{"as_of":"2026-08-09T06:04:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0279ab28b3ad3d93c0061e4ee211b9bda63521b48d90836a3f6fde3f7cca79a1","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T17:13:25.912152Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-08T12:22:27.265973Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T19:16:09.612834Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.06007","last_updated":"2025-02-09T19:51:58Z","snapshot_observed_at":"2026-08-08T17:00:51.532628Z","submitted_at":"2025-02-09T19:51:58Z","title":"Transformers versus the EM Algorithm in Multi-class Clustering","version":1},"cited_work":{"arxiv_id":"2502.06007","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.06007","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Transformers versus the em algorithm in multi-class clustering","venue":null,"work_id":"f07234f7-1c85-45b3-9ec0-65919a19829d","year":null},"citing_paper":{"arxiv_id":"2605.06609","last_updated":"2026-05-07T17:27:55Z","snapshot_observed_at":"2026-07-06T23:19:00.794334Z","submitted_at":"2026-05-07T17:27:55Z","title":"Transformers Efficiently Perform In-Context Logistic Regression via Normalized Gradient Descent","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-08T12:22:27.265973Z"},"links":{"cited_paper":"/paper/2502.06007","citing_paper":"/paper/2605.06609"},"observation_digest":"sha256:9cd7533bdf16a7d4fa733e92b538b43d51171e2e73258cc73424c394422ca987","observation_id":"0464476d-d9c3-410a-a98c-df59b7a7c2d6","resolution":{"observed_at":"2026-05-11T19:16:09.615498Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.06007/citation-record","integrity":"/paper/2502.06007/integrity","json":"/paper/2502.06007/citation-record.json","paper":"/paper/2502.06007"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:13:24.966113Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06007","last_updated":"2025-02-09T19:51:58Z","snapshot_observed_at":"2026-08-08T17:00:51.532628Z","submitted_at":"2025-02-09T19:51:58Z","title":"Transformers versus the EM Algorithm in Multi-class Clustering","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-08T17:13:24.966113Z"},"links":{"citing_paper":"/paper/2502.06007"},"observation_digest":"sha256:f7e8a4581fe9d73f20b023556fbd32a54e3b23c80c7ab209bcb6a538883050a6","observation_id":"609d41dc-bc28-44e5-9c85-57f43c28f0f5","resolution":{"observed_at":"2026-08-08T17:13:24.966113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:13:24.973894Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06007","last_updated":"2025-02-09T19:51:58Z","snapshot_observed_at":"2026-08-08T17:00:51.532628Z","submitted_at":"2025-02-09T19:51:58Z","title":"Transformers versus the EM Algorithm in Multi-class Clustering","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-08T17:13:24.973894Z"},"links":{"citing_paper":"/paper/2502.06007"},"observation_digest":"sha256:fdc7da32d31fd63df14b8b5752b35559b46ba81196792c58ee6191832bb8e4d1","observation_id":"f9003ed7-4d61-4d32-9f02-c85e49f3f7c5","resolution":{"observed_at":"2026-08-08T17:13:24.973894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:13:27.753021Z","title":"V., and Warmuth, M","venue":null,"work_id":"57914a90-7aee-4524-8782-f1befbd9aa6a","year":2024},"citing_paper":{"arxiv_id":"2502.06007","last_updated":"2025-02-09T19:51:58Z","snapshot_observed_at":"2026-08-08T17:00:51.532628Z","submitted_at":"2025-02-09T19:51:58Z","title":"Transformers versus the EM Algorithm in Multi-class Clustering","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-08T17:13:24.979340Z"},"links":{"citing_paper":"/paper/2502.06007"},"observation_digest":"sha256:efd00151eec93e0a128dc9b1ca8d1e78faa65a60d48f44c069adfe3c3f7a1024","observation_id":"42f92e7d-a146-4f3b-8a53-cf41d3be4f0c","resolution":{"observed_at":"2026-08-08T17:13:27.836041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:13:27.688693Z","title":"Transformers learn to implement preconditioned gradient descent for in-context learning","venue":null,"work_id":"585aa5af-5763-424f-a015-6b8908d8ff55","year":2024},"citing_paper":{"arxiv_id":"2502.06007","last_updated":"2025-02-09T19:51:58Z","snapshot_observed_at":"2026-08-08T17:00:51.532628Z","submitted_at":"2025-02-09T19:51:58Z","title":"Transformers versus the EM Algorithm in Multi-class Clustering","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-08T17:13:24.984201Z"},"links":{"citing_paper":"/paper/2502.06007"},"observation_digest":"sha256:69205a3fb286a7aee725945447d49607e63701e8e3ea547e183b86207f3d3b28","observation_id":"965109c9-3736-40b8-8a8e-f8ae1156ef25","resolution":{"observed_at":"2026-08-08T17:13:27.694937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.15661","last_updated":"2023-05-17T21:08:32Z","snapshot_observed_at":"2026-08-07T19:33:04.292595Z","submitted_at":"2022-11-28T18:59:51Z","title":"What learning algorithm is in-context learning? Investigations with linear models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.15661","snapshot_observed_at":"2026-08-08T17:13:24.989038Z","title":"What learning algorithm is in-context learning? investigations with linear models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.06007","last_updated":"2025-02-09T19:51:58Z","snapshot_observed_at":"2026-08-08T17:00:51.532628Z","submitted_at":"2025-02-09T19:51:58Z","title":"Transformers versus the EM Algorithm in Multi-class Clustering","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-08T17:13:24.989038Z"},"links":{"cited_paper":"/paper/2211.15661","citing_paper":"/paper/2502.06007"},"observation_digest":"sha256:65a72273af1e0c03cf5d4b2ec3b5dfdb6e0dc1d3381161bc268f86a05951dfaf","observation_id":"c8dababd-b180-4da9-bbf5-b4f196e0765a","resolution":{"observed_at":"2026-08-08T17:13:24.989038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:13:27.630732Z","title":"Breaking the curse of dimensionality with convex neural networks","venue":null,"work_id":"c6d24d6b-54f9-4843-bcc7-a8b81571c8de","year":2017},"citing_paper":{"arxiv_id":"2502.06007","last_updated":"2025-02-09T19:51:58Z","snapshot_observed_at":"2026-08-08T17:00:51.532628Z","submitted_at":"2025-02-09T19:51:58Z","title":"Transformers versus the EM Algorithm in Multi-class Clustering","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-08T17:13:24.993787Z"},"links":{"citing_paper":"/paper/2502.06007"},"observation_digest":"sha256:f01ef6d1c9d3c5f97831ec14ce734130255d6e2dc7f8ea9682aa3021f90547d4","observation_id":"5bddbedd-a814-409c-90a9-394b78ab7bfa","resolution":{"observed_at":"2026-08-08T17:13:27.672760Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:13:27.480232Z","title":"Transformers as statisticians: Provable in-context learning with in-context algorithm selection","venue":null,"work_id":"3d1b8abf-a175-41d4-8eee-1a78e55eb3a1","year":2024},"citing_paper":{"arxiv_id":"2502.06007","last_updated":"2025-02-09T19:51:58Z","snapshot_observed_at":"2026-08-08T17:00:51.532628Z","submitted_at":"2025-02-09T19:51:58Z","title":"Transformers versus the EM Algorithm in Multi-class Clustering","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-08T17:13:24.998722Z"},"links":{"citing_paper":"/paper/2502.06007"},"observation_digest":"sha256:4ab9ac83ad0a9b457b73f41a734e8ca4a192f3efd8b049ebe4efb54a4d075325","observation_id":"d309d358-62e6-44d3-ac76-6c574116d02a","resolution":{"observed_at":"2026-08-08T17:13:27.541963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.09286","last_updated":"2020-10-10T13:34:20Z","snapshot_observed_at":"2026-08-07T08:43:04.975683Z","submitted_at":"2020-06-16T16:27:56Z","title":"On the Computational Power of Transformers and its Implications in Sequence Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.09286","snapshot_observed_at":"2026-08-08T17:13:25.003270Z","title":"On the computational power of transformers and its implications in sequence modeling","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2502.06007","last_updated":"2025-02-09T19:51:58Z","snapshot_observed_at":"2026-08-08T17:00:51.532628Z","submitted_at":"2025-02-09T19:51:58Z","title":"Transformers versus the EM Algorithm in Multi-class Clustering","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-08T17:13:25.003270Z"},"links":{"cited_paper":"/paper/2006.09286","citing_paper":"/paper/2502.06007"},"observation_digest":"sha256:9f55ddc2d15f518a8c0d5960816ade52f8e7844a3d1da415ce592b62546f07c5","observation_id":"8573e64e-48b6-4e42-9380-0cc163251735","resolution":{"observed_at":"2026-08-08T17:13:25.003270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:13:25.029775Z","title":null,"venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2502.06007","last_updated":"2025-02-09T19:51:58Z","snapshot_observed_at":"2026-08-08T17:00:51.532628Z","submitted_at":"2025-02-09T19:51:58Z","title":"Transformers versus the EM Algorithm in Multi-class Clustering","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-08T17:13:25.029775Z"},"links":{"citing_paper":"/paper/2502.06007"},"observation_digest":"sha256:dae64774f08e1c9847bf9717f4588938014ec05dd172c07e015debb2adc4609c","observation_id":"1468d5b3-165e-4160-9fcf-21f87fc48133","resolution":{"observed_at":"2026-08-08T17:13:25.029775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19442","last_updated":"2024-06-10T17:18:07Z","snapshot_observed_at":"2026-08-07T21:58:57.595600Z","submitted_at":"2024-02-29T18:43:52Z","title":"Training Dynamics of Multi-Head Softmax Attention for In-Context Learning: Emergence, Convergence, and Optimality","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19442","snapshot_observed_at":"2026-08-08T17:13:25.061703Z","title":"Training dynamics of multi-head softmax attention for in-context learning: Emergence, convergence, and optimality","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06007","last_updated":"2025-02-09T19:51:58Z","snapshot_observed_at":"2026-08-08T17:00:51.532628Z","submitted_at":"2025-02-09T19:51:58Z","title":"Transformers versus the EM Algorithm in Multi-class Clustering","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-08T17:13:25.061703Z"},"links":{"cited_paper":"/paper/2402.19442","citing_paper":"/paper/2502.06007"},"observation_digest":"sha256:19c520e6818a3936496f0797a75e7a32f01c47a77f08bcdc75f2a8b2d1a410be","observation_id":"b66905c9-9f50-4e79-91d7-c9bb567967f5","resolution":{"observed_at":"2026-08-08T17:13:25.061703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:13:27.442274Z","title":"How transformers utilize multi-head attention in in-context learning? a case study on sparse linear regression","venue":null,"work_id":"02eac409-73c7-4644-be98-6035a0e88625","year":2024},"citing_paper":{"arxiv_id":"2502.06007","last_updated":"2025-02-09T19:51:58Z","snapshot_observed_at":"2026-08-08T17:00:51.532628Z","submitted_at":"2025-02-09T19:51:58Z","title":"Transformers versus the EM Algorithm in Multi-class Clustering","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-08T17:13:25.067530Z"},"links":{"citing_paper":"/paper/2502.06007"},"observation_digest":"sha256:acd4f24d3a206368125396b8b24744fc4681048e8bf9b4db6ca1e01d86f6f61f","observation_id":"f9831045-b21c-412c-867d-7bf1451bc2aa","resolution":{"observed_at":"2026-08-08T17:13:27.447164Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03183","last_updated":"2024-03-05T18:20:10Z","snapshot_observed_at":"2026-07-06T17:40:01.975792Z","submitted_at":"2024-03-05T18:20:10Z","title":"How Well Can Transformers Emulate In-context Newton's Method?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03183","snapshot_observed_at":"2026-08-08T17:13:25.085621Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06007","last_updated":"2025-02-09T19:51:58Z","snapshot_observed_at":"2026-08-08T17:00:51.532628Z","submitted_at":"2025-02-09T19:51:58Z","title":"Transformers versus the EM Algorithm in Multi-class Clustering","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-08T17:13:25.085621Z"},"links":{"cited_paper":"/paper/2403.03183","citing_paper":"/paper/2502.06007"},"observation_digest":"sha256:08d7a92de02e20e4302091d8b0f9a3a127ccbd15594cb7d7dd379b0fb47867b2","observation_id":"2fd659ec-5ad5-4404-882d-f8f2bc0922cd","resolution":{"observed_at":"2026-08-08T17:13:25.085621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01312","last_updated":"2025-01-13T03:53:34Z","snapshot_observed_at":"2026-07-06T20:15:49.954077Z","submitted_at":"2025-01-02T15:53:25Z","title":"Learning Spectral Methods by Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01312","snapshot_observed_at":"2026-08-08T17:13:25.090846Z","title":"Learning spectral methods by transformers","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.06007","last_updated":"2025-02-09T19:51:58Z","snapshot_observed_at":"2026-08-08T17:00:51.532628Z","submitted_at":"2025-02-09T19:51:58Z","title":"Transformers versus the EM Algorithm in Multi-class Clustering","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-08T17:13:25.090846Z"},"links":{"cited_paper":"/paper/2501.01312","citing_paper":"/paper/2502.06007"},"observation_digest":"sha256:3029d9e5bf1ec4557bd11e3ae82b4e954f6b4ea21275ca20d6b50d4ac5b71fb7","observation_id":"6ed2557f-9bf8-4aeb-9b7e-50038db5f801","resolution":{"observed_at":"2026-08-08T17:13:25.090846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05249","last_updated":"2023-10-08T17:55:33Z","snapshot_observed_at":"2026-07-06T16:29:32.059905Z","submitted_at":"2023-10-08T17:55:33Z","title":"In-Context Convergence of Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05249","snapshot_observed_at":"2026-08-08T17:13:25.095912Z","title":"In-context convergence of transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06007","last_updated":"2025-02-09T19:51:58Z","snapshot_observed_at":"2026-08-08T17:00:51.532628Z","submitted_at":"2025-02-09T19:51:58Z","title":"Transformers versus the EM Algorithm in Multi-class Clustering","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-08T17:13:25.095912Z"},"links":{"cited_paper":"/paper/2310.05249","citing_paper":"/paper/2502.06007"},"observation_digest":"sha256:a1c8b8ced52b3ec134e3fc8491c12e119a1f84d42c3011627a6eb347bc2564c9","observation_id":"fa12f09b-2172-4533-8849-ef380f68c8a6","resolution":{"observed_at":"2026-08-08T17:13:25.095912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:13:25.100880Z","title":"T., Lv, J., and Peng, X","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.06007","last_updated":"2025-02-09T19:51:58Z","snapshot_observed_at":"2026-08-08T17:00:51.532628Z","submitted_at":"2025-02-09T19:51:58Z","title":"Transformers versus the EM Algorithm in Multi-class Clustering","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-08T17:13:25.100880Z"},"links":{"citing_paper":"/paper/2502.06007"},"observation_digest":"sha256:2505343c2ecd9027f2f715ff83cd99920334ab43c197d40f5ec42d9d943c58e2","observation_id":"6861c27c-5cd7-4cbd-a497-1456f05af03b","resolution":{"observed_at":"2026-08-08T17:13:25.100880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:13:25.105341Z","title":"Vision transformers provably learn spatial structure","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.06007","last_updated":"2025-02-09T19:51:58Z","snapshot_observed_at":"2026-08-08T17:00:51.532628Z","submitted_at":"2025-02-09T19:51:58Z","title":"Transformers versus the EM Algorithm in Multi-class Clustering","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-08T17:13:25.105341Z"},"links":{"citing_paper":"/paper/2502.06007"},"observation_digest":"sha256:4ec32631efc513a09de5bd7c9b730e29a21ae672efc7e9206181bef39d1da080","observation_id":"50b37b80-7605-4848-90b7-b178edf2ed15","resolution":{"observed_at":"2026-08-08T17:13:25.105341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:13:27.404936Z","title":"J., Lee, J","venue":null,"work_id":"f7bade1e-6e70-48f7-bd93-bb1d09a35632","year":2024},"citing_paper":{"arxiv_id":"2502.06007","last_updated":"2025-02-09T19:51:58Z","snapshot_observed_at":"2026-08-08T17:00:51.532628Z","submitted_at":"2025-02-09T19:51:58Z","title":"Transformers versus the EM Algorithm in Multi-class Clustering","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-08T17:13:25.110051Z"},"links":{"citing_paper":"/paper/2502.06007"},"observation_digest":"sha256:40acef1817e4dc7a56be41716c73e79feee4d0857c7163cf90c77a3dc6bef6cf","observation_id":"97698f0c-c291-4b94-b529-0b92a2cf621d","resolution":{"observed_at":"2026-08-08T17:13:27.411099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:13:27.359642Z","title":"A simple linear time (1+/spl epsiv/)-approximation algorithm for k-means clustering in any dimensions","venue":null,"work_id":"d5726ec1-bd2b-494c-8dc3-aa9600fe95cf","year":2004},"citing_paper":{"arxiv_id":"2502.06007","last_updated":"2025-02-09T19:51:58Z","snapshot_observed_at":"2026-08-08T17:00:51.532628Z","submitted_at":"2025-02-09T19:51:58Z","title":"Transformers versus the EM Algorithm in Multi-class Clustering","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-08T17:13:25.114444Z"},"links":{"citing_paper":"/paper/2502.06007"},"observation_digest":"sha256:7a8d34d3f251db27d1b63415adfb99da18fc7190e901f00b70f9d51f4978a420","observation_id":"0edcaf3d-4215-44e6-86d6-1f945dbaca1d","resolution":{"observed_at":"2026-08-08T17:13:27.385671Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:13:27.182987Z","title":"E., Papailiopoulos, D., and Oymak, S","venue":null,"work_id":"5cc35ca6-c1b7-4552-beea-cea2c7da6292","year":2023},"citing_paper":{"arxiv_id":"2502.06007","last_updated":"2025-02-09T19:51:58Z","snapshot_observed_at":"2026-08-08T17:00:51.532628Z","submitted_at":"2025-02-09T19:51:58Z","title":"Transformers versus the EM Algorithm in Multi-class Clustering","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-08T17:13:25.119005Z"},"links":{"citing_paper":"/paper/2502.06007"},"observation_digest":"sha256:136654a7827ac3fa0030e5d2579c144916a75a99449fa68f2d5fa29d6fe0ea1a","observation_id":"29a67dac-380c-45cb-9299-bdf4afeed68d","resolution":{"observed_at":"2026-08-08T17:13:27.292177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:13:27.146621Z","title":"How do transformers learn topic structure: Towards a mechanistic understanding","venue":null,"work_id":"c107e5bb-2a6e-49ff-8122-73ca341740bc","year":2023},"citing_paper":{"arxiv_id":"2502.06007","last_updated":"2025-02-09T19:51:58Z","snapshot_observed_at":"2026-08-08T17:00:51.532628Z","submitted_at":"2025-02-09T19:51:58Z","title":"Transformers versus the EM Algorithm in Multi-class Clustering","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-08T17:13:25.126161Z"},"links":{"citing_paper":"/paper/2502.06007"},"observation_digest":"sha256:9d1a0908787197316393a08782c3d9cee30faaa713ec6147262a94734831c020","observation_id":"a025fb9f-c6e2-45d1-b1bc-a233b244d379","resolution":{"observed_at":"2026-08-08T17:13:27.152234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:13:27.131360Z","title":"Image clustering with external guidance","venue":null,"work_id":"bb76e53b-396a-4d68-819e-74ed48644497","year":2024},"citing_paper":{"arxiv_id":"2502.06007","last_updated":"2025-02-09T19:51:58Z","snapshot_observed_at":"2026-08-08T17:00:51.532628Z","submitted_at":"2025-02-09T19:51:58Z","title":"Transformers versus the EM Algorithm in Multi-class Clustering","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-08T17:13:25.164165Z"},"links":{"citing_paper":"/paper/2502.06007"},"observation_digest":"sha256:c2efc07d86c7060971413385ab30abfb129d9ed0f30a26ca0f5cb888fc048a2b","observation_id":"18b3adb1-635d-4f59-8f27-43a5168298a9","resolution":{"observed_at":"2026-08-08T17:13:27.136559Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:13:27.089597Z","title":"M., Fan, J., and Wang, M","venue":null,"work_id":"540e88aa-e98b-4972-914d-67f7a00fe254","year":2024},"citing_paper":{"arxiv_id":"2502.06007","last_updated":"2025-02-09T19:51:58Z","snapshot_observed_at":"2026-08-08T17:00:51.532628Z","submitted_at":"2025-02-09T19:51:58Z","title":"Transformers versus the EM Algorithm in Multi-class Clustering","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-08T17:13:25.253018Z"},"links":{"citing_paper":"/paper/2502.06007"},"observation_digest":"sha256:d98e049500eef047f253eca377876ad09461b0e4fc09d3e07c6c17ea3abb8078","observation_id":"1f96a89a-32b3-4b25-929e-570c1a21d040","resolution":{"observed_at":"2026-08-08T17:13:27.108960Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.10749","last_updated":"2023-05-02T14:16:15Z","snapshot_observed_at":"2026-08-05T14:55:09.743440Z","submitted_at":"2022-10-19T17:45:48Z","title":"Transformers Learn Shortcuts to Automata","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.10749","snapshot_observed_at":"2026-08-08T17:13:25.317497Z","title":"T., Goel, S., Krishnamurthy, A., and Zhang, C","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.06007","last_updated":"2025-02-09T19:51:58Z","snapshot_observed_at":"2026-08-08T17:00:51.532628Z","submitted_at":"2025-02-09T19:51:58Z","title":"Transformers versus the EM Algorithm in Multi-class Clustering","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-08T17:13:25.317497Z"},"links":{"cited_paper":"/paper/2210.10749","citing_paper":"/paper/2502.06007"},"observation_digest":"sha256:ddf53808af65761a70cfa1f653a88f903f1c45b20d91064dbaf42980b8c4e4f9","observation_id":"700c731c-2051-4cff-83c0-ff51694388c2","resolution":{"observed_at":"2026-08-08T17:13:25.317497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:13:25.350622Z","title":"Least squares quantization in pcm","venue":null,"work_id":null,"year":1982},"citing_paper":{"arxiv_id":"2502.06007","last_updated":"2025-02-09T19:51:58Z","snapshot_observed_at":"2026-08-08T17:00:51.532628Z","submitted_at":"2025-02-09T19:51:58Z","title":"Transformers versus the EM Algorithm in Multi-class Clustering","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-08T17:13:25.350622Z"},"links":{"citing_paper":"/paper/2502.06007"},"observation_digest":"sha256:bb893b0ecc5361432c4d2fc629f56b60172dedd62235466968f62cade42e923e","observation_id":"77a016ac-eb8c-457f-8b31-826b7fccd2bc","resolution":{"observed_at":"2026-08-08T17:13:25.350622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1612.02099","last_updated":"2016-12-07T02:35:54Z","snapshot_observed_at":"2026-08-07T23:31:37.473411Z","submitted_at":"2016-12-07T02:35:54Z","title":"Statistical and Computational Guarantees of Lloyd's Algorithm and its Variants","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1612.02099","snapshot_observed_at":"2026-08-08T17:13:25.355845Z","title":"and Zhou, H","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.06007","last_updated":"2025-02-09T19:51:58Z","snapshot_observed_at":"2026-08-08T17:00:51.532628Z","submitted_at":"2025-02-09T19:51:58Z","title":"Transformers versus the EM Algorithm in Multi-class Clustering","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-08T17:13:25.355845Z"},"links":{"cited_paper":"/paper/1612.02099","citing_paper":"/paper/2502.06007"},"observation_digest":"sha256:12ae04d28fe467fbe0301d227c3ad1ed0af34d3b35f460e4e5e4aa55ec89478f","observation_id":"b7b50c47-551b-4c34-afec-1155bb59d8a5","resolution":{"observed_at":"2026-08-08T17:13:25.355845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:13:26.928454Z","title":null,"venue":null,"work_id":"e7b49025-3f56-4f50-b0c7-cb942a2f0f6b","year":2019},"citing_paper":{"arxiv_id":"2502.06007","last_updated":"2025-02-09T19:51:58Z","snapshot_observed_at":"2026-08-08T17:00:51.532628Z","submitted_at":"2025-02-09T19:51:58Z","title":"Transformers versus the EM Algorithm in Multi-class Clustering","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-08T17:13:25.435029Z"},"links":{"citing_paper":"/paper/2502.06007"},"observation_digest":"sha256:4843f3592e46f13d0f999300920bc2b9b2c87756ecc5fa78b84b81f408e0acf9","observation_id":"5eecf896-1c65-4a4c-bb27-be2157a0c6f3","resolution":{"observed_at":"2026-08-08T17:13:27.045853Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:13:26.824188Z","title":"Deep transformation-invariant clustering","venue":null,"work_id":"86def008-ab67-46ff-b02d-4a1c9e52edf9","year":2020},"citing_paper":{"arxiv_id":"2502.06007","last_updated":"2025-02-09T19:51:58Z","snapshot_observed_at":"2026-08-08T17:00:51.532628Z","submitted_at":"2025-02-09T19:51:58Z","title":"Transformers versus the EM Algorithm in Multi-class Clustering","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-08T17:13:25.491874Z"},"links":{"citing_paper":"/paper/2502.06007"},"observation_digest":"sha256:3baf73b9677fefc8117026a8dca20ed9401e21ad3969742ff28d2d6952f19938","observation_id":"8759ec52-ccd4-463a-a611-e0b4d3d50505","resolution":{"observed_at":"2026-08-08T17:13:26.830439Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:13:25.498917Z","title":"Scikit-learn: Machine learning in python","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2502.06007","last_updated":"2025-02-09T19:51:58Z","snapshot_observed_at":"2026-08-08T17:00:51.532628Z","submitted_at":"2025-02-09T19:51:58Z","title":"Transformers versus the EM Algorithm in Multi-class Clustering","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-08T17:13:25.498917Z"},"links":{"citing_paper":"/paper/2502.06007"},"observation_digest":"sha256:42cd51768711919724e92410543c655a28b2d22cab5e34ef5e874f4236bd0736","observation_id":"6b80e1e1-5bd4-4ad8-8088-cedc4cf23880","resolution":{"observed_at":"2026-08-08T17:13:25.498917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:13:26.746549Z","title":"Attention is turing-complete","venue":null,"work_id":"29b222d5-393a-459c-b25f-4d8c17ee5211","year":2021},"citing_paper":{"arxiv_id":"2502.06007","last_updated":"2025-02-09T19:51:58Z","snapshot_observed_at":"2026-08-08T17:00:51.532628Z","submitted_at":"2025-02-09T19:51:58Z","title":"Transformers versus the EM Algorithm in Multi-class Clustering","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-08T17:13:25.503805Z"},"links":{"citing_paper":"/paper/2502.06007"},"observation_digest":"sha256:66cc6b45eacb6c4e94ec546276fc811dfde2800635d4f9b3a3461d1ef63de1aa","observation_id":"5b1cba5c-e5b4-47d1-8406-c8c8dad3696b","resolution":{"observed_at":"2026-08-08T17:13:26.789952Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:13:26.616297Z","title":"Maurey-Schwartz","venue":null,"work_id":"ac8843da-4ccb-44c4-8daa-a260712ae8ae","year":1981},"citing_paper":{"arxiv_id":"2502.06007","last_updated":"2025-02-09T19:51:58Z","snapshot_observed_at":"2026-08-08T17:00:51.532628Z","submitted_at":"2025-02-09T19:51:58Z","title":"Transformers versus the EM Algorithm in Multi-class Clustering","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-08T17:13:25.508322Z"},"links":{"citing_paper":"/paper/2502.06007"},"observation_digest":"sha256:25d71ae947606737b4cd58a9bd3a10dd2f58bfb27e898ba87c894ba4b9c70ce3","observation_id":"49cf5687-91ea-4367-9c97-d0eafedf5003","resolution":{"observed_at":"2026-08-08T17:13:26.681996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11801","last_updated":"2024-05-20T05:46:41Z","snapshot_observed_at":"2026-07-06T18:16:33.179338Z","submitted_at":"2024-05-20T05:46:41Z","title":"LSEnet: Lorentz Structural Entropy Neural Network for Deep Graph Clustering","version":1},"cited_work":{"arxiv_id":"2405.11801","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.11801","snapshot_observed_at":"2026-08-08T17:13:26.138159Z","title":"LSEnet: Lorentz Structural Entropy Neural Network for Deep Graph Clustering","venue":"cs.LG","work_id":"f7327d31-40c2-4833-99c5-5c4853f186ae","year":2024},"citing_paper":{"arxiv_id":"2502.06007","last_updated":"2025-02-09T19:51:58Z","snapshot_observed_at":"2026-08-08T17:00:51.532628Z","submitted_at":"2025-02-09T19:51:58Z","title":"Transformers versus the EM Algorithm in Multi-class Clustering","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-08T17:13:25.563610Z"},"links":{"cited_paper":"/paper/2405.11801","citing_paper":"/paper/2502.06007"},"observation_digest":"sha256:8c00dc4b6d51b9a7f0f5d937e5a4bb317ec62bd479aae504abb063a862668d19","observation_id":"ecdbb328-c44d-4b6f-a503-a5e621aafaf9","resolution":{"observed_at":"2026-08-08T17:13:26.177202Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:13:25.656742Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.06007","last_updated":"2025-02-09T19:51:58Z","snapshot_observed_at":"2026-08-08T17:00:51.532628Z","submitted_at":"2025-02-09T19:51:58Z","title":"Transformers versus the EM Algorithm in Multi-class Clustering","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-08T17:13:25.656742Z"},"links":{"citing_paper":"/paper/2502.06007"},"observation_digest":"sha256:974d28afa9cab8f5713560884d4f4b0f12b15ba9411cb81db13080141a32a0b6","observation_id":"4bfb98c0-a107-4118-92b0-6f079c0e7977","resolution":{"observed_at":"2026-08-08T17:13:25.656742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:13:26.579787Z","title":"Information-theoretic methods for high-dimensional statistics","venue":null,"work_id":"fae19d66-dc74-4189-b59d-f138ce194766","year":2020},"citing_paper":{"arxiv_id":"2502.06007","last_updated":"2025-02-09T19:51:58Z","snapshot_observed_at":"2026-08-08T17:00:51.532628Z","submitted_at":"2025-02-09T19:51:58Z","title":"Transformers versus the EM Algorithm in Multi-class Clustering","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-08T17:13:25.695645Z"},"links":{"citing_paper":"/paper/2502.06007"},"observation_digest":"sha256:c4e7f55665a8b2d82e9156a616956d708f1d9bc3c32a95bed2d532daefa99c19","observation_id":"5f9b6948-56f6-4e8b-a9b7-85796bea3789","resolution":{"observed_at":"2026-08-08T17:13:26.595156Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.11115","last_updated":"2023-03-13T01:47:55Z","snapshot_observed_at":"2026-07-06T11:12:04.788175Z","submitted_at":"2021-05-24T06:42:58Z","title":"Self-Attention Networks Can Process Bounded Hierarchical Languages","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.11115","snapshot_observed_at":"2026-08-08T17:13:25.701165Z","title":"Self-attention networks can process bounded hierarchical languages","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.06007","last_updated":"2025-02-09T19:51:58Z","snapshot_observed_at":"2026-08-08T17:00:51.532628Z","submitted_at":"2025-02-09T19:51:58Z","title":"Transformers versus the EM Algorithm in Multi-class Clustering","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-08T17:13:25.701165Z"},"links":{"cited_paper":"/paper/2105.11115","citing_paper":"/paper/2502.06007"},"observation_digest":"sha256:2080c9e84eed4ea82579fafab3a720305db6c2934c8d8e22494b09e3a19e0072","observation_id":"ce328805-e29e-4a26-a339-4448fa349653","resolution":{"observed_at":"2026-08-08T17:13:25.701165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:13:26.538536Z","title":null,"venue":null,"work_id":"e9432c61-207b-4896-917b-63a99180941e","year":2015},"citing_paper":{"arxiv_id":"2502.06007","last_updated":"2025-02-09T19:51:58Z","snapshot_observed_at":"2026-08-08T17:00:51.532628Z","submitted_at":"2025-02-09T19:51:58Z","title":"Transformers versus the EM Algorithm in Multi-class Clustering","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-08T17:13:25.705829Z"},"links":{"citing_paper":"/paper/2502.06007"},"observation_digest":"sha256:234898d3a68276aeed463d61d539ced23375d0307eb0dc4eb6ea1c20218e7d16","observation_id":"eb409cd5-201a-4490-b5a7-bbe155cede83","resolution":{"observed_at":"2026-08-08T17:13:26.550202Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.10077","last_updated":"2020-02-25T03:12:57Z","snapshot_observed_at":"2026-07-06T08:46:09.705605Z","submitted_at":"2019-12-20T19:49:32Z","title":"Are Transformers universal approximators of sequence-to-sequence functions?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.10077","snapshot_observed_at":"2026-08-08T17:13:25.754027Z","title":"S., Reddi, S","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2502.06007","last_updated":"2025-02-09T19:51:58Z","snapshot_observed_at":"2026-08-08T17:00:51.532628Z","submitted_at":"2025-02-09T19:51:58Z","title":"Transformers versus the EM Algorithm in Multi-class Clustering","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-08T17:13:25.754027Z"},"links":{"cited_paper":"/paper/1912.10077","citing_paper":"/paper/2502.06007"},"observation_digest":"sha256:0023c186af6638c10b2d0cae77bac2a30b838f070b707d7201fc863d59b44ceb","observation_id":"70a371b3-fb9d-458f-818c-9b2bd6025f81","resolution":{"observed_at":"2026-08-08T17:13:25.754027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:13:26.336070Z","title":"and Cao, Y","venue":null,"work_id":"793863de-a339-4e45-bfdf-f59a57c0ccc3","year":2025},"citing_paper":{"arxiv_id":"2502.06007","last_updated":"2025-02-09T19:51:58Z","snapshot_observed_at":"2026-08-08T17:00:51.532628Z","submitted_at":"2025-02-09T19:51:58Z","title":"Transformers versus the EM Algorithm in Multi-class Clustering","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-08T17:13:25.816294Z"},"links":{"citing_paper":"/paper/2502.06007"},"observation_digest":"sha256:05ad9329c798a3f4d9c7626b4c37525bb9c075dc0467bd7620009812d3a9dbdc","observation_id":"3f197104-1234-4984-901d-b6b61c1f982b","resolution":{"observed_at":"2026-08-08T17:13:26.415539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09927","last_updated":"2023-10-19T20:31:32Z","snapshot_observed_at":"2026-07-06T15:43:31.881201Z","submitted_at":"2023-06-16T15:50:03Z","title":"Trained Transformers Learn Linear Models In-Context","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09927","snapshot_observed_at":"2026-08-08T17:13:25.873634Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06007","last_updated":"2025-02-09T19:51:58Z","snapshot_observed_at":"2026-08-08T17:00:51.532628Z","submitted_at":"2025-02-09T19:51:58Z","title":"Transformers versus the EM Algorithm in Multi-class Clustering","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-08T17:13:25.873634Z"},"links":{"cited_paper":"/paper/2306.09927","citing_paper":"/paper/2502.06007"},"observation_digest":"sha256:cbab8eb801fd2263f2769a59c4a348735f089a9cf21ebd92ad9ae063d912261b","observation_id":"c1446f92-28fc-456e-9393-cb813de2747d","resolution":{"observed_at":"2026-08-08T17:13:25.873634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:13:25.897099Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06007","last_updated":"2025-02-09T19:51:58Z","snapshot_observed_at":"2026-08-08T17:00:51.532628Z","submitted_at":"2025-02-09T19:51:58Z","title":"Transformers versus the EM Algorithm in Multi-class Clustering","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-08T17:13:25.897099Z"},"links":{"citing_paper":"/paper/2502.06007"},"observation_digest":"sha256:b0f4110a25931b9c7ed88a84e460e7d21337de774430dff2b77c30a14dc81bb8","observation_id":"d6e9c053-295d-4489-9164-c4ae2d3f5fa6","resolution":{"observed_at":"2026-08-08T17:13:25.897099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:13:25.907097Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06007","last_updated":"2025-02-09T19:51:58Z","snapshot_observed_at":"2026-08-08T17:00:51.532628Z","submitted_at":"2025-02-09T19:51:58Z","title":"Transformers versus the EM Algorithm in Multi-class Clustering","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-08T17:13:25.907097Z"},"links":{"citing_paper":"/paper/2502.06007"},"observation_digest":"sha256:fa965b573dc537fca1497d3b7fa3453ed456d21c3427c27b8d760903a1e10651","observation_id":"461f6dd3-3456-49af-bad9-f9b903795a1f","resolution":{"observed_at":"2026-08-08T17:13:25.907097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:13:25.912152Z","title":"Recent efforts are devoted to understand the learning capacities of Transformers at the fundamental level","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06007","last_updated":"2025-02-09T19:51:58Z","snapshot_observed_at":"2026-08-08T17:00:51.532628Z","submitted_at":"2025-02-09T19:51:58Z","title":"Transformers versus the EM Algorithm in Multi-class Clustering","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-08T17:13:25.912152Z"},"links":{"citing_paper":"/paper/2502.06007"},"observation_digest":"sha256:94a8fe4c874f836863bf65d5bbde6b363785efed43e47f024241a76c089348b1","observation_id":"4595f027-eedb-40cd-ade4-50294976d181","resolution":{"observed_at":"2026-08-08T17:13:25.912152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.06007","last_updated":"2025-02-09T19:51:58Z","latest_version":1,"primary_category":"stat.ML","snapshot_observed_at":"2026-08-08T17:00:51.532628Z","submitted_at":"2025-02-09T19:51:58Z","title":"Transformers versus the EM Algorithm in Multi-class Clustering"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":24,"verified_exact":1,"verified_fuzzy":16},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 1 inbound Pith citation observation for arXiv:2502.06007."}