{"as_of":"2026-08-24T03:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e1b10f06dfa33c6c8a1251cdf69becdaf620a70fe74382eb37cfc8ecce6389d5","coverage":[{"denominator":57,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-21T23:05:56.687644Z","state":"measured"},{"denominator":60,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":60,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T06:55:10.121913Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-01T17:35:51.333328Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.00901","last_updated":"2026-05-18T13:04:24Z","snapshot_observed_at":"2026-08-18T00:30:58.619504Z","submitted_at":"2025-07-28T17:24:57Z","title":"Provable Knowledge Acquisition and Extraction in One-Layer Transformers","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.00901","snapshot_observed_at":"2026-08-03T06:55:10.121913Z","title":"Filtering with self-attention and storing with mlp: One-layer trans- formers can provably acquire and extract knowledge.arXiv preprint arXiv:2508.00901,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.21725","last_updated":"2026-05-27T19:52:53Z","snapshot_observed_at":"2026-08-04T21:23:57.701786Z","submitted_at":"2026-01-29T13:48:43Z","title":"Procedural Pretraining: Warming Up Language Models with Abstract Data","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T06:55:10.121913Z"},"links":{"cited_paper":"/paper/2508.00901","citing_paper":"/paper/2601.21725"},"observation_digest":"sha256:b7a2d27003bf444a24b678e28e1930f04944cf21a1013d835ff628634ff6e3e2","observation_id":"fca444f4-1977-4d43-8344-ba420ef3a8f3","resolution":{"observed_at":"2026-08-03T06:55:10.121913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.00901","last_updated":"2026-05-18T13:04:24Z","snapshot_observed_at":"2026-08-18T00:30:58.619504Z","submitted_at":"2025-07-28T17:24:57Z","title":"Provable Knowledge Acquisition and Extraction in One-Layer Transformers","version":4},"cited_work":{"arxiv_id":"2508.00901","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.00901","snapshot_observed_at":"2026-07-01T17:35:51.333328Z","title":"Provable Knowledge Acquisition and Extraction in One-Layer Transformers","venue":"cs.LG","work_id":"31e2e6f9-989b-4654-9c4d-2b02d273877c","year":2025},"citing_paper":{"arxiv_id":"2606.28153","last_updated":"2026-06-29T15:00:34Z","snapshot_observed_at":"2026-08-14T21:18:47.124582Z","submitted_at":"2026-06-26T14:51:16Z","title":"Robust Harmful Features Under Jailbreak Attacks: Mechanistic Evidence from Attention Head Specialization in Large Language Models","version":1},"reference_index":103,"source":"arxiv_source","source_observed_at":"2026-06-29T03:35:34.594617Z"},"links":{"cited_paper":"/paper/2508.00901","citing_paper":"/paper/2606.28153"},"observation_digest":"sha256:66a5b7bda64cde95bd7505210c79a497907e159c200748474625d31e1321837c","observation_id":"193e0fc8-0d05-4f64-bd4c-868e6ee334f4","resolution":{"observed_at":"2026-07-01T17:35:51.334692Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.00901","last_updated":"2026-05-18T13:04:24Z","snapshot_observed_at":"2026-08-18T00:30:58.619504Z","submitted_at":"2025-07-28T17:24:57Z","title":"Provable Knowledge Acquisition and Extraction in One-Layer Transformers","version":4},"cited_work":{"arxiv_id":"2508.00901","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.00901","snapshot_observed_at":"2026-07-01T17:35:51.333328Z","title":"Provable Knowledge Acquisition and Extraction in One-Layer Transformers","venue":"cs.LG","work_id":"31e2e6f9-989b-4654-9c4d-2b02d273877c","year":2025},"citing_paper":{"arxiv_id":"2606.28153","last_updated":"2026-06-29T15:00:34Z","snapshot_observed_at":"2026-08-14T21:18:47.124582Z","submitted_at":"2026-06-26T14:51:16Z","title":"Robust Harmful Features Under Jailbreak Attacks: Mechanistic Evidence from Attention Head Specialization in Large Language Models","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-06-30T09:32:59.824110Z"},"links":{"cited_paper":"/paper/2508.00901","citing_paper":"/paper/2606.28153"},"observation_digest":"sha256:65235c7897f211b774d4001b9d645e2ddad4db8509dcd6bc01c7fa3471118243","observation_id":"64ea49a1-5f14-4feb-9e8f-c4367f115cea","resolution":{"observed_at":"2026-06-30T09:34:34.439000Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2508.00901/citation-record","integrity":"/paper/2508.00901/integrity","json":"/paper/2508.00901/citation-record.json","paper":"/paper/2508.00901"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Transformers learn to implement preconditioned gradient descent for in-context learning","venue":null,"work_id":"e2bfc7f1-37e4-49cc-bc40-5cea26ab4462","year":2023},"citing_paper":{"arxiv_id":"2508.00901","last_updated":"2026-05-18T13:04:24Z","snapshot_observed_at":"2026-08-18T00:30:58.619504Z","submitted_at":"2025-07-28T17:24:57Z","title":"Provable Knowledge Acquisition and Extraction in One-Layer Transformers","version":4},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-21T23:05:56.687644Z"},"links":{"citing_paper":"/paper/2508.00901"},"observation_digest":"sha256:e8e916327d843395042ed5d0e4815002eff8e2696b69a9edc0df2407c4ff7c0a","observation_id":"5863d64c-f89d-41e6-89d1-13d758384f0f","resolution":{"observed_at":"2026-05-21T23:15:45.207862Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.09816","last_updated":"2023-02-15T10:01:31Z","snapshot_observed_at":"2026-08-20T11:06:19.455382Z","submitted_at":"2020-12-17T18:34:45Z","title":"Towards Understanding Ensemble, Knowledge Distillation and Self-Distillation in Deep Learning","version":3},"cited_work":{"arxiv_id":"2012.09816","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2012.09816","snapshot_observed_at":"2026-07-04T10:29:44.312964Z","title":"Towards understanding ensemble, knowledge distillation and self-distillation in deep learning","venue":null,"work_id":"2dba5ef3-3a9d-48db-8546-a420297aede5","year":2012},"citing_paper":{"arxiv_id":"2508.00901","last_updated":"2026-05-18T13:04:24Z","snapshot_observed_at":"2026-08-18T00:30:58.619504Z","submitted_at":"2025-07-28T17:24:57Z","title":"Provable Knowledge Acquisition and Extraction in One-Layer Transformers","version":4},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-21T23:05:56.687644Z"},"links":{"cited_paper":"/paper/2012.09816","citing_paper":"/paper/2508.00901"},"observation_digest":"sha256:79af325957c9b3a3cdcb9a154c5e96a2cb92d5fa96892fc148905c54ea312d6f","observation_id":"9263cb36-40c2-47f6-b769-3111ece9d798","resolution":{"observed_at":"2026-05-21T23:10:44.837889Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14316","last_updated":"2024-07-16T10:22:51Z","snapshot_observed_at":"2026-08-16T14:57:46.371369Z","submitted_at":"2023-09-25T17:37:20Z","title":"Physics of Language Models: Part 3.1, Knowledge Storage and Extraction","version":3},"cited_work":{"arxiv_id":"2309.14316","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.14316","snapshot_observed_at":"2026-07-04T08:59:42.744162Z","title":"Physics of language models: Part 3.1, knowledge storage and extraction","venue":null,"work_id":"a7f03a83-65ed-495c-9295-ad87e6539976","year":2024},"citing_paper":{"arxiv_id":"2508.00901","last_updated":"2026-05-18T13:04:24Z","snapshot_observed_at":"2026-08-18T00:30:58.619504Z","submitted_at":"2025-07-28T17:24:57Z","title":"Provable Knowledge Acquisition and Extraction in One-Layer Transformers","version":4},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-21T23:05:56.687644Z"},"links":{"cited_paper":"/paper/2309.14316","citing_paper":"/paper/2508.00901"},"observation_digest":"sha256:ce0697bc1dd44efee38da49b4df05835c1670889dd88f19c65a514f6e05dafc6","observation_id":"0b250b3e-629d-4e98-a566-dbccacca7cfe","resolution":{"observed_at":"2026-05-21T23:10:44.869355Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Birth of a transformer: A memory viewpoint","venue":null,"work_id":"a05ba1ac-db02-41b5-b456-e9ff0a0d3846","year":2023},"citing_paper":{"arxiv_id":"2508.00901","last_updated":"2026-05-18T13:04:24Z","snapshot_observed_at":"2026-08-18T00:30:58.619504Z","submitted_at":"2025-07-28T17:24:57Z","title":"Provable Knowledge Acquisition and Extraction in One-Layer Transformers","version":4},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-21T23:05:56.687644Z"},"links":{"citing_paper":"/paper/2508.00901"},"observation_digest":"sha256:9050db52b23389f685f74f83fd139b056ab1080f819bedba24bf474d03439684","observation_id":"52ce4e83-416e-4755-9181-98348147bcb4","resolution":{"observed_at":"2026-05-21T23:15:45.205887Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Language models are few-shot learners","venue":null,"work_id":"faddbae1-eba8-458f-9ce1-7fef7750ce55","year":1901},"citing_paper":{"arxiv_id":"2508.00901","last_updated":"2026-05-18T13:04:24Z","snapshot_observed_at":"2026-08-18T00:30:58.619504Z","submitted_at":"2025-07-28T17:24:57Z","title":"Provable Knowledge Acquisition and Extraction in One-Layer Transformers","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-21T23:05:56.687644Z"},"links":{"citing_paper":"/paper/2508.00901"},"observation_digest":"sha256:558684817872ce5eb9295e4e5d3fce5a5e02f25390ec4cc64d57aba61e449a28","observation_id":"84d2161e-a267-429d-8f19-ece9b342cb19","resolution":{"observed_at":"2026-05-21T23:15:45.167736Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02984","last_updated":"2024-02-20T19:17:52Z","snapshot_observed_at":"2026-08-17T00:59:52.712416Z","submitted_at":"2023-10-04T17:20:34Z","title":"Scaling Laws for Associative Memories","version":2},"cited_work":{"arxiv_id":"2310.02984","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.02984","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scaling laws for associative memories","venue":null,"work_id":"622e7ff2-595e-4cd8-8d2c-a3141b4b0301","year":2023},"citing_paper":{"arxiv_id":"2508.00901","last_updated":"2026-05-18T13:04:24Z","snapshot_observed_at":"2026-08-18T00:30:58.619504Z","submitted_at":"2025-07-28T17:24:57Z","title":"Provable Knowledge Acquisition and Extraction in One-Layer Transformers","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-21T23:05:56.687644Z"},"links":{"cited_paper":"/paper/2310.02984","citing_paper":"/paper/2508.00901"},"observation_digest":"sha256:493a15818825f93c3c322b01a19d1241cf7334425a1cefe2ffc2bee6321d0313","observation_id":"e3e4f27d-6cd1-488b-ac03-dc1803f1a87a","resolution":{"observed_at":"2026-05-21T23:10:44.862743Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18724","last_updated":"2024-02-28T21:47:30Z","snapshot_observed_at":"2026-08-16T14:14:21.834908Z","submitted_at":"2024-02-28T21:47:30Z","title":"Learning Associative Memories with Gradient Descent","version":1},"cited_work":{"arxiv_id":"2402.18724","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.18724","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning associative memories with gradient descent","venue":null,"work_id":"b9611efc-d70a-4ee6-b02d-b2d42c4019cf","year":2024},"citing_paper":{"arxiv_id":"2508.00901","last_updated":"2026-05-18T13:04:24Z","snapshot_observed_at":"2026-08-18T00:30:58.619504Z","submitted_at":"2025-07-28T17:24:57Z","title":"Provable Knowledge Acquisition and Extraction in One-Layer Transformers","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-21T23:05:56.687644Z"},"links":{"cited_paper":"/paper/2402.18724","citing_paper":"/paper/2508.00901"},"observation_digest":"sha256:d8e9dd570e2a721029f8ca29c09cdcb706b1af4f70d524307ce334fadde3420c","observation_id":"062bd6b0-43a0-4f38-a1a9-a41b7d86e4b3","resolution":{"observed_at":"2026-05-21T23:10:44.879130Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Benign overfitting in two-layer convolutional neural networks","venue":null,"work_id":"abfb2a2e-8915-40d8-9be0-0ecaf1ca38fb","year":2022},"citing_paper":{"arxiv_id":"2508.00901","last_updated":"2026-05-18T13:04:24Z","snapshot_observed_at":"2026-08-18T00:30:58.619504Z","submitted_at":"2025-07-28T17:24:57Z","title":"Provable Knowledge Acquisition and Extraction in One-Layer Transformers","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-21T23:05:56.687644Z"},"links":{"citing_paper":"/paper/2508.00901"},"observation_digest":"sha256:e9a2a9cae3acc5dc41507b57965820756205e49b74d4d8eb0d44bdd03eb1f2d7","observation_id":"bc3e7a8e-b5b9-4dd3-8e8e-5a2025c77776","resolution":{"observed_at":"2026-05-21T23:15:45.159784Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards understanding the mixture-of-experts layer in deep learning","venue":null,"work_id":"73c8aebe-d24d-4c24-b283-e5dca7fbad45","year":2022},"citing_paper":{"arxiv_id":"2508.00901","last_updated":"2026-05-18T13:04:24Z","snapshot_observed_at":"2026-08-18T00:30:58.619504Z","submitted_at":"2025-07-28T17:24:57Z","title":"Provable Knowledge Acquisition and Extraction in One-Layer Transformers","version":4},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-21T23:05:56.687644Z"},"links":{"citing_paper":"/paper/2508.00901"},"observation_digest":"sha256:582b5562580f00e254a35cd26d07ce33c8063d605606be386471da87585450a0","observation_id":"5ff181a0-5d14-4ec2-a864-d3ac0d70de10","resolution":{"observed_at":"2026-05-21T23:15:45.173575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-08T11:54:01.449606Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"cited_work":{"arxiv_id":"2506.01115","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.01115","snapshot_observed_at":"2026-07-02T07:56:47.880747Z","title":"Attention retrieves, mlp memorizes: Disentangling trainable components in the transformer","venue":null,"work_id":"35ca95c4-f014-4f2d-9c11-2aecc2e3ec9c","year":2025},"citing_paper":{"arxiv_id":"2508.00901","last_updated":"2026-05-18T13:04:24Z","snapshot_observed_at":"2026-08-18T00:30:58.619504Z","submitted_at":"2025-07-28T17:24:57Z","title":"Provable Knowledge Acquisition and Extraction in One-Layer Transformers","version":4},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-21T23:05:56.687644Z"},"links":{"cited_paper":"/paper/2506.01115","citing_paper":"/paper/2508.00901"},"observation_digest":"sha256:29f5d96af434e4339908edb19e8b1b532f780d4f42ad1db43eedfc939c9e5d65","observation_id":"1a7b7cd7-c4d6-4a78-9f4e-10c11430db8b","resolution":{"observed_at":"2026-05-21T23:10:44.852070Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.14913","last_updated":"2021-09-05T17:32:27Z","snapshot_observed_at":"2026-08-13T01:11:33.500647Z","submitted_at":"2020-12-29T19:12:05Z","title":"Transformer Feed-Forward Layers Are Key-Value Memories","version":2},"cited_work":{"arxiv_id":"2012.14913","doi":"10.18653/v1/2021.emnlp-main.446","metadata_source":"pith","pith_arxiv_id":"2012.14913","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Transformer Feed-Forward Layers Are Key-Value Memories","venue":"cs.CL","work_id":"af95ed34-d603-4b8d-b5d5-582dd09e9938","year":2020},"citing_paper":{"arxiv_id":"2508.00901","last_updated":"2026-05-18T13:04:24Z","snapshot_observed_at":"2026-08-18T00:30:58.619504Z","submitted_at":"2025-07-28T17:24:57Z","title":"Provable Knowledge Acquisition and Extraction in One-Layer Transformers","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-21T23:05:56.687644Z"},"links":{"cited_paper":"/paper/2012.14913","citing_paper":"/paper/2508.00901"},"observation_digest":"sha256:0dd23b7c15999e03e14089a5773e92d4da3e2323bc886346665adedd9e0b0372","observation_id":"82df89cf-70ca-4945-b7ec-772d03367ac6","resolution":{"observed_at":"2026-05-21T23:10:44.875465Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-14T23:08:16.863947+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-14T23:08:16.863947+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14785","last_updated":"2024-06-20T23:27:06Z","snapshot_observed_at":"2026-08-19T20:37:02.420992Z","submitted_at":"2024-06-20T23:27:06Z","title":"Understanding Finetuning for Factual Knowledge Extraction","version":1},"cited_work":{"arxiv_id":"2406.14785","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.14785","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Understanding finetuning for factual knowledge extraction","venue":null,"work_id":"c37ea512-a3c0-4e1c-887d-f6a4c3329df1","year":2024},"citing_paper":{"arxiv_id":"2508.00901","last_updated":"2026-05-18T13:04:24Z","snapshot_observed_at":"2026-08-18T00:30:58.619504Z","submitted_at":"2025-07-28T17:24:57Z","title":"Provable Knowledge Acquisition and Extraction in One-Layer Transformers","version":4},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-21T23:05:56.687644Z"},"links":{"cited_paper":"/paper/2406.14785","citing_paper":"/paper/2508.00901"},"observation_digest":"sha256:71d8cb5665ee78d7f39792a28523f239cab6047ea5dd822be978a49496b90eb6","observation_id":"c337a012-9ada-484b-bc02-887e77929c3e","resolution":{"observed_at":"2026-05-21T23:10:44.845010Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":"2407.21783","doi":"10.1016/s0749-0720(15","metadata_source":"pith","pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"The Llama 3 Herd of Models","venue":"cs.AI","work_id":"1549a635-88af-4ac1-acfe-51ae7bb53345","year":2024},"citing_paper":{"arxiv_id":"2508.00901","last_updated":"2026-05-18T13:04:24Z","snapshot_observed_at":"2026-08-18T00:30:58.619504Z","submitted_at":"2025-07-28T17:24:57Z","title":"Provable Knowledge Acquisition and Extraction in One-Layer Transformers","version":4},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-21T23:05:56.687644Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2508.00901"},"observation_digest":"sha256:661baa47abb2808ef8a5d7a0843f0028c73a993e6f1a020c62abdd2439fa9a01","observation_id":"c54b138c-578a-4ea6-9a19-c6b325a07410","resolution":{"observed_at":"2026-05-21T23:10:44.885336Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05249","last_updated":"2023-10-08T17:55:33Z","snapshot_observed_at":"2026-08-21T18:19:38.464498Z","submitted_at":"2023-10-08T17:55:33Z","title":"In-Context Convergence of Transformers","version":1},"cited_work":{"arxiv_id":"2310.05249","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.05249","snapshot_observed_at":"2026-06-29T08:23:15.195100Z","title":"In-context convergence of transformers","venue":null,"work_id":"a7cfc4fc-1c75-46a4-a2cf-2ef227e93641","year":2023},"citing_paper":{"arxiv_id":"2508.00901","last_updated":"2026-05-18T13:04:24Z","snapshot_observed_at":"2026-08-18T00:30:58.619504Z","submitted_at":"2025-07-28T17:24:57Z","title":"Provable Knowledge Acquisition and Extraction in One-Layer Transformers","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-21T23:05:56.687644Z"},"links":{"cited_paper":"/paper/2310.05249","citing_paper":"/paper/2508.00901"},"observation_digest":"sha256:c07ec3cf883d32bab9eb146887369c4f3835de52856d3e728dac3f685b1aa8d4","observation_id":"c79b9456-d1d4-4a60-80d9-326a67f33907","resolution":{"observed_at":"2026-05-21T23:10:44.840921Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vision transformers provably learn spatial structure","venue":null,"work_id":"4f38c9b4-30d6-4f72-9483-a33d0b78de4b","year":2022},"citing_paper":{"arxiv_id":"2508.00901","last_updated":"2026-05-18T13:04:24Z","snapshot_observed_at":"2026-08-18T00:30:58.619504Z","submitted_at":"2025-07-28T17:24:57Z","title":"Provable Knowledge Acquisition and Extraction in One-Layer Transformers","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-21T23:05:56.687644Z"},"links":{"citing_paper":"/paper/2508.00901"},"observation_digest":"sha256:450034aea591ae04f0e206707330a6b48a8a0de960710c5937bae9b480eed749","observation_id":"17e089b1-a4a6-4f41-adeb-e1763392258c","resolution":{"observed_at":"2026-05-21T23:15:45.127250Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Unveil benign overfitting for transformer in vision: Training dynamics, convergence, and generalization","venue":null,"work_id":"ad4e80e5-425e-4212-acff-9465fcf5400f","year":2024},"citing_paper":{"arxiv_id":"2508.00901","last_updated":"2026-05-18T13:04:24Z","snapshot_observed_at":"2026-08-18T00:30:58.619504Z","submitted_at":"2025-07-28T17:24:57Z","title":"Provable Knowledge Acquisition and Extraction in One-Layer Transformers","version":4},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-21T23:05:56.687644Z"},"links":{"citing_paper":"/paper/2508.00901"},"observation_digest":"sha256:fc8c1969c5a8a6ea1dc313174f4f89addc765629be2181ef68679e6f7065910d","observation_id":"693b6d58-a4b3-4cb6-aa09-c9b8cd74746d","resolution":{"observed_at":"2026-05-21T23:15:45.177731Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Optimal memorization capacity of transformers","venue":null,"work_id":"3ee844a0-138d-4782-87db-2ce7e2c19565","year":2025},"citing_paper":{"arxiv_id":"2508.00901","last_updated":"2026-05-18T13:04:24Z","snapshot_observed_at":"2026-08-18T00:30:58.619504Z","submitted_at":"2025-07-28T17:24:57Z","title":"Provable Knowledge Acquisition and Extraction in One-Layer Transformers","version":4},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-21T23:05:56.687644Z"},"links":{"citing_paper":"/paper/2508.00901"},"observation_digest":"sha256:3e8918736af236895c805ae5faa138a264c9c2809f5a98af7171bf58f210a5c4","observation_id":"7cc9718f-71dd-49ee-89bb-c509c88c97f0","resolution":{"observed_at":"2026-05-21T23:15:45.169591Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Large language models struggle to learn long-tail knowledge","venue":null,"work_id":"4f57882c-9f8a-416e-8846-3df3084cd1a7","year":2023},"citing_paper":{"arxiv_id":"2508.00901","last_updated":"2026-05-18T13:04:24Z","snapshot_observed_at":"2026-08-18T00:30:58.619504Z","submitted_at":"2025-07-28T17:24:57Z","title":"Provable Knowledge Acquisition and Extraction in One-Layer Transformers","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-21T23:05:56.687644Z"},"links":{"citing_paper":"/paper/2508.00901"},"observation_digest":"sha256:e081413d058bc5ffae33babd3fe15bcc85dbc10aa208a297de75199f6f162fd2","observation_id":"8a33e6e2-c8c1-41bb-a24d-1498eb4cb55e","resolution":{"observed_at":"2026-05-21T23:15:45.180067Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Provable memorization capacity of transformers","venue":null,"work_id":"cc6abd7e-885c-45f8-998e-4258e0a1ac3c","year":2023},"citing_paper":{"arxiv_id":"2508.00901","last_updated":"2026-05-18T13:04:24Z","snapshot_observed_at":"2026-08-18T00:30:58.619504Z","submitted_at":"2025-07-28T17:24:57Z","title":"Provable Knowledge Acquisition and Extraction in One-Layer Transformers","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-21T23:05:56.687644Z"},"links":{"citing_paper":"/paper/2508.00901"},"observation_digest":"sha256:ac61e9591b1f1d087531b080f88c1502897d32dae4cef429ca937675cefd8ab5","observation_id":"efcd39cd-ba49-4196-8bd6-e7193b11aac7","resolution":{"observed_at":"2026-05-21T23:15:45.140595Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Benign overfitting in two-layer relu convolutional neural networks","venue":null,"work_id":"4769d9af-ab7f-4ae1-a48d-96cc84c68c35","year":2023},"citing_paper":{"arxiv_id":"2508.00901","last_updated":"2026-05-18T13:04:24Z","snapshot_observed_at":"2026-08-18T00:30:58.619504Z","submitted_at":"2025-07-28T17:24:57Z","title":"Provable Knowledge Acquisition and Extraction in One-Layer Transformers","version":4},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-21T23:05:56.687644Z"},"links":{"citing_paper":"/paper/2508.00901"},"observation_digest":"sha256:1ebdd58d2f9e0cd241340543e28d819fb4340278610390fa59cf29efd491898e","observation_id":"3d6a51fe-209e-450a-8266-d5203507242a","resolution":{"observed_at":"2026-05-21T23:15:45.143623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.06499","last_updated":"2022-03-24T19:29:45Z","snapshot_observed_at":"2026-08-14T07:55:03.346803Z","submitted_at":"2021-07-14T06:06:52Z","title":"Deduplicating Training Data Makes Language Models Better","version":2},"cited_work":{"arxiv_id":"2107.06499","doi":null,"metadata_source":"pith","pith_arxiv_id":"2107.06499","snapshot_observed_at":"2026-07-09T03:05:54.907820Z","title":"Deduplicating Training Data Makes Language Models Better","venue":"cs.CL","work_id":"7b9b24f2-6013-4e4a-be6b-ce3aeef64aa8","year":2021},"citing_paper":{"arxiv_id":"2508.00901","last_updated":"2026-05-18T13:04:24Z","snapshot_observed_at":"2026-08-18T00:30:58.619504Z","submitted_at":"2025-07-28T17:24:57Z","title":"Provable Knowledge Acquisition and Extraction in One-Layer Transformers","version":4},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-21T23:05:56.687644Z"},"links":{"cited_paper":"/paper/2107.06499","citing_paper":"/paper/2508.00901"},"observation_digest":"sha256:d34f727e6fb9b1acd76a3ce70a8062e36116d8f0acdbebbb6885addaa6000162","observation_id":"c7a0fcf5-efa5-40d6-a60d-f92613bee5aa","resolution":{"observed_at":"2026-05-21T23:10:44.865987Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2405.13718","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T13:29:51.059442Z","title":"Next-token prediction capacity: general upper bounds and a lower bound for transformers","venue":null,"work_id":"70bbd170-a69b-4d88-98c6-b3ce272c6a69","year":2024},"citing_paper":{"arxiv_id":"2508.00901","last_updated":"2026-05-18T13:04:24Z","snapshot_observed_at":"2026-08-18T00:30:58.619504Z","submitted_at":"2025-07-28T17:24:57Z","title":"Provable Knowledge Acquisition and Extraction in One-Layer Transformers","version":4},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-21T23:05:56.687644Z"},"links":{"citing_paper":"/paper/2508.00901"},"observation_digest":"sha256:15c652922e0addeadc1d1042708bd128bb54f2c21013d96738a71d31c9314284","observation_id":"cd2cff31-1120-40a7-b9ec-f60124cdf36e","resolution":{"observed_at":"2026-05-21T23:10:44.882273Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.03576","last_updated":"2023-07-07T13:09:18Z","snapshot_observed_at":"2026-08-20T14:15:07.919397Z","submitted_at":"2023-07-07T13:09:18Z","title":"One Step of Gradient Descent is Provably the Optimal In-Context Learner with One Layer of Linear Self-Attention","version":1},"cited_work":{"arxiv_id":"2307.03576","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2307.03576","snapshot_observed_at":"2026-06-29T14:33:30.570924Z","title":"One step of gradient descent is provably the optimal in-context learner with one layer of linear self-attention","venue":null,"work_id":"49de5367-668e-498d-a2e1-f2d4fc0e2df6","year":2023},"citing_paper":{"arxiv_id":"2508.00901","last_updated":"2026-05-18T13:04:24Z","snapshot_observed_at":"2026-08-18T00:30:58.619504Z","submitted_at":"2025-07-28T17:24:57Z","title":"Provable Knowledge Acquisition and Extraction in One-Layer Transformers","version":4},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-21T23:05:56.687644Z"},"links":{"cited_paper":"/paper/2307.03576","citing_paper":"/paper/2508.00901"},"observation_digest":"sha256:91dafae64e4cb2d1329abc67177443df9196986d3b61eee746ccfbc37ff09200","observation_id":"98571dc9-753e-4717-8ae1-ea886bd49bf9","resolution":{"observed_at":"2026-05-21T23:10:44.859425Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02010","last_updated":"2024-03-02T07:50:37Z","snapshot_observed_at":"2026-08-16T15:26:57.006243Z","submitted_at":"2023-06-03T05:45:29Z","title":"Memorization Capacity of Multi-Head Attention in Transformers","version":3},"cited_work":{"arxiv_id":"2306.02010","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.02010","snapshot_observed_at":"2026-07-04T13:29:50.983470Z","title":"Memorization Capacity of Multi-Head Attention in Transformers","venue":null,"work_id":"afa43762-3e69-4f41-b386-b768785d6661","year":2024},"citing_paper":{"arxiv_id":"2508.00901","last_updated":"2026-05-18T13:04:24Z","snapshot_observed_at":"2026-08-18T00:30:58.619504Z","submitted_at":"2025-07-28T17:24:57Z","title":"Provable Knowledge Acquisition and Extraction in One-Layer Transformers","version":4},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-21T23:05:56.687644Z"},"links":{"cited_paper":"/paper/2306.02010","citing_paper":"/paper/2508.00901"},"observation_digest":"sha256:4a81006588cc31ea7d9177ca9d2ea2d790a27618247d74058819c336b59f6c5c","observation_id":"6bdd94b1-7785-4547-9142-481f60980056","resolution":{"observed_at":"2026-05-21T23:10:44.872367Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10511","last_updated":"2023-07-02T07:21:59Z","snapshot_observed_at":"2026-07-06T14:33:08.041820Z","submitted_at":"2022-12-20T18:30:15Z","title":"When Not to Trust Language Models: Investigating Effectiveness of Parametric and Non-Parametric Memories","version":4},"cited_work":{"arxiv_id":"2212.10511","doi":"10.48550/arxiv.2212.10511","metadata_source":"pith","pith_arxiv_id":"2212.10511","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"When Not to Trust Language Models: Investigating Effectiveness of Parametric and Non-Parametric Memories","venue":"cs.CL","work_id":"5021c16e-c088-4765-8c10-3d0dd6e18bb0","year":2022},"citing_paper":{"arxiv_id":"2508.00901","last_updated":"2026-05-18T13:04:24Z","snapshot_observed_at":"2026-08-18T00:30:58.619504Z","submitted_at":"2025-07-28T17:24:57Z","title":"Provable Knowledge Acquisition and Extraction in One-Layer Transformers","version":4},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-21T23:05:56.687644Z"},"links":{"cited_paper":"/paper/2212.10511","citing_paper":"/paper/2508.00901"},"observation_digest":"sha256:b0384c5e0742477873fba4ddcb0c2b5d1341f0f23f9cc4a67a9e39de06f9d9e0","observation_id":"ed10931f-24e5-4a47-b46f-53eed430d8a9","resolution":{"observed_at":"2026-05-21T23:10:44.834102Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Locating and editing factual associations in gpt","venue":null,"work_id":"2330af00-3882-448f-9783-ea0ca897c689","year":2022},"citing_paper":{"arxiv_id":"2508.00901","last_updated":"2026-05-18T13:04:24Z","snapshot_observed_at":"2026-08-18T00:30:58.619504Z","submitted_at":"2025-07-28T17:24:57Z","title":"Provable Knowledge Acquisition and Extraction in One-Layer Transformers","version":4},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-21T23:05:56.687644Z"},"links":{"citing_paper":"/paper/2508.00901"},"observation_digest":"sha256:35cf12f9cc3dc45105253d774b63cb0856652751864138f07def1c0cc017c89c","observation_id":"2b5b6738-1257-4614-84fb-2579408cb3cf","resolution":{"observed_at":"2026-05-21T23:15:45.148566Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14735","last_updated":"2024-08-13T15:45:37Z","snapshot_observed_at":"2026-08-16T14:16:09.696469Z","submitted_at":"2024-02-22T17:47:03Z","title":"How Transformers Learn Causal Structure with Gradient Descent","version":2},"cited_work":{"arxiv_id":"2402.14735","doi":"10.48550/arxiv.2402.14735","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.14735","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Nichani, A","venue":"arXiv (Cornell University)","work_id":"15b3610a-8bd8-4edd-9296-a4ad1ee0cbaf","year":2024},"citing_paper":{"arxiv_id":"2508.00901","last_updated":"2026-05-18T13:04:24Z","snapshot_observed_at":"2026-08-18T00:30:58.619504Z","submitted_at":"2025-07-28T17:24:57Z","title":"Provable Knowledge Acquisition and Extraction in One-Layer Transformers","version":4},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-21T23:05:56.687644Z"},"links":{"cited_paper":"/paper/2402.14735","citing_paper":"/paper/2508.00901"},"observation_digest":"sha256:6f6aeb0139156c1dbc36faea3763f4dc2e4732547a842a615c9d5c1f36114c2e","observation_id":"0f83e290-35b7-4ccd-80a0-69c93bc572ee","resolution":{"observed_at":"2026-05-21T23:10:44.830980Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06538","last_updated":"2024-12-09T14:48:14Z","snapshot_observed_at":"2026-08-23T19:26:26.873377Z","submitted_at":"2024-12-09T14:48:14Z","title":"Understanding Factual Recall in Transformers via Associative Memories","version":1},"cited_work":{"arxiv_id":"2412.06538","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.06538","snapshot_observed_at":"2026-07-10T01:36:44.301678Z","title":"Understanding factual recall in transformers via associative memories","venue":"cs.LG","work_id":"35a95075-3fb2-463f-9082-33da2c36f958","year":2024},"citing_paper":{"arxiv_id":"2508.00901","last_updated":"2026-05-18T13:04:24Z","snapshot_observed_at":"2026-08-18T00:30:58.619504Z","submitted_at":"2025-07-28T17:24:57Z","title":"Provable Knowledge Acquisition and Extraction in One-Layer Transformers","version":4},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-21T23:05:56.687644Z"},"links":{"cited_paper":"/paper/2412.06538","citing_paper":"/paper/2508.00901"},"observation_digest":"sha256:6da7fd122d2738d14f48aa1b11733eeaab692b1a4f09eae8b55faf6a838d2cca","observation_id":"f6500055-9d8b-49dc-8dcf-2c18cfa67d4d","resolution":{"observed_at":"2026-05-21T23:10:44.855297Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Language models are unsupervised multitask learners","venue":null,"work_id":"5fa609b3-1203-4f0e-a526-0110cb3f8046","year":2019},"citing_paper":{"arxiv_id":"2508.00901","last_updated":"2026-05-18T13:04:24Z","snapshot_observed_at":"2026-08-18T00:30:58.619504Z","submitted_at":"2025-07-28T17:24:57Z","title":"Provable Knowledge Acquisition and Extraction in One-Layer Transformers","version":4},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-21T23:05:56.687644Z"},"links":{"citing_paper":"/paper/2508.00901"},"observation_digest":"sha256:46189cee8d58689b0bdae6fb8b8f2ea576b8434c84c029e3bc87dba1ca9784a9","observation_id":"e3872ae8-077c-42e0-a6ef-ff13c614f70c","resolution":{"observed_at":"2026-05-21T23:15:45.153397Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Data augmentation as feature manipu- lation","venue":null,"work_id":"27c468c2-4603-4e24-98eb-f1d659ebec33","year":2022},"citing_paper":{"arxiv_id":"2508.00901","last_updated":"2026-05-18T13:04:24Z","snapshot_observed_at":"2026-08-18T00:30:58.619504Z","submitted_at":"2025-07-28T17:24:57Z","title":"Provable Knowledge Acquisition and Extraction in One-Layer Transformers","version":4},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-21T23:05:56.687644Z"},"links":{"citing_paper":"/paper/2508.00901"},"observation_digest":"sha256:a65bbfff5a0c0bcfd60476eef54834b23a9fa1dc11aa310405f19fb99ec614ce","observation_id":"db597d97-b182-46ec-9c2e-1f305677ac0e","resolution":{"observed_at":"2026-05-21T23:15:45.165587Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scan and snap: Understand- ing training dynamics and token composition in 1-layer transformer","venue":null,"work_id":"952b2c06-dd09-4db6-93f7-e574cd2a1c25","year":2023},"citing_paper":{"arxiv_id":"2508.00901","last_updated":"2026-05-18T13:04:24Z","snapshot_observed_at":"2026-08-18T00:30:58.619504Z","submitted_at":"2025-07-28T17:24:57Z","title":"Provable Knowledge Acquisition and Extraction in One-Layer Transformers","version":4},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-21T23:05:56.687644Z"},"links":{"citing_paper":"/paper/2508.00901"},"observation_digest":"sha256:e8d5b7d765191332c2eacb007afae00ea7a4cbb3d7aec8b4834a48dba4de3cc9","observation_id":"e2280d1c-a3a4-42d7-a954-3856dbd84e58","resolution":{"observed_at":"2026-05-21T23:15:45.203938Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00535","last_updated":"2024-03-15T02:03:21Z","snapshot_observed_at":"2026-08-20T04:54:14.800795Z","submitted_at":"2023-10-01T01:21:35Z","title":"JoMA: Demystifying Multilayer Transformers via JOint Dynamics of MLP and Attention","version":3},"cited_work":{"arxiv_id":"2310.00535","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.00535","snapshot_observed_at":"2026-06-29T14:33:30.605763Z","title":"Joma: Demys- tifying multilayer transformers via joint dynamics of mlp and attention","venue":null,"work_id":"6770e214-8101-4e59-98dc-74670c48e483","year":2023},"citing_paper":{"arxiv_id":"2508.00901","last_updated":"2026-05-18T13:04:24Z","snapshot_observed_at":"2026-08-18T00:30:58.619504Z","submitted_at":"2025-07-28T17:24:57Z","title":"Provable Knowledge Acquisition and Extraction in One-Layer Transformers","version":4},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-21T23:05:56.687644Z"},"links":{"cited_paper":"/paper/2310.00535","citing_paper":"/paper/2508.00901"},"observation_digest":"sha256:b28eae032e9032a603fd34aad7b005f048701f7747f3a693ae8e6cd4b49079f6","observation_id":"59d62af1-a3cd-4273-bb39-e1f1000f3757","resolution":{"observed_at":"2026-05-21T23:10:44.848215Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rethinking benign overfitting in two-layer neural networks","venue":null,"work_id":"7a0f98dd-b3fd-4ac3-abf7-13ce5baadf77","year":2025},"citing_paper":{"arxiv_id":"2508.00901","last_updated":"2026-05-18T13:04:24Z","snapshot_observed_at":"2026-08-18T00:30:58.619504Z","submitted_at":"2025-07-28T17:24:57Z","title":"Provable Knowledge Acquisition and Extraction in One-Layer Transformers","version":4},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-21T23:05:56.687644Z"},"links":{"citing_paper":"/paper/2508.00901"},"observation_digest":"sha256:f1cc5c7db943bc923df47735aab3874134b4933242ad54cb1703fbb1b179a8b8","observation_id":"9de1d0b7-1632-483d-a5e2-0f27b96f5bb4","resolution":{"observed_at":"2026-05-21T23:15:45.193881Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Knowledge circuits in pretrained transformers","venue":null,"work_id":"a870b82a-0cfb-4aa2-8e74-7b71f64567af","year":2024},"citing_paper":{"arxiv_id":"2508.00901","last_updated":"2026-05-18T13:04:24Z","snapshot_observed_at":"2026-08-18T00:30:58.619504Z","submitted_at":"2025-07-28T17:24:57Z","title":"Provable Knowledge Acquisition and Extraction in One-Layer Transformers","version":4},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-21T23:05:56.687644Z"},"links":{"citing_paper":"/paper/2508.00901"},"observation_digest":"sha256:8fae2fa46280988b876bc8633c28da4486056b4a09a4c8017c332e84ac5dfbc8","observation_id":"d245bf62-821a-4499-8cb7-f001155fdc56","resolution":{"observed_at":"2026-05-21T23:15:45.192034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Are transformers universal approximators of sequence-to-sequence functions? International Conference on Learning Representations","venue":null,"work_id":"993a0bcb-3441-43f8-a40f-e1ce3c1276db","year":2020},"citing_paper":{"arxiv_id":"2508.00901","last_updated":"2026-05-18T13:04:24Z","snapshot_observed_at":"2026-08-18T00:30:58.619504Z","submitted_at":"2025-07-28T17:24:57Z","title":"Provable Knowledge Acquisition and Extraction in One-Layer Transformers","version":4},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-21T23:05:56.687644Z"},"links":{"citing_paper":"/paper/2508.00901"},"observation_digest":"sha256:43627d197849375395f34702380c983f5c944b3ac84933a97facc2e235e2d1f5","observation_id":"98967ec6-cae9-4447-a2cc-23f063076a39","resolution":{"observed_at":"2026-05-21T23:15:45.171530Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Trained transformers learn linear models in-context","venue":null,"work_id":"1f8005b5-b53c-4cb1-a6c8-b5c236ca006e","year":2024},"citing_paper":{"arxiv_id":"2508.00901","last_updated":"2026-05-18T13:04:24Z","snapshot_observed_at":"2026-08-18T00:30:58.619504Z","submitted_at":"2025-07-28T17:24:57Z","title":"Provable Knowledge Acquisition and Extraction in One-Layer Transformers","version":4},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-21T23:05:56.687644Z"},"links":{"citing_paper":"/paper/2508.00901"},"observation_digest":"sha256:cf024dd5b37e2ea268d478f0be8520980d41b1fabdcd1c85fa09496479187f0a","observation_id":"bf517ccc-3fbb-4f49-9f22-7fd04b8cbda4","resolution":{"observed_at":"2026-05-21T23:15:45.132137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards a theoretical understanding of the’reversal curse’via training dynamics","venue":null,"work_id":"5558165e-508b-4ad7-887a-ef5ca6c5aed0","year":2024},"citing_paper":{"arxiv_id":"2508.00901","last_updated":"2026-05-18T13:04:24Z","snapshot_observed_at":"2026-08-18T00:30:58.619504Z","submitted_at":"2025-07-28T17:24:57Z","title":"Provable Knowledge Acquisition and Extraction in One-Layer Transformers","version":4},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-21T23:05:56.687644Z"},"links":{"citing_paper":"/paper/2508.00901"},"observation_digest":"sha256:5621303a3a298239cdb5712921f27e78409a66315583aebc51e0465ec903936c","observation_id":"b114abe6-ebd9-491d-8722-854deeab8a7a","resolution":{"observed_at":"2026-05-21T23:15:45.136569Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The benefits of mixup for feature learning","venue":null,"work_id":"c59aa327-b530-4faa-a039-ff6892b93444","year":2023},"citing_paper":{"arxiv_id":"2508.00901","last_updated":"2026-05-18T13:04:24Z","snapshot_observed_at":"2026-08-18T00:30:58.619504Z","submitted_at":"2025-07-28T17:24:57Z","title":"Provable Knowledge Acquisition and Extraction in One-Layer Transformers","version":4},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-21T23:05:56.687644Z"},"links":{"citing_paper":"/paper/2508.00901"},"observation_digest":"sha256:0edb0440aaf36d33628e36bab9f13d9798aaf7728682faf26ccddf0e31a9e1d7","observation_id":"2d86208f-6a23-4cea-b185-d9698c641861","resolution":{"observed_at":"2026-05-21T23:15:45.175545Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"70d19b72-30d9-4593-959c-d385c2ffc2aa","year":null},"citing_paper":{"arxiv_id":"2508.00901","last_updated":"2026-05-18T13:04:24Z","snapshot_observed_at":"2026-08-18T00:30:58.619504Z","submitted_at":"2025-07-28T17:24:57Z","title":"Provable Knowledge Acquisition and Extraction in One-Layer Transformers","version":4},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-21T23:05:56.687644Z"},"links":{"citing_paper":"/paper/2508.00901"},"observation_digest":"sha256:e8a0d3dcbb81691bf28ccce6c592c8d3064d62b1de4ce4889a194b11b87e5c4a","observation_id":"9275d688-f560-42b3-a53c-f2368f50236b","resolution":{"observed_at":"2026-05-21T23:15:45.138663Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"74ca163f-b851-48e9-b20f-f956b475eb0f","year":null},"citing_paper":{"arxiv_id":"2508.00901","last_updated":"2026-05-18T13:04:24Z","snapshot_observed_at":"2026-08-18T00:30:58.619504Z","submitted_at":"2025-07-28T17:24:57Z","title":"Provable Knowledge Acquisition and Extraction in One-Layer Transformers","version":4},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-21T23:05:56.687644Z"},"links":{"citing_paper":"/paper/2508.00901"},"observation_digest":"sha256:0779d2ab56bda258a28b1cd7ea8c83b5dc71344c534dcf682af1274c4d6f235b","observation_id":"d3d1eaeb-e6a3-4c63-8fb3-99ab63d3c1c6","resolution":{"observed_at":"2026-05-21T23:15:45.146406Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"b6dc711b-fce5-4b1d-8b3d-89d7a389dc4c","year":null},"citing_paper":{"arxiv_id":"2508.00901","last_updated":"2026-05-18T13:04:24Z","snapshot_observed_at":"2026-08-18T00:30:58.619504Z","submitted_at":"2025-07-28T17:24:57Z","title":"Provable Knowledge Acquisition and Extraction in One-Layer Transformers","version":4},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-21T23:05:56.687644Z"},"links":{"citing_paper":"/paper/2508.00901"},"observation_digest":"sha256:2aed07523ea6aaaf5355754b4fc7b66dadf534f2ad76e22fa98a373095ef9f69","observation_id":"295216a7-5bf3-460f-b129-6ce56fce8e39","resolution":{"observed_at":"2026-05-21T23:15:45.195818Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Based on the sentence set T , we construct the pre-training dataset as follows: For each (sj, ri, aj) ∈ T","venue":null,"work_id":"c262b9d1-5679-405b-91d8-0219603dec76","year":null},"citing_paper":{"arxiv_id":"2508.00901","last_updated":"2026-05-18T13:04:24Z","snapshot_observed_at":"2026-08-18T00:30:58.619504Z","submitted_at":"2025-07-28T17:24:57Z","title":"Provable Knowledge Acquisition and Extraction in One-Layer Transformers","version":4},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-21T23:05:56.687644Z"},"links":{"citing_paper":"/paper/2508.00901"},"observation_digest":"sha256:ec3d40fa67a57f2574de4e3a9e9f571a2428fb79ac0f5dfcad8b28d55b216bba","observation_id":"a625a410-8c41-4c57-bdc4-4e2ae50bf63e","resolution":{"observed_at":"2026-05-21T23:15:45.190128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"We construct the fine-tuning dataset and the test dataset as For each (sj, ri, aj) ∈ T","venue":null,"work_id":"70d3262e-d350-442c-a487-6c8f98f7b18c","year":null},"citing_paper":{"arxiv_id":"2508.00901","last_updated":"2026-05-18T13:04:24Z","snapshot_observed_at":"2026-08-18T00:30:58.619504Z","submitted_at":"2025-07-28T17:24:57Z","title":"Provable Knowledge Acquisition and Extraction in One-Layer Transformers","version":4},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-21T23:05:56.687644Z"},"links":{"citing_paper":"/paper/2508.00901"},"observation_digest":"sha256:9e0f914695438074ec9be5d159b0bbc58e6f8ac40e7f305f85460964a015b2c4","observation_id":"98e94caf-d04e-4d28-abd9-8121290fc499","resolution":{"observed_at":"2026-05-21T23:15:45.163711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"3991455a-529e-42bf-ab67-4404984cb7bc","year":null},"citing_paper":{"arxiv_id":"2508.00901","last_updated":"2026-05-18T13:04:24Z","snapshot_observed_at":"2026-08-18T00:30:58.619504Z","submitted_at":"2025-07-28T17:24:57Z","title":"Provable Knowledge Acquisition and Extraction in One-Layer Transformers","version":4},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-21T23:05:56.687644Z"},"links":{"citing_paper":"/paper/2508.00901"},"observation_digest":"sha256:f7d816c1e79ba7dda3319f9831cf2ce310a5313b8d1a7adc23239eea46488bba","observation_id":"fba0194a-03a7-47c2-9c64-8df93d491ef8","resolution":{"observed_at":"2026-05-21T23:15:45.155444Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"We assume all token embeddings— sj, ri, aj, for all j ∈ [N] and i ∈ R are generated from random Gaussian distributions N (0, σ2I)","venue":null,"work_id":"c539c44e-6b1a-4b71-9080-769e02fc50cc","year":null},"citing_paper":{"arxiv_id":"2508.00901","last_updated":"2026-05-18T13:04:24Z","snapshot_observed_at":"2026-08-18T00:30:58.619504Z","submitted_at":"2025-07-28T17:24:57Z","title":"Provable Knowledge Acquisition and Extraction in One-Layer Transformers","version":4},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-21T23:05:56.687644Z"},"links":{"citing_paper":"/paper/2508.00901"},"observation_digest":"sha256:74cb8ed05d2bf5bdf5977f7642d7af7fb82095677d64c788454f54ce658659e3","observation_id":"dbbb93a2-a461-48f3-9f98-37b7fea1d8a7","resolution":{"observed_at":"2026-05-21T23:15:45.182199Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"nX i=1 I(j ∈ A i) ≥ K 2q n # ≤ exp − nK2 2q2 . (44) 25 Proof. In each time i ∈ [n], a number j ∈ [q] has probability K/q to selected. By Hoeffding’s inequality, we have: P","venue":null,"work_id":"d8e80a40-b555-4eb6-baa1-4596d0a506b6","year":null},"citing_paper":{"arxiv_id":"2508.00901","last_updated":"2026-05-18T13:04:24Z","snapshot_observed_at":"2026-08-18T00:30:58.619504Z","submitted_at":"2025-07-28T17:24:57Z","title":"Provable Knowledge Acquisition and Extraction in One-Layer Transformers","version":4},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-21T23:05:56.687644Z"},"links":{"citing_paper":"/paper/2508.00901"},"observation_digest":"sha256:618172686df388db9e022ce7fa4164fd79874d1ce60bb468258d67acdc61d4a6","observation_id":"ee853f0d-b7d9-4e61-b8b9-7532c6fe971b","resolution":{"observed_at":"2026-05-21T23:15:45.200223Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"998e5765-00ed-4ea1-834e-4977a07012b6","year":null},"citing_paper":{"arxiv_id":"2508.00901","last_updated":"2026-05-18T13:04:24Z","snapshot_observed_at":"2026-08-18T00:30:58.619504Z","submitted_at":"2025-07-28T17:24:57Z","title":"Provable Knowledge Acquisition and Extraction in One-Layer Transformers","version":4},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-21T23:05:56.687644Z"},"links":{"citing_paper":"/paper/2508.00901"},"observation_digest":"sha256:89e3630f186bd9d489f22c155b503440f09d0988c7fec459a6f077f085c12f95","observation_id":"7aa70d31-1560-4218-bea5-e5de6f120a3d","resolution":{"observed_at":"2026-05-21T23:15:45.209658Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"6c53ce80-ad6a-4fb4-bd9a-37002245c0cb","year":null},"citing_paper":{"arxiv_id":"2508.00901","last_updated":"2026-05-18T13:04:24Z","snapshot_observed_at":"2026-08-18T00:30:58.619504Z","submitted_at":"2025-07-28T17:24:57Z","title":"Provable Knowledge Acquisition and Extraction in One-Layer Transformers","version":4},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-21T23:05:56.687644Z"},"links":{"citing_paper":"/paper/2508.00901"},"observation_digest":"sha256:1d663e274a45ff5d019224ccca50d847861ced6d7ae7fa934d2d7508f4da6935","observation_id":"7e2e6550-6ab9-478a-9902-e9fcbb57cf09","resolution":{"observed_at":"2026-05-21T23:15:45.202026Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"b433a3f1-3fa5-4d93-856c-2f157f39ed9b","year":null},"citing_paper":{"arxiv_id":"2508.00901","last_updated":"2026-05-18T13:04:24Z","snapshot_observed_at":"2026-08-18T00:30:58.619504Z","submitted_at":"2025-07-28T17:24:57Z","title":"Provable Knowledge Acquisition and Extraction in One-Layer Transformers","version":4},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-21T23:05:56.687644Z"},"links":{"citing_paper":"/paper/2508.00901"},"observation_digest":"sha256:b5d7ca061ad123d47bf5e7fbd813e2f26582e87688e6c74990d4e15598896e87","observation_id":"55e05847-3ee1-459b-8885-5013041cf37f","resolution":{"observed_at":"2026-05-21T23:15:45.161723Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"(70) Proof","venue":null,"work_id":"8205af2d-0b23-47c4-852b-233caeea40f0","year":null},"citing_paper":{"arxiv_id":"2508.00901","last_updated":"2026-05-18T13:04:24Z","snapshot_observed_at":"2026-08-18T00:30:58.619504Z","submitted_at":"2025-07-28T17:24:57Z","title":"Provable Knowledge Acquisition and Extraction in One-Layer Transformers","version":4},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-21T23:05:56.687644Z"},"links":{"citing_paper":"/paper/2508.00901"},"observation_digest":"sha256:cf7610afeae9e16f8689756eed86b58be40daeb4367a4497fcf4386e3068b40b","observation_id":"583ff63e-d385-4041-aa99-d694cde1589f","resolution":{"observed_at":"2026-05-21T23:15:45.186290Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"After 2 iterations, we have 1 m mX k=1 ⟨w(T1) I(aj),k, Ξ(T1)([o s j ri])⟩ = O λη1dKs(j) nm","venue":null,"work_id":"2689fbde-31fe-4733-a6b4-a05c0f9e32d0","year":null},"citing_paper":{"arxiv_id":"2508.00901","last_updated":"2026-05-18T13:04:24Z","snapshot_observed_at":"2026-08-18T00:30:58.619504Z","submitted_at":"2025-07-28T17:24:57Z","title":"Provable Knowledge Acquisition and Extraction in One-Layer Transformers","version":4},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-21T23:05:56.687644Z"},"links":{"citing_paper":"/paper/2508.00901"},"observation_digest":"sha256:7877cda5937f1e05d20bfd5e904a2ee74338308b10136a38adb8a067754e75c1","observation_id":"98690a49-de06-4405-9f29-1755c3d1739b","resolution":{"observed_at":"2026-05-21T23:15:45.197902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"8fc24026-119e-46ed-aa99-d04e5b2d47a7","year":null},"citing_paper":{"arxiv_id":"2508.00901","last_updated":"2026-05-18T13:04:24Z","snapshot_observed_at":"2026-08-18T00:30:58.619504Z","submitted_at":"2025-07-28T17:24:57Z","title":"Provable Knowledge Acquisition and Extraction in One-Layer Transformers","version":4},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-21T23:05:56.687644Z"},"links":{"citing_paper":"/paper/2508.00901"},"observation_digest":"sha256:508025a13c9a52c08eda065dbfc5624e5ce67c3fe10e9381df3a4b078240f763","observation_id":"555e56af-0ffe-4acf-8c6a-d9485ad77dfb","resolution":{"observed_at":"2026-05-21T23:15:45.184027Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"017daa8a-9809-44b2-8b38-58da154e3eab","year":null},"citing_paper":{"arxiv_id":"2508.00901","last_updated":"2026-05-18T13:04:24Z","snapshot_observed_at":"2026-08-18T00:30:58.619504Z","submitted_at":"2025-07-28T17:24:57Z","title":"Provable Knowledge Acquisition and Extraction in One-Layer Transformers","version":4},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-21T23:05:56.687644Z"},"links":{"citing_paper":"/paper/2508.00901"},"observation_digest":"sha256:6a65a8adb833ccc02430f94fb07710591d1862d85fd167d6780b0929d05b37e0","observation_id":"9fd531e6-32e7-4b0a-ab5c-69c3a89e4746","resolution":{"observed_at":"2026-05-21T23:15:45.188138Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"669a7558-290f-492a-9bac-1afe60ea9c0c","year":null},"citing_paper":{"arxiv_id":"2508.00901","last_updated":"2026-05-18T13:04:24Z","snapshot_observed_at":"2026-08-18T00:30:58.619504Z","submitted_at":"2025-07-28T17:24:57Z","title":"Provable Knowledge Acquisition and Extraction in One-Layer Transformers","version":4},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-21T23:05:56.687644Z"},"links":{"citing_paper":"/paper/2508.00901"},"observation_digest":"sha256:3a1932529a5ffcd55cf3f25c7f4734878c7fe24fbedd970d10ae47011c947e2d","observation_id":"61a7c4a0-89ef-441d-ae30-9c6c76589b08","resolution":{"observed_at":"2026-05-21T23:15:45.150586Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"fa8f1c88-bdf2-4c1d-b07d-6c35f7fa384a","year":null},"citing_paper":{"arxiv_id":"2508.00901","last_updated":"2026-05-18T13:04:24Z","snapshot_observed_at":"2026-08-18T00:30:58.619504Z","submitted_at":"2025-07-28T17:24:57Z","title":"Provable Knowledge Acquisition and Extraction in One-Layer Transformers","version":4},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-21T23:05:56.687644Z"},"links":{"citing_paper":"/paper/2508.00901"},"observation_digest":"sha256:df087b2cb5121d6e237fd575eb085b448216d293fbabffd1483a0b00592bc3d5","observation_id":"bd73b812-2074-42fe-857c-c753a89ae53f","resolution":{"observed_at":"2026-05-21T23:15:45.157677Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"2d33fe87-01fe-4ad4-a674-e32e352fdb02","year":null},"citing_paper":{"arxiv_id":"2508.00901","last_updated":"2026-05-18T13:04:24Z","snapshot_observed_at":"2026-08-18T00:30:58.619504Z","submitted_at":"2025-07-28T17:24:57Z","title":"Provable Knowledge Acquisition and Extraction in One-Layer Transformers","version":4},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-21T23:05:56.687644Z"},"links":{"citing_paper":"/paper/2508.00901"},"observation_digest":"sha256:6543d095fa984cd7b3a5aaf6b6c2939aee4a44dd04d5bb1737b7a64f4bc5a10a","observation_id":"9de4e054-075a-4007-952f-193140735582","resolution":{"observed_at":"2026-05-21T23:15:45.129836Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"dX j=1 σjujv⊤ j # i , [RA1(G(tf ))]i = σ1u1v⊤ 1 i . (216) Taking the L2 norms, we have [G(tf )]i 2 2 =","venue":null,"work_id":"e35608f9-9b50-4f1a-a231-d2bf61735cbc","year":2000},"citing_paper":{"arxiv_id":"2508.00901","last_updated":"2026-05-18T13:04:24Z","snapshot_observed_at":"2026-08-18T00:30:58.619504Z","submitted_at":"2025-07-28T17:24:57Z","title":"Provable Knowledge Acquisition and Extraction in One-Layer Transformers","version":4},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-21T23:05:56.687644Z"},"links":{"citing_paper":"/paper/2508.00901"},"observation_digest":"sha256:a14bafafc603ee971c642fec4ff70b908640a0a10a1d303ed872f0b2d8bdbf7a","observation_id":"4f5e8f00-9d7e-4d16-9b23-7fe38d5068fd","resolution":{"observed_at":"2026-05-21T23:15:45.134512Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.00901","last_updated":"2026-05-18T13:04:24Z","latest_version":4,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-18T00:30:58.619504Z","submitted_at":"2025-07-28T17:24:57Z","title":"Provable Knowledge Acquisition and Extraction in One-Layer Transformers"},"reference_resolution":{"displayed":57,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":12,"verified_exact":16,"verified_fuzzy":28},"total_outbound_references":57},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 24 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 3 inbound Pith citation observations for arXiv:2508.00901."}