{"as_of":"2026-08-08T02:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:38fc88799bc212f6a1a493fe8ad50df351b1487b9c2239d95138fd1f4c75f712","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":12,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":12,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":12,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":12,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:46:34.110434Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-28T23:42:49.980406Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.19442","last_updated":"2024-06-10T17:18:07Z","snapshot_observed_at":"2026-08-07T21:58:57.595600Z","submitted_at":"2024-02-29T18:43:52Z","title":"Training Dynamics of Multi-Head Softmax Attention for In-Context Learning: Emergence, Convergence, and Optimality","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19442","snapshot_observed_at":"2026-08-07T12:46:34.110434Z","title":"Training dynamics of multi- head softmax attention for in-context learning: Emergence, convergence, and optimality.arXiv preprint arXiv:2402.19442, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23683","last_updated":"2025-05-29T17:22:00Z","snapshot_observed_at":"2026-08-07T21:59:35.039840Z","submitted_at":"2025-05-29T17:22:00Z","title":"Learning Compositional Functions with Transformers from Easy-to-Hard Data","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:34.110434Z"},"links":{"cited_paper":"/paper/2402.19442","citing_paper":"/paper/2505.23683"},"observation_digest":"sha256:39124aa0083c0d9ddd557ab52c70f54d4b6d658d54eb06faf5bfa1864a560497","observation_id":"a597f3a7-8913-43cb-bfa4-167279020fab","resolution":{"observed_at":"2026-08-07T12:46:34.110434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19442","last_updated":"2024-06-10T17:18:07Z","snapshot_observed_at":"2026-08-07T21:58:57.595600Z","submitted_at":"2024-02-29T18:43:52Z","title":"Training Dynamics of Multi-Head Softmax Attention for In-Context Learning: Emergence, Convergence, and Optimality","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19442","snapshot_observed_at":"2026-08-07T10:33:35.674370Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05200","last_updated":"2025-08-28T16:07:16Z","snapshot_observed_at":"2026-08-07T21:59:28.524595Z","submitted_at":"2025-06-05T16:12:51Z","title":"Transformers Meet In-Context Learning: A Universal Approximation Theory","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T10:33:35.674370Z"},"links":{"cited_paper":"/paper/2402.19442","citing_paper":"/paper/2506.05200"},"observation_digest":"sha256:a9ce981b33cd6bc01e1826b2ef4dc61b3a6243d0160a0552e68f8b11f198dfe1","observation_id":"b0a96b15-0d08-4d63-bc77-d4a28a323726","resolution":{"observed_at":"2026-08-07T10:33:35.674370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19442","last_updated":"2024-06-10T17:18:07Z","snapshot_observed_at":"2026-08-07T21:58:57.595600Z","submitted_at":"2024-02-29T18:43:52Z","title":"Training Dynamics of Multi-Head Softmax Attention for In-Context Learning: Emergence, Convergence, and Optimality","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19442","snapshot_observed_at":"2026-08-07T06:10:17.068890Z","title":"Training dynamics of multi-head softmax attention for in-context learning: Emergence, convergence, and optimality","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06179","last_updated":"2025-06-06T15:44:10Z","snapshot_observed_at":"2026-08-07T08:23:24.866121Z","submitted_at":"2025-06-06T15:44:10Z","title":"A Theoretical Study of (Hyper) Self-Attention through the Lens of Interactions: Representation, Training, Generalization","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T06:10:17.068890Z"},"links":{"cited_paper":"/paper/2402.19442","citing_paper":"/paper/2506.06179"},"observation_digest":"sha256:25c0dde1207e9ddb64776638edeec53f394e7a8dfd8325a79cfcdbb7370d791d","observation_id":"3c02b589-bf51-4c11-a0ad-75d7b76b6c0f","resolution":{"observed_at":"2026-08-07T06:10:17.068890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19442","last_updated":"2024-06-10T17:18:07Z","snapshot_observed_at":"2026-08-07T21:58:57.595600Z","submitted_at":"2024-02-29T18:43:52Z","title":"Training Dynamics of Multi-Head Softmax Attention for In-Context Learning: Emergence, Convergence, and Optimality","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19442","snapshot_observed_at":"2026-08-07T05:42:38.662534Z","title":"Training dynamics of multi-head softmax attention for in-context learning: Emergence, convergence, and optimality.arXiv preprint arXiv:2402.19442,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07440","last_updated":"2025-06-09T05:33:28Z","snapshot_observed_at":"2026-08-07T21:40:46.271523Z","submitted_at":"2025-06-09T05:33:28Z","title":"Federated In-Context Learning: Iterative Refinement for Improved Answer Quality","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T05:42:38.662534Z"},"links":{"cited_paper":"/paper/2402.19442","citing_paper":"/paper/2506.07440"},"observation_digest":"sha256:4097ffe78a13854198fc5573e92b0a35fc9513506f59448ee44eaf03965f97de","observation_id":"9de3bf8a-670e-4ffd-8d13-05f02c5f9db0","resolution":{"observed_at":"2026-08-07T05:42:38.662534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19442","last_updated":"2024-06-10T17:18:07Z","snapshot_observed_at":"2026-08-07T21:58:57.595600Z","submitted_at":"2024-02-29T18:43:52Z","title":"Training Dynamics of Multi-Head Softmax Attention for In-Context Learning: Emergence, Convergence, and Optimality","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19442","snapshot_observed_at":"2026-08-05T22:10:17.436794Z","title":", Sheen, H","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07571","last_updated":"2025-08-19T11:54:07Z","snapshot_observed_at":"2026-08-07T21:59:26.623348Z","submitted_at":"2025-08-11T03:05:36Z","title":"Towards Theoretical Understanding of Transformer Test-Time Computing: Investigation on In-Context Linear Regression","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-05T22:10:17.436794Z"},"links":{"cited_paper":"/paper/2402.19442","citing_paper":"/paper/2508.07571"},"observation_digest":"sha256:91690e856e19d512c3d63caa8ec880d83bf18e3f229a4d46b7aaa54c7cec5394","observation_id":"b67edb81-f98b-49eb-beb4-e52eea0919f0","resolution":{"observed_at":"2026-08-05T22:10:17.436794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19442","last_updated":"2024-06-10T17:18:07Z","snapshot_observed_at":"2026-08-07T21:58:57.595600Z","submitted_at":"2024-02-29T18:43:52Z","title":"Training Dynamics of Multi-Head Softmax Attention for In-Context Learning: Emergence, Convergence, and Optimality","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19442","snapshot_observed_at":"2026-08-04T14:50:22.033438Z","title":"Training dynamics of multi-head softmax attention for in-context learning: Emergence, convergence, and optimality.arXiv preprint arXiv:2402.19442,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22854","last_updated":"2026-06-02T17:52:26Z","snapshot_observed_at":"2026-08-04T14:50:20.613083Z","submitted_at":"2025-09-26T19:05:45Z","title":"Train Once, Reuse Everywhere: Generalizable Implicit In-Context Learning by Routing Attention","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T14:50:22.033438Z"},"links":{"cited_paper":"/paper/2402.19442","citing_paper":"/paper/2509.22854"},"observation_digest":"sha256:b82999dbfdfcd1342fbb836b7319830dd941609e4bdeb54810c24b6cca0756d2","observation_id":"c25d9971-bf1e-4d93-a035-a836d7cc835e","resolution":{"observed_at":"2026-08-04T14:50:22.033438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19442","last_updated":"2024-06-10T17:18:07Z","snapshot_observed_at":"2026-08-07T21:58:57.595600Z","submitted_at":"2024-02-29T18:43:52Z","title":"Training Dynamics of Multi-Head Softmax Attention for In-Context Learning: Emergence, Convergence, and Optimality","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19442","snapshot_observed_at":"2026-08-04T13:54:13.762801Z","title":"Training dynamics of multi-head softmax attention for in-context learning: Emergence, convergence, and optimality","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.24653","last_updated":"2026-07-13T03:51:39Z","snapshot_observed_at":"2026-08-07T18:13:01.112661Z","submitted_at":"2025-09-29T12:02:05Z","title":"Unveiling the Mechanisms of Multi-Hop Reasoning in Transformers via Identity Bridge","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-04T13:54:13.762801Z"},"links":{"cited_paper":"/paper/2402.19442","citing_paper":"/paper/2509.24653"},"observation_digest":"sha256:7466d1edf2d1188cc686b7efa01558a6df50069c652e96002f4034b6763719d3","observation_id":"18964baf-208c-49d5-a14c-5e94b62590f0","resolution":{"observed_at":"2026-08-04T13:54:13.762801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19442","last_updated":"2024-06-10T17:18:07Z","snapshot_observed_at":"2026-08-07T21:58:57.595600Z","submitted_at":"2024-02-29T18:43:52Z","title":"Training Dynamics of Multi-Head Softmax Attention for In-Context Learning: Emergence, Convergence, and Optimality","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19442","snapshot_observed_at":"2026-08-04T13:29:29.816756Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.00399","last_updated":"2026-07-07T00:49:52Z","snapshot_observed_at":"2026-08-06T19:12:21.127676Z","submitted_at":"2025-10-01T01:25:01Z","title":"How Can Mamba Learn In Context with Outliers and Generalize Provably?","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-04T13:29:29.816756Z"},"links":{"cited_paper":"/paper/2402.19442","citing_paper":"/paper/2510.00399"},"observation_digest":"sha256:094e29d485da6b64a21e90849820c9984f2951f8ea1f69c7e0866488f77d00e7","observation_id":"99309c63-be3c-48db-9006-f03ff2e86828","resolution":{"observed_at":"2026-08-04T13:29:29.816756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19442","last_updated":"2024-06-10T17:18:07Z","snapshot_observed_at":"2026-08-07T21:58:57.595600Z","submitted_at":"2024-02-29T18:43:52Z","title":"Training Dynamics of Multi-Head Softmax Attention for In-Context Learning: Emergence, Convergence, and Optimality","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19442","snapshot_observed_at":"2026-08-03T20:57:09.961879Z","title":"Training dynamics of multi-head softmax attention for in-context learning: Emergence, convergence, and optimality, 2024 b","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.17852","last_updated":"2026-08-06T09:30:47Z","snapshot_observed_at":"2026-08-08T02:15:53.153267Z","submitted_at":"2025-11-22T00:38:43Z","title":"Transformers with RL or SFT Provably Learn Sparse Boolean Functions, But Differently","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-03T20:57:09.961879Z"},"links":{"cited_paper":"/paper/2402.19442","citing_paper":"/paper/2511.17852"},"observation_digest":"sha256:2b3a12e9eeb8beebda03a937aac28ebd2b8e1efb9c4660fe96e8a088034c0e04","observation_id":"e4e110b9-28e3-49d1-876c-6439086ea6e7","resolution":{"observed_at":"2026-08-03T20:57:09.961879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19442","last_updated":"2024-06-10T17:18:07Z","snapshot_observed_at":"2026-08-07T21:58:57.595600Z","submitted_at":"2024-02-29T18:43:52Z","title":"Training Dynamics of Multi-Head Softmax Attention for In-Context Learning: Emergence, Convergence, and Optimality","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19442","snapshot_observed_at":"2026-08-02T19:04:54.999021Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.03993","last_updated":"2026-06-04T09:24:00Z","snapshot_observed_at":"2026-08-04T23:26:46.694753Z","submitted_at":"2026-03-04T12:37:08Z","title":"Specialization of softmax attention heads: insights from the high-dimensional single-location model","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T19:04:54.999021Z"},"links":{"cited_paper":"/paper/2402.19442","citing_paper":"/paper/2603.03993"},"observation_digest":"sha256:ae41b3f31625c3d6d83dfa2c325218071a7a9a6ddfa1c7d2616f10fa2a9daecf","observation_id":"6b06d115-a9c7-4bdd-a19c-cb2f78b48da0","resolution":{"observed_at":"2026-08-02T19:04:54.999021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19442","last_updated":"2024-06-10T17:18:07Z","snapshot_observed_at":"2026-08-07T21:58:57.595600Z","submitted_at":"2024-02-29T18:43:52Z","title":"Training Dynamics of Multi-Head Softmax Attention for In-Context Learning: Emergence, Convergence, and Optimality","version":2},"cited_work":{"arxiv_id":"2402.19442","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.19442","snapshot_observed_at":"2026-06-28T23:42:49.980406Z","title":"Training dynamics of multi-head softmax attention for in-context learning: Emergence, convergence, and optimality","venue":null,"work_id":"6218388c-e857-432d-92be-98d1ba4e4853","year":2024},"citing_paper":{"arxiv_id":"2604.10946","last_updated":"2026-04-13T03:37:08Z","snapshot_observed_at":"2026-07-06T22:59:27.499664Z","submitted_at":"2026-04-13T03:37:08Z","title":"Learning to Adapt: In-Context Learning Beyond Stationarity","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-05-10T16:30:36.771589Z"},"links":{"cited_paper":"/paper/2402.19442","citing_paper":"/paper/2604.10946"},"observation_digest":"sha256:eb3b2ce2cb116d3c25ff3eab9712c4cc619f05e0fd703ce261acbec8fdf7768c","observation_id":"83271fa1-e835-4869-b7bb-96e36e77611f","resolution":{"observed_at":"2026-05-11T08:45:59.438462Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19442","last_updated":"2024-06-10T17:18:07Z","snapshot_observed_at":"2026-08-07T21:58:57.595600Z","submitted_at":"2024-02-29T18:43:52Z","title":"Training Dynamics of Multi-Head Softmax Attention for In-Context Learning: Emergence, Convergence, and Optimality","version":2},"cited_work":{"arxiv_id":"2402.19442","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.19442","snapshot_observed_at":"2026-06-28T23:42:49.980406Z","title":"Training dynamics of multi-head softmax attention for in-context learning: Emergence, convergence, and optimality","venue":null,"work_id":"6218388c-e857-432d-92be-98d1ba4e4853","year":2024},"citing_paper":{"arxiv_id":"2606.00183","last_updated":"2026-05-29T14:58:03Z","snapshot_observed_at":"2026-07-06T23:40:56.510371Z","submitted_at":"2026-05-29T14:58:03Z","title":"Agentic Transformers Provably Learn to Search via Reinforcement Learning","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-06-28T23:26:28.158991Z"},"links":{"cited_paper":"/paper/2402.19442","citing_paper":"/paper/2606.00183"},"observation_digest":"sha256:459453c18102dc7ac22b98a52934342ea661f63dbcf9ddf51a1d5a7fcab0c1e5","observation_id":"a096d3db-07f8-4329-b978-d42eb840abcb","resolution":{"observed_at":"2026-06-28T23:42:49.981802Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2402.19442/citation-record","integrity":"/paper/2402.19442/integrity","json":"/paper/2402.19442/citation-record.json","paper":"/paper/2402.19442"},"outbound":[],"paper":{"arxiv_id":"2402.19442","last_updated":"2024-06-10T17:18:07Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T21:58:57.595600Z","submitted_at":"2024-02-29T18:43:52Z","title":"Training Dynamics of Multi-Head Softmax Attention for In-Context Learning: Emergence, Convergence, and Optimality"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 12 inbound Pith citation observations for arXiv:2402.19442."}