{"as_of":"2026-08-11T12:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:54c331ee053f4725fb737995ebca4321e34e5d9a40afb96d6c235e8894a90050","coverage":[{"denominator":85,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":85,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T13:42:09.164276Z","state":"measured"},{"denominator":97,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":97,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":12,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":12,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T13:54:19.125912Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.16265","last_updated":"2025-05-27T20:00:08Z","snapshot_observed_at":"2026-08-11T05:50:52.752373Z","submitted_at":"2025-01-27T18:03:00Z","title":"Training Dynamics of In-Context Learning in Linear Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.16265","snapshot_observed_at":"2026-08-04T13:54:19.125912Z","title":"Singh, Peter E","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.24653","last_updated":"2026-07-13T03:51:39Z","snapshot_observed_at":"2026-08-09T06:52:58.188256Z","submitted_at":"2025-09-29T12:02:05Z","title":"Unveiling the Mechanisms of Multi-Hop Reasoning in Transformers via Identity Bridge","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-04T13:54:19.125912Z"},"links":{"cited_paper":"/paper/2501.16265","citing_paper":"/paper/2509.24653"},"observation_digest":"sha256:e27663dffcb9436f967c1390ba5a8929b292b484f8173e5cfed044b3b8079ceb","observation_id":"6e666921-58ab-4998-a320-fd8bc5ca6c26","resolution":{"observed_at":"2026-08-04T13:54:19.125912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16265","last_updated":"2025-05-27T20:00:08Z","snapshot_observed_at":"2026-08-11T05:50:52.752373Z","submitted_at":"2025-01-27T18:03:00Z","title":"Training Dynamics of In-Context Learning in Linear Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.16265","snapshot_observed_at":"2026-08-03T05:27:44.603104Z","title":"Training dynamics of in-context learning in linear attention.arXiv preprint arXiv:2501.16265,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.02470","last_updated":"2026-05-31T23:31:59Z","snapshot_observed_at":"2026-08-06T21:10:46.491693Z","submitted_at":"2026-02-02T18:50:57Z","title":"Breaking the Reversal Curse in Autoregressive Language Models via Identity Bridge","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T05:27:44.603104Z"},"links":{"cited_paper":"/paper/2501.16265","citing_paper":"/paper/2602.02470"},"observation_digest":"sha256:417024e0370b9dd617196a3677c8f0efdc8d9e55f6233bfd1f6eca21bf560726","observation_id":"b2b3f7b8-b40d-4a3c-a664-bb62f0a15515","resolution":{"observed_at":"2026-08-03T05:27:44.603104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16265","last_updated":"2025-05-27T20:00:08Z","snapshot_observed_at":"2026-08-11T05:50:52.752373Z","submitted_at":"2025-01-27T18:03:00Z","title":"Training Dynamics of In-Context Learning in Linear Attention","version":2},"cited_work":{"arxiv_id":"2501.16265","doi":"10.48550/arxiv.2501.16265","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.16265","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Training dynamics of in-context learning in linear attention","venue":"ArXiv.org","work_id":"89607802-ae04-4355-b5d0-e5f3bcb7c337","year":2025},"citing_paper":{"arxiv_id":"2603.01097","last_updated":"2026-07-29T13:53:39Z","snapshot_observed_at":"2026-08-02T19:49:42.383713Z","submitted_at":"2026-03-01T13:28:57Z","title":"Understanding LoRA as Knowledge Memory: An Empirical Analysis","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-15T18:09:54.899039Z"},"links":{"cited_paper":"/paper/2501.16265","citing_paper":"/paper/2603.01097"},"observation_digest":"sha256:6ed2f4758fef5fd7d4a7c38ffa395e6dac88a08c87b3fda8bd4969007edd1ff7","observation_id":"7b148a72-2629-48a4-97be-4e1b7a09b141","resolution":{"observed_at":"2026-05-15T18:10:13.267015Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16265","last_updated":"2025-05-27T20:00:08Z","snapshot_observed_at":"2026-08-11T05:50:52.752373Z","submitted_at":"2025-01-27T18:03:00Z","title":"Training Dynamics of In-Context Learning in Linear Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.16265","snapshot_observed_at":"2026-08-02T19:49:44.727751Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.01097","last_updated":"2026-07-29T13:53:39Z","snapshot_observed_at":"2026-08-02T19:49:42.383713Z","submitted_at":"2026-03-01T13:28:57Z","title":"Understanding LoRA as Knowledge Memory: An Empirical Analysis","version":5},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T19:49:44.727751Z"},"links":{"cited_paper":"/paper/2501.16265","citing_paper":"/paper/2603.01097"},"observation_digest":"sha256:188c33ffe6579e16a089abe569d0d1787d1a90579033e61957d481e1cdab1a4e","observation_id":"66609f14-4854-4d82-97a6-bf1bac3c3e26","resolution":{"observed_at":"2026-08-02T19:49:44.727751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16265","last_updated":"2025-05-27T20:00:08Z","snapshot_observed_at":"2026-08-11T05:50:52.752373Z","submitted_at":"2025-01-27T18:03:00Z","title":"Training Dynamics of In-Context Learning in Linear Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.16265","snapshot_observed_at":"2026-08-02T19:04:54.938955Z","title":"Zhang, A","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.03993","last_updated":"2026-06-04T09:24:00Z","snapshot_observed_at":"2026-08-04T23:26:46.694753Z","submitted_at":"2026-03-04T12:37:08Z","title":"Specialization of softmax attention heads: insights from the high-dimensional single-location model","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T19:04:54.938955Z"},"links":{"cited_paper":"/paper/2501.16265","citing_paper":"/paper/2603.03993"},"observation_digest":"sha256:d6729fa9c825ed68035be374d3bc9a557f74a03b98401adde6052b1ee81732be","observation_id":"c0c74abb-4ee8-423a-a6c1-7f2270a1226d","resolution":{"observed_at":"2026-08-02T19:04:54.938955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16265","last_updated":"2025-05-27T20:00:08Z","snapshot_observed_at":"2026-08-11T05:50:52.752373Z","submitted_at":"2025-01-27T18:03:00Z","title":"Training Dynamics of In-Context Learning in Linear Attention","version":2},"cited_work":{"arxiv_id":"2501.16265","doi":"10.48550/arxiv.2501.16265","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.16265","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Training dynamics of in-context learning in linear attention","venue":"ArXiv.org","work_id":"89607802-ae04-4355-b5d0-e5f3bcb7c337","year":2025},"citing_paper":{"arxiv_id":"2604.10946","last_updated":"2026-04-13T03:37:08Z","snapshot_observed_at":"2026-07-06T22:59:27.499664Z","submitted_at":"2026-04-13T03:37:08Z","title":"Learning to Adapt: In-Context Learning Beyond Stationarity","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-05-10T16:30:36.771589Z"},"links":{"cited_paper":"/paper/2501.16265","citing_paper":"/paper/2604.10946"},"observation_digest":"sha256:7841ba1664c366e426e0346e5e4fc1ed01775d4b53524d549d02e232aeaab47e","observation_id":"c900c87b-9bb0-439f-b446-83da4b72e296","resolution":{"observed_at":"2026-05-11T08:45:59.349405Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16265","last_updated":"2025-05-27T20:00:08Z","snapshot_observed_at":"2026-08-11T05:50:52.752373Z","submitted_at":"2025-01-27T18:03:00Z","title":"Training Dynamics of In-Context Learning in Linear Attention","version":2},"cited_work":{"arxiv_id":"2501.16265","doi":"10.48550/arxiv.2501.16265","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.16265","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Training dynamics of in-context learning in linear attention","venue":"ArXiv.org","work_id":"89607802-ae04-4355-b5d0-e5f3bcb7c337","year":2025},"citing_paper":{"arxiv_id":"2605.08475","last_updated":"2026-05-15T21:26:00Z","snapshot_observed_at":"2026-07-06T23:20:43.010758Z","submitted_at":"2026-05-08T20:50:58Z","title":"Transformers Can Implement Preconditioned Richardson Iteration for In-Context Gaussian Kernel Regression","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-05-12T03:12:49.334507Z"},"links":{"cited_paper":"/paper/2501.16265","citing_paper":"/paper/2605.08475"},"observation_digest":"sha256:dd95a117f51fd97c5e5a3b5c2a26aed268056a3da9d3790ce53c0166e60f51ff","observation_id":"c374f714-ce4e-4396-a6c9-4ed2fc64658a","resolution":{"observed_at":"2026-05-12T03:16:19.409505Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16265","last_updated":"2025-05-27T20:00:08Z","snapshot_observed_at":"2026-08-11T05:50:52.752373Z","submitted_at":"2025-01-27T18:03:00Z","title":"Training Dynamics of In-Context Learning in Linear Attention","version":2},"cited_work":{"arxiv_id":"2501.16265","doi":"10.48550/arxiv.2501.16265","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.16265","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Training dynamics of in-context learning in linear attention","venue":"ArXiv.org","work_id":"89607802-ae04-4355-b5d0-e5f3bcb7c337","year":2025},"citing_paper":{"arxiv_id":"2605.08475","last_updated":"2026-05-15T21:26:00Z","snapshot_observed_at":"2026-07-06T23:20:43.010758Z","submitted_at":"2026-05-08T20:50:58Z","title":"Transformers Can Implement Preconditioned Richardson Iteration for In-Context Gaussian Kernel Regression","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-05-20T22:26:55.610155Z"},"links":{"cited_paper":"/paper/2501.16265","citing_paper":"/paper/2605.08475"},"observation_digest":"sha256:80a5d5151aca19cdd76333daf9b4fa4b4ee25865909eed416f1bba569f61127d","observation_id":"5de7d0dd-6fd1-4589-a3c3-365faa864a81","resolution":{"observed_at":"2026-05-20T22:29:09.452218Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16265","last_updated":"2025-05-27T20:00:08Z","snapshot_observed_at":"2026-08-11T05:50:52.752373Z","submitted_at":"2025-01-27T18:03:00Z","title":"Training Dynamics of In-Context Learning in Linear Attention","version":2},"cited_work":{"arxiv_id":"2501.16265","doi":"10.48550/arxiv.2501.16265","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.16265","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Training dynamics of in-context learning in linear attention","venue":"ArXiv.org","work_id":"89607802-ae04-4355-b5d0-e5f3bcb7c337","year":2025},"citing_paper":{"arxiv_id":"2606.03217","last_updated":"2026-06-02T06:23:31Z","snapshot_observed_at":"2026-07-06T23:43:31.629075Z","submitted_at":"2026-06-02T06:23:31Z","title":"An Asymptotic Theory of Chain-of-Thought in In-Context Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-28T08:25:37.421049Z"},"links":{"cited_paper":"/paper/2501.16265","citing_paper":"/paper/2606.03217"},"observation_digest":"sha256:bd4fc1eb9dfc24f31e05e0657d392f4096c7d4d7c4e9a492b5fd5b5c02e31697","observation_id":"d81efff2-39de-4965-b583-05dda0263c3f","resolution":{"observed_at":"2026-07-02T05:16:38.978513Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16265","last_updated":"2025-05-27T20:00:08Z","snapshot_observed_at":"2026-08-11T05:50:52.752373Z","submitted_at":"2025-01-27T18:03:00Z","title":"Training Dynamics of In-Context Learning in Linear Attention","version":2},"cited_work":{"arxiv_id":"2501.16265","doi":"10.48550/arxiv.2501.16265","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.16265","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Training dynamics of in-context learning in linear attention","venue":"ArXiv.org","work_id":"89607802-ae04-4355-b5d0-e5f3bcb7c337","year":2025},"citing_paper":{"arxiv_id":"2606.05219","last_updated":"2026-05-29T13:32:18Z","snapshot_observed_at":"2026-08-08T23:43:07.652820Z","submitted_at":"2026-05-29T13:32:18Z","title":"Gradient Descent with Large Step Size Restores Symmetry in Deep Linear Networks with Multi-Pathway","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-06-28T23:15:59.394256Z"},"links":{"cited_paper":"/paper/2501.16265","citing_paper":"/paper/2606.05219"},"observation_digest":"sha256:8789ae9880551df8f3aa6cf277e45e25b4f93617c2b4246eaf5a70afeb939ca1","observation_id":"878a2b8a-6003-46f5-97a5-066f7bbd83b7","resolution":{"observed_at":"2026-06-28T23:22:46.412075Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16265","last_updated":"2025-05-27T20:00:08Z","snapshot_observed_at":"2026-08-11T05:50:52.752373Z","submitted_at":"2025-01-27T18:03:00Z","title":"Training Dynamics of In-Context Learning in Linear Attention","version":2},"cited_work":{"arxiv_id":"2501.16265","doi":"10.48550/arxiv.2501.16265","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.16265","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Training dynamics of in-context learning in linear attention","venue":"ArXiv.org","work_id":"89607802-ae04-4355-b5d0-e5f3bcb7c337","year":2025},"citing_paper":{"arxiv_id":"2606.09283","last_updated":"2026-06-08T09:51:31Z","snapshot_observed_at":"2026-08-05T07:18:00.473607Z","submitted_at":"2026-06-08T09:51:31Z","title":"Towards personalised intervention: A causal-dynamical framework to determine psychological treatment trajectories","version":1},"reference_index":132,"source":"arxiv_source","source_observed_at":"2026-06-27T14:13:28.981530Z"},"links":{"cited_paper":"/paper/2501.16265","citing_paper":"/paper/2606.09283"},"observation_digest":"sha256:39e9e2a4d8ce4463baa3c6131e18a964ada88f50e69467543e611b0e87b403eb","observation_id":"de61a2c5-ec38-437d-ad1b-38ab5e36bc22","resolution":{"observed_at":"2026-07-03T04:07:36.731429Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16265","last_updated":"2025-05-27T20:00:08Z","snapshot_observed_at":"2026-08-11T05:50:52.752373Z","submitted_at":"2025-01-27T18:03:00Z","title":"Training Dynamics of In-Context Learning in Linear Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.16265","snapshot_observed_at":"2026-07-12T00:51:41.905788Z","title":"Yufeng Zhang, Fengzhuo Zhang, Zhuoran Yang, and Zhaoran Wang","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03660","last_updated":"2026-07-04T01:47:29Z","snapshot_observed_at":"2026-08-07T05:34:25.091820Z","submitted_at":"2026-07-04T01:47:29Z","title":"Sequential Correlations Change In-Context Learning: Effective Context Length and Architectural Mismatch","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-12T00:51:41.905788Z"},"links":{"cited_paper":"/paper/2501.16265","citing_paper":"/paper/2607.03660"},"observation_digest":"sha256:7a80197a0da75486e80afb3c197f72c3fc08b33dfcf84371675ba2fedbbdce47","observation_id":"044ed462-b13a-40e1-85df-726ac21d695b","resolution":{"observed_at":"2026-07-12T00:51:41.905788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2501.16265/citation-record","integrity":"/paper/2501.16265/integrity","json":"/paper/2501.16265/citation-record.json","paper":"/paper/2501.16265"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:42:08.771564Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16265","last_updated":"2025-05-27T20:00:08Z","snapshot_observed_at":"2026-08-11T05:50:52.752373Z","submitted_at":"2025-01-27T18:03:00Z","title":"Training Dynamics of In-Context Learning in Linear Attention","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-10T13:42:08.771564Z"},"links":{"citing_paper":"/paper/2501.16265"},"observation_digest":"sha256:b344b7934ca601776babf0a59433522caca8d218c87d73c9d2f7dcf56916db8a","observation_id":"863a75de-3fea-426f-beb9-9949540cbda1","resolution":{"observed_at":"2026-08-10T13:42:08.771564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12783","last_updated":"2024-10-16T17:58:08Z","snapshot_observed_at":"2026-08-10T13:53:10.743853Z","submitted_at":"2024-10-16T17:58:08Z","title":"Context-Scaling versus Task-Scaling in In-Context Learning","version":1},"cited_work":{"arxiv_id":"2410.12783","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.12783","snapshot_observed_at":"2026-08-10T13:42:09.937377Z","title":"Context-Scaling versus Task-Scaling in In-Context Learning","venue":"cs.LG","work_id":"55009837-4f7e-4bcc-aa1b-6842a71211dc","year":2024},"citing_paper":{"arxiv_id":"2501.16265","last_updated":"2025-05-27T20:00:08Z","snapshot_observed_at":"2026-08-11T05:50:52.752373Z","submitted_at":"2025-01-27T18:03:00Z","title":"Training Dynamics of In-Context Learning in Linear Attention","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-10T13:42:08.777812Z"},"links":{"cited_paper":"/paper/2410.12783","citing_paper":"/paper/2501.16265"},"observation_digest":"sha256:d65c0600a56892eb422fca530b37146c9eaddfbfffbaa248b48bba3f62d5be0c","observation_id":"72351a8a-da9b-4801-a986-b92766eb20b9","resolution":{"observed_at":"2026-08-10T13:42:09.943815Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:42:08.784728Z","title":"Transformers learn to implement preconditioned gradient descent for in-context learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.16265","last_updated":"2025-05-27T20:00:08Z","snapshot_observed_at":"2026-08-11T05:50:52.752373Z","submitted_at":"2025-01-27T18:03:00Z","title":"Training Dynamics of In-Context Learning in Linear Attention","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-10T13:42:08.784728Z"},"links":{"citing_paper":"/paper/2501.16265"},"observation_digest":"sha256:d6e722ae39a61aba7b6d3335941ac24c4640eb25b547038202dec457cc5e1f60","observation_id":"64959c77-d4e0-4ead-8c55-ed7fb68768ca","resolution":{"observed_at":"2026-08-10T13:42:08.784728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:42:08.789849Z","title":"Linear attention is (maybe) all you need (to understand transformer optimization)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.16265","last_updated":"2025-05-27T20:00:08Z","snapshot_observed_at":"2026-08-11T05:50:52.752373Z","submitted_at":"2025-01-27T18:03:00Z","title":"Training Dynamics of In-Context Learning in Linear Attention","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-10T13:42:08.789849Z"},"links":{"citing_paper":"/paper/2501.16265"},"observation_digest":"sha256:9e65473c1e1c3e41b8f38df129bcd8225dbc2091a8d79f9107484c1d030cf105","observation_id":"0e7d4324-81d1-4fc7-8515-0dcccf45abe0","resolution":{"observed_at":"2026-08-10T13:42:08.789849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:42:08.794517Z","title":"What learning algorithm is in-context learning? investigations with linear models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.16265","last_updated":"2025-05-27T20:00:08Z","snapshot_observed_at":"2026-08-11T05:50:52.752373Z","submitted_at":"2025-01-27T18:03:00Z","title":"Training Dynamics of In-Context Learning in Linear Attention","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-10T13:42:08.794517Z"},"links":{"citing_paper":"/paper/2501.16265"},"observation_digest":"sha256:10966aee350ab4da09a00f10e9f46b2cf96f74fb326b1c6ccdc1e41a5f87998e","observation_id":"e7b2f64c-7709-4c3f-b47e-b65656303604","resolution":{"observed_at":"2026-08-10T13:42:08.794517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:42:08.799444Z","title":"A., Merullo, J., and Pavlick, E","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2501.16265","last_updated":"2025-05-27T20:00:08Z","snapshot_observed_at":"2026-08-11T05:50:52.752373Z","submitted_at":"2025-01-27T18:03:00Z","title":"Training Dynamics of In-Context Learning in Linear Attention","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-10T13:42:08.799444Z"},"links":{"citing_paper":"/paper/2501.16265"},"observation_digest":"sha256:7995faa105fcaad0f2efa3cc6a9ca2669cd0dcd73ccb6acd80efec2e77825132","observation_id":"d12b03fd-e8ef-410e-9551-b1ffaaaf4593","resolution":{"observed_at":"2026-08-10T13:42:08.799444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.05189","last_updated":"2025-08-05T21:08:58Z","snapshot_observed_at":"2026-07-06T19:47:07.442952Z","submitted_at":"2024-11-07T21:25:58Z","title":"Understanding In-Context Learning of Linear Models in Transformers Through an Adversarial Lens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.05189","snapshot_observed_at":"2026-08-10T13:42:08.805009Z","title":"V., Kirsch, L., Krueger, D., and Frei, S","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.16265","last_updated":"2025-05-27T20:00:08Z","snapshot_observed_at":"2026-08-11T05:50:52.752373Z","submitted_at":"2025-01-27T18:03:00Z","title":"Training Dynamics of In-Context Learning in Linear Attention","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-10T13:42:08.805009Z"},"links":{"cited_paper":"/paper/2411.05189","citing_paper":"/paper/2501.16265"},"observation_digest":"sha256:eb8ee98e0503884d2c2676d57d7cfea952e264f246a09723e64b809011e42447","observation_id":"5d7f1b81-2cdc-4b17-a1af-749a4644f8a3","resolution":{"observed_at":"2026-08-10T13:42:08.805009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:42:10.848598Z","title":"A convergence analysis of gradient descent for deep linear neural networks","venue":null,"work_id":"62e7931e-7ad0-4ba4-bf61-6c2d53be6fcd","year":2019},"citing_paper":{"arxiv_id":"2501.16265","last_updated":"2025-05-27T20:00:08Z","snapshot_observed_at":"2026-08-11T05:50:52.752373Z","submitted_at":"2025-01-27T18:03:00Z","title":"Training Dynamics of In-Context Learning in Linear Attention","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-10T13:42:08.811298Z"},"links":{"citing_paper":"/paper/2501.16265"},"observation_digest":"sha256:5e4b6842cdb37d3fd1f543f32de9e78c8ef64c453589712cbe2c68cd9f2cc069","observation_id":"f7074a8a-00f3-4479-9263-5718ab8df39f","resolution":{"observed_at":"2026-08-10T13:42:10.852752Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:42:10.834323Z","title":"Max-margin token selection in attention mechanism","venue":null,"work_id":"886be7ca-463f-4028-954c-0a6d817fb58b","year":2023},"citing_paper":{"arxiv_id":"2501.16265","last_updated":"2025-05-27T20:00:08Z","snapshot_observed_at":"2026-08-11T05:50:52.752373Z","submitted_at":"2025-01-27T18:03:00Z","title":"Training Dynamics of In-Context Learning in Linear Attention","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-10T13:42:08.815984Z"},"links":{"citing_paper":"/paper/2501.16265"},"observation_digest":"sha256:cfa9ad3364951c8e5141abdd4f8120b1b2dbfc6bfad39663718d7b92457c96fa","observation_id":"5c3b3432-1ef3-4765-aacf-9aef3aad3703","resolution":{"observed_at":"2026-08-10T13:42:10.838845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:42:08.820551Z","title":"Neural networks as kernel learners: The silent alignment effect","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.16265","last_updated":"2025-05-27T20:00:08Z","snapshot_observed_at":"2026-08-11T05:50:52.752373Z","submitted_at":"2025-01-27T18:03:00Z","title":"Training Dynamics of In-Context Learning in Linear Attention","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-10T13:42:08.820551Z"},"links":{"citing_paper":"/paper/2501.16265"},"observation_digest":"sha256:dbb00bdd7e7b28e31c45f91a5a162cff0e2b15543f011a4d49806d9a0bf972ae","observation_id":"9cf46489-6ab3-41b9-bc27-ae77d20a4f8a","resolution":{"observed_at":"2026-08-10T13:42:08.820551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:42:10.810572Z","title":"Transformers as statisticians: Provable in-context learning with in-context algorithm selection","venue":null,"work_id":"e7bffb88-471b-4506-b46f-a31ab05e2d0d","year":2023},"citing_paper":{"arxiv_id":"2501.16265","last_updated":"2025-05-27T20:00:08Z","snapshot_observed_at":"2026-08-11T05:50:52.752373Z","submitted_at":"2025-01-27T18:03:00Z","title":"Training Dynamics of In-Context Learning in Linear Attention","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-10T13:42:08.825679Z"},"links":{"citing_paper":"/paper/2501.16265"},"observation_digest":"sha256:d20125115f776132945440cc70ea8f8dc65cdaf225c9b19399ea535885171c62","observation_id":"349988df-dfb1-4152-9151-a32999870656","resolution":{"observed_at":"2026-08-10T13:42:10.815157Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:42:10.795176Z","title":"Transformers learn through gradual rank increase","venue":null,"work_id":"baefcffd-609a-4bc8-a02c-b493f2a9d240","year":2023},"citing_paper":{"arxiv_id":"2501.16265","last_updated":"2025-05-27T20:00:08Z","snapshot_observed_at":"2026-08-11T05:50:52.752373Z","submitted_at":"2025-01-27T18:03:00Z","title":"Training Dynamics of In-Context Learning in Linear Attention","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-10T13:42:08.830426Z"},"links":{"citing_paper":"/paper/2501.16265"},"observation_digest":"sha256:ccaebd92733d1e4fa8318341d7e02742d69e89dd964ed1b4542bd430121b758b","observation_id":"bb2831a1-992f-4bca-9856-b729fbcd9d85","resolution":{"observed_at":"2026-08-10T13:42:10.800154Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:42:10.779982Z","title":null,"venue":null,"work_id":"9559050a-de34-4b0f-8001-16bbaf4f4527","year":2024},"citing_paper":{"arxiv_id":"2501.16265","last_updated":"2025-05-27T20:00:08Z","snapshot_observed_at":"2026-08-11T05:50:52.752373Z","submitted_at":"2025-01-27T18:03:00Z","title":"Training Dynamics of In-Context Learning in Linear Attention","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-10T13:42:08.835092Z"},"links":{"citing_paper":"/paper/2501.16265"},"observation_digest":"sha256:00da596bdec8207462072ddc82fde2751357ea2b839739ec59bb9f71d6e93b1d","observation_id":"66622513-0ceb-48fe-b15f-ce4584ee3eba","resolution":{"observed_at":"2026-08-10T13:42:10.784524Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:42:10.765238Z","title":"Infinite limits of multi-head transformer dynamics","venue":null,"work_id":"62b60faf-2088-460a-a1e2-9af37439e3b6","year":2024},"citing_paper":{"arxiv_id":"2501.16265","last_updated":"2025-05-27T20:00:08Z","snapshot_observed_at":"2026-08-11T05:50:52.752373Z","submitted_at":"2025-01-27T18:03:00Z","title":"Training Dynamics of In-Context Learning in Linear Attention","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-10T13:42:08.839610Z"},"links":{"citing_paper":"/paper/2501.16265"},"observation_digest":"sha256:90efbb37cf11cdc4f5ebc4c509ce3cabb57aeff673bb2b0191563029dde4427b","observation_id":"a49640b7-93d8-485e-a725-2fe526ba29fd","resolution":{"observed_at":"2026-08-10T13:42:10.770121Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:42:08.844836Z","title":null,"venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2501.16265","last_updated":"2025-05-27T20:00:08Z","snapshot_observed_at":"2026-08-11T05:50:52.752373Z","submitted_at":"2025-01-27T18:03:00Z","title":"Training Dynamics of In-Context Learning in Linear Attention","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-10T13:42:08.844836Z"},"links":{"citing_paper":"/paper/2501.16265"},"observation_digest":"sha256:8ab30f5e6ae1b5c6c2c2f0849db71286b38638ff9f21ffd8eccae4b9622f0c47","observation_id":"4b316124-1a7f-4e01-a6df-cee59b3afa68","resolution":{"observed_at":"2026-08-10T13:42:08.844836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:42:10.741387Z","title":"Toward understanding in-context vs","venue":null,"work_id":"96d4641f-3dda-42f7-b834-47e31ac37523","year":2025},"citing_paper":{"arxiv_id":"2501.16265","last_updated":"2025-05-27T20:00:08Z","snapshot_observed_at":"2026-08-11T05:50:52.752373Z","submitted_at":"2025-01-27T18:03:00Z","title":"Training Dynamics of In-Context Learning in Linear Attention","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-10T13:42:08.849357Z"},"links":{"citing_paper":"/paper/2501.16265"},"observation_digest":"sha256:3270384204ecef92481bbcc3784a682ade9855f2e9e733147739610909ba4417","observation_id":"9431fafa-7de8-4929-b83c-34a635225f91","resolution":{"observed_at":"2026-08-10T13:42:10.745978Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:42:10.727601Z","title":"Data distributional properties drive emergent in-context learning in transformers","venue":null,"work_id":"378092c3-34c4-4d60-ac68-450cafdea220","year":2022},"citing_paper":{"arxiv_id":"2501.16265","last_updated":"2025-05-27T20:00:08Z","snapshot_observed_at":"2026-08-11T05:50:52.752373Z","submitted_at":"2025-01-27T18:03:00Z","title":"Training Dynamics of In-Context Learning in Linear Attention","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-10T13:42:08.854192Z"},"links":{"citing_paper":"/paper/2501.16265"},"observation_digest":"sha256:a0acb26051df612df2de62109b28d109cc2ac9f858b4eb81391de1a935dc717f","observation_id":"deec83fe-93d7-433b-9baf-a99c3158bce9","resolution":{"observed_at":"2026-08-10T13:42:10.731984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:42:10.713394Z","title":"L., and Saphra, N","venue":null,"work_id":"4791351a-a8e9-4075-a253-141e60f34f12","year":2024},"citing_paper":{"arxiv_id":"2501.16265","last_updated":"2025-05-27T20:00:08Z","snapshot_observed_at":"2026-08-11T05:50:52.752373Z","submitted_at":"2025-01-27T18:03:00Z","title":"Training Dynamics of In-Context Learning in Linear Attention","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-10T13:42:08.858728Z"},"links":{"citing_paper":"/paper/2501.16265"},"observation_digest":"sha256:1572684c10e87bc632bde71200201c148cb002e95a2f7851fe8c8d122278ee4c","observation_id":"cdd4c5b0-3ed7-421d-bff1-ef95b33764c2","resolution":{"observed_at":"2026-08-10T13:42:10.718066Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04084","last_updated":"2024-02-06T15:39:09Z","snapshot_observed_at":"2026-07-06T17:26:19.028623Z","submitted_at":"2024-02-06T15:39:09Z","title":"Provably learning a multi-head attention layer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04084","snapshot_observed_at":"2026-08-10T13:42:08.863656Z","title":"and Li, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.16265","last_updated":"2025-05-27T20:00:08Z","snapshot_observed_at":"2026-08-11T05:50:52.752373Z","submitted_at":"2025-01-27T18:03:00Z","title":"Training Dynamics of In-Context Learning in Linear Attention","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-10T13:42:08.863656Z"},"links":{"cited_paper":"/paper/2402.04084","citing_paper":"/paper/2501.16265"},"observation_digest":"sha256:d696bea4c4170da37565655a00955112533c4649d4dd3d322cda64dcfbc1fcd4","observation_id":"51982e89-d015-491b-8279-7a1ff550281b","resolution":{"observed_at":"2026-08-10T13:42:08.863656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:42:10.699065Z","title":"Training dynamics of multi-head softmax attention for in-context learning: Emergence, convergence, and optimality","venue":null,"work_id":"a9a03b34-f64e-4aa0-a2f8-2b1a00e4311f","year":2024},"citing_paper":{"arxiv_id":"2501.16265","last_updated":"2025-05-27T20:00:08Z","snapshot_observed_at":"2026-08-11T05:50:52.752373Z","submitted_at":"2025-01-27T18:03:00Z","title":"Training Dynamics of In-Context Learning in Linear Attention","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-10T13:42:08.868864Z"},"links":{"citing_paper":"/paper/2501.16265"},"observation_digest":"sha256:d18528b1cf7412b55e1134a3923e8f1e63549178ea5918c86ed311e53719046a","observation_id":"48c82c41-46f1-484f-9f4d-d176ffbd6535","resolution":{"observed_at":"2026-08-10T13:42:10.704119Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:42:10.684604Z","title":"Unveiling induction heads: Provable training dynamics and feature learning in transformers","venue":null,"work_id":"ddcbff02-a68d-44b0-b482-68a6d8b7a548","year":2024},"citing_paper":{"arxiv_id":"2501.16265","last_updated":"2025-05-27T20:00:08Z","snapshot_observed_at":"2026-08-11T05:50:52.752373Z","submitted_at":"2025-01-27T18:03:00Z","title":"Training Dynamics of In-Context Learning in Linear Attention","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-10T13:42:08.873299Z"},"links":{"citing_paper":"/paper/2501.16265"},"observation_digest":"sha256:9c145584b05b64052d6a1499c4aa76a741384c39f6b75aee58bd140d845d7769","observation_id":"2dfe84c6-4a23-4767-90aa-9e8e1a1b41e7","resolution":{"observed_at":"2026-08-10T13:42:10.689327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:42:10.669811Z","title":"On lazy training in differentiable programming","venue":null,"work_id":"88c87c6e-603a-4450-b67e-0e3473892b50","year":2019},"citing_paper":{"arxiv_id":"2501.16265","last_updated":"2025-05-27T20:00:08Z","snapshot_observed_at":"2026-08-11T05:50:52.752373Z","submitted_at":"2025-01-27T18:03:00Z","title":"Training Dynamics of In-Context Learning in Linear Attention","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-10T13:42:08.877770Z"},"links":{"citing_paper":"/paper/2501.16265"},"observation_digest":"sha256:f57594754bd48c8e3077f4bd55f4f2440501299cc9d14c6d1b64347f39c09854","observation_id":"8e394567-653e-4201-9626-cbb173be8e5a","resolution":{"observed_at":"2026-08-10T13:42:10.674486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:42:10.655017Z","title":"S., Hu, W., and Lee, J","venue":null,"work_id":"5213e6a7-442d-40ea-a87a-561a5cba23a1","year":2018},"citing_paper":{"arxiv_id":"2501.16265","last_updated":"2025-05-27T20:00:08Z","snapshot_observed_at":"2026-08-11T05:50:52.752373Z","submitted_at":"2025-01-27T18:03:00Z","title":"Training Dynamics of In-Context Learning in Linear Attention","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-10T13:42:08.882860Z"},"links":{"citing_paper":"/paper/2501.16265"},"observation_digest":"sha256:109b72310a142673224f6e8455f0b77d60e5f2842ad715b65af7e7ca876e888d","observation_id":"e00d3fd6-135a-4b81-932c-f81f3fd0b8bb","resolution":{"observed_at":"2026-08-10T13:42:10.659493Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.02462","last_updated":"2024-05-09T21:29:03Z","snapshot_observed_at":"2026-08-09T23:33:09.197783Z","submitted_at":"2024-05-03T19:52:07Z","title":"Finite Sample Analysis and Bounds of Generalization Error of Gradient Descent in In-Context Linear Regression","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.02462","snapshot_observed_at":"2026-08-10T13:42:08.887996Z","title":"Finite sample analysis and bounds of generalization error of gradient descent in in-context linear regression, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.16265","last_updated":"2025-05-27T20:00:08Z","snapshot_observed_at":"2026-08-11T05:50:52.752373Z","submitted_at":"2025-01-27T18:03:00Z","title":"Training Dynamics of In-Context Learning in Linear Attention","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-10T13:42:08.887996Z"},"links":{"cited_paper":"/paper/2405.02462","citing_paper":"/paper/2501.16265"},"observation_digest":"sha256:6086a6fec621c36ef3795a82b8fd65fe113e4299ebafe93a5007d56716bc2490","observation_id":"eb1251fe-4819-42d0-b142-b4df18a1c9d9","resolution":{"observed_at":"2026-08-10T13:42:08.887996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:42:10.640292Z","title":"The evolution of statistical induction heads: In-context learning markov chains","venue":null,"work_id":"2c462572-503d-4e77-94d4-a1655189a987","year":2024},"citing_paper":{"arxiv_id":"2501.16265","last_updated":"2025-05-27T20:00:08Z","snapshot_observed_at":"2026-08-11T05:50:52.752373Z","submitted_at":"2025-01-27T18:03:00Z","title":"Training Dynamics of In-Context Learning in Linear Attention","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-10T13:42:08.893622Z"},"links":{"citing_paper":"/paper/2501.16265"},"observation_digest":"sha256:0157f63b4e0855dd66a984812c645fee587bd8cc74608564f35b732c674d0107","observation_id":"e1295f8f-2108-4b23-8d35-5584f6f90474","resolution":{"observed_at":"2026-08-10T13:42:10.646077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:42:10.626728Z","title":"and Vardi, G","venue":null,"work_id":"77d776a2-6326-4511-84a8-11f24477be98","year":2025},"citing_paper":{"arxiv_id":"2501.16265","last_updated":"2025-05-27T20:00:08Z","snapshot_observed_at":"2026-08-11T05:50:52.752373Z","submitted_at":"2025-01-27T18:03:00Z","title":"Training Dynamics of In-Context Learning in Linear Attention","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-10T13:42:08.898470Z"},"links":{"citing_paper":"/paper/2501.16265"},"observation_digest":"sha256:9746ed41e918b0e4fff027948fa9d74faee256d3e5b2f94d97bfedf100264d16","observation_id":"21e847e9-0a87-4176-813d-e0ee1a1e4fb8","resolution":{"observed_at":"2026-08-10T13:42:10.630905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:42:10.613073Z","title":"Transformers learn to achieve second-order convergence rates for in-context linear regression","venue":null,"work_id":"93bf9bc1-35a9-4bb5-b76a-57de3ccc3485","year":2024},"citing_paper":{"arxiv_id":"2501.16265","last_updated":"2025-05-27T20:00:08Z","snapshot_observed_at":"2026-08-11T05:50:52.752373Z","submitted_at":"2025-01-27T18:03:00Z","title":"Training Dynamics of In-Context Learning in Linear Attention","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-10T13:42:08.903611Z"},"links":{"citing_paper":"/paper/2501.16265"},"observation_digest":"sha256:279e6544a51c9c29ab3752cb4815345c6868c73b2d062e09279dd19d46458176","observation_id":"71849b5f-4342-4594-9571-5e9f60e61493","resolution":{"observed_at":"2026-08-10T13:42:10.617623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:42:10.597001Z","title":"Effect of batch learning in multilayer neural networks","venue":null,"work_id":"74eef1b9-7260-4639-8077-0aa41cc63764","year":1998},"citing_paper":{"arxiv_id":"2501.16265","last_updated":"2025-05-27T20:00:08Z","snapshot_observed_at":"2026-08-11T05:50:52.752373Z","submitted_at":"2025-01-27T18:03:00Z","title":"Training Dynamics of In-Context Learning in Linear Attention","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-10T13:42:08.908134Z"},"links":{"citing_paper":"/paper/2501.16265"},"observation_digest":"sha256:8d0cb79772059583a4d5fe7db618e24390f3013c1de2497c1f29150180430dff","observation_id":"5fce92da-7176-4c50-a44b-b8e47b0f7504","resolution":{"observed_at":"2026-08-10T13:42:10.602828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:42:10.582487Z","title":"S., and Valiant, G","venue":null,"work_id":"530ca177-fcaf-4d69-944e-946d22631bb1","year":2022},"citing_paper":{"arxiv_id":"2501.16265","last_updated":"2025-05-27T20:00:08Z","snapshot_observed_at":"2026-08-11T05:50:52.752373Z","submitted_at":"2025-01-27T18:03:00Z","title":"Training Dynamics of In-Context Learning in Linear Attention","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-10T13:42:08.912602Z"},"links":{"citing_paper":"/paper/2501.16265"},"observation_digest":"sha256:1e0bfbee8d5c5a981d26b83140722c400a8edaaa114ef39ff140c01a0cf6e9a7","observation_id":"d3717c82-e22d-4d4a-a061-78241bdef035","resolution":{"observed_at":"2026-08-10T13:42:10.587295Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21698","last_updated":"2024-10-29T03:27:56Z","snapshot_observed_at":"2026-08-10T00:21:47.818412Z","submitted_at":"2024-10-29T03:27:56Z","title":"On the Role of Depth and Looping for In-Context Learning with Task Diversity","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21698","snapshot_observed_at":"2026-08-10T13:42:08.917150Z","title":"J., Jegelka, S., and Kumar, S","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.16265","last_updated":"2025-05-27T20:00:08Z","snapshot_observed_at":"2026-08-11T05:50:52.752373Z","submitted_at":"2025-01-27T18:03:00Z","title":"Training Dynamics of In-Context Learning in Linear Attention","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-10T13:42:08.917150Z"},"links":{"cited_paper":"/paper/2410.21698","citing_paper":"/paper/2501.16265"},"observation_digest":"sha256:254161b498e6cca2ce286031803bd1021eca67ca29cfb8febfeddd1e583f1788","observation_id":"22b504e4-4ff0-43fe-b746-85863551cc3e","resolution":{"observed_at":"2026-08-10T13:42:08.917150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06833","last_updated":"2024-10-09T12:50:50Z","snapshot_observed_at":"2026-07-06T19:30:21.486298Z","submitted_at":"2024-10-09T12:50:50Z","title":"Dynamic metastability in the self-attention model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06833","snapshot_observed_at":"2026-08-10T13:42:08.922647Z","title":"Dynamic metastability in the self-attention model, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.16265","last_updated":"2025-05-27T20:00:08Z","snapshot_observed_at":"2026-08-11T05:50:52.752373Z","submitted_at":"2025-01-27T18:03:00Z","title":"Training Dynamics of In-Context Learning in Linear Attention","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-10T13:42:08.922647Z"},"links":{"cited_paper":"/paper/2410.06833","citing_paper":"/paper/2501.16265"},"observation_digest":"sha256:8b75c8d8120e1c611acf79a879055751811156a5aeaade44ddbf198317354e54","observation_id":"080117ce-e8b2-4bcb-b8ca-b821c4b05ab7","resolution":{"observed_at":"2026-08-10T13:42:08.922647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12734","last_updated":"2025-05-27T18:50:18Z","snapshot_observed_at":"2026-08-07T16:59:17.445249Z","submitted_at":"2025-03-17T02:00:49Z","title":"In-Context Linear Regression Demystified: Training Dynamics and Mechanistic Interpretability of Multi-Head Softmax Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.12734","snapshot_observed_at":"2026-08-10T13:42:08.927759Z","title":"In-context linear regression demystified: Training dynamics and mechanistic interpretability of multi-head softmax attention, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2501.16265","last_updated":"2025-05-27T20:00:08Z","snapshot_observed_at":"2026-08-11T05:50:52.752373Z","submitted_at":"2025-01-27T18:03:00Z","title":"Training Dynamics of In-Context Learning in Linear Attention","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-10T13:42:08.927759Z"},"links":{"cited_paper":"/paper/2503.12734","citing_paper":"/paper/2501.16265"},"observation_digest":"sha256:b98ed675b9dc89128a10ff1aeeac4fb51ec7624f53273127e8074d7decfee6fb","observation_id":"a1fc2764-3e10-4b0f-8f81-e906ccb50c9d","resolution":{"observed_at":"2026-08-10T13:42:08.927759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:42:10.568255Z","title":"Learning to grok: Emergence of in-context learning and skill composition in modular arithmetic tasks","venue":null,"work_id":"bf7b8ef0-2a95-4381-b88b-4b55f27fb9c3","year":2024},"citing_paper":{"arxiv_id":"2501.16265","last_updated":"2025-05-27T20:00:08Z","snapshot_observed_at":"2026-08-11T05:50:52.752373Z","submitted_at":"2025-01-27T18:03:00Z","title":"Training Dynamics of In-Context Learning in Linear Attention","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-10T13:42:08.934151Z"},"links":{"citing_paper":"/paper/2501.16265"},"observation_digest":"sha256:a69c6cc5a93be939300c9b966379d5978d1777d65c558c9c241186a63b4f27c9","observation_id":"6860ba27-79d8-4f9a-b077-ae624ebe29f6","resolution":{"observed_at":"2026-08-10T13:42:10.572786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:42:10.553217Z","title":"T., Schrodi, S., Bratuli\\' c , J., Behrmann, N., Fischer, V., and Brox, T","venue":null,"work_id":"9eadf3b9-9fed-4d60-af06-618140eb6b11","year":2024},"citing_paper":{"arxiv_id":"2501.16265","last_updated":"2025-05-27T20:00:08Z","snapshot_observed_at":"2026-08-11T05:50:52.752373Z","submitted_at":"2025-01-27T18:03:00Z","title":"Training Dynamics of In-Context Learning in Linear Attention","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-10T13:42:08.938582Z"},"links":{"citing_paper":"/paper/2501.16265"},"observation_digest":"sha256:34778bb16c63140840012bb227e7f87d27da01a8098fa53508e1b9f4eb8f75c0","observation_id":"0e993c53-abc7-4b3a-84a4-c351153cc72a","resolution":{"observed_at":"2026-08-10T13:42:10.557977Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:42:10.538703Z","title":null,"venue":null,"work_id":"f67426ce-1e83-4387-931a-e755355d32af","year":2025},"citing_paper":{"arxiv_id":"2501.16265","last_updated":"2025-05-27T20:00:08Z","snapshot_observed_at":"2026-08-11T05:50:52.752373Z","submitted_at":"2025-01-27T18:03:00Z","title":"Training Dynamics of In-Context Learning in Linear Attention","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-10T13:42:08.943036Z"},"links":{"citing_paper":"/paper/2501.16265"},"observation_digest":"sha256:2d8f1cfe0b669c6590a80ba53975c3e2b9367bbedaa4ccd46e727b0981e8f770","observation_id":"acf3c34c-7f88-4ad2-98a2-954ff45b44d5","resolution":{"observed_at":"2026-08-10T13:42:10.543221Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:42:10.523633Z","title":"Non-asymptotic convergence of training transformers for next-token prediction","venue":null,"work_id":"1f656aeb-06e0-423c-967e-a79ff59e3405","year":2024},"citing_paper":{"arxiv_id":"2501.16265","last_updated":"2025-05-27T20:00:08Z","snapshot_observed_at":"2026-08-11T05:50:52.752373Z","submitted_at":"2025-01-27T18:03:00Z","title":"Training Dynamics of In-Context Learning in Linear Attention","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-10T13:42:08.947058Z"},"links":{"citing_paper":"/paper/2501.16265"},"observation_digest":"sha256:55ba8d7aa7bf026cac75561146fb7de0c913071daf380fe3955463d56848dd2e","observation_id":"7ecd2b09-c6dc-49c3-ba91-125b688ed482","resolution":{"observed_at":"2026-08-10T13:42:10.528891Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:42:10.509333Z","title":"In-context convergence of transformers","venue":null,"work_id":"cd02af9c-1268-49b5-873e-7ba01f3638ce","year":2024},"citing_paper":{"arxiv_id":"2501.16265","last_updated":"2025-05-27T20:00:08Z","snapshot_observed_at":"2026-08-11T05:50:52.752373Z","submitted_at":"2025-01-27T18:03:00Z","title":"Training Dynamics of In-Context Learning in Linear Attention","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-10T13:42:08.951456Z"},"links":{"citing_paper":"/paper/2501.16265"},"observation_digest":"sha256:ecf0d95ee6aace3838a846414e955c975ec30c56b4ccc7534664267f5e8802de","observation_id":"f74697cf-cb95-4040-afec-0b0370f1f431","resolution":{"observed_at":"2026-08-10T13:42:10.513722Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:42:10.493901Z","title":"A theoretical analysis of self-supervised learning for vision transformers","venue":null,"work_id":"24d4f4b4-c349-4401-b721-b925ea40d1c9","year":2025},"citing_paper":{"arxiv_id":"2501.16265","last_updated":"2025-05-27T20:00:08Z","snapshot_observed_at":"2026-08-11T05:50:52.752373Z","submitted_at":"2025-01-27T18:03:00Z","title":"Training Dynamics of In-Context Learning in Linear Attention","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-10T13:42:08.956251Z"},"links":{"citing_paper":"/paper/2501.16265"},"observation_digest":"sha256:2af7ced7696085e056266f38f969689e562346f9b702aabb9291f5a908338c7f","observation_id":"7d00bd3f-797c-4623-93a3-701fea851152","resolution":{"observed_at":"2026-08-10T13:42:10.499288Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:42:10.477371Z","title":"E., Huang, Y., Li, Y., Rawat, A","venue":null,"work_id":"4e7ea22e-5a13-40fb-97a5-74039d64c095","year":2024},"citing_paper":{"arxiv_id":"2501.16265","last_updated":"2025-05-27T20:00:08Z","snapshot_observed_at":"2026-08-11T05:50:52.752373Z","submitted_at":"2025-01-27T18:03:00Z","title":"Training Dynamics of In-Context Learning in Linear Attention","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-10T13:42:08.960781Z"},"links":{"citing_paper":"/paper/2501.16265"},"observation_digest":"sha256:617040eec3d780d84c1f8a2964b65f957d75112d21b91e5a17420b25d922afd3","observation_id":"a1af68c1-b9e9-4290-a60a-198e97f63f17","resolution":{"observed_at":"2026-08-10T13:42:10.483227Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:42:10.457228Z","title":"D., and Ryu, E","venue":null,"work_id":"80e0ca76-2f0c-4665-933d-ee1acc070add","year":2024},"citing_paper":{"arxiv_id":"2501.16265","last_updated":"2025-05-27T20:00:08Z","snapshot_observed_at":"2026-08-11T05:50:52.752373Z","submitted_at":"2025-01-27T18:03:00Z","title":"Training Dynamics of In-Context Learning in Linear Attention","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-10T13:42:08.965195Z"},"links":{"citing_paper":"/paper/2501.16265"},"observation_digest":"sha256:d321a32593e774d04e3adc0c920e873ec71004b3feaf28c07f1748d17fec2d5f","observation_id":"94160fa6-dc10-40e2-96d4-fee0712934d6","resolution":{"observed_at":"2026-08-10T13:42:10.462332Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:42:10.441662Z","title":"Vision transformers provably learn spatial structure","venue":null,"work_id":"090b6529-b1dc-47da-be17-e4ce501c928a","year":2022},"citing_paper":{"arxiv_id":"2501.16265","last_updated":"2025-05-27T20:00:08Z","snapshot_observed_at":"2026-08-11T05:50:52.752373Z","submitted_at":"2025-01-27T18:03:00Z","title":"Training Dynamics of In-Context Learning in Linear Attention","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-10T13:42:08.969754Z"},"links":{"citing_paper":"/paper/2501.16265"},"observation_digest":"sha256:cdaec8b061969afc068773a7f14b3ff31bb530ba7b6212c7828176f36835c642","observation_id":"d8050a11-f76c-47c8-a94a-6973553b1eec","resolution":{"observed_at":"2026-08-10T13:42:10.446003Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:42:10.425598Z","title":"and Telgarsky, M","venue":null,"work_id":"fcbb2436-0729-436b-908f-f13246b5abf9","year":2019},"citing_paper":{"arxiv_id":"2501.16265","last_updated":"2025-05-27T20:00:08Z","snapshot_observed_at":"2026-08-11T05:50:52.752373Z","submitted_at":"2025-01-27T18:03:00Z","title":"Training Dynamics of In-Context Learning in Linear Attention","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-10T13:42:08.974419Z"},"links":{"citing_paper":"/paper/2501.16265"},"observation_digest":"sha256:17659bab262ae768aab1b5531c7d198f27e9ebed63b61fe23401af5d54e3459a","observation_id":"d3c3ecfa-dfca-41db-89e8-8b638a718ee0","resolution":{"observed_at":"2026-08-10T13:42:10.430027Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:42:10.406370Z","title":"Unveil benign overfitting for transformer in vision: Training dynamics, convergence, and generalization","venue":null,"work_id":"6aa36105-524b-4971-b799-5ca8acab0632","year":2024},"citing_paper":{"arxiv_id":"2501.16265","last_updated":"2025-05-27T20:00:08Z","snapshot_observed_at":"2026-08-11T05:50:52.752373Z","submitted_at":"2025-01-27T18:03:00Z","title":"Training Dynamics of In-Context Learning in Linear Attention","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-10T13:42:08.978996Z"},"links":{"citing_paper":"/paper/2501.16265"},"observation_digest":"sha256:9fc86a8cf23f7aa6deca737f00f718057572ca98a72bd07f81fbba8bf6500ff3","observation_id":"a5dff65c-27b7-4a06-8c01-740afd2959a5","resolution":{"observed_at":"2026-08-10T13:42:10.412050Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:42:08.983616Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.16265","last_updated":"2025-05-27T20:00:08Z","snapshot_observed_at":"2026-08-11T05:50:52.752373Z","submitted_at":"2025-01-27T18:03:00Z","title":"Training Dynamics of In-Context Learning in Linear Attention","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-10T13:42:08.983616Z"},"links":{"citing_paper":"/paper/2501.16265"},"observation_digest":"sha256:1fc2dac7afb9439cfc4c4c9a7397b8d7c49d8dc30338f0b8bead6132b9a8a1b8","observation_id":"91ed1275-8bee-458e-8065-2b87698e280a","resolution":{"observed_at":"2026-08-10T13:42:08.983616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:42:10.389025Z","title":"and Suzuki, T","venue":null,"work_id":"ef5ae011-2d48-4654-8f70-043c877c3f71","year":2024},"citing_paper":{"arxiv_id":"2501.16265","last_updated":"2025-05-27T20:00:08Z","snapshot_observed_at":"2026-08-11T05:50:52.752373Z","submitted_at":"2025-01-27T18:03:00Z","title":"Training Dynamics of In-Context Learning in Linear Attention","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-10T13:42:08.988243Z"},"links":{"citing_paper":"/paper/2501.16265"},"observation_digest":"sha256:93c79cdef49327faa3502df878d5da7d10a2d5f1c2f088bb17157bdb706153dc","observation_id":"050d0fdb-a8db-43ce-a50f-a50a63825831","resolution":{"observed_at":"2026-08-10T13:42:10.394142Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:42:08.992917Z","title":"Geometry of linear convolutional networks","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.16265","last_updated":"2025-05-27T20:00:08Z","snapshot_observed_at":"2026-08-11T05:50:52.752373Z","submitted_at":"2025-01-27T18:03:00Z","title":"Training Dynamics of In-Context Learning in Linear Attention","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-10T13:42:08.992917Z"},"links":{"citing_paper":"/paper/2501.16265"},"observation_digest":"sha256:b558b953cb2677f9919109b8aca23218a6e1a11ec4b2d45335e10f58dadf5a0a","observation_id":"5b6df4c7-96ab-467b-b6ef-96bda7b3e719","resolution":{"observed_at":"2026-08-10T13:42:08.992917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:42:08.997544Z","title":"Function space and critical points of linear convolutional networks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.16265","last_updated":"2025-05-27T20:00:08Z","snapshot_observed_at":"2026-08-11T05:50:52.752373Z","submitted_at":"2025-01-27T18:03:00Z","title":"Training Dynamics of In-Context Learning in Linear Attention","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-10T13:42:08.997544Z"},"links":{"citing_paper":"/paper/2501.16265"},"observation_digest":"sha256:389f4da33ecd38c44a700982e84b95c8c9f48f6356f61e3bc5a5a9dc21933e48","observation_id":"7adbada2-0e9e-4892-9d7d-97f8fc51d6cd","resolution":{"observed_at":"2026-08-10T13:42:08.997544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:42:10.372548Z","title":"Is attention required for ICL ? exploring the relationship between model architecture and in-context learning ability","venue":null,"work_id":"9bd9b8b8-5cfa-4cb3-86fb-61917a34afba","year":2024},"citing_paper":{"arxiv_id":"2501.16265","last_updated":"2025-05-27T20:00:08Z","snapshot_observed_at":"2026-08-11T05:50:52.752373Z","submitted_at":"2025-01-27T18:03:00Z","title":"Training Dynamics of In-Context Learning in Linear Attention","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-10T13:42:09.002949Z"},"links":{"citing_paper":"/paper/2501.16265"},"observation_digest":"sha256:6cd59aa83ffbe19cd19dfd7295d5dbc228816f45a697c0f255327b16be8bb88e","observation_id":"ac224662-0663-4de0-ad94-82ec03472059","resolution":{"observed_at":"2026-08-10T13:42:10.377801Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:42:10.356658Z","title":"Fine-grained analysis of in-context linear estimation: Data, architecture, and beyond","venue":null,"work_id":"a2a6f2a5-9a0d-432f-bac9-4dd391910377","year":2024},"citing_paper":{"arxiv_id":"2501.16265","last_updated":"2025-05-27T20:00:08Z","snapshot_observed_at":"2026-08-11T05:50:52.752373Z","submitted_at":"2025-01-27T18:03:00Z","title":"Training Dynamics of In-Context Learning in Linear Attention","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-10T13:42:09.007960Z"},"links":{"citing_paper":"/paper/2501.16265"},"observation_digest":"sha256:67935e66ee4ade6e695cfe90bc76eda3bb31571a3dafc3a95dbe315b9e793f30","observation_id":"1c9dc810-147c-4185-8fc3-e45f9cee7c70","resolution":{"observed_at":"2026-08-10T13:42:10.361926Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:42:09.012085Z","title":"M., Letey, M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.16265","last_updated":"2025-05-27T20:00:08Z","snapshot_observed_at":"2026-08-11T05:50:52.752373Z","submitted_at":"2025-01-27T18:03:00Z","title":"Training Dynamics of In-Context Learning in Linear Attention","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-10T13:42:09.012085Z"},"links":{"citing_paper":"/paper/2501.16265"},"observation_digest":"sha256:775462e03897c914cb0b6cc70034287568c541c4bf66ddee3e0f46d56fb606d1","observation_id":"bfcc9474-cd07-44c3-a664-9f1530f7c447","resolution":{"observed_at":"2026-08-10T13:42:09.012085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:42:10.339018Z","title":"V., Hashimoto, T., and Ma, T","venue":null,"work_id":"df015d11-d34e-40e1-a31d-f5db716df670","year":2024},"citing_paper":{"arxiv_id":"2501.16265","last_updated":"2025-05-27T20:00:08Z","snapshot_observed_at":"2026-08-11T05:50:52.752373Z","submitted_at":"2025-01-27T18:03:00Z","title":"Training Dynamics of In-Context Learning in Linear Attention","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-10T13:42:09.016999Z"},"links":{"citing_paper":"/paper/2501.16265"},"observation_digest":"sha256:4d2db3afaaa154a368b7633d7ca616169b1667e52d2ffd7b017a77fb8fc71967","observation_id":"fb17ad90-e3da-42b1-9f02-1f4e87fa2969","resolution":{"observed_at":"2026-08-10T13:42:10.345757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:42:10.322826Z","title":"V., Bondaschi, M., Girish, A., Nagle, A., Kim, H., Gastpar, M., and Ekbote, C","venue":null,"work_id":"f2583458-06b4-445a-9a26-a7767c1fc998","year":2024},"citing_paper":{"arxiv_id":"2501.16265","last_updated":"2025-05-27T20:00:08Z","snapshot_observed_at":"2026-08-11T05:50:52.752373Z","submitted_at":"2025-01-27T18:03:00Z","title":"Training Dynamics of In-Context Learning in Linear Attention","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-10T13:42:09.022056Z"},"links":{"citing_paper":"/paper/2501.16265"},"observation_digest":"sha256:80bafa5f3599dbf06b5e5f64b1414554a579ab1d8103d6b5d81dd77c3989480a","observation_id":"35bb2cd7-dc34-417c-ad0d-6a6a4981f5cc","resolution":{"observed_at":"2026-08-10T13:42:10.328119Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:42:09.026844Z","title":"Progress measures for grokking via mechanistic interpretability","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.16265","last_updated":"2025-05-27T20:00:08Z","snapshot_observed_at":"2026-08-11T05:50:52.752373Z","submitted_at":"2025-01-27T18:03:00Z","title":"Training Dynamics of In-Context Learning in Linear Attention","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-10T13:42:09.026844Z"},"links":{"citing_paper":"/paper/2501.16265"},"observation_digest":"sha256:3611b2ff8d9dc4cd9c99c7a1a6a2edb5f23985f165e09a229649b7fb2fc71e9f","observation_id":"5b4a75ca-26e7-4ecb-9977-4d41283da5f6","resolution":{"observed_at":"2026-08-10T13:42:09.026844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:42:10.293110Z","title":"and Reddy, G","venue":null,"work_id":"4a898b0d-baf3-4091-9dac-4734fa45de63","year":2025},"citing_paper":{"arxiv_id":"2501.16265","last_updated":"2025-05-27T20:00:08Z","snapshot_observed_at":"2026-08-11T05:50:52.752373Z","submitted_at":"2025-01-27T18:03:00Z","title":"Training Dynamics of In-Context Learning in Linear Attention","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-10T13:42:09.031612Z"},"links":{"citing_paper":"/paper/2501.16265"},"observation_digest":"sha256:a2cea475e17beb50788e1baa8b254c43ef571a15de7e5f62e618b62e2a9c3a10","observation_id":"daa75e13-4970-47e2-8c0e-02553d455f70","resolution":{"observed_at":"2026-08-10T13:42:10.299913Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:42:10.275405Z","title":null,"venue":null,"work_id":"0c417c3c-f18c-46f1-83eb-9074e6ced1ba","year":2024},"citing_paper":{"arxiv_id":"2501.16265","last_updated":"2025-05-27T20:00:08Z","snapshot_observed_at":"2026-08-11T05:50:52.752373Z","submitted_at":"2025-01-27T18:03:00Z","title":"Training Dynamics of In-Context Learning in Linear Attention","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-10T13:42:09.036312Z"},"links":{"citing_paper":"/paper/2501.16265"},"observation_digest":"sha256:eb5abd48872be59b268c041fbeb985117c09fbb45d00defadc07482443b37420","observation_id":"927c95b6-68bb-4d4e-91d3-68fda00b5b24","resolution":{"observed_at":"2026-08-10T13:42:10.280694Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:42:10.257222Z","title":"In-context learning and induction heads, 2022","venue":null,"work_id":"bd98f743-3063-4426-96d6-66a4db8028cb","year":2022},"citing_paper":{"arxiv_id":"2501.16265","last_updated":"2025-05-27T20:00:08Z","snapshot_observed_at":"2026-08-11T05:50:52.752373Z","submitted_at":"2025-01-27T18:03:00Z","title":"Training Dynamics of In-Context Learning in Linear Attention","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-10T13:42:09.040604Z"},"links":{"citing_paper":"/paper/2501.16265"},"observation_digest":"sha256:8bd52838cc2905e2040ddd9b6260c5e78c7eb430558426fa3eaebf5307bead2e","observation_id":"98433b6e-25fe-4c04-a3e6-b8278de044cb","resolution":{"observed_at":"2026-08-10T13:42:10.263268Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1016/j.jde.2007.03.007","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:42:09.219738Z","title":"and Reznikoff, M","venue":null,"work_id":"0065f1ad-cea7-4fe9-8b9b-0d27ca2ee8bc","year":2007},"citing_paper":{"arxiv_id":"2501.16265","last_updated":"2025-05-27T20:00:08Z","snapshot_observed_at":"2026-08-11T05:50:52.752373Z","submitted_at":"2025-01-27T18:03:00Z","title":"Training Dynamics of In-Context Learning in Linear Attention","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-10T13:42:09.044925Z"},"links":{"citing_paper":"/paper/2501.16265"},"observation_digest":"sha256:24a55bece03f85fcaba6893985d8b1dc45720e183e749c82b45b765a29e086a6","observation_id":"161f5a43-37d3-47d4-bb9c-813d4208ea58","resolution":{"observed_at":"2026-08-10T13:42:09.225530Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:42:10.232554Z","title":"F., Lubana, E","venue":null,"work_id":"71225b7e-a4c4-4b3d-b665-53d82388090c","year":2025},"citing_paper":{"arxiv_id":"2501.16265","last_updated":"2025-05-27T20:00:08Z","snapshot_observed_at":"2026-08-11T05:50:52.752373Z","submitted_at":"2025-01-27T18:03:00Z","title":"Training Dynamics of In-Context Learning in Linear Attention","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-10T13:42:09.049180Z"},"links":{"citing_paper":"/paper/2501.16265"},"observation_digest":"sha256:c24f36b0ee06ad40cb12a0b5c4b6f7d5caa1a1ac651aa0ca9ab77277b05b44e5","observation_id":"ef1435cf-fe21-443d-a782-3920db0624bc","resolution":{"observed_at":"2026-08-10T13:42:10.240533Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:42:09.053680Z","title":"The mechanistic basis of data dependence and abrupt learning in an in-context classification task","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.16265","last_updated":"2025-05-27T20:00:08Z","snapshot_observed_at":"2026-08-11T05:50:52.752373Z","submitted_at":"2025-01-27T18:03:00Z","title":"Training Dynamics of In-Context Learning in Linear Attention","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-10T13:42:09.053680Z"},"links":{"citing_paper":"/paper/2501.16265"},"observation_digest":"sha256:e67078a952b7c89f0a534cff25253040ee95d09348fec04a0edf2702de4939ec","observation_id":"e69add26-a54c-4ff5-98e6-f969c065b3df","resolution":{"observed_at":"2026-08-10T13:42:09.053680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:42:10.209294Z","title":null,"venue":null,"work_id":"2f7c752f-83eb-44e9-83af-c65f06fd67ba","year":2024},"citing_paper":{"arxiv_id":"2501.16265","last_updated":"2025-05-27T20:00:08Z","snapshot_observed_at":"2026-08-11T05:50:52.752373Z","submitted_at":"2025-01-27T18:03:00Z","title":"Training Dynamics of In-Context Learning in Linear Attention","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-10T13:42:09.058068Z"},"links":{"citing_paper":"/paper/2501.16265"},"observation_digest":"sha256:092ab80cae6e21efe6c08d7c930417ceaea505a91e7e72e86928e0d3cf036154","observation_id":"f49ea934-b4d3-490d-a612-247e02399420","resolution":{"observed_at":"2026-08-10T13:42:10.213412Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:42:10.195756Z","title":"A distributional simplicity bias in the learning dynamics of transformers","venue":null,"work_id":"b73aa03b-db4d-4705-af0f-fa148794ca74","year":2024},"citing_paper":{"arxiv_id":"2501.16265","last_updated":"2025-05-27T20:00:08Z","snapshot_observed_at":"2026-08-11T05:50:52.752373Z","submitted_at":"2025-01-27T18:03:00Z","title":"Training Dynamics of In-Context Learning in Linear Attention","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-10T13:42:09.063049Z"},"links":{"citing_paper":"/paper/2501.16265"},"observation_digest":"sha256:0d29f275fbd428e4ea7f49d23469e3d1d2914197fbee5fea5c9c27fc3368998d","observation_id":"2d75092c-e492-4936-8c93-c2574e5815d2","resolution":{"observed_at":"2026-08-10T13:42:10.199875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:42:10.182437Z","title":"M., McClelland, J","venue":null,"work_id":"07f05b56-d667-45da-a9e3-a3dce233c9ab","year":2014},"citing_paper":{"arxiv_id":"2501.16265","last_updated":"2025-05-27T20:00:08Z","snapshot_observed_at":"2026-08-11T05:50:52.752373Z","submitted_at":"2025-01-27T18:03:00Z","title":"Training Dynamics of In-Context Learning in Linear Attention","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-10T13:42:09.067331Z"},"links":{"citing_paper":"/paper/2501.16265"},"observation_digest":"sha256:dd632f3421b96203eeece66950833c8eb37c00ee3c9230fa9509b4b70c063cfa","observation_id":"33e03add-e130-498c-aabe-26e79c5e8aa7","resolution":{"observed_at":"2026-08-10T13:42:10.186428Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:42:09.071591Z","title":"M., McClelland, J","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.16265","last_updated":"2025-05-27T20:00:08Z","snapshot_observed_at":"2026-08-11T05:50:52.752373Z","submitted_at":"2025-01-27T18:03:00Z","title":"Training Dynamics of In-Context Learning in Linear Attention","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-10T13:42:09.071591Z"},"links":{"citing_paper":"/paper/2501.16265"},"observation_digest":"sha256:27e46f0b0184329c04ec00ea4cb3a5ba56b68a9913e635165301f17ed385fcaf","observation_id":"0ae0ce06-93b8-44f8-85f5-afdeba87eb8f","resolution":{"observed_at":"2026-08-10T13:42:09.071591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:42:10.167505Z","title":"Linear transformers are secretly fast weight programmers","venue":null,"work_id":"19a68fef-8d2b-4c15-b865-b9a68ac1503d","year":2021},"citing_paper":{"arxiv_id":"2501.16265","last_updated":"2025-05-27T20:00:08Z","snapshot_observed_at":"2026-08-11T05:50:52.752373Z","submitted_at":"2025-01-27T18:03:00Z","title":"Training Dynamics of In-Context Learning in Linear Attention","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-10T13:42:09.075725Z"},"links":{"citing_paper":"/paper/2501.16265"},"observation_digest":"sha256:eeed2f74987d2ba8339c5d1b7d2fdeeaaf34afdfb3561fbd6619bbe2ff6969ff","observation_id":"ff51e976-4af7-43cb-aa6e-b0a7a000bf31","resolution":{"observed_at":"2026-08-10T13:42:10.172011Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:42:10.152665Z","title":"Exponential convergence time of gradient descent for one-dimensional deep linear neural networks","venue":null,"work_id":"9526165b-cc73-4146-80be-585b320f30d3","year":2019},"citing_paper":{"arxiv_id":"2501.16265","last_updated":"2025-05-27T20:00:08Z","snapshot_observed_at":"2026-08-11T05:50:52.752373Z","submitted_at":"2025-01-27T18:03:00Z","title":"Training Dynamics of In-Context Learning in Linear Attention","version":2},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-10T13:42:09.079454Z"},"links":{"citing_paper":"/paper/2501.16265"},"observation_digest":"sha256:fba7b508a2e8da9012464e4bb9a2f81a91a34689af74b5dd8684c4c198ddfaee","observation_id":"180988dd-578a-4831-8349-f2b034b461ba","resolution":{"observed_at":"2026-08-10T13:42:10.157648Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08699","last_updated":"2024-03-13T17:02:27Z","snapshot_observed_at":"2026-08-10T11:11:24.457956Z","submitted_at":"2024-03-13T17:02:27Z","title":"Implicit Regularization of Gradient Flow on One-Layer Softmax Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08699","snapshot_observed_at":"2026-08-10T13:42:09.083522Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.16265","last_updated":"2025-05-27T20:00:08Z","snapshot_observed_at":"2026-08-11T05:50:52.752373Z","submitted_at":"2025-01-27T18:03:00Z","title":"Training Dynamics of In-Context Learning in Linear Attention","version":2},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-10T13:42:09.083522Z"},"links":{"cited_paper":"/paper/2403.08699","citing_paper":"/paper/2501.16265"},"observation_digest":"sha256:27b42cc9ab256ef0aa94dce4f66b373ab4e4a8ddd48cb3a7b5468e2b8e13d3c1","observation_id":"ee85c82c-8ac2-43be-bc0f-a5588a800f5c","resolution":{"observed_at":"2026-08-10T13:42:09.083522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:42:10.136898Z","title":"K., Chan, S., Moskovitz, T., Grant, E., Saxe, A., and Hill, F","venue":null,"work_id":"5f0e424e-d0c2-4b99-a914-eab85d0ce9cf","year":2023},"citing_paper":{"arxiv_id":"2501.16265","last_updated":"2025-05-27T20:00:08Z","snapshot_observed_at":"2026-08-11T05:50:52.752373Z","submitted_at":"2025-01-27T18:03:00Z","title":"Training Dynamics of In-Context Learning in Linear Attention","version":2},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-10T13:42:09.087876Z"},"links":{"citing_paper":"/paper/2501.16265"},"observation_digest":"sha256:6326b5a416d088a82678d5a8561dd7a9028896d00a7cee7f53c3e0b85da8cd58","observation_id":"c52dee80-a090-4389-a912-04517e84c05c","resolution":{"observed_at":"2026-08-10T13:42:10.142031Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:42:10.121172Z","title":"K., Moskovitz, T., Hill, F., Chan, S","venue":null,"work_id":"b244cac5-51d8-494a-a05d-fcabacf2d29a","year":2024},"citing_paper":{"arxiv_id":"2501.16265","last_updated":"2025-05-27T20:00:08Z","snapshot_observed_at":"2026-08-11T05:50:52.752373Z","submitted_at":"2025-01-27T18:03:00Z","title":"Training Dynamics of In-Context Learning in Linear Attention","version":2},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-10T13:42:09.091488Z"},"links":{"citing_paper":"/paper/2501.16265"},"observation_digest":"sha256:9822b6b52a838411752e9a01788a4774d56207a9759a4681e2e9f96bc0943c0a","observation_id":"523c51a5-308b-4e46-8576-562225e5584e","resolution":{"observed_at":"2026-08-10T13:42:10.126088Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05631","last_updated":"2025-03-10T07:13:09Z","snapshot_observed_at":"2026-08-07T17:21:31.437596Z","submitted_at":"2025-03-07T17:54:05Z","title":"Strategy Coopetition Explains the Emergence and Transience of In-Context Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.05631","snapshot_observed_at":"2026-08-10T13:42:09.095341Z","title":"K., Moskovitz, T., Dragutinovic, S., Hill, F., Chan, S","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2501.16265","last_updated":"2025-05-27T20:00:08Z","snapshot_observed_at":"2026-08-11T05:50:52.752373Z","submitted_at":"2025-01-27T18:03:00Z","title":"Training Dynamics of In-Context Learning in Linear Attention","version":2},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-10T13:42:09.095341Z"},"links":{"cited_paper":"/paper/2503.05631","citing_paper":"/paper/2501.16265"},"observation_digest":"sha256:f8694cd5257cb2bbd81a5d79dc77071d7f24c3255970f6e765f20a4e094932d2","observation_id":"07cd9722-8346-469b-967c-fcb945bbb1b8","resolution":{"observed_at":"2026-08-10T13:42:09.095341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:42:10.106834Z","title":"Unraveling the gradient descent dynamics of transformers","venue":null,"work_id":"aaa0177f-870c-4614-9cec-1c4e3e029e38","year":2024},"citing_paper":{"arxiv_id":"2501.16265","last_updated":"2025-05-27T20:00:08Z","snapshot_observed_at":"2026-08-11T05:50:52.752373Z","submitted_at":"2025-01-27T18:03:00Z","title":"Training Dynamics of In-Context Learning in Linear Attention","version":2},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-10T13:42:09.099630Z"},"links":{"citing_paper":"/paper/2501.16265"},"observation_digest":"sha256:5bf368c139b96654e753e17b2e6c0936bd4f23f1af260983227fbb3a1af43ce4","observation_id":"5ab6d677-67c2-4c8d-9891-666ecc4bec0d","resolution":{"observed_at":"2026-08-10T13:42:10.111542Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16898","last_updated":"2024-02-22T18:38:14Z","snapshot_observed_at":"2026-08-10T11:11:22.508778Z","submitted_at":"2023-08-31T17:57:50Z","title":"Transformers as Support Vector Machines","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.16898","snapshot_observed_at":"2026-08-10T13:42:09.103451Z","title":"A., Li, Y., Thrampoulidis, C., and Oymak, S","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.16265","last_updated":"2025-05-27T20:00:08Z","snapshot_observed_at":"2026-08-11T05:50:52.752373Z","submitted_at":"2025-01-27T18:03:00Z","title":"Training Dynamics of In-Context Learning in Linear Attention","version":2},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-10T13:42:09.103451Z"},"links":{"cited_paper":"/paper/2308.16898","citing_paper":"/paper/2501.16265"},"observation_digest":"sha256:551c546c5cc2b059d894909bf8c060e3a30f6b4e42d165940158903170501c2b","observation_id":"17e09882-94d7-458b-9876-e8d11e230fe2","resolution":{"observed_at":"2026-08-10T13:42:09.103451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:42:10.091734Z","title":null,"venue":null,"work_id":"ea780b2e-06d6-4507-a4ab-b8bca185b7bc","year":2023},"citing_paper":{"arxiv_id":"2501.16265","last_updated":"2025-05-27T20:00:08Z","snapshot_observed_at":"2026-08-11T05:50:52.752373Z","submitted_at":"2025-01-27T18:03:00Z","title":"Training Dynamics of In-Context Learning in Linear Attention","version":2},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-10T13:42:09.108132Z"},"links":{"citing_paper":"/paper/2501.16265"},"observation_digest":"sha256:e1395f206f6b21b0839bad7ce4469c0980bdace879a597f7d897bda30764d993","observation_id":"56750efc-d9f1-4715-8348-b2a22df7b4c7","resolution":{"observed_at":"2026-08-10T13:42:10.096926Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:42:10.077086Z","title":null,"venue":null,"work_id":"2d6e812a-559a-44f0-ad77-c7b756b96c79","year":2025},"citing_paper":{"arxiv_id":"2501.16265","last_updated":"2025-05-27T20:00:08Z","snapshot_observed_at":"2026-08-11T05:50:52.752373Z","submitted_at":"2025-01-27T18:03:00Z","title":"Training Dynamics of In-Context Learning in Linear Attention","version":2},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-10T13:42:09.112235Z"},"links":{"citing_paper":"/paper/2501.16265"},"observation_digest":"sha256:e469dd5e74f0b80a45c89a53f0a91649a687ff7e91e5d0da48551e06c74fdec0","observation_id":"42d6f779-6a0d-4d90-bc33-edfd1c8735b6","resolution":{"observed_at":"2026-08-10T13:42:10.082014Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:42:10.062747Z","title":"Implicit bias and fast convergence rates for self-attention","venue":null,"work_id":"5d5d9f8c-0eac-45c9-8aab-947ed1fbd62c","year":2025},"citing_paper":{"arxiv_id":"2501.16265","last_updated":"2025-05-27T20:00:08Z","snapshot_observed_at":"2026-08-11T05:50:52.752373Z","submitted_at":"2025-01-27T18:03:00Z","title":"Training Dynamics of In-Context Learning in Linear Attention","version":2},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-10T13:42:09.116517Z"},"links":{"citing_paper":"/paper/2501.16265"},"observation_digest":"sha256:bb6250a993fda3f0ca6cbc4d3c8ded2946257e862c49b96dcf8b3bedda7c9e80","observation_id":"a014db2b-f462-4e30-b475-95cf5671a9f3","resolution":{"observed_at":"2026-08-10T13:42:10.067318Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:42:09.120780Z","title":"N., Kaiser, L","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.16265","last_updated":"2025-05-27T20:00:08Z","snapshot_observed_at":"2026-08-11T05:50:52.752373Z","submitted_at":"2025-01-27T18:03:00Z","title":"Training Dynamics of In-Context Learning in Linear Attention","version":2},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-10T13:42:09.120780Z"},"links":{"citing_paper":"/paper/2501.16265"},"observation_digest":"sha256:4f2ef6903599bffbe9ad3d7d97a6a44c12793336325b7582b99b31779ba87082","observation_id":"4e9d17f5-57a0-432e-918c-b2f0b4f25ebc","resolution":{"observed_at":"2026-08-10T13:42:09.120780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:42:10.038258Z","title":"Linear transformers are versatile in-context learners","venue":null,"work_id":"c7fc989b-4941-47ea-932b-e1bba990ae13","year":2024},"citing_paper":{"arxiv_id":"2501.16265","last_updated":"2025-05-27T20:00:08Z","snapshot_observed_at":"2026-08-11T05:50:52.752373Z","submitted_at":"2025-01-27T18:03:00Z","title":"Training Dynamics of In-Context Learning in Linear Attention","version":2},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-10T13:42:09.125061Z"},"links":{"citing_paper":"/paper/2501.16265"},"observation_digest":"sha256:a4ddf510d2a63e82548e0419bc195e20da0e25cd05c4c9e921a64be97de47b56","observation_id":"795111a3-fe31-4552-91bb-7dee48da91a3","resolution":{"observed_at":"2026-08-10T13:42:10.042963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:42:10.022817Z","title":"Transformers learn in-context by gradient descent","venue":null,"work_id":"d3c654c2-b465-4577-902b-9946371772a1","year":2023},"citing_paper":{"arxiv_id":"2501.16265","last_updated":"2025-05-27T20:00:08Z","snapshot_observed_at":"2026-08-11T05:50:52.752373Z","submitted_at":"2025-01-27T18:03:00Z","title":"Training Dynamics of In-Context Learning in Linear Attention","version":2},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-10T13:42:09.129291Z"},"links":{"citing_paper":"/paper/2501.16265"},"observation_digest":"sha256:76e197043f3647a54dd877d8cbe583a13908bef63be1541de843695659d2d52f","observation_id":"4b478dff-4ebe-4e02-a8bd-9fb779a69a8d","resolution":{"observed_at":"2026-08-10T13:42:10.027837Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11474","last_updated":"2025-01-29T10:27:40Z","snapshot_observed_at":"2026-08-10T11:11:25.965569Z","submitted_at":"2024-10-15T10:22:27Z","title":"How Transformers Get Rich: Approximation and Dynamics Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.11474","snapshot_observed_at":"2026-08-10T13:42:09.133732Z","title":"How transformers implement induction heads: Approximation and optimization analysis, 2024 a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.16265","last_updated":"2025-05-27T20:00:08Z","snapshot_observed_at":"2026-08-11T05:50:52.752373Z","submitted_at":"2025-01-27T18:03:00Z","title":"Training Dynamics of In-Context Learning in Linear Attention","version":2},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-10T13:42:09.133732Z"},"links":{"cited_paper":"/paper/2410.11474","citing_paper":"/paper/2501.16265"},"observation_digest":"sha256:59c4b77d2b623b8f6ec9bbaae882cc0e1086890ca61315e5bb5b2bdf27e376ca","observation_id":"26249c99-a298-4db3-be81-cc6fb5aae8bd","resolution":{"observed_at":"2026-08-10T13:42:09.133732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:42:10.007019Z","title":null,"venue":null,"work_id":"47097888-132e-4875-bff6-8b2ca7199f2d","year":2024},"citing_paper":{"arxiv_id":"2501.16265","last_updated":"2025-05-27T20:00:08Z","snapshot_observed_at":"2026-08-11T05:50:52.752373Z","submitted_at":"2025-01-27T18:03:00Z","title":"Training Dynamics of In-Context Learning in Linear Attention","version":2},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-10T13:42:09.138237Z"},"links":{"citing_paper":"/paper/2501.16265"},"observation_digest":"sha256:4a758896ce212f2d5f87a9eeb3d1ecc8ea43aee570fb29ff8f9d0de0cc0aaf34","observation_id":"24b59c78-541d-4819-8870-0e40b0d80fa7","resolution":{"observed_at":"2026-08-10T13:42:10.011623Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:42:09.142516Z","title":"D., Moroshko, E., Savarese, P., Golan, I., Soudry, D., and Srebro, N","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.16265","last_updated":"2025-05-27T20:00:08Z","snapshot_observed_at":"2026-08-11T05:50:52.752373Z","submitted_at":"2025-01-27T18:03:00Z","title":"Training Dynamics of In-Context Learning in Linear Attention","version":2},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-10T13:42:09.142516Z"},"links":{"citing_paper":"/paper/2501.16265"},"observation_digest":"sha256:e61c806a382224011a490672ba8bdc9b650b52c77bf8db679133c96cbd95bdd4","observation_id":"57f62c0c-2855-4b81-885b-8ab043f8be30","resolution":{"observed_at":"2026-08-10T13:42:09.142516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:42:09.982607Z","title":"How many pretraining tasks are needed for in-context learning of linear regression? In The Twelfth International Conference on Learning Representations, 2024","venue":null,"work_id":"bb6d654e-a043-407b-bc92-65ea9f3e104e","year":2024},"citing_paper":{"arxiv_id":"2501.16265","last_updated":"2025-05-27T20:00:08Z","snapshot_observed_at":"2026-08-11T05:50:52.752373Z","submitted_at":"2025-01-27T18:03:00Z","title":"Training Dynamics of In-Context Learning in Linear Attention","version":2},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-10T13:42:09.146831Z"},"links":{"citing_paper":"/paper/2501.16265"},"observation_digest":"sha256:92d62e5af49d8a0fcdba41321bae2522073550cafced9ba626c9f45a7c5b2997","observation_id":"8d372d5e-e8f2-4ecc-ab0c-cc721c8e3105","resolution":{"observed_at":"2026-08-10T13:42:09.987294Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:42:09.151276Z","title":"V., Pasunuru, R., Chen, D., Zettlemoyer, L., and Stoyanov, V","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.16265","last_updated":"2025-05-27T20:00:08Z","snapshot_observed_at":"2026-08-11T05:50:52.752373Z","submitted_at":"2025-01-27T18:03:00Z","title":"Training Dynamics of In-Context Learning in Linear Attention","version":2},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-10T13:42:09.151276Z"},"links":{"citing_paper":"/paper/2501.16265"},"observation_digest":"sha256:e4152c855e5988ef48ce903d64581fa2603b5898ab9602f209f09d4d2d2fc9a4","observation_id":"d0ba08e5-4b83-4754-9ab3-53727ac93825","resolution":{"observed_at":"2026-08-10T13:42:09.151276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:42:09.155908Z","title":"B., Jegelka, S., and Andreas, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.16265","last_updated":"2025-05-27T20:00:08Z","snapshot_observed_at":"2026-08-11T05:50:52.752373Z","submitted_at":"2025-01-27T18:03:00Z","title":"Training Dynamics of In-Context Learning in Linear Attention","version":2},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-10T13:42:09.155908Z"},"links":{"citing_paper":"/paper/2501.16265"},"observation_digest":"sha256:7b1b6fce7cc1a50cde34806cd3e3ede2533e8960bfece78d58a2d6c5787e41c7","observation_id":"d444a150-a108-4501-a902-0acad08361ed","resolution":{"observed_at":"2026-08-10T13:42:09.155908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:42:09.968653Z","title":null,"venue":null,"work_id":"0816acf8-4b3b-4152-880b-029da94907fb","year":2024},"citing_paper":{"arxiv_id":"2501.16265","last_updated":"2025-05-27T20:00:08Z","snapshot_observed_at":"2026-08-11T05:50:52.752373Z","submitted_at":"2025-01-27T18:03:00Z","title":"Training Dynamics of In-Context Learning in Linear Attention","version":2},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-10T13:42:09.160103Z"},"links":{"citing_paper":"/paper/2501.16265"},"observation_digest":"sha256:10ea90b39d18a12e4eecb4c1f5bb2d5527f0e16869cd4ab3495075d0e6029897","observation_id":"1aa313d2-72df-4055-8cd2-343c9770ef16","resolution":{"observed_at":"2026-08-10T13:42:09.972758Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:42:09.954085Z","title":"In-context learning of a linear transformer block: Benefits of the mlp component and one-step gd initialization","venue":null,"work_id":"4124f919-4873-439b-b9c6-07a3c7711fc5","year":2024},"citing_paper":{"arxiv_id":"2501.16265","last_updated":"2025-05-27T20:00:08Z","snapshot_observed_at":"2026-08-11T05:50:52.752373Z","submitted_at":"2025-01-27T18:03:00Z","title":"Training Dynamics of In-Context Learning in Linear Attention","version":2},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-10T13:42:09.164276Z"},"links":{"citing_paper":"/paper/2501.16265"},"observation_digest":"sha256:794030e097dbcc92523a0273a96bfe6d88d5dddf6cad30f7353a2e24fa3ee776","observation_id":"0cd92c93-764c-431c-912f-57814ddfc26e","resolution":{"observed_at":"2026-08-10T13:42:09.959015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.16265","last_updated":"2025-05-27T20:00:08Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-11T05:50:52.752373Z","submitted_at":"2025-01-27T18:03:00Z","title":"Training Dynamics of In-Context Learning in Linear Attention"},"reference_resolution":{"displayed":85,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":36,"verified_exact":2,"verified_fuzzy":47},"total_outbound_references":85},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 85 of 85 outbound references and 12 inbound Pith citation observations for arXiv:2501.16265."}