{"as_of":"2026-08-07T11:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a12325569ce0ca41b68d67773853ed058270f5232ece3db8a3f3b4a18a771cb5","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":16,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":16,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":16,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":16,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:35:38.610485Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T13:29:50.967150Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2212.07677","last_updated":"2023-05-31T08:59:47Z","snapshot_observed_at":"2026-07-31T03:35:59.280975Z","submitted_at":"2022-12-15T09:21:21Z","title":"Transformers learn in-context by gradient descent","version":2},"cited_work":{"arxiv_id":"2212.07677","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2212.07677","snapshot_observed_at":"2026-07-04T13:29:50.967150Z","title":"Transformers learn in-context by gradient descent","venue":null,"work_id":"44f96cad-4d9b-4291-8f9f-0ae36e6ee5cf","year":2022},"citing_paper":{"arxiv_id":"2303.17491","last_updated":"2023-11-16T20:15:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-30T16:01:52Z","title":"Language Models can Solve Computer Tasks","version":3},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-17T12:17:26.602361Z"},"links":{"cited_paper":"/paper/2212.07677","citing_paper":"/paper/2303.17491"},"observation_digest":"sha256:b20e1dcb5d0a37dc58a641de61c838633b1d063f36b159001be2ceb4435c023c","observation_id":"32247463-6fcb-4843-910b-dbbee5c8c1cb","resolution":{"observed_at":"2026-05-17T12:17:26.845013Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.07677","last_updated":"2023-05-31T08:59:47Z","snapshot_observed_at":"2026-07-31T03:35:59.280975Z","submitted_at":"2022-12-15T09:21:21Z","title":"Transformers learn in-context by gradient descent","version":2},"cited_work":{"arxiv_id":"2212.07677","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2212.07677","snapshot_observed_at":"2026-07-04T13:29:50.967150Z","title":"Transformers learn in-context by gradient descent","venue":null,"work_id":"44f96cad-4d9b-4291-8f9f-0ae36e6ee5cf","year":2022},"citing_paper":{"arxiv_id":"2401.10774","last_updated":"2024-06-14T23:32:32Z","snapshot_observed_at":"2026-07-06T17:17:56.276857Z","submitted_at":"2024-01-19T15:48:40Z","title":"Medusa: Simple LLM Inference Acceleration Framework with Multiple Decoding Heads","version":3},"reference_index":171,"source":"arxiv_source","source_observed_at":"2026-05-13T10:36:17.764761Z"},"links":{"cited_paper":"/paper/2212.07677","citing_paper":"/paper/2401.10774"},"observation_digest":"sha256:46181d39f1798088db1b90d3fd971a75af304ef5d42813fb47a299c5b1d8dfa1","observation_id":"6f4b0280-b613-4a58-8e59-968a275442a1","resolution":{"observed_at":"2026-05-13T10:36:18.266138Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.07677","last_updated":"2023-05-31T08:59:47Z","snapshot_observed_at":"2026-07-31T03:35:59.280975Z","submitted_at":"2022-12-15T09:21:21Z","title":"Transformers learn in-context by gradient descent","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.07677","snapshot_observed_at":"2026-08-07T10:35:38.610485Z","title":"V on Oswald, E","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.05295","last_updated":"2025-06-12T16:25:06Z","snapshot_observed_at":"2026-08-07T10:19:20.091786Z","submitted_at":"2025-06-05T17:48:19Z","title":"Sample Complexity and Representation Ability of Test-time Scaling Paradigms","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:38.610485Z"},"links":{"cited_paper":"/paper/2212.07677","citing_paper":"/paper/2506.05295"},"observation_digest":"sha256:03bf71fb50bb721f0b8997e94310c7ce27d6188a98e073cf4c45bfcde9c12f26","observation_id":"609e8753-af36-4bf4-9a0c-47b8338a16eb","resolution":{"observed_at":"2026-08-07T10:35:38.610485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.07677","last_updated":"2023-05-31T08:59:47Z","snapshot_observed_at":"2026-07-31T03:35:59.280975Z","submitted_at":"2022-12-15T09:21:21Z","title":"Transformers learn in-context by gradient descent","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.07677","snapshot_observed_at":"2026-08-07T06:10:20.795541Z","title":"Transformers learn in-context by gradient descent, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06179","last_updated":"2025-06-06T15:44:10Z","snapshot_observed_at":"2026-08-07T08:23:24.866121Z","submitted_at":"2025-06-06T15:44:10Z","title":"A Theoretical Study of (Hyper) Self-Attention through the Lens of Interactions: Representation, Training, Generalization","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T06:10:20.795541Z"},"links":{"cited_paper":"/paper/2212.07677","citing_paper":"/paper/2506.06179"},"observation_digest":"sha256:075efa909faeea6df0ff6a38af75aa628bd1757ff4409f5eddd5f90c79a80a56","observation_id":"0f0c45dd-5f99-4090-af3d-5d32b5d20624","resolution":{"observed_at":"2026-08-07T06:10:20.795541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.07677","last_updated":"2023-05-31T08:59:47Z","snapshot_observed_at":"2026-07-31T03:35:59.280975Z","submitted_at":"2022-12-15T09:21:21Z","title":"Transformers learn in-context by gradient descent","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.07677","snapshot_observed_at":"2026-08-06T21:38:16.278676Z","title":"Transformers learn in-context by gradient descent","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.00092","last_updated":"2025-06-30T09:53:41Z","snapshot_observed_at":"2026-08-06T21:32:11.201568Z","submitted_at":"2025-06-30T09:53:41Z","title":"Thinking About Thinking: SAGE-nano's Inverse Reasoning for Self-Aware Language Models","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-06T21:38:16.278676Z"},"links":{"cited_paper":"/paper/2212.07677","citing_paper":"/paper/2507.00092"},"observation_digest":"sha256:479c78337dd14c695f31698c46b1f09b24d18198d2dda142ebca0bffd3f41461","observation_id":"f01fd6a8-5cee-4206-817b-028894d7fec8","resolution":{"observed_at":"2026-08-06T21:38:16.278676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.07677","last_updated":"2023-05-31T08:59:47Z","snapshot_observed_at":"2026-07-31T03:35:59.280975Z","submitted_at":"2022-12-15T09:21:21Z","title":"Transformers learn in-context by gradient descent","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.07677","snapshot_observed_at":"2026-08-03T20:57:12.669528Z","title":"Transformers learn in-context by gradient descent, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.17852","last_updated":"2026-08-06T09:30:47Z","snapshot_observed_at":"2026-08-07T10:42:36.372918Z","submitted_at":"2025-11-22T00:38:43Z","title":"Transformers with RL or SFT Provably Learn Sparse Boolean Functions, But Differently","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-03T20:57:12.669528Z"},"links":{"cited_paper":"/paper/2212.07677","citing_paper":"/paper/2511.17852"},"observation_digest":"sha256:9da45785a68ece8598c1e46a3106d6687f933891394428a821d75b4dde872530","observation_id":"2bed3420-686e-41eb-bf14-6f62c9bffe54","resolution":{"observed_at":"2026-08-03T20:57:12.669528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.07677","last_updated":"2023-05-31T08:59:47Z","snapshot_observed_at":"2026-07-31T03:35:59.280975Z","submitted_at":"2022-12-15T09:21:21Z","title":"Transformers learn in-context by gradient descent","version":2},"cited_work":{"arxiv_id":"2212.07677","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2212.07677","snapshot_observed_at":"2026-07-04T13:29:50.967150Z","title":"Transformers learn in-context by gradient descent","venue":null,"work_id":"44f96cad-4d9b-4291-8f9f-0ae36e6ee5cf","year":2022},"citing_paper":{"arxiv_id":"2604.23371","last_updated":"2026-04-25T16:35:25Z","snapshot_observed_at":"2026-07-06T23:09:38.799345Z","submitted_at":"2026-04-25T16:35:25Z","title":"When Context Sticks: Studying Interference in In-Context Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-08T08:31:14.231710Z"},"links":{"cited_paper":"/paper/2212.07677","citing_paper":"/paper/2604.23371"},"observation_digest":"sha256:126ce71fe4b9e402f3b2d91b6b9a48f9fc671a694ff31ae8bb34abe71a0abb6d","observation_id":"5f09dc21-10d2-4352-9f20-797acd8af406","resolution":{"observed_at":"2026-05-11T20:36:09.553762Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.07677","last_updated":"2023-05-31T08:59:47Z","snapshot_observed_at":"2026-07-31T03:35:59.280975Z","submitted_at":"2022-12-15T09:21:21Z","title":"Transformers learn in-context by gradient descent","version":2},"cited_work":{"arxiv_id":"2212.07677","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2212.07677","snapshot_observed_at":"2026-07-04T13:29:50.967150Z","title":"Transformers learn in-context by gradient descent","venue":null,"work_id":"44f96cad-4d9b-4291-8f9f-0ae36e6ee5cf","year":2022},"citing_paper":{"arxiv_id":"2605.06322","last_updated":"2026-05-27T19:46:02Z","snapshot_observed_at":"2026-07-06T23:18:46.145104Z","submitted_at":"2026-05-07T14:21:26Z","title":"SMolLM: Small Language Models Learn Small Molecular Grammar","version":1},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-05-08T12:57:47.721361Z"},"links":{"cited_paper":"/paper/2212.07677","citing_paper":"/paper/2605.06322"},"observation_digest":"sha256:6a916cbae903523b5885a5f52db3d5e11c3f96ace1a8a071a0c15525e5381ed9","observation_id":"585e48d1-f584-4eee-b9bb-fcb131af08d1","resolution":{"observed_at":"2026-05-11T19:01:16.906551Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.07677","last_updated":"2023-05-31T08:59:47Z","snapshot_observed_at":"2026-07-31T03:35:59.280975Z","submitted_at":"2022-12-15T09:21:21Z","title":"Transformers learn in-context by gradient descent","version":2},"cited_work":{"arxiv_id":"2212.07677","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2212.07677","snapshot_observed_at":"2026-07-04T13:29:50.967150Z","title":"Transformers learn in-context by gradient descent","venue":null,"work_id":"44f96cad-4d9b-4291-8f9f-0ae36e6ee5cf","year":2022},"citing_paper":{"arxiv_id":"2605.09727","last_updated":"2026-05-10T19:52:29Z","snapshot_observed_at":"2026-07-31T17:23:23.893636Z","submitted_at":"2026-05-10T19:52:29Z","title":"One for All: A Non-Linear Transformer can Enable Cross-Domain Generalization for In-Context Reinforcement Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-12T03:46:21.786972Z"},"links":{"cited_paper":"/paper/2212.07677","citing_paper":"/paper/2605.09727"},"observation_digest":"sha256:382e11c867dc3f75022e5aa0a3484d3bba484e05961c7011632d6c9f63f9bb36","observation_id":"64e90ae5-66f6-45ca-ab58-f592057636a1","resolution":{"observed_at":"2026-05-12T06:56:31.950075Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.07677","last_updated":"2023-05-31T08:59:47Z","snapshot_observed_at":"2026-07-31T03:35:59.280975Z","submitted_at":"2022-12-15T09:21:21Z","title":"Transformers learn in-context by gradient descent","version":2},"cited_work":{"arxiv_id":"2212.07677","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2212.07677","snapshot_observed_at":"2026-07-04T13:29:50.967150Z","title":"Transformers learn in-context by gradient descent","venue":null,"work_id":"44f96cad-4d9b-4291-8f9f-0ae36e6ee5cf","year":2022},"citing_paper":{"arxiv_id":"2606.07623","last_updated":"2026-05-30T14:07:58Z","snapshot_observed_at":"2026-08-07T11:36:21.049124Z","submitted_at":"2026-05-30T14:07:58Z","title":"Finite Certificates for In-Context Determinacy and a Threshold Theory of Emergence in Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-28T19:07:54.236182Z"},"links":{"cited_paper":"/paper/2212.07677","citing_paper":"/paper/2606.07623"},"observation_digest":"sha256:e5bc68af0a303dfb4906eec3571c04c2a6a55714cc8a9b1243b10adcee21d84a","observation_id":"99d9c37f-1c2f-4824-b922-a66497b167a9","resolution":{"observed_at":"2026-06-28T19:12:34.778045Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.07677","last_updated":"2023-05-31T08:59:47Z","snapshot_observed_at":"2026-07-31T03:35:59.280975Z","submitted_at":"2022-12-15T09:21:21Z","title":"Transformers learn in-context by gradient descent","version":2},"cited_work":{"arxiv_id":"2212.07677","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2212.07677","snapshot_observed_at":"2026-07-04T13:29:50.967150Z","title":"Transformers learn in-context by gradient descent","venue":null,"work_id":"44f96cad-4d9b-4291-8f9f-0ae36e6ee5cf","year":2022},"citing_paper":{"arxiv_id":"2606.26749","last_updated":"2026-06-25T08:33:34Z","snapshot_observed_at":"2026-08-01T16:00:20.311664Z","submitted_at":"2026-06-25T08:33:34Z","title":"Structure Before Collapse: Transient semantic geometry in next-token prediction","version":1},"reference_index":127,"source":"arxiv_source","source_observed_at":"2026-06-26T05:14:07.208255Z"},"links":{"cited_paper":"/paper/2212.07677","citing_paper":"/paper/2606.26749"},"observation_digest":"sha256:dc1e41ce1bb176b184bd403e0e6c382f33cef3d7b13e39baad3a0c18971659e8","observation_id":"74199b95-59dc-4b8c-90ed-120a5b46db56","resolution":{"observed_at":"2026-07-04T13:29:50.968747Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.07677","last_updated":"2023-05-31T08:59:47Z","snapshot_observed_at":"2026-07-31T03:35:59.280975Z","submitted_at":"2022-12-15T09:21:21Z","title":"Transformers learn in-context by gradient descent","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.07677","snapshot_observed_at":"2026-08-01T23:43:11.269139Z","title":"2212.07677 , archiveprefix =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15277","last_updated":"2026-07-16T17:59:31Z","snapshot_observed_at":"2026-08-06T16:50:03.110275Z","submitted_at":"2026-07-16T17:59:31Z","title":"Partition, Prompt, Aggregate: Statistical Self-Consistency in Language Models","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-01T23:43:11.269139Z"},"links":{"cited_paper":"/paper/2212.07677","citing_paper":"/paper/2607.15277"},"observation_digest":"sha256:954bd7575a8f031fc4c78ced256974261b9607dbb2f0992f2b2418348cacd0cb","observation_id":"91c15dc8-0d55-435c-86b5-a4519d575197","resolution":{"observed_at":"2026-08-01T23:43:11.269139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.07677","last_updated":"2023-05-31T08:59:47Z","snapshot_observed_at":"2026-07-31T03:35:59.280975Z","submitted_at":"2022-12-15T09:21:21Z","title":"Transformers learn in-context by gradient descent","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.07677","snapshot_observed_at":"2026-08-01T22:19:54.206559Z","title":"Transformers learn in-context by gradient descent","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.15819","last_updated":"2026-07-17T10:28:27Z","snapshot_observed_at":"2026-08-04T15:34:15.583312Z","submitted_at":"2026-07-17T10:28:27Z","title":"In-context learning of closed form solution to simple linear regression task using transformer with linear self-attention","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T22:19:54.206559Z"},"links":{"cited_paper":"/paper/2212.07677","citing_paper":"/paper/2607.15819"},"observation_digest":"sha256:46b0343f1fe7fa0b62fe2c01f7c2e405f44a3e06b362dffa15de47a829dceb3f","observation_id":"937cce38-7c21-47f1-8935-1769e2e8f247","resolution":{"observed_at":"2026-08-01T22:19:54.206559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.07677","last_updated":"2023-05-31T08:59:47Z","snapshot_observed_at":"2026-07-31T03:35:59.280975Z","submitted_at":"2022-12-15T09:21:21Z","title":"Transformers learn in-context by gradient descent","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.07677","snapshot_observed_at":"2026-08-02T09:19:02.240344Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.19379","last_updated":"2026-07-01T04:05:08Z","snapshot_observed_at":"2026-08-06T07:59:11.722617Z","submitted_at":"2026-07-01T04:05:08Z","title":"Bayesian Wind Tunnels for Model Selection","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T09:19:02.240344Z"},"links":{"cited_paper":"/paper/2212.07677","citing_paper":"/paper/2607.19379"},"observation_digest":"sha256:b5cc7f6500632c8e8fe954ebb3023fb0b4c371f6954efba619ccaf9c3cadd9c9","observation_id":"b6f33ba5-fc60-4e30-8f39-4d21678e2008","resolution":{"observed_at":"2026-08-02T09:19:02.240344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.07677","last_updated":"2023-05-31T08:59:47Z","snapshot_observed_at":"2026-07-31T03:35:59.280975Z","submitted_at":"2022-12-15T09:21:21Z","title":"Transformers learn in-context by gradient descent","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.07677","snapshot_observed_at":"2026-07-31T23:53:01.264186Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23304","last_updated":"2026-07-25T17:33:35Z","snapshot_observed_at":"2026-08-04T01:16:50.556240Z","submitted_at":"2026-07-25T17:33:35Z","title":"Context-Adaptive Inference: A Unified Statistical and Foundation-Model View","version":1},"reference_index":143,"source":"pdf_text","source_observed_at":"2026-07-31T23:53:01.264186Z"},"links":{"cited_paper":"/paper/2212.07677","citing_paper":"/paper/2607.23304"},"observation_digest":"sha256:6d9dda54d5f00c43867d03463f19455e5624eb7a2df434c1dd0651d10fe9a6e6","observation_id":"fb9d9422-1de6-444c-adaa-25b1bd307e80","resolution":{"observed_at":"2026-07-31T23:53:01.264186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.07677","last_updated":"2023-05-31T08:59:47Z","snapshot_observed_at":"2026-07-31T03:35:59.280975Z","submitted_at":"2022-12-15T09:21:21Z","title":"Transformers learn in-context by gradient descent","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.07677","snapshot_observed_at":"2026-08-01T02:16:27.017180Z","title":"mlr.press/v202/von-oswald23a.html","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.25532","last_updated":"2026-07-28T10:17:59Z","snapshot_observed_at":"2026-08-07T00:42:49.772625Z","submitted_at":"2026-07-28T10:17:59Z","title":"Entangled by Design: Spurious Intra-Variable Signal Routing in Tabular In-Context Learners","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T02:16:27.017180Z"},"links":{"cited_paper":"/paper/2212.07677","citing_paper":"/paper/2607.25532"},"observation_digest":"sha256:b5a4b97c80fa75a0ed10ab3fd6aeefd3e1eed0bbca9d9413436e3aa4c05f7dc0","observation_id":"90560fd6-493c-48fc-92a2-bc098899d474","resolution":{"observed_at":"2026-08-01T02:16:27.017180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2212.07677/citation-record","integrity":"/paper/2212.07677/integrity","json":"/paper/2212.07677/citation-record.json","paper":"/paper/2212.07677"},"outbound":[],"paper":{"arxiv_id":"2212.07677","last_updated":"2023-05-31T08:59:47Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-31T03:35:59.280975Z","submitted_at":"2022-12-15T09:21:21Z","title":"Transformers learn in-context by gradient descent"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 16 inbound Pith citation observations for arXiv:2212.07677."}