{"as_of":"2026-08-08T13:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2a51c204dd091dc675a7c80f12aad7bb33f825f57a2daaec4de9cd39e3061873","coverage":[{"denominator":32,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":32,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:39:14.475409Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:48:04.570803Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T20:38:55.894248Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.18373","last_updated":"2025-07-13T01:17:02Z","snapshot_observed_at":"2026-08-07T16:27:05.749740Z","submitted_at":"2025-05-23T21:00:18Z","title":"Next-token pretraining implies in-context learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.18373","snapshot_observed_at":"2026-08-06T18:48:04.570803Z","title":"Riechers, Henry R","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07432","last_updated":"2025-07-13T00:23:45Z","snapshot_observed_at":"2026-08-06T18:38:51.633191Z","submitted_at":"2025-07-10T05:09:19Z","title":"Neural networks leverage nominally quantum and post-quantum representations","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:04.570803Z"},"links":{"cited_paper":"/paper/2505.18373","citing_paper":"/paper/2507.07432"},"observation_digest":"sha256:afbe021976e4c5667718d1cb081e9fbfb615f517e8dcf589f038106069a921a3","observation_id":"0dd0ea06-82f7-4f61-83ad-f01dbb981ebb","resolution":{"observed_at":"2026-08-06T18:48:04.570803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18373","last_updated":"2025-07-13T01:17:02Z","snapshot_observed_at":"2026-08-07T16:27:05.749740Z","submitted_at":"2025-05-23T21:00:18Z","title":"Next-token pretraining implies in-context learning","version":2},"cited_work":{"arxiv_id":"2505.18373","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18373","snapshot_observed_at":"2026-07-03T20:38:55.894248Z","title":"Mark Russinovich, Ahmed Salem, and Ronen Eldan","venue":null,"work_id":"54e89071-2a54-4bb4-abac-831d9d764d34","year":null},"citing_paper":{"arxiv_id":"2605.20382","last_updated":"2026-06-19T16:43:39Z","snapshot_observed_at":"2026-07-06T23:30:58.549353Z","submitted_at":"2026-05-19T18:32:20Z","title":"Do as I Say, Not as I Do: Instruction-Induction Conflict in LLMs","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-21T07:30:27.297971Z"},"links":{"cited_paper":"/paper/2505.18373","citing_paper":"/paper/2605.20382"},"observation_digest":"sha256:62caabce2d5b7cb9622165c5ebbf28589576707776e4d461aa51a80f6d52ead5","observation_id":"a0f54fa9-dd2f-4e5f-a778-3ee3d1e27498","resolution":{"observed_at":"2026-05-21T07:34:02.835390Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18373","last_updated":"2025-07-13T01:17:02Z","snapshot_observed_at":"2026-08-07T16:27:05.749740Z","submitted_at":"2025-05-23T21:00:18Z","title":"Next-token pretraining implies in-context learning","version":2},"cited_work":{"arxiv_id":"2505.18373","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18373","snapshot_observed_at":"2026-07-03T20:38:55.894248Z","title":"Mark Russinovich, Ahmed Salem, and Ronen Eldan","venue":null,"work_id":"54e89071-2a54-4bb4-abac-831d9d764d34","year":null},"citing_paper":{"arxiv_id":"2605.20382","last_updated":"2026-06-19T16:43:39Z","snapshot_observed_at":"2026-07-06T23:30:58.549353Z","submitted_at":"2026-05-19T18:32:20Z","title":"Do as I Say, Not as I Do: Instruction-Induction Conflict in LLMs","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-30T18:00:29.237972Z"},"links":{"cited_paper":"/paper/2505.18373","citing_paper":"/paper/2605.20382"},"observation_digest":"sha256:59fc05144bab7c1de67b69d0e0563723e6c76769e74451c13f014dc0bacb6496","observation_id":"83c8668e-eafe-4dd7-8012-f1781be88702","resolution":{"observed_at":"2026-06-30T18:04:58.158650Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18373","last_updated":"2025-07-13T01:17:02Z","snapshot_observed_at":"2026-08-07T16:27:05.749740Z","submitted_at":"2025-05-23T21:00:18Z","title":"Next-token pretraining implies in-context learning","version":2},"cited_work":{"arxiv_id":"2505.18373","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18373","snapshot_observed_at":"2026-07-03T20:38:55.894248Z","title":"Mark Russinovich, Ahmed Salem, and Ronen Eldan","venue":null,"work_id":"54e89071-2a54-4bb4-abac-831d9d764d34","year":null},"citing_paper":{"arxiv_id":"2606.18089","last_updated":"2026-07-05T17:40:26Z","snapshot_observed_at":"2026-07-12T13:34:39.011240Z","submitted_at":"2026-06-16T15:55:28Z","title":"From Reasoning Traces to Reusable Modules: Understanding Compositional Generalization in Language Model Reasoning","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-06-27T01:13:11.483599Z"},"links":{"cited_paper":"/paper/2505.18373","citing_paper":"/paper/2606.18089"},"observation_digest":"sha256:78152e08bb250c1cf92fb06e4861cd2218a15c7cd3225a3907d26c45396e5864","observation_id":"4e4983ec-6615-4d8c-bcf8-36c90a25873a","resolution":{"observed_at":"2026-07-03T20:38:55.895992Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.18373/citation-record","integrity":"/paper/2505.18373/integrity","json":"/paper/2505.18373/citation-record.json","paper":"/paper/2505.18373"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:10.522624Z","title":"Language models are unsupervised multitask learners","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.18373","last_updated":"2025-07-13T01:17:02Z","snapshot_observed_at":"2026-08-07T16:27:05.749740Z","submitted_at":"2025-05-23T21:00:18Z","title":"Next-token pretraining implies in-context learning","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:10.522624Z"},"links":{"citing_paper":"/paper/2505.18373"},"observation_digest":"sha256:5631504c682420af97c9d81ed2844552414b5097940793c157c5452816b74d3c","observation_id":"23ae4b3f-7573-43f4-9194-b2a19cb84ae8","resolution":{"observed_at":"2026-08-07T14:39:10.522624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:10.659096Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2505.18373","last_updated":"2025-07-13T01:17:02Z","snapshot_observed_at":"2026-08-07T16:27:05.749740Z","submitted_at":"2025-05-23T21:00:18Z","title":"Next-token pretraining implies in-context learning","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:10.659096Z"},"links":{"citing_paper":"/paper/2505.18373"},"observation_digest":"sha256:224bdab7d8bdefbedff1b52963cde43bc535e419a58957321276ea411d57e1d4","observation_id":"ba9a3316-9c80-450b-a6d0-83c35c5623aa","resolution":{"observed_at":"2026-08-07T14:39:10.659096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.12712","last_updated":"2023-04-13T20:41:31Z","snapshot_observed_at":"2026-08-03T04:49:15.195814Z","submitted_at":"2023-03-22T16:51:28Z","title":"Sparks of Artificial General Intelligence: Early experiments with GPT-4","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.12712","snapshot_observed_at":"2026-08-07T14:39:10.779063Z","title":"Sparks of artificial general intelligence: Early experiments with GPT-4","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18373","last_updated":"2025-07-13T01:17:02Z","snapshot_observed_at":"2026-08-07T16:27:05.749740Z","submitted_at":"2025-05-23T21:00:18Z","title":"Next-token pretraining implies in-context learning","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:10.779063Z"},"links":{"cited_paper":"/paper/2303.12712","citing_paper":"/paper/2505.18373"},"observation_digest":"sha256:11f78200ae09a1d157c1ebb520032a8d90747822838dd156d8f168823d85bf4e","observation_id":"a9d83373-353a-458a-9940-3d3bcfddc0bd","resolution":{"observed_at":"2026-08-07T14:39:10.779063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:19.466289Z","title":"An explanation of in-context learning as implicit Bayesian inference","venue":null,"work_id":"3c251c47-b507-493b-95c5-ec5c9737da45","year":2022},"citing_paper":{"arxiv_id":"2505.18373","last_updated":"2025-07-13T01:17:02Z","snapshot_observed_at":"2026-08-07T16:27:05.749740Z","submitted_at":"2025-05-23T21:00:18Z","title":"Next-token pretraining implies in-context learning","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:10.934682Z"},"links":{"citing_paper":"/paper/2505.18373"},"observation_digest":"sha256:7dfb6f070d497a868ad0cd185c23b039e9ef28dce1f1d5d026ad8e68bdda03fe","observation_id":"c507153a-c542-4234-ac4e-f98ee1bd41c2","resolution":{"observed_at":"2026-08-07T14:39:19.577650Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:11.096101Z","title":"Bayesian scaling laws for in-context learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18373","last_updated":"2025-07-13T01:17:02Z","snapshot_observed_at":"2026-08-07T16:27:05.749740Z","submitted_at":"2025-05-23T21:00:18Z","title":"Next-token pretraining implies in-context learning","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:11.096101Z"},"links":{"citing_paper":"/paper/2505.18373"},"observation_digest":"sha256:d173cc0d28e95c11b7de7071d7674a79b37e3f98a584301606a581ab4db4da67","observation_id":"fbc26298-df18-4ff3-b6dd-cae2b8c3e7ad","resolution":{"observed_at":"2026-08-07T14:39:11.096101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:19.222971Z","title":"Transformers learn in-context by gradient descent","venue":null,"work_id":"c401d1cb-729b-4870-aba1-904c28d5ee64","year":2023},"citing_paper":{"arxiv_id":"2505.18373","last_updated":"2025-07-13T01:17:02Z","snapshot_observed_at":"2026-08-07T16:27:05.749740Z","submitted_at":"2025-05-23T21:00:18Z","title":"Next-token pretraining implies in-context learning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:11.230099Z"},"links":{"citing_paper":"/paper/2505.18373"},"observation_digest":"sha256:c96c213da9189823f89e91df17ac2fa0062390bdc290ff69d384fe35dfb81666","observation_id":"a26ff039-52aa-4efb-9412-1b4c3e7297ce","resolution":{"observed_at":"2026-08-07T14:39:19.353203Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:19.016511Z","title":"Transformers learn to implement preconditioned gradient descent for in-context learning","venue":null,"work_id":"ae6c5a29-d419-4041-92a2-d187898e1115","year":2023},"citing_paper":{"arxiv_id":"2505.18373","last_updated":"2025-07-13T01:17:02Z","snapshot_observed_at":"2026-08-07T16:27:05.749740Z","submitted_at":"2025-05-23T21:00:18Z","title":"Next-token pretraining implies in-context learning","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:11.391441Z"},"links":{"citing_paper":"/paper/2505.18373"},"observation_digest":"sha256:33ac2b1b557e4731c3f9370887d71cf6548efa749b05b2889958054fe3b7e354","observation_id":"028fc5f7-63e8-4405-855a-2e1e1add81a0","resolution":{"observed_at":"2026-08-07T14:39:19.124364Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03782","last_updated":"2025-06-05T17:58:57Z","snapshot_observed_at":"2026-07-06T20:01:54.557848Z","submitted_at":"2024-12-05T00:05:11Z","title":"The broader spectrum of in-context learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03782","snapshot_observed_at":"2026-08-07T14:39:11.525634Z","title":"The broader spectrum of in-context learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18373","last_updated":"2025-07-13T01:17:02Z","snapshot_observed_at":"2026-08-07T16:27:05.749740Z","submitted_at":"2025-05-23T21:00:18Z","title":"Next-token pretraining implies in-context learning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:11.525634Z"},"links":{"cited_paper":"/paper/2412.03782","citing_paper":"/paper/2505.18373"},"observation_digest":"sha256:7d213904220e7c29f167d423c08bfba4b14a71acdb51a574552561ab114e6214","observation_id":"5d07d308-4d84-4c26-a5f0-a56514518e23","resolution":{"observed_at":"2026-08-07T14:39:11.525634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:18.772670Z","title":"Transformers represent belief state geometry in their residual stream","venue":null,"work_id":"b5051eae-94da-4fd6-97bb-6bcbda838f77","year":2024},"citing_paper":{"arxiv_id":"2505.18373","last_updated":"2025-07-13T01:17:02Z","snapshot_observed_at":"2026-08-07T16:27:05.749740Z","submitted_at":"2025-05-23T21:00:18Z","title":"Next-token pretraining implies in-context learning","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:11.658697Z"},"links":{"citing_paper":"/paper/2505.18373"},"observation_digest":"sha256:5f7ebe7e3121f0a58dd6ad1842d7f9ce02320bc5133b3a417781f2a7f8b67775","observation_id":"3c10f9de-1942-4986-aa0e-002c0df277b7","resolution":{"observed_at":"2026-08-07T14:39:18.880580Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:18.521892Z","title":"Constrained belief updates explain geometric structures in transformer representations","venue":null,"work_id":"f571c10e-b4d3-4de0-9fae-ea1e96bde786","year":2025},"citing_paper":{"arxiv_id":"2505.18373","last_updated":"2025-07-13T01:17:02Z","snapshot_observed_at":"2026-08-07T16:27:05.749740Z","submitted_at":"2025-05-23T21:00:18Z","title":"Next-token pretraining implies in-context learning","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:11.794402Z"},"links":{"citing_paper":"/paper/2505.18373"},"observation_digest":"sha256:7b77aed2b00127c094f49704de76a493530052ab177698760ba27451138a9188","observation_id":"94e3ab11-b2b9-4ac3-90d2-d155b3a412d3","resolution":{"observed_at":"2026-08-07T14:39:18.624548Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:18.299240Z","title":"RNNs represent belief state geometry in their hidden states","venue":null,"work_id":"60f8d4ea-8840-4ee8-a448-bbc1ed386279","year":2024},"citing_paper":{"arxiv_id":"2505.18373","last_updated":"2025-07-13T01:17:02Z","snapshot_observed_at":"2026-08-07T16:27:05.749740Z","submitted_at":"2025-05-23T21:00:18Z","title":"Next-token pretraining implies in-context learning","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:11.956676Z"},"links":{"citing_paper":"/paper/2505.18373"},"observation_digest":"sha256:aeef65a7c17e8edfb55fc1b214c2d8f2410eee69222a7a4754578f1434c9c511","observation_id":"f9a097d9-0a92-4919-a464-b9ddca1120c1","resolution":{"observed_at":"2026-08-07T14:39:18.434866Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:18.100424Z","title":null,"venue":null,"work_id":"a606f218-72d2-4289-b7c1-fa7a0e49f0a6","year":2001},"citing_paper":{"arxiv_id":"2505.18373","last_updated":"2025-07-13T01:17:02Z","snapshot_observed_at":"2026-08-07T16:27:05.749740Z","submitted_at":"2025-05-23T21:00:18Z","title":"Next-token pretraining implies in-context learning","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:12.092474Z"},"links":{"citing_paper":"/paper/2505.18373"},"observation_digest":"sha256:5ab5441b8860f08ad78fd559a5328e41fc0f8fd922bda5821264cd0d53be98f5","observation_id":"eebf4abf-4b44-4e28-b6ed-320a478b4e62","resolution":{"observed_at":"2026-08-07T14:39:18.181859Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:12.219137Z","title":"A mathematical framework for transformer circuits","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18373","last_updated":"2025-07-13T01:17:02Z","snapshot_observed_at":"2026-08-07T16:27:05.749740Z","submitted_at":"2025-05-23T21:00:18Z","title":"Next-token pretraining implies in-context learning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:12.219137Z"},"links":{"citing_paper":"/paper/2505.18373"},"observation_digest":"sha256:af7a1e62b847057f80d6e95efea00ee17f3ad3bba6cfae4e6dafcf23ce85aa45","observation_id":"67abdc84-aad6-4dbc-8d3b-1aa29589e4c6","resolution":{"observed_at":"2026-08-07T14:39:12.219137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:17.822129Z","title":"In-context learning and induction heads","venue":null,"work_id":"a9677835-141b-46da-8b11-deb149b4acb6","year":2022},"citing_paper":{"arxiv_id":"2505.18373","last_updated":"2025-07-13T01:17:02Z","snapshot_observed_at":"2026-08-07T16:27:05.749740Z","submitted_at":"2025-05-23T21:00:18Z","title":"Next-token pretraining implies in-context learning","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:12.470323Z"},"links":{"citing_paper":"/paper/2505.18373"},"observation_digest":"sha256:5f739c7c4a1a2c25af7cba85129f425b44923739afd8a6df7239cca3e8e40db4","observation_id":"79ede063-cb47-4393-91b7-5192c1752cc5","resolution":{"observed_at":"2026-08-07T14:39:17.925148Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:17.568871Z","title":null,"venue":null,"work_id":"627f5d8e-b9d3-49f3-9f47-349ef63cbc59","year":2018},"citing_paper":{"arxiv_id":"2505.18373","last_updated":"2025-07-13T01:17:02Z","snapshot_observed_at":"2026-08-07T16:27:05.749740Z","submitted_at":"2025-05-23T21:00:18Z","title":"Next-token pretraining implies in-context learning","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:12.590141Z"},"links":{"citing_paper":"/paper/2505.18373"},"observation_digest":"sha256:1735d5b5bd06afdae24c810789b8044bf1d85d8ceaea0fea5dd181b58d4426c1","observation_id":"4c187814-8b65-4432-a3c0-0ded963ec18e","resolution":{"observed_at":"2026-08-07T14:39:17.687571Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:17.373367Z","title":null,"venue":null,"work_id":"75d3a8be-1599-42dc-a755-af8133d24790","year":2018},"citing_paper":{"arxiv_id":"2505.18373","last_updated":"2025-07-13T01:17:02Z","snapshot_observed_at":"2026-08-07T16:27:05.749740Z","submitted_at":"2025-05-23T21:00:18Z","title":"Next-token pretraining implies in-context learning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:12.698026Z"},"links":{"citing_paper":"/paper/2505.18373"},"observation_digest":"sha256:0799287aab258e8f9c65734fff2b4abeb2831a18958050fd191819960f06cd10","observation_id":"98b9499e-0972-488e-a67c-74c62ef303bd","resolution":{"observed_at":"2026-08-07T14:39:17.461471Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:17.119696Z","title":null,"venue":null,"work_id":"f7881d23-48c3-410b-a86e-4cff3e903cfe","year":1997},"citing_paper":{"arxiv_id":"2505.18373","last_updated":"2025-07-13T01:17:02Z","snapshot_observed_at":"2026-08-07T16:27:05.749740Z","submitted_at":"2025-05-23T21:00:18Z","title":"Next-token pretraining implies in-context learning","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:12.845266Z"},"links":{"citing_paper":"/paper/2505.18373"},"observation_digest":"sha256:e4f3cb83d467a4f85a62726df5004e5941155e04303cb478699f15cce1674a1f","observation_id":"44bccc95-5339-4f4c-8909-79aaabaac208","resolution":{"observed_at":"2026-08-07T14:39:17.270392Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:16.936027Z","title":null,"venue":null,"work_id":"6a8e2b61-5d99-43be-b26f-d803272ed0d0","year":2012},"citing_paper":{"arxiv_id":"2505.18373","last_updated":"2025-07-13T01:17:02Z","snapshot_observed_at":"2026-08-07T16:27:05.749740Z","submitted_at":"2025-05-23T21:00:18Z","title":"Next-token pretraining implies in-context learning","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:12.940165Z"},"links":{"citing_paper":"/paper/2505.18373"},"observation_digest":"sha256:6e485748169ef4497d3169d201abe594c44aaca1a33b4aa6b45afab92ebf3261","observation_id":"00ef0ebd-df95-42aa-a817-2c2852e8e144","resolution":{"observed_at":"2026-08-07T14:39:17.033210Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:16.773522Z","title":null,"venue":null,"work_id":"ca2c3f55-ad83-4e3b-a9f0-e3491517ccc6","year":2016},"citing_paper":{"arxiv_id":"2505.18373","last_updated":"2025-07-13T01:17:02Z","snapshot_observed_at":"2026-08-07T16:27:05.749740Z","submitted_at":"2025-05-23T21:00:18Z","title":"Next-token pretraining implies in-context learning","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:13.020770Z"},"links":{"citing_paper":"/paper/2505.18373"},"observation_digest":"sha256:fe7465317fcb159a5f42cc5a8ab7765b6f1cf95a113908cdae8fd3eb4615c645","observation_id":"c18aefdb-5d3e-4161-9e6f-9eaca7ef037e","resolution":{"observed_at":"2026-08-07T14:39:16.846055Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:16.535361Z","title":"Shannon entropy rate of hidden markov processes","venue":null,"work_id":"2f0e1350-f097-443c-9ad0-e534be083a06","year":2021},"citing_paper":{"arxiv_id":"2505.18373","last_updated":"2025-07-13T01:17:02Z","snapshot_observed_at":"2026-08-07T16:27:05.749740Z","submitted_at":"2025-05-23T21:00:18Z","title":"Next-token pretraining implies in-context learning","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:13.151419Z"},"links":{"citing_paper":"/paper/2505.18373"},"observation_digest":"sha256:973cc75eb696ab0db42a8c8946d2476c2de83a955358307a62919de19766df70","observation_id":"71ed24ca-59f9-4d66-9227-bf3f509cb586","resolution":{"observed_at":"2026-08-07T14:39:16.623887Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:16.386246Z","title":"Critical behavior in physics and probabilistic formal languages","venue":null,"work_id":"a924acf7-c39e-493c-984d-115bda1b1a5e","year":2017},"citing_paper":{"arxiv_id":"2505.18373","last_updated":"2025-07-13T01:17:02Z","snapshot_observed_at":"2026-08-07T16:27:05.749740Z","submitted_at":"2025-05-23T21:00:18Z","title":"Next-token pretraining implies in-context learning","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:13.319546Z"},"links":{"citing_paper":"/paper/2505.18373"},"observation_digest":"sha256:07057bbfe0e047ad7a28dd5be371371ccf78a937867621a0f0fa64c59b81ab90","observation_id":"ce99a68f-39ac-40c2-a131-2b9680199ca9","resolution":{"observed_at":"2026-08-07T14:39:16.438303Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00386","last_updated":"2015-04-01T20:55:10Z","snapshot_observed_at":"2026-07-06T04:13:51.950712Z","submitted_at":"2015-04-01T20:55:10Z","title":"Signatures of Infinity: Nonergodicity and Resource Scaling in Prediction, Complexity, and Learning","version":1},"cited_work":{"arxiv_id":"1504.00386","doi":null,"metadata_source":"pith","pith_arxiv_id":"1504.00386","snapshot_observed_at":"2026-08-07T14:39:14.894415Z","title":"Signatures of Infinity: Nonergodicity and Resource Scaling in Prediction, Complexity, and Learning","venue":"cond-mat.stat-mech","work_id":"657d3fd2-e823-4e89-aa17-67139f7fdb26","year":2015},"citing_paper":{"arxiv_id":"2505.18373","last_updated":"2025-07-13T01:17:02Z","snapshot_observed_at":"2026-08-07T16:27:05.749740Z","submitted_at":"2025-05-23T21:00:18Z","title":"Next-token pretraining implies in-context learning","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:13.406121Z"},"links":{"cited_paper":"/paper/1504.00386","citing_paper":"/paper/2505.18373"},"observation_digest":"sha256:1e39290b61d0757dd0ff24b8070f446901bff86e98ade4f1446857cf3935e6ee","observation_id":"3e6274c1-974a-41bc-a5cc-dd49782f8ca3","resolution":{"observed_at":"2026-08-07T14:39:15.006118Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:16.197778Z","title":"Language models model us","venue":null,"work_id":"5d075a34-6502-409a-bb77-72f8f66adfa6","year":2024},"citing_paper":{"arxiv_id":"2505.18373","last_updated":"2025-07-13T01:17:02Z","snapshot_observed_at":"2026-08-07T16:27:05.749740Z","submitted_at":"2025-05-23T21:00:18Z","title":"Next-token pretraining implies in-context learning","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:13.547887Z"},"links":{"citing_paper":"/paper/2505.18373"},"observation_digest":"sha256:22fb35f0ccadf5eaa424729336622f2e1ed0136276bae4e681012510902c6cc7","observation_id":"faca23d7-3995-42b3-83ed-3e9d6087a9e3","resolution":{"observed_at":"2026-08-07T14:39:16.289298Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:15.975068Z","title":"Predictability, complexity, and learning","venue":null,"work_id":"5eb6359c-a0b6-4181-8e6d-6cd898de80b4","year":2001},"citing_paper":{"arxiv_id":"2505.18373","last_updated":"2025-07-13T01:17:02Z","snapshot_observed_at":"2026-08-07T16:27:05.749740Z","submitted_at":"2025-05-23T21:00:18Z","title":"Next-token pretraining implies in-context learning","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:13.687663Z"},"links":{"citing_paper":"/paper/2505.18373"},"observation_digest":"sha256:0433f88a82503568ebcb2528351ece4e484808ac4570ea828cf14e5dc0112d95","observation_id":"c6d3af4b-f423-487c-9ed5-275f884cd1fe","resolution":{"observed_at":"2026-08-07T14:39:16.060360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-07T14:39:13.843128Z","title":"Scaling laws for neural language models","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2505.18373","last_updated":"2025-07-13T01:17:02Z","snapshot_observed_at":"2026-08-07T16:27:05.749740Z","submitted_at":"2025-05-23T21:00:18Z","title":"Next-token pretraining implies in-context learning","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:13.843128Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2505.18373"},"observation_digest":"sha256:bc10f616910ef843653ab844504fa7e05bbc4947a52d495e5d6b11b9c83fb2e6","observation_id":"17d4ec45-227b-4e82-b4db-11e613628f6c","resolution":{"observed_at":"2026-08-07T14:39:13.843128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.03030","last_updated":"2019-07-18T18:09:19Z","snapshot_observed_at":"2026-08-06T05:32:29.477109Z","submitted_at":"2019-05-08T12:27:20Z","title":"Meta-learning of Sequential Strategies","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.03030","snapshot_observed_at":"2026-08-07T14:39:13.913343Z","title":"Meta-learning of sequential strategies","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2505.18373","last_updated":"2025-07-13T01:17:02Z","snapshot_observed_at":"2026-08-07T16:27:05.749740Z","submitted_at":"2025-05-23T21:00:18Z","title":"Next-token pretraining implies in-context learning","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:13.913343Z"},"links":{"cited_paper":"/paper/1905.03030","citing_paper":"/paper/2505.18373"},"observation_digest":"sha256:f44444a429562f58b64517420d77ddf39c25172f50c8d2680c3ef821e92d861b","observation_id":"75612168-e09b-498c-9425-9c5decff3d6c","resolution":{"observed_at":"2026-08-07T14:39:13.913343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:15.736527Z","title":"Data distributional properties drive emer- gent in-context learning in transformers","venue":null,"work_id":"8ef98845-3f79-4e22-b2a2-948d6e84f8e8","year":2022},"citing_paper":{"arxiv_id":"2505.18373","last_updated":"2025-07-13T01:17:02Z","snapshot_observed_at":"2026-08-07T16:27:05.749740Z","submitted_at":"2025-05-23T21:00:18Z","title":"Next-token pretraining implies in-context learning","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:14.035992Z"},"links":{"citing_paper":"/paper/2505.18373"},"observation_digest":"sha256:aaf1c16d1e4755a50da7e22bca3bec1cccdcf59354c8f6c49655961b952c20d6","observation_id":"8a8004f4-9cca-4b52-8a91-942848a9d1ce","resolution":{"observed_at":"2026-08-07T14:39:15.838207Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"cond-mat/9902341","last_updated":"1999-02-25T14:55:35Z","snapshot_observed_at":"2026-08-03T04:05:31.019816Z","submitted_at":"1999-02-25T14:55:35Z","title":"Predictive Information","version":1},"cited_work":{"arxiv_id":"cond-mat/9902341","doi":null,"metadata_source":"pith","pith_arxiv_id":"cond-mat/9902341","snapshot_observed_at":"2026-08-07T14:39:14.653506Z","title":"Predictive Information","venue":"cond-mat.stat-mech","work_id":"f7b94d47-39be-4895-a676-717ee7335f28","year":1999},"citing_paper":{"arxiv_id":"2505.18373","last_updated":"2025-07-13T01:17:02Z","snapshot_observed_at":"2026-08-07T16:27:05.749740Z","submitted_at":"2025-05-23T21:00:18Z","title":"Next-token pretraining implies in-context learning","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:14.127973Z"},"links":{"cited_paper":"/paper/cond-mat/9902341","citing_paper":"/paper/2505.18373"},"observation_digest":"sha256:a1486d17eb9c4eea419786c100b08837f97ccb54acf0d56121762702b1419328","observation_id":"9d842ca5-de7e-4687-af69-6d32106a1f45","resolution":{"observed_at":"2026-08-07T14:39:14.717646Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:15.560587Z","title":null,"venue":null,"work_id":"18c0cdfb-b5bc-4eb7-8353-72f6d743d50c","year":2003},"citing_paper":{"arxiv_id":"2505.18373","last_updated":"2025-07-13T01:17:02Z","snapshot_observed_at":"2026-08-07T16:27:05.749740Z","submitted_at":"2025-05-23T21:00:18Z","title":"Next-token pretraining implies in-context learning","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:14.238739Z"},"links":{"citing_paper":"/paper/2505.18373"},"observation_digest":"sha256:7c69b5d98b948736140b6ff7d4a87d7eda1330dc0228cfd540f5f0b1c9baccfb","observation_id":"3d6be4e3-f7d6-441b-8e7d-3783d4740593","resolution":{"observed_at":"2026-08-07T14:39:15.636570Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:15.343247Z","title":"Grassberger","venue":null,"work_id":"1ca36c04-767d-4c2d-9a93-790c38a60ab1","year":1986},"citing_paper":{"arxiv_id":"2505.18373","last_updated":"2025-07-13T01:17:02Z","snapshot_observed_at":"2026-08-07T16:27:05.749740Z","submitted_at":"2025-05-23T21:00:18Z","title":"Next-token pretraining implies in-context learning","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:14.320112Z"},"links":{"citing_paper":"/paper/2505.18373"},"observation_digest":"sha256:e4f4a930aabc1a1ade8744b74fcbf98829886b472575ca8c70643e329580a729","observation_id":"edfaebd0-8a9c-4ee6-b832-e898203a04a5","resolution":{"observed_at":"2026-08-07T14:39:15.447962Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.03762","last_updated":"2023-08-02T00:41:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-06-12T17:57:34Z","title":"Attention Is All You Need","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.03762","snapshot_observed_at":"2026-08-07T14:39:14.475409Z","title":"g(k + 1, ℓ− k) log k + 1 ℓ + 2 + g(k, ℓ+ 1− k) log ℓ + 1− k ℓ + 2 # (34) = − ℓX k=0 ℓ! k! (ℓ − k)!","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.18373","last_updated":"2025-07-13T01:17:02Z","snapshot_observed_at":"2026-08-07T16:27:05.749740Z","submitted_at":"2025-05-23T21:00:18Z","title":"Next-token pretraining implies in-context learning","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:14.475409Z"},"links":{"cited_paper":"/paper/1706.03762","citing_paper":"/paper/2505.18373"},"observation_digest":"sha256:6d46f522d342c562dd0f907c0de57ee7a8359a2e30aaab3ef658ce48322ac65d","observation_id":"246e4b65-000e-4f5b-ac02-5b18fac886bc","resolution":{"observed_at":"2026-08-07T14:39:14.475409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:12.353085Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.18373","last_updated":"2025-07-13T01:17:02Z","snapshot_observed_at":"2026-08-07T16:27:05.749740Z","submitted_at":"2025-05-23T21:00:18Z","title":"Next-token pretraining implies in-context learning","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:12.353085Z"},"links":{"citing_paper":"/paper/2505.18373"},"observation_digest":"sha256:08cd211d1e8ceb53b875618a9381a4901f7eaf5876f794c51932d460ba39d4d5","observation_id":"cc8af376-9683-4c47-aaeb-21e9d0e95bf8","resolution":{"observed_at":"2026-08-07T14:39:12.353085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.18373","last_updated":"2025-07-13T01:17:02Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T16:27:05.749740Z","submitted_at":"2025-05-23T21:00:18Z","title":"Next-token pretraining implies in-context learning"},"reference_resolution":{"displayed":32,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":17,"verified_exact":2,"verified_fuzzy":13},"total_outbound_references":32},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 32 of 32 outbound references and 4 inbound Pith citation observations for arXiv:2505.18373."}