{"as_of":"2026-08-19T08:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4ef2038bb4f2ef9582a40d9c2bdcbbf8e953b947842af04d14680f18202a99d9","coverage":[{"denominator":19,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":19,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T21:06:40.995944Z","state":"measured"},{"denominator":23,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":23,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T23:46:08.533454Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T13:18:13.088871Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2511.16893","last_updated":"2026-07-05T02:34:16Z","snapshot_observed_at":"2026-08-18T13:50:34.534646Z","submitted_at":"2025-11-21T02:17:01Z","title":"Predicting the Emergence of Induction Heads in Language Model Pretraining","version":3},"cited_work":{"arxiv_id":"2511.16893","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2511.16893","snapshot_observed_at":"2026-07-07T03:18:10.668247Z","title":"Predicting the formation of induc- tion heads","venue":null,"work_id":"1bad2be4-002d-4ad5-9ef8-338d60045aec","year":2026},"citing_paper":{"arxiv_id":"2605.18789","last_updated":"2026-05-07T15:12:42Z","snapshot_observed_at":"2026-08-15T02:11:10.404170Z","submitted_at":"2026-05-07T15:12:42Z","title":"Features have life history. And we should care","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-20T23:31:30.350171Z"},"links":{"cited_paper":"/paper/2511.16893","citing_paper":"/paper/2605.18789"},"observation_digest":"sha256:483df8c2697e6d978d64e86b1ea44342efe74ad0180af2c0e69b1c20faf319f3","observation_id":"f1a0c231-b745-4c02-8f07-d4e2aa445f5e","resolution":{"observed_at":"2026-07-07T03:18:10.668247Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.16893","last_updated":"2026-07-05T02:34:16Z","snapshot_observed_at":"2026-08-18T13:50:34.534646Z","submitted_at":"2025-11-21T02:17:01Z","title":"Predicting the Emergence of Induction Heads in Language Model Pretraining","version":3},"cited_work":{"arxiv_id":"2511.16893","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2511.16893","snapshot_observed_at":"2026-07-07T03:18:10.668247Z","title":"Predicting the formation of induc- tion heads","venue":null,"work_id":"1bad2be4-002d-4ad5-9ef8-338d60045aec","year":2026},"citing_paper":{"arxiv_id":"2606.12058","last_updated":"2026-06-10T13:26:56Z","snapshot_observed_at":"2026-08-10T20:49:33.329278Z","submitted_at":"2026-06-10T13:26:56Z","title":"Phase Transitions in Attention: A Bayesian Theory of Copy Head Emergence","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-27T08:13:40.546738Z"},"links":{"cited_paper":"/paper/2511.16893","citing_paper":"/paper/2606.12058"},"observation_digest":"sha256:e51f54e0c54f8d71432e39ce8d0aa22964e7a12ffa7e706fbf1a4ea5d88a8bbd","observation_id":"a2332822-7258-4021-9131-eb4dd89409f9","resolution":{"observed_at":"2026-07-07T03:18:10.668247Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.16893","last_updated":"2026-07-05T02:34:16Z","snapshot_observed_at":"2026-08-18T13:50:34.534646Z","submitted_at":"2025-11-21T02:17:01Z","title":"Predicting the Emergence of Induction Heads in Language Model Pretraining","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.16893","snapshot_observed_at":"2026-08-01T10:34:44.033479Z","title":"Predicting the emergence of induction heads in language model pretraining.arXiv preprint arXiv:2511.16893, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27281","last_updated":"2026-07-29T13:46:52Z","snapshot_observed_at":"2026-08-19T04:48:08.408459Z","submitted_at":"2026-07-29T13:46:52Z","title":"The Kinetics of Training: A Driven-Nucleation Rate Law for Emergence, Plasticity Loss, and Circuit Control in Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-01T10:34:44.033479Z"},"links":{"cited_paper":"/paper/2511.16893","citing_paper":"/paper/2607.27281"},"observation_digest":"sha256:32ccd62b168d50d293c279be07ddb19c0b01084fa86060eb45c6d2231e9ad94f","observation_id":"09a139ba-4662-4a24-b488-ed055f61c83b","resolution":{"observed_at":"2026-08-01T10:34:44.033479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.16893","last_updated":"2026-07-05T02:34:16Z","snapshot_observed_at":"2026-08-18T13:50:34.534646Z","submitted_at":"2025-11-21T02:17:01Z","title":"Predicting the Emergence of Induction Heads in Language Model Pretraining","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.16893","snapshot_observed_at":"2026-08-11T23:46:08.533454Z","title":"Predicting the emergence of induction heads in language model pretraining.arXiv preprint arXiv:2511.16893v3, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-15T16:06:17.843420Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.533454Z"},"links":{"cited_paper":"/paper/2511.16893","citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:b493a31fc0927b2d6bf67d49875ac3cacc9792f811deb2a957eab41d38ff0d5e","observation_id":"a7e1a1d5-c899-4e67-8e42-2ff258354cfc","resolution":{"observed_at":"2026-08-11T23:46:08.533454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2511.16893/citation-record","integrity":"/paper/2511.16893/integrity","json":"/paper/2511.16893/citation-record.json","paper":"/paper/2511.16893"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:06:38.665206Z","title":"Language models grow less humanlike beyond phase transition","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.16893","last_updated":"2026-07-05T02:34:16Z","snapshot_observed_at":"2026-08-18T13:50:34.534646Z","submitted_at":"2025-11-21T02:17:01Z","title":"Predicting the Emergence of Induction Heads in Language Model Pretraining","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T21:06:38.665206Z"},"links":{"citing_paper":"/paper/2511.16893"},"observation_digest":"sha256:9a79f159b5e9472071afc5058fe91ad4b81b1e2d0f2d9b33c649ef519f0fa695","observation_id":"742b60f9-0d32-401c-bc77-9c58a9f97b5b","resolution":{"observed_at":"2026-08-03T21:06:38.665206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.01373","last_updated":"2023-05-31T17:54:07Z","snapshot_observed_at":"2026-08-14T19:44:03.879127Z","submitted_at":"2023-04-03T20:58:15Z","title":"Pythia: A Suite for Analyzing Large Language Models Across Training and Scaling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.01373","snapshot_observed_at":"2026-08-03T21:06:38.799079Z","title":"Pythia: A suite for analyzing large language models across training and scaling.arXiv preprint arXiv:2304.01373, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.16893","last_updated":"2026-07-05T02:34:16Z","snapshot_observed_at":"2026-08-18T13:50:34.534646Z","submitted_at":"2025-11-21T02:17:01Z","title":"Predicting the Emergence of Induction Heads in Language Model Pretraining","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T21:06:38.799079Z"},"links":{"cited_paper":"/paper/2304.01373","citing_paper":"/paper/2511.16893"},"observation_digest":"sha256:45e95d8c5563e94111c1327df608eaa4a4d13515dd34e8404811b564f2dcf472","observation_id":"077ff1f1-71c1-42bd-80a0-5134499e5ee1","resolution":{"observed_at":"2026-08-03T21:06:38.799079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:06:38.926882Z","title":"Chan, Adam Santoro, Andrew Kyle Lampinen, Jane X Wang, Aaditya K Singh, Pierre Harvey Richemond, James McClelland, and Felix Hill","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.16893","last_updated":"2026-07-05T02:34:16Z","snapshot_observed_at":"2026-08-18T13:50:34.534646Z","submitted_at":"2025-11-21T02:17:01Z","title":"Predicting the Emergence of Induction Heads in Language Model Pretraining","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T21:06:38.926882Z"},"links":{"citing_paper":"/paper/2511.16893"},"observation_digest":"sha256:5220af0a7f94599061beb8b731776cd452de2c1bd739b7a74f83c18fe024731c","observation_id":"cb03c670-dfa0-445a-a0b3-4fcc7f7561ec","resolution":{"observed_at":"2026-08-03T21:06:38.926882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:06:39.304051Z","title":"Sudden drops in the loss: Syntax acquisition, phase transitions, and simplicity bias in MLMs","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.16893","last_updated":"2026-07-05T02:34:16Z","snapshot_observed_at":"2026-08-18T13:50:34.534646Z","submitted_at":"2025-11-21T02:17:01Z","title":"Predicting the Emergence of Induction Heads in Language Model Pretraining","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T21:06:39.304051Z"},"links":{"citing_paper":"/paper/2511.16893"},"observation_digest":"sha256:b9e3cd9b1401c0d29756eb68dd5f97c01c54d5e5d8bafaabe49040f17d88bd0c","observation_id":"d7a8889e-09a4-4285-b5d1-6681c9cf6f66","resolution":{"observed_at":"2026-08-03T21:06:39.304051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:06:39.476817Z","title":"Unsupervised cross-lingual representation learning at scale","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2511.16893","last_updated":"2026-07-05T02:34:16Z","snapshot_observed_at":"2026-08-18T13:50:34.534646Z","submitted_at":"2025-11-21T02:17:01Z","title":"Predicting the Emergence of Induction Heads in Language Model Pretraining","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T21:06:39.476817Z"},"links":{"citing_paper":"/paper/2511.16893"},"observation_digest":"sha256:ed7b966ba098812e33a42db15c14439c91247f870c7cb38659bef161097c0e4c","observation_id":"d36ab45c-229f-4784-a48d-b87764f9fe34","resolution":{"observed_at":"2026-08-03T21:06:39.476817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:06:39.652329Z","title":"Edelman, eran malach, and Surbhi Goel","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.16893","last_updated":"2026-07-05T02:34:16Z","snapshot_observed_at":"2026-08-18T13:50:34.534646Z","submitted_at":"2025-11-21T02:17:01Z","title":"Predicting the Emergence of Induction Heads in Language Model Pretraining","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T21:06:39.652329Z"},"links":{"citing_paper":"/paper/2511.16893"},"observation_digest":"sha256:80fc818293f4a7165477ee42d4d4eff1d2557205d7c153afb7837bf43e01c346","observation_id":"434f61ae-7b15-4c63-9477-1623b654d1c3","resolution":{"observed_at":"2026-08-03T21:06:39.652329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:06:39.800405Z","title":"A mathematical framework for transformer circuits.Transformer Circuits Thread,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.16893","last_updated":"2026-07-05T02:34:16Z","snapshot_observed_at":"2026-08-18T13:50:34.534646Z","submitted_at":"2025-11-21T02:17:01Z","title":"Predicting the Emergence of Induction Heads in Language Model Pretraining","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T21:06:39.800405Z"},"links":{"citing_paper":"/paper/2511.16893"},"observation_digest":"sha256:ccfa18a2d46230aa965ece1781475bb8d1bcdf78c36d0aa9cc2d5c153d20416d","observation_id":"5c7837a1-d8ef-4a6c-8c74-dbc33489a621","resolution":{"observed_at":"2026-08-03T21:06:39.800405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-08-13T17:41:53.092611Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-03T21:06:40.071712Z","title":"Brown, Benjamin Chess, Rewon Child, Scott Gray, Alec Radford, Jeffrey Wu, and Dario Amodei","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2511.16893","last_updated":"2026-07-05T02:34:16Z","snapshot_observed_at":"2026-08-18T13:50:34.534646Z","submitted_at":"2025-11-21T02:17:01Z","title":"Predicting the Emergence of Induction Heads in Language Model Pretraining","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T21:06:40.071712Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2511.16893"},"observation_digest":"sha256:9523fe3fb1b76672785369dd7f5e08e7fa00e8614f021234cccdf15340e775b6","observation_id":"5d809221-863c-4128-9677-beffcf791b38","resolution":{"observed_at":"2026-08-03T21:06:40.071712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:06:40.261749Z","title":"Transformerlens","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.16893","last_updated":"2026-07-05T02:34:16Z","snapshot_observed_at":"2026-08-18T13:50:34.534646Z","submitted_at":"2025-11-21T02:17:01Z","title":"Predicting the Emergence of Induction Heads in Language Model Pretraining","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T21:06:40.261749Z"},"links":{"citing_paper":"/paper/2511.16893"},"observation_digest":"sha256:88ba2ea947eed10659f8d8d38dbc52c6683ed5f5fd1fa19a8a91981f5cdbfdd6","observation_id":"6ddb9f4e-97c2-4ea8-9f01-6fbb87ae338b","resolution":{"observed_at":"2026-08-03T21:06:40.261749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:06:40.405490Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.16893","last_updated":"2026-07-05T02:34:16Z","snapshot_observed_at":"2026-08-18T13:50:34.534646Z","submitted_at":"2025-11-21T02:17:01Z","title":"Predicting the Emergence of Induction Heads in Language Model Pretraining","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T21:06:40.405490Z"},"links":{"citing_paper":"/paper/2511.16893"},"observation_digest":"sha256:5e5fcf92f39c162bbb9c90bf2ee5f4ac8c49a51ffa4e29b6efef4b252e39ada9","observation_id":"bf041a6c-87b1-4541-8609-ba263f862b3f","resolution":{"observed_at":"2026-08-03T21:06:40.405490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:06:40.535784Z","title":"In-context learning and induction heads","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.16893","last_updated":"2026-07-05T02:34:16Z","snapshot_observed_at":"2026-08-18T13:50:34.534646Z","submitted_at":"2025-11-21T02:17:01Z","title":"Predicting the Emergence of Induction Heads in Language Model Pretraining","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T21:06:40.535784Z"},"links":{"citing_paper":"/paper/2511.16893"},"observation_digest":"sha256:2a8c798e18594acce7664863874e803e1fc0fce3e031fd503b2ba4515866d4e5","observation_id":"d2b524ca-5c34-4e68-b88a-3ea3d4c83bba","resolution":{"observed_at":"2026-08-03T21:06:40.535784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:06:40.639604Z","title":"Language models are unsupervised multitask learners.OpenAI blog, 1(8): 9, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2511.16893","last_updated":"2026-07-05T02:34:16Z","snapshot_observed_at":"2026-08-18T13:50:34.534646Z","submitted_at":"2025-11-21T02:17:01Z","title":"Predicting the Emergence of Induction Heads in Language Model Pretraining","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T21:06:40.639604Z"},"links":{"citing_paper":"/paper/2511.16893"},"observation_digest":"sha256:d3954c06e0bc0cec37187b7df04a8f758c90e41d43b7e00c091fac666d7944ba","observation_id":"706d1fba-5c3a-4000-aa67-e1a968a992bd","resolution":{"observed_at":"2026-08-03T21:06:40.639604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:06:40.710687Z","title":"CCNet: Extracting high quality monolingual datasets from web crawl data","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2511.16893","last_updated":"2026-07-05T02:34:16Z","snapshot_observed_at":"2026-08-18T13:50:34.534646Z","submitted_at":"2025-11-21T02:17:01Z","title":"Predicting the Emergence of Induction Heads in Language Model Pretraining","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T21:06:40.710687Z"},"links":{"citing_paper":"/paper/2511.16893"},"observation_digest":"sha256:2ebea702822827045a8595e8be9211f9d9eebc4d5219a9445a5c04877d939445","observation_id":"09685149-81a3-4df1-9871-f691f323a9ec","resolution":{"observed_at":"2026-08-03T21:06:40.710687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:06:40.759222Z","title":"An explanation of in-context learning as implicit bayesian inference","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.16893","last_updated":"2026-07-05T02:34:16Z","snapshot_observed_at":"2026-08-18T13:50:34.534646Z","submitted_at":"2025-11-21T02:17:01Z","title":"Predicting the Emergence of Induction Heads in Language Model Pretraining","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T21:06:40.759222Z"},"links":{"citing_paper":"/paper/2511.16893"},"observation_digest":"sha256:065a449733b20b36de5f5ad57e6a6d07fa2a5f41f569e4a684f99e244432a872","observation_id":"d809bcde-34d1-4bb7-b29e-f18189d11027","resolution":{"observed_at":"2026-08-03T21:06:40.759222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14010","last_updated":"2025-02-19T12:25:02Z","snapshot_observed_at":"2026-08-18T13:49:57.967289Z","submitted_at":"2025-02-19T12:25:02Z","title":"Which Attention Heads Matter for In-Context Learning?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14010","snapshot_observed_at":"2026-08-03T21:06:40.820193Z","title":"above random,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.16893","last_updated":"2026-07-05T02:34:16Z","snapshot_observed_at":"2026-08-18T13:50:34.534646Z","submitted_at":"2025-11-21T02:17:01Z","title":"Predicting the Emergence of Induction Heads in Language Model Pretraining","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T21:06:40.820193Z"},"links":{"cited_paper":"/paper/2502.14010","citing_paper":"/paper/2511.16893"},"observation_digest":"sha256:a76c2fb003f449425e89cb6a73b49250578d1224b7b898d6bc67679578cfd5cf","observation_id":"027fbc6e-dc89-4746-bcf1-e574d0b49cbf","resolution":{"observed_at":"2026-08-03T21:06:40.820193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:06:40.937637Z","title":",A⟩sequence, 2 of them are followed by B, hence 2 4 = 1","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.16893","last_updated":"2026-07-05T02:34:16Z","snapshot_observed_at":"2026-08-18T13:50:34.534646Z","submitted_at":"2025-11-21T02:17:01Z","title":"Predicting the Emergence of Induction Heads in Language Model Pretraining","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T21:06:40.937637Z"},"links":{"citing_paper":"/paper/2511.16893"},"observation_digest":"sha256:f82cfd71572d0bf87755b3460edaf0cdc1232ac08b2bf94bd500f491aca27d72","observation_id":"c956fe18-4edf-4f53-80be-cc79e0f0faaf","resolution":{"observed_at":"2026-08-03T21:06:40.937637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:06:40.995944Z","title":"frequency","venue":null,"work_id":null,"year":1988},"citing_paper":{"arxiv_id":"2511.16893","last_updated":"2026-07-05T02:34:16Z","snapshot_observed_at":"2026-08-18T13:50:34.534646Z","submitted_at":"2025-11-21T02:17:01Z","title":"Predicting the Emergence of Induction Heads in Language Model Pretraining","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T21:06:40.995944Z"},"links":{"citing_paper":"/paper/2511.16893"},"observation_digest":"sha256:5c90f369e19377cc225b54f5fd04e69ba5deffa694f487b29b5eabba06ebca71","observation_id":"c7b17b68-45c2-46ea-ba4c-9cdc244752e7","resolution":{"observed_at":"2026-08-03T21:06:40.995944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:06:39.934203Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2511.16893","last_updated":"2026-07-05T02:34:16Z","snapshot_observed_at":"2026-08-18T13:50:34.534646Z","submitted_at":"2025-11-21T02:17:01Z","title":"Predicting the Emergence of Induction Heads in Language Model Pretraining","version":3},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-03T21:06:39.934203Z"},"links":{"citing_paper":"/paper/2511.16893"},"observation_digest":"sha256:cbe5bc5da67c6a47ef403f3392bf96705ca399c8e4b1b9ce7ec0179fa7049f3b","observation_id":"9f305f92-1932-4056-b1a0-ad74f75db167","resolution":{"observed_at":"2026-08-03T21:06:39.934203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:06:39.092557Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.16893","last_updated":"2026-07-05T02:34:16Z","snapshot_observed_at":"2026-08-18T13:50:34.534646Z","submitted_at":"2025-11-21T02:17:01Z","title":"Predicting the Emergence of Induction Heads in Language Model Pretraining","version":3},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-03T21:06:39.092557Z"},"links":{"citing_paper":"/paper/2511.16893"},"observation_digest":"sha256:6b96766298548256a2d735bd916a26c274e151d2526143d41004989cda8f5b60","observation_id":"a0aae1b8-20ed-4512-baf6-cff7344d2e34","resolution":{"observed_at":"2026-08-03T21:06:39.092557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2511.16893","last_updated":"2026-07-05T02:34:16Z","latest_version":3,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-18T13:50:34.534646Z","submitted_at":"2025-11-21T02:17:01Z","title":"Predicting the Emergence of Induction Heads in Language Model Pretraining"},"reference_resolution":{"displayed":19,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":19,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":19},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 19 of 19 outbound references and 4 inbound Pith citation observations for arXiv:2511.16893."}