{"as_of":"2026-08-13T04:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7492962e1c066da7904822fdd05c731e4be1e4253a5227c116d8ce4e8a8a8be0","coverage":[{"denominator":97,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":97,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T23:46:08.884591Z","state":"measured"},{"denominator":97,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":97,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.09093/citation-record","integrity":"/paper/2608.09093/integrity","json":"/paper/2608.09093/citation-record.json","paper":"/paper/2608.09093"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:08.516340Z","title":"OLMo-core: src/scripts/official/OLMo3/","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T03:15:28.130856Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.516340Z"},"links":{"citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:585e22a28db1e858d27593332fca3730f37e2fe883f069209651b408b13c5590","observation_id":"7d80d665-7783-47b8-b398-985c485bc325","resolution":{"observed_at":"2026-08-11T23:46:08.516340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14316","last_updated":"2024-07-16T10:22:51Z","snapshot_observed_at":"2026-08-10T16:01:01.114216Z","submitted_at":"2023-09-25T17:37:20Z","title":"Physics of Language Models: Part 3.1, Knowledge Storage and Extraction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.14316","snapshot_observed_at":"2026-08-11T23:46:08.520788Z","title":"Physics of language models: Part 3.1, knowledge storage and extraction.arXiv preprint arXiv:2309.14316, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T03:15:28.130856Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.520788Z"},"links":{"cited_paper":"/paper/2309.14316","citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:7a0cecd5417b369d066737b6db1d5a6ab9816bdc03e1e013f63b4676a6433d5a","observation_id":"7b1702d0-a405-4401-b8c6-294d43e24ab5","resolution":{"observed_at":"2026-08-11T23:46:08.520788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:08.525122Z","title":"Altmann, Giampaolo Cristadoro, and Mirko Degli Esposti","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T03:15:28.130856Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.525122Z"},"links":{"citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:dd03f74c962dbf5fa0c29b569fb34f51a4a43848989bfa6988598d1d5dc24531","observation_id":"08c41e25-757f-40c0-b855-2fd6185ed4d1","resolution":{"observed_at":"2026-08-11T23:46:08.525122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:08.529259Z","title":"Álvarez-Lacalle, B","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T03:15:28.130856Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.529259Z"},"links":{"citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:31657a99c6a9557356d4bc6b290824bcdb06b39f5456f9677e4d6a12913fa63d","observation_id":"2ca7b3bd-3eec-4f70-879a-c680a63efbe1","resolution":{"observed_at":"2026-08-11T23:46:08.529259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.16893","last_updated":"2026-07-05T02:34:16Z","snapshot_observed_at":"2026-08-10T05:00:54.764769Z","submitted_at":"2025-11-21T02:17:01Z","title":"Predicting the Emergence of Induction Heads in Language Model Pretraining","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.16893","snapshot_observed_at":"2026-08-11T23:46:08.533454Z","title":"Predicting the emergence of induction heads in language model pretraining.arXiv preprint arXiv:2511.16893v3, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T03:15:28.130856Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.533454Z"},"links":{"cited_paper":"/paper/2511.16893","citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:b7e161501e70d1458f33a52201ec10ec1839e37a015557a01ffffcd971b655db","observation_id":"a7e1a1d5-c899-4e67-8e42-2ff258354cfc","resolution":{"observed_at":"2026-08-11T23:46:08.533454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.09869","last_updated":"2024-12-09T09:20:54Z","snapshot_observed_at":"2026-08-12T23:01:33.671101Z","submitted_at":"2024-08-19T10:20:06Z","title":"Docling Technical Report","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.09869","snapshot_observed_at":"2026-08-11T23:46:08.537942Z","title":"Docling technical report.arXiv preprint arXiv:2408.09869, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T03:15:28.130856Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.537942Z"},"links":{"cited_paper":"/paper/2408.09869","citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:01727355d1cfb11b08f1bab7207195f5d97e03e328df309461f0491508f0aa38","observation_id":"4b526753-8d16-4b72-9684-f05e771197f8","resolution":{"observed_at":"2026-08-11T23:46:08.537942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.11499","last_updated":"2026-06-09T22:44:47Z","snapshot_observed_at":"2026-08-08T18:05:48.844270Z","submitted_at":"2026-06-09T22:44:47Z","title":"Hubs or Fringes: Pretraining Data Selection via Web Graph Centrality","version":1},"cited_work":{"arxiv_id":"2606.11499","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.11499","snapshot_observed_at":"2026-08-11T23:46:09.984166Z","title":"Hubs or Fringes: Pretraining Data Selection via Web Graph Centrality","venue":"cs.CL","work_id":"846d0c43-1d1a-4a5a-857f-9ef84baf16c6","year":2026},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T03:15:28.130856Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.542506Z"},"links":{"cited_paper":"/paper/2606.11499","citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:dfd83b83c5f8ea3be011b61e79f05151b61df4c27eed169309e86326666b5d6e","observation_id":"3ee3c7b5-e28b-4441-98da-1e15113f6aae","resolution":{"observed_at":"2026-08-11T23:46:09.988195Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.13006","last_updated":"2026-04-27T17:56:40Z","snapshot_observed_at":"2026-07-06T23:01:05.634599Z","submitted_at":"2026-04-14T17:40:01Z","title":"One Token Away from Collapse: The Fragility of Instruction-Tuned Helpfulness","version":2},"cited_work":{"arxiv_id":"2604.13006","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.13006","snapshot_observed_at":"2026-08-11T23:46:09.967851Z","title":"One Token Away from Collapse: The Fragility of Instruction-Tuned Helpfulness","venue":"cs.CL","work_id":"9a12705f-07fc-4306-a299-7f6d1f9d5d9d","year":2026},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T03:15:28.130856Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.546573Z"},"links":{"cited_paper":"/paper/2604.13006","citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:88843a66081968e9783d00ecd0f9cf55f0603d57c2c415836585ded3182557f2","observation_id":"281a80ca-56a9-4770-bf0d-cf4a8498a064","resolution":{"observed_at":"2026-08-11T23:46:09.972459Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:08.550671Z","title":"trafilatura: trafilatura/xml.py","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T03:15:28.130856Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.550671Z"},"links":{"citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:756b603e887893f44d2d0db11435960c994da040611f57db02ee6c6dae6ff304","observation_id":"41bcf5ad-13c7-433a-a79e-24192c9b15cb","resolution":{"observed_at":"2026-08-11T23:46:08.550671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:08.554957Z","title":"so much depends / upon / a whitespace: Why whitespace matters for poets and LLMs","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T03:15:28.130856Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.554957Z"},"links":{"citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:9c49d888c9ca189ff0b3b53c562f68b912a9a5c3ce68e5520a4ed156d4145fe6","observation_id":"fe866f33-5d83-4152-a709-23cb068733a7","resolution":{"observed_at":"2026-08-11T23:46:08.554957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.07311","last_updated":"2022-01-13T23:45:24Z","snapshot_observed_at":"2026-08-09T08:23:52.344409Z","submitted_at":"2022-01-13T23:45:24Z","title":"Datasheet for the Pile","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.07311","snapshot_observed_at":"2026-08-11T23:46:08.558757Z","title":"Datasheet for the Pile.arXiv preprint arXiv:2201.07311, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T03:15:28.130856Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.558757Z"},"links":{"cited_paper":"/paper/2201.07311","citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:3b41860c767f1cfd334f875e7232aa3d36fa336afab211094488b88484ad3f8e","observation_id":"2f9d920d-da0f-464f-9bd6-bbb8cda7e9ab","resolution":{"observed_at":"2026-08-11T23:46:08.558757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:08.562683Z","title":"Document structure in long document transformers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T03:15:28.130856Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.562683Z"},"links":{"citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:77967b96e7412395ee90ddafc388c13ff45cf611db11f4ab8122fc9408d49e15","observation_id":"f461e1e9-fc02-44e2-8ec1-199119b99b6c","resolution":{"observed_at":"2026-08-11T23:46:08.562683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08300","last_updated":"2025-06-10T00:11:30Z","snapshot_observed_at":"2026-08-07T05:11:36.958628Z","submitted_at":"2025-06-10T00:11:30Z","title":"Institutional Books 1.0: A 242B token dataset from Harvard Library's collections, refined for accuracy and usability","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.08300","snapshot_observed_at":"2026-08-11T23:46:08.566283Z","title":"Institutional books 1.0: A 242B token dataset from Harvard Library’s collections, refined for accuracy and usability.arXiv preprint arXiv:2506.08300, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T03:15:28.130856Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.566283Z"},"links":{"cited_paper":"/paper/2506.08300","citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:b906cb8f1a9fece794b3b0ad79844391bb818835f917df3afbc83e9ef86f9a76","observation_id":"8de5518a-bc11-4239-b640-0938ff3c83a7","resolution":{"observed_at":"2026-08-11T23:46:08.566283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:08.570096Z","title":"The hyperfitting phenomenon: Sharpening and stabilizing LLMs for open-ended text generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T03:15:28.130856Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.570096Z"},"links":{"citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:a87631ff7fbb48abc46a49fed4b5a0861ac7636932ef63bbdc49e920a19ab772","observation_id":"43aa3385-dc1c-4f16-b758-417d27f747bb","resolution":{"observed_at":"2026-08-11T23:46:08.570096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:08.573675Z","title":"LADM: Long-context training data selection with attention-based dependency measurement for LLMs","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T03:15:28.130856Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.573675Z"},"links":{"citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:203b61e2c7b7a6e9fe6c1dcdae707300d5cbfb04ff2bf3c520590b6db475b020","observation_id":"156cc986-1daa-496c-8fe1-8c5cc669b1fc","resolution":{"observed_at":"2026-08-11T23:46:08.573675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.16246","last_updated":"2026-06-19T17:02:20Z","snapshot_observed_at":"2026-08-03T18:12:06.699075Z","submitted_at":"2026-06-15T05:48:57Z","title":"Demystifying Training-Time Augmentation for Data-Constrained Language Model Pretraining","version":2},"cited_work":{"arxiv_id":"2606.16246","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.16246","snapshot_observed_at":"2026-08-11T23:46:09.930199Z","title":"Demystifying Training-Time Augmentation for Data-Constrained Language Model Pretraining","venue":"cs.LG","work_id":"f624b4b4-a8f5-4db2-89ae-319e04006d81","year":2026},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T03:15:28.130856Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.577429Z"},"links":{"cited_paper":"/paper/2606.16246","citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:fdd45091bbc3414ada4dcce81c10e1dcbd27341d91db2385bc8af3a713e5e367","observation_id":"4d1abd8a-90fd-4fb2-a152-b747d8e0faf0","resolution":{"observed_at":"2026-08-11T23:46:09.934456Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:08.581164Z","title":"Data mixing for large language models pretraining: A survey and outlook.Data Intelligence, 8, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T03:15:28.130856Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.581164Z"},"links":{"citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:3314a46af86f902c8bab98ea2c0ea5f7c76d0e744b998909f5e0518e1307edc0","observation_id":"d160b479-63d7-48c9-9ddb-34bcb237ebf9","resolution":{"observed_at":"2026-08-11T23:46:08.581164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10975","last_updated":"2025-08-19T17:56:36Z","snapshot_observed_at":"2026-08-11T22:11:30.788526Z","submitted_at":"2025-08-14T17:55:47Z","title":"BeyondWeb: Lessons from Scaling Synthetic Data for Trillion-scale Pretraining","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10975","snapshot_observed_at":"2026-08-11T23:46:08.585204Z","title":"BeyondWeb: Lessons from scaling synthetic data for trillion-scale pretraining","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T03:15:28.130856Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.585204Z"},"links":{"cited_paper":"/paper/2508.10975","citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:e5f2d62947d06d9c459111a2dd004955d4efa510fa53b3ed0ed009bc20f18e74","observation_id":"1e9d02fe-702a-4a6d-9bd9-36f582b86f14","resolution":{"observed_at":"2026-08-11T23:46:08.585204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-11T01:48:59.557045Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-11T23:46:08.589022Z","title":"DeepSeek-V3 technical report.arXiv preprint arXiv:2412.19437, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T03:15:28.130856Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.589022Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:45562944e184038129ac11c39a9b2b9d517ed9325b3f1a4d3179747c7d0eb59e","observation_id":"0027d995-38f6-4114-be5c-b034cb9789c5","resolution":{"observed_at":"2026-08-11T23:46:08.589022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:08.592974Z","title":"Beyond length: Quantifying long-range information for long-context LLM pretraining data","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T03:15:28.130856Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.592974Z"},"links":{"citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:8f3ed7557eddc115c4fbec5cffa8a17cd002c1613971f8d76f62ded6a0c60a5a","observation_id":"d17b519e-7057-4453-a0ee-27e1357acfee","resolution":{"observed_at":"2026-08-11T23:46:08.592974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:08.596787Z","title":"Documenting large webtext corpora: A case study on the Colossal Clean Crawled Corpus","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T03:15:28.130856Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.596787Z"},"links":{"citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:8425df46db8c5de79ab1d6cade41f86f659bf1a151b529a8503bb7f257ae492b","observation_id":"dc48d7d6-ec33-42c2-a612-f06bfed0e0b9","resolution":{"observed_at":"2026-08-11T23:46:08.596787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:08.600442Z","title":"Smith, and Jesse Dodge","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T03:15:28.130856Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.600442Z"},"links":{"citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:e6f53aa3bd1da179fb1af89c99db4c6c4a256d0a64188de79d051a15d989eb09","observation_id":"60dba6c3-a6b3-4fb0-b134-fa4678e33448","resolution":{"observed_at":"2026-08-11T23:46:08.600442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.15393","last_updated":"2024-02-05T16:33:05Z","snapshot_observed_at":"2026-08-09T06:27:27.325450Z","submitted_at":"2023-10-23T22:51:58Z","title":"DoGE: Domain Reweighting with Generalization Estimation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.15393","snapshot_observed_at":"2026-08-11T23:46:08.603929Z","title":"DoGE:Domainreweightingwithgeneralization estimation.arXiv preprint arXiv:2310.15393, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T03:15:28.130856Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.603929Z"},"links":{"cited_paper":"/paper/2310.15393","citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:1cccf55515576a5e493f34d76ed0a15a306eafc39d2868a43df14d59b598e618","observation_id":"2f086de1-d48e-434e-9b24-b4b1eb57ce2e","resolution":{"observed_at":"2026-08-11T23:46:08.603929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.27006","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:09.880313Z","title":null,"venue":null,"work_id":"ab44df4f-3e26-4c62-abdc-c4cea340a016","year":2026},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T03:15:28.130856Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.607893Z"},"links":{"citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:412a99429adab3d94d3721ba7bf58ad226a2e34a0842a9d697b0efcfb2ca8407","observation_id":"a3e7197c-7b1b-46bc-a46d-1c4d09f3ff21","resolution":{"observed_at":"2026-08-11T23:46:09.886029Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:08.611346Z","title":"NExtLong: Toward effective long-context training without long documents","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T03:15:28.130856Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.611346Z"},"links":{"citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:02dcae0d996428ebced04fcb56b77269c2dac2e4f73d7f2230d6c9e44ab159f5","observation_id":"3e9aba69-4f7d-463e-95a0-eb3bf5b0e4bf","resolution":{"observed_at":"2026-08-11T23:46:08.611346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00027","last_updated":"2020-12-31T19:00:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-12-31T19:00:10Z","title":"The Pile: An 800GB Dataset of Diverse Text for Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00027","snapshot_observed_at":"2026-08-11T23:46:08.615026Z","title":"The Pile: An 800GB dataset of diverse text for language modeling.arXiv preprint arXiv:2101.00027, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T03:15:28.130856Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.615026Z"},"links":{"cited_paper":"/paper/2101.00027","citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:567b998dd522ee37fe93b15bfa5af64fec5007fcb3645df506687209dc95b902","observation_id":"780f5689-7f57-44f5-ba34-548b09c5bf5b","resolution":{"observed_at":"2026-08-11T23:46:08.615026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:08.618858Z","title":"Wichmann","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T03:15:28.130856Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.618858Z"},"links":{"citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:c56e075d9017ed03f8e34a2dd61d9b38bace876bd8b5bf4d181886cd7e045f12","observation_id":"752ff431-3dd6-4c6f-a132-661c6eab5275","resolution":{"observed_at":"2026-08-11T23:46:08.618858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:08.622436Z","title":"Hermann, Hossein Mobahi, Thomas Fel, and Michael C","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T03:15:28.130856Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.622436Z"},"links":{"citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:1e96b1d3af6317ac504db2c2f14a9e019bd88ee3aecb5b62ff7d186766605d27","observation_id":"fbbda0e3-3cdd-4758-98c2-c72dd6e775a1","resolution":{"observed_at":"2026-08-11T23:46:08.622436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:08.626015Z","title":"The curious case of neural text degeneration","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T03:15:28.130856Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.626015Z"},"links":{"citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:3dac09774f284aea80ace49d32e8ec9457804f83dd276ff0cc90956b8c1daea8","observation_id":"b64d7edb-c0ac-44e5-85ea-1cc7665e7609","resolution":{"observed_at":"2026-08-11T23:46:08.626015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:08.629298Z","title":"FinePDFs dataset card.https://huggingface.co/datasets/HuggingFaceFW/ finepdfs, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T03:15:28.130856Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.629298Z"},"links":{"citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:7c3b6a072d158d396dceb7f06721bdab3e59dba4cadbc3f79d893578e9105b76","observation_id":"aa679acf-0007-439e-b231-fad4420d4a08","resolution":{"observed_at":"2026-08-11T23:46:08.629298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:08.632840Z","title":"SmolLM3: smol, multilingual, long-context reasoner.https://huggingface","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T03:15:28.130856Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.632840Z"},"links":{"citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:5349aeec077a647c3286e4c59022e3ec7d9b1340626cfd47ce20b054b1e2c683","observation_id":"3c955657-891e-4f49-84d4-8db2aa5e1140","resolution":{"observed_at":"2026-08-11T23:46:08.632840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:08.636370Z","title":"datatrove: src/datatrove/pipeline/extractors/trafilatura.py","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T03:15:28.130856Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.636370Z"},"links":{"citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:8c53a63ee048a205f9f6b8f5215c6bf97e058e16878f1311f23576aa9716163a","observation_id":"862abf38-3a6a-40c5-93b0-a12c7dca6b4e","resolution":{"observed_at":"2026-08-11T23:46:08.636370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.12414","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:09.791863Z","title":"propella-1: Multi- property document annotation for LLM data curation at scale.arXiv preprint arXiv:2602.12414,","venue":null,"work_id":"e801ee49-3a69-4c5b-adcd-a70c99b1a988","year":null},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T03:15:28.130856Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.640149Z"},"links":{"citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:9f4c42e75474b3037e4b7e1c2a4adace9f7d4d3fc7b6c655c381ac540f43ce5d","observation_id":"26f2f108-79da-4d13-9933-880d8f48d324","resolution":{"observed_at":"2026-08-11T23:46:09.797822Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:10.368685Z","title":"ISO 32000-1:2008 — document management: Portable document format — part 1: PDF 1.7.https://www.iso.org/standard/51502.html, 2008","venue":null,"work_id":"c6040e7f-4b67-4aac-ad8e-99d4ff5a13c1","year":2008},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T03:15:28.130856Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.648169Z"},"links":{"citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:edb3619c1ca5d01b167d197fa59e03d29bc7772c3d1688cd2c24abb23fd40567","observation_id":"8fd8c20a-b9e8-4d63-8eb5-69148ae621eb","resolution":{"observed_at":"2026-08-11T23:46:10.372740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:08.651907Z","title":"EntropyLong: Effective long-context training via predictive uncertainty.arXiv preprint arXiv:2510.02330, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T03:15:28.130856Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.651907Z"},"links":{"citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:c1cd7d823c4eb06926a17e4ba8a193539a4733d404a18f3acbead5bc0d8d0cdc","observation_id":"20791109-1ad6-4676-8a88-0b2e79946650","resolution":{"observed_at":"2026-08-11T23:46:08.651907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.19468","last_updated":"2026-06-17T18:03:34Z","snapshot_observed_at":"2026-08-12T18:27:38.677169Z","submitted_at":"2026-06-17T18:03:34Z","title":"Characterizing Narrative Content in Web-scale LLM Pretraining Data","version":1},"cited_work":{"arxiv_id":"2606.19468","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.19468","snapshot_observed_at":"2026-08-11T23:46:09.646354Z","title":"Characterizing Narrative Content in Web-scale LLM Pretraining Data","venue":"cs.CL","work_id":"2960f08a-aa29-47af-bb6b-19b9769e1607","year":2026},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T03:15:28.130856Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.655949Z"},"links":{"cited_paper":"/paper/2606.19468","citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:ce2754699367f509dd6a24e77597de3bc4e84bafc53219143a7a82fe005f5864","observation_id":"8d9332d1-f141-423a-b1ca-9e2f33cbea40","resolution":{"observed_at":"2026-08-11T23:46:09.650579Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05209","last_updated":"2025-06-05T16:21:30Z","snapshot_observed_at":"2026-08-09T07:25:20.673180Z","submitted_at":"2025-06-05T16:21:30Z","title":"The Common Pile v0.1: An 8TB Dataset of Public Domain and Openly Licensed Text","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05209","snapshot_observed_at":"2026-08-11T23:46:08.659888Z","title":"Feder Cooper, Aviya Skowron, et al","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T03:15:28.130856Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.659888Z"},"links":{"cited_paper":"/paper/2506.05209","citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:0efd2470f84e21c329ca08e56c56f042126509c4843a9069a5f08921a9625b37","observation_id":"b3db8665-93de-423c-ab03-44d3c2ed960e","resolution":{"observed_at":"2026-08-11T23:46:08.659888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.15096","last_updated":"2025-08-20T22:16:57Z","snapshot_observed_at":"2026-08-05T18:08:02.752427Z","submitted_at":"2025-08-20T22:16:57Z","title":"Nemotron-CC-Math: A 133 Billion-Token-Scale High Quality Math Pretraining Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.15096","snapshot_observed_at":"2026-08-11T23:46:08.663478Z","title":"Nemotron-CC-Math: A 133 billion-token-scale high quality math pretraining dataset.arXiv preprint arXiv:2508.15096, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T03:15:28.130856Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.663478Z"},"links":{"cited_paper":"/paper/2508.15096","citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:b27561a0155f2e16817d9a621bce2b05e3d63083f3748032cff620cdfa9e0866","observation_id":"8770db68-bc35-41c0-a8bd-1816e6f2bbc5","resolution":{"observed_at":"2026-08-11T23:46:08.663478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:10.357430Z","title":"Is a document educational or just Wikipedia- style? pitfalls of classifier-based quality filtering","venue":null,"work_id":"9cad92f8-f1e3-46bb-8976-62090f6455db","year":2026},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T03:15:28.130856Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.667449Z"},"links":{"citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:55e07b00c352f4313a18d363bcf380d3e886213402287853ba7d5bf29cdbbe5c","observation_id":"063ebcf7-a380-4951-96a6-57115306b83a","resolution":{"observed_at":"2026-08-11T23:46:10.361337Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:10.345830Z","title":"Quality at a glance: An audit of web-crawled multilingual datasets.Transactions of the Association for Computational Linguistics, 10:50–72, 2022","venue":null,"work_id":"e699aff7-a2cb-4887-b3f1-4f8b0b071d57","year":2022},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T03:15:28.130856Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.670936Z"},"links":{"citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:aa411825c76cb3510da3c02ebde022b9478fb3e4b3ba60e069974eaf1e87db78","observation_id":"0898c310-284c-4ae5-a459-5fe06675fb02","resolution":{"observed_at":"2026-08-11T23:46:10.349832Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.03616","last_updated":"2026-04-04T07:16:28Z","snapshot_observed_at":"2026-08-06T04:43:40.860475Z","submitted_at":"2026-04-04T07:16:28Z","title":"The Format Tax","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.03616","snapshot_observed_at":"2026-08-11T23:46:08.674823Z","title":"The format tax.arXiv preprint arXiv:2604.03616, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T03:15:28.130856Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.674823Z"},"links":{"cited_paper":"/paper/2604.03616","citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:2c3a869fa368c86cc770010834e83d960d246671d185c59fb836a4c236a4dbad","observation_id":"f27ed3ec-bb4c-46b4-ae4d-2a9b886c6118","resolution":{"observed_at":"2026-08-11T23:46:08.674823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:10.334990Z","title":"DataComp-LM: In search of the next generation of training sets for language models","venue":null,"work_id":"d7fb10c7-b230-4430-9ae4-2e9cfeb9db00","year":2024},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T03:15:28.130856Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.678804Z"},"links":{"citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:aba2b22458c93a3e94e79c7c33533e4f6f6012ec3bfe73b5fe4035ca7963ac69","observation_id":"04a49aa9-d9a4-4fad-9e93-22da0bd35bbf","resolution":{"observed_at":"2026-08-11T23:46:10.338832Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:10.324475Z","title":null,"venue":null,"work_id":"8abbaabe-6391-4127-9955-0ddb63dded93","year":null},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T03:15:28.130856Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.682276Z"},"links":{"citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:85e2e56f0b08a1f1458c459faf516737784233838406555793a133e75219e9ff","observation_id":"aa88155a-04b1-45bd-afa0-d5877de7cee9","resolution":{"observed_at":"2026-08-11T23:46:10.328421Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.27878","last_updated":"2026-05-27T02:55:34Z","snapshot_observed_at":"2026-08-12T22:04:47.149824Z","submitted_at":"2026-05-27T02:55:34Z","title":"Narrative Flattening: How Post-Training Compresses Thematic, Affective, and Stylistic Variation in LLM Fiction","version":1},"cited_work":{"arxiv_id":"2605.27878","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.27878","snapshot_observed_at":"2026-08-11T23:46:09.600967Z","title":"Narrative Flattening: How Post-Training Compresses Thematic, Affective, and Stylistic Variation in LLM Fiction","venue":"cs.CL","work_id":"62e3deb6-ba5e-4547-9d49-8198063c63c6","year":2026},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T03:15:28.130856Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.689681Z"},"links":{"cited_paper":"/paper/2605.27878","citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:3644cedd44e11e945636d9d749834066c981a98ba4dc9456a849afcf83b240a1","observation_id":"6aa3bdc4-83d8-4685-9b83-2bf562688710","resolution":{"observed_at":"2026-08-11T23:46:09.604854Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:10.313376Z","title":"URLhttps://aclanthology.org/2026","venue":null,"work_id":"e6165d1f-73a3-4ee5-bbbe-5afabc823874","year":2026},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T03:15:28.130856Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.685954Z"},"links":{"citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:48036e03f1c21a3d07ea48445680c5393e557395524f3aacf3a6d9ad686d28a1","observation_id":"401910f7-8ab2-4722-a830-9af0d7ee73e4","resolution":{"observed_at":"2026-08-11T23:46:10.317293Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.11643","last_updated":"2026-06-10T04:07:41Z","snapshot_observed_at":"2026-08-08T06:54:54.922502Z","submitted_at":"2026-06-10T04:07:41Z","title":"Improving Cross-Format Robustness in Language Models with Multi-Format Training","version":1},"cited_work":{"arxiv_id":"2606.11643","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.11643","snapshot_observed_at":"2026-08-11T23:46:09.583748Z","title":"Improving Cross-Format Robustness in Language Models with Multi-Format Training","venue":"cs.CL","work_id":"515edace-2b0a-4f3f-936b-a5e40a8e3488","year":2026},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T03:15:28.130856Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.697003Z"},"links":{"cited_paper":"/paper/2606.11643","citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:cecca84eafb92055b8a2b0081414087617df9490961c19881c8fa30866f3b9a0","observation_id":"961851e4-9ba4-43ca-8d08-4eca71cb8af8","resolution":{"observed_at":"2026-08-11T23:46:09.589660Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:10.303297Z","title":"Lin and Max Tegmark","venue":null,"work_id":"4d28feb0-4892-4a6e-8284-eb8c7e924788","year":2017},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T03:15:28.130856Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.693474Z"},"links":{"citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:c7d1943a14c2181e32a46d9581bb50c5b037cb4d6212e8884e8fe7adc220ed98","observation_id":"25f795c0-df9c-40f4-9f66-2c55d3361661","resolution":{"observed_at":"2026-08-11T23:46:10.306962Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:10.291830Z","title":"RegMix: Data mixture as regression for language model pre-training","venue":null,"work_id":"17f4ff3c-9f66-4fa4-84ca-7b98efc6a1e1","year":2025},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T03:15:28.130856Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.704493Z"},"links":{"citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:b0f3b10fec2e622592753a31d8f6e2f06341c2dbd490b7cab9dfedbd9b140f09","observation_id":"7d56fd29-a374-40ca-90a0-4d17fc40d3bb","resolution":{"observed_at":"2026-08-11T23:46:10.295866Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:08.700743Z","title":"Dripper: Token-efficient main HTML extraction with a lightweight LM.arXiv preprint arXiv:2511.23119, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T03:15:28.130856Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.700743Z"},"links":{"citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:6e0f0469c87834567cb3b547960b183efbae70f65eda8bd6eb0f6aba676d7268","observation_id":"870ff3b3-931c-4fa5-a01d-ef7c61816860","resolution":{"observed_at":"2026-08-11T23:46:08.700743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-10T16:40:37.411115Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-11T23:46:08.712036Z","title":"The Llama 3 herd of models.arXiv preprint arXiv:2407.21783, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T03:15:28.130856Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.712036Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:09d82d74b3e8a09b68e4b36843f4fc852abb3f42ae074aa4a034e8b26d32a07e","observation_id":"3ad61780-a039-46e8-8f0e-eb7cfe61e40d","resolution":{"observed_at":"2026-08-11T23:46:08.712036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.24077","last_updated":"2026-06-23T02:42:33Z","snapshot_observed_at":"2026-08-03T17:16:10.837184Z","submitted_at":"2026-06-23T02:42:33Z","title":"Sentence-Level Contextual Entrainment in Large Language Models","version":1},"cited_work":{"arxiv_id":"2606.24077","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.24077","snapshot_observed_at":"2026-08-11T23:46:09.503188Z","title":"Sentence-Level Contextual Entrainment in Large Language Models","venue":"cs.CL","work_id":"2920eaed-bc3e-4720-a634-9470ef98b0a6","year":2026},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T03:15:28.130856Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.708161Z"},"links":{"cited_paper":"/paper/2606.24077","citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:5d889d58091973d973f7ff61fefd7d58462885f7a769f177ea5251f51cc56aba","observation_id":"caddb278-c690-4090-852b-6567f647e123","resolution":{"observed_at":"2026-08-11T23:46:09.507694Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.16397","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:09.475810Z","title":"AICC: Parse HTML finer, make models better — a 7.3T AI-ready corpus built by a model-based HTML parser.arXiv preprint arXiv:2511.16397, 2025","venue":null,"work_id":"7561199a-5dac-48c5-bd07-2a1345104202","year":2025},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T03:15:28.130856Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.719503Z"},"links":{"citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:494a717db68a9636ec6eef8c89cf55075dc99574433b6ffef95ba9f762ebf83f","observation_id":"b5137b5c-cf5d-47a5-84ea-9e466309a633","resolution":{"observed_at":"2026-08-11T23:46:09.481795Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:10.280968Z","title":"Klein, and Jesse Dodge","venue":null,"work_id":"17b50deb-0dfb-4563-85d5-6b2bcad72659","year":2024},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T03:15:28.130856Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.715836Z"},"links":{"citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:365e907d36c1f48d8ad27c5eb118ce51c0b7d8c53f4acab3de7001d65db4f017","observation_id":"93ae5958-d8be-46eb-85f4-3c175b4b06f0","resolution":{"observed_at":"2026-08-11T23:46:10.284672Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:10.269163Z","title":"Measuring fingerprints of web-filtered text datasets and fingerprint propagation through training","venue":null,"work_id":"84e8f506-1b9d-41ab-9f21-601b0ed5c925","year":2025},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T03:15:28.130856Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.726933Z"},"links":{"citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:4a80d0633ea7807cfbbdaf5616b49799ae15c4fef5887698cd057b4f75b613a6","observation_id":"10e8715e-bef4-4679-b9da-9eb126cf768c","resolution":{"observed_at":"2026-08-11T23:46:10.273034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16380","last_updated":"2024-01-29T18:19:08Z","snapshot_observed_at":"2026-08-10T15:59:45.300276Z","submitted_at":"2024-01-29T18:19:08Z","title":"Rephrasing the Web: A Recipe for Compute and Data-Efficient Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.16380","snapshot_observed_at":"2026-08-11T23:46:08.722972Z","title":"Rephrasing the web: A recipe for compute and data-efficient language modeling.arXiv preprint arXiv:2401.16380, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T03:15:28.130856Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.722972Z"},"links":{"cited_paper":"/paper/2401.16380","citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:19172c311b570ed66c4d5c33f32520da21ca5ea14ff98853a840a29eb62eeabf","observation_id":"444cfb4f-cdf9-472d-976a-a057fb97ee46","resolution":{"observed_at":"2026-08-11T23:46:08.722972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:10.245356Z","title":"Register always matters: Analysis of LLM pretraining data through the lens of language variation","venue":null,"work_id":"aedcc807-9d06-424f-95cd-c52fcec17ec0","year":2025},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T03:15:28.130856Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.734114Z"},"links":{"citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:34d95ce62b138edb4d2aea6b263a5b29fcd2872f6b4130da11062447002240c5","observation_id":"aa540b93-f654-4ab3-84f3-d1e757d5e802","resolution":{"observed_at":"2026-08-11T23:46:10.249473Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:10.257032Z","title":"Autocorrelations decay in texts and applicability limits of language models","venue":null,"work_id":"469235ab-6009-4390-b229-ca7fe6cf7ba6","year":2023},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T03:15:28.130856Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.730477Z"},"links":{"citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:3104c247d8980c05bdcd147df9b7cd73e9cadb3f489643f597f8d63df3de236c","observation_id":"97697682-5627-4c5a-a214-f2ee8e11b7c1","resolution":{"observed_at":"2026-08-11T23:46:10.261287Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2608.05141","last_updated":"2026-08-05T17:58:15Z","snapshot_observed_at":"2026-08-11T07:48:33.858916Z","submitted_at":"2026-08-05T17:58:15Z","title":"OctoLong: Mid-Training On Cross-Repository Code Contexts Enhances Long-Context Modeling","version":1},"cited_work":{"arxiv_id":"2608.05141","doi":null,"metadata_source":"pith","pith_arxiv_id":"2608.05141","snapshot_observed_at":"2026-08-11T23:46:09.377203Z","title":"OctoLong: Mid-Training On Cross-Repository Code Contexts Enhances Long-Context Modeling","venue":"cs.AI","work_id":"3034b877-77cd-4763-a60e-e650a7d6f3d7","year":2026},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T03:15:28.130856Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.741761Z"},"links":{"cited_paper":"/paper/2608.05141","citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:89375ed93798c56c4c5ccfbbbed227a152da99a01bc77170eaf11debd492fc14","observation_id":"b557be46-2c86-42f9-b7f5-81062df62b81","resolution":{"observed_at":"2026-08-11T23:46:09.381154Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:10.232616Z","title":"How can we synthesize high-quality pretraining data? a systematic study of prompt design, generator model, and source data","venue":null,"work_id":"ced651a5-52f0-4b7c-89ee-59ec99a88c35","year":2026},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T03:15:28.130856Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.738014Z"},"links":{"citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:035871d1e47dcc34ef466b8f5464d37e785acb112655778e310bd889c05b279f","observation_id":"51c0e49c-0dc6-42b7-bf33-b9b0d4c9e571","resolution":{"observed_at":"2026-08-11T23:46:10.237160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:10.207886Z","title":"Chapter captor: Text segmentation in novels","venue":null,"work_id":"0258773a-c843-4758-b9dc-a3272537eefd","year":2020},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T03:15:28.130856Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.749302Z"},"links":{"citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:a5ca7ad5f9fa948913a8cc375fd4dfba2baa868aff32d7ef0af3f1f13603f350","observation_id":"c942c904-4efd-4d69-986e-b685988a64f1","resolution":{"observed_at":"2026-08-11T23:46:10.212033Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:10.220327Z","title":"The FineWeb datasets: Decanting the web for the finest text data at scale","venue":null,"work_id":"2163d7bb-182c-4f78-9362-0c4542905747","year":2024},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T03:15:28.130856Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.745705Z"},"links":{"citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:6fb992f82b4be9fea2b524ab08e0b80addf4dae938a153f9acbe071431c22c20","observation_id":"f850bd65-f37e-43a8-aa69-76b26ee8073d","resolution":{"observed_at":"2026-08-11T23:46:10.224614Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:10.196078Z","title":"epub2txt-all (the Books3 converter)","venue":null,"work_id":"33e77d4b-0f20-462c-8c7e-1d829a4aae47","year":null},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T03:15:28.130856Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.756470Z"},"links":{"citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:a25c259515267137c36380a5a18c77014c6da70fbfa738282018439b4dc0d394","observation_id":"5621d9f2-4963-4970-9a38-b58d6e7f334c","resolution":{"observed_at":"2026-08-11T23:46:10.199905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:08.752778Z","title":"olmOCR: Unlocking trillions of tokens in PDFs with vision language models.arXiv preprint arXiv:2502.18443, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T03:15:28.130856Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.752778Z"},"links":{"citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:732c05de941c25f54a51553cfec6682ba6498c75bd425fa6ad4209f64b97e4d3","observation_id":"4d9838a3-5ba8-4b88-9e4c-f7158e283ada","resolution":{"observed_at":"2026-08-11T23:46:08.752778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-08-10T02:15:37.272323Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.05507","snapshot_observed_at":"2026-08-11T23:46:08.767917Z","title":"Rae, Anna Potapenko, Siddhant M","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T03:15:28.130856Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.767917Z"},"links":{"cited_paper":"/paper/1911.05507","citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:1bc2254b6d7e21497a0c98725c4bc2fef5c811662a18ab2fcd554a913dde110a","observation_id":"446a9c39-3345-49e4-9aef-f56c30b97526","resolution":{"observed_at":"2026-08-11T23:46:08.767917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:08.772122Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T03:15:28.130856Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.772122Z"},"links":{"citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:7192b4ce58016ce616930ee4bb24f4e58241cb8c365adf81d88a43eed3e76dce","observation_id":"a7ceff82-8002-4e0a-be0d-3efb1465cc9e","resolution":{"observed_at":"2026-08-11T23:46:08.772122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-11T23:46:08.764228Z","title":"Qwen3 technical report.arXiv preprint arXiv:2505.09388, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T03:15:28.130856Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.764228Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:b925bcc6739363382178601271bed5dec6a0972977c5148897fb9d0bcbe40e03","observation_id":"a0bb3eb7-1ceb-47b6-bf73-1ed42815cf9c","resolution":{"observed_at":"2026-08-11T23:46:08.764228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.15968","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:09.270562Z","title":"From reflection to repair: A scoping review of dataset documentation tools.arXiv preprint arXiv:2602.15968, 2026","venue":null,"work_id":"7d56a1b1-2678-4e6c-8251-e7b0ed24eabe","year":2026},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T03:15:28.130856Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.779814Z"},"links":{"citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:01fee3c1b98b50cb8291445429eb955d75d3595f76a311ca57984569e775c91c","observation_id":"36d60be1-2d4a-48ba-8dda-7d2d8d797a99","resolution":{"observed_at":"2026-08-11T23:46:09.276678Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.07506","last_updated":"2019-12-16T17:12:00Z","snapshot_observed_at":"2026-08-03T15:37:40.504515Z","submitted_at":"2019-12-16T17:12:00Z","title":"Scale-dependent Relationships in Natural Language","version":1},"cited_work":{"arxiv_id":"1912.07506","doi":null,"metadata_source":"pith","pith_arxiv_id":"1912.07506","snapshot_observed_at":"2026-08-11T23:46:09.121921Z","title":"Scale-dependent Relationships in Natural Language","venue":"cs.CL","work_id":"60e6a407-1c2b-46c3-aeff-1db22760eee3","year":2019},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T03:15:28.130856Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.783358Z"},"links":{"cited_paper":"/paper/1912.07506","citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:74839f036cb7fd79c7b4a8a7de9b66cc9079f4ecb10cc0e124f0385bfa5963c9","observation_id":"750a02df-cc2a-49d0-a0b3-b44af8141697","resolution":{"observed_at":"2026-08-11T23:46:09.126130Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:10.167048Z","title":"RolmOCR model card.https://huggingface.co/reducto/RolmOCR, 2025","venue":null,"work_id":"01df278a-e4f9-43ec-9a36-1a517b4c7fa2","year":2025},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T03:15:28.130856Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.775948Z"},"links":{"citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:ac6c0c2ad53aa1377a0325a9561abb5e34d11814822ee66a5707d35b6a4e0644","observation_id":"b128d4cb-385d-4b47-b6b6-327a3051d027","resolution":{"observed_at":"2026-08-11T23:46:10.171029Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:10.156415Z","title":"Dolma: an open corpus of three trillion tokens for language model pretraining research","venue":null,"work_id":"44003043-0810-43af-92bc-54559da93fcc","year":2024},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T03:15:28.130856Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.791038Z"},"links":{"citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:45506c675ed3c7930badbe85d6fd8b411bbfdf677b2a2e1db41bc47a3d17f458","observation_id":"a1587bca-a466-47c0-b32e-464756d736b5","resolution":{"observed_at":"2026-08-11T23:46:10.160064Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:10.144987Z","title":"Nemotron-CC: Transforming Common Crawl into a refined long-horizon pretraining dataset","venue":null,"work_id":"a8b6de35-9e14-460c-a7e2-c85bdaa87347","year":2025},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T03:15:28.130856Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.794756Z"},"links":{"citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:b62cc78db6627b8959908286fb3c2cf02025a7b2d69ae3d054e4d0da37d8b0a8","observation_id":"29167a1b-8011-4c3f-900d-5dc057727d6c","resolution":{"observed_at":"2026-08-11T23:46:10.149510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.04271","last_updated":"2019-05-10T17:21:21Z","snapshot_observed_at":"2026-08-07T07:10:05.141697Z","submitted_at":"2019-05-10T17:21:21Z","title":"Mutual Information Scaling and Expressive Power of Sequence Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.04271","snapshot_observed_at":"2026-08-11T23:46:08.787163Z","title":"Mutual information scaling and expressive power of sequence models.arXiv preprint arXiv:1905.04271, 2019","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T03:15:28.130856Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.787163Z"},"links":{"cited_paper":"/paper/1905.04271","citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:944e8aa8365fa9655b8eebaca7fbafce174be8844b5d09eef1d1bf413dbb1f4d","observation_id":"62b3ba69-8815-4713-bb09-6d9e2ed0ef23","resolution":{"observed_at":"2026-08-11T23:46:08.787163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:10.122878Z","title":"ChapterBreak: A challenge dataset for long-range language models","venue":null,"work_id":"c9888e71-001d-4994-b814-6a706e6c22cf","year":2022},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T03:15:28.130856Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.801750Z"},"links":{"citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:4d573b8ed8da683408ef7dcbb9bb354c1369221574d8f6d4a86addf72e0af4dc","observation_id":"da602af8-0010-4589-8474-d649bc5a0871","resolution":{"observed_at":"2026-08-11T23:46:10.126803Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:10.111732Z","title":"Accessed 2026-08-09","venue":null,"work_id":"2241c4e3-50c2-4edc-9df3-a0cc30f33b73","year":2024},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T03:15:28.130856Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.805338Z"},"links":{"citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:7d1e1139e49ac96ec857eb871cc0b7a4103eaa3b9bcc8544e4f6b3ada9fe576b","observation_id":"76e0f288-a66c-47b6-a6e8-09f72bfec00d","resolution":{"observed_at":"2026-08-11T23:46:10.115418Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:10.133907Z","title":"Zico Kolter, and Zhuang Liu","venue":null,"work_id":"b0b29893-462e-4e5e-8ffc-dc34de79a618","year":2025},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T03:15:28.130856Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.798336Z"},"links":{"citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:45eaba6b44ba6d16f0cd683d3a44702461c91d7a75d474ab853c82703b80f893","observation_id":"a4994bef-5a84-4127-a17e-4746bbf90d83","resolution":{"observed_at":"2026-08-11T23:46:10.137800Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.13961","last_updated":"2026-04-14T15:12:44Z","snapshot_observed_at":"2026-08-07T08:18:31.274999Z","submitted_at":"2025-12-15T23:41:48Z","title":"Olmo 3","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.13961","snapshot_observed_at":"2026-08-11T23:46:08.812864Z","title":"Olmo 3.arXiv preprint arXiv:2512.13961, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T03:15:28.130856Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.812864Z"},"links":{"cited_paper":"/paper/2512.13961","citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:48b358478603910a05ef93dc49227738e77bbf02e8b2bdc921c3d3d918801b7e","observation_id":"5550b4f1-6a93-4bcb-b9a6-2ca0d227321a","resolution":{"observed_at":"2026-08-11T23:46:08.812864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-11T23:46:08.816699Z","title":"LLaMA: Open and efficient foundation language models.arXiv preprint arXiv:2302.13971, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T03:15:28.130856Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.816699Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:db7566f028f74152777a6b736dbc4a9053f1508aa2eb0f6c5f010523c6c10a76","observation_id":"289ede77-7263-4f8d-a5f7-ef76910dc4c5","resolution":{"observed_at":"2026-08-11T23:46:08.816699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.28109","last_updated":"2026-07-30T12:15:41Z","snapshot_observed_at":"2026-08-09T09:41:46.448779Z","submitted_at":"2026-07-30T12:15:41Z","title":"Beyond Rephrasing: Book-Level Organization Improves Synthetic Textbook Data for Mid-Training","version":1},"cited_work":{"arxiv_id":"2607.28109","doi":null,"metadata_source":"pith","pith_arxiv_id":"2607.28109","snapshot_observed_at":"2026-08-11T23:46:09.094834Z","title":"Beyond Rephrasing: Book-Level Organization Improves Synthetic Textbook Data for Mid-Training","venue":"cs.AI","work_id":"9c16bcc9-96bf-4be7-890a-4cfadd5d35de","year":2026},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T03:15:28.130856Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.808708Z"},"links":{"cited_paper":"/paper/2607.28109","citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:75d32b5bbb4a588341ef901822f35e8b008bdf653aaa62d79a751c7feb4dfe3b","observation_id":"d8d3ea3d-4234-465e-a029-1c2afa2026c7","resolution":{"observed_at":"2026-08-11T23:46:09.099133Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18839","last_updated":"2024-09-27T15:35:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T15:35:15Z","title":"MinerU: An Open-Source Solution for Precise Document Content Extraction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18839","snapshot_observed_at":"2026-08-11T23:46:08.824450Z","title":"MinerU: An open-source solution for precise document content extraction.arXiv preprint arXiv:2409.18839, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T03:15:28.130856Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.824450Z"},"links":{"cited_paper":"/paper/2409.18839","citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:d69a19dc6e19f8d8669b51f09690acfdb15fedb3890ab09bdad0977dd275e3e1","observation_id":"0e46ee02-9ea8-4e60-90cc-bbb5544db8d6","resolution":{"observed_at":"2026-08-11T23:46:08.824450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.28344","last_updated":"2026-06-01T23:20:51Z","snapshot_observed_at":"2026-07-07T00:02:29.000757Z","submitted_at":"2026-06-01T23:20:51Z","title":"PIXELRAG: Web Screenshots Beat Text for Retrieval-Augmented Generation","version":1},"cited_work":{"arxiv_id":"2606.28344","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.28344","snapshot_observed_at":"2026-08-11T23:46:09.029653Z","title":"PIXELRAG: Web Screenshots Beat Text for Retrieval-Augmented Generation","venue":"cs.IR","work_id":"a3ada67c-a353-446e-8d28-5ced9aaa124d","year":2026},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T03:15:28.130856Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.828474Z"},"links":{"cited_paper":"/paper/2606.28344","citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:2551e88080287237fc43660e26d6f36ccc3b36c933a363929b6880b238fe435d","observation_id":"ea6d276c-610c-4bd9-a5b5-32e35470cdcd","resolution":{"observed_at":"2026-08-11T23:46:09.034640Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2608.04330","last_updated":"2026-08-05T01:17:12Z","snapshot_observed_at":"2026-08-12T15:21:09.710996Z","submitted_at":"2026-08-05T01:17:12Z","title":"Right Reset: Chunking by Prefix Removal","version":1},"cited_work":{"arxiv_id":"2608.04330","doi":null,"metadata_source":"pith","pith_arxiv_id":"2608.04330","snapshot_observed_at":"2026-08-11T23:46:09.057632Z","title":"Right Reset: Chunking by Prefix Removal","venue":"cs.CL","work_id":"0e63e10a-2990-44eb-89f8-746a2004a60e","year":2026},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T03:15:28.130856Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.820342Z"},"links":{"cited_paper":"/paper/2608.04330","citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:3977cced8fc6be0f2595df9f8e675e4eb663d39dbc5bac67f6d74ad5b1c6df61","observation_id":"919507d1-adee-44a2-83b1-faa97958128e","resolution":{"observed_at":"2026-08-11T23:46:09.062126Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16860","last_updated":"2025-02-27T14:50:10Z","snapshot_observed_at":"2026-08-10T06:16:54.502401Z","submitted_at":"2025-02-24T05:51:53Z","title":"LongAttn: Selecting Long-context Training Data via Token-level Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.16860","snapshot_observed_at":"2026-08-11T23:46:08.837385Z","title":"LongAttn: Selecting long-context training data via token-level attention","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T03:15:28.130856Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.837385Z"},"links":{"cited_paper":"/paper/2502.16860","citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:3a289427ddf47023f5aabb984645742642f56c1eff454054d6a570328512268f","observation_id":"98108d02-c141-47d1-b782-01ac336a211b","resolution":{"observed_at":"2026-08-11T23:46:08.837385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:10.100579Z","title":"Morris, and Lionel Levine","venue":null,"work_id":"38b718ee-e37d-44bb-bf5b-a33680feb4ac","year":2024},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T03:15:28.130856Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.841338Z"},"links":{"citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:7b5e2173305eb32d547d53e92ee6acbea232923d0e974c357fe69bc1b82630fb","observation_id":"bf2ba5af-8693-43c8-be69-52a84b441af7","resolution":{"observed_at":"2026-08-11T23:46:10.104141Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01789","last_updated":"2025-06-03T04:18:39Z","snapshot_observed_at":"2026-08-08T11:39:24.709844Z","submitted_at":"2025-06-02T15:31:52Z","title":"Datasheets Aren't Enough: DataRubrics for Automated Quality Metrics and Accountability","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.01789","snapshot_observed_at":"2026-08-11T23:46:08.832563Z","title":"Datasheets aren’t enough: DataRubrics for automated quality metrics and accountability.arXiv preprint arXiv:2506.01789, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T03:15:28.130856Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.832563Z"},"links":{"cited_paper":"/paper/2506.01789","citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:851486be6a22593a80b7228e48da4af86de24ad32547d29df514ae93a5579009","observation_id":"f755bad9-c5f7-4fd5-aac2-ad53e0bfc3d9","resolution":{"observed_at":"2026-08-11T23:46:08.832563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:10.077089Z","title":"Learning to break the loop: Analyzing and mitigating repetitions for neural text generation","venue":null,"work_id":"012e578f-7087-4f53-816a-0fa9ac037731","year":2022},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T03:15:28.130856Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.848523Z"},"links":{"citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:69ed3fd2d06ecd5c6edd33d4197c2490963dce0b3865c9978338516e1e49a8ab","observation_id":"2f060d25-0c30-40be-b921-38c88aca8d45","resolution":{"observed_at":"2026-08-11T23:46:10.081092Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:10.065742Z","title":"Data mixing laws: Optimizing data mixtures by predicting language modeling performance","venue":null,"work_id":"2d212cac-5f37-4182-9352-468f5144795a","year":2025},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T03:15:28.130856Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.852100Z"},"links":{"citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:927cfe0d881335164fffa80a272fc0d544aee10b1e97d5661dad2550537e9f87","observation_id":"ab284549-a24a-4633-b8d2-26b4f68c11b5","resolution":{"observed_at":"2026-08-11T23:46:10.069815Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:10.089095Z","title":"Le, Tengyu Ma, and Adams Wei Yu","venue":null,"work_id":"a01f3083-4d8a-43df-81f0-5819408cdbbd","year":2023},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T03:15:28.130856Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.844966Z"},"links":{"citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:c0b928ab7d54a53cecc44f52bd85558ca42aca22d5443fc2ed7bb05d66aaed16","observation_id":"3478cf59-34f1-41c0-aec3-6735908add7d","resolution":{"observed_at":"2026-08-11T23:46:10.093107Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:10.054116Z","title":"Zacks, Nicole K","venue":null,"work_id":"7d7c5e13-ecc8-41fa-95bc-a83980dbc2ed","year":2007},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T03:15:28.130856Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.860828Z"},"links":{"citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:b84a12d0dd4914a908646627a27b2d8ccb86804979d8e37c11d658e06fc32faf","observation_id":"9f9598ca-fc52-4c51-a957-b418b878adba","resolution":{"observed_at":"2026-08-11T23:46:10.058298Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:10.041837Z","title":"From lists to emojis: How format bias affects model alignment","venue":null,"work_id":"91bfcd88-2b1e-41f0-9a92-6d1a23ed15d9","year":2025},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T03:15:28.130856Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.864257Z"},"links":{"citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:06094290c7323d2fde991e88a7bb5f8b0038887041d68f82d7aa012454f92d62","observation_id":"85c2b94d-26cb-436d-9add-963dc6f821d8","resolution":{"observed_at":"2026-08-11T23:46:10.046021Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18949","last_updated":"2025-05-25T02:52:35Z","snapshot_observed_at":"2026-08-12T06:27:26.149814Z","submitted_at":"2025-05-25T02:52:35Z","title":"The Price of Format: Diversity Collapse in LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.18949","snapshot_observed_at":"2026-08-11T23:46:08.856924Z","title":"The price of format: Diversity collapse in LLMs.arXiv preprint arXiv:2505.18949, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T03:15:28.130856Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.856924Z"},"links":{"cited_paper":"/paper/2505.18949","citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:46d0fa5ab48435f894bb63b6f3a3d0b134935f5203378466d7c776bb43a5300b","observation_id":"55707357-ff8e-4d89-a41d-509c1a44cd00","resolution":{"observed_at":"2026-08-11T23:46:08.856924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.11198","last_updated":"2026-04-21T08:47:00Z","snapshot_observed_at":"2026-08-03T18:51:30.407210Z","submitted_at":"2026-04-21T08:47:00Z","title":"The Structural Attention Tax: How Retrieval Format Hijacks In-Context Learning Independent of Content","version":1},"cited_work":{"arxiv_id":"2606.11198","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.11198","snapshot_observed_at":"2026-08-11T23:46:08.966786Z","title":"The Structural Attention Tax: How Retrieval Format Hijacks In-Context Learning Independent of Content","venue":"cs.CL","work_id":"aaddb521-1f6b-41a5-a1b7-4707880df0e3","year":2026},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T03:15:28.130856Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.871727Z"},"links":{"cited_paper":"/paper/2606.11198","citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:7211a3937697d88f1c8969d8a21255b09d01ef9210425aef4fb7373fbc715234","observation_id":"6e68ee45-f4ca-422f-b1fa-1e001cbd6add","resolution":{"observed_at":"2026-08-11T23:46:08.971210Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.10544","last_updated":"2026-05-11T13:23:21Z","snapshot_observed_at":"2026-08-11T10:54:12.115733Z","submitted_at":"2026-05-11T13:23:21Z","title":"Where Does Long-Context Supervision Actually Go? Effective-Context Exposure Balancing","version":1},"cited_work":{"arxiv_id":"2605.10544","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.10544","snapshot_observed_at":"2026-08-11T23:46:08.947663Z","title":"Where Does Long-Context Supervision Actually Go? Effective-Context Exposure Balancing","venue":"cs.CL","work_id":"83b55444-f2ef-4a91-a372-269bd632e9a9","year":2026},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T03:15:28.130856Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.875599Z"},"links":{"cited_paper":"/paper/2605.10544","citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:695e3020c98cec26385969e38bf9c96a20d190391d69779d33a7ae8de000dcab","observation_id":"84df4455-b9e6-4dd6-a651-dabc1196f62e","resolution":{"observed_at":"2026-08-11T23:46:08.954229Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2607.09657","last_updated":"2026-07-20T10:08:28Z","snapshot_observed_at":"2026-08-09T13:48:47.859181Z","submitted_at":"2026-07-10T17:57:03Z","title":"Scalable Visual Pretraining for Language Intelligence","version":2},"cited_work":{"arxiv_id":"2607.09657","doi":null,"metadata_source":"pith","pith_arxiv_id":"2607.09657","snapshot_observed_at":"2026-08-11T23:46:08.982743Z","title":"Scalable Visual Pretraining for Language Intelligence","venue":"cs.CV","work_id":"afd98409-e372-4bec-8459-446265af679a","year":2026},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T03:15:28.130856Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.868091Z"},"links":{"cited_paper":"/paper/2607.09657","citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:badd551bc00f78e70e59592dc79d7a5fadca174782b7b3e3e4620b2e100cd23e","observation_id":"9619982f-93a7-474e-989e-ae8073391783","resolution":{"observed_at":"2026-08-11T23:46:08.987020Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:10.030245Z","title":"Zwaan and Gabriel A","venue":null,"work_id":"ddaa00e8-49df-4571-b75f-24c181b4ffe2","year":1998},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T03:15:28.130856Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.884591Z"},"links":{"citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:5c844af6c7cfe3bda301ba8a79863dc12ee7c66879ab9997a75243343e65f266","observation_id":"58d6a4af-29c9-4e81-8567-412d9a7bc57c","resolution":{"observed_at":"2026-08-11T23:46:10.034224Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03705","last_updated":"2025-06-22T19:25:04Z","snapshot_observed_at":"2026-08-10T13:36:42.908582Z","submitted_at":"2025-03-05T17:56:20Z","title":"Enhancing LLM Knowledge Learning through Generalization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.03705","snapshot_observed_at":"2026-08-11T23:46:08.879720Z","title":"Enhancing LLM knowledge learning through generalization.arXiv preprint arXiv:2503.03705, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T03:15:28.130856Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.879720Z"},"links":{"cited_paper":"/paper/2503.03705","citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:400a09e80de5c263a71c9ba96d4c98ad75336b488a7329a1dc614fbac7801de3","observation_id":"075984c6-1b52-438d-be3c-70502615977e","resolution":{"observed_at":"2026-08-11T23:46:08.879720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:10.184951Z","title":null,"venue":null,"work_id":"8e5f2dac-441c-4c53-a83d-3862c66c6ce5","year":2026},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T03:15:28.130856Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.760319Z"},"links":{"citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:7c66812aa77c35922af56a0228b469c3d7300a83ba2ec3e10063b9b1c577b07b","observation_id":"812918f9-4bb3-4ae1-b781-fff4d2ae9688","resolution":{"observed_at":"2026-08-11T23:46:10.188682Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:08.644369Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T03:15:28.130856Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.644369Z"},"links":{"citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:f9fcc302036553ca8b787f2499c3670e61772272248d4f871390beb3cde19edc","observation_id":"769428fc-d8fc-4600-8193-4babf0e61a92","resolution":{"observed_at":"2026-08-11T23:46:08.644369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-13T03:15:28.130856Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora"},"reference_resolution":{"displayed":97,"state_counts":{"malformed_identifier":0,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":50,"verified_exact":16,"verified_fuzzy":28},"total_outbound_references":97},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 97 of 97 outbound references and 0 inbound Pith citation observations for arXiv:2608.09093."}