{"as_of":"2026-08-08T23:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:947fc8d312184880809c7d25c7a9d8ac49a2295a568455ec94dc3d3c01a2a9b3","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":30,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":30,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":30,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":30,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T23:08:35.527085Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T17:47:18.026339Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.02595","last_updated":"2025-05-30T20:49:42Z","snapshot_observed_at":"2026-08-04T07:58:32.632698Z","submitted_at":"2024-12-03T17:28:50Z","title":"Nemotron-CC: Transforming Common Crawl into a Refined Long-Horizon Pretraining Dataset","version":2},"cited_work":{"arxiv_id":"2412.02595","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.02595","snapshot_observed_at":"2026-07-02T17:47:18.026339Z","title":"Nemotron-cc: Transforming common crawl into a refined long-horizon pretraining dataset.arXiv preprint arXiv:2412.02595","venue":null,"work_id":"bab220a8-ec16-4f03-9452-4eb35d618607","year":2024},"citing_paper":{"arxiv_id":"2406.11794","last_updated":"2025-04-21T17:48:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-17T17:42:57Z","title":"DataComp-LM: In search of the next generation of training sets for language models","version":4},"reference_index":173,"source":"pdf_text","source_observed_at":"2026-05-17T22:58:16.523267Z"},"links":{"cited_paper":"/paper/2412.02595","citing_paper":"/paper/2406.11794"},"observation_digest":"sha256:32f983ee8f14afb649746221389cdef989013d1878d04f43a828a91a473fdee6","observation_id":"bd3463d3-238c-4d8a-ad18-d66106458013","resolution":{"observed_at":"2026-05-17T22:58:17.242565Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02595","last_updated":"2025-05-30T20:49:42Z","snapshot_observed_at":"2026-08-04T07:58:32.632698Z","submitted_at":"2024-12-03T17:28:50Z","title":"Nemotron-CC: Transforming Common Crawl into a Refined Long-Horizon Pretraining Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02595","snapshot_observed_at":"2026-08-08T23:08:35.527085Z","title":"Nemotron-cc: Transforming common crawl into a refined long-horizon pretraining dataset","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04235","last_updated":"2025-05-19T11:52:17Z","snapshot_observed_at":"2026-08-08T23:00:56.149426Z","submitted_at":"2025-02-06T17:19:55Z","title":"Reformulation for Pretraining Data Augmentation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-08T23:08:35.527085Z"},"links":{"cited_paper":"/paper/2412.02595","citing_paper":"/paper/2502.04235"},"observation_digest":"sha256:ea932325a9e548ac047b3a1918b68604df4bd5b29883e1a17a8a6298990634e6","observation_id":"14c50eca-0a41-4504-8170-d7c82bd35b3e","resolution":{"observed_at":"2026-08-08T23:08:35.527085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02595","last_updated":"2025-05-30T20:49:42Z","snapshot_observed_at":"2026-08-04T07:58:32.632698Z","submitted_at":"2024-12-03T17:28:50Z","title":"Nemotron-CC: Transforming Common Crawl into a Refined Long-Horizon Pretraining Dataset","version":2},"cited_work":{"arxiv_id":"2412.02595","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.02595","snapshot_observed_at":"2026-07-02T17:47:18.026339Z","title":"Nemotron-cc: Transforming common crawl into a refined long-horizon pretraining dataset.arXiv preprint arXiv:2412.02595","venue":null,"work_id":"bab220a8-ec16-4f03-9452-4eb35d618607","year":2024},"citing_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-05-11T23:02:51.656353Z"},"links":{"cited_paper":"/paper/2412.02595","citing_paper":"/paper/2502.16982"},"observation_digest":"sha256:6fdcdae9ce133a2577456afe7780abc9694213ddef345ef51ee68b6e39e0c291","observation_id":"b11cfc50-8406-40d3-a048-37ecaeeb235a","resolution":{"observed_at":"2026-05-11T23:02:52.280166Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02595","last_updated":"2025-05-30T20:49:42Z","snapshot_observed_at":"2026-08-04T07:58:32.632698Z","submitted_at":"2024-12-03T17:28:50Z","title":"Nemotron-CC: Transforming Common Crawl into a Refined Long-Horizon Pretraining Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02595","snapshot_observed_at":"2026-08-07T13:19:31.935769Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22232","last_updated":"2025-05-31T15:28:40Z","snapshot_observed_at":"2026-08-07T13:09:59.153649Z","submitted_at":"2025-05-28T11:06:54Z","title":"Judging Quality Across Languages: A Multilingual Approach to Pretraining Data Filtering with Language Models","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T13:19:31.935769Z"},"links":{"cited_paper":"/paper/2412.02595","citing_paper":"/paper/2505.22232"},"observation_digest":"sha256:1c5e84333854530adf6b431d69d89a48fe953bfa1079739ad836c40d94de72ac","observation_id":"6c3272de-dd3e-4678-9a08-4efa073b6124","resolution":{"observed_at":"2026-08-07T13:19:31.935769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02595","last_updated":"2025-05-30T20:49:42Z","snapshot_observed_at":"2026-08-04T07:58:32.632698Z","submitted_at":"2024-12-03T17:28:50Z","title":"Nemotron-CC: Transforming Common Crawl into a Refined Long-Horizon Pretraining Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02595","snapshot_observed_at":"2026-08-07T12:45:29.337872Z","title":"Nemotron-cc: Transforming common crawl into a refined long-horizon pretraining dataset, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23725","last_updated":"2026-06-02T01:19:21Z","snapshot_observed_at":"2026-08-07T12:36:41.591936Z","submitted_at":"2025-05-29T17:55:37Z","title":"MuLoCo: Muon is a practical inner optimizer for DiLoCo","version":3},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:29.337872Z"},"links":{"cited_paper":"/paper/2412.02595","citing_paper":"/paper/2505.23725"},"observation_digest":"sha256:b69e4cb42eb65465c7ddadeffb331c810d28c6a671d1bcd6b48afc4613dc366b","observation_id":"52731c25-da68-4dfa-a3ec-1826a0dd5c27","resolution":{"observed_at":"2026-08-07T12:45:29.337872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02595","last_updated":"2025-05-30T20:49:42Z","snapshot_observed_at":"2026-08-04T07:58:32.632698Z","submitted_at":"2024-12-03T17:28:50Z","title":"Nemotron-CC: Transforming Common Crawl into a Refined Long-Horizon Pretraining Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02595","snapshot_observed_at":"2026-08-07T05:41:14.613803Z","title":"Nemotron-4 340b technical report.arXiv preprint arXiv:2412.02595, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07463","last_updated":"2025-06-09T06:14:19Z","snapshot_observed_at":"2026-08-07T05:30:43.040489Z","submitted_at":"2025-06-09T06:14:19Z","title":"CCI4.0: A Bilingual Pretraining Dataset for Enhancing Reasoning in Large Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T05:41:14.613803Z"},"links":{"cited_paper":"/paper/2412.02595","citing_paper":"/paper/2506.07463"},"observation_digest":"sha256:61d776d7666cb087910a022d7264521833168340babf1ee2096b4d6404a57573","observation_id":"5ff8f4b7-0c07-4cd2-83bb-0dc2b5b4905b","resolution":{"observed_at":"2026-08-07T05:41:14.613803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02595","last_updated":"2025-05-30T20:49:42Z","snapshot_observed_at":"2026-08-04T07:58:32.632698Z","submitted_at":"2024-12-03T17:28:50Z","title":"Nemotron-CC: Transforming Common Crawl into a Refined Long-Horizon Pretraining Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02595","snapshot_observed_at":"2026-08-07T00:24:47.275435Z","title":"Nemotron-cc: Transforming common crawl into a refined long-horizon pretraining dataset, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14111","last_updated":"2025-06-19T19:02:41Z","snapshot_observed_at":"2026-08-07T00:16:03.841117Z","submitted_at":"2025-06-17T02:03:36Z","title":"Essential-Web v1.0: 24T tokens of organized web data","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:47.275435Z"},"links":{"cited_paper":"/paper/2412.02595","citing_paper":"/paper/2506.14111"},"observation_digest":"sha256:3701ce3ff17e6d83e19011d989453b53eba5cf5869704cf3f7e12ee59fb8b2f5","observation_id":"a1984adb-b1b0-4143-ad67-f8f9b40d8baf","resolution":{"observed_at":"2026-08-07T00:24:47.275435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02595","last_updated":"2025-05-30T20:49:42Z","snapshot_observed_at":"2026-08-04T07:58:32.632698Z","submitted_at":"2024-12-03T17:28:50Z","title":"Nemotron-CC: Transforming Common Crawl into a Refined Long-Horizon Pretraining Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02595","snapshot_observed_at":"2026-08-06T20:21:54.439779Z","title":"Nemotron-cc: Transforming common crawl into a refined long-horizon pretraining dataset","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.03253","last_updated":"2025-07-08T18:15:09Z","snapshot_observed_at":"2026-08-07T10:43:54.316543Z","submitted_at":"2025-07-04T02:19:58Z","title":"RefineX: Learning to Refine Pre-training Data at Scale from Expert-Guided Programs","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T20:21:54.439779Z"},"links":{"cited_paper":"/paper/2412.02595","citing_paper":"/paper/2507.03253"},"observation_digest":"sha256:9033589cb914ee511891a1c20d9a287dd22cc8121223b47274935a3ab1bf7e77","observation_id":"34c86beb-14da-4524-bff9-e9b876b99569","resolution":{"observed_at":"2026-08-06T20:21:54.439779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02595","last_updated":"2025-05-30T20:49:42Z","snapshot_observed_at":"2026-08-04T07:58:32.632698Z","submitted_at":"2024-12-03T17:28:50Z","title":"Nemotron-CC: Transforming Common Crawl into a Refined Long-Horizon Pretraining Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02595","snapshot_observed_at":"2026-08-06T16:53:13.978780Z","title":"Nemotron-cc: Transforming common crawl into a refined long-horizon pretraining dataset","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12466","last_updated":"2025-07-16T17:59:45Z","snapshot_observed_at":"2026-08-07T10:43:47.278118Z","submitted_at":"2025-07-16T17:59:45Z","title":"Language Models Improve When Pretraining Data Matches Target Tasks","version":1},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-08-06T16:53:13.978780Z"},"links":{"cited_paper":"/paper/2412.02595","citing_paper":"/paper/2507.12466"},"observation_digest":"sha256:cd61095365d474c055c23f2891e95ef7d5b0acd714eea15eeb9658bb7b523a33","observation_id":"6900972a-82fd-49e4-a263-0deb17173d09","resolution":{"observed_at":"2026-08-06T16:53:13.978780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02595","last_updated":"2025-05-30T20:49:42Z","snapshot_observed_at":"2026-08-04T07:58:32.632698Z","submitted_at":"2024-12-03T17:28:50Z","title":"Nemotron-CC: Transforming Common Crawl into a Refined Long-Horizon Pretraining Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02595","snapshot_observed_at":"2026-08-06T17:04:03.404164Z","title":"Nemotron-cc: Transforming common crawl into a refined long-horizon pretraining dataset","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13390","last_updated":"2025-07-16T06:14:33Z","snapshot_observed_at":"2026-08-08T05:55:43.686727Z","submitted_at":"2025-07-16T06:14:33Z","title":"PARAM-1 BharatGen 2.9B Model","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T17:04:03.404164Z"},"links":{"cited_paper":"/paper/2412.02595","citing_paper":"/paper/2507.13390"},"observation_digest":"sha256:3b8ae882d19513e16f57c9334ebdc5b13fd8fb4d81727dd75537c78b7fdeffd5","observation_id":"38adfbc9-82e4-4804-8839-58dec42a6033","resolution":{"observed_at":"2026-08-06T17:04:03.404164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02595","last_updated":"2025-05-30T20:49:42Z","snapshot_observed_at":"2026-08-04T07:58:32.632698Z","submitted_at":"2024-12-03T17:28:50Z","title":"Nemotron-CC: Transforming Common Crawl into a Refined Long-Horizon Pretraining Dataset","version":2},"cited_work":{"arxiv_id":"2412.02595","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.02595","snapshot_observed_at":"2026-07-02T17:47:18.026339Z","title":"Nemotron-cc: Transforming common crawl into a refined long-horizon pretraining dataset.arXiv preprint arXiv:2412.02595","venue":null,"work_id":"bab220a8-ec16-4f03-9452-4eb35d618607","year":2024},"citing_paper":{"arxiv_id":"2507.15640","last_updated":"2026-04-12T09:28:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-21T14:01:54Z","title":"Data Mixing Agent: Learning to Re-weight Domains for Continual Pre-training","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-19T03:36:50.366757Z"},"links":{"cited_paper":"/paper/2412.02595","citing_paper":"/paper/2507.15640"},"observation_digest":"sha256:08a019b617b1c56abdbf662372e3aabd269f799ea1e8417d2c0b8ee497bf4f27","observation_id":"7b1a5429-0f19-4ade-962c-c996430c7295","resolution":{"observed_at":"2026-05-19T03:37:00.956871Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02595","last_updated":"2025-05-30T20:49:42Z","snapshot_observed_at":"2026-08-04T07:58:32.632698Z","submitted_at":"2024-12-03T17:28:50Z","title":"Nemotron-CC: Transforming Common Crawl into a Refined Long-Horizon Pretraining Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02595","snapshot_observed_at":"2026-08-06T11:44:05.149322Z","title":"Nemotron-cc: Transforming common crawl into a refined long-horizon pretraining dataset, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-06T11:43:58.532083Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-08-06T11:44:05.149322Z"},"links":{"cited_paper":"/paper/2412.02595","citing_paper":"/paper/2507.22448"},"observation_digest":"sha256:6aca36ff2ba64f6362147b8c0ffe04797c3bde01d985de68700fa1337a77903b","observation_id":"e5ef4d0e-37f8-4d08-be1a-0cac25f6b8e1","resolution":{"observed_at":"2026-08-06T11:44:05.149322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02595","last_updated":"2025-05-30T20:49:42Z","snapshot_observed_at":"2026-08-04T07:58:32.632698Z","submitted_at":"2024-12-03T17:28:50Z","title":"Nemotron-CC: Transforming Common Crawl into a Refined Long-Horizon Pretraining Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02595","snapshot_observed_at":"2026-08-05T22:45:15.714890Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.06464","last_updated":"2025-08-08T17:13:00Z","snapshot_observed_at":"2026-08-07T13:11:39.868102Z","submitted_at":"2025-08-08T17:13:00Z","title":"Observation of momentum dependent charge density wave gap in EuTe4","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T22:45:15.714890Z"},"links":{"cited_paper":"/paper/2412.02595","citing_paper":"/paper/2508.06464"},"observation_digest":"sha256:c19481ab428a036e6c1036d611c516651f137ec9f9da3769575c1a4fb9c3dc97","observation_id":"bd0e7845-fe91-479a-b06e-8e5cb8aa6355","resolution":{"observed_at":"2026-08-05T22:45:15.714890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02595","last_updated":"2025-05-30T20:49:42Z","snapshot_observed_at":"2026-08-04T07:58:32.632698Z","submitted_at":"2024-12-03T17:28:50Z","title":"Nemotron-CC: Transforming Common Crawl into a Refined Long-Horizon Pretraining Dataset","version":2},"cited_work":{"arxiv_id":"2412.02595","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.02595","snapshot_observed_at":"2026-07-02T17:47:18.026339Z","title":"Nemotron-cc: Transforming common crawl into a refined long-horizon pretraining dataset.arXiv preprint arXiv:2412.02595","venue":null,"work_id":"bab220a8-ec16-4f03-9452-4eb35d618607","year":2024},"citing_paper":{"arxiv_id":"2508.06471","last_updated":"2025-08-08T17:21:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-08T17:21:06Z","title":"GLM-4.5: Agentic, Reasoning, and Coding (ARC) Foundation Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-11T17:50:08.399160Z"},"links":{"cited_paper":"/paper/2412.02595","citing_paper":"/paper/2508.06471"},"observation_digest":"sha256:b0bca02b2e50e79afa860b9e4255ecbd195ec5110e55e2a5b298d2d035fe6ce6","observation_id":"01b56cb4-a664-4924-9841-ae2e6daa2092","resolution":{"observed_at":"2026-05-11T17:50:08.495392Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02595","last_updated":"2025-05-30T20:49:42Z","snapshot_observed_at":"2026-08-04T07:58:32.632698Z","submitted_at":"2024-12-03T17:28:50Z","title":"Nemotron-CC: Transforming Common Crawl into a Refined Long-Horizon Pretraining Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02595","snapshot_observed_at":"2026-08-05T14:49:35.938335Z","title":"Nemotron-cc: Transforming common crawl into a refined long-horizon pretraining dataset, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.20869","last_updated":"2025-08-28T15:00:51Z","snapshot_observed_at":"2026-08-07T08:43:46.033186Z","submitted_at":"2025-08-28T15:00:51Z","title":"OLMoASR: Open Models and Data for Training Robust Speech Recognition Models","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-05T14:49:35.938335Z"},"links":{"cited_paper":"/paper/2412.02595","citing_paper":"/paper/2508.20869"},"observation_digest":"sha256:0a6cbfbf6ae537446f9a2ec49757b5c9b0e78cff45528ec375b13430e50e6ac2","observation_id":"606c1c1d-beae-4e9d-9c5f-10930968c799","resolution":{"observed_at":"2026-08-05T14:49:35.938335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02595","last_updated":"2025-05-30T20:49:42Z","snapshot_observed_at":"2026-08-04T07:58:32.632698Z","submitted_at":"2024-12-03T17:28:50Z","title":"Nemotron-CC: Transforming Common Crawl into a Refined Long-Horizon Pretraining Dataset","version":2},"cited_work":{"arxiv_id":"2412.02595","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.02595","snapshot_observed_at":"2026-07-02T17:47:18.026339Z","title":"Nemotron-cc: Transforming common crawl into a refined long-horizon pretraining dataset.arXiv preprint arXiv:2412.02595","venue":null,"work_id":"bab220a8-ec16-4f03-9452-4eb35d618607","year":2024},"citing_paper":{"arxiv_id":"2510.08008","last_updated":"2026-05-15T08:53:04Z","snapshot_observed_at":"2026-08-03T22:05:31.756040Z","submitted_at":"2025-10-09T09:45:45Z","title":"Beyond Sunk Costs: Boosting LLM Pre-training Efficiency via Orthogonal Growth of Mixture-of-Experts","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-21T20:36:22.974054Z"},"links":{"cited_paper":"/paper/2412.02595","citing_paper":"/paper/2510.08008"},"observation_digest":"sha256:71e04e21f7d2edf7c357788ba6f1a329f8816438428fba9ed382d6280535d4e3","observation_id":"0307201b-71a3-4aa6-bdd5-f229972ed47d","resolution":{"observed_at":"2026-05-21T20:40:36.456872Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02595","last_updated":"2025-05-30T20:49:42Z","snapshot_observed_at":"2026-08-04T07:58:32.632698Z","submitted_at":"2024-12-03T17:28:50Z","title":"Nemotron-CC: Transforming Common Crawl into a Refined Long-Horizon Pretraining Dataset","version":2},"cited_work":{"arxiv_id":"2412.02595","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.02595","snapshot_observed_at":"2026-07-02T17:47:18.026339Z","title":"Nemotron-cc: Transforming common crawl into a refined long-horizon pretraining dataset.arXiv preprint arXiv:2412.02595","venue":null,"work_id":"bab220a8-ec16-4f03-9452-4eb35d618607","year":2024},"citing_paper":{"arxiv_id":"2510.25741","last_updated":"2026-07-01T23:25:58Z","snapshot_observed_at":"2026-08-04T07:30:51.188041Z","submitted_at":"2025-10-29T17:45:42Z","title":"Scaling Latent Reasoning via Looped Language Models","version":4},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-15T07:43:11.620446Z"},"links":{"cited_paper":"/paper/2412.02595","citing_paper":"/paper/2510.25741"},"observation_digest":"sha256:b2a7c8f190c5b11e86ab9d3447e47388d91a445a1f81054f75cc29f7b56b654d","observation_id":"7e72b8aa-2363-42aa-87d3-24f425caddb5","resolution":{"observed_at":"2026-05-15T07:43:11.878377Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02595","last_updated":"2025-05-30T20:49:42Z","snapshot_observed_at":"2026-08-04T07:58:32.632698Z","submitted_at":"2024-12-03T17:28:50Z","title":"Nemotron-CC: Transforming Common Crawl into a Refined Long-Horizon Pretraining Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02595","snapshot_observed_at":"2026-08-04T07:31:31.556001Z","title":"Nemotron-cc: Transforming common crawl into a refined long-horizon pretraining dataset","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.25741","last_updated":"2026-07-01T23:25:58Z","snapshot_observed_at":"2026-08-04T07:30:51.188041Z","submitted_at":"2025-10-29T17:45:42Z","title":"Scaling Latent Reasoning via Looped Language Models","version":5},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-04T07:31:31.556001Z"},"links":{"cited_paper":"/paper/2412.02595","citing_paper":"/paper/2510.25741"},"observation_digest":"sha256:414cf8417151d4b9a6797f193855c29a24e7e97979b3d44308f491c44c400d28","observation_id":"0be98898-9b3b-4cd8-ac38-8a738e7a6486","resolution":{"observed_at":"2026-08-04T07:31:31.556001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02595","last_updated":"2025-05-30T20:49:42Z","snapshot_observed_at":"2026-08-04T07:58:32.632698Z","submitted_at":"2024-12-03T17:28:50Z","title":"Nemotron-CC: Transforming Common Crawl into a Refined Long-Horizon Pretraining Dataset","version":2},"cited_work":{"arxiv_id":"2412.02595","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.02595","snapshot_observed_at":"2026-07-02T17:47:18.026339Z","title":"Nemotron-cc: Transforming common crawl into a refined long-horizon pretraining dataset.arXiv preprint arXiv:2412.02595","venue":null,"work_id":"bab220a8-ec16-4f03-9452-4eb35d618607","year":2024},"citing_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-07T15:13:13.622286Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-05-18T01:12:13.426640Z"},"links":{"cited_paper":"/paper/2412.02595","citing_paper":"/paper/2510.26583"},"observation_digest":"sha256:8858e5a6b09b2b2c3b3777eb672e62a4d547ac82006e03eb70760339c90a50f8","observation_id":"9b4fce4f-03f0-4b94-adbd-7c319f45989b","resolution":{"observed_at":"2026-05-18T01:12:13.516657Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02595","last_updated":"2025-05-30T20:49:42Z","snapshot_observed_at":"2026-08-04T07:58:32.632698Z","submitted_at":"2024-12-03T17:28:50Z","title":"Nemotron-CC: Transforming Common Crawl into a Refined Long-Horizon Pretraining Dataset","version":2},"cited_work":{"arxiv_id":"2412.02595","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.02595","snapshot_observed_at":"2026-07-02T17:47:18.026339Z","title":"Nemotron-cc: Transforming common crawl into a refined long-horizon pretraining dataset.arXiv preprint arXiv:2412.02595","venue":null,"work_id":"bab220a8-ec16-4f03-9452-4eb35d618607","year":2024},"citing_paper":{"arxiv_id":"2604.03044","last_updated":"2026-04-08T07:22:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-03T13:52:38Z","title":"JoyAI-LLM Flash: Advancing Mid-Scale LLMs with Token Efficiency","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-13T19:26:38.134505Z"},"links":{"cited_paper":"/paper/2412.02595","citing_paper":"/paper/2604.03044"},"observation_digest":"sha256:d0dc997080cfb833d6c963c17afc70258a24a2ed02630527230ff3eba019cf18","observation_id":"c997e95f-e109-4df0-929b-214d5a3e4b14","resolution":{"observed_at":"2026-05-13T19:28:09.809525Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02595","last_updated":"2025-05-30T20:49:42Z","snapshot_observed_at":"2026-08-04T07:58:32.632698Z","submitted_at":"2024-12-03T17:28:50Z","title":"Nemotron-CC: Transforming Common Crawl into a Refined Long-Horizon Pretraining Dataset","version":2},"cited_work":{"arxiv_id":"2412.02595","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.02595","snapshot_observed_at":"2026-07-02T17:47:18.026339Z","title":"Nemotron-cc: Transforming common crawl into a refined long-horizon pretraining dataset.arXiv preprint arXiv:2412.02595","venue":null,"work_id":"bab220a8-ec16-4f03-9452-4eb35d618607","year":2024},"citing_paper":{"arxiv_id":"2604.05688","last_updated":"2026-04-07T10:40:16Z","snapshot_observed_at":"2026-07-06T22:54:21.571606Z","submitted_at":"2026-04-07T10:40:16Z","title":"Attention Editing: A Versatile Framework for Cross-Architecture Attention Conversion","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-10T19:47:34.869184Z"},"links":{"cited_paper":"/paper/2412.02595","citing_paper":"/paper/2604.05688"},"observation_digest":"sha256:ea6e06838c7b773caf85f11036d87e6297a4ede157dce3c439c07e7f0dcdf21f","observation_id":"de89157d-d96e-418a-a000-d896acff0925","resolution":{"observed_at":"2026-05-10T22:30:51.599421Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02595","last_updated":"2025-05-30T20:49:42Z","snapshot_observed_at":"2026-08-04T07:58:32.632698Z","submitted_at":"2024-12-03T17:28:50Z","title":"Nemotron-CC: Transforming Common Crawl into a Refined Long-Horizon Pretraining Dataset","version":2},"cited_work":{"arxiv_id":"2412.02595","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.02595","snapshot_observed_at":"2026-07-02T17:47:18.026339Z","title":"Nemotron-cc: Transforming common crawl into a refined long-horizon pretraining dataset.arXiv preprint arXiv:2412.02595","venue":null,"work_id":"bab220a8-ec16-4f03-9452-4eb35d618607","year":2024},"citing_paper":{"arxiv_id":"2605.10129","last_updated":"2026-05-11T07:40:39Z","snapshot_observed_at":"2026-07-06T23:22:08.560919Z","submitted_at":"2026-05-11T07:40:39Z","title":"Synthetic Pre-Pre-Training Improves Language Model Robustness to Noisy Pre-Training Data","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-05-12T03:38:39.738401Z"},"links":{"cited_paper":"/paper/2412.02595","citing_paper":"/paper/2605.10129"},"observation_digest":"sha256:6965c435bc34b2be3a2631f1cfb9b4d957de4b23873216313a9c7f503bd3bce9","observation_id":"978ced0b-b564-494d-bc32-4d9e41158f5d","resolution":{"observed_at":"2026-05-12T07:11:25.667213Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02595","last_updated":"2025-05-30T20:49:42Z","snapshot_observed_at":"2026-08-04T07:58:32.632698Z","submitted_at":"2024-12-03T17:28:50Z","title":"Nemotron-CC: Transforming Common Crawl into a Refined Long-Horizon Pretraining Dataset","version":2},"cited_work":{"arxiv_id":"2412.02595","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.02595","snapshot_observed_at":"2026-07-02T17:47:18.026339Z","title":"Nemotron-cc: Transforming common crawl into a refined long-horizon pretraining dataset.arXiv preprint arXiv:2412.02595","venue":null,"work_id":"bab220a8-ec16-4f03-9452-4eb35d618607","year":2024},"citing_paper":{"arxiv_id":"2605.11405","last_updated":"2026-05-13T01:55:26Z","snapshot_observed_at":"2026-07-06T23:23:16.461539Z","submitted_at":"2026-05-12T01:51:03Z","title":"20/20 Vision Language Models: A Prescription for Better VLMs through Data Curation Alone","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-13T02:52:43.674969Z"},"links":{"cited_paper":"/paper/2412.02595","citing_paper":"/paper/2605.11405"},"observation_digest":"sha256:4dcfb386e742a941ba84d7b88e3809ef733e5ba194910c2cd38fcdeaa188f5b2","observation_id":"320a060b-bbe5-47e5-a9f6-a08135c8afd6","resolution":{"observed_at":"2026-05-13T02:57:09.570773Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02595","last_updated":"2025-05-30T20:49:42Z","snapshot_observed_at":"2026-08-04T07:58:32.632698Z","submitted_at":"2024-12-03T17:28:50Z","title":"Nemotron-CC: Transforming Common Crawl into a Refined Long-Horizon Pretraining Dataset","version":2},"cited_work":{"arxiv_id":"2412.02595","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.02595","snapshot_observed_at":"2026-07-02T17:47:18.026339Z","title":"Nemotron-cc: Transforming common crawl into a refined long-horizon pretraining dataset.arXiv preprint arXiv:2412.02595","venue":null,"work_id":"bab220a8-ec16-4f03-9452-4eb35d618607","year":2024},"citing_paper":{"arxiv_id":"2605.11405","last_updated":"2026-05-13T01:55:26Z","snapshot_observed_at":"2026-07-06T23:23:16.461539Z","submitted_at":"2026-05-12T01:51:03Z","title":"20/20 Vision Language Models: A Prescription for Better VLMs through Data Curation Alone","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-14T21:28:37.680681Z"},"links":{"cited_paper":"/paper/2412.02595","citing_paper":"/paper/2605.11405"},"observation_digest":"sha256:cd704a042d671da3eb6c58d01d9b871050f82de1cdcac70ddc2586572a02adfa","observation_id":"a0e704de-33e9-49fb-aa73-003c0890e8a3","resolution":{"observed_at":"2026-05-14T21:29:28.659964Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02595","last_updated":"2025-05-30T20:49:42Z","snapshot_observed_at":"2026-08-04T07:58:32.632698Z","submitted_at":"2024-12-03T17:28:50Z","title":"Nemotron-CC: Transforming Common Crawl into a Refined Long-Horizon Pretraining Dataset","version":2},"cited_work":{"arxiv_id":"2412.02595","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.02595","snapshot_observed_at":"2026-07-02T17:47:18.026339Z","title":"Nemotron-cc: Transforming common crawl into a refined long-horizon pretraining dataset.arXiv preprint arXiv:2412.02595","venue":null,"work_id":"bab220a8-ec16-4f03-9452-4eb35d618607","year":2024},"citing_paper":{"arxiv_id":"2605.19568","last_updated":"2026-05-19T09:13:49Z","snapshot_observed_at":"2026-08-01T10:27:19.636512Z","submitted_at":"2026-05-19T09:13:49Z","title":"m3BERT: A Modern, Multi-lingual, Matryoshka Bidirectional Encoder","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-20T06:03:28.169346Z"},"links":{"cited_paper":"/paper/2412.02595","citing_paper":"/paper/2605.19568"},"observation_digest":"sha256:86cadb7beb7128b31667264287d02803966484c4aec52aabeb1771bc3023a372","observation_id":"8cd980b6-3df3-42c6-b50e-09be98a73b4b","resolution":{"observed_at":"2026-05-20T06:08:05.061971Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02595","last_updated":"2025-05-30T20:49:42Z","snapshot_observed_at":"2026-08-04T07:58:32.632698Z","submitted_at":"2024-12-03T17:28:50Z","title":"Nemotron-CC: Transforming Common Crawl into a Refined Long-Horizon Pretraining Dataset","version":2},"cited_work":{"arxiv_id":"2412.02595","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.02595","snapshot_observed_at":"2026-07-02T17:47:18.026339Z","title":"Nemotron-cc: Transforming common crawl into a refined long-horizon pretraining dataset.arXiv preprint arXiv:2412.02595","venue":null,"work_id":"bab220a8-ec16-4f03-9452-4eb35d618607","year":2024},"citing_paper":{"arxiv_id":"2605.31268","last_updated":"2026-05-29T13:01:11Z","snapshot_observed_at":"2026-07-06T23:40:27.543522Z","submitted_at":"2026-05-29T13:01:11Z","title":"Mellum2 Technical Report","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-06-28T22:58:35.397914Z"},"links":{"cited_paper":"/paper/2412.02595","citing_paper":"/paper/2605.31268"},"observation_digest":"sha256:ddf38ca46bc809447970832332ba0bea8a9aa70e0d14d8812a239b65d58cc78a","observation_id":"5c3051a9-82ed-498d-83c7-55e60d72d298","resolution":{"observed_at":"2026-06-28T23:02:46.542162Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02595","last_updated":"2025-05-30T20:49:42Z","snapshot_observed_at":"2026-08-04T07:58:32.632698Z","submitted_at":"2024-12-03T17:28:50Z","title":"Nemotron-CC: Transforming Common Crawl into a Refined Long-Horizon Pretraining Dataset","version":2},"cited_work":{"arxiv_id":"2412.02595","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.02595","snapshot_observed_at":"2026-07-02T17:47:18.026339Z","title":"Nemotron-cc: Transforming common crawl into a refined long-horizon pretraining dataset.arXiv preprint arXiv:2412.02595","venue":null,"work_id":"bab220a8-ec16-4f03-9452-4eb35d618607","year":2024},"citing_paper":{"arxiv_id":"2606.07778","last_updated":"2026-06-05T18:43:14Z","snapshot_observed_at":"2026-08-01T08:55:54.849134Z","submitted_at":"2026-06-05T18:43:14Z","title":"Unlocking Latent Value: Taxonomy-Guided Recovery of High-Performing Data from Low-Tier Web Corpora","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-27T21:52:05.238295Z"},"links":{"cited_paper":"/paper/2412.02595","citing_paper":"/paper/2606.07778"},"observation_digest":"sha256:281299adc64be901658e9267280a890705ab07f788425d68da4dc55d6d4c761b","observation_id":"e455d5dd-c964-4600-9e17-2b0db77e64ad","resolution":{"observed_at":"2026-07-02T17:47:18.027832Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02595","last_updated":"2025-05-30T20:49:42Z","snapshot_observed_at":"2026-08-04T07:58:32.632698Z","submitted_at":"2024-12-03T17:28:50Z","title":"Nemotron-CC: Transforming Common Crawl into a Refined Long-Horizon Pretraining Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02595","snapshot_observed_at":"2026-08-01T11:39:23.513308Z","title":"Nemotron-CC: Transforming Common Crawl into a refined long-horizon pretraining dataset.arXiv preprint arXiv:2412.02595,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27230","last_updated":"2026-07-31T23:34:57Z","snapshot_observed_at":"2026-08-06T23:11:28.294466Z","submitted_at":"2026-07-22T06:51:51Z","title":"Multi-Head Attention Residuals","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-01T11:39:23.513308Z"},"links":{"cited_paper":"/paper/2412.02595","citing_paper":"/paper/2607.27230"},"observation_digest":"sha256:130e353121a37336f5409cf6bd80d52fe182d694713aaa4048d7bef47f3d3933","observation_id":"82f8a3b1-02fb-4705-8f95-28465eb28a87","resolution":{"observed_at":"2026-08-01T11:39:23.513308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02595","last_updated":"2025-05-30T20:49:42Z","snapshot_observed_at":"2026-08-04T07:58:32.632698Z","submitted_at":"2024-12-03T17:28:50Z","title":"Nemotron-CC: Transforming Common Crawl into a Refined Long-Horizon Pretraining Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02595","snapshot_observed_at":"2026-08-04T01:39:48.386899Z","title":"Nemotron-CC: Transforming Common Crawl into a refined long-horizon pretraining dataset.arXiv preprint arXiv:2412.02595,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27230","last_updated":"2026-07-31T23:34:57Z","snapshot_observed_at":"2026-08-06T23:11:28.294466Z","submitted_at":"2026-07-22T06:51:51Z","title":"Multi-Head Attention Residuals","version":2},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-04T01:39:48.386899Z"},"links":{"cited_paper":"/paper/2412.02595","citing_paper":"/paper/2607.27230"},"observation_digest":"sha256:6656aad253259a5e5c38ce8524d0dfea7f4fb71deca61f26b4629e79a36b77ad","observation_id":"a1f35164-2779-4fc8-84ae-617baf6f448c","resolution":{"observed_at":"2026-08-04T01:39:48.386899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02595","last_updated":"2025-05-30T20:49:42Z","snapshot_observed_at":"2026-08-04T07:58:32.632698Z","submitted_at":"2024-12-03T17:28:50Z","title":"Nemotron-CC: Transforming Common Crawl into a Refined Long-Horizon Pretraining Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02595","snapshot_observed_at":"2026-08-01T08:29:26.275192Z","title":"arXiv preprint arXiv:2412.02595 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27379","last_updated":"2026-07-29T18:37:14Z","snapshot_observed_at":"2026-08-06T22:55:57.490924Z","submitted_at":"2026-07-29T18:37:14Z","title":"HSS-Synth: Humanities and Social Sciences Data Synthesis for LLMs","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-01T08:29:26.275192Z"},"links":{"cited_paper":"/paper/2412.02595","citing_paper":"/paper/2607.27379"},"observation_digest":"sha256:6f30ef1d5bdb1b88d74ebebe0331589288e88d324295dfa9a9e0cb6b637eac1d","observation_id":"5630ac1b-8e16-4566-8c3c-34955054e99b","resolution":{"observed_at":"2026-08-01T08:29:26.275192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2412.02595/citation-record","integrity":"/paper/2412.02595/integrity","json":"/paper/2412.02595/citation-record.json","paper":"/paper/2412.02595"},"outbound":[],"paper":{"arxiv_id":"2412.02595","last_updated":"2025-05-30T20:49:42Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-04T07:58:32.632698Z","submitted_at":"2024-12-03T17:28:50Z","title":"Nemotron-CC: Transforming Common Crawl into a Refined Long-Horizon Pretraining Dataset"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 30 inbound Pith citation observations for arXiv:2412.02595."}