{"as_of":"2026-08-18T00:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e6721128aac040a9cc6b2416456f600b99993d7a95bdeff6e6790cd8c2135ee4","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":36,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T05:28:06.132947Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T18:40:03.364876Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2403.08763","last_updated":"2024-09-04T16:13:18Z","snapshot_observed_at":"2026-08-16T14:10:04.613423Z","submitted_at":"2024-03-13T17:58:57Z","title":"Simple and Scalable Strategies to Continually Pre-train Large Language Models","version":4},"cited_work":{"arxiv_id":"2403.08763","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.08763","snapshot_observed_at":"2026-07-04T18:40:03.364876Z","title":"Ibrahim, B","venue":null,"work_id":"74c611cb-0d0e-46d7-8fa5-ad6a5196fa2c","year":2024},"citing_paper":{"arxiv_id":"2406.11794","last_updated":"2025-04-21T17:48:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-17T17:42:57Z","title":"DataComp-LM: In search of the next generation of training sets for language models","version":4},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-05-17T22:58:16.523267Z"},"links":{"cited_paper":"/paper/2403.08763","citing_paper":"/paper/2406.11794"},"observation_digest":"sha256:436b35fa4193cf6a7fe859902a42995294717312bdc92644e1541e81f49ab790","observation_id":"7cefc8d9-d899-4498-999f-59cd614e20cb","resolution":{"observed_at":"2026-05-17T22:58:17.011400Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08763","last_updated":"2024-09-04T16:13:18Z","snapshot_observed_at":"2026-08-16T14:10:04.613423Z","submitted_at":"2024-03-13T17:58:57Z","title":"Simple and Scalable Strategies to Continually Pre-train Large Language Models","version":4},"cited_work":{"arxiv_id":"2403.08763","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.08763","snapshot_observed_at":"2026-07-04T18:40:03.364876Z","title":"Ibrahim, B","venue":null,"work_id":"74c611cb-0d0e-46d7-8fa5-ad6a5196fa2c","year":2024},"citing_paper":{"arxiv_id":"2409.04777","last_updated":"2026-05-20T09:55:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-07T09:37:19Z","title":"Optimization Hyper-parameter Laws for Large Language Models","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-23T20:45:31.427677Z"},"links":{"cited_paper":"/paper/2403.08763","citing_paper":"/paper/2409.04777"},"observation_digest":"sha256:19ff991273d0a245ea1e5748ec57bb621c2aacc297fc25486c2bc459bdb63067","observation_id":"9d1a3c41-6262-40ba-8d3a-7e2dcbd5aa77","resolution":{"observed_at":"2026-05-23T20:45:48.824942Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08763","last_updated":"2024-09-04T16:13:18Z","snapshot_observed_at":"2026-08-16T14:10:04.613423Z","submitted_at":"2024-03-13T17:58:57Z","title":"Simple and Scalable Strategies to Continually Pre-train Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08763","snapshot_observed_at":"2026-08-12T15:04:38.188161Z","title":"Simple and scalable strategies to continually pre-train large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15242","last_updated":"2024-11-22T02:55:20Z","snapshot_observed_at":"2026-08-14T05:08:15.609977Z","submitted_at":"2024-11-22T02:55:20Z","title":"The Zamba2 Suite: Technical Report","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-12T15:04:38.188161Z"},"links":{"cited_paper":"/paper/2403.08763","citing_paper":"/paper/2411.15242"},"observation_digest":"sha256:2a005dbc84a48066dbea54972383d4f30f5c04013199f4c68d2b4c0411d97ed1","observation_id":"f013f16e-9803-4efe-9f5e-55e1b6ac7ed8","resolution":{"observed_at":"2026-08-12T15:04:38.188161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08763","last_updated":"2024-09-04T16:13:18Z","snapshot_observed_at":"2026-08-16T14:10:04.613423Z","submitted_at":"2024-03-13T17:58:57Z","title":"Simple and Scalable Strategies to Continually Pre-train Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08763","snapshot_observed_at":"2026-08-12T04:34:12.054446Z","title":"Simple and scalable strategies to continually pre-train large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01253","last_updated":"2025-01-22T15:09:58Z","snapshot_observed_at":"2026-08-16T16:50:21.438663Z","submitted_at":"2024-12-02T08:22:56Z","title":"Yi-Lightning Technical Report","version":5},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T04:34:12.054446Z"},"links":{"cited_paper":"/paper/2403.08763","citing_paper":"/paper/2412.01253"},"observation_digest":"sha256:32451cd5d41a911a8430e13350880cfd2a066b83bcca720d121c67a40284ca4b","observation_id":"88bf8412-69da-4847-9787-b368f85d46f5","resolution":{"observed_at":"2026-08-12T04:34:12.054446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08763","last_updated":"2024-09-04T16:13:18Z","snapshot_observed_at":"2026-08-16T14:10:04.613423Z","submitted_at":"2024-03-13T17:58:57Z","title":"Simple and Scalable Strategies to Continually Pre-train Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08763","snapshot_observed_at":"2026-08-11T19:24:43.091039Z","title":"Simple and scalable strategies to continually pre-train large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.06712","last_updated":"2024-12-09T18:01:13Z","snapshot_observed_at":"2026-08-15T17:49:30.290283Z","submitted_at":"2024-12-09T18:01:13Z","title":"How to Merge Your Multimodal Models Over Time?","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T19:24:43.091039Z"},"links":{"cited_paper":"/paper/2403.08763","citing_paper":"/paper/2412.06712"},"observation_digest":"sha256:a7fa5cd152e2824442996e59fbf3edab8c47ca0c3ed3efe68334057dd6412c19","observation_id":"779549c5-4260-480a-b8f5-524388280719","resolution":{"observed_at":"2026-08-11T19:24:43.091039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08763","last_updated":"2024-09-04T16:13:18Z","snapshot_observed_at":"2026-08-16T14:10:04.613423Z","submitted_at":"2024-03-13T17:58:57Z","title":"Simple and Scalable Strategies to Continually Pre-train Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08763","snapshot_observed_at":"2026-08-11T13:19:18.786182Z","title":"Adam Ibrahim, Benjamin Th ´erien, Kshitij Gupta, Mats L Richter, Quentin Anthony, Timoth ´ee Lesort, Eugene Belilovsky, and Irina Rish","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.13337","last_updated":"2024-12-17T21:16:59Z","snapshot_observed_at":"2026-08-17T19:05:36.135261Z","submitted_at":"2024-12-17T21:16:59Z","title":"Unveiling the Secret Recipe: A Guide For Supervised Fine-Tuning Small LLMs","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T13:19:18.786182Z"},"links":{"cited_paper":"/paper/2403.08763","citing_paper":"/paper/2412.13337"},"observation_digest":"sha256:eb9310b895c8eabc4becc094eab633a20b8ab1dd175d9d0a6c4524e079e1b666","observation_id":"8fcd72c7-5c97-4060-ab9b-9ccbb8a3c978","resolution":{"observed_at":"2026-08-11T13:19:18.786182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08763","last_updated":"2024-09-04T16:13:18Z","snapshot_observed_at":"2026-08-16T14:10:04.613423Z","submitted_at":"2024-03-13T17:58:57Z","title":"Simple and Scalable Strategies to Continually Pre-train Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08763","snapshot_observed_at":"2026-08-11T01:04:35.150244Z","title":"Simple and scalable strategies to continually pre-train large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18966","last_updated":"2024-12-25T18:58:07Z","snapshot_observed_at":"2026-08-16T16:36:06.809575Z","submitted_at":"2024-12-25T18:58:07Z","title":"ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:35.150244Z"},"links":{"cited_paper":"/paper/2403.08763","citing_paper":"/paper/2412.18966"},"observation_digest":"sha256:414d867d82502ef5216312801e34ffe75b8dfa23c78768c3b874d2a229a77774","observation_id":"a122b23e-ac11-46a5-a1ea-d759b41a5827","resolution":{"observed_at":"2026-08-11T01:04:35.150244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08763","last_updated":"2024-09-04T16:13:18Z","snapshot_observed_at":"2026-08-16T14:10:04.613423Z","submitted_at":"2024-03-13T17:58:57Z","title":"Simple and Scalable Strategies to Continually Pre-train Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08763","snapshot_observed_at":"2026-08-10T23:12:21.442808Z","title":"Ibrahim, B","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.21068","last_updated":"2024-12-30T16:35:47Z","snapshot_observed_at":"2026-08-15T17:24:11.178615Z","submitted_at":"2024-12-30T16:35:47Z","title":"Finite Horizon Optimization: Framework and Applications","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:21.442808Z"},"links":{"cited_paper":"/paper/2403.08763","citing_paper":"/paper/2412.21068"},"observation_digest":"sha256:859cd11aadde140b11c5228ca90369276895e2289308106c80eabff66b6471da","observation_id":"8fea82ab-7e43-428e-8d50-3caf85992dce","resolution":{"observed_at":"2026-08-10T23:12:21.442808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08763","last_updated":"2024-09-04T16:13:18Z","snapshot_observed_at":"2026-08-16T14:10:04.613423Z","submitted_at":"2024-03-13T17:58:57Z","title":"Simple and Scalable Strategies to Continually Pre-train Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08763","snapshot_observed_at":"2026-08-10T20:43:45.334792Z","title":"Simple and scalable strategies to continually pre-train large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.07482","last_updated":"2025-05-20T17:09:53Z","snapshot_observed_at":"2026-08-16T18:33:37.341055Z","submitted_at":"2025-01-13T16:58:32Z","title":"TiEBe: Tracking Language Model Recall of Notable Worldwide Events Through Time","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T20:43:45.334792Z"},"links":{"cited_paper":"/paper/2403.08763","citing_paper":"/paper/2501.07482"},"observation_digest":"sha256:c1e2e2d7cd61301c5e7501645997548b8861e5df49263688cf8d58e7e7995720","observation_id":"9393201d-8b51-4e5f-97ba-83bd51ba4db2","resolution":{"observed_at":"2026-08-10T20:43:45.334792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08763","last_updated":"2024-09-04T16:13:18Z","snapshot_observed_at":"2026-08-16T14:10:04.613423Z","submitted_at":"2024-03-13T17:58:57Z","title":"Simple and Scalable Strategies to Continually Pre-train Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08763","snapshot_observed_at":"2026-08-08T17:01:36.120434Z","title":"L., Anthony, Q., Lesort, T., Belilovsky, E., and Rish, I","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06042","last_updated":"2025-05-26T18:48:37Z","snapshot_observed_at":"2026-08-17T07:23:32.938675Z","submitted_at":"2025-02-09T21:44:27Z","title":"Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-08T17:01:36.120434Z"},"links":{"cited_paper":"/paper/2403.08763","citing_paper":"/paper/2502.06042"},"observation_digest":"sha256:394c5a8b23469a415bd8f6274e23af6968f85da055ce9859984d74287305fa7a","observation_id":"32c3eda3-14ab-4ce6-820c-2666f8d054b3","resolution":{"observed_at":"2026-08-08T17:01:36.120434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08763","last_updated":"2024-09-04T16:13:18Z","snapshot_observed_at":"2026-08-16T14:10:04.613423Z","submitted_at":"2024-03-13T17:58:57Z","title":"Simple and Scalable Strategies to Continually Pre-train Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08763","snapshot_observed_at":"2026-08-16T05:28:06.132947Z","title":"Richter, Quentin Anthony, Timoth \\'e e Lesort, Eugene Belilovsky, and Irina Rish","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.20609","last_updated":"2025-04-29T10:19:05Z","snapshot_observed_at":"2026-08-16T13:58:09.245857Z","submitted_at":"2025-04-29T10:19:05Z","title":"WenyanGPT: A Large Language Model for Classical Chinese Tasks","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-16T05:28:06.132947Z"},"links":{"cited_paper":"/paper/2403.08763","citing_paper":"/paper/2504.20609"},"observation_digest":"sha256:c77eb336f26b3267af3ec4009cce0d18e671733610906ad07b1784976e1556ab","observation_id":"ef218ce0-69f0-4f5e-8d2c-c21dbc223ad5","resolution":{"observed_at":"2026-08-16T05:28:06.132947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08763","last_updated":"2024-09-04T16:13:18Z","snapshot_observed_at":"2026-08-16T14:10:04.613423Z","submitted_at":"2024-03-13T17:58:57Z","title":"Simple and Scalable Strategies to Continually Pre-train Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08763","snapshot_observed_at":"2026-08-16T00:58:14.802643Z","title":"Richter, Quentin Anthony, Timothée Lesort, Eugene Belilovsky, and Irina Rish","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02410","last_updated":"2025-05-08T22:55:18Z","snapshot_observed_at":"2026-08-17T17:24:12.205219Z","submitted_at":"2025-05-05T07:03:41Z","title":"Bielik 11B v2 Technical Report","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-16T00:58:14.802643Z"},"links":{"cited_paper":"/paper/2403.08763","citing_paper":"/paper/2505.02410"},"observation_digest":"sha256:6c7e1ae3b0ad93531b3cf637ed042f8fb886966eb071528069f10af6ca7e9797","observation_id":"971084e1-ad65-4afd-9984-61c550e5baeb","resolution":{"observed_at":"2026-08-16T00:58:14.802643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08763","last_updated":"2024-09-04T16:13:18Z","snapshot_observed_at":"2026-08-16T14:10:04.613423Z","submitted_at":"2024-03-13T17:58:57Z","title":"Simple and Scalable Strategies to Continually Pre-train Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08763","snapshot_observed_at":"2026-08-16T00:53:22.092014Z","title":"Richter, Quentin Anthony, Timothée Lesort, Eugene Belilovsky, and Irina Rish","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02550","last_updated":"2025-05-08T22:57:46Z","snapshot_observed_at":"2026-08-16T16:17:12.220673Z","submitted_at":"2025-05-05T10:39:51Z","title":"Bielik v3 Small: Technical Report","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-16T00:53:22.092014Z"},"links":{"cited_paper":"/paper/2403.08763","citing_paper":"/paper/2505.02550"},"observation_digest":"sha256:311d2849d556e0c48e5572998069c5128ee1300ba15ec0bf1e903c66c06bd900","observation_id":"b23974ec-96ff-4b76-93b3-f582f26594f0","resolution":{"observed_at":"2026-08-16T00:53:22.092014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08763","last_updated":"2024-09-04T16:13:18Z","snapshot_observed_at":"2026-08-16T14:10:04.613423Z","submitted_at":"2024-03-13T17:58:57Z","title":"Simple and Scalable Strategies to Continually Pre-train Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08763","snapshot_observed_at":"2026-08-15T22:55:45.874320Z","title":"Simple and scalable strategies to continually pre-train large language models.arXiv preprint arXiv:2403.08763, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05946","last_updated":"2025-06-05T11:13:42Z","snapshot_observed_at":"2026-08-17T23:09:36.366040Z","submitted_at":"2025-05-09T10:43:37Z","title":"Full-Parameter Continual Pretraining of Gemma2: Insights into Fluency and Domain Knowledge","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T22:55:45.874320Z"},"links":{"cited_paper":"/paper/2403.08763","citing_paper":"/paper/2505.05946"},"observation_digest":"sha256:452a82ed6919dada0a437e069b52fa5dedbca884f27307350e3a8f81d3ce060a","observation_id":"c87e7829-d4d4-42bb-b8a4-3c06c09805b7","resolution":{"observed_at":"2026-08-15T22:55:45.874320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08763","last_updated":"2024-09-04T16:13:18Z","snapshot_observed_at":"2026-08-16T14:10:04.613423Z","submitted_at":"2024-03-13T17:58:57Z","title":"Simple and Scalable Strategies to Continually Pre-train Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08763","snapshot_observed_at":"2026-08-15T20:36:39.784001Z","title":"Richter, Quentin Anthony, Timoth ´ee Lesort, Eugene Belilovsky, and Irina Rish","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12512","last_updated":"2025-05-18T18:23:50Z","snapshot_observed_at":"2026-08-17T20:38:39.522719Z","submitted_at":"2025-05-18T18:23:50Z","title":"Scalable Strategies for Continual Learning with Replay","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T20:36:39.784001Z"},"links":{"cited_paper":"/paper/2403.08763","citing_paper":"/paper/2505.12512"},"observation_digest":"sha256:7bc499e05bf27655761dd21eaa206763e8ff9e733d8898def8908bbe38fed47f","observation_id":"2c718bbd-17db-4aa6-b20e-c781404f3d96","resolution":{"observed_at":"2026-08-15T20:36:39.784001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08763","last_updated":"2024-09-04T16:13:18Z","snapshot_observed_at":"2026-08-16T14:10:04.613423Z","submitted_at":"2024-03-13T17:58:57Z","title":"Simple and Scalable Strategies to Continually Pre-train Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08763","snapshot_observed_at":"2026-08-07T10:50:51.041868Z","title":"Richter, Quentin Anthony, Timothée Lesort, Eugene Belilovsky, and Irina Rish","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04344","last_updated":"2025-06-04T18:02:07Z","snapshot_observed_at":"2026-08-15T22:24:29.920738Z","submitted_at":"2025-06-04T18:02:07Z","title":"GEM: Empowering LLM for both Embedding Generation and Language Understanding","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T10:50:51.041868Z"},"links":{"cited_paper":"/paper/2403.08763","citing_paper":"/paper/2506.04344"},"observation_digest":"sha256:53f0087885e562258fe860ade0ae0e7bf6a51e6e6c6cf7c42146a613cdf05eda","observation_id":"2a349dfa-8ce7-4ec9-9dcc-80c8a642da10","resolution":{"observed_at":"2026-08-07T10:50:51.041868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08763","last_updated":"2024-09-04T16:13:18Z","snapshot_observed_at":"2026-08-16T14:10:04.613423Z","submitted_at":"2024-03-13T17:58:57Z","title":"Simple and Scalable Strategies to Continually Pre-train Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08763","snapshot_observed_at":"2026-08-07T10:29:44.222974Z","title":"Simple and scalable strategies to continually pre-train large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05209","last_updated":"2025-06-05T16:21:30Z","snapshot_observed_at":"2026-08-09T07:25:20.673180Z","submitted_at":"2025-06-05T16:21:30Z","title":"The Common Pile v0.1: An 8TB Dataset of Public Domain and Openly Licensed Text","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:44.222974Z"},"links":{"cited_paper":"/paper/2403.08763","citing_paper":"/paper/2506.05209"},"observation_digest":"sha256:f781adadf63a366fca36ed7efb6d67883c7e20fbdce1ca36e63cd539e3b5ddc6","observation_id":"c26b75f9-a895-4929-9467-2237ca90adeb","resolution":{"observed_at":"2026-08-07T10:29:44.222974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08763","last_updated":"2024-09-04T16:13:18Z","snapshot_observed_at":"2026-08-16T14:10:04.613423Z","submitted_at":"2024-03-13T17:58:57Z","title":"Simple and Scalable Strategies to Continually Pre-train Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08763","snapshot_observed_at":"2026-08-07T04:21:41.944726Z","title":"Richter, Quentin Anthony, Timoth \\'e e Lesort, Eugene Belilovsky, and Irina Rish","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10896","last_updated":"2025-06-12T17:01:11Z","snapshot_observed_at":"2026-08-16T02:51:41.287539Z","submitted_at":"2025-06-12T17:01:11Z","title":"BioClinical ModernBERT: A State-of-the-Art Long-Context Encoder for Biomedical and Clinical NLP","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T04:21:41.944726Z"},"links":{"cited_paper":"/paper/2403.08763","citing_paper":"/paper/2506.10896"},"observation_digest":"sha256:79050df1130849e949ab09b320dae011af34f32291cb38e6ffd9f9f3b4b13163","observation_id":"3048fa1f-5a21-4bc3-a5d6-aa3a36ce037e","resolution":{"observed_at":"2026-08-07T04:21:41.944726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08763","last_updated":"2024-09-04T16:13:18Z","snapshot_observed_at":"2026-08-16T14:10:04.613423Z","submitted_at":"2024-03-13T17:58:57Z","title":"Simple and Scalable Strategies to Continually Pre-train Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08763","snapshot_observed_at":"2026-08-07T00:43:52.260130Z","title":"Simple and scalable strategies to continu- ally pre-train large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13187","last_updated":"2025-06-16T07:55:14Z","snapshot_observed_at":"2026-08-14T21:55:06.493665Z","submitted_at":"2025-06-16T07:55:14Z","title":"Dynamic Context-oriented Decomposition for Task-aware Low-rank Adaptation with Less Forgetting and Faster Convergence","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T00:43:52.260130Z"},"links":{"cited_paper":"/paper/2403.08763","citing_paper":"/paper/2506.13187"},"observation_digest":"sha256:7ae6119de956244a1569f54335b6e93ed753ab338aa30e4ad79c5ff3f75eb80a","observation_id":"07dc000e-6f66-4c22-ae45-3bb023404480","resolution":{"observed_at":"2026-08-07T00:43:52.260130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08763","last_updated":"2024-09-04T16:13:18Z","snapshot_observed_at":"2026-08-16T14:10:04.613423Z","submitted_at":"2024-03-13T17:58:57Z","title":"Simple and Scalable Strategies to Continually Pre-train Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08763","snapshot_observed_at":"2026-08-06T21:36:33.358434Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23762","last_updated":"2025-06-30T12:09:29Z","snapshot_observed_at":"2026-08-13T08:27:18.830708Z","submitted_at":"2025-06-30T12:09:29Z","title":"Software Engineering for Large Language Models: Research Status, Challenges and the Road Ahead","version":1},"reference_index":140,"source":"pdf_text","source_observed_at":"2026-08-06T21:36:33.358434Z"},"links":{"cited_paper":"/paper/2403.08763","citing_paper":"/paper/2506.23762"},"observation_digest":"sha256:61276a88bf29545b4de4b7232a1e5c8bdb0673360e0a83e3fbfe8a9b8251ca4e","observation_id":"038d3a02-3d8b-4bf6-af0a-ff42eb81bfff","resolution":{"observed_at":"2026-08-06T21:36:33.358434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08763","last_updated":"2024-09-04T16:13:18Z","snapshot_observed_at":"2026-08-16T14:10:04.613423Z","submitted_at":"2024-03-13T17:58:57Z","title":"Simple and Scalable Strategies to Continually Pre-train Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08763","snapshot_observed_at":"2026-08-06T18:33:59.479358Z","title":"Simple and Scalable Strategies to Continually Pre-train Large Language Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-14T12:26:49.480476Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T18:33:59.479358Z"},"links":{"cited_paper":"/paper/2403.08763","citing_paper":"/paper/2507.07955"},"observation_digest":"sha256:493b982548a492ea80ae877ce36a4292d825b08aef269d96188a53fc01465e07","observation_id":"0636fc25-2837-42bf-a493-1f01ffbe242e","resolution":{"observed_at":"2026-08-06T18:33:59.479358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08763","last_updated":"2024-09-04T16:13:18Z","snapshot_observed_at":"2026-08-16T14:10:04.613423Z","submitted_at":"2024-03-13T17:58:57Z","title":"Simple and Scalable Strategies to Continually Pre-train Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08763","snapshot_observed_at":"2026-08-15T17:30:10.099822Z","title":"L.; Anthony, Q.; Lesort, T.; Belilovsky, E.; and Rish, I","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12387","last_updated":"2025-08-17T14:50:23Z","snapshot_observed_at":"2026-08-16T13:53:05.201184Z","submitted_at":"2025-08-17T14:50:23Z","title":"ReaLM: Reflection-Enhanced Autonomous Reasoning with Small Language Models","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-15T17:30:10.099822Z"},"links":{"cited_paper":"/paper/2403.08763","citing_paper":"/paper/2508.12387"},"observation_digest":"sha256:a5f544ac92a43f17aa9cd61ae41680989b17aa030da72ff4ee13d2f75fee3dae","observation_id":"37f53f8d-f51c-490d-bc38-47243f20455b","resolution":{"observed_at":"2026-08-15T17:30:10.099822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08763","last_updated":"2024-09-04T16:13:18Z","snapshot_observed_at":"2026-08-16T14:10:04.613423Z","submitted_at":"2024-03-13T17:58:57Z","title":"Simple and Scalable Strategies to Continually Pre-train Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08763","snapshot_observed_at":"2026-08-03T00:15:37.298100Z","title":"Simple and scalable strategies to continually pre-train large language models.arXiv preprint arXiv:2403.08763,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.11137","last_updated":"2026-05-28T23:29:40Z","snapshot_observed_at":"2026-08-03T19:24:57.288331Z","submitted_at":"2026-02-11T18:49:26Z","title":"Weight Decay Improves Language Model Plasticity","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-03T00:15:37.298100Z"},"links":{"cited_paper":"/paper/2403.08763","citing_paper":"/paper/2602.11137"},"observation_digest":"sha256:6d659064a23d1dd0cc7a9974aee37f8a934f7dbfe7c411cb098b8dd25748a92d","observation_id":"dd450b25-3e02-456f-af4d-247139eba14d","resolution":{"observed_at":"2026-08-03T00:15:37.298100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08763","last_updated":"2024-09-04T16:13:18Z","snapshot_observed_at":"2026-08-16T14:10:04.613423Z","submitted_at":"2024-03-13T17:58:57Z","title":"Simple and Scalable Strategies to Continually Pre-train Large Language Models","version":4},"cited_work":{"arxiv_id":"2403.08763","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.08763","snapshot_observed_at":"2026-07-04T18:40:03.364876Z","title":"Ibrahim, B","venue":null,"work_id":"74c611cb-0d0e-46d7-8fa5-ad6a5196fa2c","year":2024},"citing_paper":{"arxiv_id":"2605.05365","last_updated":"2026-05-06T18:44:08Z","snapshot_observed_at":"2026-08-16T18:16:47.637991Z","submitted_at":"2026-05-06T18:44:08Z","title":"ZAYA1-8B Technical Report","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-05-08T17:36:37.182196Z"},"links":{"cited_paper":"/paper/2403.08763","citing_paper":"/paper/2605.05365"},"observation_digest":"sha256:452e269a4254163f22125c6df723ba3dbc10c8097bca84fabf795638e9ae29a6","observation_id":"34d4f8d6-f342-4a48-813e-0626191389b9","resolution":{"observed_at":"2026-05-11T17:26:04.976053Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08763","last_updated":"2024-09-04T16:13:18Z","snapshot_observed_at":"2026-08-16T14:10:04.613423Z","submitted_at":"2024-03-13T17:58:57Z","title":"Simple and Scalable Strategies to Continually Pre-train Large Language Models","version":4},"cited_work":{"arxiv_id":"2403.08763","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.08763","snapshot_observed_at":"2026-07-04T18:40:03.364876Z","title":"Ibrahim, B","venue":null,"work_id":"74c611cb-0d0e-46d7-8fa5-ad6a5196fa2c","year":2024},"citing_paper":{"arxiv_id":"2605.11255","last_updated":"2026-05-11T21:27:53Z","snapshot_observed_at":"2026-07-06T23:23:06.755816Z","submitted_at":"2026-05-11T21:27:53Z","title":"HEBATRON: A Hebrew-Specialized Open-Weight Mixture-of-Experts Language Model","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-13T01:50:26.432038Z"},"links":{"cited_paper":"/paper/2403.08763","citing_paper":"/paper/2605.11255"},"observation_digest":"sha256:33004814e3945ea97215efad3dddfbd59eac08dee0e2a6c423027e1ece26ee5e","observation_id":"8d2d12dd-2b34-40d7-84cc-588f2a95cd6a","resolution":{"observed_at":"2026-05-13T01:52:05.147067Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08763","last_updated":"2024-09-04T16:13:18Z","snapshot_observed_at":"2026-08-16T14:10:04.613423Z","submitted_at":"2024-03-13T17:58:57Z","title":"Simple and Scalable Strategies to Continually Pre-train Large Language Models","version":4},"cited_work":{"arxiv_id":"2403.08763","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.08763","snapshot_observed_at":"2026-07-04T18:40:03.364876Z","title":"Ibrahim, B","venue":null,"work_id":"74c611cb-0d0e-46d7-8fa5-ad6a5196fa2c","year":2024},"citing_paper":{"arxiv_id":"2605.18083","last_updated":"2026-05-18T08:59:08Z","snapshot_observed_at":"2026-08-15T15:52:19.737316Z","submitted_at":"2026-05-18T08:59:08Z","title":"A Data-Efficient Path to Multilingual LLMs: Language Expansion via Post-training PARAM$\\Delta$ Integration into Upcycled MoE","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-05-20T11:09:22.027588Z"},"links":{"cited_paper":"/paper/2403.08763","citing_paper":"/paper/2605.18083"},"observation_digest":"sha256:c68aa0afb8ae1d044c8de2b8bf56794b05ae2c6d133b34b6206e94810c338ed8","observation_id":"a205da5e-2bc2-4581-91a4-1cd302fa003d","resolution":{"observed_at":"2026-05-20T11:13:13.593293Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08763","last_updated":"2024-09-04T16:13:18Z","snapshot_observed_at":"2026-08-16T14:10:04.613423Z","submitted_at":"2024-03-13T17:58:57Z","title":"Simple and Scalable Strategies to Continually Pre-train Large Language Models","version":4},"cited_work":{"arxiv_id":"2403.08763","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.08763","snapshot_observed_at":"2026-07-04T18:40:03.364876Z","title":"Ibrahim, B","venue":null,"work_id":"74c611cb-0d0e-46d7-8fa5-ad6a5196fa2c","year":2024},"citing_paper":{"arxiv_id":"2605.20390","last_updated":"2026-05-19T18:40:20Z","snapshot_observed_at":"2026-08-15T06:04:24.347665Z","submitted_at":"2026-05-19T18:40:20Z","title":"STELLAR: Scaling 3D Perception Large Models for Autonomous Driving","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-05-21T07:09:55.202236Z"},"links":{"cited_paper":"/paper/2403.08763","citing_paper":"/paper/2605.20390"},"observation_digest":"sha256:9ec2dc4a45f03725117358622ac73ef74ae936f82527935a8df30bdd5b26fea1","observation_id":"7e091b5d-6cf6-4b4f-b32b-53610f973f6f","resolution":{"observed_at":"2026-05-21T07:14:02.656832Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08763","last_updated":"2024-09-04T16:13:18Z","snapshot_observed_at":"2026-08-16T14:10:04.613423Z","submitted_at":"2024-03-13T17:58:57Z","title":"Simple and Scalable Strategies to Continually Pre-train Large Language Models","version":4},"cited_work":{"arxiv_id":"2403.08763","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.08763","snapshot_observed_at":"2026-07-04T18:40:03.364876Z","title":"Ibrahim, B","venue":null,"work_id":"74c611cb-0d0e-46d7-8fa5-ad6a5196fa2c","year":2024},"citing_paper":{"arxiv_id":"2605.27445","last_updated":"2026-05-23T17:46:47Z","snapshot_observed_at":"2026-08-12T16:09:48.381768Z","submitted_at":"2026-05-23T17:46:47Z","title":"RAGe: A Retrieval-Augmented Generation Evaluation Framework","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-30T12:16:19.767335Z"},"links":{"cited_paper":"/paper/2403.08763","citing_paper":"/paper/2605.27445"},"observation_digest":"sha256:3e3222e1683d7dff1a597b11bad2e46a7dd1c7ac1594120aab8997f3c72539d5","observation_id":"c341e0be-7e93-4fa5-ae6b-ab7e07f9e87c","resolution":{"observed_at":"2026-06-30T12:24:39.979296Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08763","last_updated":"2024-09-04T16:13:18Z","snapshot_observed_at":"2026-08-16T14:10:04.613423Z","submitted_at":"2024-03-13T17:58:57Z","title":"Simple and Scalable Strategies to Continually Pre-train Large Language Models","version":4},"cited_work":{"arxiv_id":"2403.08763","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.08763","snapshot_observed_at":"2026-07-04T18:40:03.364876Z","title":"Ibrahim, B","venue":null,"work_id":"74c611cb-0d0e-46d7-8fa5-ad6a5196fa2c","year":2024},"citing_paper":{"arxiv_id":"2606.13477","last_updated":"2026-06-11T15:29:56Z","snapshot_observed_at":"2026-08-15T00:13:16.450153Z","submitted_at":"2026-06-11T15:29:56Z","title":"SupraBench: A Benchmark for Supramolecular Chemistry","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-06-27T07:34:11.596337Z"},"links":{"cited_paper":"/paper/2403.08763","citing_paper":"/paper/2606.13477"},"observation_digest":"sha256:e83574e392a9e2b7f23ac71507eeb1cbcd2da4b35f47de70d90e363ce9315f0a","observation_id":"1ba6105b-ce2c-44ce-8b0c-473255862c57","resolution":{"observed_at":"2026-07-03T13:48:20.839464Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08763","last_updated":"2024-09-04T16:13:18Z","snapshot_observed_at":"2026-08-16T14:10:04.613423Z","submitted_at":"2024-03-13T17:58:57Z","title":"Simple and Scalable Strategies to Continually Pre-train Large Language Models","version":4},"cited_work":{"arxiv_id":"2403.08763","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.08763","snapshot_observed_at":"2026-07-04T18:40:03.364876Z","title":"Ibrahim, B","venue":null,"work_id":"74c611cb-0d0e-46d7-8fa5-ad6a5196fa2c","year":2024},"citing_paper":{"arxiv_id":"2606.16517","last_updated":"2026-06-30T13:49:08Z","snapshot_observed_at":"2026-08-12T12:06:04.388020Z","submitted_at":"2026-06-15T10:19:49Z","title":"How Post-Training Shapes Biological Reasoning Models","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-07-01T07:48:31.110861Z"},"links":{"cited_paper":"/paper/2403.08763","citing_paper":"/paper/2606.16517"},"observation_digest":"sha256:94f98a78eebf9ae6ca10f475c0eb5cc2e72c72b2181e6f554ae3c3f4d0381c67","observation_id":"0e975219-56d7-4054-bb91-6b67d87a5fb2","resolution":{"observed_at":"2026-07-01T07:55:31.044759Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08763","last_updated":"2024-09-04T16:13:18Z","snapshot_observed_at":"2026-08-16T14:10:04.613423Z","submitted_at":"2024-03-13T17:58:57Z","title":"Simple and Scalable Strategies to Continually Pre-train Large Language Models","version":4},"cited_work":{"arxiv_id":"2403.08763","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.08763","snapshot_observed_at":"2026-07-04T18:40:03.364876Z","title":"Ibrahim, B","venue":null,"work_id":"74c611cb-0d0e-46d7-8fa5-ad6a5196fa2c","year":2024},"citing_paper":{"arxiv_id":"2606.24320","last_updated":"2026-06-25T20:48:22Z","snapshot_observed_at":"2026-07-06T23:58:54.018557Z","submitted_at":"2026-06-23T08:57:34Z","title":"ZONOS2 Technical Report","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-06-25T22:37:15.072758Z"},"links":{"cited_paper":"/paper/2403.08763","citing_paper":"/paper/2606.24320"},"observation_digest":"sha256:874dcaac371cced44dc859ef3c010ce3c477adc683059796c8d56f3de709d0de","observation_id":"23891e67-e3e1-4a76-8c8e-c339770ca2e6","resolution":{"observed_at":"2026-07-04T18:40:03.366519Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08763","last_updated":"2024-09-04T16:13:18Z","snapshot_observed_at":"2026-08-16T14:10:04.613423Z","submitted_at":"2024-03-13T17:58:57Z","title":"Simple and Scalable Strategies to Continually Pre-train Large Language Models","version":4},"cited_work":{"arxiv_id":"2403.08763","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.08763","snapshot_observed_at":"2026-07-04T18:40:03.364876Z","title":"Ibrahim, B","venue":null,"work_id":"74c611cb-0d0e-46d7-8fa5-ad6a5196fa2c","year":2024},"citing_paper":{"arxiv_id":"2606.24320","last_updated":"2026-06-25T20:48:22Z","snapshot_observed_at":"2026-07-06T23:58:54.018557Z","submitted_at":"2026-06-23T08:57:34Z","title":"ZONOS2 Technical Report","version":2},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-06-29T02:07:31.791835Z"},"links":{"cited_paper":"/paper/2403.08763","citing_paper":"/paper/2606.24320"},"observation_digest":"sha256:d47356f19d6543a3fcfe8f17a1bd37d3df4b90acbfa29d92b8cb27672c45640c","observation_id":"7d2d0d6a-5fad-4d9c-88a2-1a6fc430256f","resolution":{"observed_at":"2026-07-01T18:15:58.908150Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08763","last_updated":"2024-09-04T16:13:18Z","snapshot_observed_at":"2026-08-16T14:10:04.613423Z","submitted_at":"2024-03-13T17:58:57Z","title":"Simple and Scalable Strategies to Continually Pre-train Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08763","snapshot_observed_at":"2026-07-14T08:04:06.432613Z","title":"arXiv preprint arXiv:2403.08763 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10959","last_updated":"2026-07-12T23:24:42Z","snapshot_observed_at":"2026-08-17T22:49:12.366394Z","submitted_at":"2026-07-12T23:24:42Z","title":"WSqD: A Horizon-Free Learning Rate Schedule for Large Model Training","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-07-14T08:04:06.432613Z"},"links":{"cited_paper":"/paper/2403.08763","citing_paper":"/paper/2607.10959"},"observation_digest":"sha256:c2549f694e964d024d96cc78df59f351f209659cb1c2d23dd111363cb45dbe3d","observation_id":"708e1389-ec1e-47d4-acc4-1a029c23e117","resolution":{"observed_at":"2026-07-14T08:04:06.432613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08763","last_updated":"2024-09-04T16:13:18Z","snapshot_observed_at":"2026-08-16T14:10:04.613423Z","submitted_at":"2024-03-13T17:58:57Z","title":"Simple and Scalable Strategies to Continually Pre-train Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08763","snapshot_observed_at":"2026-08-01T09:51:54.198135Z","title":"arXiv preprint arXiv:2403.08763 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27308","last_updated":"2026-07-29T17:49:04Z","snapshot_observed_at":"2026-08-05T10:53:49.344314Z","submitted_at":"2026-07-29T17:49:04Z","title":"ZUNA1.1: A more flexible EEG foundation model for Denoising and Super-resolution","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-01T09:51:54.198135Z"},"links":{"cited_paper":"/paper/2403.08763","citing_paper":"/paper/2607.27308"},"observation_digest":"sha256:9f925da85f5a1ecee8cd1f34d92ee64f27b0e52b2de7e6cd5b7fc87929617fc9","observation_id":"47902dca-dd64-4e65-88e4-40680c942b8f","resolution":{"observed_at":"2026-08-01T09:51:54.198135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08763","last_updated":"2024-09-04T16:13:18Z","snapshot_observed_at":"2026-08-16T14:10:04.613423Z","submitted_at":"2024-03-13T17:58:57Z","title":"Simple and Scalable Strategies to Continually Pre-train Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08763","snapshot_observed_at":"2026-08-07T12:24:00.233555Z","title":"Richter, Quentin Anthony, Timothée Lesort, Eugene Belilovsky, and Irina Rish","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06216","last_updated":"2026-08-12T04:11:22Z","snapshot_observed_at":"2026-08-17T21:47:43.806306Z","submitted_at":"2026-08-06T16:07:26Z","title":"Continual Learning in Transition","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T12:24:00.233555Z"},"links":{"cited_paper":"/paper/2403.08763","citing_paper":"/paper/2608.06216"},"observation_digest":"sha256:0edb3ece5417ab6fbc2d3bac8bb175806a7e13392de06cab4a013bbc0298a5b0","observation_id":"15dc99fc-9770-442d-ba99-c3e8b7bf4550","resolution":{"observed_at":"2026-08-07T12:24:00.233555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08763","last_updated":"2024-09-04T16:13:18Z","snapshot_observed_at":"2026-08-16T14:10:04.613423Z","submitted_at":"2024-03-13T17:58:57Z","title":"Simple and Scalable Strategies to Continually Pre-train Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08763","snapshot_observed_at":"2026-08-15T14:38:35.380281Z","title":"Richter, Quentin Anthony, Timothée Lesort, Eugene Belilovsky, and Irina Rish","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06216","last_updated":"2026-08-12T04:11:22Z","snapshot_observed_at":"2026-08-17T21:47:43.806306Z","submitted_at":"2026-08-06T16:07:26Z","title":"Continual Learning in Transition","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-15T14:38:35.380281Z"},"links":{"cited_paper":"/paper/2403.08763","citing_paper":"/paper/2608.06216"},"observation_digest":"sha256:56a64b3ef8c298275e60ddc55f6ef1b9ff40886e183dbbb4afe08094b00d0fec","observation_id":"f6991873-2ff5-4e28-9cc5-bf0e384fdfc1","resolution":{"observed_at":"2026-08-15T14:38:35.380281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2403.08763/citation-record","integrity":"/paper/2403.08763/integrity","json":"/paper/2403.08763/citation-record.json","paper":"/paper/2403.08763"},"outbound":[],"paper":{"arxiv_id":"2403.08763","last_updated":"2024-09-04T16:13:18Z","latest_version":4,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-16T14:10:04.613423Z","submitted_at":"2024-03-13T17:58:57Z","title":"Simple and Scalable Strategies to Continually Pre-train Large Language Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 36 inbound Pith citation observations for arXiv:2403.08763."}