{"as_of":"2026-08-19T08:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:819904233ee8e69bd58b661857cd68202d53a6cad85bf42ff244841e7b44bf55","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":31,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T11:37:10.174992Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T18:40:03.356996Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2308.04014","last_updated":"2023-09-06T23:13:07Z","snapshot_observed_at":"2026-08-18T13:13:10.840816Z","submitted_at":"2023-08-08T03:18:18Z","title":"Continual Pre-Training of Large Language Models: How to (re)warm your model?","version":2},"cited_work":{"arxiv_id":"2308.04014","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.04014","snapshot_observed_at":"2026-07-04T18:40:03.356996Z","title":"Continual pre-training of large language models: How to (re) warm your model?","venue":null,"work_id":"881d21e0-b9b0-4031-a085-cf950213fe5e","year":2023},"citing_paper":{"arxiv_id":"2310.10631","last_updated":"2024-03-15T19:14:39Z","snapshot_observed_at":"2026-08-16T13:51:18.629241Z","submitted_at":"2023-10-16T17:54:07Z","title":"Llemma: An Open Language Model For Mathematics","version":3},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-05-19T08:17:46.055279Z"},"links":{"cited_paper":"/paper/2308.04014","citing_paper":"/paper/2310.10631"},"observation_digest":"sha256:b8c9ee4f5e259c22ec5d7cbeaed99373c6bb97305be4ae0d5c0d00eade09bd06","observation_id":"c5301845-833a-46fd-8dab-cabb8b2d7289","resolution":{"observed_at":"2026-05-19T08:17:46.396304Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.04014","last_updated":"2023-09-06T23:13:07Z","snapshot_observed_at":"2026-08-18T13:13:10.840816Z","submitted_at":"2023-08-08T03:18:18Z","title":"Continual Pre-Training of Large Language Models: How to (re)warm your model?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.04014","snapshot_observed_at":"2026-08-12T21:22:22.001463Z","title":"Richter, Quentin Anthony, Eugene Belilovsky, Irina Rish, and Timothée Lesort","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.08968","last_updated":"2024-11-13T19:02:36Z","snapshot_observed_at":"2026-08-16T16:38:20.297580Z","submitted_at":"2024-11-13T19:02:36Z","title":"Sparse Upcycling: Inference Inefficient Finetuning","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-12T21:22:22.001463Z"},"links":{"cited_paper":"/paper/2308.04014","citing_paper":"/paper/2411.08968"},"observation_digest":"sha256:daccde875e878c2f45f41bec37bb1d0addcdd7bb61e08cc10fc2a87f3ca48f8f","observation_id":"f09bb21c-04c7-4982-b59d-0b0cf85da29c","resolution":{"observed_at":"2026-08-12T21:22:22.001463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.04014","last_updated":"2023-09-06T23:13:07Z","snapshot_observed_at":"2026-08-18T13:13:10.840816Z","submitted_at":"2023-08-08T03:18:18Z","title":"Continual Pre-Training of Large Language Models: How to (re)warm your model?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.04014","snapshot_observed_at":"2026-08-10T21:51:13.963790Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.04062","last_updated":"2025-01-07T10:39:14Z","snapshot_observed_at":"2026-08-15T11:44:16.454938Z","submitted_at":"2025-01-07T10:39:14Z","title":"ChronoLLM: A Framework for Customizing Large Language Model for Digital Twins generalization based on PyChrono","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-10T21:51:13.963790Z"},"links":{"cited_paper":"/paper/2308.04014","citing_paper":"/paper/2501.04062"},"observation_digest":"sha256:f66ec2a1c5fabe762a2389e00c7d6167a868fbac1c3f47e9b3d8ac4dfd311473","observation_id":"16865331-98b1-4acd-ad22-e5fad726a01a","resolution":{"observed_at":"2026-08-10T21:51:13.963790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.04014","last_updated":"2023-09-06T23:13:07Z","snapshot_observed_at":"2026-08-18T13:13:10.840816Z","submitted_at":"2023-08-08T03:18:18Z","title":"Continual Pre-Training of Large Language Models: How to (re)warm your model?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.04014","snapshot_observed_at":"2026-08-10T19:48:29.247682Z","title":"Richter, Quentin Anthony, Eugene Belilovsky, Irina Rish, and Timoth \\' e e Lesort","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.09706","last_updated":"2025-05-25T08:54:05Z","snapshot_observed_at":"2026-08-16T16:50:19.494422Z","submitted_at":"2025-01-16T17:58:32Z","title":"Domain Adaptation of Foundation LLMs for e-Commerce","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-10T19:48:29.247682Z"},"links":{"cited_paper":"/paper/2308.04014","citing_paper":"/paper/2501.09706"},"observation_digest":"sha256:3341daa297239c41db9b9cebcfe8a3d45900a123cd3bcc4cd17de05b23801f0f","observation_id":"e9f3f51e-c284-4f2e-b6ec-0c2672828d61","resolution":{"observed_at":"2026-08-10T19:48:29.247682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.04014","last_updated":"2023-09-06T23:13:07Z","snapshot_observed_at":"2026-08-18T13:13:10.840816Z","submitted_at":"2023-08-08T03:18:18Z","title":"Continual Pre-Training of Large Language Models: How to (re)warm your model?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.04014","snapshot_observed_at":"2026-08-16T11:37:10.174992Z","title":"Continual pre-training of large language models: How to (re) warm your model?arXiv preprint arXiv:2308.04014 , 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.15120","last_updated":"2025-08-21T06:06:39Z","snapshot_observed_at":"2026-08-18T12:49:15.212687Z","submitted_at":"2025-04-21T14:17:25Z","title":"Kuwain 1.5B: An Arabic SLM via Language Injection","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T11:37:10.174992Z"},"links":{"cited_paper":"/paper/2308.04014","citing_paper":"/paper/2504.15120"},"observation_digest":"sha256:a9abad7a8a99d6322c2051349847207df3a165dd8dd4fdb7863493628cd4a61e","observation_id":"adff1211-86d9-492c-b82f-6e1c5aa72b46","resolution":{"observed_at":"2026-08-16T11:37:10.174992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.04014","last_updated":"2023-09-06T23:13:07Z","snapshot_observed_at":"2026-08-18T13:13:10.840816Z","submitted_at":"2023-08-08T03:18:18Z","title":"Continual Pre-Training of Large Language Models: How to (re)warm your model?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.04014","snapshot_observed_at":"2026-08-16T10:47:47.500876Z","title":"Continual pre-training of large language models: How to (re) warm your model?","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.17315","last_updated":"2025-04-24T07:17:59Z","snapshot_observed_at":"2026-08-18T13:13:40.535175Z","submitted_at":"2025-04-24T07:17:59Z","title":"DIMT25@ICDAR2025: HW-TSC's End-to-End Document Image Machine Translation System Leveraging Large Vision-Language Model","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T10:47:47.500876Z"},"links":{"cited_paper":"/paper/2308.04014","citing_paper":"/paper/2504.17315"},"observation_digest":"sha256:ce268aef7d37ac1c996fdc310ef6a9ff6c200762947c259113a09d501ee327e8","observation_id":"9e75d4c4-e974-4390-91f0-802c0112428e","resolution":{"observed_at":"2026-08-16T10:47:47.500876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.04014","last_updated":"2023-09-06T23:13:07Z","snapshot_observed_at":"2026-08-18T13:13:10.840816Z","submitted_at":"2023-08-08T03:18:18Z","title":"Continual Pre-Training of Large Language Models: How to (re)warm your model?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.04014","snapshot_observed_at":"2026-08-16T05:28:06.108062Z","title":"Richter, Quentin G","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.20609","last_updated":"2025-04-29T10:19:05Z","snapshot_observed_at":"2026-08-18T13:13:39.110518Z","submitted_at":"2025-04-29T10:19:05Z","title":"WenyanGPT: A Large Language Model for Classical Chinese Tasks","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-16T05:28:06.108062Z"},"links":{"cited_paper":"/paper/2308.04014","citing_paper":"/paper/2504.20609"},"observation_digest":"sha256:652c84dc1031a60098157c171e40f27fbaf2b1df083a984e70c74dc38749b1a9","observation_id":"de5b615b-9b21-455f-b664-3f61993c92e3","resolution":{"observed_at":"2026-08-16T05:28:06.108062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.04014","last_updated":"2023-09-06T23:13:07Z","snapshot_observed_at":"2026-08-18T13:13:10.840816Z","submitted_at":"2023-08-08T03:18:18Z","title":"Continual Pre-Training of Large Language Models: How to (re)warm your model?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.04014","snapshot_observed_at":"2026-08-16T04:51:30.062833Z","title":"Richter, Quentin Anthony, Eugene Belilovsky, Irina Rish, and Timothée Lesort","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.00263","last_updated":"2025-05-01T03:07:30Z","snapshot_observed_at":"2026-08-18T02:28:48.102190Z","submitted_at":"2025-05-01T03:07:30Z","title":"EnronQA: Towards Personalized RAG over Private Documents","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T04:51:30.062833Z"},"links":{"cited_paper":"/paper/2308.04014","citing_paper":"/paper/2505.00263"},"observation_digest":"sha256:e7bdc94b6a73669aa5c5b40386e4264bd795dc787a64b0af6ab78262e94d3343","observation_id":"493bde02-200f-426a-9ae8-9b5ec1aabcef","resolution":{"observed_at":"2026-08-16T04:51:30.062833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.04014","last_updated":"2023-09-06T23:13:07Z","snapshot_observed_at":"2026-08-18T13:13:10.840816Z","submitted_at":"2023-08-08T03:18:18Z","title":"Continual Pre-Training of Large Language Models: How to (re)warm your model?","version":2},"cited_work":{"arxiv_id":"2308.04014","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.04014","snapshot_observed_at":"2026-07-04T18:40:03.356996Z","title":"Continual pre-training of large language models: How to (re) warm your model?","venue":null,"work_id":"881d21e0-b9b0-4031-a085-cf950213fe5e","year":2023},"citing_paper":{"arxiv_id":"2505.06907","last_updated":"2026-05-18T08:23:00Z","snapshot_observed_at":"2026-08-13T00:16:41.097127Z","submitted_at":"2025-05-11T08:57:53Z","title":"A Survey on Foundation Models for Personalized Federated Intelligence","version":2},"reference_index":145,"source":"pdf_text","source_observed_at":"2026-05-22T15:32:15.293888Z"},"links":{"cited_paper":"/paper/2308.04014","citing_paper":"/paper/2505.06907"},"observation_digest":"sha256:e323f6393a64c369b749e09f5a747284d8fbaaed465acbf99e460fe7d24d33bf","observation_id":"601c7a09-2686-4105-9054-b674a8c066a1","resolution":{"observed_at":"2026-05-22T15:34:57.809940Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.04014","last_updated":"2023-09-06T23:13:07Z","snapshot_observed_at":"2026-08-18T13:13:10.840816Z","submitted_at":"2023-08-08T03:18:18Z","title":"Continual Pre-Training of Large Language Models: How to (re)warm your model?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.04014","snapshot_observed_at":"2026-08-15T22:14:19.146891Z","title":"L., Anthony, Q., Belilovsky, E., Rish, I., and Lesort, T","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.07796","last_updated":"2025-06-19T10:38:17Z","snapshot_observed_at":"2026-08-18T13:14:20.005435Z","submitted_at":"2025-05-12T17:47:32Z","title":"Learning Dynamics in Continual Pre-Training for Large Language Models","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-15T22:14:19.146891Z"},"links":{"cited_paper":"/paper/2308.04014","citing_paper":"/paper/2505.07796"},"observation_digest":"sha256:22100de51270769bd2a5bc2f46088ebc469e2791270ec1f1186c1a185da85664","observation_id":"8f197b83-e306-4a0c-9dcb-19b67cd9a90b","resolution":{"observed_at":"2026-08-15T22:14:19.146891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.04014","last_updated":"2023-09-06T23:13:07Z","snapshot_observed_at":"2026-08-18T13:13:10.840816Z","submitted_at":"2023-08-08T03:18:18Z","title":"Continual Pre-Training of Large Language Models: How to (re)warm your model?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.04014","snapshot_observed_at":"2026-08-06T23:34:58.797431Z","title":"Continual pre-training of large language models: How to (re)warm your model?","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17055","last_updated":"2025-06-20T15:06:44Z","snapshot_observed_at":"2026-08-17T23:20:34.369358Z","submitted_at":"2025-06-20T15:06:44Z","title":"Universal Music Representations? Evaluating Foundation Models on World Music Corpora","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:58.797431Z"},"links":{"cited_paper":"/paper/2308.04014","citing_paper":"/paper/2506.17055"},"observation_digest":"sha256:33653446506f9847c78711877fc767bbafacb1289e57702b89be85dd9b1f1490","observation_id":"b848ad5b-8d1d-4b90-bc5f-7b1852254379","resolution":{"observed_at":"2026-08-06T23:34:58.797431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.04014","last_updated":"2023-09-06T23:13:07Z","snapshot_observed_at":"2026-08-18T13:13:10.840816Z","submitted_at":"2023-08-08T03:18:18Z","title":"Continual Pre-Training of Large Language Models: How to (re)warm your model?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.04014","snapshot_observed_at":"2026-08-15T19:06:07.406000Z","title":"Continual pre-training of large language models: How to (re)warm your model?","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17818","last_updated":"2025-06-21T21:16:39Z","snapshot_observed_at":"2026-08-19T08:12:18.050492Z","submitted_at":"2025-06-21T21:16:39Z","title":"CultureMERT: Continual Pre-Training for Cross-Cultural Music Representation Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T19:06:07.406000Z"},"links":{"cited_paper":"/paper/2308.04014","citing_paper":"/paper/2506.17818"},"observation_digest":"sha256:9b17eabada8257f8d5012958b7a0a3d425dafa50f6aac21e8d4a44df456875cb","observation_id":"5d159340-43fd-451e-8eb1-9b15311bfe25","resolution":{"observed_at":"2026-08-15T19:06:07.406000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.04014","last_updated":"2023-09-06T23:13:07Z","snapshot_observed_at":"2026-08-18T13:13:10.840816Z","submitted_at":"2023-08-08T03:18:18Z","title":"Continual Pre-Training of Large Language Models: How to (re)warm your model?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.04014","snapshot_observed_at":"2026-08-05T13:24:36.670881Z","title":"Gupta, B","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.00679","last_updated":"2025-08-31T03:22:54Z","snapshot_observed_at":"2026-08-14T07:56:27.629109Z","submitted_at":"2025-08-31T03:22:54Z","title":"Router Upcycling: Leveraging Mixture-of-Routers in Mixture-of-Experts Upcycling","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T13:24:36.670881Z"},"links":{"cited_paper":"/paper/2308.04014","citing_paper":"/paper/2509.00679"},"observation_digest":"sha256:ad919338258ee637a0393e73ba3394591cd6f471ae82f1c5c43d0160b5630ccc","observation_id":"4eabadc4-db22-4775-b454-37d42edf1f43","resolution":{"observed_at":"2026-08-05T13:24:36.670881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.04014","last_updated":"2023-09-06T23:13:07Z","snapshot_observed_at":"2026-08-18T13:13:10.840816Z","submitted_at":"2023-08-08T03:18:18Z","title":"Continual Pre-Training of Large Language Models: How to (re)warm your model?","version":2},"cited_work":{"arxiv_id":"2308.04014","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.04014","snapshot_observed_at":"2026-07-04T18:40:03.356996Z","title":"Continual pre-training of large language models: How to (re) warm your model?","venue":null,"work_id":"881d21e0-b9b0-4031-a085-cf950213fe5e","year":2023},"citing_paper":{"arxiv_id":"2604.14142","last_updated":"2026-04-15T17:59:01Z","snapshot_observed_at":"2026-08-11T21:11:54.456177Z","submitted_at":"2026-04-15T17:59:01Z","title":"From $P(y|x)$ to $P(y)$: Investigating Reinforcement Learning in Pre-train Space","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-05-10T12:50:57.603403Z"},"links":{"cited_paper":"/paper/2308.04014","citing_paper":"/paper/2604.14142"},"observation_digest":"sha256:5727cc46da7295fc0dc12fc3923651c64992bff5319e6252344a2e96c355a425","observation_id":"d2d51962-ef7d-42be-9707-e99936108d36","resolution":{"observed_at":"2026-05-11T11:41:04.228501Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.04014","last_updated":"2023-09-06T23:13:07Z","snapshot_observed_at":"2026-08-18T13:13:10.840816Z","submitted_at":"2023-08-08T03:18:18Z","title":"Continual Pre-Training of Large Language Models: How to (re)warm your model?","version":2},"cited_work":{"arxiv_id":"2308.04014","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.04014","snapshot_observed_at":"2026-07-04T18:40:03.356996Z","title":"Continual pre-training of large language models: How to (re) warm your model?","venue":null,"work_id":"881d21e0-b9b0-4031-a085-cf950213fe5e","year":2023},"citing_paper":{"arxiv_id":"2604.19835","last_updated":"2026-05-10T18:33:52Z","snapshot_observed_at":"2026-08-15T19:42:17.129212Z","submitted_at":"2026-04-21T05:53:33Z","title":"Expert Upcycling: Shifting the Compute-Efficient Frontier of Mixture-of-Experts","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T03:29:16.555166Z"},"links":{"cited_paper":"/paper/2308.04014","citing_paper":"/paper/2604.19835"},"observation_digest":"sha256:a03ee663b665eac01acd883c7800618eb99479ed6455a2bfc42c1648e2ba7811","observation_id":"17e2301d-ef36-4a92-8308-7ef0439a43b9","resolution":{"observed_at":"2026-05-10T03:29:21.464973Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.04014","last_updated":"2023-09-06T23:13:07Z","snapshot_observed_at":"2026-08-18T13:13:10.840816Z","submitted_at":"2023-08-08T03:18:18Z","title":"Continual Pre-Training of Large Language Models: How to (re)warm your model?","version":2},"cited_work":{"arxiv_id":"2308.04014","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.04014","snapshot_observed_at":"2026-07-04T18:40:03.356996Z","title":"Continual pre-training of large language models: How to (re) warm your model?","venue":null,"work_id":"881d21e0-b9b0-4031-a085-cf950213fe5e","year":2023},"citing_paper":{"arxiv_id":"2604.19835","last_updated":"2026-05-10T18:33:52Z","snapshot_observed_at":"2026-08-15T19:42:17.129212Z","submitted_at":"2026-04-21T05:53:33Z","title":"Expert Upcycling: Shifting the Compute-Efficient Frontier of Mixture-of-Experts","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-12T02:03:02.654035Z"},"links":{"cited_paper":"/paper/2308.04014","citing_paper":"/paper/2604.19835"},"observation_digest":"sha256:99db17939b63d971251917ce0f54a2851d5f88576ac208e90ec67babaa15f379","observation_id":"120a1ce5-b8c9-461f-987a-af4f801ec959","resolution":{"observed_at":"2026-05-12T02:06:15.399440Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.04014","last_updated":"2023-09-06T23:13:07Z","snapshot_observed_at":"2026-08-18T13:13:10.840816Z","submitted_at":"2023-08-08T03:18:18Z","title":"Continual Pre-Training of Large Language Models: How to (re)warm your model?","version":2},"cited_work":{"arxiv_id":"2308.04014","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.04014","snapshot_observed_at":"2026-07-04T18:40:03.356996Z","title":"Continual pre-training of large language models: How to (re) warm your model?","venue":null,"work_id":"881d21e0-b9b0-4031-a085-cf950213fe5e","year":2023},"citing_paper":{"arxiv_id":"2605.05365","last_updated":"2026-05-06T18:44:08Z","snapshot_observed_at":"2026-08-16T18:16:47.637991Z","submitted_at":"2026-05-06T18:44:08Z","title":"ZAYA1-8B Technical Report","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-05-08T17:36:37.182196Z"},"links":{"cited_paper":"/paper/2308.04014","citing_paper":"/paper/2605.05365"},"observation_digest":"sha256:d635bd655e1ddfbb5088661a387766bf52ed20d4ca8dcb22a02d8ca17af7d3f6","observation_id":"8720233f-776b-4c41-9c6c-287b845a177e","resolution":{"observed_at":"2026-05-11T17:26:05.212027Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.04014","last_updated":"2023-09-06T23:13:07Z","snapshot_observed_at":"2026-08-18T13:13:10.840816Z","submitted_at":"2023-08-08T03:18:18Z","title":"Continual Pre-Training of Large Language Models: How to (re)warm your model?","version":2},"cited_work":{"arxiv_id":"2308.04014","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.04014","snapshot_observed_at":"2026-07-04T18:40:03.356996Z","title":"Continual pre-training of large language models: How to (re) warm your model?","venue":null,"work_id":"881d21e0-b9b0-4031-a085-cf950213fe5e","year":2023},"citing_paper":{"arxiv_id":"2605.13989","last_updated":"2026-05-21T13:59:18Z","snapshot_observed_at":"2026-08-05T21:34:24.588486Z","submitted_at":"2026-05-13T18:03:07Z","title":"VectraYX-Nano: A 42M-Parameter Spanish Cybersecurity Language Model with Curriculum Learning and Native Tool Use","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-15T05:44:58.483183Z"},"links":{"cited_paper":"/paper/2308.04014","citing_paper":"/paper/2605.13989"},"observation_digest":"sha256:3d75a05eb74c9d8074c9c1f4354773ab06e43e659bb58f748f4c217342e9fe6a","observation_id":"cb5e2ed3-df43-49bb-be18-a31c84c2d041","resolution":{"observed_at":"2026-05-15T05:45:05.604780Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.04014","last_updated":"2023-09-06T23:13:07Z","snapshot_observed_at":"2026-08-18T13:13:10.840816Z","submitted_at":"2023-08-08T03:18:18Z","title":"Continual Pre-Training of Large Language Models: How to (re)warm your model?","version":2},"cited_work":{"arxiv_id":"2308.04014","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.04014","snapshot_observed_at":"2026-07-04T18:40:03.356996Z","title":"Continual pre-training of large language models: How to (re) warm your model?","venue":null,"work_id":"881d21e0-b9b0-4031-a085-cf950213fe5e","year":2023},"citing_paper":{"arxiv_id":"2605.13989","last_updated":"2026-05-21T13:59:18Z","snapshot_observed_at":"2026-08-05T21:34:24.588486Z","submitted_at":"2026-05-13T18:03:07Z","title":"VectraYX-Nano: A 42M-Parameter Spanish Cybersecurity Language Model with Curriculum Learning and Native Tool Use","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-20T21:02:51.889450Z"},"links":{"cited_paper":"/paper/2308.04014","citing_paper":"/paper/2605.13989"},"observation_digest":"sha256:092487169ed65fd8514b7d7aab5b7932b7da12dac243ba3457cf1669c49a2a73","observation_id":"3e7242d2-46c2-4ab6-98f1-bf1dd8e004de","resolution":{"observed_at":"2026-05-20T21:03:46.453219Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.04014","last_updated":"2023-09-06T23:13:07Z","snapshot_observed_at":"2026-08-18T13:13:10.840816Z","submitted_at":"2023-08-08T03:18:18Z","title":"Continual Pre-Training of Large Language Models: How to (re)warm your model?","version":2},"cited_work":{"arxiv_id":"2308.04014","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.04014","snapshot_observed_at":"2026-07-04T18:40:03.356996Z","title":"Continual pre-training of large language models: How to (re) warm your model?","venue":null,"work_id":"881d21e0-b9b0-4031-a085-cf950213fe5e","year":2023},"citing_paper":{"arxiv_id":"2605.13989","last_updated":"2026-05-21T13:59:18Z","snapshot_observed_at":"2026-08-05T21:34:24.588486Z","submitted_at":"2026-05-13T18:03:07Z","title":"VectraYX-Nano: A 42M-Parameter Spanish Cybersecurity Language Model with Curriculum Learning and Native Tool Use","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-22T09:29:30.950904Z"},"links":{"cited_paper":"/paper/2308.04014","citing_paper":"/paper/2605.13989"},"observation_digest":"sha256:329c079d3d0afe40d24084f25c8ef127dc6222a01db06295dca93174b8ca6af5","observation_id":"d394e1f9-35de-4c5a-b308-ce39d8361f77","resolution":{"observed_at":"2026-05-22T09:31:22.849196Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.04014","last_updated":"2023-09-06T23:13:07Z","snapshot_observed_at":"2026-08-18T13:13:10.840816Z","submitted_at":"2023-08-08T03:18:18Z","title":"Continual Pre-Training of Large Language Models: How to (re)warm your model?","version":2},"cited_work":{"arxiv_id":"2308.04014","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.04014","snapshot_observed_at":"2026-07-04T18:40:03.356996Z","title":"Continual pre-training of large language models: How to (re) warm your model?","venue":null,"work_id":"881d21e0-b9b0-4031-a085-cf950213fe5e","year":2023},"citing_paper":{"arxiv_id":"2605.26097","last_updated":"2026-05-25T17:54:34Z","snapshot_observed_at":"2026-07-06T23:36:01.564747Z","submitted_at":"2026-05-25T17:54:34Z","title":"Forgetting in Language Models: Capacity, Optimization, and Self-Generated Replay","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-29T23:15:45.174086Z"},"links":{"cited_paper":"/paper/2308.04014","citing_paper":"/paper/2605.26097"},"observation_digest":"sha256:ecb81d7d010f8cb55ec9a91f1ef75e031d6e769076970e986806c0857a46a058","observation_id":"4483488a-4caf-4876-8634-b89acfb0ad13","resolution":{"observed_at":"2026-06-29T23:24:02.030496Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.04014","last_updated":"2023-09-06T23:13:07Z","snapshot_observed_at":"2026-08-18T13:13:10.840816Z","submitted_at":"2023-08-08T03:18:18Z","title":"Continual Pre-Training of Large Language Models: How to (re)warm your model?","version":2},"cited_work":{"arxiv_id":"2308.04014","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.04014","snapshot_observed_at":"2026-07-04T18:40:03.356996Z","title":"Continual pre-training of large language models: How to (re) warm your model?","venue":null,"work_id":"881d21e0-b9b0-4031-a085-cf950213fe5e","year":2023},"citing_paper":{"arxiv_id":"2606.05610","last_updated":"2026-06-04T02:32:11Z","snapshot_observed_at":"2026-08-13T17:56:17.735154Z","submitted_at":"2026-06-04T02:32:11Z","title":"Predictable Scaling Laws of Optimal Hyperparameters for LLM Continued Pre-training","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-06-28T01:53:04.715108Z"},"links":{"cited_paper":"/paper/2308.04014","citing_paper":"/paper/2606.05610"},"observation_digest":"sha256:3b2b89132a06b4c0fbd6c6934a5665117552a8720cc8764350b13d44c367f67c","observation_id":"6e0dd535-a6ad-4725-8d4f-875443b23e36","resolution":{"observed_at":"2026-07-02T12:46:56.694420Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.04014","last_updated":"2023-09-06T23:13:07Z","snapshot_observed_at":"2026-08-18T13:13:10.840816Z","submitted_at":"2023-08-08T03:18:18Z","title":"Continual Pre-Training of Large Language Models: How to (re)warm your model?","version":2},"cited_work":{"arxiv_id":"2308.04014","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.04014","snapshot_observed_at":"2026-07-04T18:40:03.356996Z","title":"Continual pre-training of large language models: How to (re) warm your model?","venue":null,"work_id":"881d21e0-b9b0-4031-a085-cf950213fe5e","year":2023},"citing_paper":{"arxiv_id":"2606.16517","last_updated":"2026-06-30T13:49:08Z","snapshot_observed_at":"2026-08-12T12:06:04.388020Z","submitted_at":"2026-06-15T10:19:49Z","title":"How Post-Training Shapes Biological Reasoning Models","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-07-01T07:48:31.110861Z"},"links":{"cited_paper":"/paper/2308.04014","citing_paper":"/paper/2606.16517"},"observation_digest":"sha256:3a50c36d503fef6fcf7e30feda56da114a22653fdba76662092bf286d97e4d40","observation_id":"f108a764-8d7c-4684-bfc9-62af0f54910c","resolution":{"observed_at":"2026-07-01T07:55:31.039643Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.04014","last_updated":"2023-09-06T23:13:07Z","snapshot_observed_at":"2026-08-18T13:13:10.840816Z","submitted_at":"2023-08-08T03:18:18Z","title":"Continual Pre-Training of Large Language Models: How to (re)warm your model?","version":2},"cited_work":{"arxiv_id":"2308.04014","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.04014","snapshot_observed_at":"2026-07-04T18:40:03.356996Z","title":"Continual pre-training of large language models: How to (re) warm your model?","venue":null,"work_id":"881d21e0-b9b0-4031-a085-cf950213fe5e","year":2023},"citing_paper":{"arxiv_id":"2606.24320","last_updated":"2026-06-25T20:48:22Z","snapshot_observed_at":"2026-07-06T23:58:54.018557Z","submitted_at":"2026-06-23T08:57:34Z","title":"ZONOS2 Technical Report","version":1},"reference_index":119,"source":"arxiv_source","source_observed_at":"2026-06-25T22:37:15.072758Z"},"links":{"cited_paper":"/paper/2308.04014","citing_paper":"/paper/2606.24320"},"observation_digest":"sha256:7603c81f45965a1a3d32c481006bfe9604674babf05e9ae4846cb5bf08187a73","observation_id":"8d235313-7d98-484d-ba09-beda400464bd","resolution":{"observed_at":"2026-07-04T18:40:03.358532Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.04014","last_updated":"2023-09-06T23:13:07Z","snapshot_observed_at":"2026-08-18T13:13:10.840816Z","submitted_at":"2023-08-08T03:18:18Z","title":"Continual Pre-Training of Large Language Models: How to (re)warm your model?","version":2},"cited_work":{"arxiv_id":"2308.04014","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.04014","snapshot_observed_at":"2026-07-04T18:40:03.356996Z","title":"Continual pre-training of large language models: How to (re) warm your model?","venue":null,"work_id":"881d21e0-b9b0-4031-a085-cf950213fe5e","year":2023},"citing_paper":{"arxiv_id":"2606.24320","last_updated":"2026-06-25T20:48:22Z","snapshot_observed_at":"2026-07-06T23:58:54.018557Z","submitted_at":"2026-06-23T08:57:34Z","title":"ZONOS2 Technical Report","version":2},"reference_index":119,"source":"arxiv_source","source_observed_at":"2026-06-29T02:07:31.791835Z"},"links":{"cited_paper":"/paper/2308.04014","citing_paper":"/paper/2606.24320"},"observation_digest":"sha256:65279712d2d3c07adc03b60ab01df4a85f55a9311cffb986f13c983e9f479115","observation_id":"64b77a19-8ab0-4af1-942a-8d964300f4fc","resolution":{"observed_at":"2026-07-01T18:15:59.016168Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.04014","last_updated":"2023-09-06T23:13:07Z","snapshot_observed_at":"2026-08-18T13:13:10.840816Z","submitted_at":"2023-08-08T03:18:18Z","title":"Continual Pre-Training of Large Language Models: How to (re)warm your model?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.04014","snapshot_observed_at":"2026-07-14T08:04:06.432613Z","title":"arXiv preprint arXiv:2308.04014 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10959","last_updated":"2026-07-12T23:24:42Z","snapshot_observed_at":"2026-08-17T22:49:12.366394Z","submitted_at":"2026-07-12T23:24:42Z","title":"WSqD: A Horizon-Free Learning Rate Schedule for Large Model Training","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-07-14T08:04:06.432613Z"},"links":{"cited_paper":"/paper/2308.04014","citing_paper":"/paper/2607.10959"},"observation_digest":"sha256:c3cb71c53386e16e76a0a68d5cc1804fe8f0a9019b954c102b7338762fe62b64","observation_id":"14da3bf0-4d5a-4635-9db6-74111616e6a9","resolution":{"observed_at":"2026-07-14T08:04:06.432613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.04014","last_updated":"2023-09-06T23:13:07Z","snapshot_observed_at":"2026-08-18T13:13:10.840816Z","submitted_at":"2023-08-08T03:18:18Z","title":"Continual Pre-Training of Large Language Models: How to (re)warm your model?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.04014","snapshot_observed_at":"2026-08-02T15:39:37.195076Z","title":"Continual pre-training of large language models: How to (re) warm your model?arXiv:2308.04014,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11889","last_updated":"2026-07-17T09:32:58Z","snapshot_observed_at":"2026-08-15T22:25:06.811331Z","submitted_at":"2026-04-24T17:00:53Z","title":"Scaling Point-in-Time Language Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T15:39:37.195076Z"},"links":{"cited_paper":"/paper/2308.04014","citing_paper":"/paper/2607.11889"},"observation_digest":"sha256:25f140db438902c97c032fe18ea23a4776a4ac14b2a9ab546c7c01ab1ff6a7e2","observation_id":"b510c958-6b20-475c-b8eb-991fa208eee5","resolution":{"observed_at":"2026-08-02T15:39:37.195076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.04014","last_updated":"2023-09-06T23:13:07Z","snapshot_observed_at":"2026-08-18T13:13:10.840816Z","submitted_at":"2023-08-08T03:18:18Z","title":"Continual Pre-Training of Large Language Models: How to (re)warm your model?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.04014","snapshot_observed_at":"2026-08-01T09:52:00.140890Z","title":"arXiv preprint arXiv:2308.04014 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27308","last_updated":"2026-07-29T17:49:04Z","snapshot_observed_at":"2026-08-05T10:53:49.344314Z","submitted_at":"2026-07-29T17:49:04Z","title":"ZUNA1.1: A more flexible EEG foundation model for Denoising and Super-resolution","version":1},"reference_index":103,"source":"arxiv_source","source_observed_at":"2026-08-01T09:52:00.140890Z"},"links":{"cited_paper":"/paper/2308.04014","citing_paper":"/paper/2607.27308"},"observation_digest":"sha256:410e98bbf53755934a7c0440a62f314f9c711269e552f5280dc48635784ba0c0","observation_id":"8527eb4e-6c61-47ef-93e0-7a084bd673d7","resolution":{"observed_at":"2026-08-01T09:52:00.140890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.04014","last_updated":"2023-09-06T23:13:07Z","snapshot_observed_at":"2026-08-18T13:13:10.840816Z","submitted_at":"2023-08-08T03:18:18Z","title":"Continual Pre-Training of Large Language Models: How to (re)warm your model?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.04014","snapshot_observed_at":"2026-08-01T07:02:04.080396Z","title":"Continual Pre-Training of Large Language Models: How to (Re)warm Your Model? , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27490","last_updated":"2026-07-29T22:10:40Z","snapshot_observed_at":"2026-08-14T07:43:49.943920Z","submitted_at":"2026-07-29T22:10:40Z","title":"MedLLM: An Open Medical Language Model at the Sub-Billion Scale","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-01T07:02:04.080396Z"},"links":{"cited_paper":"/paper/2308.04014","citing_paper":"/paper/2607.27490"},"observation_digest":"sha256:3a06decd38e556cc86eea008725a0f932dbd3793e30b7d14182588d3a3d6ff98","observation_id":"986273d6-f239-4b16-a25a-03c8e668e9e3","resolution":{"observed_at":"2026-08-01T07:02:04.080396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.04014","last_updated":"2023-09-06T23:13:07Z","snapshot_observed_at":"2026-08-18T13:13:10.840816Z","submitted_at":"2023-08-08T03:18:18Z","title":"Continual Pre-Training of Large Language Models: How to (re)warm your model?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.04014","snapshot_observed_at":"2026-08-07T12:24:00.347438Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06216","last_updated":"2026-08-12T04:11:22Z","snapshot_observed_at":"2026-08-17T21:47:43.806306Z","submitted_at":"2026-08-06T16:07:26Z","title":"Continual Learning in Transition","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T12:24:00.347438Z"},"links":{"cited_paper":"/paper/2308.04014","citing_paper":"/paper/2608.06216"},"observation_digest":"sha256:89902724cb20394fd71f77b49b5da21564f3e34ab9d3dbdfba7ecf0873282239","observation_id":"7b87762a-6bd0-46de-b9dd-0e73a90bc0a6","resolution":{"observed_at":"2026-08-07T12:24:00.347438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.04014","last_updated":"2023-09-06T23:13:07Z","snapshot_observed_at":"2026-08-18T13:13:10.840816Z","submitted_at":"2023-08-08T03:18:18Z","title":"Continual Pre-Training of Large Language Models: How to (re)warm your model?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.04014","snapshot_observed_at":"2026-08-15T14:38:35.507340Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06216","last_updated":"2026-08-12T04:11:22Z","snapshot_observed_at":"2026-08-17T21:47:43.806306Z","submitted_at":"2026-08-06T16:07:26Z","title":"Continual Learning in Transition","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-15T14:38:35.507340Z"},"links":{"cited_paper":"/paper/2308.04014","citing_paper":"/paper/2608.06216"},"observation_digest":"sha256:39d2a8b2efde7ce112d19ee1d279f476f16552eb081d65c46f9f1fc6cf63fc7c","observation_id":"f134cbd8-d380-47cf-a15a-1ae4601417ce","resolution":{"observed_at":"2026-08-15T14:38:35.507340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2308.04014/citation-record","integrity":"/paper/2308.04014/integrity","json":"/paper/2308.04014/citation-record.json","paper":"/paper/2308.04014"},"outbound":[],"paper":{"arxiv_id":"2308.04014","last_updated":"2023-09-06T23:13:07Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-18T13:13:10.840816Z","submitted_at":"2023-08-08T03:18:18Z","title":"Continual Pre-Training of Large Language Models: How to (re)warm your model?"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 31 inbound Pith citation observations for arXiv:2308.04014."}