{"as_of":"2026-08-08T18:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:650f966625c2050e77ac548d6139ea704d770f09c3d6a8cdcbaa4eb17b17896d","coverage":[{"denominator":48,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":48,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T17:01:36.218426Z","state":"measured"},{"denominator":55,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":55,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":7,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T22:30:58.664303Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.06042","last_updated":"2025-05-26T18:48:37Z","snapshot_observed_at":"2026-08-08T16:54:35.007753Z","submitted_at":"2025-02-09T21:44:27Z","title":"Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection","version":2},"cited_work":{"arxiv_id":"2502.06042","doi":"10.48550/arxiv.2502.06042","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.06042","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2502.06042 , year=","venue":"ArXiv.org","work_id":"9617c4ed-1474-439a-9d08-e0612fa954ae","year":2025},"citing_paper":{"arxiv_id":"2605.00195","last_updated":"2026-05-11T12:48:16Z","snapshot_observed_at":"2026-07-31T18:51:54.041588Z","submitted_at":"2026-04-30T20:20:59Z","title":"Diversity in Large Language Models under Supervised Fine-Tuning","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-05-09T20:32:37.788283Z"},"links":{"cited_paper":"/paper/2502.06042","citing_paper":"/paper/2605.00195"},"observation_digest":"sha256:bd74563848baa47fb239301a3df07f36d2cae4005934a19faa1fc6b87a3bb4c7","observation_id":"6a545c2e-3c8f-4a92-9ebf-6f75cc838343","resolution":{"observed_at":"2026-05-09T20:37:32.124103Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06042","last_updated":"2025-05-26T18:48:37Z","snapshot_observed_at":"2026-08-08T16:54:35.007753Z","submitted_at":"2025-02-09T21:44:27Z","title":"Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection","version":2},"cited_work":{"arxiv_id":"2502.06042","doi":"10.48550/arxiv.2502.06042","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.06042","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2502.06042 , year=","venue":"ArXiv.org","work_id":"9617c4ed-1474-439a-9d08-e0612fa954ae","year":2025},"citing_paper":{"arxiv_id":"2605.00195","last_updated":"2026-05-11T12:48:16Z","snapshot_observed_at":"2026-07-31T18:51:54.041588Z","submitted_at":"2026-04-30T20:20:59Z","title":"Diversity in Large Language Models under Supervised Fine-Tuning","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-05-12T03:10:22.314719Z"},"links":{"cited_paper":"/paper/2502.06042","citing_paper":"/paper/2605.00195"},"observation_digest":"sha256:1971dfb94bdd1902d3f58a0777cb4b15c5fbde2d3c2f68ac731013d3049526bd","observation_id":"978121c7-1d7d-4fd1-beeb-272e51c1da1b","resolution":{"observed_at":"2026-05-12T03:11:18.148664Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06042","last_updated":"2025-05-26T18:48:37Z","snapshot_observed_at":"2026-08-08T16:54:35.007753Z","submitted_at":"2025-02-09T21:44:27Z","title":"Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection","version":2},"cited_work":{"arxiv_id":"2502.06042","doi":"10.48550/arxiv.2502.06042","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.06042","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2502.06042 , year=","venue":"ArXiv.org","work_id":"9617c4ed-1474-439a-9d08-e0612fa954ae","year":2025},"citing_paper":{"arxiv_id":"2605.12705","last_updated":"2026-05-12T20:08:00Z","snapshot_observed_at":"2026-08-06T21:05:32.361086Z","submitted_at":"2026-05-12T20:08:00Z","title":"Early Data Exposure Improves Robustness to Subsequent Fine-Tuning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-14T20:45:27.673290Z"},"links":{"cited_paper":"/paper/2502.06042","citing_paper":"/paper/2605.12705"},"observation_digest":"sha256:4437651c046dadcb43703a68fa0772c6eafb9cd6aa63932d087bf08b5a4fd459","observation_id":"85bd389e-4357-4b8c-aa69-868cf41f28f9","resolution":{"observed_at":"2026-05-14T20:47:58.617673Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06042","last_updated":"2025-05-26T18:48:37Z","snapshot_observed_at":"2026-08-08T16:54:35.007753Z","submitted_at":"2025-02-09T21:44:27Z","title":"Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection","version":2},"cited_work":{"arxiv_id":"2502.06042","doi":"10.48550/arxiv.2502.06042","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.06042","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2502.06042 , year=","venue":"ArXiv.org","work_id":"9617c4ed-1474-439a-9d08-e0612fa954ae","year":2025},"citing_paper":{"arxiv_id":"2605.12715","last_updated":"2026-05-15T17:01:07Z","snapshot_observed_at":"2026-07-06T23:24:23.402304Z","submitted_at":"2026-05-12T20:22:45Z","title":"Scaling Laws for Mixture Pretraining Under Data Constraints","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-14T21:44:31.429223Z"},"links":{"cited_paper":"/paper/2502.06042","citing_paper":"/paper/2605.12715"},"observation_digest":"sha256:ae355d6329b76cf117032f912838819fb717638187386d3a3479af78df8d7358","observation_id":"960bddf1-eedd-4e95-98d1-0465059c9ed9","resolution":{"observed_at":"2026-05-14T21:48:00.978072Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06042","last_updated":"2025-05-26T18:48:37Z","snapshot_observed_at":"2026-08-08T16:54:35.007753Z","submitted_at":"2025-02-09T21:44:27Z","title":"Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection","version":2},"cited_work":{"arxiv_id":"2502.06042","doi":"10.48550/arxiv.2502.06042","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.06042","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2502.06042 , year=","venue":"ArXiv.org","work_id":"9617c4ed-1474-439a-9d08-e0612fa954ae","year":2025},"citing_paper":{"arxiv_id":"2605.26097","last_updated":"2026-05-25T17:54:34Z","snapshot_observed_at":"2026-07-06T23:36:01.564747Z","submitted_at":"2026-05-25T17:54:34Z","title":"Forgetting in Language Models: Capacity, Optimization, and Self-Generated Replay","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-29T23:15:45.174086Z"},"links":{"cited_paper":"/paper/2502.06042","citing_paper":"/paper/2605.26097"},"observation_digest":"sha256:dd3cabfaed50b20b487df45c132b1b9f270b1ef9aa4627b7a3cb8cfdeb314089","observation_id":"0701f0ff-3b37-47eb-9a35-895ffbbcad32","resolution":{"observed_at":"2026-06-29T23:24:01.970658Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06042","last_updated":"2025-05-26T18:48:37Z","snapshot_observed_at":"2026-08-08T16:54:35.007753Z","submitted_at":"2025-02-09T21:44:27Z","title":"Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection","version":2},"cited_work":{"arxiv_id":"2502.06042","doi":"10.48550/arxiv.2502.06042","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.06042","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2502.06042 , year=","venue":"ArXiv.org","work_id":"9617c4ed-1474-439a-9d08-e0612fa954ae","year":2025},"citing_paper":{"arxiv_id":"2606.03924","last_updated":"2026-06-02T17:14:37Z","snapshot_observed_at":"2026-08-07T19:16:32.899046Z","submitted_at":"2026-06-02T17:14:37Z","title":"Knowledge Editing in Masked Diffusion Language Models","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-06-28T09:51:42.811856Z"},"links":{"cited_paper":"/paper/2502.06042","citing_paper":"/paper/2606.03924"},"observation_digest":"sha256:cb055abe1140a0fa36fb493e58fc6cd470c9fa2dac2f1b2b858e563fbf78855a","observation_id":"0e5085ee-2d3f-4315-a358-1eabbe3127eb","resolution":{"observed_at":"2026-07-02T03:36:29.935755Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06042","last_updated":"2025-05-26T18:48:37Z","snapshot_observed_at":"2026-08-08T16:54:35.007753Z","submitted_at":"2025-02-09T21:44:27Z","title":"Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06042","snapshot_observed_at":"2026-08-01T22:30:58.664303Z","title":"arXiv Preprint arXiv:2502.06042 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16354","last_updated":"2026-07-17T08:21:15Z","snapshot_observed_at":"2026-08-06T15:07:54.754467Z","submitted_at":"2026-07-17T08:21:15Z","title":"A Predict-then-Correct Loop Based on Few-Shot Continuous Contextual Bandit for Demand Forecasting","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-01T22:30:58.664303Z"},"links":{"cited_paper":"/paper/2502.06042","citing_paper":"/paper/2607.16354"},"observation_digest":"sha256:ef04e771e6d4d4e6996a1a6b38a19afc2b0e74fdee8744449d163f5add049cc8","observation_id":"85a28b91-5f85-4d9c-af51-c4cff710587a","resolution":{"observed_at":"2026-08-01T22:30:58.664303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2502.06042/citation-record","integrity":"/paper/2502.06042/integrity","json":"/paper/2502.06042/citation-record.json","paper":"/paper/2502.06042"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:01:36.870592Z","title":"Scaling laws for generative mixed-modal language models","venue":null,"work_id":"c2563649-ab2b-45ec-8752-1edbb408634b","year":2023},"citing_paper":{"arxiv_id":"2502.06042","last_updated":"2025-05-26T18:48:37Z","snapshot_observed_at":"2026-08-08T16:54:35.007753Z","submitted_at":"2025-02-09T21:44:27Z","title":"Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-08T17:01:36.045067Z"},"links":{"citing_paper":"/paper/2502.06042"},"observation_digest":"sha256:285fc8de6adefb33e7a69eccbb390b0dddd1417fc853f39d301b89198f645e1a","observation_id":"0e539dbd-18d5-4e79-8178-391069d27b79","resolution":{"observed_at":"2026-08-08T17:01:36.874266Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00660","last_updated":"2024-11-16T06:17:37Z","snapshot_observed_at":"2026-07-06T19:43:37.792643Z","submitted_at":"2024-11-01T15:26:15Z","title":"Physics in Next-token Prediction","version":2},"cited_work":{"arxiv_id":"2411.00660","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.00660","snapshot_observed_at":"2026-08-08T17:01:36.671244Z","title":"Physics in Next-token Prediction","venue":"cs.LG","work_id":"b5a2392b-104b-4a71-a9ff-246245e88186","year":2024},"citing_paper":{"arxiv_id":"2502.06042","last_updated":"2025-05-26T18:48:37Z","snapshot_observed_at":"2026-08-08T16:54:35.007753Z","submitted_at":"2025-02-09T21:44:27Z","title":"Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-08T17:01:36.049342Z"},"links":{"cited_paper":"/paper/2411.00660","citing_paper":"/paper/2502.06042"},"observation_digest":"sha256:0f2b7477dd6067d8860a58ac8184c8b1d41c994efceba3cec3f70bdb2c06b121","observation_id":"54015f12-73e8-4298-bc75-689f38c3d2a1","resolution":{"observed_at":"2026-08-08T17:01:36.675840Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16947","last_updated":"2024-08-30T00:06:29Z","snapshot_observed_at":"2026-07-06T19:07:59.449781Z","submitted_at":"2024-08-30T00:06:29Z","title":"An Empirical Study of Scaling Laws for Transfer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16947","snapshot_observed_at":"2026-08-08T17:01:36.054331Z","title":"An empirical study of scaling laws for transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06042","last_updated":"2025-05-26T18:48:37Z","snapshot_observed_at":"2026-08-08T16:54:35.007753Z","submitted_at":"2025-02-09T21:44:27Z","title":"Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-08T17:01:36.054331Z"},"links":{"cited_paper":"/paper/2408.16947","citing_paper":"/paper/2502.06042"},"observation_digest":"sha256:62c9763ceb0b7517bb6fe249f99f068a0f20143a0519435d773e8ca10622d432","observation_id":"348d53aa-d60c-4d10-bf07-05829460d3d8","resolution":{"observed_at":"2026-08-08T17:01:36.054331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.10102","last_updated":"2024-05-15T00:57:23Z","snapshot_observed_at":"2026-07-06T18:00:34.983732Z","submitted_at":"2024-04-15T19:19:56Z","title":"Chinchilla Scaling: A replication attempt","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.10102","snapshot_observed_at":"2026-08-08T17:01:36.058241Z","title":"Chinchilla scaling: A replication attempt","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06042","last_updated":"2025-05-26T18:48:37Z","snapshot_observed_at":"2026-08-08T16:54:35.007753Z","submitted_at":"2025-02-09T21:44:27Z","title":"Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-08T17:01:36.058241Z"},"links":{"cited_paper":"/paper/2404.10102","citing_paper":"/paper/2502.06042"},"observation_digest":"sha256:ced13057bc0880dc4dd1da7b6a2b02918184cc14fb415f73624cc5de61a19fad","observation_id":"5ad549d4-7fac-4b5a-90c7-53a13cc61fbb","resolution":{"observed_at":"2026-08-08T17:01:36.058241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-08T17:01:36.062327Z","title":"Think you have solved question answering? try arc, the ai2 reasoning challenge","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.06042","last_updated":"2025-05-26T18:48:37Z","snapshot_observed_at":"2026-08-08T16:54:35.007753Z","submitted_at":"2025-02-09T21:44:27Z","title":"Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-08T17:01:36.062327Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2502.06042"},"observation_digest":"sha256:fb6dfd748036de341cd81a697646a31f849b005c5ba3ce8e3a118dd170f3f3dd","observation_id":"d3d0fa82-5ef3-490b-8ea0-13d01b547b18","resolution":{"observed_at":"2026-08-08T17:01:36.062327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02954","last_updated":"2024-01-05T18:59:13Z","snapshot_observed_at":"2026-08-02T13:11:16.882565Z","submitted_at":"2024-01-05T18:59:13Z","title":"DeepSeek LLM: Scaling Open-Source Language Models with Longtermism","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02954","snapshot_observed_at":"2026-08-08T17:01:36.066170Z","title":"Deepseek llm: Scaling open-source language models with longtermism","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06042","last_updated":"2025-05-26T18:48:37Z","snapshot_observed_at":"2026-08-08T16:54:35.007753Z","submitted_at":"2025-02-09T21:44:27Z","title":"Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-08T17:01:36.066170Z"},"links":{"cited_paper":"/paper/2401.02954","citing_paper":"/paper/2502.06042"},"observation_digest":"sha256:e7cf126a6f6632fae959e96e8d084b300e159cc1520e64704442ae56c051cf04","observation_id":"f5824e7e-4bcb-4e98-be0e-ebfb8295506d","resolution":{"observed_at":"2026-08-08T17:01:36.066170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00027","last_updated":"2020-12-31T19:00:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-12-31T19:00:10Z","title":"The Pile: An 800GB Dataset of Diverse Text for Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00027","snapshot_observed_at":"2026-08-08T17:01:36.070822Z","title":"The pile: An 800gb dataset of diverse text for language modeling","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.06042","last_updated":"2025-05-26T18:48:37Z","snapshot_observed_at":"2026-08-08T16:54:35.007753Z","submitted_at":"2025-02-09T21:44:27Z","title":"Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-08T17:01:36.070822Z"},"links":{"cited_paper":"/paper/2101.00027","citing_paper":"/paper/2502.06042"},"observation_digest":"sha256:a251557338047c2a865e41e7bd65899336dae97810be6c7576c45395a5cd3c3c","observation_id":"6f0003f1-0c81-4ad5-8ba1-00c8381cdae5","resolution":{"observed_at":"2026-08-08T17:01:36.070822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:01:36.860983Z","title":"B., Werra, L","venue":null,"work_id":"9f3bf1e5-be9d-4be4-9f07-ebb7dcc88624","year":2024},"citing_paper":{"arxiv_id":"2502.06042","last_updated":"2025-05-26T18:48:37Z","snapshot_observed_at":"2026-08-08T16:54:35.007753Z","submitted_at":"2025-02-09T21:44:27Z","title":"Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-08T17:01:36.074685Z"},"links":{"citing_paper":"/paper/2502.06042"},"observation_digest":"sha256:9464ceed186b3921e94d91edfc381a78ddd7de3a10631979d17dc930863e8d0f","observation_id":"12aa82ea-4964-4565-8705-4c5e29328f9b","resolution":{"observed_at":"2026-08-08T17:01:36.864014Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:01:36.850761Z","title":"The elements of statistical learning: data mining, inference, and prediction, 2017","venue":null,"work_id":"03203ebe-5429-4e08-aec2-4353598f0283","year":2017},"citing_paper":{"arxiv_id":"2502.06042","last_updated":"2025-05-26T18:48:37Z","snapshot_observed_at":"2026-08-08T16:54:35.007753Z","submitted_at":"2025-02-09T21:44:27Z","title":"Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-08T17:01:36.078314Z"},"links":{"citing_paper":"/paper/2502.06042"},"observation_digest":"sha256:6fe0fc5b95e29e1ed607a09c49a8a5e268c1ab4ab472b4ac8b74dd01af1bbc9c","observation_id":"dd78c85f-f506-471a-ab91-a72768059e65","resolution":{"observed_at":"2026-08-08T17:01:36.854328Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.04366","last_updated":"2022-02-02T16:39:23Z","snapshot_observed_at":"2026-08-08T06:15:11.222260Z","submitted_at":"2021-10-08T20:22:26Z","title":"Towards a Unified View of Parameter-Efficient Transfer Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.04366","snapshot_observed_at":"2026-08-08T17:01:36.082196Z","title":"Towards a unified view of parameter-efficient transfer learning, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.06042","last_updated":"2025-05-26T18:48:37Z","snapshot_observed_at":"2026-08-08T16:54:35.007753Z","submitted_at":"2025-02-09T21:44:27Z","title":"Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-08T17:01:36.082196Z"},"links":{"cited_paper":"/paper/2110.04366","citing_paper":"/paper/2502.06042"},"observation_digest":"sha256:b956ba870bea7edda5bcfad6953ac1904dacf22672258097af000a2e795fe1af","observation_id":"2bf46535-cc36-49d7-abf5-1af770924f88","resolution":{"observed_at":"2026-08-08T17:01:36.082196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:01:36.086743Z","title":"Measuring massive multitask language understanding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.06042","last_updated":"2025-05-26T18:48:37Z","snapshot_observed_at":"2026-08-08T16:54:35.007753Z","submitted_at":"2025-02-09T21:44:27Z","title":"Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-08T17:01:36.086743Z"},"links":{"citing_paper":"/paper/2502.06042"},"observation_digest":"sha256:734285a6995daaee6bbd6d4480e865a097dc41a65e8aa605a8ab080753681101","observation_id":"df1de12e-323e-4169-a5d7-b9b9546a62ed","resolution":{"observed_at":"2026-08-08T17:01:36.086743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.01293","last_updated":"2021-02-02T04:07:38Z","snapshot_observed_at":"2026-08-01T22:46:19.170916Z","submitted_at":"2021-02-02T04:07:38Z","title":"Scaling Laws for Transfer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.01293","snapshot_observed_at":"2026-08-08T17:01:36.090967Z","title":"Scaling laws for transfer, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.06042","last_updated":"2025-05-26T18:48:37Z","snapshot_observed_at":"2026-08-08T16:54:35.007753Z","submitted_at":"2025-02-09T21:44:27Z","title":"Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-08T17:01:36.090967Z"},"links":{"cited_paper":"/paper/2102.01293","citing_paper":"/paper/2502.06042"},"observation_digest":"sha256:fbb0204ad2c22a71fe9ef5d26662463bb5dd386c648bd8a52d2d92a6eaa06f2a","observation_id":"722dd3be-544e-49c2-891c-b678f9a43b81","resolution":{"observed_at":"2026-08-08T17:01:36.090967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-08-08T17:01:36.095414Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.06042","last_updated":"2025-05-26T18:48:37Z","snapshot_observed_at":"2026-08-08T16:54:35.007753Z","submitted_at":"2025-02-09T21:44:27Z","title":"Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-08T17:01:36.095414Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2502.06042"},"observation_digest":"sha256:74f3d37efa0539ee2064a411cac52af3e218922ce606a1fec03c5f78dd616f41","observation_id":"19d8cfee-df61-4bc6-8e13-6b387f11ea40","resolution":{"observed_at":"2026-08-08T17:01:36.095414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20236","last_updated":"2024-05-30T16:40:07Z","snapshot_observed_at":"2026-07-06T18:22:48.671656Z","submitted_at":"2024-05-30T16:40:07Z","title":"Disentangling and Mitigating the Impact of Task Similarity for Continual Learning","version":1},"cited_work":{"arxiv_id":"2405.20236","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.20236","snapshot_observed_at":"2026-08-08T17:01:36.573204Z","title":"Disentangling and Mitigating the Impact of Task Similarity for Continual Learning","venue":"stat.ML","work_id":"d7d4bd2e-73bc-4c88-a2e8-d558748ae47e","year":2024},"citing_paper":{"arxiv_id":"2502.06042","last_updated":"2025-05-26T18:48:37Z","snapshot_observed_at":"2026-08-08T16:54:35.007753Z","submitted_at":"2025-02-09T21:44:27Z","title":"Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-08T17:01:36.099665Z"},"links":{"cited_paper":"/paper/2405.20236","citing_paper":"/paper/2502.06042"},"observation_digest":"sha256:7e17560e1315c98b7b9af5c73b6abfeb6e9cdf5e942710fe59417742e7ea508e","observation_id":"670b62d3-df1b-43f4-ac17-63c093676837","resolution":{"observed_at":"2026-08-08T17:01:36.579501Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-07-06T12:54:11.616335Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-08T17:01:36.103707Z","title":"A., Welbl, J., Clark, A., Hennigan, T., Noland, E., Millican, K., van den Driessche, G., Damoc, B., Guy, A., Osindero, S., Simonyan, K., Elsen, E., Rae, J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.06042","last_updated":"2025-05-26T18:48:37Z","snapshot_observed_at":"2026-08-08T16:54:35.007753Z","submitted_at":"2025-02-09T21:44:27Z","title":"Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-08T17:01:36.103707Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2502.06042"},"observation_digest":"sha256:f8c7002abb2e40b958145dc0f3c16645f031187b2b5c600287e98418e33dbeb5","observation_id":"d3629529-3168-4d20-bb8d-ce8902bde973","resolution":{"observed_at":"2026-08-08T17:01:36.103707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:01:36.832748Z","title":null,"venue":null,"work_id":"b43aaa4f-271d-4da0-82b7-8c37552e9a4f","year":2022},"citing_paper":{"arxiv_id":"2502.06042","last_updated":"2025-05-26T18:48:37Z","snapshot_observed_at":"2026-08-08T16:54:35.007753Z","submitted_at":"2025-02-09T21:44:27Z","title":"Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-08T17:01:36.107743Z"},"links":{"citing_paper":"/paper/2502.06042"},"observation_digest":"sha256:f59f884d782378be3d63e189b485f4deea87478abe2f5f11ecaef0657f4f7f90","observation_id":"7ffca25e-5a4d-4446-8e11-50e9128774da","resolution":{"observed_at":"2026-08-08T17:01:36.836051Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1902.00751","last_updated":"2019-06-13T17:48:30Z","snapshot_observed_at":"2026-07-06T07:30:44.870185Z","submitted_at":"2019-02-02T16:29:47Z","title":"Parameter-Efficient Transfer Learning for NLP","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1902.00751","snapshot_observed_at":"2026-08-08T17:01:36.110759Z","title":"Parameter-efficient transfer learning for nlp, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.06042","last_updated":"2025-05-26T18:48:37Z","snapshot_observed_at":"2026-08-08T16:54:35.007753Z","submitted_at":"2025-02-09T21:44:27Z","title":"Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-08T17:01:36.110759Z"},"links":{"cited_paper":"/paper/1902.00751","citing_paper":"/paper/2502.06042"},"observation_digest":"sha256:3a1a427d8420fbd92d4a168cf030c43506fa6c95cf432db3d37b861b813e977e","observation_id":"13153a14-8642-4f09-a584-d0d7da39aedc","resolution":{"observed_at":"2026-08-08T17:01:36.110759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-07T07:43:16.294957Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-08T17:01:36.113930Z","title":"J., Shen, Y., Wallis, P., Allen-Zhu, Z., Li, Y., Wang, S., Wang, L., and Chen, W","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.06042","last_updated":"2025-05-26T18:48:37Z","snapshot_observed_at":"2026-08-08T16:54:35.007753Z","submitted_at":"2025-02-09T21:44:27Z","title":"Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-08T17:01:36.113930Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2502.06042"},"observation_digest":"sha256:d3723f6cb46340a0a0df5ddfc5c7e25a04ada151b9b6905cf1141a4e234dc551","observation_id":"2f570756-ec8c-491d-9c7f-683279943162","resolution":{"observed_at":"2026-08-08T17:01:36.113930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:01:36.822258Z","title":"L., Wang, C., Yao, Y., Zhao, C., Zhou, J., Cai, J., Zhai, Z., Ding, N., Jia, C., Zeng, G., dahai li, Liu, Z., and Sun, M","venue":null,"work_id":"63afa9a4-9d9a-40c1-b99a-6c7ecbd4ab0f","year":2024},"citing_paper":{"arxiv_id":"2502.06042","last_updated":"2025-05-26T18:48:37Z","snapshot_observed_at":"2026-08-08T16:54:35.007753Z","submitted_at":"2025-02-09T21:44:27Z","title":"Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-08T17:01:36.117451Z"},"links":{"citing_paper":"/paper/2502.06042"},"observation_digest":"sha256:e102f57d9a55d85be53f3357e1f4929960248ce360f19550fc851f622f531042","observation_id":"5e9eebac-00a9-4b75-9358-e17ecb98a7fd","resolution":{"observed_at":"2026-08-08T17:01:36.825506Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08763","last_updated":"2024-09-04T16:13:18Z","snapshot_observed_at":"2026-07-06T17:44:09.081164Z","submitted_at":"2024-03-13T17:58:57Z","title":"Simple and Scalable Strategies to Continually Pre-train Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08763","snapshot_observed_at":"2026-08-08T17:01:36.120434Z","title":"L., Anthony, Q., Lesort, T., Belilovsky, E., and Rish, I","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06042","last_updated":"2025-05-26T18:48:37Z","snapshot_observed_at":"2026-08-08T16:54:35.007753Z","submitted_at":"2025-02-09T21:44:27Z","title":"Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-08T17:01:36.120434Z"},"links":{"cited_paper":"/paper/2403.08763","citing_paper":"/paper/2502.06042"},"observation_digest":"sha256:1630c5ea0b058c4eba7596516ce98179c8473109d20d3e9d2ec3fa76d735772e","observation_id":"32c3eda3-14ab-4ce6-820c-2666f8d054b3","resolution":{"observed_at":"2026-08-08T17:01:36.120434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:01:36.123633Z","title":"Scaling laws for downstream task performance of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06042","last_updated":"2025-05-26T18:48:37Z","snapshot_observed_at":"2026-08-08T16:54:35.007753Z","submitted_at":"2025-02-09T21:44:27Z","title":"Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-08T17:01:36.123633Z"},"links":{"citing_paper":"/paper/2502.06042"},"observation_digest":"sha256:4a1852756eeb4f16ab62a10cc0e4aad55f377aa033b92f9fb3f6e9dd767d494b","observation_id":"c1c71820-692a-4f1a-a23e-6be4f017bc7c","resolution":{"observed_at":"2026-08-08T17:01:36.123633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.05605","last_updated":"2024-01-11T00:44:25Z","snapshot_observed_at":"2026-07-06T17:14:03.152949Z","submitted_at":"2024-01-11T00:44:25Z","title":"Scaling Laws for Forgetting When Fine-Tuning Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.05605","snapshot_observed_at":"2026-08-08T17:01:36.126796Z","title":"Scaling laws for forgetting when fine-tuning large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06042","last_updated":"2025-05-26T18:48:37Z","snapshot_observed_at":"2026-08-08T16:54:35.007753Z","submitted_at":"2025-02-09T21:44:27Z","title":"Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-08T17:01:36.126796Z"},"links":{"cited_paper":"/paper/2401.05605","citing_paper":"/paper/2502.06042"},"observation_digest":"sha256:427c9da19beadac62402fd1a2901d128092ed1af4186635390ec83156ab9f153","observation_id":"46cd8a44-6f4f-4b39-bed4-e6aae40e8a25","resolution":{"observed_at":"2026-08-08T17:01:36.126796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.02774","last_updated":"2024-05-05T00:08:00Z","snapshot_observed_at":"2026-07-06T18:09:55.249620Z","submitted_at":"2024-05-05T00:08:00Z","title":"Get more for less: Principled Data Selection for Warming Up Fine-Tuning in LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.02774","snapshot_observed_at":"2026-08-08T17:01:36.130140Z","title":"A., Sun, Y., Jahagirdar, H., Zhang, Y., Du, R., Sahu, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06042","last_updated":"2025-05-26T18:48:37Z","snapshot_observed_at":"2026-08-08T16:54:35.007753Z","submitted_at":"2025-02-09T21:44:27Z","title":"Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-08T17:01:36.130140Z"},"links":{"cited_paper":"/paper/2405.02774","citing_paper":"/paper/2502.06042"},"observation_digest":"sha256:8d5f160d47778513ed32e19cd7ad33181dd9d5f1867ebc9d0e43cfec049398e4","observation_id":"eb9e3c6f-cab7-4d45-be90-58871f1ca401","resolution":{"observed_at":"2026-08-08T17:01:36.130140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-08T17:01:36.133857Z","title":"B., Chess, B., Child, R., Gray, S., Radford, A., Wu, J., and Amodei, D","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2502.06042","last_updated":"2025-05-26T18:48:37Z","snapshot_observed_at":"2026-08-08T16:54:35.007753Z","submitted_at":"2025-02-09T21:44:27Z","title":"Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-08T17:01:36.133857Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2502.06042"},"observation_digest":"sha256:997ae4c4a7b42483098b7faaaa181a4c7982ce54716f52b9638dcf5ca4c4d377","observation_id":"f69888e6-bb5c-4108-8578-105fac66082d","resolution":{"observed_at":"2026-08-08T17:01:36.133857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1808.06226","last_updated":"2018-08-19T16:49:06Z","snapshot_observed_at":"2026-07-06T06:56:20.935388Z","submitted_at":"2018-08-19T16:49:06Z","title":"SentencePiece: A simple and language independent subword tokenizer and detokenizer for Neural Text Processing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1808.06226","snapshot_observed_at":"2026-08-08T17:01:36.137146Z","title":"Sentencepiece: A simple and language independent subword tokenizer and detokenizer for neural text processing","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.06042","last_updated":"2025-05-26T18:48:37Z","snapshot_observed_at":"2026-08-08T16:54:35.007753Z","submitted_at":"2025-02-09T21:44:27Z","title":"Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-08T17:01:36.137146Z"},"links":{"cited_paper":"/paper/1808.06226","citing_paper":"/paper/2502.06042"},"observation_digest":"sha256:4561a6d7f6b7542497a8606fcc17dea026cab03156e62816376845103b6e07f4","observation_id":"d4b50a27-f704-4b8b-b279-6409a8d22899","resolution":{"observed_at":"2026-08-08T17:01:36.137146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:01:36.810516Z","title":"Improved fine-tuning by better leveraging pre-training data","venue":null,"work_id":"a553b18c-e2b2-4bbb-a720-8e893851e636","year":2022},"citing_paper":{"arxiv_id":"2502.06042","last_updated":"2025-05-26T18:48:37Z","snapshot_observed_at":"2026-08-08T16:54:35.007753Z","submitted_at":"2025-02-09T21:44:27Z","title":"Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-08T17:01:36.140667Z"},"links":{"citing_paper":"/paper/2502.06042"},"observation_digest":"sha256:199d9a2c47101d83c726070fcde8851e0b3519f7d675e86ff5bfdab99f83181a","observation_id":"9e551a4f-ba48-4fff-85fc-cd1a357abb79","resolution":{"observed_at":"2026-08-08T17:01:36.814908Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:01:36.799302Z","title":"and Hutter, F","venue":null,"work_id":"7b27ff8a-ffa8-4faf-94f1-d06efd6ae03a","year":2017},"citing_paper":{"arxiv_id":"2502.06042","last_updated":"2025-05-26T18:48:37Z","snapshot_observed_at":"2026-08-08T16:54:35.007753Z","submitted_at":"2025-02-09T21:44:27Z","title":"Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-08T17:01:36.144198Z"},"links":{"citing_paper":"/paper/2502.06042"},"observation_digest":"sha256:462d806e3f2f80c606b7fed8f9ecedb3dab08b1e5ec116ec4611aa468ab42595","observation_id":"5bdfefc6-a351-409c-ac89-22579ccc7eac","resolution":{"observed_at":"2026-08-08T17:01:36.803295Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:01:36.147470Z","title":"and Hutter, F","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.06042","last_updated":"2025-05-26T18:48:37Z","snapshot_observed_at":"2026-08-08T16:54:35.007753Z","submitted_at":"2025-02-09T21:44:27Z","title":"Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-08T17:01:36.147470Z"},"links":{"citing_paper":"/paper/2502.06042"},"observation_digest":"sha256:07a6d953130663430d9230c99ba9dcfc836841b124ca5d61e1c6dbe7600a78ec","observation_id":"9fa8498c-dad9-43e8-a60c-a0e333f548b3","resolution":{"observed_at":"2026-08-08T17:01:36.147470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.08747","last_updated":"2025-01-05T04:09:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-17T02:53:23Z","title":"An Empirical Study of Catastrophic Forgetting in Large Language Models During Continual Fine-tuning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.08747","snapshot_observed_at":"2026-08-08T17:01:36.150551Z","title":"An empirical study of catastrophic forgetting in large language models during continual fine-tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06042","last_updated":"2025-05-26T18:48:37Z","snapshot_observed_at":"2026-08-08T16:54:35.007753Z","submitted_at":"2025-02-09T21:44:27Z","title":"Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-08T17:01:36.150551Z"},"links":{"cited_paper":"/paper/2308.08747","citing_paper":"/paper/2502.06042"},"observation_digest":"sha256:0b40e2dfa4c91470a948426f11910861fb30922e7ea1c1fed581dbf8f0652da3","observation_id":"b0701b48-8b4b-4e01-86cc-847043c43dbd","resolution":{"observed_at":"2026-08-08T17:01:36.150551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12120","last_updated":"2026-05-20T13:58:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-17T18:45:25Z","title":"LLMs on the Line: Data Determines Loss-to-Loss Scaling Laws","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12120","snapshot_observed_at":"2026-08-08T17:01:36.154116Z","title":"Llms on the line: Data determines loss-to-loss scaling laws","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.06042","last_updated":"2025-05-26T18:48:37Z","snapshot_observed_at":"2026-08-08T16:54:35.007753Z","submitted_at":"2025-02-09T21:44:27Z","title":"Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-08T17:01:36.154116Z"},"links":{"cited_paper":"/paper/2502.12120","citing_paper":"/paper/2502.06042"},"observation_digest":"sha256:67948fcaf7da594453edaa8e8d233c9fe9a293c84e09c8b862fea75ddc972037","observation_id":"89f4ec0a-15e4-410c-9400-07e39d7e2ef8","resolution":{"observed_at":"2026-08-08T17:01:36.154116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:01:36.782288Z","title":"Metaicl: Learning to learn in context","venue":null,"work_id":"b457b4a6-933e-47ee-a9f2-ff7818dddc66","year":2022},"citing_paper":{"arxiv_id":"2502.06042","last_updated":"2025-05-26T18:48:37Z","snapshot_observed_at":"2026-08-08T16:54:35.007753Z","submitted_at":"2025-02-09T21:44:27Z","title":"Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-08T17:01:36.157349Z"},"links":{"citing_paper":"/paper/2502.06042"},"observation_digest":"sha256:37b9f01b5c2afee64c1563ce6a83b0f5556ace95e3601881258f012e6961e7ac","observation_id":"22ad3363-1613-43d8-a6f3-8698700c4d9a","resolution":{"observed_at":"2026-08-08T17:01:36.786124Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:01:36.160335Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06042","last_updated":"2025-05-26T18:48:37Z","snapshot_observed_at":"2026-08-08T16:54:35.007753Z","submitted_at":"2025-02-09T21:44:27Z","title":"Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-08T17:01:36.160335Z"},"links":{"citing_paper":"/paper/2502.06042"},"observation_digest":"sha256:2cccb0c589b9a8fa4a8362c919b571dca7a9fb2ae00cad4989ba6c19f0cf911f","observation_id":"b42c65b6-0a14-4b5f-a976-f198e5fb034a","resolution":{"observed_at":"2026-08-08T17:01:36.160335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:01:36.163627Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.06042","last_updated":"2025-05-26T18:48:37Z","snapshot_observed_at":"2026-08-08T16:54:35.007753Z","submitted_at":"2025-02-09T21:44:27Z","title":"Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-08T17:01:36.163627Z"},"links":{"citing_paper":"/paper/2502.06042"},"observation_digest":"sha256:3f4420af43b404172da450e08cc1171154434ff80854a438759e32b5fb7855e3","observation_id":"275cdcbb-c633-49dd-8b0e-b6b879a9b018","resolution":{"observed_at":"2026-08-08T17:01:36.163627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19146","last_updated":"2025-01-19T10:34:08Z","snapshot_observed_at":"2026-07-06T18:37:55.945869Z","submitted_at":"2024-06-27T13:02:43Z","title":"Resolving Discrepancies in Compute-Optimal Scaling of Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19146","snapshot_observed_at":"2026-08-08T17:01:36.166405Z","title":"Resolving discrepancies in compute-optimal scaling of language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06042","last_updated":"2025-05-26T18:48:37Z","snapshot_observed_at":"2026-08-08T16:54:35.007753Z","submitted_at":"2025-02-09T21:44:27Z","title":"Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-08T17:01:36.166405Z"},"links":{"cited_paper":"/paper/2406.19146","citing_paper":"/paper/2502.06042"},"observation_digest":"sha256:c25ee18f5b0b291654cc756aefbc562ea92f0ba0127240de2fa00ec17e87b639","observation_id":"774c7d91-55e4-49be-8a31-36fbb86bdd82","resolution":{"observed_at":"2026-08-08T17:01:36.166405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.05682","last_updated":"2022-10-10T16:36:47Z","snapshot_observed_at":"2026-08-06T17:49:01.053607Z","submitted_at":"2021-12-10T17:25:07Z","title":"Self-attention Does Not Need $O(n^2)$ Memory","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.05682","snapshot_observed_at":"2026-08-08T17:01:36.169940Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.06042","last_updated":"2025-05-26T18:48:37Z","snapshot_observed_at":"2026-08-08T16:54:35.007753Z","submitted_at":"2025-02-09T21:44:27Z","title":"Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-08T17:01:36.169940Z"},"links":{"cited_paper":"/paper/2112.05682","citing_paper":"/paper/2502.06042"},"observation_digest":"sha256:f1670a179e9b16dc99cc58d93a64b5bbce61b151bc9874934d4ddbf6b837bf08","observation_id":"d1acaf38-48d1-4533-b92d-d1ccf2ea4737","resolution":{"observed_at":"2026-08-08T17:01:36.169940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:01:36.756738Z","title":"Language models are unsupervised multitask learners","venue":null,"work_id":"c4dbba5d-f756-4a89-8ca6-518a180ba6f0","year":2019},"citing_paper":{"arxiv_id":"2502.06042","last_updated":"2025-05-26T18:48:37Z","snapshot_observed_at":"2026-08-08T16:54:35.007753Z","submitted_at":"2025-02-09T21:44:27Z","title":"Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-08T17:01:36.174011Z"},"links":{"citing_paper":"/paper/2502.06042"},"observation_digest":"sha256:702a1717ee9b4deecbee6beb8d17fafaa3ab60d62a040b754602c9d1f80cecfd","observation_id":"d3f9934a-f0b0-4695-ad68-967cbd97e01a","resolution":{"observed_at":"2026-08-08T17:01:36.760912Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:01:36.745635Z","title":"Multitask prompted training enables zero-shot task generalization","venue":null,"work_id":"4ad603f9-e1a4-45a4-9e11-598fe3916592","year":2022},"citing_paper":{"arxiv_id":"2502.06042","last_updated":"2025-05-26T18:48:37Z","snapshot_observed_at":"2026-08-08T16:54:35.007753Z","submitted_at":"2025-02-09T21:44:27Z","title":"Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-08T17:01:36.177949Z"},"links":{"citing_paper":"/paper/2502.06042"},"observation_digest":"sha256:c3bef0baf27957b642f702b3099194411eee6bd1bd185cb58d8827ba4e376888","observation_id":"9e25533c-d209-44cc-a08c-28141256f423","resolution":{"observed_at":"2026-08-08T17:01:36.749186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.00448","last_updated":"2025-04-14T10:11:13Z","snapshot_observed_at":"2026-07-06T17:10:21.098136Z","submitted_at":"2023-12-31T10:53:58Z","title":"Beyond Chinchilla-Optimal: Accounting for Inference in Language Model Scaling Laws","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.00448","snapshot_observed_at":"2026-08-08T17:01:36.181915Z","title":"Beyond chinchilla-optimal: Accounting for inference in language model scaling laws, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06042","last_updated":"2025-05-26T18:48:37Z","snapshot_observed_at":"2026-08-08T16:54:35.007753Z","submitted_at":"2025-02-09T21:44:27Z","title":"Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-08T17:01:36.181915Z"},"links":{"cited_paper":"/paper/2401.00448","citing_paper":"/paper/2502.06042"},"observation_digest":"sha256:142f74b5dc7444b525171e3c575c5fd6aefdb910c90b3f37ed3d186efdfb68c1","observation_id":"642d8bb8-aa55-41cd-a887-240b8c4f5928","resolution":{"observed_at":"2026-08-08T17:01:36.181915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1409.3215","last_updated":"2014-12-14T20:59:51Z","snapshot_observed_at":"2026-08-02T03:58:50.109606Z","submitted_at":"2014-09-10T19:55:35Z","title":"Sequence to Sequence Learning with Neural Networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1409.3215","snapshot_observed_at":"2026-08-08T17:01:36.186433Z","title":"Sequence to sequence learning with neural networks","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2502.06042","last_updated":"2025-05-26T18:48:37Z","snapshot_observed_at":"2026-08-08T16:54:35.007753Z","submitted_at":"2025-02-09T21:44:27Z","title":"Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-08T17:01:36.186433Z"},"links":{"cited_paper":"/paper/1409.3215","citing_paper":"/paper/2502.06042"},"observation_digest":"sha256:f71fef1ee5d277c8d386c7fe7a98616c6f4a708ce7b7557ea3f312f23261af15","observation_id":"115c1904-e99d-429f-903e-b3d1bc5afdfe","resolution":{"observed_at":"2026-08-08T17:01:36.186433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:01:36.734692Z","title":"Openhermes 2.5: An open dataset of synthetic data for generalist llm assistants, 2023","venue":null,"work_id":"a761c99e-f7b2-4b56-9fff-0fdcb3f48d21","year":2023},"citing_paper":{"arxiv_id":"2502.06042","last_updated":"2025-05-26T18:48:37Z","snapshot_observed_at":"2026-08-08T16:54:35.007753Z","submitted_at":"2025-02-09T21:44:27Z","title":"Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-08T17:01:36.190495Z"},"links":{"citing_paper":"/paper/2502.06042"},"observation_digest":"sha256:0f3d37c7156c7d38880acd4be60343ceb1c990ec03d3352cdefd921b706ffc33","observation_id":"3b9816fa-688c-4341-b4a2-73273cece9e3","resolution":{"observed_at":"2026-08-08T17:01:36.738109Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11029","last_updated":"2024-10-24T17:56:14Z","snapshot_observed_at":"2026-08-06T07:25:53.036005Z","submitted_at":"2024-08-20T17:30:48Z","title":"Scaling Law with Learning Rate Annealing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11029","snapshot_observed_at":"2026-08-08T17:01:36.194110Z","title":"Scaling law with learning rate annealing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06042","last_updated":"2025-05-26T18:48:37Z","snapshot_observed_at":"2026-08-08T16:54:35.007753Z","submitted_at":"2025-02-09T21:44:27Z","title":"Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-08T17:01:36.194110Z"},"links":{"cited_paper":"/paper/2408.11029","citing_paper":"/paper/2502.06042"},"observation_digest":"sha256:6ab3f1802713ff5115b564ad7869a154fe408f84532be65fcc2d2726dc7b5104","observation_id":"db0581da-92ba-4af8-90c0-2553e2f59445","resolution":{"observed_at":"2026-08-08T17:01:36.194110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13476","last_updated":"2024-11-26T09:46:25Z","snapshot_observed_at":"2026-08-05T12:30:14.699982Z","submitted_at":"2024-11-20T17:22:31Z","title":"When Precision Meets Position: BFloat16 Breaks Down RoPE in Long-Context Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13476","snapshot_observed_at":"2026-08-08T17:01:36.198148Z","title":"When precision meets position: Bfloat16 breaks down rope in long-context training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06042","last_updated":"2025-05-26T18:48:37Z","snapshot_observed_at":"2026-08-08T16:54:35.007753Z","submitted_at":"2025-02-09T21:44:27Z","title":"Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-08T17:01:36.198148Z"},"links":{"cited_paper":"/paper/2411.13476","citing_paper":"/paper/2502.06042"},"observation_digest":"sha256:ecbaf1d8d0e2eeb7e9289e2dbe3c08ca1a40554039dc9b9c82104256f44b0c3f","observation_id":"702def6f-d4b2-4b6f-9f4f-80b9658d61cf","resolution":{"observed_at":"2026-08-08T17:01:36.198148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:01:36.723873Z","title":null,"venue":null,"work_id":"5b38b600-5832-4f80-b447-11cb54ebccf1","year":2024},"citing_paper":{"arxiv_id":"2502.06042","last_updated":"2025-05-26T18:48:37Z","snapshot_observed_at":"2026-08-08T16:54:35.007753Z","submitted_at":"2025-02-09T21:44:27Z","title":"Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-08T17:01:36.202404Z"},"links":{"citing_paper":"/paper/2502.06042"},"observation_digest":"sha256:b6ecfb26d66f21ed49f309bd727fbb80d3a7a62504d521116f7d73b96c383184","observation_id":"e4c8af24-347c-4f88-8d86-0e579484ba57","resolution":{"observed_at":"2026-08-08T17:01:36.727455Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:01:36.713435Z","title":"W., Lester, B., Du, N., Dai, A","venue":null,"work_id":"6e92979f-8af3-463c-80fd-186b6d9ba7c3","year":2022},"citing_paper":{"arxiv_id":"2502.06042","last_updated":"2025-05-26T18:48:37Z","snapshot_observed_at":"2026-08-08T16:54:35.007753Z","submitted_at":"2025-02-09T21:44:27Z","title":"Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-08T17:01:36.205762Z"},"links":{"citing_paper":"/paper/2502.06042"},"observation_digest":"sha256:d7e1695ccf932320a265ab4c0f787026cce6506bd83f830b0ed2580232e39c46","observation_id":"9c8321d0-e366-4e90-b046-338df60caa46","resolution":{"observed_at":"2026-08-08T17:01:36.717023Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:01:36.701639Z","title":"What makes a high-quality training dataset for large language models: A practitioners' perspective","venue":null,"work_id":"ba143f1b-c81f-49bf-8487-914b90b8da17","year":2024},"citing_paper":{"arxiv_id":"2502.06042","last_updated":"2025-05-26T18:48:37Z","snapshot_observed_at":"2026-08-08T16:54:35.007753Z","submitted_at":"2025-02-09T21:44:27Z","title":"Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-08T17:01:36.208846Z"},"links":{"citing_paper":"/paper/2502.06042"},"observation_digest":"sha256:5abac2e0ef2862fdf497218d9aea2b81ce9c7a6cb77f02acf4ca9dab58b17ba5","observation_id":"ec7e55ca-b143-495b-bae8-4fbbdeee3771","resolution":{"observed_at":"2026-08-08T17:01:36.705655Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:01:36.689960Z","title":"When scaling meets LLM finetuning: The effect of data, model and finetuning method","venue":null,"work_id":"30add9c9-01db-4207-8b7f-271d5363e206","year":2024},"citing_paper":{"arxiv_id":"2502.06042","last_updated":"2025-05-26T18:48:37Z","snapshot_observed_at":"2026-08-08T16:54:35.007753Z","submitted_at":"2025-02-09T21:44:27Z","title":"Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-08T17:01:36.211919Z"},"links":{"citing_paper":"/paper/2502.06042"},"observation_digest":"sha256:98d000d75f36fe0759fc44508d10e5335bbfad7374b4a13a72e1115d89b81a3a","observation_id":"8e58dd0b-5e36-44bd-a36e-76d72e08d32c","resolution":{"observed_at":"2026-08-08T17:01:36.693831Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16842","last_updated":"2024-02-27T18:06:29Z","snapshot_observed_at":"2026-07-06T17:35:41.168780Z","submitted_at":"2024-02-26T18:59:12Z","title":"Asymmetry in Low-Rank Adapters of Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16842","snapshot_observed_at":"2026-08-08T17:01:36.214939Z","title":"S., Gabrielsson, R","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06042","last_updated":"2025-05-26T18:48:37Z","snapshot_observed_at":"2026-08-08T16:54:35.007753Z","submitted_at":"2025-02-09T21:44:27Z","title":"Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-08T17:01:36.214939Z"},"links":{"cited_paper":"/paper/2402.16842","citing_paper":"/paper/2502.06042"},"observation_digest":"sha256:fccfe04b330fc229a6f6a666804b96ecd9b0b5192a37959581c6b05ed7b717a1","observation_id":"da611d14-44c9-419b-bc38-a58e6281c029","resolution":{"observed_at":"2026-08-08T17:01:36.214939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:01:36.218426Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06042","last_updated":"2025-05-26T18:48:37Z","snapshot_observed_at":"2026-08-08T16:54:35.007753Z","submitted_at":"2025-02-09T21:44:27Z","title":"Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-08T17:01:36.218426Z"},"links":{"citing_paper":"/paper/2502.06042"},"observation_digest":"sha256:66f6872ca10c449449407035caef0bc7db34b1779f3bffe9c0ed113798ce032f","observation_id":"170695dc-26c0-4cb5-af04-f682e50a23ea","resolution":{"observed_at":"2026-08-08T17:01:36.218426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.06042","last_updated":"2025-05-26T18:48:37Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-08T16:54:35.007753Z","submitted_at":"2025-02-09T21:44:27Z","title":"Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection"},"reference_resolution":{"displayed":48,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":33,"verified_exact":2,"verified_fuzzy":13},"total_outbound_references":48},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 48 of 48 outbound references and 7 inbound Pith citation observations for arXiv:2502.06042."}