{"as_of":"2026-08-08T19:35:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:22b779e81a398009dda162dd54c138d8a4a10b3810f2fa03fb976a1dec22caf6","coverage":[{"denominator":48,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":48,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T14:36:36.594376Z","state":"measured"},{"denominator":49,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":49,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:09:50.090492Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T14:09:51.295780Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.06733","last_updated":"2025-02-10T17:57:15Z","snapshot_observed_at":"2026-08-08T14:27:58.475022Z","submitted_at":"2025-02-10T17:57:15Z","title":"Dynamic Loss-Based Sample Reweighting for Improved Large Language Model Pretraining","version":1},"cited_work":{"arxiv_id":"2502.06733","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.06733","snapshot_observed_at":"2026-08-07T14:09:51.295780Z","title":"Dynamic Loss-Based Sample Reweighting for Improved Large Language Model Pretraining","venue":"cs.LG","work_id":"e868ae07-fb4a-474f-a69b-c36e69aa2487","year":2025},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-07T14:01:57.359586Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:50.090492Z"},"links":{"cited_paper":"/paper/2502.06733","citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:a10775977cc9e2ef293baa28ff9d8bed2abe2a6a6c3c159447fd67d7d49a0745","observation_id":"457b51ea-2390-4ed0-8f05-fefe992ccef0","resolution":{"observed_at":"2026-08-07T14:09:51.406696Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.06733/citation-record","integrity":"/paper/2502.06733/integrity","json":"/paper/2502.06733/citation-record.json","paper":"/paper/2502.06733"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:36:36.371171Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06733","last_updated":"2025-02-10T17:57:15Z","snapshot_observed_at":"2026-08-08T14:27:58.475022Z","submitted_at":"2025-02-10T17:57:15Z","title":"Dynamic Loss-Based Sample Reweighting for Improved Large Language Model Pretraining","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-08T14:36:36.371171Z"},"links":{"citing_paper":"/paper/2502.06733"},"observation_digest":"sha256:1d638f0038f75f788a4eb81afd8c114d01dac26e1a90a3226259cad0f104f91f","observation_id":"64c56565-2fec-4d9c-9e1a-8cea83f807e5","resolution":{"observed_at":"2026-08-08T14:36:36.371171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-08T14:36:36.377163Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06733","last_updated":"2025-02-10T17:57:15Z","snapshot_observed_at":"2026-08-08T14:27:58.475022Z","submitted_at":"2025-02-10T17:57:15Z","title":"Dynamic Loss-Based Sample Reweighting for Improved Large Language Model Pretraining","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-08T14:36:36.377163Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2502.06733"},"observation_digest":"sha256:ea22efd0361ac602b6ae530d2dc98661e00f99f97fb5179c1425136011c8f226","observation_id":"145c6055-4bcf-4d83-b6ee-c758d2e238b9","resolution":{"observed_at":"2026-08-08T14:36:36.377163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:36:36.382732Z","title":"Piqa: Reasoning about physical commonsense in natural language","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.06733","last_updated":"2025-02-10T17:57:15Z","snapshot_observed_at":"2026-08-08T14:27:58.475022Z","submitted_at":"2025-02-10T17:57:15Z","title":"Dynamic Loss-Based Sample Reweighting for Improved Large Language Model Pretraining","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-08T14:36:36.382732Z"},"links":{"citing_paper":"/paper/2502.06733"},"observation_digest":"sha256:418254f6ca96b7891a1b8a8cc26399d878f05c1c86e75fca17b54132b796add0","observation_id":"b200ef2d-00e0-475e-af3e-b5dc128e5c58","resolution":{"observed_at":"2026-08-08T14:36:36.382732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:36:36.387751Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2502.06733","last_updated":"2025-02-10T17:57:15Z","snapshot_observed_at":"2026-08-08T14:27:58.475022Z","submitted_at":"2025-02-10T17:57:15Z","title":"Dynamic Loss-Based Sample Reweighting for Improved Large Language Model Pretraining","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-08T14:36:36.387751Z"},"links":{"citing_paper":"/paper/2502.06733"},"observation_digest":"sha256:bdd2f7ec823ae1e0e94549a519912441b631ef881da50f1d7175527f8b58bcd0","observation_id":"7a369ffc-4bd7-4a41-82e9-40ba5d586606","resolution":{"observed_at":"2026-08-08T14:36:36.387751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:36:37.535436Z","title":"Skill-it! a data-driven skills framework for understanding and training language models","venue":null,"work_id":"3fbbc421-8f3a-4a97-bea5-f5c2f8a38897","year":2023},"citing_paper":{"arxiv_id":"2502.06733","last_updated":"2025-02-10T17:57:15Z","snapshot_observed_at":"2026-08-08T14:27:58.475022Z","submitted_at":"2025-02-10T17:57:15Z","title":"Dynamic Loss-Based Sample Reweighting for Improved Large Language Model Pretraining","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-08T14:36:36.392796Z"},"links":{"citing_paper":"/paper/2502.06733"},"observation_digest":"sha256:226d5d62f09268ddb85296c2693122a95f7746605e9ebf99864c139a11671251","observation_id":"037c0e44-3ff5-4e1a-8e51-fc7a9e100b6e","resolution":{"observed_at":"2026-08-08T14:36:37.575749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14270","last_updated":"2024-03-01T15:21:16Z","snapshot_observed_at":"2026-08-06T02:46:48.297978Z","submitted_at":"2024-02-22T04:10:57Z","title":"Take the Bull by the Horns: Hard Sample-Reweighted Continual Training Improves LLM Generalization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14270","snapshot_observed_at":"2026-08-08T14:36:36.397638Z","title":"Take the bull by the horns: Hard sample-reweighted continual training improves llm generalization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06733","last_updated":"2025-02-10T17:57:15Z","snapshot_observed_at":"2026-08-08T14:27:58.475022Z","submitted_at":"2025-02-10T17:57:15Z","title":"Dynamic Loss-Based Sample Reweighting for Improved Large Language Model Pretraining","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-08T14:36:36.397638Z"},"links":{"cited_paper":"/paper/2402.14270","citing_paper":"/paper/2502.06733"},"observation_digest":"sha256:335ecfc708356f848465532f038cc1470b61663de8c12fb7dca5334720f6d046","observation_id":"9311650d-fc56-431a-ad92-bf9903a64d29","resolution":{"observed_at":"2026-08-08T14:36:36.397638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:36:36.402751Z","title":"Palm: Scaling language modeling with pathways","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06733","last_updated":"2025-02-10T17:57:15Z","snapshot_observed_at":"2026-08-08T14:27:58.475022Z","submitted_at":"2025-02-10T17:57:15Z","title":"Dynamic Loss-Based Sample Reweighting for Improved Large Language Model Pretraining","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-08T14:36:36.402751Z"},"links":{"citing_paper":"/paper/2502.06733"},"observation_digest":"sha256:c07e5b88a317f10111822292efe3e11f8b5a1b41d5557145697222223fcf86ad","observation_id":"4053a7a8-7ef9-44c9-9130-7e24b0bcd021","resolution":{"observed_at":"2026-08-08T14:36:36.402751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.02355","last_updated":"2021-09-06T10:48:40Z","snapshot_observed_at":"2026-07-06T11:44:36.471158Z","submitted_at":"2021-09-06T10:48:40Z","title":"A Farewell to the Bias-Variance Tradeoff? An Overview of the Theory of Overparameterized Machine Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.02355","snapshot_observed_at":"2026-08-08T14:36:36.407927Z","title":"A farewell to the bias-variance tradeoff? an overview of the theory of overparameterized machine learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.06733","last_updated":"2025-02-10T17:57:15Z","snapshot_observed_at":"2026-08-08T14:27:58.475022Z","submitted_at":"2025-02-10T17:57:15Z","title":"Dynamic Loss-Based Sample Reweighting for Improved Large Language Model Pretraining","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-08T14:36:36.407927Z"},"links":{"cited_paper":"/paper/2109.02355","citing_paper":"/paper/2502.06733"},"observation_digest":"sha256:daa17c71da9010371768956afead71e78f73bda72f192af2a80458b542445ef4","observation_id":"32bddf59-41d5-4333-b82c-361002398ebb","resolution":{"observed_at":"2026-08-08T14:36:36.407927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-08T14:36:36.413017Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06733","last_updated":"2025-02-10T17:57:15Z","snapshot_observed_at":"2026-08-08T14:27:58.475022Z","submitted_at":"2025-02-10T17:57:15Z","title":"Dynamic Loss-Based Sample Reweighting for Improved Large Language Model Pretraining","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-08T14:36:36.413017Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2502.06733"},"observation_digest":"sha256:86fac1e91c621366c3d4a63f704598e8466d0cdd91e0b555333ad07de3ea8fa1","observation_id":"d8b248d9-d51d-4735-a035-09d1ebc902fc","resolution":{"observed_at":"2026-08-08T14:36:36.413017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.15389","last_updated":"2023-10-23T22:41:33Z","snapshot_observed_at":"2026-08-08T07:52:55.072991Z","submitted_at":"2023-10-23T22:41:33Z","title":"Irreducible Curriculum for Language Model Pretraining","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.15389","snapshot_observed_at":"2026-08-08T14:36:36.418212Z","title":"Irreducible curriculum for language model pretraining","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06733","last_updated":"2025-02-10T17:57:15Z","snapshot_observed_at":"2026-08-08T14:27:58.475022Z","submitted_at":"2025-02-10T17:57:15Z","title":"Dynamic Loss-Based Sample Reweighting for Improved Large Language Model Pretraining","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-08T14:36:36.418212Z"},"links":{"cited_paper":"/paper/2310.15389","citing_paper":"/paper/2502.06733"},"observation_digest":"sha256:ddd5f9cc8b91a111b38fc9a4ae49e88b56aed5538cc293fe46c2f2f47c9e2d52","observation_id":"f164f619-804d-4e77-b050-cb185a0ffaa6","resolution":{"observed_at":"2026-08-08T14:36:36.418212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:36:37.446418Z","title":"DOGE : Domain reweighting with generalization estimation","venue":null,"work_id":"c0de7598-439c-4a7b-84ff-64c1c1987b6c","year":2023},"citing_paper":{"arxiv_id":"2502.06733","last_updated":"2025-02-10T17:57:15Z","snapshot_observed_at":"2026-08-08T14:27:58.475022Z","submitted_at":"2025-02-10T17:57:15Z","title":"Dynamic Loss-Based Sample Reweighting for Improved Large Language Model Pretraining","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-08T14:36:36.423775Z"},"links":{"citing_paper":"/paper/2502.06733"},"observation_digest":"sha256:a497575cac6c057c97f6aa367daf36f9983f819ad0e5cfd39b5a331ab42b5f6d","observation_id":"7f18b473-c5e8-4fcf-9a23-c12d131e717c","resolution":{"observed_at":"2026-08-08T14:36:37.479585Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:36:36.428397Z","title":"Rethinking importance weighting for deep learning under distribution shift","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.06733","last_updated":"2025-02-10T17:57:15Z","snapshot_observed_at":"2026-08-08T14:27:58.475022Z","submitted_at":"2025-02-10T17:57:15Z","title":"Dynamic Loss-Based Sample Reweighting for Improved Large Language Model Pretraining","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-08T14:36:36.428397Z"},"links":{"citing_paper":"/paper/2502.06733"},"observation_digest":"sha256:83907f829bd1c2cbc4f5c72ba05973279a76ab491132a668f842a9ffd074e364","observation_id":"dc59a251-160d-4d96-b914-4ccd88e57a78","resolution":{"observed_at":"2026-08-08T14:36:36.428397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00027","last_updated":"2020-12-31T19:00:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-12-31T19:00:10Z","title":"The Pile: An 800GB Dataset of Diverse Text for Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00027","snapshot_observed_at":"2026-08-08T14:36:36.433253Z","title":"The pile: An 800gb dataset of diverse text for language modeling","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.06733","last_updated":"2025-02-10T17:57:15Z","snapshot_observed_at":"2026-08-08T14:27:58.475022Z","submitted_at":"2025-02-10T17:57:15Z","title":"Dynamic Loss-Based Sample Reweighting for Improved Large Language Model Pretraining","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-08T14:36:36.433253Z"},"links":{"cited_paper":"/paper/2101.00027","citing_paper":"/paper/2502.06733"},"observation_digest":"sha256:aedd5d082e09bb4291c762370dcd0982f24d99034ae814e1fd7377bb4bb3e4a2","observation_id":"cd800386-1655-4ed8-b3d9-ed3703bc65d7","resolution":{"observed_at":"2026-08-08T14:36:36.433253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.11973","last_updated":"2023-11-20T18:01:29Z","snapshot_observed_at":"2026-08-05T09:54:58.638813Z","submitted_at":"2023-11-20T18:01:29Z","title":"Adaptive Training Distributions with Scalable Online Bilevel Optimization","version":1},"cited_work":{"arxiv_id":"2311.11973","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.11973","snapshot_observed_at":"2026-08-08T14:36:36.967638Z","title":"Adaptive Training Distributions with Scalable Online Bilevel Optimization","venue":"cs.LG","work_id":"bba1d828-8162-45e1-a0c3-390234295c2f","year":2023},"citing_paper":{"arxiv_id":"2502.06733","last_updated":"2025-02-10T17:57:15Z","snapshot_observed_at":"2026-08-08T14:27:58.475022Z","submitted_at":"2025-02-10T17:57:15Z","title":"Dynamic Loss-Based Sample Reweighting for Improved Large Language Model Pretraining","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-08T14:36:36.438299Z"},"links":{"cited_paper":"/paper/2311.11973","citing_paper":"/paper/2502.06733"},"observation_digest":"sha256:fc3b3d620d90664654eed460176169e7ec78b6baa1c299daf5060946b6faf5fc","observation_id":"7351fd65-d779-4697-ba4c-ce4641107993","resolution":{"observed_at":"2026-08-08T14:36:36.972736Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:36:37.355167Z","title":"Fedexp: Speeding up federated averaging via extrapolation","venue":null,"work_id":"694014a5-6376-46aa-838a-49d8b3da1718","year":2023},"citing_paper":{"arxiv_id":"2502.06733","last_updated":"2025-02-10T17:57:15Z","snapshot_observed_at":"2026-08-08T14:27:58.475022Z","submitted_at":"2025-02-10T17:57:15Z","title":"Dynamic Loss-Based Sample Reweighting for Improved Large Language Model Pretraining","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-08T14:36:36.443123Z"},"links":{"citing_paper":"/paper/2502.06733"},"observation_digest":"sha256:1aebf3fc1fc1ad7ba13d3c2adbb0c0982e76ae25939c32d072e090c796b29ebf","observation_id":"a60e61d2-3a92-46d6-910b-d1bdddf903c2","resolution":{"observed_at":"2026-08-08T14:36:37.394485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.00762","last_updated":"2019-10-02T03:34:29Z","snapshot_observed_at":"2026-08-07T07:17:09.592892Z","submitted_at":"2019-10-02T03:34:29Z","title":"Accelerating Deep Learning by Focusing on the Biggest Losers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.00762","snapshot_observed_at":"2026-08-08T14:36:36.447693Z","title":"Accelerating deep learning by focusing on the biggest losers","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2502.06733","last_updated":"2025-02-10T17:57:15Z","snapshot_observed_at":"2026-08-08T14:27:58.475022Z","submitted_at":"2025-02-10T17:57:15Z","title":"Dynamic Loss-Based Sample Reweighting for Improved Large Language Model Pretraining","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-08T14:36:36.447693Z"},"links":{"cited_paper":"/paper/1910.00762","citing_paper":"/paper/2502.06733"},"observation_digest":"sha256:6595635404befd9fd519f04cf27607a483e3d8047d5cd76955cf74bfea74ad46","observation_id":"a908a46f-4f5f-44e6-9726-cf66d8072390","resolution":{"observed_at":"2026-08-08T14:36:36.447693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.09849","last_updated":"2024-12-12T14:56:20Z","snapshot_observed_at":"2026-07-06T19:02:20.097267Z","submitted_at":"2024-08-19T09:51:02Z","title":"Importance Weighting Can Help Large Language Models Self-Improve","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.09849","snapshot_observed_at":"2026-08-08T14:36:36.452596Z","title":"Importance weighting can help large language models self-improve","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06733","last_updated":"2025-02-10T17:57:15Z","snapshot_observed_at":"2026-08-08T14:27:58.475022Z","submitted_at":"2025-02-10T17:57:15Z","title":"Dynamic Loss-Based Sample Reweighting for Improved Large Language Model Pretraining","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-08T14:36:36.452596Z"},"links":{"cited_paper":"/paper/2408.09849","citing_paper":"/paper/2502.06733"},"observation_digest":"sha256:f70d35179d1dbac44d4fb42f2860d12e911427532a342af56e58e9222eb8a939","observation_id":"6c359732-9b22-4939-a8e4-d99ef841ffa8","resolution":{"observed_at":"2026-08-08T14:36:36.452596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:36:37.289149Z","title":"Instance weighting for domain adaptation in NLP","venue":null,"work_id":"8ac3b7ae-de1b-43a2-8c2a-0ae6f67d7dfe","year":2007},"citing_paper":{"arxiv_id":"2502.06733","last_updated":"2025-02-10T17:57:15Z","snapshot_observed_at":"2026-08-08T14:27:58.475022Z","submitted_at":"2025-02-10T17:57:15Z","title":"Dynamic Loss-Based Sample Reweighting for Improved Large Language Model Pretraining","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-08T14:36:36.457381Z"},"links":{"citing_paper":"/paper/2502.06733"},"observation_digest":"sha256:163d6c88c74c3702dd673496a551a54c6e634e86735d339984438b15419edc80","observation_id":"07d8b422-8c1e-4fc3-88e9-0fcd14d12602","resolution":{"observed_at":"2026-08-08T14:36:37.315830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:36:36.462282Z","title":"Not all samples are created equal: Deep learning with importance sampling","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.06733","last_updated":"2025-02-10T17:57:15Z","snapshot_observed_at":"2026-08-08T14:27:58.475022Z","submitted_at":"2025-02-10T17:57:15Z","title":"Dynamic Loss-Based Sample Reweighting for Improved Large Language Model Pretraining","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-08T14:36:36.462282Z"},"links":{"citing_paper":"/paper/2502.06733"},"observation_digest":"sha256:e6877c9fca539646bccac89c6134e979a1998c7a66b20827dae004a28f9f6ea8","observation_id":"7734a31c-4f42-4cd9-b793-740ca928c358","resolution":{"observed_at":"2026-08-08T14:36:36.462282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09222","last_updated":"2024-10-13T04:07:11Z","snapshot_observed_at":"2026-07-06T15:43:03.878575Z","submitted_at":"2023-06-15T15:58:04Z","title":"Stochastic Re-weighted Gradient Descent via Distributionally Robust Optimization","version":5},"cited_work":{"arxiv_id":"2306.09222","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.09222","snapshot_observed_at":"2026-08-08T14:36:36.915260Z","title":"Stochastic Re-weighted Gradient Descent via Distributionally Robust Optimization","venue":"cs.LG","work_id":"0b586a0c-3819-41c3-af4f-59f5229227d7","year":2023},"citing_paper":{"arxiv_id":"2502.06733","last_updated":"2025-02-10T17:57:15Z","snapshot_observed_at":"2026-08-08T14:27:58.475022Z","submitted_at":"2025-02-10T17:57:15Z","title":"Dynamic Loss-Based Sample Reweighting for Improved Large Language Model Pretraining","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-08T14:36:36.466643Z"},"links":{"cited_paper":"/paper/2306.09222","citing_paper":"/paper/2502.06733"},"observation_digest":"sha256:fbd2c6ad2259af29bc2185a6b5000da47ba089f9050b4aba7520a61b88edf3d2","observation_id":"2387da00-b5a9-424e-9a12-cb218ebc7a90","resolution":{"observed_at":"2026-08-08T14:36:36.920322Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:36:37.265097Z","title":"Probabilistic margins for instance reweighting in adversarial training","venue":null,"work_id":"bc35e5db-568d-44fd-8d8b-fc8fec0b3629","year":2021},"citing_paper":{"arxiv_id":"2502.06733","last_updated":"2025-02-10T17:57:15Z","snapshot_observed_at":"2026-08-08T14:27:58.475022Z","submitted_at":"2025-02-10T17:57:15Z","title":"Dynamic Loss-Based Sample Reweighting for Improved Large Language Model Pretraining","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-08T14:36:36.471610Z"},"links":{"citing_paper":"/paper/2502.06733"},"observation_digest":"sha256:6d1fc6a779597c8d33692f0ac6c712705b7603fdf795d0bd039fc9b6dd628bcb","observation_id":"a3df622a-a821-48a8-9992-8b8a25502890","resolution":{"observed_at":"2026-08-08T14:36:37.269915Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:36:36.476014Z","title":"Logiqa 2.0—an improved dataset for logical reasoning in natural language understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06733","last_updated":"2025-02-10T17:57:15Z","snapshot_observed_at":"2026-08-08T14:27:58.475022Z","submitted_at":"2025-02-10T17:57:15Z","title":"Dynamic Loss-Based Sample Reweighting for Improved Large Language Model Pretraining","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-08T14:36:36.476014Z"},"links":{"citing_paper":"/paper/2502.06733"},"observation_digest":"sha256:4e30860ead677985987c1e61205270e4162c62b45b24360080ec24f3f99c0818","observation_id":"5f15e577-aaa0-48e7-8940-52f416cb07cd","resolution":{"observed_at":"2026-08-08T14:36:36.476014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2007.08124","last_updated":"2020-07-16T05:52:16Z","snapshot_observed_at":"2026-07-06T09:38:41.713097Z","submitted_at":"2020-07-16T05:52:16Z","title":"LogiQA: A Challenge Dataset for Machine Reading Comprehension with Logical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.08124","snapshot_observed_at":"2026-08-08T14:36:36.480431Z","title":"Logiqa: A challenge dataset for machine reading comprehension with logical reasoning","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2502.06733","last_updated":"2025-02-10T17:57:15Z","snapshot_observed_at":"2026-08-08T14:27:58.475022Z","submitted_at":"2025-02-10T17:57:15Z","title":"Dynamic Loss-Based Sample Reweighting for Improved Large Language Model Pretraining","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-08T14:36:36.480431Z"},"links":{"cited_paper":"/paper/2007.08124","citing_paper":"/paper/2502.06733"},"observation_digest":"sha256:92015cbc5228aaaf918723d0fcb65a94f214081fdcad3f0717c6a56d5088eefa","observation_id":"fa7f26f8-24d7-4ea3-bf6b-19e8538d0901","resolution":{"observed_at":"2026-08-08T14:36:36.480431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13169","last_updated":"2023-11-13T14:50:06Z","snapshot_observed_at":"2026-07-06T15:30:45.921201Z","submitted_at":"2023-05-22T15:57:53Z","title":"A Pretrainer's Guide to Training Data: Measuring the Effects of Data Age, Domain Coverage, Quality, & Toxicity","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13169","snapshot_observed_at":"2026-08-08T14:36:36.485151Z","title":"A pretrainer's guide to training data: Measuring the effects of data age, domain coverage, quality, & toxicity","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06733","last_updated":"2025-02-10T17:57:15Z","snapshot_observed_at":"2026-08-08T14:27:58.475022Z","submitted_at":"2025-02-10T17:57:15Z","title":"Dynamic Loss-Based Sample Reweighting for Improved Large Language Model Pretraining","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-08T14:36:36.485151Z"},"links":{"cited_paper":"/paper/2305.13169","citing_paper":"/paper/2502.06733"},"observation_digest":"sha256:f2aa0df624e36232969af7c2316f5c9adea76233946eaeddb93d112c70a2e931","observation_id":"3516fb05-27ec-4f9e-b457-255a998579dd","resolution":{"observed_at":"2026-08-08T14:36:36.485151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1511.06343","last_updated":"2016-04-25T14:00:21Z","snapshot_observed_at":"2026-08-06T18:58:16.729973Z","submitted_at":"2015-11-19T20:24:09Z","title":"Online Batch Selection for Faster Training of Neural Networks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.06343","snapshot_observed_at":"2026-08-08T14:36:36.489866Z","title":"Online batch selection for faster training of neural networks","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.06733","last_updated":"2025-02-10T17:57:15Z","snapshot_observed_at":"2026-08-08T14:27:58.475022Z","submitted_at":"2025-02-10T17:57:15Z","title":"Dynamic Loss-Based Sample Reweighting for Improved Large Language Model Pretraining","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-08T14:36:36.489866Z"},"links":{"cited_paper":"/paper/1511.06343","citing_paper":"/paper/2502.06733"},"observation_digest":"sha256:c34160bf28cf961198d02b96c198591c2dbe1f8f716ca448a11b659942c3e70c","observation_id":"49dd77b7-6a50-44d1-8ab5-0364242ec0d8","resolution":{"observed_at":"2026-08-08T14:36:36.489866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.01116","last_updated":"2023-06-01T20:03:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-01T20:03:56Z","title":"The RefinedWeb Dataset for Falcon LLM: Outperforming Curated Corpora with Web Data, and Web Data Only","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.01116","snapshot_observed_at":"2026-08-08T14:36:36.494040Z","title":"The refinedweb dataset for falcon llm: outperforming curated corpora with web data, and web data only","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06733","last_updated":"2025-02-10T17:57:15Z","snapshot_observed_at":"2026-08-08T14:27:58.475022Z","submitted_at":"2025-02-10T17:57:15Z","title":"Dynamic Loss-Based Sample Reweighting for Improved Large Language Model Pretraining","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-08T14:36:36.494040Z"},"links":{"cited_paper":"/paper/2306.01116","citing_paper":"/paper/2502.06733"},"observation_digest":"sha256:ff8d827ca4ad5a4d7e1ade9217e85300e746285d5da335629f5d7ae300720dba","observation_id":"bc97de34-1176-4300-aac6-3827a5853cb0","resolution":{"observed_at":"2026-08-08T14:36:36.494040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17557","last_updated":"2024-10-31T11:37:49Z","snapshot_observed_at":"2026-08-02T15:25:02.551919Z","submitted_at":"2024-06-25T13:50:56Z","title":"The FineWeb Datasets: Decanting the Web for the Finest Text Data at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17557","snapshot_observed_at":"2026-08-08T14:36:36.499623Z","title":"The fineweb datasets: Decanting the web for the finest text data at scale, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06733","last_updated":"2025-02-10T17:57:15Z","snapshot_observed_at":"2026-08-08T14:27:58.475022Z","submitted_at":"2025-02-10T17:57:15Z","title":"Dynamic Loss-Based Sample Reweighting for Improved Large Language Model Pretraining","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-08T14:36:36.499623Z"},"links":{"cited_paper":"/paper/2406.17557","citing_paper":"/paper/2502.06733"},"observation_digest":"sha256:ff71036b953631cfb7009eaa262db0e4b7aef90ae1c4611ddf39026cdd78fc67","observation_id":"9ffc1f42-882c-4357-b311-0b4d9beea84b","resolution":{"observed_at":"2026-08-08T14:36:36.499623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:36:37.239869Z","title":"An online method for a class of distributionally robust optimization with non-convex objectives","venue":null,"work_id":"ea29a6a5-33b2-422a-bdb5-2b59fc544a47","year":2021},"citing_paper":{"arxiv_id":"2502.06733","last_updated":"2025-02-10T17:57:15Z","snapshot_observed_at":"2026-08-08T14:27:58.475022Z","submitted_at":"2025-02-10T17:57:15Z","title":"Dynamic Loss-Based Sample Reweighting for Improved Large Language Model Pretraining","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-08T14:36:36.504056Z"},"links":{"citing_paper":"/paper/2502.06733"},"observation_digest":"sha256:ed25558acb57c67f477e73ae46c37b033897b23a55b10a77ca42429e18e8e6ea","observation_id":"975a3e06-4a62-4cfd-b667-09b58438ee5f","resolution":{"observed_at":"2026-08-08T14:36:37.244956Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:36:37.224885Z","title":"Robust optimization over multiple domains","venue":null,"work_id":"89f6ae0f-c201-47b6-81d3-0e2a662636be","year":2019},"citing_paper":{"arxiv_id":"2502.06733","last_updated":"2025-02-10T17:57:15Z","snapshot_observed_at":"2026-08-08T14:27:58.475022Z","submitted_at":"2025-02-10T17:57:15Z","title":"Dynamic Loss-Based Sample Reweighting for Improved Large Language Model Pretraining","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-08T14:36:36.508337Z"},"links":{"citing_paper":"/paper/2502.06733"},"observation_digest":"sha256:bf7362d8e0a20b605ad871eceb39f8822c16300754f1f87ba091ccfcec203ce3","observation_id":"878d2deb-6e38-4f9b-852b-67819459e719","resolution":{"observed_at":"2026-08-08T14:36:37.229574Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:36:36.513078Z","title":"Language models are unsupervised multitask learners","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.06733","last_updated":"2025-02-10T17:57:15Z","snapshot_observed_at":"2026-08-08T14:27:58.475022Z","submitted_at":"2025-02-10T17:57:15Z","title":"Dynamic Loss-Based Sample Reweighting for Improved Large Language Model Pretraining","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-08T14:36:36.513078Z"},"links":{"citing_paper":"/paper/2502.06733"},"observation_digest":"sha256:6ba0b6890c49450084300dcea7efc9cc0ede005ceaaa1d395a702a6255c15caa","observation_id":"c1fefab7-baa5-48d1-b45e-86375429c6e8","resolution":{"observed_at":"2026-08-08T14:36:36.513078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:36:36.517595Z","title":"Overparameterized neural networks implement associative memory","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.06733","last_updated":"2025-02-10T17:57:15Z","snapshot_observed_at":"2026-08-08T14:27:58.475022Z","submitted_at":"2025-02-10T17:57:15Z","title":"Dynamic Loss-Based Sample Reweighting for Improved Large Language Model Pretraining","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-08T14:36:36.517595Z"},"links":{"citing_paper":"/paper/2502.06733"},"observation_digest":"sha256:4d4a3ea8417d415011e32882641f1e1f1624980f4cdff38a68884722adc94b2c","observation_id":"65025dcb-73ea-4396-90f3-70901d96ec03","resolution":{"observed_at":"2026-08-08T14:36:36.517595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:36:36.521933Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.06733","last_updated":"2025-02-10T17:57:15Z","snapshot_observed_at":"2026-08-08T14:27:58.475022Z","submitted_at":"2025-02-10T17:57:15Z","title":"Dynamic Loss-Based Sample Reweighting for Improved Large Language Model Pretraining","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-08T14:36:36.521933Z"},"links":{"citing_paper":"/paper/2502.06733"},"observation_digest":"sha256:4381b080d4fe248219d409ec2d7e7b852cead0eab27879df6cdaabaf87774afe","observation_id":"d42889cc-31d8-4cbb-a88a-abef68ed65e8","resolution":{"observed_at":"2026-08-08T14:36:36.521933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:36:37.181835Z","title":"Learning to reweight examples for robust deep learning","venue":null,"work_id":"fb37fd51-0460-4aa4-ad53-78af1afaf64e","year":2018},"citing_paper":{"arxiv_id":"2502.06733","last_updated":"2025-02-10T17:57:15Z","snapshot_observed_at":"2026-08-08T14:27:58.475022Z","submitted_at":"2025-02-10T17:57:15Z","title":"Dynamic Loss-Based Sample Reweighting for Improved Large Language Model Pretraining","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-08T14:36:36.526334Z"},"links":{"citing_paper":"/paper/2502.06733"},"observation_digest":"sha256:d831bb3d127379b98ebe65d8678abad39a4de3a463134c78a63a6cae0daf7603","observation_id":"c5ae3537-a782-48c7-bfaf-3c5036a19fd4","resolution":{"observed_at":"2026-08-08T14:36:37.186740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:36:37.166473Z","title":"Almost sure convergence rates for stochastic gradient descent and stochastic heavy ball","venue":null,"work_id":"b711036d-cb8e-421e-ba03-438498ae7165","year":2021},"citing_paper":{"arxiv_id":"2502.06733","last_updated":"2025-02-10T17:57:15Z","snapshot_observed_at":"2026-08-08T14:27:58.475022Z","submitted_at":"2025-02-10T17:57:15Z","title":"Dynamic Loss-Based Sample Reweighting for Improved Large Language Model Pretraining","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-08T14:36:36.530538Z"},"links":{"citing_paper":"/paper/2502.06733"},"observation_digest":"sha256:0c9728180355b3682a7a67587b2c8032b5fd45e30fdc55099a932402b050f3a7","observation_id":"13e9e73f-5f13-4786-ad4c-071a30b06062","resolution":{"observed_at":"2026-08-08T14:36:37.171130Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:36:37.150471Z","title":"SlimPajama: A 627B token cleaned and deduplicated version of RedPajama","venue":null,"work_id":"0b0cb4e3-3664-41ba-8a25-2451b73976c1","year":2023},"citing_paper":{"arxiv_id":"2502.06733","last_updated":"2025-02-10T17:57:15Z","snapshot_observed_at":"2026-08-08T14:27:58.475022Z","submitted_at":"2025-02-10T17:57:15Z","title":"Dynamic Loss-Based Sample Reweighting for Improved Large Language Model Pretraining","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-08T14:36:36.535047Z"},"links":{"citing_paper":"/paper/2502.06733"},"observation_digest":"sha256:89341aba7e32420c51d2a8c1c129958b841eb62e0b50d3520419190634eb24d0","observation_id":"e0419639-5862-4bba-b4f4-6718335ada6e","resolution":{"observed_at":"2026-08-08T14:36:37.155346Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.00311","last_updated":"2023-08-01T06:16:18Z","snapshot_observed_at":"2026-07-06T16:01:07.532053Z","submitted_at":"2023-08-01T06:16:18Z","title":"Doubly Robust Instance-Reweighted Adversarial Training","version":1},"cited_work":{"arxiv_id":"2308.00311","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.00311","snapshot_observed_at":"2026-08-08T14:36:36.818059Z","title":"Doubly Robust Instance-Reweighted Adversarial Training","venue":"cs.LG","work_id":"1bd45073-55ff-4ee0-8f5d-7301c193977c","year":2023},"citing_paper":{"arxiv_id":"2502.06733","last_updated":"2025-02-10T17:57:15Z","snapshot_observed_at":"2026-08-08T14:27:58.475022Z","submitted_at":"2025-02-10T17:57:15Z","title":"Dynamic Loss-Based Sample Reweighting for Improved Large Language Model Pretraining","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-08T14:36:36.539574Z"},"links":{"cited_paper":"/paper/2308.00311","citing_paper":"/paper/2502.06733"},"observation_digest":"sha256:9562775ea2dcc9986023f7d5468388ca1a22fb613d04d73149600e81b6c0e8ad","observation_id":"1b499208-2bbf-46ad-92e4-da3ff31f1400","resolution":{"observed_at":"2026-08-08T14:36:36.823339Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.00913","last_updated":"2023-11-02T01:00:46Z","snapshot_observed_at":"2026-07-06T16:42:00.138744Z","submitted_at":"2023-11-02T01:00:46Z","title":"Self-Influence Guided Data Reweighting for Language Model Pre-training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.00913","snapshot_observed_at":"2026-08-08T14:36:36.544083Z","title":"Self-influence guided data reweighting for language model pre-training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06733","last_updated":"2025-02-10T17:57:15Z","snapshot_observed_at":"2026-08-08T14:27:58.475022Z","submitted_at":"2025-02-10T17:57:15Z","title":"Dynamic Loss-Based Sample Reweighting for Improved Large Language Model Pretraining","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-08T14:36:36.544083Z"},"links":{"cited_paper":"/paper/2311.00913","citing_paper":"/paper/2502.06733"},"observation_digest":"sha256:207331c7a6a42a6538a06d9026c3271d6ee1858c11f2c8451c68149ea800e24e","observation_id":"067775a3-e8a9-4d8c-97a7-8b0dc06906b9","resolution":{"observed_at":"2026-08-08T14:36:36.544083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-08T14:36:36.548756Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06733","last_updated":"2025-02-10T17:57:15Z","snapshot_observed_at":"2026-08-08T14:27:58.475022Z","submitted_at":"2025-02-10T17:57:15Z","title":"Dynamic Loss-Based Sample Reweighting for Improved Large Language Model Pretraining","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-08T14:36:36.548756Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2502.06733"},"observation_digest":"sha256:a6e73c9778be58cba15ec67893a69263d14a62406364928d9af80c979bc865fe","observation_id":"91fc5ff7-dcfe-4697-8dfd-916f31101db7","resolution":{"observed_at":"2026-08-08T14:36:36.548756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:36:36.553280Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.06733","last_updated":"2025-02-10T17:57:15Z","snapshot_observed_at":"2026-08-08T14:27:58.475022Z","submitted_at":"2025-02-10T17:57:15Z","title":"Dynamic Loss-Based Sample Reweighting for Improved Large Language Model Pretraining","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-08T14:36:36.553280Z"},"links":{"citing_paper":"/paper/2502.06733"},"observation_digest":"sha256:faf9cde42ad095784a01c30b4e87bd3d36fcd52ec6da5ffc9f55811ea20362a5","observation_id":"e40a2f10-2db2-4ca9-ae72-dd7e5256a23d","resolution":{"observed_at":"2026-08-08T14:36:36.553280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:36:37.125698Z","title":"Liu, and Matt Gardner","venue":null,"work_id":"0f50f533-d81b-4337-8f4f-cf73860de1db","year":2017},"citing_paper":{"arxiv_id":"2502.06733","last_updated":"2025-02-10T17:57:15Z","snapshot_observed_at":"2026-08-08T14:27:58.475022Z","submitted_at":"2025-02-10T17:57:15Z","title":"Dynamic Loss-Based Sample Reweighting for Improved Large Language Model Pretraining","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-08T14:36:36.557827Z"},"links":{"citing_paper":"/paper/2502.06733"},"observation_digest":"sha256:2631803bd2c880bd1c78227e57195c2a087876e0f1bc05da93fbf0837f3f864c","observation_id":"14980b0b-66f3-4c25-b84e-ab3672c9b73e","resolution":{"observed_at":"2026-08-08T14:36:37.130683Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:36:37.110335Z","title":"Q u R ating: Selecting high-quality data for training language models","venue":null,"work_id":"61dff57b-5e50-406a-b1ef-d480b35f98d3","year":2024},"citing_paper":{"arxiv_id":"2502.06733","last_updated":"2025-02-10T17:57:15Z","snapshot_observed_at":"2026-08-08T14:27:58.475022Z","submitted_at":"2025-02-10T17:57:15Z","title":"Dynamic Loss-Based Sample Reweighting for Improved Large Language Model Pretraining","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-08T14:36:36.562124Z"},"links":{"citing_paper":"/paper/2502.06733"},"observation_digest":"sha256:0f0ddd0ab9af0fbdf7ef57c0ffcb82779d39a1131a148396aa949ba94eeee19b","observation_id":"6e524103-9ed9-4afc-8b46-379e36ffe1f5","resolution":{"observed_at":"2026-08-08T14:36:37.115261Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10429","last_updated":"2023-11-21T02:01:53Z","snapshot_observed_at":"2026-07-06T15:28:49.253125Z","submitted_at":"2023-05-17T17:58:13Z","title":"DoReMi: Optimizing Data Mixtures Speeds Up Language Model Pretraining","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10429","snapshot_observed_at":"2026-08-08T14:36:36.566504Z","title":"Doremi: Optimizing data mixtures speeds up language model pretraining","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06733","last_updated":"2025-02-10T17:57:15Z","snapshot_observed_at":"2026-08-08T14:27:58.475022Z","submitted_at":"2025-02-10T17:57:15Z","title":"Dynamic Loss-Based Sample Reweighting for Improved Large Language Model Pretraining","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-08T14:36:36.566504Z"},"links":{"cited_paper":"/paper/2305.10429","citing_paper":"/paper/2502.06733"},"observation_digest":"sha256:9c4ab1ce7d06fab5fae89d06568e3ca20de7f732160e2dd7a36a46efce8b7c6b","observation_id":"f0addaf2-1bbc-44bb-a1ac-08568136d1bd","resolution":{"observed_at":"2026-08-08T14:36:36.566504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.08933","last_updated":"2021-03-16T09:31:04Z","snapshot_observed_at":"2026-07-06T10:50:21.341854Z","submitted_at":"2021-03-16T09:31:04Z","title":"Reweighting Augmented Samples by Minimizing the Maximal Expected Loss","version":1},"cited_work":{"arxiv_id":"2103.08933","doi":null,"metadata_source":"pith","pith_arxiv_id":"2103.08933","snapshot_observed_at":"2026-08-08T14:36:36.748642Z","title":"Reweighting Augmented Samples by Minimizing the Maximal Expected Loss","venue":"cs.LG","work_id":"5d6db84d-462a-4d67-906d-bbe4b96e4351","year":2021},"citing_paper":{"arxiv_id":"2502.06733","last_updated":"2025-02-10T17:57:15Z","snapshot_observed_at":"2026-08-08T14:27:58.475022Z","submitted_at":"2025-02-10T17:57:15Z","title":"Dynamic Loss-Based Sample Reweighting for Improved Large Language Model Pretraining","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-08T14:36:36.571036Z"},"links":{"cited_paper":"/paper/2103.08933","citing_paper":"/paper/2502.06733"},"observation_digest":"sha256:cfc50af4e9bb5ec7d1401dbf92c0cbdc0002fc6b6a50838bd898214c5c1dbe60","observation_id":"292adc5b-079c-420b-9b21-1ad503d3cbc8","resolution":{"observed_at":"2026-08-08T14:36:36.755381Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:36:37.094750Z","title":"Are adversarial examples created equal? a learnable weighted minimax risk for robustness under non-uniform attacks","venue":null,"work_id":"99b5a324-09df-463d-8b18-45ebc11f8221","year":2021},"citing_paper":{"arxiv_id":"2502.06733","last_updated":"2025-02-10T17:57:15Z","snapshot_observed_at":"2026-08-08T14:27:58.475022Z","submitted_at":"2025-02-10T17:57:15Z","title":"Dynamic Loss-Based Sample Reweighting for Improved Large Language Model Pretraining","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-08T14:36:36.576280Z"},"links":{"citing_paper":"/paper/2502.06733"},"observation_digest":"sha256:8f2adc5a65fe3ec8067dcca2ff83906b728fea13da99f3af2cfbcb86067331db","observation_id":"0d86ab4b-182f-4ed0-b62d-bbcbe860286c","resolution":{"observed_at":"2026-08-08T14:36:37.100186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.01736","last_updated":"2021-05-31T02:49:55Z","snapshot_observed_at":"2026-07-06T10:01:23.472948Z","submitted_at":"2020-10-05T01:33:11Z","title":"Geometry-aware Instance-reweighted Adversarial Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.01736","snapshot_observed_at":"2026-08-08T14:36:36.580744Z","title":"Geometry-aware instance-reweighted adversarial training","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2502.06733","last_updated":"2025-02-10T17:57:15Z","snapshot_observed_at":"2026-08-08T14:27:58.475022Z","submitted_at":"2025-02-10T17:57:15Z","title":"Dynamic Loss-Based Sample Reweighting for Improved Large Language Model Pretraining","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-08T14:36:36.580744Z"},"links":{"cited_paper":"/paper/2010.01736","citing_paper":"/paper/2502.06733"},"observation_digest":"sha256:71d2ce795e3aa252f75edb52a9098e55fcab01163433fa24b4d5f08609a62416","observation_id":"a5493920-4563-4eb5-95f9-ec3f4c696e37","resolution":{"observed_at":"2026-08-08T14:36:36.580744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:36:36.585174Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06733","last_updated":"2025-02-10T17:57:15Z","snapshot_observed_at":"2026-08-08T14:27:58.475022Z","submitted_at":"2025-02-10T17:57:15Z","title":"Dynamic Loss-Based Sample Reweighting for Improved Large Language Model Pretraining","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-08T14:36:36.585174Z"},"links":{"citing_paper":"/paper/2502.06733"},"observation_digest":"sha256:a424ec0a56590211fe79d49f33868ce915dc5f2b33a050d6fde92a039180e2f4","observation_id":"2b7bc779-e2e8-42af-8d5c-9d3a65f6e1c7","resolution":{"observed_at":"2026-08-08T14:36:36.585174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:36:36.590108Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06733","last_updated":"2025-02-10T17:57:15Z","snapshot_observed_at":"2026-08-08T14:27:58.475022Z","submitted_at":"2025-02-10T17:57:15Z","title":"Dynamic Loss-Based Sample Reweighting for Improved Large Language Model Pretraining","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-08T14:36:36.590108Z"},"links":{"citing_paper":"/paper/2502.06733"},"observation_digest":"sha256:6aefbd8f053125202de28a02e52412d845c5f91b35bc951998ad75998891e3a7","observation_id":"0b37c6c4-73d3-4613-b482-42a83b623b7c","resolution":{"observed_at":"2026-08-08T14:36:36.590108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:36:36.594376Z","title":"誁ڞYBq0 w @ \\˂bF 3`^) f ` WޏTb]tQ Z Ы;]2Zj8ݐlW c kX֏'y S! QfĊ GYs) W 4 P0,Or (W ; )C NƢ). ; W `m GN 徐ݏիhF ސWW xu3ur]!54#VO=? ±* ^p rx ]K f hFIf QY b g+ <mcOt3Gܘ tX","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2502.06733","last_updated":"2025-02-10T17:57:15Z","snapshot_observed_at":"2026-08-08T14:27:58.475022Z","submitted_at":"2025-02-10T17:57:15Z","title":"Dynamic Loss-Based Sample Reweighting for Improved Large Language Model Pretraining","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-08T14:36:36.594376Z"},"links":{"citing_paper":"/paper/2502.06733"},"observation_digest":"sha256:8d066175869dbc4db2288f47b9fce273eba200c852d6479cfdab5cc2f5600ea4","observation_id":"fecb48e0-38df-4660-bc77-e3154feb128c","resolution":{"observed_at":"2026-08-08T14:36:36.594376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.06733","last_updated":"2025-02-10T17:57:15Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-08T14:27:58.475022Z","submitted_at":"2025-02-10T17:57:15Z","title":"Dynamic Loss-Based Sample Reweighting for Improved Large Language Model Pretraining"},"reference_resolution":{"displayed":48,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":31,"verified_exact":4,"verified_fuzzy":13},"total_outbound_references":48},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 48 of 48 outbound references and 1 inbound Pith citation observation for arXiv:2502.06733."}