{"as_of":"2026-08-20T02:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b2b51571c57471df8ae6c59a448212100819738c2533756a17a7d7f4b113491b","coverage":[{"denominator":54,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":54,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-23T02:47:37.492619Z","state":"measured"},{"denominator":61,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":61,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":7,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T04:32:12.517211Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.12120","last_updated":"2026-05-20T13:58:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-17T18:45:25Z","title":"LLMs on the Line: Data Determines Loss-to-Loss Scaling Laws","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12120","snapshot_observed_at":"2026-08-08T17:01:36.154116Z","title":"Llms on the line: Data determines loss-to-loss scaling laws","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.06042","last_updated":"2025-05-26T18:48:37Z","snapshot_observed_at":"2026-08-18T01:19:54.045887Z","submitted_at":"2025-02-09T21:44:27Z","title":"Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-08T17:01:36.154116Z"},"links":{"cited_paper":"/paper/2502.12120","citing_paper":"/paper/2502.06042"},"observation_digest":"sha256:ba555c0e30f029d70beac1c106b39896181cbf1527dc3f4205da29ef416837c9","observation_id":"89f4ec0a-15e4-410c-9400-07e39d7e2ef8","resolution":{"observed_at":"2026-08-08T17:01:36.154116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12120","last_updated":"2026-05-20T13:58:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-17T18:45:25Z","title":"LLMs on the Line: Data Determines Loss-to-Loss Scaling Laws","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12120","snapshot_observed_at":"2026-08-07T14:09:48.398461Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-16T14:41:19.873688Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:48.398461Z"},"links":{"cited_paper":"/paper/2502.12120","citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:d53ec9233b61660769ccdd6da72290b0495f2dee25e7f1cd1a4d5e139fe72809","observation_id":"7fcf85e1-298e-4c01-8cb1-422e54e41ba0","resolution":{"observed_at":"2026-08-07T14:09:48.398461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12120","last_updated":"2026-05-20T13:58:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-17T18:45:25Z","title":"LLMs on the Line: Data Determines Loss-to-Loss Scaling Laws","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12120","snapshot_observed_at":"2026-08-06T16:53:11.706808Z","title":"Llms on the line: Data determines loss-to-loss scaling laws","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.12466","last_updated":"2025-07-16T17:59:45Z","snapshot_observed_at":"2026-08-19T19:30:29.233194Z","submitted_at":"2025-07-16T17:59:45Z","title":"Language Models Improve When Pretraining Data Matches Target Tasks","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-06T16:53:11.706808Z"},"links":{"cited_paper":"/paper/2502.12120","citing_paper":"/paper/2507.12466"},"observation_digest":"sha256:b5d5189eb630b69280a29718479110bc5070b1019d352f08d825e064b039e79f","observation_id":"1846d484-bc65-4f03-a5e3-cebc18861ac0","resolution":{"observed_at":"2026-08-06T16:53:11.706808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12120","last_updated":"2026-05-20T13:58:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-17T18:45:25Z","title":"LLMs on the Line: Data Determines Loss-to-Loss Scaling Laws","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12120","snapshot_observed_at":"2026-08-03T05:23:34.355258Z","title":"Llms on the line: Data de- termines loss-to-loss scaling laws.arXiv preprint arXiv:2502.12120, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.02465","last_updated":"2026-06-10T12:52:04Z","snapshot_observed_at":"2026-08-08T05:57:49.430723Z","submitted_at":"2026-02-02T18:49:06Z","title":"MentisOculi: Revealing the Limits of Reasoning with Mental Imagery","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T05:23:34.355258Z"},"links":{"cited_paper":"/paper/2502.12120","citing_paper":"/paper/2602.02465"},"observation_digest":"sha256:43c15a579fae15e5c31485008677334aa69a2980ae10654fd49c8b1bf7fdcf9f","observation_id":"3c516a2c-cfca-4dda-b51e-369d1236d499","resolution":{"observed_at":"2026-08-03T05:23:34.355258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12120","last_updated":"2026-05-20T13:58:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-17T18:45:25Z","title":"LLMs on the Line: Data Determines Loss-to-Loss Scaling Laws","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12120","snapshot_observed_at":"2026-08-01T17:31:48.273075Z","title":"Llms on the line: Data determines loss-to-loss scaling laws.arXiv:2502.12120,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17624","last_updated":"2026-07-20T07:26:17Z","snapshot_observed_at":"2026-08-18T06:31:54.070932Z","submitted_at":"2026-07-20T07:26:17Z","title":"Can Transformers Really Do It All? On the Compatibility of Inductive Biases Across Tasks","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T17:31:48.273075Z"},"links":{"cited_paper":"/paper/2502.12120","citing_paper":"/paper/2607.17624"},"observation_digest":"sha256:89fd671d9ddb73b72a4269aaeff2aa330ed99ef2852c9582713e09a3b0636c4e","observation_id":"9833058b-abf7-4bad-b952-1a77eea611cc","resolution":{"observed_at":"2026-08-01T17:31:48.273075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12120","last_updated":"2026-05-20T13:58:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-17T18:45:25Z","title":"LLMs on the Line: Data Determines Loss-to-Loss Scaling Laws","version":3},"cited_work":{"arxiv_id":"2502.12120","doi":"10.48550/arxiv.2502.12120","metadata_source":"pith","pith_arxiv_id":"2502.12120","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"LLMs on the Line: Data Determines Loss-to-Loss Scaling Laws","venue":"cs.LG","work_id":"cd1795b0-2ca2-497a-859a-a80aa92975ae","year":2025},"citing_paper":{"arxiv_id":"2607.25271","last_updated":"2026-07-28T04:18:49Z","snapshot_observed_at":"2026-08-13T02:12:02.677620Z","submitted_at":"2026-07-28T04:18:49Z","title":"Bridging Compute- and Data-Optimal Pretraining","version":1},"reference_index":103,"source":"arxiv_source","source_observed_at":"2026-08-01T03:02:07.540907Z"},"links":{"cited_paper":"/paper/2502.12120","citing_paper":"/paper/2607.25271"},"observation_digest":"sha256:eb8c10084a4c3fdff4fc1031b23aff020b0ba9b64565a4eaa1fdc74eebe93da8","observation_id":"e59d2c6f-c038-46e0-af4a-c47f3d7bce59","resolution":{"observed_at":"2026-08-01T03:08:35.287832Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12120","last_updated":"2026-05-20T13:58:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-17T18:45:25Z","title":"LLMs on the Line: Data Determines Loss-to-Loss Scaling Laws","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12120","snapshot_observed_at":"2026-08-14T04:32:12.517211Z","title":"LLMs on the line: Data determines loss-to-loss scaling laws, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.13545","last_updated":"2026-08-13T17:56:12Z","snapshot_observed_at":"2026-08-17T23:53:20.073266Z","submitted_at":"2026-08-13T17:56:12Z","title":"LittleLearner: Language Models Under Pedagogically Controlled Knowledge Exposure","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:12.517211Z"},"links":{"cited_paper":"/paper/2502.12120","citing_paper":"/paper/2608.13545"},"observation_digest":"sha256:633bde19c7590b9fde7a8ea4a29914eea7252d6935255f31b236693db7dfa2eb","observation_id":"b4333c37-c8e1-46c5-88ff-8055cf3b5f51","resolution":{"observed_at":"2026-08-14T04:32:12.517211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2502.12120/citation-record","integrity":"/paper/2502.12120/integrity","json":"/paper/2502.12120/citation-record.json","paper":"/paper/2502.12120"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2210.12517","last_updated":"2022-10-22T18:17:31Z","snapshot_observed_at":"2026-08-16T16:21:58.631343Z","submitted_at":"2022-10-22T18:17:31Z","title":"Exploring The Landscape of Distributional Robustness for Question Answering Models","version":1},"cited_work":{"arxiv_id":"2210.12517","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2210.12517","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Exploring the landscape of distributional robustness for question answering models","venue":null,"work_id":"b5acf429-d562-44df-b2b3-1f1c1c445654","year":2022},"citing_paper":{"arxiv_id":"2502.12120","last_updated":"2026-05-20T13:58:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-17T18:45:25Z","title":"LLMs on the Line: Data Determines Loss-to-Loss Scaling Laws","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-05-23T02:47:37.492619Z"},"links":{"cited_paper":"/paper/2210.12517","citing_paper":"/paper/2502.12120"},"observation_digest":"sha256:7003dd6c858667c73396bceb72bcead17f8d8d558864a04d557e81cfe4302476","observation_id":"e36ddbe5-0711-4b57-bb6e-f18d93399fa1","resolution":{"observed_at":"2026-05-23T02:52:27.150102Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.01373","last_updated":"2023-05-31T17:54:07Z","snapshot_observed_at":"2026-08-14T19:44:03.879127Z","submitted_at":"2023-04-03T20:58:15Z","title":"Pythia: A Suite for Analyzing Large Language Models Across Training and Scaling","version":2},"cited_work":{"arxiv_id":"2304.01373","doi":"10.48550/arxiv.2304.01373","metadata_source":"pith","pith_arxiv_id":"2304.01373","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pythia: A Suite for Analyzing Large Language Models Across Training and Scaling","venue":"cs.CL","work_id":"745b4799-6ac4-4abe-924f-78bf0a08ffa1","year":2023},"citing_paper":{"arxiv_id":"2502.12120","last_updated":"2026-05-20T13:58:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-17T18:45:25Z","title":"LLMs on the Line: Data Determines Loss-to-Loss Scaling Laws","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-05-23T02:47:37.492619Z"},"links":{"cited_paper":"/paper/2304.01373","citing_paper":"/paper/2502.12120"},"observation_digest":"sha256:8c8f83c63be5772fad2778270c8704293663f54eee6a4fcbabb311cb778ff564","observation_id":"c7cea62b-03fc-4c28-b0ed-fea36cc1fd3b","resolution":{"observed_at":"2026-05-23T02:52:27.153689Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-14T20:38:11.240501+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-14T20:38:11.240501+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11641","last_updated":"2019-11-26T15:31:46Z","snapshot_observed_at":"2026-08-08T00:48:01.603669Z","submitted_at":"2019-11-26T15:31:46Z","title":"PIQA: Reasoning about Physical Commonsense in Natural Language","version":1},"cited_work":{"arxiv_id":"1911.11641","doi":"10.48550/arxiv.1911.11641","metadata_source":"pith","pith_arxiv_id":"1911.11641","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"PIQA: Reasoning about Physical Commonsense in Natural Language","venue":"cs.CL","work_id":"0d865a62-6376-4606-8d3a-eeb3b6e9ba6d","year":2019},"citing_paper":{"arxiv_id":"2502.12120","last_updated":"2026-05-20T13:58:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-17T18:45:25Z","title":"LLMs on the Line: Data Determines Loss-to-Loss Scaling Laws","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-05-23T02:47:37.492619Z"},"links":{"cited_paper":"/paper/1911.11641","citing_paper":"/paper/2502.12120"},"observation_digest":"sha256:ec07ce140779c5475011cc65c5de0dbf09ffc38dc071ffda1fdbb1685fc6b6e5","observation_id":"d06baeb1-d551-4cc1-b11b-31006ccf408e","resolution":{"observed_at":"2026-05-23T02:52:27.142978Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gpt-neo: Large scale autoregressive language modeling with mesh-tensorflow","venue":null,"work_id":"4599a1e1-5616-4500-9f2c-bc2853068d5b","year":2021},"citing_paper":{"arxiv_id":"2502.12120","last_updated":"2026-05-20T13:58:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-17T18:45:25Z","title":"LLMs on the Line: Data Determines Loss-to-Loss Scaling Laws","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-05-23T02:47:37.492619Z"},"links":{"citing_paper":"/paper/2502.12120"},"observation_digest":"sha256:9f1392a0358eacca0c9563468294cbba3b265715aaa12b97bb085806fb8c8a01","observation_id":"6aace21d-bf84-4ef1-8893-bdbb6402fbe7","resolution":{"observed_at":"2026-05-23T06:27:39.098836Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06745","last_updated":"2022-04-14T04:00:27Z","snapshot_observed_at":"2026-08-13T14:54:27.001192Z","submitted_at":"2022-04-14T04:00:27Z","title":"GPT-NeoX-20B: An Open-Source Autoregressive Language Model","version":1},"cited_work":{"arxiv_id":"2204.06745","doi":"10.48550/arxiv.2204.06745","metadata_source":"pith","pith_arxiv_id":"2204.06745","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-NeoX-20B: An Open-Source Autoregressive Language Model","venue":"cs.CL","work_id":"168a55d5-675d-49cf-be47-a17ee8cd742e","year":2022},"citing_paper":{"arxiv_id":"2502.12120","last_updated":"2026-05-20T13:58:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-17T18:45:25Z","title":"LLMs on the Line: Data Determines Loss-to-Loss Scaling Laws","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-05-23T02:47:37.492619Z"},"links":{"cited_paper":"/paper/2204.06745","citing_paper":"/paper/2502.12120"},"observation_digest":"sha256:6f6a6414d209c84258c9a2fa3b1fae00256a234d0326726a2ee171d60c5b64c3","observation_id":"e2ddf806-0f71-4c3b-aaff-ea600b6737c1","resolution":{"observed_at":"2026-05-23T02:52:27.125494Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.12925","last_updated":"2024-11-19T23:23:16Z","snapshot_observed_at":"2026-08-15T20:28:04.642002Z","submitted_at":"2024-11-19T23:23:16Z","title":"Loss-to-Loss Prediction: Scaling Laws for All Datasets","version":1},"cited_work":{"arxiv_id":"2411.12925","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.12925","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Loss-to-loss prediction: Scaling laws for all datasets","venue":null,"work_id":"ca1ab8d9-f186-477b-ac4f-29f15f191fed","year":2024},"citing_paper":{"arxiv_id":"2502.12120","last_updated":"2026-05-20T13:58:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-17T18:45:25Z","title":"LLMs on the Line: Data Determines Loss-to-Loss Scaling Laws","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-05-23T02:47:37.492619Z"},"links":{"cited_paper":"/paper/2411.12925","citing_paper":"/paper/2502.12120"},"observation_digest":"sha256:9326817c9be2282c8edbf4bd1f7c9d9dd6c939e556518e774159a34898699580","observation_id":"301b63cf-4ca6-43db-9fd3-45446de0fef7","resolution":{"observed_at":"2026-05-23T02:52:27.118254Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-08-14T19:36:07.505691Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":"1803.05457","doi":"10.1162/tacl_a_00448.https://aclanthology.org/2022.tacl-1.5","metadata_source":"pith","pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","venue":"cs.AI","work_id":"28ea1282-d657-4c61-a83c-f1249be6d6b1","year":2018},"citing_paper":{"arxiv_id":"2502.12120","last_updated":"2026-05-20T13:58:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-17T18:45:25Z","title":"LLMs on the Line: Data Determines Loss-to-Loss Scaling Laws","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-05-23T02:47:37.492619Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2502.12120"},"observation_digest":"sha256:79351f9b7f0c4a442c1ef5d3eb0524c2eb2e968cd5478eac6257942cbb95f930","observation_id":"fbdb04fe-61c0-4e19-8fdf-1792bcc767d6","resolution":{"observed_at":"2026-05-23T02:52:27.121737Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21060","last_updated":"2024-05-31T17:50:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:50:01Z","title":"Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality","version":1},"cited_work":{"arxiv_id":"2405.21060","doi":"10.48550/arxiv.2405.21060","metadata_source":"pith","pith_arxiv_id":"2405.21060","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality","venue":"cs.LG","work_id":"d8eba076-0449-4f6a-aae1-5a7260677f0f","year":2024},"citing_paper":{"arxiv_id":"2502.12120","last_updated":"2026-05-20T13:58:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-17T18:45:25Z","title":"LLMs on the Line: Data Determines Loss-to-Loss Scaling Laws","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-05-23T02:47:37.492619Z"},"links":{"cited_paper":"/paper/2405.21060","citing_paper":"/paper/2502.12120"},"observation_digest":"sha256:235f677c80ee86f6990f49003abb396656c3d1049049e01d09f389f249860977","observation_id":"363b004a-1ffb-4daf-bc06-6e9c0cfe343d","resolution":{"observed_at":"2026-05-23T02:52:27.128976Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08758","last_updated":"2021-09-30T17:20:01Z","snapshot_observed_at":"2026-08-19T02:21:00.581684Z","submitted_at":"2021-04-18T07:42:52Z","title":"Documenting Large Webtext Corpora: A Case Study on the Colossal Clean Crawled Corpus","version":2},"cited_work":{"arxiv_id":"2104.08758","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2104.08758","snapshot_observed_at":"2026-07-03T07:17:43.977703Z","title":"Documenting large webtext corpora: A case study on the colossal clean crawled corpus","venue":null,"work_id":"59523556-6a22-43cd-8d60-0063c81c6638","year":2021},"citing_paper":{"arxiv_id":"2502.12120","last_updated":"2026-05-20T13:58:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-17T18:45:25Z","title":"LLMs on the Line: Data Determines Loss-to-Loss Scaling Laws","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-23T02:47:37.492619Z"},"links":{"cited_paper":"/paper/2104.08758","citing_paper":"/paper/2502.12120"},"observation_digest":"sha256:0a6d3e04c9a62be232245c10746c767b144a81972a6b5ad31508735a772f8e31","observation_id":"084b1a00-7f2d-49f3-b08d-4b2d743be9d5","resolution":{"observed_at":"2026-05-23T02:52:27.135687Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.15796","last_updated":"2025-01-15T02:48:59Z","snapshot_observed_at":"2026-08-16T14:07:07.590212Z","submitted_at":"2024-03-23T11:03:31Z","title":"Understanding Emergent Abilities of Language Models from the Loss Perspective","version":3},"cited_work":{"arxiv_id":"2403.15796","doi":"10.48550/arxiv.2403.15796","metadata_source":"arxiv_reference","pith_arxiv_id":"2403.15796","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2403.15796 , year=","venue":"arXiv (Cornell University)","work_id":"871bc70b-ac57-442c-892b-f8d06c9abab2","year":2025},"citing_paper":{"arxiv_id":"2502.12120","last_updated":"2026-05-20T13:58:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-17T18:45:25Z","title":"LLMs on the Line: Data Determines Loss-to-Loss Scaling Laws","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-05-23T02:47:37.492619Z"},"links":{"cited_paper":"/paper/2403.15796","citing_paper":"/paper/2502.12120"},"observation_digest":"sha256:775e6d6fddddc1e71d344d598038b6c56cf92faf32d597b2911b98756eeebce4","observation_id":"1b5153ba-a9e3-4f99-8924-8726896eb432","resolution":{"observed_at":"2026-05-23T02:52:27.109203Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01397","last_updated":"2022-08-22T23:59:30Z","snapshot_observed_at":"2026-08-16T17:02:58.194662Z","submitted_at":"2022-05-03T10:06:51Z","title":"Data Determines Distributional Robustness in Contrastive Language Image Pre-training (CLIP)","version":2},"cited_work":{"arxiv_id":"2205.01397","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2205.01397","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Data determines distributional robustness in contrastive language image pre-training (clip)","venue":null,"work_id":"6b31772e-55ea-4893-975f-2b41fcb141af","year":2022},"citing_paper":{"arxiv_id":"2502.12120","last_updated":"2026-05-20T13:58:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-17T18:45:25Z","title":"LLMs on the Line: Data Determines Loss-to-Loss Scaling Laws","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-05-23T02:47:37.492619Z"},"links":{"cited_paper":"/paper/2205.01397","citing_paper":"/paper/2502.12120"},"observation_digest":"sha256:472a30b6131b29d1e9cb5f2d30c0938d9e260c89dc40afb26b3d803ebcaff316","observation_id":"364ec55a-d6e0-462f-9dfc-01d21d19c0c5","resolution":{"observed_at":"2026-05-23T02:52:27.114874Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08540","last_updated":"2024-06-14T20:21:05Z","snapshot_observed_at":"2026-08-16T14:10:11.362149Z","submitted_at":"2024-03-13T13:54:00Z","title":"Language models scale reliably with over-training and on downstream tasks","version":2},"cited_work":{"arxiv_id":"2403.08540","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.08540","snapshot_observed_at":"2026-07-04T20:30:07.554623Z","title":"Kanishk Gandhi, Denise Lee, Gabriel Grand, Muxin Liu, Winson Cheng, Archit Sharma, and Noah D Goodman","venue":null,"work_id":"b3ccca34-2e12-48b4-ad09-521ec9797b0c","year":2024},"citing_paper":{"arxiv_id":"2502.12120","last_updated":"2026-05-20T13:58:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-17T18:45:25Z","title":"LLMs on the Line: Data Determines Loss-to-Loss Scaling Laws","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-05-23T02:47:37.492619Z"},"links":{"cited_paper":"/paper/2403.08540","citing_paper":"/paper/2502.12120"},"observation_digest":"sha256:ef733fc053aa82d3f2723065a1167dc42d19277dace10d9d01cba43ac1b9b5e2","observation_id":"a75009f9-5d6a-4cf2-b1ff-5b5c1803bba2","resolution":{"observed_at":"2026-05-23T02:52:27.106052Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00027","last_updated":"2020-12-31T19:00:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-12-31T19:00:10Z","title":"The Pile: An 800GB Dataset of Diverse Text for Language Modeling","version":1},"cited_work":{"arxiv_id":"2101.00027","doi":"10.1117/1.jmi.10.6.061104","metadata_source":"pith","pith_arxiv_id":"2101.00027","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The Pile: An 800GB Dataset of Diverse Text for Language Modeling","venue":"cs.CL","work_id":"9b10667a-da61-4358-aceb-10578234d45d","year":2020},"citing_paper":{"arxiv_id":"2502.12120","last_updated":"2026-05-20T13:58:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-17T18:45:25Z","title":"LLMs on the Line: Data Determines Loss-to-Loss Scaling Laws","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-23T02:47:37.492619Z"},"links":{"cited_paper":"/paper/2101.00027","citing_paper":"/paper/2502.12120"},"observation_digest":"sha256:a622f42f35c295e78057294b77dff090356d8a53016ba1a38d9f0b34222ed9e1","observation_id":"4cf67fdd-c60e-4d83-a24f-b30aa6f3fc25","resolution":{"observed_at":"2026-05-23T02:52:27.098574Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"records/1260860","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T14:47:14.558044Z","title":"He, B., Yin, L., Zhen, H.-L., Liu, S., Wu, H., Zhang, X., Yuan, M., and Ma, C","venue":null,"work_id":"e7e9d443-273d-4722-8ec7-59adb893de0e","year":2024},"citing_paper":{"arxiv_id":"2502.12120","last_updated":"2026-05-20T13:58:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-17T18:45:25Z","title":"LLMs on the Line: Data Determines Loss-to-Loss Scaling Laws","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-23T02:47:37.492619Z"},"links":{"citing_paper":"/paper/2502.12120"},"observation_digest":"sha256:e8830feb0ef6d7a8e80b4215eb4e0d6158282c03f9e23483142ca1af85e34ca3","observation_id":"cda4c4ca-532c-4873-b0c1-0a612c7ca51d","resolution":{"observed_at":"2026-05-23T02:52:27.102560Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"S., Kozareva, Z., and Roemmele, M","venue":null,"work_id":"59cac3f8-9e6c-4698-93c8-ab174271422a","year":2011},"citing_paper":{"arxiv_id":"2502.12120","last_updated":"2026-05-20T13:58:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-17T18:45:25Z","title":"LLMs on the Line: Data Determines Loss-to-Loss Scaling Laws","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-05-23T02:47:37.492619Z"},"links":{"citing_paper":"/paper/2502.12120"},"observation_digest":"sha256:33dccc2cc5eac7a88dcf839c248958b01accac057b17eaa6d2894b7cf3d17812","observation_id":"81d5c581-4990-43f7-abd9-756b2bcf6f4f","resolution":{"observed_at":"2026-05-23T06:27:39.108621Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":"2407.21783","doi":"10.1016/s0749-0720(15","metadata_source":"pith","pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"The Llama 3 Herd of Models","venue":"cs.AI","work_id":"1549a635-88af-4ac1-acfe-51ae7bb53345","year":2024},"citing_paper":{"arxiv_id":"2502.12120","last_updated":"2026-05-20T13:58:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-17T18:45:25Z","title":"LLMs on the Line: Data Determines Loss-to-Loss Scaling Laws","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-23T02:47:37.492619Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2502.12120"},"observation_digest":"sha256:0143ab698a5a8a0d726303c3bb6317d9bd1e189b4d5fd6c86e2b6b8ed237c096","observation_id":"d1538cda-641c-40ad-a48e-900c7d8de0d8","resolution":{"observed_at":"2026-05-23T02:52:27.111926Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.acl-long.841","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T04:43:07.039288Z","title":"OLM o: Accelerating the science of language models","venue":"Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers)","work_id":"2810cf0f-92b2-4eac-bf27-0fd54d24f591","year":2024},"citing_paper":{"arxiv_id":"2502.12120","last_updated":"2026-05-20T13:58:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-17T18:45:25Z","title":"LLMs on the Line: Data Determines Loss-to-Loss Scaling Laws","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-05-23T02:47:37.492619Z"},"links":{"citing_paper":"/paper/2502.12120"},"observation_digest":"sha256:ac4fd60b87eec3dc443eb3e5634c4fff62568747ec768b0e514e084d1f1fcf30","observation_id":"25ad0d65-43b7-4e46-b480-ad677be85622","resolution":{"observed_at":"2026-05-23T02:52:26.337254Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00752","last_updated":"2024-05-31T17:55:27Z","snapshot_observed_at":"2026-08-17T20:47:46.242385Z","submitted_at":"2023-12-01T18:01:34Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","version":2},"cited_work":{"arxiv_id":"2312.00752","doi":"10.48550/arxiv.2312.00752","metadata_source":"pith","pith_arxiv_id":"2312.00752","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","venue":"cs.LG","work_id":"4ee75248-1199-492c-a52f-6661e0f4adff","year":2023},"citing_paper":{"arxiv_id":"2502.12120","last_updated":"2026-05-20T13:58:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-17T18:45:25Z","title":"LLMs on the Line: Data Determines Loss-to-Loss Scaling Laws","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-05-23T02:47:37.492619Z"},"links":{"cited_paper":"/paper/2312.00752","citing_paper":"/paper/2502.12120"},"observation_digest":"sha256:91f9a93784c52a92a156c9b703d8374c666c3020f062309e786c7129d6429b78","observation_id":"fcc93f31-4bbd-486f-bd71-73b88014a7ff","resolution":{"observed_at":"2026-05-23T02:52:27.139211Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-13T20:38:14.544227+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-13T20:38:14.544227+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-13T20:44:28.824685Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":"2009.03300","doi":"10.48550/arxiv.2009.03300","metadata_source":"pith","pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measuring Massive Multitask Language Understanding","venue":"cs.CY","work_id":"e87ec49a-544b-4ec8-8991-75298c64ff5e","year":2020},"citing_paper":{"arxiv_id":"2502.12120","last_updated":"2026-05-20T13:58:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-17T18:45:25Z","title":"LLMs on the Line: Data Determines Loss-to-Loss Scaling Laws","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-23T02:47:37.492619Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2502.12120"},"observation_digest":"sha256:57adc9e4781799d46abdd48582d6d9f5ed7e84f4d612358f911120af8a2e823e","observation_id":"c8dc67b7-acfa-4e7b-ac8c-aae2bacf76c8","resolution":{"observed_at":"2026-05-23T02:52:27.084002Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-04T01:08:06.256034+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-04T01:08:06.256034+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-08-14T02:46:56.838057Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":"1712.00409","doi":null,"metadata_source":"pith","pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-07-04T18:40:03.351817Z","title":"Deep Learning Scaling is Predictable, Empirically","venue":"cs.LG","work_id":"3638ccb4-3a4f-460e-8b6f-867a65922801","year":2017},"citing_paper":{"arxiv_id":"2502.12120","last_updated":"2026-05-20T13:58:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-17T18:45:25Z","title":"LLMs on the Line: Data Determines Loss-to-Loss Scaling Laws","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-05-23T02:47:37.492619Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2502.12120"},"observation_digest":"sha256:684ea82de37c99d065aa98e02f5d0efcb0fc25cf5747a9812e406715d69b7821","observation_id":"58e3fb3e-fadf-4442-90c2-2ea0e79218b3","resolution":{"observed_at":"2026-05-23T02:52:27.146660Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-08-09T19:52:33.533277Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":"2203.15556","doi":"10.1098/rsta.2024.0522","metadata_source":"pith","pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Training Compute-Optimal Large Language Models","venue":"cs.CL","work_id":"b2faf28d-86b7-429c-bc42-469458efc246","year":2022},"citing_paper":{"arxiv_id":"2502.12120","last_updated":"2026-05-20T13:58:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-17T18:45:25Z","title":"LLMs on the Line: Data Determines Loss-to-Loss Scaling Laws","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-05-23T02:47:37.492619Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2502.12120"},"observation_digest":"sha256:af1e5f6b03d80ea6bbf1f2c928799afa3afaa0ab306aa7a7f5931534517e8e97","observation_id":"6b70340b-707e-4ee4-955a-5fa53d4ac107","resolution":{"observed_at":"2026-05-23T02:52:27.077172Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06395","last_updated":"2024-06-03T08:54:38Z","snapshot_observed_at":"2026-08-12T13:10:06.472493Z","submitted_at":"2024-04-09T15:36:50Z","title":"MiniCPM: Unveiling the Potential of Small Language Models with Scalable Training Strategies","version":3},"cited_work":{"arxiv_id":"2404.06395","doi":"10.48550/arxiv.2404.06395","metadata_source":"pith","pith_arxiv_id":"2404.06395","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MiniCPM: Unveiling the Potential of Small Language Models with Scalable Training Strategies","venue":"cs.CL","work_id":"f20a4304-bd39-414a-923b-d18322e29258","year":2024},"citing_paper":{"arxiv_id":"2502.12120","last_updated":"2026-05-20T13:58:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-17T18:45:25Z","title":"LLMs on the Line: Data Determines Loss-to-Loss Scaling Laws","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-05-23T02:47:37.492619Z"},"links":{"cited_paper":"/paper/2404.06395","citing_paper":"/paper/2502.12120"},"observation_digest":"sha256:2567ec49a1bcc1ae93123b0fa9a939ecd3fe30517854ef1e4270abf2f25bc2aa","observation_id":"629d0798-9ebd-46e2-9a83-6010ee3ac1ed","resolution":{"observed_at":"2026-05-23T02:52:27.094710Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2402.04177","doi":"10.48550/arxiv.2402.04177","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling laws for downstream task performance of large language models","venue":"arXiv (Cornell University)","work_id":"ae81c291-4985-4e00-a40f-6f4b4abbc1f3","year":2024},"citing_paper":{"arxiv_id":"2502.12120","last_updated":"2026-05-20T13:58:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-17T18:45:25Z","title":"LLMs on the Line: Data Determines Loss-to-Loss Scaling Laws","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-05-23T02:47:37.492619Z"},"links":{"citing_paper":"/paper/2502.12120"},"observation_digest":"sha256:24c5e092a1d7cfcc209699f128e0789da06e1dfedd8572c5ab2a5bf3d5584b10","observation_id":"078c30a2-9096-4c4c-b0c7-95988dbad9d3","resolution":{"observed_at":"2026-05-23T02:52:27.087842Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-08-13T17:41:53.092611Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":"2001.08361","doi":"10.1145/3616855.3635845","metadata_source":"pith","pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling Laws for Neural Language Models","venue":"cs.LG","work_id":"b7dd8749-9c45-4977-ab9b-64478dce1ae8","year":2020},"citing_paper":{"arxiv_id":"2502.12120","last_updated":"2026-05-20T13:58:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-17T18:45:25Z","title":"LLMs on the Line: Data Determines Loss-to-Loss Scaling Laws","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-05-23T02:47:37.492619Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2502.12120"},"observation_digest":"sha256:4deee1984337fd4c68abbc610cba2be01f33a3cec891a91289164f6ce3e2a311","observation_id":"fbae82ac-aae8-499b-8a10-f6fdc2595eda","resolution":{"observed_at":"2026-05-23T02:52:27.090961Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"nanogpt","venue":null,"work_id":"87240abc-fe64-4d75-b7f8-4b0ba511f51a","year":2022},"citing_paper":{"arxiv_id":"2502.12120","last_updated":"2026-05-20T13:58:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-17T18:45:25Z","title":"LLMs on the Line: Data Determines Loss-to-Loss Scaling Laws","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-05-23T02:47:37.492619Z"},"links":{"citing_paper":"/paper/2502.12120"},"observation_digest":"sha256:fdc1ed2be792f64734eb83665eb3ed3433d124e7e6c4a379e27c939293eb64df","observation_id":"d936a0bf-0910-4dc8-a2fe-0c7c5e64c97a","resolution":{"observed_at":"2026-05-23T06:27:39.115411Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-08-17T19:26:44.032537Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":"1412.6980","doi":"10.1002/mrm.28086","metadata_source":"pith","pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Adam: A Method for Stochastic Optimization","venue":"cs.LG","work_id":"1910796d-9b52-4683-bf5c-de9632c1028b","year":2014},"citing_paper":{"arxiv_id":"2502.12120","last_updated":"2026-05-20T13:58:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-17T18:45:25Z","title":"LLMs on the Line: Data Determines Loss-to-Loss Scaling Laws","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-05-23T02:47:37.492619Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2502.12120"},"observation_digest":"sha256:aa553c5d442143314d0299b3a482a0fceb9f90e32145ac43771a39c3021d2bb9","observation_id":"c358675d-1e29-4408-b9ce-8ada8219276c","resolution":{"observed_at":"2026-05-23T02:52:27.132399Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1608.03983","last_updated":"2017-05-03T16:28:09Z","snapshot_observed_at":"2026-07-06T05:06:55.589962Z","submitted_at":"2016-08-13T13:46:05Z","title":"SGDR: Stochastic Gradient Descent with Warm Restarts","version":5},"cited_work":{"arxiv_id":"1608.03983","doi":"10.21203/rs.3.rs-7055642/v1","metadata_source":"pith","pith_arxiv_id":"1608.03983","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"SGDR: Stochastic Gradient Descent with Warm Restarts","venue":"cs.LG","work_id":"ad476478-c5ea-495b-a454-168c504bbfcc","year":2016},"citing_paper":{"arxiv_id":"2502.12120","last_updated":"2026-05-20T13:58:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-17T18:45:25Z","title":"LLMs on the Line: Data Determines Loss-to-Loss Scaling Laws","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-05-23T02:47:37.492619Z"},"links":{"cited_paper":"/paper/1608.03983","citing_paper":"/paper/2502.12120"},"observation_digest":"sha256:ba91451776d176d770ac30b0562e0bb9d941718cc79ed36aa545d13eba662c4e","observation_id":"8d3247ff-e86f-4033-97c3-2edf744f7ba8","resolution":{"observed_at":"2026-05-23T02:52:27.073705Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-14T20:13:52.872565Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":"1711.05101","doi":"10.1137/1.9781611972825.47","metadata_source":"pith","pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Decoupled Weight Decay Regularization","venue":"cs.LG","work_id":"07ef7360-d385-4033-83f7-8384a6325204","year":2017},"citing_paper":{"arxiv_id":"2502.12120","last_updated":"2026-05-20T13:58:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-17T18:45:25Z","title":"LLMs on the Line: Data Determines Loss-to-Loss Scaling Laws","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-05-23T02:47:37.492619Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2502.12120"},"observation_digest":"sha256:0592fef90f1a8beb98af4b9bd5671445b24c6e1fd1553a502d60ba4743aa3699","observation_id":"2df8dae7-c30f-4812-b7d4-9205bce9803e","resolution":{"observed_at":"2026-05-23T02:52:27.059391Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10229","last_updated":"2024-06-14T17:59:54Z","snapshot_observed_at":"2026-08-16T13:42:51.314941Z","submitted_at":"2024-06-14T17:59:54Z","title":"Quantifying Variance in Evaluation Benchmarks","version":1},"cited_work":{"arxiv_id":"2406.10229","doi":"10.48550/arxiv.2406.10229","metadata_source":"pith","pith_arxiv_id":"2406.10229","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"K., Schaeffer, R., Poulton, A., Koyejo, S., Stenetorp, P., Narang, S., and Hupkes, D","venue":"cs.LG","work_id":"7225cb09-2ce3-40e3-9e6b-2bdbb8bc58c8","year":2024},"citing_paper":{"arxiv_id":"2502.12120","last_updated":"2026-05-20T13:58:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-17T18:45:25Z","title":"LLMs on the Line: Data Determines Loss-to-Loss Scaling Laws","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-05-23T02:47:37.492619Z"},"links":{"cited_paper":"/paper/2406.10229","citing_paper":"/paper/2502.12120"},"observation_digest":"sha256:f9764d6d41c5924662cb092eb97ad6bbf0559e2724f3de9abff86202b374c6d6","observation_id":"0b1e145f-0b0c-4cbf-938e-5aa28133c018","resolution":{"observed_at":"2026-05-23T02:52:27.051526Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09562","last_updated":"2024-03-14T18:18:49Z","snapshot_observed_at":"2026-08-16T14:52:09.337137Z","submitted_at":"2023-10-14T11:24:28Z","title":"Does CLIP's Generalization Performance Mainly Stem from High Train-Test Similarity?","version":2},"cited_work":{"arxiv_id":"2310.09562","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.09562","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Does clip's generalization performance mainly stem from high train-test similarity?, 2024 a","venue":null,"work_id":"a4ce7b06-cb62-44e1-bf81-5545218d7a1c","year":2024},"citing_paper":{"arxiv_id":"2502.12120","last_updated":"2026-05-20T13:58:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-17T18:45:25Z","title":"LLMs on the Line: Data Determines Loss-to-Loss Scaling Laws","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-05-23T02:47:37.492619Z"},"links":{"cited_paper":"/paper/2310.09562","citing_paper":"/paper/2502.12120"},"observation_digest":"sha256:e65f8c3f96e89bd6c4b6d387c7ce1224584c3d160b01512b025900b1806ecf7c","observation_id":"eb592648-1229-459d-983a-d2cd8215eae8","resolution":{"observed_at":"2026-05-23T02:52:27.055543Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08258","last_updated":"2025-06-06T15:29:53Z","snapshot_observed_at":"2026-08-18T11:50:52.978865Z","submitted_at":"2024-10-10T17:50:45Z","title":"In Search of Forgotten Domain Generalization","version":2},"cited_work":{"arxiv_id":"2410.08258","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.08258","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"S., Wiedemer, T., Rusak, E., Juhos, A., Bethge, M., and Brendel, W","venue":null,"work_id":"cb3e5300-2432-449b-9026-5215f078513e","year":2024},"citing_paper":{"arxiv_id":"2502.12120","last_updated":"2026-05-20T13:58:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-17T18:45:25Z","title":"LLMs on the Line: Data Determines Loss-to-Loss Scaling Laws","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-05-23T02:47:37.492619Z"},"links":{"cited_paper":"/paper/2410.08258","citing_paper":"/paper/2502.12120"},"observation_digest":"sha256:b9b7ab0dc1327f9bbc600e897e381f9318e00f3ee7a9fda038ab0725a7d0b887","observation_id":"eb1ea2a2-7574-4ae8-80ef-4b181286e205","resolution":{"observed_at":"2026-05-23T02:52:27.063822Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.04649","last_updated":"2021-10-07T23:59:19Z","snapshot_observed_at":"2026-08-19T18:07:12.375860Z","submitted_at":"2021-07-09T19:48:23Z","title":"Accuracy on the Line: On the Strong Correlation Between Out-of-Distribution and In-Distribution Generalization","version":2},"cited_work":{"arxiv_id":"2107.04649","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2107.04649","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"W., Shankar, V., Liang, P., Carmon, Y., and Schmidt, L","venue":null,"work_id":"2e0d122c-6ea7-4fcc-a45a-e57bfa6918a1","year":2021},"citing_paper":{"arxiv_id":"2502.12120","last_updated":"2026-05-20T13:58:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-17T18:45:25Z","title":"LLMs on the Line: Data Determines Loss-to-Loss Scaling Laws","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-05-23T02:47:37.492619Z"},"links":{"cited_paper":"/paper/2107.04649","citing_paper":"/paper/2502.12120"},"observation_digest":"sha256:aab204fa287c2574111bc6d19981fb42425e0f453fce9fc7ed7eee51602924b6","observation_id":"d0ac1c9a-2327-4dd7-88ea-771f6bac3209","resolution":{"observed_at":"2026-05-23T02:52:27.067063Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.01116","last_updated":"2023-06-01T20:03:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-01T20:03:56Z","title":"The RefinedWeb Dataset for Falcon LLM: Outperforming Curated Corpora with Web Data, and Web Data Only","version":1},"cited_work":{"arxiv_id":"2306.01116","doi":"10.48550/arxiv.2306.01116","metadata_source":"pith","pith_arxiv_id":"2306.01116","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The RefinedWeb Dataset for Falcon LLM: Outperforming Curated Corpora with Web Data, and Web Data Only","venue":"cs.CL","work_id":"edfb45ee-84c2-4531-b3cd-bd8eb830f4e1","year":2023},"citing_paper":{"arxiv_id":"2502.12120","last_updated":"2026-05-20T13:58:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-17T18:45:25Z","title":"LLMs on the Line: Data Determines Loss-to-Loss Scaling Laws","version":3},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-05-23T02:47:37.492619Z"},"links":{"cited_paper":"/paper/2306.01116","citing_paper":"/paper/2502.12120"},"observation_digest":"sha256:432767a0429f7e1bf54b002a6690449afc41ddc80ec3b7cd7b0a5c6de4c13d55","observation_id":"fe364a94-f893-4468-ab85-1d61454841d2","resolution":{"observed_at":"2026-05-23T02:52:27.008419Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17557","last_updated":"2024-10-31T11:37:49Z","snapshot_observed_at":"2026-08-14T14:43:02.130172Z","submitted_at":"2024-06-25T13:50:56Z","title":"The FineWeb Datasets: Decanting the Web for the Finest Text Data at Scale","version":2},"cited_work":{"arxiv_id":"2406.17557","doi":"10.48550/arxiv.2406.17557","metadata_source":"pith","pith_arxiv_id":"2406.17557","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The FineWeb Datasets: Decanting the Web for the Finest Text Data at Scale","venue":"cs.CL","work_id":"1ac90585-1330-4f90-8836-6382fa63c4eb","year":2024},"citing_paper":{"arxiv_id":"2502.12120","last_updated":"2026-05-20T13:58:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-17T18:45:25Z","title":"LLMs on the Line: Data Determines Loss-to-Loss Scaling Laws","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-05-23T02:47:37.492619Z"},"links":{"cited_paper":"/paper/2406.17557","citing_paper":"/paper/2502.12120"},"observation_digest":"sha256:a5f96f59c5543401200436d1b2ebabf049711a1c26e29f87fff59fae67ca18b5","observation_id":"16246f4b-6745-49a5-8b97-5e93b98c865f","resolution":{"observed_at":"2026-05-23T02:52:27.040547Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-14T20:38:10.326889+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-14T20:38:10.326889+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19146","last_updated":"2025-01-19T10:34:08Z","snapshot_observed_at":"2026-08-16T13:39:05.282413Z","submitted_at":"2024-06-27T13:02:43Z","title":"Resolving Discrepancies in Compute-Optimal Scaling of Language Models","version":4},"cited_work":{"arxiv_id":"2406.19146","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.19146","snapshot_observed_at":"2026-06-30T08:24:26.777027Z","title":"Resolving discrepancies in compute-optimal scaling of language models","venue":null,"work_id":"651c4663-eeef-4500-9585-de00f9300854","year":2024},"citing_paper":{"arxiv_id":"2502.12120","last_updated":"2026-05-20T13:58:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-17T18:45:25Z","title":"LLMs on the Line: Data Determines Loss-to-Loss Scaling Laws","version":3},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-05-23T02:47:37.492619Z"},"links":{"cited_paper":"/paper/2406.19146","citing_paper":"/paper/2502.12120"},"observation_digest":"sha256:fd6699e95374ad54062586f8b9beb191841ab83f568f84f80d838d8c674e2557","observation_id":"67dd0421-289c-416f-89ea-365cd9570f7d","resolution":{"observed_at":"2026-05-23T02:52:27.048190Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Language models are unsupervised multitask learners","venue":null,"work_id":"4c516662-d1ea-4146-bb9d-492b0775095f","year":2019},"citing_paper":{"arxiv_id":"2502.12120","last_updated":"2026-05-20T13:58:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-17T18:45:25Z","title":"LLMs on the Line: Data Determines Loss-to-Loss Scaling Laws","version":3},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-05-23T02:47:37.492619Z"},"links":{"citing_paper":"/paper/2502.12120"},"observation_digest":"sha256:e915b07fdcaf9373d2f1d74fe4e275549068eaaaff3e14b8b3c86ae637cc2e17","observation_id":"85eaf020-83ab-46d9-9930-5a1b8df51300","resolution":{"observed_at":"2026-05-23T06:27:39.118336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2007.00810","last_updated":"2020-07-08T03:51:28Z","snapshot_observed_at":"2026-08-09T00:43:33.824393Z","submitted_at":"2020-07-01T23:33:37Z","title":"On Linear Identifiability of Learned Representations","version":3},"cited_work":{"arxiv_id":"2007.00810","doi":"10.48550/arxiv.2007.00810","metadata_source":"arxiv_reference","pith_arxiv_id":"2007.00810","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"On linear identifiability of learned representations","venue":"arXiv (Cornell University)","work_id":"78191837-7fdc-4ea0-98b4-f7ef5b7e223f","year":2007},"citing_paper":{"arxiv_id":"2502.12120","last_updated":"2026-05-20T13:58:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-17T18:45:25Z","title":"LLMs on the Line: Data Determines Loss-to-Loss Scaling Laws","version":3},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-05-23T02:47:37.492619Z"},"links":{"cited_paper":"/paper/2007.00810","citing_paper":"/paper/2502.12120"},"observation_digest":"sha256:3118f955db8708cdc29316ba193afb37e272ca6508d2613ef1e3e97cacaa5363","observation_id":"18ec24e3-6e4c-4537-9c4c-9f0d19ccef1e","resolution":{"observed_at":"2026-05-23T02:52:27.025945Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.10641","last_updated":"2019-11-21T19:01:32Z","snapshot_observed_at":"2026-08-16T10:42:13.725165Z","submitted_at":"2019-07-24T18:11:59Z","title":"WinoGrande: An Adversarial Winograd Schema Challenge at Scale","version":2},"cited_work":{"arxiv_id":"1907.10641","doi":"10.48550/arxiv.1907.10641","metadata_source":"pith","pith_arxiv_id":"1907.10641","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WinoGrande: An Adversarial Winograd Schema Challenge at Scale","venue":"cs.CL","work_id":"9587a902-54ad-434e-9cbc-bdfe54b5d3bf","year":2019},"citing_paper":{"arxiv_id":"2502.12120","last_updated":"2026-05-20T13:58:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-17T18:45:25Z","title":"LLMs on the Line: Data Determines Loss-to-Loss Scaling Laws","version":3},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-23T02:47:37.492619Z"},"links":{"cited_paper":"/paper/1907.10641","citing_paper":"/paper/2502.12120"},"observation_digest":"sha256:35e2b1b63d8d98b304ad99c2e19487cae6e9fc5964662ffc98eeb05f5de4d350","observation_id":"95f63f9d-15ea-4528-9fec-3598a2e9c887","resolution":{"observed_at":"2026-05-23T02:52:27.029445Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-14T20:38:10.649009+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-14T20:38:10.649009+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09728","last_updated":"2019-09-09T17:29:55Z","snapshot_observed_at":"2026-08-12T21:45:41.485479Z","submitted_at":"2019-04-22T05:36:37Z","title":"SocialIQA: Commonsense Reasoning about Social Interactions","version":3},"cited_work":{"arxiv_id":"1904.09728","doi":null,"metadata_source":"pith","pith_arxiv_id":"1904.09728","snapshot_observed_at":"2026-07-08T01:44:26.198243Z","title":"SocialIQA: Commonsense Reasoning about Social Interactions","venue":"cs.CL","work_id":"3f93670e-0ae7-40e5-bed5-74c216638dd1","year":2019},"citing_paper":{"arxiv_id":"2502.12120","last_updated":"2026-05-20T13:58:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-17T18:45:25Z","title":"LLMs on the Line: Data Determines Loss-to-Loss Scaling Laws","version":3},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-05-23T02:47:37.492619Z"},"links":{"cited_paper":"/paper/1904.09728","citing_paper":"/paper/2502.12120"},"observation_digest":"sha256:96cfbf95f4c53d5b7b73ae2e57807e97c3a1e672dd633fb36b7ef58791c931e1","observation_id":"db2ab083-36a2-4b7f-a885-cb06416fa40b","resolution":{"observed_at":"2026-05-23T02:52:27.036979Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19044","last_updated":"2024-09-27T17:58:21Z","snapshot_observed_at":"2026-08-20T02:25:49.636304Z","submitted_at":"2024-09-27T17:58:21Z","title":"On the Inductive Bias of Stacking Towards Improving Reasoning","version":1},"cited_work":{"arxiv_id":"2409.19044","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.19044","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"J., and Kumar, S","venue":null,"work_id":"dfd6d323-479b-4e71-a265-41022f60e028","year":2024},"citing_paper":{"arxiv_id":"2502.12120","last_updated":"2026-05-20T13:58:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-17T18:45:25Z","title":"LLMs on the Line: Data Determines Loss-to-Loss Scaling Laws","version":3},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-05-23T02:47:37.492619Z"},"links":{"cited_paper":"/paper/2409.19044","citing_paper":"/paper/2502.12120"},"observation_digest":"sha256:e78fb9200453286544dfdd2fc0b2395ced9e1019208215ccb132b65245d20a9f","observation_id":"24b30f4c-6ab0-4dd5-8bb9-fb22db13d759","resolution":{"observed_at":"2026-05-23T02:52:27.044287Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04391","last_updated":"2025-02-05T17:44:38Z","snapshot_observed_at":"2026-08-18T06:29:33.921147Z","submitted_at":"2024-06-06T17:46:56Z","title":"Why Has Predicting Downstream Capabilities of Frontier AI Models with Scale Remained Elusive?","version":2},"cited_work":{"arxiv_id":"2406.04391","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.04391","snapshot_observed_at":"2026-07-03T14:28:31.177053Z","title":"Why has predicting downstream capabilities of frontier ai models with scale remained elusive?","venue":null,"work_id":"be1d9879-f2f1-4d45-b39a-4417d1ca29ef","year":2025},"citing_paper":{"arxiv_id":"2502.12120","last_updated":"2026-05-20T13:58:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-17T18:45:25Z","title":"LLMs on the Line: Data Determines Loss-to-Loss Scaling Laws","version":3},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-05-23T02:47:37.492619Z"},"links":{"cited_paper":"/paper/2406.04391","citing_paper":"/paper/2502.12120"},"observation_digest":"sha256:51934514e6ab587a0fb423e3ec4410338331e4fa663d7f85277be722b6ac77ba","observation_id":"7068dbf6-0708-4ce8-8de9-7d697bdceed7","resolution":{"observed_at":"2026-05-23T02:52:27.070448Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.10818","last_updated":"2024-05-09T13:56:06Z","snapshot_observed_at":"2026-08-19T12:32:54.420704Z","submitted_at":"2023-09-19T17:59:54Z","title":"SlimPajama-DC: Understanding Data Combinations for LLM Training","version":3},"cited_work":{"arxiv_id":"2309.10818","doi":"10.48550/arxiv.2309.10818","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.10818","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Xing , title =","venue":"arXiv (Cornell University)","work_id":"d4330bb0-2cd0-4a69-aa23-53ec4cd66b4d","year":2023},"citing_paper":{"arxiv_id":"2502.12120","last_updated":"2026-05-20T13:58:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-17T18:45:25Z","title":"LLMs on the Line: Data Determines Loss-to-Loss Scaling Laws","version":3},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-05-23T02:47:37.492619Z"},"links":{"cited_paper":"/paper/2309.10818","citing_paper":"/paper/2502.12120"},"observation_digest":"sha256:8583d184be792c9badf5461755bcef08ad2874b4917cbee342f16e0714f16df7","observation_id":"a9c4ac4a-f922-4458-8966-c4436408edf6","resolution":{"observed_at":"2026-05-23T02:52:27.015453Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-05-24T05:54:41.460759+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T05:54:41.460759+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-08-12T10:50:46.357243Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":"1909.08053","doi":"10.48550/arxiv.1909.08053","metadata_source":"pith","pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","venue":"cs.CL","work_id":"c888e6d1-0b1d-43d6-9ef5-f0912a0efa1b","year":2019},"citing_paper":{"arxiv_id":"2502.12120","last_updated":"2026-05-20T13:58:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-17T18:45:25Z","title":"LLMs on the Line: Data Determines Loss-to-Loss Scaling Laws","version":3},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-05-23T02:47:37.492619Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2502.12120"},"observation_digest":"sha256:ef4ff52befea2c54243bfb64a04705ea9248fb9df683eb744f2fcaf072f94d32","observation_id":"8d15554c-d71a-4ef7-8c1c-fdf1cccd2c44","resolution":{"observed_at":"2026-05-23T02:52:27.022377Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:33.392193+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:33.392193+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1811.00937","last_updated":"2019-03-15T18:02:58Z","snapshot_observed_at":"2026-08-14T18:05:06.623407Z","submitted_at":"2018-11-02T15:34:29Z","title":"CommonsenseQA: A Question Answering Challenge Targeting Commonsense Knowledge","version":2},"cited_work":{"arxiv_id":"1811.00937","doi":null,"metadata_source":"pith","pith_arxiv_id":"1811.00937","snapshot_observed_at":"2026-07-10T04:46:45.601872Z","title":"CommonsenseQA: A Question Answering Challenge Targeting Commonsense Knowledge","venue":"cs.CL","work_id":"8cea02ba-76c4-4dec-b914-230fd66e4eb2","year":2018},"citing_paper":{"arxiv_id":"2502.12120","last_updated":"2026-05-20T13:58:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-17T18:45:25Z","title":"LLMs on the Line: Data Determines Loss-to-Loss Scaling Laws","version":3},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-05-23T02:47:37.492619Z"},"links":{"cited_paper":"/paper/1811.00937","citing_paper":"/paper/2502.12120"},"observation_digest":"sha256:a91e99908c0f2586d617fe3c50752d46e55e6247d4c6504898bef053bd86e7a9","observation_id":"66c487a5-5417-4570-8154-86fe5729766b","resolution":{"observed_at":"2026-05-23T02:52:27.018724Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2007.00644","last_updated":"2020-09-14T09:55:13Z","snapshot_observed_at":"2026-08-13T09:32:00.308636Z","submitted_at":"2020-07-01T17:53:26Z","title":"Measuring Robustness to Natural Distribution Shifts in Image Classification","version":2},"cited_work":{"arxiv_id":"2007.00644","doi":"10.48550/arxiv.2007.00644","metadata_source":"arxiv_reference","pith_arxiv_id":"2007.00644","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measuring robustness to natural distribution shifts in image classification","venue":"arXiv (Cornell University)","work_id":"9fbbb702-710a-4f58-a562-a356d005c262","year":2007},"citing_paper":{"arxiv_id":"2502.12120","last_updated":"2026-05-20T13:58:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-17T18:45:25Z","title":"LLMs on the Line: Data Determines Loss-to-Loss Scaling Laws","version":3},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-05-23T02:47:37.492619Z"},"links":{"cited_paper":"/paper/2007.00644","citing_paper":"/paper/2502.12120"},"observation_digest":"sha256:ae99c77e4842e8ded4e4174128a6d9dd9d755bd65e0d2c20099333d6250f50f6","observation_id":"aff85cf0-1cc3-48ad-9117-65df32209e0c","resolution":{"observed_at":"2026-05-23T02:52:27.011832Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.10551","last_updated":"2022-07-21T15:50:22Z","snapshot_observed_at":"2026-08-16T16:44:16.282152Z","submitted_at":"2022-07-21T15:50:22Z","title":"Scaling Laws vs Model Architectures: How does Inductive Bias Influence Scaling?","version":1},"cited_work":{"arxiv_id":"2207.10551","doi":"10.48550/arxiv.2207.10551","metadata_source":"arxiv_reference","pith_arxiv_id":"2207.10551","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"W., Fedus, W., Rao, J., Narang, S., Tran, V","venue":"arXiv (Cornell University)","work_id":"1288e113-5f13-4618-8fd1-710152a69ca0","year":2022},"citing_paper":{"arxiv_id":"2502.12120","last_updated":"2026-05-20T13:58:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-17T18:45:25Z","title":"LLMs on the Line: Data Determines Loss-to-Loss Scaling Laws","version":3},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-05-23T02:47:37.492619Z"},"links":{"cited_paper":"/paper/2207.10551","citing_paper":"/paper/2502.12120"},"observation_digest":"sha256:f42616f2b4bf4cebbfb5f9a7bc22ef83159332ad938b9a8412107a96e5cc1710","observation_id":"91de4426-7f01-48ba-ad49-6892bf231d93","resolution":{"observed_at":"2026-05-23T02:52:27.033438Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Y., Haziza, D., Wehrstedt, L., Copet, J., Teytaud, O., and Lopez-Paz, D","venue":null,"work_id":"2afe4d5e-6e85-44e6-905e-ca86671689ae","year":2024},"citing_paper":{"arxiv_id":"2502.12120","last_updated":"2026-05-20T13:58:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-17T18:45:25Z","title":"LLMs on the Line: Data Determines Loss-to-Loss Scaling Laws","version":3},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-05-23T02:47:37.492619Z"},"links":{"citing_paper":"/paper/2502.12120"},"observation_digest":"sha256:815da42a93d02d6f6553e2ccbb022137713df8847fc4c2904a673efed2009f66","observation_id":"9387ca80-436e-48bc-9825-6b3459f90f8c","resolution":{"observed_at":"2026-05-23T06:27:39.112060Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1038/s41592-019-0686-2","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T02:37:45.798234Z","title":"Oliphant, Matt Haberland, Tyler Reddy, David Cournapeau, Evgeni Burovski, Pearu Peterson, Warren Weckesser, Jonathan Bright, St´ efan J","venue":"Nature Methods","work_id":"1a44c2d3-9a48-46f3-924b-d2fa43b6729a","year":2020},"citing_paper":{"arxiv_id":"2502.12120","last_updated":"2026-05-20T13:58:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-17T18:45:25Z","title":"LLMs on the Line: Data Determines Loss-to-Loss Scaling Laws","version":3},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-05-23T02:47:37.492619Z"},"links":{"citing_paper":"/paper/2502.12120"},"observation_digest":"sha256:db91c25f065638ab3c6de4f23fa3fdd25e9a06b3f16a6dbdd44707f28ec0c7a8","observation_id":"5e3d9051-8da0-4201-b34a-7055c581d87e","resolution":{"observed_at":"2026-05-23T02:52:26.333993Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[{"edge_observation":{"observed_at":"2026-07-11T03:19:08.722131+00:00","source":"paper_reference_links","state":"open"},"event_date":"2020-03-04","event_type":"correction","notice_doi":"10.1038/s41592-020-0772-5","provenance":{"observed_at":"2026-07-11T03:08:19.430942+00:00","source":"crossref","source_record_id":"10.1038/s41592-020-0772-5->10.1038/s41592-019-0686-2:correction"}}],"reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"and Komatsuzaki, A","venue":null,"work_id":"f39ef218-ce21-4b16-a72f-e5722f4a7a27","year":2021},"citing_paper":{"arxiv_id":"2502.12120","last_updated":"2026-05-20T13:58:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-17T18:45:25Z","title":"LLMs on the Line: Data Determines Loss-to-Loss Scaling Laws","version":3},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-05-23T02:47:37.492619Z"},"links":{"citing_paper":"/paper/2502.12120"},"observation_digest":"sha256:70738eb0d9c98360d5ea61d148e0b5d31952f37a03d31c27a0780c995745ee91","observation_id":"cbfe1370-971c-4fea-b12c-716dd4ef8d09","resolution":{"observed_at":"2026-05-23T06:27:39.105234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05661","last_updated":"2024-10-08T03:21:56Z","snapshot_observed_at":"2026-08-16T13:11:40.512040Z","submitted_at":"2024-10-08T03:21:56Z","title":"Scaling Laws Across Model Architectures: A Comparative Analysis of Dense and MoE Models in Large Language Models","version":1},"cited_work":{"arxiv_id":"2410.05661","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.05661","snapshot_observed_at":"2026-07-02T22:17:25.544159Z","title":"Scaling laws across model architectures: A comparative analysis of dense and moe models in large language models","venue":null,"work_id":"8b378d72-2a38-4a99-878c-667bd29b6603","year":2024},"citing_paper":{"arxiv_id":"2502.12120","last_updated":"2026-05-20T13:58:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-17T18:45:25Z","title":"LLMs on the Line: Data Determines Loss-to-Loss Scaling Laws","version":3},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-05-23T02:47:37.492619Z"},"links":{"cited_paper":"/paper/2410.05661","citing_paper":"/paper/2502.12120"},"observation_digest":"sha256:57c2461703d34f1ec3f668e13a33520374bd915814f981fd3111f1e0ed4de883","observation_id":"73e00f2a-6b80-4a37-9734-c94fd4c1993a","resolution":{"observed_at":"2026-05-23T02:52:27.080480Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pretraining frequency predicts compositional generalization of CLIP on real-world tasks","venue":null,"work_id":"c77e6fdc-ee52-418b-a06b-aaa11d7061ea","year":2024},"citing_paper":{"arxiv_id":"2502.12120","last_updated":"2026-05-20T13:58:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-17T18:45:25Z","title":"LLMs on the Line: Data Determines Loss-to-Loss Scaling Laws","version":3},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-05-23T02:47:37.492619Z"},"links":{"citing_paper":"/paper/2502.12120"},"observation_digest":"sha256:b4485b3457768c4e3fb2d3699f6cdf59b276f0f0aafe15c07950f59a5ccb0cc8","observation_id":"ad57ad34-54a2-4996-b754-2a1c99fdde05","resolution":{"observed_at":"2026-05-23T06:27:39.102181Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.03771","last_updated":"2020-07-14T03:42:34Z","snapshot_observed_at":"2026-07-06T08:27:58.343233Z","submitted_at":"2019-10-09T03:23:22Z","title":"HuggingFace's Transformers: State-of-the-art Natural Language Processing","version":5},"cited_work":{"arxiv_id":"1910.03771","doi":"10.48550/arxiv.1910.03771","metadata_source":"pith","pith_arxiv_id":"1910.03771","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HuggingFace's Transformers: State-of-the-art Natural Language Processing","venue":"cs.CL","work_id":"9d86da8d-01d3-41af-a0d2-ee14897927a9","year":2019},"citing_paper":{"arxiv_id":"2502.12120","last_updated":"2026-05-20T13:58:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-17T18:45:25Z","title":"LLMs on the Line: Data Determines Loss-to-Loss Scaling Laws","version":3},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-05-23T02:47:37.492619Z"},"links":{"cited_paper":"/paper/1910.03771","citing_paper":"/paper/2502.12120"},"observation_digest":"sha256:b359a9d9baa0d4df4d271e89c9dc6f5bc7ba6e0c87fa33727f8702f159e75714","observation_id":"749b280b-6aec-42a7-afbe-1319b694d4a1","resolution":{"observed_at":"2026-05-23T02:52:27.004648Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-07T21:38:08.865847+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-07T21:38:08.865847+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.07830","last_updated":"2019-05-19T23:57:23Z","snapshot_observed_at":"2026-08-15T09:37:44.321271Z","submitted_at":"2019-05-19T23:57:23Z","title":"HellaSwag: Can a Machine Really Finish Your Sentence?","version":1},"cited_work":{"arxiv_id":"1905.07830","doi":"10.48550/arxiv.1905.07830","metadata_source":"pith","pith_arxiv_id":"1905.07830","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HellaSwag: Can a Machine Really Finish Your Sentence?","venue":"cs.CL","work_id":"79f44c0c-96f4-4edb-bc50-a3c9d6b85936","year":2019},"citing_paper":{"arxiv_id":"2502.12120","last_updated":"2026-05-20T13:58:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-17T18:45:25Z","title":"LLMs on the Line: Data Determines Loss-to-Loss Scaling Laws","version":3},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-05-23T02:47:37.492619Z"},"links":{"cited_paper":"/paper/1905.07830","citing_paper":"/paper/2502.12120"},"observation_digest":"sha256:48ca20e9507ff662c50dbf2d430bf07ba67c018557243a63f674d6e2f18b5e4f","observation_id":"7ade2323-c95b-4630-ae9f-567be4c1e44d","resolution":{"observed_at":"2026-05-23T02:52:27.001197Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T08:36:07.226215Z","title":"write newline","venue":null,"work_id":"8481976a-f196-4822-833d-e487ae5a1e81","year":null},"citing_paper":{"arxiv_id":"2502.12120","last_updated":"2026-05-20T13:58:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-17T18:45:25Z","title":"LLMs on the Line: Data Determines Loss-to-Loss Scaling Laws","version":3},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-05-23T02:47:37.492619Z"},"links":{"citing_paper":"/paper/2502.12120"},"observation_digest":"sha256:27aeacd5b02886b1e70f1034cabb7507452990585cdbe5b7cb24df042a554660","observation_id":"7ae70e27-f2c3-4dd1-8a0b-762fbf1f3215","resolution":{"observed_at":"2026-05-23T06:27:39.121286Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2502.12120","last_updated":"2026-05-20T13:58:03Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-17T18:45:25Z","title":"LLMs on the Line: Data Determines Loss-to-Loss Scaling Laws"},"reference_resolution":{"displayed":54,"state_counts":{"malformed_identifier":0,"metadata_mismatch":12,"parse_uncertain":0,"unresolved":0,"verified_exact":34,"verified_fuzzy":8},"total_outbound_references":54},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 54 of 54 outbound references and 7 inbound Pith citation observations for arXiv:2502.12120."}