{"as_of":"2026-08-07T16:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:af8ecffeb8e760a7f07aefd90ebd3f01b99bf252d6ca32b627a8e7e27c4f9cc2","coverage":[{"denominator":56,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":56,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T20:48:55.792391Z","state":"measured"},{"denominator":57,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":57,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-16T06:58:38.927268Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-16T07:00:43.255075Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","snapshot_observed_at":"2026-08-06T20:35:13.610100Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks","version":2},"cited_work":{"arxiv_id":"2507.02119","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02119","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"G., Pennington, J., and Agar- wala, A","venue":null,"work_id":"8d07adf0-3365-4326-a700-454de9ee464b","year":null},"citing_paper":{"arxiv_id":"2602.04774","last_updated":"2026-05-08T16:24:57Z","snapshot_observed_at":"2026-08-03T01:34:12.578849Z","submitted_at":"2026-02-04T17:11:36Z","title":"Theory of Optimal Learning Rate Schedules and Scaling Laws for a Random Feature Model","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-16T06:58:38.927268Z"},"links":{"cited_paper":"/paper/2507.02119","citing_paper":"/paper/2602.04774"},"observation_digest":"sha256:0faba64160e9e9b4ef1730719f81d2da0db77afe92e9e5a00921768551086f7d","observation_id":"41fd3f8c-d9fe-418e-b9d8-5b79dd298a3f","resolution":{"observed_at":"2026-05-16T07:00:43.256809Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.02119/citation-record","integrity":"/paper/2507.02119/integrity","json":"/paper/2507.02119/citation-record.json","paper":"/paper/2507.02119"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T20:48:48.890013Z","title":"L., Almeida, D., Altenschmidt, J., Altman, S., Anadkat, S., et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","snapshot_observed_at":"2026-08-06T20:35:13.610100Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T20:48:48.890013Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.02119"},"observation_digest":"sha256:8d9562fe16938c0fc7bd14f0ce2475e66ceea54e878883e8532ce43d58e4837d","observation_id":"1f8507b7-d662-4d9a-a6f9-a37c495b3814","resolution":{"observed_at":"2026-08-06T20:48:48.890013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:49:03.187780Z","title":"and Fisher, D","venue":null,"work_id":"78c03c41-a1dc-4d7a-a6f0-6cfbafbdf88e","year":2019},"citing_paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","snapshot_observed_at":"2026-08-06T20:35:13.610100Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T20:48:48.984871Z"},"links":{"citing_paper":"/paper/2507.02119"},"observation_digest":"sha256:f4b44c7decfc92858faf42cb89e8787cda938c0bf0c82a7957d6fa155103c629","observation_id":"ff16d3b2-6874-4029-bc2a-03c5d1a16f45","resolution":{"observed_at":"2026-08-06T20:49:03.332256Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.19261","last_updated":"2025-02-01T01:30:40Z","snapshot_observed_at":"2026-07-06T18:07:27.432252Z","submitted_at":"2024-04-30T04:54:15Z","title":"High dimensional analysis reveals conservative sharpening and a stochastic edge of stability","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.19261","snapshot_observed_at":"2026-08-06T20:48:49.116497Z","title":"and Pennington, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","snapshot_observed_at":"2026-08-06T20:35:13.610100Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T20:48:49.116497Z"},"links":{"cited_paper":"/paper/2404.19261","citing_paper":"/paper/2507.02119"},"observation_digest":"sha256:b532c8cdaedb08cee618a1c632ec4dde508d938561abf7b5676ef1e10e12d2f3","observation_id":"d210d09d-bd03-4756-84ab-8877e7587d6b","resolution":{"observed_at":"2026-08-06T20:48:49.116497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:48:49.230831Z","title":"Power lines: Scaling laws for weight decay and batch size in llm pre-training","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","snapshot_observed_at":"2026-08-06T20:35:13.610100Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T20:48:49.230831Z"},"links":{"citing_paper":"/paper/2507.02119"},"observation_digest":"sha256:b76a2e71aaed297a796ca83d758b3e052b64fd1b0cbf8907af1c4de0176daa17","observation_id":"803ba54a-c036-4b78-a89f-9aacfaba5bff","resolution":{"observed_at":"2026-08-06T20:48:49.230831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:49:02.997796Z","title":"Finite size scaling analysis of ising model block distribution functions","venue":null,"work_id":"26f7dfc4-cdad-42f9-8998-5da169846d97","year":1981},"citing_paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","snapshot_observed_at":"2026-08-06T20:35:13.610100Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T20:48:49.341620Z"},"links":{"citing_paper":"/paper/2507.02119"},"observation_digest":"sha256:39ae9873e15612f6fde1f20da2c643c3f53cbd3f68df8ac2f32d184faa9bb310","observation_id":"19d23896-26c3-4357-a7ee-da726da3d950","resolution":{"observed_at":"2026-08-06T20:49:03.061062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:49:02.704232Z","title":"and Pehlevan, C","venue":null,"work_id":"798ad1a4-3f67-4dfb-96b4-89f3561d4f84","year":2022},"citing_paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","snapshot_observed_at":"2026-08-06T20:35:13.610100Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T20:48:49.465906Z"},"links":{"citing_paper":"/paper/2507.02119"},"observation_digest":"sha256:a09cf0699a3503a14e792bb82eea52e15e907d2b737073352bb1ed2eb7d04614","observation_id":"00ddcf25-616c-4d98-97c1-562523c70530","resolution":{"observed_at":"2026-08-06T20:49:02.877934Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16620","last_updated":"2023-12-08T18:19:44Z","snapshot_observed_at":"2026-07-06T16:25:01.609308Z","submitted_at":"2023-09-28T17:20:50Z","title":"Depthwise Hyperparameter Transfer in Residual Networks: Dynamics and Scaling Limit","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16620","snapshot_observed_at":"2026-08-06T20:48:49.634542Z","title":"B., Hanin, B., and Pehlevan, C","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","snapshot_observed_at":"2026-08-06T20:35:13.610100Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T20:48:49.634542Z"},"links":{"cited_paper":"/paper/2309.16620","citing_paper":"/paper/2507.02119"},"observation_digest":"sha256:3a401d4a2139526e6ac9e778682821ac97be16919d48b0a55e6ed8d9533825ef","observation_id":"7c5eee10-f120-4418-be25-ed004d944912","resolution":{"observed_at":"2026-08-06T20:48:49.634542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01092","last_updated":"2024-06-23T10:46:17Z","snapshot_observed_at":"2026-08-06T19:33:29.368862Z","submitted_at":"2024-02-02T01:41:38Z","title":"A Dynamical Model of Neural Scaling Laws","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01092","snapshot_observed_at":"2026-08-06T20:48:49.730886Z","title":"A dynamical model of neural scaling laws","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","snapshot_observed_at":"2026-08-06T20:35:13.610100Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T20:48:49.730886Z"},"links":{"cited_paper":"/paper/2402.01092","citing_paper":"/paper/2507.02119"},"observation_digest":"sha256:87e9f518fc51d332a2b7f12c705e3a3a6bc5aeb81f41101093c837d460864ff4","observation_id":"34cf55a9-2ec1-4ee3-979d-31fb7e50ae16","resolution":{"observed_at":"2026-08-06T20:48:49.730886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17858","last_updated":"2025-04-04T13:47:57Z","snapshot_observed_at":"2026-07-06T19:22:45.746115Z","submitted_at":"2024-09-26T14:05:32Z","title":"How Feature Learning Can Improve Neural Scaling Laws","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17858","snapshot_observed_at":"2026-08-06T20:48:49.856090Z","title":"How feature learning can improve neural scaling laws","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","snapshot_observed_at":"2026-08-06T20:35:13.610100Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T20:48:49.856090Z"},"links":{"cited_paper":"/paper/2409.17858","citing_paper":"/paper/2507.02119"},"observation_digest":"sha256:fb5bacc71225d84d3f2fba5bb55c2df6b3e501863871171ca8fcd8039a37409f","observation_id":"14832c06-88b9-461a-8b12-2d859f17a77f","resolution":{"observed_at":"2026-08-06T20:48:49.856090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:49:02.332172Z","title":"Infinite limits of multi-head transformer dynamics","venue":null,"work_id":"7baeaf16-4934-464a-b607-f6e5c2788147","year":2024},"citing_paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","snapshot_observed_at":"2026-08-06T20:35:13.610100Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T20:48:49.979212Z"},"links":{"citing_paper":"/paper/2507.02119"},"observation_digest":"sha256:47fb1cdb47a4f245a3298c6ab41bb3040a9f5d8b1750c2470934dbd94424f0b3","observation_id":"03d58112-1883-4f77-943c-d1f8987069cd","resolution":{"observed_at":"2026-08-06T20:49:02.507256Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00065","last_updated":"2022-11-23T18:09:57Z","snapshot_observed_at":"2026-08-06T02:48:08.712124Z","submitted_at":"2021-02-26T22:08:19Z","title":"Gradient Descent on Neural Networks Typically Occurs at the Edge of Stability","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.00065","snapshot_observed_at":"2026-08-06T20:48:50.108888Z","title":"M., Kaur, S., Li, Y., Kolter, J","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","snapshot_observed_at":"2026-08-06T20:35:13.610100Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T20:48:50.108888Z"},"links":{"cited_paper":"/paper/2103.00065","citing_paper":"/paper/2507.02119"},"observation_digest":"sha256:ede063d16f99b4e4f66281c82f9608436c6894ff3c23e5c26cdef4f359726a1e","observation_id":"b2a49a53-e9c1-4dc0-bdee-154cb355f9c6","resolution":{"observed_at":"2026-08-06T20:48:50.108888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.14484","last_updated":"2024-04-15T22:52:51Z","snapshot_observed_at":"2026-07-06T13:36:37.251739Z","submitted_at":"2022-07-29T05:23:47Z","title":"Adaptive Gradient Methods at the Edge of Stability","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.14484","snapshot_observed_at":"2026-08-06T20:48:50.237889Z","title":"M., Ghorbani, B., Krishnan, S., Agarwal, N., Medapati, S., Badura, M., Suo, D., Cardoze, D., Nado, Z., Dahl, G","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","snapshot_observed_at":"2026-08-06T20:35:13.610100Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T20:48:50.237889Z"},"links":{"cited_paper":"/paper/2207.14484","citing_paper":"/paper/2507.02119"},"observation_digest":"sha256:6077a68fbf546694046e092b835aa8fbf462b7f5b53a916650eb149fd3dc7051","observation_id":"4d05b138-7864-4521-a851-7c0cf4d60ba8","resolution":{"observed_at":"2026-08-06T20:48:50.237889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:48:50.344017Z","title":"M., Damian, A., Talwalkar, A., Kolter, Z., and Lee, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","snapshot_observed_at":"2026-08-06T20:35:13.610100Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T20:48:50.344017Z"},"links":{"citing_paper":"/paper/2507.02119"},"observation_digest":"sha256:3c02e7d200aa7d676905e0238b1a3656100a72d6f003b284c5bc2602af6ddc10","observation_id":"6e76a5f3-8709-4694-8311-a01ccecbc2c8","resolution":{"observed_at":"2026-08-06T20:48:50.344017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.04509","last_updated":"2022-02-09T15:15:39Z","snapshot_observed_at":"2026-07-06T12:36:04.284368Z","submitted_at":"2022-02-09T15:15:39Z","title":"Optimal learning rate schedules in high-dimensional non-convex optimization problems","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.04509","snapshot_observed_at":"2026-08-06T20:48:50.480589Z","title":"Optimal learning rate schedules in high-dimensional non-convex optimization problems","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","snapshot_observed_at":"2026-08-06T20:35:13.610100Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T20:48:50.480589Z"},"links":{"cited_paper":"/paper/2202.04509","citing_paper":"/paper/2507.02119"},"observation_digest":"sha256:dea4b9bca6063f26d3b75eb3fcb5f4cc0d4950fb97dc9ab897ff0b299c18db75","observation_id":"80156d54-db79-46f4-8069-df4302dbccae","resolution":{"observed_at":"2026-08-06T20:48:50.480589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:48:50.592169Z","title":"C., Noci, L., Li, M., Bordelon, B., Bergsma, S., Pehlevan, C., Hanin, B., and Hestness, J","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","snapshot_observed_at":"2026-08-06T20:35:13.610100Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T20:48:50.592169Z"},"links":{"citing_paper":"/paper/2507.02119"},"observation_digest":"sha256:6f235ac14e595810e2a129be0f68d7af6a049f436cd678bdf742cab6654a660f","observation_id":"9502e4e6-1a62-40ee-8cb0-5ed9eaf6c731","resolution":{"observed_at":"2026-08-06T20:48:50.592169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:49:02.083371Z","title":"Kingma, J","venue":null,"work_id":"cb513680-d7d7-4bfc-9e84-597c255ede27","year":2015},"citing_paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","snapshot_observed_at":"2026-08-06T20:35:13.610100Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T20:48:50.697194Z"},"links":{"citing_paper":"/paper/2507.02119"},"observation_digest":"sha256:b62bbd6f6a2695ce0cbf90d0547b78cf61c1c666f8203c051adc161e046f8362","observation_id":"ad86be4a-4417-4076-9c0f-e4185cd2952a","resolution":{"observed_at":"2026-08-06T20:49:02.206565Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05872","last_updated":"2024-07-16T17:40:09Z","snapshot_observed_at":"2026-07-06T18:42:56.281402Z","submitted_at":"2024-07-08T12:32:51Z","title":"Scaling Exponents Across Parameterizations and Optimizers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05872","snapshot_observed_at":"2026-08-06T20:48:50.834417Z","title":"A., Novak, R., Liu, P","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","snapshot_observed_at":"2026-08-06T20:35:13.610100Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T20:48:50.834417Z"},"links":{"cited_paper":"/paper/2407.05872","citing_paper":"/paper/2507.02119"},"observation_digest":"sha256:b8bc22cebb2e397590c1a79e380973db8da5c4efbbd9c9ed26b4a4202694350b","observation_id":"0231a66f-5898-4deb-a78f-3976de64ab0d","resolution":{"observed_at":"2026-08-06T20:48:50.834417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:49:01.789913Z","title":null,"venue":null,"work_id":"8add9626-2d20-4fcc-bebd-db7207463149","year":2013},"citing_paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","snapshot_observed_at":"2026-08-06T20:35:13.610100Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T20:48:50.982931Z"},"links":{"citing_paper":"/paper/2507.02119"},"observation_digest":"sha256:061f7a146c225a2fdb6a2608fc5e9ff1db007c61875eeabbf67b69aeeafbf873","observation_id":"a27cd3c4-c959-4c6c-ade8-6651aebda303","resolution":{"observed_at":"2026-08-06T20:49:01.969127Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:49:01.428144Z","title":"Monte Carlo methods in financial engineering, volume 53","venue":null,"work_id":"ba9a1046-044c-4b81-8ec3-d299826c7d8e","year":2004},"citing_paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","snapshot_observed_at":"2026-08-06T20:35:13.610100Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T20:48:51.135576Z"},"links":{"citing_paper":"/paper/2507.02119"},"observation_digest":"sha256:cb03ab001ee580655a84f7ba1e0f0e093f2d086509dca56637ddbd3c99348b7b","observation_id":"9b472174-aad9-4b29-a6f6-280c995a9936","resolution":{"observed_at":"2026-08-06T20:49:01.602856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:49:01.138438Z","title":"and Fisher, D","venue":null,"work_id":"0897cec5-bec4-4362-9ef7-d174e4fa87f1","year":2014},"citing_paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","snapshot_observed_at":"2026-08-06T20:35:13.610100Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T20:48:51.288401Z"},"links":{"citing_paper":"/paper/2507.02119"},"observation_digest":"sha256:8fa236c6f36fab89aacb5b0f233268364264c2a849f76091d0bc753e1b496560","observation_id":"894f4596-0b96-4b61-a659-2679eddf39c2","resolution":{"observed_at":"2026-08-06T20:49:01.275473Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.08415","last_updated":"2023-06-06T01:53:32Z","snapshot_observed_at":"2026-07-06T05:01:27.910364Z","submitted_at":"2016-06-27T19:20:40Z","title":"Gaussian Error Linear Units (GELUs)","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.08415","snapshot_observed_at":"2026-08-06T20:48:51.439168Z","title":"and Gimpel, K","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","snapshot_observed_at":"2026-08-06T20:35:13.610100Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T20:48:51.439168Z"},"links":{"cited_paper":"/paper/1606.08415","citing_paper":"/paper/2507.02119"},"observation_digest":"sha256:8e721d23c56658deab2adf934316224fcb8d22da9d9d27f03e1d54761c8b1abd","observation_id":"01e15fe3-4ed2-492b-8957-bad8c1daf31e","resolution":{"observed_at":"2026-08-06T20:48:51.439168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-08-06T20:48:51.541070Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","snapshot_observed_at":"2026-08-06T20:35:13.610100Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T20:48:51.541070Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2507.02119"},"observation_digest":"sha256:5dfee6fe27e37930b7f4da78a8ed63cb73d90ed0a23fa3f647b78f4814eeaa14","observation_id":"4e936d7a-dbe8-4e16-ba21-53b8d78e44a6","resolution":{"observed_at":"2026-08-06T20:48:51.541070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-07-06T12:54:11.616335Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-06T20:48:51.686276Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","snapshot_observed_at":"2026-08-06T20:35:13.610100Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T20:48:51.686276Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2507.02119"},"observation_digest":"sha256:5f34eacce41f45b21bd5c3badaf0e65a74f194fa35f6d19c256c94b2267f2779","observation_id":"a53d9abd-f9f5-46f0-9a61-462a98c5354a","resolution":{"observed_at":"2026-08-06T20:48:51.686276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-06T20:48:51.813397Z","title":"B., Chess, B., Child, R., Gray, S., Radford, A., Wu, J., and Amodei, D","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","snapshot_observed_at":"2026-08-06T20:35:13.610100Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T20:48:51.813397Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2507.02119"},"observation_digest":"sha256:bee26aadde83f73bb066c52beb254f1e8d2991e146d56f48da5f46b5d516eb53","observation_id":"6c3c0699-c49f-492c-a582-7a53930cd057","resolution":{"observed_at":"2026-08-06T20:48:51.813397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:49:00.808738Z","title":"F., Blundell, J","venue":null,"work_id":"b21cd242-e8f1-4d45-b764-cdeac3cb2c83","year":2015},"citing_paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","snapshot_observed_at":"2026-08-06T20:35:13.610100Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T20:48:51.957254Z"},"links":{"citing_paper":"/paper/2507.02119"},"observation_digest":"sha256:015d9b36ddd8ef95d51b855deae085343a1b2239176cfb42ad9d11bd19c7681d","observation_id":"ff42298c-b9e7-4d0e-9192-5040dfe2c84d","resolution":{"observed_at":"2026-08-06T20:49:00.969218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:49:00.583115Z","title":"Stochastic modified equations and adaptive stochastic gradient algorithms","venue":null,"work_id":"fe7594f6-9995-4b9a-8268-49f98cb996b7","year":2017},"citing_paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","snapshot_observed_at":"2026-08-06T20:35:13.610100Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T20:48:52.040916Z"},"links":{"citing_paper":"/paper/2507.02119"},"observation_digest":"sha256:b7aa5c65d1863b82c6d08e0d4b952674e11b06c15cd8785ab85db7891d11cd08","observation_id":"285b1657-f9f6-4e76-9a21-83e8c78a68f3","resolution":{"observed_at":"2026-08-06T20:49:00.702563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12811","last_updated":"2025-03-17T04:36:45Z","snapshot_observed_at":"2026-07-06T20:53:41.124209Z","submitted_at":"2025-03-17T04:36:45Z","title":"A Multi-Power Law for Loss Curve Prediction Across Learning Rate Schedules","version":1},"cited_work":{"arxiv_id":"2503.12811","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.12811","snapshot_observed_at":"2026-08-06T20:48:56.360959Z","title":"A Multi-Power Law for Loss Curve Prediction Across Learning Rate Schedules","venue":"cs.LG","work_id":"0ab39c2c-1c5e-4217-a3ec-4b32e0e8aafb","year":2025},"citing_paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","snapshot_observed_at":"2026-08-06T20:35:13.610100Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T20:48:52.152237Z"},"links":{"cited_paper":"/paper/2503.12811","citing_paper":"/paper/2507.02119"},"observation_digest":"sha256:2d31f0fd9a42d0c3d5b3cf08474a40158e1cbd5cda765fa64175d67a3a377f54","observation_id":"1541ff55-00bc-4e67-beb4-0ec9ee48de10","resolution":{"observed_at":"2026-08-06T20:48:56.444458Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:49:00.344518Z","title":"On the sdes and scaling rules for adaptive gradient algorithms","venue":null,"work_id":"5598fa69-fcff-46b9-a5e9-8090b16c04d5","year":2022},"citing_paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","snapshot_observed_at":"2026-08-06T20:35:13.610100Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T20:48:52.302674Z"},"links":{"citing_paper":"/paper/2507.02119"},"observation_digest":"sha256:e1de708e54524a1bb3577c12e9c8dd283a0d687af9b9cfe01f08c735ad98368a","observation_id":"aaa4604b-ec14-4b6c-be1a-efdd3c1a479d","resolution":{"observed_at":"2026-08-06T20:49:00.420054Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:49:00.111704Z","title":"and Pastur, L","venue":null,"work_id":"0c0365b8-fb9d-4ca1-b9db-d66b3023f438","year":1967},"citing_paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","snapshot_observed_at":"2026-08-06T20:35:13.610100Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T20:48:52.402249Z"},"links":{"citing_paper":"/paper/2507.02119"},"observation_digest":"sha256:85794681c0b5334d57deee56a7b6f1370234d881e0c975775812eb7575683fb5","observation_id":"f77b1822-0677-4628-920b-ba8297a7df0a","resolution":{"observed_at":"2026-08-06T20:49:00.239937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.06162","last_updated":"2018-12-14T20:49:09Z","snapshot_observed_at":"2026-07-06T07:21:19.842962Z","submitted_at":"2018-12-14T20:49:09Z","title":"An Empirical Model of Large-Batch Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.06162","snapshot_observed_at":"2026-08-06T20:48:52.527254Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","snapshot_observed_at":"2026-08-06T20:35:13.610100Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T20:48:52.527254Z"},"links":{"cited_paper":"/paper/1812.06162","citing_paper":"/paper/2507.02119"},"observation_digest":"sha256:bbf30a6c585aed2476b47750447614e10f5fef92fb6b4261066ded468c77b3d5","observation_id":"3593f90c-ab38-4294-a77a-dbf7cb00324e","resolution":{"observed_at":"2026-08-06T20:48:52.527254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:48:52.668462Z","title":"Y., Singh, S., Bhatele, A., Goldblum, M., Panda, A., and Goldstein, T","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","snapshot_observed_at":"2026-08-06T20:35:13.610100Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T20:48:52.668462Z"},"links":{"citing_paper":"/paper/2507.02119"},"observation_digest":"sha256:9fd5170571f70b7000d011988bb75abd95a999bb08b1eb227c2ac0e0cfe63734","observation_id":"9d7c7f74-d112-40fa-87e1-a8fce35df8b4","resolution":{"observed_at":"2026-08-06T20:48:52.668462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.08127","last_updated":"2021-02-19T03:24:24Z","snapshot_observed_at":"2026-08-03T04:24:28.195669Z","submitted_at":"2020-10-16T03:07:49Z","title":"The Deep Bootstrap Framework: Good Online Learners are Good Offline Generalizers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.08127","snapshot_observed_at":"2026-08-06T20:48:52.826035Z","title":"The deep bootstrap framework: Good online learners are good offline generalizers","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","snapshot_observed_at":"2026-08-06T20:35:13.610100Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T20:48:52.826035Z"},"links":{"cited_paper":"/paper/2010.08127","citing_paper":"/paper/2507.02119"},"observation_digest":"sha256:2c76d7160dfead933b9275d738878dacf5bc59b3da1c5a2880b603682997c43b","observation_id":"04774ee9-505a-45a6-9571-c86f9dea0c0d","resolution":{"observed_at":"2026-08-06T20:48:52.826035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:48:59.921587Z","title":"Super consistency of neural network landscapes and learning rate transfer","venue":null,"work_id":"562f92fe-f62d-4127-8b7c-9bd453bcbedd","year":2024},"citing_paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","snapshot_observed_at":"2026-08-06T20:35:13.610100Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T20:48:52.964417Z"},"links":{"citing_paper":"/paper/2507.02119"},"observation_digest":"sha256:fdc59988af1f8ba9d5255ab0cd7d589978975cbecebd248f15f194f3f286798f","observation_id":"32a46c09-50ef-497d-b2dd-898847fea43b","resolution":{"observed_at":"2026-08-06T20:48:59.986705Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:48:59.696081Z","title":"Sgd in the large: Average-case analysis, asymptotics, and stepsize criticality","venue":null,"work_id":"75627fa1-14fc-46a0-a099-2796192212f7","year":2021},"citing_paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","snapshot_observed_at":"2026-08-06T20:35:13.610100Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T20:48:53.062783Z"},"links":{"citing_paper":"/paper/2507.02119"},"observation_digest":"sha256:38929dd3cacda409fd87bf8f1da4afa326fcd2c83eca38b66a1ddabffd9f245b","observation_id":"f53c09ca-dfd3-44cb-a19f-41b65fc5e507","resolution":{"observed_at":"2026-08-06T20:48:59.812856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:48:59.464840Z","title":"Homogenization of sgd in high-dimensions: Exact dynamics and generalization properties","venue":null,"work_id":"a57b9cfc-8256-4ee6-be49-552527050b78","year":2024},"citing_paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","snapshot_observed_at":"2026-08-06T20:35:13.610100Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T20:48:53.171825Z"},"links":{"citing_paper":"/paper/2507.02119"},"observation_digest":"sha256:45f1a64d8201c3e6babbc7d67a426b6d5e93508d205bc74f2e173a9dfca6a5d2","observation_id":"6a579c77-06eb-48d0-a7fb-542382b48a89","resolution":{"observed_at":"2026-08-06T20:48:59.564827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15074","last_updated":"2025-04-18T21:56:39Z","snapshot_observed_at":"2026-08-01T23:00:36.303010Z","submitted_at":"2024-05-23T21:50:54Z","title":"4+3 Phases of Compute-Optimal Neural Scaling Laws","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.15074","snapshot_observed_at":"2026-08-06T20:48:53.293116Z","title":"4+ 3 phases of compute-optimal neural scaling laws","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","snapshot_observed_at":"2026-08-06T20:35:13.610100Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T20:48:53.293116Z"},"links":{"cited_paper":"/paper/2405.15074","citing_paper":"/paper/2507.02119"},"observation_digest":"sha256:ef759e682efdea105be895a337eb24e37152fdcb51e2c3c48815fc58f7c95b36","observation_id":"17e6d158-514a-450d-ad6c-12a4ecc631b6","resolution":{"observed_at":"2026-08-06T20:48:53.293116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:48:59.170771Z","title":"T., Agarwala, A., and Fisher, D","venue":null,"work_id":"c0543f5a-3d97-4a78-9d53-56b065e7fd02","year":2020},"citing_paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","snapshot_observed_at":"2026-08-06T20:35:13.610100Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T20:48:53.414115Z"},"links":{"citing_paper":"/paper/2507.02119"},"observation_digest":"sha256:85e3cd55efb2971537c7963c6c18f0bf50113bc6fbe63a462ad40d895a823eef","observation_id":"ae4e746d-a68b-4e00-a98f-f1a8a904de60","resolution":{"observed_at":"2026-08-06T20:48:59.330413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12907","last_updated":"2024-11-21T12:17:22Z","snapshot_observed_at":"2026-07-06T18:33:11.370375Z","submitted_at":"2024-06-12T13:30:48Z","title":"Reconciling Kaplan and Chinchilla Scaling Laws","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12907","snapshot_observed_at":"2026-08-06T20:48:53.523148Z","title":"and Song, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","snapshot_observed_at":"2026-08-06T20:35:13.610100Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T20:48:53.523148Z"},"links":{"cited_paper":"/paper/2406.12907","citing_paper":"/paper/2507.02119"},"observation_digest":"sha256:4da63801d9f801eafeaffb884fc5bb6cc8a6df5dbca7c7c7f4002321979643c7","observation_id":"5be144fc-b5ef-41b9-bb18-d0db1e2f5d94","resolution":{"observed_at":"2026-08-06T20:48:53.523148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:48:58.907121Z","title":"J., Davison, M., Bhaya, D., and Fisher, D","venue":null,"work_id":"be8297a6-e523-47cd-a376-71b7a54edcee","year":2015},"citing_paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","snapshot_observed_at":"2026-08-06T20:35:13.610100Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T20:48:53.640808Z"},"links":{"citing_paper":"/paper/2507.02119"},"observation_digest":"sha256:4b41dc5f5ab4266b43312a114605277ba54c9bc336ef894fcf33072de20d6dcb","observation_id":"81426342-a206-4235-9622-0e17160b76f0","resolution":{"observed_at":"2026-08-06T20:48:59.064308Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18965","last_updated":"2025-07-23T13:03:41Z","snapshot_observed_at":"2026-07-06T20:28:52.880548Z","submitted_at":"2025-01-31T08:55:56Z","title":"The Surprising Agreement Between Convex Optimization Theory and Learning-Rate Scheduling for Large Model Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.18965","snapshot_observed_at":"2026-08-06T20:48:53.764373Z","title":"The surprising agreement between convex optimization theory and learning-rate scheduling for large model training","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","snapshot_observed_at":"2026-08-06T20:35:13.610100Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T20:48:53.764373Z"},"links":{"cited_paper":"/paper/2501.18965","citing_paper":"/paper/2507.02119"},"observation_digest":"sha256:7aa73a113d5c5eaba3c0af7b223fafb3e9174003aecd011d62eca5b55e3f9b7a","observation_id":"524ba4f5-5eea-4805-bd48-9394a5ddabe6","resolution":{"observed_at":"2026-08-06T20:48:53.764373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:48:58.616331Z","title":"Ubiquitous abundance distribution of non-dominant plankton across the global ocean","venue":null,"work_id":"5c8b3698-02c2-4f44-9c3c-2bf8388ef02f","year":2018},"citing_paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","snapshot_observed_at":"2026-08-06T20:35:13.610100Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T20:48:53.834070Z"},"links":{"citing_paper":"/paper/2507.02119"},"observation_digest":"sha256:92dddd933fc2275971e6c63ac54b362468617680d744eb985fd592754bd82f08","observation_id":"671b23b1-1324-45fa-af71-19fe0c84092b","resolution":{"observed_at":"2026-08-06T20:48:58.772167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:48:58.317527Z","title":"and Kaplan, J","venue":null,"work_id":"9e1d3430-0c38-4ba6-8049-b2d7561ff4dc","year":2022},"citing_paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","snapshot_observed_at":"2026-08-06T20:35:13.610100Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-06T20:48:53.926114Z"},"links":{"citing_paper":"/paper/2507.02119"},"observation_digest":"sha256:7b764eb5264f616ac2d9971eaab80b402876e26b611de4e337663d897543c5b3","observation_id":"fa376d3b-72b2-4d46-8bf4-f6869b571edc","resolution":{"observed_at":"2026-08-06T20:48:58.494464Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02284","last_updated":"2025-04-10T05:38:41Z","snapshot_observed_at":"2026-08-01T20:35:17.105153Z","submitted_at":"2023-07-05T13:39:02Z","title":"Universal Scaling Laws of Absorbing Phase Transitions in Artificial Deep Neural Networks","version":3},"cited_work":{"arxiv_id":"2307.02284","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.02284","snapshot_observed_at":"2026-08-06T20:48:55.963447Z","title":"Universal Scaling Laws of Absorbing Phase Transitions in Artificial Deep Neural Networks","venue":"stat.ML","work_id":"5ac49b4f-6b38-43c5-a133-202928e84503","year":2023},"citing_paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","snapshot_observed_at":"2026-08-06T20:35:13.610100Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-06T20:48:54.043892Z"},"links":{"cited_paper":"/paper/2307.02284","citing_paper":"/paper/2507.02119"},"observation_digest":"sha256:7d106e271294f37da1c99d1f33f4bcef600a25e6e21a083cc755495f44806393","observation_id":"4091f172-60bd-41e7-a799-b1009cb2f517","resolution":{"observed_at":"2026-08-06T20:48:56.060606Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11029","last_updated":"2024-10-24T17:56:14Z","snapshot_observed_at":"2026-08-06T07:25:53.036005Z","submitted_at":"2024-08-20T17:30:48Z","title":"Scaling Law with Learning Rate Annealing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11029","snapshot_observed_at":"2026-08-06T20:48:54.159538Z","title":"Scaling law with learning rate annealing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","snapshot_observed_at":"2026-08-06T20:35:13.610100Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-06T20:48:54.159538Z"},"links":{"cited_paper":"/paper/2408.11029","citing_paper":"/paper/2507.02119"},"observation_digest":"sha256:cb3bbd8cfdea06dc7fbdfe587b808d88d080c7126dcbbbbca985cf3b9962bf2a","observation_id":"0d53d82b-059b-4a33-be5a-6c88d9f6f97d","resolution":{"observed_at":"2026-08-06T20:48:54.159538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:48:57.997099Z","title":"R., Geiler-Samerotte, K., H \\'e rissant, L., Blundell, J","venue":null,"work_id":"516ff17a-a618-413b-bd0f-bc722c0e72bd","year":2016},"citing_paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","snapshot_observed_at":"2026-08-06T20:35:13.610100Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-06T20:48:54.271428Z"},"links":{"citing_paper":"/paper/2507.02119"},"observation_digest":"sha256:9dfc31a8d7012741b324526f3a2f342fb73ce0c0e1cda794418a0fded312efba","observation_id":"8b73fa26-db25-4502-92c4-30c46691e5dc","resolution":{"observed_at":"2026-08-06T20:48:58.140034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:48:57.665167Z","title":"Feature-learning networks are consistent across widths at realistic scales","venue":null,"work_id":"782df296-b554-45bc-9526-9d56a30cfbd0","year":2023},"citing_paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","snapshot_observed_at":"2026-08-06T20:35:13.610100Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-06T20:48:54.396692Z"},"links":{"citing_paper":"/paper/2507.02119"},"observation_digest":"sha256:f0dee006d4254938eb48fe39259134f0989e0d342340155221b568ac50966fb1","observation_id":"dbb367e9-4461-4699-9c01-b99aa9f5d739","resolution":{"observed_at":"2026-08-06T20:48:57.822552Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.13698","last_updated":"2025-06-01T16:35:40Z","snapshot_observed_at":"2026-07-06T18:17:59.081203Z","submitted_at":"2024-05-22T14:43:02Z","title":"How to set AdamW's weight decay as you scale model and dataset size","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.13698","snapshot_observed_at":"2026-08-06T20:48:54.538611Z","title":"and Aitchison, L","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","snapshot_observed_at":"2026-08-06T20:35:13.610100Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-06T20:48:54.538611Z"},"links":{"cited_paper":"/paper/2405.13698","citing_paper":"/paper/2507.02119"},"observation_digest":"sha256:3ff0aa94d30074ca7052c6333c4ed0409d14da9ca52ece351dbfdb40addd92e4","observation_id":"16c13459-0ce0-4da9-8d2f-dab0399daa4c","resolution":{"observed_at":"2026-08-06T20:48:54.538611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05192","last_updated":"2024-12-02T21:54:54Z","snapshot_observed_at":"2026-07-06T19:29:09.714725Z","submitted_at":"2024-10-07T16:49:39Z","title":"Understanding Warmup-Stable-Decay Learning Rates: A River Valley Loss Landscape Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05192","snapshot_observed_at":"2026-08-06T20:48:54.682273Z","title":"Understanding warmup-stable-decay learning rates: A river valley loss landscape perspective","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","snapshot_observed_at":"2026-08-06T20:35:13.610100Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-06T20:48:54.682273Z"},"links":{"cited_paper":"/paper/2410.05192","citing_paper":"/paper/2507.02119"},"observation_digest":"sha256:03b16b1668ec72c37d703cebaba481f0267cec2a8650e95c7fdf95b82d02d360","observation_id":"8e56a2c6-68f4-468a-b2d3-e557308434b4","resolution":{"observed_at":"2026-08-06T20:48:54.682273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:48:57.435356Z","title":null,"venue":null,"work_id":"ba53343e-cb90-4a57-9362-36118f67fac4","year":1971},"citing_paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","snapshot_observed_at":"2026-08-06T20:35:13.610100Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-06T20:48:54.825321Z"},"links":{"citing_paper":"/paper/2507.02119"},"observation_digest":"sha256:090e37dd0fc01ba9b1cea87cdc4a1c6991d1849b79ebeac06ce8f518c1374e4d","observation_id":"675f7208-5acd-4a1d-bed0-13fa8463fd56","resolution":{"observed_at":"2026-08-06T20:48:57.542119Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14322","last_updated":"2023-10-16T18:43:25Z","snapshot_observed_at":"2026-07-06T16:23:26.584450Z","submitted_at":"2023-09-25T17:48:51Z","title":"Small-scale proxies for large-scale Transformer training instabilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.14322","snapshot_observed_at":"2026-08-06T20:48:54.971531Z","title":"J., Xiao, L., Everett, K., Alemi, A., Adlam, B., Co-Reyes, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","snapshot_observed_at":"2026-08-06T20:35:13.610100Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-06T20:48:54.971531Z"},"links":{"cited_paper":"/paper/2309.14322","citing_paper":"/paper/2507.02119"},"observation_digest":"sha256:fcd44bac45d20111655c963c8982f43c7ea5931f38f8450d47fe7e1c5ccc245a","observation_id":"e268f4b4-f837-49ba-a19f-7c5fdae47cf3","resolution":{"observed_at":"2026-08-06T20:48:54.971531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15156","last_updated":"2025-02-14T04:54:23Z","snapshot_observed_at":"2026-07-06T19:20:32.349889Z","submitted_at":"2024-09-23T16:04:03Z","title":"Rethinking Conventional Wisdom in Machine Learning: From Generalization to Scaling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.15156","snapshot_observed_at":"2026-08-06T20:48:55.089882Z","title":"Rethinking conventional wisdom in machine learning: From generalization to scaling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","snapshot_observed_at":"2026-08-06T20:35:13.610100Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-06T20:48:55.089882Z"},"links":{"cited_paper":"/paper/2409.15156","citing_paper":"/paper/2507.02119"},"observation_digest":"sha256:8cb5ad8eb742973b9c72dc7e87ea8b2cbe74216490834b7f4281101a9fabfdb7","observation_id":"daf49d49-f471-46bf-8352-787c0b0f9991","resolution":{"observed_at":"2026-08-06T20:48:55.089882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:48:57.077929Z","title":"and Hu, E","venue":null,"work_id":"f82ad670-d905-4f2f-8ed5-743c650bb769","year":2021},"citing_paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","snapshot_observed_at":"2026-08-06T20:35:13.610100Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-06T20:48:55.214821Z"},"links":{"citing_paper":"/paper/2507.02119"},"observation_digest":"sha256:8674307a66929da12062d15f45053b7056d8dc8140ce372e6303cad12fde92c4","observation_id":"cf60c245-08c2-470e-b2e2-307e619503a5","resolution":{"observed_at":"2026-08-06T20:48:57.192764Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:48:56.929980Z","title":"and Littwin, E","venue":null,"work_id":"5858b770-6d9e-47bb-a008-0599346fe424","year":2023},"citing_paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","snapshot_observed_at":"2026-08-06T20:35:13.610100Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-06T20:48:55.349785Z"},"links":{"citing_paper":"/paper/2507.02119"},"observation_digest":"sha256:300d555c2dcc5cb683354efa3f10c73098987c0753ac1feeacab2011e64a11f8","observation_id":"6907316e-e6d2-48a5-97e1-881565c4a1ec","resolution":{"observed_at":"2026-08-06T20:48:57.010570Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:48:56.793233Z","title":"J., Babuschkin, I., Sidor, S., Liu, X., Farhi, D., Ryder, N., Pachocki, J., Chen, W., and Gao, J","venue":null,"work_id":"b6b85137-4d94-454d-b2f6-4ce66b36a62b","year":2021},"citing_paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","snapshot_observed_at":"2026-08-06T20:35:13.610100Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-06T20:48:55.507002Z"},"links":{"citing_paper":"/paper/2507.02119"},"observation_digest":"sha256:cbc8eeb815174dc9a83dfb309ed11180b7c1e0404f6a6d003b8d75215ceddbcb","observation_id":"b05f31e8-fb3c-44e1-b053-f8a9f689ea30","resolution":{"observed_at":"2026-08-06T20:48:56.863551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:48:55.635949Z","title":"and Sennrich, R","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","snapshot_observed_at":"2026-08-06T20:35:13.610100Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-06T20:48:55.635949Z"},"links":{"citing_paper":"/paper/2507.02119"},"observation_digest":"sha256:d7d328bfc7121ed836c0d854330a18702b7c77188b577c308bddd7938b6fc3c8","observation_id":"d6b96640-4afb-48c5-a528-1ee0a2da6836","resolution":{"observed_at":"2026-08-06T20:48:55.635949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:48:55.792391Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","snapshot_observed_at":"2026-08-06T20:35:13.610100Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-06T20:48:55.792391Z"},"links":{"citing_paper":"/paper/2507.02119"},"observation_digest":"sha256:5a128b61e69f3e1ebc116ff71464b93296c568bf99aaa1620609cf22b8f8268c","observation_id":"ae15619c-a965-4477-a706-d53476ec9131","resolution":{"observed_at":"2026-08-06T20:48:55.792391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-06T20:35:13.610100Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks"},"reference_resolution":{"displayed":56,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":31,"verified_exact":2,"verified_fuzzy":23},"total_outbound_references":56},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 56 of 56 outbound references and 1 inbound Pith citation observation for arXiv:2507.02119."}