{"as_of":"2026-08-04T09:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a1f202adb1ab359f8be4d1178bd2bfc6dbc9475945d89d8077d36083794d9630","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":7,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":7,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":7,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T03:02:01.026199Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T23:59:07.430461Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2410.21676","last_updated":"2025-04-21T04:19:56Z","snapshot_observed_at":"2026-07-06T19:41:15.267950Z","submitted_at":"2024-10-29T02:54:06Z","title":"How Does Critical Batch Size Scale in Pre-training?","version":4},"cited_work":{"arxiv_id":"2410.21676","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.21676","snapshot_observed_at":"2026-07-03T23:59:07.430461Z","title":"Zhang, D","venue":null,"work_id":"ff070f01-8558-4662-ade8-c1a10ea2423f","year":2024},"citing_paper":{"arxiv_id":"2605.09154","last_updated":"2026-05-09T20:35:09Z","snapshot_observed_at":"2026-07-06T23:21:16.454273Z","submitted_at":"2026-05-09T20:35:09Z","title":"Predicting Large Model Test Losses with a Noisy Quadratic System","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-05-12T04:40:05.006583Z"},"links":{"cited_paper":"/paper/2410.21676","citing_paper":"/paper/2605.09154"},"observation_digest":"sha256:bd2b806f9ce8a4b291b027360b3d04ba83c4fa9da90644176556cbf77c03e590","observation_id":"9db54e40-6023-4347-b63c-506c461349fc","resolution":{"observed_at":"2026-05-12T06:01:25.573125Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21676","last_updated":"2025-04-21T04:19:56Z","snapshot_observed_at":"2026-07-06T19:41:15.267950Z","submitted_at":"2024-10-29T02:54:06Z","title":"How Does Critical Batch Size Scale in Pre-training?","version":4},"cited_work":{"arxiv_id":"2410.21676","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.21676","snapshot_observed_at":"2026-07-03T23:59:07.430461Z","title":"Zhang, D","venue":null,"work_id":"ff070f01-8558-4662-ade8-c1a10ea2423f","year":2024},"citing_paper":{"arxiv_id":"2605.11215","last_updated":"2026-05-22T00:14:51Z","snapshot_observed_at":"2026-07-06T23:23:06.755816Z","submitted_at":"2026-05-11T20:28:31Z","title":"ReCoVer: Resilient LLM Pre-Training System via Fault-Tolerant Collective and Versatile Workload","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-13T01:59:28.408860Z"},"links":{"cited_paper":"/paper/2410.21676","citing_paper":"/paper/2605.11215"},"observation_digest":"sha256:c55c6f0c01b49151df0429c66e19654371f2b9ec12892b78e24dd8c08488f81a","observation_id":"e4dfbb5e-9efa-42c3-9c40-a3717612f892","resolution":{"observed_at":"2026-05-13T02:02:06.468306Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21676","last_updated":"2025-04-21T04:19:56Z","snapshot_observed_at":"2026-07-06T19:41:15.267950Z","submitted_at":"2024-10-29T02:54:06Z","title":"How Does Critical Batch Size Scale in Pre-training?","version":4},"cited_work":{"arxiv_id":"2410.21676","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.21676","snapshot_observed_at":"2026-07-03T23:59:07.430461Z","title":"Zhang, D","venue":null,"work_id":"ff070f01-8558-4662-ade8-c1a10ea2423f","year":2024},"citing_paper":{"arxiv_id":"2605.11215","last_updated":"2026-05-22T00:14:51Z","snapshot_observed_at":"2026-07-06T23:23:06.755816Z","submitted_at":"2026-05-11T20:28:31Z","title":"ReCoVer: Resilient LLM Pre-Training System via Fault-Tolerant Collective and Versatile Workload","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-25T05:52:30.402478Z"},"links":{"cited_paper":"/paper/2410.21676","citing_paper":"/paper/2605.11215"},"observation_digest":"sha256:92f10e83858d0a275f9013c2bab97e04a286bd4fa07a9b17185b5b3a098e4963","observation_id":"144ac853-5870-4d81-9e16-c5c21cdf1c26","resolution":{"observed_at":"2026-05-25T05:55:24.625480Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21676","last_updated":"2025-04-21T04:19:56Z","snapshot_observed_at":"2026-07-06T19:41:15.267950Z","submitted_at":"2024-10-29T02:54:06Z","title":"How Does Critical Batch Size Scale in Pre-training?","version":4},"cited_work":{"arxiv_id":"2410.21676","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.21676","snapshot_observed_at":"2026-07-03T23:59:07.430461Z","title":"Zhang, D","venue":null,"work_id":"ff070f01-8558-4662-ade8-c1a10ea2423f","year":2024},"citing_paper":{"arxiv_id":"2605.19095","last_updated":"2026-05-18T20:31:49Z","snapshot_observed_at":"2026-07-06T23:29:52.061489Z","submitted_at":"2026-05-18T20:31:49Z","title":"ScheduleFree+: Scaling Learning-Rate-Free & Schedule-Free Learning to Large Language Models","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-05-20T12:22:30.263086Z"},"links":{"cited_paper":"/paper/2410.21676","citing_paper":"/paper/2605.19095"},"observation_digest":"sha256:2e0d7fbbfa443ad112c67a047b4a650bf73dad6e07453bd017d05906e5aad796","observation_id":"dcfc156b-b9a1-4849-a977-f084f4a441a1","resolution":{"observed_at":"2026-05-20T12:23:16.775669Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21676","last_updated":"2025-04-21T04:19:56Z","snapshot_observed_at":"2026-07-06T19:41:15.267950Z","submitted_at":"2024-10-29T02:54:06Z","title":"How Does Critical Batch Size Scale in Pre-training?","version":4},"cited_work":{"arxiv_id":"2410.21676","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.21676","snapshot_observed_at":"2026-07-03T23:59:07.430461Z","title":"Zhang, D","venue":null,"work_id":"ff070f01-8558-4662-ade8-c1a10ea2423f","year":2024},"citing_paper":{"arxiv_id":"2606.19179","last_updated":"2026-06-17T15:19:20Z","snapshot_observed_at":"2026-08-02T17:17:56.626421Z","submitted_at":"2026-06-17T15:19:20Z","title":"Compute Efficiency and Serial Runtime Tradeoffs for Stochastic Momentum Methods","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-26T21:31:49.871520Z"},"links":{"cited_paper":"/paper/2410.21676","citing_paper":"/paper/2606.19179"},"observation_digest":"sha256:e8d7ba2e0c61157d2a2ee8c7509495f18354cb0fe64ef072e47815be9a16f047","observation_id":"7e7692b0-c2a6-4ad9-9bb0-d8a88d208115","resolution":{"observed_at":"2026-07-03T23:59:07.432881Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21676","last_updated":"2025-04-21T04:19:56Z","snapshot_observed_at":"2026-07-06T19:41:15.267950Z","submitted_at":"2024-10-29T02:54:06Z","title":"How Does Critical Batch Size Scale in Pre-training?","version":4},"cited_work":{"arxiv_id":"2410.21676","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.21676","snapshot_observed_at":"2026-07-03T23:59:07.430461Z","title":"Zhang, D","venue":null,"work_id":"ff070f01-8558-4662-ade8-c1a10ea2423f","year":2024},"citing_paper":{"arxiv_id":"2606.30634","last_updated":"2026-06-29T17:57:50Z","snapshot_observed_at":"2026-08-02T16:54:35.399479Z","submitted_at":"2026-06-29T17:57:50Z","title":"One-Step Gradient Delay is Not a Barrier for Large-Scale Asynchronous Pipeline Parallel LLM Pretraining","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-30T06:41:55.732230Z"},"links":{"cited_paper":"/paper/2410.21676","citing_paper":"/paper/2606.30634"},"observation_digest":"sha256:093adb0c3ed98c4cb7e17caea5d9429163288e9dcca0bb3148d71c6be16e9ce9","observation_id":"0a6b880c-f5b9-4eb1-9285-6969038660ea","resolution":{"observed_at":"2026-06-30T06:44:18.850288Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21676","last_updated":"2025-04-21T04:19:56Z","snapshot_observed_at":"2026-07-06T19:41:15.267950Z","submitted_at":"2024-10-29T02:54:06Z","title":"How Does Critical Batch Size Scale in Pre-training?","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21676","snapshot_observed_at":"2026-08-01T03:02:01.026199Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25271","last_updated":"2026-07-28T04:18:49Z","snapshot_observed_at":"2026-08-03T13:49:38.726720Z","submitted_at":"2026-07-28T04:18:49Z","title":"Bridging Compute- and Data-Optimal Pretraining","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-01T03:02:01.026199Z"},"links":{"cited_paper":"/paper/2410.21676","citing_paper":"/paper/2607.25271"},"observation_digest":"sha256:75550ee05a161bb5f9a9d57b6accd9e25002b7c732db1748306999c0df28a7b2","observation_id":"4b332e82-0af7-4de7-a849-44aa9359d05d","resolution":{"observed_at":"2026-08-01T03:02:01.026199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2410.21676/citation-record","integrity":"/paper/2410.21676/integrity","json":"/paper/2410.21676/citation-record.json","paper":"/paper/2410.21676"},"outbound":[],"paper":{"arxiv_id":"2410.21676","last_updated":"2025-04-21T04:19:56Z","latest_version":4,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T19:41:15.267950Z","submitted_at":"2024-10-29T02:54:06Z","title":"How Does Critical Batch Size Scale in Pre-training?"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 7 inbound Pith citation observations for arXiv:2410.21676."}