{"as_of":"2026-08-04T20:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f1aaf88ff96b17e4b1a3389d0f23621ce7658216d0506b609fff00d07e40ef3e","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":15,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":15,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":15,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":15,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T15:20:16.153293Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T17:58:46.561911Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2304.09871","last_updated":"2023-04-25T04:48:47Z","snapshot_observed_at":"2026-08-01T21:16:54.439908Z","submitted_at":"2023-04-19T06:15:11Z","title":"A Theory on Adam Instability in Large-Scale Machine Learning","version":2},"cited_work":{"arxiv_id":"2304.09871","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2304.09871","snapshot_observed_at":"2026-07-03T17:58:46.561911Z","title":"Molybog, P","venue":null,"work_id":"3eb50cd8-c781-4c60-bee1-e598dbed9106","year":2023},"citing_paper":{"arxiv_id":"2412.20404","last_updated":"2024-12-29T08:52:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-29T08:52:49Z","title":"Open-Sora: Democratizing Efficient Video Production for All","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-11T12:01:51.366667Z"},"links":{"cited_paper":"/paper/2304.09871","citing_paper":"/paper/2412.20404"},"observation_digest":"sha256:8b8e953150720fdee79c56dc0e886953bc265582cd0967c315c5e68cd8617d82","observation_id":"7a33ac89-6c24-41ec-966f-92f9ae595e57","resolution":{"observed_at":"2026-05-11T12:01:51.910253Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.09871","last_updated":"2023-04-25T04:48:47Z","snapshot_observed_at":"2026-08-01T21:16:54.439908Z","submitted_at":"2023-04-19T06:15:11Z","title":"A Theory on Adam Instability in Large-Scale Machine Learning","version":2},"cited_work":{"arxiv_id":"2304.09871","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2304.09871","snapshot_observed_at":"2026-07-03T17:58:46.561911Z","title":"Molybog, P","venue":null,"work_id":"3eb50cd8-c781-4c60-bee1-e598dbed9106","year":2023},"citing_paper":{"arxiv_id":"2501.07237","last_updated":"2026-04-27T13:03:55Z","snapshot_observed_at":"2026-07-06T20:20:14.452585Z","submitted_at":"2025-01-13T11:35:09Z","title":"GWT: Scalable Optimizer State Compression for Large Language Model Training","version":5},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-23T05:57:09.276224Z"},"links":{"cited_paper":"/paper/2304.09871","citing_paper":"/paper/2501.07237"},"observation_digest":"sha256:99d491b66b33009d0746e88ebdf19388644d599222fca574d5eaccd2de8a336e","observation_id":"727a2f04-a0a2-4150-817c-55135e9601ad","resolution":{"observed_at":"2026-05-23T05:57:36.571046Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.09871","last_updated":"2023-04-25T04:48:47Z","snapshot_observed_at":"2026-08-01T21:16:54.439908Z","submitted_at":"2023-04-19T06:15:11Z","title":"A Theory on Adam Instability in Large-Scale Machine Learning","version":2},"cited_work":{"arxiv_id":"2304.09871","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2304.09871","snapshot_observed_at":"2026-07-03T17:58:46.561911Z","title":"Molybog, P","venue":null,"work_id":"3eb50cd8-c781-4c60-bee1-e598dbed9106","year":2023},"citing_paper":{"arxiv_id":"2505.14683","last_updated":"2025-07-27T11:45:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-20T17:59:30Z","title":"Emerging Properties in Unified Multimodal Pretraining","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-10T16:23:41.854132Z"},"links":{"cited_paper":"/paper/2304.09871","citing_paper":"/paper/2505.14683"},"observation_digest":"sha256:5a935f5c3de1a7f4bba7c7818a4ab750761268412fa1b69daa33cf23f7a7e72c","observation_id":"5e355aed-54ed-489a-b66e-e6d8bbc94de5","resolution":{"observed_at":"2026-05-10T16:23:42.174655Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.09871","last_updated":"2023-04-25T04:48:47Z","snapshot_observed_at":"2026-08-01T21:16:54.439908Z","submitted_at":"2023-04-19T06:15:11Z","title":"A Theory on Adam Instability in Large-Scale Machine Learning","version":2},"cited_work":{"arxiv_id":"2304.09871","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2304.09871","snapshot_observed_at":"2026-07-03T17:58:46.561911Z","title":"Molybog, P","venue":null,"work_id":"3eb50cd8-c781-4c60-bee1-e598dbed9106","year":2023},"citing_paper":{"arxiv_id":"2506.13585","last_updated":"2025-06-16T15:08:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-16T15:08:02Z","title":"MiniMax-M1: Scaling Test-Time Compute Efficiently with Lightning Attention","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-12T09:28:16.189617Z"},"links":{"cited_paper":"/paper/2304.09871","citing_paper":"/paper/2506.13585"},"observation_digest":"sha256:02b4d3f2198a6ddb940c2b8a9312801a2b16e12d7b12649076a2e254a6d068b5","observation_id":"65ff9138-aa07-45f5-819a-2f8d2b8f82d2","resolution":{"observed_at":"2026-05-12T09:28:16.436746Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.09871","last_updated":"2023-04-25T04:48:47Z","snapshot_observed_at":"2026-08-01T21:16:54.439908Z","submitted_at":"2023-04-19T06:15:11Z","title":"A Theory on Adam Instability in Large-Scale Machine Learning","version":2},"cited_work":{"arxiv_id":"2304.09871","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2304.09871","snapshot_observed_at":"2026-07-03T17:58:46.561911Z","title":"Molybog, P","venue":null,"work_id":"3eb50cd8-c781-4c60-bee1-e598dbed9106","year":2023},"citing_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-05-19T05:48:02.828938Z"},"links":{"cited_paper":"/paper/2304.09871","citing_paper":"/paper/2507.06261"},"observation_digest":"sha256:726526d71ddb183475cfe44b948b2abcd21d47a8dbe97209628833a4b672f1fb","observation_id":"1cce8f6d-0731-434a-8d6e-ad40ad447574","resolution":{"observed_at":"2026-05-19T05:52:07.741814Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.09871","last_updated":"2023-04-25T04:48:47Z","snapshot_observed_at":"2026-08-01T21:16:54.439908Z","submitted_at":"2023-04-19T06:15:11Z","title":"A Theory on Adam Instability in Large-Scale Machine Learning","version":2},"cited_work":{"arxiv_id":"2304.09871","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2304.09871","snapshot_observed_at":"2026-07-03T17:58:46.561911Z","title":"Molybog, P","venue":null,"work_id":"3eb50cd8-c781-4c60-bee1-e598dbed9106","year":2023},"citing_paper":{"arxiv_id":"2510.04212","last_updated":"2026-04-18T01:36:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-05T14:01:24Z","title":"Why Low-Precision Transformer Training Fails: An Analysis on Flash Attention","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-18T10:01:56.131253Z"},"links":{"cited_paper":"/paper/2304.09871","citing_paper":"/paper/2510.04212"},"observation_digest":"sha256:9df8e32b7477720e80420c32cba1549b2fc0ecee6a10218d23d33e9a6b81d95f","observation_id":"89f76f7b-7d55-4d47-bbd3-2d7e6cf46b53","resolution":{"observed_at":"2026-05-18T10:02:31.691756Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.09871","last_updated":"2023-04-25T04:48:47Z","snapshot_observed_at":"2026-08-01T21:16:54.439908Z","submitted_at":"2023-04-19T06:15:11Z","title":"A Theory on Adam Instability in Large-Scale Machine Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.09871","snapshot_observed_at":"2026-08-04T09:54:26.229865Z","title":"A theory on adam instability in large- scale machine learning.arXiv preprint arXiv:2304.09871,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.12784","last_updated":"2026-06-28T11:09:54Z","snapshot_observed_at":"2026-08-04T09:54:23.338683Z","submitted_at":"2025-10-14T17:56:11Z","title":"SRUM: Fine-Grained Self-Rewarding for Unified Multimodal Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T09:54:26.229865Z"},"links":{"cited_paper":"/paper/2304.09871","citing_paper":"/paper/2510.12784"},"observation_digest":"sha256:e1dbb9bda411307b306ebb8a3d67f7fcce8ce60e2e24dcecd4c87981adad1361","observation_id":"69d936c1-0a4b-4c8d-a1ed-c26e1e006dbd","resolution":{"observed_at":"2026-08-04T09:54:26.229865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.09871","last_updated":"2023-04-25T04:48:47Z","snapshot_observed_at":"2026-08-01T21:16:54.439908Z","submitted_at":"2023-04-19T06:15:11Z","title":"A Theory on Adam Instability in Large-Scale Machine Learning","version":2},"cited_work":{"arxiv_id":"2304.09871","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2304.09871","snapshot_observed_at":"2026-07-03T17:58:46.561911Z","title":"Molybog, P","venue":null,"work_id":"3eb50cd8-c781-4c60-bee1-e598dbed9106","year":2023},"citing_paper":{"arxiv_id":"2605.06152","last_updated":"2026-05-26T10:55:47Z","snapshot_observed_at":"2026-08-03T10:09:25.526337Z","submitted_at":"2026-05-07T12:45:21Z","title":"Grokking or Glitching? How Low-Precision Drives Slingshot Loss Spikes","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-08T13:40:34.426011Z"},"links":{"cited_paper":"/paper/2304.09871","citing_paper":"/paper/2605.06152"},"observation_digest":"sha256:41170a40d49b192c2db12a791c773f5c77fb1c48473babbbcde106e252cd1aa6","observation_id":"0010ad04-dffd-4a2e-9e32-734603c76f76","resolution":{"observed_at":"2026-05-11T18:51:07.706844Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.09871","last_updated":"2023-04-25T04:48:47Z","snapshot_observed_at":"2026-08-01T21:16:54.439908Z","submitted_at":"2023-04-19T06:15:11Z","title":"A Theory on Adam Instability in Large-Scale Machine Learning","version":2},"cited_work":{"arxiv_id":"2304.09871","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2304.09871","snapshot_observed_at":"2026-07-03T17:58:46.561911Z","title":"Molybog, P","venue":null,"work_id":"3eb50cd8-c781-4c60-bee1-e598dbed9106","year":2023},"citing_paper":{"arxiv_id":"2605.06152","last_updated":"2026-05-26T10:55:47Z","snapshot_observed_at":"2026-08-03T10:09:25.526337Z","submitted_at":"2026-05-07T12:45:21Z","title":"Grokking or Glitching? How Low-Precision Drives Slingshot Loss Spikes","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-13T07:11:04.242477Z"},"links":{"cited_paper":"/paper/2304.09871","citing_paper":"/paper/2605.06152"},"observation_digest":"sha256:2c103804288aa69fcb77ca1f22b363b9aab1009d060b6959bf88da6eef48f68d","observation_id":"e7a1767b-089d-41a6-a40e-94209f7887dd","resolution":{"observed_at":"2026-05-13T07:12:27.956242Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.09871","last_updated":"2023-04-25T04:48:47Z","snapshot_observed_at":"2026-08-01T21:16:54.439908Z","submitted_at":"2023-04-19T06:15:11Z","title":"A Theory on Adam Instability in Large-Scale Machine Learning","version":2},"cited_work":{"arxiv_id":"2304.09871","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2304.09871","snapshot_observed_at":"2026-07-03T17:58:46.561911Z","title":"Molybog, P","venue":null,"work_id":"3eb50cd8-c781-4c60-bee1-e598dbed9106","year":2023},"citing_paper":{"arxiv_id":"2605.06152","last_updated":"2026-05-26T10:55:47Z","snapshot_observed_at":"2026-08-03T10:09:25.526337Z","submitted_at":"2026-05-07T12:45:21Z","title":"Grokking or Glitching? How Low-Precision Drives Slingshot Loss Spikes","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-30T23:33:31.271082Z"},"links":{"cited_paper":"/paper/2304.09871","citing_paper":"/paper/2605.06152"},"observation_digest":"sha256:af867f2c5b47eb1836b376d8cacca9b3316671aa874f72ede729dea4b43befbb","observation_id":"a0839373-1ea1-4b56-a250-ec18a8ab4ae6","resolution":{"observed_at":"2026-06-30T23:35:07.177922Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.09871","last_updated":"2023-04-25T04:48:47Z","snapshot_observed_at":"2026-08-01T21:16:54.439908Z","submitted_at":"2023-04-19T06:15:11Z","title":"A Theory on Adam Instability in Large-Scale Machine Learning","version":2},"cited_work":{"arxiv_id":"2304.09871","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2304.09871","snapshot_observed_at":"2026-07-03T17:58:46.561911Z","title":"Molybog, P","venue":null,"work_id":"3eb50cd8-c781-4c60-bee1-e598dbed9106","year":2023},"citing_paper":{"arxiv_id":"2605.09176","last_updated":"2026-05-09T21:34:28Z","snapshot_observed_at":"2026-07-06T23:21:16.454273Z","submitted_at":"2026-05-09T21:34:28Z","title":"Navigating LLM Valley: From AdamW to Memory-Efficient and Matrix-Based Optimizers","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-12T04:01:32.057022Z"},"links":{"cited_paper":"/paper/2304.09871","citing_paper":"/paper/2605.09176"},"observation_digest":"sha256:24a4b42bba6203c9683fa3f070a812c89ec570702cdf5d2608a9d66763389167","observation_id":"f05c12b8-8e3f-4fd5-9ca6-6aad744bc447","resolution":{"observed_at":"2026-05-12T06:41:45.364071Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.09871","last_updated":"2023-04-25T04:48:47Z","snapshot_observed_at":"2026-08-01T21:16:54.439908Z","submitted_at":"2023-04-19T06:15:11Z","title":"A Theory on Adam Instability in Large-Scale Machine Learning","version":2},"cited_work":{"arxiv_id":"2304.09871","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2304.09871","snapshot_observed_at":"2026-07-03T17:58:46.561911Z","title":"Molybog, P","venue":null,"work_id":"3eb50cd8-c781-4c60-bee1-e598dbed9106","year":2023},"citing_paper":{"arxiv_id":"2605.25704","last_updated":"2026-05-25T11:02:05Z","snapshot_observed_at":"2026-07-06T23:35:36.158984Z","submitted_at":"2026-05-25T11:02:05Z","title":"PowLU: An Activation Function for Stable Pre-Training of LLMs","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-29T21:48:45.339523Z"},"links":{"cited_paper":"/paper/2304.09871","citing_paper":"/paper/2605.25704"},"observation_digest":"sha256:948718f8b7c5afdc12e7610e639def0751d8989b801b846ee8c70204cbdb5744","observation_id":"c2fef1fe-201a-4872-9993-551dc61a4c9c","resolution":{"observed_at":"2026-06-29T21:53:59.472017Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.09871","last_updated":"2023-04-25T04:48:47Z","snapshot_observed_at":"2026-08-01T21:16:54.439908Z","submitted_at":"2023-04-19T06:15:11Z","title":"A Theory on Adam Instability in Large-Scale Machine Learning","version":2},"cited_work":{"arxiv_id":"2304.09871","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2304.09871","snapshot_observed_at":"2026-07-03T17:58:46.561911Z","title":"Molybog, P","venue":null,"work_id":"3eb50cd8-c781-4c60-bee1-e598dbed9106","year":2023},"citing_paper":{"arxiv_id":"2607.01678","last_updated":"2026-07-02T04:10:42Z","snapshot_observed_at":"2026-07-07T00:07:13.555571Z","submitted_at":"2026-07-02T04:10:42Z","title":"SCAPE: Accurate and Efficient LLM Training with Extreme Sparse Communication","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-03T17:56:52.510949Z"},"links":{"cited_paper":"/paper/2304.09871","citing_paper":"/paper/2607.01678"},"observation_digest":"sha256:46e285793f5b0ef36dc76287bbd7e4c7076d07462c2622a5c9689ff340044456","observation_id":"1f6851aa-1254-4e80-86e8-65ba957d359c","resolution":{"observed_at":"2026-07-03T17:58:46.564385Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.09871","last_updated":"2023-04-25T04:48:47Z","snapshot_observed_at":"2026-08-01T21:16:54.439908Z","submitted_at":"2023-04-19T06:15:11Z","title":"A Theory on Adam Instability in Large-Scale Machine Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.09871","snapshot_observed_at":"2026-08-01T08:50:45.390519Z","title":"arXiv preprint arXiv:2304.09871 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21005","last_updated":"2026-07-23T07:39:03Z","snapshot_observed_at":"2026-08-03T21:09:33.535500Z","submitted_at":"2026-07-23T07:39:03Z","title":"Weight-norm Criticality: A Mechanism for Loss Spikes Induced by the Normalization and Weight Decay","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-01T08:50:45.390519Z"},"links":{"cited_paper":"/paper/2304.09871","citing_paper":"/paper/2607.21005"},"observation_digest":"sha256:b9145b83a655892801778cced11f26c856eaeeae01b2e044be1706960b143ee5","observation_id":"2279d5e6-0658-4bb4-80f7-9d0c7e81dbb5","resolution":{"observed_at":"2026-08-01T08:50:45.390519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.09871","last_updated":"2023-04-25T04:48:47Z","snapshot_observed_at":"2026-08-01T21:16:54.439908Z","submitted_at":"2023-04-19T06:15:11Z","title":"A Theory on Adam Instability in Large-Scale Machine Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.09871","snapshot_observed_at":"2026-08-04T15:20:16.153293Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02091","last_updated":"2026-08-03T11:50:06Z","snapshot_observed_at":"2026-08-04T20:22:12.255038Z","submitted_at":"2026-08-03T11:50:06Z","title":"One QK Channel, Many Sources: Guarding Low-Precision Attention Collapse","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-04T15:20:16.153293Z"},"links":{"cited_paper":"/paper/2304.09871","citing_paper":"/paper/2608.02091"},"observation_digest":"sha256:8ef157e6172e70dc877cf2bbce6cb821a3bb5db39a87b7d6e23063caafe66c1f","observation_id":"a88a8d50-ca31-4335-b80d-d67f365b3321","resolution":{"observed_at":"2026-08-04T15:20:16.153293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2304.09871/citation-record","integrity":"/paper/2304.09871/integrity","json":"/paper/2304.09871/citation-record.json","paper":"/paper/2304.09871"},"outbound":[],"paper":{"arxiv_id":"2304.09871","last_updated":"2023-04-25T04:48:47Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-01T21:16:54.439908Z","submitted_at":"2023-04-19T06:15:11Z","title":"A Theory on Adam Instability in Large-Scale Machine Learning"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 15 inbound Pith citation observations for arXiv:2304.09871."}