{"as_of":"2026-08-03T04:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6fd29da6cb7cae7ce5a0446bb476db0730fef391d5b2f621c579eada28de0348","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-18T10:01:56.131253Z","state":"measured"},{"denominator":39,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":39,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-02T06:30:47.504484+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T07:54:47.068638Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2510.04212","last_updated":"2026-04-18T01:36:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-05T14:01:24Z","title":"Why Low-Precision Transformer Training Fails: An Analysis on Flash Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.04212","snapshot_observed_at":"2026-07-14T15:32:26.691504Z","title":"Why low-precision transformer training fails: an analysis on flash atten- tion,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.09800","last_updated":"2026-07-28T02:32:08Z","snapshot_observed_at":"2026-08-02T07:54:44.716900Z","submitted_at":"2026-07-09T15:23:42Z","title":"Reference Traces for Auditing Invisible Weight Updates and Guiding Exact-Budget Protection","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-14T15:32:26.691504Z"},"links":{"cited_paper":"/paper/2510.04212","citing_paper":"/paper/2607.09800"},"observation_digest":"sha256:c854fc300eefe640ef0d8163a2ac8cfa5831479a6de14eb474ab92bcb0105412","observation_id":"d8e3f90e-889b-4d2a-94c3-39e22dfc17bc","resolution":{"observed_at":"2026-07-14T15:32:26.691504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.04212","last_updated":"2026-04-18T01:36:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-05T14:01:24Z","title":"Why Low-Precision Transformer Training Fails: An Analysis on Flash Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.04212","snapshot_observed_at":"2026-08-02T07:54:47.068638Z","title":"Why low-precision transformer training fails: An analysis on flash attention","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.09800","last_updated":"2026-07-28T02:32:08Z","snapshot_observed_at":"2026-08-02T07:54:44.716900Z","submitted_at":"2026-07-09T15:23:42Z","title":"Reference Traces for Auditing Invisible Weight Updates and Guiding Exact-Budget Protection","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-02T07:54:47.068638Z"},"links":{"cited_paper":"/paper/2510.04212","citing_paper":"/paper/2607.09800"},"observation_digest":"sha256:375a404f953dc47cf1352653432b559941c379454bca18c3488f1b79dc7356e7","observation_id":"ab61e964-02b0-4497-874c-767d0fae2e8b","resolution":{"observed_at":"2026-08-02T07:54:47.068638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.04212","last_updated":"2026-04-18T01:36:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-05T14:01:24Z","title":"Why Low-Precision Transformer Training Fails: An Analysis on Flash Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.04212","snapshot_observed_at":"2026-08-01T11:54:35.779079Z","title":"Qiu and Q","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.19771","last_updated":"2026-07-22T05:39:00Z","snapshot_observed_at":"2026-08-01T11:54:33.566920Z","submitted_at":"2026-07-22T05:39:00Z","title":"An Isotropy-Preserving Spectral Cap for Muon: Theory and Three Case Studies","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T11:54:35.779079Z"},"links":{"cited_paper":"/paper/2510.04212","citing_paper":"/paper/2607.19771"},"observation_digest":"sha256:31e4bd0bd2fcbfc0b93b7ecdf7d6d0094473d8c9de0b859c897babffa47c0ea3","observation_id":"55e5c0eb-4757-49d1-9eb8-3d238c96c5ab","resolution":{"observed_at":"2026-08-01T11:54:35.779079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.04212","last_updated":"2026-04-18T01:36:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-05T14:01:24Z","title":"Why Low-Precision Transformer Training Fails: An Analysis on Flash Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.04212","snapshot_observed_at":"2026-08-01T02:20:39.957037Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.25494","last_updated":"2026-07-28T09:31:17Z","snapshot_observed_at":"2026-08-03T02:57:49.564757Z","submitted_at":"2026-07-28T09:31:17Z","title":"Automated Numerical Stability Analysis of Deep Learning Operators","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-01T02:20:39.957037Z"},"links":{"cited_paper":"/paper/2510.04212","citing_paper":"/paper/2607.25494"},"observation_digest":"sha256:dae3f549d21c536e02fff14c2e6d7989823192e1f8f07d722988db1abecec798","observation_id":"f11b71b5-ce65-43a5-9ff8-5b4734344cb7","resolution":{"observed_at":"2026-08-01T02:20:39.957037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2510.04212/citation-record","integrity":"/paper/2510.04212/integrity","json":"/paper/2510.04212/citation-record.json","paper":"/paper/2510.04212"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2407.17353","last_updated":"2024-07-24T15:26:01Z","snapshot_observed_at":"2026-07-31T14:43:17.904917Z","submitted_at":"2024-07-24T15:26:01Z","title":"Scalify: scale propagation for efficient low-precision LLM training","version":1},"cited_work":{"arxiv_id":"2407.17353","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.17353","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scalify: scale propagation for efficient low-precision llm training.arXiv preprint arXiv:2407.17353","venue":null,"work_id":"0feb4a58-8d98-4b7d-a867-c4a42b0f1230","year":null},"citing_paper":{"arxiv_id":"2510.04212","last_updated":"2026-04-18T01:36:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-05T14:01:24Z","title":"Why Low-Precision Transformer Training Fails: An Analysis on Flash Attention","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-18T10:01:56.131253Z"},"links":{"cited_paper":"/paper/2407.17353","citing_paper":"/paper/2510.04212"},"observation_digest":"sha256:b433e2d57cd9f8b8c4a6144a7dc568e34ae598fa53408bc119b05eaa34398aa0","observation_id":"84ef2b0d-6d00-4360-8707-47ea35c43375","resolution":{"observed_at":"2026-05-18T10:02:31.677451Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17465","last_updated":"2025-01-10T14:22:02Z","snapshot_observed_at":"2026-07-06T18:51:28.182977Z","submitted_at":"2024-07-24T17:58:42Z","title":"u-$\\mu$P: The Unit-Scaled Maximal Update Parametrization","version":3},"cited_work":{"arxiv_id":"2407.17465","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.17465","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"u-µp: The unit- scaled maximal update parametrization.arXiv preprint arXiv:2407.17465","venue":null,"work_id":"ceefab8a-2f82-4c5c-9707-1b9ca6fcbc6b","year":null},"citing_paper":{"arxiv_id":"2510.04212","last_updated":"2026-04-18T01:36:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-05T14:01:24Z","title":"Why Low-Precision Transformer Training Fails: An Analysis on Flash Attention","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-18T10:01:56.131253Z"},"links":{"cited_paper":"/paper/2407.17465","citing_paper":"/paper/2510.04212"},"observation_digest":"sha256:625fe9d70727de67d4266ab0eeea0be77a43ec01b576a902825198718055d959","observation_id":"c8ce8386-332b-4824-a827-d4101c1410d5","resolution":{"observed_at":"2026-05-18T10:02:31.733884Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T14:57:14.742120Z","title":"Language models are few-shot learners.Advances in neural information processing systems, 33:1877–1901","venue":null,"work_id":"84780adb-76cf-44ac-a8b7-e24d4fa5c592","year":1901},"citing_paper":{"arxiv_id":"2510.04212","last_updated":"2026-04-18T01:36:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-05T14:01:24Z","title":"Why Low-Precision Transformer Training Fails: An Analysis on Flash Attention","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-18T10:01:56.131253Z"},"links":{"citing_paper":"/paper/2510.04212"},"observation_digest":"sha256:bce2a07199c686059b69d135fd3b389005437c61d0a76acdcbab59678147de59","observation_id":"acad3c74-c1c2-4dc6-bcbf-cf9f912f814c","resolution":{"observed_at":"2026-05-18T10:02:31.810103Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12517","last_updated":"2025-02-10T09:37:59Z","snapshot_observed_at":"2026-07-06T19:18:00.304916Z","submitted_at":"2024-09-19T07:15:58Z","title":"Scaling FP8 training to trillion-token LLMs","version":2},"cited_work":{"arxiv_id":"2409.12517","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.12517","snapshot_observed_at":"2026-07-03T07:27:44.431731Z","title":"Scaling FP8 Training to Trillion- Token LLMs","venue":null,"work_id":"67213178-57f3-4231-9e3e-3545902d31de","year":2024},"citing_paper":{"arxiv_id":"2510.04212","last_updated":"2026-04-18T01:36:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-05T14:01:24Z","title":"Why Low-Precision Transformer Training Fails: An Analysis on Flash Attention","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-18T10:01:56.131253Z"},"links":{"cited_paper":"/paper/2409.12517","citing_paper":"/paper/2510.04212"},"observation_digest":"sha256:79bddcd718a0eaded3f3abc00e3c7eccb933d27ca172280c6a5b6efa55351618","observation_id":"2747e26a-663e-407e-9239-46432204b867","resolution":{"observed_at":"2026-05-18T10:02:31.710568Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Aaron Gokaslan, Vanya Cohen, Ellie Pavlick, and Stefanie Tellex","venue":null,"work_id":"24ce4a00-5065-4018-8ad7-94215dc5b639","year":2025},"citing_paper":{"arxiv_id":"2510.04212","last_updated":"2026-04-18T01:36:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-05T14:01:24Z","title":"Why Low-Precision Transformer Training Fails: An Analysis on Flash Attention","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-18T10:01:56.131253Z"},"links":{"citing_paper":"/paper/2510.04212"},"observation_digest":"sha256:0bfa48c5403a62123914a6e00d0fe11b79b144fc7c624ea1a693a2c82a663cd8","observation_id":"a45bdfba-62a7-40cd-8e79-c5196ab742e5","resolution":{"observed_at":"2026-05-18T10:02:31.806824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.02803","last_updated":"2024-05-05T03:25:25Z","snapshot_observed_at":"2026-07-06T18:09:55.249620Z","submitted_at":"2024-05-05T03:25:25Z","title":"Is Flash Attention Stable?","version":1},"cited_work":{"arxiv_id":"2405.02803","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.02803","snapshot_observed_at":"2026-07-03T05:07:38.312172Z","title":"Is flash attention stable?","venue":null,"work_id":"e4a589ee-4499-4492-bb04-3ebb3ea0233d","year":2024},"citing_paper":{"arxiv_id":"2510.04212","last_updated":"2026-04-18T01:36:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-05T14:01:24Z","title":"Why Low-Precision Transformer Training Fails: An Analysis on Flash Attention","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-18T10:01:56.131253Z"},"links":{"cited_paper":"/paper/2405.02803","citing_paper":"/paper/2510.04212"},"observation_digest":"sha256:59b857fe4e28d76b34859330afb6ee9531898036ce75780ed3d5bc492309ac17","observation_id":"0a266c88-bd65-4dac-bdbe-67731ecbcadc","resolution":{"observed_at":"2026-05-18T10:02:31.719792Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.01043","last_updated":"2026-07-29T08:00:39Z","snapshot_observed_at":"2026-08-01T23:12:36.493428Z","submitted_at":"2025-05-02T06:33:25Z","title":"Low-Precision Training of Large Language Models: Methods, Challenges, and Opportunities","version":2},"cited_work":{"arxiv_id":"2505.01043","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.01043","snapshot_observed_at":"2026-07-30T01:18:51.459998Z","title":"Low-precision training of large language models: Methods, challenges, and opportunities","venue":null,"work_id":"bf4a3b3b-fb8b-47f4-bc34-9c5da16141a0","year":2025},"citing_paper":{"arxiv_id":"2510.04212","last_updated":"2026-04-18T01:36:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-05T14:01:24Z","title":"Why Low-Precision Transformer Training Fails: An Analysis on Flash Attention","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-18T10:01:56.131253Z"},"links":{"cited_paper":"/paper/2505.01043","citing_paper":"/paper/2510.04212"},"observation_digest":"sha256:d4ab36e2cc8b0b34436c039b5a84306e727486038ff5e5d4ffb112532244a056","observation_id":"51ef9cb5-1de1-4065-b39d-0102ff8bb07f","resolution":{"observed_at":"2026-07-30T01:18:51.459998Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.04245","last_updated":"2020-10-08T20:12:35Z","snapshot_observed_at":"2026-07-06T10:02:48.167825Z","submitted_at":"2020-10-08T20:12:35Z","title":"Query-Key Normalization for Transformers","version":1},"cited_work":{"arxiv_id":"2010.04245","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2010.04245","snapshot_observed_at":"2026-07-04T14:19:53.801066Z","title":"Query-key normal- ization for transformers","venue":null,"work_id":"df170a47-09f7-49ba-b2e5-6493efa0a095","year":2020},"citing_paper":{"arxiv_id":"2510.04212","last_updated":"2026-04-18T01:36:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-05T14:01:24Z","title":"Why Low-Precision Transformer Training Fails: An Analysis on Flash Attention","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-18T10:01:56.131253Z"},"links":{"cited_paper":"/paper/2010.04245","citing_paper":"/paper/2510.04212"},"observation_digest":"sha256:02bf01b1b34b9568fc97ce204da12748914bf88ea41ae3ced02745fd017d6225","observation_id":"cc065a55-4627-413b-9d94-158782c9e583","resolution":{"observed_at":"2026-05-18T10:02:31.673927Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-07-06T12:54:11.616335Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":"2203.15556","doi":"10.1098/rsta.2024.0522","metadata_source":"pith","pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Training Compute-Optimal Large Language Models","venue":"cs.CL","work_id":"b2faf28d-86b7-429c-bc42-469458efc246","year":2022},"citing_paper":{"arxiv_id":"2510.04212","last_updated":"2026-04-18T01:36:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-05T14:01:24Z","title":"Why Low-Precision Transformer Training Fails: An Analysis on Flash Attention","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-18T10:01:56.131253Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2510.04212"},"observation_digest":"sha256:983a085c521f75f78cecae12cb6f859b45fbf26c70e4d0b06f3390afa4c96bd8","observation_id":"8f6b5e54-03fc-4290-a857-7034d2da5616","resolution":{"observed_at":"2026-05-18T10:02:31.752653Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06842","last_updated":"2025-02-28T15:15:31Z","snapshot_observed_at":"2026-07-06T20:19:55.486841Z","submitted_at":"2025-01-12T15:21:22Z","title":"SPAM: Spike-Aware Adam with Momentum Reset for Stable LLM Training","version":2},"cited_work":{"arxiv_id":"2501.06842","doi":"10.48550/arxiv.2501.06842","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.06842","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Spam: Spike- aware adam with momentum reset for stable llm training.arXiv preprint arXiv:2501.06842","venue":null,"work_id":"a6e8de5a-448e-4f96-9f47-63cd6fbe7450","year":2025},"citing_paper":{"arxiv_id":"2510.04212","last_updated":"2026-04-18T01:36:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-05T14:01:24Z","title":"Why Low-Precision Transformer Training Fails: An Analysis on Flash Attention","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-18T10:01:56.131253Z"},"links":{"cited_paper":"/paper/2501.06842","citing_paper":"/paper/2510.04212"},"observation_digest":"sha256:001df523ffc1f238fb6510700b33dd57e8bec9e74802b8c58c8af833c5471e1b","observation_id":"88aff18f-3fb0-4d42-b513-6972e031ff0f","resolution":{"observed_at":"2026-05-18T10:02:31.706582Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.12322","last_updated":"2019-06-13T17:55:30Z","snapshot_observed_at":"2026-07-06T07:56:22.526754Z","submitted_at":"2019-05-29T10:50:32Z","title":"A Study of BFLOAT16 for Deep Learning Training","version":3},"cited_work":{"arxiv_id":"1905.12322","doi":"10.48550/arxiv.1905.12322","metadata_source":"pith","pith_arxiv_id":"1905.12322","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"A Study of BFLOAT16 for Deep Learning Training","venue":"cs.LG","work_id":"5e0bebf8-8f7b-4b5d-afd7-8867758a6277","year":2019},"citing_paper":{"arxiv_id":"2510.04212","last_updated":"2026-04-18T01:36:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-05T14:01:24Z","title":"Why Low-Precision Transformer Training Fails: An Analysis on Flash Attention","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-18T10:01:56.131253Z"},"links":{"cited_paper":"/paper/1905.12322","citing_paper":"/paper/2510.04212"},"observation_digest":"sha256:ad38cbe3f9e1588fde96512d2eaf95efe893bbeb81d81b0a2f855d7c78e89e35","observation_id":"52e00fa9-ec25-4b75-8a7a-7be7ccc302f3","resolution":{"observed_at":"2026-05-18T10:02:31.738309Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.20534","last_updated":"2026-02-03T04:57:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-28T05:35:43Z","title":"Kimi K2: Open Agentic Intelligence","version":2},"cited_work":{"arxiv_id":"2507.20534","doi":"10.1145/3448609","metadata_source":"pith","pith_arxiv_id":"2507.20534","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Kimi K2: Open Agentic Intelligence","venue":"cs.LG","work_id":"7f18284c-12d3-4137-bea1-1da97e8cf3c1","year":2025},"citing_paper":{"arxiv_id":"2510.04212","last_updated":"2026-04-18T01:36:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-05T14:01:24Z","title":"Why Low-Precision Transformer Training Fails: An Analysis on Flash Attention","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-18T10:01:56.131253Z"},"links":{"cited_paper":"/paper/2507.20534","citing_paper":"/paper/2510.04212"},"observation_digest":"sha256:70bb9aeb560181224f9e62750323a9d7b9a85f4ceeff05ec044d55dd5ca90742","observation_id":"53f66d0e-6c7b-41f6-96be-f52c7003805a","resolution":{"observed_at":"2026-05-18T10:02:31.756129Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-05-25T01:23:16.170083+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T01:23:16.170083+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":"2412.19437","doi":"10.1016/j.neucom.2023.127063.url:https://www.sciencedirect","metadata_source":"pith","pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"DeepSeek-V3 Technical Report","venue":"cs.CL","work_id":"57d2791d-2219-4c31-a077-afc04b12a75c","year":2024},"citing_paper":{"arxiv_id":"2510.04212","last_updated":"2026-04-18T01:36:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-05T14:01:24Z","title":"Why Low-Precision Transformer Training Fails: An Analysis on Flash Attention","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-18T10:01:56.131253Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2510.04212"},"observation_digest":"sha256:9db0bd87dde91dd92da373a3a1193465c786bf8293b5e33b8bd0264643207911","observation_id":"0d9e66a6-2abb-4607-b5bf-4c19b90c21b2","resolution":{"observed_at":"2026-05-18T10:02:31.702310Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.12334","last_updated":"2019-05-29T11:25:09Z","snapshot_observed_at":"2026-07-06T07:56:22.526754Z","submitted_at":"2019-05-29T11:25:09Z","title":"Mixed Precision Training With 8-bit Floating Point","version":1},"cited_work":{"arxiv_id":"1905.12334","doi":null,"metadata_source":"pith","pith_arxiv_id":"1905.12334","snapshot_observed_at":"2026-07-02T06:06:41.652034Z","title":"Mixed Precision Training With 8-bit Floating Point","venue":"cs.LG","work_id":"01487127-b6f6-4500-9462-66ab5800b8fd","year":2019},"citing_paper":{"arxiv_id":"2510.04212","last_updated":"2026-04-18T01:36:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-05T14:01:24Z","title":"Why Low-Precision Transformer Training Fails: An Analysis on Flash Attention","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-18T10:01:56.131253Z"},"links":{"cited_paper":"/paper/1905.12334","citing_paper":"/paper/2510.04212"},"observation_digest":"sha256:6f698c727f1ed090cda4d363aaf9c1c168601c5ca3e5817b61fbf3e36dce4fb3","observation_id":"3e77396a-2006-4532-94df-1611f448be03","resolution":{"observed_at":"2026-05-18T10:02:31.684327Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"cited_work":{"arxiv_id":"1710.03740","doi":"10.48550/arxiv.1710.03740","metadata_source":"pith","pith_arxiv_id":"1710.03740","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Mixed Precision Training","venue":"cs.AI","work_id":"c525941b-ce20-4bcb-8509-a9968f1e89c3","year":2017},"citing_paper":{"arxiv_id":"2510.04212","last_updated":"2026-04-18T01:36:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-05T14:01:24Z","title":"Why Low-Precision Transformer Training Fails: An Analysis on Flash Attention","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-18T10:01:56.131253Z"},"links":{"cited_paper":"/paper/1710.03740","citing_paper":"/paper/2510.04212"},"observation_digest":"sha256:2c6a01aecab70589ca17320df0068a830207a00f30ca757591ec1ce4703d61de","observation_id":"7b607e40-1368-4393-880c-4fb464af087f","resolution":{"observed_at":"2026-05-18T10:02:31.654634Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.05433","last_updated":"2022-09-29T20:47:07Z","snapshot_observed_at":"2026-07-06T13:51:20.183063Z","submitted_at":"2022-09-12T17:39:55Z","title":"FP8 Formats for Deep Learning","version":2},"cited_work":{"arxiv_id":"2209.05433","doi":"10.48550/arxiv.2209.05433","metadata_source":"pith","pith_arxiv_id":"2209.05433","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"FP8 Formats for Deep Learning","venue":"cs.LG","work_id":"c7217bc9-e53d-40c5-a437-25a74abc36cd","year":2022},"citing_paper":{"arxiv_id":"2510.04212","last_updated":"2026-04-18T01:36:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-05T14:01:24Z","title":"Why Low-Precision Transformer Training Fails: An Analysis on Flash Attention","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-18T10:01:56.131253Z"},"links":{"cited_paper":"/paper/2209.05433","citing_paper":"/paper/2510.04212"},"observation_digest":"sha256:29deccc9e098351e8fc424b6d5ebd12d77230b03d380ad3d7b5dfb02e66b136c","observation_id":"267a6714-9fda-4947-8fd6-a76fb131a427","resolution":{"observed_at":"2026-05-18T10:02:31.723095Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:35.618396+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:35.618396+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.09871","last_updated":"2023-04-25T04:48:47Z","snapshot_observed_at":"2026-08-01T21:16:54.439908Z","submitted_at":"2023-04-19T06:15:11Z","title":"A Theory on Adam Instability in Large-Scale Machine Learning","version":2},"cited_work":{"arxiv_id":"2304.09871","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2304.09871","snapshot_observed_at":"2026-07-03T17:58:46.561911Z","title":"Molybog, P","venue":null,"work_id":"3eb50cd8-c781-4c60-bee1-e598dbed9106","year":2023},"citing_paper":{"arxiv_id":"2510.04212","last_updated":"2026-04-18T01:36:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-05T14:01:24Z","title":"Why Low-Precision Transformer Training Fails: An Analysis on Flash Attention","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-18T10:01:56.131253Z"},"links":{"cited_paper":"/paper/2304.09871","citing_paper":"/paper/2510.04212"},"observation_digest":"sha256:3810e45ce1d79ea89c67442c9873ab85ab9464ad996a1f517c38c8e0b0ee1509","observation_id":"89f76f7b-7d55-4d47-bbd3-2d7e6cf46b53","resolution":{"observed_at":"2026-05-18T10:02:31.691756Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"nanoGPT Issue","venue":null,"work_id":"e52160ac-0677-4617-8452-55cd01cec1f5","year":2025},"citing_paper":{"arxiv_id":"2510.04212","last_updated":"2026-04-18T01:36:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-05T14:01:24Z","title":"Why Low-Precision Transformer Training Fails: An Analysis on Flash Attention","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-18T10:01:56.131253Z"},"links":{"citing_paper":"/paper/2510.04212"},"observation_digest":"sha256:c90e08222c8a112d5c2f7112f360c1b384ed260af5a04dc87b03d1e465751bdc","observation_id":"1e1dbe79-4ae7-41dc-939e-c2a6900e0c92","resolution":{"observed_at":"2026-05-18T10:02:31.803305Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.02915","last_updated":"2022-06-06T21:31:32Z","snapshot_observed_at":"2026-07-06T13:18:02.186241Z","submitted_at":"2022-06-06T21:31:32Z","title":"8-bit Numerical Formats for Deep Neural Networks","version":1},"cited_work":{"arxiv_id":"2206.02915","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2206.02915","snapshot_observed_at":"2026-07-03T03:47:35.998768Z","title":"Badreddine Noune, Philip Jones, Daniel Justus, Dominic Masters, and Carlo Luschi","venue":null,"work_id":"1e2b4814-de0d-4c25-a0cd-d671fb337f4d","year":2022},"citing_paper":{"arxiv_id":"2510.04212","last_updated":"2026-04-18T01:36:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-05T14:01:24Z","title":"Why Low-Precision Transformer Training Fails: An Analysis on Flash Attention","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-18T10:01:56.131253Z"},"links":{"cited_paper":"/paper/2206.02915","citing_paper":"/paper/2510.04212"},"observation_digest":"sha256:d1ee40305e79a2c227f8e708fae0860a7c76fd4eba9ad96e0f8d5ac1aca7bbd1","observation_id":"93c4ca0f-0f0f-492e-9f4b-9839f0659c4e","resolution":{"observed_at":"2026-05-18T10:02:31.639481Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.18313","last_updated":"2023-12-19T12:27:58Z","snapshot_observed_at":"2026-07-06T16:39:36.790016Z","submitted_at":"2023-10-27T17:59:51Z","title":"FP8-LM: Training FP8 Large Language Models","version":2},"cited_work":{"arxiv_id":"2310.18313","doi":"10.48550/arxiv.2310.18313","metadata_source":"pith","pith_arxiv_id":"2310.18313","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"FP8-LM: Training FP8 Large Language Models","venue":"cs.LG","work_id":"8aa8a89a-8428-4ed6-9efe-c9d583f852cf","year":2023},"citing_paper":{"arxiv_id":"2510.04212","last_updated":"2026-04-18T01:36:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-05T14:01:24Z","title":"Why Low-Precision Transformer Training Fails: An Analysis on Flash Attention","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-18T10:01:56.131253Z"},"links":{"cited_paper":"/paper/2310.18313","citing_paper":"/paper/2510.04212"},"observation_digest":"sha256:81bca6fc54f51ca457bbc702d5596b7ceb4cfc8a3b10c69a176a44464329d784","observation_id":"65c71bf6-d9cd-4002-9fb2-6a0f447ec470","resolution":{"observed_at":"2026-05-18T10:02:31.727622Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:31.760018+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:31.760018+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17224","last_updated":"2023-09-29T13:24:33Z","snapshot_observed_at":"2026-07-06T16:25:29.858870Z","submitted_at":"2023-09-29T13:24:33Z","title":"Training and inference of large language models using 8-bit floating point","version":1},"cited_work":{"arxiv_id":"2309.17224","doi":"10.48550/arxiv.2309.17224","metadata_source":"pith","pith_arxiv_id":"2309.17224","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Training and inference of large lan- guage models using 8-bit floating point.arXiv preprint arXiv:2309.17224","venue":"cs.LG","work_id":"93af2807-3da0-479d-a9d7-67bc61639f22","year":2023},"citing_paper":{"arxiv_id":"2510.04212","last_updated":"2026-04-18T01:36:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-05T14:01:24Z","title":"Why Low-Precision Transformer Training Fails: An Analysis on Flash Attention","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-18T10:01:56.131253Z"},"links":{"cited_paper":"/paper/2309.17224","citing_paper":"/paper/2510.04212"},"observation_digest":"sha256:945a614dc02c9d80124e2fd5f0724c5fdebb5adae03d8d9a6caf82c2e21032b8","observation_id":"56d5338f-e883-4b21-a256-22388e7fa288","resolution":{"observed_at":"2026-05-18T10:02:31.696207Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:36.299839+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:36.299839+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"cited_work":{"arxiv_id":"2505.06708","doi":"10.48550/arxiv.2505.06708","metadata_source":"pith","pith_arxiv_id":"2505.06708","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","venue":"cs.CL","work_id":"35cc586b-44f1-4948-a84b-866e8335e649","year":2025},"citing_paper":{"arxiv_id":"2510.04212","last_updated":"2026-04-18T01:36:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-05T14:01:24Z","title":"Why Low-Precision Transformer Training Fails: An Analysis on Flash Attention","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-18T10:01:56.131253Z"},"links":{"cited_paper":"/paper/2505.06708","citing_paper":"/paper/2510.04212"},"observation_digest":"sha256:a1250db78a1952451b745f6e1cabdadfee3f127a08f490ae9e7cf33450fd8973","observation_id":"bf83668c-6f1c-4e1e-b0be-bd887d7e2282","resolution":{"observed_at":"2026-05-18T10:02:31.643403Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2510.04212","last_updated":"2026-04-18T01:36:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-05T14:01:24Z","title":"Why Low-Precision Transformer Training Fails: An Analysis on Flash Attention","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-18T10:01:56.131253Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2510.04212"},"observation_digest":"sha256:20c3b564755d7a0efab3e9fbe1858c0b03222d1202317b739dbc789525feaa3e","observation_id":"35f406cc-da44-44be-9695-590dda5c8203","resolution":{"observed_at":"2026-05-18T10:02:31.647731Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.11446","last_updated":"2022-01-21T18:39:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-12-08T19:41:47Z","title":"Scaling Language Models: Methods, Analysis & Insights from Training Gopher","version":2},"cited_work":{"arxiv_id":"2112.11446","doi":"10.48550/arxiv.2112.11446","metadata_source":"pith","pith_arxiv_id":"2112.11446","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Scaling Language Models: Methods, Analysis & Insights from Training Gopher","venue":"cs.CL","work_id":"47ce8be9-e500-407d-af41-ac2d132215eb","year":2021},"citing_paper":{"arxiv_id":"2510.04212","last_updated":"2026-04-18T01:36:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-05T14:01:24Z","title":"Why Low-Precision Transformer Training Fails: An Analysis on Flash Attention","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-18T10:01:56.131253Z"},"links":{"cited_paper":"/paper/2112.11446","citing_paper":"/paper/2510.04212"},"observation_digest":"sha256:f573004e88cac9bc409a3d333500681e8fc3c52b9e663be099eddb899abb3302","observation_id":"f223dff7-69e1-434c-8aa5-d4a7d67c0139","resolution":{"observed_at":"2026-05-18T10:02:31.746740Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16682","last_updated":"2024-10-22T04:27:03Z","snapshot_observed_at":"2026-07-06T19:37:33.729773Z","submitted_at":"2024-10-22T04:27:03Z","title":"Methods of improving LLM training stability","version":1},"cited_work":{"arxiv_id":"2410.16682","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.16682","snapshot_observed_at":"2026-07-02T21:17:24.582185Z","title":"Methods of improving llm training stability.arXiv preprint arXiv:2410.16682","venue":null,"work_id":"6a681be8-dfbc-4350-a4d0-056b08871320","year":2024},"citing_paper":{"arxiv_id":"2510.04212","last_updated":"2026-04-18T01:36:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-05T14:01:24Z","title":"Why Low-Precision Transformer Training Fails: An Analysis on Flash Attention","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-18T10:01:56.131253Z"},"links":{"cited_paper":"/paper/2410.16682","citing_paper":"/paper/2510.04212"},"observation_digest":"sha256:871b716f995cb649a5f002fd43bccd4dc3f8a696a41e41d4326aff6139e13618","observation_id":"22a56c48-f98b-43e8-84e5-c06205cf2fcc","resolution":{"observed_at":"2026-05-18T10:02:31.742547Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":"2302.13971","doi":"10.48550/arxiv.2302.13971","metadata_source":"pith","pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-07-11T03:47:48.508181Z","title":"LLaMA: Open and Efficient Foundation Language Models","venue":"cs.CL","work_id":"c018fc23-6f3f-4035-9d02-28a2173b2b9d","year":2023},"citing_paper":{"arxiv_id":"2510.04212","last_updated":"2026-04-18T01:36:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-05T14:01:24Z","title":"Why Low-Precision Transformer Training Fails: An Analysis on Flash Attention","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-18T10:01:56.131253Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2510.04212"},"observation_digest":"sha256:7281f6aeb25edbf9f6a99cff13973b13935e16657e8377b454e837e5c79bd95e","observation_id":"ab409d59-1954-493a-bdfc-a17037221042","resolution":{"observed_at":"2026-05-18T10:02:31.651207Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-01T11:08:05.851253+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T11:08:05.851253+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.20586","last_updated":"2025-08-26T23:08:09Z","snapshot_observed_at":"2026-07-06T20:44:04.093457Z","submitted_at":"2025-02-27T23:01:31Z","title":"Training LLMs with MXFP4","version":3},"cited_work":{"arxiv_id":"2502.20586","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.20586","snapshot_observed_at":"2026-07-01T20:36:12.313960Z","title":"Training llms with mxfp4","venue":null,"work_id":"5311bef0-5858-4f57-9a9b-c9febbfff8b9","year":2025},"citing_paper":{"arxiv_id":"2510.04212","last_updated":"2026-04-18T01:36:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-05T14:01:24Z","title":"Why Low-Precision Transformer Training Fails: An Analysis on Flash Attention","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-18T10:01:56.131253Z"},"links":{"cited_paper":"/paper/2502.20586","citing_paper":"/paper/2510.04212"},"observation_digest":"sha256:7b0548ee916c66d5035639eb9772b5c362740a2a83620fffadb18577262dac17","observation_id":"0ee60707-4b4f-478a-ab91-f55567e38442","resolution":{"observed_at":"2026-05-18T10:02:31.760017Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17116","last_updated":"2025-05-23T09:44:25Z","snapshot_observed_at":"2026-08-02T15:17:06.428629Z","submitted_at":"2025-01-28T18:04:50Z","title":"Optimizing Large Language Model Training Using FP4 Quantization","version":2},"cited_work":{"arxiv_id":"2501.17116","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.17116","snapshot_observed_at":"2026-07-03T07:27:44.449472Z","title":"Optimizing Large Language Model Training Using FP4 Quantization","venue":"cs.LG","work_id":"dd7006b4-487d-4b92-9319-2fc36e31d954","year":2025},"citing_paper":{"arxiv_id":"2510.04212","last_updated":"2026-04-18T01:36:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-05T14:01:24Z","title":"Why Low-Precision Transformer Training Fails: An Analysis on Flash Attention","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-18T10:01:56.131253Z"},"links":{"cited_paper":"/paper/2501.17116","citing_paper":"/paper/2510.04212"},"observation_digest":"sha256:83781c0ae8abb3bc102480e56e7d00281670ea774e230c58ea6fa3818d1eea2e","observation_id":"7eee6e6f-7efe-42c7-a26d-c059d5f17b33","resolution":{"observed_at":"2026-05-20T00:00:17.330307Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mitchell Wortsman, Tim Dettmers, Luke Zettlemoyer, Ari S","venue":null,"work_id":"f6a59a11-32e2-434a-8931-8388a39d65ab","year":2025},"citing_paper":{"arxiv_id":"2510.04212","last_updated":"2026-04-18T01:36:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-05T14:01:24Z","title":"Why Low-Precision Transformer Training Fails: An Analysis on Flash Attention","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-18T10:01:56.131253Z"},"links":{"citing_paper":"/paper/2510.04212"},"observation_digest":"sha256:71f140b8e50e4fe124516554424c7e321903f2093a193c6c9068b3d260d5b38d","observation_id":"8f603f96-661d-4b81-a8c9-86a00ab49069","resolution":{"observed_at":"2026-05-18T10:02:31.799841Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17453","last_updated":"2024-04-07T00:56:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-29T17:59:56Z","title":"Efficient Streaming Language Models with Attention Sinks","version":4},"cited_work":{"arxiv_id":"2309.17453","doi":"10.48550/arxiv.2309.17453","metadata_source":"pith","pith_arxiv_id":"2309.17453","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Efficient Streaming Language Models with Attention Sinks","venue":"cs.CL","work_id":"a8d25452-c237-48c9-88a4-682717c3979a","year":2023},"citing_paper":{"arxiv_id":"2510.04212","last_updated":"2026-04-18T01:36:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-05T14:01:24Z","title":"Why Low-Precision Transformer Training Fails: An Analysis on Flash Attention","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-18T10:01:56.131253Z"},"links":{"cited_paper":"/paper/2309.17453","citing_paper":"/paper/2510.04212"},"observation_digest":"sha256:b2c8984e806d01fe17f732a3028cd86e3044f21064f271b821720c0ecfafd2c0","observation_id":"7b776de5-23a8-4a73-bd64-03fed27455ee","resolution":{"observed_at":"2026-05-18T10:02:31.687763Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.03466","last_updated":"2022-03-28T08:12:14Z","snapshot_observed_at":"2026-07-06T12:45:10.731233Z","submitted_at":"2022-03-07T15:37:35Z","title":"Tensor Programs V: Tuning Large Neural Networks via Zero-Shot Hyperparameter Transfer","version":2},"cited_work":{"arxiv_id":"2203.03466","doi":"10.48550/arxiv.2203.03466","metadata_source":"arxiv_reference","pith_arxiv_id":"2203.03466","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Tensor programs v: Tuning large neural networks via zero-shot hyperparameter transfer","venue":null,"work_id":"22ad4cec-5465-4cdb-a2aa-ace82b84b5e9","year":2022},"citing_paper":{"arxiv_id":"2510.04212","last_updated":"2026-04-18T01:36:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-05T14:01:24Z","title":"Why Low-Precision Transformer Training Fails: An Analysis on Flash Attention","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-18T10:01:56.131253Z"},"links":{"cited_paper":"/paper/2203.03466","citing_paper":"/paper/2510.04212"},"observation_digest":"sha256:f30e1f77f785bf63052f8d735a53da00d2dca889a97a5d7e478933c327d2733d","observation_id":"ab5518ee-fc94-4220-a46e-72af56d69016","resolution":{"observed_at":"2026-05-18T10:02:31.664367Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.17813","last_updated":"2024-05-14T00:10:33Z","snapshot_observed_at":"2026-07-06T16:39:16.652626Z","submitted_at":"2023-10-26T23:17:39Z","title":"A Spectral Condition for Feature Learning","version":2},"cited_work":{"arxiv_id":"2310.17813","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.17813","snapshot_observed_at":"2026-07-03T00:27:30.167566Z","title":"A spectral condition for feature learning","venue":null,"work_id":"ea5e7b7c-3b11-439d-8d99-51b97d507821","year":2023},"citing_paper":{"arxiv_id":"2510.04212","last_updated":"2026-04-18T01:36:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-05T14:01:24Z","title":"Why Low-Precision Transformer Training Fails: An Analysis on Flash Attention","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-18T10:01:56.131253Z"},"links":{"cited_paper":"/paper/2310.17813","citing_paper":"/paper/2510.04212"},"observation_digest":"sha256:ddcb24b30998fdcebef7d505050dbd00c0037893c4b7c8865d6daa13192d0dc9","observation_id":"94f1e29d-3a57-407c-8f9e-e46d13956016","resolution":{"observed_at":"2026-05-18T10:02:31.669691Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11458","last_updated":"2025-02-17T05:33:11Z","snapshot_observed_at":"2026-07-06T20:37:33.041473Z","submitted_at":"2025-02-17T05:33:11Z","title":"Towards Efficient Pre-training: Exploring FP4 Precision in Large Language Models","version":1},"cited_work":{"arxiv_id":"2502.11458","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.11458","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards efficient pre-training: Exploring fp4 precision in large language models.arXiv preprint arXiv:2502.11458","venue":null,"work_id":"2259d141-047b-4820-a5ad-8e92299e1390","year":null},"citing_paper":{"arxiv_id":"2510.04212","last_updated":"2026-04-18T01:36:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-05T14:01:24Z","title":"Why Low-Precision Transformer Training Fails: An Analysis on Flash Attention","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-18T10:01:56.131253Z"},"links":{"cited_paper":"/paper/2502.11458","citing_paper":"/paper/2510.04212"},"observation_digest":"sha256:a24a0d36dee52f50e24c517e32c2bf3eb8553218f85b4a69d1f41190e0f0d8ec","observation_id":"2afeead0-f78f-4c56-b46a-2fd1adf104bb","resolution":{"observed_at":"2026-05-18T10:02:31.635398Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"gradient spikes","venue":null,"work_id":"ff41f005-1e39-46cc-83c6-9ac4e24bd9b9","year":2017},"citing_paper":{"arxiv_id":"2510.04212","last_updated":"2026-04-18T01:36:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-05T14:01:24Z","title":"Why Low-Precision Transformer Training Fails: An Analysis on Flash Attention","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-18T10:01:56.131253Z"},"links":{"citing_paper":"/paper/2510.04212"},"observation_digest":"sha256:4ab150e8f9eb5423ca71d6ea4311124dcc356dd088caa97c01a877746c3eb69f","observation_id":"7d863fef-6e0c-4126-91d7-be66321cb39a","resolution":{"observed_at":"2026-05-18T10:02:31.796249Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Seg en Ã st 're ich s ho hem S oh ne / Un ser m Kaiser Ferdinand !","venue":null,"work_id":"902d1064-4a85-4b50-ad4d-df05465fed1d","year":2000},"citing_paper":{"arxiv_id":"2510.04212","last_updated":"2026-04-18T01:36:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-05T14:01:24Z","title":"Why Low-Precision Transformer Training Fails: An Analysis on Flash Attention","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-18T10:01:56.131253Z"},"links":{"citing_paper":"/paper/2510.04212"},"observation_digest":"sha256:c80e06605518b0cc57f527874785d8d2257603b397062f6cd96685ffa8b09bd5","observation_id":"a5f9a6f2-e73d-488c-b77f-1eed422f3313","resolution":{"observed_at":"2026-05-18T10:02:31.793196Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2510.04212","last_updated":"2026-04-18T01:36:25Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-05T14:01:24Z","title":"Why Low-Precision Transformer Training Fails: An Analysis on Flash Attention"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":2,"metadata_mismatch":6,"parse_uncertain":0,"unresolved":0,"verified_exact":23,"verified_fuzzy":4},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"thesis":"As of 3 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 4 inbound Pith citation observations for arXiv:2510.04212."}