{"as_of":"2026-08-10T07:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f6a71b92f97716c221a0748ecaf88e61a70cf446b44897a1dcfd12889b69208e","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":19,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":19,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":19,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":19,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T11:23:40.929720Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T07:27:44.431731Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2409.12517","last_updated":"2025-02-10T09:37:59Z","snapshot_observed_at":"2026-08-07T19:54:09.137276Z","submitted_at":"2024-09-19T07:15:58Z","title":"Scaling FP8 training to trillion-token LLMs","version":2},"cited_work":{"arxiv_id":"2409.12517","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.12517","snapshot_observed_at":"2026-07-03T07:27:44.431731Z","title":"Scaling FP8 Training to Trillion- Token LLMs","venue":null,"work_id":"67213178-57f3-4231-9e3e-3545902d31de","year":2024},"citing_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-05-23T07:42:22.478647Z"},"links":{"cited_paper":"/paper/2409.12517","citing_paper":"/paper/2412.04468"},"observation_digest":"sha256:6f479c9dd1d8a921f59a71204d53ae9a756fa5b70ccb1d31fe416ff199b6dbda","observation_id":"c4b9be6e-0317-4925-8dc5-709c656c726e","resolution":{"observed_at":"2026-05-23T07:42:43.040130Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12517","last_updated":"2025-02-10T09:37:59Z","snapshot_observed_at":"2026-08-07T19:54:09.137276Z","submitted_at":"2024-09-19T07:15:58Z","title":"Scaling FP8 training to trillion-token LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12517","snapshot_observed_at":"2026-08-09T11:23:40.929720Z","title":"Scaling FP8 training to trillion-token llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02732","last_updated":"2025-06-06T11:19:11Z","snapshot_observed_at":"2026-08-10T02:04:43.754736Z","submitted_at":"2025-02-04T21:29:47Z","title":"Peri-LN: Revisiting Normalization Layer in the Transformer Architecture","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-09T11:23:40.929720Z"},"links":{"cited_paper":"/paper/2409.12517","citing_paper":"/paper/2502.02732"},"observation_digest":"sha256:af49dd92c79e776a3dcc942ff66b403780695b78fb035def00c96f556bc3b95f","observation_id":"f804b551-985d-46b4-9dc7-9f50336ff2f0","resolution":{"observed_at":"2026-08-09T11:23:40.929720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12517","last_updated":"2025-02-10T09:37:59Z","snapshot_observed_at":"2026-08-07T19:54:09.137276Z","submitted_at":"2024-09-19T07:15:58Z","title":"Scaling FP8 training to trillion-token LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12517","snapshot_observed_at":"2026-08-09T04:28:03.922252Z","title":"Scal- ing fp8 training to trillion-token llms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.10424","last_updated":"2025-02-05T20:43:48Z","snapshot_observed_at":"2026-08-09T15:11:12.836727Z","submitted_at":"2025-02-05T20:43:48Z","title":"QuantSpec: Self-Speculative Decoding with Hierarchical Quantized KV Cache","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-09T04:28:03.922252Z"},"links":{"cited_paper":"/paper/2409.12517","citing_paper":"/paper/2502.10424"},"observation_digest":"sha256:084ca4e626f1721a7dcf209854f0c357e5d787f9932ddd37222ac7f05e20f204","observation_id":"67aba63f-2798-4df1-9f36-1e7f316667f5","resolution":{"observed_at":"2026-08-09T04:28:03.922252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12517","last_updated":"2025-02-10T09:37:59Z","snapshot_observed_at":"2026-08-07T19:54:09.137276Z","submitted_at":"2024-09-19T07:15:58Z","title":"Scaling FP8 training to trillion-token LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12517","snapshot_observed_at":"2026-08-07T15:41:06.104682Z","title":"Scaling fp8 training to trillion-token llms.arXiv preprint arXiv:2409.12517, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14302","last_updated":"2025-05-20T12:54:43Z","snapshot_observed_at":"2026-08-07T15:43:23.244437Z","submitted_at":"2025-05-20T12:54:43Z","title":"Scaling Law for Quantization-Aware Training","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T15:41:06.104682Z"},"links":{"cited_paper":"/paper/2409.12517","citing_paper":"/paper/2505.14302"},"observation_digest":"sha256:0b8495900e480614abc5f18cf5005a86c5895ba8243da009f3b886d60b8eed1a","observation_id":"4cac8f33-ef05-41ca-aeeb-e6fc175a5a72","resolution":{"observed_at":"2026-08-07T15:41:06.104682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12517","last_updated":"2025-02-10T09:37:59Z","snapshot_observed_at":"2026-08-07T19:54:09.137276Z","submitted_at":"2024-09-19T07:15:58Z","title":"Scaling FP8 training to trillion-token LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12517","snapshot_observed_at":"2026-08-07T14:25:38.069250Z","title":"Scaling fp8 training to trillion-token llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19115","last_updated":"2025-08-10T07:10:29Z","snapshot_observed_at":"2026-08-09T06:55:04.491282Z","submitted_at":"2025-05-25T12:14:25Z","title":"FP4 All the Way: Fully Quantized Training of LLMs","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:38.069250Z"},"links":{"cited_paper":"/paper/2409.12517","citing_paper":"/paper/2505.19115"},"observation_digest":"sha256:fc9ff18b8e1c98de029042f0583c183403246db889664e99019dd044e16bfe06","observation_id":"f59b69c3-0296-407c-b2e7-12e45dd8d740","resolution":{"observed_at":"2026-08-07T14:25:38.069250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12517","last_updated":"2025-02-10T09:37:59Z","snapshot_observed_at":"2026-08-07T19:54:09.137276Z","submitted_at":"2024-09-19T07:15:58Z","title":"Scaling FP8 training to trillion-token LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12517","snapshot_observed_at":"2026-08-07T12:12:47.282884Z","title":"Scaling fp8 training to trillion-token llms, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08027","last_updated":"2025-08-18T19:51:06Z","snapshot_observed_at":"2026-08-09T09:33:39.206845Z","submitted_at":"2025-05-30T21:08:15Z","title":"Recipes for Pre-training LLMs with MXFP8","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:47.282884Z"},"links":{"cited_paper":"/paper/2409.12517","citing_paper":"/paper/2506.08027"},"observation_digest":"sha256:847e8d9f6752003df9a5b5275c19fef1edd5cdf66f6615aedc54fd480680f4e8","observation_id":"6873f7de-f463-4129-8d2a-ad77c575243b","resolution":{"observed_at":"2026-08-07T12:12:47.282884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12517","last_updated":"2025-02-10T09:37:59Z","snapshot_observed_at":"2026-08-07T19:54:09.137276Z","submitted_at":"2024-09-19T07:15:58Z","title":"Scaling FP8 training to trillion-token LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12517","snapshot_observed_at":"2026-08-06T22:47:52.213010Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20752","last_updated":"2025-06-25T18:25:08Z","snapshot_observed_at":"2026-08-09T12:08:21.616173Z","submitted_at":"2025-06-25T18:25:08Z","title":"Characterization and Mitigation of Training Instabilities in Microscaling Formats","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T22:47:52.213010Z"},"links":{"cited_paper":"/paper/2409.12517","citing_paper":"/paper/2506.20752"},"observation_digest":"sha256:5fe565d4546967899430276345a2e1cf5815e358616c3372aee94748648a066e","observation_id":"87602fef-a9ad-4628-a28a-e57900c9ba43","resolution":{"observed_at":"2026-08-06T22:47:52.213010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12517","last_updated":"2025-02-10T09:37:59Z","snapshot_observed_at":"2026-08-07T19:54:09.137276Z","submitted_at":"2024-09-19T07:15:58Z","title":"Scaling FP8 training to trillion-token LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12517","snapshot_observed_at":"2026-08-06T23:58:09.687331Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21595","last_updated":"2025-06-18T17:33:51Z","snapshot_observed_at":"2026-08-09T19:09:21.501829Z","submitted_at":"2025-06-18T17:33:51Z","title":"Thunder-LLM: Efficiently Adapting LLMs to Korean with Minimal Resources","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T23:58:09.687331Z"},"links":{"cited_paper":"/paper/2409.12517","citing_paper":"/paper/2506.21595"},"observation_digest":"sha256:9e7d4fde1672b025ed92860c2c0df54d2938213467f8aef2d566a0f08b9c0249","observation_id":"d5b58414-1fa1-4c1b-b30d-a0aa36c878c4","resolution":{"observed_at":"2026-08-06T23:58:09.687331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12517","last_updated":"2025-02-10T09:37:59Z","snapshot_observed_at":"2026-08-07T19:54:09.137276Z","submitted_at":"2024-09-19T07:15:58Z","title":"Scaling FP8 training to trillion-token LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12517","snapshot_observed_at":"2026-08-06T17:47:40.337409Z","title":"Scaling FP8 training to trillion-token LLMs,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09955","last_updated":"2025-07-14T06:10:30Z","snapshot_observed_at":"2026-08-07T11:12:53.489576Z","submitted_at":"2025-07-14T06:10:30Z","title":"DeepSeek: Paradigm Shifts and Technical Evolution in Large AI Models","version":1},"reference_index":128,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:40.337409Z"},"links":{"cited_paper":"/paper/2409.12517","citing_paper":"/paper/2507.09955"},"observation_digest":"sha256:dadb4bb765070d1d54f0a8e7e09b958850cf92c189723f8dfe09fef1974684cc","observation_id":"0ef52389-2791-4e33-9958-2e8aac0f444e","resolution":{"observed_at":"2026-08-06T17:47:40.337409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12517","last_updated":"2025-02-10T09:37:59Z","snapshot_observed_at":"2026-08-07T19:54:09.137276Z","submitted_at":"2024-09-19T07:15:58Z","title":"Scaling FP8 training to trillion-token LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12517","snapshot_observed_at":"2026-08-04T14:51:29.281759Z","title":"Scaling fp8 training to trillion-token llms, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.22536","last_updated":"2026-08-02T17:29:40Z","snapshot_observed_at":"2026-08-07T13:25:12.335817Z","submitted_at":"2025-09-26T16:16:49Z","title":"A Comprehensive FP8 Training Recipe for Reasoning-Enhanced Language Models","version":5},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-04T14:51:29.281759Z"},"links":{"cited_paper":"/paper/2409.12517","citing_paper":"/paper/2509.22536"},"observation_digest":"sha256:4b2fbc707b0a860f85db6f3cc0dbbe3f45efdc7e6f9ba02e7cfa03d5c12a58b6","observation_id":"a17c0e55-6fb2-471e-9476-971700957f1f","resolution":{"observed_at":"2026-08-04T14:51:29.281759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12517","last_updated":"2025-02-10T09:37:59Z","snapshot_observed_at":"2026-08-07T19:54:09.137276Z","submitted_at":"2024-09-19T07:15:58Z","title":"Scaling FP8 training to trillion-token LLMs","version":2},"cited_work":{"arxiv_id":"2409.12517","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.12517","snapshot_observed_at":"2026-07-03T07:27:44.431731Z","title":"Scaling FP8 Training to Trillion- Token LLMs","venue":null,"work_id":"67213178-57f3-4231-9e3e-3545902d31de","year":2024},"citing_paper":{"arxiv_id":"2510.04212","last_updated":"2026-04-18T01:36:25Z","snapshot_observed_at":"2026-08-05T11:27:54.389799Z","submitted_at":"2025-10-05T14:01:24Z","title":"Why Low-Precision Transformer Training Fails: An Analysis on Flash Attention","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-18T10:01:56.131253Z"},"links":{"cited_paper":"/paper/2409.12517","citing_paper":"/paper/2510.04212"},"observation_digest":"sha256:316af45f3ec22c6746fbc1d80c2e20317f6270860af6fb73de15ebea0fc8e9a1","observation_id":"2747e26a-663e-407e-9239-46432204b867","resolution":{"observed_at":"2026-05-18T10:02:31.710568Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12517","last_updated":"2025-02-10T09:37:59Z","snapshot_observed_at":"2026-08-07T19:54:09.137276Z","submitted_at":"2024-09-19T07:15:58Z","title":"Scaling FP8 training to trillion-token LLMs","version":2},"cited_work":{"arxiv_id":"2409.12517","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.12517","snapshot_observed_at":"2026-07-03T07:27:44.431731Z","title":"Scaling FP8 Training to Trillion- Token LLMs","venue":null,"work_id":"67213178-57f3-4231-9e3e-3545902d31de","year":2024},"citing_paper":{"arxiv_id":"2605.09370","last_updated":"2026-06-09T06:04:44Z","snapshot_observed_at":"2026-07-06T23:21:30.897592Z","submitted_at":"2026-05-10T06:46:06Z","title":"From Detection to Recovery: Operational Analysis on LLM Pre-training with 504 GPUs","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-12T02:10:43.006238Z"},"links":{"cited_paper":"/paper/2409.12517","citing_paper":"/paper/2605.09370"},"observation_digest":"sha256:4530e622147655a4cbdc11c344662ad5a70a5838505074f163493c5d1b5f37b0","observation_id":"16d8a70c-f9d1-4dae-b920-fb03d4795f40","resolution":{"observed_at":"2026-05-12T02:11:15.382428Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12517","last_updated":"2025-02-10T09:37:59Z","snapshot_observed_at":"2026-08-07T19:54:09.137276Z","submitted_at":"2024-09-19T07:15:58Z","title":"Scaling FP8 training to trillion-token LLMs","version":2},"cited_work":{"arxiv_id":"2409.12517","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.12517","snapshot_observed_at":"2026-07-03T07:27:44.431731Z","title":"Scaling FP8 Training to Trillion- Token LLMs","venue":null,"work_id":"67213178-57f3-4231-9e3e-3545902d31de","year":2024},"citing_paper":{"arxiv_id":"2605.09370","last_updated":"2026-06-09T06:04:44Z","snapshot_observed_at":"2026-07-06T23:21:30.897592Z","submitted_at":"2026-05-10T06:46:06Z","title":"From Detection to Recovery: Operational Analysis on LLM Pre-training with 504 GPUs","version":4},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-30T22:57:31.085889Z"},"links":{"cited_paper":"/paper/2409.12517","citing_paper":"/paper/2605.09370"},"observation_digest":"sha256:700b14138b20dac8a523ce6f49b6f0ee83725362e8fa00e7a308838766014153","observation_id":"ceea8870-8af1-47ab-941f-aaac89e01fb9","resolution":{"observed_at":"2026-07-01T13:35:46.637821Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12517","last_updated":"2025-02-10T09:37:59Z","snapshot_observed_at":"2026-08-07T19:54:09.137276Z","submitted_at":"2024-09-19T07:15:58Z","title":"Scaling FP8 training to trillion-token LLMs","version":2},"cited_work":{"arxiv_id":"2409.12517","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.12517","snapshot_observed_at":"2026-07-03T07:27:44.431731Z","title":"Scaling FP8 Training to Trillion- Token LLMs","venue":null,"work_id":"67213178-57f3-4231-9e3e-3545902d31de","year":2024},"citing_paper":{"arxiv_id":"2605.10886","last_updated":"2026-07-09T02:30:06Z","snapshot_observed_at":"2026-07-12T23:17:31.243229Z","submitted_at":"2026-05-11T17:32:29Z","title":"LoKA: Low-precision Kernel Applications for Recommendation Models At Scale","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-12T04:33:41.411292Z"},"links":{"cited_paper":"/paper/2409.12517","citing_paper":"/paper/2605.10886"},"observation_digest":"sha256:f1b6d97d10434fa57787b0644e66686fac381a20dc5e6cefff61ca090493d5ae","observation_id":"8732e7ae-e736-45f3-b579-645a99dd585c","resolution":{"observed_at":"2026-05-12T06:06:28.075687Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12517","last_updated":"2025-02-10T09:37:59Z","snapshot_observed_at":"2026-08-07T19:54:09.137276Z","submitted_at":"2024-09-19T07:15:58Z","title":"Scaling FP8 training to trillion-token LLMs","version":2},"cited_work":{"arxiv_id":"2409.12517","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.12517","snapshot_observed_at":"2026-07-03T07:27:44.431731Z","title":"Scaling FP8 Training to Trillion- Token LLMs","venue":null,"work_id":"67213178-57f3-4231-9e3e-3545902d31de","year":2024},"citing_paper":{"arxiv_id":"2605.10886","last_updated":"2026-07-09T02:30:06Z","snapshot_observed_at":"2026-07-12T23:17:31.243229Z","submitted_at":"2026-05-11T17:32:29Z","title":"LoKA: Low-precision Kernel Applications for Recommendation Models At Scale","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-15T04:55:01.973832Z"},"links":{"cited_paper":"/paper/2409.12517","citing_paper":"/paper/2605.10886"},"observation_digest":"sha256:94482dffd8407d6f4f3f2c35515c18331e007dfaa996944c658a7ba53e117609","observation_id":"aee8c9c7-516b-4276-869f-b4e7a917cc26","resolution":{"observed_at":"2026-05-15T04:59:46.257916Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12517","last_updated":"2025-02-10T09:37:59Z","snapshot_observed_at":"2026-08-07T19:54:09.137276Z","submitted_at":"2024-09-19T07:15:58Z","title":"Scaling FP8 training to trillion-token LLMs","version":2},"cited_work":{"arxiv_id":"2409.12517","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.12517","snapshot_observed_at":"2026-07-03T07:27:44.431731Z","title":"Scaling FP8 Training to Trillion- Token LLMs","venue":null,"work_id":"67213178-57f3-4231-9e3e-3545902d31de","year":2024},"citing_paper":{"arxiv_id":"2605.23191","last_updated":"2026-05-22T03:17:29Z","snapshot_observed_at":"2026-08-02T13:46:42.873263Z","submitted_at":"2026-05-22T03:17:29Z","title":"Expand More, Shrink Less: Shaping Effective-Rank Dynamics for Dense Scaling in Recommendation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-25T05:29:49.474591Z"},"links":{"cited_paper":"/paper/2409.12517","citing_paper":"/paper/2605.23191"},"observation_digest":"sha256:3f2b7b91651c9b2ba519b927aa5e052753f370c9236f5adf68af411078c1472f","observation_id":"ec427814-b049-427b-889c-79e1561f93b9","resolution":{"observed_at":"2026-05-25T05:30:22.650040Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12517","last_updated":"2025-02-10T09:37:59Z","snapshot_observed_at":"2026-08-07T19:54:09.137276Z","submitted_at":"2024-09-19T07:15:58Z","title":"Scaling FP8 training to trillion-token LLMs","version":2},"cited_work":{"arxiv_id":"2409.12517","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.12517","snapshot_observed_at":"2026-07-03T07:27:44.431731Z","title":"Scaling FP8 Training to Trillion- Token LLMs","venue":null,"work_id":"67213178-57f3-4231-9e3e-3545902d31de","year":2024},"citing_paper":{"arxiv_id":"2606.10493","last_updated":"2026-06-09T07:17:34Z","snapshot_observed_at":"2026-08-02T12:04:13.074478Z","submitted_at":"2026-06-09T07:17:34Z","title":"Achieving Cloud-Grade SLOs for Local Mixture-of-Experts Inference through CPU-GPU Hybrid Design","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-27T12:06:46.806138Z"},"links":{"cited_paper":"/paper/2409.12517","citing_paper":"/paper/2606.10493"},"observation_digest":"sha256:abf88e48250e13291467021528441f36fe50b31aa55702f130c06bd6470a94ad","observation_id":"04e1bcac-80e3-4b73-b29a-26833937f021","resolution":{"observed_at":"2026-07-03T07:27:44.433192Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12517","last_updated":"2025-02-10T09:37:59Z","snapshot_observed_at":"2026-08-07T19:54:09.137276Z","submitted_at":"2024-09-19T07:15:58Z","title":"Scaling FP8 training to trillion-token LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12517","snapshot_observed_at":"2026-07-11T19:17:59.044982Z","title":"Scaling fp8 training to trillion-token llms.arXiv preprint arXiv:2409.12517, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04422","last_updated":"2026-07-05T17:31:36Z","snapshot_observed_at":"2026-08-09T04:20:48.760691Z","submitted_at":"2026-07-05T17:31:36Z","title":"Full-Stack FP4: Stable LLM Pretraining with Quantized Projections, Optimizers, and Attention","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-11T19:17:59.044982Z"},"links":{"cited_paper":"/paper/2409.12517","citing_paper":"/paper/2607.04422"},"observation_digest":"sha256:8ad643914983e484dec448992cb6cfd471b019de5b991e2fec4e167d5f6b4426","observation_id":"7ae5b301-63ae-49e1-8d4e-0c59f242f88d","resolution":{"observed_at":"2026-07-11T19:17:59.044982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12517","last_updated":"2025-02-10T09:37:59Z","snapshot_observed_at":"2026-08-07T19:54:09.137276Z","submitted_at":"2024-09-19T07:15:58Z","title":"Scaling FP8 training to trillion-token LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12517","snapshot_observed_at":"2026-08-04T15:20:15.926212Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02091","last_updated":"2026-08-03T11:50:06Z","snapshot_observed_at":"2026-08-08T01:20:23.329247Z","submitted_at":"2026-08-03T11:50:06Z","title":"One QK Channel, Many Sources: Guarding Low-Precision Attention Collapse","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-04T15:20:15.926212Z"},"links":{"cited_paper":"/paper/2409.12517","citing_paper":"/paper/2608.02091"},"observation_digest":"sha256:24e844925e655292553e59ccdf312afc685e720aca93577f4a4d3762dcdc59a8","observation_id":"fc699b5a-1423-467d-977a-07cd651a73b9","resolution":{"observed_at":"2026-08-04T15:20:15.926212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2409.12517/citation-record","integrity":"/paper/2409.12517/integrity","json":"/paper/2409.12517/citation-record.json","paper":"/paper/2409.12517"},"outbound":[],"paper":{"arxiv_id":"2409.12517","last_updated":"2025-02-10T09:37:59Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T19:54:09.137276Z","submitted_at":"2024-09-19T07:15:58Z","title":"Scaling FP8 training to trillion-token LLMs"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 19 inbound Pith citation observations for arXiv:2409.12517."}