{"as_of":"2026-08-08T06:57:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0e50d9031804c3d6f81714eae8780303296d377b85d0dee629b053e92707c24a","coverage":[{"denominator":27,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":27,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:25:39.827829Z","state":"measured"},{"denominator":51,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":51,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":24,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":24,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T11:10:52.650817Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T12:59:52.409670Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.19115","last_updated":"2025-08-10T07:10:29Z","snapshot_observed_at":"2026-08-08T06:01:38.959977Z","submitted_at":"2025-05-25T12:14:25Z","title":"FP4 All the Way: Fully Quantized Training of LLMs","version":2},"cited_work":{"arxiv_id":"2505.19115","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.19115","snapshot_observed_at":"2026-07-04T12:59:52.409670Z","title":"FP4 all the way: Fully quantized training of LLMs","venue":null,"work_id":"a2961f5c-3ba7-4418-824d-f6a0e5bb4e5f","year":2025},"citing_paper":{"arxiv_id":"2512.02010","last_updated":"2026-05-09T05:39:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-01T18:59:45Z","title":"Four Over Six: More Accurate NVFP4 Quantization with Adaptive Block Scaling","version":5},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-17T02:23:01.845123Z"},"links":{"cited_paper":"/paper/2505.19115","citing_paper":"/paper/2512.02010"},"observation_digest":"sha256:89c463eb74f0f82531c7be8e32beaf85fe9dab906ad8ace01dcff4a3d2f6dca0","observation_id":"dfb348c4-4296-4725-ae96-0980ae7a7fba","resolution":{"observed_at":"2026-05-17T02:23:52.818063Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19115","last_updated":"2025-08-10T07:10:29Z","snapshot_observed_at":"2026-08-08T06:01:38.959977Z","submitted_at":"2025-05-25T12:14:25Z","title":"FP4 All the Way: Fully Quantized Training of LLMs","version":2},"cited_work":{"arxiv_id":"2505.19115","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.19115","snapshot_observed_at":"2026-07-04T12:59:52.409670Z","title":"FP4 all the way: Fully quantized training of LLMs","venue":null,"work_id":"a2961f5c-3ba7-4418-824d-f6a0e5bb4e5f","year":2025},"citing_paper":{"arxiv_id":"2512.12131","last_updated":"2026-05-11T19:05:27Z","snapshot_observed_at":"2026-08-02T10:02:28.902022Z","submitted_at":"2025-12-13T01:50:18Z","title":"BOOST: BOttleneck-Optimized Scalable Training Framework for Low-Rank Large Language Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-16T23:19:02.358348Z"},"links":{"cited_paper":"/paper/2505.19115","citing_paper":"/paper/2512.12131"},"observation_digest":"sha256:94e67378526cb543c3134e7f517d03bcacc91d246cc2e92a3c17b7cafebbc52b","observation_id":"7fdd1f00-da0c-4bdf-bd18-6930aa9d5363","resolution":{"observed_at":"2026-05-16T23:21:21.620411Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19115","last_updated":"2025-08-10T07:10:29Z","snapshot_observed_at":"2026-08-08T06:01:38.959977Z","submitted_at":"2025-05-25T12:14:25Z","title":"FP4 All the Way: Fully Quantized Training of LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19115","snapshot_observed_at":"2026-08-03T11:10:52.650817Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.07475","last_updated":"2026-07-04T06:36:53Z","snapshot_observed_at":"2026-08-07T03:15:08.762396Z","submitted_at":"2026-01-12T12:27:22Z","title":"ARCQuant: Boosting NVFP4 Quantization with Augmented Residual Channels for LLMs","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-03T11:10:52.650817Z"},"links":{"cited_paper":"/paper/2505.19115","citing_paper":"/paper/2601.07475"},"observation_digest":"sha256:301fa0632371448c09483c51359b5d88f4d5bf00b5bd0e2be446147e401f931f","observation_id":"46960556-563e-4edb-8753-6880375aa4be","resolution":{"observed_at":"2026-08-03T11:10:52.650817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19115","last_updated":"2025-08-10T07:10:29Z","snapshot_observed_at":"2026-08-08T06:01:38.959977Z","submitted_at":"2025-05-25T12:14:25Z","title":"FP4 All the Way: Fully Quantized Training of LLMs","version":2},"cited_work":{"arxiv_id":"2505.19115","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.19115","snapshot_observed_at":"2026-07-04T12:59:52.409670Z","title":"FP4 all the way: Fully quantized training of LLMs","venue":null,"work_id":"a2961f5c-3ba7-4418-824d-f6a0e5bb4e5f","year":2025},"citing_paper":{"arxiv_id":"2601.17187","last_updated":"2026-05-13T16:41:48Z","snapshot_observed_at":"2026-08-06T05:31:02.944877Z","submitted_at":"2026-01-23T21:32:44Z","title":"High-Rate Quantized Matrix Multiplication I","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-16T11:18:41.456313Z"},"links":{"cited_paper":"/paper/2505.19115","citing_paper":"/paper/2601.17187"},"observation_digest":"sha256:32d9afc58ee9bec51d5c3c54bb9f63086ed6901f82bcca0b744f186af8e98bcd","observation_id":"61097926-dfdd-4a4b-b540-c62ae915347a","resolution":{"observed_at":"2026-05-16T11:20:53.206184Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19115","last_updated":"2025-08-10T07:10:29Z","snapshot_observed_at":"2026-08-08T06:01:38.959977Z","submitted_at":"2025-05-25T12:14:25Z","title":"FP4 All the Way: Fully Quantized Training of LLMs","version":2},"cited_work":{"arxiv_id":"2505.19115","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.19115","snapshot_observed_at":"2026-07-04T12:59:52.409670Z","title":"FP4 all the way: Fully quantized training of LLMs","venue":null,"work_id":"a2961f5c-3ba7-4418-824d-f6a0e5bb4e5f","year":2025},"citing_paper":{"arxiv_id":"2604.02525","last_updated":"2026-05-07T21:33:53Z","snapshot_observed_at":"2026-07-06T22:51:53.458444Z","submitted_at":"2026-04-02T21:24:15Z","title":"AdaHOP: Fast and Accurate Low-Precision Training via Outlier-Pattern-Aware Rotation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-13T20:51:39.641700Z"},"links":{"cited_paper":"/paper/2505.19115","citing_paper":"/paper/2604.02525"},"observation_digest":"sha256:02214dc956089272b3204d7978c165d38a1378ca2f12ff85c5dc70fdda183de0","observation_id":"1ded2507-6c15-48e0-9118-f3d4b0f3adf4","resolution":{"observed_at":"2026-05-13T20:53:15.750455Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19115","last_updated":"2025-08-10T07:10:29Z","snapshot_observed_at":"2026-08-08T06:01:38.959977Z","submitted_at":"2025-05-25T12:14:25Z","title":"FP4 All the Way: Fully Quantized Training of LLMs","version":2},"cited_work":{"arxiv_id":"2505.19115","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.19115","snapshot_observed_at":"2026-07-04T12:59:52.409670Z","title":"FP4 all the way: Fully quantized training of LLMs","venue":null,"work_id":"a2961f5c-3ba7-4418-824d-f6a0e5bb4e5f","year":2025},"citing_paper":{"arxiv_id":"2604.04523","last_updated":"2026-04-06T08:35:41Z","snapshot_observed_at":"2026-07-06T22:53:29.118925Z","submitted_at":"2026-04-06T08:35:41Z","title":"LOCALUT: Harnessing Capacity-Computation Tradeoffs for LUT-Based Inference in DRAM-PIM","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T20:05:11.335715Z"},"links":{"cited_paper":"/paper/2505.19115","citing_paper":"/paper/2604.04523"},"observation_digest":"sha256:f69f6f9a907b857c3a050264144771d7fc0f14a95f4ef77aa51f3e431ad2008a","observation_id":"9936330a-b2b3-4187-a0f5-123894580e86","resolution":{"observed_at":"2026-05-10T22:15:49.608665Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19115","last_updated":"2025-08-10T07:10:29Z","snapshot_observed_at":"2026-08-08T06:01:38.959977Z","submitted_at":"2025-05-25T12:14:25Z","title":"FP4 All the Way: Fully Quantized Training of LLMs","version":2},"cited_work":{"arxiv_id":"2505.19115","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.19115","snapshot_observed_at":"2026-07-04T12:59:52.409670Z","title":"FP4 all the way: Fully quantized training of LLMs","venue":null,"work_id":"a2961f5c-3ba7-4418-824d-f6a0e5bb4e5f","year":2025},"citing_paper":{"arxiv_id":"2604.08826","last_updated":"2026-04-09T23:50:56Z","snapshot_observed_at":"2026-08-04T10:41:29.108562Z","submitted_at":"2026-04-09T23:50:56Z","title":"HiFloat4 Format for Language Model Pre-training on Ascend NPUs","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T16:49:58.735409Z"},"links":{"cited_paper":"/paper/2505.19115","citing_paper":"/paper/2604.08826"},"observation_digest":"sha256:92ae18719ff9774a15f7aaf7680490df29a8dd1909acb5ffbb5dd8bd9f852018","observation_id":"cf77dddc-4953-4186-bdba-5f030e14fe9f","resolution":{"observed_at":"2026-05-11T08:05:59.791732Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19115","last_updated":"2025-08-10T07:10:29Z","snapshot_observed_at":"2026-08-08T06:01:38.959977Z","submitted_at":"2025-05-25T12:14:25Z","title":"FP4 All the Way: Fully Quantized Training of LLMs","version":2},"cited_work":{"arxiv_id":"2505.19115","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.19115","snapshot_observed_at":"2026-07-04T12:59:52.409670Z","title":"FP4 all the way: Fully quantized training of LLMs","venue":null,"work_id":"a2961f5c-3ba7-4418-824d-f6a0e5bb4e5f","year":2025},"citing_paper":{"arxiv_id":"2605.09825","last_updated":"2026-05-14T02:08:01Z","snapshot_observed_at":"2026-07-06T23:21:54.140120Z","submitted_at":"2026-05-11T00:04:07Z","title":"Pretraining large language models with MXFP4 on Native FP4 Hardware","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-05-12T05:03:04.972344Z"},"links":{"cited_paper":"/paper/2505.19115","citing_paper":"/paper/2605.09825"},"observation_digest":"sha256:da73826565e677e90a303f1bbdb7093032e99d2e31446e31bb58549b216e3bf7","observation_id":"cdd10c52-c1dd-4880-9f07-684de0307828","resolution":{"observed_at":"2026-05-12T05:41:26.391419Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19115","last_updated":"2025-08-10T07:10:29Z","snapshot_observed_at":"2026-08-08T06:01:38.959977Z","submitted_at":"2025-05-25T12:14:25Z","title":"FP4 All the Way: Fully Quantized Training of LLMs","version":2},"cited_work":{"arxiv_id":"2505.19115","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.19115","snapshot_observed_at":"2026-07-04T12:59:52.409670Z","title":"FP4 all the way: Fully quantized training of LLMs","venue":null,"work_id":"a2961f5c-3ba7-4418-824d-f6a0e5bb4e5f","year":2025},"citing_paper":{"arxiv_id":"2605.09825","last_updated":"2026-05-14T02:08:01Z","snapshot_observed_at":"2026-07-06T23:21:54.140120Z","submitted_at":"2026-05-11T00:04:07Z","title":"Pretraining large language models with MXFP4 on Native FP4 Hardware","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-05-14T21:04:57.021482Z"},"links":{"cited_paper":"/paper/2505.19115","citing_paper":"/paper/2605.09825"},"observation_digest":"sha256:fc22679635be6392eebd7b41cf449c3fcd3c241e97e3dfe9ca32e1967d948f7a","observation_id":"29e2965f-27f3-4e26-9c0e-aa259043a244","resolution":{"observed_at":"2026-05-14T21:19:28.705236Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19115","last_updated":"2025-08-10T07:10:29Z","snapshot_observed_at":"2026-08-08T06:01:38.959977Z","submitted_at":"2025-05-25T12:14:25Z","title":"FP4 All the Way: Fully Quantized Training of LLMs","version":2},"cited_work":{"arxiv_id":"2505.19115","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.19115","snapshot_observed_at":"2026-07-04T12:59:52.409670Z","title":"FP4 all the way: Fully quantized training of LLMs","venue":null,"work_id":"a2961f5c-3ba7-4418-824d-f6a0e5bb4e5f","year":2025},"citing_paper":{"arxiv_id":"2605.09825","last_updated":"2026-05-14T02:08:01Z","snapshot_observed_at":"2026-07-06T23:21:54.140120Z","submitted_at":"2026-05-11T00:04:07Z","title":"Pretraining large language models with MXFP4 on Native FP4 Hardware","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-05-15T05:15:58.477985Z"},"links":{"cited_paper":"/paper/2505.19115","citing_paper":"/paper/2605.09825"},"observation_digest":"sha256:dd9cac36ff50217f2cdd5c90815aced77ef68397ab6722a3ae958e84b11b8cd6","observation_id":"1ec88665-dc46-4b2c-8d80-b0108fcf52c6","resolution":{"observed_at":"2026-05-15T05:19:46.442334Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19115","last_updated":"2025-08-10T07:10:29Z","snapshot_observed_at":"2026-08-08T06:01:38.959977Z","submitted_at":"2025-05-25T12:14:25Z","title":"FP4 All the Way: Fully Quantized Training of LLMs","version":2},"cited_work":{"arxiv_id":"2505.19115","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.19115","snapshot_observed_at":"2026-07-04T12:59:52.409670Z","title":"FP4 all the way: Fully quantized training of LLMs","venue":null,"work_id":"a2961f5c-3ba7-4418-824d-f6a0e5bb4e5f","year":2025},"citing_paper":{"arxiv_id":"2605.10886","last_updated":"2026-07-09T02:30:06Z","snapshot_observed_at":"2026-07-12T23:17:31.243229Z","submitted_at":"2026-05-11T17:32:29Z","title":"LoKA: Low-precision Kernel Applications for Recommendation Models At Scale","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-12T04:33:41.411292Z"},"links":{"cited_paper":"/paper/2505.19115","citing_paper":"/paper/2605.10886"},"observation_digest":"sha256:0b7ad377c62436ba65cda106dc77803e84382d0e0190de11f25f9d3f3e35a335","observation_id":"1267038f-a00a-49e0-a5b5-cfdd6ee773c3","resolution":{"observed_at":"2026-05-12T06:06:27.990594Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19115","last_updated":"2025-08-10T07:10:29Z","snapshot_observed_at":"2026-08-08T06:01:38.959977Z","submitted_at":"2025-05-25T12:14:25Z","title":"FP4 All the Way: Fully Quantized Training of LLMs","version":2},"cited_work":{"arxiv_id":"2505.19115","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.19115","snapshot_observed_at":"2026-07-04T12:59:52.409670Z","title":"FP4 all the way: Fully quantized training of LLMs","venue":null,"work_id":"a2961f5c-3ba7-4418-824d-f6a0e5bb4e5f","year":2025},"citing_paper":{"arxiv_id":"2605.10886","last_updated":"2026-07-09T02:30:06Z","snapshot_observed_at":"2026-07-12T23:17:31.243229Z","submitted_at":"2026-05-11T17:32:29Z","title":"LoKA: Low-precision Kernel Applications for Recommendation Models At Scale","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-15T04:55:01.973832Z"},"links":{"cited_paper":"/paper/2505.19115","citing_paper":"/paper/2605.10886"},"observation_digest":"sha256:46e2a32ffd1f9635a1e2be5230d42fa9a5f4a5160ca1845ca85f5e4c2d40f9b7","observation_id":"0ab41feb-246c-44f7-88d0-4dd08e440945","resolution":{"observed_at":"2026-05-15T04:59:46.247998Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19115","last_updated":"2025-08-10T07:10:29Z","snapshot_observed_at":"2026-08-08T06:01:38.959977Z","submitted_at":"2025-05-25T12:14:25Z","title":"FP4 All the Way: Fully Quantized Training of LLMs","version":2},"cited_work":{"arxiv_id":"2505.19115","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.19115","snapshot_observed_at":"2026-07-04T12:59:52.409670Z","title":"FP4 all the way: Fully quantized training of LLMs","venue":null,"work_id":"a2961f5c-3ba7-4418-824d-f6a0e5bb4e5f","year":2025},"citing_paper":{"arxiv_id":"2605.12327","last_updated":"2026-05-12T16:09:02Z","snapshot_observed_at":"2026-08-03T03:41:10.713228Z","submitted_at":"2026-05-12T16:09:02Z","title":"Grid Games: The Power of Multiple Grids for Quantizing Large Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-13T06:44:59.501345Z"},"links":{"cited_paper":"/paper/2505.19115","citing_paper":"/paper/2605.12327"},"observation_digest":"sha256:f13ae4eebaefe70c34f66d7486751715ab04648b17122eea43e1b63679a562bd","observation_id":"a4359e84-ed0e-4b79-a928-c4d1a463401f","resolution":{"observed_at":"2026-05-13T06:47:26.495623Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19115","last_updated":"2025-08-10T07:10:29Z","snapshot_observed_at":"2026-08-08T06:01:38.959977Z","submitted_at":"2025-05-25T12:14:25Z","title":"FP4 All the Way: Fully Quantized Training of LLMs","version":2},"cited_work":{"arxiv_id":"2505.19115","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.19115","snapshot_observed_at":"2026-07-04T12:59:52.409670Z","title":"FP4 all the way: Fully quantized training of LLMs","venue":null,"work_id":"a2961f5c-3ba7-4418-824d-f6a0e5bb4e5f","year":2025},"citing_paper":{"arxiv_id":"2605.12464","last_updated":"2026-05-12T17:50:08Z","snapshot_observed_at":"2026-08-02T04:50:55.914032Z","submitted_at":"2026-05-12T17:50:08Z","title":"Search Your Block Floating Point Scales!","version":1},"reference_index":109,"source":"arxiv_source","source_observed_at":"2026-05-13T05:52:26.558984Z"},"links":{"cited_paper":"/paper/2505.19115","citing_paper":"/paper/2605.12464"},"observation_digest":"sha256:0fe2d2a6b61a01ef802abe45f2f7390ff96c3382fe492918917b5c1437f50b86","observation_id":"0a970008-0572-497b-b7fb-d116e17ce35b","resolution":{"observed_at":"2026-05-13T06:02:24.114030Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19115","last_updated":"2025-08-10T07:10:29Z","snapshot_observed_at":"2026-08-08T06:01:38.959977Z","submitted_at":"2025-05-25T12:14:25Z","title":"FP4 All the Way: Fully Quantized Training of LLMs","version":2},"cited_work":{"arxiv_id":"2505.19115","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.19115","snapshot_observed_at":"2026-07-04T12:59:52.409670Z","title":"FP4 all the way: Fully quantized training of LLMs","venue":null,"work_id":"a2961f5c-3ba7-4418-824d-f6a0e5bb4e5f","year":2025},"citing_paper":{"arxiv_id":"2605.18739","last_updated":"2026-05-19T17:46:12Z","snapshot_observed_at":"2026-07-06T23:29:33.702647Z","submitted_at":"2026-05-18T17:57:03Z","title":"LongLive-2.0: An NVFP4 Parallel Infrastructure for Long Video Generation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-20T11:02:39.465293Z"},"links":{"cited_paper":"/paper/2505.19115","citing_paper":"/paper/2605.18739"},"observation_digest":"sha256:1f5b0b0477eb6558a7eec0410eae7d4a6c06baeb4e8f57b6e9c3712de5343a69","observation_id":"e1798ca2-e196-49f9-a62b-e97776136ad9","resolution":{"observed_at":"2026-05-20T11:03:13.286141Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19115","last_updated":"2025-08-10T07:10:29Z","snapshot_observed_at":"2026-08-08T06:01:38.959977Z","submitted_at":"2025-05-25T12:14:25Z","title":"FP4 All the Way: Fully Quantized Training of LLMs","version":2},"cited_work":{"arxiv_id":"2505.19115","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.19115","snapshot_observed_at":"2026-07-04T12:59:52.409670Z","title":"FP4 all the way: Fully quantized training of LLMs","venue":null,"work_id":"a2961f5c-3ba7-4418-824d-f6a0e5bb4e5f","year":2025},"citing_paper":{"arxiv_id":"2605.20402","last_updated":"2026-06-02T02:26:08Z","snapshot_observed_at":"2026-08-03T02:25:20.739566Z","submitted_at":"2026-05-19T18:59:26Z","title":"Decomposing MXFP4 quantization error for LLM reinforcement learning: reducible bias, recoverable deadzone, and an irreducible floor","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-05-21T07:59:43.755196Z"},"links":{"cited_paper":"/paper/2505.19115","citing_paper":"/paper/2605.20402"},"observation_digest":"sha256:e03dc4906a824c710371d6e418c07a974b57f304547f04159fc963477eff9e1e","observation_id":"08066668-74ff-4291-a7c5-ae89e48f4375","resolution":{"observed_at":"2026-05-21T07:59:50.040245Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19115","last_updated":"2025-08-10T07:10:29Z","snapshot_observed_at":"2026-08-08T06:01:38.959977Z","submitted_at":"2025-05-25T12:14:25Z","title":"FP4 All the Way: Fully Quantized Training of LLMs","version":2},"cited_work":{"arxiv_id":"2505.19115","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.19115","snapshot_observed_at":"2026-07-04T12:59:52.409670Z","title":"FP4 all the way: Fully quantized training of LLMs","venue":null,"work_id":"a2961f5c-3ba7-4418-824d-f6a0e5bb4e5f","year":2025},"citing_paper":{"arxiv_id":"2605.20402","last_updated":"2026-06-02T02:26:08Z","snapshot_observed_at":"2026-08-03T02:25:20.739566Z","submitted_at":"2026-05-19T18:59:26Z","title":"Decomposing MXFP4 quantization error for LLM reinforcement learning: reducible bias, recoverable deadzone, and an irreducible floor","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-05-25T05:49:08.484663Z"},"links":{"cited_paper":"/paper/2505.19115","citing_paper":"/paper/2605.20402"},"observation_digest":"sha256:30a707098416ac295db9828275e0fa14373f22998ae4854f9bea67b440ce8b96","observation_id":"87a77ead-3487-4ab2-b95c-8e45c8563012","resolution":{"observed_at":"2026-05-25T05:50:23.699203Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19115","last_updated":"2025-08-10T07:10:29Z","snapshot_observed_at":"2026-08-08T06:01:38.959977Z","submitted_at":"2025-05-25T12:14:25Z","title":"FP4 All the Way: Fully Quantized Training of LLMs","version":2},"cited_work":{"arxiv_id":"2505.19115","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.19115","snapshot_observed_at":"2026-07-04T12:59:52.409670Z","title":"FP4 all the way: Fully quantized training of LLMs","venue":null,"work_id":"a2961f5c-3ba7-4418-824d-f6a0e5bb4e5f","year":2025},"citing_paper":{"arxiv_id":"2605.20402","last_updated":"2026-06-02T02:26:08Z","snapshot_observed_at":"2026-08-03T02:25:20.739566Z","submitted_at":"2026-05-19T18:59:26Z","title":"Decomposing MXFP4 quantization error for LLM reinforcement learning: reducible bias, recoverable deadzone, and an irreducible floor","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-06-30T18:01:38.509794Z"},"links":{"cited_paper":"/paper/2505.19115","citing_paper":"/paper/2605.20402"},"observation_digest":"sha256:09147961f2b1e835af72910554ad04e7ad0eea3823d93feb90b5e871ccb06a4c","observation_id":"0dc9c0c0-3f62-43fc-a49a-80d9f308bc8c","resolution":{"observed_at":"2026-06-30T18:04:57.963897Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19115","last_updated":"2025-08-10T07:10:29Z","snapshot_observed_at":"2026-08-08T06:01:38.959977Z","submitted_at":"2025-05-25T12:14:25Z","title":"FP4 All the Way: Fully Quantized Training of LLMs","version":2},"cited_work":{"arxiv_id":"2505.19115","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.19115","snapshot_observed_at":"2026-07-04T12:59:52.409670Z","title":"FP4 all the way: Fully quantized training of LLMs","venue":null,"work_id":"a2961f5c-3ba7-4418-824d-f6a0e5bb4e5f","year":2025},"citing_paper":{"arxiv_id":"2605.23081","last_updated":"2026-05-21T22:28:27Z","snapshot_observed_at":"2026-08-04T11:05:52.350024Z","submitted_at":"2026-05-21T22:28:27Z","title":"ThriftAttention: Selective Mixed Precision for Long-Context FP4 Attention","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-25T05:28:40.888215Z"},"links":{"cited_paper":"/paper/2505.19115","citing_paper":"/paper/2605.23081"},"observation_digest":"sha256:c786529c827c4472c57b0ee73ff47638f4f57423d460a9ea14791afb2f4e12ed","observation_id":"85e19bbb-5c93-4ce5-a232-91a91599ee77","resolution":{"observed_at":"2026-05-25T05:30:22.853160Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19115","last_updated":"2025-08-10T07:10:29Z","snapshot_observed_at":"2026-08-08T06:01:38.959977Z","submitted_at":"2025-05-25T12:14:25Z","title":"FP4 All the Way: Fully Quantized Training of LLMs","version":2},"cited_work":{"arxiv_id":"2505.19115","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.19115","snapshot_observed_at":"2026-07-04T12:59:52.409670Z","title":"FP4 all the way: Fully quantized training of LLMs","venue":null,"work_id":"a2961f5c-3ba7-4418-824d-f6a0e5bb4e5f","year":2025},"citing_paper":{"arxiv_id":"2605.27616","last_updated":"2026-05-26T19:29:37Z","snapshot_observed_at":"2026-08-04T02:03:56.319527Z","submitted_at":"2026-05-26T19:29:37Z","title":"Not All NVFP4 QAT Recipes Are Equal: How Architecture and Scale Shape Model Quality for Anomaly Segmentation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-29T18:12:36.883817Z"},"links":{"cited_paper":"/paper/2505.19115","citing_paper":"/paper/2605.27616"},"observation_digest":"sha256:af0347c12ba7387d29c14ddf4df622e71deec82df5086004710692dabf57b22c","observation_id":"84eea01a-7c74-45e3-8444-e8d51f9d72a2","resolution":{"observed_at":"2026-06-29T18:13:48.341253Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19115","last_updated":"2025-08-10T07:10:29Z","snapshot_observed_at":"2026-08-08T06:01:38.959977Z","submitted_at":"2025-05-25T12:14:25Z","title":"FP4 All the Way: Fully Quantized Training of LLMs","version":2},"cited_work":{"arxiv_id":"2505.19115","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.19115","snapshot_observed_at":"2026-07-04T12:59:52.409670Z","title":"FP4 all the way: Fully quantized training of LLMs","venue":null,"work_id":"a2961f5c-3ba7-4418-824d-f6a0e5bb4e5f","year":2025},"citing_paper":{"arxiv_id":"2606.26587","last_updated":"2026-06-25T04:19:04Z","snapshot_observed_at":"2026-08-02T10:04:20.542320Z","submitted_at":"2026-06-25T04:19:04Z","title":"SharQ: Bridging Activation Sparsity and FP4 Quantization for LLM Inference","version":1},"reference_index":175,"source":"arxiv_source","source_observed_at":"2026-06-26T05:41:39.052865Z"},"links":{"cited_paper":"/paper/2505.19115","citing_paper":"/paper/2606.26587"},"observation_digest":"sha256:aebcf456aa6ea7353f1aebb63e4f8b6e30abeb936e9bdf13b6b4eb588a47d357","observation_id":"4de64193-bee7-4a9f-803a-d7294170eab0","resolution":{"observed_at":"2026-07-04T12:59:52.410951Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19115","last_updated":"2025-08-10T07:10:29Z","snapshot_observed_at":"2026-08-08T06:01:38.959977Z","submitted_at":"2025-05-25T12:14:25Z","title":"FP4 All the Way: Fully Quantized Training of LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19115","snapshot_observed_at":"2026-07-11T19:17:59.044982Z","title":"Fp4 all the way: Fully quantized training of llms.arXiv preprint arXiv:2505.19115, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04422","last_updated":"2026-07-05T17:31:36Z","snapshot_observed_at":"2026-08-04T03:31:46.106169Z","submitted_at":"2026-07-05T17:31:36Z","title":"Full-Stack FP4: Stable LLM Pretraining with Quantized Projections, Optimizers, and Attention","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-11T19:17:59.044982Z"},"links":{"cited_paper":"/paper/2505.19115","citing_paper":"/paper/2607.04422"},"observation_digest":"sha256:a85df1a0702098a7ff9c19f173172b0915dad8c06aa65f0e30cbf9629903615b","observation_id":"5eedd8b1-b69f-4922-9e04-185ae5971f29","resolution":{"observed_at":"2026-07-11T19:17:59.044982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19115","last_updated":"2025-08-10T07:10:29Z","snapshot_observed_at":"2026-08-08T06:01:38.959977Z","submitted_at":"2025-05-25T12:14:25Z","title":"FP4 All the Way: Fully Quantized Training of LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19115","snapshot_observed_at":"2026-07-31T05:04:00.326163Z","title":"Fp4 all the way: Fully quantized training of llms.arXiv preprint arXiv:2505.19115, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24953","last_updated":"2026-07-27T18:03:34Z","snapshot_observed_at":"2026-08-02T14:17:58.928914Z","submitted_at":"2026-07-27T18:03:34Z","title":"Stable FP4 Training via Transposition-Invariant Block Quantization","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-31T05:04:00.326163Z"},"links":{"cited_paper":"/paper/2505.19115","citing_paper":"/paper/2607.24953"},"observation_digest":"sha256:ab9cef90718bb1733ff1e0e720b98f33f6b0cd76e3c2451e8f57998119bdc552","observation_id":"29efcb24-d89d-486f-9773-2cb109c39845","resolution":{"observed_at":"2026-07-31T05:04:00.326163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19115","last_updated":"2025-08-10T07:10:29Z","snapshot_observed_at":"2026-08-08T06:01:38.959977Z","submitted_at":"2025-05-25T12:14:25Z","title":"FP4 All the Way: Fully Quantized Training of LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19115","snapshot_observed_at":"2026-08-01T03:16:46.760453Z","title":"Fp4 all the way: Fully quantized training of llms,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27694","last_updated":"2026-07-30T05:26:20Z","snapshot_observed_at":"2026-08-06T21:37:30.089385Z","submitted_at":"2026-07-30T05:26:20Z","title":"GyRot: Leveraging Hidden Synergy between Rotation and Fine-grained Group Quantization for Low-bit LLM Inference","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T03:16:46.760453Z"},"links":{"cited_paper":"/paper/2505.19115","citing_paper":"/paper/2607.27694"},"observation_digest":"sha256:26afcb05907b731f66945987696fd538fa0227eddc471a0ec0f1bebfc81a0d64","observation_id":"13cde71f-d6e9-4a27-a796-673ee2f73819","resolution":{"observed_at":"2026-08-01T03:16:46.760453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.19115/citation-record","integrity":"/paper/2505.19115/integrity","json":"/paper/2505.19115/citation-record.json","paper":"/paper/2505.19115"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:41.760370Z","title":"URL https://resources.nvidia.com/ en-us-blackwell-architecture","venue":null,"work_id":"39d54533-8e73-4857-862c-db53b2ea82af","year":null},"citing_paper":{"arxiv_id":"2505.19115","last_updated":"2025-08-10T07:10:29Z","snapshot_observed_at":"2026-08-08T06:01:38.959977Z","submitted_at":"2025-05-25T12:14:25Z","title":"FP4 All the Way: Fully Quantized Training of LLMs","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:37.594428Z"},"links":{"citing_paper":"/paper/2505.19115"},"observation_digest":"sha256:7d494b1a7c2613741be7067e01f063539619ae9ca40bd7f9449c4a5cf8059aa8","observation_id":"6ba406ad-82b3-45e9-bc82-6741b521057b","resolution":{"observed_at":"2026-08-07T14:25:41.835562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:37.624166Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2505.19115","last_updated":"2025-08-10T07:10:29Z","snapshot_observed_at":"2026-08-08T06:01:38.959977Z","submitted_at":"2025-05-25T12:14:25Z","title":"FP4 All the Way: Fully Quantized Training of LLMs","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:37.624166Z"},"links":{"citing_paper":"/paper/2505.19115"},"observation_digest":"sha256:dd7b18e233d2a12888c11c16f6918305791939d8c4a15820b625ebe08283d5e8","observation_id":"4f76d78e-30d7-4b61-93db-f8e70456bda1","resolution":{"observed_at":"2026-08-07T14:25:37.624166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05516","last_updated":"2024-10-08T02:02:35Z","snapshot_observed_at":"2026-07-06T16:16:56.609388Z","submitted_at":"2023-09-11T14:58:23Z","title":"Optimize Weight Rounding via Signed Gradient Descent for the Quantization of LLMs","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05516","snapshot_observed_at":"2026-08-07T14:25:37.677654Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19115","last_updated":"2025-08-10T07:10:29Z","snapshot_observed_at":"2026-08-08T06:01:38.959977Z","submitted_at":"2025-05-25T12:14:25Z","title":"FP4 All the Way: Fully Quantized Training of LLMs","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:37.677654Z"},"links":{"cited_paper":"/paper/2309.05516","citing_paper":"/paper/2505.19115"},"observation_digest":"sha256:d1ba14c807b64e1379cbd392a9b95121de189b8fbc44b6f5f02cc80e93df3df8","observation_id":"13897263-99c9-41a4-b548-2c9e10523d40","resolution":{"observed_at":"2026-08-07T14:25:37.677654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:41.538362Z","title":"Accurate neural training with 4-bit matrix multiplications at standard formats","venue":null,"work_id":"7168281d-6849-4cb3-b504-46a0302956e0","year":2021},"citing_paper":{"arxiv_id":"2505.19115","last_updated":"2025-08-10T07:10:29Z","snapshot_observed_at":"2026-08-08T06:01:38.959977Z","submitted_at":"2025-05-25T12:14:25Z","title":"FP4 All the Way: Fully Quantized Training of LLMs","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:37.777003Z"},"links":{"citing_paper":"/paper/2505.19115"},"observation_digest":"sha256:87d13990d17c1c5d6960237aac9a2d3b761ab9e2eb4f1ea6ff081ba7d73536bd","observation_id":"e68648de-15dd-4880-904d-14948d9d7bdb","resolution":{"observed_at":"2026-08-07T14:25:41.630104Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:37.839077Z","title":"Redpajama: an open dataset for training large language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19115","last_updated":"2025-08-10T07:10:29Z","snapshot_observed_at":"2026-08-08T06:01:38.959977Z","submitted_at":"2025-05-25T12:14:25Z","title":"FP4 All the Way: Fully Quantized Training of LLMs","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:37.839077Z"},"links":{"citing_paper":"/paper/2505.19115"},"observation_digest":"sha256:bb2d794a50c71a31bbefa2f1cafa9181edcd7afe6b680a31c17c4fabf618776d","observation_id":"b5e8933b-569f-4855-a39b-e475714a1e94","resolution":{"observed_at":"2026-08-07T14:25:37.839077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-07T14:25:37.906504Z","title":"Zhang, Han Bao, Hanwei Xu, Haocheng Wang, Haowei Zhang, Honghui Ding, Huajian Xin, Huazuo Gao, Hui Li, Hui Qu, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19115","last_updated":"2025-08-10T07:10:29Z","snapshot_observed_at":"2026-08-08T06:01:38.959977Z","submitted_at":"2025-05-25T12:14:25Z","title":"FP4 All the Way: Fully Quantized Training of LLMs","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:37.906504Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2505.19115"},"observation_digest":"sha256:f3770242ae6538ca62a2f4ce902e8d1cf4d9a4fd5a3d87adc072670b8d723435","observation_id":"28ca5bca-76b3-421a-ad43-ce8d50a21959","resolution":{"observed_at":"2026-08-07T14:25:37.906504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14314","last_updated":"2023-05-23T17:50:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-23T17:50:33Z","title":"QLoRA: Efficient Finetuning of Quantized LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14314","snapshot_observed_at":"2026-08-07T14:25:37.978555Z","title":"Qlora: Efficient finetun- ing of quantized llms","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19115","last_updated":"2025-08-10T07:10:29Z","snapshot_observed_at":"2026-08-08T06:01:38.959977Z","submitted_at":"2025-05-25T12:14:25Z","title":"FP4 All the Way: Fully Quantized Training of LLMs","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:37.978555Z"},"links":{"cited_paper":"/paper/2305.14314","citing_paper":"/paper/2505.19115"},"observation_digest":"sha256:74b1967a1dd2f9c40d35030f73972e0f14a4444e179459e59ff4fc5d8b43f2de","observation_id":"5d0176b9-a51c-4080-a674-fd9011da3652","resolution":{"observed_at":"2026-08-07T14:25:37.978555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12517","last_updated":"2025-02-10T09:37:59Z","snapshot_observed_at":"2026-08-07T19:54:09.137276Z","submitted_at":"2024-09-19T07:15:58Z","title":"Scaling FP8 training to trillion-token LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12517","snapshot_observed_at":"2026-08-07T14:25:38.069250Z","title":"Scaling fp8 training to trillion-token llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19115","last_updated":"2025-08-10T07:10:29Z","snapshot_observed_at":"2026-08-08T06:01:38.959977Z","submitted_at":"2025-05-25T12:14:25Z","title":"FP4 All the Way: Fully Quantized Training of LLMs","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:38.069250Z"},"links":{"cited_paper":"/paper/2409.12517","citing_paper":"/paper/2505.19115"},"observation_digest":"sha256:16a85a074e9777bb1b2896af12ee66ab4a63bf5b0dd9bbdfdb44a6dc78e4e806","observation_id":"f59b69c3-0296-407c-b2e7-12e45dd8d740","resolution":{"observed_at":"2026-08-07T14:25:38.069250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.17323","last_updated":"2023-03-22T13:10:47Z","snapshot_observed_at":"2026-08-07T08:38:54.025062Z","submitted_at":"2022-10-31T13:42:40Z","title":"GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.17323","snapshot_observed_at":"2026-08-07T14:25:38.148834Z","title":"Gptq: Accurate post-training quantization for generative pre-trained transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19115","last_updated":"2025-08-10T07:10:29Z","snapshot_observed_at":"2026-08-08T06:01:38.959977Z","submitted_at":"2025-05-25T12:14:25Z","title":"FP4 All the Way: Fully Quantized Training of LLMs","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:38.148834Z"},"links":{"cited_paper":"/paper/2210.17323","citing_paper":"/paper/2505.19115"},"observation_digest":"sha256:4ef135a88c170c0d9d5626e2550930f16792b3dd069ed7280b28e0db8ff30b1c","observation_id":"f7b9a476-e921-4eb2-a7ee-873421f5dc5b","resolution":{"observed_at":"2026-08-07T14:25:38.148834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1902.03129","last_updated":"2019-10-08T09:28:43Z","snapshot_observed_at":"2026-08-05T21:24:52.219584Z","submitted_at":"2019-02-07T03:18:54Z","title":"Towards Automatic Concept-based Explanations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1902.03129","snapshot_observed_at":"2026-08-07T14:25:38.226601Z","title":"Automating interpretability: Discovering and testing visual concepts learned by neural networks","venue":null,"work_id":null,"year":1902},"citing_paper":{"arxiv_id":"2505.19115","last_updated":"2025-08-10T07:10:29Z","snapshot_observed_at":"2026-08-08T06:01:38.959977Z","submitted_at":"2025-05-25T12:14:25Z","title":"FP4 All the Way: Fully Quantized Training of LLMs","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:38.226601Z"},"links":{"cited_paper":"/paper/1902.03129","citing_paper":"/paper/2505.19115"},"observation_digest":"sha256:636fa6a6c39beaa396dc8a09104ad515ea08961a9dd48e3fbdb695f7284a09cc","observation_id":"7cbc7242-0508-417f-a06a-82983dde6859","resolution":{"observed_at":"2026-08-07T14:25:38.226601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:41.259032Z","title":"Awq: Activation-aware weight quantization for on-device llm compression and acceleration","venue":null,"work_id":"c74961b6-2786-4f03-b978-a2567c266e9a","year":2023},"citing_paper":{"arxiv_id":"2505.19115","last_updated":"2025-08-10T07:10:29Z","snapshot_observed_at":"2026-08-08T06:01:38.959977Z","submitted_at":"2025-05-25T12:14:25Z","title":"FP4 All the Way: Fully Quantized Training of LLMs","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:38.314625Z"},"links":{"citing_paper":"/paper/2505.19115"},"observation_digest":"sha256:5099be7c35b1090d3e1c12d1ba926959e4ae69b33a40aebebeeeeff491cc6067","observation_id":"8f6e53c3-4769-4199-b206-286d11800f20","resolution":{"observed_at":"2026-08-07T14:25:41.407060Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05003","last_updated":"2025-06-10T18:01:40Z","snapshot_observed_at":"2026-07-06T20:32:52.772976Z","submitted_at":"2025-02-07T15:23:34Z","title":"QuEST: Stable Training of LLMs with 1-Bit Weights and Activations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05003","snapshot_observed_at":"2026-08-07T14:25:38.408806Z","title":"Castro, Mahdi Nikdan, and Dan Alis- tarh","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19115","last_updated":"2025-08-10T07:10:29Z","snapshot_observed_at":"2026-08-08T06:01:38.959977Z","submitted_at":"2025-05-25T12:14:25Z","title":"FP4 All the Way: Fully Quantized Training of LLMs","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:38.408806Z"},"links":{"cited_paper":"/paper/2502.05003","citing_paper":"/paper/2505.19115"},"observation_digest":"sha256:972d587d094486abbbaf517f5c8aae02ebd106da74a67eccc6a8e118ffff6329","observation_id":"8d5d4d8a-3600-43c7-8af9-e07044b03515","resolution":{"observed_at":"2026-08-07T14:25:38.408806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.18313","last_updated":"2023-12-19T12:27:58Z","snapshot_observed_at":"2026-08-07T11:12:18.020559Z","submitted_at":"2023-10-27T17:59:51Z","title":"FP8-LM: Training FP8 Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.18313","snapshot_observed_at":"2026-08-07T14:25:38.586190Z","title":"Fp8-lm: Training fp8 large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19115","last_updated":"2025-08-10T07:10:29Z","snapshot_observed_at":"2026-08-08T06:01:38.959977Z","submitted_at":"2025-05-25T12:14:25Z","title":"FP4 All the Way: Fully Quantized Training of LLMs","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:38.586190Z"},"links":{"cited_paper":"/paper/2310.18313","citing_paper":"/paper/2505.19115"},"observation_digest":"sha256:61851db1cb76c5f6a0d90a6a834980d48be77e32a88da2a3900db81e0a3d143c","observation_id":"cadca501-3ecf-453d-89b4-51f13c108a8d","resolution":{"observed_at":"2026-08-07T14:25:38.586190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:40.945389Z","title":"Nonlinear random matrix theory for deep learning","venue":null,"work_id":"fc85c030-3ee0-4e9d-a662-1025ca59cc88","year":2017},"citing_paper":{"arxiv_id":"2505.19115","last_updated":"2025-08-10T07:10:29Z","snapshot_observed_at":"2026-08-08T06:01:38.959977Z","submitted_at":"2025-05-25T12:14:25Z","title":"FP4 All the Way: Fully Quantized Training of LLMs","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:38.661370Z"},"links":{"citing_paper":"/paper/2505.19115"},"observation_digest":"sha256:4b42836f892ce2c492007e0650a6ea12a7770bb4e5083ddb1baad864a6a342f8","observation_id":"9ea209cf-3319-439a-9e0f-50606cd2b962","resolution":{"observed_at":"2026-08-07T14:25:41.030042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10537","last_updated":"2023-10-19T16:38:33Z","snapshot_observed_at":"2026-08-08T01:04:32.134805Z","submitted_at":"2023-10-16T16:07:41Z","title":"Microscaling Data Formats for Deep Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10537","snapshot_observed_at":"2026-08-07T14:25:38.750726Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19115","last_updated":"2025-08-10T07:10:29Z","snapshot_observed_at":"2026-08-08T06:01:38.959977Z","submitted_at":"2025-05-25T12:14:25Z","title":"FP4 All the Way: Fully Quantized Training of LLMs","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:38.750726Z"},"links":{"cited_paper":"/paper/2310.10537","citing_paper":"/paper/2505.19115"},"observation_digest":"sha256:528daafe89e8d7525650e55557cb6e603fbc2e5ed817370fa8fb67763d594002","observation_id":"7b4d5fc0-00e7-4635-bd23-bcd65a4c4de4","resolution":{"observed_at":"2026-08-07T14:25:38.750726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.04454","last_updated":"2018-05-07T15:43:39Z","snapshot_observed_at":"2026-07-30T23:08:51.956017Z","submitted_at":"2017-06-14T12:50:00Z","title":"Empirical Analysis of the Hessian of Over-Parametrized Neural Networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.04454","snapshot_observed_at":"2026-08-07T14:25:38.845174Z","title":"Ugur Güney, Yann Dauphin, and Léon Bottou","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.19115","last_updated":"2025-08-10T07:10:29Z","snapshot_observed_at":"2026-08-08T06:01:38.959977Z","submitted_at":"2025-05-25T12:14:25Z","title":"FP4 All the Way: Fully Quantized Training of LLMs","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:38.845174Z"},"links":{"cited_paper":"/paper/1706.04454","citing_paper":"/paper/2505.19115"},"observation_digest":"sha256:25dabfa85d08f05adf449aed02a5e8445c8888cdf37f437f8ebdff54590f8460","observation_id":"331594bd-b301-4f6c-8a28-039754152a95","resolution":{"observed_at":"2026-08-07T14:25:38.845174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:38.942131Z","title":"Roformer: Enhanced transformer with rotary position embedding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19115","last_updated":"2025-08-10T07:10:29Z","snapshot_observed_at":"2026-08-08T06:01:38.959977Z","submitted_at":"2025-05-25T12:14:25Z","title":"FP4 All the Way: Fully Quantized Training of LLMs","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:38.942131Z"},"links":{"citing_paper":"/paper/2505.19115"},"observation_digest":"sha256:59cd05900010c986cc6ef463f17d66d36a648ec224ac8aa16eff03bd129d20cb","observation_id":"5fe26c97-1248-42e6-9e80-50d32788f270","resolution":{"observed_at":"2026-08-07T14:25:38.942131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T14:25:39.054033Z","title":"Stone, Peter Albert, Amjad Almahairi, Yasmine Babaei, Nikolay Bashlykov, Soumya Batra, Prajjwal Bhargava, Shruti Bhosale, Daniel M","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19115","last_updated":"2025-08-10T07:10:29Z","snapshot_observed_at":"2026-08-08T06:01:38.959977Z","submitted_at":"2025-05-25T12:14:25Z","title":"FP4 All the Way: Fully Quantized Training of LLMs","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:39.054033Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2505.19115"},"observation_digest":"sha256:59d4147135d3c5f685972be844bd52bca5f80def18d6066c73d43bcf158df911","observation_id":"5abf3f54-e5ea-4017-9b9b-51e609510ed1","resolution":{"observed_at":"2026-08-07T14:25:39.054033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.20586","last_updated":"2025-08-26T23:08:09Z","snapshot_observed_at":"2026-08-07T17:41:27.066746Z","submitted_at":"2025-02-27T23:01:31Z","title":"Training LLMs with MXFP4","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.20586","snapshot_observed_at":"2026-08-07T14:25:39.162969Z","title":"Training llms with mxfp4","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19115","last_updated":"2025-08-10T07:10:29Z","snapshot_observed_at":"2026-08-08T06:01:38.959977Z","submitted_at":"2025-05-25T12:14:25Z","title":"FP4 All the Way: Fully Quantized Training of LLMs","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:39.162969Z"},"links":{"cited_paper":"/paper/2502.20586","citing_paper":"/paper/2505.19115"},"observation_digest":"sha256:0db5538f11b00d42efa0486274ed1624e18af43e92b0e20da486a1166a8d1943","observation_id":"30346e9c-fc01-46c8-b573-e6a49430264e","resolution":{"observed_at":"2026-08-07T14:25:39.162969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11453","last_updated":"2023-10-17T17:59:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-17T17:59:15Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11453","snapshot_observed_at":"2026-08-07T14:25:39.407120Z","title":"Bitnet: Scaling 1-bit transformers for large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19115","last_updated":"2025-08-10T07:10:29Z","snapshot_observed_at":"2026-08-08T06:01:38.959977Z","submitted_at":"2025-05-25T12:14:25Z","title":"FP4 All the Way: Fully Quantized Training of LLMs","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:39.407120Z"},"links":{"cited_paper":"/paper/2310.11453","citing_paper":"/paper/2505.19115"},"observation_digest":"sha256:23e05555372d44d75c507236d61598afc5e990d18ce0e00053134856e781d979","observation_id":"87270417-b027-4778-91be-96be6f139905","resolution":{"observed_at":"2026-08-07T14:25:39.407120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:40.786274Z","title":null,"venue":null,"work_id":"f8d66f6b-b3f4-4276-b6c3-6da13d95a5c4","year":null},"citing_paper":{"arxiv_id":"2505.19115","last_updated":"2025-08-10T07:10:29Z","snapshot_observed_at":"2026-08-08T06:01:38.959977Z","submitted_at":"2025-05-25T12:14:25Z","title":"FP4 All the Way: Fully Quantized Training of LLMs","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:39.289948Z"},"links":{"citing_paper":"/paper/2505.19115"},"observation_digest":"sha256:9cfea8f2ef6b8f7d50efcb3baddb47c305eec33ec126783f58cc3c7aad85c301","observation_id":"f2d37f27-6c2b-4f9a-8009-abfb75ab3631","resolution":{"observed_at":"2026-08-07T14:25:40.851425Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.10438","last_updated":"2024-03-29T19:21:58Z","snapshot_observed_at":"2026-08-07T09:04:32.994880Z","submitted_at":"2022-11-18T18:59:33Z","title":"SmoothQuant: Accurate and Efficient Post-Training Quantization for Large Language Models","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.10438","snapshot_observed_at":"2026-08-07T14:25:39.599677Z","title":"Smoothquant: Accu- rate and efficient post-training quantization for large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19115","last_updated":"2025-08-10T07:10:29Z","snapshot_observed_at":"2026-08-08T06:01:38.959977Z","submitted_at":"2025-05-25T12:14:25Z","title":"FP4 All the Way: Fully Quantized Training of LLMs","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:39.599677Z"},"links":{"cited_paper":"/paper/2211.10438","citing_paper":"/paper/2505.19115"},"observation_digest":"sha256:92f4877ad32262b09692ba50f97ae2c2bbe5305344428c3d891f04e9c1189874","observation_id":"476290e5-da91-4c8b-9712-a27c3547cc4f","resolution":{"observed_at":"2026-08-07T14:25:39.599677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17116","last_updated":"2025-05-23T09:44:25Z","snapshot_observed_at":"2026-08-02T15:17:06.428629Z","submitted_at":"2025-01-28T18:04:50Z","title":"Optimizing Large Language Model Training Using FP4 Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17116","snapshot_observed_at":"2026-08-07T14:25:39.524611Z","title":"Optimizing large language model training using fp4 quantization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19115","last_updated":"2025-08-10T07:10:29Z","snapshot_observed_at":"2026-08-08T06:01:38.959977Z","submitted_at":"2025-05-25T12:14:25Z","title":"FP4 All the Way: Fully Quantized Training of LLMs","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:39.524611Z"},"links":{"cited_paper":"/paper/2501.17116","citing_paper":"/paper/2505.19115"},"observation_digest":"sha256:e37e20096096b90bb09ae1e966844c1e6851d5708832802d18b9e7d1dda46627","observation_id":"d81d5031-9355-4cbc-b0ec-e6d68c58ae2f","resolution":{"observed_at":"2026-08-07T14:25:39.524611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:40.394019Z","title":"Root mean square layer normalization","venue":null,"work_id":"37b85fd6-6194-4637-8906-0758071762d4","year":2019},"citing_paper":{"arxiv_id":"2505.19115","last_updated":"2025-08-10T07:10:29Z","snapshot_observed_at":"2026-08-08T06:01:38.959977Z","submitted_at":"2025-05-25T12:14:25Z","title":"FP4 All the Way: Fully Quantized Training of LLMs","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:39.782691Z"},"links":{"citing_paper":"/paper/2505.19115"},"observation_digest":"sha256:939ed7e095273b051c59872207395717e9a7130a2e1c34eebab3485b82b544a8","observation_id":"511862f2-1152-49b1-8f15-8a32debae8db","resolution":{"observed_at":"2026-08-07T14:25:40.481483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:40.246884Z","title":"useful descent","venue":null,"work_id":"b8abfecb-3952-40e4-b054-bc2e00207c72","year":null},"citing_paper":{"arxiv_id":"2505.19115","last_updated":"2025-08-10T07:10:29Z","snapshot_observed_at":"2026-08-08T06:01:38.959977Z","submitted_at":"2025-05-25T12:14:25Z","title":"FP4 All the Way: Fully Quantized Training of LLMs","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:39.827829Z"},"links":{"citing_paper":"/paper/2505.19115"},"observation_digest":"sha256:e1d24615bc90306695766fff96f15cadafaebb90a5c456739a5abef3f3c695ee","observation_id":"0ae21ed9-17b4-48d4-9155-936cc9b0febe","resolution":{"observed_at":"2026-08-07T14:25:40.278888Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:40.608320Z","title":null,"venue":null,"work_id":"18d2b0a9-c629-4ad8-b5b0-6061f016f104","year":null},"citing_paper":{"arxiv_id":"2505.19115","last_updated":"2025-08-10T07:10:29Z","snapshot_observed_at":"2026-08-08T06:01:38.959977Z","submitted_at":"2025-05-25T12:14:25Z","title":"FP4 All the Way: Fully Quantized Training of LLMs","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:39.720611Z"},"links":{"citing_paper":"/paper/2505.19115"},"observation_digest":"sha256:e016c779f70ab1873a2ecd085a606c69fa978ee8c416a3b6961d1a7c47c7936c","observation_id":"01e5c2e3-bc79-4150-b62c-359f7c966eb5","resolution":{"observed_at":"2026-08-07T14:25:40.738238Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:41.073214Z","title":null,"venue":null,"work_id":"499901e3-24bc-444e-a182-efb9e9e300ea","year":null},"citing_paper":{"arxiv_id":"2505.19115","last_updated":"2025-08-10T07:10:29Z","snapshot_observed_at":"2026-08-08T06:01:38.959977Z","submitted_at":"2025-05-25T12:14:25Z","title":"FP4 All the Way: Fully Quantized Training of LLMs","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:38.508222Z"},"links":{"citing_paper":"/paper/2505.19115"},"observation_digest":"sha256:b187de15d2b55d22d9780f3f60b807fa95e693fd8fe4064cd494f2213093f562","observation_id":"7f3ac726-250d-44dd-82a3-daac1d91ea40","resolution":{"observed_at":"2026-08-07T14:25:41.141357Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.19115","last_updated":"2025-08-10T07:10:29Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-08T06:01:38.959977Z","submitted_at":"2025-05-25T12:14:25Z","title":"FP4 All the Way: Fully Quantized Training of LLMs"},"reference_resolution":{"displayed":27,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":21,"verified_exact":0,"verified_fuzzy":6},"total_outbound_references":27},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 27 of 27 outbound references and 24 inbound Pith citation observations for arXiv:2505.19115."}