{"as_of":"2026-08-04T17:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:df5881c895e835ed067f7470d6435857d43578ff659ed8b87b9563df859ff01f","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":48,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":48,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":48,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":48,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T15:20:16.175942Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-10T06:15:00.866473Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2310.10537","last_updated":"2023-10-19T16:38:33Z","snapshot_observed_at":"2026-07-06T16:33:55.369704Z","submitted_at":"2023-10-16T16:07:41Z","title":"Microscaling Data Formats for Deep Learning","version":3},"cited_work":{"arxiv_id":"2310.10537","doi":"10.48550/arxiv.2310.10537","metadata_source":"arxiv_reference","pith_arxiv_id":"2310.10537","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Microscaling data formats for deep learning.arXiv preprint arXiv:2310.10537","venue":null,"work_id":"fead0f60-0895-4dc8-9fec-b579bf79288e","year":2023},"citing_paper":{"arxiv_id":"2509.09505","last_updated":"2026-04-12T10:29:26Z","snapshot_observed_at":"2026-07-06T22:28:48.082201Z","submitted_at":"2025-09-11T14:49:50Z","title":"Combating the Memory Walls: Optimization Pathways for Long-Context Agentic LLM Inference","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-18T17:47:58.019030Z"},"links":{"cited_paper":"/paper/2310.10537","citing_paper":"/paper/2509.09505"},"observation_digest":"sha256:2fe9757de12ce0108340f6520799f5a74b8acad2408bd945e4eab61b8125ca4c","observation_id":"8ecaf391-d4bf-46f3-b78c-4663723696ff","resolution":{"observed_at":"2026-05-18T17:51:42.214887Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10537","last_updated":"2023-10-19T16:38:33Z","snapshot_observed_at":"2026-07-06T16:33:55.369704Z","submitted_at":"2023-10-16T16:07:41Z","title":"Microscaling Data Formats for Deep Learning","version":3},"cited_work":{"arxiv_id":"2310.10537","doi":"10.48550/arxiv.2310.10537","metadata_source":"arxiv_reference","pith_arxiv_id":"2310.10537","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Microscaling data formats for deep learning.arXiv preprint arXiv:2310.10537","venue":null,"work_id":"fead0f60-0895-4dc8-9fec-b579bf79288e","year":2023},"citing_paper":{"arxiv_id":"2512.02010","last_updated":"2026-05-09T05:39:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-01T18:59:45Z","title":"Four Over Six: More Accurate NVFP4 Quantization with Adaptive Block Scaling","version":5},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-17T02:23:01.845123Z"},"links":{"cited_paper":"/paper/2310.10537","citing_paper":"/paper/2512.02010"},"observation_digest":"sha256:ff015fb1c63586e2fab3afade4e7216849296d1fc52d96a8256229f9ef3e26cf","observation_id":"92e42020-4801-456c-9c6a-fbbfd4e89d65","resolution":{"observed_at":"2026-05-17T02:23:52.774424Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10537","last_updated":"2023-10-19T16:38:33Z","snapshot_observed_at":"2026-07-06T16:33:55.369704Z","submitted_at":"2023-10-16T16:07:41Z","title":"Microscaling Data Formats for Deep Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10537","snapshot_observed_at":"2026-08-03T16:35:53.163602Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.12930","last_updated":"2026-01-22T01:38:36Z","snapshot_observed_at":"2026-08-04T05:40:34.076678Z","submitted_at":"2025-12-15T02:29:08Z","title":"SeVeDo: A Heterogeneous Transformer Accelerator for Low-Bit Inference via Hierarchical Group Quantization and SVD-Guided Mixed Precision","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T16:35:53.163602Z"},"links":{"cited_paper":"/paper/2310.10537","citing_paper":"/paper/2512.12930"},"observation_digest":"sha256:9a293adfa3b36517b44e34bfd206cc55a7c7556453a23574a7f5ff2295f65936","observation_id":"5bacdbd1-1915-4f66-80a4-195e592fc989","resolution":{"observed_at":"2026-08-03T16:35:53.163602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10537","last_updated":"2023-10-19T16:38:33Z","snapshot_observed_at":"2026-07-06T16:33:55.369704Z","submitted_at":"2023-10-16T16:07:41Z","title":"Microscaling Data Formats for Deep Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10537","snapshot_observed_at":"2026-08-03T11:10:52.658894Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.07475","last_updated":"2026-07-04T06:36:53Z","snapshot_observed_at":"2026-08-03T11:10:51.606457Z","submitted_at":"2026-01-12T12:27:22Z","title":"ARCQuant: Boosting NVFP4 Quantization with Augmented Residual Channels for LLMs","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-03T11:10:52.658894Z"},"links":{"cited_paper":"/paper/2310.10537","citing_paper":"/paper/2601.07475"},"observation_digest":"sha256:812c7b72ce4ace3bdc81a53073afe7ff86c921f7daa7455c164016ee23c3ac2d","observation_id":"b922ee21-5e4e-48e3-84d8-c4dd2ff40647","resolution":{"observed_at":"2026-08-03T11:10:52.658894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10537","last_updated":"2023-10-19T16:38:33Z","snapshot_observed_at":"2026-07-06T16:33:55.369704Z","submitted_at":"2023-10-16T16:07:41Z","title":"Microscaling Data Formats for Deep Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10537","snapshot_observed_at":"2026-08-03T03:13:24.213416Z","title":"Microscaling data formats for deep learning.arXiv preprint arXiv:2310.10537, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.08923","last_updated":"2026-07-07T20:21:24Z","snapshot_observed_at":"2026-08-03T03:13:13.370255Z","submitted_at":"2026-02-09T17:25:37Z","title":"DynamiQ: Accelerating Gradient Synchronization using Compressed Multi-hop All-reduce","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-03T03:13:24.213416Z"},"links":{"cited_paper":"/paper/2310.10537","citing_paper":"/paper/2602.08923"},"observation_digest":"sha256:adbccac80981b17e9df57557a3f26c589a1a74a28531d418d4d801211212215c","observation_id":"26067140-9557-461d-97a0-fc26efc44524","resolution":{"observed_at":"2026-08-03T03:13:24.213416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10537","last_updated":"2023-10-19T16:38:33Z","snapshot_observed_at":"2026-07-06T16:33:55.369704Z","submitted_at":"2023-10-16T16:07:41Z","title":"Microscaling Data Formats for Deep Learning","version":3},"cited_work":{"arxiv_id":"2310.10537","doi":"10.48550/arxiv.2310.10537","metadata_source":"arxiv_reference","pith_arxiv_id":"2310.10537","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Microscaling data formats for deep learning.arXiv preprint arXiv:2310.10537","venue":null,"work_id":"fead0f60-0895-4dc8-9fec-b579bf79288e","year":2023},"citing_paper":{"arxiv_id":"2604.03950","last_updated":"2026-04-05T03:56:21Z","snapshot_observed_at":"2026-07-06T22:53:01.835843Z","submitted_at":"2026-04-05T03:56:21Z","title":"Diagonal-Tiled Mixed-Precision Attention for Efficient Low-Bit MXFP Inference","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-13T17:32:06.384120Z"},"links":{"cited_paper":"/paper/2310.10537","citing_paper":"/paper/2604.03950"},"observation_digest":"sha256:fa964026e23a6007847d5b44959824c07d23d1d3e2bbea94d06ce8c4bc27a492","observation_id":"9138fc19-8e25-4027-b643-e08a85025d27","resolution":{"observed_at":"2026-05-13T17:33:02.303676Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10537","last_updated":"2023-10-19T16:38:33Z","snapshot_observed_at":"2026-07-06T16:33:55.369704Z","submitted_at":"2023-10-16T16:07:41Z","title":"Microscaling Data Formats for Deep Learning","version":3},"cited_work":{"arxiv_id":"2310.10537","doi":"10.48550/arxiv.2310.10537","metadata_source":"arxiv_reference","pith_arxiv_id":"2310.10537","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Microscaling data formats for deep learning.arXiv preprint arXiv:2310.10537","venue":null,"work_id":"fead0f60-0895-4dc8-9fec-b579bf79288e","year":2023},"citing_paper":{"arxiv_id":"2604.04523","last_updated":"2026-04-06T08:35:41Z","snapshot_observed_at":"2026-07-06T22:53:29.118925Z","submitted_at":"2026-04-06T08:35:41Z","title":"LOCALUT: Harnessing Capacity-Computation Tradeoffs for LUT-Based Inference in DRAM-PIM","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-10T20:05:11.335715Z"},"links":{"cited_paper":"/paper/2310.10537","citing_paper":"/paper/2604.04523"},"observation_digest":"sha256:e7f772b7cdc94b34c7052b696c70e8c9d35a00cf618731e4c824891ab6e916d4","observation_id":"991abe71-dca1-4f68-bf04-e8755d7693d3","resolution":{"observed_at":"2026-05-10T22:15:49.669653Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10537","last_updated":"2023-10-19T16:38:33Z","snapshot_observed_at":"2026-07-06T16:33:55.369704Z","submitted_at":"2023-10-16T16:07:41Z","title":"Microscaling Data Formats for Deep Learning","version":3},"cited_work":{"arxiv_id":"2310.10537","doi":"10.48550/arxiv.2310.10537","metadata_source":"arxiv_reference","pith_arxiv_id":"2310.10537","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Microscaling data formats for deep learning.arXiv preprint arXiv:2310.10537","venue":null,"work_id":"fead0f60-0895-4dc8-9fec-b579bf79288e","year":2023},"citing_paper":{"arxiv_id":"2604.08826","last_updated":"2026-04-09T23:50:56Z","snapshot_observed_at":"2026-08-04T10:41:29.108562Z","submitted_at":"2026-04-09T23:50:56Z","title":"HiFloat4 Format for Language Model Pre-training on Ascend NPUs","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T16:49:58.735409Z"},"links":{"cited_paper":"/paper/2310.10537","citing_paper":"/paper/2604.08826"},"observation_digest":"sha256:a901995f677a1156789de9f84c280e0664edc1f49ee1d9bc34655ff16121d1ad","observation_id":"ff7dc2f2-3774-4385-9ac7-c5b2ebeaeddf","resolution":{"observed_at":"2026-05-11T08:05:59.824512Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10537","last_updated":"2023-10-19T16:38:33Z","snapshot_observed_at":"2026-07-06T16:33:55.369704Z","submitted_at":"2023-10-16T16:07:41Z","title":"Microscaling Data Formats for Deep Learning","version":3},"cited_work":{"arxiv_id":"2310.10537","doi":"10.48550/arxiv.2310.10537","metadata_source":"arxiv_reference","pith_arxiv_id":"2310.10537","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Microscaling data formats for deep learning.arXiv preprint arXiv:2310.10537","venue":null,"work_id":"fead0f60-0895-4dc8-9fec-b579bf79288e","year":2023},"citing_paper":{"arxiv_id":"2604.12782","last_updated":"2026-04-14T14:17:59Z","snapshot_observed_at":"2026-07-06T23:00:56.449281Z","submitted_at":"2026-04-14T14:17:59Z","title":"OSC: Hardware Efficient W4A4 Quantization via Outlier Separation in Channel Dimension","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T16:15:59.622461Z"},"links":{"cited_paper":"/paper/2310.10537","citing_paper":"/paper/2604.12782"},"observation_digest":"sha256:cc3e9b1292c5b8397c8579ee5c22d456b654d3e14f73888a92f974265f839730","observation_id":"6fb18462-2aea-4ee2-b1c3-9dc2d7b98fd3","resolution":{"observed_at":"2026-05-11T09:05:59.520668Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10537","last_updated":"2023-10-19T16:38:33Z","snapshot_observed_at":"2026-07-06T16:33:55.369704Z","submitted_at":"2023-10-16T16:07:41Z","title":"Microscaling Data Formats for Deep Learning","version":3},"cited_work":{"arxiv_id":"2310.10537","doi":"10.48550/arxiv.2310.10537","metadata_source":"arxiv_reference","pith_arxiv_id":"2310.10537","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Microscaling data formats for deep learning.arXiv preprint arXiv:2310.10537","venue":null,"work_id":"fead0f60-0895-4dc8-9fec-b579bf79288e","year":2023},"citing_paper":{"arxiv_id":"2605.02568","last_updated":"2026-05-04T13:19:29Z","snapshot_observed_at":"2026-07-31T19:18:10.074012Z","submitted_at":"2026-05-04T13:19:29Z","title":"StreamIndex: Memory-Bounded Compressed Sparse Attention via Streaming Top-k","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-05-08T18:44:42.456111Z"},"links":{"cited_paper":"/paper/2310.10537","citing_paper":"/paper/2605.02568"},"observation_digest":"sha256:147822d023452b5ff6624639ff6949812fb686d933a178decf8ad24aa5c8a262","observation_id":"c48a6cc7-ca14-4642-9ecd-25e9b0f4f0e9","resolution":{"observed_at":"2026-05-09T06:15:37.680566Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10537","last_updated":"2023-10-19T16:38:33Z","snapshot_observed_at":"2026-07-06T16:33:55.369704Z","submitted_at":"2023-10-16T16:07:41Z","title":"Microscaling Data Formats for Deep Learning","version":3},"cited_work":{"arxiv_id":"2310.10537","doi":"10.48550/arxiv.2310.10537","metadata_source":"arxiv_reference","pith_arxiv_id":"2310.10537","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Microscaling data formats for deep learning.arXiv preprint arXiv:2310.10537","venue":null,"work_id":"fead0f60-0895-4dc8-9fec-b579bf79288e","year":2023},"citing_paper":{"arxiv_id":"2605.09825","last_updated":"2026-05-14T02:08:01Z","snapshot_observed_at":"2026-07-06T23:21:54.140120Z","submitted_at":"2026-05-11T00:04:07Z","title":"Pretraining large language models with MXFP4 on Native FP4 Hardware","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-05-12T05:03:04.972344Z"},"links":{"cited_paper":"/paper/2310.10537","citing_paper":"/paper/2605.09825"},"observation_digest":"sha256:71425b7ca0115a6394e80184b7970a71b37942bea3e5a8c288cd1c1f7ab41ac5","observation_id":"4e18bf1c-568d-4e90-9799-6564fc0f453e","resolution":{"observed_at":"2026-05-12T05:41:26.364189Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10537","last_updated":"2023-10-19T16:38:33Z","snapshot_observed_at":"2026-07-06T16:33:55.369704Z","submitted_at":"2023-10-16T16:07:41Z","title":"Microscaling Data Formats for Deep Learning","version":3},"cited_work":{"arxiv_id":"2310.10537","doi":"10.48550/arxiv.2310.10537","metadata_source":"arxiv_reference","pith_arxiv_id":"2310.10537","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Microscaling data formats for deep learning.arXiv preprint arXiv:2310.10537","venue":null,"work_id":"fead0f60-0895-4dc8-9fec-b579bf79288e","year":2023},"citing_paper":{"arxiv_id":"2605.09825","last_updated":"2026-05-14T02:08:01Z","snapshot_observed_at":"2026-07-06T23:21:54.140120Z","submitted_at":"2026-05-11T00:04:07Z","title":"Pretraining large language models with MXFP4 on Native FP4 Hardware","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-05-14T21:04:57.021482Z"},"links":{"cited_paper":"/paper/2310.10537","citing_paper":"/paper/2605.09825"},"observation_digest":"sha256:3078687a980b85d48e4b809b009c5fae88a4f21d61453ec7743d9949188c12f8","observation_id":"2dd452da-9ee5-4db2-9ce8-19a2f9ab37c3","resolution":{"observed_at":"2026-05-14T21:19:28.727720Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10537","last_updated":"2023-10-19T16:38:33Z","snapshot_observed_at":"2026-07-06T16:33:55.369704Z","submitted_at":"2023-10-16T16:07:41Z","title":"Microscaling Data Formats for Deep Learning","version":3},"cited_work":{"arxiv_id":"2310.10537","doi":"10.48550/arxiv.2310.10537","metadata_source":"arxiv_reference","pith_arxiv_id":"2310.10537","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Microscaling data formats for deep learning.arXiv preprint arXiv:2310.10537","venue":null,"work_id":"fead0f60-0895-4dc8-9fec-b579bf79288e","year":2023},"citing_paper":{"arxiv_id":"2605.09825","last_updated":"2026-05-14T02:08:01Z","snapshot_observed_at":"2026-07-06T23:21:54.140120Z","submitted_at":"2026-05-11T00:04:07Z","title":"Pretraining large language models with MXFP4 on Native FP4 Hardware","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-05-15T05:15:58.477985Z"},"links":{"cited_paper":"/paper/2310.10537","citing_paper":"/paper/2605.09825"},"observation_digest":"sha256:fbaf09827a4245049d4ccc931cc6180330276e09c510ac85bf7f00df35902496","observation_id":"c9c9f698-f1df-4444-9864-de54501e14a4","resolution":{"observed_at":"2026-05-15T05:19:46.436060Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10537","last_updated":"2023-10-19T16:38:33Z","snapshot_observed_at":"2026-07-06T16:33:55.369704Z","submitted_at":"2023-10-16T16:07:41Z","title":"Microscaling Data Formats for Deep Learning","version":3},"cited_work":{"arxiv_id":"2310.10537","doi":"10.48550/arxiv.2310.10537","metadata_source":"arxiv_reference","pith_arxiv_id":"2310.10537","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Microscaling data formats for deep learning.arXiv preprint arXiv:2310.10537","venue":null,"work_id":"fead0f60-0895-4dc8-9fec-b579bf79288e","year":2023},"citing_paper":{"arxiv_id":"2605.10886","last_updated":"2026-07-09T02:30:06Z","snapshot_observed_at":"2026-07-12T23:17:31.243229Z","submitted_at":"2026-05-11T17:32:29Z","title":"LoKA: Low-precision Kernel Applications for Recommendation Models At Scale","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-12T04:33:41.411292Z"},"links":{"cited_paper":"/paper/2310.10537","citing_paper":"/paper/2605.10886"},"observation_digest":"sha256:60f7acbbdf2773e4e62182e28b0ce7428ed02ddf846d7d1fe9a9663ddc375c94","observation_id":"6f91f873-ce09-485d-9fa8-6aa85ab53d52","resolution":{"observed_at":"2026-05-12T06:06:28.153739Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10537","last_updated":"2023-10-19T16:38:33Z","snapshot_observed_at":"2026-07-06T16:33:55.369704Z","submitted_at":"2023-10-16T16:07:41Z","title":"Microscaling Data Formats for Deep Learning","version":3},"cited_work":{"arxiv_id":"2310.10537","doi":"10.48550/arxiv.2310.10537","metadata_source":"arxiv_reference","pith_arxiv_id":"2310.10537","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Microscaling data formats for deep learning.arXiv preprint arXiv:2310.10537","venue":null,"work_id":"fead0f60-0895-4dc8-9fec-b579bf79288e","year":2023},"citing_paper":{"arxiv_id":"2605.10886","last_updated":"2026-07-09T02:30:06Z","snapshot_observed_at":"2026-07-12T23:17:31.243229Z","submitted_at":"2026-05-11T17:32:29Z","title":"LoKA: Low-precision Kernel Applications for Recommendation Models At Scale","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-15T04:55:01.973832Z"},"links":{"cited_paper":"/paper/2310.10537","citing_paper":"/paper/2605.10886"},"observation_digest":"sha256:c1d00f8326144bd6e1dbc7b9edfd5b8da18e407f727ab7995a7c43f7438e3473","observation_id":"9b8803d6-86b6-4a38-96d5-abadc95c0592","resolution":{"observed_at":"2026-05-15T04:59:46.216734Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10537","last_updated":"2023-10-19T16:38:33Z","snapshot_observed_at":"2026-07-06T16:33:55.369704Z","submitted_at":"2023-10-16T16:07:41Z","title":"Microscaling Data Formats for Deep Learning","version":3},"cited_work":{"arxiv_id":"2310.10537","doi":"10.48550/arxiv.2310.10537","metadata_source":"arxiv_reference","pith_arxiv_id":"2310.10537","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Microscaling data formats for deep learning.arXiv preprint arXiv:2310.10537","venue":null,"work_id":"fead0f60-0895-4dc8-9fec-b579bf79288e","year":2023},"citing_paper":{"arxiv_id":"2605.11546","last_updated":"2026-05-12T05:20:43Z","snapshot_observed_at":"2026-07-06T23:23:21.034839Z","submitted_at":"2026-05-12T05:20:43Z","title":"The Entropy of Floating-Point Numbers","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-13T01:26:53.802738Z"},"links":{"cited_paper":"/paper/2310.10537","citing_paper":"/paper/2605.11546"},"observation_digest":"sha256:e7abc19ffa4b49aa1fc6f04ac90b5c416175ad6ab17694546350670a3404aae8","observation_id":"c8b3b680-1f3f-4f4e-abf6-ef929b62cb3c","resolution":{"observed_at":"2026-05-13T01:27:01.603906Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10537","last_updated":"2023-10-19T16:38:33Z","snapshot_observed_at":"2026-07-06T16:33:55.369704Z","submitted_at":"2023-10-16T16:07:41Z","title":"Microscaling Data Formats for Deep Learning","version":3},"cited_work":{"arxiv_id":"2310.10537","doi":"10.48550/arxiv.2310.10537","metadata_source":"arxiv_reference","pith_arxiv_id":"2310.10537","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Microscaling data formats for deep learning.arXiv preprint arXiv:2310.10537","venue":null,"work_id":"fead0f60-0895-4dc8-9fec-b579bf79288e","year":2023},"citing_paper":{"arxiv_id":"2605.12245","last_updated":"2026-05-12T15:13:18Z","snapshot_observed_at":"2026-08-02T08:34:04.143426Z","submitted_at":"2026-05-12T15:13:18Z","title":"SOAR: Scale Optimization for Accurate Reconstruction in NVFP4 Quantization","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-05-13T05:54:01.264659Z"},"links":{"cited_paper":"/paper/2310.10537","citing_paper":"/paper/2605.12245"},"observation_digest":"sha256:6bcd9cf223f0755a9ddb24c140d260ff0aeccc45de3f67d3b999717142983a4b","observation_id":"d9b819fc-1efd-4f57-bca2-adf82abf8687","resolution":{"observed_at":"2026-05-13T06:02:23.831066Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10537","last_updated":"2023-10-19T16:38:33Z","snapshot_observed_at":"2026-07-06T16:33:55.369704Z","submitted_at":"2023-10-16T16:07:41Z","title":"Microscaling Data Formats for Deep Learning","version":3},"cited_work":{"arxiv_id":"2310.10537","doi":"10.48550/arxiv.2310.10537","metadata_source":"arxiv_reference","pith_arxiv_id":"2310.10537","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Microscaling data formats for deep learning.arXiv preprint arXiv:2310.10537","venue":null,"work_id":"fead0f60-0895-4dc8-9fec-b579bf79288e","year":2023},"citing_paper":{"arxiv_id":"2605.12327","last_updated":"2026-05-12T16:09:02Z","snapshot_observed_at":"2026-08-03T03:41:10.713228Z","submitted_at":"2026-05-12T16:09:02Z","title":"Grid Games: The Power of Multiple Grids for Quantizing Large Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-13T06:44:59.501345Z"},"links":{"cited_paper":"/paper/2310.10537","citing_paper":"/paper/2605.12327"},"observation_digest":"sha256:847df4bf1af6d358bb2af9c093ec3d664176d8ea29996034c6f0d8d04f68173d","observation_id":"33871e95-793f-44b0-98f6-1c01b0f10fa3","resolution":{"observed_at":"2026-05-13T06:47:26.456839Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10537","last_updated":"2023-10-19T16:38:33Z","snapshot_observed_at":"2026-07-06T16:33:55.369704Z","submitted_at":"2023-10-16T16:07:41Z","title":"Microscaling Data Formats for Deep Learning","version":3},"cited_work":{"arxiv_id":"2310.10537","doi":"10.48550/arxiv.2310.10537","metadata_source":"arxiv_reference","pith_arxiv_id":"2310.10537","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Microscaling data formats for deep learning.arXiv preprint arXiv:2310.10537","venue":null,"work_id":"fead0f60-0895-4dc8-9fec-b579bf79288e","year":2023},"citing_paper":{"arxiv_id":"2605.13915","last_updated":"2026-05-13T09:49:56Z","snapshot_observed_at":"2026-07-06T23:25:25.361350Z","submitted_at":"2026-05-13T09:49:56Z","title":"Multi-Scale Dequant: Eliminating Dequantization Bottleneck via Activation Decomposition for Efficient LLM Inference","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-15T02:57:18.944617Z"},"links":{"cited_paper":"/paper/2310.10537","citing_paper":"/paper/2605.13915"},"observation_digest":"sha256:b9fd0a80c14a095d8249bd97645c14af6a45c0681f757b59b7cb95bfa525e047","observation_id":"0d46cba1-eb42-4a06-a9c9-599a942712af","resolution":{"observed_at":"2026-05-15T02:58:34.206283Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10537","last_updated":"2023-10-19T16:38:33Z","snapshot_observed_at":"2026-07-06T16:33:55.369704Z","submitted_at":"2023-10-16T16:07:41Z","title":"Microscaling Data Formats for Deep Learning","version":3},"cited_work":{"arxiv_id":"2310.10537","doi":"10.48550/arxiv.2310.10537","metadata_source":"arxiv_reference","pith_arxiv_id":"2310.10537","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Microscaling data formats for deep learning.arXiv preprint arXiv:2310.10537","venue":null,"work_id":"fead0f60-0895-4dc8-9fec-b579bf79288e","year":2023},"citing_paper":{"arxiv_id":"2605.14929","last_updated":"2026-05-14T15:03:58Z","snapshot_observed_at":"2026-07-06T23:26:18.733776Z","submitted_at":"2026-05-14T15:03:58Z","title":"A Hardware-Aware, Per-Layer Methodology for Post-Training Quantization of Large Language Models","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-06-30T21:03:05.361805Z"},"links":{"cited_paper":"/paper/2310.10537","citing_paper":"/paper/2605.14929"},"observation_digest":"sha256:12b45da70d45971514c1a68e572af4806ecc9db895c17950fe07751cb8446b84","observation_id":"d601843e-fc0b-4f28-aa46-e865bb0f7d35","resolution":{"observed_at":"2026-06-30T21:05:03.956703Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10537","last_updated":"2023-10-19T16:38:33Z","snapshot_observed_at":"2026-07-06T16:33:55.369704Z","submitted_at":"2023-10-16T16:07:41Z","title":"Microscaling Data Formats for Deep Learning","version":3},"cited_work":{"arxiv_id":"2310.10537","doi":"10.48550/arxiv.2310.10537","metadata_source":"arxiv_reference","pith_arxiv_id":"2310.10537","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Microscaling data formats for deep learning.arXiv preprint arXiv:2310.10537","venue":null,"work_id":"fead0f60-0895-4dc8-9fec-b579bf79288e","year":2023},"citing_paper":{"arxiv_id":"2605.18739","last_updated":"2026-05-19T17:46:12Z","snapshot_observed_at":"2026-07-06T23:29:33.702647Z","submitted_at":"2026-05-18T17:57:03Z","title":"LongLive-2.0: An NVFP4 Parallel Infrastructure for Long Video Generation","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-20T11:02:39.465293Z"},"links":{"cited_paper":"/paper/2310.10537","citing_paper":"/paper/2605.18739"},"observation_digest":"sha256:c73a5125a4f4fb5cc0e5ff2696dcfe5fce8e40e74d2cb59d7011482022bbba80","observation_id":"17ee07c3-6a31-4afa-8d91-289e28cc800f","resolution":{"observed_at":"2026-05-20T11:03:13.294669Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10537","last_updated":"2023-10-19T16:38:33Z","snapshot_observed_at":"2026-07-06T16:33:55.369704Z","submitted_at":"2023-10-16T16:07:41Z","title":"Microscaling Data Formats for Deep Learning","version":3},"cited_work":{"arxiv_id":"2310.10537","doi":"10.48550/arxiv.2310.10537","metadata_source":"arxiv_reference","pith_arxiv_id":"2310.10537","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Microscaling data formats for deep learning.arXiv preprint arXiv:2310.10537","venue":null,"work_id":"fead0f60-0895-4dc8-9fec-b579bf79288e","year":2023},"citing_paper":{"arxiv_id":"2605.19195","last_updated":"2026-05-18T23:51:02Z","snapshot_observed_at":"2026-07-06T23:29:57.003383Z","submitted_at":"2026-05-18T23:51:02Z","title":"The Thermodynamic Costs of Simple Linear Regression","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-20T07:03:21.987679Z"},"links":{"cited_paper":"/paper/2310.10537","citing_paper":"/paper/2605.19195"},"observation_digest":"sha256:1537b167e45c08d78da098c5d479e6ad1f59852bf33808c6e5f290ab94998ff2","observation_id":"69db121e-6ddc-4936-a720-0d3b37141821","resolution":{"observed_at":"2026-05-20T07:03:23.258985Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10537","last_updated":"2023-10-19T16:38:33Z","snapshot_observed_at":"2026-07-06T16:33:55.369704Z","submitted_at":"2023-10-16T16:07:41Z","title":"Microscaling Data Formats for Deep Learning","version":3},"cited_work":{"arxiv_id":"2310.10537","doi":"10.48550/arxiv.2310.10537","metadata_source":"arxiv_reference","pith_arxiv_id":"2310.10537","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Microscaling data formats for deep learning.arXiv preprint arXiv:2310.10537","venue":null,"work_id":"fead0f60-0895-4dc8-9fec-b579bf79288e","year":2023},"citing_paper":{"arxiv_id":"2605.23081","last_updated":"2026-05-21T22:28:27Z","snapshot_observed_at":"2026-08-04T11:05:52.350024Z","submitted_at":"2026-05-21T22:28:27Z","title":"ThriftAttention: Selective Mixed Precision for Long-Context FP4 Attention","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-25T05:28:40.888215Z"},"links":{"cited_paper":"/paper/2310.10537","citing_paper":"/paper/2605.23081"},"observation_digest":"sha256:2517fbe1035f6ef251dc17dbc9bc46e8dc35e615169454460948a0c600723f88","observation_id":"aad4aede-8983-4ecf-87b1-85f69f9805d8","resolution":{"observed_at":"2026-05-25T05:30:22.804401Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10537","last_updated":"2023-10-19T16:38:33Z","snapshot_observed_at":"2026-07-06T16:33:55.369704Z","submitted_at":"2023-10-16T16:07:41Z","title":"Microscaling Data Formats for Deep Learning","version":3},"cited_work":{"arxiv_id":"2310.10537","doi":"10.48550/arxiv.2310.10537","metadata_source":"arxiv_reference","pith_arxiv_id":"2310.10537","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Microscaling data formats for deep learning.arXiv preprint arXiv:2310.10537","venue":null,"work_id":"fead0f60-0895-4dc8-9fec-b579bf79288e","year":2023},"citing_paper":{"arxiv_id":"2605.23226","last_updated":"2026-05-22T04:37:51Z","snapshot_observed_at":"2026-08-03T13:58:17.668433Z","submitted_at":"2026-05-22T04:37:51Z","title":"MASQ: Accelerating Masked Diffusion via Stage-Wise Multi-Precision Quantization","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-25T02:59:25.037162Z"},"links":{"cited_paper":"/paper/2310.10537","citing_paper":"/paper/2605.23226"},"observation_digest":"sha256:ddd39a08b7565aca3e52b8c90409774cf6558ade34d958a8c2c7b4dd7ff19664","observation_id":"135f833e-3ba9-43e5-af4f-4ea77dfc875e","resolution":{"observed_at":"2026-05-25T03:00:15.853710Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10537","last_updated":"2023-10-19T16:38:33Z","snapshot_observed_at":"2026-07-06T16:33:55.369704Z","submitted_at":"2023-10-16T16:07:41Z","title":"Microscaling Data Formats for Deep Learning","version":3},"cited_work":{"arxiv_id":"2310.10537","doi":"10.48550/arxiv.2310.10537","metadata_source":"arxiv_reference","pith_arxiv_id":"2310.10537","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Microscaling data formats for deep learning.arXiv preprint arXiv:2310.10537","venue":null,"work_id":"fead0f60-0895-4dc8-9fec-b579bf79288e","year":2023},"citing_paper":{"arxiv_id":"2605.24391","last_updated":"2026-06-01T18:51:49Z","snapshot_observed_at":"2026-08-02T23:03:15.031676Z","submitted_at":"2026-05-23T04:21:57Z","title":"MX-SAFE: Versatile Inference- and Training-Proof Microscaling Format with On-the-Fly Exponent and Mantissa Bit Allocation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-30T12:42:57.909391Z"},"links":{"cited_paper":"/paper/2310.10537","citing_paper":"/paper/2605.24391"},"observation_digest":"sha256:90884776ffbec96a45c4347fbec6f51afe6a7bb3276182f0b5af4e6e194c60fa","observation_id":"b373f641-574f-42ba-917d-93f9d7edce77","resolution":{"observed_at":"2026-06-30T12:44:39.221357Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10537","last_updated":"2023-10-19T16:38:33Z","snapshot_observed_at":"2026-07-06T16:33:55.369704Z","submitted_at":"2023-10-16T16:07:41Z","title":"Microscaling Data Formats for Deep Learning","version":3},"cited_work":{"arxiv_id":"2310.10537","doi":"10.48550/arxiv.2310.10537","metadata_source":"arxiv_reference","pith_arxiv_id":"2310.10537","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Microscaling data formats for deep learning.arXiv preprint arXiv:2310.10537","venue":null,"work_id":"fead0f60-0895-4dc8-9fec-b579bf79288e","year":2023},"citing_paper":{"arxiv_id":"2605.26558","last_updated":"2026-05-26T05:12:44Z","snapshot_observed_at":"2026-08-02T18:18:56.704933Z","submitted_at":"2026-05-26T05:12:44Z","title":"Cassandra: Enabling Reasoning LLMs at Edge via Self-Speculative Decoding","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-01T16:19:54.910430Z"},"links":{"cited_paper":"/paper/2310.10537","citing_paper":"/paper/2605.26558"},"observation_digest":"sha256:a24a6c9308db0300d694be43711809d3a63e085e296890e7e309cb4632d3c7e7","observation_id":"bb2595bb-1b2b-4090-9cd2-22061cbbe22e","resolution":{"observed_at":"2026-07-01T16:25:49.798946Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10537","last_updated":"2023-10-19T16:38:33Z","snapshot_observed_at":"2026-07-06T16:33:55.369704Z","submitted_at":"2023-10-16T16:07:41Z","title":"Microscaling Data Formats for Deep Learning","version":3},"cited_work":{"arxiv_id":"2310.10537","doi":"10.48550/arxiv.2310.10537","metadata_source":"arxiv_reference","pith_arxiv_id":"2310.10537","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Microscaling data formats for deep learning.arXiv preprint arXiv:2310.10537","venue":null,"work_id":"fead0f60-0895-4dc8-9fec-b579bf79288e","year":2023},"citing_paper":{"arxiv_id":"2606.02333","last_updated":"2026-06-01T14:44:05Z","snapshot_observed_at":"2026-08-03T13:27:52.287848Z","submitted_at":"2026-06-01T14:44:05Z","title":"O-POPE: High-Frequency Pipelined Outer Product based GEMM acceleration with minimal buffering overhead","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-28T12:11:38.789928Z"},"links":{"cited_paper":"/paper/2310.10537","citing_paper":"/paper/2606.02333"},"observation_digest":"sha256:4ccf1a9137f18f9d8aa48724d0b84b41914a86228140361241be13f4a7ec2bf7","observation_id":"05e0a655-bb1e-40b1-ba1c-b15cc2f4fa1c","resolution":{"observed_at":"2026-07-02T01:16:25.114709Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10537","last_updated":"2023-10-19T16:38:33Z","snapshot_observed_at":"2026-07-06T16:33:55.369704Z","submitted_at":"2023-10-16T16:07:41Z","title":"Microscaling Data Formats for Deep Learning","version":3},"cited_work":{"arxiv_id":"2310.10537","doi":"10.48550/arxiv.2310.10537","metadata_source":"arxiv_reference","pith_arxiv_id":"2310.10537","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Microscaling data formats for deep learning.arXiv preprint arXiv:2310.10537","venue":null,"work_id":"fead0f60-0895-4dc8-9fec-b579bf79288e","year":2023},"citing_paper":{"arxiv_id":"2606.04115","last_updated":"2026-07-14T14:04:32Z","snapshot_observed_at":"2026-08-02T05:34:23.902031Z","submitted_at":"2026-06-02T18:23:20Z","title":"dMX: Differentiable Mixed-Precision Assignment for Low-Precision Floating-Point Formats","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-28T11:20:06.292977Z"},"links":{"cited_paper":"/paper/2310.10537","citing_paper":"/paper/2606.04115"},"observation_digest":"sha256:c3d9a251b661d079a98a4b2cdc4bc6231a69e389cc1b0cb193e1d19d84958725","observation_id":"a1c44425-878a-4bf9-ad33-a0bc5552a848","resolution":{"observed_at":"2026-07-02T02:06:26.120872Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10537","last_updated":"2023-10-19T16:38:33Z","snapshot_observed_at":"2026-07-06T16:33:55.369704Z","submitted_at":"2023-10-16T16:07:41Z","title":"Microscaling Data Formats for Deep Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10537","snapshot_observed_at":"2026-07-15T10:56:54.155632Z","title":"Microscaling data formats for deep learning.arXiv preprint arXiv:2310.10537, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.04115","last_updated":"2026-07-14T14:04:32Z","snapshot_observed_at":"2026-08-02T05:34:23.902031Z","submitted_at":"2026-06-02T18:23:20Z","title":"dMX: Differentiable Mixed-Precision Assignment for Low-Precision Floating-Point Formats","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-15T10:56:54.155632Z"},"links":{"cited_paper":"/paper/2310.10537","citing_paper":"/paper/2606.04115"},"observation_digest":"sha256:de1694efe045684904bcc41f4b2fbcde6e7cbc9ebe871b17535330899d24c520","observation_id":"481d94f3-5b30-4a98-b9f7-de44a7593944","resolution":{"observed_at":"2026-07-15T10:56:54.155632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10537","last_updated":"2023-10-19T16:38:33Z","snapshot_observed_at":"2026-07-06T16:33:55.369704Z","submitted_at":"2023-10-16T16:07:41Z","title":"Microscaling Data Formats for Deep Learning","version":3},"cited_work":{"arxiv_id":"2310.10537","doi":"10.48550/arxiv.2310.10537","metadata_source":"arxiv_reference","pith_arxiv_id":"2310.10537","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Microscaling data formats for deep learning.arXiv preprint arXiv:2310.10537","venue":null,"work_id":"fead0f60-0895-4dc8-9fec-b579bf79288e","year":2023},"citing_paper":{"arxiv_id":"2606.05017","last_updated":"2026-06-22T12:03:17Z","snapshot_observed_at":"2026-07-06T23:45:02.342193Z","submitted_at":"2026-06-03T15:41:16Z","title":"GoldenFloat: A Phi-Derived Static-Split Floating-Point Family from GF4 to GF1024 with a Lucas-Exact Integer Identity","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-28T03:47:27.000639Z"},"links":{"cited_paper":"/paper/2310.10537","citing_paper":"/paper/2606.05017"},"observation_digest":"sha256:29e1e4f183f71df17d86a13ac1e1602a028e871eb8a92892a2b48b97713f9b55","observation_id":"e902f905-60a7-459b-8bd5-03b9000ab0a7","resolution":{"observed_at":"2026-07-02T11:26:54.592249Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10537","last_updated":"2023-10-19T16:38:33Z","snapshot_observed_at":"2026-07-06T16:33:55.369704Z","submitted_at":"2023-10-16T16:07:41Z","title":"Microscaling Data Formats for Deep Learning","version":3},"cited_work":{"arxiv_id":"2310.10537","doi":"10.48550/arxiv.2310.10537","metadata_source":"arxiv_reference","pith_arxiv_id":"2310.10537","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Microscaling data formats for deep learning.arXiv preprint arXiv:2310.10537","venue":null,"work_id":"fead0f60-0895-4dc8-9fec-b579bf79288e","year":2023},"citing_paper":{"arxiv_id":"2606.05206","last_updated":"2026-05-23T19:19:32Z","snapshot_observed_at":"2026-07-06T23:45:11.627867Z","submitted_at":"2026-05-23T19:19:32Z","title":"Ontology-constrained multi-LLM scoring of hypothesis support in the predictive processing literature","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-06-30T11:49:43.332490Z"},"links":{"cited_paper":"/paper/2310.10537","citing_paper":"/paper/2606.05206"},"observation_digest":"sha256:19504f4a7bfcfe997ebe10853cb9b1f324ab869a6db646b57aa94fdca8d7e238","observation_id":"0377c884-1de7-4aca-9b77-524deeb31b7d","resolution":{"observed_at":"2026-06-30T11:54:37.877107Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10537","last_updated":"2023-10-19T16:38:33Z","snapshot_observed_at":"2026-07-06T16:33:55.369704Z","submitted_at":"2023-10-16T16:07:41Z","title":"Microscaling Data Formats for Deep Learning","version":3},"cited_work":{"arxiv_id":"2310.10537","doi":"10.48550/arxiv.2310.10537","metadata_source":"arxiv_reference","pith_arxiv_id":"2310.10537","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Microscaling data formats for deep learning.arXiv preprint arXiv:2310.10537","venue":null,"work_id":"fead0f60-0895-4dc8-9fec-b579bf79288e","year":2023},"citing_paper":{"arxiv_id":"2606.09686","last_updated":"2026-06-22T12:28:45Z","snapshot_observed_at":"2026-08-01T08:59:58.818601Z","submitted_at":"2026-06-08T16:04:15Z","title":"An 83-Format Numeric Catalog with Bit-Exact Conformance Vectors: A Vendor-Neutral Reference for FP8, BF16, MXFP4, and Microscaling Formats","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-27T14:33:42.876697Z"},"links":{"cited_paper":"/paper/2310.10537","citing_paper":"/paper/2606.09686"},"observation_digest":"sha256:2ba7be99d3644c413d599b64f46d9eff16064e85c3e20364b672ccfbee9dbe1d","observation_id":"3be37054-5140-45bf-b02a-c094514b5651","resolution":{"observed_at":"2026-07-03T03:47:35.977373Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10537","last_updated":"2023-10-19T16:38:33Z","snapshot_observed_at":"2026-07-06T16:33:55.369704Z","submitted_at":"2023-10-16T16:07:41Z","title":"Microscaling Data Formats for Deep Learning","version":3},"cited_work":{"arxiv_id":"2310.10537","doi":"10.48550/arxiv.2310.10537","metadata_source":"arxiv_reference","pith_arxiv_id":"2310.10537","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Microscaling data formats for deep learning.arXiv preprint arXiv:2310.10537","venue":null,"work_id":"fead0f60-0895-4dc8-9fec-b579bf79288e","year":2023},"citing_paper":{"arxiv_id":"2606.13233","last_updated":"2026-06-11T11:47:40Z","snapshot_observed_at":"2026-07-06T23:51:59.619032Z","submitted_at":"2026-06-11T11:47:40Z","title":"ReSET: Accurate Latency-Critical NVFP4 Reasoning via Step-Aware Temperature Scaling","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-27T07:40:01.154810Z"},"links":{"cited_paper":"/paper/2310.10537","citing_paper":"/paper/2606.13233"},"observation_digest":"sha256:ad28be4a9d3980b90a5796d602ae2b6eb1e5c19425f91217387df6e8d9b0b351","observation_id":"1afda128-a2e0-45ec-9c83-f49e7ca59e58","resolution":{"observed_at":"2026-07-03T13:38:19.595324Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10537","last_updated":"2023-10-19T16:38:33Z","snapshot_observed_at":"2026-07-06T16:33:55.369704Z","submitted_at":"2023-10-16T16:07:41Z","title":"Microscaling Data Formats for Deep Learning","version":3},"cited_work":{"arxiv_id":"2310.10537","doi":"10.48550/arxiv.2310.10537","metadata_source":"arxiv_reference","pith_arxiv_id":"2310.10537","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Microscaling data formats for deep learning.arXiv preprint arXiv:2310.10537","venue":null,"work_id":"fead0f60-0895-4dc8-9fec-b579bf79288e","year":2023},"citing_paper":{"arxiv_id":"2606.20381","last_updated":"2026-06-18T15:40:51Z","snapshot_observed_at":"2026-07-06T23:55:34.411178Z","submitted_at":"2026-06-18T15:40:51Z","title":"Rethinking Shrinkage Bias in LLM FP4 Pretraining: Geometric Origin, Systemic Impact, and UFP4 Recipe","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-06-26T16:59:57.067069Z"},"links":{"cited_paper":"/paper/2310.10537","citing_paper":"/paper/2606.20381"},"observation_digest":"sha256:d81de3cfff9e3252a37f23902ce38e08ea4ec0507fe7310c45652abbb268b7f9","observation_id":"10c04bb2-3aca-450f-be0b-9ac900872458","resolution":{"observed_at":"2026-07-04T04:29:34.888762Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10537","last_updated":"2023-10-19T16:38:33Z","snapshot_observed_at":"2026-07-06T16:33:55.369704Z","submitted_at":"2023-10-16T16:07:41Z","title":"Microscaling Data Formats for Deep Learning","version":3},"cited_work":{"arxiv_id":"2310.10537","doi":"10.48550/arxiv.2310.10537","metadata_source":"arxiv_reference","pith_arxiv_id":"2310.10537","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Microscaling data formats for deep learning.arXiv preprint arXiv:2310.10537","venue":null,"work_id":"fead0f60-0895-4dc8-9fec-b579bf79288e","year":2023},"citing_paper":{"arxiv_id":"2606.23406","last_updated":"2026-06-22T14:30:47Z","snapshot_observed_at":"2026-07-06T23:58:07.236199Z","submitted_at":"2026-06-22T14:30:47Z","title":"HyperQuant: A Rate-Distortion-Optimal Quantization Pipeline for Large Language and Diffusion Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-26T08:46:01.500880Z"},"links":{"cited_paper":"/paper/2310.10537","citing_paper":"/paper/2606.23406"},"observation_digest":"sha256:1cb5ebd4846dad79af791a22e24c971f09b8f2cc15a06ac354e3060d4cbd8d5d","observation_id":"a1689784-7c2d-4ab1-a94d-10375afd1e29","resolution":{"observed_at":"2026-07-04T10:29:45.538537Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10537","last_updated":"2023-10-19T16:38:33Z","snapshot_observed_at":"2026-07-06T16:33:55.369704Z","submitted_at":"2023-10-16T16:07:41Z","title":"Microscaling Data Formats for Deep Learning","version":3},"cited_work":{"arxiv_id":"2310.10537","doi":"10.48550/arxiv.2310.10537","metadata_source":"arxiv_reference","pith_arxiv_id":"2310.10537","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Microscaling data formats for deep learning.arXiv preprint arXiv:2310.10537","venue":null,"work_id":"fead0f60-0895-4dc8-9fec-b579bf79288e","year":2023},"citing_paper":{"arxiv_id":"2606.26587","last_updated":"2026-06-25T04:19:04Z","snapshot_observed_at":"2026-08-02T10:04:20.542320Z","submitted_at":"2026-06-25T04:19:04Z","title":"SharQ: Bridging Activation Sparsity and FP4 Quantization for LLM Inference","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-06-26T05:41:39.052865Z"},"links":{"cited_paper":"/paper/2310.10537","citing_paper":"/paper/2606.26587"},"observation_digest":"sha256:6e05a5b144cc682f801a1e8710932d0e6d7503a58d38320d0591ad3eee1d88b7","observation_id":"a5cc00b9-0efd-4b55-aa55-d5d2d391f9cd","resolution":{"observed_at":"2026-07-04T12:59:52.348306Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10537","last_updated":"2023-10-19T16:38:33Z","snapshot_observed_at":"2026-07-06T16:33:55.369704Z","submitted_at":"2023-10-16T16:07:41Z","title":"Microscaling Data Formats for Deep Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10537","snapshot_observed_at":"2026-07-11T19:17:59.044982Z","title":"Microscaling data formats for deep learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04422","last_updated":"2026-07-05T17:31:36Z","snapshot_observed_at":"2026-08-04T03:31:46.106169Z","submitted_at":"2026-07-05T17:31:36Z","title":"Full-Stack FP4: Stable LLM Pretraining with Quantized Projections, Optimizers, and Attention","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-11T19:17:59.044982Z"},"links":{"cited_paper":"/paper/2310.10537","citing_paper":"/paper/2607.04422"},"observation_digest":"sha256:64c9e3dedeb011fc3ae7c3a593618168f3fef44720c2fb58a3850d9bb0676f60","observation_id":"024a417c-01ec-4800-92ba-301d29e9da18","resolution":{"observed_at":"2026-07-11T19:17:59.044982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10537","last_updated":"2023-10-19T16:38:33Z","snapshot_observed_at":"2026-07-06T16:33:55.369704Z","submitted_at":"2023-10-16T16:07:41Z","title":"Microscaling Data Formats for Deep Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10537","snapshot_observed_at":"2026-07-14T15:56:34.283388Z","title":"Microscaling Data Formats for Deep Learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09775","last_updated":"2026-07-07T20:26:25Z","snapshot_observed_at":"2026-07-29T19:54:00.521676Z","submitted_at":"2026-07-07T20:26:25Z","title":"WINT: A Novel Weighted Integer Representation with Improved Error Characteristics","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-14T15:56:34.283388Z"},"links":{"cited_paper":"/paper/2310.10537","citing_paper":"/paper/2607.09775"},"observation_digest":"sha256:fb648d2ff3944522304ba0c66ef8a37822aca52e87361f1c6dc93088ec991f4b","observation_id":"0988e4e9-1dd2-4acc-90a4-5efb10eec4d8","resolution":{"observed_at":"2026-07-14T15:56:34.283388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10537","last_updated":"2023-10-19T16:38:33Z","snapshot_observed_at":"2026-07-06T16:33:55.369704Z","submitted_at":"2023-10-16T16:07:41Z","title":"Microscaling Data Formats for Deep Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10537","snapshot_observed_at":"2026-08-02T03:25:29.316109Z","title":"Microscaling Data Formats for Deep Learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13898","last_updated":"2026-07-15T14:40:59Z","snapshot_observed_at":"2026-08-02T03:25:28.471378Z","submitted_at":"2026-07-15T14:40:59Z","title":"Jack of All Scales: A Versatile FPGA Tensor Block for MXFP Precisions","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T03:25:29.316109Z"},"links":{"cited_paper":"/paper/2310.10537","citing_paper":"/paper/2607.13898"},"observation_digest":"sha256:fc3c6c5ff05c1a9ace76d54216f648bae529e70279e2cfbc0cbfa114b3b94618","observation_id":"345071d8-d100-4f97-9f30-ebfbf078e0d6","resolution":{"observed_at":"2026-08-02T03:25:29.316109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10537","last_updated":"2023-10-19T16:38:33Z","snapshot_observed_at":"2026-07-06T16:33:55.369704Z","submitted_at":"2023-10-16T16:07:41Z","title":"Microscaling Data Formats for Deep Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10537","snapshot_observed_at":"2026-08-01T17:12:27.562005Z","title":"arXiv preprint arXiv:2310.10537 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17733","last_updated":"2026-07-20T09:23:10Z","snapshot_observed_at":"2026-08-03T10:45:48.871032Z","submitted_at":"2026-07-20T09:23:10Z","title":"MXSens: Sensitivity-Aware Mixed-Precision Quantization for Efficient LLM Inference","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-01T17:12:27.562005Z"},"links":{"cited_paper":"/paper/2310.10537","citing_paper":"/paper/2607.17733"},"observation_digest":"sha256:d2c9008ae3caf50fc364a382d9a529c43d8aa46bffa977376829492fd9208575","observation_id":"be13ca87-9323-40a3-bad4-990ba4de8185","resolution":{"observed_at":"2026-08-01T17:12:27.562005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10537","last_updated":"2023-10-19T16:38:33Z","snapshot_observed_at":"2026-07-06T16:33:55.369704Z","submitted_at":"2023-10-16T16:07:41Z","title":"Microscaling Data Formats for Deep Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10537","snapshot_observed_at":"2026-08-01T17:12:28.283144Z","title":"Microscaling Data Formats for Deep Learning , journal =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.17733","last_updated":"2026-07-20T09:23:10Z","snapshot_observed_at":"2026-08-03T10:45:48.871032Z","submitted_at":"2026-07-20T09:23:10Z","title":"MXSens: Sensitivity-Aware Mixed-Precision Quantization for Efficient LLM Inference","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-01T17:12:28.283144Z"},"links":{"cited_paper":"/paper/2310.10537","citing_paper":"/paper/2607.17733"},"observation_digest":"sha256:684f18706d0d25ceac4d8264ca025e7a514d0149e4c7df0ba6a232c487351f0c","observation_id":"d150366b-146d-4864-8500-6d7060c83dfc","resolution":{"observed_at":"2026-08-01T17:12:28.283144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10537","last_updated":"2023-10-19T16:38:33Z","snapshot_observed_at":"2026-07-06T16:33:55.369704Z","submitted_at":"2023-10-16T16:07:41Z","title":"Microscaling Data Formats for Deep Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10537","snapshot_observed_at":"2026-08-02T08:11:51.850576Z","title":"Microscaling data formats for deep learning.arXiv preprint arXiv:2310.10537, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.20518","last_updated":"2026-07-08T02:22:22Z","snapshot_observed_at":"2026-08-02T08:11:49.429401Z","submitted_at":"2026-07-08T02:22:22Z","title":"CANN Bench: Benchmarking Agent Generated Kernels against Real NPU and Algorithmic Limits","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T08:11:51.850576Z"},"links":{"cited_paper":"/paper/2310.10537","citing_paper":"/paper/2607.20518"},"observation_digest":"sha256:980116c581a36fe4613b53c825f3c5df1eb392a8694dcab3ef12460db36d5034","observation_id":"16918522-e25b-46b1-aa71-5d4ea41f551a","resolution":{"observed_at":"2026-08-02T08:11:51.850576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10537","last_updated":"2023-10-19T16:38:33Z","snapshot_observed_at":"2026-07-06T16:33:55.369704Z","submitted_at":"2023-10-16T16:07:41Z","title":"Microscaling Data Formats for Deep Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10537","snapshot_observed_at":"2026-07-31T16:32:52.030874Z","title":"Microscaling data formats for deep learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24377","last_updated":"2026-07-27T12:53:22Z","snapshot_observed_at":"2026-08-04T11:30:12.414384Z","submitted_at":"2026-07-27T12:53:22Z","title":"MXAttention: Data-Free Optimal Scaling and Pre-Normalization Quantization for MXFP4 Attention","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-31T16:32:52.030874Z"},"links":{"cited_paper":"/paper/2310.10537","citing_paper":"/paper/2607.24377"},"observation_digest":"sha256:46d61f3c402fe054fe4c5f9147b8377b88cc96d6146360dcc06d7268d2098537","observation_id":"e42587c1-dcac-4350-8f5e-00f64a879e1f","resolution":{"observed_at":"2026-07-31T16:32:52.030874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10537","last_updated":"2023-10-19T16:38:33Z","snapshot_observed_at":"2026-07-06T16:33:55.369704Z","submitted_at":"2023-10-16T16:07:41Z","title":"Microscaling Data Formats for Deep Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10537","snapshot_observed_at":"2026-07-31T05:04:00.375801Z","title":"Microscaling data formats for deep learning.arXiv preprint arXiv:2310.10537, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24953","last_updated":"2026-07-27T18:03:34Z","snapshot_observed_at":"2026-08-02T14:17:58.928914Z","submitted_at":"2026-07-27T18:03:34Z","title":"Stable FP4 Training via Transposition-Invariant Block Quantization","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-31T05:04:00.375801Z"},"links":{"cited_paper":"/paper/2310.10537","citing_paper":"/paper/2607.24953"},"observation_digest":"sha256:b1433177000cd8591f4a643b69b72110ed1b5333aff5459b7001a18a679f31bb","observation_id":"aca84154-2b5c-41cb-816f-ca068542a253","resolution":{"observed_at":"2026-07-31T05:04:00.375801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10537","last_updated":"2023-10-19T16:38:33Z","snapshot_observed_at":"2026-07-06T16:33:55.369704Z","submitted_at":"2023-10-16T16:07:41Z","title":"Microscaling Data Formats for Deep Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10537","snapshot_observed_at":"2026-08-01T03:16:46.884728Z","title":"Microscaling data formats for deep learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.27694","last_updated":"2026-07-30T05:26:20Z","snapshot_observed_at":"2026-08-02T23:38:31.307524Z","submitted_at":"2026-07-30T05:26:20Z","title":"GyRot: Leveraging Hidden Synergy between Rotation and Fine-grained Group Quantization for Low-bit LLM Inference","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-01T03:16:46.884728Z"},"links":{"cited_paper":"/paper/2310.10537","citing_paper":"/paper/2607.27694"},"observation_digest":"sha256:0e15a3066a0ac22087b57c4089e298473c8dfa2ae5c8a8bb833accec1a354f13","observation_id":"2d02397a-cb4b-4f3f-a300-63f457fec6d0","resolution":{"observed_at":"2026-08-01T03:16:46.884728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10537","last_updated":"2023-10-19T16:38:33Z","snapshot_observed_at":"2026-07-06T16:33:55.369704Z","submitted_at":"2023-10-16T16:07:41Z","title":"Microscaling Data Formats for Deep Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10537","snapshot_observed_at":"2026-08-01T03:01:45.331505Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27704","last_updated":"2026-07-30T05:39:58Z","snapshot_observed_at":"2026-08-04T01:14:27.509565Z","submitted_at":"2026-07-30T05:39:58Z","title":"LightRot: A Light-Weighted Rotation Scheme and Architecture for Accurate Low-Bit Large Language Model Inference","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T03:01:45.331505Z"},"links":{"cited_paper":"/paper/2310.10537","citing_paper":"/paper/2607.27704"},"observation_digest":"sha256:27699296d39daf962d868f8090f6f8e6eca633af87be0067586091cad0fe369b","observation_id":"2399894d-50e4-4d9a-9916-01847cc72137","resolution":{"observed_at":"2026-08-01T03:01:45.331505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10537","last_updated":"2023-10-19T16:38:33Z","snapshot_observed_at":"2026-07-06T16:33:55.369704Z","submitted_at":"2023-10-16T16:07:41Z","title":"Microscaling Data Formats for Deep Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10537","snapshot_observed_at":"2026-08-03T07:51:22.144778Z","title":"arXiv preprint arXiv:2310.10537 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29397","last_updated":"2026-07-31T13:15:11Z","snapshot_observed_at":"2026-08-04T16:31:34.397987Z","submitted_at":"2026-07-31T13:15:11Z","title":"Studying quantization trade-offs for efficient inference deployment in machine translation","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-03T07:51:22.144778Z"},"links":{"cited_paper":"/paper/2310.10537","citing_paper":"/paper/2607.29397"},"observation_digest":"sha256:4e8abc25f2fc2df99c2481d91533a38fdaed6666d89d0b3bc5daa3dec9fdfeaf","observation_id":"07becc51-2ceb-46cf-a8fa-f4e98530c00b","resolution":{"observed_at":"2026-08-03T07:51:22.144778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10537","last_updated":"2023-10-19T16:38:33Z","snapshot_observed_at":"2026-07-06T16:33:55.369704Z","submitted_at":"2023-10-16T16:07:41Z","title":"Microscaling Data Formats for Deep Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10537","snapshot_observed_at":"2026-08-04T15:20:16.175942Z","title":"Microscaling data formats for deep learning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02091","last_updated":"2026-08-03T11:50:06Z","snapshot_observed_at":"2026-08-04T16:57:16.166296Z","submitted_at":"2026-08-03T11:50:06Z","title":"One QK Channel, Many Sources: Guarding Low-Precision Attention Collapse","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T15:20:16.175942Z"},"links":{"cited_paper":"/paper/2310.10537","citing_paper":"/paper/2608.02091"},"observation_digest":"sha256:07189e16feb272d0820c9fe86f26ea2d52d279bb96f97f3194d14321a05b8987","observation_id":"0feeb5e7-3265-4323-a76d-44f7884cf796","resolution":{"observed_at":"2026-08-04T15:20:16.175942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2310.10537/citation-record","integrity":"/paper/2310.10537/integrity","json":"/paper/2310.10537/citation-record.json","paper":"/paper/2310.10537"},"outbound":[],"paper":{"arxiv_id":"2310.10537","last_updated":"2023-10-19T16:38:33Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T16:33:55.369704Z","submitted_at":"2023-10-16T16:07:41Z","title":"Microscaling Data Formats for Deep Learning"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 48 inbound Pith citation observations for arXiv:2310.10537."}