{"as_of":"2026-08-09T17:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1bf4aebdc320c715232e675649437a167c8f18ac003898a71eb4818832ecb52d","coverage":[{"denominator":32,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":32,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T17:19:29.257758Z","state":"measured"},{"denominator":33,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":33,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-19T16:35:40.231293Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-19T16:37:39.800519Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.05967","last_updated":"2025-06-05T08:10:47Z","snapshot_observed_at":"2026-08-08T17:09:44.232666Z","submitted_at":"2025-02-09T17:31:09Z","title":"$\\mu$nit Scaling: Simple and Scalable FP8 LLM Training","version":3},"cited_work":{"arxiv_id":"2502.05967","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.05967","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2502.05967","venue":null,"work_id":"13690185-5a56-496d-9810-076e23214e81","year":null},"citing_paper":{"arxiv_id":"2605.15290","last_updated":"2026-05-14T18:03:16Z","snapshot_observed_at":"2026-07-06T23:26:37.362117Z","submitted_at":"2026-05-14T18:03:16Z","title":"GQA-{\\mu}P: The maximal parameterization update for grouped query attention","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-19T16:35:40.231293Z"},"links":{"cited_paper":"/paper/2502.05967","citing_paper":"/paper/2605.15290"},"observation_digest":"sha256:4fdefcc446bbda982d78ac655e706fadbf4bed1d77588cdf511ca7c1aceef3f8","observation_id":"480a76eb-61a5-447c-bacd-b121edb009f7","resolution":{"observed_at":"2026-05-19T16:37:39.801944Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.05967/citation-record","integrity":"/paper/2502.05967/integrity","json":"/paper/2502.05967/citation-record.json","paper":"/paper/2502.05967"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:19:29.720253Z","title":"Scaling FP 8 training to trillion-token LLM s","venue":null,"work_id":"1c481e96-4624-4805-b502-1d0ea1877804","year":2024},"citing_paper":{"arxiv_id":"2502.05967","last_updated":"2025-06-05T08:10:47Z","snapshot_observed_at":"2026-08-08T17:09:44.232666Z","submitted_at":"2025-02-09T17:31:09Z","title":"$\\mu$nit Scaling: Simple and Scalable FP8 LLM Training","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-08T17:19:29.124327Z"},"links":{"citing_paper":"/paper/2502.05967"},"observation_digest":"sha256:df5e78d6d91402bd0ca28a050ad0bb6dfea940b9eee91df0d0e25d4756996953","observation_id":"96ddc2c1-2900-4902-9aa8-8785742dc3e0","resolution":{"observed_at":"2026-08-08T17:19:29.723781Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:19:29.709732Z","title":"Calibrating the Mosaic evaluation Gauntlet , 4 2024","venue":null,"work_id":"2061992f-2627-4968-93ad-f1bd00dc9c44","year":2024},"citing_paper":{"arxiv_id":"2502.05967","last_updated":"2025-06-05T08:10:47Z","snapshot_observed_at":"2026-08-08T17:09:44.232666Z","submitted_at":"2025-02-09T17:31:09Z","title":"$\\mu$nit Scaling: Simple and Scalable FP8 LLM Training","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-08T17:19:29.128906Z"},"links":{"citing_paper":"/paper/2502.05967"},"observation_digest":"sha256:0242076ac2c9f3029beec22891dc5e79048244257a4d0170824f12ccd8a06b66","observation_id":"be115354-0bf3-490b-8643-6dd7d0517722","resolution":{"observed_at":"2026-08-08T17:19:29.713434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:19:29.699105Z","title":"Unit scaling: Out-of-the-box low-precision training","venue":null,"work_id":"da2d1f47-ddd2-4571-b5cb-141ac25a4f1b","year":2023},"citing_paper":{"arxiv_id":"2502.05967","last_updated":"2025-06-05T08:10:47Z","snapshot_observed_at":"2026-08-08T17:09:44.232666Z","submitted_at":"2025-02-09T17:31:09Z","title":"$\\mu$nit Scaling: Simple and Scalable FP8 LLM Training","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-08T17:19:29.132981Z"},"links":{"citing_paper":"/paper/2502.05967"},"observation_digest":"sha256:d0014625b6aaacf819e80fb8def9afffa3861e85613be8ab9403f018c0cfc295","observation_id":"1ae901c9-233d-4631-bc4f-e16d4ce3175f","resolution":{"observed_at":"2026-08-08T17:19:29.703031Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:19:29.688251Z","title":"Y., Deiseroth, B., Cruz-Salinas, A","venue":null,"work_id":"3441bf11-14ff-4a33-b4bd-856ce35404ac","year":2024},"citing_paper":{"arxiv_id":"2502.05967","last_updated":"2025-06-05T08:10:47Z","snapshot_observed_at":"2026-08-08T17:09:44.232666Z","submitted_at":"2025-02-09T17:31:09Z","title":"$\\mu$nit Scaling: Simple and Scalable FP8 LLM Training","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-08T17:19:29.137768Z"},"links":{"citing_paper":"/paper/2502.05967"},"observation_digest":"sha256:6425d372c84afb91ce41b3a81c4e09dde596b1207009d4395c6a6fe733082c10","observation_id":"4b7d9766-8df9-4506-8ef9-042a19fff08b","resolution":{"observed_at":"2026-08-08T17:19:29.691447Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:19:29.678075Z","title":"and Berger, R","venue":null,"work_id":"b925db76-275d-4650-b508-2a3a0d8d9aeb","year":2002},"citing_paper":{"arxiv_id":"2502.05967","last_updated":"2025-06-05T08:10:47Z","snapshot_observed_at":"2026-08-08T17:09:44.232666Z","submitted_at":"2025-02-09T17:31:09Z","title":"$\\mu$nit Scaling: Simple and Scalable FP8 LLM Training","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-08T17:19:29.147562Z"},"links":{"citing_paper":"/paper/2502.05967"},"observation_digest":"sha256:c7a76a2411bb468e86e7dcf5624df9e8352af14d3d3b6f04512eafc78ad4ae94","observation_id":"e5c59901-c6f5-45d5-a2d8-1fa0f4027f2a","resolution":{"observed_at":"2026-08-08T17:19:29.681667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:19:29.666869Z","title":null,"venue":null,"work_id":"67770138-dc61-4003-ba3a-1975b104d843","year":2023},"citing_paper":{"arxiv_id":"2502.05967","last_updated":"2025-06-05T08:10:47Z","snapshot_observed_at":"2026-08-08T17:09:44.232666Z","submitted_at":"2025-02-09T17:31:09Z","title":"$\\mu$nit Scaling: Simple and Scalable FP8 LLM Training","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-08T17:19:29.151332Z"},"links":{"citing_paper":"/paper/2502.05967"},"observation_digest":"sha256:c218171b3a38cd844a54770c52183e6c7b35df8b9839525fdd16bd415a652c83","observation_id":"63e97931-b0fe-4eb0-b0b5-cdfa73cab07c","resolution":{"observed_at":"2026-08-08T17:19:29.670824Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:19:29.656393Z","title":"LLM .int8(): 8-bit matrix multiplication for transformers at scale","venue":null,"work_id":"acae5d85-1da1-4514-a1fe-7439180c2b84","year":2022},"citing_paper":{"arxiv_id":"2502.05967","last_updated":"2025-06-05T08:10:47Z","snapshot_observed_at":"2026-08-08T17:09:44.232666Z","submitted_at":"2025-02-09T17:31:09Z","title":"$\\mu$nit Scaling: Simple and Scalable FP8 LLM Training","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-08T17:19:29.156732Z"},"links":{"citing_paper":"/paper/2502.05967"},"observation_digest":"sha256:3a8160d6abeb882c5c469c4dc4bf262bbc5868dce9946199c32f9142a3c60d36","observation_id":"83163bd4-76ba-4dc6-822d-0ef0c3b474a1","resolution":{"observed_at":"2026-08-08T17:19:29.660262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:19:29.645429Z","title":"Blazingly fast LLM evaluation for in-context learning, 2 2023","venue":null,"work_id":"34cb1d76-9e43-4c56-95e4-1272ccaf82e3","year":2023},"citing_paper":{"arxiv_id":"2502.05967","last_updated":"2025-06-05T08:10:47Z","snapshot_observed_at":"2026-08-08T17:09:44.232666Z","submitted_at":"2025-02-09T17:31:09Z","title":"$\\mu$nit Scaling: Simple and Scalable FP8 LLM Training","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-08T17:19:29.161453Z"},"links":{"citing_paper":"/paper/2502.05967"},"observation_digest":"sha256:104010d1b0bf520b05b38e64035cbc7a12fcc096f65dc36be8b15aa134c814b3","observation_id":"c5b080e9-8866-464e-9a1e-05eae69138c8","resolution":{"observed_at":"2026-08-08T17:19:29.649863Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05496","last_updated":"2024-12-07T01:46:38Z","snapshot_observed_at":"2026-08-07T15:28:16.662668Z","submitted_at":"2024-12-07T01:46:38Z","title":"Flex Attention: A Programming Model for Generating Optimized Attention Kernels","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05496","snapshot_observed_at":"2026-08-08T17:19:29.164938Z","title":"Flex attention: A programming model for generating optimized attention kernels, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05967","last_updated":"2025-06-05T08:10:47Z","snapshot_observed_at":"2026-08-08T17:09:44.232666Z","submitted_at":"2025-02-09T17:31:09Z","title":"$\\mu$nit Scaling: Simple and Scalable FP8 LLM Training","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-08T17:19:29.164938Z"},"links":{"cited_paper":"/paper/2412.05496","citing_paper":"/paper/2502.05967"},"observation_digest":"sha256:29e9d7248a4ff5804e0b1de74f47dcbc96f579079da405a2ee41055b8f67ca90","observation_id":"131c9f01-2a4d-4373-bdc1-e7c3d7d42eef","resolution":{"observed_at":"2026-08-08T17:19:29.164938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.05615","last_updated":"2021-01-13T00:34:04Z","snapshot_observed_at":"2026-07-06T10:32:32.891632Z","submitted_at":"2021-01-13T00:34:04Z","title":"FBGEMM: Enabling High-Performance Low-Precision Deep Learning Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.05615","snapshot_observed_at":"2026-08-08T17:19:29.168874Z","title":"Fbgemm: Enabling high-performance low-precision deep learning inference, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.05967","last_updated":"2025-06-05T08:10:47Z","snapshot_observed_at":"2026-08-08T17:09:44.232666Z","submitted_at":"2025-02-09T17:31:09Z","title":"$\\mu$nit Scaling: Simple and Scalable FP8 LLM Training","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-08T17:19:29.168874Z"},"links":{"cited_paper":"/paper/2101.05615","citing_paper":"/paper/2502.05967"},"observation_digest":"sha256:fa00f733256f1462a67f924b6c5a985d55b0292ad0f0c6d5fdd0d9e056257fc1","observation_id":"5b033ee9-601f-4d05-bac6-400ec649f6a7","resolution":{"observed_at":"2026-08-08T17:19:29.168874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-08T17:19:29.172567Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.05967","last_updated":"2025-06-05T08:10:47Z","snapshot_observed_at":"2026-08-08T17:09:44.232666Z","submitted_at":"2025-02-09T17:31:09Z","title":"$\\mu$nit Scaling: Simple and Scalable FP8 LLM Training","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-08T17:19:29.172567Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2502.05967"},"observation_digest":"sha256:86c5fe9eb33ece680f43f7c6f69465d4cab1d5cfc0026c0adf40d674853ae049","observation_id":"c2caf857-8d98-465e-843d-2c3babedd853","resolution":{"observed_at":"2026-08-08T17:19:29.172567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05728","last_updated":"2025-02-13T23:19:42Z","snapshot_observed_at":"2026-07-06T17:57:23.183907Z","submitted_at":"2024-04-08T17:59:44Z","title":"An Empirical Study of $\\mu$P Learning Rate Transfer","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.05728","snapshot_observed_at":"2026-08-08T17:19:29.177838Z","title":"A large-scale exploration of -transfer, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05967","last_updated":"2025-06-05T08:10:47Z","snapshot_observed_at":"2026-08-08T17:09:44.232666Z","submitted_at":"2025-02-09T17:31:09Z","title":"$\\mu$nit Scaling: Simple and Scalable FP8 LLM Training","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-08T17:19:29.177838Z"},"links":{"cited_paper":"/paper/2404.05728","citing_paper":"/paper/2502.05967"},"observation_digest":"sha256:4d58394e102e68c7dfca06c5ded361164ecfa8d67614c75a77ad1a75d571899a","observation_id":"71dac2fd-01c7-4d32-a163-a40994b02812","resolution":{"observed_at":"2026-08-08T17:19:29.177838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:19:29.182203Z","title":"Swin transformer v2: Scaling up capacity and resolution","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.05967","last_updated":"2025-06-05T08:10:47Z","snapshot_observed_at":"2026-08-08T17:09:44.232666Z","submitted_at":"2025-02-09T17:31:09Z","title":"$\\mu$nit Scaling: Simple and Scalable FP8 LLM Training","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-08T17:19:29.182203Z"},"links":{"citing_paper":"/paper/2502.05967"},"observation_digest":"sha256:25ca50bf15674b22f9a422509c8b12319c1f7ad48d6cc73732691f23ca21bae8","observation_id":"38016c2e-d8c8-4112-9998-e32ca5ea3471","resolution":{"observed_at":"2026-08-08T17:19:29.182203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:19:29.628997Z","title":"Mixed precision training","venue":null,"work_id":"e3ff0e3a-ccc3-4a8a-b322-46dd804a1e1e","year":2018},"citing_paper":{"arxiv_id":"2502.05967","last_updated":"2025-06-05T08:10:47Z","snapshot_observed_at":"2026-08-08T17:09:44.232666Z","submitted_at":"2025-02-09T17:31:09Z","title":"$\\mu$nit Scaling: Simple and Scalable FP8 LLM Training","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-08T17:19:29.185719Z"},"links":{"citing_paper":"/paper/2502.05967"},"observation_digest":"sha256:e1b96a3a5bf007f03db468ace903e40676397408cbb4ae9647123bffe9ae6828","observation_id":"aa95d758-2d0a-41e1-88ab-269b8b08569e","resolution":{"observed_at":"2026-08-08T17:19:29.632410Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.05433","last_updated":"2022-09-29T20:47:07Z","snapshot_observed_at":"2026-07-06T13:51:20.183063Z","submitted_at":"2022-09-12T17:39:55Z","title":"FP8 Formats for Deep Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.05433","snapshot_observed_at":"2026-08-08T17:19:29.189352Z","title":"Fp8 formats for deep learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.05967","last_updated":"2025-06-05T08:10:47Z","snapshot_observed_at":"2026-08-08T17:09:44.232666Z","submitted_at":"2025-02-09T17:31:09Z","title":"$\\mu$nit Scaling: Simple and Scalable FP8 LLM Training","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-08T17:19:29.189352Z"},"links":{"cited_paper":"/paper/2209.05433","citing_paper":"/paper/2502.05967"},"observation_digest":"sha256:90f1470dc6fc647b60e614c1356c16b8b31437640424646f8e2ca95dd967d61f","observation_id":"1ae13680-7316-4c76-bd0e-eeb389e9106d","resolution":{"observed_at":"2026-08-08T17:19:29.189352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:19:29.617947Z","title":"I., Alizadeh-Vahid, K., Mehta, S., del Mundo, C","venue":null,"work_id":"9fd7d2e4-d0cf-4dae-a7da-deb1bd273f9d","year":2024},"citing_paper":{"arxiv_id":"2502.05967","last_updated":"2025-06-05T08:10:47Z","snapshot_observed_at":"2026-08-08T17:09:44.232666Z","submitted_at":"2025-02-09T17:31:09Z","title":"$\\mu$nit Scaling: Simple and Scalable FP8 LLM Training","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-08T17:19:29.193163Z"},"links":{"citing_paper":"/paper/2502.05967"},"observation_digest":"sha256:304975b0848bbe10d648abb5a8460ef17b804eea23a1ec0f09d4f6087a135c29","observation_id":"58904f1e-1df3-4abd-b755-600b094d9e95","resolution":{"observed_at":"2026-08-08T17:19:29.621493Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:19:29.606831Z","title":"Composer","venue":null,"work_id":"8dc620ae-0d47-4f06-a438-723eac4df9b7","year":2021},"citing_paper":{"arxiv_id":"2502.05967","last_updated":"2025-06-05T08:10:47Z","snapshot_observed_at":"2026-08-08T17:09:44.232666Z","submitted_at":"2025-02-09T17:31:09Z","title":"$\\mu$nit Scaling: Simple and Scalable FP8 LLM Training","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-08T17:19:29.196804Z"},"links":{"citing_paper":"/paper/2502.05967"},"observation_digest":"sha256:9355e46c4ebab682710e5bf187027d1723391a1d60dda1bd1407cf9740016be5","observation_id":"3f90a058-88e0-48f3-8eff-0275d559a572","resolution":{"observed_at":"2026-08-08T17:19:29.610565Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:19:29.595908Z","title":"LLM F oundry","venue":null,"work_id":"62d8e490-fb86-4de0-84bf-b0698ccf7e0c","year":2022},"citing_paper":{"arxiv_id":"2502.05967","last_updated":"2025-06-05T08:10:47Z","snapshot_observed_at":"2026-08-08T17:09:44.232666Z","submitted_at":"2025-02-09T17:31:09Z","title":"$\\mu$nit Scaling: Simple and Scalable FP8 LLM Training","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-08T17:19:29.200330Z"},"links":{"citing_paper":"/paper/2502.05967"},"observation_digest":"sha256:b656952e5703b162aa54f079d47273768b41c401a38fb409f7d7c76ff2379103","observation_id":"3d7f6d4f-077d-4fb7-b60d-eb2a0c67a44e","resolution":{"observed_at":"2026-08-08T17:19:29.599524Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:19:29.584778Z","title":"Streaming","venue":null,"work_id":"ff4525c6-d7bc-4b76-8d97-5aa92dabc8d2","year":2022},"citing_paper":{"arxiv_id":"2502.05967","last_updated":"2025-06-05T08:10:47Z","snapshot_observed_at":"2026-08-08T17:09:44.232666Z","submitted_at":"2025-02-09T17:31:09Z","title":"$\\mu$nit Scaling: Simple and Scalable FP8 LLM Training","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-08T17:19:29.203719Z"},"links":{"citing_paper":"/paper/2502.05967"},"observation_digest":"sha256:cd2e10b82740d6fb04835a010b5a43c220523f9b2c5593312db0596d96e25b16","observation_id":"80a15c84-ba1c-4aa0-aba8-25a7aef724fb","resolution":{"observed_at":"2026-08-08T17:19:29.588442Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:19:29.574025Z","title":"Asynchronous multiply-and-accumulate instruction: wgmma.mma\\_async","venue":null,"work_id":"bf966214-edb0-476a-a8d5-23ff9104655e","year":null},"citing_paper":{"arxiv_id":"2502.05967","last_updated":"2025-06-05T08:10:47Z","snapshot_observed_at":"2026-08-08T17:09:44.232666Z","submitted_at":"2025-02-09T17:31:09Z","title":"$\\mu$nit Scaling: Simple and Scalable FP8 LLM Training","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-08T17:19:29.208054Z"},"links":{"citing_paper":"/paper/2502.05967"},"observation_digest":"sha256:d2e4a9e8d59eb116e50983d2486d27bf6de16e2294178fb4b839be21ccc3a6e7","observation_id":"55d2c8bb-f9de-4b44-b4fb-ddc3c061e630","resolution":{"observed_at":"2026-08-08T17:19:29.577873Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:19:29.563628Z","title":"Transformer E ngine, 2023","venue":null,"work_id":"9c6715a4-e22f-430e-9478-2a200c6b8971","year":2023},"citing_paper":{"arxiv_id":"2502.05967","last_updated":"2025-06-05T08:10:47Z","snapshot_observed_at":"2026-08-08T17:09:44.232666Z","submitted_at":"2025-02-09T17:31:09Z","title":"$\\mu$nit Scaling: Simple and Scalable FP8 LLM Training","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-08T17:19:29.212306Z"},"links":{"citing_paper":"/paper/2502.05967"},"observation_digest":"sha256:193a469ed0456131e4f1106eb73ebc5fe0b78ec7714948f3a0acc336b41b2565","observation_id":"c417dd04-99ef-49cd-92b8-c135a238169d","resolution":{"observed_at":"2026-08-08T17:19:29.567179Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:19:29.552057Z","title":"cuBLAS : cublasLtMatmul()","venue":null,"work_id":"b5d627ef-23a5-48c8-9462-eda7dab33214","year":2024},"citing_paper":{"arxiv_id":"2502.05967","last_updated":"2025-06-05T08:10:47Z","snapshot_observed_at":"2026-08-08T17:09:44.232666Z","submitted_at":"2025-02-09T17:31:09Z","title":"$\\mu$nit Scaling: Simple and Scalable FP8 LLM Training","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-08T17:19:29.216823Z"},"links":{"citing_paper":"/paper/2502.05967"},"observation_digest":"sha256:ab17b1a16bdfd95c36fbe93bc89d4cdd0460879ead2c6bc20e1a6bdfdd169f5f","observation_id":"4404d4ff-b480-467d-903c-1de8557f7243","resolution":{"observed_at":"2026-08-08T17:19:29.556156Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00656","last_updated":"2025-10-08T07:50:45Z","snapshot_observed_at":"2026-08-08T06:58:44.493777Z","submitted_at":"2024-12-31T21:55:10Z","title":"2 OLMo 2 Furious","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00656","snapshot_observed_at":"2026-08-08T17:19:29.220412Z","title":"2 olmo 2 furious","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05967","last_updated":"2025-06-05T08:10:47Z","snapshot_observed_at":"2026-08-08T17:09:44.232666Z","submitted_at":"2025-02-09T17:31:09Z","title":"$\\mu$nit Scaling: Simple and Scalable FP8 LLM Training","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-08T17:19:29.220412Z"},"links":{"cited_paper":"/paper/2501.00656","citing_paper":"/paper/2502.05967"},"observation_digest":"sha256:42180383522f03903d8b4ae724eb15ebd205831cdac7870cebbfb1efc6bbcdc1","observation_id":"f9c9cec1-849b-4b84-ae3a-4f0d1c8534cc","resolution":{"observed_at":"2026-08-08T17:19:29.220412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:19:29.540446Z","title":"V., Cui, X., Zhang, W., and Gopalakrishnan, K","venue":null,"work_id":"d58ecb1e-a861-4d94-8c15-f815a16435aa","year":2019},"citing_paper":{"arxiv_id":"2502.05967","last_updated":"2025-06-05T08:10:47Z","snapshot_observed_at":"2026-08-08T17:09:44.232666Z","submitted_at":"2025-02-09T17:31:09Z","title":"$\\mu$nit Scaling: Simple and Scalable FP8 LLM Training","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-08T17:19:29.224893Z"},"links":{"citing_paper":"/paper/2502.05967"},"observation_digest":"sha256:487185b347abdfce7b5ddd0363257f2ad09ffaf56ec610da8ebc760fa1b301c3","observation_id":"4d7e4bda-9da5-49cc-993a-5c765416cdb3","resolution":{"observed_at":"2026-08-08T17:19:29.544769Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:19:29.229551Z","title":"T., and Cox, D","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.05967","last_updated":"2025-06-05T08:10:47Z","snapshot_observed_at":"2026-08-08T17:09:44.232666Z","submitted_at":"2025-02-09T17:31:09Z","title":"$\\mu$nit Scaling: Simple and Scalable FP8 LLM Training","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-08T17:19:29.229551Z"},"links":{"citing_paper":"/paper/2502.05967"},"observation_digest":"sha256:b608c97112afcabe7e4cc6d6ad0ffb62a1bf398d4c064e928debc7eafb7dc220","observation_id":"9235daec-c6e0-4fe5-befc-e41a88f096f5","resolution":{"observed_at":"2026-08-08T17:19:29.229551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:19:29.233664Z","title":"N., Kaiser, L","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.05967","last_updated":"2025-06-05T08:10:47Z","snapshot_observed_at":"2026-08-08T17:09:44.232666Z","submitted_at":"2025-02-09T17:31:09Z","title":"$\\mu$nit Scaling: Simple and Scalable FP8 LLM Training","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-08T17:19:29.233664Z"},"links":{"citing_paper":"/paper/2502.05967"},"observation_digest":"sha256:d06c2ab909415dd2246e9b0a79ab71aa81ab1a518cdfdae8694007a7c7af1ad4","observation_id":"2247b83d-277f-4b2f-b595-915f8d23d1e0","resolution":{"observed_at":"2026-08-08T17:19:29.233664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.13698","last_updated":"2025-06-01T16:35:40Z","snapshot_observed_at":"2026-08-09T06:13:16.272849Z","submitted_at":"2024-05-22T14:43:02Z","title":"How to set AdamW's weight decay as you scale model and dataset size","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.13698","snapshot_observed_at":"2026-08-08T17:19:29.237555Z","title":"and Aitchison, L","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05967","last_updated":"2025-06-05T08:10:47Z","snapshot_observed_at":"2026-08-08T17:09:44.232666Z","submitted_at":"2025-02-09T17:31:09Z","title":"$\\mu$nit Scaling: Simple and Scalable FP8 LLM Training","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-08T17:19:29.237555Z"},"links":{"cited_paper":"/paper/2405.13698","citing_paper":"/paper/2502.05967"},"observation_digest":"sha256:9ecf4309527db2d73419e69daa931ba642430d4807860d2f077d57320ec50ce7","observation_id":"90af06df-b171-4857-bc55-902473b9d5df","resolution":{"observed_at":"2026-08-08T17:19:29.237555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:19:29.523096Z","title":"J., Xiao, L., Everett, K","venue":null,"work_id":"a30a5200-4f6a-4e22-a1b4-53d448189ffd","year":2024},"citing_paper":{"arxiv_id":"2502.05967","last_updated":"2025-06-05T08:10:47Z","snapshot_observed_at":"2026-08-08T17:09:44.232666Z","submitted_at":"2025-02-09T17:31:09Z","title":"$\\mu$nit Scaling: Simple and Scalable FP8 LLM Training","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-08T17:19:29.241813Z"},"links":{"citing_paper":"/paper/2502.05967"},"observation_digest":"sha256:f8f64175d69a7c2e23deaabc7ed7ed0303adfd2af4580662a5325a8094ebcd65","observation_id":"5990abfe-fed8-4212-8098-42e725d1572a","resolution":{"observed_at":"2026-08-08T17:19:29.526729Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:19:29.511552Z","title":"J., Babuschkin, I., Sidor, S., Liu, X., Farhi, D., Ryder, N., Pachocki, J., Chen, W., and Gao, J","venue":null,"work_id":"c98c4327-e4f1-497b-a8d2-2f84ad46a15a","year":2021},"citing_paper":{"arxiv_id":"2502.05967","last_updated":"2025-06-05T08:10:47Z","snapshot_observed_at":"2026-08-08T17:09:44.232666Z","submitted_at":"2025-02-09T17:31:09Z","title":"$\\mu$nit Scaling: Simple and Scalable FP8 LLM Training","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-08T17:19:29.245461Z"},"links":{"citing_paper":"/paper/2502.05967"},"observation_digest":"sha256:b896cc901a37fd7a8bb9bcfaae0bcc463ac2280b64f1c2357ccf408811e172e7","observation_id":"f43f067b-788c-4ce3-b69e-e1547344345b","resolution":{"observed_at":"2026-08-08T17:19:29.515309Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.17813","last_updated":"2024-05-14T00:10:33Z","snapshot_observed_at":"2026-07-06T16:39:16.652626Z","submitted_at":"2023-10-26T23:17:39Z","title":"A Spectral Condition for Feature Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.17813","snapshot_observed_at":"2026-08-08T17:19:29.249207Z","title":"B., and Bernstein, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05967","last_updated":"2025-06-05T08:10:47Z","snapshot_observed_at":"2026-08-08T17:09:44.232666Z","submitted_at":"2025-02-09T17:31:09Z","title":"$\\mu$nit Scaling: Simple and Scalable FP8 LLM Training","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-08T17:19:29.249207Z"},"links":{"cited_paper":"/paper/2310.17813","citing_paper":"/paper/2502.05967"},"observation_digest":"sha256:d410e64d093cdf15a9fbe454a7b5d75c03b375f6e7b7ca54952eebd04f917e90","observation_id":"b974ecab-14f8-4001-bdb9-dc2704304119","resolution":{"observed_at":"2026-08-08T17:19:29.249207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:19:29.498751Z","title":"Tensor programs VI : Feature learning in infinite depth neural networks","venue":null,"work_id":"9a965672-bf63-4457-b48e-7e5ded76c144","year":2024},"citing_paper":{"arxiv_id":"2502.05967","last_updated":"2025-06-05T08:10:47Z","snapshot_observed_at":"2026-08-08T17:09:44.232666Z","submitted_at":"2025-02-09T17:31:09Z","title":"$\\mu$nit Scaling: Simple and Scalable FP8 LLM Training","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-08T17:19:29.253110Z"},"links":{"citing_paper":"/paper/2502.05967"},"observation_digest":"sha256:d08583ed788cdf025700e9fa4ec0d00a5f049f4d1ac426a033f7b02cf8f8f99a","observation_id":"5c200309-8b24-494a-9c8d-de876a55f057","resolution":{"observed_at":"2026-08-08T17:19:29.504154Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:19:29.257758Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05967","last_updated":"2025-06-05T08:10:47Z","snapshot_observed_at":"2026-08-08T17:09:44.232666Z","submitted_at":"2025-02-09T17:31:09Z","title":"$\\mu$nit Scaling: Simple and Scalable FP8 LLM Training","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-08T17:19:29.257758Z"},"links":{"citing_paper":"/paper/2502.05967"},"observation_digest":"sha256:359e80e0da9327e874bb99743dd98fecd6f22b03812152a3202f1aeaedf683f1","observation_id":"7c282597-b668-4e7a-aae6-89acc8a195f0","resolution":{"observed_at":"2026-08-08T17:19:29.257758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.05967","last_updated":"2025-06-05T08:10:47Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-08T17:09:44.232666Z","submitted_at":"2025-02-09T17:31:09Z","title":"$\\mu$nit Scaling: Simple and Scalable FP8 LLM Training"},"reference_resolution":{"displayed":32,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":13,"verified_exact":0,"verified_fuzzy":19},"total_outbound_references":32},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 32 of 32 outbound references and 1 inbound Pith citation observation for arXiv:2502.05967."}