{"as_of":"2026-08-23T11:23:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e2ee770fe0235d4eb8e3210d6e40b1c45c736154acc7c1ba3be6f7ccb8786f9e","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-09T09:15:12.214083Z","state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.07494/citation-record","integrity":"/paper/2607.07494/integrity","json":"/paper/2607.07494/citation-record.json","paper":"/paper/2607.07494"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1802.09941","last_updated":"2018-09-15T08:36:28Z","snapshot_observed_at":"2026-08-18T16:12:45.242664Z","submitted_at":"2018-02-26T08:47:34Z","title":"Demystifying Parallel and Distributed Deep Learning: An In-Depth Concurrency Analysis","version":2},"cited_work":{"arxiv_id":"1802.09941","doi":"10.48550/arxiv.1802.09941","metadata_source":"pith","pith_arxiv_id":"1802.09941","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Demystifying Parallel and Distributed Deep Learning: An In-Depth Concurrency Analysis","venue":"cs.LG","work_id":"24d2bff3-5f46-43cc-8aa8-865f85664f1a","year":2018},"citing_paper":{"arxiv_id":"2607.07494","last_updated":"2026-07-08T14:55:51Z","snapshot_observed_at":"2026-08-15T04:18:15.955265Z","submitted_at":"2026-07-08T14:55:51Z","title":"GIFT: Geometry-Informed Low-precision Gradient Communication for LLM Pretraining","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-09T09:15:12.214083Z"},"links":{"cited_paper":"/paper/1802.09941","citing_paper":"/paper/2607.07494"},"observation_digest":"sha256:bc726fdf9090925dddc964c770cce55c7e8053605e2881f493844af057e1686c","observation_id":"f2059980-4aad-474d-9191-13547e0f19a3","resolution":{"observed_at":"2026-07-09T09:16:06.522575Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:30.920088+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:30.920088+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1016/j.jpdc.2008.09.002","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Bandwidth optimal all-reduce algorithms for clusters of workstations,","venue":"Journal of Parallel and Distributed Computing","work_id":"1e28a4c1-7e78-494b-9ce5-62074b99add9","year":2009},"citing_paper":{"arxiv_id":"2607.07494","last_updated":"2026-07-08T14:55:51Z","snapshot_observed_at":"2026-08-15T04:18:15.955265Z","submitted_at":"2026-07-08T14:55:51Z","title":"GIFT: Geometry-Informed Low-precision Gradient Communication for LLM Pretraining","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-09T09:15:12.214083Z"},"links":{"citing_paper":"/paper/2607.07494"},"observation_digest":"sha256:1256db7aaf5202f0aaadb260cab55b7108700240ccc978847954abd7c018a2b5","observation_id":"25c15d21-ac6a-4772-999b-aa7130eb0aa7","resolution":{"observed_at":"2026-07-09T09:16:06.530439Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-08T02:38:06.62145+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T02:38:06.62145+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"5693.357571","doi":"10.1145/3575693.3575710","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InProceedings of the 28th ACM International Conference on Architectural Support for Programming Languages and Operating Systems, Volume 2(Vancouver, BC, Canada)(ASPLOS 2023)","venue":null,"work_id":"2c54d747-8d80-4616-b574-a20896d3f223","year":2023},"citing_paper":{"arxiv_id":"2607.07494","last_updated":"2026-07-08T14:55:51Z","snapshot_observed_at":"2026-08-15T04:18:15.955265Z","submitted_at":"2026-07-08T14:55:51Z","title":"GIFT: Geometry-Informed Low-precision Gradient Communication for LLM Pretraining","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-09T09:15:12.214083Z"},"links":{"citing_paper":"/paper/2607.07494"},"observation_digest":"sha256:c67d1d9db918100dc1c83148fb76f82d8ba7a9ff9db1d460582c56a58cb4f05f","observation_id":"d0b93274-9f9b-475e-b361-3f92cbd9b5b7","resolution":{"observed_at":"2026-07-09T09:16:06.475475Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.18313","last_updated":"2023-12-19T12:27:58Z","snapshot_observed_at":"2026-08-20T09:36:30.706781Z","submitted_at":"2023-10-27T17:59:51Z","title":"FP8-LM: Training FP8 Large Language Models","version":2},"cited_work":{"arxiv_id":"2310.18313","doi":"10.48550/arxiv.2310.18313","metadata_source":"pith","pith_arxiv_id":"2310.18313","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"FP8-LM: Training FP8 Large Language Models","venue":"cs.LG","work_id":"8aa8a89a-8428-4ed6-9efe-c9d583f852cf","year":2023},"citing_paper":{"arxiv_id":"2607.07494","last_updated":"2026-07-08T14:55:51Z","snapshot_observed_at":"2026-08-15T04:18:15.955265Z","submitted_at":"2026-07-08T14:55:51Z","title":"GIFT: Geometry-Informed Low-precision Gradient Communication for LLM Pretraining","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-09T09:15:12.214083Z"},"links":{"cited_paper":"/paper/2310.18313","citing_paper":"/paper/2607.07494"},"observation_digest":"sha256:caa141d6fd7bdaa6c7c4e6546c28959b4e255e539dbe3335b81aaca5e72aa7bd","observation_id":"0a318c2e-7a83-4f3b-8fbf-d728b7ed2f33","resolution":{"observed_at":"2026-07-09T09:16:06.500582Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:31.760018+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:31.760018+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.19313","last_updated":"2025-02-12T23:37:50Z","snapshot_observed_at":"2026-08-21T14:51:37.453490Z","submitted_at":"2024-10-25T05:59:30Z","title":"COAT: Compressing Optimizer states and Activation for Memory-Efficient FP8 Training","version":3},"cited_work":{"arxiv_id":"2410.19313","doi":"10.48550/arxiv.2410.19313","metadata_source":"pith","pith_arxiv_id":"2410.19313","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"COAT: Compressing Optimizer States and Activation for Memory-Efficient FP8 Training","venue":"cs.LG","work_id":"6c512b3e-ec3b-4af1-bfc1-b0ec4eb0c860","year":2024},"citing_paper":{"arxiv_id":"2607.07494","last_updated":"2026-07-08T14:55:51Z","snapshot_observed_at":"2026-08-15T04:18:15.955265Z","submitted_at":"2026-07-08T14:55:51Z","title":"GIFT: Geometry-Informed Low-precision Gradient Communication for LLM Pretraining","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-09T09:15:12.214083Z"},"links":{"cited_paper":"/paper/2410.19313","citing_paper":"/paper/2607.07494"},"observation_digest":"sha256:e8ed2f2fac9bb44be43ef95f3f465a1c873a21403573a5283ea5b8d7617ae1ef","observation_id":"ddf31843-2c99-487e-b4f2-f2f4ac1398c0","resolution":{"observed_at":"2026-07-09T09:16:06.523377Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:31.986644+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:31.986644+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T09:16:06.709145Z","title":"Decoupled Weight Decay Regularization,","venue":null,"work_id":"a8445212-2917-4e13-94c5-beaf10246ba1","year":null},"citing_paper":{"arxiv_id":"2607.07494","last_updated":"2026-07-08T14:55:51Z","snapshot_observed_at":"2026-08-15T04:18:15.955265Z","submitted_at":"2026-07-08T14:55:51Z","title":"GIFT: Geometry-Informed Low-precision Gradient Communication for LLM Pretraining","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-09T09:15:12.214083Z"},"links":{"citing_paper":"/paper/2607.07494"},"observation_digest":"sha256:faa25c75f21cc62ab673ff89871684b038a552f751db2f70c28a48f9b446a73e","observation_id":"6c557088-e4b3-49a4-bcc5-9c1618a6957d","resolution":{"observed_at":"2026-07-09T09:16:06.711251Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-14T20:13:52.872565Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":"1711.05101","doi":"10.1137/1.9781611972825.47","metadata_source":"pith","pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Decoupled Weight Decay Regularization","venue":"cs.LG","work_id":"07ef7360-d385-4033-83f7-8384a6325204","year":2017},"citing_paper":{"arxiv_id":"2607.07494","last_updated":"2026-07-08T14:55:51Z","snapshot_observed_at":"2026-08-15T04:18:15.955265Z","submitted_at":"2026-07-08T14:55:51Z","title":"GIFT: Geometry-Informed Low-precision Gradient Communication for LLM Pretraining","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-09T09:15:12.214083Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2607.07494"},"observation_digest":"sha256:04a4bd957944d846c125488ebbee9bac942fa0b928a7770c7fa37e23257b2563","observation_id":"c8ba83ef-4f75-4bbc-bd4e-b3b4c2d95e2a","resolution":{"observed_at":"2026-07-09T09:16:06.503181Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15526","last_updated":"2024-11-23T20:53:48Z","snapshot_observed_at":"2026-08-18T03:03:08.540794Z","submitted_at":"2024-10-20T22:36:02Z","title":"SDP4Bit: Toward 4-bit Communication Quantization in Sharded Data Parallelism for LLM Training","version":2},"cited_work":{"arxiv_id":"2410.15526","doi":"10.48550/arxiv.2410.15526","metadata_source":"pith","pith_arxiv_id":"2410.15526","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SDP4Bit: Toward 4-bit Communication Quantization in Sharded Data Parallelism for LLM Training","venue":"cs.LG","work_id":"a020daad-80d5-45e5-a77f-b931a55ec0d3","year":2024},"citing_paper":{"arxiv_id":"2607.07494","last_updated":"2026-07-08T14:55:51Z","snapshot_observed_at":"2026-08-15T04:18:15.955265Z","submitted_at":"2026-07-08T14:55:51Z","title":"GIFT: Geometry-Informed Low-precision Gradient Communication for LLM Pretraining","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-09T09:15:12.214083Z"},"links":{"cited_paper":"/paper/2410.15526","citing_paper":"/paper/2607.07494"},"observation_digest":"sha256:885f12b46b4a17367e8462ebe9a01717ac33d26ec7a0aef6955d954f361fcd82","observation_id":"14715872-799e-4a17-9d7f-200112564f06","resolution":{"observed_at":"2026-07-09T09:16:06.535859Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:32.453611+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:32.453611+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T09:16:06.713532Z","title":"Muon: An optimizer for hidden layers in neural networks,","venue":null,"work_id":"7ec93082-14eb-4deb-84b9-c7b1978a6122","year":null},"citing_paper":{"arxiv_id":"2607.07494","last_updated":"2026-07-08T14:55:51Z","snapshot_observed_at":"2026-08-15T04:18:15.955265Z","submitted_at":"2026-07-08T14:55:51Z","title":"GIFT: Geometry-Informed Low-precision Gradient Communication for LLM Pretraining","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-09T09:15:12.214083Z"},"links":{"citing_paper":"/paper/2607.07494"},"observation_digest":"sha256:c289e1534e475d2c28fd9a2969e56eefe8083b8a7674abab82d51e12d1de7104","observation_id":"93309472-6084-4e32-bf80-1856cef73652","resolution":{"observed_at":"2026-07-09T09:16:06.715190Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T09:16:06.711490Z","title":"Available: https://kellerjordan.github.io/posts/muon/","venue":null,"work_id":"8e52e593-9db4-4b56-b5d6-88604c05984b","year":null},"citing_paper":{"arxiv_id":"2607.07494","last_updated":"2026-07-08T14:55:51Z","snapshot_observed_at":"2026-08-15T04:18:15.955265Z","submitted_at":"2026-07-08T14:55:51Z","title":"GIFT: Geometry-Informed Low-precision Gradient Communication for LLM Pretraining","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-09T09:15:12.214083Z"},"links":{"citing_paper":"/paper/2607.07494"},"observation_digest":"sha256:3dc231ddaefc76d8e029eabbf32cb0ddbe47bf9f0a70210b271bf10ab814889b","observation_id":"028df0d8-96d5-43b3-95c1-2f594ef0e20b","resolution":{"observed_at":"2026-07-09T09:16:06.712955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T09:16:06.715856Z","title":"Amari,Information Geometry and Its Applications","venue":null,"work_id":"015e4fac-8499-4242-b08b-2eee6d350a8f","year":2016},"citing_paper":{"arxiv_id":"2607.07494","last_updated":"2026-07-08T14:55:51Z","snapshot_observed_at":"2026-08-15T04:18:15.955265Z","submitted_at":"2026-07-08T14:55:51Z","title":"GIFT: Geometry-Informed Low-precision Gradient Communication for LLM Pretraining","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-09T09:15:12.214083Z"},"links":{"citing_paper":"/paper/2607.07494"},"observation_digest":"sha256:2d334e510f35765bae616329c18377cda854dd409af0e3f3b566caa05659d356","observation_id":"63e731fd-9438-4aac-b9ac-457c38815966","resolution":{"observed_at":"2026-07-09T09:16:06.717572Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1162/089976698300017746","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Natural Gradient Works Efficiently in Learning , journal =","venue":"Neural Computation","work_id":"5d6bb961-fdf9-48d3-9b33-d1fd429c6dae","year":1998},"citing_paper":{"arxiv_id":"2607.07494","last_updated":"2026-07-08T14:55:51Z","snapshot_observed_at":"2026-08-15T04:18:15.955265Z","submitted_at":"2026-07-08T14:55:51Z","title":"GIFT: Geometry-Informed Low-precision Gradient Communication for LLM Pretraining","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-09T09:15:12.214083Z"},"links":{"citing_paper":"/paper/2607.07494"},"observation_digest":"sha256:4686303868d4566ab15dc8cdd8c90b35e801c39a505de50038967318af68cb69","observation_id":"5fe4aa30-baa6-4314-b6f0-26c35db697a5","resolution":{"observed_at":"2026-07-09T09:16:06.528219Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-22T08:38:13.253949+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-22T08:38:13.253949+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1503.05671","last_updated":"2020-06-08T01:28:58Z","snapshot_observed_at":"2026-08-14T22:55:43.974882Z","submitted_at":"2015-03-19T08:30:24Z","title":"Optimizing Neural Networks with Kronecker-factored Approximate Curvature","version":7},"cited_work":{"arxiv_id":"1503.05671","doi":"10.48550/arxiv.1503.05671","metadata_source":"pith","pith_arxiv_id":"1503.05671","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Optimizing neural networks with kronecker-factored approximate curvature","venue":"cs.LG","work_id":"b79e4130-9cb2-46ae-802d-b9fefb5e1fb7","year":2015},"citing_paper":{"arxiv_id":"2607.07494","last_updated":"2026-07-08T14:55:51Z","snapshot_observed_at":"2026-08-15T04:18:15.955265Z","submitted_at":"2026-07-08T14:55:51Z","title":"GIFT: Geometry-Informed Low-precision Gradient Communication for LLM Pretraining","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-09T09:15:12.214083Z"},"links":{"cited_paper":"/paper/1503.05671","citing_paper":"/paper/2607.07494"},"observation_digest":"sha256:2e31278d1030f5cd146d5619b53b1ffb41d4324dd16ab34007bb19cfd1d22830","observation_id":"8782c345-28f4-4a7e-9dd9-83fdb7b5ad87","resolution":{"observed_at":"2026-07-09T09:16:06.515307Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:32.896852+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:32.896852+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.04473","last_updated":"2021-08-23T19:41:13Z","snapshot_observed_at":"2026-08-21T22:18:44.715830Z","submitted_at":"2021-04-09T16:43:11Z","title":"Efficient Large-Scale Language Model Training on GPU Clusters Using Megatron-LM","version":5},"cited_work":{"arxiv_id":"2104.04473","doi":"10.48550/arxiv.2104.04473","metadata_source":"pith","pith_arxiv_id":"2104.04473","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efﬁcient large-scale language model training on gpu clusters using megatron-lm","venue":"cs.CL","work_id":"cb405716-f30a-4004-aef0-12f4f12f0e20","year":2021},"citing_paper":{"arxiv_id":"2607.07494","last_updated":"2026-07-08T14:55:51Z","snapshot_observed_at":"2026-08-15T04:18:15.955265Z","submitted_at":"2026-07-08T14:55:51Z","title":"GIFT: Geometry-Informed Low-precision Gradient Communication for LLM Pretraining","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-09T09:15:12.214083Z"},"links":{"cited_paper":"/paper/2104.04473","citing_paper":"/paper/2607.07494"},"observation_digest":"sha256:a31d0c36fecb2e768f145dfa842b526b3086ccf2d15445fbd6c8eae3c2bea135","observation_id":"7ed52c58-f009-466d-870c-16cd34446578","resolution":{"observed_at":"2026-07-09T09:16:06.525993Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:33.133437+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:33.133437+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T09:16:06.704033Z","title":"Openwebtext cor- pus,","venue":null,"work_id":"996ee51b-289f-4f4e-948a-e0ad9b159321","year":2019},"citing_paper":{"arxiv_id":"2607.07494","last_updated":"2026-07-08T14:55:51Z","snapshot_observed_at":"2026-08-15T04:18:15.955265Z","submitted_at":"2026-07-08T14:55:51Z","title":"GIFT: Geometry-Informed Low-precision Gradient Communication for LLM Pretraining","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-09T09:15:12.214083Z"},"links":{"citing_paper":"/paper/2607.07494"},"observation_digest":"sha256:d31e9e077901719cbb882da4b61579ead42509e2abaf091e1f6931780061aebf","observation_id":"f9b0c093-bb8a-4dfe-8673-35189ed11d3e","resolution":{"observed_at":"2026-07-09T09:16:06.705423Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-08-12T10:50:46.357243Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":"1909.08053","doi":"10.48550/arxiv.1909.08053","metadata_source":"pith","pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","venue":"cs.CL","work_id":"c888e6d1-0b1d-43d6-9ef5-f0912a0efa1b","year":2019},"citing_paper":{"arxiv_id":"2607.07494","last_updated":"2026-07-08T14:55:51Z","snapshot_observed_at":"2026-08-15T04:18:15.955265Z","submitted_at":"2026-07-08T14:55:51Z","title":"GIFT: Geometry-Informed Low-precision Gradient Communication for LLM Pretraining","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-09T09:15:12.214083Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2607.07494"},"observation_digest":"sha256:fd18c320d3d17b3aba3e60fbf3fbbd1507829f8dec67c2421256b910b67c84a3","observation_id":"77bd7475-7b24-454f-81e8-3cc2d5443949","resolution":{"observed_at":"2026-07-09T09:16:06.679697Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:33.392193+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:33.392193+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-08-12T10:50:46.357243Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":"1909.08053","doi":"10.48550/arxiv.1909.08053","metadata_source":"pith","pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","venue":"cs.CL","work_id":"c888e6d1-0b1d-43d6-9ef5-f0912a0efa1b","year":2019},"citing_paper":{"arxiv_id":"2607.07494","last_updated":"2026-07-08T14:55:51Z","snapshot_observed_at":"2026-08-15T04:18:15.955265Z","submitted_at":"2026-07-08T14:55:51Z","title":"GIFT: Geometry-Informed Low-precision Gradient Communication for LLM Pretraining","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-09T09:15:12.214083Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2607.07494"},"observation_digest":"sha256:f887ce9b312618d829ca40e071dc118b24a95af093aec1df7035c57783b61214","observation_id":"5cf6404c-142b-481a-8678-195109daa2e2","resolution":{"observed_at":"2026-07-09T09:16:06.482358Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:33.392193+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:33.392193+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1811.06965","last_updated":"2019-07-25T21:42:58Z","snapshot_observed_at":"2026-08-17T19:36:58.372516Z","submitted_at":"2018-11-16T18:43:28Z","title":"GPipe: Efficient Training of Giant Neural Networks using Pipeline Parallelism","version":5},"cited_work":{"arxiv_id":"1811.06965","doi":"10.48550/arxiv.1811.06965","metadata_source":"pith","pith_arxiv_id":"1811.06965","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPipe: Efficient Training of Giant Neural Networks using Pipeline Parallelism","venue":"cs.CV","work_id":"37375911-ccd2-4498-abd8-45af00a7f04f","year":2018},"citing_paper":{"arxiv_id":"2607.07494","last_updated":"2026-07-08T14:55:51Z","snapshot_observed_at":"2026-08-15T04:18:15.955265Z","submitted_at":"2026-07-08T14:55:51Z","title":"GIFT: Geometry-Informed Low-precision Gradient Communication for LLM Pretraining","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-09T09:15:12.214083Z"},"links":{"cited_paper":"/paper/1811.06965","citing_paper":"/paper/2607.07494"},"observation_digest":"sha256:051feeab15835d90005f2add7c9332236e2b495087b3f6dc8972c5689699258b","observation_id":"e4cca9e8-6a67-4820-8d2b-b420695220e3","resolution":{"observed_at":"2026-07-09T09:16:06.520887Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:33.63915+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:33.63915+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.09503","last_updated":"2021-07-22T17:25:58Z","snapshot_observed_at":"2026-08-20T07:45:06.695966Z","submitted_at":"2020-06-16T20:33:54Z","title":"Memory-Efficient Pipeline-Parallel DNN Training","version":3},"cited_work":{"arxiv_id":"2006.09503","doi":"10.48550/arxiv.2006.09503","metadata_source":"pith","pith_arxiv_id":"2006.09503","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Memory-efficient pipeline-parallel DNN training","venue":"cs.LG","work_id":"7d0c006c-aeef-43d9-8ee1-344ad1d1df9f","year":2020},"citing_paper":{"arxiv_id":"2607.07494","last_updated":"2026-07-08T14:55:51Z","snapshot_observed_at":"2026-08-15T04:18:15.955265Z","submitted_at":"2026-07-08T14:55:51Z","title":"GIFT: Geometry-Informed Low-precision Gradient Communication for LLM Pretraining","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-09T09:15:12.214083Z"},"links":{"cited_paper":"/paper/2006.09503","citing_paper":"/paper/2607.07494"},"observation_digest":"sha256:2ac2d862277a3aefca9bb4947283b9c0e144c867362978756dc75fd5b6f7b53e","observation_id":"49378994-0105-4fc3-be1b-69c070a6aebb","resolution":{"observed_at":"2026-07-09T09:16:06.540962Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:33.887993+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:33.887993+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.02054","last_updated":"2020-05-13T06:45:15Z","snapshot_observed_at":"2026-07-06T08:27:00.558613Z","submitted_at":"2019-10-04T17:29:39Z","title":"ZeRO: Memory Optimizations Toward Training Trillion Parameter Models","version":3},"cited_work":{"arxiv_id":"1910.02054","doi":"10.48550/arxiv.1910.02054","metadata_source":"pith","pith_arxiv_id":"1910.02054","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ZeRO: Memory Optimizations Toward Training Trillion Parameter Models","venue":"cs.LG","work_id":"c5e9ad7b-c11d-43b7-b02d-c46d74a77fa9","year":2019},"citing_paper":{"arxiv_id":"2607.07494","last_updated":"2026-07-08T14:55:51Z","snapshot_observed_at":"2026-08-15T04:18:15.955265Z","submitted_at":"2026-07-08T14:55:51Z","title":"GIFT: Geometry-Informed Low-precision Gradient Communication for LLM Pretraining","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-09T09:15:12.214083Z"},"links":{"cited_paper":"/paper/1910.02054","citing_paper":"/paper/2607.07494"},"observation_digest":"sha256:3957b1d9d3e695d14096b58d8af73c309001ce0395805b3fd671006c1d61ee21","observation_id":"8ede1d75-5111-4ccb-bd94-561dca7c8fda","resolution":{"observed_at":"2026-07-09T09:16:06.530633Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:34.137438+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:34.137438+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.10209","last_updated":"2023-06-16T23:26:19Z","snapshot_observed_at":"2026-08-21T10:00:49.700416Z","submitted_at":"2023-06-16T23:26:19Z","title":"ZeRO++: Extremely Efficient Collective Communication for Giant Model Training","version":1},"cited_work":{"arxiv_id":"2306.10209","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.10209","snapshot_observed_at":"2026-07-09T09:16:06.674984Z","title":"A., Holmes, C., Rajbhandari, S., Ruwase, O., Yan, F., Yang, L., and He, Y","venue":"cs.DC","work_id":"92286222-082e-48d9-adb1-cc42b4538115","year":2023},"citing_paper":{"arxiv_id":"2607.07494","last_updated":"2026-07-08T14:55:51Z","snapshot_observed_at":"2026-08-15T04:18:15.955265Z","submitted_at":"2026-07-08T14:55:51Z","title":"GIFT: Geometry-Informed Low-precision Gradient Communication for LLM Pretraining","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-09T09:15:12.214083Z"},"links":{"cited_paper":"/paper/2306.10209","citing_paper":"/paper/2607.07494"},"observation_digest":"sha256:f74e7d24add570cd052710ab533f406f286bae46201ab7b2fc81d97f8d8fb317","observation_id":"f72b09a6-2543-4ecb-aea5-a3711a6cba83","resolution":{"observed_at":"2026-07-09T09:16:06.676458Z","resolver_source":"local_arxiv","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.00636","last_updated":"2024-01-11T17:32:26Z","snapshot_observed_at":"2026-08-17T21:53:54.552199Z","submitted_at":"2023-11-01T16:37:00Z","title":"Kronecker-Factored Approximate Curvature for Modern Neural Network Architectures","version":2},"cited_work":{"arxiv_id":"2311.00636","doi":"10.48550/arxiv.2311.00636","metadata_source":"pith","pith_arxiv_id":"2311.00636","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2024 , journal =","venue":"cs.LG","work_id":"b19cfb8c-203c-4960-957e-f5a3dfdf967e","year":2023},"citing_paper":{"arxiv_id":"2607.07494","last_updated":"2026-07-08T14:55:51Z","snapshot_observed_at":"2026-08-15T04:18:15.955265Z","submitted_at":"2026-07-08T14:55:51Z","title":"GIFT: Geometry-Informed Low-precision Gradient Communication for LLM Pretraining","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-09T09:15:12.214083Z"},"links":{"cited_paper":"/paper/2311.00636","citing_paper":"/paper/2607.07494"},"observation_digest":"sha256:80aaf417867533a37a2379eb2a4c84a63853a086533b97e90f5ed3499f8ed960","observation_id":"c31c9677-d310-4239-ab2b-88cf985e9f0a","resolution":{"observed_at":"2026-07-09T09:16:06.535810Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:34.382996+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:34.382996+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1610.02132","last_updated":"2017-12-06T18:28:32Z","snapshot_observed_at":"2026-08-18T02:18:54.983399Z","submitted_at":"2016-10-07T03:44:34Z","title":"QSGD: Communication-Efficient SGD via Gradient Quantization and Encoding","version":4},"cited_work":{"arxiv_id":"1610.02132","doi":"10.48550/arxiv.1610.02132","metadata_source":"pith","pith_arxiv_id":"1610.02132","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"QSGD: Communication-Efficient SGD via Gradient Quantization and Encoding","venue":"cs.LG","work_id":"cac53f8a-ecd0-4a1e-b6e0-0249417a3593","year":2016},"citing_paper":{"arxiv_id":"2607.07494","last_updated":"2026-07-08T14:55:51Z","snapshot_observed_at":"2026-08-15T04:18:15.955265Z","submitted_at":"2026-07-08T14:55:51Z","title":"GIFT: Geometry-Informed Low-precision Gradient Communication for LLM Pretraining","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-09T09:15:12.214083Z"},"links":{"cited_paper":"/paper/1610.02132","citing_paper":"/paper/2607.07494"},"observation_digest":"sha256:712ab88be2546cc1f25f80a6f0b99046af9b563dbf28d4a0e66d65ea09b9e1f6","observation_id":"fde0184c-24a9-4b70-8164-6af20c5072b6","resolution":{"observed_at":"2026-07-09T09:16:06.525204Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:34.624953+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:34.624953+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T09:16:06.706257Z","title":"Deep gradient compression: Reducing the communication bandwidth for distributed training,","venue":null,"work_id":"89898531-ccba-491b-97c0-370ec71220d9","year":null},"citing_paper":{"arxiv_id":"2607.07494","last_updated":"2026-07-08T14:55:51Z","snapshot_observed_at":"2026-08-15T04:18:15.955265Z","submitted_at":"2026-07-08T14:55:51Z","title":"GIFT: Geometry-Informed Low-precision Gradient Communication for LLM Pretraining","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-09T09:15:12.214083Z"},"links":{"citing_paper":"/paper/2607.07494"},"observation_digest":"sha256:51a6533b10ca00c3608b6e73225e7b56e7a66f428028f2917a6ef2e9b7fb32a9","observation_id":"384737c0-8c4b-4c26-b2e0-cc3911f32a6e","resolution":{"observed_at":"2026-07-09T09:16:06.708056Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.01887","last_updated":"2020-06-23T03:28:30Z","snapshot_observed_at":"2026-08-18T15:24:54.289687Z","submitted_at":"2017-12-05T19:48:11Z","title":"Deep Gradient Compression: Reducing the Communication Bandwidth for Distributed Training","version":3},"cited_work":{"arxiv_id":"1712.01887","doi":"10.48550/arxiv.1712.01887","metadata_source":"pith","pith_arxiv_id":"1712.01887","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Deep gradient compression: Reducing the communication bandwidth for distributed training","venue":"cs.CV","work_id":"d6d95b2f-ca12-43e9-bf95-2bc1d987d1a5","year":2017},"citing_paper":{"arxiv_id":"2607.07494","last_updated":"2026-07-08T14:55:51Z","snapshot_observed_at":"2026-08-15T04:18:15.955265Z","submitted_at":"2026-07-08T14:55:51Z","title":"GIFT: Geometry-Informed Low-precision Gradient Communication for LLM Pretraining","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-09T09:15:12.214083Z"},"links":{"cited_paper":"/paper/1712.01887","citing_paper":"/paper/2607.07494"},"observation_digest":"sha256:9611ba7ce889df9a9892ba4fa469380c76fd053f7d25a2def403c23c9e1b98f4","observation_id":"cd1c83f9-abf0-49e7-af9b-d7af0fb478c3","resolution":{"observed_at":"2026-07-09T09:16:06.510183Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:34.86728+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:34.86728+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.13727","last_updated":"2020-02-18T14:13:56Z","snapshot_observed_at":"2026-08-14T16:58:01.501820Z","submitted_at":"2019-05-31T17:25:13Z","title":"PowerSGD: Practical Low-Rank Gradient Compression for Distributed Optimization","version":3},"cited_work":{"arxiv_id":"1905.13727","doi":"10.48550/arxiv.1905.13727","metadata_source":"pith","pith_arxiv_id":"1905.13727","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Powersgd: Practical low-rank gradient compression for distributed optimization","venue":"cs.LG","work_id":"22628493-4721-431c-ae39-65a14842db81","year":2019},"citing_paper":{"arxiv_id":"2607.07494","last_updated":"2026-07-08T14:55:51Z","snapshot_observed_at":"2026-08-15T04:18:15.955265Z","submitted_at":"2026-07-08T14:55:51Z","title":"GIFT: Geometry-Informed Low-precision Gradient Communication for LLM Pretraining","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-09T09:15:12.214083Z"},"links":{"cited_paper":"/paper/1905.13727","citing_paper":"/paper/2607.07494"},"observation_digest":"sha256:096c8a0ac39dba10207b795ec3f99ea2b2880b0aaa189be6a06a47af0e36efcb","observation_id":"b8e742f2-10f4-40be-bcfc-b4d96c844f24","resolution":{"observed_at":"2026-07-09T09:16:06.518204Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:35.109338+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:35.109338+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.02888","last_updated":"2021-06-29T18:25:26Z","snapshot_observed_at":"2026-08-21T00:33:05.484846Z","submitted_at":"2021-02-04T21:02:19Z","title":"1-bit Adam: Communication Efficient Large-Scale Training with Adam's Convergence Speed","version":2},"cited_work":{"arxiv_id":"2102.02888","doi":"10.48550/arxiv.2102.02888","metadata_source":"pith","pith_arxiv_id":"2102.02888","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2102.02888 , year=","venue":"cs.LG","work_id":"59b37977-aeba-432a-b7a5-6c05b001cebe","year":2021},"citing_paper":{"arxiv_id":"2607.07494","last_updated":"2026-07-08T14:55:51Z","snapshot_observed_at":"2026-08-15T04:18:15.955265Z","submitted_at":"2026-07-08T14:55:51Z","title":"GIFT: Geometry-Informed Low-precision Gradient Communication for LLM Pretraining","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-09T09:15:12.214083Z"},"links":{"cited_paper":"/paper/2102.02888","citing_paper":"/paper/2607.07494"},"observation_digest":"sha256:f05bac4b07cafabf78c6769baffb7929d3ab3bd9a6269f3e45efee3dc6c44be6","observation_id":"4c5ab36d-92f2-4a45-9c18-3f0e2ae59ea7","resolution":{"observed_at":"2026-07-09T09:16:06.538354Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:35.360803+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:35.360803+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.05433","last_updated":"2022-09-29T20:47:07Z","snapshot_observed_at":"2026-08-14T05:39:52.416140Z","submitted_at":"2022-09-12T17:39:55Z","title":"FP8 Formats for Deep Learning","version":2},"cited_work":{"arxiv_id":"2209.05433","doi":"10.48550/arxiv.2209.05433","metadata_source":"pith","pith_arxiv_id":"2209.05433","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"FP8 Formats for Deep Learning","venue":"cs.LG","work_id":"c7217bc9-e53d-40c5-a437-25a74abc36cd","year":2022},"citing_paper":{"arxiv_id":"2607.07494","last_updated":"2026-07-08T14:55:51Z","snapshot_observed_at":"2026-08-15T04:18:15.955265Z","submitted_at":"2026-07-08T14:55:51Z","title":"GIFT: Geometry-Informed Low-precision Gradient Communication for LLM Pretraining","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-09T09:15:12.214083Z"},"links":{"cited_paper":"/paper/2209.05433","citing_paper":"/paper/2607.07494"},"observation_digest":"sha256:5a55bfd2068cb81af5152c95357fc53ef1b457f945da795abf1f9b80f1b55d13","observation_id":"b7609279-ffb8-41e6-87ae-ae7f4e5522a6","resolution":{"observed_at":"2026-07-09T09:16:06.492807Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-14T20:38:10.201356+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-14T20:38:10.201356+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04480","last_updated":"2024-11-29T08:38:55Z","snapshot_observed_at":"2026-08-20T06:40:25.855335Z","submitted_at":"2024-07-05T13:01:36Z","title":"LoCo: Low-Bit Communication Adaptor for Large-scale Model Training","version":2},"cited_work":{"arxiv_id":"2407.04480","doi":"10.48550/arxiv.2407.04480","metadata_source":"pith","pith_arxiv_id":"2407.04480","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LoCo: Low-Bit Communication Adaptor for Large-scale Model Training","venue":"cs.LG","work_id":"c5e5e79f-4557-459c-bc74-bbd324cfc889","year":2024},"citing_paper":{"arxiv_id":"2607.07494","last_updated":"2026-07-08T14:55:51Z","snapshot_observed_at":"2026-08-15T04:18:15.955265Z","submitted_at":"2026-07-08T14:55:51Z","title":"GIFT: Geometry-Informed Low-precision Gradient Communication for LLM Pretraining","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-09T09:15:12.214083Z"},"links":{"cited_paper":"/paper/2407.04480","citing_paper":"/paper/2607.07494"},"observation_digest":"sha256:34b09423395d7017e87b7c8003b278dbdd5f9c2ffb38ff7fa70b8ed417c90583","observation_id":"0223999c-3059-413c-9253-5e6703b9c96a","resolution":{"observed_at":"2026-07-09T09:16:06.532939Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:35.852762+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:35.852762+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-08-12T13:00:33.339808Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"cited_work":{"arxiv_id":"1710.03740","doi":"10.48550/arxiv.1710.03740","metadata_source":"pith","pith_arxiv_id":"1710.03740","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mixed Precision Training","venue":"cs.AI","work_id":"c525941b-ce20-4bcb-8509-a9968f1e89c3","year":2017},"citing_paper":{"arxiv_id":"2607.07494","last_updated":"2026-07-08T14:55:51Z","snapshot_observed_at":"2026-08-15T04:18:15.955265Z","submitted_at":"2026-07-08T14:55:51Z","title":"GIFT: Geometry-Informed Low-precision Gradient Communication for LLM Pretraining","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-09T09:15:12.214083Z"},"links":{"cited_paper":"/paper/1710.03740","citing_paper":"/paper/2607.07494"},"observation_digest":"sha256:3d15a17da72054adbbddd6e51f35bfb5cf020121d212ee1de0919d413454c1a4","observation_id":"75ae97cc-eea2-4299-99a6-6ba24ebfe5e2","resolution":{"observed_at":"2026-07-09T09:16:06.471623Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17224","last_updated":"2023-09-29T13:24:33Z","snapshot_observed_at":"2026-08-19T22:28:22.907704Z","submitted_at":"2023-09-29T13:24:33Z","title":"Training and inference of large language models using 8-bit floating point","version":1},"cited_work":{"arxiv_id":"2309.17224","doi":"10.48550/arxiv.2309.17224","metadata_source":"pith","pith_arxiv_id":"2309.17224","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Training and inference of large lan- guage models using 8-bit floating point.arXiv preprint arXiv:2309.17224","venue":"cs.LG","work_id":"93af2807-3da0-479d-a9d7-67bc61639f22","year":2023},"citing_paper":{"arxiv_id":"2607.07494","last_updated":"2026-07-08T14:55:51Z","snapshot_observed_at":"2026-08-15T04:18:15.955265Z","submitted_at":"2026-07-08T14:55:51Z","title":"GIFT: Geometry-Informed Low-precision Gradient Communication for LLM Pretraining","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-09T09:15:12.214083Z"},"links":{"cited_paper":"/paper/2309.17224","citing_paper":"/paper/2607.07494"},"observation_digest":"sha256:813627bcb5ca9c53c4f0ff013376abbf19c32bf0905e89f6863f4956d6e0a34e","observation_id":"58e148da-2af6-44f8-aa17-242246c20812","resolution":{"observed_at":"2026-07-09T09:16:06.538522Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:36.299839+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:36.299839+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2607.07494","last_updated":"2026-07-08T14:55:51Z","latest_version":1,"primary_category":"cs.DC","snapshot_observed_at":"2026-08-15T04:18:15.955265Z","submitted_at":"2026-07-08T14:55:51Z","title":"GIFT: Geometry-Informed Low-precision Gradient Communication for LLM Pretraining"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":2,"metadata_mismatch":6,"parse_uncertain":0,"unresolved":0,"verified_exact":18,"verified_fuzzy":5},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 0 inbound Pith citation observations for arXiv:2607.07494."}