{"as_of":"2026-08-07T04:23:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:699f330be2921f29b89f32243ce45bb0e00ba12933f01ac0f9b3014edc75e270","coverage":[{"denominator":37,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":37,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-18T20:39:32.123038Z","state":"measured"},{"denominator":38,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":38,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-15T13:17:47.603967Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.21613","last_updated":"2026-04-20T07:16:46Z","snapshot_observed_at":"2026-07-30T02:14:25.450050Z","submitted_at":"2025-08-29T13:22:11Z","title":"Chameleon: Adaptive Fault Tolerance for Distributed Training via Real-time Policy Selection","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.21613","snapshot_observed_at":"2026-07-15T13:17:47.603967Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.07382","last_updated":"2026-05-26T18:40:11Z","snapshot_observed_at":"2026-08-04T11:18:49.231532Z","submitted_at":"2026-03-07T23:48:25Z","title":"Enhancing OLAP Resilience at LinkedIn","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-07-15T13:17:47.603967Z"},"links":{"cited_paper":"/paper/2508.21613","citing_paper":"/paper/2603.07382"},"observation_digest":"sha256:f84df061ff7d9afa9f71128dfd46d7aae5c31fe4aadac74df731fb854082e099","observation_id":"9d0e2fe2-aee7-4187-91f1-908239989285","resolution":{"observed_at":"2026-07-15T13:17:47.603967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2508.21613/citation-record","integrity":"/paper/2508.21613/integrity","json":"/paper/2508.21613/citation-record.json","paper":"/paper/2508.21613"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":"2407.21783","doi":"10.1016/s0749-0720(15","metadata_source":"pith","pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"The Llama 3 Herd of Models","venue":"cs.AI","work_id":"1549a635-88af-4ac1-acfe-51ae7bb53345","year":2024},"citing_paper":{"arxiv_id":"2508.21613","last_updated":"2026-04-20T07:16:46Z","snapshot_observed_at":"2026-07-30T02:14:25.450050Z","submitted_at":"2025-08-29T13:22:11Z","title":"Chameleon: Adaptive Fault Tolerance for Distributed Training via Real-time Policy Selection","version":4},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-18T20:39:32.123038Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2508.21613"},"observation_digest":"sha256:7442158f08323bc0c21d666f4c94968df7e5e2f0b99c8d5809731246f8c5a3e2","observation_id":"a07ee32b-c396-40ac-94e6-593d3e531650","resolution":{"observed_at":"2026-05-18T20:41:50.688302Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":"2303.08774","doi":"10.1002/tea.20265","metadata_source":"pith","pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4 Technical Report","venue":"cs.CL","work_id":"b928e041-6991-4c08-8c81-0359e4097c7b","year":2023},"citing_paper":{"arxiv_id":"2508.21613","last_updated":"2026-04-20T07:16:46Z","snapshot_observed_at":"2026-07-30T02:14:25.450050Z","submitted_at":"2025-08-29T13:22:11Z","title":"Chameleon: Adaptive Fault Tolerance for Distributed Training via Real-time Policy Selection","version":4},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-18T20:39:32.123038Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2508.21613"},"observation_digest":"sha256:6dc0b377b7e4bc514f884451d212ffa5da17409f7d5de54241896a7c9564eed6","observation_id":"a669348c-f4e7-4781-aa37-1e9f897d1663","resolution":{"observed_at":"2026-05-18T20:41:50.693665Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"0006.361314","doi":"10.1145/3600006.3613140","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"URLhttps://doi.org/10.1145/3600006.3613145","venue":null,"work_id":"18b7dddd-4486-4b1b-a344-4c04f60d4fa3","year":2023},"citing_paper":{"arxiv_id":"2508.21613","last_updated":"2026-04-20T07:16:46Z","snapshot_observed_at":"2026-07-30T02:14:25.450050Z","submitted_at":"2025-08-29T13:22:11Z","title":"Chameleon: Adaptive Fault Tolerance for Distributed Training via Real-time Policy Selection","version":4},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-18T20:39:32.123038Z"},"links":{"citing_paper":"/paper/2508.21613"},"observation_digest":"sha256:213e6cf73c545d5f70998f29f8fafac8b55332eabc2013096292fa5c99d37a40","observation_id":"69a3850e-4219-44da-9acd-4ea8f9816459","resolution":{"observed_at":"2026-05-18T20:41:50.315045Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Check- N-Run: a checkpointing system for training deep learning recommendation models","venue":null,"work_id":"6cbe6d3a-12b1-405e-a1d6-2c4df3a89f4c","year":2022},"citing_paper":{"arxiv_id":"2508.21613","last_updated":"2026-04-20T07:16:46Z","snapshot_observed_at":"2026-07-30T02:14:25.450050Z","submitted_at":"2025-08-29T13:22:11Z","title":"Chameleon: Adaptive Fault Tolerance for Distributed Training via Real-time Policy Selection","version":4},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-18T20:39:32.123038Z"},"links":{"citing_paper":"/paper/2508.21613"},"observation_digest":"sha256:89fd325edb4b5c249328c7a4b569fdb4510e62323204c70f20fc60f280ad7e2b","observation_id":"f09d9a6c-27fa-4ba6-8249-1960f72f5a28","resolution":{"observed_at":"2026-05-18T20:41:51.905063Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15627","last_updated":"2024-02-23T22:10:59Z","snapshot_observed_at":"2026-07-06T17:34:49.001670Z","submitted_at":"2024-02-23T22:10:59Z","title":"MegaScale: Scaling Large Language Model Training to More Than 10,000 GPUs","version":1},"cited_work":{"arxiv_id":"2402.15627","doi":"10.48550/arxiv.2402.15627","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.15627","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Megascale: Scaling large language model training to more than 10,000 gpus","venue":"arXiv (Cornell University)","work_id":"3647e8b1-068d-4920-805e-7b567887fbc8","year":2024},"citing_paper":{"arxiv_id":"2508.21613","last_updated":"2026-04-20T07:16:46Z","snapshot_observed_at":"2026-07-30T02:14:25.450050Z","submitted_at":"2025-08-29T13:22:11Z","title":"Chameleon: Adaptive Fault Tolerance for Distributed Training via Real-time Policy Selection","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-18T20:39:32.123038Z"},"links":{"cited_paper":"/paper/2402.15627","citing_paper":"/paper/2508.21613"},"observation_digest":"sha256:c17597498f64702a8aed1c21b8db316b5c06b8666b65881356474331cde92efc","observation_id":"a0ac690c-53b7-4fe9-a033-64c61ee2c191","resolution":{"observed_at":"2026-05-18T20:41:50.682623Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-21T12:26:45.911435+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T12:26:45.911435+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Elan: Towards generic and efficient elastic training for deep learning","venue":null,"work_id":"02dffe5e-b79c-4777-840a-5d215d08e352","year":2020},"citing_paper":{"arxiv_id":"2508.21613","last_updated":"2026-04-20T07:16:46Z","snapshot_observed_at":"2026-07-30T02:14:25.450050Z","submitted_at":"2025-08-29T13:22:11Z","title":"Chameleon: Adaptive Fault Tolerance for Distributed Training via Real-time Policy Selection","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-18T20:39:32.123038Z"},"links":{"citing_paper":"/paper/2508.21613"},"observation_digest":"sha256:cf6d30a0b4cf5ac4f5581443cb712ccc7d8a48d6035309d9c68764e47c67f81e","observation_id":"794654ba-8e13-4695-8cb7-ba2f66719e9e","resolution":{"observed_at":"2026-05-18T20:41:51.901286Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bamboo: Making preemptible instances resilient for affordable training of large{DNNs}","venue":null,"work_id":"a87359fa-5232-43bf-ba05-b6f1610b711c","year":2023},"citing_paper":{"arxiv_id":"2508.21613","last_updated":"2026-04-20T07:16:46Z","snapshot_observed_at":"2026-07-30T02:14:25.450050Z","submitted_at":"2025-08-29T13:22:11Z","title":"Chameleon: Adaptive Fault Tolerance for Distributed Training via Real-time Policy Selection","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-18T20:39:32.123038Z"},"links":{"citing_paper":"/paper/2508.21613"},"observation_digest":"sha256:86cee22a0f2108431aef2fde0acf92db5415a33d9dddf842788b759e7493eff0","observation_id":"d4297cb2-d11b-4e9f-9cef-3bd8fc5418ae","resolution":{"observed_at":"2026-05-18T20:41:51.897817Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Oobleck: Resilient distributed training of large models using pipeline templates","venue":null,"work_id":"8ab9bee1-f1a4-44d5-bbd5-1f1ac951707f","year":2023},"citing_paper":{"arxiv_id":"2508.21613","last_updated":"2026-04-20T07:16:46Z","snapshot_observed_at":"2026-07-30T02:14:25.450050Z","submitted_at":"2025-08-29T13:22:11Z","title":"Chameleon: Adaptive Fault Tolerance for Distributed Training via Real-time Policy Selection","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-18T20:39:32.123038Z"},"links":{"citing_paper":"/paper/2508.21613"},"observation_digest":"sha256:9641943772e6e49764880ea4ac83e5174e41256d58dbbd3ed6b09cebbe01ff01","observation_id":"67f52b03-5938-475c-ace7-616fbdcd2d7f","resolution":{"observed_at":"2026-05-18T20:41:51.894134Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Recycle: Re- silient training of large dnns using pipeline adaptation","venue":null,"work_id":"c178133d-d5c2-43a1-88bf-adf7bca2084f","year":2024},"citing_paper":{"arxiv_id":"2508.21613","last_updated":"2026-04-20T07:16:46Z","snapshot_observed_at":"2026-07-30T02:14:25.450050Z","submitted_at":"2025-08-29T13:22:11Z","title":"Chameleon: Adaptive Fault Tolerance for Distributed Training via Real-time Policy Selection","version":4},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-18T20:39:32.123038Z"},"links":{"citing_paper":"/paper/2508.21613"},"observation_digest":"sha256:8f0ec743d09f4433e5fa578a5011743fd12c7a4ef0f7c34217454e407a79d795","observation_id":"29c021fc-a986-49b2-aaa3-2a54e214225a","resolution":{"observed_at":"2026-05-18T20:41:51.890778Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tenplex: Dynamic parallelism for deep learning using parallelizable tensor col- lections","venue":null,"work_id":"9fa76459-3049-47d3-b982-0ea4a713239b","year":2024},"citing_paper":{"arxiv_id":"2508.21613","last_updated":"2026-04-20T07:16:46Z","snapshot_observed_at":"2026-07-30T02:14:25.450050Z","submitted_at":"2025-08-29T13:22:11Z","title":"Chameleon: Adaptive Fault Tolerance for Distributed Training via Real-time Policy Selection","version":4},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-18T20:39:32.123038Z"},"links":{"citing_paper":"/paper/2508.21613"},"observation_digest":"sha256:66099cdf2521e6c5cada53f5619796c45b804dc9a5906da75665f60660340919","observation_id":"6f353f01-72b2-41cf-9dcf-189c503483a4","resolution":{"observed_at":"2026-05-18T20:41:51.887146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ascend: a scalable and unified architecture for ubiquitous deep neural network computing: Industry track paper","venue":null,"work_id":"b8647d0b-7ef8-4d09-8e62-c44a7f2f4292","year":2021},"citing_paper":{"arxiv_id":"2508.21613","last_updated":"2026-04-20T07:16:46Z","snapshot_observed_at":"2026-07-30T02:14:25.450050Z","submitted_at":"2025-08-29T13:22:11Z","title":"Chameleon: Adaptive Fault Tolerance for Distributed Training via Real-time Policy Selection","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-18T20:39:32.123038Z"},"links":{"citing_paper":"/paper/2508.21613"},"observation_digest":"sha256:9a1034d2b136c2605e25f549e86dbf252edd249e9df9df039f1c41a83f50808c","observation_id":"d9b38c0b-7c6c-4324-81aa-9e6315f0da30","resolution":{"observed_at":"2026-05-18T20:41:51.883628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.15112","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Parallel scan on ascend ai accelerators","venue":null,"work_id":"88448a43-66a0-4904-8f57-118352348e9f","year":2025},"citing_paper":{"arxiv_id":"2508.21613","last_updated":"2026-04-20T07:16:46Z","snapshot_observed_at":"2026-07-30T02:14:25.450050Z","submitted_at":"2025-08-29T13:22:11Z","title":"Chameleon: Adaptive Fault Tolerance for Distributed Training via Real-time Policy Selection","version":4},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-18T20:39:32.123038Z"},"links":{"citing_paper":"/paper/2508.21613"},"observation_digest":"sha256:6d89816483e488fa7dfcc3070b6cee1e6859de80f1f140fb5539bf90d44dee74","observation_id":"f5908091-346d-4114-b213-3a3c3abb219f","resolution":{"observed_at":"2026-05-18T20:41:50.666848Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.02677","last_updated":"2018-04-30T21:53:41Z","snapshot_observed_at":"2026-07-06T05:46:07.424788Z","submitted_at":"2017-06-08T16:51:53Z","title":"Accurate, Large Minibatch SGD: Training ImageNet in 1 Hour","version":2},"cited_work":{"arxiv_id":"1706.02677","doi":"10.48550/arxiv.1706.02677","metadata_source":"pith","pith_arxiv_id":"1706.02677","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Accurate, Large Minibatch SGD: Training ImageNet in 1 Hour","venue":"cs.CV","work_id":"f3dc32a4-cf81-467b-8ff4-3b2f21d3bf1f","year":2017},"citing_paper":{"arxiv_id":"2508.21613","last_updated":"2026-04-20T07:16:46Z","snapshot_observed_at":"2026-07-30T02:14:25.450050Z","submitted_at":"2025-08-29T13:22:11Z","title":"Chameleon: Adaptive Fault Tolerance for Distributed Training via Real-time Policy Selection","version":4},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-18T20:39:32.123038Z"},"links":{"cited_paper":"/paper/1706.02677","citing_paper":"/paper/2508.21613"},"observation_digest":"sha256:6f2bac7638f0f6b4c87cb26ef6cb692ba5526938a7ab01933577d93ac83c0582","observation_id":"710d63b9-f237-49f7-aa67-04ff0cbfa936","resolution":{"observed_at":"2026-05-18T20:41:50.651257Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-13T20:21:09.485311+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T20:21:09.485311+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1802.05799","last_updated":"2018-02-21T04:30:30Z","snapshot_observed_at":"2026-07-06T06:23:45.215820Z","submitted_at":"2018-02-15T23:36:51Z","title":"Horovod: fast and easy distributed deep learning in TensorFlow","version":3},"cited_work":{"arxiv_id":"1802.05799","doi":"10.48550/arxiv.1802.05799","metadata_source":"pith","pith_arxiv_id":"1802.05799","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Horovod: fast and easy distributed deep learning in TensorFlow","venue":"cs.LG","work_id":"1437d05a-4ec5-4ff0-afdb-fd503478751e","year":2018},"citing_paper":{"arxiv_id":"2508.21613","last_updated":"2026-04-20T07:16:46Z","snapshot_observed_at":"2026-07-30T02:14:25.450050Z","submitted_at":"2025-08-29T13:22:11Z","title":"Chameleon: Adaptive Fault Tolerance for Distributed Training via Real-time Policy Selection","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-18T20:39:32.123038Z"},"links":{"cited_paper":"/paper/1802.05799","citing_paper":"/paper/2508.21613"},"observation_digest":"sha256:13b5e4b4182f8ed10300c96b5079dabd2643c3a96eac61284909603ba66d8deb","observation_id":"23a3272d-7a27-41ee-b508-837b62afecac","resolution":{"observed_at":"2026-05-18T20:41:50.641241Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1709.05011","last_updated":"2018-01-31T05:15:27Z","snapshot_observed_at":"2026-07-06T05:59:44.509533Z","submitted_at":"2017-09-14T23:59:52Z","title":"ImageNet Training in Minutes","version":10},"cited_work":{"arxiv_id":"1709.05011","doi":null,"metadata_source":"pith","pith_arxiv_id":"1709.05011","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ImageNet Training in Minutes","venue":"cs.CV","work_id":"4d1ddacb-f90b-49d5-870e-7a78442410a0","year":2017},"citing_paper":{"arxiv_id":"2508.21613","last_updated":"2026-04-20T07:16:46Z","snapshot_observed_at":"2026-07-30T02:14:25.450050Z","submitted_at":"2025-08-29T13:22:11Z","title":"Chameleon: Adaptive Fault Tolerance for Distributed Training via Real-time Policy Selection","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-18T20:39:32.123038Z"},"links":{"cited_paper":"/paper/1709.05011","citing_paper":"/paper/2508.21613"},"observation_digest":"sha256:3e29a599b589f7195f06796f097ef63c40a7dff45797f3351e82701ef858efd3","observation_id":"31891851-6ccf-4e31-85e2-c3352e6269df","resolution":{"observed_at":"2026-05-18T20:41:50.630641Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"cited_work":{"arxiv_id":"2201.11990","doi":"10.48550/arxiv.2201.11990","metadata_source":"pith","pith_arxiv_id":"2201.11990","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","venue":"cs.CL","work_id":"7db569c6-f66a-40a1-9974-3de1eb611cc1","year":2022},"citing_paper":{"arxiv_id":"2508.21613","last_updated":"2026-04-20T07:16:46Z","snapshot_observed_at":"2026-07-30T02:14:25.450050Z","submitted_at":"2025-08-29T13:22:11Z","title":"Chameleon: Adaptive Fault Tolerance for Distributed Training via Real-time Policy Selection","version":4},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-18T20:39:32.123038Z"},"links":{"cited_paper":"/paper/2201.11990","citing_paper":"/paper/2508.21613"},"observation_digest":"sha256:bb261bebc7df59a03c7925fc7891a3d47531851db0d53ac6f882d6cc540f40e9","observation_id":"3356bce0-fe8f-4732-ac13-4893bee81912","resolution":{"observed_at":"2026-05-18T20:41:50.646394Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1811.06965","last_updated":"2019-07-25T21:42:58Z","snapshot_observed_at":"2026-07-06T07:15:13.277903Z","submitted_at":"2018-11-16T18:43:28Z","title":"GPipe: Efficient Training of Giant Neural Networks using Pipeline Parallelism","version":5},"cited_work":{"arxiv_id":"1811.06965","doi":"10.48550/arxiv.1811.06965","metadata_source":"pith","pith_arxiv_id":"1811.06965","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPipe: Efficient Training of Giant Neural Networks using Pipeline Parallelism","venue":"cs.CV","work_id":"37375911-ccd2-4498-abd8-45af00a7f04f","year":2018},"citing_paper":{"arxiv_id":"2508.21613","last_updated":"2026-04-20T07:16:46Z","snapshot_observed_at":"2026-07-30T02:14:25.450050Z","submitted_at":"2025-08-29T13:22:11Z","title":"Chameleon: Adaptive Fault Tolerance for Distributed Training via Real-time Policy Selection","version":4},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-18T20:39:32.123038Z"},"links":{"cited_paper":"/paper/1811.06965","citing_paper":"/paper/2508.21613"},"observation_digest":"sha256:c4dd5a28dad78f9ea578d73b0f3e13b832a101e0daa9ecf55ef6ec3948e1654c","observation_id":"2c2149b2-0772-49b8-8097-ef3a26bf5d0c","resolution":{"observed_at":"2026-05-18T20:41:50.677249Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:33.63915+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:33.63915+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"BPipe: Memory-balanced pipeline parallelism for training large language models","venue":null,"work_id":"59617b73-ffe8-42b3-b8f9-9bb6d045a8f8","year":2023},"citing_paper":{"arxiv_id":"2508.21613","last_updated":"2026-04-20T07:16:46Z","snapshot_observed_at":"2026-07-30T02:14:25.450050Z","submitted_at":"2025-08-29T13:22:11Z","title":"Chameleon: Adaptive Fault Tolerance for Distributed Training via Real-time Policy Selection","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-18T20:39:32.123038Z"},"links":{"citing_paper":"/paper/2508.21613"},"observation_digest":"sha256:4d9c79d81132d08bd25a28034af689aa113c07bc9a032340752a8fcfecd1d566","observation_id":"e77b0450-8f64-4cc5-b1fd-2ff4c85a717e","resolution":{"observed_at":"2026-05-18T20:41:51.879787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.02054","last_updated":"2020-05-13T06:45:15Z","snapshot_observed_at":"2026-07-06T08:27:00.558613Z","submitted_at":"2019-10-04T17:29:39Z","title":"ZeRO: Memory Optimizations Toward Training Trillion Parameter Models","version":3},"cited_work":{"arxiv_id":"1910.02054","doi":"10.48550/arxiv.1910.02054","metadata_source":"pith","pith_arxiv_id":"1910.02054","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ZeRO: Memory Optimizations Toward Training Trillion Parameter Models","venue":"cs.LG","work_id":"c5e9ad7b-c11d-43b7-b02d-c46d74a77fa9","year":2019},"citing_paper":{"arxiv_id":"2508.21613","last_updated":"2026-04-20T07:16:46Z","snapshot_observed_at":"2026-07-30T02:14:25.450050Z","submitted_at":"2025-08-29T13:22:11Z","title":"Chameleon: Adaptive Fault Tolerance for Distributed Training via Real-time Policy Selection","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-18T20:39:32.123038Z"},"links":{"cited_paper":"/paper/1910.02054","citing_paper":"/paper/2508.21613"},"observation_digest":"sha256:e1a1bc1ef569a0ecaa2cd4c1ca8dadf493fee94e7d5d6c1129f7d976d6000520","observation_id":"d77e79dd-3b5b-4704-b993-0431996b3dbc","resolution":{"observed_at":"2026-05-18T20:41:50.656090Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:34.137438+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:34.137438+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05019","last_updated":"2025-05-29T04:25:16Z","snapshot_observed_at":"2026-07-06T17:56:49.318298Z","submitted_at":"2024-04-07T17:17:23Z","title":"Shortcut-connected Expert Parallelism for Accelerating Mixture-of-Experts","version":3},"cited_work":{"arxiv_id":"2404.05019","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.05019","snapshot_observed_at":"2026-06-29T19:23:54.128784Z","title":"Shortcut-connected expert parallelism for accelerating mixture-of-experts","venue":null,"work_id":"190c67f2-7d8f-48c0-af65-75443b7d0920","year":2024},"citing_paper":{"arxiv_id":"2508.21613","last_updated":"2026-04-20T07:16:46Z","snapshot_observed_at":"2026-07-30T02:14:25.450050Z","submitted_at":"2025-08-29T13:22:11Z","title":"Chameleon: Adaptive Fault Tolerance for Distributed Training via Real-time Policy Selection","version":4},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-18T20:39:32.123038Z"},"links":{"cited_paper":"/paper/2404.05019","citing_paper":"/paper/2508.21613"},"observation_digest":"sha256:a9ecec2e271624ae76a481d4af051f19e3f20c22b02a732ff92a2fdd1804cbab","observation_id":"42bc76e4-b3cf-475d-bf2b-430ed40f5930","resolution":{"observed_at":"2026-05-18T20:41:50.619868Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12247","last_updated":"2025-01-03T06:19:14Z","snapshot_observed_at":"2026-08-03T22:59:00.088255Z","submitted_at":"2024-10-16T05:17:49Z","title":"EPS-MoE: Expert Pipeline Scheduler for Cost-Efficient MoE Inference","version":2},"cited_work":{"arxiv_id":"2410.12247","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.12247","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Eps- moe: Expert pipeline scheduler for cost-efficient moe inference","venue":null,"work_id":"4eb3b543-205e-45ab-b19b-089fda405e89","year":2024},"citing_paper":{"arxiv_id":"2508.21613","last_updated":"2026-04-20T07:16:46Z","snapshot_observed_at":"2026-07-30T02:14:25.450050Z","submitted_at":"2025-08-29T13:22:11Z","title":"Chameleon: Adaptive Fault Tolerance for Distributed Training via Real-time Policy Selection","version":4},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-18T20:39:32.123038Z"},"links":{"cited_paper":"/paper/2410.12247","citing_paper":"/paper/2508.21613"},"observation_digest":"sha256:fb08fb7c5269ce688ba2b8910ce6b78a994e78c456e2db1ec254bdefa014202a","observation_id":"863dbd24-f1b2-4d47-8830-6895e417b805","resolution":{"observed_at":"2026-05-18T20:41:50.608867Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2504.14960","doi":"10.48550/arxiv.2504.14960","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Moe parallel folding: Heterogeneous parallelism mappings for efficient large-scale moe model training with megatron core","venue":"Open MIND","work_id":"c907419e-5e64-4e38-aece-ad5867bcef05","year":2025},"citing_paper":{"arxiv_id":"2508.21613","last_updated":"2026-04-20T07:16:46Z","snapshot_observed_at":"2026-07-30T02:14:25.450050Z","submitted_at":"2025-08-29T13:22:11Z","title":"Chameleon: Adaptive Fault Tolerance for Distributed Training via Real-time Policy Selection","version":4},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-18T20:39:32.123038Z"},"links":{"citing_paper":"/paper/2508.21613"},"observation_digest":"sha256:bc326faf6d9902eed21597de1103a5f705ad7f9c40ec4378220b04e7d4cc696d","observation_id":"2944bfda-781b-43ad-b12b-2891759dd942","resolution":{"observed_at":"2026-05-18T20:41:50.614182Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Switch transformers: scaling to trillion parameter models with simple and efficient sparsity","venue":null,"work_id":"a4c179cd-82d4-452f-9abb-c6f9ad3f6a78","year":2022},"citing_paper":{"arxiv_id":"2508.21613","last_updated":"2026-04-20T07:16:46Z","snapshot_observed_at":"2026-07-30T02:14:25.450050Z","submitted_at":"2025-08-29T13:22:11Z","title":"Chameleon: Adaptive Fault Tolerance for Distributed Training via Real-time Policy Selection","version":4},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-18T20:39:32.123038Z"},"links":{"citing_paper":"/paper/2508.21613"},"observation_digest":"sha256:4afad092defba2f68a14304ce9ef28369e702101af1685d24cfc9facf2e3053b","observation_id":"c0b33fbc-ced1-4f00-a407-01b95eaefe16","resolution":{"observed_at":"2026-05-18T20:41:51.876089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.03382","last_updated":"2023-06-05T15:05:24Z","snapshot_observed_at":"2026-08-06T17:50:04.734688Z","submitted_at":"2022-06-07T15:20:20Z","title":"Tutel: Adaptive Mixture-of-Experts at Scale","version":2},"cited_work":{"arxiv_id":"2206.03382","doi":"10.48550/arxiv.2206.03382","metadata_source":"arxiv_reference","pith_arxiv_id":"2206.03382","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tutel: Adaptive mixture-of-experts at scale","venue":"arXiv (Cornell University)","work_id":"96d1130a-f636-4196-b910-d4bb0cda5d38","year":2022},"citing_paper":{"arxiv_id":"2508.21613","last_updated":"2026-04-20T07:16:46Z","snapshot_observed_at":"2026-07-30T02:14:25.450050Z","submitted_at":"2025-08-29T13:22:11Z","title":"Chameleon: Adaptive Fault Tolerance for Distributed Training via Real-time Policy Selection","version":4},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-18T20:39:32.123038Z"},"links":{"cited_paper":"/paper/2206.03382","citing_paper":"/paper/2508.21613"},"observation_digest":"sha256:f703f567d6d713b8298231109d0edcef632c27a25a3a9669e6f504796ef31f70","observation_id":"ea35a451-8a4a-4010-99dc-292664997f1d","resolution":{"observed_at":"2026-05-18T20:41:50.636452Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.11432","doi":"10.48550/arxiv.2505.11432","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T01:07:43.805821Z","title":"Megascale-moe: Large-scale communication-efficient training of mixture-of-experts models in production","venue":null,"work_id":"d2e5a111-b10c-463f-8ca7-b88ca8a6ff29","year":2025},"citing_paper":{"arxiv_id":"2508.21613","last_updated":"2026-04-20T07:16:46Z","snapshot_observed_at":"2026-07-30T02:14:25.450050Z","submitted_at":"2025-08-29T13:22:11Z","title":"Chameleon: Adaptive Fault Tolerance for Distributed Training via Real-time Policy Selection","version":4},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-18T20:39:32.123038Z"},"links":{"citing_paper":"/paper/2508.21613"},"observation_digest":"sha256:654039c5ca14f94a53ee9801117617bde0b97b630fa5c878c01b8add2cec4299","observation_id":"8c68d54a-5f6f-4055-8ceb-25edab022570","resolution":{"observed_at":"2026-05-18T20:41:50.625516Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"3408.366340","doi":"10.1145/3663408.3663409","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Understanding communication characteristics of distributed training","venue":null,"work_id":"d86d711f-084b-412b-aafd-a92cbfea1bde","year":2024},"citing_paper":{"arxiv_id":"2508.21613","last_updated":"2026-04-20T07:16:46Z","snapshot_observed_at":"2026-07-30T02:14:25.450050Z","submitted_at":"2025-08-29T13:22:11Z","title":"Chameleon: Adaptive Fault Tolerance for Distributed Training via Real-time Policy Selection","version":4},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-18T20:39:32.123038Z"},"links":{"citing_paper":"/paper/2508.21613"},"observation_digest":"sha256:fa65251c906e8a310cc9e47bfed42f9e73264e88a4f65d2de7152e043d227b40","observation_id":"2e840f52-915e-4557-b1ca-4001fd5428a6","resolution":{"observed_at":"2026-05-18T20:41:50.308004Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Amped: An analytical model for performance in distributed training of transformers","venue":null,"work_id":"7f46d566-68d7-4dfa-a8d3-5360eb87e2c9","year":2023},"citing_paper":{"arxiv_id":"2508.21613","last_updated":"2026-04-20T07:16:46Z","snapshot_observed_at":"2026-07-30T02:14:25.450050Z","submitted_at":"2025-08-29T13:22:11Z","title":"Chameleon: Adaptive Fault Tolerance for Distributed Training via Real-time Policy Selection","version":4},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-18T20:39:32.123038Z"},"links":{"citing_paper":"/paper/2508.21613"},"observation_digest":"sha256:ad5d50f313ecae97b44032b576ea38c63b389e1b345fa2a1e354d976827e6305","observation_id":"8e0a46fb-5b31-474c-bba2-271646555743","resolution":{"observed_at":"2026-05-18T20:41:51.872686Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.05198","last_updated":"2022-05-10T22:40:17Z","snapshot_observed_at":"2026-07-06T13:08:41.837840Z","submitted_at":"2022-05-10T22:40:17Z","title":"Reducing Activation Recomputation in Large Transformer Models","version":1},"cited_work":{"arxiv_id":"2205.05198","doi":"10.48550/arxiv.2205.05198","metadata_source":"arxiv_reference","pith_arxiv_id":"2205.05198","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kuaishou","venue":"arXiv (Cornell University)","work_id":"95aeb8ec-f2a2-4ca9-b63d-125f9638d395","year":2024},"citing_paper":{"arxiv_id":"2508.21613","last_updated":"2026-04-20T07:16:46Z","snapshot_observed_at":"2026-07-30T02:14:25.450050Z","submitted_at":"2025-08-29T13:22:11Z","title":"Chameleon: Adaptive Fault Tolerance for Distributed Training via Real-time Policy Selection","version":4},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-18T20:39:32.123038Z"},"links":{"cited_paper":"/paper/2205.05198","citing_paper":"/paper/2508.21613"},"observation_digest":"sha256:4fc4987997afdbf145922f47391c63fe1b9d2e14063fac05bbc9e473583bd7cd","observation_id":"2310f253-5f7a-4c4f-b35c-c2b3c75cacbb","resolution":{"observed_at":"2026-05-18T20:41:50.661629Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-21T12:26:21.423141+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T12:26:21.423141+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"8817.347614","doi":"10.1145/3458817.3476145","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proceedings of the International Conference for High Performance Computing, Networking, Storage and Analysis , articleno =","venue":null,"work_id":"5cd8482e-f3c9-4c6f-8b82-c98cdd40ed8a","year":2021},"citing_paper":{"arxiv_id":"2508.21613","last_updated":"2026-04-20T07:16:46Z","snapshot_observed_at":"2026-07-30T02:14:25.450050Z","submitted_at":"2025-08-29T13:22:11Z","title":"Chameleon: Adaptive Fault Tolerance for Distributed Training via Real-time Policy Selection","version":4},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-18T20:39:32.123038Z"},"links":{"citing_paper":"/paper/2508.21613"},"observation_digest":"sha256:7d24313030f1f60278216008c0b0ab4a730e3bdb0344ab13abbc152320dab4d8","observation_id":"19f3c7a3-a5bf-47ea-b116-53ad995d2a1d","resolution":{"observed_at":"2026-05-18T20:41:50.295300Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-12T02:49:49.202054+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T02:49:49.202054+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"5478.341553","doi":"10.14778/3415478.3415530","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pytorch distributed: experiences on accelerating data parallel training","venue":"Proceedings of the VLDB Endowment","work_id":"7ab44fdb-1a99-4d9c-a488-b2228b851233","year":2020},"citing_paper":{"arxiv_id":"2508.21613","last_updated":"2026-04-20T07:16:46Z","snapshot_observed_at":"2026-07-30T02:14:25.450050Z","submitted_at":"2025-08-29T13:22:11Z","title":"Chameleon: Adaptive Fault Tolerance for Distributed Training via Real-time Policy Selection","version":4},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-18T20:39:32.123038Z"},"links":{"citing_paper":"/paper/2508.21613"},"observation_digest":"sha256:a4e3b84d9de871047dde708f9780fadaaaa2d37eaaa8e5bb4b3162ef92d75bd3","observation_id":"f6dbc7bb-df01-4242-a69f-09c725584504","resolution":{"observed_at":"2026-05-18T20:41:50.301514Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-12T02:49:48.668534+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T02:49:48.668534+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Varuna: scalable, low-cost training of massive deep learning models","venue":null,"work_id":"c1a9bd31-c037-415a-a97a-6df3cec97ae3","year":2022},"citing_paper":{"arxiv_id":"2508.21613","last_updated":"2026-04-20T07:16:46Z","snapshot_observed_at":"2026-07-30T02:14:25.450050Z","submitted_at":"2025-08-29T13:22:11Z","title":"Chameleon: Adaptive Fault Tolerance for Distributed Training via Real-time Policy Selection","version":4},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-18T20:39:32.123038Z"},"links":{"citing_paper":"/paper/2508.21613"},"observation_digest":"sha256:9463fa8567c04b3c621fceb0ad8077d070e900319223ce05c6c6478fc61ff364","observation_id":"b240e950-ad48-452e-9dcb-e6e8d4cee2eb","resolution":{"observed_at":"2026-05-18T20:41:51.869630Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Failures in large scale systems: Long-term measurement, analysis, and implications","venue":null,"work_id":"14f405ce-21e0-4d28-a299-b323ee50e39f","year":2017},"citing_paper":{"arxiv_id":"2508.21613","last_updated":"2026-04-20T07:16:46Z","snapshot_observed_at":"2026-07-30T02:14:25.450050Z","submitted_at":"2025-08-29T13:22:11Z","title":"Chameleon: Adaptive Fault Tolerance for Distributed Training via Real-time Policy Selection","version":4},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-18T20:39:32.123038Z"},"links":{"citing_paper":"/paper/2508.21613"},"observation_digest":"sha256:ddc5b891512895607dc59460113491e9399864f410d1ba5401e3e6bfad6df79b","observation_id":"7fea385a-ea6b-4e33-bc6e-a204e02792b8","resolution":{"observed_at":"2026-05-18T20:41:51.866624Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"MLaaS in the wild: Workload analysis and scheduling in Large-Scale heterogeneous GPU clusters","venue":null,"work_id":"d5d48726-7b70-4873-834c-57ea8bc3cc49","year":2022},"citing_paper":{"arxiv_id":"2508.21613","last_updated":"2026-04-20T07:16:46Z","snapshot_observed_at":"2026-07-30T02:14:25.450050Z","submitted_at":"2025-08-29T13:22:11Z","title":"Chameleon: Adaptive Fault Tolerance for Distributed Training via Real-time Policy Selection","version":4},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-18T20:39:32.123038Z"},"links":{"citing_paper":"/paper/2508.21613"},"observation_digest":"sha256:615b0f7264cf1dac521ccc0210fdb5329481b15dcd7a78fc320d02e82bd4152c","observation_id":"ff22b037-5091-495f-a53b-7b2cc18184a2","resolution":{"observed_at":"2026-05-18T20:41:51.863489Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Minder: Faulty machine detection for large-scale distributed model training","venue":null,"work_id":"8ced09f5-2d1d-443c-96f2-8b6a116272e3","year":2025},"citing_paper":{"arxiv_id":"2508.21613","last_updated":"2026-04-20T07:16:46Z","snapshot_observed_at":"2026-07-30T02:14:25.450050Z","submitted_at":"2025-08-29T13:22:11Z","title":"Chameleon: Adaptive Fault Tolerance for Distributed Training via Real-time Policy Selection","version":4},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-18T20:39:32.123038Z"},"links":{"citing_paper":"/paper/2508.21613"},"observation_digest":"sha256:fcfd98a8419174530c699d9ccc9db2798f0987ae6eaa08d8a7f96c9bd6dc4eff","observation_id":"93b186d6-d0e8-4f84-97e9-d482ff7898e2","resolution":{"observed_at":"2026-05-18T20:41:51.860249Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Alpa: Automating inter- and Intra-Operator parallelism for distributed deep learning","venue":null,"work_id":"f3a3e916-77d0-4163-bfa6-ca73339cfe53","year":2022},"citing_paper":{"arxiv_id":"2508.21613","last_updated":"2026-04-20T07:16:46Z","snapshot_observed_at":"2026-07-30T02:14:25.450050Z","submitted_at":"2025-08-29T13:22:11Z","title":"Chameleon: Adaptive Fault Tolerance for Distributed Training via Real-time Policy Selection","version":4},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-18T20:39:32.123038Z"},"links":{"citing_paper":"/paper/2508.21613"},"observation_digest":"sha256:14f5615ee11433b5e3f61046a5e8ebb89b85b84e7155733c86b11660e6c241de","observation_id":"babf272d-7115-4c67-8df3-a0bcf6e60010","resolution":{"observed_at":"2026-05-18T20:41:51.856876Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The hungarian method for the assignment problem","venue":null,"work_id":"0d890922-88ad-4584-92a2-f968d062e9f2","year":2012},"citing_paper":{"arxiv_id":"2508.21613","last_updated":"2026-04-20T07:16:46Z","snapshot_observed_at":"2026-07-30T02:14:25.450050Z","submitted_at":"2025-08-29T13:22:11Z","title":"Chameleon: Adaptive Fault Tolerance for Distributed Training via Real-time Policy Selection","version":4},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-18T20:39:32.123038Z"},"links":{"citing_paper":"/paper/2508.21613"},"observation_digest":"sha256:ea8b2a7737fd13bc62b1da3be4ab7cca7b7dd199bb0b98b00e198c542f81ca5b","observation_id":"492049b6-3fee-44ae-8f88-c66af5985182","resolution":{"observed_at":"2026-05-18T20:41:51.853505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-02T11:57:18.735747Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":"2307.09288","doi":"10.24963/ijcai.2025/706","metadata_source":"pith","pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","venue":"cs.CL","work_id":"68a5177f-d644-44c1-bd4f-4e5278c22f5d","year":2023},"citing_paper":{"arxiv_id":"2508.21613","last_updated":"2026-04-20T07:16:46Z","snapshot_observed_at":"2026-07-30T02:14:25.450050Z","submitted_at":"2025-08-29T13:22:11Z","title":"Chameleon: Adaptive Fault Tolerance for Distributed Training via Real-time Policy Selection","version":4},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-18T20:39:32.123038Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2508.21613"},"observation_digest":"sha256:5167ea5a2e23a0b00bf0e12e2f1b36695a2c9ae6ef4f639569490a02bfb0e705","observation_id":"6b00ff77-1b97-4770-ae2a-8655b4f723cd","resolution":{"observed_at":"2026-05-18T20:41:50.671674Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.21613","last_updated":"2026-04-20T07:16:46Z","latest_version":4,"primary_category":"cs.DC","snapshot_observed_at":"2026-07-30T02:14:25.450050Z","submitted_at":"2025-08-29T13:22:11Z","title":"Chameleon: Adaptive Fault Tolerance for Distributed Training via Real-time Policy Selection"},"reference_resolution":{"displayed":37,"state_counts":{"malformed_identifier":0,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":0,"verified_exact":18,"verified_fuzzy":16},"total_outbound_references":37},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 37 of 37 outbound references and 1 inbound Pith citation observation for arXiv:2508.21613."}