{"as_of":"2026-08-07T11:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:290e197d6e88d7f581a2d8df45aacd3d5df539461666cdbab9ad60bdd18ac4e0","coverage":[{"denominator":58,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":58,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-12T04:01:42.265205Z","state":"measured"},{"denominator":58,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":58,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.06374/citation-record","integrity":"/paper/2605.06374/integrity","json":"/paper/2605.06374/citation-record.json","paper":"/paper/2605.06374"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"9764c839-590b-4d77-85d0-ebef169c90d8","year":2020},"citing_paper":{"arxiv_id":"2605.06374","last_updated":"2026-05-11T13:11:57Z","snapshot_observed_at":"2026-07-06T23:18:51.157048Z","submitted_at":"2026-05-07T14:52:54Z","title":"ResiHP: Taming LLM Training Failures with Dynamic Hybrid Parallelism","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-12T04:01:42.265205Z"},"links":{"citing_paper":"/paper/2605.06374"},"observation_digest":"sha256:680e0efa41c1d4ddcd13dd042ede1d6673c4c25a0a26ab9555179df4fb4b8c04","observation_id":"cbb7827b-5b9b-4055-b489-bff82099cd06","resolution":{"observed_at":"2026-05-12T17:06:42.615062Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"962bf9c9-9f29-4b30-a700-bdb9f566affa","year":2022},"citing_paper":{"arxiv_id":"2605.06374","last_updated":"2026-05-11T13:11:57Z","snapshot_observed_at":"2026-07-06T23:18:51.157048Z","submitted_at":"2026-05-07T14:52:54Z","title":"ResiHP: Taming LLM Training Failures with Dynamic Hybrid Parallelism","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-12T04:01:42.265205Z"},"links":{"citing_paper":"/paper/2605.06374"},"observation_digest":"sha256:b85469148625f959942a9396b3b6b5ec6a002891bf5cd0e90540476f575b73e0","observation_id":"18d16531-638b-4728-897b-fb9724b2866e","resolution":{"observed_at":"2026-05-12T17:06:42.582278Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"c494edaa-2e16-4410-9969-09f9459099c7","year":2022},"citing_paper":{"arxiv_id":"2605.06374","last_updated":"2026-05-11T13:11:57Z","snapshot_observed_at":"2026-07-06T23:18:51.157048Z","submitted_at":"2026-05-07T14:52:54Z","title":"ResiHP: Taming LLM Training Failures with Dynamic Hybrid Parallelism","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-12T04:01:42.265205Z"},"links":{"citing_paper":"/paper/2605.06374"},"observation_digest":"sha256:c93e566346614b26928ec09fbb415b5de645096ccb8af67a144ecd5d16a2b587","observation_id":"2219b46f-ff0a-4273-b4ec-1759d7d18381","resolution":{"observed_at":"2026-05-12T17:06:42.625233Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"f677a3e7-cb3b-421b-9608-f23ab4c50db1","year":2024},"citing_paper":{"arxiv_id":"2605.06374","last_updated":"2026-05-11T13:11:57Z","snapshot_observed_at":"2026-07-06T23:18:51.157048Z","submitted_at":"2026-05-07T14:52:54Z","title":"ResiHP: Taming LLM Training Failures with Dynamic Hybrid Parallelism","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-12T04:01:42.265205Z"},"links":{"citing_paper":"/paper/2605.06374"},"observation_digest":"sha256:f554fdd2d18f7210c3f1eab050d3c7b92d0af357e1dc35554aa8ea27610cd8b6","observation_id":"97febac6-8c72-46ab-8f52-7cd757495d3d","resolution":{"observed_at":"2026-05-12T17:06:42.603374Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":"2412.19437","doi":"10.1016/j.neucom.2023.127063.url:https://www.sciencedirect","metadata_source":"pith","pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"DeepSeek-V3 Technical Report","venue":"cs.CL","work_id":"57d2791d-2219-4c31-a077-afc04b12a75c","year":2024},"citing_paper":{"arxiv_id":"2605.06374","last_updated":"2026-05-11T13:11:57Z","snapshot_observed_at":"2026-07-06T23:18:51.157048Z","submitted_at":"2026-05-07T14:52:54Z","title":"ResiHP: Taming LLM Training Failures with Dynamic Hybrid Parallelism","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-12T04:01:42.265205Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2605.06374"},"observation_digest":"sha256:14000c44832be2a2fef5ee0ae5ff3226b4c4fdc33ca584745e0c0c116bd9c3b0","observation_id":"9033362c-2726-4dd2-b70c-c95aebbdbfd9","resolution":{"observed_at":"2026-05-12T06:41:45.064519Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"436e0bb9-93cf-43e3-9d76-e061f0340711","year":2025},"citing_paper":{"arxiv_id":"2605.06374","last_updated":"2026-05-11T13:11:57Z","snapshot_observed_at":"2026-07-06T23:18:51.157048Z","submitted_at":"2026-05-07T14:52:54Z","title":"ResiHP: Taming LLM Training Failures with Dynamic Hybrid Parallelism","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-12T04:01:42.265205Z"},"links":{"citing_paper":"/paper/2605.06374"},"observation_digest":"sha256:e602d0d782e241542260224c2dd97f5309e466f1417c2f8202d8c052fa80d755","observation_id":"a739c7aa-8701-44c4-aeb6-6b4a22c9a9ff","resolution":{"observed_at":"2026-05-12T17:06:42.579931Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T08:16:06.526490Z","title":null,"venue":null,"work_id":"6d35d3b2-5bfb-470a-8771-9513c607d8b6","year":2024},"citing_paper":{"arxiv_id":"2605.06374","last_updated":"2026-05-11T13:11:57Z","snapshot_observed_at":"2026-07-06T23:18:51.157048Z","submitted_at":"2026-05-07T14:52:54Z","title":"ResiHP: Taming LLM Training Failures with Dynamic Hybrid Parallelism","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-12T04:01:42.265205Z"},"links":{"citing_paper":"/paper/2605.06374"},"observation_digest":"sha256:7890cee81ebe5bdfdf8e0eb69559d212100b6ed8c85f2a7b34619015bebdb060","observation_id":"5734e788-fff4-4c0d-977f-1a3fb34edcbe","resolution":{"observed_at":"2026-05-12T17:06:42.584659Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.06263","last_updated":"2021-12-12T15:39:11Z","snapshot_observed_at":"2026-08-03T18:43:19.681804Z","submitted_at":"2021-12-12T15:39:11Z","title":"Sage: Leveraging ML to Diagnose Unpredictable Performance in Cloud Microservices","version":1},"cited_work":{"arxiv_id":"2112.06263","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2112.06263","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"63546676-17cd-42c6-9a59-60aaa7960ec4","year":2021},"citing_paper":{"arxiv_id":"2605.06374","last_updated":"2026-05-11T13:11:57Z","snapshot_observed_at":"2026-07-06T23:18:51.157048Z","submitted_at":"2026-05-07T14:52:54Z","title":"ResiHP: Taming LLM Training Failures with Dynamic Hybrid Parallelism","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-12T04:01:42.265205Z"},"links":{"cited_paper":"/paper/2112.06263","citing_paper":"/paper/2605.06374"},"observation_digest":"sha256:807a79bcdf061facfe9da8842e3fceb697c822f8625e7df602c37be99c25bc38","observation_id":"8f531f66-2b36-4c76-9666-23ebe6328abd","resolution":{"observed_at":"2026-05-12T06:41:45.094643Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T14:32:36.353632Z","title":null,"venue":null,"work_id":"5d3c5989-5404-43e5-9bdb-058327e73e4f","year":2019},"citing_paper":{"arxiv_id":"2605.06374","last_updated":"2026-05-11T13:11:57Z","snapshot_observed_at":"2026-07-06T23:18:51.157048Z","submitted_at":"2026-05-07T14:52:54Z","title":"ResiHP: Taming LLM Training Failures with Dynamic Hybrid Parallelism","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-12T04:01:42.265205Z"},"links":{"citing_paper":"/paper/2605.06374"},"observation_digest":"sha256:81a158e8aee7bfb08fea4fc76691f68e760f8269dd9171d748a3e1e4073ebb73","observation_id":"f54e1e4a-ac08-455e-9dab-2eb4d8722f60","resolution":{"observed_at":"2026-05-12T17:06:42.621013Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"77bbc95a-4783-4e50-9241-2bac873245d6","year":null},"citing_paper":{"arxiv_id":"2605.06374","last_updated":"2026-05-11T13:11:57Z","snapshot_observed_at":"2026-07-06T23:18:51.157048Z","submitted_at":"2026-05-07T14:52:54Z","title":"ResiHP: Taming LLM Training Failures with Dynamic Hybrid Parallelism","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-12T04:01:42.265205Z"},"links":{"citing_paper":"/paper/2605.06374"},"observation_digest":"sha256:3ed99d1f3b106f590815c6b9aa5244356a496f037ecd26fb813cebd08f485d20","observation_id":"884b28d0-4a21-478b-ac0c-827607a32e05","resolution":{"observed_at":"2026-05-12T17:06:42.611055Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In Proceedings of the ACM SIGOPS 30th Symposium on Operating Systems Principles","venue":null,"work_id":"732091d0-31c4-4653-8e76-3b989f26e21e","year":null},"citing_paper":{"arxiv_id":"2605.06374","last_updated":"2026-05-11T13:11:57Z","snapshot_observed_at":"2026-07-06T23:18:51.157048Z","submitted_at":"2026-05-07T14:52:54Z","title":"ResiHP: Taming LLM Training Failures with Dynamic Hybrid Parallelism","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-12T04:01:42.265205Z"},"links":{"citing_paper":"/paper/2605.06374"},"observation_digest":"sha256:c4c1f05695fbe3a196cd9e12710d702c65b2bd6c3c5dbf024d8e0b2b4c374c1c","observation_id":"ab732ce7-5025-4e89-a776-a8d051d3b249","resolution":{"observed_at":"2026-05-12T17:06:42.617384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.21009","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T16:29:56.817095Z","title":"Rollpacker: Mitigating long-tail rollouts for fast, synchronous rl post-training","venue":null,"work_id":"5a098eae-1c24-47d3-8e41-f32bd7dbd571","year":2025},"citing_paper":{"arxiv_id":"2605.06374","last_updated":"2026-05-11T13:11:57Z","snapshot_observed_at":"2026-07-06T23:18:51.157048Z","submitted_at":"2026-05-07T14:52:54Z","title":"ResiHP: Taming LLM Training Failures with Dynamic Hybrid Parallelism","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-12T04:01:42.265205Z"},"links":{"citing_paper":"/paper/2605.06374"},"observation_digest":"sha256:4c1031853dce45f233bf74bf2a6334206338abe6555f21cb457397a7ce7360d4","observation_id":"f589bbec-0dfe-464f-95e7-a563b92257cb","resolution":{"observed_at":"2026-05-12T06:41:45.024246Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"67a45a7f-85c2-46c3-bcd0-7ab7282672d9","year":2025},"citing_paper":{"arxiv_id":"2605.06374","last_updated":"2026-05-11T13:11:57Z","snapshot_observed_at":"2026-07-06T23:18:51.157048Z","submitted_at":"2026-05-07T14:52:54Z","title":"ResiHP: Taming LLM Training Failures with Dynamic Hybrid Parallelism","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-12T04:01:42.265205Z"},"links":{"citing_paper":"/paper/2605.06374"},"observation_digest":"sha256:c3be04856efa9c30353d952b565c931024774f1603e29f2f64cdad0867dc170d","observation_id":"69f5e69b-a33d-4fcd-be89-72c208c335bc","resolution":{"observed_at":"2026-05-12T17:06:42.595685Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"ed62033d-1c5b-4548-ab06-fd54556842e3","year":2007},"citing_paper":{"arxiv_id":"2605.06374","last_updated":"2026-05-11T13:11:57Z","snapshot_observed_at":"2026-07-06T23:18:51.157048Z","submitted_at":"2026-05-07T14:52:54Z","title":"ResiHP: Taming LLM Training Failures with Dynamic Hybrid Parallelism","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-12T04:01:42.265205Z"},"links":{"citing_paper":"/paper/2605.06374"},"observation_digest":"sha256:d8be37c2740c2cd9b911433a8af288c21313360da6718c170f7f09bae028be0a","observation_id":"83456f6a-a984-4e31-9c02-9b338fc9084c","resolution":{"observed_at":"2026-05-12T17:06:42.627210Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"4ba880dc-9c91-4b77-b26b-25095eeaa0af","year":2018},"citing_paper":{"arxiv_id":"2605.06374","last_updated":"2026-05-11T13:11:57Z","snapshot_observed_at":"2026-07-06T23:18:51.157048Z","submitted_at":"2026-05-07T14:52:54Z","title":"ResiHP: Taming LLM Training Failures with Dynamic Hybrid Parallelism","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-12T04:01:42.265205Z"},"links":{"citing_paper":"/paper/2605.06374"},"observation_digest":"sha256:c3e757b2acb7e211b91bbdaeb98d1cd6f9acee33dd5ba7d57a94f7aa0ce2972c","observation_id":"3bc0eebe-5f0d-4640-9773-0208769567b7","resolution":{"observed_at":"2026-05-12T17:06:42.612982Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1145/3242086","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gunawi, Riza O","venue":"ACM Transactions on Storage","work_id":"4651e741-17d2-4cf2-8743-607f10346167","year":2018},"citing_paper":{"arxiv_id":"2605.06374","last_updated":"2026-05-11T13:11:57Z","snapshot_observed_at":"2026-07-06T23:18:51.157048Z","submitted_at":"2026-05-07T14:52:54Z","title":"ResiHP: Taming LLM Training Failures with Dynamic Hybrid Parallelism","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-12T04:01:42.265205Z"},"links":{"citing_paper":"/paper/2605.06374"},"observation_digest":"sha256:4ee4b80ca5375ec9497ee9835e46220c30240c6521724424daa436a8175048d3","observation_id":"12b9e1e9-6abc-4760-9c89-40f49a67def0","resolution":{"observed_at":"2026-05-12T04:11:22.419269Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23722","last_updated":"2026-07-03T02:44:15Z","snapshot_observed_at":"2026-08-04T14:42:54.705316Z","submitted_at":"2025-09-28T08:05:13Z","title":"OctoPipe: Reducing Pipeline Bubbles for Heterogeneous Models via Co-Optimizing Partitioning, Placement, and Scheduling","version":2},"cited_work":{"arxiv_id":"2509.23722","doi":"10.48550/arxiv.2509.23722","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.23722","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Adaptis: Reducing pipeline bubbles with adaptive pipeline parallelism on heterogeneous models","venue":"ArXiv.org","work_id":"85dca17e-3bbb-4782-9f4a-a0d83597f9e8","year":2025},"citing_paper":{"arxiv_id":"2605.06374","last_updated":"2026-05-11T13:11:57Z","snapshot_observed_at":"2026-07-06T23:18:51.157048Z","submitted_at":"2026-05-07T14:52:54Z","title":"ResiHP: Taming LLM Training Failures with Dynamic Hybrid Parallelism","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-12T04:01:42.265205Z"},"links":{"cited_paper":"/paper/2509.23722","citing_paper":"/paper/2605.06374"},"observation_digest":"sha256:5225208d2c0849f7b100bcc6ecce90ea0c1e3f4dcc6a8ea56351371414634e31","observation_id":"07de0392-3ff9-4436-9fcf-16b7533bbcea","resolution":{"observed_at":"2026-07-07T02:15:57.736644Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"ff11fbec-de92-479c-ac07-2440f0e851f4","year":2024},"citing_paper":{"arxiv_id":"2605.06374","last_updated":"2026-05-11T13:11:57Z","snapshot_observed_at":"2026-07-06T23:18:51.157048Z","submitted_at":"2026-05-07T14:52:54Z","title":"ResiHP: Taming LLM Training Failures with Dynamic Hybrid Parallelism","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-12T04:01:42.265205Z"},"links":{"citing_paper":"/paper/2605.06374"},"observation_digest":"sha256:81e7b7d243c164908082f408d137fa16558de65f9b01c61078056698a1da57cd","observation_id":"c7fa4d47-5cc6-4dd5-92ed-11801c8dd32c","resolution":{"observed_at":"2026-05-12T17:06:42.586943Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Le, Yonghui Wu, and Zhifeng Chen","venue":null,"work_id":"30fe7dc9-b875-4fc3-8cfa-e08627ee663e","year":2019},"citing_paper":{"arxiv_id":"2605.06374","last_updated":"2026-05-11T13:11:57Z","snapshot_observed_at":"2026-07-06T23:18:51.157048Z","submitted_at":"2026-05-07T14:52:54Z","title":"ResiHP: Taming LLM Training Failures with Dynamic Hybrid Parallelism","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-12T04:01:42.265205Z"},"links":{"citing_paper":"/paper/2605.06374"},"observation_digest":"sha256:baab3cedfb528893b3f6342457081321b52d2c56c3a7d65e46a55320833fdc61","observation_id":"c716d102-16e2-4fb9-84f1-af47cdf9f55f","resolution":{"observed_at":"2026-05-12T17:06:42.591437Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14509","last_updated":"2023-10-04T16:51:13Z","snapshot_observed_at":"2026-08-04T19:27:31.715261Z","submitted_at":"2023-09-25T20:15:57Z","title":"DeepSpeed Ulysses: System Optimizations for Enabling Training of Extreme Long Sequence Transformer Models","version":2},"cited_work":{"arxiv_id":"2309.14509","doi":"10.48550/arxiv.2309.14509","metadata_source":"pith","pith_arxiv_id":"2309.14509","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSpeed Ulysses: System Optimizations for Enabling Training of Extreme Long Sequence Transformer Models","venue":"cs.LG","work_id":"bb119d0b-c7f0-412a-a426-f74bd6949a51","year":2023},"citing_paper":{"arxiv_id":"2605.06374","last_updated":"2026-05-11T13:11:57Z","snapshot_observed_at":"2026-07-06T23:18:51.157048Z","submitted_at":"2026-05-07T14:52:54Z","title":"ResiHP: Taming LLM Training Failures with Dynamic Hybrid Parallelism","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-12T04:01:42.265205Z"},"links":{"cited_paper":"/paper/2309.14509","citing_paper":"/paper/2605.06374"},"observation_digest":"sha256:aaa0bc1f55ae5eec730d8b054a2e7afa3139ebc953cf5cde3e5e872bc8ea3666","observation_id":"afd2c21a-ed1a-4e13-8f6d-c3cabe23af85","resolution":{"observed_at":"2026-05-13T01:07:22.650116Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"1991.The Art of Computer Systems Performance Analysis: Techniques for Experimental Design, Measurement, Simulation, and Modeling","venue":null,"work_id":"fcf7a87c-c658-4a75-be06-86bfd2a003b4","year":1991},"citing_paper":{"arxiv_id":"2605.06374","last_updated":"2026-05-11T13:11:57Z","snapshot_observed_at":"2026-07-06T23:18:51.157048Z","submitted_at":"2026-05-07T14:52:54Z","title":"ResiHP: Taming LLM Training Failures with Dynamic Hybrid Parallelism","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-12T04:01:42.265205Z"},"links":{"citing_paper":"/paper/2605.06374"},"observation_digest":"sha256:bc044d20c3d1f21dee1b54f3fe8dea20d756e8a0b3f32e284828baad1929c95d","observation_id":"cd1faaf7-8570-44cf-996f-7cc1b2262649","resolution":{"observed_at":"2026-05-12T17:06:42.593538Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"814b7756-4d31-4baf-bccc-726ebfcd9761","year":2023},"citing_paper":{"arxiv_id":"2605.06374","last_updated":"2026-05-11T13:11:57Z","snapshot_observed_at":"2026-07-06T23:18:51.157048Z","submitted_at":"2026-05-07T14:52:54Z","title":"ResiHP: Taming LLM Training Failures with Dynamic Hybrid Parallelism","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-12T04:01:42.265205Z"},"links":{"citing_paper":"/paper/2605.06374"},"observation_digest":"sha256:5a81a9479aad17d4b71a5cfae42efb306a865679e0ade2a0c52103b6cdeb7605","observation_id":"0aac8b09-bb09-485f-a350-3ca28d132053","resolution":{"observed_at":"2026-05-12T17:06:42.589474Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"34f394a3-ffad-4516-8bef-9b07a5c1d5c7","year":2024},"citing_paper":{"arxiv_id":"2605.06374","last_updated":"2026-05-11T13:11:57Z","snapshot_observed_at":"2026-07-06T23:18:51.157048Z","submitted_at":"2026-05-07T14:52:54Z","title":"ResiHP: Taming LLM Training Failures with Dynamic Hybrid Parallelism","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-12T04:01:42.265205Z"},"links":{"citing_paper":"/paper/2605.06374"},"observation_digest":"sha256:a27fc6d7753d2d2cdd8e727e2e394ffcadfc0ba59942bee93f1bfbfb571118b1","observation_id":"9b222ff8-f02b-42e2-b736-79f45a5ddab0","resolution":{"observed_at":"2026-05-12T17:06:42.623004Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"ae813ea9-0fcf-467d-ae31-f887c934a1ce","year":2024},"citing_paper":{"arxiv_id":"2605.06374","last_updated":"2026-05-11T13:11:57Z","snapshot_observed_at":"2026-07-06T23:18:51.157048Z","submitted_at":"2026-05-07T14:52:54Z","title":"ResiHP: Taming LLM Training Failures with Dynamic Hybrid Parallelism","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-12T04:01:42.265205Z"},"links":{"citing_paper":"/paper/2605.06374"},"observation_digest":"sha256:00299addae6d0e8524913170debe17aa94b406030c5ed61cb6c489e74662f8c0","observation_id":"195e3356-f231-424e-a5a8-b15a228840f2","resolution":{"observed_at":"2026-05-12T17:06:42.605373Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.00606","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T04:07:37.148824Z","title":"Elaswave: An elastic-native system for scalable hybrid-parallel training.arXiv preprint arXiv:2510.00606, 2025","venue":null,"work_id":"5ed619d8-8a08-4e44-983a-8594b2155a71","year":2025},"citing_paper":{"arxiv_id":"2605.06374","last_updated":"2026-05-11T13:11:57Z","snapshot_observed_at":"2026-07-06T23:18:51.157048Z","submitted_at":"2026-05-07T14:52:54Z","title":"ResiHP: Taming LLM Training Failures with Dynamic Hybrid Parallelism","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-12T04:01:42.265205Z"},"links":{"citing_paper":"/paper/2605.06374"},"observation_digest":"sha256:4e38bf2b9b9b5e47fef3a660c86712e0958425424fab6148b6aaaf1995b7a1a0","observation_id":"9858b347-8f22-4a2a-97b2-54624664e180","resolution":{"observed_at":"2026-05-12T06:41:44.999358Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"7db6183f-23ae-4ba1-9101-b66b59933850","year":2023},"citing_paper":{"arxiv_id":"2605.06374","last_updated":"2026-05-11T13:11:57Z","snapshot_observed_at":"2026-07-06T23:18:51.157048Z","submitted_at":"2026-05-07T14:52:54Z","title":"ResiHP: Taming LLM Training Failures with Dynamic Hybrid Parallelism","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-12T04:01:42.265205Z"},"links":{"citing_paper":"/paper/2605.06374"},"observation_digest":"sha256:62ce1b2b60c24730fbbe0b5b9904e7f6dc2deb363af3f6db64a36f483b10c47a","observation_id":"3c5d0d30-36a2-4de1-8c70-c083189ef69a","resolution":{"observed_at":"2026-05-12T17:06:42.649150Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.02027","last_updated":"2022-10-05T20:14:52Z","snapshot_observed_at":"2026-08-06T06:13:52.132620Z","submitted_at":"2021-06-29T04:37:23Z","title":"Efficient Sequence Packing without Cross-contamination: Accelerating Large Language Models without Impacting Performance","version":2},"cited_work":{"arxiv_id":"2107.02027","doi":"10.48550/arxiv.2107.02027","metadata_source":"pith","pith_arxiv_id":"2107.02027","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kosec, S","venue":"cs.CL","work_id":"168014c6-0f97-4394-a665-a80a203ae40c","year":2021},"citing_paper":{"arxiv_id":"2605.06374","last_updated":"2026-05-11T13:11:57Z","snapshot_observed_at":"2026-07-06T23:18:51.157048Z","submitted_at":"2026-05-07T14:52:54Z","title":"ResiHP: Taming LLM Training Failures with Dynamic Hybrid Parallelism","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-12T04:01:42.265205Z"},"links":{"cited_paper":"/paper/2107.02027","citing_paper":"/paper/2605.06374"},"observation_digest":"sha256:c62385eb8a90d1a707b11391e486e1c528ff7e33778c003d82b64bd6af34f6ef","observation_id":"1a25cd3a-af29-4808-8f11-3c10c6ef14a3","resolution":{"observed_at":"2026-05-12T06:41:44.985422Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16668","last_updated":"2020-06-30T10:42:02Z","snapshot_observed_at":"2026-08-07T09:27:36.420559Z","submitted_at":"2020-06-30T10:42:02Z","title":"GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding","version":1},"cited_work":{"arxiv_id":"2006.16668","doi":"10.48550/arxiv.2006.16668","metadata_source":"pith","pith_arxiv_id":"2006.16668","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding","venue":"cs.CL","work_id":"52b3c9a6-2a27-45a7-ba2b-ebe4b5bb5a5f","year":2020},"citing_paper":{"arxiv_id":"2605.06374","last_updated":"2026-05-11T13:11:57Z","snapshot_observed_at":"2026-07-06T23:18:51.157048Z","submitted_at":"2026-05-07T14:52:54Z","title":"ResiHP: Taming LLM Training Failures with Dynamic Hybrid Parallelism","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-12T04:01:42.265205Z"},"links":{"cited_paper":"/paper/2006.16668","citing_paper":"/paper/2605.06374"},"observation_digest":"sha256:37dd62fdad136e03105d2fddc9bd0508d75820813f9fccba05a0db3f7e02dcce","observation_id":"e472f29c-22d5-4084-ad54-144b92a72eae","resolution":{"observed_at":"2026-05-12T06:41:44.903290Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1145/3769802","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":null,"venue":"Proceedings of the ACM on Management of Data","work_id":"b2c70c49-6859-4614-ab75-5e899174a4a9","year":2025},"citing_paper":{"arxiv_id":"2605.06374","last_updated":"2026-05-11T13:11:57Z","snapshot_observed_at":"2026-07-06T23:18:51.157048Z","submitted_at":"2026-05-07T14:52:54Z","title":"ResiHP: Taming LLM Training Failures with Dynamic Hybrid Parallelism","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-12T04:01:42.265205Z"},"links":{"citing_paper":"/paper/2605.06374"},"observation_digest":"sha256:69a72833d5436aac0040f8a4feb342ee3369497610e77e0c3242e0b5217c7bfe","observation_id":"9a164a99-2b3d-4125-af43-3f3f1abbda66","resolution":{"observed_at":"2026-05-12T04:11:22.408097Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.05713","last_updated":"2025-05-12T17:52:35Z","snapshot_observed_at":"2026-07-06T21:21:14.988474Z","submitted_at":"2025-05-09T01:24:24Z","title":"Understanding Stragglers in Large Model Training Using What-if Analysis","version":2},"cited_work":{"arxiv_id":"2505.05713","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.05713","snapshot_observed_at":"2026-07-01T13:35:46.651338Z","title":"Understanding stragglers in large model training using what-if analysis","venue":null,"work_id":"d6b07ca0-b548-45db-bd5f-8733d18bd11a","year":2025},"citing_paper":{"arxiv_id":"2605.06374","last_updated":"2026-05-11T13:11:57Z","snapshot_observed_at":"2026-07-06T23:18:51.157048Z","submitted_at":"2026-05-07T14:52:54Z","title":"ResiHP: Taming LLM Training Failures with Dynamic Hybrid Parallelism","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-12T04:01:42.265205Z"},"links":{"cited_paper":"/paper/2505.05713","citing_paper":"/paper/2605.06374"},"observation_digest":"sha256:a58d6bbf9ac810ddc21d684bb9d5849dbccc0093033fbbb1ffc1381929afd854","observation_id":"e8ac1c2b-a3a3-4685-999a-f0e076821a8b","resolution":{"observed_at":"2026-05-12T06:41:45.015153Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"0db633b6-86d2-46ef-963a-d50d48b57796","year":2024},"citing_paper":{"arxiv_id":"2605.06374","last_updated":"2026-05-11T13:11:57Z","snapshot_observed_at":"2026-07-06T23:18:51.157048Z","submitted_at":"2026-05-07T14:52:54Z","title":"ResiHP: Taming LLM Training Failures with Dynamic Hybrid Parallelism","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-12T04:01:42.265205Z"},"links":{"citing_paper":"/paper/2605.06374"},"observation_digest":"sha256:3a04f76cd15d005a3e0b5c0eada075a04a747fe600d0e8962c51671d42a1bcd3","observation_id":"52b6e005-c0eb-4ab9-b9f5-2a263743aed9","resolution":{"observed_at":"2026-05-12T17:06:42.609257Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"90014f84-d55a-4ac0-a35c-12746705935d","year":null},"citing_paper":{"arxiv_id":"2605.06374","last_updated":"2026-05-11T13:11:57Z","snapshot_observed_at":"2026-07-06T23:18:51.157048Z","submitted_at":"2026-05-07T14:52:54Z","title":"ResiHP: Taming LLM Training Failures with Dynamic Hybrid Parallelism","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-12T04:01:42.265205Z"},"links":{"citing_paper":"/paper/2605.06374"},"observation_digest":"sha256:fec88cd3a8b740dee16118d7ac2be059fb08c81ecabd207f9e936fbc2696ef6d","observation_id":"f1bc1880-d36d-49fb-a4d9-ee83049632db","resolution":{"observed_at":"2026-05-12T17:06:42.651087Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In Proceedings of the 21st USENIX Conference on File and Storage Technologies(Santa Clara, CA, USA)(FAST’23)","venue":null,"work_id":"706e32a0-c9ec-46a3-ac3f-81bf6d8de341","year":null},"citing_paper":{"arxiv_id":"2605.06374","last_updated":"2026-05-11T13:11:57Z","snapshot_observed_at":"2026-07-06T23:18:51.157048Z","submitted_at":"2026-05-07T14:52:54Z","title":"ResiHP: Taming LLM Training Failures with Dynamic Hybrid Parallelism","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-12T04:01:42.265205Z"},"links":{"citing_paper":"/paper/2605.06374"},"observation_digest":"sha256:a60c47619a39d2f8eebe5199aa0d88e6295c10de00c3e12a5593637eafdd12ee","observation_id":"f71fb791-f5cf-46dc-b3ed-a59e587a100e","resolution":{"observed_at":"2026-05-12T17:06:42.607412Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"bbce631a-bcb7-4cab-9b31-dc7e6bad53bc","year":2025},"citing_paper":{"arxiv_id":"2605.06374","last_updated":"2026-05-11T13:11:57Z","snapshot_observed_at":"2026-07-06T23:18:51.157048Z","submitted_at":"2026-05-07T14:52:54Z","title":"ResiHP: Taming LLM Training Failures with Dynamic Hybrid Parallelism","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-12T04:01:42.265205Z"},"links":{"citing_paper":"/paper/2605.06374"},"observation_digest":"sha256:8bcaecf209b29646fc554bd53228f87c7d721f0ee8e6069dabfccff9e55d0b4c","observation_id":"986b2d83-1b70-4854-8f9e-5ab5954b1eed","resolution":{"observed_at":"2026-05-12T17:06:42.601127Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"570623cf-e1ee-42f9-a7ff-105a79d6edae","year":2019},"citing_paper":{"arxiv_id":"2605.06374","last_updated":"2026-05-11T13:11:57Z","snapshot_observed_at":"2026-07-06T23:18:51.157048Z","submitted_at":"2026-05-07T14:52:54Z","title":"ResiHP: Taming LLM Training Failures with Dynamic Hybrid Parallelism","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-12T04:01:42.265205Z"},"links":{"citing_paper":"/paper/2605.06374"},"observation_digest":"sha256:3e734fa48c75e21dd9004130c6b26fc338911432b17a6aa71a0ce00637917ca4","observation_id":"62ac62db-9df5-42da-b477-510c14c3c00a","resolution":{"observed_at":"2026-05-12T17:06:42.642703Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"8817.347620","doi":"10.1145/3458817.3476205","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proceedings of the International Conference for High Performance Computing, Networking, Storage and Analysis , articleno =","venue":null,"work_id":"65666e92-1679-4e6b-831b-29afb00b2254","year":2021},"citing_paper":{"arxiv_id":"2605.06374","last_updated":"2026-05-11T13:11:57Z","snapshot_observed_at":"2026-07-06T23:18:51.157048Z","submitted_at":"2026-05-07T14:52:54Z","title":"ResiHP: Taming LLM Training Failures with Dynamic Hybrid Parallelism","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-12T04:01:42.265205Z"},"links":{"citing_paper":"/paper/2605.06374"},"observation_digest":"sha256:73899ceab5017ccda910d09b96f4d1832e045cb8237ec01d4df470527778fac8","observation_id":"3097e593-810f-4c70-a281-ff953f4c8eb4","resolution":{"observed_at":"2026-05-12T04:11:22.402864Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-19T23:52:07.370374+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T23:52:07.370374+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":"2303.08774","doi":"10.1002/tea.20265","metadata_source":"pith","pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4 Technical Report","venue":"cs.CL","work_id":"b928e041-6991-4c08-8c81-0359e4097c7b","year":2023},"citing_paper":{"arxiv_id":"2605.06374","last_updated":"2026-05-11T13:11:57Z","snapshot_observed_at":"2026-07-06T23:18:51.157048Z","submitted_at":"2026-05-07T14:52:54Z","title":"ResiHP: Taming LLM Training Failures with Dynamic Hybrid Parallelism","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-12T04:01:42.265205Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2605.06374"},"observation_digest":"sha256:f650a2621c1abc55464d0f51abb8b7af104a9932b67844f7672000edf3a0ab0d","observation_id":"9554db37-893b-4973-9e16-9ed1b0a9f82f","resolution":{"observed_at":"2026-05-12T06:41:45.031808Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"deaf76e0-3eb1-4d2b-9d0e-d40174854716","year":2019},"citing_paper":{"arxiv_id":"2605.06374","last_updated":"2026-05-11T13:11:57Z","snapshot_observed_at":"2026-07-06T23:18:51.157048Z","submitted_at":"2026-05-07T14:52:54Z","title":"ResiHP: Taming LLM Training Failures with Dynamic Hybrid Parallelism","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-12T04:01:42.265205Z"},"links":{"citing_paper":"/paper/2605.06374"},"observation_digest":"sha256:0e27b2554be6910bd2007196933fa25a560c0cf44ce0c56c6a61ed25167c172c","observation_id":"d00ee5ca-9901-4322-8b6c-76c14cc6f3b3","resolution":{"observed_at":"2026-05-12T17:06:42.631811Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"f65561ab-ea82-4b43-9e67-78cace5049cf","year":2024},"citing_paper":{"arxiv_id":"2605.06374","last_updated":"2026-05-11T13:11:57Z","snapshot_observed_at":"2026-07-06T23:18:51.157048Z","submitted_at":"2026-05-07T14:52:54Z","title":"ResiHP: Taming LLM Training Failures with Dynamic Hybrid Parallelism","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-12T04:01:42.265205Z"},"links":{"citing_paper":"/paper/2605.06374"},"observation_digest":"sha256:a88b4d21d26ac4870d0b07e580be5fff8a6a42826067a74e69424cf2cb97c04a","observation_id":"5031289f-d905-42df-ab91-89535e82d3fb","resolution":{"observed_at":"2026-05-12T17:06:42.647121Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":"1909.08053","doi":"10.48550/arxiv.1909.08053","metadata_source":"pith","pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","venue":"cs.CL","work_id":"c888e6d1-0b1d-43d6-9ef5-f0912a0efa1b","year":2019},"citing_paper":{"arxiv_id":"2605.06374","last_updated":"2026-05-11T13:11:57Z","snapshot_observed_at":"2026-07-06T23:18:51.157048Z","submitted_at":"2026-05-07T14:52:54Z","title":"ResiHP: Taming LLM Training Failures with Dynamic Hybrid Parallelism","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-12T04:01:42.265205Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2605.06374"},"observation_digest":"sha256:797d85596e6b5210de02c47e97eab05a515ce194bee2330008d9324b02d4e406","observation_id":"7024e6b4-6287-4ad2-abdc-514f7e67da16","resolution":{"observed_at":"2026-05-12T06:41:45.072097Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:33.392193+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:33.392193+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"26abb074-26fb-495b-9333-75b5b350b2d8","year":2025},"citing_paper":{"arxiv_id":"2605.06374","last_updated":"2026-05-11T13:11:57Z","snapshot_observed_at":"2026-07-06T23:18:51.157048Z","submitted_at":"2026-05-07T14:52:54Z","title":"ResiHP: Taming LLM Training Failures with Dynamic Hybrid Parallelism","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-12T04:01:42.265205Z"},"links":{"citing_paper":"/paper/2605.06374"},"observation_digest":"sha256:87243c5807808c5224f78cabd5e8349f2bb21022cd0d19443cf9d2876b96e55d","observation_id":"e21b24ad-1ba5-411a-a238-2c75e576d1c8","resolution":{"observed_at":"2026-05-12T17:06:42.597914Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"d9204d31-0a05-4cdf-81ac-adeded740fb7","year":2023},"citing_paper":{"arxiv_id":"2605.06374","last_updated":"2026-05-11T13:11:57Z","snapshot_observed_at":"2026-07-06T23:18:51.157048Z","submitted_at":"2026-05-07T14:52:54Z","title":"ResiHP: Taming LLM Training Failures with Dynamic Hybrid Parallelism","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-12T04:01:42.265205Z"},"links":{"citing_paper":"/paper/2605.06374"},"observation_digest":"sha256:1ba13b909e657bad7ed3c4a5637999db431f9d1b2f59964c9d20f81f6b22770e","observation_id":"b39d1908-ed25-4e38-9fb6-8a6e90cf8b48","resolution":{"observed_at":"2026-05-12T17:06:42.629733Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-02T11:57:18.735747Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":"2307.09288","doi":"10.24963/ijcai.2025/706","metadata_source":"pith","pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","venue":"cs.CL","work_id":"68a5177f-d644-44c1-bd4f-4e5278c22f5d","year":2023},"citing_paper":{"arxiv_id":"2605.06374","last_updated":"2026-05-11T13:11:57Z","snapshot_observed_at":"2026-07-06T23:18:51.157048Z","submitted_at":"2026-05-07T14:52:54Z","title":"ResiHP: Taming LLM Training Failures with Dynamic Hybrid Parallelism","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-12T04:01:42.265205Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2605.06374"},"observation_digest":"sha256:dee799b94de2b9786542cbe9216184af6df4bd2d4e5b2c068b02ecba7e376361","observation_id":"c9219296-854f-4280-b58c-57d8453a66dd","resolution":{"observed_at":"2026-05-12T06:41:45.109354Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"9173.79181","doi":"10.1145/79173.79181","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"doi: 10.1145/79173.79181","venue":"Communications of the ACM","work_id":"d897d214-b838-4d61-9f63-de1a547c139a","year":1990},"citing_paper":{"arxiv_id":"2605.06374","last_updated":"2026-05-11T13:11:57Z","snapshot_observed_at":"2026-07-06T23:18:51.157048Z","submitted_at":"2026-05-07T14:52:54Z","title":"ResiHP: Taming LLM Training Failures with Dynamic Hybrid Parallelism","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-12T04:01:42.265205Z"},"links":{"citing_paper":"/paper/2605.06374"},"observation_digest":"sha256:9f5bac33912c6cca532842b50b2518760452bdff6961f7e302683b5c432c9bea","observation_id":"b65968e0-aec5-470d-9fb0-4fb231395e41","resolution":{"observed_at":"2026-05-12T04:11:22.413429Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.03762","last_updated":"2023-08-02T00:41:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-06-12T17:57:34Z","title":"Attention Is All You Need","version":7},"cited_work":{"arxiv_id":"1706.03762","doi":"10.1186/s13550-021-00830-6","metadata_source":"pith","pith_arxiv_id":"1706.03762","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Attention Is All You Need","venue":"cs.CL","work_id":"baafb5a2-5272-43bc-932f-09fa9ffe5316","year":2017},"citing_paper":{"arxiv_id":"2605.06374","last_updated":"2026-05-11T13:11:57Z","snapshot_observed_at":"2026-07-06T23:18:51.157048Z","submitted_at":"2026-05-07T14:52:54Z","title":"ResiHP: Taming LLM Training Failures with Dynamic Hybrid Parallelism","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-12T04:01:42.265205Z"},"links":{"cited_paper":"/paper/1706.03762","citing_paper":"/paper/2605.06374"},"observation_digest":"sha256:f1bf9f09112795dc28d37fb34c843070d1906d12a3b0c5fd6d49fe652b0d0e1a","observation_id":"1fef4a67-de75-4956-8dc2-e51ec9266352","resolution":{"observed_at":"2026-05-12T06:41:45.053054Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01523","last_updated":"2025-02-11T07:31:03Z","snapshot_observed_at":"2026-08-06T18:47:46.282219Z","submitted_at":"2024-12-02T14:16:03Z","title":"FlexSP: Accelerating Large Language Model Training via Flexible Sequence Parallelism","version":3},"cited_work":{"arxiv_id":"2412.01523","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.01523","snapshot_observed_at":"2026-06-29T18:43:50.389607Z","title":"Sam Wiseman and Alexander M Rush","venue":null,"work_id":"91f83fa4-65a9-48f0-9391-7b490cd3a2b3","year":2024},"citing_paper":{"arxiv_id":"2605.06374","last_updated":"2026-05-11T13:11:57Z","snapshot_observed_at":"2026-07-06T23:18:51.157048Z","submitted_at":"2026-05-07T14:52:54Z","title":"ResiHP: Taming LLM Training Failures with Dynamic Hybrid Parallelism","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-12T04:01:42.265205Z"},"links":{"cited_paper":"/paper/2412.01523","citing_paper":"/paper/2605.06374"},"observation_digest":"sha256:da922e7ac1ab469271a1d898950d5b193823f7385afeb01abf0cff3e9b2c305f","observation_id":"e2813930-5fe5-48fa-a1b1-2102bc4815ec","resolution":{"observed_at":"2026-05-12T06:41:45.038571Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"7cdf411d-392b-4295-b95c-5d48e97d8c8b","year":2025},"citing_paper":{"arxiv_id":"2605.06374","last_updated":"2026-05-11T13:11:57Z","snapshot_observed_at":"2026-07-06T23:18:51.157048Z","submitted_at":"2026-05-07T14:52:54Z","title":"ResiHP: Taming LLM Training Failures with Dynamic Hybrid Parallelism","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-12T04:01:42.265205Z"},"links":{"citing_paper":"/paper/2605.06374"},"observation_digest":"sha256:9dcfcc025a51bc52b6b815d019ec5fe37af3087f1de481713da38b4797317c07","observation_id":"5859c23a-0a77-4928-8a5c-bc7d4b8232ad","resolution":{"observed_at":"2026-05-12T17:06:42.619216Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.05100","last_updated":"2023-06-27T09:57:58Z","snapshot_observed_at":"2026-08-04T18:56:03.233715Z","submitted_at":"2022-11-09T18:48:09Z","title":"BLOOM: A 176B-Parameter Open-Access Multilingual Language Model","version":4},"cited_work":{"arxiv_id":"2211.05100","doi":"10.48550/arxiv.2211.05100","metadata_source":"pith","pith_arxiv_id":"2211.05100","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"BLOOM: A 176B-Parameter Open-Access Multilingual Language Model","venue":"cs.CL","work_id":"337ba690-f35d-4154-9450-8edf4bc9f488","year":2022},"citing_paper":{"arxiv_id":"2605.06374","last_updated":"2026-05-11T13:11:57Z","snapshot_observed_at":"2026-07-06T23:18:51.157048Z","submitted_at":"2026-05-07T14:52:54Z","title":"ResiHP: Taming LLM Training Failures with Dynamic Hybrid Parallelism","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-12T04:01:42.265205Z"},"links":{"cited_paper":"/paper/2211.05100","citing_paper":"/paper/2605.06374"},"observation_digest":"sha256:e9cacdf17b4b9d787067926a4d07b545145e2b092745ebddac09f409a2033101","observation_id":"80a56e51-9083-4476-bdca-56c44babdd01","resolution":{"observed_at":"2026-05-12T06:41:45.123097Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-25T16:25:57.975024+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T16:25:57.975024+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.19232","last_updated":"2025-04-27T13:18:13Z","snapshot_observed_at":"2026-07-06T21:15:21.546083Z","submitted_at":"2025-04-27T13:18:13Z","title":"Adaptra: Straggler-Resilient Hybrid-Parallel Training with Pipeline Adaptation","version":1},"cited_work":{"arxiv_id":"2504.19232","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.19232","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Adaptra: Straggler-resilient hybrid-parallel training with pipeline adaptation","venue":null,"work_id":"3c2c7c95-5cb4-4c49-993e-a8b00140cc6d","year":2025},"citing_paper":{"arxiv_id":"2605.06374","last_updated":"2026-05-11T13:11:57Z","snapshot_observed_at":"2026-07-06T23:18:51.157048Z","submitted_at":"2026-05-07T14:52:54Z","title":"ResiHP: Taming LLM Training Failures with Dynamic Hybrid Parallelism","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-12T04:01:42.265205Z"},"links":{"cited_paper":"/paper/2504.19232","citing_paper":"/paper/2605.06374"},"observation_digest":"sha256:0a0dd0b5b5d1a0778fdb1ff96f5ead2f213d8d5897909e4fe6a76b5e293511e0","observation_id":"6b6f1df8-4c35-4b50-8767-088c04899e1b","resolution":{"observed_at":"2026-05-12T06:41:44.863146Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2025.{GREYHOUND}: Hunting {Fail-Slows} in {Hybrid-Parallel} Training at Scale","venue":null,"work_id":"e0f82606-dce0-41cd-bdf4-7cb926775878","year":2025},"citing_paper":{"arxiv_id":"2605.06374","last_updated":"2026-05-11T13:11:57Z","snapshot_observed_at":"2026-07-06T23:18:51.157048Z","submitted_at":"2026-05-07T14:52:54Z","title":"ResiHP: Taming LLM Training Failures with Dynamic Hybrid Parallelism","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-12T04:01:42.265205Z"},"links":{"citing_paper":"/paper/2605.06374"},"observation_digest":"sha256:357d32f81e607c3ccd7ac2438b0ea294d06aaac016ba3811ec3d75a5e20ff7d0","observation_id":"06e39b09-e972-4d8c-835c-6b186018ad3c","resolution":{"observed_at":"2026-05-12T17:06:42.644831Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"34c0188c-5535-4c3e-8ed4-e686b2de5ee7","year":2024},"citing_paper":{"arxiv_id":"2605.06374","last_updated":"2026-05-11T13:11:57Z","snapshot_observed_at":"2026-07-06T23:18:51.157048Z","submitted_at":"2026-05-07T14:52:54Z","title":"ResiHP: Taming LLM Training Failures with Dynamic Hybrid Parallelism","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-12T04:01:42.265205Z"},"links":{"citing_paper":"/paper/2605.06374"},"observation_digest":"sha256:e7c0e50978beff1e25a8e3420a332bfa01e405cd62891be7ba133ff9aa99d26a","observation_id":"0705ef04-44cb-4be8-8fce-b425ca4ac340","resolution":{"observed_at":"2026-05-12T17:06:42.640821Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2605.06374","last_updated":"2026-05-11T13:11:57Z","snapshot_observed_at":"2026-07-06T23:18:51.157048Z","submitted_at":"2026-05-07T14:52:54Z","title":"ResiHP: Taming LLM Training Failures with Dynamic Hybrid Parallelism","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-12T04:01:42.265205Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2605.06374"},"observation_digest":"sha256:e688392b16400ce44bde1b702434040813d23ed7cee29784a5160cb09fd2541f","observation_id":"92fa8395-7e95-4708-b584-ddff64799c2a","resolution":{"observed_at":"2026-05-12T06:41:44.871209Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":"2407.10671","doi":"10.18653/v1/2024.naacl-long.246","metadata_source":"pith","pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2 Technical Report","venue":"cs.CL","work_id":"a1857881-ab9b-4b80-9b5f-9ae4b5c2566d","year":2024},"citing_paper":{"arxiv_id":"2605.06374","last_updated":"2026-05-11T13:11:57Z","snapshot_observed_at":"2026-07-06T23:18:51.157048Z","submitted_at":"2026-05-07T14:52:54Z","title":"ResiHP: Taming LLM Training Failures with Dynamic Hybrid Parallelism","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-12T04:01:42.265205Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2605.06374"},"observation_digest":"sha256:e7086431ded7521bff0fc75bdf287b38a6804611642496b75ea2b7a7a1971c5d","observation_id":"bbd496ec-e30f-4906-95ab-9455eda732ca","resolution":{"observed_at":"2026-05-12T06:41:44.876401Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"50fa2a33-ff06-4a4b-a6bf-15d82258c6f9","year":2024},"citing_paper":{"arxiv_id":"2605.06374","last_updated":"2026-05-11T13:11:57Z","snapshot_observed_at":"2026-07-06T23:18:51.157048Z","submitted_at":"2026-05-07T14:52:54Z","title":"ResiHP: Taming LLM Training Failures with Dynamic Hybrid Parallelism","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-12T04:01:42.265205Z"},"links":{"citing_paper":"/paper/2605.06374"},"observation_digest":"sha256:a163096ca73ec1fd38d5bebc66046c2b96033c24d4df41016a78ed04abf79126","observation_id":"30f9a60f-c72d-4a5b-98df-61696b7fbc80","resolution":{"observed_at":"2026-05-12T17:06:42.634041Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-08-06T03:13:37.403059Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":"2205.01068","doi":"10.48550/arxiv.2205.01068","metadata_source":"pith","pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-07-11T03:37:45.880117Z","title":"OPT: Open Pre-trained Transformer Language Models","venue":"cs.CL","work_id":"d7ff3b21-1fff-4cf4-952a-4714e3ef2307","year":2022},"citing_paper":{"arxiv_id":"2605.06374","last_updated":"2026-05-11T13:11:57Z","snapshot_observed_at":"2026-07-06T23:18:51.157048Z","submitted_at":"2026-05-07T14:52:54Z","title":"ResiHP: Taming LLM Training Failures with Dynamic Hybrid Parallelism","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-12T04:01:42.265205Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2605.06374"},"observation_digest":"sha256:a0af8874c8e8beb773612728935dfc95906e7977d69dec2fe39dfaf8b053e40b","observation_id":"1ce9e58f-4d6a-4fe4-ba03-29a7226664db","resolution":{"observed_at":"2026-05-12T06:41:44.893673Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"8f040046-59d3-443f-ab25-068e11e8ea26","year":2024},"citing_paper":{"arxiv_id":"2605.06374","last_updated":"2026-05-11T13:11:57Z","snapshot_observed_at":"2026-07-06T23:18:51.157048Z","submitted_at":"2026-05-07T14:52:54Z","title":"ResiHP: Taming LLM Training Failures with Dynamic Hybrid Parallelism","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-12T04:01:42.265205Z"},"links":{"citing_paper":"/paper/2605.06374"},"observation_digest":"sha256:39a9206cc3b90076570b164356a138eb2ab81e025b6327981ca10352b616166e","observation_id":"245dae69-bb4f-48ef-8a65-fffaa6c46a3f","resolution":{"observed_at":"2026-05-12T17:06:42.636414Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"8958.375047","doi":"10.1145/3718958.3750472","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":null,"venue":null,"work_id":"7b25dd17-cc0e-43a4-bb9d-cdd973473505","year":2025},"citing_paper":{"arxiv_id":"2605.06374","last_updated":"2026-05-11T13:11:57Z","snapshot_observed_at":"2026-07-06T23:18:51.157048Z","submitted_at":"2026-05-07T14:52:54Z","title":"ResiHP: Taming LLM Training Failures with Dynamic Hybrid Parallelism","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-12T04:01:42.265205Z"},"links":{"citing_paper":"/paper/2605.06374"},"observation_digest":"sha256:611de7a08914da7229505a4342670caa5a20f90c27dcc4bbae169754d93cf255","observation_id":"062a0ddd-c2d6-4255-80aa-87d7bc4d697e","resolution":{"observed_at":"2026-05-12T04:11:22.395391Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-13T19:49:33.887547+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T19:49:33.887547+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gonzalez, and Ion Stoica","venue":null,"work_id":"a5c2e90d-bc28-4580-b4f2-540c6b2574c1","year":2022},"citing_paper":{"arxiv_id":"2605.06374","last_updated":"2026-05-11T13:11:57Z","snapshot_observed_at":"2026-07-06T23:18:51.157048Z","submitted_at":"2026-05-07T14:52:54Z","title":"ResiHP: Taming LLM Training Failures with Dynamic Hybrid Parallelism","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-12T04:01:42.265205Z"},"links":{"citing_paper":"/paper/2605.06374"},"observation_digest":"sha256:93a8ef965df934d76c433addc74665c8b0906f5c2b000ba12c4fa7b80c84e3c4","observation_id":"f23cb24a-86ae-41cf-9305-c6c214882f30","resolution":{"observed_at":"2026-05-12T17:06:42.638664Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.06374","last_updated":"2026-05-11T13:11:57Z","latest_version":2,"primary_category":"cs.DC","snapshot_observed_at":"2026-07-06T23:18:51.157048Z","submitted_at":"2026-05-07T14:52:54Z","title":"ResiHP: Taming LLM Training Failures with Dynamic Hybrid Parallelism"},"reference_resolution":{"displayed":58,"state_counts":{"malformed_identifier":0,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":28,"verified_exact":21,"verified_fuzzy":6},"total_outbound_references":58},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 58 of 58 outbound references and 0 inbound Pith citation observations for arXiv:2605.06374."}