{"as_of":"2026-08-17T14:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:54d5c96002c3360d9558d4984ba52e9e4ac0ca2dea0102c33dce164f7c616a00","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:23:57.277715Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.00394/citation-record","integrity":"/paper/2507.00394/integrity","json":"/paper/2507.00394/citation-record.json","paper":"/paper/2507.00394"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:24:03.505145Z","title":null,"venue":null,"work_id":"5fd7ca4f-0617-43a3-8717-28e51470e61b","year":2024},"citing_paper":{"arxiv_id":"2507.00394","last_updated":"2025-07-01T03:11:18Z","snapshot_observed_at":"2026-08-12T17:43:37.021575Z","submitted_at":"2025-07-01T03:11:18Z","title":"HelixPipe: Efficient Distributed Training of Long Sequence Transformers with Attention Parallel Pipeline Parallelism","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:53.692087Z"},"links":{"citing_paper":"/paper/2507.00394"},"observation_digest":"sha256:023b932e2a083d538838f569ca0c88247695ec064ad6618136278bcddd00a142","observation_id":"7e1ce8b1-d90e-4d44-aa5a-9af96869b2d4","resolution":{"observed_at":"2026-08-06T21:24:03.670773Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02954","last_updated":"2024-01-05T18:59:13Z","snapshot_observed_at":"2026-08-14T19:47:04.330126Z","submitted_at":"2024-01-05T18:59:13Z","title":"DeepSeek LLM: Scaling Open-Source Language Models with Longtermism","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02954","snapshot_observed_at":"2026-08-06T21:23:53.746363Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00394","last_updated":"2025-07-01T03:11:18Z","snapshot_observed_at":"2026-08-12T17:43:37.021575Z","submitted_at":"2025-07-01T03:11:18Z","title":"HelixPipe: Efficient Distributed Training of Long Sequence Transformers with Attention Parallel Pipeline Parallelism","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:53.746363Z"},"links":{"cited_paper":"/paper/2401.02954","citing_paper":"/paper/2507.00394"},"observation_digest":"sha256:a0d31d570724713ca6222430bb613c919e68d005ccc3d0fcf06ee06d5735ef39","observation_id":"f03e460f-d1ae-44fa-87fa-24e56ad829d0","resolution":{"observed_at":"2026-08-06T21:23:53.746363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:23:53.811024Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.00394","last_updated":"2025-07-01T03:11:18Z","snapshot_observed_at":"2026-08-12T17:43:37.021575Z","submitted_at":"2025-07-01T03:11:18Z","title":"HelixPipe: Efficient Distributed Training of Long Sequence Transformers with Attention Parallel Pipeline Parallelism","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:53.811024Z"},"links":{"citing_paper":"/paper/2507.00394"},"observation_digest":"sha256:7efc02b006f68f888e650548039bfc60b4b0478ffc9a36bf8d53d158b3ca1e1f","observation_id":"66aefc22-c41f-47d0-bc87-337c72c6d552","resolution":{"observed_at":"2026-08-06T21:23:53.811024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:24:03.185195Z","title":null,"venue":null,"work_id":"d8939d81-0d8d-4bee-8fd2-2629002574ab","year":2022},"citing_paper":{"arxiv_id":"2507.00394","last_updated":"2025-07-01T03:11:18Z","snapshot_observed_at":"2026-08-12T17:43:37.021575Z","submitted_at":"2025-07-01T03:11:18Z","title":"HelixPipe: Efficient Distributed Training of Long Sequence Transformers with Attention Parallel Pipeline Parallelism","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:53.919535Z"},"links":{"citing_paper":"/paper/2507.00394"},"observation_digest":"sha256:d70fccc16e7512dde6336df83041a6faddb17313949e5f93d65d4cc15fd82055","observation_id":"b70e40e5-1bd8-4f25-995e-f354d2900947","resolution":{"observed_at":"2026-08-06T21:24:03.334440Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-06T21:23:53.999056Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00394","last_updated":"2025-07-01T03:11:18Z","snapshot_observed_at":"2026-08-12T17:43:37.021575Z","submitted_at":"2025-07-01T03:11:18Z","title":"HelixPipe: Efficient Distributed Training of Long Sequence Transformers with Attention Parallel Pipeline Parallelism","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:53.999056Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2507.00394"},"observation_digest":"sha256:42c672ddd6540f0d66f5f7894afef06d3e84cb5663279650fdb39a7441d3cd74","observation_id":"21f8fc66-b51f-404f-81b0-df1cb9960068","resolution":{"observed_at":"2026-08-06T21:23:53.999056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T21:23:54.092188Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00394","last_updated":"2025-07-01T03:11:18Z","snapshot_observed_at":"2026-08-12T17:43:37.021575Z","submitted_at":"2025-07-01T03:11:18Z","title":"HelixPipe: Efficient Distributed Training of Long Sequence Transformers with Attention Parallel Pipeline Parallelism","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:54.092188Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2507.00394"},"observation_digest":"sha256:3e75396359e90cf342cdf97f0f86b0e9ad54281f34741001d800f154ef90b488","observation_id":"54decfe8-aaa5-4a55-b2cd-4e8452080815","resolution":{"observed_at":"2026-08-06T21:23:54.092188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:24:02.883689Z","title":null,"venue":null,"work_id":"d3d38d34-5bb4-4076-9211-57714790a830","year":2021},"citing_paper":{"arxiv_id":"2507.00394","last_updated":"2025-07-01T03:11:18Z","snapshot_observed_at":"2026-08-12T17:43:37.021575Z","submitted_at":"2025-07-01T03:11:18Z","title":"HelixPipe: Efficient Distributed Training of Long Sequence Transformers with Attention Parallel Pipeline Parallelism","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:54.176929Z"},"links":{"citing_paper":"/paper/2507.00394"},"observation_digest":"sha256:fa8c36eb4f70731159f84ca0aa12acfc1c4ea9cb35a8d5593872fb16dcb14261","observation_id":"dcb32a89-63da-4874-8717-6f75d9ec2454","resolution":{"observed_at":"2026-08-06T21:24:03.045327Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.07719","last_updated":"2024-07-02T09:03:26Z","snapshot_observed_at":"2026-08-16T13:53:11.380164Z","submitted_at":"2024-05-13T13:08:02Z","title":"USP: A Unified Sequence Parallelism Approach for Long Context Generative AI","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.07719","snapshot_observed_at":"2026-08-06T21:23:54.265899Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00394","last_updated":"2025-07-01T03:11:18Z","snapshot_observed_at":"2026-08-12T17:43:37.021575Z","submitted_at":"2025-07-01T03:11:18Z","title":"HelixPipe: Efficient Distributed Training of Long Sequence Transformers with Attention Parallel Pipeline Parallelism","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:54.265899Z"},"links":{"cited_paper":"/paper/2405.07719","citing_paper":"/paper/2507.00394"},"observation_digest":"sha256:cfba7240eddfc84f17c7dbb3abfcbcf0c125ed084ed32bed0f72a0c11c731537","observation_id":"be9fd903-38b4-4e0a-8481-7b47fc283194","resolution":{"observed_at":"2026-08-06T21:23:54.265899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:24:02.648928Z","title":null,"venue":null,"work_id":"4a1f0f1d-8d75-4bb6-9558-559b033008de","year":2024},"citing_paper":{"arxiv_id":"2507.00394","last_updated":"2025-07-01T03:11:18Z","snapshot_observed_at":"2026-08-12T17:43:37.021575Z","submitted_at":"2025-07-01T03:11:18Z","title":"HelixPipe: Efficient Distributed Training of Long Sequence Transformers with Attention Parallel Pipeline Parallelism","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:54.334328Z"},"links":{"citing_paper":"/paper/2507.00394"},"observation_digest":"sha256:5786802d559313b4816ec94690f142f5ad6c2e5e59b51d61952374c0bbb5df54","observation_id":"3f67d6b1-d963-4268-a4a4-1d4dc9069aeb","resolution":{"observed_at":"2026-08-06T21:24:02.766120Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14196","last_updated":"2024-01-26T09:23:11Z","snapshot_observed_at":"2026-08-06T22:40:28.707813Z","submitted_at":"2024-01-25T14:17:53Z","title":"DeepSeek-Coder: When the Large Language Model Meets Programming -- The Rise of Code Intelligence","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14196","snapshot_observed_at":"2026-08-06T21:23:54.404334Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00394","last_updated":"2025-07-01T03:11:18Z","snapshot_observed_at":"2026-08-12T17:43:37.021575Z","submitted_at":"2025-07-01T03:11:18Z","title":"HelixPipe: Efficient Distributed Training of Long Sequence Transformers with Attention Parallel Pipeline Parallelism","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:54.404334Z"},"links":{"cited_paper":"/paper/2401.14196","citing_paper":"/paper/2507.00394"},"observation_digest":"sha256:3ff14d4a1bf8066463e0667f475f3b7b2ec1c822d5c4cedda6d339a2824d5849","observation_id":"cf242950-5162-4173-b51c-d5953b8efc5d","resolution":{"observed_at":"2026-08-06T21:23:54.404334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:23:54.494880Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.00394","last_updated":"2025-07-01T03:11:18Z","snapshot_observed_at":"2026-08-12T17:43:37.021575Z","submitted_at":"2025-07-01T03:11:18Z","title":"HelixPipe: Efficient Distributed Training of Long Sequence Transformers with Attention Parallel Pipeline Parallelism","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:54.494880Z"},"links":{"citing_paper":"/paper/2507.00394"},"observation_digest":"sha256:7f6d8cb6be31050ebe3b15e756b9231278bf6aa085d7983718183eb5290cf651","observation_id":"3bf1575b-0bec-47a3-ba93-aac7a1855d34","resolution":{"observed_at":"2026-08-06T21:23:54.494880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:24:02.376965Z","title":null,"venue":null,"work_id":"460f1ba1-3d01-45b7-b74f-f7c43ed5f203","year":null},"citing_paper":{"arxiv_id":"2507.00394","last_updated":"2025-07-01T03:11:18Z","snapshot_observed_at":"2026-08-12T17:43:37.021575Z","submitted_at":"2025-07-01T03:11:18Z","title":"HelixPipe: Efficient Distributed Training of Long Sequence Transformers with Attention Parallel Pipeline Parallelism","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:54.569804Z"},"links":{"citing_paper":"/paper/2507.00394"},"observation_digest":"sha256:5c0dd792332b9ef9f812b18a11238a5f29376f46860d1fa6d51d1d6142e6d633","observation_id":"66212a3d-1f92-43db-9a54-34f11a449e39","resolution":{"observed_at":"2026-08-06T21:24:02.501002Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:24:01.830806Z","title":null,"venue":null,"work_id":"1b303398-169b-41ad-b7de-5c945bf21581","year":2023},"citing_paper":{"arxiv_id":"2507.00394","last_updated":"2025-07-01T03:11:18Z","snapshot_observed_at":"2026-08-12T17:43:37.021575Z","submitted_at":"2025-07-01T03:11:18Z","title":"HelixPipe: Efficient Distributed Training of Long Sequence Transformers with Attention Parallel Pipeline Parallelism","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:54.690197Z"},"links":{"citing_paper":"/paper/2507.00394"},"observation_digest":"sha256:b4efcf946262e0beef594b748785d14f8d2b8fd0475b2f2b66c8a9fa5c994d57","observation_id":"7d32cd38-de21-4a71-8530-10df60b90716","resolution":{"observed_at":"2026-08-06T21:24:01.941271Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-17T07:44:10.213698Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-06T21:23:54.753887Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00394","last_updated":"2025-07-01T03:11:18Z","snapshot_observed_at":"2026-08-12T17:43:37.021575Z","submitted_at":"2025-07-01T03:11:18Z","title":"HelixPipe: Efficient Distributed Training of Long Sequence Transformers with Attention Parallel Pipeline Parallelism","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:54.753887Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2507.00394"},"observation_digest":"sha256:efd82aeea533fce5e63180c29985f599cd25cc581606929e858c6a09e4e62054","observation_id":"38e3f04f-ecb9-43ab-82b0-76250608e5e0","resolution":{"observed_at":"2026-08-06T21:23:54.753887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:24:01.487423Z","title":null,"venue":null,"work_id":"7eeeabf8-1491-4430-92cd-4fd35133c424","year":2023},"citing_paper":{"arxiv_id":"2507.00394","last_updated":"2025-07-01T03:11:18Z","snapshot_observed_at":"2026-08-12T17:43:37.021575Z","submitted_at":"2025-07-01T03:11:18Z","title":"HelixPipe: Efficient Distributed Training of Long Sequence Transformers with Attention Parallel Pipeline Parallelism","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:54.870535Z"},"links":{"citing_paper":"/paper/2507.00394"},"observation_digest":"sha256:abdb27182e01398f55409cdb596d175267a76d0118f446da50f370d4ad0e616a","observation_id":"d222a1c7-1200-4e39-b55b-f32c37388b0f","resolution":{"observed_at":"2026-08-06T21:24:01.637962Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:24:01.172525Z","title":null,"venue":null,"work_id":"32b4a389-416a-4ac0-9945-c325a529cbc3","year":2023},"citing_paper":{"arxiv_id":"2507.00394","last_updated":"2025-07-01T03:11:18Z","snapshot_observed_at":"2026-08-12T17:43:37.021575Z","submitted_at":"2025-07-01T03:11:18Z","title":"HelixPipe: Efficient Distributed Training of Long Sequence Transformers with Attention Parallel Pipeline Parallelism","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:54.923264Z"},"links":{"citing_paper":"/paper/2507.00394"},"observation_digest":"sha256:225112e577eee85f9b847d2a7c41a23508374edd6f4b8f3d9de56dbb0bc8df7b","observation_id":"75e023c8-4dbb-472d-8327-ff54db289f5f","resolution":{"observed_at":"2026-08-06T21:24:01.308121Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:24:00.846636Z","title":null,"venue":null,"work_id":"25b033fb-8088-4810-b7ad-f352ed70014d","year":2024},"citing_paper":{"arxiv_id":"2507.00394","last_updated":"2025-07-01T03:11:18Z","snapshot_observed_at":"2026-08-12T17:43:37.021575Z","submitted_at":"2025-07-01T03:11:18Z","title":"HelixPipe: Efficient Distributed Training of Long Sequence Transformers with Attention Parallel Pipeline Parallelism","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:55.008323Z"},"links":{"citing_paper":"/paper/2507.00394"},"observation_digest":"sha256:c0b9bacc172b814280334d24b487172cb33060de9169d04c9d616cdbfd18b09f","observation_id":"3f8a2902-375a-4ecf-8504-336ee7d3c488","resolution":{"observed_at":"2026-08-06T21:24:01.003026Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:24:00.544121Z","title":null,"venue":null,"work_id":"e6dcb2a8-e7b5-47e1-bb9d-25790460f817","year":2021},"citing_paper":{"arxiv_id":"2507.00394","last_updated":"2025-07-01T03:11:18Z","snapshot_observed_at":"2026-08-12T17:43:37.021575Z","submitted_at":"2025-07-01T03:11:18Z","title":"HelixPipe: Efficient Distributed Training of Long Sequence Transformers with Attention Parallel Pipeline Parallelism","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:55.073248Z"},"links":{"citing_paper":"/paper/2507.00394"},"observation_digest":"sha256:bf2f49357c5ee78da8e281f64ccce231a906145fa068894aa3321ffe45edb70e","observation_id":"dba36695-6cf5-4dc5-b602-1174f066fd7a","resolution":{"observed_at":"2026-08-06T21:24:00.700180Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:24:00.203845Z","title":null,"venue":null,"work_id":"090eaa8f-3563-4240-a7e4-9e3b10e32eeb","year":2023},"citing_paper":{"arxiv_id":"2507.00394","last_updated":"2025-07-01T03:11:18Z","snapshot_observed_at":"2026-08-12T17:43:37.021575Z","submitted_at":"2025-07-01T03:11:18Z","title":"HelixPipe: Efficient Distributed Training of Long Sequence Transformers with Attention Parallel Pipeline Parallelism","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:55.160694Z"},"links":{"citing_paper":"/paper/2507.00394"},"observation_digest":"sha256:f4e44b3e66eb041ac00998cb3dca178ed9087f24d3b527106c831722dc823cfc","observation_id":"a13e50ff-8e12-4612-93f3-33d0edf1b02b","resolution":{"observed_at":"2026-08-06T21:24:00.364723Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:23:55.248788Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.00394","last_updated":"2025-07-01T03:11:18Z","snapshot_observed_at":"2026-08-12T17:43:37.021575Z","submitted_at":"2025-07-01T03:11:18Z","title":"HelixPipe: Efficient Distributed Training of Long Sequence Transformers with Attention Parallel Pipeline Parallelism","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:55.248788Z"},"links":{"citing_paper":"/paper/2507.00394"},"observation_digest":"sha256:65c8d90d219d4c38539cdf6b699d0ef64ed93d296f2aec904402855f6751964d","observation_id":"496d1de6-7dbf-4d6d-a431-8506ccc2940e","resolution":{"observed_at":"2026-08-06T21:23:55.248788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:23:59.961591Z","title":null,"venue":null,"work_id":"e4b78c64-c450-4cca-a0e4-701cf6f561af","year":null},"citing_paper":{"arxiv_id":"2507.00394","last_updated":"2025-07-01T03:11:18Z","snapshot_observed_at":"2026-08-12T17:43:37.021575Z","submitted_at":"2025-07-01T03:11:18Z","title":"HelixPipe: Efficient Distributed Training of Long Sequence Transformers with Attention Parallel Pipeline Parallelism","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:55.321069Z"},"links":{"citing_paper":"/paper/2507.00394"},"observation_digest":"sha256:6bef25946e9593ef5bd2552c463d97edc67f454c6a7f829bbe90faad400fb041","observation_id":"e6514cc5-8d59-424b-8b58-da03c8ca28b7","resolution":{"observed_at":"2026-08-06T21:24:00.037916Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-15T17:27:11.980940Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-06T21:23:55.472812Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00394","last_updated":"2025-07-01T03:11:18Z","snapshot_observed_at":"2026-08-12T17:43:37.021575Z","submitted_at":"2025-07-01T03:11:18Z","title":"HelixPipe: Efficient Distributed Training of Long Sequence Transformers with Attention Parallel Pipeline Parallelism","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:55.472812Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2507.00394"},"observation_digest":"sha256:a76c95547693a4b0f5cd4046334e063c89bd9fc5541cc2a44f4dd4439f30bf51","observation_id":"129cf0d0-9a86-4868-a4c7-63d8842fdc76","resolution":{"observed_at":"2026-08-06T21:23:55.472812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01889","last_updated":"2023-11-27T06:38:47Z","snapshot_observed_at":"2026-08-14T10:14:18.862721Z","submitted_at":"2023-10-03T08:44:50Z","title":"Ring Attention with Blockwise Transformers for Near-Infinite Context","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01889","snapshot_observed_at":"2026-08-06T21:23:55.547812Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00394","last_updated":"2025-07-01T03:11:18Z","snapshot_observed_at":"2026-08-12T17:43:37.021575Z","submitted_at":"2025-07-01T03:11:18Z","title":"HelixPipe: Efficient Distributed Training of Long Sequence Transformers with Attention Parallel Pipeline Parallelism","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:55.547812Z"},"links":{"cited_paper":"/paper/2310.01889","citing_paper":"/paper/2507.00394"},"observation_digest":"sha256:6910d7cb668f625bc4390ba79e3ff62f4a24e9781c3e63542f248b77bb6f46e1","observation_id":"7597863a-0a1f-446a-8451-2bcf32160e0c","resolution":{"observed_at":"2026-08-06T21:23:55.547812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:23:59.622928Z","title":null,"venue":null,"work_id":"0d591f71-40e9-42b9-9f16-4a8027e8771d","year":2023},"citing_paper":{"arxiv_id":"2507.00394","last_updated":"2025-07-01T03:11:18Z","snapshot_observed_at":"2026-08-12T17:43:37.021575Z","submitted_at":"2025-07-01T03:11:18Z","title":"HelixPipe: Efficient Distributed Training of Long Sequence Transformers with Attention Parallel Pipeline Parallelism","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:55.658827Z"},"links":{"citing_paper":"/paper/2507.00394"},"observation_digest":"sha256:b6fb47de74e6152684ecb2ca8e4ac352113736ea02eb72d305a9289fca366758","observation_id":"7eb2167d-ce4f-4764-af10-9b5ce2063e66","resolution":{"observed_at":"2026-08-06T21:23:59.686121Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:23:55.772412Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00394","last_updated":"2025-07-01T03:11:18Z","snapshot_observed_at":"2026-08-12T17:43:37.021575Z","submitted_at":"2025-07-01T03:11:18Z","title":"HelixPipe: Efficient Distributed Training of Long Sequence Transformers with Attention Parallel Pipeline Parallelism","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:55.772412Z"},"links":{"citing_paper":"/paper/2507.00394"},"observation_digest":"sha256:8363fe9d780cb4bcf4518e193e464c3cbadbd5a02cc858431d8deff70020a445","observation_id":"25162bd5-444a-425d-af0b-3bf046a04a9a","resolution":{"observed_at":"2026-08-06T21:23:55.772412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:23:55.834829Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00394","last_updated":"2025-07-01T03:11:18Z","snapshot_observed_at":"2026-08-12T17:43:37.021575Z","submitted_at":"2025-07-01T03:11:18Z","title":"HelixPipe: Efficient Distributed Training of Long Sequence Transformers with Attention Parallel Pipeline Parallelism","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:55.834829Z"},"links":{"citing_paper":"/paper/2507.00394"},"observation_digest":"sha256:8105176fd6f3ae36276a8bfe70ce2a28b4e02ef28dc97590559edca1606e2f9c","observation_id":"f93070be-af65-4dea-aca7-a4a0661841af","resolution":{"observed_at":"2026-08-06T21:23:55.834829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:23:56.007833Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.00394","last_updated":"2025-07-01T03:11:18Z","snapshot_observed_at":"2026-08-12T17:43:37.021575Z","submitted_at":"2025-07-01T03:11:18Z","title":"HelixPipe: Efficient Distributed Training of Long Sequence Transformers with Attention Parallel Pipeline Parallelism","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:56.007833Z"},"links":{"citing_paper":"/paper/2507.00394"},"observation_digest":"sha256:96041675c8a86246c9424bc43cbc0ad3a8cd1aa6554bd46ade7dd6953782ac13","observation_id":"435abde4-0717-400b-a9a4-406356bea774","resolution":{"observed_at":"2026-08-06T21:23:56.007833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:23:59.288110Z","title":null,"venue":null,"work_id":"6be6a0cf-7956-429a-a35b-fcb19db9bcb7","year":2025},"citing_paper":{"arxiv_id":"2507.00394","last_updated":"2025-07-01T03:11:18Z","snapshot_observed_at":"2026-08-12T17:43:37.021575Z","submitted_at":"2025-07-01T03:11:18Z","title":"HelixPipe: Efficient Distributed Training of Long Sequence Transformers with Attention Parallel Pipeline Parallelism","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:56.102723Z"},"links":{"citing_paper":"/paper/2507.00394"},"observation_digest":"sha256:cd91a96d560fd1ea348cd0fd2cafd785f8db9ec47449b02468c7861df9dc3ce4","observation_id":"390127d0-7036-452f-8b3b-a56c778b71e1","resolution":{"observed_at":"2026-08-06T21:23:59.356370Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:23:59.070562Z","title":null,"venue":null,"work_id":"6edb13db-9f2a-46c1-9b06-00800afd38fe","year":2025},"citing_paper":{"arxiv_id":"2507.00394","last_updated":"2025-07-01T03:11:18Z","snapshot_observed_at":"2026-08-12T17:43:37.021575Z","submitted_at":"2025-07-01T03:11:18Z","title":"HelixPipe: Efficient Distributed Training of Long Sequence Transformers with Attention Parallel Pipeline Parallelism","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:56.175810Z"},"links":{"citing_paper":"/paper/2507.00394"},"observation_digest":"sha256:44443bbf5dbf0e98922348e58e6d8dddb9f0ad2936156abeeb53642a0c7b08bc","observation_id":"9104f383-fd2f-4ba4-a83a-94871ccb3d13","resolution":{"observed_at":"2026-08-06T21:23:59.160970Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:23:58.885412Z","title":null,"venue":null,"work_id":"dbfa7119-7172-443c-abd2-1f09ff1621ea","year":2022},"citing_paper":{"arxiv_id":"2507.00394","last_updated":"2025-07-01T03:11:18Z","snapshot_observed_at":"2026-08-12T17:43:37.021575Z","submitted_at":"2025-07-01T03:11:18Z","title":"HelixPipe: Efficient Distributed Training of Long Sequence Transformers with Attention Parallel Pipeline Parallelism","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:56.271845Z"},"links":{"citing_paper":"/paper/2507.00394"},"observation_digest":"sha256:ace94c578f527d6b3375f15da0803098557e4e85a4fcbfdaaedd505f3e198b10","observation_id":"e1d62b35-5f9b-4b53-856b-f7595985923a","resolution":{"observed_at":"2026-08-06T21:23:58.981341Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:23:58.693904Z","title":null,"venue":null,"work_id":"e54a0403-8201-48d0-97d1-7176f86ea2b4","year":2024},"citing_paper":{"arxiv_id":"2507.00394","last_updated":"2025-07-01T03:11:18Z","snapshot_observed_at":"2026-08-12T17:43:37.021575Z","submitted_at":"2025-07-01T03:11:18Z","title":"HelixPipe: Efficient Distributed Training of Long Sequence Transformers with Attention Parallel Pipeline Parallelism","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:56.383276Z"},"links":{"citing_paper":"/paper/2507.00394"},"observation_digest":"sha256:dd55b04bf49cfe21d7a58a40b4b915dab57ed4ecd31bceb73d4552235f37e96c","observation_id":"7e56b1ac-78c8-4e80-88a3-a974a0c0f45c","resolution":{"observed_at":"2026-08-06T21:23:58.762835Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:23:56.489085Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.00394","last_updated":"2025-07-01T03:11:18Z","snapshot_observed_at":"2026-08-12T17:43:37.021575Z","submitted_at":"2025-07-01T03:11:18Z","title":"HelixPipe: Efficient Distributed Training of Long Sequence Transformers with Attention Parallel Pipeline Parallelism","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:56.489085Z"},"links":{"citing_paper":"/paper/2507.00394"},"observation_digest":"sha256:acfb3a1c4360f865ce7d66dc4e794719124ce1ea64b57bf5d9bd4bf59d0222c3","observation_id":"ea0ebc7b-b993-49d7-94e8-fc6b8241f4d4","resolution":{"observed_at":"2026-08-06T21:23:56.489085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:23:58.505835Z","title":null,"venue":null,"work_id":"61869307-1c89-480a-888a-dae0a7b90cbb","year":2011},"citing_paper":{"arxiv_id":"2507.00394","last_updated":"2025-07-01T03:11:18Z","snapshot_observed_at":"2026-08-12T17:43:37.021575Z","submitted_at":"2025-07-01T03:11:18Z","title":"HelixPipe: Efficient Distributed Training of Long Sequence Transformers with Attention Parallel Pipeline Parallelism","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:56.580033Z"},"links":{"citing_paper":"/paper/2507.00394"},"observation_digest":"sha256:7938f97fd27dc6b3e8cdb529830b399b9cfe634c0977ed338eec3770c0cbabfe","observation_id":"e7c3f6c6-ac7c-4cf5-9afb-2a483388e045","resolution":{"observed_at":"2026-08-06T21:23:58.592539Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-08-12T10:50:46.357243Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-06T21:23:56.666910Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.00394","last_updated":"2025-07-01T03:11:18Z","snapshot_observed_at":"2026-08-12T17:43:37.021575Z","submitted_at":"2025-07-01T03:11:18Z","title":"HelixPipe: Efficient Distributed Training of Long Sequence Transformers with Attention Parallel Pipeline Parallelism","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:56.666910Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2507.00394"},"observation_digest":"sha256:8a5f506f49eed25c715748c1f04bb87a75c9f47c5b6dd85df8ceb0da7e10e735","observation_id":"cf26fdbf-5e54-4254-a548-6a186cf0043b","resolution":{"observed_at":"2026-08-06T21:23:56.666910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:23:58.352278Z","title":null,"venue":null,"work_id":"ec60c7df-0e91-4aae-9534-2730b437f38f","year":2024},"citing_paper":{"arxiv_id":"2507.00394","last_updated":"2025-07-01T03:11:18Z","snapshot_observed_at":"2026-08-12T17:43:37.021575Z","submitted_at":"2025-07-01T03:11:18Z","title":"HelixPipe: Efficient Distributed Training of Long Sequence Transformers with Attention Parallel Pipeline Parallelism","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:56.734991Z"},"links":{"citing_paper":"/paper/2507.00394"},"observation_digest":"sha256:cb18fc5486722d6e4e056d58a8685a150be3ab373f145a545f47064f3f5eb708","observation_id":"6b19b1a6-196f-4ef6-8832-f7b171ef148f","resolution":{"observed_at":"2026-08-06T21:23:58.414552Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-06T21:23:56.821030Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00394","last_updated":"2025-07-01T03:11:18Z","snapshot_observed_at":"2026-08-12T17:43:37.021575Z","submitted_at":"2025-07-01T03:11:18Z","title":"HelixPipe: Efficient Distributed Training of Long Sequence Transformers with Attention Parallel Pipeline Parallelism","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:56.821030Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2507.00394"},"observation_digest":"sha256:eab9c724e612d7304e72b55be33a7d9774f3f4c1283c9edeca4ca8573829659d","observation_id":"ad5e93b9-61d4-48e6-8908-e607a079ba83","resolution":{"observed_at":"2026-08-06T21:23:56.821030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-06T21:23:56.891434Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00394","last_updated":"2025-07-01T03:11:18Z","snapshot_observed_at":"2026-08-12T17:43:37.021575Z","submitted_at":"2025-07-01T03:11:18Z","title":"HelixPipe: Efficient Distributed Training of Long Sequence Transformers with Attention Parallel Pipeline Parallelism","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:56.891434Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2507.00394"},"observation_digest":"sha256:160a0f43b8744005cc22b3060be74a41063e17b6c7040c3ce44dcc61f4e33ce1","observation_id":"9bf4fe87-cc1b-4a75-bb18-3290431fac3d","resolution":{"observed_at":"2026-08-06T21:23:56.891434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:23:58.215728Z","title":null,"venue":null,"work_id":"2dc2b9ef-3a33-4a50-82ea-d5531fd3c95a","year":2015},"citing_paper":{"arxiv_id":"2507.00394","last_updated":"2025-07-01T03:11:18Z","snapshot_observed_at":"2026-08-12T17:43:37.021575Z","submitted_at":"2025-07-01T03:11:18Z","title":"HelixPipe: Efficient Distributed Training of Long Sequence Transformers with Attention Parallel Pipeline Parallelism","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:56.968369Z"},"links":{"citing_paper":"/paper/2507.00394"},"observation_digest":"sha256:fa1891b8d18d54d52dfa099152ba6d110370d0ff346bf5564776f25246ccbe80","observation_id":"7ed9074f-8eac-4128-bbf6-7a483de12b80","resolution":{"observed_at":"2026-08-06T21:23:58.279592Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:23:58.057663Z","title":null,"venue":null,"work_id":"e8e21c65-7076-42c9-9b3a-89f7ce31f684","year":2020},"citing_paper":{"arxiv_id":"2507.00394","last_updated":"2025-07-01T03:11:18Z","snapshot_observed_at":"2026-08-12T17:43:37.021575Z","submitted_at":"2025-07-01T03:11:18Z","title":"HelixPipe: Efficient Distributed Training of Long Sequence Transformers with Attention Parallel Pipeline Parallelism","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:57.059904Z"},"links":{"citing_paper":"/paper/2507.00394"},"observation_digest":"sha256:11c9bdb8deac21cc77c926e862ca4032eb8ec1512f29aa4a4448fe6c50ba592b","observation_id":"c82eb653-57bb-45e8-9fbc-20fe622ca4fe","resolution":{"observed_at":"2026-08-06T21:23:58.124578Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:23:57.885126Z","title":null,"venue":null,"work_id":"1c46a2f0-00fc-4798-9db5-4d75e2abe5ab","year":2024},"citing_paper":{"arxiv_id":"2507.00394","last_updated":"2025-07-01T03:11:18Z","snapshot_observed_at":"2026-08-12T17:43:37.021575Z","submitted_at":"2025-07-01T03:11:18Z","title":"HelixPipe: Efficient Distributed Training of Long Sequence Transformers with Attention Parallel Pipeline Parallelism","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:57.138196Z"},"links":{"citing_paper":"/paper/2507.00394"},"observation_digest":"sha256:8de08721078ace5b55918eeea2a94eca01b9e3ddd7a35c7332123d526723879d","observation_id":"bc1cfb32-aa57-4df2-9948-297a09d1b946","resolution":{"observed_at":"2026-08-06T21:23:57.976974Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:23:57.697693Z","title":null,"venue":null,"work_id":"63f051dd-6a1e-4c5a-896b-13e0f3c1b18c","year":2024},"citing_paper":{"arxiv_id":"2507.00394","last_updated":"2025-07-01T03:11:18Z","snapshot_observed_at":"2026-08-12T17:43:37.021575Z","submitted_at":"2025-07-01T03:11:18Z","title":"HelixPipe: Efficient Distributed Training of Long Sequence Transformers with Attention Parallel Pipeline Parallelism","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:57.193802Z"},"links":{"citing_paper":"/paper/2507.00394"},"observation_digest":"sha256:4a985ff14d57a068253d75da76b97e529155a0a4e40b891e27f3f19cf536e5dc","observation_id":"8f143952-21da-46b3-a843-a11580c1b94f","resolution":{"observed_at":"2026-08-06T21:23:57.785876Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:23:57.548272Z","title":null,"venue":null,"work_id":"1f53cf53-3feb-4616-9108-62b176234652","year":2022},"citing_paper":{"arxiv_id":"2507.00394","last_updated":"2025-07-01T03:11:18Z","snapshot_observed_at":"2026-08-12T17:43:37.021575Z","submitted_at":"2025-07-01T03:11:18Z","title":"HelixPipe: Efficient Distributed Training of Long Sequence Transformers with Attention Parallel Pipeline Parallelism","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:57.277715Z"},"links":{"citing_paper":"/paper/2507.00394"},"observation_digest":"sha256:5d1b7ef04fd715664c80fa86971a7c36a8c47fbb4ed503407d73fec7b4f1aa2a","observation_id":"e572460a-fb9b-4cdd-80d9-a1e0c7b32e2c","resolution":{"observed_at":"2026-08-06T21:23:57.612096Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:23:59.430053Z","title":"InInternational Conference on Machine Learning","venue":null,"work_id":"7e0a2bc3-6484-4700-a808-2993af5b78da","year":null},"citing_paper":{"arxiv_id":"2507.00394","last_updated":"2025-07-01T03:11:18Z","snapshot_observed_at":"2026-08-12T17:43:37.021575Z","submitted_at":"2025-07-01T03:11:18Z","title":"HelixPipe: Efficient Distributed Training of Long Sequence Transformers with Attention Parallel Pipeline Parallelism","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:55.917433Z"},"links":{"citing_paper":"/paper/2507.00394"},"observation_digest":"sha256:02398b0ecbc7e436deb0b1cd8ee3c1bcf1236ab77846821115eadb0805a14a21","observation_id":"3a94528f-2750-4aff-9239-166fc2f14c28","resolution":{"observed_at":"2026-08-06T21:23:59.523899Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:24:02.064964Z","title":"In Proceedings of the 43rd ACM Symposium on Principles of Distributed Computing","venue":null,"work_id":"1e57f643-7235-471a-81c2-c5cb7d297ae8","year":null},"citing_paper":{"arxiv_id":"2507.00394","last_updated":"2025-07-01T03:11:18Z","snapshot_observed_at":"2026-08-12T17:43:37.021575Z","submitted_at":"2025-07-01T03:11:18Z","title":"HelixPipe: Efficient Distributed Training of Long Sequence Transformers with Attention Parallel Pipeline Parallelism","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:54.633412Z"},"links":{"citing_paper":"/paper/2507.00394"},"observation_digest":"sha256:2eb59bd1f0204ba3cf6b0fac42f77a53ed10f7de44d4b25d18fb445c18dd543d","observation_id":"e8fffe23-9abb-4695-9a38-f20ab03c119e","resolution":{"observed_at":"2026-08-06T21:24:02.251674Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:23:59.769746Z","title":"In Proceedings of the 30th ACM SIGPLAN Annual Symposium on Principles and Practice of Parallel Programming","venue":null,"work_id":"d60d1879-f3a0-4a31-ba2b-1472dccff37c","year":null},"citing_paper":{"arxiv_id":"2507.00394","last_updated":"2025-07-01T03:11:18Z","snapshot_observed_at":"2026-08-12T17:43:37.021575Z","submitted_at":"2025-07-01T03:11:18Z","title":"HelixPipe: Efficient Distributed Training of Long Sequence Transformers with Attention Parallel Pipeline Parallelism","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:55.387069Z"},"links":{"citing_paper":"/paper/2507.00394"},"observation_digest":"sha256:4bf883e25ba19a38160d1b8bf31355bf00a8c3d4ed85ddd42c405434ed4603b7","observation_id":"83645299-c5fe-42fc-b7bc-3a15e5c91e50","resolution":{"observed_at":"2026-08-06T21:23:59.859672Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.00394","last_updated":"2025-07-01T03:11:18Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-12T17:43:37.021575Z","submitted_at":"2025-07-01T03:11:18Z","title":"HelixPipe: Efficient Distributed Training of Long Sequence Transformers with Attention Parallel Pipeline Parallelism"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":42,"verified_exact":0,"verified_fuzzy":3},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 0 inbound Pith citation observations for arXiv:2507.00394."}