{"as_of":"2026-08-08T17:57:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3dc1e300985bec317c521098dbefbf988cb8e8cbe74fb2cb5bff29655a921586","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":25,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":25,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":25,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":25,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:52:55.653397Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T09:39:46.806179Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2105.13120","last_updated":"2022-05-21T06:03:54Z","snapshot_observed_at":"2026-08-07T22:48:10.415434Z","submitted_at":"2021-05-26T13:40:58Z","title":"Sequence Parallelism: Long Sequence Training from System Perspective","version":3},"cited_work":{"arxiv_id":"2105.13120","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2105.13120","snapshot_observed_at":"2026-07-04T09:39:46.806179Z","title":"arXiv preprint arXiv:2105.13120 , year=","venue":null,"work_id":"ed001793-ff39-4794-be7b-212c2a1f4de1","year":2022},"citing_paper":{"arxiv_id":"2311.16867","last_updated":"2023-11-29T19:45:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-28T15:12:47Z","title":"The Falcon Series of Open Language Models","version":2},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-05-16T09:46:09.701440Z"},"links":{"cited_paper":"/paper/2105.13120","citing_paper":"/paper/2311.16867"},"observation_digest":"sha256:5c0c23e4d5f35767aa80bd98ded87672104408f54d8b2a276a484483a1bb4b17","observation_id":"b7f674bf-6ba0-432b-ad68-b49b25746a3f","resolution":{"observed_at":"2026-05-16T09:46:10.164904Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.13120","last_updated":"2022-05-21T06:03:54Z","snapshot_observed_at":"2026-08-07T22:48:10.415434Z","submitted_at":"2021-05-26T13:40:58Z","title":"Sequence Parallelism: Long Sequence Training from System Perspective","version":3},"cited_work":{"arxiv_id":"2105.13120","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2105.13120","snapshot_observed_at":"2026-07-04T09:39:46.806179Z","title":"arXiv preprint arXiv:2105.13120 , year=","venue":null,"work_id":"ed001793-ff39-4794-be7b-212c2a1f4de1","year":2022},"citing_paper":{"arxiv_id":"2402.08268","last_updated":"2025-02-03T21:47:31Z","snapshot_observed_at":"2026-08-05T16:01:06.026395Z","submitted_at":"2024-02-13T07:47:36Z","title":"World Model on Million-Length Video And Language With Blockwise RingAttention","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-16T06:36:57.165551Z"},"links":{"cited_paper":"/paper/2105.13120","citing_paper":"/paper/2402.08268"},"observation_digest":"sha256:b0e973e8e6788ffc403a4213abf898d007d2c52af75750b5805cc3b48c6753fa","observation_id":"03e34ab8-7ec6-42be-a8fa-b3947023d55f","resolution":{"observed_at":"2026-05-16T06:36:57.307966Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.13120","last_updated":"2022-05-21T06:03:54Z","snapshot_observed_at":"2026-08-07T22:48:10.415434Z","submitted_at":"2021-05-26T13:40:58Z","title":"Sequence Parallelism: Long Sequence Training from System Perspective","version":3},"cited_work":{"arxiv_id":"2105.13120","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2105.13120","snapshot_observed_at":"2026-07-04T09:39:46.806179Z","title":"arXiv preprint arXiv:2105.13120 , year=","venue":null,"work_id":"ed001793-ff39-4794-be7b-212c2a1f4de1","year":2022},"citing_paper":{"arxiv_id":"2403.04652","last_updated":"2025-01-21T10:12:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-07T16:52:49Z","title":"Yi: Open Foundation Models by 01.AI","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-13T05:47:27.775529Z"},"links":{"cited_paper":"/paper/2105.13120","citing_paper":"/paper/2403.04652"},"observation_digest":"sha256:8972b04de7943ed8572cfa59fc07824ce7e8be9d3bca4e3d5cb5549bd323aef9","observation_id":"664367ad-fd64-46f2-95fe-9a4d17909af8","resolution":{"observed_at":"2026-05-13T05:47:27.874603Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.13120","last_updated":"2022-05-21T06:03:54Z","snapshot_observed_at":"2026-08-07T22:48:10.415434Z","submitted_at":"2021-05-26T13:40:58Z","title":"Sequence Parallelism: Long Sequence Training from System Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.13120","snapshot_observed_at":"2026-08-07T14:52:55.653397Z","title":"Sequence paral- lelism: Long sequence training from system perspective.arXiv preprint arXiv:2105.13120, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.17315","last_updated":"2026-06-02T22:13:24Z","snapshot_observed_at":"2026-08-07T22:00:02.564609Z","submitted_at":"2025-05-22T22:09:47Z","title":"Longer Context, Deeper Thinking: Uncovering the Role of Long-Context Ability in Reasoning","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:52:55.653397Z"},"links":{"cited_paper":"/paper/2105.13120","citing_paper":"/paper/2505.17315"},"observation_digest":"sha256:d91bd9f8f39a0cd88484c3c2eea3bcc24a57dd9d294b1b7d8107ce33a9b11af2","observation_id":"1c57709c-5045-4694-aebb-90fad6e68c7b","resolution":{"observed_at":"2026-08-07T14:52:55.653397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.13120","last_updated":"2022-05-21T06:03:54Z","snapshot_observed_at":"2026-08-07T22:48:10.415434Z","submitted_at":"2021-05-26T13:40:58Z","title":"Sequence Parallelism: Long Sequence Training from System Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.13120","snapshot_observed_at":"2026-08-07T14:47:55.986399Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.17694","last_updated":"2026-03-28T10:14:51Z","snapshot_observed_at":"2026-08-07T14:40:02.904487Z","submitted_at":"2025-05-23T10:03:28Z","title":"CoDec: Prefix-Shared Decoding Kernel for LLMs","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:47:55.986399Z"},"links":{"cited_paper":"/paper/2105.13120","citing_paper":"/paper/2505.17694"},"observation_digest":"sha256:f76d06ab6b840f158611554917139939330399d230038c5bf89641656b1e1111","observation_id":"519d403c-33f9-416e-a771-6143d673a16c","resolution":{"observed_at":"2026-08-07T14:47:55.986399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.13120","last_updated":"2022-05-21T06:03:54Z","snapshot_observed_at":"2026-08-07T22:48:10.415434Z","submitted_at":"2021-05-26T13:40:58Z","title":"Sequence Parallelism: Long Sequence Training from System Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.13120","snapshot_observed_at":"2026-08-07T14:20:25.288961Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.19293","last_updated":"2026-06-02T22:08:40Z","snapshot_observed_at":"2026-08-07T14:15:05.692688Z","submitted_at":"2025-05-25T19:58:31Z","title":"100-LongBench: Are de facto Long-Context Benchmarks Literally Evaluating Long-Context Ability?","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T14:20:25.288961Z"},"links":{"cited_paper":"/paper/2105.13120","citing_paper":"/paper/2505.19293"},"observation_digest":"sha256:35d0489fd7646fd09c64afaa2876cfffab073b4e6aa42312f212a0833c0bb03a","observation_id":"7b19a446-827a-4ff6-87aa-f8fe4cbc08b9","resolution":{"observed_at":"2026-08-07T14:20:25.288961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.13120","last_updated":"2022-05-21T06:03:54Z","snapshot_observed_at":"2026-08-07T22:48:10.415434Z","submitted_at":"2021-05-26T13:40:58Z","title":"Sequence Parallelism: Long Sequence Training from System Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.13120","snapshot_observed_at":"2026-08-07T11:17:36.333821Z","title":"Sequence paral- lelism: Long sequence training from system perspective.arXiv preprint arXiv:2105.13120, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.03077","last_updated":"2025-06-03T16:54:15Z","snapshot_observed_at":"2026-08-08T08:52:04.200826Z","submitted_at":"2025-06-03T16:54:15Z","title":"StreamBP: Memory-Efficient Exact Backpropagation for Long Sequence Training of LLMs","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T11:17:36.333821Z"},"links":{"cited_paper":"/paper/2105.13120","citing_paper":"/paper/2506.03077"},"observation_digest":"sha256:8d51ba48ad2f35e62440646abf1984dc32a2958b7dcbdf5e73b4d01527f8dea1","observation_id":"8316e377-e9ca-4bba-99fc-99db6a301f91","resolution":{"observed_at":"2026-08-07T11:17:36.333821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.13120","last_updated":"2022-05-21T06:03:54Z","snapshot_observed_at":"2026-08-07T22:48:10.415434Z","submitted_at":"2021-05-26T13:40:58Z","title":"Sequence Parallelism: Long Sequence Training from System Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.13120","snapshot_observed_at":"2026-08-07T10:28:32.085563Z","title":"Sequence paral- lelism: Long sequence training from system perspective","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.05343","last_updated":"2025-06-11T15:48:38Z","snapshot_observed_at":"2026-08-07T16:28:43.172435Z","submitted_at":"2025-06-05T17:59:54Z","title":"ContentV: Efficient Training of Video Generation Models with Limited Compute","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:32.085563Z"},"links":{"cited_paper":"/paper/2105.13120","citing_paper":"/paper/2506.05343"},"observation_digest":"sha256:f688062b5a6ff4e9908cd6497d8bc49204c9721f5ef3e62e21dc2fb0d28f7590","observation_id":"aa75cc33-de9a-4262-beba-b1b0be105839","resolution":{"observed_at":"2026-08-07T10:28:32.085563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.13120","last_updated":"2022-05-21T06:03:54Z","snapshot_observed_at":"2026-08-07T22:48:10.415434Z","submitted_at":"2021-05-26T13:40:58Z","title":"Sequence Parallelism: Long Sequence Training from System Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.13120","snapshot_observed_at":"2026-08-07T06:02:32.922834Z","title":"Sequence parallelism: Making 4d parallelism possible","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.06122","last_updated":"2025-06-06T14:33:56Z","snapshot_observed_at":"2026-08-07T21:55:43.371585Z","submitted_at":"2025-06-06T14:33:56Z","title":"Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:32.922834Z"},"links":{"cited_paper":"/paper/2105.13120","citing_paper":"/paper/2506.06122"},"observation_digest":"sha256:4e0dd02c6d4b388f1171809a1f2bddba2fd95046392b470d43cac9cfa9d7f725","observation_id":"4397b7e9-5a51-4462-97ae-4f0f935b4ab0","resolution":{"observed_at":"2026-08-07T06:02:32.922834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.13120","last_updated":"2022-05-21T06:03:54Z","snapshot_observed_at":"2026-08-07T22:48:10.415434Z","submitted_at":"2021-05-26T13:40:58Z","title":"Sequence Parallelism: Long Sequence Training from System Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.13120","snapshot_observed_at":"2026-08-07T00:30:57.105856Z","title":"Sequence parallelism: Long sequence training from system perspective,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.13996","last_updated":"2025-06-16T20:52:28Z","snapshot_observed_at":"2026-08-07T00:22:45.763989Z","submitted_at":"2025-06-16T20:52:28Z","title":"Arctic Long Sequence Training: Scalable And Efficient Training For Multi-Million Token Sequences","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T00:30:57.105856Z"},"links":{"cited_paper":"/paper/2105.13120","citing_paper":"/paper/2506.13996"},"observation_digest":"sha256:2261b646f992e399f1f5ba1aaa1e94d7f894b11d37876f09af8f47aaf0352a60","observation_id":"9786b61f-a944-441d-8011-a71f08b31f5f","resolution":{"observed_at":"2026-08-07T00:30:57.105856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.13120","last_updated":"2022-05-21T06:03:54Z","snapshot_observed_at":"2026-08-07T22:48:10.415434Z","submitted_at":"2021-05-26T13:40:58Z","title":"Sequence Parallelism: Long Sequence Training from System Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.13120","snapshot_observed_at":"2026-08-06T23:11:08.905826Z","title":"Sequence parallelism: Long sequence training from system perspective.arXiv preprint arXiv:2105.13120,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.19290","last_updated":"2025-06-24T03:53:36Z","snapshot_observed_at":"2026-08-06T23:04:48.970210Z","submitted_at":"2025-06-24T03:53:36Z","title":"Skywork-SWE: Unveiling Data Scaling Laws for Software Engineering in LLMs","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T23:11:08.905826Z"},"links":{"cited_paper":"/paper/2105.13120","citing_paper":"/paper/2506.19290"},"observation_digest":"sha256:bbacb3c2a8a2e3bb3a02c86780ec64014dc66dc3ba862ec06acb36658484c8bc","observation_id":"b5dd0957-cac0-43ba-8316-4e8de9778731","resolution":{"observed_at":"2026-08-06T23:11:08.905826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.13120","last_updated":"2022-05-21T06:03:54Z","snapshot_observed_at":"2026-08-07T22:48:10.415434Z","submitted_at":"2021-05-26T13:40:58Z","title":"Sequence Parallelism: Long Sequence Training from System Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.13120","snapshot_observed_at":"2026-08-05T17:55:11.234042Z","title":"Sequence parallelism: Long sequence training from system perspective","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-05T17:55:04.790166Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:11.234042Z"},"links":{"cited_paper":"/paper/2105.13120","citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:f04a725fdd476f9dff4675d7dd66cf962731011b6d2460f95543f3815062ddb0","observation_id":"dc945350-74c7-40d7-a7fe-22216310527c","resolution":{"observed_at":"2026-08-05T17:55:11.234042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.13120","last_updated":"2022-05-21T06:03:54Z","snapshot_observed_at":"2026-08-07T22:48:10.415434Z","submitted_at":"2021-05-26T13:40:58Z","title":"Sequence Parallelism: Long Sequence Training from System Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.13120","snapshot_observed_at":"2026-08-05T13:52:28.794986Z","title":"Sequence parallelism: Long sequence training from system perspective","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.00217","last_updated":"2025-08-29T20:01:35Z","snapshot_observed_at":"2026-08-05T13:52:27.296960Z","submitted_at":"2025-08-29T20:01:35Z","title":"Learning to Shard: RL for Co-optimizing the Parallelism Degrees and Per-operator Sharding Dimensions in Distributed LLM Inference","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-05T13:52:28.794986Z"},"links":{"cited_paper":"/paper/2105.13120","citing_paper":"/paper/2509.00217"},"observation_digest":"sha256:db67aa8857deef3087cc95f89e8a1a45199c4820d9d212a0735aa7f47b854a55","observation_id":"5b76fa2b-c631-4d1f-91e3-164d2e7593a7","resolution":{"observed_at":"2026-08-05T13:52:28.794986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.13120","last_updated":"2022-05-21T06:03:54Z","snapshot_observed_at":"2026-08-07T22:48:10.415434Z","submitted_at":"2021-05-26T13:40:58Z","title":"Sequence Parallelism: Long Sequence Training from System Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.13120","snapshot_observed_at":"2026-08-04T12:55:10.837066Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.01565","last_updated":"2026-06-18T01:08:24Z","snapshot_observed_at":"2026-08-07T13:00:11.048060Z","submitted_at":"2025-10-02T01:23:32Z","title":"TetriServe: Efficiently Serving Mixed DiT Workloads","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T12:55:10.837066Z"},"links":{"cited_paper":"/paper/2105.13120","citing_paper":"/paper/2510.01565"},"observation_digest":"sha256:c63842acb24806497fff9590a162d6964a781c0226a21059c719938fb6ee3699","observation_id":"547516d7-5037-43eb-a675-17713898ed44","resolution":{"observed_at":"2026-08-04T12:55:10.837066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.13120","last_updated":"2022-05-21T06:03:54Z","snapshot_observed_at":"2026-08-07T22:48:10.415434Z","submitted_at":"2021-05-26T13:40:58Z","title":"Sequence Parallelism: Long Sequence Training from System Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.13120","snapshot_observed_at":"2026-08-02T21:11:50.032377Z","title":"Sequence parallelism: Long sequence training from system perspective, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.21196","last_updated":"2026-07-10T12:36:34Z","snapshot_observed_at":"2026-08-07T08:21:33.678621Z","submitted_at":"2026-02-24T18:54:39Z","title":"Untied Ulysses: Memory-Efficient Context Parallelism via Headwise Chunking","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-02T21:11:50.032377Z"},"links":{"cited_paper":"/paper/2105.13120","citing_paper":"/paper/2602.21196"},"observation_digest":"sha256:ddb69d7bf30757699879e98c4a64e73c99389da0f542b43acb5114db127b215a","observation_id":"0a064b01-f126-40e6-bf92-a8c2d30f1b24","resolution":{"observed_at":"2026-08-02T21:11:50.032377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.13120","last_updated":"2022-05-21T06:03:54Z","snapshot_observed_at":"2026-08-07T22:48:10.415434Z","submitted_at":"2021-05-26T13:40:58Z","title":"Sequence Parallelism: Long Sequence Training from System Perspective","version":3},"cited_work":{"arxiv_id":"2105.13120","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2105.13120","snapshot_observed_at":"2026-07-04T09:39:46.806179Z","title":"arXiv preprint arXiv:2105.13120 , year=","venue":null,"work_id":"ed001793-ff39-4794-be7b-212c2a1f4de1","year":2022},"citing_paper":{"arxiv_id":"2605.05628","last_updated":"2026-05-07T03:29:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-07T03:29:51Z","title":"Towards Compute-Aware In-Switch Computing for LLMs Tensor-Parallelism on Multi-GPU Systems","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-08T04:41:03.457680Z"},"links":{"cited_paper":"/paper/2105.13120","citing_paper":"/paper/2605.05628"},"observation_digest":"sha256:c71171b918a3154f8a1e0b24dd0208d9a8d7ac65e2ea16df3cd331fcc7f66c5a","observation_id":"02222285-4611-4fc1-8a99-ed855fe0cc04","resolution":{"observed_at":"2026-05-11T21:41:14.135198Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.13120","last_updated":"2022-05-21T06:03:54Z","snapshot_observed_at":"2026-08-07T22:48:10.415434Z","submitted_at":"2021-05-26T13:40:58Z","title":"Sequence Parallelism: Long Sequence Training from System Perspective","version":3},"cited_work":{"arxiv_id":"2105.13120","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2105.13120","snapshot_observed_at":"2026-07-04T09:39:46.806179Z","title":"arXiv preprint arXiv:2105.13120 , year=","venue":null,"work_id":"ed001793-ff39-4794-be7b-212c2a1f4de1","year":2022},"citing_paper":{"arxiv_id":"2605.17164","last_updated":"2026-05-19T23:51:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-16T21:28:22Z","title":"Charon: A Unified and Fine-Grained Simulator for Large-Scale LLM Training and Inference","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-21T08:55:31.298030Z"},"links":{"cited_paper":"/paper/2105.13120","citing_paper":"/paper/2605.17164"},"observation_digest":"sha256:fd0d05b60d3bc261e03f565f0a15a6f90ec40420afe405d7f77140e91a622bb5","observation_id":"a43b33c6-db05-495b-975a-439585037437","resolution":{"observed_at":"2026-05-21T08:59:55.770043Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.13120","last_updated":"2022-05-21T06:03:54Z","snapshot_observed_at":"2026-08-07T22:48:10.415434Z","submitted_at":"2021-05-26T13:40:58Z","title":"Sequence Parallelism: Long Sequence Training from System Perspective","version":3},"cited_work":{"arxiv_id":"2105.13120","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2105.13120","snapshot_observed_at":"2026-07-04T09:39:46.806179Z","title":"arXiv preprint arXiv:2105.13120 , year=","venue":null,"work_id":"ed001793-ff39-4794-be7b-212c2a1f4de1","year":2022},"citing_paper":{"arxiv_id":"2605.18710","last_updated":"2026-05-18T17:44:29Z","snapshot_observed_at":"2026-07-06T23:29:33.702647Z","submitted_at":"2026-05-18T17:44:29Z","title":"Mosaic: Towards Efficient Training of Multimodal Models with Spatial Resource Multiplexing","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-20T07:53:11.761843Z"},"links":{"cited_paper":"/paper/2105.13120","citing_paper":"/paper/2605.18710"},"observation_digest":"sha256:6933d56407d919b23039229cbd187ecac78a31057d99d5c4a6c970edcede0b06","observation_id":"442c23a1-c1ce-4b8c-b020-79353d910f77","resolution":{"observed_at":"2026-05-20T07:53:24.750202Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.13120","last_updated":"2022-05-21T06:03:54Z","snapshot_observed_at":"2026-08-07T22:48:10.415434Z","submitted_at":"2021-05-26T13:40:58Z","title":"Sequence Parallelism: Long Sequence Training from System Perspective","version":3},"cited_work":{"arxiv_id":"2105.13120","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2105.13120","snapshot_observed_at":"2026-07-04T09:39:46.806179Z","title":"arXiv preprint arXiv:2105.13120 , year=","venue":null,"work_id":"ed001793-ff39-4794-be7b-212c2a1f4de1","year":2022},"citing_paper":{"arxiv_id":"2606.19989","last_updated":"2026-06-18T09:29:28Z","snapshot_observed_at":"2026-08-02T02:03:02.388345Z","submitted_at":"2026-06-18T09:29:28Z","title":"Online Dynamic Batching with Formal Guarantees for LLM Training","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-26T15:57:18.544274Z"},"links":{"cited_paper":"/paper/2105.13120","citing_paper":"/paper/2606.19989"},"observation_digest":"sha256:0e6cb444bcc41ca8a885c10ee29020e0e51bbaa77a39701cdeb04c4423e14890","observation_id":"9525b37c-6ba3-41ad-81f2-6b08c1687abc","resolution":{"observed_at":"2026-07-04T05:29:35.935578Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.13120","last_updated":"2022-05-21T06:03:54Z","snapshot_observed_at":"2026-08-07T22:48:10.415434Z","submitted_at":"2021-05-26T13:40:58Z","title":"Sequence Parallelism: Long Sequence Training from System Perspective","version":3},"cited_work":{"arxiv_id":"2105.13120","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2105.13120","snapshot_observed_at":"2026-07-04T09:39:46.806179Z","title":"arXiv preprint arXiv:2105.13120 , year=","venue":null,"work_id":"ed001793-ff39-4794-be7b-212c2a1f4de1","year":2022},"citing_paper":{"arxiv_id":"2606.22541","last_updated":"2026-06-21T14:57:45Z","snapshot_observed_at":"2026-08-05T19:10:35.929740Z","submitted_at":"2026-06-21T14:57:45Z","title":"ASAP: A Disaggregated and Asynchronous Inference System for MoE Prefill","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-26T09:42:39.573568Z"},"links":{"cited_paper":"/paper/2105.13120","citing_paper":"/paper/2606.22541"},"observation_digest":"sha256:9c403f596a47661a65978c89dd0548ac80942e59794c04196e3e4e98df304828","observation_id":"a02cb5f7-b5af-431a-a4ad-2b877e49476e","resolution":{"observed_at":"2026-07-04T09:39:46.807624Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.13120","last_updated":"2022-05-21T06:03:54Z","snapshot_observed_at":"2026-08-07T22:48:10.415434Z","submitted_at":"2021-05-26T13:40:58Z","title":"Sequence Parallelism: Long Sequence Training from System Perspective","version":3},"cited_work":{"arxiv_id":"2105.13120","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2105.13120","snapshot_observed_at":"2026-07-04T09:39:46.806179Z","title":"arXiv preprint arXiv:2105.13120 , year=","venue":null,"work_id":"ed001793-ff39-4794-be7b-212c2a1f4de1","year":2022},"citing_paper":{"arxiv_id":"2607.01646","last_updated":"2026-07-06T23:06:49Z","snapshot_observed_at":"2026-08-08T05:43:18.001820Z","submitted_at":"2026-07-02T03:17:58Z","title":"PHOENIX: Resilient LLM Training with Hot-Swapping via Zero-Overhead Checkpoint","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-03T17:26:07.870260Z"},"links":{"cited_paper":"/paper/2105.13120","citing_paper":"/paper/2607.01646"},"observation_digest":"sha256:b94ef50224b8c5446b59c1ac9d30a9304683ce178608ad2aaab192977e831606","observation_id":"69a5c0ea-6441-4a69-8384-16c246a3f958","resolution":{"observed_at":"2026-07-03T17:28:43.956670Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.13120","last_updated":"2022-05-21T06:03:54Z","snapshot_observed_at":"2026-08-07T22:48:10.415434Z","submitted_at":"2021-05-26T13:40:58Z","title":"Sequence Parallelism: Long Sequence Training from System Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.13120","snapshot_observed_at":"2026-07-12T08:40:29.554554Z","title":"Sequence parallelism: Long sequence training from system perspective,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.01646","last_updated":"2026-07-06T23:06:49Z","snapshot_observed_at":"2026-08-08T05:43:18.001820Z","submitted_at":"2026-07-02T03:17:58Z","title":"PHOENIX: Resilient LLM Training with Hot-Swapping via Zero-Overhead Checkpoint","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-12T08:40:29.554554Z"},"links":{"cited_paper":"/paper/2105.13120","citing_paper":"/paper/2607.01646"},"observation_digest":"sha256:6decb35a35717f67ac8ed7722e564b55caacce4583aa342e1ee4502ff02bb140","observation_id":"a648ba3b-41c3-4a22-b4a4-38b97f72cd32","resolution":{"observed_at":"2026-07-12T08:40:29.554554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.13120","last_updated":"2022-05-21T06:03:54Z","snapshot_observed_at":"2026-08-07T22:48:10.415434Z","submitted_at":"2021-05-26T13:40:58Z","title":"Sequence Parallelism: Long Sequence Training from System Perspective","version":3},"cited_work":{"arxiv_id":"2105.13120","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2105.13120","snapshot_observed_at":"2026-07-04T09:39:46.806179Z","title":"arXiv preprint arXiv:2105.13120 , year=","venue":null,"work_id":"ed001793-ff39-4794-be7b-212c2a1f4de1","year":2022},"citing_paper":{"arxiv_id":"2607.01817","last_updated":"2026-07-02T07:30:53Z","snapshot_observed_at":"2026-08-08T01:33:34.083325Z","submitted_at":"2026-07-02T07:30:53Z","title":"HCMS: Head-Chunked Multi-Stream Pipeline for Communication-Computation Overlap in Long-Sequence Parallel Attention","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-03T06:22:23.985308Z"},"links":{"cited_paper":"/paper/2105.13120","citing_paper":"/paper/2607.01817"},"observation_digest":"sha256:8d7ce5dad67740a6fff6867c8992fba4b551ba701c73327ca69b625ee1daea27","observation_id":"f8b4783f-dd2b-4cb4-8f77-fd28935a3bad","resolution":{"observed_at":"2026-07-03T06:27:41.863772Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.13120","last_updated":"2022-05-21T06:03:54Z","snapshot_observed_at":"2026-08-07T22:48:10.415434Z","submitted_at":"2021-05-26T13:40:58Z","title":"Sequence Parallelism: Long Sequence Training from System Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.13120","snapshot_observed_at":"2026-07-12T02:29:52.764344Z","title":"Sequence","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05439","last_updated":"2026-07-03T15:50:24Z","snapshot_observed_at":"2026-07-12T02:29:47.974846Z","submitted_at":"2026-07-03T15:50:24Z","title":"Design-CP: Context Parallelism for Design of Protein Nanoparticles","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-07-12T02:29:52.764344Z"},"links":{"cited_paper":"/paper/2105.13120","citing_paper":"/paper/2607.05439"},"observation_digest":"sha256:92de6d40a42da3d4b03c1c7e0b4ef9bd5f0c1d3ea692ab80da31d5cbdea8ca02","observation_id":"6712b88c-b529-44d7-87b3-51e4c5d5f696","resolution":{"observed_at":"2026-07-12T02:29:52.764344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.13120","last_updated":"2022-05-21T06:03:54Z","snapshot_observed_at":"2026-08-07T22:48:10.415434Z","submitted_at":"2021-05-26T13:40:58Z","title":"Sequence Parallelism: Long Sequence Training from System Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.13120","snapshot_observed_at":"2026-08-01T20:54:14.069087Z","title":"Sequence parallelism: Long sequence training from system perspective,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.16488","last_updated":"2026-07-17T20:27:26Z","snapshot_observed_at":"2026-08-07T14:52:50.399447Z","submitted_at":"2026-07-17T20:27:26Z","title":"Auto-Scaling Heterogeneous Neural Processing Units for Energy and Cost-Efficient LLM Serving","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-01T20:54:14.069087Z"},"links":{"cited_paper":"/paper/2105.13120","citing_paper":"/paper/2607.16488"},"observation_digest":"sha256:ff615f7b4391099a97fc0434d6ffff0d4341e01d0776e9c7601d9b45c69133a9","observation_id":"ad4c00d3-51d0-48fa-ab5b-91bdf8133d7a","resolution":{"observed_at":"2026-08-01T20:54:14.069087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2105.13120/citation-record","integrity":"/paper/2105.13120/integrity","json":"/paper/2105.13120/citation-record.json","paper":"/paper/2105.13120"},"outbound":[],"paper":{"arxiv_id":"2105.13120","last_updated":"2022-05-21T06:03:54Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T22:48:10.415434Z","submitted_at":"2021-05-26T13:40:58Z","title":"Sequence Parallelism: Long Sequence Training from System Perspective"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 25 inbound Pith citation observations for arXiv:2105.13120."}