{"as_of":"2026-08-18T12:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:59eda300beb1a32a6eb88c87fd875f79709cf8fcacfc04fe3add8c7c8eba8c3d","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":32,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":32,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":32,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":32,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T11:53:33.063209Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":1,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2311.09431","last_updated":"2023-11-15T23:01:02Z","snapshot_observed_at":"2026-08-17T19:29:18.923800Z","submitted_at":"2023-11-15T23:01:02Z","title":"Striped Attention: Faster Ring Attention for Causal Transformers","version":1},"cited_work":{"arxiv_id":"2311.09431","doi":"10.48550/arxiv.2311.09431","metadata_source":"arxiv_reference","pith_arxiv_id":"2311.09431","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Striped attention: Faster ring attention for causal transformers","venue":"arXiv (Cornell University)","work_id":"7cc4e141-1418-4a62-bc6a-4e3270436eec","year":2023},"citing_paper":{"arxiv_id":"2312.06635","last_updated":"2024-08-27T01:27:29Z","snapshot_observed_at":"2026-08-17T21:47:46.144942Z","submitted_at":"2023-12-11T18:51:59Z","title":"Gated Linear Attention Transformers with Hardware-Efficient Training","version":6},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-05-15T01:15:13.991219Z"},"links":{"cited_paper":"/paper/2311.09431","citing_paper":"/paper/2312.06635"},"observation_digest":"sha256:b79e88ee63e2d34a6f5b4d3bc96d05f6666fff17118362e0c147be3e8c9d331d","observation_id":"19e865a1-8439-4196-a980-63f72b256b16","resolution":{"observed_at":"2026-05-15T01:15:14.087284Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09431","last_updated":"2023-11-15T23:01:02Z","snapshot_observed_at":"2026-08-17T19:29:18.923800Z","submitted_at":"2023-11-15T23:01:02Z","title":"Striped Attention: Faster Ring Attention for Causal Transformers","version":1},"cited_work":{"arxiv_id":"2311.09431","doi":"10.48550/arxiv.2311.09431","metadata_source":"arxiv_reference","pith_arxiv_id":"2311.09431","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Striped attention: Faster ring attention for causal transformers","venue":"arXiv (Cornell University)","work_id":"7cc4e141-1418-4a62-bc6a-4e3270436eec","year":2023},"citing_paper":{"arxiv_id":"2402.08268","last_updated":"2025-02-03T21:47:31Z","snapshot_observed_at":"2026-08-14T09:16:47.522119Z","submitted_at":"2024-02-13T07:47:36Z","title":"World Model on Million-Length Video And Language With Blockwise RingAttention","version":4},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-16T06:36:57.165551Z"},"links":{"cited_paper":"/paper/2311.09431","citing_paper":"/paper/2402.08268"},"observation_digest":"sha256:3df7758344c9b145b0f861f79f68135515752a9890e9d046e1d01533bbeac94f","observation_id":"47441c1d-c0c7-4f0b-b054-e6069f9a8e85","resolution":{"observed_at":"2026-05-16T06:36:57.210663Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09431","last_updated":"2023-11-15T23:01:02Z","snapshot_observed_at":"2026-08-17T19:29:18.923800Z","submitted_at":"2023-11-15T23:01:02Z","title":"Striped Attention: Faster Ring Attention for Causal Transformers","version":1},"cited_work":{"arxiv_id":"2311.09431","doi":"10.48550/arxiv.2311.09431","metadata_source":"arxiv_reference","pith_arxiv_id":"2311.09431","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Striped attention: Faster ring attention for causal transformers","venue":"arXiv (Cornell University)","work_id":"7cc4e141-1418-4a62-bc6a-4e3270436eec","year":2023},"citing_paper":{"arxiv_id":"2405.21060","last_updated":"2024-05-31T17:50:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:50:01Z","title":"Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-11T12:16:25.390683Z"},"links":{"cited_paper":"/paper/2311.09431","citing_paper":"/paper/2405.21060"},"observation_digest":"sha256:a1dcb50e218812aae890881894563f1d778cfffb9cdcd94b428adbb06d5aefd8","observation_id":"5adb0167-f8de-4cb1-a868-e75ec101b984","resolution":{"observed_at":"2026-05-11T12:16:25.699945Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09431","last_updated":"2023-11-15T23:01:02Z","snapshot_observed_at":"2026-08-17T19:29:18.923800Z","submitted_at":"2023-11-15T23:01:02Z","title":"Striped Attention: Faster Ring Attention for Causal Transformers","version":1},"cited_work":{"arxiv_id":"2311.09431","doi":"10.48550/arxiv.2311.09431","metadata_source":"arxiv_reference","pith_arxiv_id":"2311.09431","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Striped attention: Faster ring attention for causal transformers","venue":"arXiv (Cornell University)","work_id":"7cc4e141-1418-4a62-bc6a-4e3270436eec","year":2023},"citing_paper":{"arxiv_id":"2407.08608","last_updated":"2024-07-12T22:15:02Z","snapshot_observed_at":"2026-08-16T11:15:38.109255Z","submitted_at":"2024-07-11T15:44:48Z","title":"FlashAttention-3: Fast and Accurate Attention with Asynchrony and Low-precision","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-20T19:45:36.337956Z"},"links":{"cited_paper":"/paper/2311.09431","citing_paper":"/paper/2407.08608"},"observation_digest":"sha256:2af57eb10872fae295e8079015d2cb8545ac1ebf63720702174efa3684e76ea0","observation_id":"0edaa502-2638-4306-af23-19d83fadc09b","resolution":{"observed_at":"2026-05-20T19:45:36.459905Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09431","last_updated":"2023-11-15T23:01:02Z","snapshot_observed_at":"2026-08-17T19:29:18.923800Z","submitted_at":"2023-11-15T23:01:02Z","title":"Striped Attention: Faster Ring Attention for Causal Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.09431","snapshot_observed_at":"2026-08-12T04:24:48.791822Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01523","last_updated":"2025-02-11T07:31:03Z","snapshot_observed_at":"2026-08-15T07:52:28.837243Z","submitted_at":"2024-12-02T14:16:03Z","title":"FlexSP: Accelerating Large Language Model Training via Flexible Sequence Parallelism","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T04:24:48.791822Z"},"links":{"cited_paper":"/paper/2311.09431","citing_paper":"/paper/2412.01523"},"observation_digest":"sha256:c7183b4ead68836037de08324518b2a435097df127479fdf089959b14d11ec54","observation_id":"6f211ab9-c326-409b-8d95-3e4a206842ef","resolution":{"observed_at":"2026-08-12T04:24:48.791822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09431","last_updated":"2023-11-15T23:01:02Z","snapshot_observed_at":"2026-08-17T19:29:18.923800Z","submitted_at":"2023-11-15T23:01:02Z","title":"Striped Attention: Faster Ring Attention for Causal Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.09431","snapshot_observed_at":"2026-08-11T17:50:17.585230Z","title":"Striped attention: Faster ring attention for causal transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08585","last_updated":"2024-12-17T05:40:09Z","snapshot_observed_at":"2026-08-16T04:06:40.628618Z","submitted_at":"2024-12-11T18:03:05Z","title":"TurboAttention: Efficient Attention Approximation For High Throughputs LLMs","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-11T17:50:17.585230Z"},"links":{"cited_paper":"/paper/2311.09431","citing_paper":"/paper/2412.08585"},"observation_digest":"sha256:3e97b7ecc0c8243e074bf0788db4f5e48354245dabb8789fcd1cf16f8bcf2340","observation_id":"6bdd5a1b-c521-4d2b-a238-f346c1343156","resolution":{"observed_at":"2026-08-11T17:50:17.585230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09431","last_updated":"2023-11-15T23:01:02Z","snapshot_observed_at":"2026-08-17T19:29:18.923800Z","submitted_at":"2023-11-15T23:01:02Z","title":"Striped Attention: Faster Ring Attention for Causal Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.09431","snapshot_observed_at":"2026-08-10T23:26:40.892673Z","title":"Striped attention: Faster ring attention for causal transformers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.20501","last_updated":"2024-12-29T15:37:37Z","snapshot_observed_at":"2026-08-17T03:29:07.728545Z","submitted_at":"2024-12-29T15:37:37Z","title":"TokenRing: An Efficient Parallelism Framework for Infinite-Context LLMs via Bidirectional Communication","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T23:26:40.892673Z"},"links":{"cited_paper":"/paper/2311.09431","citing_paper":"/paper/2412.20501"},"observation_digest":"sha256:50a0fa8d3a21342e05fdbd268844f56ba30ffeb371e37d4b9efaf2d7927f1a6d","observation_id":"a5f4dc18-95ea-4a28-9974-68f6d893dfd0","resolution":{"observed_at":"2026-08-10T23:26:40.892673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09431","last_updated":"2023-11-15T23:01:02Z","snapshot_observed_at":"2026-08-17T19:29:18.923800Z","submitted_at":"2023-11-15T23:01:02Z","title":"Striped Attention: Faster Ring Attention for Causal Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.09431","snapshot_observed_at":"2026-08-09T12:23:40.430129Z","title":"Striped attention: Faster ring attention for causal transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02406","last_updated":"2025-05-27T21:46:43Z","snapshot_observed_at":"2026-08-16T23:03:33.076450Z","submitted_at":"2025-02-04T15:24:16Z","title":"LV-XAttn: Distributed Cross-Attention for Long Visual Inputs in Multimodal Large Language Models","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-09T12:23:40.430129Z"},"links":{"cited_paper":"/paper/2311.09431","citing_paper":"/paper/2502.02406"},"observation_digest":"sha256:591e81f5b0f03c29e5b1d2c30b7e8f7f4c6d5a00afdf37cd6ed2a5892a455386","observation_id":"441df307-bd25-4c85-acb1-14b589bc797c","resolution":{"observed_at":"2026-08-09T12:23:40.430129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09431","last_updated":"2023-11-15T23:01:02Z","snapshot_observed_at":"2026-08-17T19:29:18.923800Z","submitted_at":"2023-11-15T23:01:02Z","title":"Striped Attention: Faster Ring Attention for Causal Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.09431","snapshot_observed_at":"2026-08-16T11:53:33.063209Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14519","last_updated":"2025-04-20T07:33:33Z","snapshot_observed_at":"2026-08-18T08:04:32.899868Z","submitted_at":"2025-04-20T07:33:33Z","title":"SlimPipe: Memory-Thrifty and Efficient Pipeline Parallelism for Long-Context LLM Training","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:33.063209Z"},"links":{"cited_paper":"/paper/2311.09431","citing_paper":"/paper/2504.14519"},"observation_digest":"sha256:c63bab50166cd691ddd77ebba171187c51a65fa00fe82ca22350872cfe28f73c","observation_id":"747eacf6-a6bc-42f1-adce-fabdc4395184","resolution":{"observed_at":"2026-08-16T11:53:33.063209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09431","last_updated":"2023-11-15T23:01:02Z","snapshot_observed_at":"2026-08-17T19:29:18.923800Z","submitted_at":"2023-11-15T23:01:02Z","title":"Striped Attention: Faster Ring Attention for Causal Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.09431","snapshot_observed_at":"2026-08-16T11:40:27.576790Z","title":"Striped attention: Faster ring attention for causal transformers.CoRR, abs/2311.09431, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-18T09:07:23.317188Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.576790Z"},"links":{"cited_paper":"/paper/2311.09431","citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:0c3e267a6042ecf4091f3e0048177d3c6bb6fbdad67f2782bb185c6c28397d4d","observation_id":"091c1abf-aee0-4067-8db9-777408e2aedd","resolution":{"observed_at":"2026-08-16T11:40:27.576790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09431","last_updated":"2023-11-15T23:01:02Z","snapshot_observed_at":"2026-08-17T19:29:18.923800Z","submitted_at":"2023-11-15T23:01:02Z","title":"Striped Attention: Faster Ring Attention for Causal Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.09431","snapshot_observed_at":"2026-08-16T05:49:09.697978Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.19720","last_updated":"2025-04-28T12:14:02Z","snapshot_observed_at":"2026-08-17T14:38:27.066872Z","submitted_at":"2025-04-28T12:14:02Z","title":"Taming the Titans: A Survey of Efficient LLM Inference Serving","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-16T05:49:09.697978Z"},"links":{"cited_paper":"/paper/2311.09431","citing_paper":"/paper/2504.19720"},"observation_digest":"sha256:b58ed2d6f72d1a61928ab37dade15239974c9b29f4ceee48b142fed7ce932c9c","observation_id":"0dd6a633-91c9-4e0e-a58a-42cb02ec5a8d","resolution":{"observed_at":"2026-08-16T05:49:09.697978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09431","last_updated":"2023-11-15T23:01:02Z","snapshot_observed_at":"2026-08-17T19:29:18.923800Z","submitted_at":"2023-11-15T23:01:02Z","title":"Striped Attention: Faster Ring Attention for Causal Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.09431","snapshot_observed_at":"2026-08-16T05:32:40.677570Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.20490","last_updated":"2026-07-01T15:34:59Z","snapshot_observed_at":"2026-08-17T18:48:47.116913Z","submitted_at":"2025-04-29T07:27:54Z","title":"Hetu v2: A General and Scalable Deep Learning System with Hierarchical and Heterogeneous Single Program Multiple Data Annotations","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T05:32:40.677570Z"},"links":{"cited_paper":"/paper/2311.09431","citing_paper":"/paper/2504.20490"},"observation_digest":"sha256:e655998a3fa4cfde5f0c182ce7008669c47fe916234ab40dc5e8541bf2bd624b","observation_id":"9100d0d1-f3ee-4ac5-b576-db660990928e","resolution":{"observed_at":"2026-08-16T05:32:40.677570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09431","last_updated":"2023-11-15T23:01:02Z","snapshot_observed_at":"2026-08-17T19:29:18.923800Z","submitted_at":"2023-11-15T23:01:02Z","title":"Striped Attention: Faster Ring Attention for Causal Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.09431","snapshot_observed_at":"2026-08-15T20:05:06.265472Z","title":"Striped atten- tion: Faster ring attention for causal transformers.arXiv preprint arXiv:2311.09431, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13497","last_updated":"2025-06-16T13:54:41Z","snapshot_observed_at":"2026-08-18T05:39:06.774742Z","submitted_at":"2025-06-16T13:54:41Z","title":"DDiT: Dynamic Resource Allocation for Diffusion Transformer Model Serving","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T20:05:06.265472Z"},"links":{"cited_paper":"/paper/2311.09431","citing_paper":"/paper/2506.13497"},"observation_digest":"sha256:581e6d2496f89c48d74f4e2bc6a5b14a541fdcf8c68d11223c02ea512b4861aa","observation_id":"828659ad-2bf4-48ac-892d-6e32b7519cd2","resolution":{"observed_at":"2026-08-15T20:05:06.265472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09431","last_updated":"2023-11-15T23:01:02Z","snapshot_observed_at":"2026-08-17T19:29:18.923800Z","submitted_at":"2023-11-15T23:01:02Z","title":"Striped Attention: Faster Ring Attention for Causal Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.09431","snapshot_observed_at":"2026-08-07T00:30:57.281690Z","title":"Striped attention: Faster ring attention for causal transformers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13996","last_updated":"2025-06-16T20:52:28Z","snapshot_observed_at":"2026-08-14T00:17:32.497393Z","submitted_at":"2025-06-16T20:52:28Z","title":"Arctic Long Sequence Training: Scalable And Efficient Training For Multi-Million Token Sequences","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T00:30:57.281690Z"},"links":{"cited_paper":"/paper/2311.09431","citing_paper":"/paper/2506.13996"},"observation_digest":"sha256:610fdd3c72b4cc323d02668d3fc9d67d0c9c54f2866fdb594d29ed85d1af079e","observation_id":"4cf2c8ee-c34e-4f71-a054-6050612b2b61","resolution":{"observed_at":"2026-08-07T00:30:57.281690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09431","last_updated":"2023-11-15T23:01:02Z","snapshot_observed_at":"2026-08-17T19:29:18.923800Z","submitted_at":"2023-11-15T23:01:02Z","title":"Striped Attention: Faster Ring Attention for Causal Transformers","version":1},"cited_work":{"arxiv_id":"2311.09431","doi":"10.48550/arxiv.2311.09431","metadata_source":"arxiv_reference","pith_arxiv_id":"2311.09431","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Striped attention: Faster ring attention for causal transformers","venue":"arXiv (Cornell University)","work_id":"7cc4e141-1418-4a62-bc6a-4e3270436eec","year":2023},"citing_paper":{"arxiv_id":"2509.21275","last_updated":"2026-04-25T07:48:56Z","snapshot_observed_at":"2026-08-15T02:22:31.205815Z","submitted_at":"2025-09-25T15:01:25Z","title":"InfiniPipe: Elastic Pipeline Parallelism for Efficient Variable-Length Long-Context LLM Training","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-18T14:04:31.017142Z"},"links":{"cited_paper":"/paper/2311.09431","citing_paper":"/paper/2509.21275"},"observation_digest":"sha256:252856f3ba3485cd155b0270a42b91ad7f1c6256a00050a1d8c309318c096043","observation_id":"60063694-1e0a-425f-8e3c-e3a782aa45dc","resolution":{"observed_at":"2026-05-18T14:06:27.320262Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09431","last_updated":"2023-11-15T23:01:02Z","snapshot_observed_at":"2026-08-17T19:29:18.923800Z","submitted_at":"2023-11-15T23:01:02Z","title":"Striped Attention: Faster Ring Attention for Causal Transformers","version":1},"cited_work":{"arxiv_id":"2311.09431","doi":"10.48550/arxiv.2311.09431","metadata_source":"arxiv_reference","pith_arxiv_id":"2311.09431","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Striped attention: Faster ring attention for causal transformers","venue":"arXiv (Cornell University)","work_id":"7cc4e141-1418-4a62-bc6a-4e3270436eec","year":2023},"citing_paper":{"arxiv_id":"2510.18830","last_updated":"2026-05-19T17:27:20Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T17:25:32Z","title":"MTraining: Distributed Dynamic Sparse Attention for Efficient Ultra-Long Context Training","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-21T19:44:04.833504Z"},"links":{"cited_paper":"/paper/2311.09431","citing_paper":"/paper/2510.18830"},"observation_digest":"sha256:a3287f2be5cc8ae561dd5b04d09475228df000780acf4697787677fb54bf45fa","observation_id":"d419d5d6-aaa8-4dda-a17d-4368d07e05c0","resolution":{"observed_at":"2026-05-21T19:44:19.650627Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09431","last_updated":"2023-11-15T23:01:02Z","snapshot_observed_at":"2026-08-17T19:29:18.923800Z","submitted_at":"2023-11-15T23:01:02Z","title":"Striped Attention: Faster Ring Attention for Causal Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.09431","snapshot_observed_at":"2026-08-03T06:51:58.967510Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.21824","last_updated":"2026-01-29T15:10:13Z","snapshot_observed_at":"2026-08-17T08:41:35.303057Z","submitted_at":"2026-01-29T15:10:13Z","title":"DASH: Deterministic Attention Scheduling for High-throughput Reproducible LLM Training","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T06:51:58.967510Z"},"links":{"cited_paper":"/paper/2311.09431","citing_paper":"/paper/2601.21824"},"observation_digest":"sha256:b96aa887275bd6c65872d9ba3d45326d716a4500505780e8a0effcdb8807aaaa","observation_id":"4a38f240-de5f-4dd4-8401-72a530ab8b19","resolution":{"observed_at":"2026-08-03T06:51:58.967510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09431","last_updated":"2023-11-15T23:01:02Z","snapshot_observed_at":"2026-08-17T19:29:18.923800Z","submitted_at":"2023-11-15T23:01:02Z","title":"Striped Attention: Faster Ring Attention for Causal Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.09431","snapshot_observed_at":"2026-08-02T20:59:24.267345Z","title":"Chen, Z., Wu, J., Wang, W., Su, W., Chen, G., Xing, S., Zhong, M., Zhang, Q., Zhu, X., Lu, L., Li, B., Luo, P., Lu, T., Qiao, Y ., and Dai, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.21788","last_updated":"2026-06-08T12:37:51Z","snapshot_observed_at":"2026-08-18T08:39:43.001388Z","submitted_at":"2026-02-25T11:11:53Z","title":"Efficient Scaling of LLM Training with Flexible Context Parallelism","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T20:59:24.267345Z"},"links":{"cited_paper":"/paper/2311.09431","citing_paper":"/paper/2602.21788"},"observation_digest":"sha256:f145698b430a4a978f2b20bbb5b7d7480aeef10b7b2ea27940d680145c9e40f8","observation_id":"8369c83e-4273-4f61-97ee-f9ec7db5fb9b","resolution":{"observed_at":"2026-08-02T20:59:24.267345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09431","last_updated":"2023-11-15T23:01:02Z","snapshot_observed_at":"2026-08-17T19:29:18.923800Z","submitted_at":"2023-11-15T23:01:02Z","title":"Striped Attention: Faster Ring Attention for Causal Transformers","version":1},"cited_work":{"arxiv_id":"2311.09431","doi":"10.48550/arxiv.2311.09431","metadata_source":"arxiv_reference","pith_arxiv_id":"2311.09431","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Striped attention: Faster ring attention for causal transformers","venue":"arXiv (Cornell University)","work_id":"7cc4e141-1418-4a62-bc6a-4e3270436eec","year":2023},"citing_paper":{"arxiv_id":"2603.27960","last_updated":"2026-04-11T06:07:02Z","snapshot_observed_at":"2026-08-11T16:23:12.824554Z","submitted_at":"2026-03-30T02:23:37Z","title":"Towards Efficient Large Vision-Language Models: A Comprehensive Survey on Inference Strategies","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-14T21:40:55.343169Z"},"links":{"cited_paper":"/paper/2311.09431","citing_paper":"/paper/2603.27960"},"observation_digest":"sha256:435e917d73ce559625693ea2527da462610a3562930585894587696020b7ed8a","observation_id":"9f8c18c4-ec94-4b1d-a563-956f55225fb4","resolution":{"observed_at":"2026-05-14T21:43:00.722585Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09431","last_updated":"2023-11-15T23:01:02Z","snapshot_observed_at":"2026-08-17T19:29:18.923800Z","submitted_at":"2023-11-15T23:01:02Z","title":"Striped Attention: Faster Ring Attention for Causal Transformers","version":1},"cited_work":{"arxiv_id":"2311.09431","doi":"10.48550/arxiv.2311.09431","metadata_source":"arxiv_reference","pith_arxiv_id":"2311.09431","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Striped attention: Faster ring attention for causal transformers","venue":"arXiv (Cornell University)","work_id":"7cc4e141-1418-4a62-bc6a-4e3270436eec","year":2023},"citing_paper":{"arxiv_id":"2604.14561","last_updated":"2026-04-21T03:27:38Z","snapshot_observed_at":"2026-08-12T12:48:34.320348Z","submitted_at":"2026-04-16T02:43:06Z","title":"CoCoDiff: Optimizing Collective Communications for Distributed Diffusion Transformer Inference Under Ulysses Sequence Parallelism","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-10T10:23:19.236803Z"},"links":{"cited_paper":"/paper/2311.09431","citing_paper":"/paper/2604.14561"},"observation_digest":"sha256:9a968da93a456217fc6abaf7969c6d4280b562dfc24032a3c8459aad6928b3ec","observation_id":"a2efe191-b917-4261-a5c9-faead9eb34dc","resolution":{"observed_at":"2026-05-10T10:24:20.531274Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09431","last_updated":"2023-11-15T23:01:02Z","snapshot_observed_at":"2026-08-17T19:29:18.923800Z","submitted_at":"2023-11-15T23:01:02Z","title":"Striped Attention: Faster Ring Attention for Causal Transformers","version":1},"cited_work":{"arxiv_id":"2311.09431","doi":"10.48550/arxiv.2311.09431","metadata_source":"arxiv_reference","pith_arxiv_id":"2311.09431","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Striped attention: Faster ring attention for causal transformers","venue":"arXiv (Cornell University)","work_id":"7cc4e141-1418-4a62-bc6a-4e3270436eec","year":2023},"citing_paper":{"arxiv_id":"2605.07569","last_updated":"2026-05-08T10:41:04Z","snapshot_observed_at":"2026-08-17T23:15:04.162719Z","submitted_at":"2026-05-08T10:41:04Z","title":"HexiSeq: Accommodating Long Context Training of LLMs over Heterogeneous Hardware","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-11T03:00:19.355357Z"},"links":{"cited_paper":"/paper/2311.09431","citing_paper":"/paper/2605.07569"},"observation_digest":"sha256:59723c6aa7471605feb355218caf17ed47345b8b612d8a3b28fbcba661551cca","observation_id":"c671cc5d-3024-46e1-b9f4-bd300002b7c1","resolution":{"observed_at":"2026-05-11T03:00:55.656684Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09431","last_updated":"2023-11-15T23:01:02Z","snapshot_observed_at":"2026-08-17T19:29:18.923800Z","submitted_at":"2023-11-15T23:01:02Z","title":"Striped Attention: Faster Ring Attention for Causal Transformers","version":1},"cited_work":{"arxiv_id":"2311.09431","doi":"10.48550/arxiv.2311.09431","metadata_source":"arxiv_reference","pith_arxiv_id":"2311.09431","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Striped attention: Faster ring attention for causal transformers","venue":"arXiv (Cornell University)","work_id":"7cc4e141-1418-4a62-bc6a-4e3270436eec","year":2023},"citing_paper":{"arxiv_id":"2605.08587","last_updated":"2026-05-09T01:07:01Z","snapshot_observed_at":"2026-08-15T01:18:14.451523Z","submitted_at":"2026-05-09T01:07:01Z","title":"Kaczmarz Linear Attention","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-12T01:15:58.330766Z"},"links":{"cited_paper":"/paper/2311.09431","citing_paper":"/paper/2605.08587"},"observation_digest":"sha256:8d9cac3c92736ab2a7298062e8c1110b71015c95f0ada0550966e93219f6945e","observation_id":"ec20bb38-ed73-44bd-b14f-3849e8e7b49c","resolution":{"observed_at":"2026-05-12T08:21:23.166304Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09431","last_updated":"2023-11-15T23:01:02Z","snapshot_observed_at":"2026-08-17T19:29:18.923800Z","submitted_at":"2023-11-15T23:01:02Z","title":"Striped Attention: Faster Ring Attention for Causal Transformers","version":1},"cited_work":{"arxiv_id":"2311.09431","doi":"10.48550/arxiv.2311.09431","metadata_source":"arxiv_reference","pith_arxiv_id":"2311.09431","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Striped attention: Faster ring attention for causal transformers","venue":"arXiv (Cornell University)","work_id":"7cc4e141-1418-4a62-bc6a-4e3270436eec","year":2023},"citing_paper":{"arxiv_id":"2606.10493","last_updated":"2026-06-09T07:17:34Z","snapshot_observed_at":"2026-08-16T07:29:50.978649Z","submitted_at":"2026-06-09T07:17:34Z","title":"Achieving Cloud-Grade SLOs for Local Mixture-of-Experts Inference through CPU-GPU Hybrid Design","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-27T12:06:46.806138Z"},"links":{"cited_paper":"/paper/2311.09431","citing_paper":"/paper/2606.10493"},"observation_digest":"sha256:c3cb96752bdeffc95371f77458a1fd9ad68a2876d0e08948a483c4086f4f5b89","observation_id":"3a744266-4670-4c50-8d2e-c6614c944168","resolution":{"observed_at":"2026-07-03T07:27:44.420530Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09431","last_updated":"2023-11-15T23:01:02Z","snapshot_observed_at":"2026-08-17T19:29:18.923800Z","submitted_at":"2023-11-15T23:01:02Z","title":"Striped Attention: Faster Ring Attention for Causal Transformers","version":1},"cited_work":{"arxiv_id":"2311.09431","doi":"10.48550/arxiv.2311.09431","metadata_source":"arxiv_reference","pith_arxiv_id":"2311.09431","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Striped attention: Faster ring attention for causal transformers","venue":"arXiv (Cornell University)","work_id":"7cc4e141-1418-4a62-bc6a-4e3270436eec","year":2023},"citing_paper":{"arxiv_id":"2606.17059","last_updated":"2026-05-07T15:40:51Z","snapshot_observed_at":"2026-08-14T21:14:29.940633Z","submitted_at":"2026-05-07T15:40:51Z","title":"Towards Distributed Inference of LLMs on a P2P Network","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-06-30T23:13:57.705287Z"},"links":{"cited_paper":"/paper/2311.09431","citing_paper":"/paper/2606.17059"},"observation_digest":"sha256:f7fad66e4f86e9ad234a5d4403fe75f8244c82ae2bc2895e006eccbfbf9008ff","observation_id":"3f95ae7d-bc46-45c3-a17e-399dac150bd6","resolution":{"observed_at":"2026-06-30T23:15:07.942418Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09431","last_updated":"2023-11-15T23:01:02Z","snapshot_observed_at":"2026-08-17T19:29:18.923800Z","submitted_at":"2023-11-15T23:01:02Z","title":"Striped Attention: Faster Ring Attention for Causal Transformers","version":1},"cited_work":{"arxiv_id":"2311.09431","doi":"10.48550/arxiv.2311.09431","metadata_source":"arxiv_reference","pith_arxiv_id":"2311.09431","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Striped attention: Faster ring attention for causal transformers","venue":"arXiv (Cornell University)","work_id":"7cc4e141-1418-4a62-bc6a-4e3270436eec","year":2023},"citing_paper":{"arxiv_id":"2606.22541","last_updated":"2026-06-21T14:57:45Z","snapshot_observed_at":"2026-08-15T02:15:13.395465Z","submitted_at":"2026-06-21T14:57:45Z","title":"ASAP: A Disaggregated and Asynchronous Inference System for MoE Prefill","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-26T09:42:39.573568Z"},"links":{"cited_paper":"/paper/2311.09431","citing_paper":"/paper/2606.22541"},"observation_digest":"sha256:faaf01b5f0c231fd4e55905bfd3c09bb28eb4ff6315b2c81ec0f84096ab89502","observation_id":"7583702a-b018-4649-b582-ea1fa8804ad2","resolution":{"observed_at":"2026-07-04T09:39:46.802503Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09431","last_updated":"2023-11-15T23:01:02Z","snapshot_observed_at":"2026-08-17T19:29:18.923800Z","submitted_at":"2023-11-15T23:01:02Z","title":"Striped Attention: Faster Ring Attention for Causal Transformers","version":1},"cited_work":{"arxiv_id":"2311.09431","doi":"10.48550/arxiv.2311.09431","metadata_source":"arxiv_reference","pith_arxiv_id":"2311.09431","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Striped attention: Faster ring attention for causal transformers","venue":"arXiv (Cornell University)","work_id":"7cc4e141-1418-4a62-bc6a-4e3270436eec","year":2023},"citing_paper":{"arxiv_id":"2607.01701","last_updated":"2026-07-02T04:50:33Z","snapshot_observed_at":"2026-07-07T00:07:13.555571Z","submitted_at":"2026-07-02T04:50:33Z","title":"Arachne: Orchestrating Cascades for Efficient Text-to-Video Model Training","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-03T06:27:48.935774Z"},"links":{"cited_paper":"/paper/2311.09431","citing_paper":"/paper/2607.01701"},"observation_digest":"sha256:13f1853859858c339de85224a09e6fa123a69206d6379570a597d7f911e400fe","observation_id":"3ecc045f-c542-4b29-8ee2-0d29a8121101","resolution":{"observed_at":"2026-07-03T06:37:41.994384Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09431","last_updated":"2023-11-15T23:01:02Z","snapshot_observed_at":"2026-08-17T19:29:18.923800Z","submitted_at":"2023-11-15T23:01:02Z","title":"Striped Attention: Faster Ring Attention for Causal Transformers","version":1},"cited_work":{"arxiv_id":"2311.09431","doi":"10.48550/arxiv.2311.09431","metadata_source":"arxiv_reference","pith_arxiv_id":"2311.09431","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Striped attention: Faster ring attention for causal transformers","venue":"arXiv (Cornell University)","work_id":"7cc4e141-1418-4a62-bc6a-4e3270436eec","year":2023},"citing_paper":{"arxiv_id":"2607.01817","last_updated":"2026-07-02T07:30:53Z","snapshot_observed_at":"2026-08-08T01:33:34.083325Z","submitted_at":"2026-07-02T07:30:53Z","title":"HCMS: Head-Chunked Multi-Stream Pipeline for Communication-Computation Overlap in Long-Sequence Parallel Attention","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-03T06:22:23.985308Z"},"links":{"cited_paper":"/paper/2311.09431","citing_paper":"/paper/2607.01817"},"observation_digest":"sha256:29de16ed2f3385c3274da01bdbaaf88859903318cb452dee75ac1de660a7b891","observation_id":"7fcde856-0cf4-4090-97fe-29b541eb4e23","resolution":{"observed_at":"2026-07-03T06:27:41.858999Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09431","last_updated":"2023-11-15T23:01:02Z","snapshot_observed_at":"2026-08-17T19:29:18.923800Z","submitted_at":"2023-11-15T23:01:02Z","title":"Striped Attention: Faster Ring Attention for Causal Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.09431","snapshot_observed_at":"2026-07-12T09:50:23.266920Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02574","last_updated":"2026-06-30T16:12:40Z","snapshot_observed_at":"2026-08-13T16:31:58.188253Z","submitted_at":"2026-06-30T16:12:40Z","title":"From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-12T09:50:23.266920Z"},"links":{"cited_paper":"/paper/2311.09431","citing_paper":"/paper/2607.02574"},"observation_digest":"sha256:6f9b95029187c2ce379c0352d6dd4da5cc618d6ee781c79719f24b0d12961bb5","observation_id":"1e3b4bab-c379-4bc9-98ad-e1d195f3e73d","resolution":{"observed_at":"2026-07-12T09:50:23.266920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09431","last_updated":"2023-11-15T23:01:02Z","snapshot_observed_at":"2026-08-17T19:29:18.923800Z","submitted_at":"2023-11-15T23:01:02Z","title":"Striped Attention: Faster Ring Attention for Causal Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.09431","snapshot_observed_at":"2026-08-01T17:32:36.816550Z","title":"Brandon, W., Nrusimha, A., Qian, K., Ankner, Z., Jin, T., Song, Z., and Ragan-Kelley, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17644","last_updated":"2026-07-20T07:57:34Z","snapshot_observed_at":"2026-08-17T12:59:56.886335Z","submitted_at":"2026-07-20T07:57:34Z","title":"A Training-Memory Regression in MLA Sequence Parallelism: Why Megatron-Core Forbids Absorption, and LAGA -- a Communication-Efficient Fix","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-01T17:32:36.816550Z"},"links":{"cited_paper":"/paper/2311.09431","citing_paper":"/paper/2607.17644"},"observation_digest":"sha256:ec8dca3b993f1b4ce4dd3e17d5ae5aafb78d0695ffdcd9d666e5d8f9dea898f4","observation_id":"48fc9efd-7438-4d22-9406-373f497c5deb","resolution":{"observed_at":"2026-08-01T17:32:36.816550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09431","last_updated":"2023-11-15T23:01:02Z","snapshot_observed_at":"2026-08-17T19:29:18.923800Z","submitted_at":"2023-11-15T23:01:02Z","title":"Striped Attention: Faster Ring Attention for Causal Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.09431","snapshot_observed_at":"2026-08-01T06:48:43.565950Z","title":"Striped Attention: Faster Ring Attention for Causal Transformers , journal =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21793","last_updated":"2026-07-23T20:20:56Z","snapshot_observed_at":"2026-08-14T22:32:30.695699Z","submitted_at":"2026-07-23T20:20:56Z","title":"QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization","version":1},"reference_index":191,"source":"arxiv_source","source_observed_at":"2026-08-01T06:48:43.565950Z"},"links":{"cited_paper":"/paper/2311.09431","citing_paper":"/paper/2607.21793"},"observation_digest":"sha256:8b074ff5bb53bbf8a1c2ef29ac1608170ab65728a676ecd8dbb6ca12798125f2","observation_id":"6f0bc92b-1dce-4bd6-8387-3c2dacb2ea9f","resolution":{"observed_at":"2026-08-01T06:48:43.565950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09431","last_updated":"2023-11-15T23:01:02Z","snapshot_observed_at":"2026-08-17T19:29:18.923800Z","submitted_at":"2023-11-15T23:01:02Z","title":"Striped Attention: Faster Ring Attention for Causal Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.09431","snapshot_observed_at":"2026-08-01T00:03:06.819097Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23250","last_updated":"2026-07-25T15:21:25Z","snapshot_observed_at":"2026-08-18T07:36:11.076910Z","submitted_at":"2026-07-25T15:21:25Z","title":"Libra: Taming Attention Workload Skew in Long-Context LLM Training with Bounded Sequence Pool","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T00:03:06.819097Z"},"links":{"cited_paper":"/paper/2311.09431","citing_paper":"/paper/2607.23250"},"observation_digest":"sha256:8c940719173e97d127353b3f4ea1c6b6722abcac199c174ce56b6cf5fbd0762a","observation_id":"34d83ea0-6ca3-400e-babc-b547b3e963da","resolution":{"observed_at":"2026-08-01T00:03:06.819097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09431","last_updated":"2023-11-15T23:01:02Z","snapshot_observed_at":"2026-08-17T19:29:18.923800Z","submitted_at":"2023-11-15T23:01:02Z","title":"Striped Attention: Faster Ring Attention for Causal Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.09431","snapshot_observed_at":"2026-08-11T23:12:09.873268Z","title":"Striped attention: Faster ring attention for causal transformers.arXiv preprint arXiv:2311.09431, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09119","last_updated":"2026-08-10T04:53:05Z","snapshot_observed_at":"2026-08-17T09:55:52.567490Z","submitted_at":"2026-08-10T04:53:05Z","title":"Motif 3: Technical Report","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T23:12:09.873268Z"},"links":{"cited_paper":"/paper/2311.09431","citing_paper":"/paper/2608.09119"},"observation_digest":"sha256:c0949f8da9caae1adb04570cccb649afa9298cc58570763c635f77d6cae17a72","observation_id":"199e88d6-ca7d-46ff-9779-2cd69ff64e3f","resolution":{"observed_at":"2026-08-11T23:12:09.873268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2311.09431/citation-record","integrity":"/paper/2311.09431/integrity","json":"/paper/2311.09431/citation-record.json","paper":"/paper/2311.09431"},"outbound":[],"paper":{"arxiv_id":"2311.09431","last_updated":"2023-11-15T23:01:02Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-17T19:29:18.923800Z","submitted_at":"2023-11-15T23:01:02Z","title":"Striped Attention: Faster Ring Attention for Causal Transformers"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 32 inbound Pith citation observations for arXiv:2311.09431."}