{"as_of":"2026-08-19T18:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4c8c393963c86178146425dc2c7e6fd0361688844b3a7fb05fc5e298778c07c9","coverage":[{"denominator":15,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":15,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T17:32:37.715125Z","state":"measured"},{"denominator":15,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":15,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.17644/citation-record","integrity":"/paper/2607.17644/integrity","json":"/paper/2607.17644/citation-record.json","paper":"/paper/2607.17644"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.07120","last_updated":"2025-07-07T19:47:24Z","snapshot_observed_at":"2026-08-06T19:23:55.037420Z","submitted_at":"2025-07-07T19:47:24Z","title":"Helix Parallelism: Rethinking Sharding Strategies for Interactive Multi-Million-Token LLM Decoding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.07120","snapshot_observed_at":"2026-08-01T17:32:36.731755Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17644","last_updated":"2026-07-20T07:57:34Z","snapshot_observed_at":"2026-08-17T12:59:56.886335Z","submitted_at":"2026-07-20T07:57:34Z","title":"A Training-Memory Regression in MLA Sequence Parallelism: Why Megatron-Core Forbids Absorption, and LAGA -- a Communication-Efficient Fix","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T17:32:36.731755Z"},"links":{"cited_paper":"/paper/2507.07120","citing_paper":"/paper/2607.17644"},"observation_digest":"sha256:a8a7cfd1670a5ad5421991b40b2f96a8cf814495b74a09fb44b3564ba50ed743","observation_id":"3e40bfb8-68d0-4162-a39f-3ee33752e764","resolution":{"observed_at":"2026-08-01T17:32:36.731755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.07719","last_updated":"2024-07-02T09:03:26Z","snapshot_observed_at":"2026-08-16T13:53:11.380164Z","submitted_at":"2024-05-13T13:08:02Z","title":"USP: A Unified Sequence Parallelism Approach for Long Context Generative AI","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.07719","snapshot_observed_at":"2026-08-01T17:32:37.049832Z","title":"and Zhao, S","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17644","last_updated":"2026-07-20T07:57:34Z","snapshot_observed_at":"2026-08-17T12:59:56.886335Z","submitted_at":"2026-07-20T07:57:34Z","title":"A Training-Memory Regression in MLA Sequence Parallelism: Why Megatron-Core Forbids Absorption, and LAGA -- a Communication-Efficient Fix","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T17:32:37.049832Z"},"links":{"cited_paper":"/paper/2405.07719","citing_paper":"/paper/2607.17644"},"observation_digest":"sha256:c7ea393c0abc34c2cb681e8191958aff611657034d77b13d9718d7e554097426","observation_id":"cda9b7c0-975e-49a7-a44d-c79672a8342d","resolution":{"observed_at":"2026-08-01T17:32:37.049832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.15841","last_updated":"2022-11-29T00:27:08Z","snapshot_observed_at":"2026-08-16T16:12:36.431574Z","submitted_at":"2022-11-29T00:27:08Z","title":"MegaBlocks: Efficient Sparse Training with Mixture-of-Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.15841","snapshot_observed_at":"2026-08-01T17:32:37.115161Z","title":"Gu, D., Sun, P., Hu, Q., Huang, T., Chen, X., Xiong, Y ., Wang, G., Chen, Q., Zhao, S., Fang, J., Wen, Y ., Zhang, T., Jin, X., and Liu, X","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17644","last_updated":"2026-07-20T07:57:34Z","snapshot_observed_at":"2026-08-17T12:59:56.886335Z","submitted_at":"2026-07-20T07:57:34Z","title":"A Training-Memory Regression in MLA Sequence Parallelism: Why Megatron-Core Forbids Absorption, and LAGA -- a Communication-Efficient Fix","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T17:32:37.115161Z"},"links":{"cited_paper":"/paper/2211.15841","citing_paper":"/paper/2607.17644"},"observation_digest":"sha256:5668df09b5307998b325e574dd1882d3afd544dda568c8392c1d9a26026f4f63","observation_id":"fb0b9cf3-8307-4248-9806-c49d1a1b584e","resolution":{"observed_at":"2026-08-01T17:32:37.115161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.03382","last_updated":"2023-06-05T15:05:24Z","snapshot_observed_at":"2026-08-16T16:54:42.644064Z","submitted_at":"2022-06-07T15:20:20Z","title":"Tutel: Adaptive Mixture-of-Experts at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.03382","snapshot_observed_at":"2026-08-01T17:32:37.181249Z","title":"Jacobs, S","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17644","last_updated":"2026-07-20T07:57:34Z","snapshot_observed_at":"2026-08-17T12:59:56.886335Z","submitted_at":"2026-07-20T07:57:34Z","title":"A Training-Memory Regression in MLA Sequence Parallelism: Why Megatron-Core Forbids Absorption, and LAGA -- a Communication-Efficient Fix","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T17:32:37.181249Z"},"links":{"cited_paper":"/paper/2206.03382","citing_paper":"/paper/2607.17644"},"observation_digest":"sha256:174a9dd9ad36b8f58e3f5355e1439f53d8c0563f63baf5a621ed7eac9e14338e","observation_id":"1f5b4d38-2a5a-4c5b-9986-7f2b0dbe516a","resolution":{"observed_at":"2026-08-01T17:32:37.181249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.05198","last_updated":"2022-05-10T22:40:17Z","snapshot_observed_at":"2026-08-19T01:36:16.251515Z","submitted_at":"2022-05-10T22:40:17Z","title":"Reducing Activation Recomputation in Large Transformer Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.05198","snapshot_observed_at":"2026-08-01T17:32:37.263658Z","title":"Li, J., Jiang, Y ., Zhu, Y ., Wang, C., and Xu, H","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17644","last_updated":"2026-07-20T07:57:34Z","snapshot_observed_at":"2026-08-17T12:59:56.886335Z","submitted_at":"2026-07-20T07:57:34Z","title":"A Training-Memory Regression in MLA Sequence Parallelism: Why Megatron-Core Forbids Absorption, and LAGA -- a Communication-Efficient Fix","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T17:32:37.263658Z"},"links":{"cited_paper":"/paper/2205.05198","citing_paper":"/paper/2607.17644"},"observation_digest":"sha256:1364f018d5018818a3088a48b333c67642793562a0312096fa204a1a0e01d6a4","observation_id":"58bacf8a-3c44-477c-ad9a-a7ebad505fcb","resolution":{"observed_at":"2026-08-01T17:32:37.263658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.17223","last_updated":"2024-04-28T21:28:12Z","snapshot_observed_at":"2026-08-16T16:19:49.489519Z","submitted_at":"2022-10-31T11:07:23Z","title":"Accelerating Distributed MoE Training and Inference with Lina","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.17223","snapshot_observed_at":"2026-08-01T17:32:37.332884Z","title":"Liu, H., Zaharia, M., and Abbeel, P","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17644","last_updated":"2026-07-20T07:57:34Z","snapshot_observed_at":"2026-08-17T12:59:56.886335Z","submitted_at":"2026-07-20T07:57:34Z","title":"A Training-Memory Regression in MLA Sequence Parallelism: Why Megatron-Core Forbids Absorption, and LAGA -- a Communication-Efficient Fix","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T17:32:37.332884Z"},"links":{"cited_paper":"/paper/2210.17223","citing_paper":"/paper/2607.17644"},"observation_digest":"sha256:3ef196b06de72e046636e26fb99a1659a3b19214711ee658f9738cff16300915","observation_id":"6dc5e0e5-a6ad-4b3e-9656-cdfaab448c1c","resolution":{"observed_at":"2026-08-01T17:32:37.332884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01889","last_updated":"2023-11-27T06:38:47Z","snapshot_observed_at":"2026-08-14T10:14:18.862721Z","submitted_at":"2023-10-03T08:44:50Z","title":"Ring Attention with Blockwise Transformers for Near-Infinite Context","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01889","snapshot_observed_at":"2026-08-01T17:32:37.392437Z","title":"Liu, S., Peng, H., Zhang, Z., Chen, Z., and Guo, Y","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17644","last_updated":"2026-07-20T07:57:34Z","snapshot_observed_at":"2026-08-17T12:59:56.886335Z","submitted_at":"2026-07-20T07:57:34Z","title":"A Training-Memory Regression in MLA Sequence Parallelism: Why Megatron-Core Forbids Absorption, and LAGA -- a Communication-Efficient Fix","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T17:32:37.392437Z"},"links":{"cited_paper":"/paper/2310.01889","citing_paper":"/paper/2607.17644"},"observation_digest":"sha256:d1c8efc7b276bdf634001b27131a2ea1beeebe324831b570e7c83df0d752fa94","observation_id":"938b3a12-e031-4c54-bedd-6cc931241390","resolution":{"observed_at":"2026-08-01T17:32:37.392437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07563","last_updated":"2025-02-11T14:01:39Z","snapshot_observed_at":"2026-08-17T10:39:26.514643Z","submitted_at":"2025-02-11T14:01:39Z","title":"LASP-2: Rethinking Sequence Parallelism for Linear Attention and Its Hybrid","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.07563","snapshot_observed_at":"2026-08-01T17:32:37.570769Z","title":"Sun, W., Lan, D., Zhong, Y ., Qu, X., and Cheng, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17644","last_updated":"2026-07-20T07:57:34Z","snapshot_observed_at":"2026-08-17T12:59:56.886335Z","submitted_at":"2026-07-20T07:57:34Z","title":"A Training-Memory Regression in MLA Sequence Parallelism: Why Megatron-Core Forbids Absorption, and LAGA -- a Communication-Efficient Fix","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T17:32:37.570769Z"},"links":{"cited_paper":"/paper/2502.07563","citing_paper":"/paper/2607.17644"},"observation_digest":"sha256:95e276c343c9efb098fb095978fd26d8f1c162350a82570b7150b10ddc56b4d8","observation_id":"2967adc6-a89e-4b02-aa21-be8e8d1c471d","resolution":{"observed_at":"2026-08-01T17:32:37.570769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-19T17:54:54.763717Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.15881","snapshot_observed_at":"2026-08-01T17:32:37.642188Z","title":"Inference/decode only","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17644","last_updated":"2026-07-20T07:57:34Z","snapshot_observed_at":"2026-08-17T12:59:56.886335Z","submitted_at":"2026-07-20T07:57:34Z","title":"A Training-Memory Regression in MLA Sequence Parallelism: Why Megatron-Core Forbids Absorption, and LAGA -- a Communication-Efficient Fix","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T17:32:37.642188Z"},"links":{"cited_paper":"/paper/2508.15881","citing_paper":"/paper/2607.17644"},"observation_digest":"sha256:0610828d9d90025699776875788731483a910c937cf2c433a9267c2e3ae65101","observation_id":"6107027a-ed16-41c6-ab09-fbc260fc3daa","resolution":{"observed_at":"2026-08-01T17:32:37.642188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:32:37.715125Z","title":"DeepEP: an efficient expert- parallel communication library","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17644","last_updated":"2026-07-20T07:57:34Z","snapshot_observed_at":"2026-08-17T12:59:56.886335Z","submitted_at":"2026-07-20T07:57:34Z","title":"A Training-Memory Regression in MLA Sequence Parallelism: Why Megatron-Core Forbids Absorption, and LAGA -- a Communication-Efficient Fix","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T17:32:37.715125Z"},"links":{"citing_paper":"/paper/2607.17644"},"observation_digest":"sha256:9fb6dfe0366afb4f2a8d4ad7d19dbe9ee62a7ff6e4c9c60693578af44e09cc32","observation_id":"d53bd1c2-bea0-4529-b3e3-69c6ba285482","resolution":{"observed_at":"2026-08-01T17:32:37.715125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.04473","last_updated":"2021-08-23T19:41:13Z","snapshot_observed_at":"2026-08-16T18:32:42.098841Z","submitted_at":"2021-04-09T16:43:11Z","title":"Efficient Large-Scale Language Model Training on GPU Clusters Using Megatron-LM","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.04473","snapshot_observed_at":"2026-08-01T17:32:37.511773Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17644","last_updated":"2026-07-20T07:57:34Z","snapshot_observed_at":"2026-08-17T12:59:56.886335Z","submitted_at":"2026-07-20T07:57:34Z","title":"A Training-Memory Regression in MLA Sequence Parallelism: Why Megatron-Core Forbids Absorption, and LAGA -- a Communication-Efficient Fix","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-01T17:32:37.511773Z"},"links":{"cited_paper":"/paper/2104.04473","citing_paper":"/paper/2607.17644"},"observation_digest":"sha256:e2c2f80ede73c87b07dc8dc8373544bfcd54c33aed392bf1b1cbdfeaaca38055","observation_id":"73494bae-8a1d-4c9f-a9ac-3a3c3d90d1a0","resolution":{"observed_at":"2026-08-01T17:32:37.511773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-01T17:32:36.906798Z","title":"DeepSeek-V2: A strong, economical, and ef- ficient mixture-of-experts language model.arXiv preprint arXiv:2405.04434,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17644","last_updated":"2026-07-20T07:57:34Z","snapshot_observed_at":"2026-08-17T12:59:56.886335Z","submitted_at":"2026-07-20T07:57:34Z","title":"A Training-Memory Regression in MLA Sequence Parallelism: Why Megatron-Core Forbids Absorption, and LAGA -- a Communication-Efficient Fix","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-01T17:32:36.906798Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2607.17644"},"observation_digest":"sha256:6a277b4a5481618aad8134b29b4a6440932839d3c7bf2d1c12ea7da62c858985","observation_id":"cb99d2a5-fb3b-44ce-9700-19eed4d5b7f0","resolution":{"observed_at":"2026-08-01T17:32:36.906798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-18T18:18:37.449517Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-01T17:32:36.988309Z","title":"DeepSeek-V3 technical report.arXiv preprint arXiv:2412.19437,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17644","last_updated":"2026-07-20T07:57:34Z","snapshot_observed_at":"2026-08-17T12:59:56.886335Z","submitted_at":"2026-07-20T07:57:34Z","title":"A Training-Memory Regression in MLA Sequence Parallelism: Why Megatron-Core Forbids Absorption, and LAGA -- a Communication-Efficient Fix","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-01T17:32:36.988309Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2607.17644"},"observation_digest":"sha256:c25b5fa1182e96caa8a866fc1d593f0edd587ed986427f3b10ca13a9990d8a95","observation_id":"f7587e05-073a-4771-81f7-355e0ac466bf","resolution":{"observed_at":"2026-08-01T17:32:36.988309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09431","last_updated":"2023-11-15T23:01:02Z","snapshot_observed_at":"2026-08-17T19:29:18.923800Z","submitted_at":"2023-11-15T23:01:02Z","title":"Striped Attention: Faster Ring Attention for Causal Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.09431","snapshot_observed_at":"2026-08-01T17:32:36.816550Z","title":"Brandon, W., Nrusimha, A., Qian, K., Ankner, Z., Jin, T., Song, Z., and Ragan-Kelley, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17644","last_updated":"2026-07-20T07:57:34Z","snapshot_observed_at":"2026-08-17T12:59:56.886335Z","submitted_at":"2026-07-20T07:57:34Z","title":"A Training-Memory Regression in MLA Sequence Parallelism: Why Megatron-Core Forbids Absorption, and LAGA -- a Communication-Efficient Fix","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-01T17:32:36.816550Z"},"links":{"cited_paper":"/paper/2311.09431","citing_paper":"/paper/2607.17644"},"observation_digest":"sha256:ec8dca3b993f1b4ce4dd3e17d5ae5aafb78d0695ffdcd9d666e5d8f9dea898f4","observation_id":"48fc9efd-7438-4d22-9406-373f497c5deb","resolution":{"observed_at":"2026-08-01T17:32:36.816550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:32:37.454051Z","title":"arXiv:2603.02188","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17644","last_updated":"2026-07-20T07:57:34Z","snapshot_observed_at":"2026-08-17T12:59:56.886335Z","submitted_at":"2026-07-20T07:57:34Z","title":"A Training-Memory Regression in MLA Sequence Parallelism: Why Megatron-Core Forbids Absorption, and LAGA -- a Communication-Efficient Fix","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-01T17:32:37.454051Z"},"links":{"citing_paper":"/paper/2607.17644"},"observation_digest":"sha256:1bc914f4f567c9429dcc9f593b5454e0c94a4d31f07959b582b8782c28eef448","observation_id":"c7d866cb-9aaf-4854-b798-14f33450d906","resolution":{"observed_at":"2026-08-01T17:32:37.454051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.17644","last_updated":"2026-07-20T07:57:34Z","latest_version":1,"primary_category":"cs.DC","snapshot_observed_at":"2026-08-17T12:59:56.886335Z","submitted_at":"2026-07-20T07:57:34Z","title":"A Training-Memory Regression in MLA Sequence Parallelism: Why Megatron-Core Forbids Absorption, and LAGA -- a Communication-Efficient Fix"},"reference_resolution":{"displayed":15,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":15,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":15},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 15 of 15 outbound references and 0 inbound Pith citation observations for arXiv:2607.17644."}