{"as_of":"2026-08-09T06:04:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bbb9e9dd1a7172a3373a04092a20a0747a98301d3eae9df07da7c1dcbce03471","coverage":[{"denominator":37,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":37,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T12:25:42.790098Z","state":"measured"},{"denominator":39,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":39,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T17:32:37.570769Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-18T18:51:45.610699Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.07563","last_updated":"2025-02-11T14:01:39Z","snapshot_observed_at":"2026-08-08T12:15:35.512720Z","submitted_at":"2025-02-11T14:01:39Z","title":"LASP-2: Rethinking Sequence Parallelism for Linear Attention and Its Hybrid","version":1},"cited_work":{"arxiv_id":"2502.07563","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.07563","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Weigao Sun, Disen Lan, Yiran Zhong, Xiaoye Qu, and Yu Cheng","venue":null,"work_id":"465d5e3f-fbe8-47f8-8ea0-ba50d2e0139b","year":null},"citing_paper":{"arxiv_id":"2509.05276","last_updated":"2026-05-08T09:41:26Z","snapshot_observed_at":"2026-07-06T22:24:38.247543Z","submitted_at":"2025-09-05T17:34:00Z","title":"SpikingBrain: Spiking Brain-inspired Large Models","version":4},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-18T18:51:06.243305Z"},"links":{"cited_paper":"/paper/2502.07563","citing_paper":"/paper/2509.05276"},"observation_digest":"sha256:475399ec0bbce630b8d1b4e3c6132c3810988f459d5eb488efe4ebcd345d825b","observation_id":"78e836d7-64ee-4e55-ab47-b3727d46e310","resolution":{"observed_at":"2026-05-18T18:51:45.613221Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07563","last_updated":"2025-02-11T14:01:39Z","snapshot_observed_at":"2026-08-08T12:15:35.512720Z","submitted_at":"2025-02-11T14:01:39Z","title":"LASP-2: Rethinking Sequence Parallelism for Linear Attention and Its Hybrid","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.07563","snapshot_observed_at":"2026-08-01T17:32:37.570769Z","title":"Sun, W., Lan, D., Zhong, Y ., Qu, X., and Cheng, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17644","last_updated":"2026-07-20T07:57:34Z","snapshot_observed_at":"2026-08-07T15:41:17.993721Z","submitted_at":"2026-07-20T07:57:34Z","title":"A Training-Memory Regression in MLA Sequence Parallelism: Why Megatron-Core Forbids Absorption, and LAGA -- a Communication-Efficient Fix","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T17:32:37.570769Z"},"links":{"cited_paper":"/paper/2502.07563","citing_paper":"/paper/2607.17644"},"observation_digest":"sha256:e6352ee46e7ba871d208288afd40d1764d366ba0a913eb1a954dc6178cc915ad","observation_id":"2967adc6-a89e-4b02-aa21-be8e8d1c471d","resolution":{"observed_at":"2026-08-01T17:32:37.570769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2502.07563/citation-record","integrity":"/paper/2502.07563/integrity","json":"/paper/2502.07563/citation-record.json","paper":"/paper/2502.07563"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-08T12:25:42.612941Z","title":"L., Almeida, D., Altenschmidt, J., Altman, S., Anadkat, S., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07563","last_updated":"2025-02-11T14:01:39Z","snapshot_observed_at":"2026-08-08T12:15:35.512720Z","submitted_at":"2025-02-11T14:01:39Z","title":"LASP-2: Rethinking Sequence Parallelism for Linear Attention and Its Hybrid","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-08T12:25:42.612941Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2502.07563"},"observation_digest":"sha256:d4e9c29aab2afa03b0a397ed4f3a80a24f9e90321be98eae35b5f91ae9ac503f","observation_id":"b2761e0e-4b64-409e-af90-d7fe4de38bd5","resolution":{"observed_at":"2026-08-08T12:25:42.612941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10644","last_updated":"2024-06-05T14:13:22Z","snapshot_observed_at":"2026-07-06T17:31:08.762955Z","submitted_at":"2024-02-16T12:44:15Z","title":"Linear Transformers with Learnable Kernel Functions are Better In-Context Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10644","snapshot_observed_at":"2026-08-08T12:25:42.624361Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07563","last_updated":"2025-02-11T14:01:39Z","snapshot_observed_at":"2026-08-08T12:15:35.512720Z","submitted_at":"2025-02-11T14:01:39Z","title":"LASP-2: Rethinking Sequence Parallelism for Linear Attention and Its Hybrid","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-08T12:25:42.624361Z"},"links":{"cited_paper":"/paper/2402.10644","citing_paper":"/paper/2502.07563"},"observation_digest":"sha256:2a2384d31bd9d4009725d6238c05ddb410660ca92fbeff71aa59bc1339700aa3","observation_id":"d1565af2-adb7-4c74-b980-67bf83a13cfe","resolution":{"observed_at":"2026-08-08T12:25:42.624361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10266","last_updated":"2023-05-17T14:58:06Z","snapshot_observed_at":"2026-08-06T10:25:49.431167Z","submitted_at":"2023-05-17T14:58:06Z","title":"Searching for Needles in a Haystack: On the Role of Incidental Bilingualism in PaLM's Translation Capability","version":1},"cited_work":{"arxiv_id":"2305.10266","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.10266","snapshot_observed_at":"2026-08-08T12:25:43.252578Z","title":"Searching for Needles in a Haystack: On the Role of Incidental Bilingualism in PaLM's Translation Capability","venue":"cs.CL","work_id":"2c898bf7-3ce8-485d-9080-5766f1bd6a37","year":2023},"citing_paper":{"arxiv_id":"2502.07563","last_updated":"2025-02-11T14:01:39Z","snapshot_observed_at":"2026-08-08T12:15:35.512720Z","submitted_at":"2025-02-11T14:01:39Z","title":"LASP-2: Rethinking Sequence Parallelism for Linear Attention and Its Hybrid","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-08T12:25:42.635272Z"},"links":{"cited_paper":"/paper/2305.10266","citing_paper":"/paper/2502.07563"},"observation_digest":"sha256:5e295fdccb6512226040a206b52c9d187a90a0dd673184c392c106875f195a02","observation_id":"3be2ee39-3959-4271-bd90-f009297dddef","resolution":{"observed_at":"2026-08-08T12:25:43.257935Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08691","last_updated":"2023-07-17T17:50:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-17T17:50:36Z","title":"FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08691","snapshot_observed_at":"2026-08-08T12:25:42.640835Z","title":"Flashattention-2: Faster attention with bet- ter parallelism and work partitioning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07563","last_updated":"2025-02-11T14:01:39Z","snapshot_observed_at":"2026-08-08T12:15:35.512720Z","submitted_at":"2025-02-11T14:01:39Z","title":"LASP-2: Rethinking Sequence Parallelism for Linear Attention and Its Hybrid","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-08T12:25:42.640835Z"},"links":{"cited_paper":"/paper/2307.08691","citing_paper":"/paper/2502.07563"},"observation_digest":"sha256:c7298776f7609d80931f316dcd1d659bdb66f5eb90c2d83d0eff93983bb07beb","observation_id":"3ab4cdec-02e3-43ca-8111-9d3670376504","resolution":{"observed_at":"2026-08-08T12:25:42.640835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21060","last_updated":"2024-05-31T17:50:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:50:01Z","title":"Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21060","snapshot_observed_at":"2026-08-08T12:25:42.646406Z","title":"and Gu, A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07563","last_updated":"2025-02-11T14:01:39Z","snapshot_observed_at":"2026-08-08T12:15:35.512720Z","submitted_at":"2025-02-11T14:01:39Z","title":"LASP-2: Rethinking Sequence Parallelism for Linear Attention and Its Hybrid","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T12:25:42.646406Z"},"links":{"cited_paper":"/paper/2405.21060","citing_paper":"/paper/2502.07563"},"observation_digest":"sha256:e7ec5f885d7c12d116141b91c3b657c4634f458f20d7681c3e0f0badf82ddeac","observation_id":"91312a3a-7ed3-4b88-866a-fea054710de2","resolution":{"observed_at":"2026-08-08T12:25:42.646406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-08T12:25:42.656382Z","title":"The Llama 3 herd of models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07563","last_updated":"2025-02-11T14:01:39Z","snapshot_observed_at":"2026-08-08T12:15:35.512720Z","submitted_at":"2025-02-11T14:01:39Z","title":"LASP-2: Rethinking Sequence Parallelism for Linear Attention and Its Hybrid","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T12:25:42.656382Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2502.07563"},"observation_digest":"sha256:31262a9dc7e12bdad0612166cdd4994bd7a88691b89e97e88f22162c0660e9bb","observation_id":"c925f4d6-1bc0-4283-880d-3c95e3e0f5c8","resolution":{"observed_at":"2026-08-08T12:25:42.656382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00752","last_updated":"2024-05-31T17:55:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-01T18:01:34Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00752","snapshot_observed_at":"2026-08-08T12:25:42.661139Z","title":"and Dao, T","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07563","last_updated":"2025-02-11T14:01:39Z","snapshot_observed_at":"2026-08-08T12:15:35.512720Z","submitted_at":"2025-02-11T14:01:39Z","title":"LASP-2: Rethinking Sequence Parallelism for Linear Attention and Its Hybrid","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T12:25:42.661139Z"},"links":{"cited_paper":"/paper/2312.00752","citing_paper":"/paper/2502.07563"},"observation_digest":"sha256:01202b5609da32a93b3250cea7334a8668b19e44e72c5b0443f09fa05cd3c5f6","observation_id":"b7c14e75-2bbc-48cd-878f-db7fdcfb4804","resolution":{"observed_at":"2026-08-08T12:25:42.661139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-08T12:25:42.666217Z","title":"Measuring mas- sive multitask language understanding","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2502.07563","last_updated":"2025-02-11T14:01:39Z","snapshot_observed_at":"2026-08-08T12:15:35.512720Z","submitted_at":"2025-02-11T14:01:39Z","title":"LASP-2: Rethinking Sequence Parallelism for Linear Attention and Its Hybrid","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T12:25:42.666217Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2502.07563"},"observation_digest":"sha256:baf6c490f59a9c56a22343fdc06a43d4cd6e8dca0d81c858c1adcf48442274af","observation_id":"834dc8f1-c38c-4d0e-a4bc-f1dc493a1ecc","resolution":{"observed_at":"2026-08-08T12:25:42.666217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01032","last_updated":"2024-06-03T22:22:15Z","snapshot_observed_at":"2026-08-05T02:24:20.613110Z","submitted_at":"2024-02-01T21:44:11Z","title":"Repeat After Me: Transformers are Better than State Space Models at Copying","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01032","snapshot_observed_at":"2026-08-08T12:25:42.671185Z","title":"M., and Malach, E","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07563","last_updated":"2025-02-11T14:01:39Z","snapshot_observed_at":"2026-08-08T12:15:35.512720Z","submitted_at":"2025-02-11T14:01:39Z","title":"LASP-2: Rethinking Sequence Parallelism for Linear Attention and Its Hybrid","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T12:25:42.671185Z"},"links":{"cited_paper":"/paper/2402.01032","citing_paper":"/paper/2502.07563"},"observation_digest":"sha256:1c762b22ba806b61f1af315163bba7828a7add6816db0ff995223dbc14d9b8c1","observation_id":"cc935757-5111-4368-955a-85e43c483e88","resolution":{"observed_at":"2026-08-08T12:25:42.671185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.08313","snapshot_observed_at":"2026-08-08T12:25:42.680742Z","title":"Minimax-01: Scaling foundation models with lightning attention","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07563","last_updated":"2025-02-11T14:01:39Z","snapshot_observed_at":"2026-08-08T12:15:35.512720Z","submitted_at":"2025-02-11T14:01:39Z","title":"LASP-2: Rethinking Sequence Parallelism for Linear Attention and Its Hybrid","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T12:25:42.680742Z"},"links":{"cited_paper":"/paper/2501.08313","citing_paper":"/paper/2502.07563"},"observation_digest":"sha256:7d7530140c91120366ac97bd92d98d2d2856f06e608a44ec2733706b4c95e1e6","observation_id":"2ffb14d9-494f-4d45-a10e-7eb99a1d6501","resolution":{"observed_at":"2026-08-08T12:25:42.680742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.19887","last_updated":"2024-07-03T14:30:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-28T23:55:06Z","title":"Jamba: A Hybrid Transformer-Mamba Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.19887","snapshot_observed_at":"2026-08-08T12:25:42.685122Z","title":"Jamba: A hybrid transformer-mamba language model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07563","last_updated":"2025-02-11T14:01:39Z","snapshot_observed_at":"2026-08-08T12:15:35.512720Z","submitted_at":"2025-02-11T14:01:39Z","title":"LASP-2: Rethinking Sequence Parallelism for Linear Attention and Its Hybrid","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T12:25:42.685122Z"},"links":{"cited_paper":"/paper/2403.19887","citing_paper":"/paper/2502.07563"},"observation_digest":"sha256:b8d6fcca823a805cbd85ac346033a4020ba92db3d44429d7cdf6c5691d4fed31","observation_id":"b69a9752-719a-47e6-bd6d-a2636c0c7e99","resolution":{"observed_at":"2026-08-08T12:25:42.685122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:25:43.417562Z","title":null,"venue":null,"work_id":"fb78184c-57d5-4174-a430-d6a1364aa82e","year":2023},"citing_paper":{"arxiv_id":"2502.07563","last_updated":"2025-02-11T14:01:39Z","snapshot_observed_at":"2026-08-08T12:15:35.512720Z","submitted_at":"2025-02-11T14:01:39Z","title":"LASP-2: Rethinking Sequence Parallelism for Linear Attention and Its Hybrid","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T12:25:42.689644Z"},"links":{"citing_paper":"/paper/2502.07563"},"observation_digest":"sha256:5257841a1697c7361fdb2d1cc4e5994fa8493c00f7f5dcd46c632e587a6e1a69","observation_id":"cf67f9af-7e53-47d2-bdae-d883706bb468","resolution":{"observed_at":"2026-08-08T12:25:43.422421Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:25:42.693907Z","title":"doi: 10.18653/v1/2023.findings-emnlp","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07563","last_updated":"2025-02-11T14:01:39Z","snapshot_observed_at":"2026-08-08T12:15:35.512720Z","submitted_at":"2025-02-11T14:01:39Z","title":"LASP-2: Rethinking Sequence Parallelism for Linear Attention and Its Hybrid","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-08T12:25:42.693907Z"},"links":{"citing_paper":"/paper/2502.07563"},"observation_digest":"sha256:1f5a3fa65044f7b3289a37bd6c319d262b593f174aea285966f001fcb70679e1","observation_id":"12a6d39f-d016-4439-87ba-0d22cc0d3524","resolution":{"observed_at":"2026-08-08T12:25:42.693907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.13226","last_updated":"2025-01-06T23:51:47Z","snapshot_observed_at":"2026-08-07T15:16:10.566534Z","submitted_at":"2024-05-21T22:26:01Z","title":"Dataset Decomposition: Faster LLM Training with Variable Sequence Length Curriculum","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.13226","snapshot_observed_at":"2026-08-08T12:25:42.703293Z","title":"R., Vasu, P","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07563","last_updated":"2025-02-11T14:01:39Z","snapshot_observed_at":"2026-08-08T12:15:35.512720Z","submitted_at":"2025-02-11T14:01:39Z","title":"LASP-2: Rethinking Sequence Parallelism for Linear Attention and Its Hybrid","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T12:25:42.703293Z"},"links":{"cited_paper":"/paper/2405.13226","citing_paper":"/paper/2502.07563"},"observation_digest":"sha256:cad41c9b032336a23db0cdc35ad15b5b2c285eb7c4fc6539760189b3d72e61ff","observation_id":"7c2fab43-7087-4322-8cde-93c3f06e6345","resolution":{"observed_at":"2026-08-08T12:25:42.703293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.14995","last_updated":"2024-01-19T07:47:01Z","snapshot_observed_at":"2026-08-01T19:55:19.898676Z","submitted_at":"2023-07-27T16:45:33Z","title":"TransNormerLLM: A Faster and Better Large Language Model with Improved TransNormer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.14995","snapshot_observed_at":"2026-08-08T12:25:42.707448Z","title":"TransNormerLLM: A faster and better large language model with improved transnormer","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07563","last_updated":"2025-02-11T14:01:39Z","snapshot_observed_at":"2026-08-08T12:15:35.512720Z","submitted_at":"2025-02-11T14:01:39Z","title":"LASP-2: Rethinking Sequence Parallelism for Linear Attention and Its Hybrid","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-08T12:25:42.707448Z"},"links":{"cited_paper":"/paper/2307.14995","citing_paper":"/paper/2502.07563"},"observation_digest":"sha256:125dc17d73a04f404a666ef2ad984450af1d06f314a82e7411506a569a5810ac","observation_id":"7b8e93ba-727c-40d1-abd2-01c8cd362928","resolution":{"observed_at":"2026-08-08T12:25:42.707448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07522","last_updated":"2025-02-28T02:20:49Z","snapshot_observed_at":"2026-08-06T19:04:16.718797Z","submitted_at":"2024-06-11T17:50:51Z","title":"Samba: Simple Hybrid State Space Models for Efficient Unlimited Context Language Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07522","snapshot_observed_at":"2026-08-08T12:25:42.711865Z","title":"Samba: Simple hybrid state space models for efficient unlimited context language modeling","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07563","last_updated":"2025-02-11T14:01:39Z","snapshot_observed_at":"2026-08-08T12:15:35.512720Z","submitted_at":"2025-02-11T14:01:39Z","title":"LASP-2: Rethinking Sequence Parallelism for Linear Attention and Its Hybrid","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-08T12:25:42.711865Z"},"links":{"cited_paper":"/paper/2406.07522","citing_paper":"/paper/2502.07563"},"observation_digest":"sha256:31cdf5bbe6dcc54046657a080da0ab52cb72913bb594b1d6aec16a9df70d2197","observation_id":"339ae241-9a41-4f7a-9c8e-ecafd7c78a05","resolution":{"observed_at":"2026-08-08T12:25:42.711865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16690","last_updated":"2024-06-24T14:51:31Z","snapshot_observed_at":"2026-08-05T15:41:30.684979Z","submitted_at":"2024-06-24T14:51:31Z","title":"Scaling Laws for Linear Complexity Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16690","snapshot_observed_at":"2026-08-08T12:25:42.721108Z","title":"Scaling laws for linear complexity language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07563","last_updated":"2025-02-11T14:01:39Z","snapshot_observed_at":"2026-08-08T12:15:35.512720Z","submitted_at":"2025-02-11T14:01:39Z","title":"LASP-2: Rethinking Sequence Parallelism for Linear Attention and Its Hybrid","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-08T12:25:42.721108Z"},"links":{"cited_paper":"/paper/2406.16690","citing_paper":"/paper/2502.07563"},"observation_digest":"sha256:3ff10deff0253edac0b60b69fb24272cc4894a91dc11a096d13c53a8cfe8d661","observation_id":"ee0d4a49-1b80-4720-9669-95881963ddff","resolution":{"observed_at":"2026-08-08T12:25:42.721108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-08T12:25:42.725885Z","title":"Megatron-LM: Training multi- billion parameter language models using model paral- lelism","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2502.07563","last_updated":"2025-02-11T14:01:39Z","snapshot_observed_at":"2026-08-08T12:15:35.512720Z","submitted_at":"2025-02-11T14:01:39Z","title":"LASP-2: Rethinking Sequence Parallelism for Linear Attention and Its Hybrid","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-08T12:25:42.725885Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2502.07563"},"observation_digest":"sha256:f44782a207d61ae024ac402352818fe57021c3a2c46c99018e881f12451b3168","observation_id":"88ccc2bf-1a61-4aed-8e0d-f1c7062771e4","resolution":{"observed_at":"2026-08-08T12:25:42.725885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02882","last_updated":"2025-05-16T03:34:33Z","snapshot_observed_at":"2026-08-05T23:47:01.233708Z","submitted_at":"2024-04-03T17:33:21Z","title":"Linear Attention Sequence Parallelism","version":3},"cited_work":{"arxiv_id":"2404.02882","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.02882","snapshot_observed_at":"2026-08-08T12:25:42.945747Z","title":"Linear Attention Sequence Parallelism","venue":"cs.LG","work_id":"5d251d89-a9bf-44fb-98d4-d5de06249a3a","year":2024},"citing_paper":{"arxiv_id":"2502.07563","last_updated":"2025-02-11T14:01:39Z","snapshot_observed_at":"2026-08-08T12:15:35.512720Z","submitted_at":"2025-02-11T14:01:39Z","title":"LASP-2: Rethinking Sequence Parallelism for Linear Attention and Its Hybrid","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-08T12:25:42.730995Z"},"links":{"cited_paper":"/paper/2404.02882","citing_paper":"/paper/2502.07563"},"observation_digest":"sha256:b2137b5c81c9b0bbd9b4c9b70168d6c15b17d0403bf09d3e2e6e2efc98ceb694","observation_id":"7ec65b29-6216-4b59-9f1b-0d3a79743ac3","resolution":{"observed_at":"2026-08-08T12:25:42.952657Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-08-08T12:25:42.741468Z","title":"LongVILA: Scal- ing long-context visual language models for long videos","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07563","last_updated":"2025-02-11T14:01:39Z","snapshot_observed_at":"2026-08-08T12:15:35.512720Z","submitted_at":"2025-02-11T14:01:39Z","title":"LASP-2: Rethinking Sequence Parallelism for Linear Attention and Its Hybrid","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-08T12:25:42.741468Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2502.07563"},"observation_digest":"sha256:c9169895d0dbb818874a13c359bd8dde3ea30446e663976916345b09898507d9","observation_id":"ab372280-d145-4bd1-91db-11abde4aaaf2","resolution":{"observed_at":"2026-08-08T12:25:42.741468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06635","last_updated":"2024-08-27T01:27:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-11T18:51:59Z","title":"Gated Linear Attention Transformers with Hardware-Efficient Training","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06635","snapshot_observed_at":"2026-08-08T12:25:42.746310Z","title":"Gated linear attention transformers with hardware-efficient train- ing","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07563","last_updated":"2025-02-11T14:01:39Z","snapshot_observed_at":"2026-08-08T12:15:35.512720Z","submitted_at":"2025-02-11T14:01:39Z","title":"LASP-2: Rethinking Sequence Parallelism for Linear Attention and Its Hybrid","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-08T12:25:42.746310Z"},"links":{"cited_paper":"/paper/2312.06635","citing_paper":"/paper/2502.07563"},"observation_digest":"sha256:defec111fb9f735c1a1a344fac57e3449b41d91c7ef719e0cbd15679c108ed2b","observation_id":"c0ec0ec4-683c-44c3-ae7b-462d4e62bebd","resolution":{"observed_at":"2026-08-08T12:25:42.746310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06484","last_updated":"2025-01-15T10:41:40Z","snapshot_observed_at":"2026-08-06T05:53:13.494942Z","submitted_at":"2024-06-10T17:24:42Z","title":"Parallelizing Linear Transformers with the Delta Rule over Sequence Length","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06484","snapshot_observed_at":"2026-08-08T12:25:42.751276Z","title":"Par- allelizing linear transformers with the delta rule over se- quence length","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07563","last_updated":"2025-02-11T14:01:39Z","snapshot_observed_at":"2026-08-08T12:15:35.512720Z","submitted_at":"2025-02-11T14:01:39Z","title":"LASP-2: Rethinking Sequence Parallelism for Linear Attention and Its Hybrid","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-08T12:25:42.751276Z"},"links":{"cited_paper":"/paper/2406.06484","citing_paper":"/paper/2502.07563"},"observation_digest":"sha256:9bdb8f930a1bd22ceddfa60fdbf708e9a40736997a172ffa6a291f1e2622abab","observation_id":"a2b0d8cd-b9c5-450a-8bba-bde9b09a046c","resolution":{"observed_at":"2026-08-08T12:25:42.751276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.08124","last_updated":"2022-08-17T07:40:20Z","snapshot_observed_at":"2026-07-06T13:42:36.328169Z","submitted_at":"2022-08-17T07:40:20Z","title":"Boosting Distributed Training Performance of the Unpadded BERT Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.08124","snapshot_observed_at":"2026-08-08T12:25:42.756424Z","title":"Boosting distributed training performance of the un- padded bert model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07563","last_updated":"2025-02-11T14:01:39Z","snapshot_observed_at":"2026-08-08T12:15:35.512720Z","submitted_at":"2025-02-11T14:01:39Z","title":"LASP-2: Rethinking Sequence Parallelism for Linear Attention and Its Hybrid","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-08T12:25:42.756424Z"},"links":{"cited_paper":"/paper/2208.08124","citing_paper":"/paper/2502.07563"},"observation_digest":"sha256:3b2fb4a3883d56206bd60e9cf4d6951c50975de4c99a9eed2352602fac77fb90","observation_id":"b7a65e53-4525-4a5c-b54c-566a1621e8df","resolution":{"observed_at":"2026-08-08T12:25:42.756424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:25:43.401001Z","title":"ByteTransformer: A high- performance transformer boosted for variable-length in- puts","venue":null,"work_id":"27ffff6f-195a-4909-9b7c-05d4c20feddd","year":2023},"citing_paper":{"arxiv_id":"2502.07563","last_updated":"2025-02-11T14:01:39Z","snapshot_observed_at":"2026-08-08T12:15:35.512720Z","submitted_at":"2025-02-11T14:01:39Z","title":"LASP-2: Rethinking Sequence Parallelism for Linear Attention and Its Hybrid","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-08T12:25:42.761073Z"},"links":{"citing_paper":"/paper/2502.07563"},"observation_digest":"sha256:da62870fd11b801ace36487958dff58df1e097350d596fa3980d676a18049d9c","observation_id":"6760dd63-efe1-42db-ba9a-47bb5f14016b","resolution":{"observed_at":"2026-08-08T12:25:43.406108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.11277","last_updated":"2023-09-12T16:28:00Z","snapshot_observed_at":"2026-08-01T19:01:47.393546Z","submitted_at":"2023-04-21T23:52:27Z","title":"PyTorch FSDP: Experiences on Scaling Fully Sharded Data Parallel","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.11277","snapshot_observed_at":"2026-08-08T12:25:42.771337Z","title":"Pytorch FSDP: experiences on scaling fully sharded data parallel","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07563","last_updated":"2025-02-11T14:01:39Z","snapshot_observed_at":"2026-08-08T12:15:35.512720Z","submitted_at":"2025-02-11T14:01:39Z","title":"LASP-2: Rethinking Sequence Parallelism for Linear Attention and Its Hybrid","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-08T12:25:42.771337Z"},"links":{"cited_paper":"/paper/2304.11277","citing_paper":"/paper/2502.07563"},"observation_digest":"sha256:3279a462d3462d5386d8694463b3ef35ea8d6116e25f0e120cc7edd691f314cd","observation_id":"63a8ebcd-779d-4711-b25d-16f3495823ca","resolution":{"observed_at":"2026-08-08T12:25:42.771337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:25:43.384630Z","title":"As these techniques are variants of data parallelism, they integrate seamlessly with LASP","venue":null,"work_id":"aa970812-534d-457d-8141-2722021d7325","year":2022},"citing_paper":{"arxiv_id":"2502.07563","last_updated":"2025-02-11T14:01:39Z","snapshot_observed_at":"2026-08-08T12:15:35.512720Z","submitted_at":"2025-02-11T14:01:39Z","title":"LASP-2: Rethinking Sequence Parallelism for Linear Attention and Its Hybrid","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-08T12:25:42.776156Z"},"links":{"citing_paper":"/paper/2502.07563"},"observation_digest":"sha256:5e2c8333944853794b5cc123866e73b6940dd5600084e0ef895add58c0783064","observation_id":"69562057-6f52-486b-a7b7-5ec38ad4514f","resolution":{"observed_at":"2026-08-08T12:25:43.389640Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:25:43.368916Z","title":"LASP-2 can manage variable sequence lengths efficiently by treating the entire batch as a single long sequence, streamlining the process without requiring padding","venue":null,"work_id":"da88a762-ec99-400f-a12c-41afc0982858","year":2024},"citing_paper":{"arxiv_id":"2502.07563","last_updated":"2025-02-11T14:01:39Z","snapshot_observed_at":"2026-08-08T12:15:35.512720Z","submitted_at":"2025-02-11T14:01:39Z","title":"LASP-2: Rethinking Sequence Parallelism for Linear Attention and Its Hybrid","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-08T12:25:42.781266Z"},"links":{"citing_paper":"/paper/2502.07563"},"observation_digest":"sha256:76acf16682ee46d257f8c626d245aa4bcff2f124e93f78ca25d0cfb0545338c2","observation_id":"1571c3da-451f-4f1c-9c49-dcd8957877ae","resolution":{"observed_at":"2026-08-08T12:25:43.373969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:25:43.335317Z","title":"Split Size of Gathering 2048 512 128 32 Number of Splits 1 4 16 64 Throughput 486183 486166 486169 486158 A.5.4","venue":null,"work_id":"834cae55-98c2-4587-b247-6c21754b0782","year":null},"citing_paper":{"arxiv_id":"2502.07563","last_updated":"2025-02-11T14:01:39Z","snapshot_observed_at":"2026-08-08T12:15:35.512720Z","submitted_at":"2025-02-11T14:01:39Z","title":"LASP-2: Rethinking Sequence Parallelism for Linear Attention and Its Hybrid","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-08T12:25:42.790098Z"},"links":{"citing_paper":"/paper/2502.07563"},"observation_digest":"sha256:c5eead6708bda2285f6d522bcc2f327abb40b6467727f7314a741711517b864a","observation_id":"3e494f39-e4b1-477b-881e-934873950d53","resolution":{"observed_at":"2026-08-08T12:25:43.340423Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05892","last_updated":"2024-09-26T22:39:08Z","snapshot_observed_at":"2026-08-06T19:53:21.536135Z","submitted_at":"2024-04-08T22:20:59Z","title":"Eagle and Finch: RWKV with Matrix-Valued States and Dynamic Recurrence","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.05892","snapshot_observed_at":"2026-08-08T12:25:42.698693Z","title":"findings-emnlp.936","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07563","last_updated":"2025-02-11T14:01:39Z","snapshot_observed_at":"2026-08-08T12:15:35.512720Z","submitted_at":"2025-02-11T14:01:39Z","title":"LASP-2: Rethinking Sequence Parallelism for Linear Attention and Its Hybrid","version":1},"reference_index":936,"source":"pdf_text","source_observed_at":"2026-08-08T12:25:42.698693Z"},"links":{"cited_paper":"/paper/2404.05892","citing_paper":"/paper/2502.07563"},"observation_digest":"sha256:973e4c8c87b93b76992e163e7a789d4243e43437d9bf1456bdacd1aaba552310","observation_id":"d3b1d05e-81bf-411b-bf0b-c8b773864e59","resolution":{"observed_at":"2026-08-08T12:25:42.698693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07887","last_updated":"2024-06-12T05:25:15Z","snapshot_observed_at":"2026-07-06T18:29:21.709395Z","submitted_at":"2024-06-12T05:25:15Z","title":"An Empirical Study of Mamba-based Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07887","snapshot_observed_at":"2026-08-08T12:25:42.735960Z","title":"An empirical study of mamba- based language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07563","last_updated":"2025-02-11T14:01:39Z","snapshot_observed_at":"2026-08-08T12:15:35.512720Z","submitted_at":"2025-02-11T14:01:39Z","title":"LASP-2: Rethinking Sequence Parallelism for Linear Attention and Its Hybrid","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-08T12:25:42.735960Z"},"links":{"cited_paper":"/paper/2406.07887","citing_paper":"/paper/2502.07563"},"observation_digest":"sha256:a6d3f7d4351404e7df00fa91091fa179980b51e82335ad2d29642936ec317a7d","observation_id":"c48c134d-9f26-4c62-86c9-29f0f81fa76a","resolution":{"observed_at":"2026-08-08T12:25:42.735960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.07146","last_updated":"2024-10-31T13:54:35Z","snapshot_observed_at":"2026-08-05T10:09:10.015371Z","submitted_at":"2024-09-11T09:49:50Z","title":"Gated Slot Attention for Efficient Linear-Time Sequence Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.07146","snapshot_observed_at":"2026-08-08T12:25:42.766684Z","title":"B., Zhou, P., and Fu, G","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07563","last_updated":"2025-02-11T14:01:39Z","snapshot_observed_at":"2026-08-08T12:15:35.512720Z","submitted_at":"2025-02-11T14:01:39Z","title":"LASP-2: Rethinking Sequence Parallelism for Linear Attention and Its Hybrid","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-08T12:25:42.766684Z"},"links":{"cited_paper":"/paper/2409.07146","citing_paper":"/paper/2502.07563"},"observation_digest":"sha256:445f6d5e886b93a96ff561e94a23b4260ae77b6040f552020590a95d9a59712f","observation_id":"32bc18e4-d811-4504-82ba-4ea714b00317","resolution":{"observed_at":"2026-08-08T12:25:42.766684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-08T12:25:42.676350Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07563","last_updated":"2025-02-11T14:01:39Z","snapshot_observed_at":"2026-08-08T12:15:35.512720Z","submitted_at":"2025-02-11T14:01:39Z","title":"LASP-2: Rethinking Sequence Parallelism for Linear Attention and Its Hybrid","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-08T12:25:42.676350Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2502.07563"},"observation_digest":"sha256:54f34cef8b6f55c32219543e3e113020fda54d4813fab1c6807bf0439c06283e","observation_id":"a2c982bb-f607-469c-9c02-db98ad7db2a2","resolution":{"observed_at":"2026-08-08T12:25:42.676350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08608","last_updated":"2024-07-12T22:15:02Z","snapshot_observed_at":"2026-07-06T18:44:53.587276Z","submitted_at":"2024-07-11T15:44:48Z","title":"FlashAttention-3: Fast and Accurate Attention with Asynchrony and Low-precision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08608","snapshot_observed_at":"2026-08-08T12:25:42.716501Z","title":"Flashattention-3: Fast and accurate atten- tion with asynchrony and low-precision","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07563","last_updated":"2025-02-11T14:01:39Z","snapshot_observed_at":"2026-08-08T12:15:35.512720Z","submitted_at":"2025-02-11T14:01:39Z","title":"LASP-2: Rethinking Sequence Parallelism for Linear Attention and Its Hybrid","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-08T12:25:42.716501Z"},"links":{"cited_paper":"/paper/2407.08608","citing_paper":"/paper/2502.07563"},"observation_digest":"sha256:59c2ed54cf0b346c2b66022be615d7f32cb5dc5235d55537ff39306aee27722e","observation_id":"98267f49-1450-4e61-b3ab-b1c491650e7d","resolution":{"observed_at":"2026-08-08T12:25:42.716501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.10830","last_updated":"2024-05-02T17:10:44Z","snapshot_observed_at":"2026-08-03T15:51:51.613383Z","submitted_at":"2024-04-16T18:08:29Z","title":"Fewer Truncations Improve Language Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.10830","snapshot_observed_at":"2026-08-08T12:25:42.651269Z","title":"Fewer truncations improve language modeling","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07563","last_updated":"2025-02-11T14:01:39Z","snapshot_observed_at":"2026-08-08T12:15:35.512720Z","submitted_at":"2025-02-11T14:01:39Z","title":"LASP-2: Rethinking Sequence Parallelism for Linear Attention and Its Hybrid","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-08T12:25:42.651269Z"},"links":{"cited_paper":"/paper/2404.10830","citing_paper":"/paper/2502.07563"},"observation_digest":"sha256:cc5ad48be3faad621dcf677fec177d6236b0c28704d524e0dab5a5bc80040bf8","observation_id":"685225d0-e7d6-4c7b-a73b-8e6e7070c9d1","resolution":{"observed_at":"2026-08-08T12:25:42.651269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13245","last_updated":"2023-12-23T17:55:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-22T17:16:38Z","title":"GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13245","snapshot_observed_at":"2026-08-08T12:25:42.618676Z","title":"GQA: Training generalized multi-query transformer models from multi-head check- points","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07563","last_updated":"2025-02-11T14:01:39Z","snapshot_observed_at":"2026-08-08T12:15:35.512720Z","submitted_at":"2025-02-11T14:01:39Z","title":"LASP-2: Rethinking Sequence Parallelism for Linear Attention and Its Hybrid","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-08T12:25:42.618676Z"},"links":{"cited_paper":"/paper/2305.13245","citing_paper":"/paper/2502.07563"},"observation_digest":"sha256:6822a4e013ceea7f5d41ced20585baa7b67a38ed56a256777e1d06b8e8470314","observation_id":"c6aee1e7-a230-4000-80da-79992ce586cb","resolution":{"observed_at":"2026-08-08T12:25:42.618676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18668","last_updated":"2025-03-07T18:57:52Z","snapshot_observed_at":"2026-07-06T17:37:05.339368Z","submitted_at":"2024-02-28T19:28:27Z","title":"Simple linear attention language models balance the recall-throughput tradeoff","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.18668","snapshot_observed_at":"2026-08-08T12:25:42.629773Z","title":"Z., Rudra, A., and Ré, C","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07563","last_updated":"2025-02-11T14:01:39Z","snapshot_observed_at":"2026-08-08T12:15:35.512720Z","submitted_at":"2025-02-11T14:01:39Z","title":"LASP-2: Rethinking Sequence Parallelism for Linear Attention and Its Hybrid","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-08T12:25:42.629773Z"},"links":{"cited_paper":"/paper/2402.18668","citing_paper":"/paper/2502.07563"},"observation_digest":"sha256:b1340bc48145208732758861e32331cdf78ee3078b33f81da9657262c72f555a","observation_id":"43ea1b62-b1b9-43a9-8ba9-e0a1cbe80823","resolution":{"observed_at":"2026-08-08T12:25:42.629773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:25:43.350867Z","title":"L\" denotes linear Transformer layers and","venue":null,"work_id":"5b3c639e-b03a-41b1-a1a1-08b1f3982f81","year":null},"citing_paper":{"arxiv_id":"2502.07563","last_updated":"2025-02-11T14:01:39Z","snapshot_observed_at":"2026-08-08T12:15:35.512720Z","submitted_at":"2025-02-11T14:01:39Z","title":"LASP-2: Rethinking Sequence Parallelism for Linear Attention and Its Hybrid","version":1},"reference_index":2048,"source":"pdf_text","source_observed_at":"2026-08-08T12:25:42.785686Z"},"links":{"citing_paper":"/paper/2502.07563"},"observation_digest":"sha256:068e9ba586595382e874bb3b7165dd06ed6df5073ca88da99478de0e20789d4f","observation_id":"ca173ad3-351c-43fc-9841-3ce85014a41d","resolution":{"observed_at":"2026-08-08T12:25:43.357187Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2502.07563","last_updated":"2025-02-11T14:01:39Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-08T12:15:35.512720Z","submitted_at":"2025-02-11T14:01:39Z","title":"LASP-2: Rethinking Sequence Parallelism for Linear Attention and Its Hybrid"},"reference_resolution":{"displayed":37,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":30,"verified_exact":1,"verified_fuzzy":5},"total_outbound_references":37},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 37 of 37 outbound references and 2 inbound Pith citation observations for arXiv:2502.07563."}