{"as_of":"2026-08-05T22:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d45bc30a0be2e8d67c3cb96e350bdd7107a96435a9e3157b3015a8c7f1c00c18","coverage":[{"denominator":68,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":68,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-21T19:44:04.833504Z","state":"measured"},{"denominator":69,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":69,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-20T10:50:12.926232Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-05-20T10:53:13.511836Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2510.18830","last_updated":"2026-05-19T17:27:20Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T17:25:32Z","title":"MTraining: Distributed Dynamic Sparse Attention for Efficient Ultra-Long Context Training","version":2},"cited_work":{"arxiv_id":"2510.18830","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.18830","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"MTraining: Distributed Dynamic Sparse Attention for Efficient Ultra-Long Context Training","venue":"cs.CL","work_id":"e937dbd7-aaa8-45fd-bda0-f1407adafb5c","year":2025},"citing_paper":{"arxiv_id":"2605.18753","last_updated":"2026-05-18T17:59:52Z","snapshot_observed_at":"2026-08-02T11:52:59.734226Z","submitted_at":"2026-05-18T17:59:52Z","title":"DashAttention: Differentiable and Adaptive Sparse Hierarchical Attention","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-20T10:50:12.926232Z"},"links":{"cited_paper":"/paper/2510.18830","citing_paper":"/paper/2605.18753"},"observation_digest":"sha256:4d93434e5ea8bcbab63f15c59098aec6d7e23177e8d57c7dc325aa52150028f3","observation_id":"a8990c60-f268-4918-920b-394a6500e38c","resolution":{"observed_at":"2026-05-20T10:53:13.513638Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2510.18830/citation-record","integrity":"/paper/2510.18830/integrity","json":"/paper/2510.18830/citation-record.json","paper":"/paper/2510.18830"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2305.15387","last_updated":"2023-05-24T17:48:40Z","snapshot_observed_at":"2026-07-06T15:32:49.322000Z","submitted_at":"2023-05-24T17:48:40Z","title":"Peek Across: Improving Multi-Document Modeling via Cross-Document Question-Answering","version":1},"cited_work":{"arxiv_id":"2305.15387","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.15387","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Peek across: Improving multi-document modeling via cross-document question-answering","venue":null,"work_id":"6eb1884a-5ea0-4cf2-bd04-d80623fd6066","year":2023},"citing_paper":{"arxiv_id":"2510.18830","last_updated":"2026-05-19T17:27:20Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T17:25:32Z","title":"MTraining: Distributed Dynamic Sparse Attention for Efficient Ultra-Long Context Training","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-21T19:44:04.833504Z"},"links":{"cited_paper":"/paper/2305.15387","citing_paper":"/paper/2510.18830"},"observation_digest":"sha256:cbdf2f230df47f190823c936f53029c2ffd68f9e76fab1ca60ed435b001d28d2","observation_id":"5156b2c3-1e9e-49dc-8745-21a4ec1cc503","resolution":{"observed_at":"2026-05-21T19:44:19.617697Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01523","last_updated":"2024-11-12T04:37:44Z","snapshot_observed_at":"2026-07-06T18:39:43.472708Z","submitted_at":"2024-07-01T17:59:26Z","title":"MMLongBench-Doc: Benchmarking Long-context Document Understanding with Visualizations","version":3},"cited_work":{"arxiv_id":"2407.01523","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.01523","snapshot_observed_at":"2026-07-02T16:17:09.161062Z","title":"Mmlongbench-doc: Benchmarking long-context document understanding with visualizations","venue":null,"work_id":"2246b9f1-e504-4ca8-9082-3ab923759798","year":2024},"citing_paper":{"arxiv_id":"2510.18830","last_updated":"2026-05-19T17:27:20Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T17:25:32Z","title":"MTraining: Distributed Dynamic Sparse Attention for Efficient Ultra-Long Context Training","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-21T19:44:04.833504Z"},"links":{"cited_paper":"/paper/2407.01523","citing_paper":"/paper/2510.18830"},"observation_digest":"sha256:0ac8c57cead77cff78b8ab44c4f88af65e788822859fc29ce59f1905b6a897f2","observation_id":"8b59d568-3960-45b1-a816-be2561950209","resolution":{"observed_at":"2026-05-21T19:44:19.671447Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06770","last_updated":"2024-11-11T23:05:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T16:47:29Z","title":"SWE-bench: Can Language Models Resolve Real-World GitHub Issues?","version":3},"cited_work":{"arxiv_id":"2310.06770","doi":"10.1145/512927.512945","metadata_source":"pith","pith_arxiv_id":"2310.06770","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SWE-bench: Can Language Models Resolve Real-World GitHub Issues?","venue":"cs.CL","work_id":"d0effe15-a689-441a-8e3f-ea35f1c4e4b1","year":2023},"citing_paper":{"arxiv_id":"2510.18830","last_updated":"2026-05-19T17:27:20Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T17:25:32Z","title":"MTraining: Distributed Dynamic Sparse Attention for Efficient Ultra-Long Context Training","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-21T19:44:04.833504Z"},"links":{"cited_paper":"/paper/2310.06770","citing_paper":"/paper/2510.18830"},"observation_digest":"sha256:e9c6414eebca024653877a04b89d6c42fd330f11514d8dd269f5640f6d0cea71","observation_id":"11946e18-9bf2-405b-92bb-d7f9f5539dc8","resolution":{"observed_at":"2026-05-21T19:44:19.681275Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Livecodebench: Holistic and contamination free evaluation of large language models for code","venue":null,"work_id":"efaa1922-d6c8-45e6-8baf-430529e31b5d","year":2025},"citing_paper":{"arxiv_id":"2510.18830","last_updated":"2026-05-19T17:27:20Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T17:25:32Z","title":"MTraining: Distributed Dynamic Sparse Attention for Efficient Ultra-Long Context Training","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-21T19:44:04.833504Z"},"links":{"citing_paper":"/paper/2510.18830"},"observation_digest":"sha256:3fbf53943ba0251d1169a0b87f9894ab1b82aa6ff491105bb716b613d22972fc","observation_id":"af577f49-b0c7-482a-beaf-219c289e88cf","resolution":{"observed_at":"2026-05-21T19:44:19.814875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Introducing deep research","venue":null,"work_id":"98819817-b5cc-4545-9e5a-bf0bbdb1161f","year":2025},"citing_paper":{"arxiv_id":"2510.18830","last_updated":"2026-05-19T17:27:20Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T17:25:32Z","title":"MTraining: Distributed Dynamic Sparse Attention for Efficient Ultra-Long Context Training","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-21T19:44:04.833504Z"},"links":{"citing_paper":"/paper/2510.18830"},"observation_digest":"sha256:845472a3de4651c8f0e2beef486abd2c8e2ad9f45afd4e94e5e672e58b982a8b","observation_id":"1b1a1cc1-1fed-4755-a618-e6a580edc27d","resolution":{"observed_at":"2026-05-21T19:44:19.796990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Leave it to manus.https://manus.im/","venue":null,"work_id":"febb9878-6bb4-49d8-8756-582916ff15c0","year":2025},"citing_paper":{"arxiv_id":"2510.18830","last_updated":"2026-05-19T17:27:20Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T17:25:32Z","title":"MTraining: Distributed Dynamic Sparse Attention for Efficient Ultra-Long Context Training","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-21T19:44:04.833504Z"},"links":{"citing_paper":"/paper/2510.18830"},"observation_digest":"sha256:3c7df1063ffa10003a8b88b240a7df20b859716837c19766231f92ca302ffe5a","observation_id":"501e3336-eb8a-4efd-ba3f-236e59fe70fc","resolution":{"observed_at":"2026-05-21T19:44:19.770143Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2510.18830","last_updated":"2026-05-19T17:27:20Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T17:25:32Z","title":"MTraining: Distributed Dynamic Sparse Attention for Efficient Ultra-Long Context Training","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-21T19:44:04.833504Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2510.18830"},"observation_digest":"sha256:22df66d4ac082c3243484fd0d1eb34284fa1cf42828d386ea55d2817ed61bcd4","observation_id":"3967738b-0bcf-4abc-b923-f82fb79bbcf5","resolution":{"observed_at":"2026-05-21T19:44:19.666724Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":"2407.10671","doi":"10.18653/v1/2024.naacl-long.246","metadata_source":"pith","pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2 Technical Report","venue":"cs.CL","work_id":"a1857881-ab9b-4b80-9b5f-9ae4b5c2566d","year":2024},"citing_paper":{"arxiv_id":"2510.18830","last_updated":"2026-05-19T17:27:20Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T17:25:32Z","title":"MTraining: Distributed Dynamic Sparse Attention for Efficient Ultra-Long Context Training","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-21T19:44:04.833504Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2510.18830"},"observation_digest":"sha256:b6b0099526ed83c23ece2f3cd92ed1a10b92f68f4080b616d2946ac6af93af63","observation_id":"3c2098a1-d92b-47a9-9f8a-72f3df8d1add","resolution":{"observed_at":"2026-05-21T19:44:19.701904Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":"2412.19437","doi":"10.1016/j.neucom.2023.127063.url:https://www.sciencedirect","metadata_source":"pith","pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"DeepSeek-V3 Technical Report","venue":"cs.CL","work_id":"57d2791d-2219-4c31-a077-afc04b12a75c","year":2024},"citing_paper":{"arxiv_id":"2510.18830","last_updated":"2026-05-19T17:27:20Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T17:25:32Z","title":"MTraining: Distributed Dynamic Sparse Attention for Efficient Ultra-Long Context Training","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-21T19:44:04.833504Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2510.18830"},"observation_digest":"sha256:cebed33b09ab9cde2373adceafe0e2f8b0682a46b790c6ed38db6990e236853a","observation_id":"078993bc-e5d7-4298-ae2b-49d7427f839d","resolution":{"observed_at":"2026-05-21T19:44:19.684088Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15383","last_updated":"2025-01-26T03:47:25Z","snapshot_observed_at":"2026-07-31T01:49:29.562668Z","submitted_at":"2025-01-26T03:47:25Z","title":"Qwen2.5-1M Technical Report","version":1},"cited_work":{"arxiv_id":"2501.15383","doi":"10.48550/arxiv.2501.15383","metadata_source":"pith","pith_arxiv_id":"2501.15383","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5-1M Technical Report","venue":"cs.CL","work_id":"397e3b66-80bd-403f-bcf9-9a907eed1830","year":2025},"citing_paper":{"arxiv_id":"2510.18830","last_updated":"2026-05-19T17:27:20Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T17:25:32Z","title":"MTraining: Distributed Dynamic Sparse Attention for Efficient Ultra-Long Context Training","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-21T19:44:04.833504Z"},"links":{"cited_paper":"/paper/2501.15383","citing_paper":"/paper/2510.18830"},"observation_digest":"sha256:c4a318aafeb43bc1d9dcfa6b9f91fbcd27248c473bb9257f03f7c301c8bf2780","observation_id":"365dd40c-f9b7-4744-b502-aafdfd5e2728","resolution":{"observed_at":"2026-05-21T19:44:19.692165Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":"2407.21783","doi":"10.1016/s0749-0720(15","metadata_source":"pith","pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"The Llama 3 Herd of Models","venue":"cs.AI","work_id":"1549a635-88af-4ac1-acfe-51ae7bb53345","year":2024},"citing_paper":{"arxiv_id":"2510.18830","last_updated":"2026-05-19T17:27:20Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T17:25:32Z","title":"MTraining: Distributed Dynamic Sparse Attention for Efficient Ultra-Long Context Training","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-21T19:44:04.833504Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2510.18830"},"observation_digest":"sha256:bb5ba44c0c8f3b363f657efdabdf3b9e059b8a7258bb4bd6d8f65b196cc3d6bd","observation_id":"c66bbf04-33bf-48a5-887a-ef0cbac2436b","resolution":{"observed_at":"2026-05-21T19:44:19.647423Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2410.02660","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T18:40:03.208056Z","title":"How to train long- context language models (effectively)","venue":null,"work_id":"1a93fc7f-b292-4ad8-b303-698846cc45a6","year":2024},"citing_paper":{"arxiv_id":"2510.18830","last_updated":"2026-05-19T17:27:20Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T17:25:32Z","title":"MTraining: Distributed Dynamic Sparse Attention for Efficient Ultra-Long Context Training","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-21T19:44:04.833504Z"},"links":{"citing_paper":"/paper/2510.18830"},"observation_digest":"sha256:429e0dcaafab2eb71769125fe1a79fbae6cdd12cf6db8d2c329708533eab23f0","observation_id":"5e1ac85b-cf30-4fff-a625-a69ab91f625e","resolution":{"observed_at":"2026-05-21T19:44:19.660631Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"QUEST: Query-aware sparsity for efficient long-context LLM inference","venue":null,"work_id":"2c7c3cb1-eee5-46fc-bd45-c7e70ce422c2","year":2024},"citing_paper":{"arxiv_id":"2510.18830","last_updated":"2026-05-19T17:27:20Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T17:25:32Z","title":"MTraining: Distributed Dynamic Sparse Attention for Efficient Ultra-Long Context Training","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-21T19:44:04.833504Z"},"links":{"citing_paper":"/paper/2510.18830"},"observation_digest":"sha256:7ab7b69aededb1901f78af038a2d3c166154cb3635ba6bb2a98eaf8c7b69b1b8","observation_id":"db7b691a-988a-4892-99b9-015b8950cfb1","resolution":{"observed_at":"2026-05-21T19:44:19.810291Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Minference 1.0: Accelerating pre-filling for long-context llms via dynamic sparse attention.Advances in Neural Information Processing Systems, 37:52481–52515","venue":null,"work_id":"0f739555-9314-424f-bd51-93a9de3a572b","year":2024},"citing_paper":{"arxiv_id":"2510.18830","last_updated":"2026-05-19T17:27:20Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T17:25:32Z","title":"MTraining: Distributed Dynamic Sparse Attention for Efficient Ultra-Long Context Training","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-21T19:44:04.833504Z"},"links":{"citing_paper":"/paper/2510.18830"},"observation_digest":"sha256:5a7c34ae2cbaf7398fab5ccb4d80336c0e8be24255f6001327689b6fa7ecf369","observation_id":"e3d1aef4-6538-43b8-a3c4-70a452dda11b","resolution":{"observed_at":"2026-05-21T19:44:19.764076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T01:40:35.498722Z","title":"Flexprefill: A context- aware sparse attention mechanism for efficient long-sequence inference","venue":null,"work_id":"07a8f1da-670a-4649-8136-ca5d30d33235","year":2025},"citing_paper":{"arxiv_id":"2510.18830","last_updated":"2026-05-19T17:27:20Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T17:25:32Z","title":"MTraining: Distributed Dynamic Sparse Attention for Efficient Ultra-Long Context Training","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-21T19:44:04.833504Z"},"links":{"citing_paper":"/paper/2510.18830"},"observation_digest":"sha256:df0e9d544c0a1103443f20e9aa83e1df9ad4f4ccdcdf7a8eb623a055876a92ee","observation_id":"99781537-8690-4c73-b4ae-59911756f801","resolution":{"observed_at":"2026-05-21T19:44:19.753640Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sparq attention: Bandwidth-efficient LLM inference","venue":null,"work_id":"e9f7bb36-af1e-4a10-b937-de8e7c16fce6","year":2024},"citing_paper":{"arxiv_id":"2510.18830","last_updated":"2026-05-19T17:27:20Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T17:25:32Z","title":"MTraining: Distributed Dynamic Sparse Attention for Efficient Ultra-Long Context Training","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-21T19:44:04.833504Z"},"links":{"citing_paper":"/paper/2510.18830"},"observation_digest":"sha256:9de63265d6e02b76e9739c8d735eed0368945a1101c3309083339c5a525bf3cf","observation_id":"2530f5e5-728d-42bd-84b2-79dab862de57","resolution":{"observed_at":"2026-05-21T19:44:19.767266Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11089","last_updated":"2025-02-27T09:01:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-16T11:53:44Z","title":"Native Sparse Attention: Hardware-Aligned and Natively Trainable Sparse Attention","version":2},"cited_work":{"arxiv_id":"2502.11089","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.11089","snapshot_observed_at":"2026-07-10T01:36:44.142264Z","title":"Native Sparse Attention: Hardware-Aligned and Natively Trainable Sparse Attention","venue":"cs.CL","work_id":"c74d35ec-94d3-48f5-a291-20cfad7c04a3","year":2025},"citing_paper":{"arxiv_id":"2510.18830","last_updated":"2026-05-19T17:27:20Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T17:25:32Z","title":"MTraining: Distributed Dynamic Sparse Attention for Efficient Ultra-Long Context Training","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-21T19:44:04.833504Z"},"links":{"cited_paper":"/paper/2502.11089","citing_paper":"/paper/2510.18830"},"observation_digest":"sha256:ad79d5c5e93680fa559a5950c2f311c4832e87d2d71998dbc209af8be48461f3","observation_id":"7620b104-d95d-4ebb-8ee0-b469f1ffc6c4","resolution":{"observed_at":"2026-05-21T19:44:19.618794Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"cited_work":{"arxiv_id":"2502.13189","doi":"10.48550/arxiv.2502.13189","metadata_source":"pith","pith_arxiv_id":"2502.13189","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","venue":"cs.LG","work_id":"de16df2d-eb7f-429d-82c7-8e4bf5183193","year":2025},"citing_paper":{"arxiv_id":"2510.18830","last_updated":"2026-05-19T17:27:20Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T17:25:32Z","title":"MTraining: Distributed Dynamic Sparse Attention for Efficient Ultra-Long Context Training","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-21T19:44:04.833504Z"},"links":{"cited_paper":"/paper/2502.13189","citing_paper":"/paper/2510.18830"},"observation_digest":"sha256:295961e78602be2e64bd645da6fba3a30687fb9a956ae789d1857ac1994bc47c","observation_id":"52c40fb4-c89c-4206-aa23-b0b1a830503d","resolution":{"observed_at":"2026-05-21T19:44:19.643653Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ring attention with blockwise transformers for near-infinite context","venue":null,"work_id":"08c508d5-b740-4993-a3bb-8f636f2dfc34","year":2024},"citing_paper":{"arxiv_id":"2510.18830","last_updated":"2026-05-19T17:27:20Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T17:25:32Z","title":"MTraining: Distributed Dynamic Sparse Attention for Efficient Ultra-Long Context Training","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-21T19:44:04.833504Z"},"links":{"citing_paper":"/paper/2510.18830"},"observation_digest":"sha256:c7f892986c6bfe47c186dbb0ef4ff3680609d1f5cf6b0bfb1c2fc09b46711821","observation_id":"0bedc2a2-31f4-41fe-8952-7f1b8aa92efb","resolution":{"observed_at":"2026-05-21T19:44:19.816601Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09431","last_updated":"2023-11-15T23:01:02Z","snapshot_observed_at":"2026-07-06T16:48:16.671370Z","submitted_at":"2023-11-15T23:01:02Z","title":"Striped Attention: Faster Ring Attention for Causal Transformers","version":1},"cited_work":{"arxiv_id":"2311.09431","doi":"10.48550/arxiv.2311.09431","metadata_source":"arxiv_reference","pith_arxiv_id":"2311.09431","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Striped attention: Faster ring attention for causal transformers","venue":"arXiv (Cornell University)","work_id":"7cc4e141-1418-4a62-bc6a-4e3270436eec","year":2023},"citing_paper":{"arxiv_id":"2510.18830","last_updated":"2026-05-19T17:27:20Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T17:25:32Z","title":"MTraining: Distributed Dynamic Sparse Attention for Efficient Ultra-Long Context Training","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-21T19:44:04.833504Z"},"links":{"cited_paper":"/paper/2311.09431","citing_paper":"/paper/2510.18830"},"observation_digest":"sha256:7c68fa00920767b93c277cde0635bec5496999adf27db1bfbc56a8362980b5b5","observation_id":"d419d5d6-aaa8-4dda-a17d-4368d07e05c0","resolution":{"observed_at":"2026-05-21T19:44:19.650627Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2412.15115","doi":"10.1145/3581783.3612503","metadata_source":"pith","pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5 Technical Report","venue":"cs.CL","work_id":"d8432992-4980-4a81-85c7-9fa2c2b87f85","year":2024},"citing_paper":{"arxiv_id":"2510.18830","last_updated":"2026-05-19T17:27:20Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T17:25:32Z","title":"MTraining: Distributed Dynamic Sparse Attention for Efficient Ultra-Long Context Training","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-21T19:44:04.833504Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2510.18830"},"observation_digest":"sha256:aacd239851b7fd462efd488124cb7d18ead98c56d8d78cc0f9cbbe9c0afa2c56","observation_id":"5ea97251-5024-4118-89b3-d8afe3ffeca7","resolution":{"observed_at":"2026-05-21T19:44:19.695297Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T01:40:35.521522Z","title":"RULER: What’s the real context size of your long-context language models? InFirst Conference on Language Modeling","venue":null,"work_id":"95c144f4-cb75-4090-a6ba-e076ca5009fb","year":2024},"citing_paper":{"arxiv_id":"2510.18830","last_updated":"2026-05-19T17:27:20Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T17:25:32Z","title":"MTraining: Distributed Dynamic Sparse Attention for Efficient Ultra-Long Context Training","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-21T19:44:04.833504Z"},"links":{"citing_paper":"/paper/2510.18830"},"observation_digest":"sha256:ff9df244fb4550165a9f17fd01b689473fd13875782f022368b39fb090743a96","observation_id":"8f620287-2ec2-4a1d-a770-223e185746ac","resolution":{"observed_at":"2026-05-21T19:44:19.771894Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Needle in a haystack - pressure testing llms","venue":null,"work_id":"927fff4a-3616-4764-b859-a19e2b17e333","year":2023},"citing_paper":{"arxiv_id":"2510.18830","last_updated":"2026-05-19T17:27:20Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T17:25:32Z","title":"MTraining: Distributed Dynamic Sparse Attention for Efficient Ultra-Long Context Training","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-21T19:44:04.833504Z"},"links":{"citing_paper":"/paper/2510.18830"},"observation_digest":"sha256:bed034d646016c93afa6853d28bf002db26b458d933c9f5e4cd24f1bd98962d8","observation_id":"3c7d8006-3b1c-4c2d-bbb3-47c47c934954","resolution":{"observed_at":"2026-05-21T19:44:19.789323Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Infinitebench: Extending long context evaluation beyond 100K tokens","venue":null,"work_id":"aa2d8cae-9234-487c-871e-5f3cfe2dc18e","year":2024},"citing_paper":{"arxiv_id":"2510.18830","last_updated":"2026-05-19T17:27:20Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T17:25:32Z","title":"MTraining: Distributed Dynamic Sparse Attention for Efficient Ultra-Long Context Training","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-21T19:44:04.833504Z"},"links":{"citing_paper":"/paper/2510.18830"},"observation_digest":"sha256:b0fe4d43db837c292c51aca43b36d75bcaae2f870370d0e44b268dd29f351ec5","observation_id":"b4744c0a-c978-43a1-9840-5f7f976ccc23","resolution":{"observed_at":"2026-05-21T19:44:19.803646Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"cited_work":{"arxiv_id":"1911.05507","doi":"10.48550/arxiv.1911.05507","metadata_source":"pith","pith_arxiv_id":"1911.05507","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Compressive Transformers for Long-Range Sequence Modelling","venue":"cs.LG","work_id":"70572d78-130b-4a13-908f-0702dcf423df","year":2019},"citing_paper":{"arxiv_id":"2510.18830","last_updated":"2026-05-19T17:27:20Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T17:25:32Z","title":"MTraining: Distributed Dynamic Sparse Attention for Efficient Ultra-Long Context Training","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-21T19:44:04.833504Z"},"links":{"cited_paper":"/paper/1911.05507","citing_paper":"/paper/2510.18830"},"observation_digest":"sha256:fc695040b081369cea0b8a6098fce478e6632940016ca806f7a5535054ddf533","observation_id":"9acf4671-7194-4cb0-a65e-e8227b7d8ab9","resolution":{"observed_at":"2026-05-21T19:44:19.647760Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Flashattention: Fast and memory-efficient exact attention with io-awareness.Advances in neural information processing systems, 35:16344–16359","venue":null,"work_id":"baf7b16d-f364-4c99-8aec-b87642e2bede","year":2022},"citing_paper":{"arxiv_id":"2510.18830","last_updated":"2026-05-19T17:27:20Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T17:25:32Z","title":"MTraining: Distributed Dynamic Sparse Attention for Efficient Ultra-Long Context Training","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-21T19:44:04.833504Z"},"links":{"citing_paper":"/paper/2510.18830"},"observation_digest":"sha256:750e7fad24b30e23d87a90ca6ca8f9ef9d11b5454622e38253fe71f44c40fe9a","observation_id":"0f2178f6-c1cc-4d47-819c-b161ceb74655","resolution":{"observed_at":"2026-05-21T19:44:19.812799Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"[Feature request] balancing computation with zigzag blocking","venue":null,"work_id":"2fbcd269-795d-49f3-8621-9e93c23a8953","year":2024},"citing_paper":{"arxiv_id":"2510.18830","last_updated":"2026-05-19T17:27:20Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T17:25:32Z","title":"MTraining: Distributed Dynamic Sparse Attention for Efficient Ultra-Long Context Training","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-21T19:44:04.833504Z"},"links":{"citing_paper":"/paper/2510.18830"},"observation_digest":"sha256:7d67a2c2c9c673d699428edec51153008850bc4e3cfbb967775f2e0125ef2447","observation_id":"e350ce1f-9611-4814-8d8a-287d81cd19c2","resolution":{"observed_at":"2026-05-21T19:44:19.826498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.16428","last_updated":"2025-03-20T17:59:58Z","snapshot_observed_at":"2026-07-06T20:56:14.017923Z","submitted_at":"2025-03-20T17:59:58Z","title":"XAttention: Block Sparse Attention with Antidiagonal Scoring","version":1},"cited_work":{"arxiv_id":"2503.16428","doi":"10.48550/arxiv.2503.16428","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.16428","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Xattention: Block sparse attention with antidiagonal scoring.arXiv preprint arXiv:2503.16428","venue":"ArXiv.org","work_id":"660ed69e-6b5b-4d82-8a52-f5b1514a694b","year":2018},"citing_paper":{"arxiv_id":"2510.18830","last_updated":"2026-05-19T17:27:20Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T17:25:32Z","title":"MTraining: Distributed Dynamic Sparse Attention for Efficient Ultra-Long Context Training","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-21T19:44:04.833504Z"},"links":{"cited_paper":"/paper/2503.16428","citing_paper":"/paper/2510.18830"},"observation_digest":"sha256:db02bddaebe2edfeae235535047e84a4aa905714575022855679637b2da09fe6","observation_id":"123ba3fd-bb6b-49f8-ae64-83c38e133c4c","resolution":{"observed_at":"2026-05-21T19:44:19.675195Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T17:57:26.595007Z","title":"Roformer: Enhanced transformer with rotary position embedding.Neurocomputing, 568:127063","venue":null,"work_id":"b5fd43ff-336f-45fd-933c-ffddf3003880","year":2024},"citing_paper":{"arxiv_id":"2510.18830","last_updated":"2026-05-19T17:27:20Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T17:25:32Z","title":"MTraining: Distributed Dynamic Sparse Attention for Efficient Ultra-Long Context Training","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-21T19:44:04.833504Z"},"links":{"citing_paper":"/paper/2510.18830"},"observation_digest":"sha256:e8208a2e6078aab3cea639361701830479df7666baa4af4de3dbd90ac62329e0","observation_id":"f6d17fc7-3803-45a0-98c1-4b4fb9709656","resolution":{"observed_at":"2026-05-21T19:44:19.819660Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18485","last_updated":"2024-06-26T16:51:28Z","snapshot_observed_at":"2026-07-06T18:37:26.588451Z","submitted_at":"2024-06-26T16:51:28Z","title":"LoongTrain: Efficient Training of Long-Sequence LLMs with Head-Context Parallelism","version":1},"cited_work":{"arxiv_id":"2406.18485","doi":"10.48550/arxiv.2406.18485","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.18485","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Loongtrain: Efficient training of long-sequence llms with head-context parallelism","venue":"arXiv (Cornell University)","work_id":"87d1589c-18e6-4146-8145-7506ce9b380e","year":2024},"citing_paper":{"arxiv_id":"2510.18830","last_updated":"2026-05-19T17:27:20Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T17:25:32Z","title":"MTraining: Distributed Dynamic Sparse Attention for Efficient Ultra-Long Context Training","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-21T19:44:04.833504Z"},"links":{"cited_paper":"/paper/2406.18485","citing_paper":"/paper/2510.18830"},"observation_digest":"sha256:687bebb7873bd10431c2f0ab5db80a90f19926ca118fffdfc7cad4c60f68050e","observation_id":"3cb32a3f-1115-4ce4-ab42-b1adb59684f9","resolution":{"observed_at":"2026-05-21T19:44:19.688737Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"{nnScaler}:{Constraint-Guided} parallelization plan generation for deep learning training","venue":null,"work_id":"37a58759-a82e-4283-b3d0-528a64ca9e16","year":2024},"citing_paper":{"arxiv_id":"2510.18830","last_updated":"2026-05-19T17:27:20Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T17:25:32Z","title":"MTraining: Distributed Dynamic Sparse Attention for Efficient Ultra-Long Context Training","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-21T19:44:04.833504Z"},"links":{"citing_paper":"/paper/2510.18830"},"observation_digest":"sha256:33e436138eb84865faa380ede0e7754e3587d7aff1669f05a29b26397fc29b7c","observation_id":"0e24abef-8f4c-4ab8-93b9-45eab6506218","resolution":{"observed_at":"2026-05-21T19:44:19.821999Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Zero: Memory optimiza- tions toward training trillion parameter models","venue":null,"work_id":"12ac66c5-fdc5-4994-8bb5-dabc189b44f3","year":2020},"citing_paper":{"arxiv_id":"2510.18830","last_updated":"2026-05-19T17:27:20Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T17:25:32Z","title":"MTraining: Distributed Dynamic Sparse Attention for Efficient Ultra-Long Context Training","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-21T19:44:04.833504Z"},"links":{"citing_paper":"/paper/2510.18830"},"observation_digest":"sha256:3a0dd70a7ff48bdd86e9c229bff18cf079a5f552c54586a0aaacdcfa4d53505a","observation_id":"8ccb14f7-86a5-4fd3-92ec-5bebc232e287","resolution":{"observed_at":"2026-05-21T19:44:19.733256Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gpipe: Efficient training of giant neural networks using pipeline parallelism.Advances in neural information processing systems, 32","venue":null,"work_id":"2956ae1f-2746-48df-bd62-6ff23a9cfb0d","year":2019},"citing_paper":{"arxiv_id":"2510.18830","last_updated":"2026-05-19T17:27:20Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T17:25:32Z","title":"MTraining: Distributed Dynamic Sparse Attention for Efficient Ultra-Long Context Training","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-21T19:44:04.833504Z"},"links":{"citing_paper":"/paper/2510.18830"},"observation_digest":"sha256:aa9bd925ad9e245a3f279bc89b5bb98bdbecebbd37bc9f789e70282a11e7cf67","observation_id":"2dd9909d-2552-46a2-981d-bc4b8af800c1","resolution":{"observed_at":"2026-05-21T19:44:19.801230Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1604.06174","last_updated":"2016-04-22T19:21:36Z","snapshot_observed_at":"2026-08-04T13:01:58.606241Z","submitted_at":"2016-04-21T04:15:27Z","title":"Training Deep Nets with Sublinear Memory Cost","version":2},"cited_work":{"arxiv_id":"1604.06174","doi":"10.48550/arxiv.1604.06174","metadata_source":"pith","pith_arxiv_id":"1604.06174","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Training Deep Nets with Sublinear Memory Cost","venue":"cs.LG","work_id":"f2c5c287-a500-40e4-a136-e7e3172db1d7","year":2016},"citing_paper":{"arxiv_id":"2510.18830","last_updated":"2026-05-19T17:27:20Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T17:25:32Z","title":"MTraining: Distributed Dynamic Sparse Attention for Efficient Ultra-Long Context Training","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-21T19:44:04.833504Z"},"links":{"cited_paper":"/paper/1604.06174","citing_paper":"/paper/2510.18830"},"observation_digest":"sha256:8684d4b42178c601f7fb3e25888a93f66f8950d5872ccf5375233000e84acca3","observation_id":"9088f2ef-f293-4b82-a8bc-c10788acca88","resolution":{"observed_at":"2026-05-21T19:44:19.680299Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-21T12:26:33.666045+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T12:26:33.666045+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Block Sparse Attention","venue":null,"work_id":"c25af761-959a-453d-a52d-368b5c1dbd09","year":2024},"citing_paper":{"arxiv_id":"2510.18830","last_updated":"2026-05-19T17:27:20Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T17:25:32Z","title":"MTraining: Distributed Dynamic Sparse Attention for Efficient Ultra-Long Context Training","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-21T19:44:04.833504Z"},"links":{"citing_paper":"/paper/2510.18830"},"observation_digest":"sha256:d747e55fc5e3ef71a2b428d4989cb8962968ec625b9de23436e6b2102d192b67","observation_id":"a5154ded-68f1-4877-831e-01769cf4a23f","resolution":{"observed_at":"2026-05-21T19:44:19.808064Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pit: Optimization of dynamic sparse deep learning models via permutation invariant transformation","venue":null,"work_id":"e0d43194-61eb-44a2-87fa-5dd88b253503","year":2023},"citing_paper":{"arxiv_id":"2510.18830","last_updated":"2026-05-19T17:27:20Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T17:25:32Z","title":"MTraining: Distributed Dynamic Sparse Attention for Efficient Ultra-Long Context Training","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-21T19:44:04.833504Z"},"links":{"citing_paper":"/paper/2510.18830"},"observation_digest":"sha256:af8981cd9137a0c8f03228146a8b6dee172dfb78a44c5691837ad6004aff1a15","observation_id":"2aa37b1f-138d-46e6-93a4-5e1f82d646f4","resolution":{"observed_at":"2026-05-21T19:44:19.824343Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Efficient memory management for large language model serving with pagedattention","venue":null,"work_id":"98acac9a-046b-4954-b8b8-7b8eb7fb4d18","year":2023},"citing_paper":{"arxiv_id":"2510.18830","last_updated":"2026-05-19T17:27:20Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T17:25:32Z","title":"MTraining: Distributed Dynamic Sparse Attention for Efficient Ultra-Long Context Training","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-21T19:44:04.833504Z"},"links":{"citing_paper":"/paper/2510.18830"},"observation_digest":"sha256:c6bf0624100ce3b5a2d2606c48b201b2af79a8f23e96c01888e29ca2ee8e3fc2","observation_id":"a867570d-452f-4a05-9915-f395e76c49b7","resolution":{"observed_at":"2026-05-21T19:44:19.799983Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"YaRN: Efficient context window extension of large language models","venue":null,"work_id":"9a6ddb9f-a11b-47bc-85ad-b2a8eb496439","year":2024},"citing_paper":{"arxiv_id":"2510.18830","last_updated":"2026-05-19T17:27:20Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T17:25:32Z","title":"MTraining: Distributed Dynamic Sparse Attention for Efficient Ultra-Long Context Training","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-21T19:44:04.833504Z"},"links":{"citing_paper":"/paper/2510.18830"},"observation_digest":"sha256:1fa068fda181885014d14bfa61369a281a3bf756147948b20a0373043aab3f50","observation_id":"2796d3b7-1526-4251-8dc9-035bb939000a","resolution":{"observed_at":"2026-05-21T19:44:19.790405Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reducing activation recomputation in large transformer models.Proceedings of Machine Learning and Systems, 5:341–353","venue":null,"work_id":"57dbd174-0077-44a4-b8b9-406cfd9abc98","year":2023},"citing_paper":{"arxiv_id":"2510.18830","last_updated":"2026-05-19T17:27:20Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T17:25:32Z","title":"MTraining: Distributed Dynamic Sparse Attention for Efficient Ultra-Long Context Training","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-21T19:44:04.833504Z"},"links":{"citing_paper":"/paper/2510.18830"},"observation_digest":"sha256:99e01f6c79c251e549dd5fe43905a092e84422182598da52f5131703b89c1784","observation_id":"d618a994-714a-4444-a140-113e5d4776ce","resolution":{"observed_at":"2026-05-21T19:44:19.805533Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"System optimizations for enabling training of extreme long sequence transformer models","venue":null,"work_id":"46b56767-57cb-47ee-9153-3486749a06d3","year":2024},"citing_paper":{"arxiv_id":"2510.18830","last_updated":"2026-05-19T17:27:20Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T17:25:32Z","title":"MTraining: Distributed Dynamic Sparse Attention for Efficient Ultra-Long Context Training","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-21T19:44:04.833504Z"},"links":{"citing_paper":"/paper/2510.18830"},"observation_digest":"sha256:e962eddf951874a64c2037b494524327ddabdc3ce792eaf32be7efc49fe9c4a8","observation_id":"e84b3ddf-c141-4043-b1c8-4c10a6c5de85","resolution":{"observed_at":"2026-05-21T19:44:19.759334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mini-sequence transformers: Optimizing intermediate memory for long sequences training","venue":null,"work_id":"46a38d14-8d40-4116-8aac-b4ef002ec873","year":2024},"citing_paper":{"arxiv_id":"2510.18830","last_updated":"2026-05-19T17:27:20Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T17:25:32Z","title":"MTraining: Distributed Dynamic Sparse Attention for Efficient Ultra-Long Context Training","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-21T19:44:04.833504Z"},"links":{"citing_paper":"/paper/2510.18830"},"observation_digest":"sha256:5b675a120c21f5dd84c3528dcdc275af86427dd92f06f78e1729f513aad22c64","observation_id":"1ca7e239-0078-40c4-b6b1-3d624cb28fb0","resolution":{"observed_at":"2026-05-21T19:44:19.738305Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.07719","last_updated":"2024-07-02T09:03:26Z","snapshot_observed_at":"2026-07-06T18:13:29.693360Z","submitted_at":"2024-05-13T13:08:02Z","title":"USP: A Unified Sequence Parallelism Approach for Long Context Generative AI","version":5},"cited_work":{"arxiv_id":"2405.07719","doi":"10.48550/arxiv.2405.07719","metadata_source":"pith","pith_arxiv_id":"2405.07719","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A unified sequence parallelism approach for long context generative ai","venue":"cs.LG","work_id":"277d0fdf-d9cc-4497-ad08-04aba6226c36","year":2024},"citing_paper":{"arxiv_id":"2510.18830","last_updated":"2026-05-19T17:27:20Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T17:25:32Z","title":"MTraining: Distributed Dynamic Sparse Attention for Efficient Ultra-Long Context Training","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-21T19:44:04.833504Z"},"links":{"cited_paper":"/paper/2405.07719","citing_paper":"/paper/2510.18830"},"observation_digest":"sha256:db7913626f82533abf1937bdf3b3559d8fd494e9e0112a3277a1805d75196e64","observation_id":"9e833785-1c43-43b2-879b-0cf4c406a57b","resolution":{"observed_at":"2026-05-21T19:44:19.604126Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.21231","last_updated":"2025-02-28T17:01:03Z","snapshot_observed_at":"2026-07-06T20:44:31.199648Z","submitted_at":"2025-02-28T17:01:03Z","title":"ByteScale: Efficient Scaling of LLM Training with a 2048K Context Length on More Than 12,000 GPUs","version":1},"cited_work":{"arxiv_id":"2502.21231","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.21231","snapshot_observed_at":"2026-07-02T23:27:28.048568Z","title":"Bytescale: Efficient scaling of llm training with a 2048k context length on more than 12,000 gpus","venue":null,"work_id":"660685cd-8bce-447d-a0db-b0a85fc5b20d","year":2025},"citing_paper":{"arxiv_id":"2510.18830","last_updated":"2026-05-19T17:27:20Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T17:25:32Z","title":"MTraining: Distributed Dynamic Sparse Attention for Efficient Ultra-Long Context Training","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-21T19:44:04.833504Z"},"links":{"cited_paper":"/paper/2502.21231","citing_paper":"/paper/2510.18830"},"observation_digest":"sha256:3f2f1b9802a41b7647260f8e1b3a72792e5e3f57fd2d60595730a6172feb396b","observation_id":"a492123d-5b69-401e-b410-6bbfaff96408","resolution":{"observed_at":"2026-05-21T19:44:19.608821Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.17924","last_updated":"2025-03-23T03:40:45Z","snapshot_observed_at":"2026-07-06T20:57:16.750503Z","submitted_at":"2025-03-23T03:40:45Z","title":"WLB-LLM: Workload-Balanced 4D Parallelism for Large Language Model Training","version":1},"cited_work":{"arxiv_id":"2503.17924","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.17924","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Wlb-llm: Workload-balanced 4d parallelism for large language model training","venue":null,"work_id":"0f3d6ca9-8e4d-40e6-bc19-d63f8b0262ce","year":2025},"citing_paper":{"arxiv_id":"2510.18830","last_updated":"2026-05-19T17:27:20Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T17:25:32Z","title":"MTraining: Distributed Dynamic Sparse Attention for Efficient Ultra-Long Context Training","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-21T19:44:04.833504Z"},"links":{"cited_paper":"/paper/2503.17924","citing_paper":"/paper/2510.18830"},"observation_digest":"sha256:d588035c634748457a9d5ade36f8c6b4689d50670668a814cb2da0fe03745ce6","observation_id":"4079208c-6b8f-41cd-8e90-5c2bfba5487f","resolution":{"observed_at":"2026-05-21T19:44:19.687243Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Flexsp: Accelerating large language model training via flexible sequence parallelism","venue":null,"work_id":"ad0f6d02-ac5f-42eb-9c28-b803722732ac","year":2025},"citing_paper":{"arxiv_id":"2510.18830","last_updated":"2026-05-19T17:27:20Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T17:25:32Z","title":"MTraining: Distributed Dynamic Sparse Attention for Efficient Ultra-Long Context Training","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-21T19:44:04.833504Z"},"links":{"citing_paper":"/paper/2510.18830"},"observation_digest":"sha256:960a9affe8e391e908a19f4c9c8518789c47fd6bc2043d6a8929dbaffc5aeeb5","observation_id":"07d888c3-aa41-4f36-a53d-1a6db1f2b7b8","resolution":{"observed_at":"2026-05-21T19:44:19.782393Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.02027","last_updated":"2022-10-05T20:14:52Z","snapshot_observed_at":"2026-08-04T15:58:44.498394Z","submitted_at":"2021-06-29T04:37:23Z","title":"Efficient Sequence Packing without Cross-contamination: Accelerating Large Language Models without Impacting Performance","version":2},"cited_work":{"arxiv_id":"2107.02027","doi":"10.48550/arxiv.2107.02027","metadata_source":"pith","pith_arxiv_id":"2107.02027","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kosec, S","venue":"cs.CL","work_id":"168014c6-0f97-4394-a665-a80a203ae40c","year":2021},"citing_paper":{"arxiv_id":"2510.18830","last_updated":"2026-05-19T17:27:20Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T17:25:32Z","title":"MTraining: Distributed Dynamic Sparse Attention for Efficient Ultra-Long Context Training","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-21T19:44:04.833504Z"},"links":{"cited_paper":"/paper/2107.02027","citing_paper":"/paper/2510.18830"},"observation_digest":"sha256:b06936a32c601beafa63e7cd410c43a17183f63d60b1df0bec60446dbe251b3a","observation_id":"85f52a22-9f59-4f47-bb47-6d587fae16c4","resolution":{"observed_at":"2026-05-21T19:44:19.661086Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Magiattention: A distributed attention towards linear scalability for ultra-long context, heterogeneous mask training","venue":null,"work_id":"89570eed-a7cc-4ca2-adae-f0c0ba2147f6","year":2025},"citing_paper":{"arxiv_id":"2510.18830","last_updated":"2026-05-19T17:27:20Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T17:25:32Z","title":"MTraining: Distributed Dynamic Sparse Attention for Efficient Ultra-Long Context Training","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-21T19:44:04.833504Z"},"links":{"citing_paper":"/paper/2510.18830"},"observation_digest":"sha256:59ad3406f4c2692af5b9db8fd01ee890f99e83a0d471612e191ecb2952c73369","observation_id":"fb9b6527-eff2-4a36-b865-b0ae63916a20","resolution":{"observed_at":"2026-05-21T19:44:19.819381Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"LongroPE: Extending LLM context window beyond 2 million tokens","venue":null,"work_id":"f861dfda-96ce-4e8c-988b-e08529bc87ea","year":2024},"citing_paper":{"arxiv_id":"2510.18830","last_updated":"2026-05-19T17:27:20Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T17:25:32Z","title":"MTraining: Distributed Dynamic Sparse Attention for Efficient Ultra-Long Context Training","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-21T19:44:04.833504Z"},"links":{"citing_paper":"/paper/2510.18830"},"observation_digest":"sha256:77fce3c1d621671f7bb89a66176ec1173151e847d5dd8ab9b02a0553839e4223","observation_id":"9e51610f-379a-4ad8-9c12-778355d60636","resolution":{"observed_at":"2026-05-21T19:44:19.802683Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A length-extrapolatable transformer","venue":null,"work_id":"164f1d87-e24a-4cfb-9642-66f2742fca2b","year":2023},"citing_paper":{"arxiv_id":"2510.18830","last_updated":"2026-05-19T17:27:20Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T17:25:32Z","title":"MTraining: Distributed Dynamic Sparse Attention for Efficient Ultra-Long Context Training","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-21T19:44:04.833504Z"},"links":{"citing_paper":"/paper/2510.18830"},"observation_digest":"sha256:a3f33b0b44e5ca8524d23a6f7882c1fc5ce024e81c8071c3761f65f42cd0e097","observation_id":"43b0a93d-7881-4d41-81e9-e4939ed19ed7","resolution":{"observed_at":"2026-05-21T19:44:19.805934Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15595","last_updated":"2023-06-28T04:26:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-27T16:26:26Z","title":"Extending Context Window of Large Language Models via Positional Interpolation","version":2},"cited_work":{"arxiv_id":"2306.15595","doi":"10.48550/arxiv.2306.15595","metadata_source":"pith","pith_arxiv_id":"2306.15595","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Extending Context Window of Large Language Models via Positional Interpolation","venue":"cs.CL","work_id":"c8b6df85-e7da-4bd8-90a4-d309cc2a0f60","year":2023},"citing_paper":{"arxiv_id":"2510.18830","last_updated":"2026-05-19T17:27:20Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T17:25:32Z","title":"MTraining: Distributed Dynamic Sparse Attention for Efficient Ultra-Long Context Training","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-21T19:44:04.833504Z"},"links":{"cited_paper":"/paper/2306.15595","citing_paper":"/paper/2510.18830"},"observation_digest":"sha256:0c95df28c6f840c0a189cdc6f685d6a0286b0b2e8ad63189f16013041040e737","observation_id":"2d489ac2-221e-424d-92a4-a2b5c881d464","resolution":{"observed_at":"2026-05-21T19:44:19.683897Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-01T10:38:12.283235+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T10:38:12.283235+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Training-free long-context scaling of large language models","venue":null,"work_id":"36e3e331-b144-4d0b-b362-462435dec589","year":2024},"citing_paper":{"arxiv_id":"2510.18830","last_updated":"2026-05-19T17:27:20Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T17:25:32Z","title":"MTraining: Distributed Dynamic Sparse Attention for Efficient Ultra-Long Context Training","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-21T19:44:04.833504Z"},"links":{"citing_paper":"/paper/2510.18830"},"observation_digest":"sha256:b94b3e4306b497eec0dd6ad73289bd0fdab63a0e682387926c3cf0f6f446f312","observation_id":"04eddd50-1c84-4e98-8eba-b86dbdd17d7d","resolution":{"observed_at":"2026-05-21T19:44:19.817334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Why does the effective context length of LLMs fall short? InThe Thirteenth International Conference on Learning Representations","venue":null,"work_id":"e25b8712-2017-4a30-9271-38cbe843f908","year":2025},"citing_paper":{"arxiv_id":"2510.18830","last_updated":"2026-05-19T17:27:20Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T17:25:32Z","title":"MTraining: Distributed Dynamic Sparse Attention for Efficient Ultra-Long Context Training","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-21T19:44:04.833504Z"},"links":{"citing_paper":"/paper/2510.18830"},"observation_digest":"sha256:ff4bd06178f1f30c03aa45d3f11cfd6e8c67b2a50f9cf5d521af99539fb0b297","observation_id":"1226a374-0537-4db2-9916-087ad7edf812","resolution":{"observed_at":"2026-05-21T19:44:19.793674Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"KIVI: A tuning-free asymmetric 2bit quantization for KV cache","venue":null,"work_id":"f8cd8025-8459-4514-8bad-9291318e3a41","year":2024},"citing_paper":{"arxiv_id":"2510.18830","last_updated":"2026-05-19T17:27:20Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T17:25:32Z","title":"MTraining: Distributed Dynamic Sparse Attention for Efficient Ultra-Long Context Training","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-21T19:44:04.833504Z"},"links":{"citing_paper":"/paper/2510.18830"},"observation_digest":"sha256:4aac4191ca13e9bffe42f1e6a2a805e867ba7e824222915f09647aedad89f423","observation_id":"1657870b-8491-4ce4-8d88-0f92c0073135","resolution":{"observed_at":"2026-05-21T19:44:19.798957Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Kvquant: Towards 10 million context length llm inference with kv cache quantization.Advances in Neural Information Processing Systems, 37:1270–1303","venue":null,"work_id":"172ee51b-e990-4cc3-beb8-85cde692e623","year":2024},"citing_paper":{"arxiv_id":"2510.18830","last_updated":"2026-05-19T17:27:20Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T17:25:32Z","title":"MTraining: Distributed Dynamic Sparse Attention for Efficient Ultra-Long Context Training","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-21T19:44:04.833504Z"},"links":{"citing_paper":"/paper/2510.18830"},"observation_digest":"sha256:2ac44711fa638bff2a7e17b6b025731b83ccabb7bc5a86730d1788dd82605fdc","observation_id":"17587785-99ab-439f-bd14-2e24dcfaa86f","resolution":{"observed_at":"2026-05-21T19:44:19.750835Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"You only cache once: Decoder-decoder architectures for language models.Advances in Neural Information Processing Systems, 37:7339–7361","venue":null,"work_id":"baa9f18e-b764-433d-bb31-7fdeb12241ba","year":2024},"citing_paper":{"arxiv_id":"2510.18830","last_updated":"2026-05-19T17:27:20Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T17:25:32Z","title":"MTraining: Distributed Dynamic Sparse Attention for Efficient Ultra-Long Context Training","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-21T19:44:04.833504Z"},"links":{"citing_paper":"/paper/2510.18830"},"observation_digest":"sha256:0d74d9395460fab7d0198877fb5829d30407dcd0ee63404b375c8e4a7067a8ba","observation_id":"f37217c9-de4e-469f-8398-79b64e6c5e05","resolution":{"observed_at":"2026-05-21T19:44:19.784456Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12077","last_updated":"2024-07-16T18:00:00Z","snapshot_observed_at":"2026-07-06T18:47:25.751118Z","submitted_at":"2024-07-16T18:00:00Z","title":"GoldFinch: High Performance RWKV/Transformer Hybrid with Linear Pre-Fill and Extreme KV-Cache Compression","version":1},"cited_work":{"arxiv_id":"2407.12077","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.12077","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Goldfinch: High performance rwkv/transformer hybrid with linear pre-fill and extreme kv-cache compression","venue":null,"work_id":"82b4e9a5-0352-43e7-831e-9131e7be27f0","year":2024},"citing_paper":{"arxiv_id":"2510.18830","last_updated":"2026-05-19T17:27:20Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T17:25:32Z","title":"MTraining: Distributed Dynamic Sparse Attention for Efficient Ultra-Long Context Training","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-21T19:44:04.833504Z"},"links":{"cited_paper":"/paper/2407.12077","citing_paper":"/paper/2510.18830"},"observation_digest":"sha256:d4dc3dd28515b06179948f7596b9846b0a0705497979edcdf3994237f297dc6e","observation_id":"1b7e8f8a-947e-478a-a1ca-5aab8f7c45cf","resolution":{"observed_at":"2026-05-21T19:44:19.690254Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"GQA: Training generalized multi-query transformer models from multi-head checkpoints","venue":null,"work_id":"2df78dcb-eede-4c44-9b63-bdce3eafa59f","year":2023},"citing_paper":{"arxiv_id":"2510.18830","last_updated":"2026-05-19T17:27:20Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T17:25:32Z","title":"MTraining: Distributed Dynamic Sparse Attention for Efficient Ultra-Long Context Training","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-21T19:44:04.833504Z"},"links":{"citing_paper":"/paper/2510.18830"},"observation_digest":"sha256:2ef797787a904eeef50d6d1827380529904ef285cf8018d80f55f0afca3417b5","observation_id":"732e8330-7756-4c70-827f-fa8c363f6026","resolution":{"observed_at":"2026-05-21T19:44:19.832231Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"DHA: Learning decoupled-head attention from transformer checkpoints via adaptive heads fusion","venue":null,"work_id":"0ab5ff0e-5a34-43af-928a-b8ecfec62224","year":2024},"citing_paper":{"arxiv_id":"2510.18830","last_updated":"2026-05-19T17:27:20Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T17:25:32Z","title":"MTraining: Distributed Dynamic Sparse Attention for Efficient Ultra-Long Context Training","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-21T19:44:04.833504Z"},"links":{"citing_paper":"/paper/2510.18830"},"observation_digest":"sha256:0400509e4d8e8a58660d7a745726bb144d6ffc9ea19654c57d7e1ba2f48787c5","observation_id":"6e481a43-a90c-4b04-a399-d51c2e9bab06","resolution":{"observed_at":"2026-05-21T19:44:19.826744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"LLM maybe longLM: Selfextend LLM context window without tuning","venue":null,"work_id":"558f809d-3b50-49d4-b322-a8005975f071","year":2024},"citing_paper":{"arxiv_id":"2510.18830","last_updated":"2026-05-19T17:27:20Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T17:25:32Z","title":"MTraining: Distributed Dynamic Sparse Attention for Efficient Ultra-Long Context Training","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-21T19:44:04.833504Z"},"links":{"citing_paper":"/paper/2510.18830"},"observation_digest":"sha256:86d4bf69b02ad3fa34548e124c23a594a3a6c5421dabdb8599641632adb9deca","observation_id":"defbfae1-5b82-4ccf-8ac0-f3e207e1445f","resolution":{"observed_at":"2026-05-21T19:44:19.776759Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"{InfiniGen}: Efficient generative inference of large language models with dynamic {KV} cache management","venue":null,"work_id":"f9665aea-fd0d-43ce-a35a-16506ce2cce2","year":2024},"citing_paper":{"arxiv_id":"2510.18830","last_updated":"2026-05-19T17:27:20Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T17:25:32Z","title":"MTraining: Distributed Dynamic Sparse Attention for Efficient Ultra-Long Context Training","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-21T19:44:04.833504Z"},"links":{"citing_paper":"/paper/2510.18830"},"observation_digest":"sha256:3f2626dd21a52cae86e104d6ce63bb9e2dde96f4bd1590f72b4d23f9e602a1ee","observation_id":"5e2aee28-565d-4b14-ae5b-1d7657f00efd","resolution":{"observed_at":"2026-05-21T19:44:19.829391Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":"2004.05150","doi":"10.48550/arxiv.2004.05150","metadata_source":"pith","pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Longformer: The Long-Document Transformer","venue":"cs.CL","work_id":"abea7a44-6668-4de7-aab6-f53a6e5aa088","year":2020},"citing_paper":{"arxiv_id":"2510.18830","last_updated":"2026-05-19T17:27:20Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T17:25:32Z","title":"MTraining: Distributed Dynamic Sparse Attention for Efficient Ultra-Long Context Training","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-21T19:44:04.833504Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2510.18830"},"observation_digest":"sha256:7c4a07d476766282e5642555a07bca2f6868e0979268c6dd67b8289c5720324e","observation_id":"9400a663-a1d5-455e-b551-eb84a272d2b1","resolution":{"observed_at":"2026-05-21T19:44:19.651616Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-12T21:49:59.161233+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T21:49:59.161233+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Big bird: Transformers for longer sequences.Advances in neural information processing systems, 33:17283–17297","venue":null,"work_id":"fe6aa838-638c-4840-bfc1-1b9ffe8f9ee8","year":2020},"citing_paper":{"arxiv_id":"2510.18830","last_updated":"2026-05-19T17:27:20Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T17:25:32Z","title":"MTraining: Distributed Dynamic Sparse Attention for Efficient Ultra-Long Context Training","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-21T19:44:04.833504Z"},"links":{"citing_paper":"/paper/2510.18830"},"observation_digest":"sha256:1421eac9fec8648b2749da04e88a4096d9daffdf64157d2919b159bdc0b389e8","observation_id":"48e379e1-52db-4310-be03-da0911e128f4","resolution":{"observed_at":"2026-05-21T19:44:19.791761Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.04451","last_updated":"2020-02-18T16:01:18Z","snapshot_observed_at":"2026-07-06T08:50:12.690900Z","submitted_at":"2020-01-13T18:38:28Z","title":"Reformer: The Efficient Transformer","version":2},"cited_work":{"arxiv_id":"2001.04451","doi":"10.48550/arxiv.2001.04451","metadata_source":"pith","pith_arxiv_id":"2001.04451","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reformer: The Efficient Transformer","venue":"cs.LG","work_id":"eb3dbae4-931f-40ab-a37b-507a35f42712","year":2020},"citing_paper":{"arxiv_id":"2510.18830","last_updated":"2026-05-19T17:27:20Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T17:25:32Z","title":"MTraining: Distributed Dynamic Sparse Attention for Efficient Ultra-Long Context Training","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-21T19:44:04.833504Z"},"links":{"cited_paper":"/paper/2001.04451","citing_paper":"/paper/2510.18830"},"observation_digest":"sha256:8c3d154ae948cc425d5c20efd1c95e5f3dd2cc53aa1ea817186bbda0c593158d","observation_id":"c982ce7e-a165-476f-92fa-b86a024a784b","resolution":{"observed_at":"2026-05-21T19:44:19.698753Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-12T21:50:01.947571+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T21:50:01.947571+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Abdi, Dongsheng Li, Jianfeng Gao, Yuqing Yang, and Lili Qiu","venue":null,"work_id":"a6877941-45e8-436e-b98a-0d4309691a9a","year":2025},"citing_paper":{"arxiv_id":"2510.18830","last_updated":"2026-05-19T17:27:20Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T17:25:32Z","title":"MTraining: Distributed Dynamic Sparse Attention for Efficient Ultra-Long Context Training","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-21T19:44:04.833504Z"},"links":{"citing_paper":"/paper/2510.18830"},"observation_digest":"sha256:8718eee719923b85dca4af32faec0a2b8221586fab9df2193b351447eee2b617","observation_id":"de00f9e1-e847-4bb3-8830-214186114207","resolution":{"observed_at":"2026-05-21T19:44:19.813750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2502.18137","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T20:48:56.478959Z","title":"Spargeattn: Accurate sparse attention accelerating any model inference","venue":null,"work_id":"6199672f-7a6e-41ee-9a53-dcc98d435cb6","year":2025},"citing_paper":{"arxiv_id":"2510.18830","last_updated":"2026-05-19T17:27:20Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T17:25:32Z","title":"MTraining: Distributed Dynamic Sparse Attention for Efficient Ultra-Long Context Training","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-21T19:44:04.833504Z"},"links":{"citing_paper":"/paper/2510.18830"},"observation_digest":"sha256:de3d26f49f6ab03fe6dc7f8a593b073002527e2e1f42b932511f0c8353e3ba78","observation_id":"fbee031b-c71d-4f29-81f0-8865182a58f8","resolution":{"observed_at":"2026-05-21T19:44:19.678313Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"MagicPIG: LSH sampling for efficient LLM generation","venue":null,"work_id":"0c6de33a-301d-4838-97a5-b44ab8772506","year":2025},"citing_paper":{"arxiv_id":"2510.18830","last_updated":"2026-05-19T17:27:20Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T17:25:32Z","title":"MTraining: Distributed Dynamic Sparse Attention for Efficient Ultra-Long Context Training","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-21T19:44:04.833504Z"},"links":{"citing_paper":"/paper/2510.18830"},"observation_digest":"sha256:a39fc1329caefeea2f96a158dac4a32c53cf1a05c6329f5260fcd579e02b1b5e","observation_id":"652ae4b6-c055-46ab-8b27-c726766dbc2f","resolution":{"observed_at":"2026-05-21T19:44:19.808308Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":"1412.6980","doi":"10.1002/mrm.28086","metadata_source":"pith","pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Adam: A Method for Stochastic Optimization","venue":"cs.LG","work_id":"1910796d-9b52-4683-bf5c-de9632c1028b","year":2014},"citing_paper":{"arxiv_id":"2510.18830","last_updated":"2026-05-19T17:27:20Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T17:25:32Z","title":"MTraining: Distributed Dynamic Sparse Attention for Efficient Ultra-Long Context Training","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-21T19:44:04.833504Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2510.18830"},"observation_digest":"sha256:69a99b3c537f67e1efc2a30c0fc16b67f08972e0693908443a4c6ecb0ab41fda","observation_id":"0b81fa29-922c-456b-ab01-4c17a00644ac","resolution":{"observed_at":"2026-05-21T19:44:19.667903Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"67358ad0-302c-419a-bb5e-8237916145eb","year":null},"citing_paper":{"arxiv_id":"2510.18830","last_updated":"2026-05-19T17:27:20Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T17:25:32Z","title":"MTraining: Distributed Dynamic Sparse Attention for Efficient Ultra-Long Context Training","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-21T19:44:04.833504Z"},"links":{"citing_paper":"/paper/2510.18830"},"observation_digest":"sha256:d750a1fb851a9cc9aa2571b73574a3bfe1d4c1a2b8337da52b06376948883f81","observation_id":"f82f0226-62b5-4383-b62f-734d4564d5cd","resolution":{"observed_at":"2026-05-21T19:44:19.824066Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2510.18830","last_updated":"2026-05-19T17:27:20Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T17:25:32Z","title":"MTraining: Distributed Dynamic Sparse Attention for Efficient Ultra-Long Context Training"},"reference_resolution":{"displayed":68,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":1,"verified_exact":26,"verified_fuzzy":40},"total_outbound_references":68},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 68 of 68 outbound references and 1 inbound Pith citation observation for arXiv:2510.18830."}