{"as_of":"2026-08-04T23:29:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b9f4d5f7d2b5b85e07966979e2612b13c3f20588f7d032fb491f446ba84b660c","coverage":[{"denominator":73,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":73,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-16T06:15:46.085555Z","state":"measured"},{"denominator":124,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":124,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":51,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":51,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T14:43:02.987885Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-10T12:15:01.137692Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"cited_work":{"arxiv_id":"2502.13189","doi":"10.48550/arxiv.2502.13189","metadata_source":"pith","pith_arxiv_id":"2502.13189","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","venue":"cs.LG","work_id":"de16df2d-eb7f-429d-82c7-8e4bf5183193","year":2025},"citing_paper":{"arxiv_id":"2506.13585","last_updated":"2025-06-16T15:08:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-16T15:08:02Z","title":"MiniMax-M1: Scaling Test-Time Compute Efficiently with Lightning Attention","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-12T09:28:16.189617Z"},"links":{"cited_paper":"/paper/2502.13189","citing_paper":"/paper/2506.13585"},"observation_digest":"sha256:186becf8b3fdc23d9f7620d194b7fc7e138d3f2f408913e8795c6733fc123a04","observation_id":"91649ab1-c636-4a27-89a8-ad28dba2fafb","resolution":{"observed_at":"2026-05-16T06:15:46.352230Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"cited_work":{"arxiv_id":"2502.13189","doi":"10.48550/arxiv.2502.13189","metadata_source":"pith","pith_arxiv_id":"2502.13189","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","venue":"cs.LG","work_id":"de16df2d-eb7f-429d-82c7-8e4bf5183193","year":2025},"citing_paper":{"arxiv_id":"2507.02259","last_updated":"2026-07-29T12:55:39Z","snapshot_observed_at":"2026-08-01T23:32:07.108143Z","submitted_at":"2025-07-03T03:11:50Z","title":"MemAgent: Reshaping Long-Context LLM with Multi-Conv RL-based Memory Agent","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-15T11:17:24.406028Z"},"links":{"cited_paper":"/paper/2502.13189","citing_paper":"/paper/2507.02259"},"observation_digest":"sha256:cef109f98998c0d49323dfca1ea889af767cfef0fc1b6114ced509e170411a50","observation_id":"cbbca396-4ce9-41eb-bab1-80182d8c10ed","resolution":{"observed_at":"2026-05-16T06:15:46.352230Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"cited_work":{"arxiv_id":"2502.13189","doi":"10.48550/arxiv.2502.13189","metadata_source":"pith","pith_arxiv_id":"2502.13189","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","venue":"cs.LG","work_id":"de16df2d-eb7f-429d-82c7-8e4bf5183193","year":2025},"citing_paper":{"arxiv_id":"2508.16703","last_updated":"2026-04-08T06:56:34Z","snapshot_observed_at":"2026-07-06T22:16:52.874707Z","submitted_at":"2025-08-22T07:41:35Z","title":"ShadowNPU: System and Algorithm Co-design for NPU-Centric On-Device LLM Inference","version":4},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-18T22:03:10.316005Z"},"links":{"cited_paper":"/paper/2502.13189","citing_paper":"/paper/2508.16703"},"observation_digest":"sha256:2d46bcf0a5f639dcb8e760cbbf019435aad21e7398f5d99dae3d78a04f480fe6","observation_id":"593aa73c-a482-4ac9-8a62-df9131d31232","resolution":{"observed_at":"2026-05-18T22:06:52.086462Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13189","snapshot_observed_at":"2026-08-04T14:43:02.987885Z","title":"Zhang, Zhilin Yang, Xinyu Zhou, Mingxing Zhang, and Jiezhong Qiu","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.02361","last_updated":"2026-05-25T07:51:15Z","snapshot_observed_at":"2026-08-04T14:42:55.586487Z","submitted_at":"2025-09-28T11:04:00Z","title":"ChunkLLM: A Lightweight Pluggable Framework for Accelerating LLMs Inference","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:02.987885Z"},"links":{"cited_paper":"/paper/2502.13189","citing_paper":"/paper/2510.02361"},"observation_digest":"sha256:38a46c9cbb491e9013c6082f9e58764f5799150eab6c9bf566cc24a3d5a881c4","observation_id":"5ed79671-7dcb-4b84-950c-0656a590b46d","resolution":{"observed_at":"2026-08-04T14:43:02.987885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"cited_work":{"arxiv_id":"2502.13189","doi":"10.48550/arxiv.2502.13189","metadata_source":"pith","pith_arxiv_id":"2502.13189","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","venue":"cs.LG","work_id":"de16df2d-eb7f-429d-82c7-8e4bf5183193","year":2025},"citing_paper":{"arxiv_id":"2510.04800","last_updated":"2026-04-21T13:16:20Z","snapshot_observed_at":"2026-08-02T20:03:37.497118Z","submitted_at":"2025-10-06T13:30:07Z","title":"Hybrid Architectures for Language Models: Systematic Analysis and Design Insights","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-18T10:18:04.431436Z"},"links":{"cited_paper":"/paper/2502.13189","citing_paper":"/paper/2510.04800"},"observation_digest":"sha256:1848fb12c89bf9da4cb0d9de4065a33b80c15624595d7a45389b33371456ab5f","observation_id":"4c8c4548-2e04-42be-bbb5-a61a684b5dce","resolution":{"observed_at":"2026-05-18T10:21:14.905213Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"cited_work":{"arxiv_id":"2502.13189","doi":"10.48550/arxiv.2502.13189","metadata_source":"pith","pith_arxiv_id":"2502.13189","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","venue":"cs.LG","work_id":"de16df2d-eb7f-429d-82c7-8e4bf5183193","year":2025},"citing_paper":{"arxiv_id":"2510.18830","last_updated":"2026-05-19T17:27:20Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T17:25:32Z","title":"MTraining: Distributed Dynamic Sparse Attention for Efficient Ultra-Long Context Training","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-21T19:44:04.833504Z"},"links":{"cited_paper":"/paper/2502.13189","citing_paper":"/paper/2510.18830"},"observation_digest":"sha256:6606fcc2f11c7d9e123270d4c8d7e7746ff1e82b3a58c72e15a9e7342e97ddfd","observation_id":"52c40fb4-c89c-4206-aa23-b0b1a830503d","resolution":{"observed_at":"2026-05-21T19:44:19.643653Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"cited_work":{"arxiv_id":"2502.13189","doi":"10.48550/arxiv.2502.13189","metadata_source":"pith","pith_arxiv_id":"2502.13189","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","venue":"cs.LG","work_id":"de16df2d-eb7f-429d-82c7-8e4bf5183193","year":2025},"citing_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-13T23:49:10.555255Z"},"links":{"cited_paper":"/paper/2502.13189","citing_paper":"/paper/2510.26692"},"observation_digest":"sha256:43a1526b2fe4076d0a1adaa2b2ce1fbdeffdb6fe4ad3b7b14166c0548f0bbc81","observation_id":"2242e950-55d2-4337-8d75-0495dc20700b","resolution":{"observed_at":"2026-05-16T06:15:46.352230Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"cited_work":{"arxiv_id":"2502.13189","doi":"10.48550/arxiv.2502.13189","metadata_source":"pith","pith_arxiv_id":"2502.13189","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","venue":"cs.LG","work_id":"de16df2d-eb7f-429d-82c7-8e4bf5183193","year":2025},"citing_paper":{"arxiv_id":"2512.12602","last_updated":"2026-05-08T15:47:57Z","snapshot_observed_at":"2026-07-06T22:38:59.725645Z","submitted_at":"2025-12-14T08:51:02Z","title":"Exact Flow Linear Attention: Exact Solution from Continuous-Time Dynamics","version":4},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-16T23:06:27.535997Z"},"links":{"cited_paper":"/paper/2502.13189","citing_paper":"/paper/2512.12602"},"observation_digest":"sha256:3d72b6ebc90fb2d999e2c6eb656ba2047fb01b6f8fc7526de79d5c5bec87641b","observation_id":"fce0a8bf-9db7-4480-88c1-caec5d6e0e5b","resolution":{"observed_at":"2026-05-16T23:08:39.758825Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"cited_work":{"arxiv_id":"2502.13189","doi":"10.48550/arxiv.2502.13189","metadata_source":"pith","pith_arxiv_id":"2502.13189","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","venue":"cs.LG","work_id":"de16df2d-eb7f-429d-82c7-8e4bf5183193","year":2025},"citing_paper":{"arxiv_id":"2512.13368","last_updated":"2026-05-22T09:00:57Z","snapshot_observed_at":"2026-08-02T00:54:15.217111Z","submitted_at":"2025-12-15T14:23:57Z","title":"BlossomRec: Block-level Fused Sparse Attention Mechanism for Sequential Recommendations","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-25T07:20:46.517218Z"},"links":{"cited_paper":"/paper/2502.13189","citing_paper":"/paper/2512.13368"},"observation_digest":"sha256:9c9981286861513ec6ce5412b55b1126887bba9cd4ca363fc9613e1ff979e09c","observation_id":"951f5481-db43-4982-99fb-16529f1273ca","resolution":{"observed_at":"2026-05-25T07:26:42.182634Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13189","snapshot_observed_at":"2026-08-03T15:46:09.903579Z","title":"Moba: Mixture of block attention for long-context llms.arXiv preprint arXiv:2502.13189, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.15702","last_updated":"2026-07-01T03:39:09Z","snapshot_observed_at":"2026-08-03T15:46:03.731716Z","submitted_at":"2025-12-17T18:53:29Z","title":"End-to-End Training for Autoregressive Video Diffusion via Self-Resampling","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-03T15:46:09.903579Z"},"links":{"cited_paper":"/paper/2502.13189","citing_paper":"/paper/2512.15702"},"observation_digest":"sha256:ab063b5ce1f7f2c9414c1bb0e15e5a15abecd676fbea28bf7a0990eba433a07f","observation_id":"c3fb043c-b8f9-4c19-90c8-534aa5a0ee3e","resolution":{"observed_at":"2026-08-03T15:46:09.903579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13189","snapshot_observed_at":"2026-08-03T15:35:15.553731Z","title":"Moba: Mixture of block attention for long- context llms.arXiv preprint arXiv:2502.13189, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.16615","last_updated":"2026-07-23T12:12:25Z","snapshot_observed_at":"2026-08-03T15:35:12.338904Z","submitted_at":"2025-12-18T14:53:12Z","title":"Trainable Log-linear Sparse Attention for Efficient Diffusion Transformers","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T15:35:15.553731Z"},"links":{"cited_paper":"/paper/2502.13189","citing_paper":"/paper/2512.16615"},"observation_digest":"sha256:ef12c5d3ea1f01d5723aa4c94ac61a49f4ebfe9fae509622b2058196ce9e5910","observation_id":"9f28409e-6f4e-4de5-a9df-3a649259673c","resolution":{"observed_at":"2026-08-03T15:35:15.553731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"cited_work":{"arxiv_id":"2502.13189","doi":"10.48550/arxiv.2502.13189","metadata_source":"pith","pith_arxiv_id":"2502.13189","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","venue":"cs.LG","work_id":"de16df2d-eb7f-429d-82c7-8e4bf5183193","year":2025},"citing_paper":{"arxiv_id":"2602.01219","last_updated":"2026-05-09T11:14:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-01T13:21:53Z","title":"Mixture-of-Top-k Attention: Efficient Attention via Scalable Fast Weights","version":5},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-16T08:51:25.375847Z"},"links":{"cited_paper":"/paper/2502.13189","citing_paper":"/paper/2602.01219"},"observation_digest":"sha256:d4d2b9344d3dfded3b8cf87ecbc1173a61a2a4a219f38bc6f1302f3b914a06d2","observation_id":"6ac34134-e03a-4309-825f-d9ee75fa499b","resolution":{"observed_at":"2026-05-16T08:52:37.649073Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13189","snapshot_observed_at":"2026-08-03T04:55:42.148739Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.03681","last_updated":"2026-06-02T17:25:15Z","snapshot_observed_at":"2026-08-03T04:55:39.986463Z","submitted_at":"2026-02-03T16:02:50Z","title":"Neural Attention Search Linear: Towards Adaptive Token-Level Hybrid Attention Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T04:55:42.148739Z"},"links":{"cited_paper":"/paper/2502.13189","citing_paper":"/paper/2602.03681"},"observation_digest":"sha256:c1edb27f8460fb4e4da37e09f7cb48c893e5a2217e1846e2a0c346f528225ecf","observation_id":"62b64b26-4dca-463c-9f29-07274483fd75","resolution":{"observed_at":"2026-08-03T04:55:42.148739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"cited_work":{"arxiv_id":"2502.13189","doi":"10.48550/arxiv.2502.13189","metadata_source":"pith","pith_arxiv_id":"2502.13189","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","venue":"cs.LG","work_id":"de16df2d-eb7f-429d-82c7-8e4bf5183193","year":2025},"citing_paper":{"arxiv_id":"2602.18196","last_updated":"2026-05-28T10:28:00Z","snapshot_observed_at":"2026-08-02T22:05:41.622495Z","submitted_at":"2026-02-20T13:09:49Z","title":"RAT+: Train Dense, Infer Sparse -- Recurrence Augmented Attention for Dilated Inference","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-15T20:59:33.902420Z"},"links":{"cited_paper":"/paper/2502.13189","citing_paper":"/paper/2602.18196"},"observation_digest":"sha256:5d7aca5cf255af02f763b2c5fad5102a0d4e154a3ffb11cd031e47d3ca801f3d","observation_id":"3dff839e-e01b-490d-8368-7674fa151a69","resolution":{"observed_at":"2026-05-16T06:15:46.352230Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"cited_work":{"arxiv_id":"2502.13189","doi":"10.48550/arxiv.2502.13189","metadata_source":"pith","pith_arxiv_id":"2502.13189","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","venue":"cs.LG","work_id":"de16df2d-eb7f-429d-82c7-8e4bf5183193","year":2025},"citing_paper":{"arxiv_id":"2602.18196","last_updated":"2026-05-28T10:28:00Z","snapshot_observed_at":"2026-08-02T22:05:41.622495Z","submitted_at":"2026-02-20T13:09:49Z","title":"RAT+: Train Dense, Infer Sparse -- Recurrence Augmented Attention for Dilated Inference","version":4},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-21T12:45:27.150368Z"},"links":{"cited_paper":"/paper/2502.13189","citing_paper":"/paper/2602.18196"},"observation_digest":"sha256:8f877ba371097b451ea58ac2d09fdbcf08039531f02cb48cb32dc09e75d5c2f8","observation_id":"05a76c18-e14d-406b-8671-3280f3a5a4fe","resolution":{"observed_at":"2026-05-21T12:50:09.458960Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13189","snapshot_observed_at":"2026-08-02T22:05:43.025992Z","title":"Moba: Mixture of block attention for long-context llms.arXiv preprint arXiv:2502.13189,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.18196","last_updated":"2026-05-28T10:28:00Z","snapshot_observed_at":"2026-08-02T22:05:41.622495Z","submitted_at":"2026-02-20T13:09:49Z","title":"RAT+: Train Dense, Infer Sparse -- Recurrence Augmented Attention for Dilated Inference","version":5},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-02T22:05:43.025992Z"},"links":{"cited_paper":"/paper/2502.13189","citing_paper":"/paper/2602.18196"},"observation_digest":"sha256:399ac1a5674336ca709bb104e00a30b620770e29ad13589c4848c30f6b137020","observation_id":"703fce07-2eb4-422f-a5d2-54418911d808","resolution":{"observed_at":"2026-08-02T22:05:43.025992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13189","snapshot_observed_at":"2026-07-13T16:19:49.419805Z","title":"Moba: Mixture of block attention for long-context llms.arXiv preprint arXiv:2502.13189,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.28457","last_updated":"2026-06-24T09:39:21Z","snapshot_observed_at":"2026-08-02T09:49:06.093893Z","submitted_at":"2026-03-30T13:59:38Z","title":"Three non-Hermitian random matrix universality classes of complex edge statistics: Spacing ratios and distributions","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-13T16:19:49.419805Z"},"links":{"cited_paper":"/paper/2502.13189","citing_paper":"/paper/2603.28457"},"observation_digest":"sha256:e6abe29eef264ff14364675a24cd84018ce9c92856a5dc52eb2d8bf0d9b4b646","observation_id":"8b64b4c0-d99c-4bbc-8a2d-e46dfa70daa8","resolution":{"observed_at":"2026-07-13T16:19:49.419805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"cited_work":{"arxiv_id":"2502.13189","doi":"10.48550/arxiv.2502.13189","metadata_source":"pith","pith_arxiv_id":"2502.13189","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","venue":"cs.LG","work_id":"de16df2d-eb7f-429d-82c7-8e4bf5183193","year":2025},"citing_paper":{"arxiv_id":"2603.28458","last_updated":"2026-04-06T09:47:34Z","snapshot_observed_at":"2026-08-02T11:27:36.874895Z","submitted_at":"2026-03-30T13:59:51Z","title":"HISA: Efficient Hierarchical Indexing for Fine-Grained Sparse Attention","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-14T21:40:28.854082Z"},"links":{"cited_paper":"/paper/2502.13189","citing_paper":"/paper/2603.28458"},"observation_digest":"sha256:df34e089317dd5897a381c4b7317bf454d68a53a6a37ca8f73f098e7558c260e","observation_id":"db90e36b-b2db-409e-9a2d-ae47d675ee4b","resolution":{"observed_at":"2026-05-16T06:15:46.352230Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"cited_work":{"arxiv_id":"2502.13189","doi":"10.48550/arxiv.2502.13189","metadata_source":"pith","pith_arxiv_id":"2502.13189","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","venue":"cs.LG","work_id":"de16df2d-eb7f-429d-82c7-8e4bf5183193","year":2025},"citing_paper":{"arxiv_id":"2604.03260","last_updated":"2026-04-29T02:07:19Z","snapshot_observed_at":"2026-08-01T18:14:45.126825Z","submitted_at":"2026-03-12T14:06:04Z","title":"Why Attend to Everything? Focus is the Key","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-05-15T11:55:36.701888Z"},"links":{"cited_paper":"/paper/2502.13189","citing_paper":"/paper/2604.03260"},"observation_digest":"sha256:6a45cbad745909a0e95f421fab22d98d7e2a7301179bacf47ab14f2141cd30c6","observation_id":"e37bf27e-2c58-4303-a673-69373a4e434d","resolution":{"observed_at":"2026-05-16T06:15:46.352230Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"cited_work":{"arxiv_id":"2502.13189","doi":"10.48550/arxiv.2502.13189","metadata_source":"pith","pith_arxiv_id":"2502.13189","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","venue":"cs.LG","work_id":"de16df2d-eb7f-429d-82c7-8e4bf5183193","year":2025},"citing_paper":{"arxiv_id":"2604.08077","last_updated":"2026-04-09T10:48:32Z","snapshot_observed_at":"2026-07-06T22:57:13.745326Z","submitted_at":"2026-04-09T10:48:32Z","title":"AdaSpark: Adaptive Sparsity for Efficient Long-Video Understanding","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-10T17:21:47.439019Z"},"links":{"cited_paper":"/paper/2502.13189","citing_paper":"/paper/2604.08077"},"observation_digest":"sha256:60618fbba62fc00f7bf919a790e908f179a87da08ad37a77b4644358fd87107c","observation_id":"96fa5758-9f5b-41f7-a1cc-2deed830a7e0","resolution":{"observed_at":"2026-05-16T06:15:46.352230Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"cited_work":{"arxiv_id":"2502.13189","doi":"10.48550/arxiv.2502.13189","metadata_source":"pith","pith_arxiv_id":"2502.13189","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","venue":"cs.LG","work_id":"de16df2d-eb7f-429d-82c7-8e4bf5183193","year":2025},"citing_paper":{"arxiv_id":"2604.12798","last_updated":"2026-04-14T14:28:50Z","snapshot_observed_at":"2026-07-06T23:00:56.449281Z","submitted_at":"2026-04-14T14:28:50Z","title":"VFA: Relieving Vector Operations in Flash Attention with Global Maximum Pre-computation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T16:10:40.858525Z"},"links":{"cited_paper":"/paper/2502.13189","citing_paper":"/paper/2604.12798"},"observation_digest":"sha256:b56f2d503e2f439ef0e85e9671bb3f53969de5105345b7ea6b0580337e5a2819","observation_id":"70fc0503-e8dc-4fae-877f-dc822a24bd59","resolution":{"observed_at":"2026-05-16T06:15:46.352230Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"cited_work":{"arxiv_id":"2502.13189","doi":"10.48550/arxiv.2502.13189","metadata_source":"pith","pith_arxiv_id":"2502.13189","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","venue":"cs.LG","work_id":"de16df2d-eb7f-429d-82c7-8e4bf5183193","year":2025},"citing_paper":{"arxiv_id":"2604.20920","last_updated":"2026-06-26T06:02:50Z","snapshot_observed_at":"2026-07-06T23:07:36.996629Z","submitted_at":"2026-04-22T04:22:32Z","title":"Simplified Sparse Attention via Gist Tokens","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-05-10T00:33:20.234142Z"},"links":{"cited_paper":"/paper/2502.13189","citing_paper":"/paper/2604.20920"},"observation_digest":"sha256:c27d17c37b4f59cf3c233caa98d860e53247ba007e425b8ad4bb679662bb71e4","observation_id":"0d330da9-381f-4a9f-91e7-9705836464b4","resolution":{"observed_at":"2026-05-16T06:15:46.352230Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"cited_work":{"arxiv_id":"2502.13189","doi":"10.48550/arxiv.2502.13189","metadata_source":"pith","pith_arxiv_id":"2502.13189","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","venue":"cs.LG","work_id":"de16df2d-eb7f-429d-82c7-8e4bf5183193","year":2025},"citing_paper":{"arxiv_id":"2604.22312","last_updated":"2026-04-24T07:46:25Z","snapshot_observed_at":"2026-07-06T23:08:42.301487Z","submitted_at":"2026-04-24T07:46:25Z","title":"Guess-Verify-Refine: Data-Aware Top-K for Sparse-Attention Decoding on Blackwell via Temporal Correlation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-08T09:58:45.903396Z"},"links":{"cited_paper":"/paper/2502.13189","citing_paper":"/paper/2604.22312"},"observation_digest":"sha256:7d61e03571b44efd7eed220c20470544cc35d5e522210c454a77efce7aab6881","observation_id":"eb1bedcb-bb67-422e-9551-47fcf22d9926","resolution":{"observed_at":"2026-05-16T06:15:46.352230Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"cited_work":{"arxiv_id":"2502.13189","doi":"10.48550/arxiv.2502.13189","metadata_source":"pith","pith_arxiv_id":"2502.13189","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","venue":"cs.LG","work_id":"de16df2d-eb7f-429d-82c7-8e4bf5183193","year":2025},"citing_paper":{"arxiv_id":"2604.24820","last_updated":"2026-04-27T14:06:21Z","snapshot_observed_at":"2026-07-31T06:39:38.066325Z","submitted_at":"2026-04-27T14:06:21Z","title":"Salca: A Sparsity-Aware Hardware Accelerator for Efficient Long-Context Attention Decoding","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-07T17:56:39.124969Z"},"links":{"cited_paper":"/paper/2502.13189","citing_paper":"/paper/2604.24820"},"observation_digest":"sha256:cc8409a98db58969eb6e05afce63981e845972c399a6f4f31715ac2720d7c34e","observation_id":"46165425-c769-4cba-88ab-9f9a6f8c515d","resolution":{"observed_at":"2026-05-16T06:15:46.352230Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"cited_work":{"arxiv_id":"2502.13189","doi":"10.48550/arxiv.2502.13189","metadata_source":"pith","pith_arxiv_id":"2502.13189","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","venue":"cs.LG","work_id":"de16df2d-eb7f-429d-82c7-8e4bf5183193","year":2025},"citing_paper":{"arxiv_id":"2605.05888","last_updated":"2026-05-07T08:58:51Z","snapshot_observed_at":"2026-07-06T23:18:26.864785Z","submitted_at":"2026-05-07T08:58:51Z","title":"MoE-Hub: Taming Software Complexity for Seamless MoE Overlap with Hardware-Accelerated Communication on Multi-GPU Systems","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-08T04:29:57.548702Z"},"links":{"cited_paper":"/paper/2502.13189","citing_paper":"/paper/2605.05888"},"observation_digest":"sha256:031adcbff5d452768473dd88670ee8bbdbf7b8747cce90ee769ccde16e87d117","observation_id":"80e7fe14-75c1-45c5-bdf0-f2ff75546026","resolution":{"observed_at":"2026-05-16T06:15:46.352230Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"cited_work":{"arxiv_id":"2502.13189","doi":"10.48550/arxiv.2502.13189","metadata_source":"pith","pith_arxiv_id":"2502.13189","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","venue":"cs.LG","work_id":"de16df2d-eb7f-429d-82c7-8e4bf5183193","year":2025},"citing_paper":{"arxiv_id":"2605.06221","last_updated":"2026-05-07T13:18:08Z","snapshot_observed_at":"2026-08-04T15:36:16.480613Z","submitted_at":"2026-05-07T13:18:08Z","title":"UniPrefill: Universal Long-Context Prefill Acceleration via Block-wise Dynamic Sparsification","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-08T10:43:01.724760Z"},"links":{"cited_paper":"/paper/2502.13189","citing_paper":"/paper/2605.06221"},"observation_digest":"sha256:4681f198b5528bdc18b1ea1ae6be702b82285e5575cfa6444aa5bc78e7732881","observation_id":"59a50ae5-32e2-4822-9612-85474f9aebdd","resolution":{"observed_at":"2026-05-16T06:15:46.352230Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"cited_work":{"arxiv_id":"2502.13189","doi":"10.48550/arxiv.2502.13189","metadata_source":"pith","pith_arxiv_id":"2502.13189","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","venue":"cs.LG","work_id":"de16df2d-eb7f-429d-82c7-8e4bf5183193","year":2025},"citing_paper":{"arxiv_id":"2605.06554","last_updated":"2026-05-07T16:49:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-07T16:49:28Z","title":"Long Context Pre-Training with Lighthouse Attention","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-08T10:10:38.610613Z"},"links":{"cited_paper":"/paper/2502.13189","citing_paper":"/paper/2605.06554"},"observation_digest":"sha256:9ae12c6e1d9c8b995a30af3a8b4f96576575a6477817c1c16aa7b74664ff5c20","observation_id":"11ef081f-4157-4478-be15-0655e734f5cb","resolution":{"observed_at":"2026-05-16T06:15:46.352230Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"cited_work":{"arxiv_id":"2502.13189","doi":"10.48550/arxiv.2502.13189","metadata_source":"pith","pith_arxiv_id":"2502.13189","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","venue":"cs.LG","work_id":"de16df2d-eb7f-429d-82c7-8e4bf5183193","year":2025},"citing_paper":{"arxiv_id":"2605.07363","last_updated":"2026-05-08T07:19:34Z","snapshot_observed_at":"2026-07-06T23:19:46.018236Z","submitted_at":"2026-05-08T07:19:34Z","title":"MISA: Mixture of Indexer Sparse Attention for Long-Context LLM Inference","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-11T02:27:55.991919Z"},"links":{"cited_paper":"/paper/2502.13189","citing_paper":"/paper/2605.07363"},"observation_digest":"sha256:382535d75ac718d58f3082e30106033f146b839b9471c1831b9928c3f8b08f21","observation_id":"b0897f00-1ee1-4dca-8059-d00e17609658","resolution":{"observed_at":"2026-05-16T06:15:46.352230Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"cited_work":{"arxiv_id":"2502.13189","doi":"10.48550/arxiv.2502.13189","metadata_source":"pith","pith_arxiv_id":"2502.13189","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","venue":"cs.LG","work_id":"de16df2d-eb7f-429d-82c7-8e4bf5183193","year":2025},"citing_paper":{"arxiv_id":"2605.07719","last_updated":"2026-05-08T13:24:39Z","snapshot_observed_at":"2026-07-31T02:35:55.019423Z","submitted_at":"2026-05-08T13:24:39Z","title":"An Efficient Hybrid Sparse Attention with CPU-GPU Parallelism for Long-Context Inference","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-11T02:56:28.828593Z"},"links":{"cited_paper":"/paper/2502.13189","citing_paper":"/paper/2605.07719"},"observation_digest":"sha256:09754cfe9fd6dbeea1e5ca5354047280a3ee396d565a76022ef9f734ee17e41d","observation_id":"a8495edb-0293-4b3b-b588-6a2420b73829","resolution":{"observed_at":"2026-05-16T06:15:46.352230Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"cited_work":{"arxiv_id":"2502.13189","doi":"10.48550/arxiv.2502.13189","metadata_source":"pith","pith_arxiv_id":"2502.13189","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","venue":"cs.LG","work_id":"de16df2d-eb7f-429d-82c7-8e4bf5183193","year":2025},"citing_paper":{"arxiv_id":"2605.12110","last_updated":"2026-05-12T13:23:55Z","snapshot_observed_at":"2026-07-06T23:23:48.960874Z","submitted_at":"2026-05-12T13:23:55Z","title":"AB-Sparse: Sparse Attention with Adaptive Block Size for Accurate and Efficient Long-Context Inference","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-13T04:42:26.433689Z"},"links":{"cited_paper":"/paper/2502.13189","citing_paper":"/paper/2605.12110"},"observation_digest":"sha256:e4eefb7d8dd8c207b9e41872151a5d85db0d685630dac5b4a6a954d1c6a3b517","observation_id":"f66b317f-425c-486d-89b2-23f33c98abef","resolution":{"observed_at":"2026-05-16T06:15:46.352230Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"cited_work":{"arxiv_id":"2502.13189","doi":"10.48550/arxiv.2502.13189","metadata_source":"pith","pith_arxiv_id":"2502.13189","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","venue":"cs.LG","work_id":"de16df2d-eb7f-429d-82c7-8e4bf5183193","year":2025},"citing_paper":{"arxiv_id":"2605.12496","last_updated":"2026-05-12T17:59:51Z","snapshot_observed_at":"2026-07-06T23:24:08.763444Z","submitted_at":"2026-05-12T17:59:51Z","title":"CausalCine: Real-Time Autoregressive Generation for Multi-Shot Video Narratives","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-13T05:38:21.587653Z"},"links":{"cited_paper":"/paper/2502.13189","citing_paper":"/paper/2605.12496"},"observation_digest":"sha256:0d5325890aabdd7c9491081066a7fbe4fb3938a28ee38b3e0cf167585f418ea2","observation_id":"528c7a79-a5f3-4fd2-a759-949c7e27a743","resolution":{"observed_at":"2026-05-16T06:15:46.352230Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"cited_work":{"arxiv_id":"2502.13189","doi":"10.48550/arxiv.2502.13189","metadata_source":"pith","pith_arxiv_id":"2502.13189","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","venue":"cs.LG","work_id":"de16df2d-eb7f-429d-82c7-8e4bf5183193","year":2025},"citing_paper":{"arxiv_id":"2605.15684","last_updated":"2026-05-15T07:13:27Z","snapshot_observed_at":"2026-08-02T22:46:51.504070Z","submitted_at":"2026-05-15T07:13:27Z","title":"ElasticDiT: Efficient Diffusion Transformers via Elastic Architecture and Sparse Attention for High-Resolution Image Generation on Mobile Devices","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-05-20T20:00:27.987481Z"},"links":{"cited_paper":"/paper/2502.13189","citing_paper":"/paper/2605.15684"},"observation_digest":"sha256:16273c9414899d73748aa2595a64901b82a25575470c88e59dd9d2b85e24a3b5","observation_id":"0fefc4be-0bbb-4834-9867-18a5d02daa44","resolution":{"observed_at":"2026-05-20T20:03:43.898122Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"cited_work":{"arxiv_id":"2502.13189","doi":"10.48550/arxiv.2502.13189","metadata_source":"pith","pith_arxiv_id":"2502.13189","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","venue":"cs.LG","work_id":"de16df2d-eb7f-429d-82c7-8e4bf5183193","year":2025},"citing_paper":{"arxiv_id":"2605.16839","last_updated":"2026-05-16T06:47:41Z","snapshot_observed_at":"2026-07-06T23:27:57.805018Z","submitted_at":"2026-05-16T06:47:41Z","title":"CompactAttention: Accelerating Chunked Prefill with Block-Union KV Selection","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-19T21:19:31.263068Z"},"links":{"cited_paper":"/paper/2502.13189","citing_paper":"/paper/2605.16839"},"observation_digest":"sha256:74f366bc434fa63cf64e585206c1046c5080776a26503f428fb566f274f2fea2","observation_id":"ac3ca924-8a70-4938-bbff-cf5ff5feb2c8","resolution":{"observed_at":"2026-05-19T21:22:47.954338Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"cited_work":{"arxiv_id":"2502.13189","doi":"10.48550/arxiv.2502.13189","metadata_source":"pith","pith_arxiv_id":"2502.13189","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","venue":"cs.LG","work_id":"de16df2d-eb7f-429d-82c7-8e4bf5183193","year":2025},"citing_paper":{"arxiv_id":"2605.18071","last_updated":"2026-05-18T08:54:16Z","snapshot_observed_at":"2026-08-02T15:32:20.092680Z","submitted_at":"2026-05-18T08:54:16Z","title":"KVDrive: A Holistic Multi-Tier KV Cache Management System for Long-Context LLM Inference","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-20T11:13:46.098095Z"},"links":{"cited_paper":"/paper/2502.13189","citing_paper":"/paper/2605.18071"},"observation_digest":"sha256:7bfdef689769819fea572b1858fa3569b260decb29f4c913c02f7b63c76857a6","observation_id":"8d377bdb-ab8e-4879-bd48-443a7f4da7bb","resolution":{"observed_at":"2026-05-20T11:18:13.985129Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"cited_work":{"arxiv_id":"2502.13189","doi":"10.48550/arxiv.2502.13189","metadata_source":"pith","pith_arxiv_id":"2502.13189","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","venue":"cs.LG","work_id":"de16df2d-eb7f-429d-82c7-8e4bf5183193","year":2025},"citing_paper":{"arxiv_id":"2605.25475","last_updated":"2026-05-25T06:29:43Z","snapshot_observed_at":"2026-08-02T08:45:15.831498Z","submitted_at":"2026-05-25T06:29:43Z","title":"IndexMem: Learned KV-Cache Eviction with Latent Memory for Long-Context LLM Inference","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-29T22:03:07.685253Z"},"links":{"cited_paper":"/paper/2502.13189","citing_paper":"/paper/2605.25475"},"observation_digest":"sha256:6bb644aaa1aba29f6465ee2926b646122f3f3240b0c14e1e770e8329960551ed","observation_id":"a4afe736-77b8-4f36-9da0-83346051d342","resolution":{"observed_at":"2026-06-29T22:03:59.891987Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"cited_work":{"arxiv_id":"2502.13189","doi":"10.48550/arxiv.2502.13189","metadata_source":"pith","pith_arxiv_id":"2502.13189","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","venue":"cs.LG","work_id":"de16df2d-eb7f-429d-82c7-8e4bf5183193","year":2025},"citing_paper":{"arxiv_id":"2605.28384","last_updated":"2026-05-27T12:21:28Z","snapshot_observed_at":"2026-08-01T10:47:24.351788Z","submitted_at":"2026-05-27T12:21:28Z","title":"Meta-Attention: Bayesian Per-Token Routing for Efficient Transformer Inference","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-29T14:44:08.335157Z"},"links":{"cited_paper":"/paper/2502.13189","citing_paper":"/paper/2605.28384"},"observation_digest":"sha256:8442943aeb8b96dd4caae9bb32f83e6ec75b9b7284c0c7016007e0ff60d81550","observation_id":"0707ab39-5de4-4e2a-8751-07a87169a7b3","resolution":{"observed_at":"2026-06-29T14:53:31.442700Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"cited_work":{"arxiv_id":"2502.13189","doi":"10.48550/arxiv.2502.13189","metadata_source":"pith","pith_arxiv_id":"2502.13189","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","venue":"cs.LG","work_id":"de16df2d-eb7f-429d-82c7-8e4bf5183193","year":2025},"citing_paper":{"arxiv_id":"2605.30325","last_updated":"2026-05-28T17:57:07Z","snapshot_observed_at":"2026-07-06T23:39:38.845840Z","submitted_at":"2026-05-28T17:57:07Z","title":"Veda: Scalable Video Diffusion via Distilled Sparse Attention","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-29T07:54:13.390911Z"},"links":{"cited_paper":"/paper/2502.13189","citing_paper":"/paper/2605.30325"},"observation_digest":"sha256:03336fb2b3e4b0a5b32138b63fbc825aad079fa4f88267e5b17800cdad8add64","observation_id":"fa47025f-39c9-48de-9077-b6e51fe0753d","resolution":{"observed_at":"2026-06-29T08:03:14.703191Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"cited_work":{"arxiv_id":"2502.13189","doi":"10.48550/arxiv.2502.13189","metadata_source":"pith","pith_arxiv_id":"2502.13189","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","venue":"cs.LG","work_id":"de16df2d-eb7f-429d-82c7-8e4bf5183193","year":2025},"citing_paper":{"arxiv_id":"2605.31463","last_updated":"2026-05-29T15:52:58Z","snapshot_observed_at":"2026-08-03T10:19:30.254575Z","submitted_at":"2026-05-29T15:52:58Z","title":"PithTrain: A Compact and Agent-Native MoE Training System","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-28T23:12:14.193089Z"},"links":{"cited_paper":"/paper/2502.13189","citing_paper":"/paper/2605.31463"},"observation_digest":"sha256:35f4f341cbcf1ed91efc9824c96519d5878f430f4aca6c21493f25b3f2f976d1","observation_id":"9d0a0992-787b-4667-b0e1-844344b5fcb3","resolution":{"observed_at":"2026-06-28T23:12:46.518850Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"cited_work":{"arxiv_id":"2502.13189","doi":"10.48550/arxiv.2502.13189","metadata_source":"pith","pith_arxiv_id":"2502.13189","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","venue":"cs.LG","work_id":"de16df2d-eb7f-429d-82c7-8e4bf5183193","year":2025},"citing_paper":{"arxiv_id":"2606.06453","last_updated":"2026-06-04T17:48:17Z","snapshot_observed_at":"2026-07-06T23:46:15.936608Z","submitted_at":"2026-06-04T17:48:17Z","title":"Vortex: Efficient and Programmable Sparse Attention Serving for AI Agents","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-28T01:07:14.691347Z"},"links":{"cited_paper":"/paper/2502.13189","citing_paper":"/paper/2606.06453"},"observation_digest":"sha256:e693477efd1146edb9563ef32ba92bedabc96fc597ad78eaab2c61992705bf98","observation_id":"f82cc046-74f5-4be5-9c97-881ca97d28ce","resolution":{"observed_at":"2026-07-02T13:36:59.493601Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"cited_work":{"arxiv_id":"2502.13189","doi":"10.48550/arxiv.2502.13189","metadata_source":"pith","pith_arxiv_id":"2502.13189","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","venue":"cs.LG","work_id":"de16df2d-eb7f-429d-82c7-8e4bf5183193","year":2025},"citing_paper":{"arxiv_id":"2606.06467","last_updated":"2026-06-04T17:54:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-04T17:54:04Z","title":"You Only Index Once: Cross-Layer Sparse Attention with Shared Routing","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-28T01:06:04.896501Z"},"links":{"cited_paper":"/paper/2502.13189","citing_paper":"/paper/2606.06467"},"observation_digest":"sha256:2522636be3bcead95abedc8d3e4bf3b5d2e1c8789d6f6a81fa62459c70fe7152","observation_id":"98d16934-afb1-4c7a-97c6-94fa64e93098","resolution":{"observed_at":"2026-07-02T13:36:59.573386Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"cited_work":{"arxiv_id":"2502.13189","doi":"10.48550/arxiv.2502.13189","metadata_source":"pith","pith_arxiv_id":"2502.13189","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","venue":"cs.LG","work_id":"de16df2d-eb7f-429d-82c7-8e4bf5183193","year":2025},"citing_paper":{"arxiv_id":"2606.11634","last_updated":"2026-06-10T03:56:03Z","snapshot_observed_at":"2026-08-02T13:37:43.737297Z","submitted_at":"2026-06-10T03:56:03Z","title":"Architecture-Aware Reinforcement Learning Makes Sliding-Window Attention Competitive in Math Reasoning","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-06-27T10:18:54.163862Z"},"links":{"cited_paper":"/paper/2502.13189","citing_paper":"/paper/2606.11634"},"observation_digest":"sha256:ba34b3c164cdea16e2745db8e9dd3f203e5718363bf3e543df7a7fe1c7704733","observation_id":"17684f85-2612-453e-9fd9-65cb7539bca8","resolution":{"observed_at":"2026-07-03T09:47:59.831441Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"cited_work":{"arxiv_id":"2502.13189","doi":"10.48550/arxiv.2502.13189","metadata_source":"pith","pith_arxiv_id":"2502.13189","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","venue":"cs.LG","work_id":"de16df2d-eb7f-429d-82c7-8e4bf5183193","year":2025},"citing_paper":{"arxiv_id":"2606.23019","last_updated":"2026-06-22T08:32:07Z","snapshot_observed_at":"2026-07-31T17:52:55.153198Z","submitted_at":"2026-06-22T08:32:07Z","title":"ScalingAttention: Discovering Intrinsic Sparse Attention Topology for Video Diffusion Transformers","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-06-26T09:22:55.731241Z"},"links":{"cited_paper":"/paper/2502.13189","citing_paper":"/paper/2606.23019"},"observation_digest":"sha256:2dce2ee1bc11f5b2605e5816f001021d2d58c12e21f0c053e1d0bbfa4322ad98","observation_id":"10e7ae0c-ac28-4599-9b2c-29186ff03bae","resolution":{"observed_at":"2026-07-04T09:49:44.824110Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"cited_work":{"arxiv_id":"2502.13189","doi":"10.48550/arxiv.2502.13189","metadata_source":"pith","pith_arxiv_id":"2502.13189","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","venue":"cs.LG","work_id":"de16df2d-eb7f-429d-82c7-8e4bf5183193","year":2025},"citing_paper":{"arxiv_id":"2606.29844","last_updated":"2026-06-29T06:33:37Z","snapshot_observed_at":"2026-08-03T00:15:01.794218Z","submitted_at":"2026-06-29T06:33:37Z","title":"MATCH: Modulating Attention via In-Context Retrieval for Long-Context Transformers","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-06-30T06:11:23.742632Z"},"links":{"cited_paper":"/paper/2502.13189","citing_paper":"/paper/2606.29844"},"observation_digest":"sha256:ee6a44023f87725dde9b2dfe6d8011879db48fd45410f8702e5d904f0822aaf8","observation_id":"cb04915f-b1b4-434e-950a-ce400a613889","resolution":{"observed_at":"2026-06-30T06:14:17.946951Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"cited_work":{"arxiv_id":"2502.13189","doi":"10.48550/arxiv.2502.13189","metadata_source":"pith","pith_arxiv_id":"2502.13189","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","venue":"cs.LG","work_id":"de16df2d-eb7f-429d-82c7-8e4bf5183193","year":2025},"citing_paper":{"arxiv_id":"2607.01538","last_updated":"2026-07-01T23:38:25Z","snapshot_observed_at":"2026-08-02T05:27:20.501902Z","submitted_at":"2026-07-01T23:38:25Z","title":"Can Language Models Actually Retrieve In-Context? Drowning in Documents at Million Token Scale","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-03T20:43:40.938898Z"},"links":{"cited_paper":"/paper/2502.13189","citing_paper":"/paper/2607.01538"},"observation_digest":"sha256:4dcdddc5e6fd3dc20f7d4752cc4eb38918c619fbb61ae8c62102bee9b72b5240","observation_id":"f0d533e4-affd-46cc-805b-fbec043a26c7","resolution":{"observed_at":"2026-07-03T20:48:55.260804Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13189","snapshot_observed_at":"2026-07-12T05:40:56.557646Z","title":"Zhang, Zhilin Yang, Xinyu Zhou, Mingxing Zhang, and Jiezhong Qiu","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02980","last_updated":"2026-07-03T05:39:00Z","snapshot_observed_at":"2026-08-03T09:31:25.197718Z","submitted_at":"2026-07-03T05:39:00Z","title":"Hierarchical Sparse Attention Done Right: Toward Infinite Context Modeling","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-12T05:40:56.557646Z"},"links":{"cited_paper":"/paper/2502.13189","citing_paper":"/paper/2607.02980"},"observation_digest":"sha256:b0abcd297639d0429f347af70e8a22643daba91fd90500ac5db83d1c2562f8f2","observation_id":"5cb92a38-82cb-45da-9c9c-c78b1ab8dd38","resolution":{"observed_at":"2026-07-12T05:40:56.557646Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13189","snapshot_observed_at":"2026-07-11T22:15:14.580916Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.07724","last_updated":"2026-07-04T20:41:42Z","snapshot_observed_at":"2026-08-02T15:40:18.200445Z","submitted_at":"2026-07-04T20:41:42Z","title":"Uncertainty-gated selection for block-sparse attention","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-07-11T22:15:14.580916Z"},"links":{"cited_paper":"/paper/2502.13189","citing_paper":"/paper/2607.07724"},"observation_digest":"sha256:caac75f4a8ee23003dc95f70cb323d8d00da52159a4262012acdf79f65f1f93a","observation_id":"60420798-09bf-424f-b3cc-063e7a00f118","resolution":{"observed_at":"2026-07-11T22:15:14.580916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"cited_work":{"arxiv_id":"2502.13189","doi":"10.48550/arxiv.2502.13189","metadata_source":"pith","pith_arxiv_id":"2502.13189","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","venue":"cs.LG","work_id":"de16df2d-eb7f-429d-82c7-8e4bf5183193","year":2025},"citing_paper":{"arxiv_id":"2607.08032","last_updated":"2026-07-09T01:15:03Z","snapshot_observed_at":"2026-08-02T16:38:21.894642Z","submitted_at":"2026-07-09T01:15:03Z","title":"What to Keep, What to Forget: A Rate--Distortion View of Memory Compaction in LLMs and Agents","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-07-10T01:26:59.421158Z"},"links":{"cited_paper":"/paper/2502.13189","citing_paper":"/paper/2607.08032"},"observation_digest":"sha256:3aab56a969b0b5ec1cae78a245f6c93407f1fc91c95fff1fa855be1be3cfd1b5","observation_id":"261ad5a0-1847-4a54-a4c9-8b71fb2d2987","resolution":{"observed_at":"2026-07-10T01:36:44.216848Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13189","snapshot_observed_at":"2026-08-01T07:14:36.975183Z","title":"Moba: Mixture of block attention for long-context llms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21692","last_updated":"2026-07-29T14:12:37Z","snapshot_observed_at":"2026-08-03T20:50:16.612190Z","submitted_at":"2026-07-23T17:11:34Z","title":"Learning What Matters: Supervising Global Context Pruning with Causal Evidence Sets","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-01T07:14:36.975183Z"},"links":{"cited_paper":"/paper/2502.13189","citing_paper":"/paper/2607.21692"},"observation_digest":"sha256:9b9ba36e4260c8882e4bbc6f65f12af46efbe20942712f3a2dfb3383b60ef4d6","observation_id":"4dd80a52-b285-43e4-b4ad-8148cfacc908","resolution":{"observed_at":"2026-08-01T07:14:36.975183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13189","snapshot_observed_at":"2026-07-31T11:49:11.707395Z","title":"Zhang, Zhilin Yang, Xinyu Zhou, Mingxing Zhang, and Jiezhong Qiu","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24555","last_updated":"2026-07-27T15:28:52Z","snapshot_observed_at":"2026-08-02T06:50:39.173138Z","submitted_at":"2026-07-27T15:28:52Z","title":"LOCKS: Page-Local Compact Key Summaries for Efficient Long-Context Decoding","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-31T11:49:11.707395Z"},"links":{"cited_paper":"/paper/2502.13189","citing_paper":"/paper/2607.24555"},"observation_digest":"sha256:0cba24434b039ea51d71c4b2ce14112a1a658e38a5cb9ea4eec123ffcf59b8cc","observation_id":"78245182-d1d3-4e19-9e05-613aed85bdd3","resolution":{"observed_at":"2026-07-31T11:49:11.707395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13189","snapshot_observed_at":"2026-07-31T11:04:04.532117Z","title":"URL https://arxiv","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24593","last_updated":"2026-07-27T15:58:07Z","snapshot_observed_at":"2026-08-04T16:51:01.691381Z","submitted_at":"2026-07-27T15:58:07Z","title":"PIVOT: Efficient Query-Group Indexing for Token-Level Sparse Attention","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-07-31T11:04:04.532117Z"},"links":{"cited_paper":"/paper/2502.13189","citing_paper":"/paper/2607.24593"},"observation_digest":"sha256:2081a92dbfe269ed2b5d766680d83ab5ecdcbce33c58fa29e96881b366ad0a48","observation_id":"59aba606-4570-4574-8eb9-a9b4061065c8","resolution":{"observed_at":"2026-07-31T11:04:04.532117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13189","snapshot_observed_at":"2026-08-01T02:37:54.207074Z","title":"Available: https://arxiv.org/abs/2502.13189","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25380","last_updated":"2026-07-28T07:34:53Z","snapshot_observed_at":"2026-08-01T14:23:07.610419Z","submitted_at":"2026-07-28T07:34:53Z","title":"Memory for Large Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T02:37:54.207074Z"},"links":{"cited_paper":"/paper/2502.13189","citing_paper":"/paper/2607.25380"},"observation_digest":"sha256:203fafb810db97bb39b7848c39bde7db395127019403d95c758ac5a4fd11ffc8","observation_id":"5f33fcab-a341-4953-ae6e-5a943bd895d5","resolution":{"observed_at":"2026-08-01T02:37:54.207074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2502.13189/citation-record","integrity":"/paper/2502.13189/integrity","json":"/paper/2502.13189/citation-record.json","paper":"/paper/2502.13189"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T13:07:05.804778Z","title":"Scaling Learning Algorithms Towards","venue":null,"work_id":"bb2761cc-98d0-411b-92f6-803773d64460","year":null},"citing_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-05-16T06:15:46.085555Z"},"links":{"citing_paper":"/paper/2502.13189"},"observation_digest":"sha256:8a11b83d7dca7e13ac35bbd1656982bef9ff5ac97555bc59736cab22db06b847","observation_id":"12e2308a-217e-49c4-a647-8e6d0a944d20","resolution":{"observed_at":"2026-05-16T06:15:46.322837Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T13:07:05.766846Z","title":"and Osindero, Simon and Teh, Yee Whye , journal =","venue":null,"work_id":"0a5921e3-ac4e-46f1-85ae-866119a87be0","year":null},"citing_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-05-16T06:15:46.085555Z"},"links":{"citing_paper":"/paper/2502.13189"},"observation_digest":"sha256:789b9a7f0d43dd73aa3333409c5eb4a9cbbbbf9be76f80a69e0afc02f318d027","observation_id":"5792de7e-bc5b-4143-8d42-b9f68f66d312","resolution":{"observed_at":"2026-05-16T06:15:46.300897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T21:57:45.913036Z","title":"2016 , publisher=","venue":null,"work_id":"cf0899e0-53ee-4591-aae4-f38fa5ac12ad","year":2016},"citing_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-05-16T06:15:46.085555Z"},"links":{"citing_paper":"/paper/2502.13189"},"observation_digest":"sha256:1ba64b5915d10dff0c62e454c491afa5df08f5173ca094441b8994fed29d3cc4","observation_id":"96afa291-3871-48f8-9a08-24a026a7469e","resolution":{"observed_at":"2026-05-16T06:15:46.303270Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.10509","last_updated":"2019-04-23T19:29:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-04-23T19:29:47Z","title":"Generating Long Sequences with Sparse Transformers","version":1},"cited_work":{"arxiv_id":"1904.10509","doi":"10.48550/arxiv.1904.10509","metadata_source":"pith","pith_arxiv_id":"1904.10509","snapshot_observed_at":"2026-07-11T03:27:46.891605Z","title":"Generating Long Sequences with Sparse Transformers","venue":"cs.LG","work_id":"c5b81688-45ee-4a9a-b095-e6290f45cb6c","year":2019},"citing_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-05-16T06:15:46.085555Z"},"links":{"cited_paper":"/paper/1904.10509","citing_paper":"/paper/2502.13189"},"observation_digest":"sha256:136f107e810c4e6cd290e6764119fdfe6c34c9da97ad87f5429d558c354d50a9","observation_id":"34cfb8e2-a36a-4b7a-87d6-af8e8e28c49c","resolution":{"observed_at":"2026-05-16T06:15:46.210118Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-12T21:49:59.71041+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T21:49:59.71041+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.07916","last_updated":"2022-05-03T14:19:03Z","snapshot_observed_at":"2026-07-06T12:18:56.726209Z","submitted_at":"2021-12-15T06:35:29Z","title":"LongT5: Efficient Text-To-Text Transformer for Long Sequences","version":2},"cited_work":{"arxiv_id":"2112.07916","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2112.07916","snapshot_observed_at":"2026-07-04T11:09:46.439387Z","title":"Longt5: Efficient text-to-text transformer for long sequences","venue":null,"work_id":"0afba6c9-0a77-46c8-bc3b-9f16e6992ab8","year":2021},"citing_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-05-16T06:15:46.085555Z"},"links":{"cited_paper":"/paper/2112.07916","citing_paper":"/paper/2502.13189"},"observation_digest":"sha256:b7bee4d218cadc3cfb52e125e05052fc7b9520743e0c2dbe1249f8f4dcc84841","observation_id":"2f741f92-27b3-4a70-a768-9cbfaa59e447","resolution":{"observed_at":"2026-05-16T06:15:46.213645Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T01:20:38.104164Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":"f361e57f-a683-426f-9ca5-cbbcb616d775","year":null},"citing_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-05-16T06:15:46.085555Z"},"links":{"citing_paper":"/paper/2502.13189"},"observation_digest":"sha256:4c8c2af8d8ff369d96df23feb9433f91e863ca926ee419f8c24f15a65ab7b21f","observation_id":"3b5588be-29d5-4f98-a344-922e38631ada","resolution":{"observed_at":"2026-05-16T06:15:46.311157Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02486","last_updated":"2023-07-19T12:25:35Z","snapshot_observed_at":"2026-07-06T15:50:41.385379Z","submitted_at":"2023-07-05T17:59:38Z","title":"LongNet: Scaling Transformers to 1,000,000,000 Tokens","version":2},"cited_work":{"arxiv_id":"2307.02486","doi":"10.48550/arxiv.2307.02486","metadata_source":"arxiv_reference","pith_arxiv_id":"2307.02486","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"arXiv preprint arXiv:2307.02486 (2023)","venue":null,"work_id":"d2bcbcf1-3536-4da3-a03e-007066557381","year":2023},"citing_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-05-16T06:15:46.085555Z"},"links":{"cited_paper":"/paper/2307.02486","citing_paper":"/paper/2502.13189"},"observation_digest":"sha256:adb4c23aebdb6cf2f8e8a251e6e53a8d710a51471dd410d4f59eb13092c60040","observation_id":"514cd672-df6f-4d31-93dc-794f790a38cc","resolution":{"observed_at":"2026-05-16T06:15:46.217139Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.12180","last_updated":"2019-12-20T13:27:27Z","snapshot_observed_at":"2026-07-06T08:47:13.959253Z","submitted_at":"2019-12-20T13:27:27Z","title":"Axial Attention in Multidimensional Transformers","version":1},"cited_work":{"arxiv_id":"1912.12180","doi":null,"metadata_source":"pith","pith_arxiv_id":"1912.12180","snapshot_observed_at":"2026-07-07T21:24:09.333342Z","title":"Axial attention in multidimensional transformers","venue":"cs.CV","work_id":"69d7a080-9410-49f8-a9ef-bb18e909ee8f","year":2019},"citing_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-05-16T06:15:46.085555Z"},"links":{"cited_paper":"/paper/1912.12180","citing_paper":"/paper/2502.13189"},"observation_digest":"sha256:6ca98b52c6bd6f5ca45922b97ac10e86a0fdc509b47f6f12e00468b7a2357f86","observation_id":"9b2bbb8b-ab59-4153-8108-5f7111b2aac5","resolution":{"observed_at":"2026-05-16T06:15:46.220433Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2024 , url =","venue":null,"work_id":"d7655233-6743-4371-864b-d8550cad7f99","year":2024},"citing_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-16T06:15:46.085555Z"},"links":{"citing_paper":"/paper/2502.13189"},"observation_digest":"sha256:22fc50629ea9fbab0a74ef7c7f5d75c5bf74d6d15cfe9d3c4eb19f24edd6d1bb","observation_id":"d2b1cde8-cb34-4e30-b1d1-25e47ff9ed5c","resolution":{"observed_at":"2026-05-16T06:15:46.318192Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":"2004.05150","doi":"10.48550/arxiv.2004.05150","metadata_source":"pith","pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-07-11T03:27:46.681766Z","title":"Longformer: The Long-Document Transformer","venue":"cs.CL","work_id":"abea7a44-6668-4de7-aab6-f53a6e5aa088","year":2020},"citing_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-05-16T06:15:46.085555Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2502.13189"},"observation_digest":"sha256:5ce646e9245a50cd22e7f41c3dfed52f6cddf4ad002cdf2b2d10a4384d76cf6a","observation_id":"6a879985-4ec8-4282-9e4b-f298c61796f2","resolution":{"observed_at":"2026-05-16T06:15:46.223489Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-12T21:49:59.161233+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T21:49:59.161233+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.08483","last_updated":"2020-10-27T16:54:17Z","snapshot_observed_at":"2026-08-04T14:45:39.650238Z","submitted_at":"2020-04-17T23:10:18Z","title":"ETC: Encoding Long and Structured Inputs in Transformers","version":5},"cited_work":{"arxiv_id":"2004.08483","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2004.08483","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2004.08483 , eprint =","venue":null,"work_id":"14b46d96-aa7f-4b49-8896-10940404b98c","year":2004},"citing_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-05-16T06:15:46.085555Z"},"links":{"cited_paper":"/paper/2004.08483","citing_paper":"/paper/2502.13189"},"observation_digest":"sha256:be2c2eb855a72000889027dadbe37779bb0dba58e52eeaa9da448294b67d6d11","observation_id":"ead3599f-f9cc-418f-9179-1c87a3e95737","resolution":{"observed_at":"2026-05-16T06:15:46.226877Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03274","last_updated":"2020-06-05T07:50:40Z","snapshot_observed_at":"2026-08-04T17:38:53.487476Z","submitted_at":"2020-06-05T07:50:40Z","title":"GMAT: Global Memory Augmentation for Transformers","version":1},"cited_work":{"arxiv_id":"2006.03274","doi":"10.48550/arxiv.2006.03274","metadata_source":"arxiv_reference","pith_arxiv_id":"2006.03274","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"arXiv preprint arXiv:2006.03274 , eprint =","venue":null,"work_id":"98408eae-06e2-4781-915c-41237b2aaeca","year":2006},"citing_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-05-16T06:15:46.085555Z"},"links":{"cited_paper":"/paper/2006.03274","citing_paper":"/paper/2502.13189"},"observation_digest":"sha256:90ce639e348bd3add3f5dfefa53e437c02c030364cc178158b576449060dac69","observation_id":"57751407-4cf9-44f8-80a4-c1e854fe1993","resolution":{"observed_at":"2026-05-16T06:15:46.230102Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1902.09113","last_updated":"2022-04-24T08:56:39Z","snapshot_observed_at":"2026-08-04T17:48:12.200183Z","submitted_at":"2019-02-25T07:07:38Z","title":"Star-Transformer","version":3},"cited_work":{"arxiv_id":"1902.09113","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1902.09113","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Star-transformer","venue":null,"work_id":"85d2d792-5ce6-491c-af1b-40f2d6b30669","year":1902},"citing_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-16T06:15:46.085555Z"},"links":{"cited_paper":"/paper/1902.09113","citing_paper":"/paper/2502.13189"},"observation_digest":"sha256:d7da8fcfb008e9ecabdfb7144a7ddfc672caa59fec235a2c70800ce47b36b3a1","observation_id":"efa61b2d-2c40-4970-904f-55f59d316ff6","resolution":{"observed_at":"2026-05-16T06:15:46.233414Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.02972","last_updated":"2020-11-01T12:48:03Z","snapshot_observed_at":"2026-07-06T08:35:25.887801Z","submitted_at":"2019-11-07T16:35:53Z","title":"Blockwise Self-Attention for Long Document Understanding","version":2},"cited_work":{"arxiv_id":"1911.02972","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1911.02972","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:1911.02972 , year=","venue":null,"work_id":"18cfe5a9-c64c-4cfa-8e02-d65e7917b140","year":1911},"citing_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-16T06:15:46.085555Z"},"links":{"cited_paper":"/paper/1911.02972","citing_paper":"/paper/2502.13189"},"observation_digest":"sha256:1838c17cfeb2b48ac96e4645fa9d023cb027ab0c4bbfb9c6ddf079628f4eb054","observation_id":"b25c3b8a-7bf2-427f-b295-d86fed6eab4a","resolution":{"observed_at":"2026-05-16T06:15:46.236730Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.04451","last_updated":"2020-02-18T16:01:18Z","snapshot_observed_at":"2026-07-06T08:50:12.690900Z","submitted_at":"2020-01-13T18:38:28Z","title":"Reformer: The Efficient Transformer","version":2},"cited_work":{"arxiv_id":"2001.04451","doi":"10.48550/arxiv.2001.04451","metadata_source":"pith","pith_arxiv_id":"2001.04451","snapshot_observed_at":"2026-07-11T01:27:45.922878Z","title":"Reformer: The Efficient Transformer","venue":"cs.LG","work_id":"eb3dbae4-931f-40ab-a37b-507a35f42712","year":2020},"citing_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-05-16T06:15:46.085555Z"},"links":{"cited_paper":"/paper/2001.04451","citing_paper":"/paper/2502.13189"},"observation_digest":"sha256:62ea763644e98cb07b7404bd347a74eeab5b31833ff669f6adb055dbd3c8fd24","observation_id":"d6d3db81-2cd1-499b-83b4-646e7fe5ceef","resolution":{"observed_at":"2026-05-16T06:15:46.240130Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-12T21:50:01.947571+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T21:50:01.947571+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Transactions of the Association for Computational Linguistics , volume=","venue":null,"work_id":"40997d40-8995-4592-9bfd-13df0686a249","year":2021},"citing_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-16T06:15:46.085555Z"},"links":{"citing_paper":"/paper/2502.13189"},"observation_digest":"sha256:e405e68144f35aa15119b5478e7fb6050175210352907f5d3537d9ec2d54b905","observation_id":"cfa15bc7-0a08-4c1f-ac1f-bd161827775f","resolution":{"observed_at":"2026-05-16T06:15:46.333948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.08913","last_updated":"2022-03-16T19:54:35Z","snapshot_observed_at":"2026-07-06T12:48:46.626926Z","submitted_at":"2022-03-16T19:54:35Z","title":"Memorizing Transformers","version":1},"cited_work":{"arxiv_id":"2203.08913","doi":null,"metadata_source":"pith","pith_arxiv_id":"2203.08913","snapshot_observed_at":"2026-07-10T01:36:44.169594Z","title":"arXiv preprint arXiv:2203.08913 , year =","venue":"cs.LG","work_id":"bdf3b953-d673-4dec-a588-e1e3613ee7fd","year":2022},"citing_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-05-16T06:15:46.085555Z"},"links":{"cited_paper":"/paper/2203.08913","citing_paper":"/paper/2502.13189"},"observation_digest":"sha256:44c893d26a047d8908a7a86c1b44fbdbad3559c7126dfdbfa0b39b3827b7eab5","observation_id":"e9d33f26-8fdf-4aea-8ac7-b0d98759d246","resolution":{"observed_at":"2026-05-16T06:15:46.243639Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":"35ef0e91-92eb-4d09-a46b-2c46f860be07","year":null},"citing_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-05-16T06:15:46.085555Z"},"links":{"citing_paper":"/paper/2502.13189"},"observation_digest":"sha256:f7bfb108fe3c18521bab2d7aa3f427212deb6e8f513340c6e14c60fc582ca99f","observation_id":"1a12abfc-82e2-4c6c-ab43-34d8fe56e6f9","resolution":{"observed_at":"2026-05-16T06:15:46.338489Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.09752","last_updated":"2023-10-24T00:51:49Z","snapshot_observed_at":"2026-07-06T15:04:31.778399Z","submitted_at":"2023-03-17T03:28:17Z","title":"CoLT5: Faster Long-Range Transformers with Conditional Computation","version":3},"cited_work":{"arxiv_id":"2303.09752","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2303.09752","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ainslie, T","venue":null,"work_id":"ffe0489f-b4bb-4f0a-a69a-f7e79c161dd0","year":2023},"citing_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-16T06:15:46.085555Z"},"links":{"cited_paper":"/paper/2303.09752","citing_paper":"/paper/2502.13189"},"observation_digest":"sha256:640e5b424b7bdd6de610fc06ad27f82cd192dfdf63f9c1643c2e2885001d0ba2","observation_id":"a07c9720-4fe3-42fb-b5fb-18333ad56c1e","resolution":{"observed_at":"2026-05-16T06:15:46.247140Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"International Conference on Machine Learning , pages=","venue":null,"work_id":"f6b5fadb-eba6-4c68-bc48-615aba0ef81d","year":2020},"citing_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-05-16T06:15:46.085555Z"},"links":{"citing_paper":"/paper/2502.13189"},"observation_digest":"sha256:f419a14fd17fb902d849186f5937f3c2523ae5baf1776e4adc46ef877f1a853a","observation_id":"0375d885-57bf-477f-8c30-f5df2fc931df","resolution":{"observed_at":"2026-05-16T06:15:46.343436Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T09:46:13.303040Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":"ef054f60-0ace-4832-8446-4153714ca6f2","year":null},"citing_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-05-16T06:15:46.085555Z"},"links":{"citing_paper":"/paper/2502.13189"},"observation_digest":"sha256:f7984ef95304d4325de941bdca6b0f158a83c8ad96ee90f24192deee9cdc5633","observation_id":"67719e0c-3f05-4aeb-b7a4-1b0c4d3a5174","resolution":{"observed_at":"2026-05-16T06:15:46.346114Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17453","last_updated":"2024-04-07T00:56:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-29T17:59:56Z","title":"Efficient Streaming Language Models with Attention Sinks","version":4},"cited_work":{"arxiv_id":"2309.17453","doi":"10.48550/arxiv.2309.17453","metadata_source":"pith","pith_arxiv_id":"2309.17453","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Efficient Streaming Language Models with Attention Sinks","venue":"cs.CL","work_id":"a8d25452-c237-48c9-88a4-682717c3979a","year":2023},"citing_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-05-16T06:15:46.085555Z"},"links":{"cited_paper":"/paper/2309.17453","citing_paper":"/paper/2502.13189"},"observation_digest":"sha256:5d137567761f23df764148a79325206583b7f3f7effb1e27ea8987d0ed5ee9b3","observation_id":"f15e4b8f-8298-4f3f-b212-0ed879b3308c","resolution":{"observed_at":"2026-05-16T06:15:46.250197Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02490","last_updated":"2024-10-30T14:53:22Z","snapshot_observed_at":"2026-07-06T18:40:27.299063Z","submitted_at":"2024-07-02T17:59:56Z","title":"MInference 1.0: Accelerating Pre-filling for Long-Context LLMs via Dynamic Sparse Attention","version":2},"cited_work":{"arxiv_id":"2407.02490","doi":"10.48550/arxiv.2407.02490","metadata_source":"pith","pith_arxiv_id":"2407.02490","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Abdi, Dongsheng Li, Chin-Yew Lin, Yuqing Yang, and Lili Qiu","venue":"cs.CL","work_id":"ead3d842-61e6-4c52-8e2a-ea9a3986a1af","year":2024},"citing_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-05-16T06:15:46.085555Z"},"links":{"cited_paper":"/paper/2407.02490","citing_paper":"/paper/2502.13189"},"observation_digest":"sha256:9a87dc31c93ab7f8ca20f2b1e15300cd13c4658a431a287220643d945fd64f15","observation_id":"7277d24d-9352-4285-820c-0cb3f6496af7","resolution":{"observed_at":"2026-05-16T06:15:46.253626Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2406.14909","doi":"10.48550/arxiv.2406.14909","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Moa: Mixture of sparse attention for automatic large language model compression.arXiv preprint arXiv:2406.14909","venue":null,"work_id":"adb4db82-49c4-43ed-bd1e-898fc0a4e7c1","year":2024},"citing_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-05-16T06:15:46.085555Z"},"links":{"citing_paper":"/paper/2502.13189"},"observation_digest":"sha256:3fe9fd2fe8dc63c823c6f0475e0dea00abf310910a6c74bade51f51df234e3fb","observation_id":"00ac9eb8-ae5a-4f83-9310-e27de39e5693","resolution":{"observed_at":"2026-05-16T06:15:46.256755Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13276","last_updated":"2025-02-17T02:24:47Z","snapshot_observed_at":"2026-07-06T19:35:04.087584Z","submitted_at":"2024-10-17T07:07:09Z","title":"SeerAttention: Learning Intrinsic Sparse Attention in Your LLMs","version":4},"cited_work":{"arxiv_id":"2410.13276","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.13276","snapshot_observed_at":"2026-07-10T01:36:44.065347Z","title":"Seerattention: Learning intrinsic sparse attention in your llms.arXiv preprint arXiv:2410.13276","venue":"cs.CL","work_id":"7e69f9a0-9472-4c02-8f79-806ba81f8531","year":2024},"citing_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-05-16T06:15:46.085555Z"},"links":{"cited_paper":"/paper/2410.13276","citing_paper":"/paper/2502.13189"},"observation_digest":"sha256:a0af8a68ace309494fdebe93998b969171c42d832cb0022724bd87ee2317e48a","observation_id":"4bfcbe89-ca11-47ad-ac6f-e8349a2c8a76","resolution":{"observed_at":"2026-05-16T06:15:46.260047Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01801","last_updated":"2024-10-29T18:26:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-03T05:17:08Z","title":"Model Tells You What to Discard: Adaptive KV Cache Compression for LLMs","version":4},"cited_work":{"arxiv_id":"2310.01801","doi":"10.48550/arxiv.2310.01801","metadata_source":"pith","pith_arxiv_id":"2310.01801","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Model Tells You What to Discard: Adaptive KV Cache Compression for LLMs","venue":"cs.CL","work_id":"91379982-466d-4895-96f5-079b66259a73","year":2023},"citing_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-05-16T06:15:46.085555Z"},"links":{"cited_paper":"/paper/2310.01801","citing_paper":"/paper/2502.13189"},"observation_digest":"sha256:d2cf4ecdd7710fb69b8183d3a490b188bf2aecd917139c85a9e43c7dd3663e0d","observation_id":"91644674-c33f-4c00-aba0-99523a188179","resolution":{"observed_at":"2026-05-17T11:11:21.895994Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10774","last_updated":"2024-08-26T21:01:02Z","snapshot_observed_at":"2026-07-06T18:31:36.504766Z","submitted_at":"2024-06-16T01:33:02Z","title":"Quest: Query-Aware Sparsity for Efficient Long-Context LLM Inference","version":2},"cited_work":{"arxiv_id":"2406.10774","doi":"10.48550/arxiv.2406.10774","metadata_source":"pith","pith_arxiv_id":"2406.10774","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Quest: Query-Aware Sparsity for Efficient Long-Context LLM Inference","venue":"cs.CL","work_id":"2cad64c9-e2d5-42b6-8db9-03fafde4bcb0","year":2024},"citing_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-05-16T06:15:46.085555Z"},"links":{"cited_paper":"/paper/2406.10774","citing_paper":"/paper/2502.13189"},"observation_digest":"sha256:a064ba387cc9852f0688889ee2c49d561c39c5736bd4a59a1726df3ffb2ccff3","observation_id":"a7878e5d-c591-4aa5-8ce4-a30a81ee994a","resolution":{"observed_at":"2026-05-16T06:15:46.266513Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06104","last_updated":"2024-06-18T09:16:14Z","snapshot_observed_at":"2026-08-01T20:05:47.143531Z","submitted_at":"2024-01-11T18:35:26Z","title":"Transformers are Multi-State RNNs","version":2},"cited_work":{"arxiv_id":"2401.06104","doi":"10.48550/arxiv.2401.06104","metadata_source":"pith","pith_arxiv_id":"2401.06104","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Transformers are multi-state rnns.arXiv preprint arXiv:2401.06104","venue":"cs.CL","work_id":"08b2eb3d-8a1b-454d-8785-7d3f2918642e","year":2024},"citing_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-05-16T06:15:46.085555Z"},"links":{"cited_paper":"/paper/2401.06104","citing_paper":"/paper/2502.13189"},"observation_digest":"sha256:f36cf49a0c88bb7ad2785b93bf37f612bb8bb2afa8266d2995a570217b2ba35f","observation_id":"f8187306-dc17-460f-b73e-463d1aec41f5","resolution":{"observed_at":"2026-05-16T06:15:46.269719Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00752","last_updated":"2024-05-31T17:55:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-01T18:01:34Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","version":2},"cited_work":{"arxiv_id":"2312.00752","doi":"10.48550/arxiv.2312.00752","metadata_source":"pith","pith_arxiv_id":"2312.00752","snapshot_observed_at":"2026-07-10T20:07:33.480124Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","venue":"cs.LG","work_id":"4ee75248-1199-492c-a52f-6661e0f4adff","year":2023},"citing_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-05-16T06:15:46.085555Z"},"links":{"cited_paper":"/paper/2312.00752","citing_paper":"/paper/2502.13189"},"observation_digest":"sha256:964a9e101aac87a403818fa16c3cbdac3a3a9e66cafca21d43fecd980c305db7","observation_id":"00c7f58e-c130-4208-9fb8-98c99e972f56","resolution":{"observed_at":"2026-05-16T06:15:46.272655Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-30T19:25:31.081761+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-30T19:25:31.081761+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13048","last_updated":"2023-12-11T03:58:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-22T13:57:41Z","title":"RWKV: Reinventing RNNs for the Transformer Era","version":2},"cited_work":{"arxiv_id":"2305.13048","doi":"10.48550/arxiv.2305.13048","metadata_source":"pith","pith_arxiv_id":"2305.13048","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"RWKV: Reinventing RNNs for the Transformer Era","venue":"cs.CL","work_id":"524dc80d-f4ef-4f89-bf1a-9a8c1e4b6a81","year":2023},"citing_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-05-16T06:15:46.085555Z"},"links":{"cited_paper":"/paper/2305.13048","citing_paper":"/paper/2502.13189"},"observation_digest":"sha256:f4e14c39457de259731cda70fbfbd0b6d7c9826bbe79d4e0ba17cafac5dadad8","observation_id":"39690b6a-cd0c-4abf-b951-7edd59aa7551","resolution":{"observed_at":"2026-05-16T06:15:46.276017Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"International Conference on Machine Learning , pages=","venue":null,"work_id":"e7a5acca-6ec7-44ec-9034-e3b80db6920f","year":2023},"citing_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-05-16T06:15:46.085555Z"},"links":{"citing_paper":"/paper/2502.13189"},"observation_digest":"sha256:07354cfce724adab0db95f75c0ba13eff81fcab58d31ef306820f78bdc46185a","observation_id":"532b35ac-d941-4e80-ae57-94dedef9d6f4","resolution":{"observed_at":"2026-05-16T06:15:46.327299Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.14794","last_updated":"2022-11-19T12:45:21Z","snapshot_observed_at":"2026-08-02T09:26:59.716070Z","submitted_at":"2020-09-30T17:09:09Z","title":"Rethinking Attention with Performers","version":4},"cited_work":{"arxiv_id":"2009.14794","doi":"10.48550/arxiv.2009.14794","metadata_source":"pith","pith_arxiv_id":"2009.14794","snapshot_observed_at":"2026-07-11T01:47:47.727352Z","title":"Rethinking Attention with Performers","venue":"cs.LG","work_id":"4c26d308-8b72-4a98-8e73-950617a75f50","year":2020},"citing_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-05-16T06:15:46.085555Z"},"links":{"cited_paper":"/paper/2009.14794","citing_paper":"/paper/2502.13189"},"observation_digest":"sha256:014343d81d72f2d586edc86f3817c70e21bf10315fba93ab4e25e8f933bb45c8","observation_id":"6edff3ea-9471-49b3-83c6-ad6e3d32e8ee","resolution":{"observed_at":"2026-05-16T06:15:46.278924Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-12T21:49:59.959694+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T21:49:59.959694+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04768","last_updated":"2020-06-14T08:15:54Z","snapshot_observed_at":"2026-07-06T09:27:03.809621Z","submitted_at":"2020-06-08T17:37:52Z","title":"Linformer: Self-Attention with Linear Complexity","version":3},"cited_work":{"arxiv_id":"2006.04768","doi":"10.48550/arxiv.2006.04768","metadata_source":"pith","pith_arxiv_id":"2006.04768","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Linformer: Self-Attention with Linear Complexity","venue":"cs.LG","work_id":"4b717b51-6098-45d0-8e9e-b69bef651bc3","year":2020},"citing_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-05-16T06:15:46.085555Z"},"links":{"cited_paper":"/paper/2006.04768","citing_paper":"/paper/2502.13189"},"observation_digest":"sha256:0cc1341b3667d7b300cdf14d5f59a4754bebba6fd08e72948483ac409004261f","observation_id":"2cf07895-9ff1-4b48-a39b-d3f94ccd1aeb","resolution":{"observed_at":"2026-05-16T06:15:46.281866Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"International conference on machine learning , pages=","venue":null,"work_id":"1432f44e-9780-42ee-80c7-ce157a12e773","year":2020},"citing_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-05-16T06:15:46.085555Z"},"links":{"citing_paper":"/paper/2502.13189"},"observation_digest":"sha256:847599a67dd23dc460ef0fb9d2058de2db8a0d6d682ec0f1eeedd3a0a54e0406","observation_id":"8084c340-6425-4c01-8ea5-5bf795723cc1","resolution":{"observed_at":"2026-05-16T06:15:46.336297Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.06732","last_updated":"2022-03-14T10:35:35Z","snapshot_observed_at":"2026-07-06T09:55:34.647932Z","submitted_at":"2020-09-14T20:38:14Z","title":"Efficient Transformers: A Survey","version":3},"cited_work":{"arxiv_id":"2009.06732","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2009.06732","snapshot_observed_at":"2026-07-02T02:36:26.546053Z","title":"Efﬁcient transformers: A survey","venue":null,"work_id":"c87abbd6-fe7f-42b9-8f83-f8e5e37b7cc3","year":2009},"citing_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-05-16T06:15:46.085555Z"},"links":{"cited_paper":"/paper/2009.06732","citing_paper":"/paper/2502.13189"},"observation_digest":"sha256:f87137149a27f9a94cac18928cb61896d6705e9690de165ab710ce8f3d84e430","observation_id":"5de5ed35-0373-454a-a6b3-dcf414336252","resolution":{"observed_at":"2026-05-16T06:15:46.285388Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01889","last_updated":"2023-11-27T06:38:47Z","snapshot_observed_at":"2026-07-06T16:26:58.234941Z","submitted_at":"2023-10-03T08:44:50Z","title":"Ring Attention with Blockwise Transformers for Near-Infinite Context","version":4},"cited_work":{"arxiv_id":"2310.01889","doi":"10.48550/arxiv.2310.01889","metadata_source":"pith","pith_arxiv_id":"2310.01889","snapshot_observed_at":"2026-07-10T20:07:33.534600Z","title":"Ring Attention with Blockwise Transformers for Near-Infinite Context","venue":"cs.CL","work_id":"982498c4-e80e-4e66-8c44-c60813be298d","year":2023},"citing_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-05-16T06:15:46.085555Z"},"links":{"cited_paper":"/paper/2310.01889","citing_paper":"/paper/2502.13189"},"observation_digest":"sha256:2f174dc1e291d453451aceb5417596769f9daaee509e85e13e33074d3e1d9e8f","observation_id":"981ac2b2-1042-4276-8a1f-d4e46aff7130","resolution":{"observed_at":"2026-05-16T06:15:46.288484Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:50:24.101224+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:50:24.101224+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14509","last_updated":"2023-10-04T16:51:13Z","snapshot_observed_at":"2026-08-04T19:27:31.715261Z","submitted_at":"2023-09-25T20:15:57Z","title":"DeepSpeed Ulysses: System Optimizations for Enabling Training of Extreme Long Sequence Transformer Models","version":2},"cited_work":{"arxiv_id":"2309.14509","doi":"10.48550/arxiv.2309.14509","metadata_source":"pith","pith_arxiv_id":"2309.14509","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"DeepSpeed Ulysses: System Optimizations for Enabling Training of Extreme Long Sequence Transformer Models","venue":"cs.LG","work_id":"bb119d0b-c7f0-412a-a426-f74bd6949a51","year":2023},"citing_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-05-16T06:15:46.085555Z"},"links":{"cited_paper":"/paper/2309.14509","citing_paper":"/paper/2502.13189"},"observation_digest":"sha256:fc5470a923c28c9263ec8d50e773b03f5229d02d5b05774127fad87b5001c603","observation_id":"f2cac3bf-2d49-43ec-b3a8-2e358773441f","resolution":{"observed_at":"2026-05-16T06:15:46.291664Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":"2403.05530","doi":"10.48550/arxiv.2403.05530","metadata_source":"pith","pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-07-11T03:37:46.178537Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","venue":"cs.CL","work_id":"80e3e977-f1bb-4c83-8d0c-1ab0a0c5c3f1","year":2024},"citing_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-16T06:15:46.085555Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2502.13189"},"observation_digest":"sha256:c3477038bb6ce1e09f14d7dee5272d78622580ee76d629f8adcff5e95bfa2e2e","observation_id":"ac5bd988-1512-42d5-b2d3-911fb07bb9f9","resolution":{"observed_at":"2026-05-16T06:15:46.294698Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-02T03:08:14.426583+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-02T03:08:14.426583+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.07719","last_updated":"2024-07-02T09:03:26Z","snapshot_observed_at":"2026-07-06T18:13:29.693360Z","submitted_at":"2024-05-13T13:08:02Z","title":"USP: A Unified Sequence Parallelism Approach for Long Context Generative AI","version":5},"cited_work":{"arxiv_id":"2405.07719","doi":"10.48550/arxiv.2405.07719","metadata_source":"pith","pith_arxiv_id":"2405.07719","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"A unified sequence parallelism approach for long context generative ai","venue":"cs.LG","work_id":"277d0fdf-d9cc-4497-ad08-04aba6226c36","year":2024},"citing_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-05-16T06:15:46.085555Z"},"links":{"cited_paper":"/paper/2405.07719","citing_paper":"/paper/2502.13189"},"observation_digest":"sha256:950ef62f460353f8df11b0af2673c69edc5b0f6e7762ce23ffbe10d0455081b9","observation_id":"301216a2-0a7d-46ef-a9f6-cbc5a762a757","resolution":{"observed_at":"2026-05-16T06:15:46.298224Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16039","last_updated":"2023-11-14T01:40:13Z","snapshot_observed_at":"2026-07-06T16:24:38.375055Z","submitted_at":"2023-09-27T21:41:49Z","title":"Effective Long-Context Scaling of Foundation Models","version":3},"cited_work":{"arxiv_id":"2309.16039","doi":"10.48550/arxiv.2309.16039","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.16039","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"A., Oguz, B., et al","venue":null,"work_id":"100ca4eb-be6f-4510-9c7f-bbb24f10d946","year":2023},"citing_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-05-16T06:15:46.085555Z"},"links":{"cited_paper":"/paper/2309.16039","citing_paper":"/paper/2502.13189"},"observation_digest":"sha256:ec8bcd4950887c2f83ac3af999ce97939dd805a07735df5a01e30ee160e0dea1","observation_id":"3de63877-21a0-4fe7-b85d-29e2c110e9a0","resolution":{"observed_at":"2026-05-16T06:15:46.122456Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-07-06T12:54:11.616335Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":"2203.15556","doi":"10.1098/rsta.2024.0522","metadata_source":"pith","pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Training Compute-Optimal Large Language Models","venue":"cs.CL","work_id":"b2faf28d-86b7-429c-bc42-469458efc246","year":2022},"citing_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-05-16T06:15:46.085555Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2502.13189"},"observation_digest":"sha256:6933e8600e33bbcf8a977a5633476eb3e4f181302c131e5d4e7e0c605c9a16af","observation_id":"4c8bd24e-30ee-4361-9f20-a39bb6978cf8","resolution":{"observed_at":"2026-05-16T06:15:46.127680Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18745","last_updated":"2024-10-24T13:51:50Z","snapshot_observed_at":"2026-07-06T19:39:06.300432Z","submitted_at":"2024-10-24T13:51:50Z","title":"Why Does the Effective Context Length of LLMs Fall Short?","version":1},"cited_work":{"arxiv_id":"2410.18745","doi":"10.48550/arxiv.2410.18745","metadata_source":"pith","pith_arxiv_id":"2410.18745","snapshot_observed_at":"2026-07-10T20:07:33.540183Z","title":"arXiv preprint arXiv:2410.18745 , year=","venue":"cs.CL","work_id":"0997a120-6b10-430f-a398-a4ea45238cfc","year":2024},"citing_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-05-16T06:15:46.085555Z"},"links":{"cited_paper":"/paper/2410.18745","citing_paper":"/paper/2502.13189"},"observation_digest":"sha256:aa2f7c39002adda48e0526aa63a6e5d87d49afd7dacf3d6f94c3bb4ca5ee5a4d","observation_id":"5eb8880f-4595-4d0a-a18b-38c610de0259","resolution":{"observed_at":"2026-05-16T06:15:46.132633Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.03953","last_updated":"2018-03-02T20:20:52Z","snapshot_observed_at":"2026-08-04T06:22:23.897655Z","submitted_at":"2017-11-10T18:29:00Z","title":"Breaking the Softmax Bottleneck: A High-Rank RNN Language Model","version":4},"cited_work":{"arxiv_id":"1711.03953","doi":null,"metadata_source":"pith","pith_arxiv_id":"1711.03953","snapshot_observed_at":"2026-07-04T08:19:44.399751Z","title":"Breaking the Softmax Bottleneck: A High-Rank RNN Language Model","venue":"cs.CL","work_id":"bfedf27f-9cbb-4e1d-9585-2a5229779437","year":2017},"citing_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-05-16T06:15:46.085555Z"},"links":{"cited_paper":"/paper/1711.03953","citing_paper":"/paper/2502.13189"},"observation_digest":"sha256:eeffc166e758f2bc612d40c82f8191ba207b6c38cf030d7e1ec13619bddff922","observation_id":"7f7f9b04-8ec8-4d8a-998e-f1f76f9359ef","resolution":{"observed_at":"2026-05-16T06:15:46.137946Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06066","last_updated":"2024-01-11T17:31:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-11T17:31:42Z","title":"DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture-of-Experts Language Models","version":1},"cited_work":{"arxiv_id":"2401.06066","doi":"10.48550/arxiv.2401.06066","metadata_source":"pith","pith_arxiv_id":"2401.06066","snapshot_observed_at":"2026-07-11T03:27:46.973573Z","title":"DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture-of-Experts Language Models","venue":"cs.CL","work_id":"a9888d6d-bf47-4324-9834-7cc12ac3a78c","year":2024},"citing_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-05-16T06:15:46.085555Z"},"links":{"cited_paper":"/paper/2401.06066","citing_paper":"/paper/2502.13189"},"observation_digest":"sha256:9c431bcdcee290113ecff501617937ed97c202e3d544c65528d08a83c6858b83","observation_id":"710b9ef6-14fc-48bd-a274-2ae6fb78c45d","resolution":{"observed_at":"2026-05-16T06:15:46.142836Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2412.15115","doi":"10.1145/3581783.3612503","metadata_source":"pith","pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen2.5 Technical Report","venue":"cs.CL","work_id":"d8432992-4980-4a81-85c7-9fa2c2b87f85","year":2024},"citing_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-05-16T06:15:46.085555Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2502.13189"},"observation_digest":"sha256:8eb1f92e26df7af03e0dcdff1f065c4e3f1ddb52a15b125358df6d91551ff9b1","observation_id":"e79fe5f8-5b77-45b0-8c8e-162d08d2de25","resolution":{"observed_at":"2026-05-16T06:15:46.147240Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2023 , journal=","venue":null,"work_id":"491b1565-b99f-427b-afdb-56a901c0a8e3","year":2023},"citing_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-05-16T06:15:46.085555Z"},"links":{"citing_paper":"/paper/2502.13189"},"observation_digest":"sha256:e5dfdbe9d8ff58c210c353d87c6a1b77b6298b34d582282efe059cb5dc41442a","observation_id":"8667b04c-c3ce-40f6-ac36-06504cc9e4a0","resolution":{"observed_at":"2026-05-16T06:15:46.331669Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10685","last_updated":"2024-03-25T11:50:32Z","snapshot_observed_at":"2026-07-06T17:31:08.762955Z","submitted_at":"2024-02-16T13:39:34Z","title":"LongHeads: Multi-Head Attention is Secretly a Long Context Processor","version":2},"cited_work":{"arxiv_id":"2402.10685","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.10685","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2402.10685 , year=","venue":null,"work_id":"04c2ad84-da76-471a-aaa2-6382cf9a4f78","year":null},"citing_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-05-16T06:15:46.085555Z"},"links":{"cited_paper":"/paper/2402.10685","citing_paper":"/paper/2502.13189"},"observation_digest":"sha256:35a7b69eb5a4738bf342253f9a4917f7377b2ada3766480bb2e3117ecbd30840","observation_id":"8c9f3010-3668-49b1-8002-b70b6b3ef302","resolution":{"observed_at":"2026-05-16T06:15:46.151606Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13846","last_updated":"2026-05-18T05:12:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-17T17:58:14Z","title":"LightTransfer: Your Long-Context LLM is Secretly a Hybrid Model with Effortless Adaptation","version":3},"cited_work":{"arxiv_id":"2410.13846","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.13846","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Zejun Zhang, Li Zhang, Xin Yuan, Anlan Zhang, Mengwei Xu, and Feng Qian","venue":null,"work_id":"22f54fdf-0289-47d5-9769-93ec17111867","year":null},"citing_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-05-16T06:15:46.085555Z"},"links":{"cited_paper":"/paper/2410.13846","citing_paper":"/paper/2502.13189"},"observation_digest":"sha256:8609ea4a1cf4f9b42fcc664624f5684480fb91bb140efaa39e045cf15b0ec9d6","observation_id":"d2868931-587e-43ee-933d-eebd682c6fba","resolution":{"observed_at":"2026-05-20T00:04:05.393377Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":"2501.12599","doi":"10.48550/arxiv.2501.12599","metadata_source":"pith","pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-07-10T22:47:36.964713Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","venue":"cs.AI","work_id":"bff96ab1-bd6a-4585-be23-74fdb51969c7","year":2025},"citing_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-05-16T06:15:46.085555Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2502.13189"},"observation_digest":"sha256:c13ba9e82f2b4256eb1a87c62a6e29ec6972a7cfcd71567ddaac45bc2cbe30ce","observation_id":"3f941a00-a54c-4ee6-979b-bb26acf1bf0d","resolution":{"observed_at":"2026-05-16T06:15:46.159064Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:38.585868+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:38.585868+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-05-16T06:15:46.085555Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2502.13189"},"observation_digest":"sha256:c2e198a8e8d7c9ea0832dc509ff168bff620a1e4a4bd49e6a0edc5acaedf95ff","observation_id":"44924d88-cb1c-4f33-938c-4cb66f2ec26c","resolution":{"observed_at":"2026-05-16T06:15:46.162426Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-07-06T20:11:15.503499Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":"2412.16339","doi":"10.48550/arxiv.2412.16339","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Y ., Joglekar, M., Wallace, E., Jain, S., Barak, B., Heylar, A., Dias, R., Vallone, A., Ren, H., Wei, J., et al","venue":null,"work_id":"900d0032-4aa1-4b47-ab57-616164d48b88","year":2024},"citing_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-05-16T06:15:46.085555Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2502.13189"},"observation_digest":"sha256:31e2f89d22ebedeeb2c3ad9e20f0ebe077d8352ad178a0f8b3e901dfab7a537d","observation_id":"6ef9a4ad-f9b4-4eed-abe4-dde4c5d50bf1","resolution":{"observed_at":"2026-05-16T06:15:46.165967Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.06640","last_updated":"2024-05-10T17:59:08Z","snapshot_observed_at":"2026-07-06T18:12:43.301678Z","submitted_at":"2024-05-10T17:59:08Z","title":"Linearizing Large Language Models","version":1},"cited_work":{"arxiv_id":"2405.06640","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.06640","snapshot_observed_at":"2026-07-09T01:45:50.807991Z","title":"Let’s verify step by step","venue":"cs.CL","work_id":"87cc9178-d804-46fe-8128-c9074077dd04","year":2024},"citing_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-05-16T06:15:46.085555Z"},"links":{"cited_paper":"/paper/2405.06640","citing_paper":"/paper/2502.13189"},"observation_digest":"sha256:36ec3c03f0637def1ea206bbb3b5dbd6900c9f448a650e530d270a925eee65a8","observation_id":"2b4ea7c9-1078-4610-abd1-e1717b026f56","resolution":{"observed_at":"2026-05-16T06:15:46.169517Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":"ca24975f-fa57-41e7-9ff7-5b571066e913","year":null},"citing_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-05-16T06:15:46.085555Z"},"links":{"citing_paper":"/paper/2502.13189"},"observation_digest":"sha256:58ae0109ceedd46e21dbee025b17805a837d6ab83dbcc3764828203d1fc1c7ac","observation_id":"18c6b876-afea-4a2c-a198-9d8cb2d8336a","resolution":{"observed_at":"2026-05-16T06:15:46.315969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15237","last_updated":"2025-06-27T07:54:57Z","snapshot_observed_at":"2026-07-06T19:06:41.697671Z","submitted_at":"2024-08-27T17:56:11Z","title":"The Mamba in the Llama: Distilling and Accelerating Hybrid Models","version":4},"cited_work":{"arxiv_id":"2408.15237","doi":"10.48550/arxiv.2408.15237","metadata_source":"arxiv_reference","pith_arxiv_id":"2408.15237","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"M., and Dao, T","venue":null,"work_id":"f3d96c6b-3711-4ecc-a229-a36268dcde4a","year":2025},"citing_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-05-16T06:15:46.085555Z"},"links":{"cited_paper":"/paper/2408.15237","citing_paper":"/paper/2502.13189"},"observation_digest":"sha256:090499de8e8f51628b053b9986af1aa073916a7bd5b528961f4d434136fb5aef","observation_id":"89a7a419-4dd7-40de-9e05-ed267e17c94f","resolution":{"observed_at":"2026-05-16T06:15:46.173069Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10254","last_updated":"2025-03-05T21:57:04Z","snapshot_observed_at":"2026-08-03T11:26:16.144571Z","submitted_at":"2024-10-14T08:10:34Z","title":"LoLCATs: On Low-Rank Linearizing of Large Language Models","version":3},"cited_work":{"arxiv_id":"2410.10254","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.10254","snapshot_observed_at":"2026-07-09T01:45:50.782998Z","title":"Lolcats: On low- rank linearizing of large language models","venue":"cs.LG","work_id":"9d869e4a-9d42-44fa-bb5d-b5e48ac4aed3","year":2024},"citing_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-05-16T06:15:46.085555Z"},"links":{"cited_paper":"/paper/2410.10254","citing_paper":"/paper/2502.13189"},"observation_digest":"sha256:ff2e08db7240a8ffef6b49033c8f81b8004f02e4bc9a4d907ad7713414f61690","observation_id":"91c17f74-ab0e-4972-8bf7-96dfd231179d","resolution":{"observed_at":"2026-05-16T06:15:46.117218Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08621","last_updated":"2023-08-09T08:53:08Z","snapshot_observed_at":"2026-08-02T13:21:32.251959Z","submitted_at":"2023-07-17T16:40:01Z","title":"Retentive Network: A Successor to Transformer for Large Language Models","version":4},"cited_work":{"arxiv_id":"2307.08621","doi":"10.48550/arxiv.2307.08621","metadata_source":"pith","pith_arxiv_id":"2307.08621","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Retentive Network: A Successor to Transformer for Large Language Models","venue":"cs.CL","work_id":"5b0449ac-92b0-41f2-8b4f-586c2b5a08b6","year":2023},"citing_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-05-16T06:15:46.085555Z"},"links":{"cited_paper":"/paper/2307.08621","citing_paper":"/paper/2502.13189"},"observation_digest":"sha256:879bf60ca387ad9a2035c36c6e6620f742d0c154df94687b6025dffafd252539","observation_id":"0e5c1054-ab0f-4330-84a0-b8c5a6461f63","resolution":{"observed_at":"2026-05-16T06:15:46.176867Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21060","last_updated":"2024-05-31T17:50:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:50:01Z","title":"Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality","version":1},"cited_work":{"arxiv_id":"2405.21060","doi":"10.48550/arxiv.2405.21060","metadata_source":"pith","pith_arxiv_id":"2405.21060","snapshot_observed_at":"2026-07-10T21:57:38.573725Z","title":"Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality","venue":"cs.LG","work_id":"d8eba076-0449-4f6a-aae1-5a7260677f0f","year":2024},"citing_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-05-16T06:15:46.085555Z"},"links":{"cited_paper":"/paper/2405.21060","citing_paper":"/paper/2502.13189"},"observation_digest":"sha256:d83aa3bcc07852d40b93adb6baf5b12ea8659d54beb80a3389e65d86f61b4970","observation_id":"4a8264cb-9a74-4e91-bb83-0174ae50ff0e","resolution":{"observed_at":"2026-05-16T06:15:46.181106Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05892","last_updated":"2024-09-26T22:39:08Z","snapshot_observed_at":"2026-07-06T17:57:27.510162Z","submitted_at":"2024-04-08T22:20:59Z","title":"Eagle and Finch: RWKV with Matrix-Valued States and Dynamic Recurrence","version":4},"cited_work":{"arxiv_id":"2404.05892","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.05892","snapshot_observed_at":"2026-07-04T10:09:43.990339Z","title":"Eagle and Finch: RWKV with Matrix-Valued States and Dynamic Recurrence","venue":"cs.CL","work_id":"b993c2c1-c4d3-4ade-a380-dc5464bcb940","year":2024},"citing_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-05-16T06:15:46.085555Z"},"links":{"cited_paper":"/paper/2404.05892","citing_paper":"/paper/2502.13189"},"observation_digest":"sha256:9aa1a23d9a890b2642988c18643da15dbda1682724999ea7ae6c1f2967db2857","observation_id":"7d40d808-e022-46d4-9c11-43bcb4407866","resolution":{"observed_at":"2026-05-17T23:19:58.366890Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"cited_work":{"arxiv_id":"2501.08313","doi":"10.48550/arxiv.2501.08313","metadata_source":"pith","pith_arxiv_id":"2501.08313","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","venue":"cs.CL","work_id":"137e6ed4-1c1d-40bd-801e-9d2baea0bd0c","year":2025},"citing_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-05-16T06:15:46.085555Z"},"links":{"cited_paper":"/paper/2501.08313","citing_paper":"/paper/2502.13189"},"observation_digest":"sha256:e9be2238c7d80272e235624dc0c0d44d62bad9fe196880ed292d4e93e1015f9e","observation_id":"70cbb10f-d834-44e6-917c-872bc1fcfe16","resolution":{"observed_at":"2026-05-16T06:26:38.921226Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"cited_work":{"arxiv_id":"2409.10516","doi":"10.48550/arxiv.2409.10516","metadata_source":"pith","pith_arxiv_id":"2409.10516","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","venue":"cs.LG","work_id":"96e08aaa-a828-4d47-8eb6-182994c0f8f2","year":2024},"citing_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-05-16T06:15:46.085555Z"},"links":{"cited_paper":"/paper/2409.10516","citing_paper":"/paper/2502.13189"},"observation_digest":"sha256:3d584cb4f53512ffabd3cd64603046b06dcd6d0080b622cccdf474390a9d5011","observation_id":"3e10dd34-8e53-4d49-97a5-93813fe8839a","resolution":{"observed_at":"2026-05-18T08:12:02.395521Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1701.06538","last_updated":"2017-01-23T18:10:00Z","snapshot_observed_at":"2026-07-06T05:27:13.416519Z","submitted_at":"2017-01-23T18:10:00Z","title":"Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer","version":1},"cited_work":{"arxiv_id":"1701.06538","doi":"10.48550/arxiv.1701.06538","metadata_source":"pith","pith_arxiv_id":"1701.06538","snapshot_observed_at":"2026-07-11T01:07:45.051014Z","title":"Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer","venue":"cs.LG","work_id":"2c6b3f6d-54e4-4df7-baa7-475a490799af","year":2017},"citing_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-05-16T06:15:46.085555Z"},"links":{"cited_paper":"/paper/1701.06538","citing_paper":"/paper/2502.13189"},"observation_digest":"sha256:f593586097950d6c002b4230477692d1cba467e48bf9973f1c4b306c7ecbbe41","observation_id":"1b3a2159-d31e-4435-bcc8-7f355f7a69b0","resolution":{"observed_at":"2026-05-16T06:15:46.196956Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-01T08:08:24.174744+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T08:08:24.174744+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16668","last_updated":"2020-06-30T10:42:02Z","snapshot_observed_at":"2026-07-06T09:33:58.857566Z","submitted_at":"2020-06-30T10:42:02Z","title":"GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding","version":1},"cited_work":{"arxiv_id":"2006.16668","doi":"10.48550/arxiv.2006.16668","metadata_source":"pith","pith_arxiv_id":"2006.16668","snapshot_observed_at":"2026-07-11T01:07:44.079601Z","title":"GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding","venue":"cs.CL","work_id":"52b3c9a6-2a27-45a7-ba2b-ebe4b5bb5a5f","year":2020},"citing_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-05-16T06:15:46.085555Z"},"links":{"cited_paper":"/paper/2006.16668","citing_paper":"/paper/2502.13189"},"observation_digest":"sha256:9fe8924d5c926118f59714a27a803ede8b94a27bd65e00f3e4e74af77cd683e6","observation_id":"f6a8de79-2a3a-4e1c-9872-cb16dad3c2b9","resolution":{"observed_at":"2026-05-16T06:15:46.200494Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T00:36:39.740772Z","title":"Journal of Machine Learning Research , volume=","venue":null,"work_id":"98474244-687e-4868-9f6d-df3cdb9ae9ed","year":null},"citing_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-05-16T06:15:46.085555Z"},"links":{"citing_paper":"/paper/2502.13189"},"observation_digest":"sha256:082e3718c246e193f289d0083dffe6039d017f9a8222b429cc54583b8d23b09e","observation_id":"c26987b1-df06-49d8-b5e1-144410e91d1e","resolution":{"observed_at":"2026-05-16T06:15:46.313749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":"2202.08906","doi":"10.48550/arxiv:2202.08906","metadata_source":"pith","pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-07-11T03:27:46.863255Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","venue":"cs.CL","work_id":"b7581741-3f43-4528-a7d0-3af9e51a4d9f","year":2022},"citing_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-05-16T06:15:46.085555Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2502.13189"},"observation_digest":"sha256:ec3230226fda351f374ab6a07b3938ec69141179c5b53154d9e2e7355ba8ced4","observation_id":"84a53930-ff56-42f4-82a0-c4d607a2c969","resolution":{"observed_at":"2026-05-16T06:15:46.203629Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2018 , journal=","venue":null,"work_id":"56c57655-a0fc-49f7-bbab-63dc6bdda9a7","year":2018},"citing_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-05-16T06:15:46.085555Z"},"links":{"citing_paper":"/paper/2502.13189"},"observation_digest":"sha256:6e3b9eef0ede5a04bc16aa6f2b862db42e6dbc1fbe3f125f1070c4c6c84b3b9d","observation_id":"4a50dbf4-e967-4987-b4ba-51a2bc0e31ca","resolution":{"observed_at":"2026-05-16T06:15:46.325086Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2023 , journal=","venue":null,"work_id":"3b4f6cae-10dc-43a7-80f5-7dde095ee605","year":2023},"citing_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-05-16T06:15:46.085555Z"},"links":{"citing_paper":"/paper/2502.13189"},"observation_digest":"sha256:d2dcfbdffe64870d733447e3a1a25a4b4f200540da7d3f8e618dae2b5628d5ff","observation_id":"437eac4b-f066-4fd1-a985-d50434a82917","resolution":{"observed_at":"2026-05-16T06:15:46.329476Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"NIPS , year=","venue":null,"work_id":"71f9a2a9-5b3f-402b-8e8a-85c2e373219c","year":null},"citing_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-05-16T06:15:46.085555Z"},"links":{"citing_paper":"/paper/2502.13189"},"observation_digest":"sha256:aa872180e105d5c611f546075f0aaded053dafc7401cf77e20c020b3d36eeff8","observation_id":"0f0fb7a0-5a3a-4155-986e-3af46da9e583","resolution":{"observed_at":"2026-05-16T06:15:46.340993Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"3a5866d5-30f4-4f4f-9f4b-3a6f9e7da160","year":null},"citing_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-05-16T06:15:46.085555Z"},"links":{"citing_paper":"/paper/2502.13189"},"observation_digest":"sha256:51c808dfd653af0bea2ee38dffe8bc87fa415a26253ef055bb834b3d0d65f9ad","observation_id":"51cbc9c4-bd84-4efe-8bcb-6a04b4feca62","resolution":{"observed_at":"2026-05-16T06:15:46.348702Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"International conference on machine learning , pages=","venue":null,"work_id":"a14f12a6-0413-425f-bd83-e3dc17c3f3dd","year":2022},"citing_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-05-16T06:15:46.085555Z"},"links":{"citing_paper":"/paper/2502.13189"},"observation_digest":"sha256:fa06bf53b58180b6f97f0593ab4b7df2dc062380beb814d0811d79794c6ed898","observation_id":"6fcc58e4-9da8-495a-a43b-22e292ad3bd9","resolution":{"observed_at":"2026-05-16T06:15:46.351291Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T00:04:22.792596Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":"bf4c2a2a-5d4c-4e52-9b3b-24d9abf680f2","year":null},"citing_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-05-16T06:15:46.085555Z"},"links":{"citing_paper":"/paper/2502.13189"},"observation_digest":"sha256:cec22c35620539396eef9f55aa5805a331e8ad83bce72ef07d85415d909129a8","observation_id":"a51c58be-91b1-4c7c-97ed-9cecd5b02c86","resolution":{"observed_at":"2026-05-16T06:15:46.305836Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":"1909.08053","doi":"10.48550/arxiv.1909.08053","metadata_source":"pith","pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-07-10T16:37:23.051852Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","venue":"cs.CL","work_id":"c888e6d1-0b1d-43d6-9ef5-f0912a0efa1b","year":2019},"citing_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-05-16T06:15:46.085555Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2502.13189"},"observation_digest":"sha256:3dce8876d587da37d06d2a46898c330918ae349c52a79013c118fd76e3d552af","observation_id":"002410d4-50e7-4c87-953f-205dc12df36f","resolution":{"observed_at":"2026-05-16T06:15:46.206948Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:33.392193+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:33.392193+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cell , volume=","venue":null,"work_id":"0393dd74-39a3-428a-b05f-7cb392d278de","year":2025},"citing_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-05-16T06:15:46.085555Z"},"links":{"citing_paper":"/paper/2502.13189"},"observation_digest":"sha256:43fca3adeb9b77c492e62372c28ea1d6b26fec119ebbb9115ae86afc4d688dc3","observation_id":"5284c4b4-c7f4-439b-9a48-e4027324dd3a","resolution":{"observed_at":"2026-05-16T06:15:46.320409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"and Yang, Zhilin and Zhou, Xinyu and Zhang, Mingxing and Qiu, Jiezhong , title =","venue":null,"work_id":"307266fd-15a3-4c61-95cc-b7f79570470f","year":null},"citing_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-05-16T06:15:46.085555Z"},"links":{"citing_paper":"/paper/2502.13189"},"observation_digest":"sha256:9a3a88d106fb4b8892a5100b963ed4d1d351fb9a545e7d8deb1fae98eb429171","observation_id":"441115e9-38cb-435a-800a-0320414f36cc","resolution":{"observed_at":"2026-05-16T06:15:46.308534Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs"},"reference_resolution":{"displayed":73,"state_counts":{"malformed_identifier":0,"metadata_mismatch":38,"parse_uncertain":0,"unresolved":1,"verified_exact":13,"verified_fuzzy":21},"total_outbound_references":73},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 73 of 73 outbound references and 51 inbound Pith citation observations for arXiv:2502.13189."}