{"as_of":"2026-08-10T19:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7b157a2ec35b870fdff5f1f33e09c577a1f2c61610981dbbcee3c62d898b522a","coverage":[{"denominator":66,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":66,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-20T05:52:14.089334Z","state":"measured"},{"denominator":67,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":67,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T23:18:25.150782Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.19726","last_updated":"2026-05-19T12:01:13Z","snapshot_observed_at":"2026-08-01T08:38:35.585519Z","submitted_at":"2026-05-19T12:01:13Z","title":"Efficient Long-Context Modeling in Diffusion Language Models via Block Approximate Sparse Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.19726","snapshot_observed_at":"2026-07-31T23:18:25.150782Z","title":"Efficient long-context modeling in diffusion language models via block approximate sparse attention.arXiv preprint arXiv:2605.19726, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.24027","last_updated":"2026-07-27T05:53:28Z","snapshot_observed_at":"2026-08-10T18:28:36.193485Z","submitted_at":"2026-07-27T05:53:28Z","title":"Sol-Attn: Accelerating Video Generation Inference via On-the-Fly Attention Sparsification","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-31T23:18:25.150782Z"},"links":{"cited_paper":"/paper/2605.19726","citing_paper":"/paper/2607.24027"},"observation_digest":"sha256:8db16f19016e88ef0dd5fe6634d37f0a309465808fa518100d9b8fb1b6b8335a","observation_id":"3caa674b-9cd1-41ee-a30d-f8a9d2f4623b","resolution":{"observed_at":"2026-07-31T23:18:25.150782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2605.19726/citation-record","integrity":"/paper/2605.19726/integrity","json":"/paper/2605.19726/citation-record.json","paper":"/paper/2605.19726"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2308.14508","last_updated":"2024-06-19T04:00:32Z","snapshot_observed_at":"2026-08-08T03:49:18.086396Z","submitted_at":"2023-08-28T11:53:40Z","title":"LongBench: A Bilingual, Multitask Benchmark for Long Context Understanding","version":2},"cited_work":{"arxiv_id":"2308.14508","doi":"10.48550/arxiv.2308.14508","metadata_source":"pith","pith_arxiv_id":"2308.14508","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LongBench: A Bilingual, Multitask Benchmark for Long Context Understanding","venue":"cs.CL","work_id":"ba7831c4-9427-4e0e-a5c1-4e98511f4b53","year":2023},"citing_paper":{"arxiv_id":"2605.19726","last_updated":"2026-05-19T12:01:13Z","snapshot_observed_at":"2026-08-01T08:38:35.585519Z","submitted_at":"2026-05-19T12:01:13Z","title":"Efficient Long-Context Modeling in Diffusion Language Models via Block Approximate Sparse Attention","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:14.089334Z"},"links":{"cited_paper":"/paper/2308.14508","citing_paper":"/paper/2605.19726"},"observation_digest":"sha256:40330ee7dfd532c41196dbe4418052af3b46e8f4ef0eb53b86867b50e77b2f68","observation_id":"f44d5873-36fb-4851-ac53-d81815535586","resolution":{"observed_at":"2026-05-20T05:53:04.600211Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":"2004.05150","doi":"10.48550/arxiv.2004.05150","metadata_source":"pith","pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Longformer: The Long-Document Transformer","venue":"cs.CL","work_id":"abea7a44-6668-4de7-aab6-f53a6e5aa088","year":2020},"citing_paper":{"arxiv_id":"2605.19726","last_updated":"2026-05-19T12:01:13Z","snapshot_observed_at":"2026-08-01T08:38:35.585519Z","submitted_at":"2026-05-19T12:01:13Z","title":"Efficient Long-Context Modeling in Diffusion Language Models via Block Approximate Sparse Attention","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:14.089334Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2605.19726"},"observation_digest":"sha256:2fb05d6892e727f06d01d52d3c0340d5b7f613521fbfc06d0bb7c2e75665e14b","observation_id":"312b94e8-1067-4af4-a033-13fd308edadc","resolution":{"observed_at":"2026-05-20T05:53:04.609543Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-12T21:49:59.161233+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T21:49:59.161233+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cambridge University Press, Cambridge, UK","venue":null,"work_id":"205b8bb4-0787-47f9-840d-dcd962f239ef","year":2004},"citing_paper":{"arxiv_id":"2605.19726","last_updated":"2026-05-19T12:01:13Z","snapshot_observed_at":"2026-08-01T08:38:35.585519Z","submitted_at":"2026-05-19T12:01:13Z","title":"Efficient Long-Context Modeling in Diffusion Language Models via Block Approximate Sparse Attention","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:14.089334Z"},"links":{"citing_paper":"/paper/2605.19726"},"observation_digest":"sha256:d4001744d4c3a03dac943e7a6e9d913dd2afba4a76163c68653bd8798e755c07","observation_id":"f4d66070-3010-44a2-95e5-308301adcfbc","resolution":{"observed_at":"2026-05-20T05:53:22.602000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.04202","last_updated":"2023-03-01T00:18:33Z","snapshot_observed_at":"2026-08-06T15:11:19.955049Z","submitted_at":"2022-08-08T15:08:40Z","title":"Analog Bits: Generating Discrete Data using Diffusion Models with Self-Conditioning","version":2},"cited_work":{"arxiv_id":"2208.04202","doi":"10.48550/arxiv.2208.04202","metadata_source":"pith","pith_arxiv_id":"2208.04202","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Analog bits: Generating discrete data using diffusion models with self-conditioning","venue":"cs.CV","work_id":"89278cce-9610-430c-a4e1-9c5915aa5c95","year":2022},"citing_paper":{"arxiv_id":"2605.19726","last_updated":"2026-05-19T12:01:13Z","snapshot_observed_at":"2026-08-01T08:38:35.585519Z","submitted_at":"2026-05-19T12:01:13Z","title":"Efficient Long-Context Modeling in Diffusion Language Models via Block Approximate Sparse Attention","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:14.089334Z"},"links":{"cited_paper":"/paper/2208.04202","citing_paper":"/paper/2605.19726"},"observation_digest":"sha256:e5800bf370ab4021372d707301007417cd186abb6d81a6a7d7bec9b7935ac524","observation_id":"52880562-8001-4b16-a0ac-55fe3b9a1aeb","resolution":{"observed_at":"2026-05-20T05:53:04.641918Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09193","last_updated":"2024-12-06T03:52:24Z","snapshot_observed_at":"2026-07-06T17:02:01.491624Z","submitted_at":"2023-12-14T18:14:11Z","title":"Fast Sampling via Discrete Non-Markov Diffusion Models with Predetermined Transition Time","version":3},"cited_work":{"arxiv_id":"2312.09193","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.09193","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fast sampling via de- randomization for discrete diffusion models","venue":null,"work_id":"19c1e430-1409-412d-b13e-f87d1e5714a7","year":2023},"citing_paper":{"arxiv_id":"2605.19726","last_updated":"2026-05-19T12:01:13Z","snapshot_observed_at":"2026-08-01T08:38:35.585519Z","submitted_at":"2026-05-19T12:01:13Z","title":"Efficient Long-Context Modeling in Diffusion Language Models via Block Approximate Sparse Attention","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:14.089334Z"},"links":{"cited_paper":"/paper/2312.09193","citing_paper":"/paper/2605.19726"},"observation_digest":"sha256:9df977b3a682944109835d5758137467de3453627ac7ba26a36d17c35d5f0fb3","observation_id":"a086e25c-49dc-4ec7-84e3-f2a54c8fd9f3","resolution":{"observed_at":"2026-05-20T05:53:04.630087Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Generating long sequences with sparse transformers","venue":null,"work_id":"9200b5f0-50d9-41da-9c99-5ea83ce433a3","year":2019},"citing_paper":{"arxiv_id":"2605.19726","last_updated":"2026-05-19T12:01:13Z","snapshot_observed_at":"2026-08-01T08:38:35.585519Z","submitted_at":"2026-05-19T12:01:13Z","title":"Efficient Long-Context Modeling in Diffusion Language Models via Block Approximate Sparse Attention","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:14.089334Z"},"links":{"citing_paper":"/paper/2605.19726"},"observation_digest":"sha256:d6c55b23f3518b26a575f969a8c6cbc0ccb89a73d96c81ed86d8b0d27c92175f","observation_id":"9c840ff3-54fd-433a-9905-4113bb4384a6","resolution":{"observed_at":"2026-05-20T05:53:22.605311Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rethink- ing attention with performers","venue":null,"work_id":"28228974-c2cd-4b79-92ca-31a7519f647a","year":2022},"citing_paper":{"arxiv_id":"2605.19726","last_updated":"2026-05-19T12:01:13Z","snapshot_observed_at":"2026-08-01T08:38:35.585519Z","submitted_at":"2026-05-19T12:01:13Z","title":"Efficient Long-Context Modeling in Diffusion Language Models via Block Approximate Sparse Attention","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:14.089334Z"},"links":{"citing_paper":"/paper/2605.19726"},"observation_digest":"sha256:a6fc2cb73cf701da809bc0808670cde5c99a15dc110b13ba9f6ecdbe7b3b330d","observation_id":"de471ff5-3208-44a5-912a-c9844d360f8a","resolution":{"observed_at":"2026-05-20T05:53:22.606895Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"FlashAttention-2: Faster attention with better par- allelism and work partitioning","venue":null,"work_id":"491b9198-86e9-4a3d-8047-12228a823b34","year":2023},"citing_paper":{"arxiv_id":"2605.19726","last_updated":"2026-05-19T12:01:13Z","snapshot_observed_at":"2026-08-01T08:38:35.585519Z","submitted_at":"2026-05-19T12:01:13Z","title":"Efficient Long-Context Modeling in Diffusion Language Models via Block Approximate Sparse Attention","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:14.089334Z"},"links":{"citing_paper":"/paper/2605.19726"},"observation_digest":"sha256:f07d9264bbe862d88aca5bf5aec395ae442d7b7b1a7746db37ce18073a9c9107","observation_id":"1e8498a8-357f-446f-96fe-75d70bf792ac","resolution":{"observed_at":"2026-05-20T05:53:22.644169Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fu, Stefano Ermon, Atri Rudra, and Christopher R ´e","venue":null,"work_id":"a3794561-d35d-4e13-9f49-adcdb7b206e6","year":2022},"citing_paper":{"arxiv_id":"2605.19726","last_updated":"2026-05-19T12:01:13Z","snapshot_observed_at":"2026-08-01T08:38:35.585519Z","submitted_at":"2026-05-19T12:01:13Z","title":"Efficient Long-Context Modeling in Diffusion Language Models via Block Approximate Sparse Attention","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:14.089334Z"},"links":{"citing_paper":"/paper/2605.19726"},"observation_digest":"sha256:764ad7aed8ce3e87a779f019fa8e72731e3b94497dc3b362fced9eb2ee28fcad","observation_id":"3206fa08-ffe9-46f4-b7f6-ed32d453c940","resolution":{"observed_at":"2026-05-20T05:53:22.594355Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.15089","last_updated":"2022-12-15T14:27:19Z","snapshot_observed_at":"2026-08-07T07:03:02.158312Z","submitted_at":"2022-11-28T06:08:54Z","title":"Continuous diffusion for categorical data","version":3},"cited_work":{"arxiv_id":"2211.15089","doi":null,"metadata_source":"pith","pith_arxiv_id":"2211.15089","snapshot_observed_at":"2026-07-04T17:09:58.816805Z","title":"Continuous diffusion for categorical data","venue":"cs.CL","work_id":"c0904b65-a618-46bd-85ef-53635f43ea5c","year":2022},"citing_paper":{"arxiv_id":"2605.19726","last_updated":"2026-05-19T12:01:13Z","snapshot_observed_at":"2026-08-01T08:38:35.585519Z","submitted_at":"2026-05-19T12:01:13Z","title":"Efficient Long-Context Modeling in Diffusion Language Models via Block Approximate Sparse Attention","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:14.089334Z"},"links":{"cited_paper":"/paper/2211.15089","citing_paper":"/paper/2605.19726"},"observation_digest":"sha256:ca029b23f460bf921d8a9535f90af792401ee09d13789720a0e02063c583dfc0","observation_id":"6320d10c-b9b8-453d-a036-bfa0ff4e373a","resolution":{"observed_at":"2026-05-20T05:53:04.584479Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scaling rectified flow trans- formers for high-resolution image synthesis","venue":null,"work_id":"c4ff5bb1-b0e2-42b1-881c-700d8886b871","year":2024},"citing_paper":{"arxiv_id":"2605.19726","last_updated":"2026-05-19T12:01:13Z","snapshot_observed_at":"2026-08-01T08:38:35.585519Z","submitted_at":"2026-05-19T12:01:13Z","title":"Efficient Long-Context Modeling in Diffusion Language Models via Block Approximate Sparse Attention","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:14.089334Z"},"links":{"citing_paper":"/paper/2605.19726"},"observation_digest":"sha256:ce5b45c93fd1f164c4909d8d55479f043c5d270f2483c1eafc4b64b89e0f198a","observation_id":"8cb6bc00-fafd-4550-9636-90f55a9e0a1e","resolution":{"observed_at":"2026-05-20T05:53:22.593309Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":"2405.21075","doi":"10.1609/icwsm.v17i1.22209","metadata_source":"pith","pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","venue":"cs.CV","work_id":"77fd5ac9-ae98-4846-9d83-e9c73c8f2a52","year":2024},"citing_paper":{"arxiv_id":"2605.19726","last_updated":"2026-05-19T12:01:13Z","snapshot_observed_at":"2026-08-01T08:38:35.585519Z","submitted_at":"2026-05-19T12:01:13Z","title":"Efficient Long-Context Modeling in Diffusion Language Models via Block Approximate Sparse Attention","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:14.089334Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2605.19726"},"observation_digest":"sha256:5996f42d8b835b5da57b600761785a36639a9536ed6d6c5ba3bd0c0a050820a8","observation_id":"e84dd191-f6f6-4054-aaa8-fe13afb797f5","resolution":{"observed_at":"2026-05-20T05:53:04.590594Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Seerattention: Learning in- trinsic sparse attention in your llms","venue":null,"work_id":"46cb3450-ec08-4b92-abee-512898161f7d","year":2025},"citing_paper":{"arxiv_id":"2605.19726","last_updated":"2026-05-19T12:01:13Z","snapshot_observed_at":"2026-08-01T08:38:35.585519Z","submitted_at":"2026-05-19T12:01:13Z","title":"Efficient Long-Context Modeling in Diffusion Language Models via Block Approximate Sparse Attention","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:14.089334Z"},"links":{"citing_paper":"/paper/2605.19726"},"observation_digest":"sha256:41ddb57dcd5008c1b1b41c5d79f799c65603080c2f2a70137633dd301fbc7ac1","observation_id":"c1eccca5-6657-4336-a8f2-9a1b5d4d153b","resolution":{"observed_at":"2026-05-20T05:53:22.596742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15595","last_updated":"2024-11-05T10:02:42Z","snapshot_observed_at":"2026-07-06T18:50:00.486434Z","submitted_at":"2024-07-22T12:33:27Z","title":"Discrete Flow Matching","version":2},"cited_work":{"arxiv_id":"2407.15595","doi":"10.48550/arxiv.2407.15595","metadata_source":"arxiv_reference","pith_arxiv_id":"2407.15595","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Discrete flow matching","venue":"arXiv (Cornell University)","work_id":"d3810acb-2472-492b-b3b2-2cefdf738e9c","year":2024},"citing_paper":{"arxiv_id":"2605.19726","last_updated":"2026-05-19T12:01:13Z","snapshot_observed_at":"2026-08-01T08:38:35.585519Z","submitted_at":"2026-05-19T12:01:13Z","title":"Efficient Long-Context Modeling in Diffusion Language Models via Block Approximate Sparse Attention","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:14.089334Z"},"links":{"cited_paper":"/paper/2407.15595","citing_paper":"/paper/2605.19726"},"observation_digest":"sha256:183ffd65ad5a0f9841bfc32d2548cce28e51f1445dc68efdb4054bdeb0e7d006","observation_id":"1791bdea-5808-45a6-bff5-00aeeaaf79da","resolution":{"observed_at":"2026-05-20T05:53:04.633179Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.08933","last_updated":"2023-02-14T06:45:49Z","snapshot_observed_at":"2026-07-06T14:06:34.310083Z","submitted_at":"2022-10-17T10:49:08Z","title":"DiffuSeq: Sequence to Sequence Text Generation with Diffusion Models","version":3},"cited_work":{"arxiv_id":"2210.08933","doi":"10.48550/arxiv.2210.08933","metadata_source":"pith","pith_arxiv_id":"2210.08933","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DiffuSeq: Sequence to Sequence Text Generation with Diffusion Models","venue":"cs.CL","work_id":"180ac1b2-1f1e-4b77-9bf9-7a16f0167e1b","year":2022},"citing_paper":{"arxiv_id":"2605.19726","last_updated":"2026-05-19T12:01:13Z","snapshot_observed_at":"2026-08-01T08:38:35.585519Z","submitted_at":"2026-05-19T12:01:13Z","title":"Efficient Long-Context Modeling in Diffusion Language Models via Block Approximate Sparse Attention","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:14.089334Z"},"links":{"cited_paper":"/paper/2210.08933","citing_paper":"/paper/2605.19726"},"observation_digest":"sha256:15fce36903e1e10d51752e240a9c9c07960b8e2a4eb4d6167a0e6ee019020d35","observation_id":"4c26f12a-11ea-4189-8222-cb08efd978a6","resolution":{"observed_at":"2026-05-20T06:50:38.345995Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.07037","last_updated":"2025-03-11T08:07:39Z","snapshot_observed_at":"2026-07-06T16:05:55.074136Z","submitted_at":"2023-08-14T09:56:35Z","title":"Bayesian Flow Networks","version":6},"cited_work":{"arxiv_id":"2308.07037","doi":"10.48550/arxiv.2308.07037","metadata_source":"arxiv_reference","pith_arxiv_id":"2308.07037","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Bayesian flow networks","venue":"arXiv (Cornell University)","work_id":"cf1d1296-8467-45d6-a054-ef16e15dea21","year":2023},"citing_paper":{"arxiv_id":"2605.19726","last_updated":"2026-05-19T12:01:13Z","snapshot_observed_at":"2026-08-01T08:38:35.585519Z","submitted_at":"2026-05-19T12:01:13Z","title":"Efficient Long-Context Modeling in Diffusion Language Models via Block Approximate Sparse Attention","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:14.089334Z"},"links":{"cited_paper":"/paper/2308.07037","citing_paper":"/paper/2605.19726"},"observation_digest":"sha256:b017d6970e92eccd2dfb3f84d6c87835cb73e44d704c3dc72d8e11402e3b46dd","observation_id":"bed639e1-e0e6-486d-bf96-3d546977af23","resolution":{"observed_at":"2026-05-20T05:53:04.603331Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.17432","last_updated":"2023-06-26T22:31:06Z","snapshot_observed_at":"2026-08-08T10:55:08.646488Z","submitted_at":"2022-10-31T16:02:00Z","title":"SSD-LM: Semi-autoregressive Simplex-based Diffusion Language Model for Text Generation and Modular Control","version":2},"cited_work":{"arxiv_id":"2210.17432","doi":null,"metadata_source":"pith","pith_arxiv_id":"2210.17432","snapshot_observed_at":"2026-07-11T03:07:52.620085Z","title":"Ssd- lm: Semi-autoregressive simplex-based diffusion language model for text generation and modular control","venue":"cs.CL","work_id":"92551172-cac4-4cf1-852c-8afc80877d9f","year":2022},"citing_paper":{"arxiv_id":"2605.19726","last_updated":"2026-05-19T12:01:13Z","snapshot_observed_at":"2026-08-01T08:38:35.585519Z","submitted_at":"2026-05-19T12:01:13Z","title":"Efficient Long-Context Modeling in Diffusion Language Models via Block Approximate Sparse Attention","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:14.089334Z"},"links":{"cited_paper":"/paper/2210.17432","citing_paper":"/paper/2605.19726"},"observation_digest":"sha256:087214effe336fbaeb154143717a030880d11112b08cf63274b9db358a4a5301","observation_id":"92892330-67bc-4b92-bc27-67a773663d71","resolution":{"observed_at":"2026-05-20T05:53:04.627026Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ultrallada: Scaling the context length to 128k for diffusion large language models","venue":null,"work_id":"37a20c0a-172d-491c-90d0-f118ed4ab91e","year":2025},"citing_paper":{"arxiv_id":"2605.19726","last_updated":"2026-05-19T12:01:13Z","snapshot_observed_at":"2026-08-01T08:38:35.585519Z","submitted_at":"2026-05-19T12:01:13Z","title":"Efficient Long-Context Modeling in Diffusion Language Models via Block Approximate Sparse Attention","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:14.089334Z"},"links":{"citing_paper":"/paper/2605.19726"},"observation_digest":"sha256:8d181aee19c614dfdd58f7878883d2073a0e900ca2e2685d462e5614a4db380d","observation_id":"fc19f77b-9233-41f0-a13f-693e3ab22422","resolution":{"observed_at":"2026-05-20T05:53:22.587895Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-08-10T09:20:57.804343Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":"2404.06654","doi":"10.48550/arxiv.2404.06654","metadata_source":"pith","pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","venue":"cs.CL","work_id":"c0bc4689-3ce8-4e3d-9442-bd74869445bb","year":2024},"citing_paper":{"arxiv_id":"2605.19726","last_updated":"2026-05-19T12:01:13Z","snapshot_observed_at":"2026-08-01T08:38:35.585519Z","submitted_at":"2026-05-19T12:01:13Z","title":"Efficient Long-Context Modeling in Diffusion Language Models via Block Approximate Sparse Attention","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:14.089334Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2605.19726"},"observation_digest":"sha256:49434412bf587b5c310ad0ba8078b8829986c2006b584fae47cd3ed70557b0f0","observation_id":"f6a338e4-53ec-4200-8b14-745ec0fb30ce","resolution":{"observed_at":"2026-05-20T05:53:04.587393Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"VBench: Com- prehensive benchmark suite for video generative models","venue":null,"work_id":"eb2094d6-c272-42a4-b249-0d793f62357e","year":2024},"citing_paper":{"arxiv_id":"2605.19726","last_updated":"2026-05-19T12:01:13Z","snapshot_observed_at":"2026-08-01T08:38:35.585519Z","submitted_at":"2026-05-19T12:01:13Z","title":"Efficient Long-Context Modeling in Diffusion Language Models via Block Approximate Sparse Attention","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:14.089334Z"},"links":{"citing_paper":"/paper/2605.19726"},"observation_digest":"sha256:19508997d28d1774474b9f5a30ae8e3af850352c946ac4fa2557f47d17930d4b","observation_id":"c3aa4ede-cabe-4774-a929-b05c5352795e","resolution":{"observed_at":"2026-05-20T05:53:22.651140Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Abdi, Dongsheng Li, Chin-Yew Lin, Yuqing Yang, and Lili Qiu","venue":null,"work_id":"69ea0e59-3367-4063-a072-3674c71f7fd6","year":2024},"citing_paper":{"arxiv_id":"2605.19726","last_updated":"2026-05-19T12:01:13Z","snapshot_observed_at":"2026-08-01T08:38:35.585519Z","submitted_at":"2026-05-19T12:01:13Z","title":"Efficient Long-Context Modeling in Diffusion Language Models via Block Approximate Sparse Attention","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:14.089334Z"},"links":{"citing_paper":"/paper/2605.19726"},"observation_digest":"sha256:ddcae4c9116337f31374e9aa457a2abd64cd47c87d9c887e3ff4b4e172b9fe98","observation_id":"a5db2dae-c3a1-4587-9588-1542e7e34fef","resolution":{"observed_at":"2026-05-20T05:53:22.634377Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05253","last_updated":"2024-02-07T18:59:55Z","snapshot_observed_at":"2026-08-09T22:48:17.232859Z","submitted_at":"2023-12-08T18:59:14Z","title":"DiSK: A Diffusion Model for Structured Knowledge","version":2},"cited_work":{"arxiv_id":"2312.05253","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.05253","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Disk: A diffusion model for structured knowledge","venue":null,"work_id":"f0249983-104c-4539-a79c-423343e8daaf","year":2023},"citing_paper":{"arxiv_id":"2605.19726","last_updated":"2026-05-19T12:01:13Z","snapshot_observed_at":"2026-08-01T08:38:35.585519Z","submitted_at":"2026-05-19T12:01:13Z","title":"Efficient Long-Context Modeling in Diffusion Language Models via Block Approximate Sparse Attention","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:14.089334Z"},"links":{"cited_paper":"/paper/2312.05253","citing_paper":"/paper/2605.19726"},"observation_digest":"sha256:f9e4769905b0c271f11df0d951a71c9bc6e43de9ee6db9382a59a814d9377088","observation_id":"48ffb516-0d61-49ac-bbe4-c96c9321e4a6","resolution":{"observed_at":"2026-05-20T05:53:04.650180Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Flexprefill: A context-aware sparse attention mecha- nism for efficient long-sequence inference","venue":null,"work_id":"8e5773db-bebd-4fc2-a4b8-02d67cd20608","year":2025},"citing_paper":{"arxiv_id":"2605.19726","last_updated":"2026-05-19T12:01:13Z","snapshot_observed_at":"2026-08-01T08:38:35.585519Z","submitted_at":"2026-05-19T12:01:13Z","title":"Efficient Long-Context Modeling in Diffusion Language Models via Block Approximate Sparse Attention","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:14.089334Z"},"links":{"citing_paper":"/paper/2605.19726"},"observation_digest":"sha256:9a2c06c58cbe307ecc3aded4ff890cf5078f7213c9931566f333a8358801473e","observation_id":"f8ef3565-7d3e-4912-85b6-8855cae133a6","resolution":{"observed_at":"2026-05-20T05:53:22.632397Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Selective attention improves transformer","venue":null,"work_id":"3cb6f587-47b1-46b9-bcaf-5d78874ce613","year":2024},"citing_paper":{"arxiv_id":"2605.19726","last_updated":"2026-05-19T12:01:13Z","snapshot_observed_at":"2026-08-01T08:38:35.585519Z","submitted_at":"2026-05-19T12:01:13Z","title":"Efficient Long-Context Modeling in Diffusion Language Models via Block Approximate Sparse Attention","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:14.089334Z"},"links":{"citing_paper":"/paper/2605.19726"},"observation_digest":"sha256:3628049f90dcfac20856c9a4bc5f878d98905173812455af93eec5b0a61df8ec","observation_id":"139bf43e-b641-4de4-95e2-8c48a49314cb","resolution":{"observed_at":"2026-05-20T05:53:22.603704Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Diffusion-lm improves control- lable text generation.Advances in Neural Information Pro- cessing Systems, 35:4328–4343","venue":null,"work_id":"61ef7fe8-630f-4fbb-93ea-6e98d204e034","year":2022},"citing_paper":{"arxiv_id":"2605.19726","last_updated":"2026-05-19T12:01:13Z","snapshot_observed_at":"2026-08-01T08:38:35.585519Z","submitted_at":"2026-05-19T12:01:13Z","title":"Efficient Long-Context Modeling in Diffusion Language Models via Block Approximate Sparse Attention","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:14.089334Z"},"links":{"citing_paper":"/paper/2605.19726"},"observation_digest":"sha256:c8be188837387fa106d9095d15705a748def13f90918386591fe623b7befa42a","observation_id":"372eae89-c2a0-4707-943a-7f7c56afae51","resolution":{"observed_at":"2026-05-20T05:53:22.592679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Text generation with diffusion language models: A pre-training approach with continuous paragraph denoise","venue":null,"work_id":"90bbfc05-b9a1-4996-bfc4-0ec61acce9e3","year":2023},"citing_paper":{"arxiv_id":"2605.19726","last_updated":"2026-05-19T12:01:13Z","snapshot_observed_at":"2026-08-01T08:38:35.585519Z","submitted_at":"2026-05-19T12:01:13Z","title":"Efficient Long-Context Modeling in Diffusion Language Models via Block Approximate Sparse Attention","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:14.089334Z"},"links":{"citing_paper":"/paper/2605.19726"},"observation_digest":"sha256:8a6ce481675e0deabf3ff96a4df88faee1e1be1d4877b336c9c2d8ad31c5e3ca","observation_id":"c2027f30-6631-4cfd-be79-d162ceaffb2f","resolution":{"observed_at":"2026-05-20T05:53:22.577758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Longllada: Unlocking long con- text capabilities in diffusion llms","venue":null,"work_id":"81afb383-36c7-4dda-b1ec-b4355b318071","year":2025},"citing_paper":{"arxiv_id":"2605.19726","last_updated":"2026-05-19T12:01:13Z","snapshot_observed_at":"2026-08-01T08:38:35.585519Z","submitted_at":"2026-05-19T12:01:13Z","title":"Efficient Long-Context Modeling in Diffusion Language Models via Block Approximate Sparse Attention","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:14.089334Z"},"links":{"citing_paper":"/paper/2605.19726"},"observation_digest":"sha256:b52f58e6f0828ea934e9c2234641a681d04270d242441a25aac99fa63f76c8cd","observation_id":"8ba109ee-81e0-48d2-8876-9b46d9d05411","resolution":{"observed_at":"2026-05-20T05:53:22.588889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reflected diffusion models","venue":null,"work_id":"5b7a3529-d498-4dcc-ada1-829d964952c1","year":null},"citing_paper":{"arxiv_id":"2605.19726","last_updated":"2026-05-19T12:01:13Z","snapshot_observed_at":"2026-08-01T08:38:35.585519Z","submitted_at":"2026-05-19T12:01:13Z","title":"Efficient Long-Context Modeling in Diffusion Language Models via Block Approximate Sparse Attention","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:14.089334Z"},"links":{"citing_paper":"/paper/2605.19726"},"observation_digest":"sha256:6d90c125c00f05bba9f3827791919e76afa1a6058ab8641bb8680e32950c2adf","observation_id":"7b9d2878-48b9-45d8-af21-ca5aef48d043","resolution":{"observed_at":"2026-05-20T05:53:22.579120Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Zhang, Zhilin Yang, Xinyu Zhou, Mingxing Zhang, and Jiezhong Qiu","venue":null,"work_id":"19c82428-09c2-4aac-a1f5-dc769f412b01","year":2025},"citing_paper":{"arxiv_id":"2605.19726","last_updated":"2026-05-19T12:01:13Z","snapshot_observed_at":"2026-08-01T08:38:35.585519Z","submitted_at":"2026-05-19T12:01:13Z","title":"Efficient Long-Context Modeling in Diffusion Language Models via Block Approximate Sparse Attention","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:14.089334Z"},"links":{"citing_paper":"/paper/2605.19726"},"observation_digest":"sha256:9698c59ab71ea29b3358ab51cdc7d0fd0758ced6114fed4a419ce270e3b26457","observation_id":"8662358e-a180-4e19-85ae-350b8737b0f8","resolution":{"observed_at":"2026-05-20T05:53:22.647749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Peters, and Ar- man Cohan","venue":null,"work_id":"43443c72-4dcd-41d0-86f9-c3182093de65","year":2024},"citing_paper":{"arxiv_id":"2605.19726","last_updated":"2026-05-19T12:01:13Z","snapshot_observed_at":"2026-08-01T08:38:35.585519Z","submitted_at":"2026-05-19T12:01:13Z","title":"Efficient Long-Context Modeling in Diffusion Language Models via Block Approximate Sparse Attention","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:14.089334Z"},"links":{"citing_paper":"/paper/2605.19726"},"observation_digest":"sha256:444cb8a69c8e90f8e9679f9c7478ef497a100455a4770c79770efc70893c832b","observation_id":"7e15e67f-8f08-48b1-8991-fd8fdeec01b2","resolution":{"observed_at":"2026-05-20T05:53:22.630043Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.10244","last_updated":"2022-03-19T05:00:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-19T05:00:30Z","title":"ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning","version":1},"cited_work":{"arxiv_id":"2203.10244","doi":null,"metadata_source":"pith","pith_arxiv_id":"2203.10244","snapshot_observed_at":"2026-07-04T16:39:57.602645Z","title":"ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning","venue":"cs.CL","work_id":"8b49b78c-7e1d-4f57-af10-7c11cd63ff7c","year":2022},"citing_paper":{"arxiv_id":"2605.19726","last_updated":"2026-05-19T12:01:13Z","snapshot_observed_at":"2026-08-01T08:38:35.585519Z","submitted_at":"2026-05-19T12:01:13Z","title":"Efficient Long-Context Modeling in Diffusion Language Models via Block Approximate Sparse Attention","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:14.089334Z"},"links":{"cited_paper":"/paper/2203.10244","citing_paper":"/paper/2605.19726"},"observation_digest":"sha256:edd7b3cb6ed9b8a7d432af11cb1fe768cf40a3b7c9c27aa07e9861946ad46669","observation_id":"aeae9016-9c2c-4f4a-8aae-716676c076f8","resolution":{"observed_at":"2026-05-20T05:53:04.639105Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Docvqa: A dataset for vqa on document images","venue":null,"work_id":"0e39824f-1343-4443-baec-b609ed8d1bde","year":2021},"citing_paper":{"arxiv_id":"2605.19726","last_updated":"2026-05-19T12:01:13Z","snapshot_observed_at":"2026-08-01T08:38:35.585519Z","submitted_at":"2026-05-19T12:01:13Z","title":"Efficient Long-Context Modeling in Diffusion Language Models via Block Approximate Sparse Attention","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:14.089334Z"},"links":{"citing_paper":"/paper/2605.19726"},"observation_digest":"sha256:efdb3fdad2000522b9ae68122226cee6f83c05c4c3ec1cd4340bb7a84656beca","observation_id":"4ce251a0-6281-403b-80bb-0485249cfc92","resolution":{"observed_at":"2026-05-20T05:53:22.638412Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Infographicvqa","venue":null,"work_id":"b372d4d5-c25d-45d5-a4c7-1b50b65567ee","year":2022},"citing_paper":{"arxiv_id":"2605.19726","last_updated":"2026-05-19T12:01:13Z","snapshot_observed_at":"2026-08-01T08:38:35.585519Z","submitted_at":"2026-05-19T12:01:13Z","title":"Efficient Long-Context Modeling in Diffusion Language Models via Block Approximate Sparse Attention","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:14.089334Z"},"links":{"citing_paper":"/paper/2605.19726"},"observation_digest":"sha256:c38d390f0297e4e0ce4d62ba5fb342e00bd236ab29ab2059ba37ee5666aa80f6","observation_id":"972e793e-f5b5-4360-a6da-cc438b4e51e0","resolution":{"observed_at":"2026-05-20T05:53:22.597788Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Transformers are multi-state rnns","venue":null,"work_id":"06a710fb-a620-434b-b301-81232549b65a","year":2024},"citing_paper":{"arxiv_id":"2605.19726","last_updated":"2026-05-19T12:01:13Z","snapshot_observed_at":"2026-08-01T08:38:35.585519Z","submitted_at":"2026-05-19T12:01:13Z","title":"Efficient Long-Context Modeling in Diffusion Language Models via Block Approximate Sparse Attention","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:14.089334Z"},"links":{"citing_paper":"/paper/2605.19726"},"observation_digest":"sha256:1bf56e7bd239ff8e3459fd1a9c745afb8896f6d804eeeb73c63d513b80e967a6","observation_id":"51ddba6a-17ed-4693-9049-0968a5b4ae1e","resolution":{"observed_at":"2026-05-20T05:53:22.619588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hellendoorn, and Graham Neubig","venue":null,"work_id":"66c5c674-126f-41b1-9edf-c97ee2914d1e","year":null},"citing_paper":{"arxiv_id":"2605.19726","last_updated":"2026-05-19T12:01:13Z","snapshot_observed_at":"2026-08-01T08:38:35.585519Z","submitted_at":"2026-05-19T12:01:13Z","title":"Efficient Long-Context Modeling in Diffusion Language Models via Block Approximate Sparse Attention","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:14.089334Z"},"links":{"citing_paper":"/paper/2605.19726"},"observation_digest":"sha256:5bb757862d321a58fd0bc31718fe6731f68d4687f209ae526fa0e976dd722517","observation_id":"2aea28ad-dcfb-4887-9d5d-5fad38e3c165","resolution":{"observed_at":"2026-05-20T05:53:22.624758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Richemond, Sander Dieleman, and Arnaud Doucet","venue":null,"work_id":"abb1ac04-83b3-45dd-be8e-18e4c0502dba","year":2022},"citing_paper":{"arxiv_id":"2605.19726","last_updated":"2026-05-19T12:01:13Z","snapshot_observed_at":"2026-08-01T08:38:35.585519Z","submitted_at":"2026-05-19T12:01:13Z","title":"Efficient Long-Context Modeling in Diffusion Language Models via Block Approximate Sparse Attention","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:14.089334Z"},"links":{"citing_paper":"/paper/2605.19726"},"observation_digest":"sha256:51a742582504ee8926ffb1e33748c9778f0208f23f566bb7d00a383ebd624744","observation_id":"b57561d9-3e4f-471c-a4b1-88f584a766a7","resolution":{"observed_at":"2026-05-20T05:53:22.612804Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.04236","last_updated":"2022-11-08T13:30:27Z","snapshot_observed_at":"2026-08-10T08:01:48.939987Z","submitted_at":"2022-11-08T13:30:27Z","title":"Self-conditioned Embedding Diffusion for Text Generation","version":1},"cited_work":{"arxiv_id":"2211.04236","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2211.04236","snapshot_observed_at":"2026-07-03T17:38:43.646621Z","title":"Self- conditioned embedding diffusion for text generation","venue":null,"work_id":"b8ff832e-f8bf-46b5-a76a-7491ac443852","year":2022},"citing_paper":{"arxiv_id":"2605.19726","last_updated":"2026-05-19T12:01:13Z","snapshot_observed_at":"2026-08-01T08:38:35.585519Z","submitted_at":"2026-05-19T12:01:13Z","title":"Efficient Long-Context Modeling in Diffusion Language Models via Block Approximate Sparse Attention","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:14.089334Z"},"links":{"cited_paper":"/paper/2211.04236","citing_paper":"/paper/2605.19726"},"observation_digest":"sha256:d5fba4feeb088a2cd01e097bf6314fa162c30396466de41ed349021b516e2bf6","observation_id":"050dd22b-395d-42a4-a3ec-0e84eb97451f","resolution":{"observed_at":"2026-05-20T05:53:04.593491Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.16750","last_updated":"2023-03-06T18:57:42Z","snapshot_observed_at":"2026-08-07T14:16:10.981980Z","submitted_at":"2022-11-30T05:33:29Z","title":"Score-based Continuous-time Discrete Diffusion Models","version":2},"cited_work":{"arxiv_id":"2211.16750","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2211.16750","snapshot_observed_at":"2026-07-03T17:38:43.674052Z","title":"Score-based continuous-time discrete diffusion models","venue":null,"work_id":"5f785ebe-ed23-4b6e-9cac-a61f221697ca","year":2022},"citing_paper":{"arxiv_id":"2605.19726","last_updated":"2026-05-19T12:01:13Z","snapshot_observed_at":"2026-08-01T08:38:35.585519Z","submitted_at":"2026-05-19T12:01:13Z","title":"Efficient Long-Context Modeling in Diffusion Language Models via Block Approximate Sparse Attention","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:14.089334Z"},"links":{"cited_paper":"/paper/2211.16750","citing_paper":"/paper/2605.19726"},"observation_digest":"sha256:e42b4a9b020e3b5faa12f549409eb5ce34b5174c03f71c0b0cfeffabacb96e2a","observation_id":"dc335636-39dd-4710-9460-634b734f6426","resolution":{"observed_at":"2026-05-20T05:53:04.644680Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"f7633051-e4fe-4f17-af99-cf58158f372d","year":2019},"citing_paper":{"arxiv_id":"2605.19726","last_updated":"2026-05-19T12:01:13Z","snapshot_observed_at":"2026-08-01T08:38:35.585519Z","submitted_at":"2026-05-19T12:01:13Z","title":"Efficient Long-Context Modeling in Diffusion Language Models via Block Approximate Sparse Attention","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:14.089334Z"},"links":{"citing_paper":"/paper/2605.19726"},"observation_digest":"sha256:fc75b0c1e1c8f351a14104b48682c3903e3c96179d5379325ed6a0d4a47e6431","observation_id":"d18bdf79-ebb4-4e6e-8b83-54c86c46969b","resolution":{"observed_at":"2026-05-20T05:53:22.599620Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Wan: Open and advanced large-scale video generative models","venue":null,"work_id":"cdba9adc-fc0e-4152-8019-cea675591d42","year":2025},"citing_paper":{"arxiv_id":"2605.19726","last_updated":"2026-05-19T12:01:13Z","snapshot_observed_at":"2026-08-01T08:38:35.585519Z","submitted_at":"2026-05-19T12:01:13Z","title":"Efficient Long-Context Modeling in Diffusion Language Models via Block Approximate Sparse Attention","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:14.089334Z"},"links":{"citing_paper":"/paper/2605.19726"},"observation_digest":"sha256:d39912666cda1cdc5a3081c17b4c9a82779f5e24bce2c5a730a65cf30a8a4008","observation_id":"2b9251ad-dcf6-4cef-af05-9510bf6f98bc","resolution":{"observed_at":"2026-05-20T05:53:22.601367Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09411","last_updated":"2024-07-02T01:56:14Z","snapshot_observed_at":"2026-08-09T15:18:46.301127Z","submitted_at":"2024-06-13T17:59:52Z","title":"MuirBench: A Comprehensive Benchmark for Robust Multi-image Understanding","version":2},"cited_work":{"arxiv_id":"2406.09411","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.09411","snapshot_observed_at":"2026-07-04T21:00:08.872451Z","title":"MuirBench: A Comprehensive Benchmark for Robust Multi-image Understanding","venue":"cs.CV","work_id":"9303f540-1c57-4c25-bed8-4456eb1c7e17","year":2024},"citing_paper":{"arxiv_id":"2605.19726","last_updated":"2026-05-19T12:01:13Z","snapshot_observed_at":"2026-08-01T08:38:35.585519Z","submitted_at":"2026-05-19T12:01:13Z","title":"Efficient Long-Context Modeling in Diffusion Language Models via Block Approximate Sparse Attention","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:14.089334Z"},"links":{"cited_paper":"/paper/2406.09411","citing_paper":"/paper/2605.19726"},"observation_digest":"sha256:1f85cba1bcc67675d97e36743e443ba31caacc852355b1b5a461aeb067816eff","observation_id":"2b463ede-dc0d-4298-937e-c05f1b0ea842","resolution":{"observed_at":"2026-05-20T05:53:04.647464Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fast-dllm: Training-free acceleration of diffusion llm by enabling kv cache and parallel decoding","venue":null,"work_id":"ea930b4a-eedf-4a78-8a79-c72323ccbbc9","year":2025},"citing_paper":{"arxiv_id":"2605.19726","last_updated":"2026-05-19T12:01:13Z","snapshot_observed_at":"2026-08-01T08:38:35.585519Z","submitted_at":"2026-05-19T12:01:13Z","title":"Efficient Long-Context Modeling in Diffusion Language Models via Block Approximate Sparse Attention","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:14.089334Z"},"links":{"citing_paper":"/paper/2605.19726"},"observation_digest":"sha256:c6f76bc62398d1d7995af30e2a4635c59b8cf0adbbfab387a7055de9fa557c32","observation_id":"55ee2001-1347-4f03-9fb9-69f3d0c19996","resolution":{"observed_at":"2026-05-20T05:53:22.604840Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ar-diffusion: Auto-regressive diffusion model for text generation","venue":null,"work_id":"afd79e01-9892-4675-aa4c-bc3b56f98f8f","year":2023},"citing_paper":{"arxiv_id":"2605.19726","last_updated":"2026-05-19T12:01:13Z","snapshot_observed_at":"2026-08-01T08:38:35.585519Z","submitted_at":"2026-05-19T12:01:13Z","title":"Efficient Long-Context Modeling in Diffusion Language Models via Block Approximate Sparse Attention","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:14.089334Z"},"links":{"citing_paper":"/paper/2605.19726"},"observation_digest":"sha256:a716a0a00bfdca4c9b2d25ad3b55d4753767264e6378deb9a944c06ef05abe44","observation_id":"1dee2a00-6f63-4237-980a-0442770d4cac","resolution":{"observed_at":"2026-05-20T05:53:22.608986Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Grok-1.5 vision preview","venue":null,"work_id":"b1d8e804-c9c3-4b00-ab3e-9b24c579e6e4","year":2024},"citing_paper":{"arxiv_id":"2605.19726","last_updated":"2026-05-19T12:01:13Z","snapshot_observed_at":"2026-08-01T08:38:35.585519Z","submitted_at":"2026-05-19T12:01:13Z","title":"Efficient Long-Context Modeling in Diffusion Language Models via Block Approximate Sparse Attention","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:14.089334Z"},"links":{"citing_paper":"/paper/2605.19726"},"observation_digest":"sha256:93e01a803996945b0a09c0f52293770b2e6a483c21a8028096386a7a31350f6e","observation_id":"bc915e6d-0599-460d-8791-f54d93edcb6b","resolution":{"observed_at":"2026-05-20T05:53:22.642394Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sparse videogen: Accelerating video diffusion transformers with spatial-temporal sparsity","venue":null,"work_id":"6826a368-4536-4a98-b6cd-942a57c1ebf5","year":2025},"citing_paper":{"arxiv_id":"2605.19726","last_updated":"2026-05-19T12:01:13Z","snapshot_observed_at":"2026-08-01T08:38:35.585519Z","submitted_at":"2026-05-19T12:01:13Z","title":"Efficient Long-Context Modeling in Diffusion Language Models via Block Approximate Sparse Attention","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:14.089334Z"},"links":{"citing_paper":"/paper/2605.19726"},"observation_digest":"sha256:8044537c39d4fb5feecd32f9a803696c0ee657f6f6ca1bfecf3c97ae55f7b5b0","observation_id":"e6048583-dd94-4a6e-aa18-2eca0ff3333b","resolution":{"observed_at":"2026-05-20T05:53:22.645895Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Efficient streaming language models with attention sinks","venue":null,"work_id":"6d97327b-e301-4aec-988c-b22505a8e564","year":2024},"citing_paper":{"arxiv_id":"2605.19726","last_updated":"2026-05-19T12:01:13Z","snapshot_observed_at":"2026-08-01T08:38:35.585519Z","submitted_at":"2026-05-19T12:01:13Z","title":"Efficient Long-Context Modeling in Diffusion Language Models via Block Approximate Sparse Attention","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:14.089334Z"},"links":{"citing_paper":"/paper/2605.19726"},"observation_digest":"sha256:f10d48b5a38f5483d4e691ffada371ab439d3a87fc2c3f1d98123d59fa04263f","observation_id":"5955d4cf-688d-492e-952c-3b73c1f9d9bf","resolution":{"observed_at":"2026-05-20T05:53:22.638569Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Efficient streaming language models with attention sinks","venue":null,"work_id":"ae49a4e0-8f5b-4b7d-8493-5b8e106c8bfc","year":2024},"citing_paper":{"arxiv_id":"2605.19726","last_updated":"2026-05-19T12:01:13Z","snapshot_observed_at":"2026-08-01T08:38:35.585519Z","submitted_at":"2026-05-19T12:01:13Z","title":"Efficient Long-Context Modeling in Diffusion Language Models via Block Approximate Sparse Attention","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:14.089334Z"},"links":{"citing_paper":"/paper/2605.19726"},"observation_digest":"sha256:f2a64ba337ee139ea2b33669a81f62c6c253fbb80c759606976b5ba0d58fc2b9","observation_id":"47060cb4-dd3e-4965-8a4e-90f609cfbb44","resolution":{"observed_at":"2026-05-20T05:53:22.636307Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Xattention: Block sparse attention with an- tidiagonal scoring","venue":null,"work_id":"1f17ea43-e35b-47ca-9258-0af60af0e5be","year":2025},"citing_paper":{"arxiv_id":"2605.19726","last_updated":"2026-05-19T12:01:13Z","snapshot_observed_at":"2026-08-01T08:38:35.585519Z","submitted_at":"2026-05-19T12:01:13Z","title":"Efficient Long-Context Modeling in Diffusion Language Models via Block Approximate Sparse Attention","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:14.089334Z"},"links":{"citing_paper":"/paper/2605.19726"},"observation_digest":"sha256:ca9a298e911e623a5cb01af9bbd3d31af679b67ed4428c506c5cc3c75c703fbf","observation_id":"7c93b1b7-59cf-429c-9fb1-f6e69f1c7d11","resolution":{"observed_at":"2026-05-20T05:53:22.636796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.15766","last_updated":"2024-06-02T13:55:21Z","snapshot_observed_at":"2026-07-06T18:04:54.726338Z","submitted_at":"2024-04-24T09:39:06Z","title":"Unifying Bayesian Flow Networks and Diffusion Models through Stochastic Differential Equations","version":2},"cited_work":{"arxiv_id":"2404.15766","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.15766","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Unifying bayesian flow net- works and diffusion models through stochastic differential equations","venue":null,"work_id":"d28fa240-da17-4e03-9a51-477aa38dc0de","year":2024},"citing_paper":{"arxiv_id":"2605.19726","last_updated":"2026-05-19T12:01:13Z","snapshot_observed_at":"2026-08-01T08:38:35.585519Z","submitted_at":"2026-05-19T12:01:13Z","title":"Efficient Long-Context Modeling in Diffusion Language Models via Block Approximate Sparse Attention","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:14.089334Z"},"links":{"cited_paper":"/paper/2404.15766","citing_paper":"/paper/2605.19726"},"observation_digest":"sha256:701f3a5d9111cea418e365662202cca1268a75b5a65460c6bbc9f58dbee18371","observation_id":"c1ceb7d8-81fb-418e-b237-110b0c5c9b93","resolution":{"observed_at":"2026-05-20T05:53:04.606868Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sparse videogen2: Accelerate video generation with sparse attention via semantic-aware permutation","venue":null,"work_id":"22ff972e-07ef-4f98-8d35-e7bab8111639","year":2025},"citing_paper":{"arxiv_id":"2605.19726","last_updated":"2026-05-19T12:01:13Z","snapshot_observed_at":"2026-08-01T08:38:35.585519Z","submitted_at":"2026-05-19T12:01:13Z","title":"Efficient Long-Context Modeling in Diffusion Language Models via Block Approximate Sparse Attention","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:14.089334Z"},"links":{"citing_paper":"/paper/2605.19726"},"observation_digest":"sha256:da1038e28e1f2d93ffc96451df572a2c1ef63d3884b5b15a9988b737f2dc6ded","observation_id":"243a22f3-2542-4e0e-85b1-c29637ee70a2","resolution":{"observed_at":"2026-05-20T05:53:22.631738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12219","last_updated":"2025-02-24T05:09:09Z","snapshot_observed_at":"2026-07-06T16:09:35.920101Z","submitted_at":"2023-08-23T16:01:12Z","title":"Diffusion Language Models Can Perform Many Tasks with Scaling and Instruction-Finetuning","version":3},"cited_work":{"arxiv_id":"2308.12219","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.12219","snapshot_observed_at":"2026-07-04T10:29:44.773372Z","title":"Diffusion language mod- els can perform many tasks with scaling and instruction-finetuning","venue":null,"work_id":"d42f14d9-5aef-4d9a-9e98-89236097a2de","year":2023},"citing_paper":{"arxiv_id":"2605.19726","last_updated":"2026-05-19T12:01:13Z","snapshot_observed_at":"2026-08-01T08:38:35.585519Z","submitted_at":"2026-05-19T12:01:13Z","title":"Efficient Long-Context Modeling in Diffusion Language Models via Block Approximate Sparse Attention","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:14.089334Z"},"links":{"cited_paper":"/paper/2308.12219","citing_paper":"/paper/2605.19726"},"observation_digest":"sha256:402d9d35cf0d3b9ed8d9d9b17d6cc5e2741cbcf3e3694de694ec4375fa4f6462","observation_id":"2f4cb38b-9b6c-46ef-84bc-d6bd54bac48c","resolution":{"observed_at":"2026-05-20T05:53:04.615584Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.10025","last_updated":"2024-05-01T02:58:30Z","snapshot_observed_at":"2026-07-06T14:53:42.192162Z","submitted_at":"2023-02-20T15:14:46Z","title":"DINOISER: Diffused Conditional Sequence Learning by Manipulating Noises","version":2},"cited_work":{"arxiv_id":"2302.10025","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2302.10025","snapshot_observed_at":"2026-07-03T17:08:43.457635Z","title":"Dinoiser: Diffused conditional se- quence learning by manipulating noises","venue":null,"work_id":"35c5afd4-f834-46e8-bf77-934bc6312553","year":2023},"citing_paper":{"arxiv_id":"2605.19726","last_updated":"2026-05-19T12:01:13Z","snapshot_observed_at":"2026-08-01T08:38:35.585519Z","submitted_at":"2026-05-19T12:01:13Z","title":"Efficient Long-Context Modeling in Diffusion Language Models via Block Approximate Sparse Attention","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:14.089334Z"},"links":{"cited_paper":"/paper/2302.10025","citing_paper":"/paper/2605.19726"},"observation_digest":"sha256:a8b50a3c662fe3906793edbf2fd23d2321f96cae4f479f12509325e9793a20bb","observation_id":"2e38edc2-7706-4ce7-84aa-452819d7a00c","resolution":{"observed_at":"2026-05-20T05:53:04.621261Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cascade infer- ence: Memory bandwidth efficient shared prefix batch de- coding.https://flashinfer.ai/2024/01/08/ cascade-inference.html","venue":null,"work_id":"7023e4d2-ed6f-4d47-880e-f621134098f5","year":2024},"citing_paper":{"arxiv_id":"2605.19726","last_updated":"2026-05-19T12:01:13Z","snapshot_observed_at":"2026-08-01T08:38:35.585519Z","submitted_at":"2026-05-19T12:01:13Z","title":"Efficient Long-Context Modeling in Diffusion Language Models via Block Approximate Sparse Attention","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:14.089334Z"},"links":{"citing_paper":"/paper/2605.19726"},"observation_digest":"sha256:ae0592d4d93811a2b6ae9c1f7a978523d348ec23ae97f4a44753781768502177","observation_id":"0cadcb8b-5064-4424-a8c6-b3422442deb2","resolution":{"observed_at":"2026-05-20T05:53:22.643816Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Llada-v: Large language diffusion models with visual instruction tuning","venue":null,"work_id":"84ceacca-801c-46eb-9714-5e08b7c6b47f","year":null},"citing_paper":{"arxiv_id":"2605.19726","last_updated":"2026-05-19T12:01:13Z","snapshot_observed_at":"2026-08-01T08:38:35.585519Z","submitted_at":"2026-05-19T12:01:13Z","title":"Efficient Long-Context Modeling in Diffusion Language Models via Block Approximate Sparse Attention","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:14.089334Z"},"links":{"citing_paper":"/paper/2605.19726"},"observation_digest":"sha256:caddef1dd0b6234b0919c225ac24b148ac5bdda05296acc7899597abf27aa48b","observation_id":"beed53e4-85af-421d-9d05-ddb0d5ece317","resolution":{"observed_at":"2026-05-20T05:53:22.625923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"5f77516d-d769-437e-8b65-4c14ecd61a19","year":2025},"citing_paper":{"arxiv_id":"2605.19726","last_updated":"2026-05-19T12:01:13Z","snapshot_observed_at":"2026-08-01T08:38:35.585519Z","submitted_at":"2026-05-19T12:01:13Z","title":"Efficient Long-Context Modeling in Diffusion Language Models via Block Approximate Sparse Attention","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:14.089334Z"},"links":{"citing_paper":"/paper/2605.19726"},"observation_digest":"sha256:6c92346c75d91bc9de54fa99a1cf1ea810cc5f7ef190eea75d0946b769975409","observation_id":"c1d940b2-e13c-4c05-ad96-d82fe73c21a6","resolution":{"observed_at":"2026-05-20T05:53:22.630210Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for ex- pert agi","venue":null,"work_id":"ebce06ae-ed76-4601-b960-d133e369bc40","year":2024},"citing_paper":{"arxiv_id":"2605.19726","last_updated":"2026-05-19T12:01:13Z","snapshot_observed_at":"2026-08-01T08:38:35.585519Z","submitted_at":"2026-05-19T12:01:13Z","title":"Efficient Long-Context Modeling in Diffusion Language Models via Block Approximate Sparse Attention","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:14.089334Z"},"links":{"citing_paper":"/paper/2605.19726"},"observation_digest":"sha256:d1c4f25affa6fb1a386f3db4efe1c731c1418086df5a2c9cc0774474fa408e71","observation_id":"1a39369b-b86e-429d-aeaf-08408be870d2","resolution":{"observed_at":"2026-05-20T05:53:22.640650Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02813","last_updated":"2025-05-22T08:22:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-04T15:31:26Z","title":"MMMU-Pro: A More Robust Multi-discipline Multimodal Understanding Benchmark","version":3},"cited_work":{"arxiv_id":"2409.02813","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.02813","snapshot_observed_at":"2026-07-08T19:35:32.916072Z","title":"MMMU-Pro: A More Robust Multi-discipline Multimodal Understanding Benchmark","venue":"cs.CL","work_id":"19883673-604e-4b58-b036-5a04ec11a6f9","year":2024},"citing_paper":{"arxiv_id":"2605.19726","last_updated":"2026-05-19T12:01:13Z","snapshot_observed_at":"2026-08-01T08:38:35.585519Z","submitted_at":"2026-05-19T12:01:13Z","title":"Efficient Long-Context Modeling in Diffusion Language Models via Block Approximate Sparse Attention","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:14.089334Z"},"links":{"cited_paper":"/paper/2409.02813","citing_paper":"/paper/2605.19726"},"observation_digest":"sha256:41da3006c86b53947cc6e7eef608aa6b089c7eb7fd2ac0bcac3a9ad44a0d2c67","observation_id":"a82bbf69-7e34-4c6c-98b5-af8865ed88a1","resolution":{"observed_at":"2026-05-20T05:53:04.597353Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Big bird: Transformers for longer sequences.Advances in Neu- ral Information Processing Systems, 33","venue":null,"work_id":"009c4254-7109-4358-8e75-9694068603da","year":2020},"citing_paper":{"arxiv_id":"2605.19726","last_updated":"2026-05-19T12:01:13Z","snapshot_observed_at":"2026-08-01T08:38:35.585519Z","submitted_at":"2026-05-19T12:01:13Z","title":"Efficient Long-Context Modeling in Diffusion Language Models via Block Approximate Sparse Attention","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:14.089334Z"},"links":{"citing_paper":"/paper/2605.19726"},"observation_digest":"sha256:6430f130cafdc4ab97dfd34f30660b4a8c3adf6839f1fbee3176e1f14e4b4ce6","observation_id":"1a4265dd-352d-4d95-82b1-446fe221e3fa","resolution":{"observed_at":"2026-05-20T05:53:22.649441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fast video gen- eration with sliding tile attention","venue":null,"work_id":"8e6b4a57-74a7-46b1-ba35-0cef4f93ad29","year":2025},"citing_paper":{"arxiv_id":"2605.19726","last_updated":"2026-05-19T12:01:13Z","snapshot_observed_at":"2026-08-01T08:38:35.585519Z","submitted_at":"2026-05-19T12:01:13Z","title":"Efficient Long-Context Modeling in Diffusion Language Models via Block Approximate Sparse Attention","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:14.089334Z"},"links":{"citing_paper":"/paper/2605.19726"},"observation_digest":"sha256:7fb1c8164b7194822832e58e97c801210dcf514e816cc764d1ef47587fb807c3","observation_id":"a8633d23-b270-4e01-a2d7-329793961255","resolution":{"observed_at":"2026-05-20T05:53:22.621527Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16431","last_updated":"2025-04-23T05:32:58Z","snapshot_observed_at":"2026-08-07T16:00:00.984752Z","submitted_at":"2025-04-23T05:32:58Z","title":"Target Concrete Score Matching: A Holistic Framework for Discrete Diffusion","version":1},"cited_work":{"arxiv_id":"2504.16431","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.16431","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Target concrete score matching: A holistic framework for discrete diffusion","venue":null,"work_id":"cf0a5b62-2551-4788-aad3-b4cde4f2d668","year":2025},"citing_paper":{"arxiv_id":"2605.19726","last_updated":"2026-05-19T12:01:13Z","snapshot_observed_at":"2026-08-01T08:38:35.585519Z","submitted_at":"2026-05-19T12:01:13Z","title":"Efficient Long-Context Modeling in Diffusion Language Models via Block Approximate Sparse Attention","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:14.089334Z"},"links":{"cited_paper":"/paper/2504.16431","citing_paper":"/paper/2605.19726"},"observation_digest":"sha256:1beae917f9fc9dc60dc84bffcf7ebd8c094ec29c32f45495db7743b5eaaa9db6","observation_id":"10d35052-eebe-4e30-b4f6-29425426dc86","resolution":{"observed_at":"2026-05-20T05:53:04.618418Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Planner: Generating diversified paragraph via latent language diffusion model","venue":null,"work_id":"8c84388a-f3cd-4cbc-98ae-92d9f1ae1870","year":2023},"citing_paper":{"arxiv_id":"2605.19726","last_updated":"2026-05-19T12:01:13Z","snapshot_observed_at":"2026-08-01T08:38:35.585519Z","submitted_at":"2026-05-19T12:01:13Z","title":"Efficient Long-Context Modeling in Diffusion Language Models via Block Approximate Sparse Attention","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:14.089334Z"},"links":{"citing_paper":"/paper/2605.19726"},"observation_digest":"sha256:03711c595fc99a2cf9ab44116df055c34e3aa804ab307e7a2419876f38856114","observation_id":"89a97160-6e4c-44e7-9dd0-36db950be0ed","resolution":{"observed_at":"2026-05-20T05:53:22.618324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"H 2o: Heavy-hitter oracle for efficient generative in- ference of large language models","venue":null,"work_id":"925b360e-2f74-4a71-a608-f68294f267c3","year":2023},"citing_paper":{"arxiv_id":"2605.19726","last_updated":"2026-05-19T12:01:13Z","snapshot_observed_at":"2026-08-01T08:38:35.585519Z","submitted_at":"2026-05-19T12:01:13Z","title":"Efficient Long-Context Modeling in Diffusion Language Models via Block Approximate Sparse Attention","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:14.089334Z"},"links":{"citing_paper":"/paper/2605.19726"},"observation_digest":"sha256:8fbf7f42fd34a4bbaef8b1206e49b88e6723e4e169915205dad2c9e814fdcd14","observation_id":"2fe0e7ea-afb9-4351-bc77-e0facf748ef0","resolution":{"observed_at":"2026-05-20T05:53:22.612950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Masked diffusion models are secretly time-agnostic masked models and exploit inaccurate categorical sampling","venue":null,"work_id":"0d919011-e8e7-4063-afa2-6871f5a252e4","year":2024},"citing_paper":{"arxiv_id":"2605.19726","last_updated":"2026-05-19T12:01:13Z","snapshot_observed_at":"2026-08-01T08:38:35.585519Z","submitted_at":"2026-05-19T12:01:13Z","title":"Efficient Long-Context Modeling in Diffusion Language Models via Block Approximate Sparse Attention","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:14.089334Z"},"links":{"citing_paper":"/paper/2605.19726"},"observation_digest":"sha256:fb593fadaf6b1f5ce2366da3bd0fc2ed0412b2ae79201123591a17f4138772c9","observation_id":"a6dba996-c5dc-415e-96f5-721060a8b143","resolution":{"observed_at":"2026-05-20T05:53:22.617891Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.05737","last_updated":"2024-08-02T16:09:14Z","snapshot_observed_at":"2026-08-06T16:42:40.001017Z","submitted_at":"2023-02-11T16:26:57Z","title":"A Reparameterized Discrete Diffusion Model for Text Generation","version":3},"cited_work":{"arxiv_id":"2302.05737","doi":"10.48550/arxiv.2302.05737","metadata_source":"pith","pith_arxiv_id":"2302.05737","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A reparameterized discrete diffusion model for text generation","venue":"cs.CL","work_id":"e2ab2b71-c375-49cc-be9c-fdbb182e8d64","year":2023},"citing_paper":{"arxiv_id":"2605.19726","last_updated":"2026-05-19T12:01:13Z","snapshot_observed_at":"2026-08-01T08:38:35.585519Z","submitted_at":"2026-05-19T12:01:13Z","title":"Efficient Long-Context Modeling in Diffusion Language Models via Block Approximate Sparse Attention","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:14.089334Z"},"links":{"cited_paper":"/paper/2302.05737","citing_paper":"/paper/2605.19726"},"observation_digest":"sha256:adc659f88d5c80fe6d8d1883d5e9fd26e8e6e6084ae1d17b5e308a06dc899595","observation_id":"4cb48701-5e40-47d4-96bf-cbf4fc4ec25b","resolution":{"observed_at":"2026-05-20T05:53:04.636431Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04264","last_updated":"2025-01-01T15:53:58Z","snapshot_observed_at":"2026-08-03T20:38:36.602554Z","submitted_at":"2024-06-06T17:09:32Z","title":"MLVU: Benchmarking Multi-task Long Video Understanding","version":3},"cited_work":{"arxiv_id":"2406.04264","doi":"10.48550/arxiv.2406.04264","metadata_source":"pith","pith_arxiv_id":"2406.04264","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MLVU: Benchmarking Multi-task Long Video Understanding","venue":"cs.CV","work_id":"346256da-dd21-4cc3-9a98-519467614854","year":2024},"citing_paper":{"arxiv_id":"2605.19726","last_updated":"2026-05-19T12:01:13Z","snapshot_observed_at":"2026-08-01T08:38:35.585519Z","submitted_at":"2026-05-19T12:01:13Z","title":"Efficient Long-Context Modeling in Diffusion Language Models via Block Approximate Sparse Attention","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:14.089334Z"},"links":{"cited_paper":"/paper/2406.04264","citing_paper":"/paper/2605.19726"},"observation_digest":"sha256:4c04df05d89da1113e7d438bd2caf53a21ccd8b4a8a0098b8ee5bc6c94bc1428","observation_id":"404b5d4c-185c-4e52-85c9-89bf2f6c93bb","resolution":{"observed_at":"2026-05-20T05:53:04.623711Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Llada 1.5: Variance- reduced preference optimization for large language diffusion models","venue":null,"work_id":"fd054834-2955-4a02-8c36-1a6daf368d18","year":2025},"citing_paper":{"arxiv_id":"2605.19726","last_updated":"2026-05-19T12:01:13Z","snapshot_observed_at":"2026-08-01T08:38:35.585519Z","submitted_at":"2026-05-19T12:01:13Z","title":"Efficient Long-Context Modeling in Diffusion Language Models via Block Approximate Sparse Attention","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:14.089334Z"},"links":{"citing_paper":"/paper/2605.19726"},"observation_digest":"sha256:c74f6749817e90487ff182a12ca374882508d470768e1551d55c4d7045d0526d","observation_id":"79e754ac-e453-4edc-8d6a-ffae300cdf69","resolution":{"observed_at":"2026-05-20T05:53:22.621312Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.19726","last_updated":"2026-05-19T12:01:13Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-01T08:38:35.585519Z","submitted_at":"2026-05-19T12:01:13Z","title":"Efficient Long-Context Modeling in Diffusion Language Models via Block Approximate Sparse Attention"},"reference_resolution":{"displayed":66,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":2,"verified_exact":22,"verified_fuzzy":41},"total_outbound_references":66},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 66 of 66 outbound references and 1 inbound Pith citation observation for arXiv:2605.19726."}