{"as_of":"2026-08-05T03:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fa0e1b54db79e5146cc9306633f1fb86b9084ba18b05b7081a8ab6bda14c63a5","coverage":[{"denominator":51,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":51,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-12T05:40:56.557646Z","state":"measured"},{"denominator":52,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":52,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T11:49:11.671759Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2607.02980","last_updated":"2026-07-03T05:39:00Z","snapshot_observed_at":"2026-08-03T09:31:25.197718Z","submitted_at":"2026-07-03T05:39:00Z","title":"Hierarchical Sparse Attention Done Right: Toward Infinite Context Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.02980","snapshot_observed_at":"2026-07-31T11:49:11.671759Z","title":"Hierarchical sparse attention done right: Toward infinite context modeling","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.24555","last_updated":"2026-07-27T15:28:52Z","snapshot_observed_at":"2026-08-02T06:50:39.173138Z","submitted_at":"2026-07-27T15:28:52Z","title":"LOCKS: Page-Local Compact Key Summaries for Efficient Long-Context Decoding","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-31T11:49:11.671759Z"},"links":{"cited_paper":"/paper/2607.02980","citing_paper":"/paper/2607.24555"},"observation_digest":"sha256:6d10addd7b9a4a77d5d09536eef5a515e825da777c676e6e3aebc139f65e11b7","observation_id":"14757c3e-1a75-4357-91d4-012f5450664d","resolution":{"observed_at":"2026-07-31T11:49:11.671759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2607.02980/citation-record","integrity":"/paper/2607.02980/integrity","json":"/paper/2607.02980/citation-record.json","paper":"/paper/2607.02980"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T05:40:56.557646Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2607.02980","last_updated":"2026-07-03T05:39:00Z","snapshot_observed_at":"2026-08-03T09:31:25.197718Z","submitted_at":"2026-07-03T05:39:00Z","title":"Hierarchical Sparse Attention Done Right: Toward Infinite Context Modeling","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-12T05:40:56.557646Z"},"links":{"citing_paper":"/paper/2607.02980"},"observation_digest":"sha256:c8809be61afd45f4ccb66bfe217fe06c3c6443fbf1326a6de06ee0bdf03d4156","observation_id":"2eb64c77-23c0-476e-85f8-a772b4ff3e7c","resolution":{"observed_at":"2026-07-12T05:40:56.557646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-07-12T05:40:56.557646Z","title":"Gpt-4 technical report.arXiv preprint arXiv:2303.08774, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02980","last_updated":"2026-07-03T05:39:00Z","snapshot_observed_at":"2026-08-03T09:31:25.197718Z","submitted_at":"2026-07-03T05:39:00Z","title":"Hierarchical Sparse Attention Done Right: Toward Infinite Context Modeling","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-12T05:40:56.557646Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2607.02980"},"observation_digest":"sha256:13ec43ea4a52a5d03fbb8623b9df47776c4999a338c112c2e63e1e4e2032709a","observation_id":"34930743-82ec-4477-9df2-68251098acf8","resolution":{"observed_at":"2026-07-12T05:40:56.557646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T05:40:56.557646Z","title":"Ringattention with blockwise transformers for near-infinite context","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02980","last_updated":"2026-07-03T05:39:00Z","snapshot_observed_at":"2026-08-03T09:31:25.197718Z","submitted_at":"2026-07-03T05:39:00Z","title":"Hierarchical Sparse Attention Done Right: Toward Infinite Context Modeling","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-12T05:40:56.557646Z"},"links":{"citing_paper":"/paper/2607.02980"},"observation_digest":"sha256:ff03479e1499069ccee0d6360e5bfe871605ef7292aca41b38f2ae26e76f1e6f","observation_id":"ec48742f-c459-4bc0-a86a-403df44cccdf","resolution":{"observed_at":"2026-07-12T05:40:56.557646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T05:40:56.557646Z","title":"Efficient length-generalizable attention via causal retrieval for long-context language modeling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02980","last_updated":"2026-07-03T05:39:00Z","snapshot_observed_at":"2026-08-03T09:31:25.197718Z","submitted_at":"2026-07-03T05:39:00Z","title":"Hierarchical Sparse Attention Done Right: Toward Infinite Context Modeling","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-12T05:40:56.557646Z"},"links":{"citing_paper":"/paper/2607.02980"},"observation_digest":"sha256:219986b5efaf2db28d131d6a15fdbd719f5d6e5a8970f29ab2798fbd1608feda","observation_id":"8773a429-c908-4866-b31a-46822a454302","resolution":{"observed_at":"2026-07-12T05:40:56.557646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T05:40:56.557646Z","title":"Native sparse attention: Hardware-aligned and natively trainable sparse attention","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02980","last_updated":"2026-07-03T05:39:00Z","snapshot_observed_at":"2026-08-03T09:31:25.197718Z","submitted_at":"2026-07-03T05:39:00Z","title":"Hierarchical Sparse Attention Done Right: Toward Infinite Context Modeling","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-12T05:40:56.557646Z"},"links":{"citing_paper":"/paper/2607.02980"},"observation_digest":"sha256:fc535358a8cdfa471717fb526f126b8927fc4a6c399b605ab2b60e51d331b994","observation_id":"17a45e6a-823a-47b9-ac14-4698687336b2","resolution":{"observed_at":"2026-07-12T05:40:56.557646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13189","snapshot_observed_at":"2026-07-12T05:40:56.557646Z","title":"Zhang, Zhilin Yang, Xinyu Zhou, Mingxing Zhang, and Jiezhong Qiu","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02980","last_updated":"2026-07-03T05:39:00Z","snapshot_observed_at":"2026-08-03T09:31:25.197718Z","submitted_at":"2026-07-03T05:39:00Z","title":"Hierarchical Sparse Attention Done Right: Toward Infinite Context Modeling","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-12T05:40:56.557646Z"},"links":{"cited_paper":"/paper/2502.13189","citing_paper":"/paper/2607.02980"},"observation_digest":"sha256:b0abcd297639d0429f347af70e8a22643daba91fd90500ac5db83d1c2562f8f2","observation_id":"5cb92a38-82cb-45da-9c9c-c78b1ab8dd38","resolution":{"observed_at":"2026-07-12T05:40:56.557646Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T05:40:56.557646Z","title":"Nosa: Native and offloadable sparse attention,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.02980","last_updated":"2026-07-03T05:39:00Z","snapshot_observed_at":"2026-08-03T09:31:25.197718Z","submitted_at":"2026-07-03T05:39:00Z","title":"Hierarchical Sparse Attention Done Right: Toward Infinite Context Modeling","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-12T05:40:56.557646Z"},"links":{"citing_paper":"/paper/2607.02980"},"observation_digest":"sha256:029b74c4a9dbf7830ef205878f46b011e60d213728ae17872b18dee4eace10fc","observation_id":"f6d71465-b57f-473f-9d72-473ebacc8f7b","resolution":{"observed_at":"2026-07-12T05:40:56.557646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T05:40:56.557646Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.02980","last_updated":"2026-07-03T05:39:00Z","snapshot_observed_at":"2026-08-03T09:31:25.197718Z","submitted_at":"2026-07-03T05:39:00Z","title":"Hierarchical Sparse Attention Done Right: Toward Infinite Context Modeling","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-12T05:40:56.557646Z"},"links":{"citing_paper":"/paper/2607.02980"},"observation_digest":"sha256:ec8d0475e94a632925452c2fbafce16afaa619ad99173fdeaaf6810d31f97bcf","observation_id":"7f65b2b7-da87-4d54-ba3c-af7082b61107","resolution":{"observed_at":"2026-07-12T05:40:56.557646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T05:40:56.557646Z","title":"Random-access infinite context length for transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02980","last_updated":"2026-07-03T05:39:00Z","snapshot_observed_at":"2026-08-03T09:31:25.197718Z","submitted_at":"2026-07-03T05:39:00Z","title":"Hierarchical Sparse Attention Done Right: Toward Infinite Context Modeling","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-12T05:40:56.557646Z"},"links":{"citing_paper":"/paper/2607.02980"},"observation_digest":"sha256:773128ca723f49858affa4bb549e4523b2b342429704e632aec5518a7bb5cdb0","observation_id":"25e20da4-6683-45c2-9d06-3eeaf97c104c","resolution":{"observed_at":"2026-07-12T05:40:56.557646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-07-12T05:40:56.557646Z","title":"Ruler: What’s the real context size of your long-context language models?arXiv preprint arXiv:2404.06654, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02980","last_updated":"2026-07-03T05:39:00Z","snapshot_observed_at":"2026-08-03T09:31:25.197718Z","submitted_at":"2026-07-03T05:39:00Z","title":"Hierarchical Sparse Attention Done Right: Toward Infinite Context Modeling","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-12T05:40:56.557646Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2607.02980"},"observation_digest":"sha256:9eb09a71c396483e93ead3147bcaa3c18dc9bc95cd365297760a31952b5f0796","observation_id":"217fb610-a863-4caf-848f-c46c5b852002","resolution":{"observed_at":"2026-07-12T05:40:56.557646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T05:40:56.557646Z","title":"Longbench: A bilingual, multitask benchmark for long context understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02980","last_updated":"2026-07-03T05:39:00Z","snapshot_observed_at":"2026-08-03T09:31:25.197718Z","submitted_at":"2026-07-03T05:39:00Z","title":"Hierarchical Sparse Attention Done Right: Toward Infinite Context Modeling","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-12T05:40:56.557646Z"},"links":{"citing_paper":"/paper/2607.02980"},"observation_digest":"sha256:dc667815b3295b4a9e5b4148dbbaca10dbb8419393b3584ef3b2d34e2615221a","observation_id":"6e1348ee-951a-49e9-91d4-66de81d2f2c0","resolution":{"observed_at":"2026-07-12T05:40:56.557646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T05:40:56.557646Z","title":"YaRN: Efficient context window extension of large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.02980","last_updated":"2026-07-03T05:39:00Z","snapshot_observed_at":"2026-08-03T09:31:25.197718Z","submitted_at":"2026-07-03T05:39:00Z","title":"Hierarchical Sparse Attention Done Right: Toward Infinite Context Modeling","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-12T05:40:56.557646Z"},"links":{"citing_paper":"/paper/2607.02980"},"observation_digest":"sha256:8d2bfec972672be9db34ed2f3736fe1abfd19d866636a5f757488f939d569161","observation_id":"92c3a0ce-0857-4a7e-85c9-fa4e2ca2ad0d","resolution":{"observed_at":"2026-07-12T05:40:56.557646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T05:40:56.557646Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.02980","last_updated":"2026-07-03T05:39:00Z","snapshot_observed_at":"2026-08-03T09:31:25.197718Z","submitted_at":"2026-07-03T05:39:00Z","title":"Hierarchical Sparse Attention Done Right: Toward Infinite Context Modeling","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-12T05:40:56.557646Z"},"links":{"citing_paper":"/paper/2607.02980"},"observation_digest":"sha256:376ca25d4bdfaa88d00ea764cb37ce3e2331b4996ddaeff70b09fc33d55fa654","observation_id":"5fe7ba32-cb6c-42d6-811c-94fefdf0d91f","resolution":{"observed_at":"2026-07-12T05:40:56.557646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.13392","last_updated":"2026-06-11T14:23:41Z","snapshot_observed_at":"2026-08-01T14:56:42.323551Z","submitted_at":"2026-06-11T14:23:41Z","title":"MiniMax Sparse Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.13392","snapshot_observed_at":"2026-07-12T05:40:56.557646Z","title":"Minimax sparse attention, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.02980","last_updated":"2026-07-03T05:39:00Z","snapshot_observed_at":"2026-08-03T09:31:25.197718Z","submitted_at":"2026-07-03T05:39:00Z","title":"Hierarchical Sparse Attention Done Right: Toward Infinite Context Modeling","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-12T05:40:56.557646Z"},"links":{"cited_paper":"/paper/2606.13392","citing_paper":"/paper/2607.02980"},"observation_digest":"sha256:40a6d30e6b90184f2ea89e73f796f629983db3fd84f37c066b3d81d50089aa63","observation_id":"d7d874e0-21e1-48a4-ab53-12e2bbbc76c0","resolution":{"observed_at":"2026-07-12T05:40:56.557646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-12T05:40:56.557646Z","title":"Qwen3 technical report.arXiv preprint arXiv:2505.09388, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02980","last_updated":"2026-07-03T05:39:00Z","snapshot_observed_at":"2026-08-03T09:31:25.197718Z","submitted_at":"2026-07-03T05:39:00Z","title":"Hierarchical Sparse Attention Done Right: Toward Infinite Context Modeling","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-12T05:40:56.557646Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2607.02980"},"observation_digest":"sha256:41fe1396f3949c5356a6d9bb965587600872b62d3aadc2d38c7e3eb79ad1e05c","observation_id":"29165f26-caea-4d0c-b9a1-519ddc4ef9b5","resolution":{"observed_at":"2026-07-12T05:40:56.557646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T05:40:56.557646Z","title":"Roformer: Enhanced transformer with rotary position embedding.Neurocomputing, 568:127063, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02980","last_updated":"2026-07-03T05:39:00Z","snapshot_observed_at":"2026-08-03T09:31:25.197718Z","submitted_at":"2026-07-03T05:39:00Z","title":"Hierarchical Sparse Attention Done Right: Toward Infinite Context Modeling","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-12T05:40:56.557646Z"},"links":{"citing_paper":"/paper/2607.02980"},"observation_digest":"sha256:eb2618e418d332e21ddd6b334079c7456d2a8b8d23977393d79f47608d92bb04","observation_id":"a0eeb4ec-c1e0-4a04-9783-026b7ddbdb38","resolution":{"observed_at":"2026-07-12T05:40:56.557646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T05:40:56.557646Z","title":"HoPE: A novel positional encoding without long-term decay for enhanced context awareness and extrapolation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02980","last_updated":"2026-07-03T05:39:00Z","snapshot_observed_at":"2026-08-03T09:31:25.197718Z","submitted_at":"2026-07-03T05:39:00Z","title":"Hierarchical Sparse Attention Done Right: Toward Infinite Context Modeling","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-12T05:40:56.557646Z"},"links":{"citing_paper":"/paper/2607.02980"},"observation_digest":"sha256:ab0b45f9690eb23981fab87fc928ddb75896ecdf32de53554469af896246759c","observation_id":"07ccf919-1941-42ef-a4da-1936a14c631d","resolution":{"observed_at":"2026-07-12T05:40:56.557646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T05:40:56.557646Z","title":"GQA: Training generalized multi-query transformer models from multi-head checkpoints","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02980","last_updated":"2026-07-03T05:39:00Z","snapshot_observed_at":"2026-08-03T09:31:25.197718Z","submitted_at":"2026-07-03T05:39:00Z","title":"Hierarchical Sparse Attention Done Right: Toward Infinite Context Modeling","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-12T05:40:56.557646Z"},"links":{"citing_paper":"/paper/2607.02980"},"observation_digest":"sha256:27e18a515ac361cc02f18a5b863d595fa8f16c86969f0c336c46422b4e4dcb94","observation_id":"2e95ecd2-8605-4478-a694-1e940fd4a8e2","resolution":{"observed_at":"2026-07-12T05:40:56.557646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T05:40:56.557646Z","title":"Fast inference from transformers via speculative decoding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02980","last_updated":"2026-07-03T05:39:00Z","snapshot_observed_at":"2026-08-03T09:31:25.197718Z","submitted_at":"2026-07-03T05:39:00Z","title":"Hierarchical Sparse Attention Done Right: Toward Infinite Context Modeling","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-12T05:40:56.557646Z"},"links":{"citing_paper":"/paper/2607.02980"},"observation_digest":"sha256:a47cef636c89a8b755fc5c9ae4ffa017c81503bfc9b8bd43bad71a5b9e4e1762","observation_id":"47593d0b-0359-4689-83b8-528d3aad2dc9","resolution":{"observed_at":"2026-07-12T05:40:56.557646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T05:40:56.557646Z","title":"Language models are unsupervised multitask learners.OpenAI Technical Report, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.02980","last_updated":"2026-07-03T05:39:00Z","snapshot_observed_at":"2026-08-03T09:31:25.197718Z","submitted_at":"2026-07-03T05:39:00Z","title":"Hierarchical Sparse Attention Done Right: Toward Infinite Context Modeling","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-12T05:40:56.557646Z"},"links":{"citing_paper":"/paper/2607.02980"},"observation_digest":"sha256:f8dd127ec0fa15f22b4cf55a7a3f1fdf9712b2cafe4c45dd4bbfa2170a82f9e1","observation_id":"9947f1f7-56d7-436a-afb2-71d950ce5b47","resolution":{"observed_at":"2026-07-12T05:40:56.557646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T05:40:56.557646Z","title":"Rattention: Towards the minimal sliding window size in local-global attention models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02980","last_updated":"2026-07-03T05:39:00Z","snapshot_observed_at":"2026-08-03T09:31:25.197718Z","submitted_at":"2026-07-03T05:39:00Z","title":"Hierarchical Sparse Attention Done Right: Toward Infinite Context Modeling","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-12T05:40:56.557646Z"},"links":{"citing_paper":"/paper/2607.02980"},"observation_digest":"sha256:ccfc008e18a6631840a44b2222c801d67ae556f4dae2fb920336a0a5d6dc22b7","observation_id":"6e7bc4cc-7b70-4e85-a77e-2cdab854799c","resolution":{"observed_at":"2026-07-12T05:40:56.557646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T05:40:56.557646Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.02980","last_updated":"2026-07-03T05:39:00Z","snapshot_observed_at":"2026-08-03T09:31:25.197718Z","submitted_at":"2026-07-03T05:39:00Z","title":"Hierarchical Sparse Attention Done Right: Toward Infinite Context Modeling","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-12T05:40:56.557646Z"},"links":{"citing_paper":"/paper/2607.02980"},"observation_digest":"sha256:b28fc6c3e056731742145a9bd554f92c5c30ef6a917e8412bd396190227cf762","observation_id":"baa60914-cc84-4f73-91f5-3bc3f6b31e7e","resolution":{"observed_at":"2026-07-12T05:40:56.557646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.18753","last_updated":"2026-05-18T17:59:52Z","snapshot_observed_at":"2026-08-02T11:52:59.734226Z","submitted_at":"2026-05-18T17:59:52Z","title":"DashAttention: Differentiable and Adaptive Sparse Hierarchical Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.18753","snapshot_observed_at":"2026-07-12T05:40:56.557646Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.02980","last_updated":"2026-07-03T05:39:00Z","snapshot_observed_at":"2026-08-03T09:31:25.197718Z","submitted_at":"2026-07-03T05:39:00Z","title":"Hierarchical Sparse Attention Done Right: Toward Infinite Context Modeling","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-12T05:40:56.557646Z"},"links":{"cited_paper":"/paper/2605.18753","citing_paper":"/paper/2607.02980"},"observation_digest":"sha256:dad3c4d87a59f7ddb4b69327c7f096fa82a3dce97e08e9c28dff0871510b9399","observation_id":"db6737fa-c185-44b1-a272-8815764a89af","resolution":{"observed_at":"2026-07-12T05:40:56.557646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T05:40:56.557646Z","title":"Infllm-v2: Dense-sparse switchable attention for seamless short-to-long adaptation, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02980","last_updated":"2026-07-03T05:39:00Z","snapshot_observed_at":"2026-08-03T09:31:25.197718Z","submitted_at":"2026-07-03T05:39:00Z","title":"Hierarchical Sparse Attention Done Right: Toward Infinite Context Modeling","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-12T05:40:56.557646Z"},"links":{"citing_paper":"/paper/2607.02980"},"observation_digest":"sha256:9f7a98edbfeabed4535b35968947dc6dfd39ce6202913870b9a27f4bcdaa6441","observation_id":"ae363642-9bf0-4d8f-bb92-7602650eef04","resolution":{"observed_at":"2026-07-12T05:40:56.557646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T05:40:56.557646Z","title":"Every token counts: Gener- alizing 16m ultra-long context in large language models","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.02980","last_updated":"2026-07-03T05:39:00Z","snapshot_observed_at":"2026-08-03T09:31:25.197718Z","submitted_at":"2026-07-03T05:39:00Z","title":"Hierarchical Sparse Attention Done Right: Toward Infinite Context Modeling","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-12T05:40:56.557646Z"},"links":{"citing_paper":"/paper/2607.02980"},"observation_digest":"sha256:61fe614ce8ac9e3d393a38563c7c3c67798568c56ea8f9c518054b836605a0ba","observation_id":"0f273f31-422c-43cb-9ceb-00faaf201f69","resolution":{"observed_at":"2026-07-12T05:40:56.557646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T05:40:56.557646Z","title":"dolma3_longmino_mix-50b-1025 dataset","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02980","last_updated":"2026-07-03T05:39:00Z","snapshot_observed_at":"2026-08-03T09:31:25.197718Z","submitted_at":"2026-07-03T05:39:00Z","title":"Hierarchical Sparse Attention Done Right: Toward Infinite Context Modeling","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-12T05:40:56.557646Z"},"links":{"citing_paper":"/paper/2607.02980"},"observation_digest":"sha256:696244a29c4a2840fda20f9579784efe8777c21c2544ed558fc087f284ecbbb9","observation_id":"d6e90398-6c6a-46bd-9bb5-3f8eef7e7fd2","resolution":{"observed_at":"2026-07-12T05:40:56.557646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T05:40:56.557646Z","title":"Olmo-3-1025-7b (stage1-step999000)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02980","last_updated":"2026-07-03T05:39:00Z","snapshot_observed_at":"2026-08-03T09:31:25.197718Z","submitted_at":"2026-07-03T05:39:00Z","title":"Hierarchical Sparse Attention Done Right: Toward Infinite Context Modeling","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-12T05:40:56.557646Z"},"links":{"citing_paper":"/paper/2607.02980"},"observation_digest":"sha256:769047b1f7e7f0b7c7dc459e1d514bd48ec8e6067d9249b88c699d5a8d61574e","observation_id":"3eb0b007-87fd-40e1-848b-91b2ad09de29","resolution":{"observed_at":"2026-07-12T05:40:56.557646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.13961","last_updated":"2026-04-14T15:12:44Z","snapshot_observed_at":"2026-07-06T22:39:08.850289Z","submitted_at":"2025-12-15T23:41:48Z","title":"Olmo 3","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.13961","snapshot_observed_at":"2026-07-12T05:40:56.557646Z","title":"Olmo 3.arXiv preprint arXiv:2512.13961, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02980","last_updated":"2026-07-03T05:39:00Z","snapshot_observed_at":"2026-08-03T09:31:25.197718Z","submitted_at":"2026-07-03T05:39:00Z","title":"Hierarchical Sparse Attention Done Right: Toward Infinite Context Modeling","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-12T05:40:56.557646Z"},"links":{"cited_paper":"/paper/2512.13961","citing_paper":"/paper/2607.02980"},"observation_digest":"sha256:f4101686690a4888bca501c8f4ba39fdaea733daf3ebd5472041454fa28b18de","observation_id":"2f4b10b8-1d3b-40f1-b280-0490f488d892","resolution":{"observed_at":"2026-07-12T05:40:56.557646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-07-12T05:40:56.557646Z","title":"Gonzalez, Clark Barrett, and Ying Sheng","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02980","last_updated":"2026-07-03T05:39:00Z","snapshot_observed_at":"2026-08-03T09:31:25.197718Z","submitted_at":"2026-07-03T05:39:00Z","title":"Hierarchical Sparse Attention Done Right: Toward Infinite Context Modeling","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-12T05:40:56.557646Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2607.02980"},"observation_digest":"sha256:d663cd234777d4e72e6421e107452224ca00ec8c1f6604afcadcf0df4bbbf28f","observation_id":"303e54f1-e3b4-4172-9751-c76ff02f98a7","resolution":{"observed_at":"2026-07-12T05:40:56.557646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.02556","last_updated":"2025-12-02T09:25:14Z","snapshot_observed_at":"2026-07-31T23:49:25.878472Z","submitted_at":"2025-12-02T09:25:14Z","title":"DeepSeek-V3.2: Pushing the Frontier of Open Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.02556","snapshot_observed_at":"2026-07-12T05:40:56.557646Z","title":"Deepseek-v3","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02980","last_updated":"2026-07-03T05:39:00Z","snapshot_observed_at":"2026-08-03T09:31:25.197718Z","submitted_at":"2026-07-03T05:39:00Z","title":"Hierarchical Sparse Attention Done Right: Toward Infinite Context Modeling","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-12T05:40:56.557646Z"},"links":{"cited_paper":"/paper/2512.02556","citing_paper":"/paper/2607.02980"},"observation_digest":"sha256:09bbd310ead74d6117eb0aa4cb7a7b47e31e75b8655036c89fac4ea268cbf38d","observation_id":"d9669ab1-3d6d-455d-91be-929e3fdbc354","resolution":{"observed_at":"2026-07-12T05:40:56.557646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13276","last_updated":"2025-02-17T02:24:47Z","snapshot_observed_at":"2026-07-06T19:35:04.087584Z","submitted_at":"2024-10-17T07:07:09Z","title":"SeerAttention: Learning Intrinsic Sparse Attention in Your LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13276","snapshot_observed_at":"2026-07-12T05:40:56.557646Z","title":"Seerattention: Learning intrinsic sparse attention in your llms, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02980","last_updated":"2026-07-03T05:39:00Z","snapshot_observed_at":"2026-08-03T09:31:25.197718Z","submitted_at":"2026-07-03T05:39:00Z","title":"Hierarchical Sparse Attention Done Right: Toward Infinite Context Modeling","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-12T05:40:56.557646Z"},"links":{"cited_paper":"/paper/2410.13276","citing_paper":"/paper/2607.02980"},"observation_digest":"sha256:0f1a7969a689972ead8b1d2a8f1991a2e2d2504bb40476dca7b8f14442461208","observation_id":"b285cdf4-9467-4eef-a267-1ec0c423dd1d","resolution":{"observed_at":"2026-07-12T05:40:56.557646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T05:40:56.557646Z","title":"Hardware-aligned hierarchical sparse attention for efficient long-term memory access.Advances in Neural Information Processing Systems, 38:88925–88950,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.02980","last_updated":"2026-07-03T05:39:00Z","snapshot_observed_at":"2026-08-03T09:31:25.197718Z","submitted_at":"2026-07-03T05:39:00Z","title":"Hierarchical Sparse Attention Done Right: Toward Infinite Context Modeling","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-12T05:40:56.557646Z"},"links":{"citing_paper":"/paper/2607.02980"},"observation_digest":"sha256:a74de42d69426ac81e0c9fffdef39dae7899ba5d77be3980dfa36ed8e4e45a61","observation_id":"da987b74-1eb0-417a-bdac-07e845b9065c","resolution":{"observed_at":"2026-07-12T05:40:56.557646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T05:40:56.557646Z","title":"Understanding and improving length generalization in hierarchical sparse attention models","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.02980","last_updated":"2026-07-03T05:39:00Z","snapshot_observed_at":"2026-08-03T09:31:25.197718Z","submitted_at":"2026-07-03T05:39:00Z","title":"Hierarchical Sparse Attention Done Right: Toward Infinite Context Modeling","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-12T05:40:56.557646Z"},"links":{"citing_paper":"/paper/2607.02980"},"observation_digest":"sha256:bc0c9ab26a94824a624433927c3a16d09593b291f3225931d0ccbd8f8022aa36","observation_id":"c6c9495c-bae7-4590-bb50-3809c920a931","resolution":{"observed_at":"2026-07-12T05:40:56.557646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T05:40:56.557646Z","title":"The faiss library.IEEE Transactions on Big Data, 12(2):346–361, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.02980","last_updated":"2026-07-03T05:39:00Z","snapshot_observed_at":"2026-08-03T09:31:25.197718Z","submitted_at":"2026-07-03T05:39:00Z","title":"Hierarchical Sparse Attention Done Right: Toward Infinite Context Modeling","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-12T05:40:56.557646Z"},"links":{"citing_paper":"/paper/2607.02980"},"observation_digest":"sha256:d1e971671e83ea94c5f615ea1ce1aa4bf70dc43838c983c4429dfdf24cde3bd5","observation_id":"fc5bbf46-6c84-4dc5-8e72-f1ffa29fc55a","resolution":{"observed_at":"2026-07-12T05:40:56.557646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T05:40:56.557646Z","title":"Dolma 3 mix 6t-1025-7b dataset","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02980","last_updated":"2026-07-03T05:39:00Z","snapshot_observed_at":"2026-08-03T09:31:25.197718Z","submitted_at":"2026-07-03T05:39:00Z","title":"Hierarchical Sparse Attention Done Right: Toward Infinite Context Modeling","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-12T05:40:56.557646Z"},"links":{"citing_paper":"/paper/2607.02980"},"observation_digest":"sha256:9838de4f2e489efc0a686840dfcfd9b187f0067dde82a40f21dccc1d1b208501","observation_id":"0d0e754e-9bc2-428c-8da6-565d9fa21d6b","resolution":{"observed_at":"2026-07-12T05:40:56.557646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T05:40:56.557646Z","title":"The lambada dataset: Word prediction requiring a broad discourse context","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.02980","last_updated":"2026-07-03T05:39:00Z","snapshot_observed_at":"2026-08-03T09:31:25.197718Z","submitted_at":"2026-07-03T05:39:00Z","title":"Hierarchical Sparse Attention Done Right: Toward Infinite Context Modeling","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-12T05:40:56.557646Z"},"links":{"citing_paper":"/paper/2607.02980"},"observation_digest":"sha256:138bfff94f26263925c88c494acbe34ff84d96557783daeca4ffbe432bb26ba0","observation_id":"0f411e60-f8a7-40b4-8cfd-35de3d95eadb","resolution":{"observed_at":"2026-07-12T05:40:56.557646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T05:40:56.557646Z","title":"Hellaswag: Can a machine really finish your sentence? InProceedings of the 57th annual meeting of the association for computational linguistics, pages 4791–4800, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.02980","last_updated":"2026-07-03T05:39:00Z","snapshot_observed_at":"2026-08-03T09:31:25.197718Z","submitted_at":"2026-07-03T05:39:00Z","title":"Hierarchical Sparse Attention Done Right: Toward Infinite Context Modeling","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-12T05:40:56.557646Z"},"links":{"citing_paper":"/paper/2607.02980"},"observation_digest":"sha256:3f9650d6879a905a84ba99f4b7184a9a13371f7113b686bfa58f3c95014730fb","observation_id":"5329cc48-bf44-44a8-88ff-32873767751b","resolution":{"observed_at":"2026-07-12T05:40:56.557646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T05:40:56.557646Z","title":"Piqa: Reasoning about physical common- sense in natural language","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.02980","last_updated":"2026-07-03T05:39:00Z","snapshot_observed_at":"2026-08-03T09:31:25.197718Z","submitted_at":"2026-07-03T05:39:00Z","title":"Hierarchical Sparse Attention Done Right: Toward Infinite Context Modeling","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-12T05:40:56.557646Z"},"links":{"citing_paper":"/paper/2607.02980"},"observation_digest":"sha256:ee14c8874b79fcdf6cf354d3eb5b5134898b86e8a8d27523cba02d4ded49d700","observation_id":"86bf55b9-258b-44e2-8be7-e83a404c2416","resolution":{"observed_at":"2026-07-12T05:40:56.557646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T05:40:56.557646Z","title":"Winogrande: An adversarial winograd schema challenge at scale.Communications of the ACM, 64(9):99–106, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.02980","last_updated":"2026-07-03T05:39:00Z","snapshot_observed_at":"2026-08-03T09:31:25.197718Z","submitted_at":"2026-07-03T05:39:00Z","title":"Hierarchical Sparse Attention Done Right: Toward Infinite Context Modeling","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-12T05:40:56.557646Z"},"links":{"citing_paper":"/paper/2607.02980"},"observation_digest":"sha256:10981f7d19d42fa75862e505b5c15b4996538ba2f4276d035ed26f7dbd4fa7fa","observation_id":"4e295f4f-e20a-4fbe-bba1-1d7ca27d940f","resolution":{"observed_at":"2026-07-12T05:40:56.557646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T05:40:56.557646Z","title":"Can a suit of armor conduct electricity? a new dataset for open book question answering","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.02980","last_updated":"2026-07-03T05:39:00Z","snapshot_observed_at":"2026-08-03T09:31:25.197718Z","submitted_at":"2026-07-03T05:39:00Z","title":"Hierarchical Sparse Attention Done Right: Toward Infinite Context Modeling","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-12T05:40:56.557646Z"},"links":{"citing_paper":"/paper/2607.02980"},"observation_digest":"sha256:d6207ba31f3262cc2e3219d62941842311bb3fe05bc7d73dba9d47f279682bd7","observation_id":"6681cec1-207e-4b6b-9ca0-8d422554f1ec","resolution":{"observed_at":"2026-07-12T05:40:56.557646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-07-12T05:40:56.557646Z","title":"Think you have solved question answering? try arc, the ai2 reasoning challenge.arXiv preprint arXiv:1803.05457, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.02980","last_updated":"2026-07-03T05:39:00Z","snapshot_observed_at":"2026-08-03T09:31:25.197718Z","submitted_at":"2026-07-03T05:39:00Z","title":"Hierarchical Sparse Attention Done Right: Toward Infinite Context Modeling","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-12T05:40:56.557646Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2607.02980"},"observation_digest":"sha256:2bfc3bd0dc28b515482642f599bfc01ffb10c08cef92e10f5114589138522ec7","observation_id":"e1e7934f-e603-465c-8792-b204af0cde50","resolution":{"observed_at":"2026-07-12T05:40:56.557646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T05:40:56.557646Z","title":"Measuring massive multitask language understanding.Proceedings of the International Conference on Learning Representations (ICLR), 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.02980","last_updated":"2026-07-03T05:39:00Z","snapshot_observed_at":"2026-08-03T09:31:25.197718Z","submitted_at":"2026-07-03T05:39:00Z","title":"Hierarchical Sparse Attention Done Right: Toward Infinite Context Modeling","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-12T05:40:56.557646Z"},"links":{"citing_paper":"/paper/2607.02980"},"observation_digest":"sha256:fb6332dc17fec0925571f1b5a2857eec93166c9277f63dec94b4d625a76849b6","observation_id":"f620287b-1372-4f80-81b9-d35a88006dc7","resolution":{"observed_at":"2026-07-12T05:40:56.557646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T05:40:56.557646Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02980","last_updated":"2026-07-03T05:39:00Z","snapshot_observed_at":"2026-08-03T09:31:25.197718Z","submitted_at":"2026-07-03T05:39:00Z","title":"Hierarchical Sparse Attention Done Right: Toward Infinite Context Modeling","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-12T05:40:56.557646Z"},"links":{"citing_paper":"/paper/2607.02980"},"observation_digest":"sha256:b8f79b1e3fb5414e30447b711c8c296a01a1f206d1d942dbaea8c82fedb99935","observation_id":"cc67cd23-2f20-4c67-a0d9-4dea8e6ca608","resolution":{"observed_at":"2026-07-12T05:40:56.557646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T05:40:56.557646Z","title":"BoolQ: Exploring the surprising difficulty of natural yes/no questions","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.02980","last_updated":"2026-07-03T05:39:00Z","snapshot_observed_at":"2026-08-03T09:31:25.197718Z","submitted_at":"2026-07-03T05:39:00Z","title":"Hierarchical Sparse Attention Done Right: Toward Infinite Context Modeling","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-12T05:40:56.557646Z"},"links":{"citing_paper":"/paper/2607.02980"},"observation_digest":"sha256:562fc4ce2b0232d42b85328232948d457fc8d680557f17dd3db2e79385c202fa","observation_id":"6a80f55e-ff32-4f82-a1c8-3d653b10492a","resolution":{"observed_at":"2026-07-12T05:40:56.557646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T05:40:56.557646Z","title":"RACE: Large-scale ReAding comprehension dataset from examinations","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.02980","last_updated":"2026-07-03T05:39:00Z","snapshot_observed_at":"2026-08-03T09:31:25.197718Z","submitted_at":"2026-07-03T05:39:00Z","title":"Hierarchical Sparse Attention Done Right: Toward Infinite Context Modeling","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-12T05:40:56.557646Z"},"links":{"citing_paper":"/paper/2607.02980"},"observation_digest":"sha256:e3174e7703cb34adcd1dc8c71391054ce5d5ecf7f8c07f716a748403d729f3a6","observation_id":"52f99ebb-3173-4731-9e08-783b2aabcdea","resolution":{"observed_at":"2026-07-12T05:40:56.557646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.16636","last_updated":"2023-06-29T02:19:50Z","snapshot_observed_at":"2026-07-06T15:48:05.491179Z","submitted_at":"2023-06-29T02:19:50Z","title":"CMATH: Can Your Language Model Pass Chinese Elementary School Math Test?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.16636","snapshot_observed_at":"2026-07-12T05:40:56.557646Z","title":"Cmath: Can your language model pass chinese elementary school math test?, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02980","last_updated":"2026-07-03T05:39:00Z","snapshot_observed_at":"2026-08-03T09:31:25.197718Z","submitted_at":"2026-07-03T05:39:00Z","title":"Hierarchical Sparse Attention Done Right: Toward Infinite Context Modeling","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-12T05:40:56.557646Z"},"links":{"cited_paper":"/paper/2306.16636","citing_paper":"/paper/2607.02980"},"observation_digest":"sha256:5ea7f4037777670596b8cfc758eda12baa570d270d6f8949d9cf915d53f74e7f","observation_id":"41bad85f-b01e-446c-9c98-289b6466dcd3","resolution":{"observed_at":"2026-07-12T05:40:56.557646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-04T15:46:25.710484Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-07-12T05:40:56.557646Z","title":"Training verifiers to solve math word problems.arXiv preprint arXiv:2110.14168, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.02980","last_updated":"2026-07-03T05:39:00Z","snapshot_observed_at":"2026-08-03T09:31:25.197718Z","submitted_at":"2026-07-03T05:39:00Z","title":"Hierarchical Sparse Attention Done Right: Toward Infinite Context Modeling","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-12T05:40:56.557646Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2607.02980"},"observation_digest":"sha256:e2cd863c4b9a2fe7e7ff78bf151c655fefc1c852314d3ad294de432ea644895f","observation_id":"0a81a954-a59f-4135-863d-6966df4731b1","resolution":{"observed_at":"2026-07-12T05:40:56.557646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.03065","last_updated":"2024-01-05T20:53:51Z","snapshot_observed_at":"2026-07-06T17:12:10.787061Z","submitted_at":"2024-01-05T20:53:51Z","title":"CRUXEval: A Benchmark for Code Reasoning, Understanding and Execution","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.03065","snapshot_observed_at":"2026-07-12T05:40:56.557646Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02980","last_updated":"2026-07-03T05:39:00Z","snapshot_observed_at":"2026-08-03T09:31:25.197718Z","submitted_at":"2026-07-03T05:39:00Z","title":"Hierarchical Sparse Attention Done Right: Toward Infinite Context Modeling","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-12T05:40:56.557646Z"},"links":{"cited_paper":"/paper/2401.03065","citing_paper":"/paper/2607.02980"},"observation_digest":"sha256:a2386ced88a676ac862a2fb41b205f935d9e72afcc6ea4e94d34ea9fcb68269e","observation_id":"495266bb-87a8-4fb5-bad5-983b142b88ea","resolution":{"observed_at":"2026-07-12T05:40:56.557646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T05:40:56.557646Z","title":"Is your code generated by chatGPT really correct? rigorous evaluation of large language models for code generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02980","last_updated":"2026-07-03T05:39:00Z","snapshot_observed_at":"2026-08-03T09:31:25.197718Z","submitted_at":"2026-07-03T05:39:00Z","title":"Hierarchical Sparse Attention Done Right: Toward Infinite Context Modeling","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-12T05:40:56.557646Z"},"links":{"citing_paper":"/paper/2607.02980"},"observation_digest":"sha256:9fd19d1af50672bb578de4fc42df55a526dad895e67665eb8b9071bfdff5834b","observation_id":"1950537a-21f8-4a9f-a106-e4e445b091a5","resolution":{"observed_at":"2026-07-12T05:40:56.557646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T05:40:56.557646Z","title":"Evaluating language models for efficient code generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02980","last_updated":"2026-07-03T05:39:00Z","snapshot_observed_at":"2026-08-03T09:31:25.197718Z","submitted_at":"2026-07-03T05:39:00Z","title":"Hierarchical Sparse Attention Done Right: Toward Infinite Context Modeling","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-12T05:40:56.557646Z"},"links":{"citing_paper":"/paper/2607.02980"},"observation_digest":"sha256:19d91177478a43c7a7ef094070be857e8305aa4ede18cddc4c4562f87d582bd6","observation_id":"14135837-3c3e-4057-9558-449eb5afe4e0","resolution":{"observed_at":"2026-07-12T05:40:56.557646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-02T19:23:53.535075Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-07-12T05:40:56.557646Z","title":"Program synthesis with large language models, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.02980","last_updated":"2026-07-03T05:39:00Z","snapshot_observed_at":"2026-08-03T09:31:25.197718Z","submitted_at":"2026-07-03T05:39:00Z","title":"Hierarchical Sparse Attention Done Right: Toward Infinite Context Modeling","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-12T05:40:56.557646Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2607.02980"},"observation_digest":"sha256:b1ba908de694d2737a695b2a26a3116135bb46fbef2b966eef73a4f298db4c6a","observation_id":"15270d1a-3bd3-461a-a3c5-877816679de1","resolution":{"observed_at":"2026-07-12T05:40:56.557646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.02980","last_updated":"2026-07-03T05:39:00Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-03T09:31:25.197718Z","submitted_at":"2026-07-03T05:39:00Z","title":"Hierarchical Sparse Attention Done Right: Toward Infinite Context Modeling"},"reference_resolution":{"displayed":51,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":50,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":51},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 51 of 51 outbound references and 1 inbound Pith citation observation for arXiv:2607.02980."}