{"as_of":"2026-08-09T15:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a7591769605911f2690365ef50b51808e54cc0f1d6003cb76ba5c80bd00fbc11","coverage":[{"denominator":28,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":28,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:52:48.987113Z","state":"measured"},{"denominator":32,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":32,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:06:32.693476Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T13:46:58.816966Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.04108","last_updated":"2025-06-05T05:39:48Z","snapshot_observed_at":"2026-08-08T01:16:59.339584Z","submitted_at":"2025-06-04T16:01:48Z","title":"Rectified Sparse Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.04108","snapshot_observed_at":"2026-08-07T05:06:32.693476Z","title":"Rectified sparse attention.arXiv preprint arXiv:2506.04108, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-07T11:00:03.513055Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.693476Z"},"links":{"cited_paper":"/paper/2506.04108","citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:cfc5444271bc66d18ec4e30e7ce63df2692b4d3bfae1785da2e63e339858d70a","observation_id":"973f0b67-f390-49b2-b41c-433cfb715649","resolution":{"observed_at":"2026-08-07T05:06:32.693476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04108","last_updated":"2025-06-05T05:39:48Z","snapshot_observed_at":"2026-08-08T01:16:59.339584Z","submitted_at":"2025-06-04T16:01:48Z","title":"Rectified Sparse Attention","version":2},"cited_work":{"arxiv_id":"2506.04108","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.04108","snapshot_observed_at":"2026-07-02T13:46:58.816966Z","title":"Rectified sparse attention","venue":null,"work_id":"aa22dbb5-75b6-4873-be14-90ee8a85e41a","year":2025},"citing_paper":{"arxiv_id":"2511.02043","last_updated":"2026-05-20T23:03:49Z","snapshot_observed_at":"2026-07-06T22:34:48.431368Z","submitted_at":"2025-11-03T20:25:19Z","title":"Flashlight: PyTorch Compiler Extensions to Accelerate Attention Variants","version":4},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-05-22T11:40:41.762364Z"},"links":{"cited_paper":"/paper/2506.04108","citing_paper":"/paper/2511.02043"},"observation_digest":"sha256:1dcc953643380135a1c96a2b01418cbd47825b5c42aa3132763ca15e34b849b5","observation_id":"3fd29474-9a0f-4b7a-89b8-11bf887c5093","resolution":{"observed_at":"2026-05-22T11:41:30.042725Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04108","last_updated":"2025-06-05T05:39:48Z","snapshot_observed_at":"2026-08-08T01:16:59.339584Z","submitted_at":"2025-06-04T16:01:48Z","title":"Rectified Sparse Attention","version":2},"cited_work":{"arxiv_id":"2506.04108","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.04108","snapshot_observed_at":"2026-07-02T13:46:58.816966Z","title":"Rectified sparse attention","venue":null,"work_id":"aa22dbb5-75b6-4873-be14-90ee8a85e41a","year":2025},"citing_paper":{"arxiv_id":"2512.12087","last_updated":"2026-04-28T06:58:25Z","snapshot_observed_at":"2026-07-06T22:38:54.914862Z","submitted_at":"2025-12-12T23:30:43Z","title":"BLASST: Dynamic BLocked Attention Sparsity via Softmax Thresholding","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-16T22:20:53.856657Z"},"links":{"cited_paper":"/paper/2506.04108","citing_paper":"/paper/2512.12087"},"observation_digest":"sha256:b9cc2333392597c28ca95aba727adf7626acab86f5746909040d2aec6e9b58ab","observation_id":"cf2a2230-520c-4f33-b5b1-5d835d2570f9","resolution":{"observed_at":"2026-05-16T22:21:18.626267Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04108","last_updated":"2025-06-05T05:39:48Z","snapshot_observed_at":"2026-08-08T01:16:59.339584Z","submitted_at":"2025-06-04T16:01:48Z","title":"Rectified Sparse Attention","version":2},"cited_work":{"arxiv_id":"2506.04108","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.04108","snapshot_observed_at":"2026-07-02T13:46:58.816966Z","title":"Rectified sparse attention","venue":null,"work_id":"aa22dbb5-75b6-4873-be14-90ee8a85e41a","year":2025},"citing_paper":{"arxiv_id":"2606.06467","last_updated":"2026-06-04T17:54:04Z","snapshot_observed_at":"2026-08-08T09:09:14.963315Z","submitted_at":"2026-06-04T17:54:04Z","title":"You Only Index Once: Cross-Layer Sparse Attention with Shared Routing","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-28T01:06:04.896501Z"},"links":{"cited_paper":"/paper/2506.04108","citing_paper":"/paper/2606.06467"},"observation_digest":"sha256:13fea5adc7dca1ebd9aae0a0bc767c685ed1dc5fdaf70c83ff67f5dd2bb52417","observation_id":"5361cd55-4d42-455c-8d9c-b0a2d1a68d7f","resolution":{"observed_at":"2026-07-02T13:46:58.818402Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.04108/citation-record","integrity":"/paper/2506.04108/integrity","json":"/paper/2506.04108/citation-record.json","paper":"/paper/2506.04108"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2308.16369","last_updated":"2023-08-31T00:03:02Z","snapshot_observed_at":"2026-08-06T15:43:00.292272Z","submitted_at":"2023-08-31T00:03:02Z","title":"SARATHI: Efficient LLM Inference by Piggybacking Decodes with Chunked Prefills","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.16369","snapshot_observed_at":"2026-08-07T10:52:48.200672Z","title":"Sarathi: Efficient llm inference by piggybacking decodes with chunked prefills.arXiv preprint arXiv:2308.16369, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04108","last_updated":"2025-06-05T05:39:48Z","snapshot_observed_at":"2026-08-08T01:16:59.339584Z","submitted_at":"2025-06-04T16:01:48Z","title":"Rectified Sparse Attention","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:48.200672Z"},"links":{"cited_paper":"/paper/2308.16369","citing_paper":"/paper/2506.04108"},"observation_digest":"sha256:f1342fa4330800a1c277f5a1f4639042d95458fa8fd6b37b77bce093e6e6699a","observation_id":"195f9a5b-f13b-4520-a5d3-b22ff14f473a","resolution":{"observed_at":"2026-08-07T10:52:48.200672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13245","last_updated":"2023-12-23T17:55:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-22T17:16:38Z","title":"GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13245","snapshot_observed_at":"2026-08-07T10:52:48.285123Z","title":"Training generalized multi-query transformer models from multi-head checkpoints.arXiv preprint arXiv:2305.13245, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04108","last_updated":"2025-06-05T05:39:48Z","snapshot_observed_at":"2026-08-08T01:16:59.339584Z","submitted_at":"2025-06-04T16:01:48Z","title":"Rectified Sparse Attention","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:48.285123Z"},"links":{"cited_paper":"/paper/2305.13245","citing_paper":"/paper/2506.04108"},"observation_digest":"sha256:79ba6b2467635ecd19b369c181f15f223e8b3880c6bf3261488bd6e43cea0e4a","observation_id":"bbacd52a-ac00-421f-b26f-472ea2bbf55b","resolution":{"observed_at":"2026-08-07T10:52:48.285123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10774","last_updated":"2024-06-14T23:32:32Z","snapshot_observed_at":"2026-07-06T17:17:56.276857Z","submitted_at":"2024-01-19T15:48:40Z","title":"Medusa: Simple LLM Inference Acceleration Framework with Multiple Decoding Heads","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10774","snapshot_observed_at":"2026-08-07T10:52:48.349290Z","title":"Medusa: Simple llm inference acceleration framework with multiple decoding heads","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04108","last_updated":"2025-06-05T05:39:48Z","snapshot_observed_at":"2026-08-08T01:16:59.339584Z","submitted_at":"2025-06-04T16:01:48Z","title":"Rectified Sparse Attention","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:48.349290Z"},"links":{"cited_paper":"/paper/2401.10774","citing_paper":"/paper/2506.04108"},"observation_digest":"sha256:4e2d22c5cc53e2af58fe01568d3cd6f8c03e31f9caf7c2b8ed34b78309b6f04c","observation_id":"16245e3d-3417-44ff-8c73-564e3e612f0b","resolution":{"observed_at":"2026-08-07T10:52:48.349290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16179","last_updated":"2024-12-18T17:36:36Z","snapshot_observed_at":"2026-07-06T19:37:11.636987Z","submitted_at":"2024-10-21T16:44:51Z","title":"MagicPIG: LSH Sampling for Efficient LLM Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.16179","snapshot_observed_at":"2026-08-07T10:52:48.465707Z","title":"Magicpig: Lsh sampling for efficient llm generation.arXiv preprint arXiv:2410.16179, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04108","last_updated":"2025-06-05T05:39:48Z","snapshot_observed_at":"2026-08-08T01:16:59.339584Z","submitted_at":"2025-06-04T16:01:48Z","title":"Rectified Sparse Attention","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:48.465707Z"},"links":{"cited_paper":"/paper/2410.16179","citing_paper":"/paper/2506.04108"},"observation_digest":"sha256:73c97405a092d808beef343760ab2f9a3a7913ca31d3e39e09e4bd0606db6933","observation_id":"6d71bcdd-d3e0-46c7-98e1-921e2eea93a6","resolution":{"observed_at":"2026-08-07T10:52:48.465707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-07T10:52:48.527304Z","title":"Training verifiers to solve math word problems.arXiv preprint arXiv:2110.14168, 2021","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04108","last_updated":"2025-06-05T05:39:48Z","snapshot_observed_at":"2026-08-08T01:16:59.339584Z","submitted_at":"2025-06-04T16:01:48Z","title":"Rectified Sparse Attention","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:48.527304Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2506.04108"},"observation_digest":"sha256:0e19a1f4ee8b15f617d6e622d1c6b98b1d0055caa6726843e77d3660b7e46726","observation_id":"6ca1098b-5ddc-474f-a14e-ce7f8b4b2dfa","resolution":{"observed_at":"2026-08-07T10:52:48.527304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:49.265932Z","title":"Flash-Decoding for long-context inference.https://crfm.stanford.edu/2023/10/12/flashdecoding.html, 2023","venue":null,"work_id":"1deb46c3-e74f-4b74-88dd-e76ef0109fc2","year":2023},"citing_paper":{"arxiv_id":"2506.04108","last_updated":"2025-06-05T05:39:48Z","snapshot_observed_at":"2026-08-08T01:16:59.339584Z","submitted_at":"2025-06-04T16:01:48Z","title":"Rectified Sparse Attention","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:48.550761Z"},"links":{"citing_paper":"/paper/2506.04108"},"observation_digest":"sha256:e40cdcef753559cc8e4369280b84848a78417872e4643edb7d13f74096dc34ba","observation_id":"ed759aec-6814-40db-a56d-41151166bdf9","resolution":{"observed_at":"2026-08-07T10:52:49.268981Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11743","last_updated":"2024-08-21T16:10:41Z","snapshot_observed_at":"2026-08-06T08:01:32.307047Z","submitted_at":"2024-08-21T16:10:41Z","title":"MARLIN: Mixed-Precision Auto-Regressive Parallel Inference on Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11743","snapshot_observed_at":"2026-08-07T10:52:48.650576Z","title":"Marlin: Mixed-precision auto-regressive parallel inference on large language models.arXiv preprint arXiv:2408.11743, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04108","last_updated":"2025-06-05T05:39:48Z","snapshot_observed_at":"2026-08-08T01:16:59.339584Z","submitted_at":"2025-06-04T16:01:48Z","title":"Rectified Sparse Attention","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:48.650576Z"},"links":{"cited_paper":"/paper/2408.11743","citing_paper":"/paper/2506.04108"},"observation_digest":"sha256:fdc41d4d3d507e2b2679d18e77122df5305cb8c3465c59a729356f88d30de32c","observation_id":"22abf7b4-91e0-48e1-b5b4-8b0ae3a4152c","resolution":{"observed_at":"2026-08-07T10:52:48.650576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13276","last_updated":"2025-02-17T02:24:47Z","snapshot_observed_at":"2026-08-05T05:19:17.395325Z","submitted_at":"2024-10-17T07:07:09Z","title":"SeerAttention: Learning Intrinsic Sparse Attention in Your LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13276","snapshot_observed_at":"2026-08-07T10:52:48.764869Z","title":"Seerattention: Learning intrinsic sparse attention in your llms.arXiv preprint arXiv:2410.13276, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04108","last_updated":"2025-06-05T05:39:48Z","snapshot_observed_at":"2026-08-08T01:16:59.339584Z","submitted_at":"2025-06-04T16:01:48Z","title":"Rectified Sparse Attention","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:48.764869Z"},"links":{"cited_paper":"/paper/2410.13276","citing_paper":"/paper/2506.04108"},"observation_digest":"sha256:e9d6ff612c3b7fc87a8e7489b3e1cd7d754bf9f0340f6b6b35960367c72e4b61","observation_id":"e892edf0-045c-41f9-81e0-73dd74f82b7f","resolution":{"observed_at":"2026-08-07T10:52:48.764869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T10:52:48.868706Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.04108","last_updated":"2025-06-05T05:39:48Z","snapshot_observed_at":"2026-08-08T01:16:59.339584Z","submitted_at":"2025-06-04T16:01:48Z","title":"Rectified Sparse Attention","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:48.868706Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.04108"},"observation_digest":"sha256:e94a54600873cbda0b8c4b5dc96b8981db100a17562273056f89dc911827d612","observation_id":"99217db7-9ac4-4fd3-91b0-9f5e57ab2e5c","resolution":{"observed_at":"2026-08-07T10:52:48.868706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14008","last_updated":"2024-06-06T13:19:44Z","snapshot_observed_at":"2026-08-03T03:39:09.398343Z","submitted_at":"2024-02-21T18:49:26Z","title":"OlympiadBench: A Challenging Benchmark for Promoting AGI with Olympiad-Level Bilingual Multimodal Scientific Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14008","snapshot_observed_at":"2026-08-07T10:52:48.901428Z","title":"Olympiadbench: A challenging benchmark for promoting agi with olympiad-level bilingual multimodal scientific problems.arXiv preprint arXiv:2402.14008, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04108","last_updated":"2025-06-05T05:39:48Z","snapshot_observed_at":"2026-08-08T01:16:59.339584Z","submitted_at":"2025-06-04T16:01:48Z","title":"Rectified Sparse Attention","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:48.901428Z"},"links":{"cited_paper":"/paper/2402.14008","citing_paper":"/paper/2506.04108"},"observation_digest":"sha256:f43abc35a80760a2344da47235efaf9bea79bf1eb2d79f414879a52fb1a6ab2f","observation_id":"ee8639a1-dc19-4f1b-8861-83e1711016ae","resolution":{"observed_at":"2026-08-07T10:52:48.901428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:48.935265Z","title":"Measuring mathematical problem solving with the math dataset","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.04108","last_updated":"2025-06-05T05:39:48Z","snapshot_observed_at":"2026-08-08T01:16:59.339584Z","submitted_at":"2025-06-04T16:01:48Z","title":"Rectified Sparse Attention","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:48.935265Z"},"links":{"citing_paper":"/paper/2506.04108"},"observation_digest":"sha256:9144c8b6abc93777cc8b84a14cd808ec320961633087f2c84af31a15a1c15875","observation_id":"b8c5d9b4-69ab-498a-9051-24b27898a446","resolution":{"observed_at":"2026-08-07T10:52:48.935265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08671","last_updated":"2024-01-09T06:49:40Z","snapshot_observed_at":"2026-07-06T17:16:25.682072Z","submitted_at":"2024-01-09T06:49:40Z","title":"DeepSpeed-FastGen: High-throughput Text Generation for LLMs via MII and DeepSpeed-Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08671","snapshot_observed_at":"2026-08-07T10:52:48.938385Z","title":"Deepspeed-fastgen: High-throughput text generation for llms via mii and deepspeed-inference","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04108","last_updated":"2025-06-05T05:39:48Z","snapshot_observed_at":"2026-08-08T01:16:59.339584Z","submitted_at":"2025-06-04T16:01:48Z","title":"Rectified Sparse Attention","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:48.938385Z"},"links":{"cited_paper":"/paper/2401.08671","citing_paper":"/paper/2506.04108"},"observation_digest":"sha256:b8bdafa6450187f61779b5480531061c2153c719ef283a72dc2e63f3c68d7da7","observation_id":"17c4b2d3-7d80-4f7e-a321-478c29739989","resolution":{"observed_at":"2026-08-07T10:52:48.938385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-07T10:52:48.941415Z","title":"Openai o1 system card.arXiv preprint arXiv:2412.16720, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04108","last_updated":"2025-06-05T05:39:48Z","snapshot_observed_at":"2026-08-08T01:16:59.339584Z","submitted_at":"2025-06-04T16:01:48Z","title":"Rectified Sparse Attention","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:48.941415Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2506.04108"},"observation_digest":"sha256:6c220513c06debf437c4a9d94eaa76ee491ebf2eeca3e0d5100f6cd922fff9e1","observation_id":"12ea0f1f-3189-47b6-864f-d1ea47ef7f87","resolution":{"observed_at":"2026-08-07T10:52:48.941415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:48.944325Z","title":"Fast inference from transformers via speculative decoding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04108","last_updated":"2025-06-05T05:39:48Z","snapshot_observed_at":"2026-08-08T01:16:59.339584Z","submitted_at":"2025-06-04T16:01:48Z","title":"Rectified Sparse Attention","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:48.944325Z"},"links":{"citing_paper":"/paper/2506.04108"},"observation_digest":"sha256:556c815192633d5f274537e331be63401395fda207a154937569a2e909d1286b","observation_id":"35a5dac5-0e4d-46d9-b136-1aecd9c73860","resolution":{"observed_at":"2026-08-07T10:52:48.944325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:48.947196Z","title":"Solving quantitative reasoning problems with language models.Advances in Neural Information Processing Systems, 35:3843–3857, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.04108","last_updated":"2025-06-05T05:39:48Z","snapshot_observed_at":"2026-08-08T01:16:59.339584Z","submitted_at":"2025-06-04T16:01:48Z","title":"Rectified Sparse Attention","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:48.947196Z"},"links":{"citing_paper":"/paper/2506.04108"},"observation_digest":"sha256:2905784186f4fe30157ea0a9ff023ab8b8aa067cf66417fa547ff53f282282fc","observation_id":"be024e36-8e0f-44cc-909d-dd3b550312c7","resolution":{"observed_at":"2026-08-07T10:52:48.947196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.15077","last_updated":"2025-03-04T13:58:39Z","snapshot_observed_at":"2026-08-03T09:40:31.365295Z","submitted_at":"2024-01-26T18:59:01Z","title":"EAGLE: Speculative Sampling Requires Rethinking Feature Uncertainty","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.15077","snapshot_observed_at":"2026-08-07T10:52:48.949963Z","title":"Eagle: Speculative sampling requires rethinking feature uncertainty.arXiv preprint arXiv:2401.15077, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04108","last_updated":"2025-06-05T05:39:48Z","snapshot_observed_at":"2026-08-08T01:16:59.339584Z","submitted_at":"2025-06-04T16:01:48Z","title":"Rectified Sparse Attention","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:48.949963Z"},"links":{"cited_paper":"/paper/2401.15077","citing_paper":"/paper/2506.04108"},"observation_digest":"sha256:2939de3544dd3b8c83377e82fad5bd17816e773b0968e0f8a7804752334735a4","observation_id":"11fa7331-4345-4ad5-ac3d-8fe859d827c4","resolution":{"observed_at":"2026-08-07T10:52:48.949963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08190","last_updated":"2024-02-21T20:28:13Z","snapshot_observed_at":"2026-07-30T23:49:06.775533Z","submitted_at":"2024-01-16T08:08:01Z","title":"MARIO: MAth Reasoning with code Interpreter Output -- A Reproducible Pipeline","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08190","snapshot_observed_at":"2026-08-07T10:52:48.952928Z","title":"Mario: Math reasoning with code interpreter output–a reproducible pipeline.arXiv preprint arXiv:2401.08190, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04108","last_updated":"2025-06-05T05:39:48Z","snapshot_observed_at":"2026-08-08T01:16:59.339584Z","submitted_at":"2025-06-04T16:01:48Z","title":"Rectified Sparse Attention","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:48.952928Z"},"links":{"cited_paper":"/paper/2401.08190","citing_paper":"/paper/2506.04108"},"observation_digest":"sha256:755a94996678d6bdadaf26af50a7ca7e6793b4b88ee685df2d974738cc105c91","observation_id":"6ec6e455-732c-44d0-b336-17cb5fc7c4e6","resolution":{"observed_at":"2026-08-07T10:52:48.952928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03213","last_updated":"2025-06-14T06:17:33Z","snapshot_observed_at":"2026-07-06T20:01:27.728631Z","submitted_at":"2024-12-04T10:58:27Z","title":"ClusterKV: Manipulating LLM KV Cache in Semantic Space for Recallable Compression","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03213","snapshot_observed_at":"2026-08-07T10:52:48.956989Z","title":"Clusterkv: Manipulating llm kv cache in semantic space for recallable compression.arXiv preprint arXiv:2412.03213, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04108","last_updated":"2025-06-05T05:39:48Z","snapshot_observed_at":"2026-08-08T01:16:59.339584Z","submitted_at":"2025-06-04T16:01:48Z","title":"Rectified Sparse Attention","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:48.956989Z"},"links":{"cited_paper":"/paper/2412.03213","citing_paper":"/paper/2506.04108"},"observation_digest":"sha256:c83ebaa6e8a76de5b40c4d1fe3c2264eddcd2a254fd1c31f43f68122df011b14","observation_id":"89b1cfc7-6b65-4532-a222-6d99636ed20f","resolution":{"observed_at":"2026-08-07T10:52:48.956989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13189","snapshot_observed_at":"2026-08-07T10:52:48.960314Z","title":"Moba: Mixture of block attention for long-context llms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.04108","last_updated":"2025-06-05T05:39:48Z","snapshot_observed_at":"2026-08-08T01:16:59.339584Z","submitted_at":"2025-06-04T16:01:48Z","title":"Rectified Sparse Attention","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:48.960314Z"},"links":{"cited_paper":"/paper/2502.13189","citing_paper":"/paper/2506.04108"},"observation_digest":"sha256:bea3d3f60bbfa30a1524b02557d236d561acedb1af561c3bec57fa1f64cf1624","observation_id":"131d3691-37ae-43d6-81b2-a7d6ccfa2d99","resolution":{"observed_at":"2026-08-07T10:52:48.960314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-07T10:52:48.963403Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context.arXiv preprint arXiv:2403.05530, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04108","last_updated":"2025-06-05T05:39:48Z","snapshot_observed_at":"2026-08-08T01:16:59.339584Z","submitted_at":"2025-06-04T16:01:48Z","title":"Rectified Sparse Attention","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:48.963403Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2506.04108"},"observation_digest":"sha256:0d5905599fedb0141dbe64dac6a943ca9ab07959d5e5ba818e4decbf49e4561e","observation_id":"ff56fa26-426a-4638-807d-425e491602f4","resolution":{"observed_at":"2026-08-07T10:52:48.963403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11049","last_updated":"2025-04-02T01:58:38Z","snapshot_observed_at":"2026-08-08T01:17:07.764692Z","submitted_at":"2024-08-20T17:57:31Z","title":"MagicDec: Breaking the Latency-Throughput Tradeoff for Long Context Generation with Speculative Decoding","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11049","snapshot_observed_at":"2026-08-07T10:52:48.966152Z","title":"Magicdec: Breaking the latency- throughput tradeoff for long context generation with speculative decoding.arXiv preprint arXiv:2408.11049, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04108","last_updated":"2025-06-05T05:39:48Z","snapshot_observed_at":"2026-08-08T01:16:59.339584Z","submitted_at":"2025-06-04T16:01:48Z","title":"Rectified Sparse Attention","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:48.966152Z"},"links":{"cited_paper":"/paper/2408.11049","citing_paper":"/paper/2506.04108"},"observation_digest":"sha256:dba76ec5a11842c70cd70ee41046aa06ff2bf9f4f3fd8d50c5de1c249c444767","observation_id":"e9161153-b987-4d15-aee1-1ea702c8f66c","resolution":{"observed_at":"2026-08-07T10:52:48.966152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.11912","last_updated":"2024-08-04T00:58:04Z","snapshot_observed_at":"2026-08-08T01:16:46.668747Z","submitted_at":"2024-04-18T05:25:54Z","title":"TriForce: Lossless Acceleration of Long Sequence Generation with Hierarchical Speculative Decoding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.11912","snapshot_observed_at":"2026-08-07T10:52:48.969030Z","title":"Triforce: Lossless acceleration of long sequence generation with hierarchical speculative decoding.arXiv preprint arXiv:2404.11912, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04108","last_updated":"2025-06-05T05:39:48Z","snapshot_observed_at":"2026-08-08T01:16:59.339584Z","submitted_at":"2025-06-04T16:01:48Z","title":"Rectified Sparse Attention","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:48.969030Z"},"links":{"cited_paper":"/paper/2404.11912","citing_paper":"/paper/2506.04108"},"observation_digest":"sha256:c075cd5551cc584d427b75bc52b213adc9a91a9fbf7d92463defa32bc388b9e0","observation_id":"ee44efbc-ac4b-45df-b458-0d636cf0ee21","resolution":{"observed_at":"2026-08-07T10:52:48.969030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10774","last_updated":"2024-08-26T21:01:02Z","snapshot_observed_at":"2026-07-06T18:31:36.504766Z","submitted_at":"2024-06-16T01:33:02Z","title":"Quest: Query-Aware Sparsity for Efficient Long-Context LLM Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10774","snapshot_observed_at":"2026-08-07T10:52:48.972268Z","title":"Quest: Query-aware sparsity for efficient long-context llm inference.arXiv preprint arXiv:2406.10774, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04108","last_updated":"2025-06-05T05:39:48Z","snapshot_observed_at":"2026-08-08T01:16:59.339584Z","submitted_at":"2025-06-04T16:01:48Z","title":"Rectified Sparse Attention","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:48.972268Z"},"links":{"cited_paper":"/paper/2406.10774","citing_paper":"/paper/2506.04108"},"observation_digest":"sha256:41e8ea428a3a4e25ccbca48575d245c888f376cb82c10bc0ef9531efb56f3f22","observation_id":"4e5d68fd-4e9c-4eae-8d71-39bf16189b3d","resolution":{"observed_at":"2026-08-07T10:52:48.972268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04617","last_updated":"2024-05-28T12:05:12Z","snapshot_observed_at":"2026-07-06T17:26:39.109878Z","submitted_at":"2024-02-07T06:50:42Z","title":"InfLLM: Training-Free Long-Context Extrapolation for LLMs with an Efficient Context Memory","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04617","snapshot_observed_at":"2026-08-07T10:52:48.975137Z","title":"Infllm: Training-free long-context extrapolation for llms with an efficient context memory.arXiv preprint arXiv:2402.04617, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04108","last_updated":"2025-06-05T05:39:48Z","snapshot_observed_at":"2026-08-08T01:16:59.339584Z","submitted_at":"2025-06-04T16:01:48Z","title":"Rectified Sparse Attention","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:48.975137Z"},"links":{"cited_paper":"/paper/2402.04617","citing_paper":"/paper/2506.04108"},"observation_digest":"sha256:8dddb91a4ec10b0705e605d502283f166b932c932395621be39f41445cea1962","observation_id":"1a8181b3-5ed7-4a97-975b-447725659275","resolution":{"observed_at":"2026-08-07T10:52:48.975137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T10:52:48.978094Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04108","last_updated":"2025-06-05T05:39:48Z","snapshot_observed_at":"2026-08-08T01:16:59.339584Z","submitted_at":"2025-06-04T16:01:48Z","title":"Rectified Sparse Attention","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:48.978094Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2506.04108"},"observation_digest":"sha256:4fb8874f8b4fc82fdeb7bcf0b26aceaba44ebb9d9f628ef5eb94a5de5a051932","observation_id":"524b4230-df1a-4c66-a691-39c2f3aa839b","resolution":{"observed_at":"2026-08-07T10:52:48.978094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15383","last_updated":"2025-01-26T03:47:25Z","snapshot_observed_at":"2026-07-31T01:49:29.562668Z","submitted_at":"2025-01-26T03:47:25Z","title":"Qwen2.5-1M Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.15383","snapshot_observed_at":"2026-08-07T10:52:48.981099Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.04108","last_updated":"2025-06-05T05:39:48Z","snapshot_observed_at":"2026-08-08T01:16:59.339584Z","submitted_at":"2025-06-04T16:01:48Z","title":"Rectified Sparse Attention","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:48.981099Z"},"links":{"cited_paper":"/paper/2501.15383","citing_paper":"/paper/2506.04108"},"observation_digest":"sha256:9a8d0acad295423691be35c356cb5b35949f1c981633254086a6d488440800a1","observation_id":"afb1e160-cf1b-40f4-8c89-1d923ac34cf3","resolution":{"observed_at":"2026-08-07T10:52:48.981099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:49.234617Z","title":"Orca: A distributed serving system for Transformer-based generative models","venue":null,"work_id":"fa27bd2e-7f7e-4aa7-a646-d4bdc6d319fb","year":2022},"citing_paper":{"arxiv_id":"2506.04108","last_updated":"2025-06-05T05:39:48Z","snapshot_observed_at":"2026-08-08T01:16:59.339584Z","submitted_at":"2025-06-04T16:01:48Z","title":"Rectified Sparse Attention","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:48.984029Z"},"links":{"citing_paper":"/paper/2506.04108"},"observation_digest":"sha256:d4605864df2609ff1195e3635e47bf8ead776a2a6f39ec82611de559627c87df","observation_id":"e9a5af27-b368-4d42-817a-6675be5981b5","resolution":{"observed_at":"2026-08-07T10:52:49.239761Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11089","last_updated":"2025-02-27T09:01:21Z","snapshot_observed_at":"2026-08-07T14:17:15.942844Z","submitted_at":"2025-02-16T11:53:44Z","title":"Native Sparse Attention: Hardware-Aligned and Natively Trainable Sparse Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11089","snapshot_observed_at":"2026-08-07T10:52:48.987113Z","title":"Native sparse attention: Hardware-aligned and natively trainable sparse attention.arXiv preprint arXiv:2502.11089, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.04108","last_updated":"2025-06-05T05:39:48Z","snapshot_observed_at":"2026-08-08T01:16:59.339584Z","submitted_at":"2025-06-04T16:01:48Z","title":"Rectified Sparse Attention","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:48.987113Z"},"links":{"cited_paper":"/paper/2502.11089","citing_paper":"/paper/2506.04108"},"observation_digest":"sha256:73d95f4bb8dea0f0d0c399c65d923f91a4e5986e3eba72cf863e06c748de85fd","observation_id":"cb718aeb-3183-4d09-8cca-503448e3a0ba","resolution":{"observed_at":"2026-08-07T10:52:48.987113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.04108","last_updated":"2025-06-05T05:39:48Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-08T01:16:59.339584Z","submitted_at":"2025-06-04T16:01:48Z","title":"Rectified Sparse Attention"},"reference_resolution":{"displayed":28,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":26,"verified_exact":0,"verified_fuzzy":2},"total_outbound_references":28},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 28 of 28 outbound references and 4 inbound Pith citation observations for arXiv:2506.04108."}