{"as_of":"2026-08-07T08:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:557caf52adc32ce1c09d4e1b2b216968faff8048350c80302836b70900ab3d66","coverage":[{"denominator":17,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":17,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:42:03.215037Z","state":"measured"},{"denominator":18,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":18,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T15:32:54.053527Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.07311","last_updated":"2025-06-08T22:59:20Z","snapshot_observed_at":"2026-08-07T05:34:24.593458Z","submitted_at":"2025-06-08T22:59:20Z","title":"Paged Attention Meets FlexAttention: Unlocking Long-Context Efficiency in Deployed Inference","version":1},"cited_work":{"arxiv_id":"2506.07311","doi":"10.48550/arxiv.2506.07311","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07311","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":null,"venue":"ArXiv.org","work_id":"e2c730d6-8a83-4f74-996f-9a312a771486","year":2025},"citing_paper":{"arxiv_id":"2604.12282","last_updated":"2026-04-14T04:47:21Z","snapshot_observed_at":"2026-07-06T23:00:32.607699Z","submitted_at":"2026-04-14T04:47:21Z","title":"Towards Robust Real-World Spreadsheet Understanding with Multi-Agent Multi-Format Reasoning","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-05-10T15:32:54.053527Z"},"links":{"cited_paper":"/paper/2506.07311","citing_paper":"/paper/2604.12282"},"observation_digest":"sha256:428e69fcc15cc639439b5ad688657b3467bdf411049e0bd72a763c86a03f7e25","observation_id":"225f89c3-5025-40db-9d92-944995851518","resolution":{"observed_at":"2026-05-10T15:35:33.206129Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.07311/citation-record","integrity":"/paper/2506.07311/integrity","json":"/paper/2506.07311/citation-record.json","paper":"/paper/2506.07311"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:42:03.487292Z","title":null,"venue":null,"work_id":"4dd336c7-2cc1-4dbc-a82e-b609035941c2","year":2022},"citing_paper":{"arxiv_id":"2506.07311","last_updated":"2025-06-08T22:59:20Z","snapshot_observed_at":"2026-08-07T05:34:24.593458Z","submitted_at":"2025-06-08T22:59:20Z","title":"Paged Attention Meets FlexAttention: Unlocking Long-Context Efficiency in Deployed Inference","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T05:42:03.128212Z"},"links":{"citing_paper":"/paper/2506.07311"},"observation_digest":"sha256:39d60826a6105ffa1b62ea87887b3a99f27986c2a9808d6911eab8d5497783c0","observation_id":"32980e6a-6544-4164-bb3f-eeb57a65a044","resolution":{"observed_at":"2026-08-07T05:42:03.491648Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:42:03.473227Z","title":null,"venue":null,"work_id":"4a858599-d1bd-4c1c-9232-69be04a9d118","year":2023},"citing_paper":{"arxiv_id":"2506.07311","last_updated":"2025-06-08T22:59:20Z","snapshot_observed_at":"2026-08-07T05:34:24.593458Z","submitted_at":"2025-06-08T22:59:20Z","title":"Paged Attention Meets FlexAttention: Unlocking Long-Context Efficiency in Deployed Inference","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T05:42:03.133517Z"},"links":{"citing_paper":"/paper/2506.07311"},"observation_digest":"sha256:78881796774d13e9196f912507d6f4c1d44fdb8bba11f55fcad9bd5077eda908","observation_id":"ffe6b098-d5a7-4508-ab1e-48768d93b525","resolution":{"observed_at":"2026-08-07T05:42:03.477925Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:42:03.459939Z","title":"Prabhu, L","venue":null,"work_id":"c34bbb57-1314-4b44-b41a-980af43a4f57","year":2024},"citing_paper":{"arxiv_id":"2506.07311","last_updated":"2025-06-08T22:59:20Z","snapshot_observed_at":"2026-08-07T05:34:24.593458Z","submitted_at":"2025-06-08T22:59:20Z","title":"Paged Attention Meets FlexAttention: Unlocking Long-Context Efficiency in Deployed Inference","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T05:42:03.138558Z"},"links":{"citing_paper":"/paper/2506.07311"},"observation_digest":"sha256:3e1f97f5417e37a03cac04b9370634dd5f54cab28b757574313ac65b4ace80b4","observation_id":"bce681c7-7c52-4262-9333-d47bdade284e","resolution":{"observed_at":"2026-08-07T05:42:03.464289Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:42:03.446307Z","title":"[Online]","venue":null,"work_id":"2189586e-c779-41ed-acfc-ea4e0db356fb","year":2023},"citing_paper":{"arxiv_id":"2506.07311","last_updated":"2025-06-08T22:59:20Z","snapshot_observed_at":"2026-08-07T05:34:24.593458Z","submitted_at":"2025-06-08T22:59:20Z","title":"Paged Attention Meets FlexAttention: Unlocking Long-Context Efficiency in Deployed Inference","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T05:42:03.143130Z"},"links":{"citing_paper":"/paper/2506.07311"},"observation_digest":"sha256:233c1fc9b25e271f535435f134c6aedfa13405018c74d4804f78604839bb80dd","observation_id":"ec09f6c2-3409-4f31-affc-70a963c8795c","resolution":{"observed_at":"2026-08-07T05:42:03.450752Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:42:03.431735Z","title":"[Online]","venue":null,"work_id":"91ec8e54-371b-46fe-b274-6908761ac61d","year":2023},"citing_paper":{"arxiv_id":"2506.07311","last_updated":"2025-06-08T22:59:20Z","snapshot_observed_at":"2026-08-07T05:34:24.593458Z","submitted_at":"2025-06-08T22:59:20Z","title":"Paged Attention Meets FlexAttention: Unlocking Long-Context Efficiency in Deployed Inference","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T05:42:03.148604Z"},"links":{"citing_paper":"/paper/2506.07311"},"observation_digest":"sha256:07d0d3be38d26921a7fc72aff5e221a324a6329a4b9d80a61cb36e0d88c9962a","observation_id":"ad24db31-bbda-4922-b6c9-cb44a0fb7bb6","resolution":{"observed_at":"2026-08-07T05:42:03.436169Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:42:03.417391Z","title":"[Online]","venue":null,"work_id":"ef51cde1-52ad-4fd1-a7c7-28fec763dd64","year":2023},"citing_paper":{"arxiv_id":"2506.07311","last_updated":"2025-06-08T22:59:20Z","snapshot_observed_at":"2026-08-07T05:34:24.593458Z","submitted_at":"2025-06-08T22:59:20Z","title":"Paged Attention Meets FlexAttention: Unlocking Long-Context Efficiency in Deployed Inference","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T05:42:03.153588Z"},"links":{"citing_paper":"/paper/2506.07311"},"observation_digest":"sha256:c45269fb86e6f5876d52b137da590e7c41553092ffe5ace522d3446d11e0fc09","observation_id":"e1c5ff71-c368-4500-9c7f-cc02bc813682","resolution":{"observed_at":"2026-08-07T05:42:03.421948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:42:03.403018Z","title":"[Online]","venue":null,"work_id":"fc204aee-eb36-4614-8f03-b889afedc89c","year":2023},"citing_paper":{"arxiv_id":"2506.07311","last_updated":"2025-06-08T22:59:20Z","snapshot_observed_at":"2026-08-07T05:34:24.593458Z","submitted_at":"2025-06-08T22:59:20Z","title":"Paged Attention Meets FlexAttention: Unlocking Long-Context Efficiency in Deployed Inference","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T05:42:03.158930Z"},"links":{"citing_paper":"/paper/2506.07311"},"observation_digest":"sha256:fcc64549d1a5b3cd0303c8dc114fb49eb93833a15c843a1f8df83ab6d0c912ce","observation_id":"740119d4-79eb-47aa-9828-2b9fe5db0e30","resolution":{"observed_at":"2026-08-07T05:42:03.408052Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:42:03.388509Z","title":null,"venue":null,"work_id":"45389b17-82c0-4cc7-a174-af53372095e2","year":null},"citing_paper":{"arxiv_id":"2506.07311","last_updated":"2025-06-08T22:59:20Z","snapshot_observed_at":"2026-08-07T05:34:24.593458Z","submitted_at":"2025-06-08T22:59:20Z","title":"Paged Attention Meets FlexAttention: Unlocking Long-Context Efficiency in Deployed Inference","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T05:42:03.164131Z"},"links":{"citing_paper":"/paper/2506.07311"},"observation_digest":"sha256:541498d8182d900a7fd4a8dae418d901141dec351bd2d733be730863508d7bcf","observation_id":"44393581-ba9f-4c53-8865-0ce489f9fcc9","resolution":{"observed_at":"2026-08-07T05:42:03.393051Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-07T05:42:03.174336Z","title":"Megatron-LM: Training multi-billion parameter language models using model parallelism,","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2506.07311","last_updated":"2025-06-08T22:59:20Z","snapshot_observed_at":"2026-08-07T05:34:24.593458Z","submitted_at":"2025-06-08T22:59:20Z","title":"Paged Attention Meets FlexAttention: Unlocking Long-Context Efficiency in Deployed Inference","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T05:42:03.174336Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2506.07311"},"observation_digest":"sha256:2405e8d1e039d95922b87220736e9fbdbcd67a2b2814e6e0c8e8841bf71bbe4f","observation_id":"7d0c0f8f-6a31-4408-a92c-c6f216346911","resolution":{"observed_at":"2026-08-07T05:42:03.174336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:42:03.357431Z","title":"FasterTransformer: A GPU inference engine for transformer models,","venue":null,"work_id":"93eb7989-4bfe-45a2-bc58-83a45cc27740","year":2021},"citing_paper":{"arxiv_id":"2506.07311","last_updated":"2025-06-08T22:59:20Z","snapshot_observed_at":"2026-08-07T05:34:24.593458Z","submitted_at":"2025-06-08T22:59:20Z","title":"Paged Attention Meets FlexAttention: Unlocking Long-Context Efficiency in Deployed Inference","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T05:42:03.179316Z"},"links":{"citing_paper":"/paper/2506.07311"},"observation_digest":"sha256:c023df628418527dc3467aa49dc66c7bccff9bfbb8408f0cfd3f95112f9c47f7","observation_id":"81e180f8-7faa-47ee-8a66-4df5d7800a97","resolution":{"observed_at":"2026-08-07T05:42:03.362372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:42:03.342462Z","title":"xFormers: A modular and hackable vision & language transformer library,","venue":null,"work_id":"70345ead-bfc8-4787-b202-cc6d68f6449c","year":2022},"citing_paper":{"arxiv_id":"2506.07311","last_updated":"2025-06-08T22:59:20Z","snapshot_observed_at":"2026-08-07T05:34:24.593458Z","submitted_at":"2025-06-08T22:59:20Z","title":"Paged Attention Meets FlexAttention: Unlocking Long-Context Efficiency in Deployed Inference","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T05:42:03.183694Z"},"links":{"citing_paper":"/paper/2506.07311"},"observation_digest":"sha256:7c91b19589ccdff2aaa20ec89aef966d0d6412b3f188f738f3631e68a54fd303","observation_id":"dded19c1-fdc9-4f96-a6b8-18b276f78fb1","resolution":{"observed_at":"2026-08-07T05:42:03.347219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:42:03.327577Z","title":"DeepSpeed-MoE: Advancing mixture-of-experts inference and training to beyond trillion parameter models,","venue":null,"work_id":"b6ea7f81-4b99-4387-ab11-60f54b329c0d","year":2022},"citing_paper":{"arxiv_id":"2506.07311","last_updated":"2025-06-08T22:59:20Z","snapshot_observed_at":"2026-08-07T05:34:24.593458Z","submitted_at":"2025-06-08T22:59:20Z","title":"Paged Attention Meets FlexAttention: Unlocking Long-Context Efficiency in Deployed Inference","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T05:42:03.194725Z"},"links":{"citing_paper":"/paper/2506.07311"},"observation_digest":"sha256:528d27c90704fb9b7b97849ca1af069e3961c307bf9b733b69de3c698eb0082d","observation_id":"25ed2417-70c6-49be-914f-a632a8156951","resolution":{"observed_at":"2026-08-07T05:42:03.332425Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12345","last_updated":"2023-10-18T21:43:37Z","snapshot_observed_at":"2026-07-06T16:35:19.728025Z","submitted_at":"2023-10-18T21:43:37Z","title":"ClusT3: Information Invariant Test-Time Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12345","snapshot_observed_at":"2026-08-07T05:42:03.199805Z","title":"InfiniAttention: Memory-efficient attention for long sequences,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07311","last_updated":"2025-06-08T22:59:20Z","snapshot_observed_at":"2026-08-07T05:34:24.593458Z","submitted_at":"2025-06-08T22:59:20Z","title":"Paged Attention Meets FlexAttention: Unlocking Long-Context Efficiency in Deployed Inference","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T05:42:03.199805Z"},"links":{"cited_paper":"/paper/2310.12345","citing_paper":"/paper/2506.07311"},"observation_digest":"sha256:b8e4cfc93ebbb5ba79a0f619bc65ac76341f84f6cd59e11868ae72096400d56f","observation_id":"714de216-6a6a-4ea1-a218-a712e53c958f","resolution":{"observed_at":"2026-08-07T05:42:03.199805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:42:03.312454Z","title":"HierKV: Hierarchical key-value caching for language models,","venue":null,"work_id":"1f865d9c-8425-4d8b-a6a5-e7a654cc3f62","year":2024},"citing_paper":{"arxiv_id":"2506.07311","last_updated":"2025-06-08T22:59:20Z","snapshot_observed_at":"2026-08-07T05:34:24.593458Z","submitted_at":"2025-06-08T22:59:20Z","title":"Paged Attention Meets FlexAttention: Unlocking Long-Context Efficiency in Deployed Inference","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T05:42:03.205467Z"},"links":{"citing_paper":"/paper/2506.07311"},"observation_digest":"sha256:1daa6bfd3ec1f6c8939d77870f1636fe90b402a1f04d29eaa428598340acd01d","observation_id":"68732079-3b0a-443c-ac0a-40b039aa360d","resolution":{"observed_at":"2026-08-07T05:42:03.317245Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01234","last_updated":"2024-02-02T08:56:52Z","snapshot_observed_at":"2026-08-06T11:32:01.626046Z","submitted_at":"2024-02-02T08:56:52Z","title":"Connection of event shapes to the heavy-flavor baryon enhancement","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01234","snapshot_observed_at":"2026-08-07T05:42:03.210169Z","title":"LazyKV: On-demand hierarchical KV caching for efficient LLM inference,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07311","last_updated":"2025-06-08T22:59:20Z","snapshot_observed_at":"2026-08-07T05:34:24.593458Z","submitted_at":"2025-06-08T22:59:20Z","title":"Paged Attention Meets FlexAttention: Unlocking Long-Context Efficiency in Deployed Inference","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T05:42:03.210169Z"},"links":{"cited_paper":"/paper/2402.01234","citing_paper":"/paper/2506.07311"},"observation_digest":"sha256:a27bed62f558334c084efb03d50a638dfd79842992e70bd853631c5da6bf509d","observation_id":"0da5eb60-9715-411f-a2db-1d335238c15c","resolution":{"observed_at":"2026-08-07T05:42:03.210169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:42:03.293417Z","title":"PrefixSharing: Efficient prefix reuse for memory- optimized LLM serving,","venue":null,"work_id":"181c5d03-8a02-4007-9d96-34233048b08a","year":2024},"citing_paper":{"arxiv_id":"2506.07311","last_updated":"2025-06-08T22:59:20Z","snapshot_observed_at":"2026-08-07T05:34:24.593458Z","submitted_at":"2025-06-08T22:59:20Z","title":"Paged Attention Meets FlexAttention: Unlocking Long-Context Efficiency in Deployed Inference","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T05:42:03.215037Z"},"links":{"citing_paper":"/paper/2506.07311"},"observation_digest":"sha256:34dfa3be5592431a164ebb320f8dc321f9567df71127648d5250bbf428e440ed","observation_id":"b846b6e0-969e-4cfc-af0d-f6059d347fe0","resolution":{"observed_at":"2026-08-07T05:42:03.300570Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:42:03.373237Z","title":"Available: https://huggingface.co/docs/accelerate","venue":null,"work_id":"363f7da1-e3cf-42bd-8aa6-ab8f3084241c","year":null},"citing_paper":{"arxiv_id":"2506.07311","last_updated":"2025-06-08T22:59:20Z","snapshot_observed_at":"2026-08-07T05:34:24.593458Z","submitted_at":"2025-06-08T22:59:20Z","title":"Paged Attention Meets FlexAttention: Unlocking Long-Context Efficiency in Deployed Inference","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T05:42:03.169253Z"},"links":{"citing_paper":"/paper/2506.07311"},"observation_digest":"sha256:db2a7ad60171a7a7f64acdbdb576c98139d4f10133bbb6304803c73c59e5d197","observation_id":"ad4d0fb4-1207-4992-af29-6c927d00831d","resolution":{"observed_at":"2026-08-07T05:42:03.378073Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.07311","last_updated":"2025-06-08T22:59:20Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T05:34:24.593458Z","submitted_at":"2025-06-08T22:59:20Z","title":"Paged Attention Meets FlexAttention: Unlocking Long-Context Efficiency in Deployed Inference"},"reference_resolution":{"displayed":17,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":6,"verified_exact":0,"verified_fuzzy":11},"total_outbound_references":17},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 17 of 17 outbound references and 1 inbound Pith citation observation for arXiv:2506.07311."}