{"as_of":"2026-08-08T16:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:957730db54d183e408f8d2d5b045c043da32df7cfc8a1ec7089164a829394bca","coverage":[{"denominator":15,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":15,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T10:57:44.554457Z","state":"measured"},{"denominator":18,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":18,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T05:58:45.892043Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-12T08:06:33.691924Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2510.07651","last_updated":"2026-05-28T18:28:06Z","snapshot_observed_at":"2026-08-04T10:57:42.002395Z","submitted_at":"2025-10-09T00:58:28Z","title":"OBCache: Optimal Brain KV Cache Pruning for Efficient Long-Context LLM Inference","version":2},"cited_work":{"arxiv_id":"2510.07651","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2510.07651","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"OBCache: Optimal brain KV cache pruning for efficient long-context LLM inference","venue":null,"work_id":"76a3a3cf-1a68-4fa0-9ac8-293b25f59f3a","year":2025},"citing_paper":{"arxiv_id":"2604.10098","last_updated":"2026-04-11T08:41:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-11T08:41:33Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-10T16:17:09.834609Z"},"links":{"cited_paper":"/paper/2510.07651","citing_paper":"/paper/2604.10098"},"observation_digest":"sha256:736f781220b06d75d1d91e42e1f5938bed6c25f254d31c3695e7a33e76f97bc5","observation_id":"e446f852-d717-4982-bde7-a17c29e5d233","resolution":{"observed_at":"2026-06-01T02:02:20.220338Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.07651","last_updated":"2026-05-28T18:28:06Z","snapshot_observed_at":"2026-08-04T10:57:42.002395Z","submitted_at":"2025-10-09T00:58:28Z","title":"OBCache: Optimal Brain KV Cache Pruning for Efficient Long-Context LLM Inference","version":2},"cited_work":{"arxiv_id":"2510.07651","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2510.07651","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"OBCache: Optimal brain KV cache pruning for efficient long-context LLM inference","venue":null,"work_id":"76a3a3cf-1a68-4fa0-9ac8-293b25f59f3a","year":2025},"citing_paper":{"arxiv_id":"2605.08317","last_updated":"2026-05-08T15:15:06Z","snapshot_observed_at":"2026-07-06T23:20:33.816373Z","submitted_at":"2026-05-08T15:15:06Z","title":"RDKV: Rate-Distortion Bit Allocation for Joint Eviction and Quantization of the KV Cache","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-12T01:16:15.869198Z"},"links":{"cited_paper":"/paper/2510.07651","citing_paper":"/paper/2605.08317"},"observation_digest":"sha256:f647ccb1926ae740079d49fa6d4942047bdabf0d9a3ceec03cf5a0e08ed0f567","observation_id":"c67c7406-a3a2-41df-9a04-98c6fd5e1b13","resolution":{"observed_at":"2026-06-01T02:02:20.220338Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.07651","last_updated":"2026-05-28T18:28:06Z","snapshot_observed_at":"2026-08-04T10:57:42.002395Z","submitted_at":"2025-10-09T00:58:28Z","title":"OBCache: Optimal Brain KV Cache Pruning for Efficient Long-Context LLM Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.07651","snapshot_observed_at":"2026-08-02T05:58:45.892043Z","title":"OBCache: Optimal brain KV cache pruning for effi- cient long-context LLM inference,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13205","last_updated":"2026-07-14T18:55:20Z","snapshot_observed_at":"2026-08-07T14:57:47.896782Z","submitted_at":"2026-07-14T18:55:20Z","title":"Adaptive Filtering of the KV Cache: Diagnosing and Correcting Structural-Role Bias in LLM Inference","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T05:58:45.892043Z"},"links":{"cited_paper":"/paper/2510.07651","citing_paper":"/paper/2607.13205"},"observation_digest":"sha256:b1fa294d4d1d460e1fcfefb9766be0cf551bc4ef1cc984eb2a792d7ee62a84df","observation_id":"362591c2-7ed1-4e33-9052-e37188acaa17","resolution":{"observed_at":"2026-08-02T05:58:45.892043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2510.07651/citation-record","integrity":"/paper/2510.07651/integrity","json":"/paper/2510.07651/citation-record.json","paper":"/paper/2510.07651"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-04T10:57:43.002729Z","title":"Qwen technical report.arXiv preprint arXiv:2309.16609, 2023a","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.07651","last_updated":"2026-05-28T18:28:06Z","snapshot_observed_at":"2026-08-04T10:57:42.002395Z","submitted_at":"2025-10-09T00:58:28Z","title":"OBCache: Optimal Brain KV Cache Pruning for Efficient Long-Context LLM Inference","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T10:57:43.002729Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2510.07651"},"observation_digest":"sha256:d8d7171f413dcc7dc4c9501b295d66c39f5e52b30e53ee893bd7c9b5a660976d","observation_id":"cead4cdf-912d-450a-ad98-cab3b41a2ead","resolution":{"observed_at":"2026-08-04T10:57:43.002729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-04T10:57:43.283901Z","title":"The llama 3 herd of models.arXiv preprint arXiv:2407.21783,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.07651","last_updated":"2026-05-28T18:28:06Z","snapshot_observed_at":"2026-08-04T10:57:42.002395Z","submitted_at":"2025-10-09T00:58:28Z","title":"OBCache: Optimal Brain KV Cache Pruning for Efficient Long-Context LLM Inference","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T10:57:43.283901Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2510.07651"},"observation_digest":"sha256:c99cf292953f1a0bcba40ce53b14ac2ec60c28d93567f5cdcc2b2a619de08885","observation_id":"b330c0fc-b402-4df2-bb98-85756f245a3d","resolution":{"observed_at":"2026-08-04T10:57:43.283901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-04T10:57:43.626012Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.07651","last_updated":"2026-05-28T18:28:06Z","snapshot_observed_at":"2026-08-04T10:57:42.002395Z","submitted_at":"2025-10-09T00:58:28Z","title":"OBCache: Optimal Brain KV Cache Pruning for Efficient Long-Context LLM Inference","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T10:57:43.626012Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2510.07651"},"observation_digest":"sha256:ca8fe92abb989492cc8257c47994a6aac4f10fae5d0a2d8e84b188b8e09b04a0","observation_id":"6fccc0d0-f496-408b-aa8e-b062405847ae","resolution":{"observed_at":"2026-08-04T10:57:43.626012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06104","last_updated":"2024-06-18T09:16:14Z","snapshot_observed_at":"2026-08-07T11:50:21.011836Z","submitted_at":"2024-01-11T18:35:26Z","title":"Transformers are Multi-State RNNs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06104","snapshot_observed_at":"2026-08-04T10:57:43.739935Z","title":"Transformers are multi- state rnns.arXiv preprint arXiv:2401.06104,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.07651","last_updated":"2026-05-28T18:28:06Z","snapshot_observed_at":"2026-08-04T10:57:42.002395Z","submitted_at":"2025-10-09T00:58:28Z","title":"OBCache: Optimal Brain KV Cache Pruning for Efficient Long-Context LLM Inference","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T10:57:43.739935Z"},"links":{"cited_paper":"/paper/2401.06104","citing_paper":"/paper/2510.07651"},"observation_digest":"sha256:fcc51c5c62aa59ec961cc0bd713c4b94b33c49e0a6cc75ad2709e08079d6da6c","observation_id":"0da759d6-e3a3-47f4-8bed-dee80839d12a","resolution":{"observed_at":"2026-08-04T10:57:43.739935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12950","last_updated":"2024-01-31T19:47:26Z","snapshot_observed_at":"2026-07-06T16:10:07.931347Z","submitted_at":"2023-08-24T17:39:13Z","title":"Code Llama: Open Foundation Models for Code","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12950","snapshot_observed_at":"2026-08-04T10:57:43.957435Z","title":"Code llama: Open foundation models for code.arXiv preprint arXiv:2308.12950,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.07651","last_updated":"2026-05-28T18:28:06Z","snapshot_observed_at":"2026-08-04T10:57:42.002395Z","submitted_at":"2025-10-09T00:58:28Z","title":"OBCache: Optimal Brain KV Cache Pruning for Efficient Long-Context LLM Inference","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T10:57:43.957435Z"},"links":{"cited_paper":"/paper/2308.12950","citing_paper":"/paper/2510.07651"},"observation_digest":"sha256:d03506a2d30f49e38d041a59ceea506106a7a883b47bf5665b8df6c581499381","observation_id":"c9beb50c-1ef1-486c-aab2-5730030b5a4b","resolution":{"observed_at":"2026-08-04T10:57:43.957435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-04T10:57:44.070569Z","title":"Llama: Open and efficient foundation language models.arXiv preprint arXiv:2302.13971, 2023a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.07651","last_updated":"2026-05-28T18:28:06Z","snapshot_observed_at":"2026-08-04T10:57:42.002395Z","submitted_at":"2025-10-09T00:58:28Z","title":"OBCache: Optimal Brain KV Cache Pruning for Efficient Long-Context LLM Inference","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T10:57:44.070569Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2510.07651"},"observation_digest":"sha256:805aff7638ed03bee4bc7caa3fa6c305ba696d0553b154c0ceaf78e9f9427427","observation_id":"4aa486f3-a59e-4e2b-9ed7-5fd3f474efd7","resolution":{"observed_at":"2026-08-04T10:57:44.070569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:57:44.336299Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.07651","last_updated":"2026-05-28T18:28:06Z","snapshot_observed_at":"2026-08-04T10:57:42.002395Z","submitted_at":"2025-10-09T00:58:28Z","title":"OBCache: Optimal Brain KV Cache Pruning for Efficient Long-Context LLM Inference","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T10:57:44.336299Z"},"links":{"citing_paper":"/paper/2510.07651"},"observation_digest":"sha256:46ef7dc3cd929437d6c81a7ce22713e1349eaca17c35253e20a276c09b515eed","observation_id":"5f6ffa20-de3a-4f7c-b2aa-542b49f58d15","resolution":{"observed_at":"2026-08-04T10:57:44.336299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:57:44.427450Z","title":"Task-specific evaluation metrics (e.g., Exact Match/F1 for QA tasks, ROUGE for summarization tasks) are re- ported using LongBench’s official evaluation script3","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.07651","last_updated":"2026-05-28T18:28:06Z","snapshot_observed_at":"2026-08-04T10:57:42.002395Z","submitted_at":"2025-10-09T00:58:28Z","title":"OBCache: Optimal Brain KV Cache Pruning for Efficient Long-Context LLM Inference","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T10:57:44.427450Z"},"links":{"citing_paper":"/paper/2510.07651"},"observation_digest":"sha256:ea6898ad710536ed97fba676b9592417921ddf342831f6c723bf14bfc7318c72","observation_id":"bb5cb6f7-5a78-4f87-973b-cf7cacc05b40","resolution":{"observed_at":"2026-08-04T10:57:44.427450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:57:44.476767Z","title":"All eviction methods are evaluated with a fixed 1024-token cache budget","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.07651","last_updated":"2026-05-28T18:28:06Z","snapshot_observed_at":"2026-08-04T10:57:42.002395Z","submitted_at":"2025-10-09T00:58:28Z","title":"OBCache: Optimal Brain KV Cache Pruning for Efficient Long-Context LLM Inference","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T10:57:44.476767Z"},"links":{"citing_paper":"/paper/2510.07651"},"observation_digest":"sha256:076d0e684f7fff71552b3e5b03ea20f550463931668557b606c2be4590cc77e8","observation_id":"15003227-2cf3-436d-a8e9-81b665cdc891","resolution":{"observed_at":"2026-08-04T10:57:44.476767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:57:44.554457Z","title":null,"venue":null,"work_id":null,"year":1944},"citing_paper":{"arxiv_id":"2510.07651","last_updated":"2026-05-28T18:28:06Z","snapshot_observed_at":"2026-08-04T10:57:42.002395Z","submitted_at":"2025-10-09T00:58:28Z","title":"OBCache: Optimal Brain KV Cache Pruning for Efficient Long-Context LLM Inference","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T10:57:44.554457Z"},"links":{"citing_paper":"/paper/2510.07651"},"observation_digest":"sha256:8f07e70fc88cf965702d0b64c9efe76a23f89347be0d57691bb377bbbad2305b","observation_id":"50848417-4499-4d46-be35-52a4545ff997","resolution":{"observed_at":"2026-08-04T10:57:44.554457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-04T10:57:43.388072Z","title":"Ruler: What’s the real context size of your long-context language models?arXiv preprint arXiv:2404.06654,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.07651","last_updated":"2026-05-28T18:28:06Z","snapshot_observed_at":"2026-08-04T10:57:42.002395Z","submitted_at":"2025-10-09T00:58:28Z","title":"OBCache: Optimal Brain KV Cache Pruning for Efficient Long-Context LLM Inference","version":2},"reference_index":1992,"source":"pdf_text","source_observed_at":"2026-08-04T10:57:43.388072Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2510.07651"},"observation_digest":"sha256:17ae0beec77fb4d40fe8f449a2f398857cfc76a57c9eb0362eb4cd88cd663a75","observation_id":"5e24562f-9ff6-4b16-9c8f-fc0e680c0989","resolution":{"observed_at":"2026-08-04T10:57:43.388072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.05507","snapshot_observed_at":"2026-08-04T10:57:43.845157Z","title":"Compressive transformers for long-range sequence modelling.arXiv preprint arXiv:1911.05507,","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2510.07651","last_updated":"2026-05-28T18:28:06Z","snapshot_observed_at":"2026-08-04T10:57:42.002395Z","submitted_at":"2025-10-09T00:58:28Z","title":"OBCache: Optimal Brain KV Cache Pruning for Efficient Long-Context LLM Inference","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-04T10:57:43.845157Z"},"links":{"cited_paper":"/paper/1911.05507","citing_paper":"/paper/2510.07651"},"observation_digest":"sha256:fca7aaccbe9ae7bd8277dde961ef18615779764cf638b3afe972b0771037c886","observation_id":"3fafd378-c5e3-4f4c-8aea-981b1e5929ff","resolution":{"observed_at":"2026-08-04T10:57:43.845157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08691","last_updated":"2023-07-17T17:50:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-17T17:50:36Z","title":"FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08691","snapshot_observed_at":"2026-08-04T10:57:43.165745Z","title":"Flashattention-2: Faster attention with better parallelism and work partitioning.arXiv preprint arXiv:2307.08691,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.07651","last_updated":"2026-05-28T18:28:06Z","snapshot_observed_at":"2026-08-04T10:57:42.002395Z","submitted_at":"2025-10-09T00:58:28Z","title":"OBCache: Optimal Brain KV Cache Pruning for Efficient Long-Context LLM Inference","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-04T10:57:43.165745Z"},"links":{"cited_paper":"/paper/2307.08691","citing_paper":"/paper/2510.07651"},"observation_digest":"sha256:cc006ce56ce05766442065b113306aa5cb1b16b0d1319d4be0d53c58759f6c28","observation_id":"e6381fab-c13e-4ae1-afc0-450ed921c73e","resolution":{"observed_at":"2026-08-04T10:57:43.165745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06984","last_updated":"2023-07-06T18:52:08Z","snapshot_observed_at":"2026-08-07T09:17:00.780341Z","submitted_at":"2023-05-11T17:14:33Z","title":"Evaluating Open-Domain Question Answering in the Era of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06984","snapshot_observed_at":"2026-08-04T10:57:43.507915Z","title":"Evaluating open-domain question answering in the era of large language models.arXiv preprint arXiv:2305.06984,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.07651","last_updated":"2026-05-28T18:28:06Z","snapshot_observed_at":"2026-08-04T10:57:42.002395Z","submitted_at":"2025-10-09T00:58:28Z","title":"OBCache: Optimal Brain KV Cache Pruning for Efficient Long-Context LLM Inference","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-04T10:57:43.507915Z"},"links":{"cited_paper":"/paper/2305.06984","citing_paper":"/paper/2510.07651"},"observation_digest":"sha256:4cabd5b16a125a4d5edae4aedad907df62a6ba8075d2e66e06f988a8c41e2e84","observation_id":"0e88f5d3-3700-40e5-80ad-3f88f9bff7bf","resolution":{"observed_at":"2026-08-04T10:57:43.507915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:57:44.194526Z","title":"Transformers: State-of-the-art natural language processing","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2510.07651","last_updated":"2026-05-28T18:28:06Z","snapshot_observed_at":"2026-08-04T10:57:42.002395Z","submitted_at":"2025-10-09T00:58:28Z","title":"OBCache: Optimal Brain KV Cache Pruning for Efficient Long-Context LLM Inference","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-04T10:57:44.194526Z"},"links":{"citing_paper":"/paper/2510.07651"},"observation_digest":"sha256:d8f907de30b26eccbca86f7cf35f1dce56e35b2923495752e08566b371b05a85","observation_id":"b280c9da-d9b7-4e5e-8bf7-e2c4f0a1cbf2","resolution":{"observed_at":"2026-08-04T10:57:44.194526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2510.07651","last_updated":"2026-05-28T18:28:06Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-04T10:57:42.002395Z","submitted_at":"2025-10-09T00:58:28Z","title":"OBCache: Optimal Brain KV Cache Pruning for Efficient Long-Context LLM Inference"},"reference_resolution":{"displayed":15,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":15,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":15},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 15 of 15 outbound references and 3 inbound Pith citation observations for arXiv:2510.07651."}