{"as_of":"2026-08-08T18:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:dd91cb24eb26aa49ed1ca174b2a5342e441159c00ae4a013b43c9f3e7ce83b86","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":9,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":9,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":9,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":9,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:03:52.186188Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T15:08:33.737665Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2409.04992","last_updated":"2024-09-08T06:06:44Z","snapshot_observed_at":"2026-08-03T16:41:00.102590Z","submitted_at":"2024-09-08T06:06:44Z","title":"InstInfer: In-Storage Attention Offloading for Cost-Effective Long-Context LLM Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.04992","snapshot_observed_at":"2026-08-07T15:03:52.186188Z","title":"Instinfer: In-storage attention offloading for cost-effective long-context llm inference,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16502","last_updated":"2025-05-24T04:40:44Z","snapshot_observed_at":"2026-08-07T14:57:30.728147Z","submitted_at":"2025-05-22T10:36:05Z","title":"Recursive Offloading for LLM Serving in Multi-tier Networks","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T15:03:52.186188Z"},"links":{"cited_paper":"/paper/2409.04992","citing_paper":"/paper/2505.16502"},"observation_digest":"sha256:66055da898f6f9c34676d106d3231dae868d7ae2d6d96102893565e6936404e7","observation_id":"3cc82a1b-c19a-45d0-89b6-ae7e0ea360c1","resolution":{"observed_at":"2026-08-07T15:03:52.186188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.04992","last_updated":"2024-09-08T06:06:44Z","snapshot_observed_at":"2026-08-03T16:41:00.102590Z","submitted_at":"2024-09-08T06:06:44Z","title":"InstInfer: In-Storage Attention Offloading for Cost-Effective Long-Context LLM Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.04992","snapshot_observed_at":"2026-08-06T23:00:11.154210Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.20187","last_updated":"2025-07-02T05:12:29Z","snapshot_observed_at":"2026-08-07T20:42:38.846597Z","submitted_at":"2025-06-25T07:26:42Z","title":"Breaking the Boundaries of Long-Context LLM Inference: Adaptive KV Management on a Single Commodity GPU","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T23:00:11.154210Z"},"links":{"cited_paper":"/paper/2409.04992","citing_paper":"/paper/2506.20187"},"observation_digest":"sha256:93f70260d45a21286c7e9c69063d47f32258a5d2a5ed1924b7f2210143820da1","observation_id":"ce740891-810a-48c2-b92e-2e3cb7a9f7f1","resolution":{"observed_at":"2026-08-06T23:00:11.154210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.04992","last_updated":"2024-09-08T06:06:44Z","snapshot_observed_at":"2026-08-03T16:41:00.102590Z","submitted_at":"2024-09-08T06:06:44Z","title":"InstInfer: In-Storage Attention Offloading for Cost-Effective Long-Context LLM Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.04992","snapshot_observed_at":"2026-08-06T20:23:08.996865Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.03153","last_updated":"2025-07-03T20:20:33Z","snapshot_observed_at":"2026-08-07T13:11:43.542936Z","submitted_at":"2025-07-03T20:20:33Z","title":"HGCA: Hybrid GPU-CPU Attention for Long Context LLM Inference","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T20:23:08.996865Z"},"links":{"cited_paper":"/paper/2409.04992","citing_paper":"/paper/2507.03153"},"observation_digest":"sha256:94adec27989343820dea3fd8772ca70bcfe20c97123181b921becf6094f37558","observation_id":"a6a83586-5834-405a-a6b6-f5e81933883a","resolution":{"observed_at":"2026-08-06T20:23:08.996865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.04992","last_updated":"2024-09-08T06:06:44Z","snapshot_observed_at":"2026-08-03T16:41:00.102590Z","submitted_at":"2024-09-08T06:06:44Z","title":"InstInfer: In-Storage Attention Offloading for Cost-Effective Long-Context LLM Inference","version":1},"cited_work":{"arxiv_id":"2409.04992","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.04992","snapshot_observed_at":"2026-07-03T15:08:33.737665Z","title":"Instinfer: In-storage at- tention offloading for cost-effective long-context llm inference","venue":null,"work_id":"fe50b7f0-ebe7-4b19-a1f6-3acb32599f28","year":2024},"citing_paper":{"arxiv_id":"2602.09725","last_updated":"2026-05-12T14:12:11Z","snapshot_observed_at":"2026-07-06T22:45:15.978102Z","submitted_at":"2026-02-10T12:29:02Z","title":"Efficient Remote KV Cache Reuse with GPU-native Video Codec","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-16T05:21:04.555356Z"},"links":{"cited_paper":"/paper/2409.04992","citing_paper":"/paper/2602.09725"},"observation_digest":"sha256:b59445b02588a999d0e50c7aa3799350f7da1f255701770a0a3aa73f1315aa24","observation_id":"da8dd679-23b6-47f7-b5a0-7e1daeef5325","resolution":{"observed_at":"2026-05-16T05:22:22.775393Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.04992","last_updated":"2024-09-08T06:06:44Z","snapshot_observed_at":"2026-08-03T16:41:00.102590Z","submitted_at":"2024-09-08T06:06:44Z","title":"InstInfer: In-Storage Attention Offloading for Cost-Effective Long-Context LLM Inference","version":1},"cited_work":{"arxiv_id":"2409.04992","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.04992","snapshot_observed_at":"2026-07-03T15:08:33.737665Z","title":"Instinfer: In-storage at- tention offloading for cost-effective long-context llm inference","venue":null,"work_id":"fe50b7f0-ebe7-4b19-a1f6-3acb32599f28","year":2024},"citing_paper":{"arxiv_id":"2604.16883","last_updated":"2026-04-18T07:23:22Z","snapshot_observed_at":"2026-08-03T01:53:31.909118Z","submitted_at":"2026-04-18T07:23:22Z","title":"SinkRouter: Sink-Aware Routing for Efficient Long-Context Decoding in Large Language and Multimodal Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-10T07:56:05.583390Z"},"links":{"cited_paper":"/paper/2409.04992","citing_paper":"/paper/2604.16883"},"observation_digest":"sha256:7be9eb698d16c195e784352344c2a61133c403ddd59f35d4efa5366166749f81","observation_id":"7c106dcc-4808-49d2-8e4d-bcfd094ef7bf","resolution":{"observed_at":"2026-05-10T07:57:15.446640Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.04992","last_updated":"2024-09-08T06:06:44Z","snapshot_observed_at":"2026-08-03T16:41:00.102590Z","submitted_at":"2024-09-08T06:06:44Z","title":"InstInfer: In-Storage Attention Offloading for Cost-Effective Long-Context LLM Inference","version":1},"cited_work":{"arxiv_id":"2409.04992","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.04992","snapshot_observed_at":"2026-07-03T15:08:33.737665Z","title":"Instinfer: In-storage at- tention offloading for cost-effective long-context llm inference","venue":null,"work_id":"fe50b7f0-ebe7-4b19-a1f6-3acb32599f28","year":2024},"citing_paper":{"arxiv_id":"2604.21026","last_updated":"2026-04-24T07:54:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-22T19:18:30Z","title":"MCAP: Deployment-Time Layer Profiling for Memory-Constrained LLM Inference","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T00:54:33.897112Z"},"links":{"cited_paper":"/paper/2409.04992","citing_paper":"/paper/2604.21026"},"observation_digest":"sha256:14743982ab1af435435c5fe4c3cbee137a3f5979c3e90a54cf058c85ee220049","observation_id":"5cbaa4b8-62c4-4477-b3ba-0b73e4df97db","resolution":{"observed_at":"2026-05-10T00:54:48.398544Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.04992","last_updated":"2024-09-08T06:06:44Z","snapshot_observed_at":"2026-08-03T16:41:00.102590Z","submitted_at":"2024-09-08T06:06:44Z","title":"InstInfer: In-Storage Attention Offloading for Cost-Effective Long-Context LLM Inference","version":1},"cited_work":{"arxiv_id":"2409.04992","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.04992","snapshot_observed_at":"2026-07-03T15:08:33.737665Z","title":"Instinfer: In-storage at- tention offloading for cost-effective long-context llm inference","venue":null,"work_id":"fe50b7f0-ebe7-4b19-a1f6-3acb32599f28","year":2024},"citing_paper":{"arxiv_id":"2604.26557","last_updated":"2026-04-29T11:44:35Z","snapshot_observed_at":"2026-08-04T05:23:57.478922Z","submitted_at":"2026-04-29T11:44:35Z","title":"DUAL-BLADE: Dual-Path NVMe-Direct KV-Cache Offloading for Edge LLM Inference","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-07T12:51:42.916410Z"},"links":{"cited_paper":"/paper/2409.04992","citing_paper":"/paper/2604.26557"},"observation_digest":"sha256:ab61ebe255cef7de9bf93afe91e250263063d4925bd585865bda3830d61969d3","observation_id":"d7d8662d-d962-417a-9f9e-fac135a34a56","resolution":{"observed_at":"2026-05-12T09:06:26.525019Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.04992","last_updated":"2024-09-08T06:06:44Z","snapshot_observed_at":"2026-08-03T16:41:00.102590Z","submitted_at":"2024-09-08T06:06:44Z","title":"InstInfer: In-Storage Attention Offloading for Cost-Effective Long-Context LLM Inference","version":1},"cited_work":{"arxiv_id":"2409.04992","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.04992","snapshot_observed_at":"2026-07-03T15:08:33.737665Z","title":"Instinfer: In-storage at- tention offloading for cost-effective long-context llm inference","venue":null,"work_id":"fe50b7f0-ebe7-4b19-a1f6-3acb32599f28","year":2024},"citing_paper":{"arxiv_id":"2606.13361","last_updated":"2026-06-11T13:47:33Z","snapshot_observed_at":"2026-08-05T05:26:01.117784Z","submitted_at":"2026-06-11T13:47:33Z","title":"Can I Buy Your KV Cache?","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-27T06:37:39.592571Z"},"links":{"cited_paper":"/paper/2409.04992","citing_paper":"/paper/2606.13361"},"observation_digest":"sha256:fc9975692ab0646f238a6ffdf6fefcfd2ca20f70370411a8775637906c16d80a","observation_id":"e031f882-aef6-4d03-8ef2-204c5f93705c","resolution":{"observed_at":"2026-07-03T15:08:33.739576Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.04992","last_updated":"2024-09-08T06:06:44Z","snapshot_observed_at":"2026-08-03T16:41:00.102590Z","submitted_at":"2024-09-08T06:06:44Z","title":"InstInfer: In-Storage Attention Offloading for Cost-Effective Long-Context LLM Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.04992","snapshot_observed_at":"2026-08-01T12:00:24.365208Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26633","last_updated":"2026-07-29T08:58:04Z","snapshot_observed_at":"2026-08-07T13:12:18.376857Z","submitted_at":"2026-07-29T08:58:04Z","title":"NELSSA: A GPU-PNM Heterogeneous System for Mixed-Length LLM Serving via Length-based Request Placement","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-01T12:00:24.365208Z"},"links":{"cited_paper":"/paper/2409.04992","citing_paper":"/paper/2607.26633"},"observation_digest":"sha256:0169f9a3c66a4d21b54a5f14d5130330a71b4bd537be3a9b189ad2ad757cabbe","observation_id":"36d558ef-bfc5-44bc-88d3-b2e0487f09cd","resolution":{"observed_at":"2026-08-01T12:00:24.365208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2409.04992/citation-record","integrity":"/paper/2409.04992/integrity","json":"/paper/2409.04992/citation-record.json","paper":"/paper/2409.04992"},"outbound":[],"paper":{"arxiv_id":"2409.04992","last_updated":"2024-09-08T06:06:44Z","latest_version":1,"primary_category":"cs.AR","snapshot_observed_at":"2026-08-03T16:41:00.102590Z","submitted_at":"2024-09-08T06:06:44Z","title":"InstInfer: In-Storage Attention Offloading for Cost-Effective Long-Context LLM Inference"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 9 inbound Pith citation observations for arXiv:2409.04992."}