{"as_of":"2026-07-23T07:46:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f9d1d3be4e5a17252681f83f9e32c34a617c90ea1b61d1be1b1c2a2291a8b416","coverage":[{"denominator":47,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":47,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-07T12:51:42.916410Z","state":"measured"},{"denominator":47,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":47,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-07-23T06:31:01.910684+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2604.26557/citation-record","integrity":"/paper/2604.26557/integrity","json":"/paper/2604.26557/citation-record.json","paper":"/paper/2604.26557"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A review on edge large language models: Design, execution, and applications","venue":null,"work_id":"77e89c8c-0882-4545-a8ff-423b1c68dae5","year":2025},"citing_paper":{"arxiv_id":"2604.26557","last_updated":"2026-04-29T11:44:35Z","snapshot_observed_at":"2026-07-06T23:12:10.599132Z","submitted_at":"2026-04-29T11:44:35Z","title":"DUAL-BLADE: Dual-Path NVMe-Direct KV-Cache Offloading for Edge LLM Inference","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-07T12:51:42.916410Z"},"links":{"citing_paper":"/paper/2604.26557"},"observation_digest":"sha256:986d5424b7b232e0eab86c06f27735896b4c5be49216aaf84413e0d28baff3e4","observation_id":"970792c5-a738-409a-9064-a5ae51dc645e","resolution":{"observed_at":"2026-05-27T06:18:52.794640Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.18101","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T12:48:11.774241Z","title":"A cost-benefit analysis of on-premise large language model deployment: Breaking even with commercial llm services","venue":null,"work_id":"ec9b28a5-09f9-4a33-bf11-dd1a9a0ad1b3","year":2025},"citing_paper":{"arxiv_id":"2604.26557","last_updated":"2026-04-29T11:44:35Z","snapshot_observed_at":"2026-07-06T23:12:10.599132Z","submitted_at":"2026-04-29T11:44:35Z","title":"DUAL-BLADE: Dual-Path NVMe-Direct KV-Cache Offloading for Edge LLM Inference","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-07T12:51:42.916410Z"},"links":{"citing_paper":"/paper/2604.26557"},"observation_digest":"sha256:bd0e344f4951f44411e2a9fedab9195b8096eddf7ff88992ecb51b038cf2c97a","observation_id":"c965984f-a1ad-4e57-a157-162a1cb06049","resolution":{"observed_at":"2026-05-12T09:06:26.539616Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mobilellm: Optimizing sub- billion parameter language models for on-device use cases","venue":null,"work_id":"4089ef5f-042a-4d93-8c41-df2013059ed2","year":2024},"citing_paper":{"arxiv_id":"2604.26557","last_updated":"2026-04-29T11:44:35Z","snapshot_observed_at":"2026-07-06T23:12:10.599132Z","submitted_at":"2026-04-29T11:44:35Z","title":"DUAL-BLADE: Dual-Path NVMe-Direct KV-Cache Offloading for Edge LLM Inference","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-07T12:51:42.916410Z"},"links":{"citing_paper":"/paper/2604.26557"},"observation_digest":"sha256:2775b546018953de6f06121de64162531dd06e3a096eb663ad9faf14f40aaa67","observation_id":"a1a76803-32f5-49ac-80d3-f628cebb426b","resolution":{"observed_at":"2026-05-27T06:18:52.807121Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Intelligent data analysis in edge com- puting with large language models: applications, challenges, and future directions","venue":null,"work_id":"b95cec54-ed8f-4bf4-a009-db2d9ed0f579","year":2025},"citing_paper":{"arxiv_id":"2604.26557","last_updated":"2026-04-29T11:44:35Z","snapshot_observed_at":"2026-07-06T23:12:10.599132Z","submitted_at":"2026-04-29T11:44:35Z","title":"DUAL-BLADE: Dual-Path NVMe-Direct KV-Cache Offloading for Edge LLM Inference","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-07T12:51:42.916410Z"},"links":{"citing_paper":"/paper/2604.26557"},"observation_digest":"sha256:28c5051c29304fb505abc696147f9e280bd147780f902f5866ebe0ba8db1de96","observation_id":"4062ded4-711d-4bce-9eec-330733d03515","resolution":{"observed_at":"2026-05-27T06:18:52.849755Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"CUDA Programming Guide: Unified and system mem- ory","venue":null,"work_id":"a2f5da5d-cbe7-428b-ad2b-c75689f23a38","year":2025},"citing_paper":{"arxiv_id":"2604.26557","last_updated":"2026-04-29T11:44:35Z","snapshot_observed_at":"2026-07-06T23:12:10.599132Z","submitted_at":"2026-04-29T11:44:35Z","title":"DUAL-BLADE: Dual-Path NVMe-Direct KV-Cache Offloading for Edge LLM Inference","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-07T12:51:42.916410Z"},"links":{"citing_paper":"/paper/2604.26557"},"observation_digest":"sha256:101b3395d6558f00e4259f70066441d440f474c97a4c2aa844f63914bcdd509a","observation_id":"8e0d5816-a7a6-4150-a1b8-fdf121bbd6b7","resolution":{"observed_at":"2026-05-27T06:18:52.812880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08295","last_updated":"2024-04-16T12:52:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-13T06:59:16Z","title":"Gemma: Open Models Based on Gemini Research and Technology","version":4},"cited_work":{"arxiv_id":"2403.08295","doi":"10.48550/arxiv.2403.08295","metadata_source":"pith","pith_arxiv_id":"2403.08295","snapshot_observed_at":"2026-07-10T23:07:48.332027Z","title":"Gemma: Open Models Based on Gemini Research and Technology","venue":"cs.CL","work_id":"a9ea2870-df28-40b8-a9e0-a7e9a116f793","year":2024},"citing_paper":{"arxiv_id":"2604.26557","last_updated":"2026-04-29T11:44:35Z","snapshot_observed_at":"2026-07-06T23:12:10.599132Z","submitted_at":"2026-04-29T11:44:35Z","title":"DUAL-BLADE: Dual-Path NVMe-Direct KV-Cache Offloading for Edge LLM Inference","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-07T12:51:42.916410Z"},"links":{"cited_paper":"/paper/2403.08295","citing_paper":"/paper/2604.26557"},"observation_digest":"sha256:82051bae5959422caaa08d11502c98af31ebb89fc28c2d6500038619bb8d68c6","observation_id":"e291abe5-5b35-4b7e-8632-c55e2bccfee0","resolution":{"observed_at":"2026-05-12T09:06:26.510120Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":"2310.06825","doi":"10.48550/arxiv.2310.06825","metadata_source":"pith","pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-07-10T14:47:14.537301Z","title":"Mistral 7B","venue":"cs.CL","work_id":"eb5e1305-ad11-4875-ad8d-ad8b8f697599","year":2023},"citing_paper":{"arxiv_id":"2604.26557","last_updated":"2026-04-29T11:44:35Z","snapshot_observed_at":"2026-07-06T23:12:10.599132Z","submitted_at":"2026-04-29T11:44:35Z","title":"DUAL-BLADE: Dual-Path NVMe-Direct KV-Cache Offloading for Edge LLM Inference","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-07T12:51:42.916410Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2604.26557"},"observation_digest":"sha256:831bd9ace39b555d72501c44843a4136a5460f43f728f14e51f4c5ecdeaa8709","observation_id":"07c1500e-e8c4-43e7-9dd3-c1f0bafc4a74","resolution":{"observed_at":"2026-05-12T09:06:26.529461Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-11T05:19:23.48574+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T05:19:23.48574+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":"2407.21783","doi":"10.1016/s0749-0720(15","metadata_source":"pith","pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"The Llama 3 Herd of Models","venue":"cs.AI","work_id":"1549a635-88af-4ac1-acfe-51ae7bb53345","year":2024},"citing_paper":{"arxiv_id":"2604.26557","last_updated":"2026-04-29T11:44:35Z","snapshot_observed_at":"2026-07-06T23:12:10.599132Z","submitted_at":"2026-04-29T11:44:35Z","title":"DUAL-BLADE: Dual-Path NVMe-Direct KV-Cache Offloading for Edge LLM Inference","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-07T12:51:42.916410Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2604.26557"},"observation_digest":"sha256:f78ea568c6fc6f78ea5f57888f06ff0832d27e7461da7b5e171172882a013e97","observation_id":"533b9f04-6e59-4be0-ad72-2d35bf5d5362","resolution":{"observed_at":"2026-05-12T09:06:26.534152Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Longreward: Improving long-context large language models with ai feedback","venue":null,"work_id":"d918211c-2ad1-4dbd-8566-19e361bb9d3d","year":2025},"citing_paper":{"arxiv_id":"2604.26557","last_updated":"2026-04-29T11:44:35Z","snapshot_observed_at":"2026-07-06T23:12:10.599132Z","submitted_at":"2026-04-29T11:44:35Z","title":"DUAL-BLADE: Dual-Path NVMe-Direct KV-Cache Offloading for Edge LLM Inference","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-07T12:51:42.916410Z"},"links":{"citing_paper":"/paper/2604.26557"},"observation_digest":"sha256:26fade05173ffd816963b86b7cade66b62ce82c4ecb1f865f4f04ba12115305b","observation_id":"c5bdda9d-dcf2-4b01-987c-f77ddc87440a","resolution":{"observed_at":"2026-05-27T06:18:52.789106Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Longbench: A bilingual, multitask benchmark for long context understanding","venue":null,"work_id":"8cc0811a-fd86-47d7-b533-c99dd2cb5759","year":2024},"citing_paper":{"arxiv_id":"2604.26557","last_updated":"2026-04-29T11:44:35Z","snapshot_observed_at":"2026-07-06T23:12:10.599132Z","submitted_at":"2026-04-29T11:44:35Z","title":"DUAL-BLADE: Dual-Path NVMe-Direct KV-Cache Offloading for Edge LLM Inference","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-07T12:51:42.916410Z"},"links":{"citing_paper":"/paper/2604.26557"},"observation_digest":"sha256:2b1dff50816667e107caba46b6eb83ac6ee343a949af5c13fb575717664fb762","observation_id":"d3203377-fd91-4f8f-a5c5-e1cf4399bf01","resolution":{"observed_at":"2026-05-27T06:18:52.791735Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual instruction tuning","venue":null,"work_id":"bfc73ba8-e84c-4e94-92aa-51b7d879ecb9","year":2023},"citing_paper":{"arxiv_id":"2604.26557","last_updated":"2026-04-29T11:44:35Z","snapshot_observed_at":"2026-07-06T23:12:10.599132Z","submitted_at":"2026-04-29T11:44:35Z","title":"DUAL-BLADE: Dual-Path NVMe-Direct KV-Cache Offloading for Edge LLM Inference","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-07T12:51:42.916410Z"},"links":{"citing_paper":"/paper/2604.26557"},"observation_digest":"sha256:a5cd849b96ce3bb38e51e6265af3977068fea79ea077cd548d6d32b518625946","observation_id":"2eaf2ecb-bfb9-4d1a-8d40-a4c5fdc1d73f","resolution":{"observed_at":"2026-05-27T06:18:52.797731Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Logparser-llm: Advancing efficient log parsing with large language models","venue":null,"work_id":"1ca4d29b-71ea-4437-bc0e-1dc0579ce392","year":2024},"citing_paper":{"arxiv_id":"2604.26557","last_updated":"2026-04-29T11:44:35Z","snapshot_observed_at":"2026-07-06T23:12:10.599132Z","submitted_at":"2026-04-29T11:44:35Z","title":"DUAL-BLADE: Dual-Path NVMe-Direct KV-Cache Offloading for Edge LLM Inference","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-07T12:51:42.916410Z"},"links":{"citing_paper":"/paper/2604.26557"},"observation_digest":"sha256:5badce1b7bfce05bfa6069e38c5c782b0bd15dad260d8424d913638fca98f904","observation_id":"6c880d7d-283e-4f27-b180-0826a8a0e2a2","resolution":{"observed_at":"2026-05-27T06:18:52.800615Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deepspeed-inference: enabling efficient inference of transformer models at unprecedented scale","venue":null,"work_id":"cea6c28a-2b72-473f-a945-147ded080221","year":2022},"citing_paper":{"arxiv_id":"2604.26557","last_updated":"2026-04-29T11:44:35Z","snapshot_observed_at":"2026-07-06T23:12:10.599132Z","submitted_at":"2026-04-29T11:44:35Z","title":"DUAL-BLADE: Dual-Path NVMe-Direct KV-Cache Offloading for Edge LLM Inference","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-07T12:51:42.916410Z"},"links":{"citing_paper":"/paper/2604.26557"},"observation_digest":"sha256:f52c877565f2fa852d650d214a67a4436d9c4c39f59c584cf322592e8a7c8dec","observation_id":"e62b4a2f-4854-40bc-bc4a-af8a0e903e06","resolution":{"observed_at":"2026-05-27T06:18:52.786627Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Flexgen: High-throughput generative inference of large language models with a single gpu","venue":null,"work_id":"919c5fa2-2a85-4519-97aa-3a0cba964897","year":2023},"citing_paper":{"arxiv_id":"2604.26557","last_updated":"2026-04-29T11:44:35Z","snapshot_observed_at":"2026-07-06T23:12:10.599132Z","submitted_at":"2026-04-29T11:44:35Z","title":"DUAL-BLADE: Dual-Path NVMe-Direct KV-Cache Offloading for Edge LLM Inference","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-07T12:51:42.916410Z"},"links":{"citing_paper":"/paper/2604.26557"},"observation_digest":"sha256:dd4053b68856428f8d08254e386e5f928b53fbfaddc5aac6540298b1673133ac","observation_id":"28a86021-209b-497e-9c4f-09325b8bb454","resolution":{"observed_at":"2026-05-27T06:18:52.784026Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T14:07:06.849417Z","title":"Attention is all you need","venue":null,"work_id":"4f585692-8ef8-4f20-8f75-5e0e32647d76","year":2017},"citing_paper":{"arxiv_id":"2604.26557","last_updated":"2026-04-29T11:44:35Z","snapshot_observed_at":"2026-07-06T23:12:10.599132Z","submitted_at":"2026-04-29T11:44:35Z","title":"DUAL-BLADE: Dual-Path NVMe-Direct KV-Cache Offloading for Edge LLM Inference","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-07T12:51:42.916410Z"},"links":{"citing_paper":"/paper/2604.26557"},"observation_digest":"sha256:52e1cae7272ff9e138909566c7f01e5d9d726022a52bee0450c2f770ee43f78f","observation_id":"72fbe47a-cf7f-4b87-b2d7-43e486ba1424","resolution":{"observed_at":"2026-05-27T06:18:52.844599Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Infinigen: Efficient generative inference of large language models with dynamic kv cache manage- ment","venue":null,"work_id":"42ae8f18-d98a-4f52-a9df-861f0a5e2fcc","year":2024},"citing_paper":{"arxiv_id":"2604.26557","last_updated":"2026-04-29T11:44:35Z","snapshot_observed_at":"2026-07-06T23:12:10.599132Z","submitted_at":"2026-04-29T11:44:35Z","title":"DUAL-BLADE: Dual-Path NVMe-Direct KV-Cache Offloading for Edge LLM Inference","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-07T12:51:42.916410Z"},"links":{"citing_paper":"/paper/2604.26557"},"observation_digest":"sha256:7a9513e0cbab26890f4c81ea545c9770c7d6ffe65e1a78a10c861eab19e543e3","observation_id":"e0c86885-4aa6-4a0a-b7e9-a5f12923d31d","resolution":{"observed_at":"2026-05-27T06:18:52.818998Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"llama.cpp: Llm inference in c/c++","venue":null,"work_id":"07924bf1-4fa3-4f9b-9314-0a51fe3c0705","year":2023},"citing_paper":{"arxiv_id":"2604.26557","last_updated":"2026-04-29T11:44:35Z","snapshot_observed_at":"2026-07-06T23:12:10.599132Z","submitted_at":"2026-04-29T11:44:35Z","title":"DUAL-BLADE: Dual-Path NVMe-Direct KV-Cache Offloading for Edge LLM Inference","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-07T12:51:42.916410Z"},"links":{"citing_paper":"/paper/2604.26557"},"observation_digest":"sha256:e6e0e4234a215404ca405ba3408c0cfbe0053273198f53ff23d0ad0b775fe961","observation_id":"5099a91b-04ec-401b-b1d9-e180df3497e6","resolution":{"observed_at":"2026-05-27T06:18:52.815558Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.09665","doi":"10.48550/arxiv.2510.09665","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Lmcache: An efficient kv cache layer for enterprise-scale llm inference","venue":null,"work_id":"089b937e-f3f9-4525-a792-524ef0f7db1d","year":2025},"citing_paper":{"arxiv_id":"2604.26557","last_updated":"2026-04-29T11:44:35Z","snapshot_observed_at":"2026-07-06T23:12:10.599132Z","submitted_at":"2026-04-29T11:44:35Z","title":"DUAL-BLADE: Dual-Path NVMe-Direct KV-Cache Offloading for Edge LLM Inference","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-07T12:51:42.916410Z"},"links":{"citing_paper":"/paper/2604.26557"},"observation_digest":"sha256:b292e0bba4fab0dc835baff91e693409f3095d35316a49958344d752472d62b6","observation_id":"8a0e41bc-7d9d-4d9f-9699-3baf8cdd2671","resolution":{"observed_at":"2026-05-12T09:06:26.545204Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Powerinfer: Fast large language model serving with a consumer-grade gpu","venue":null,"work_id":"80bde891-3553-45b1-8e22-f54b87a71064","year":2024},"citing_paper":{"arxiv_id":"2604.26557","last_updated":"2026-04-29T11:44:35Z","snapshot_observed_at":"2026-07-06T23:12:10.599132Z","submitted_at":"2026-04-29T11:44:35Z","title":"DUAL-BLADE: Dual-Path NVMe-Direct KV-Cache Offloading for Edge LLM Inference","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-07T12:51:42.916410Z"},"links":{"citing_paper":"/paper/2604.26557"},"observation_digest":"sha256:51ce40da1ec71c04e823facc7298d8c204d1b13c03e01b65fb97bf75b659c3d4","observation_id":"b97e96bc-ce18-42c5-a622-a10245d5786b","resolution":{"observed_at":"2026-05-27T06:18:52.847092Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.11907","doi":"10.48550/arxiv.2511.11907","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"KVSwap: Disk-aware KV Cache Offloading for Long-Context On-device Inference","venue":null,"work_id":"60e2424f-0afb-4adb-b425-a384158e8c2e","year":2025},"citing_paper":{"arxiv_id":"2604.26557","last_updated":"2026-04-29T11:44:35Z","snapshot_observed_at":"2026-07-06T23:12:10.599132Z","submitted_at":"2026-04-29T11:44:35Z","title":"DUAL-BLADE: Dual-Path NVMe-Direct KV-Cache Offloading for Edge LLM Inference","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-07T12:51:42.916410Z"},"links":{"citing_paper":"/paper/2604.26557"},"observation_digest":"sha256:12ed3a69048047772810b0b57ed123051367e11a7206d69402f1cf5cfc651828","observation_id":"43f22c5d-b873-4d8e-ae59-6d1f52e518b7","resolution":{"observed_at":"2026-05-12T09:06:26.515079Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Llm in a flash: Efficient large language model inference with limited memory","venue":null,"work_id":"019467e5-a20e-46d9-a763-c35602031ffb","year":2024},"citing_paper":{"arxiv_id":"2604.26557","last_updated":"2026-04-29T11:44:35Z","snapshot_observed_at":"2026-07-06T23:12:10.599132Z","submitted_at":"2026-04-29T11:44:35Z","title":"DUAL-BLADE: Dual-Path NVMe-Direct KV-Cache Offloading for Edge LLM Inference","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-07T12:51:42.916410Z"},"links":{"citing_paper":"/paper/2604.26557"},"observation_digest":"sha256:1faf5d4495fb31871748a81d51604be9f0241dc3515f3a9bbd36057485034f3b","observation_id":"0e4f2afc-c9b7-4b6f-b6fe-f402d2781efe","resolution":{"observed_at":"2026-05-27T06:18:52.841912Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Designing a true direct-access file system with devfs","venue":null,"work_id":"01ff9cc2-a106-49be-b9b2-36b9da932e4e","year":2018},"citing_paper":{"arxiv_id":"2604.26557","last_updated":"2026-04-29T11:44:35Z","snapshot_observed_at":"2026-07-06T23:12:10.599132Z","submitted_at":"2026-04-29T11:44:35Z","title":"DUAL-BLADE: Dual-Path NVMe-Direct KV-Cache Offloading for Edge LLM Inference","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-07T12:51:42.916410Z"},"links":{"citing_paper":"/paper/2604.26557"},"observation_digest":"sha256:49df1f16fa9f8e62d581e78b18ce9624579b33f070de480b742acd4a2ec41ac9","observation_id":"939ef159-377f-4b61-9faa-77c20137241a","resolution":{"observed_at":"2026-05-27T06:18:52.769716Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Storage performance development kit (spdk)","venue":null,"work_id":"a3ba64b4-a02e-44c2-8654-c80525943dc1","year":null},"citing_paper":{"arxiv_id":"2604.26557","last_updated":"2026-04-29T11:44:35Z","snapshot_observed_at":"2026-07-06T23:12:10.599132Z","submitted_at":"2026-04-29T11:44:35Z","title":"DUAL-BLADE: Dual-Path NVMe-Direct KV-Cache Offloading for Edge LLM Inference","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-07T12:51:42.916410Z"},"links":{"citing_paper":"/paper/2604.26557"},"observation_digest":"sha256:2909223a9ac189b8e9e02b69aeee5b483a6ad6340af3ffa33305455c727f1eb3","observation_id":"8bbe7533-8e6a-4322-a812-bb99ce68b502","resolution":{"observed_at":"2026-05-27T06:18:52.766803Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"c286b8eb-0b6a-4ece-8967-b22aece6116d","year":2026},"citing_paper":{"arxiv_id":"2604.26557","last_updated":"2026-04-29T11:44:35Z","snapshot_observed_at":"2026-07-06T23:12:10.599132Z","submitted_at":"2026-04-29T11:44:35Z","title":"DUAL-BLADE: Dual-Path NVMe-Direct KV-Cache Offloading for Edge LLM Inference","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-07T12:51:42.916410Z"},"links":{"citing_paper":"/paper/2604.26557"},"observation_digest":"sha256:c72abe521549d87423ba3e382a1120258a9bdd895c83319e3b12f88f5b300bf7","observation_id":"6830ef55-1c88-42db-9a7c-19450044ef1b","resolution":{"observed_at":"2026-05-27T06:18:52.775565Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Flashshare: Punching through server storage stack from kernel to firmware for ultra-low latency ssds","venue":null,"work_id":"54da2657-5e84-4cdf-b1ab-c13b1db2cde6","year":2018},"citing_paper":{"arxiv_id":"2604.26557","last_updated":"2026-04-29T11:44:35Z","snapshot_observed_at":"2026-07-06T23:12:10.599132Z","submitted_at":"2026-04-29T11:44:35Z","title":"DUAL-BLADE: Dual-Path NVMe-Direct KV-Cache Offloading for Edge LLM Inference","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-07T12:51:42.916410Z"},"links":{"citing_paper":"/paper/2604.26557"},"observation_digest":"sha256:ba88b40e375c63a0a4171f3a8cd86b69317df6d3ce46c44ef13d2c0534f9c8b4","observation_id":"44b10cd0-9821-4a0d-9bff-1934176621b8","resolution":{"observed_at":"2026-05-27T06:18:52.760390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"I/o passthru: Upstreaming a flexible and efficient i/o path in linux","venue":null,"work_id":"da95900f-f1ab-4a7a-8d9b-79a38f554bbb","year":2024},"citing_paper":{"arxiv_id":"2604.26557","last_updated":"2026-04-29T11:44:35Z","snapshot_observed_at":"2026-07-06T23:12:10.599132Z","submitted_at":"2026-04-29T11:44:35Z","title":"DUAL-BLADE: Dual-Path NVMe-Direct KV-Cache Offloading for Edge LLM Inference","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-07T12:51:42.916410Z"},"links":{"citing_paper":"/paper/2604.26557"},"observation_digest":"sha256:a5657fd2b257fa9c7ded15c8def55d72636605eb461006e79331055135fd6f50","observation_id":"73d94845-dcd5-4f2f-8090-c32daabd4c3c","resolution":{"observed_at":"2026-05-27T06:18:52.754131Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Opt-6.7b","venue":null,"work_id":"90d0cbf9-00c9-4c1b-a2f4-846a75f00e5f","year":2022},"citing_paper":{"arxiv_id":"2604.26557","last_updated":"2026-04-29T11:44:35Z","snapshot_observed_at":"2026-07-06T23:12:10.599132Z","submitted_at":"2026-04-29T11:44:35Z","title":"DUAL-BLADE: Dual-Path NVMe-Direct KV-Cache Offloading for Edge LLM Inference","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-07T12:51:42.916410Z"},"links":{"citing_paper":"/paper/2604.26557"},"observation_digest":"sha256:6f68d9c699b272fb51c1222dada7b23203495ae4f082d23af3229ad86274bf41","observation_id":"4efa9446-4204-4693-bcaa-bc9ec6c7fbf6","resolution":{"observed_at":"2026-05-27T06:18:52.748372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"X3: A low overhead high performance buffer management replacement algorithm","venue":null,"work_id":"b8de8cfa-2887-448c-98b2-5c4f76434c47","year":1994},"citing_paper":{"arxiv_id":"2604.26557","last_updated":"2026-04-29T11:44:35Z","snapshot_observed_at":"2026-07-06T23:12:10.599132Z","submitted_at":"2026-04-29T11:44:35Z","title":"DUAL-BLADE: Dual-Path NVMe-Direct KV-Cache Offloading for Edge LLM Inference","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-07T12:51:42.916410Z"},"links":{"citing_paper":"/paper/2604.26557"},"observation_digest":"sha256:31ff9889c3bb727c66353eaf15f917f5bf920bdfcf6186af2982606def1326d0","observation_id":"996224ef-2f4d-4422-befd-89d09c9d80fa","resolution":{"observed_at":"2026-05-27T06:18:52.772838Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Arc: A self-tuning, low overhead replacement cache","venue":null,"work_id":"cb9257c2-218b-4b6b-b093-167da2a1340c","year":2003},"citing_paper":{"arxiv_id":"2604.26557","last_updated":"2026-04-29T11:44:35Z","snapshot_observed_at":"2026-07-06T23:12:10.599132Z","submitted_at":"2026-04-29T11:44:35Z","title":"DUAL-BLADE: Dual-Path NVMe-Direct KV-Cache Offloading for Edge LLM Inference","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-07T12:51:42.916410Z"},"links":{"citing_paper":"/paper/2604.26557"},"observation_digest":"sha256:24d233ee2f0b03652e6744e2fc3b1b6e3575cbd08de6fd9a62fecb96fd347952","observation_id":"9136f0ee-5ef5-433e-8a51-12a2cfc4c3a5","resolution":{"observed_at":"2026-05-27T06:18:52.745700Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Streamcache: Revisiting page cache for file scanning on fast storage devices","venue":null,"work_id":"cc10fc11-c9bc-4726-b208-332759235222","year":2024},"citing_paper":{"arxiv_id":"2604.26557","last_updated":"2026-04-29T11:44:35Z","snapshot_observed_at":"2026-07-06T23:12:10.599132Z","submitted_at":"2026-04-29T11:44:35Z","title":"DUAL-BLADE: Dual-Path NVMe-Direct KV-Cache Offloading for Edge LLM Inference","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-07T12:51:42.916410Z"},"links":{"citing_paper":"/paper/2604.26557"},"observation_digest":"sha256:8a5ff60fc77a80220cd256781edd922fd2cf66ae55375a1d76c1dbfb1a74762f","observation_id":"823641a5-b407-4aa0-9775-2d93fa1dc916","resolution":{"observed_at":"2026-05-27T06:18:52.751246Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gregg,BPF performance tools","venue":null,"work_id":"c2bb91c9-77a8-47bc-aff3-3b5ea1113b18","year":2019},"citing_paper":{"arxiv_id":"2604.26557","last_updated":"2026-04-29T11:44:35Z","snapshot_observed_at":"2026-07-06T23:12:10.599132Z","submitted_at":"2026-04-29T11:44:35Z","title":"DUAL-BLADE: Dual-Path NVMe-Direct KV-Cache Offloading for Edge LLM Inference","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-07T12:51:42.916410Z"},"links":{"citing_paper":"/paper/2604.26557"},"observation_digest":"sha256:f038f053b11f13d95ce23bfb3a0385c93d76d32dfdaf0ec55aec5097da276fee","observation_id":"1101bdff-c005-4abb-841a-2785741d0ed2","resolution":{"observed_at":"2026-05-27T06:18:52.756947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Asynchronous i/o stack: A low-latency kernel i/o stack for ultra-low latency ssds","venue":null,"work_id":"1f72063f-0f1e-427f-a2a7-cd4ce18a20b6","year":2019},"citing_paper":{"arxiv_id":"2604.26557","last_updated":"2026-04-29T11:44:35Z","snapshot_observed_at":"2026-07-06T23:12:10.599132Z","submitted_at":"2026-04-29T11:44:35Z","title":"DUAL-BLADE: Dual-Path NVMe-Direct KV-Cache Offloading for Edge LLM Inference","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-07T12:51:42.916410Z"},"links":{"citing_paper":"/paper/2604.26557"},"observation_digest":"sha256:d567fd590b520233fe6fc123282f6f440f0835fd713b91c70174dcbcf526f4cc","observation_id":"92217bb7-fffe-47ce-af08-9b78c936aa74","resolution":{"observed_at":"2026-05-27T06:18:52.763199Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"D2FQ:Device-Direct Fair Queueing for NVMe SSDs","venue":null,"work_id":"aed2b74c-4865-4e44-928b-ed9e40eb5912","year":2021},"citing_paper":{"arxiv_id":"2604.26557","last_updated":"2026-04-29T11:44:35Z","snapshot_observed_at":"2026-07-06T23:12:10.599132Z","submitted_at":"2026-04-29T11:44:35Z","title":"DUAL-BLADE: Dual-Path NVMe-Direct KV-Cache Offloading for Edge LLM Inference","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-07T12:51:42.916410Z"},"links":{"citing_paper":"/paper/2604.26557"},"observation_digest":"sha256:44aecc1f52396e55ecd293a62e99aaa9c73c2cac73d0a01942004f726610e36d","observation_id":"b456fee8-6ce8-41f0-9697-ccb835151936","resolution":{"observed_at":"2026-05-27T06:18:52.778401Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"iJournaling:Fine-Grained journaling for improving the latency of fsync system call","venue":null,"work_id":"4a2ff153-a842-45b9-97df-6a7b7f5fac78","year":2017},"citing_paper":{"arxiv_id":"2604.26557","last_updated":"2026-04-29T11:44:35Z","snapshot_observed_at":"2026-07-06T23:12:10.599132Z","submitted_at":"2026-04-29T11:44:35Z","title":"DUAL-BLADE: Dual-Path NVMe-Direct KV-Cache Offloading for Edge LLM Inference","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-07T12:51:42.916410Z"},"links":{"citing_paper":"/paper/2604.26557"},"observation_digest":"sha256:09c0796e06c298414acb4e449629f7b6e35b62547202c43110c0fab61e9f6ec3","observation_id":"8de83568-eb69-4f4b-ab94-ba1fef7131f5","resolution":{"observed_at":"2026-05-27T06:18:52.828454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Asynchronous i/o support in linux 2.5","venue":null,"work_id":"99ddda9b-393f-4b61-8aa6-8a6f05f7b545","year":2003},"citing_paper":{"arxiv_id":"2604.26557","last_updated":"2026-04-29T11:44:35Z","snapshot_observed_at":"2026-07-06T23:12:10.599132Z","submitted_at":"2026-04-29T11:44:35Z","title":"DUAL-BLADE: Dual-Path NVMe-Direct KV-Cache Offloading for Edge LLM Inference","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-07T12:51:42.916410Z"},"links":{"citing_paper":"/paper/2604.26557"},"observation_digest":"sha256:aecd11211a4944cea97c061c3629bbf321d01772fceea199af67410458f763aa","observation_id":"b9e57702-adab-4729-9b91-61d8886df1c7","resolution":{"observed_at":"2026-05-27T06:18:52.821871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Do we still need io schedulers for low-latency disks?","venue":null,"work_id":"33e39db6-8bc6-4644-bf24-166bf03eff64","year":2023},"citing_paper":{"arxiv_id":"2604.26557","last_updated":"2026-04-29T11:44:35Z","snapshot_observed_at":"2026-07-06T23:12:10.599132Z","submitted_at":"2026-04-29T11:44:35Z","title":"DUAL-BLADE: Dual-Path NVMe-Direct KV-Cache Offloading for Edge LLM Inference","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-07T12:51:42.916410Z"},"links":{"citing_paper":"/paper/2604.26557"},"observation_digest":"sha256:5836685568d3941479d143352815bcbdb15c655aca8e64dd8789097cf8644ccf","observation_id":"e0838906-55df-4c7f-be66-30944e20dcfa","resolution":{"observed_at":"2026-05-27T06:18:52.839154Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bfq, multiqueue- deadline, or kyber? performance characterization of linux storage sched- ulers in the nvme era","venue":null,"work_id":"44c848af-491d-4671-bb63-1041c73979d1","year":2024},"citing_paper":{"arxiv_id":"2604.26557","last_updated":"2026-04-29T11:44:35Z","snapshot_observed_at":"2026-07-06T23:12:10.599132Z","submitted_at":"2026-04-29T11:44:35Z","title":"DUAL-BLADE: Dual-Path NVMe-Direct KV-Cache Offloading for Edge LLM Inference","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-07T12:51:42.916410Z"},"links":{"citing_paper":"/paper/2604.26557"},"observation_digest":"sha256:a6d4f8a513fc9918b606ef758b5e3c5bdbd1f3f2c6581949861d8e63d9d4b71b","observation_id":"0b22dbcb-5396-4a6e-a86f-7174feff4de9","resolution":{"observed_at":"2026-05-27T06:18:52.836740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":"2205.01068","doi":"10.48550/arxiv.2205.01068","metadata_source":"pith","pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-07-11T03:37:45.880117Z","title":"OPT: Open Pre-trained Transformer Language Models","venue":"cs.CL","work_id":"d7ff3b21-1fff-4cf4-952a-4714e3ef2307","year":2022},"citing_paper":{"arxiv_id":"2604.26557","last_updated":"2026-04-29T11:44:35Z","snapshot_observed_at":"2026-07-06T23:12:10.599132Z","submitted_at":"2026-04-29T11:44:35Z","title":"DUAL-BLADE: Dual-Path NVMe-Direct KV-Cache Offloading for Edge LLM Inference","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-07T12:51:42.916410Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2604.26557"},"observation_digest":"sha256:dec6e169096d8863be7a617f07f03889d1bd7bd66f5cb52c95e37da1d608bb0f","observation_id":"3b336d32-789a-4534-83fd-984717ec7570","resolution":{"observed_at":"2026-05-12T09:06:26.505328Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cuda c++ programming guide","venue":null,"work_id":"c0356d81-929b-4710-8c4e-2d2b62c15d4f","year":2024},"citing_paper":{"arxiv_id":"2604.26557","last_updated":"2026-04-29T11:44:35Z","snapshot_observed_at":"2026-07-06T23:12:10.599132Z","submitted_at":"2026-04-29T11:44:35Z","title":"DUAL-BLADE: Dual-Path NVMe-Direct KV-Cache Offloading for Edge LLM Inference","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-07T12:51:42.916410Z"},"links":{"citing_paper":"/paper/2604.26557"},"observation_digest":"sha256:161ea6307aeee1912252aea3a89af53e88a3bf93ec2d21373630d645d7217e75","observation_id":"96561b3a-073a-4357-a418-d001abd9cb8a","resolution":{"observed_at":"2026-05-27T06:18:52.831054Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.09911","last_updated":"2022-12-24T10:12:53Z","snapshot_observed_at":"2026-07-06T13:11:54.024820Z","submitted_at":"2022-05-20T00:53:43Z","title":"Can Foundation Models Wrangle Your Data?","version":2},"cited_work":{"arxiv_id":"2205.09911","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2205.09911","snapshot_observed_at":"2026-07-04T20:50:11.311006Z","title":"Can foundation models wrangle your data?","venue":null,"work_id":"561c47c5-a699-47db-9dbb-247950202f3d","year":2022},"citing_paper":{"arxiv_id":"2604.26557","last_updated":"2026-04-29T11:44:35Z","snapshot_observed_at":"2026-07-06T23:12:10.599132Z","submitted_at":"2026-04-29T11:44:35Z","title":"DUAL-BLADE: Dual-Path NVMe-Direct KV-Cache Offloading for Edge LLM Inference","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-07T12:51:42.916410Z"},"links":{"cited_paper":"/paper/2205.09911","citing_paper":"/paper/2604.26557"},"observation_digest":"sha256:658483e2b5d519aa9f22a0674857a368c359bd77789b9a91b39046b3667a0f59","observation_id":"887e8ffd-7f93-45ca-b673-6024568ad8a4","resolution":{"observed_at":"2026-05-12T09:06:26.520020Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cost-efficient large language model serving for multi-turn conversations with cachedattention","venue":null,"work_id":"1f165504-5f5b-466c-a561-5826b01115df","year":2024},"citing_paper":{"arxiv_id":"2604.26557","last_updated":"2026-04-29T11:44:35Z","snapshot_observed_at":"2026-07-06T23:12:10.599132Z","submitted_at":"2026-04-29T11:44:35Z","title":"DUAL-BLADE: Dual-Path NVMe-Direct KV-Cache Offloading for Edge LLM Inference","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-07T12:51:42.916410Z"},"links":{"citing_paper":"/paper/2604.26557"},"observation_digest":"sha256:bd18873e079d6f6294a3769e74fde9e1fe7eace238830347ccfa04313593d421","observation_id":"5147f533-fb3b-4f48-aaf1-d4bb6051c84d","resolution":{"observed_at":"2026-05-27T06:18:52.781127Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"An i/o characterizing study of offloading llm models and kv caches to nvme ssd","venue":null,"work_id":"a893f0ea-7096-4003-9784-675da280cff6","year":2025},"citing_paper":{"arxiv_id":"2604.26557","last_updated":"2026-04-29T11:44:35Z","snapshot_observed_at":"2026-07-06T23:12:10.599132Z","submitted_at":"2026-04-29T11:44:35Z","title":"DUAL-BLADE: Dual-Path NVMe-Direct KV-Cache Offloading for Edge LLM Inference","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-07T12:51:42.916410Z"},"links":{"citing_paper":"/paper/2604.26557"},"observation_digest":"sha256:aaf2cbc023ce8c5d47e837c905ccfdfc73a56e5f78195d655c7869432605d882","observation_id":"73247e4d-6233-41a7-8fba-e6d1a616e7d6","resolution":{"observed_at":"2026-05-27T06:18:52.825230Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.04992","last_updated":"2024-09-08T06:06:44Z","snapshot_observed_at":"2026-07-06T19:12:06.671181Z","submitted_at":"2024-09-08T06:06:44Z","title":"InstInfer: In-Storage Attention Offloading for Cost-Effective Long-Context LLM Inference","version":1},"cited_work":{"arxiv_id":"2409.04992","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.04992","snapshot_observed_at":"2026-07-03T15:08:33.737665Z","title":"Instinfer: In-storage at- tention offloading for cost-effective long-context llm inference","venue":null,"work_id":"fe50b7f0-ebe7-4b19-a1f6-3acb32599f28","year":2024},"citing_paper":{"arxiv_id":"2604.26557","last_updated":"2026-04-29T11:44:35Z","snapshot_observed_at":"2026-07-06T23:12:10.599132Z","submitted_at":"2026-04-29T11:44:35Z","title":"DUAL-BLADE: Dual-Path NVMe-Direct KV-Cache Offloading for Edge LLM Inference","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-07T12:51:42.916410Z"},"links":{"cited_paper":"/paper/2409.04992","citing_paper":"/paper/2604.26557"},"observation_digest":"sha256:c11095767155f4f883d6a1a7d33e7de9df81fccf9c58b287728f7595ef0ea13b","observation_id":"d7d8662d-d962-417a-9f9e-fac135a34a56","resolution":{"observed_at":"2026-05-12T09:06:26.525019Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"INF2: High- throughput generative inference of large language models using near- storage processing","venue":null,"work_id":"7b0d4942-dffc-408e-9266-82b762c0f9cb","year":2025},"citing_paper":{"arxiv_id":"2604.26557","last_updated":"2026-04-29T11:44:35Z","snapshot_observed_at":"2026-07-06T23:12:10.599132Z","submitted_at":"2026-04-29T11:44:35Z","title":"DUAL-BLADE: Dual-Path NVMe-Direct KV-Cache Offloading for Edge LLM Inference","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-07T12:51:42.916410Z"},"links":{"citing_paper":"/paper/2604.26557"},"observation_digest":"sha256:c1dc9ddaa1d7cd4e052673fd4410f1b70e1937f646257f23dca5035104f5c1e6","observation_id":"f1eb7498-279d-430f-899d-d14b3403aa0a","resolution":{"observed_at":"2026-05-27T06:18:52.803707Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Efficient memory management for large language model serving with pagedattention","venue":null,"work_id":"8594a62f-a4aa-4a46-8b22-97107927c3ba","year":2023},"citing_paper":{"arxiv_id":"2604.26557","last_updated":"2026-04-29T11:44:35Z","snapshot_observed_at":"2026-07-06T23:12:10.599132Z","submitted_at":"2026-04-29T11:44:35Z","title":"DUAL-BLADE: Dual-Path NVMe-Direct KV-Cache Offloading for Edge LLM Inference","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-07T12:51:42.916410Z"},"links":{"citing_paper":"/paper/2604.26557"},"observation_digest":"sha256:3246cd51af167ed6c209cdb60535fa3ad83273fa85c74c90b4bca6fc4c39e629","observation_id":"76222427-6bc4-4968-b5bc-9989dc9a59dd","resolution":{"observed_at":"2026-05-27T06:18:52.810087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"GPUDirect Storage: A Direct Path Between Storage and GPU Memory","venue":null,"work_id":"409d397d-af85-4d2f-8fe9-3b94b57a5950","year":2025},"citing_paper":{"arxiv_id":"2604.26557","last_updated":"2026-04-29T11:44:35Z","snapshot_observed_at":"2026-07-06T23:12:10.599132Z","submitted_at":"2026-04-29T11:44:35Z","title":"DUAL-BLADE: Dual-Path NVMe-Direct KV-Cache Offloading for Edge LLM Inference","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-07T12:51:42.916410Z"},"links":{"citing_paper":"/paper/2604.26557"},"observation_digest":"sha256:b60e494b105567d07b1fe9c0e909e42d28f3441d535121a341e5d390abe93356","observation_id":"55b4c814-6c56-4d6a-9f28-fee673c70855","resolution":{"observed_at":"2026-05-27T06:18:52.852734Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gpu- initiated on-demand high-throughput storage access in the bam system architecture","venue":null,"work_id":"27a13427-cd54-4beb-868e-147a6835d169","year":2023},"citing_paper":{"arxiv_id":"2604.26557","last_updated":"2026-04-29T11:44:35Z","snapshot_observed_at":"2026-07-06T23:12:10.599132Z","submitted_at":"2026-04-29T11:44:35Z","title":"DUAL-BLADE: Dual-Path NVMe-Direct KV-Cache Offloading for Edge LLM Inference","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-07T12:51:42.916410Z"},"links":{"citing_paper":"/paper/2604.26557"},"observation_digest":"sha256:990e7c37834fc4627a4679aa26a8406594e069efd63498a36044fb9cbb35142b","observation_id":"143753e3-c563-4e07-826e-eeef2a96793d","resolution":{"observed_at":"2026-05-27T06:18:52.833824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2604.26557","last_updated":"2026-04-29T11:44:35Z","latest_version":1,"primary_category":"cs.DC","snapshot_observed_at":"2026-07-06T23:12:10.599132Z","submitted_at":"2026-04-29T11:44:35Z","title":"DUAL-BLADE: Dual-Path NVMe-Direct KV-Cache Offloading for Edge LLM Inference"},"reference_resolution":{"displayed":47,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":0,"verified_exact":9,"verified_fuzzy":37},"total_outbound_references":47},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"thesis":"As of 23 July 2026, this Paper Citation Record lists 47 of 47 outbound references and 0 inbound Pith citation observations for arXiv:2604.26557."}