{"as_of":"2026-08-09T05:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:03d23cf685939fb913c5129f073c88075d19f52faac4c60695a6933efa0d8f09","coverage":[{"denominator":37,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":37,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:43:26.657972Z","state":"measured"},{"denominator":37,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":37,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.17787/citation-record","integrity":"/paper/2505.17787/integrity","json":"/paper/2505.17787/citation-record.json","paper":"/paper/2505.17787"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2310.09259","last_updated":"2023-11-02T14:26:57Z","snapshot_observed_at":"2026-07-06T16:32:37.715900Z","submitted_at":"2023-10-13T17:15:05Z","title":"QUIK: Towards End-to-End 4-Bit Inference on Generative Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09259","snapshot_observed_at":"2026-08-07T14:43:23.877823Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17787","last_updated":"2025-05-23T12:00:09Z","snapshot_observed_at":"2026-08-07T14:38:30.235477Z","submitted_at":"2025-05-23T12:00:09Z","title":"Titanus: Enabling KV Cache Pruning and Quantization On-the-Fly for LLM Acceleration","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:43:23.877823Z"},"links":{"cited_paper":"/paper/2310.09259","citing_paper":"/paper/2505.17787"},"observation_digest":"sha256:a4e265681cd36faedd9176fd3bec6eafc185c503673b746aaf881b3cb27ee244","observation_id":"561a2594-52b9-46dd-8a6f-22701e488092","resolution":{"observed_at":"2026-08-07T14:43:23.877823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.21259","last_updated":"2025-02-28T17:35:14Z","snapshot_observed_at":"2026-08-07T17:39:17.324129Z","submitted_at":"2025-02-28T17:35:14Z","title":"Optimizing and Exploring System Performance in Compact Processing-in-Memory-based Chips","version":1},"cited_work":{"arxiv_id":"2502.21259","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.21259","snapshot_observed_at":"2026-08-07T14:43:27.208890Z","title":"Optimizing and Exploring System Performance in Compact Processing-in-Memory-based Chips","venue":"cs.AR","work_id":"993a0716-530a-428e-a278-50f5c8a91a78","year":2025},"citing_paper":{"arxiv_id":"2505.17787","last_updated":"2025-05-23T12:00:09Z","snapshot_observed_at":"2026-08-07T14:38:30.235477Z","submitted_at":"2025-05-23T12:00:09Z","title":"Titanus: Enabling KV Cache Pruning and Quantization On-the-Fly for LLM Acceleration","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:43:23.942576Z"},"links":{"cited_paper":"/paper/2502.21259","citing_paper":"/paper/2505.17787"},"observation_digest":"sha256:267dd842bdb92ec0b399ca8b15208d67b836d6a9e6c2ea50b38a1daefc0c29db","observation_id":"2f64061e-f78b-47ea-9f73-d6791272b5d1","resolution":{"observed_at":"2026-08-07T14:43:27.277510Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:43:31.789590Z","title":null,"venue":null,"work_id":"fa132fc6-99b9-423a-a288-c226e7adda21","year":2021},"citing_paper":{"arxiv_id":"2505.17787","last_updated":"2025-05-23T12:00:09Z","snapshot_observed_at":"2026-08-07T14:38:30.235477Z","submitted_at":"2025-05-23T12:00:09Z","title":"Titanus: Enabling KV Cache Pruning and Quantization On-the-Fly for LLM Acceleration","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:43:24.039824Z"},"links":{"citing_paper":"/paper/2505.17787"},"observation_digest":"sha256:813a61ccddf8e7824b7054aa44c2e205341c421f6148537cbefb9f31bfd5f000","observation_id":"b42d80e2-e522-4e49-bb9f-1aa1535408d0","resolution":{"observed_at":"2026-08-07T14:43:31.936899Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:43:31.515465Z","title":null,"venue":null,"work_id":"3562c9fe-80cc-43e3-aafe-a1c191b68c60","year":2002},"citing_paper":{"arxiv_id":"2505.17787","last_updated":"2025-05-23T12:00:09Z","snapshot_observed_at":"2026-08-07T14:38:30.235477Z","submitted_at":"2025-05-23T12:00:09Z","title":"Titanus: Enabling KV Cache Pruning and Quantization On-the-Fly for LLM Acceleration","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:43:24.110700Z"},"links":{"citing_paper":"/paper/2505.17787"},"observation_digest":"sha256:a60ac2823e550de4e951c0c5f1ce3ee29b6c27cd1b08f170bb6205769c990ea3","observation_id":"6a184e9b-7bba-49ef-8b5a-32f8dbcbee78","resolution":{"observed_at":"2026-08-07T14:43:31.635460Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:43:31.282652Z","title":null,"venue":null,"work_id":"a16e1d14-0720-41d2-b0fa-bd82b373785c","year":2022},"citing_paper":{"arxiv_id":"2505.17787","last_updated":"2025-05-23T12:00:09Z","snapshot_observed_at":"2026-08-07T14:38:30.235477Z","submitted_at":"2025-05-23T12:00:09Z","title":"Titanus: Enabling KV Cache Pruning and Quantization On-the-Fly for LLM Acceleration","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:43:24.161475Z"},"links":{"citing_paper":"/paper/2505.17787"},"observation_digest":"sha256:03a136a3b85522bfbd2e5602bb6dad8c46f765ef6a758c8a48ca4a43cf83058d","observation_id":"ddbea822-a18c-4fd6-95f5-2f8eb180d89a","resolution":{"observed_at":"2026-08-07T14:43:31.396927Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14057","last_updated":"2024-07-19T06:34:45Z","snapshot_observed_at":"2026-07-06T18:48:49.546589Z","submitted_at":"2024-07-19T06:34:45Z","title":"LazyLLM: Dynamic Token Pruning for Efficient Long Context LLM Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14057","snapshot_observed_at":"2026-08-07T14:43:24.234222Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17787","last_updated":"2025-05-23T12:00:09Z","snapshot_observed_at":"2026-08-07T14:38:30.235477Z","submitted_at":"2025-05-23T12:00:09Z","title":"Titanus: Enabling KV Cache Pruning and Quantization On-the-Fly for LLM Acceleration","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:43:24.234222Z"},"links":{"cited_paper":"/paper/2407.14057","citing_paper":"/paper/2505.17787"},"observation_digest":"sha256:96f3b48ac6fbc094d437aeac88f3db083ab6934f1740de651e92b05fffdaf5a2","observation_id":"241ba12b-38b3-44e0-975b-b543ce66e8a2","resolution":{"observed_at":"2026-08-07T14:43:24.234222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:43:31.046467Z","title":null,"venue":null,"work_id":"c5ca9ddf-6a6f-464f-b27e-bddde50aae0c","year":2020},"citing_paper":{"arxiv_id":"2505.17787","last_updated":"2025-05-23T12:00:09Z","snapshot_observed_at":"2026-08-07T14:38:30.235477Z","submitted_at":"2025-05-23T12:00:09Z","title":"Titanus: Enabling KV Cache Pruning and Quantization On-the-Fly for LLM Acceleration","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:43:24.324465Z"},"links":{"citing_paper":"/paper/2505.17787"},"observation_digest":"sha256:ea6cc8394a6a8ce394d325c099a7c545d4c35e4c5e453ccda447b83b450adf5c","observation_id":"a1c51d3d-3c4c-4263-a874-0e0ece0aea54","resolution":{"observed_at":"2026-08-07T14:43:31.160358Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:43:30.822809Z","title":null,"venue":null,"work_id":"0ae1e920-8ffa-4611-8f62-a61028b28ea2","year":2021},"citing_paper":{"arxiv_id":"2505.17787","last_updated":"2025-05-23T12:00:09Z","snapshot_observed_at":"2026-08-07T14:38:30.235477Z","submitted_at":"2025-05-23T12:00:09Z","title":"Titanus: Enabling KV Cache Pruning and Quantization On-the-Fly for LLM Acceleration","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:43:24.395816Z"},"links":{"citing_paper":"/paper/2505.17787"},"observation_digest":"sha256:391d8417d391b24f5fbc4e5a765f15a47a95b0b0095aa94974776f5395ec0684","observation_id":"83d7cedf-b6b7-46ed-aa55-27a68c486a08","resolution":{"observed_at":"2026-08-07T14:43:30.923499Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-05T09:48:25.127042Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-07T14:43:24.481761Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17787","last_updated":"2025-05-23T12:00:09Z","snapshot_observed_at":"2026-08-07T14:38:30.235477Z","submitted_at":"2025-05-23T12:00:09Z","title":"Titanus: Enabling KV Cache Pruning and Quantization On-the-Fly for LLM Acceleration","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:43:24.481761Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2505.17787"},"observation_digest":"sha256:60e16a2024afbf2cc633661d11639406f794aa4b46fca6ba71e8f45b039a6189","observation_id":"626ad239-cb82-4223-92e2-612a9d4ef34a","resolution":{"observed_at":"2026-08-07T14:43:24.481761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08391","last_updated":"2024-10-10T21:55:11Z","snapshot_observed_at":"2026-07-06T19:31:31.809692Z","submitted_at":"2024-10-10T21:55:11Z","title":"KV Prediction for Improved Time to First Token","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08391","snapshot_observed_at":"2026-08-07T14:43:24.538615Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17787","last_updated":"2025-05-23T12:00:09Z","snapshot_observed_at":"2026-08-07T14:38:30.235477Z","submitted_at":"2025-05-23T12:00:09Z","title":"Titanus: Enabling KV Cache Pruning and Quantization On-the-Fly for LLM Acceleration","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:43:24.538615Z"},"links":{"cited_paper":"/paper/2410.08391","citing_paper":"/paper/2505.17787"},"observation_digest":"sha256:f6301ce5fa063b50c816b8db9257027fad04b0a932aa3b6b2f26fd6bc3f41cc4","observation_id":"cf9ed798-cd90-4e1d-a68d-a47f2fc04aff","resolution":{"observed_at":"2026-08-07T14:43:24.538615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:43:24.611567Z","title":null,"venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2505.17787","last_updated":"2025-05-23T12:00:09Z","snapshot_observed_at":"2026-08-07T14:38:30.235477Z","submitted_at":"2025-05-23T12:00:09Z","title":"Titanus: Enabling KV Cache Pruning and Quantization On-the-Fly for LLM Acceleration","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:43:24.611567Z"},"links":{"citing_paper":"/paper/2505.17787"},"observation_digest":"sha256:5cb22fc3696f6ea6d15e07390fbeec264c39094e5221246df65065cc3ca12954","observation_id":"2ab19418-e60c-41b5-ad3d-55ced89406bd","resolution":{"observed_at":"2026-08-07T14:43:24.611567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:43:30.548665Z","title":null,"venue":null,"work_id":"8a4cdc68-0c96-481c-a5e4-20232f41977b","year":2024},"citing_paper":{"arxiv_id":"2505.17787","last_updated":"2025-05-23T12:00:09Z","snapshot_observed_at":"2026-08-07T14:38:30.235477Z","submitted_at":"2025-05-23T12:00:09Z","title":"Titanus: Enabling KV Cache Pruning and Quantization On-the-Fly for LLM Acceleration","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:43:24.687006Z"},"links":{"citing_paper":"/paper/2505.17787"},"observation_digest":"sha256:607a9497eef539d30ff0903a631f6267db52fbaa3b160fe73f80d194325929c4","observation_id":"d66e8fae-65ff-4ff7-929c-bc0181c6f516","resolution":{"observed_at":"2026-08-07T14:43:30.660504Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.07958","last_updated":"2022-05-08T02:43:02Z","snapshot_observed_at":"2026-08-03T16:26:48.747700Z","submitted_at":"2021-09-08T17:15:27Z","title":"TruthfulQA: Measuring How Models Mimic Human Falsehoods","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.07958","snapshot_observed_at":"2026-08-07T14:43:24.737825Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.17787","last_updated":"2025-05-23T12:00:09Z","snapshot_observed_at":"2026-08-07T14:38:30.235477Z","submitted_at":"2025-05-23T12:00:09Z","title":"Titanus: Enabling KV Cache Pruning and Quantization On-the-Fly for LLM Acceleration","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:43:24.737825Z"},"links":{"cited_paper":"/paper/2109.07958","citing_paper":"/paper/2505.17787"},"observation_digest":"sha256:7d87221427733f83330802a5f2c194ac445fa194c99e61b81037ca258354417c","observation_id":"9994723e-e003-4489-a9e0-19fbd2093c5c","resolution":{"observed_at":"2026-08-07T14:43:24.737825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02750","last_updated":"2024-07-25T09:16:05Z","snapshot_observed_at":"2026-07-06T17:25:18.238343Z","submitted_at":"2024-02-05T06:06:47Z","title":"KIVI: A Tuning-Free Asymmetric 2bit Quantization for KV Cache","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02750","snapshot_observed_at":"2026-08-07T14:43:24.804107Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17787","last_updated":"2025-05-23T12:00:09Z","snapshot_observed_at":"2026-08-07T14:38:30.235477Z","submitted_at":"2025-05-23T12:00:09Z","title":"Titanus: Enabling KV Cache Pruning and Quantization On-the-Fly for LLM Acceleration","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:43:24.804107Z"},"links":{"cited_paper":"/paper/2402.02750","citing_paper":"/paper/2505.17787"},"observation_digest":"sha256:6b44e8d2bf2b1a60c667685aaeb4a320bcd5d917ef4c9d5fc7f475b5eddc3131","observation_id":"81218080-6259-443c-96da-4eb6a9e4563e","resolution":{"observed_at":"2026-08-07T14:43:24.804107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00907","last_updated":"2024-10-02T15:34:12Z","snapshot_observed_at":"2026-07-06T19:25:28.300272Z","submitted_at":"2024-10-01T17:53:28Z","title":"Addition is All You Need for Energy-efficient Language Models","version":2},"cited_work":{"arxiv_id":"2410.00907","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.00907","snapshot_observed_at":"2026-08-07T14:43:26.899448Z","title":"Addition is All You Need for Energy-efficient Language Models","venue":"cs.CL","work_id":"68dbcd45-7962-4528-9d82-229c9fa58d9d","year":2024},"citing_paper":{"arxiv_id":"2505.17787","last_updated":"2025-05-23T12:00:09Z","snapshot_observed_at":"2026-08-07T14:38:30.235477Z","submitted_at":"2025-05-23T12:00:09Z","title":"Titanus: Enabling KV Cache Pruning and Quantization On-the-Fly for LLM Acceleration","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:43:24.884943Z"},"links":{"cited_paper":"/paper/2410.00907","citing_paper":"/paper/2505.17787"},"observation_digest":"sha256:8e4c3c5b32d603f8d470fd2066e665ce65490e4e43e38ccff67d2e928bd6295b","observation_id":"bc17d69f-6bfc-4177-a896-ceacabeb714e","resolution":{"observed_at":"2026-08-07T14:43:26.968577Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:43:30.331009Z","title":null,"venue":null,"work_id":"0363c42e-dd12-4550-a4d9-f25dadd1ad40","year":2009},"citing_paper":{"arxiv_id":"2505.17787","last_updated":"2025-05-23T12:00:09Z","snapshot_observed_at":"2026-08-07T14:38:30.235477Z","submitted_at":"2025-05-23T12:00:09Z","title":"Titanus: Enabling KV Cache Pruning and Quantization On-the-Fly for LLM Acceleration","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:43:24.962401Z"},"links":{"citing_paper":"/paper/2505.17787"},"observation_digest":"sha256:591ff8f5acd742ad8e8cdec8cc2e3c48696b2bfbaac8c990d90d0e22beb003b3","observation_id":"699f1c02-d1a9-42dd-8a55-39c907d87efa","resolution":{"observed_at":"2026-08-07T14:43:30.425303Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.06031","last_updated":"2016-06-20T09:37:17Z","snapshot_observed_at":"2026-08-05T16:27:22.031013Z","submitted_at":"2016-06-20T09:37:17Z","title":"The LAMBADA dataset: Word prediction requiring a broad discourse context","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.06031","snapshot_observed_at":"2026-08-07T14:43:25.057858Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.17787","last_updated":"2025-05-23T12:00:09Z","snapshot_observed_at":"2026-08-07T14:38:30.235477Z","submitted_at":"2025-05-23T12:00:09Z","title":"Titanus: Enabling KV Cache Pruning and Quantization On-the-Fly for LLM Acceleration","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:43:25.057858Z"},"links":{"cited_paper":"/paper/1606.06031","citing_paper":"/paper/2505.17787"},"observation_digest":"sha256:09f3ccf34d6b65121d33e8ebac5650dd849960c2e807df302cf796d9f03480c9","observation_id":"250c1624-1a87-499a-8bc5-06cda2c4c6d6","resolution":{"observed_at":"2026-08-07T14:43:25.057858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:43:30.069334Z","title":null,"venue":null,"work_id":"d59bed77-5542-4d05-977b-9cb4267e92c6","year":2015},"citing_paper":{"arxiv_id":"2505.17787","last_updated":"2025-05-23T12:00:09Z","snapshot_observed_at":"2026-08-07T14:38:30.235477Z","submitted_at":"2025-05-23T12:00:09Z","title":"Titanus: Enabling KV Cache Pruning and Quantization On-the-Fly for LLM Acceleration","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:43:25.100835Z"},"links":{"citing_paper":"/paper/2505.17787"},"observation_digest":"sha256:f86131c507b3984b03d9de1046253109a89da849825545c68a7b4c9c58622971","observation_id":"ad2999bc-5683-4649-8326-1a35682ab888","resolution":{"observed_at":"2026-08-07T14:43:30.193697Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:43:29.878118Z","title":null,"venue":null,"work_id":"3d472138-af83-46af-bc7d-d2f538b33d0a","year":2022},"citing_paper":{"arxiv_id":"2505.17787","last_updated":"2025-05-23T12:00:09Z","snapshot_observed_at":"2026-08-07T14:38:30.235477Z","submitted_at":"2025-05-23T12:00:09Z","title":"Titanus: Enabling KV Cache Pruning and Quantization On-the-Fly for LLM Acceleration","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:43:25.191669Z"},"links":{"citing_paper":"/paper/2505.17787"},"observation_digest":"sha256:4255f3abc55cc2e09ae04ae0a755258c7723a44c4231cd9b30bc02f3a4273e07","observation_id":"23a6d20a-d763-49f8-b7b3-f1e7122ffad6","resolution":{"observed_at":"2026-08-07T14:43:29.968288Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.13137","last_updated":"2024-03-18T05:33:22Z","snapshot_observed_at":"2026-07-06T16:10:15.694898Z","submitted_at":"2023-08-25T02:28:35Z","title":"OmniQuant: Omnidirectionally Calibrated Quantization for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.13137","snapshot_observed_at":"2026-08-07T14:43:25.278890Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17787","last_updated":"2025-05-23T12:00:09Z","snapshot_observed_at":"2026-08-07T14:38:30.235477Z","submitted_at":"2025-05-23T12:00:09Z","title":"Titanus: Enabling KV Cache Pruning and Quantization On-the-Fly for LLM Acceleration","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:43:25.278890Z"},"links":{"cited_paper":"/paper/2308.13137","citing_paper":"/paper/2505.17787"},"observation_digest":"sha256:847509c929cc8e44470832ee1201dc84dc1e7ad147d92d5e986100f3a40905cc","observation_id":"e98d8f9a-d375-4af1-b99f-d0bce2c45af4","resolution":{"observed_at":"2026-08-07T14:43:25.278890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:43:29.627504Z","title":null,"venue":null,"work_id":"f8d83fea-7862-496d-b48d-631a00ca9b9f","year":2023},"citing_paper":{"arxiv_id":"2505.17787","last_updated":"2025-05-23T12:00:09Z","snapshot_observed_at":"2026-08-07T14:38:30.235477Z","submitted_at":"2025-05-23T12:00:09Z","title":"Titanus: Enabling KV Cache Pruning and Quantization On-the-Fly for LLM Acceleration","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:43:25.353835Z"},"links":{"citing_paper":"/paper/2505.17787"},"observation_digest":"sha256:aa31f96e91db78b9f4310e81b7901d2c3416a688ba07db606e53a07402142721","observation_id":"07643cca-4ef2-4cbd-8649-a3a3b02299e0","resolution":{"observed_at":"2026-08-07T14:43:29.717204Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:43:29.431827Z","title":null,"venue":null,"work_id":"21bd8945-f3f3-4cb4-8024-5456f7600b66","year":2017},"citing_paper":{"arxiv_id":"2505.17787","last_updated":"2025-05-23T12:00:09Z","snapshot_observed_at":"2026-08-07T14:38:30.235477Z","submitted_at":"2025-05-23T12:00:09Z","title":"Titanus: Enabling KV Cache Pruning and Quantization On-the-Fly for LLM Acceleration","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:43:25.443295Z"},"links":{"citing_paper":"/paper/2505.17787"},"observation_digest":"sha256:04cc906aed5ffcdedcf8ab0ea50e8439d469e2de4aab20cd367278e6dcfc443e","observation_id":"2fa4ab26-ac34-41b1-bd3d-0635aa8916f6","resolution":{"observed_at":"2026-08-07T14:43:29.513676Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:43:29.260478Z","title":null,"venue":null,"work_id":"8ea8a0a7-7729-42bc-9861-8575ac8a043f","year":2022},"citing_paper":{"arxiv_id":"2505.17787","last_updated":"2025-05-23T12:00:09Z","snapshot_observed_at":"2026-08-07T14:38:30.235477Z","submitted_at":"2025-05-23T12:00:09Z","title":"Titanus: Enabling KV Cache Pruning and Quantization On-the-Fly for LLM Acceleration","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:43:25.517443Z"},"links":{"citing_paper":"/paper/2505.17787"},"observation_digest":"sha256:bcd2173b723e457043056d338791027c29f669b817e31bb3285995172c246b1d","observation_id":"81eefca8-b57a-4ed4-a735-622195e74359","resolution":{"observed_at":"2026-08-07T14:43:29.337818Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:43:29.119515Z","title":null,"venue":null,"work_id":"5a014a04-50ae-43e4-b380-79aadeb80930","year":2022},"citing_paper":{"arxiv_id":"2505.17787","last_updated":"2025-05-23T12:00:09Z","snapshot_observed_at":"2026-08-07T14:38:30.235477Z","submitted_at":"2025-05-23T12:00:09Z","title":"Titanus: Enabling KV Cache Pruning and Quantization On-the-Fly for LLM Acceleration","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:43:25.550282Z"},"links":{"citing_paper":"/paper/2505.17787"},"observation_digest":"sha256:7c8b3b54c866ce1d680c3f35d34abf50c534496b9c9ef68581d39f1229980706","observation_id":"58ffa4c2-4bab-43d1-8950-f7c836236800","resolution":{"observed_at":"2026-08-07T14:43:29.190460Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:43:28.937597Z","title":null,"venue":null,"work_id":"d6ba6579-99bf-4fbc-a93d-eeb662ca7a8f","year":2023},"citing_paper":{"arxiv_id":"2505.17787","last_updated":"2025-05-23T12:00:09Z","snapshot_observed_at":"2026-08-07T14:38:30.235477Z","submitted_at":"2025-05-23T12:00:09Z","title":"Titanus: Enabling KV Cache Pruning and Quantization On-the-Fly for LLM Acceleration","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:43:25.638413Z"},"links":{"citing_paper":"/paper/2505.17787"},"observation_digest":"sha256:4847d20c01075200dce4a60d4d0f16e6a8ff086192418612a25452234922f7e1","observation_id":"fdeef3c6-7d87-40eb-ab28-a2b3ca2a5955","resolution":{"observed_at":"2026-08-07T14:43:29.026897Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:43:28.774908Z","title":null,"venue":null,"work_id":"89bde62a-44e8-4275-855f-485e160a2625","year":2019},"citing_paper":{"arxiv_id":"2505.17787","last_updated":"2025-05-23T12:00:09Z","snapshot_observed_at":"2026-08-07T14:38:30.235477Z","submitted_at":"2025-05-23T12:00:09Z","title":"Titanus: Enabling KV Cache Pruning and Quantization On-the-Fly for LLM Acceleration","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:43:25.723605Z"},"links":{"citing_paper":"/paper/2505.17787"},"observation_digest":"sha256:06bd55ea13628d3864101932ceb34e2eec45e305c3415307f2ec5934045ba071","observation_id":"d511cb77-3f21-43e5-b2a3-eabe8d4af8a9","resolution":{"observed_at":"2026-08-07T14:43:28.845187Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:43:28.647410Z","title":null,"venue":null,"work_id":"f3d6000f-97ac-4db9-a092-28928e2ac772","year":2021},"citing_paper":{"arxiv_id":"2505.17787","last_updated":"2025-05-23T12:00:09Z","snapshot_observed_at":"2026-08-07T14:38:30.235477Z","submitted_at":"2025-05-23T12:00:09Z","title":"Titanus: Enabling KV Cache Pruning and Quantization On-the-Fly for LLM Acceleration","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:43:25.802538Z"},"links":{"citing_paper":"/paper/2505.17787"},"observation_digest":"sha256:7edc08ac20306dad242e91a21c7fc789a0cbdb80f65967526878d410f4296dc9","observation_id":"67421942-2deb-4a80-995f-add295af4af8","resolution":{"observed_at":"2026-08-07T14:43:28.701804Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:43:28.505651Z","title":null,"venue":null,"work_id":"4abfd444-1041-4b1d-94ea-d367ffa59667","year":2017},"citing_paper":{"arxiv_id":"2505.17787","last_updated":"2025-05-23T12:00:09Z","snapshot_observed_at":"2026-08-07T14:38:30.235477Z","submitted_at":"2025-05-23T12:00:09Z","title":"Titanus: Enabling KV Cache Pruning and Quantization On-the-Fly for LLM Acceleration","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:43:25.887573Z"},"links":{"citing_paper":"/paper/2505.17787"},"observation_digest":"sha256:d052b9eeab176fb1e112085ee424d6324aeb3d560363b3b7f33a450a3333071d","observation_id":"41e95834-93a5-4a6c-839f-8d9e3b60c4d2","resolution":{"observed_at":"2026-08-07T14:43:28.555081Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:43:28.346552Z","title":null,"venue":null,"work_id":"847807e7-957f-4172-8872-23e62f586d21","year":2023},"citing_paper":{"arxiv_id":"2505.17787","last_updated":"2025-05-23T12:00:09Z","snapshot_observed_at":"2026-08-07T14:38:30.235477Z","submitted_at":"2025-05-23T12:00:09Z","title":"Titanus: Enabling KV Cache Pruning and Quantization On-the-Fly for LLM Acceleration","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:43:25.963396Z"},"links":{"citing_paper":"/paper/2505.17787"},"observation_digest":"sha256:b7d6ed426f7decd66a909169283e15f3e37468f2156ccdb132c1d75d95af5823","observation_id":"6b6f1283-a928-425c-9934-c178e5b2c5e8","resolution":{"observed_at":"2026-08-07T14:43:28.437439Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21018","last_updated":"2025-02-27T12:30:43Z","snapshot_observed_at":"2026-08-02T14:11:02.770149Z","submitted_at":"2024-07-30T17:59:08Z","title":"ThinK: Thinner Key Cache by Query-Driven Pruning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21018","snapshot_observed_at":"2026-08-07T14:43:26.032859Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17787","last_updated":"2025-05-23T12:00:09Z","snapshot_observed_at":"2026-08-07T14:38:30.235477Z","submitted_at":"2025-05-23T12:00:09Z","title":"Titanus: Enabling KV Cache Pruning and Quantization On-the-Fly for LLM Acceleration","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:43:26.032859Z"},"links":{"cited_paper":"/paper/2407.21018","citing_paper":"/paper/2505.17787"},"observation_digest":"sha256:711bf84142c7c5d5763998cb8e0c8aef87571fd16941941bf4591e491f21ead4","observation_id":"f7b6bb84-7f31-4437-9796-8233bc028077","resolution":{"observed_at":"2026-08-07T14:43:26.032859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:43:28.134252Z","title":null,"venue":null,"work_id":"c3d08951-b53f-4323-9158-580da602cdce","year":2022},"citing_paper":{"arxiv_id":"2505.17787","last_updated":"2025-05-23T12:00:09Z","snapshot_observed_at":"2026-08-07T14:38:30.235477Z","submitted_at":"2025-05-23T12:00:09Z","title":"Titanus: Enabling KV Cache Pruning and Quantization On-the-Fly for LLM Acceleration","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:43:26.109407Z"},"links":{"citing_paper":"/paper/2505.17787"},"observation_digest":"sha256:9b4e8c02cb4e9393e7e5282f5656b19b4b911d3e86a753d2772f9643a043b4f0","observation_id":"61ec1d3a-11ca-4ca6-aeee-4d9893304a55","resolution":{"observed_at":"2026-08-07T14:43:28.232862Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:43:27.990617Z","title":null,"venue":null,"work_id":"d6091ada-2ade-46cf-bb2b-ccd65c9323b9","year":2024},"citing_paper":{"arxiv_id":"2505.17787","last_updated":"2025-05-23T12:00:09Z","snapshot_observed_at":"2026-08-07T14:38:30.235477Z","submitted_at":"2025-05-23T12:00:09Z","title":"Titanus: Enabling KV Cache Pruning and Quantization On-the-Fly for LLM Acceleration","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:43:26.187914Z"},"links":{"citing_paper":"/paper/2505.17787"},"observation_digest":"sha256:ac9159e6225fc288558db5ab82506ab9a3e2cf830eb6614a2fb0aa3dcf75486a","observation_id":"f138160f-1de5-4c85-a283-2d7300b06fc9","resolution":{"observed_at":"2026-08-07T14:43:28.035037Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:43:27.809896Z","title":null,"venue":null,"work_id":"11f2bc78-3dc7-4485-bb1f-52f145b24115","year":2020},"citing_paper":{"arxiv_id":"2505.17787","last_updated":"2025-05-23T12:00:09Z","snapshot_observed_at":"2026-08-07T14:38:30.235477Z","submitted_at":"2025-05-23T12:00:09Z","title":"Titanus: Enabling KV Cache Pruning and Quantization On-the-Fly for LLM Acceleration","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:43:26.262607Z"},"links":{"citing_paper":"/paper/2505.17787"},"observation_digest":"sha256:07922b761ffeb6ccc1f90f81b4da54d3fd14c847ba9e782731bbe545a2e66837","observation_id":"235865e1-0480-4074-bfe2-2f887d621b60","resolution":{"observed_at":"2026-08-07T14:43:27.880457Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:43:27.699666Z","title":null,"venue":null,"work_id":"f84c94bc-dab0-47f9-beff-8f8add922a59","year":2022},"citing_paper":{"arxiv_id":"2505.17787","last_updated":"2025-05-23T12:00:09Z","snapshot_observed_at":"2026-08-07T14:38:30.235477Z","submitted_at":"2025-05-23T12:00:09Z","title":"Titanus: Enabling KV Cache Pruning and Quantization On-the-Fly for LLM Acceleration","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:43:26.354391Z"},"links":{"citing_paper":"/paper/2505.17787"},"observation_digest":"sha256:9b9a70aba6f700888a50f9e91a779e3d5b4d098436e511f28bd731f724996695","observation_id":"f98220bc-9151-42b5-8478-f8cee8cc6b7b","resolution":{"observed_at":"2026-08-07T14:43:27.739880Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:43:27.553502Z","title":null,"venue":null,"work_id":"31f992a8-482e-4f80-b37a-62d312b5e2a9","year":2024},"citing_paper":{"arxiv_id":"2505.17787","last_updated":"2025-05-23T12:00:09Z","snapshot_observed_at":"2026-08-07T14:38:30.235477Z","submitted_at":"2025-05-23T12:00:09Z","title":"Titanus: Enabling KV Cache Pruning and Quantization On-the-Fly for LLM Acceleration","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:43:26.435277Z"},"links":{"citing_paper":"/paper/2505.17787"},"observation_digest":"sha256:0fd2fbe6dec43a615ae8ecdd79337dbf4c67d79c86df7d237e006703fcfa4db9","observation_id":"c9c4e108-3d06-4227-b163-0ca88d906369","resolution":{"observed_at":"2026-08-07T14:43:27.627494Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:43:27.393415Z","title":null,"venue":null,"work_id":"923ebd12-63bd-47c9-8143-7806a031d56e","year":2024},"citing_paper":{"arxiv_id":"2505.17787","last_updated":"2025-05-23T12:00:09Z","snapshot_observed_at":"2026-08-07T14:38:30.235477Z","submitted_at":"2025-05-23T12:00:09Z","title":"Titanus: Enabling KV Cache Pruning and Quantization On-the-Fly for LLM Acceleration","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:43:26.533443Z"},"links":{"citing_paper":"/paper/2505.17787"},"observation_digest":"sha256:fd9cc7e064f49d557ec1925a133d978f963186fbb36bc06b35ae79ef7a6b28f2","observation_id":"9f0fd63f-07fb-4556-9421-06af70a1bb8a","resolution":{"observed_at":"2026-08-07T14:43:27.459640Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-08-06T03:13:37.403059Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-08-07T14:43:26.657972Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.17787","last_updated":"2025-05-23T12:00:09Z","snapshot_observed_at":"2026-08-07T14:38:30.235477Z","submitted_at":"2025-05-23T12:00:09Z","title":"Titanus: Enabling KV Cache Pruning and Quantization On-the-Fly for LLM Acceleration","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:43:26.657972Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2505.17787"},"observation_digest":"sha256:08c7e16a47a64799507ecdb1958e6f3fe8230fab6c59973bae6949288f92b0bc","observation_id":"a8cf7b4b-d36c-4e34-baf9-8f9d1ef77f31","resolution":{"observed_at":"2026-08-07T14:43:26.657972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.17787","last_updated":"2025-05-23T12:00:09Z","latest_version":1,"primary_category":"cs.AR","snapshot_observed_at":"2026-08-07T14:38:30.235477Z","submitted_at":"2025-05-23T12:00:09Z","title":"Titanus: Enabling KV Cache Pruning and Quantization On-the-Fly for LLM Acceleration"},"reference_resolution":{"displayed":37,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":35,"verified_exact":2,"verified_fuzzy":0},"total_outbound_references":37},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 37 of 37 outbound references and 0 inbound Pith citation observations for arXiv:2505.17787."}