{"as_of":"2026-08-15T11:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7cca6c8b040b7264ecfd566b649f83604d2b89c237712e8dcd81a77b2d5fe641","coverage":[{"denominator":36,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T04:36:00.112987Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.08569/citation-record","integrity":"/paper/2608.08569/integrity","json":"/paper/2608.08569/citation-record.json","paper":"/paper/2608.08569"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.03054","last_updated":"2025-05-12T19:49:55Z","snapshot_observed_at":"2026-08-13T20:00:18.501357Z","submitted_at":"2025-05-05T22:28:53Z","title":"BLAB: Brutally Long Audio Bench","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.03054","snapshot_observed_at":"2026-08-14T04:35:59.135694Z","title":"Smith, Yulia Tsvetkov, and Sachin Kumar","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.08569","last_updated":"2026-08-09T08:17:18Z","snapshot_observed_at":"2026-08-14T05:31:45.654940Z","submitted_at":"2026-08-09T08:17:18Z","title":"VoxZip: Semantic-Anchored Temporal KV Cache Compression for Long-Context Audio Inference","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-14T04:35:59.135694Z"},"links":{"cited_paper":"/paper/2505.03054","citing_paper":"/paper/2608.08569"},"observation_digest":"sha256:7ffc4fc12b9fee3efc180e984b165695f2f4334bfc4870098cce620b0e732864","observation_id":"18af69e4-2d18-4367-90eb-0bb74d7443ba","resolution":{"observed_at":"2026-08-14T04:35:59.135694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02069","last_updated":"2025-05-15T17:18:12Z","snapshot_observed_at":"2026-08-13T04:39:30.300015Z","submitted_at":"2024-06-04T07:51:30Z","title":"PyramidKV: Dynamic KV Cache Compression based on Pyramidal Information Funneling","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02069","snapshot_observed_at":"2026-08-14T04:35:59.194760Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.08569","last_updated":"2026-08-09T08:17:18Z","snapshot_observed_at":"2026-08-14T05:31:45.654940Z","submitted_at":"2026-08-09T08:17:18Z","title":"VoxZip: Semantic-Anchored Temporal KV Cache Compression for Long-Context Audio Inference","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-14T04:35:59.194760Z"},"links":{"cited_paper":"/paper/2406.02069","citing_paper":"/paper/2608.08569"},"observation_digest":"sha256:6c9cd3075070633c7b32176441c33ab5456ef0b5b5d59977645aa70bdd374aa5","observation_id":"c9fef5ea-cbfe-4d18-89ca-319338a1a6b0","resolution":{"observed_at":"2026-08-14T04:35:59.194760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:35:59.228521Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.08569","last_updated":"2026-08-09T08:17:18Z","snapshot_observed_at":"2026-08-14T05:31:45.654940Z","submitted_at":"2026-08-09T08:17:18Z","title":"VoxZip: Semantic-Anchored Temporal KV Cache Compression for Long-Context Audio Inference","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-14T04:35:59.228521Z"},"links":{"citing_paper":"/paper/2608.08569"},"observation_digest":"sha256:0dd6cca9524dd90e489075a8a34b9fb2c2bde7bc779b4dd4fe9d655162599d5c","observation_id":"1a44667e-00e0-43a4-bbff-0dda3c69bf6d","resolution":{"observed_at":"2026-08-14T04:35:59.228521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06764","last_updated":"2024-09-02T05:48:54Z","snapshot_observed_at":"2026-08-14T09:58:22.897108Z","submitted_at":"2024-03-11T14:35:32Z","title":"An Image is Worth 1/2 Tokens After Layer 2: Plug-and-Play Inference Acceleration for Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.06764","snapshot_observed_at":"2026-08-14T04:35:59.253139Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.08569","last_updated":"2026-08-09T08:17:18Z","snapshot_observed_at":"2026-08-14T05:31:45.654940Z","submitted_at":"2026-08-09T08:17:18Z","title":"VoxZip: Semantic-Anchored Temporal KV Cache Compression for Long-Context Audio Inference","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-14T04:35:59.253139Z"},"links":{"cited_paper":"/paper/2403.06764","citing_paper":"/paper/2608.08569"},"observation_digest":"sha256:72c4a80fc9a9c7653b998e15d3cd9f6b76ad91641b2fac7f916d2c8e53a471dc","observation_id":"4be03bd7-5968-4e10-a1ef-2dee94eeaded","resolution":{"observed_at":"2026-08-14T04:35:59.253139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:36:02.754398Z","title":null,"venue":null,"work_id":"7b911f0e-c9e9-4a3f-b15d-8d4bc3eb433e","year":null},"citing_paper":{"arxiv_id":"2608.08569","last_updated":"2026-08-09T08:17:18Z","snapshot_observed_at":"2026-08-14T05:31:45.654940Z","submitted_at":"2026-08-09T08:17:18Z","title":"VoxZip: Semantic-Anchored Temporal KV Cache Compression for Long-Context Audio Inference","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-14T04:35:59.270599Z"},"links":{"citing_paper":"/paper/2608.08569"},"observation_digest":"sha256:711cd9e6b9d115742dd105e25dcf277d1876fc2e1384d7b311d618c03f141492","observation_id":"40832834-43ad-42af-8a0b-24d75dc11042","resolution":{"observed_at":"2026-08-14T04:36:02.790078Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:35:59.327134Z","title":"Guo, and Irwin King","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.08569","last_updated":"2026-08-09T08:17:18Z","snapshot_observed_at":"2026-08-14T05:31:45.654940Z","submitted_at":"2026-08-09T08:17:18Z","title":"VoxZip: Semantic-Anchored Temporal KV Cache Compression for Long-Context Audio Inference","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-14T04:35:59.327134Z"},"links":{"citing_paper":"/paper/2608.08569"},"observation_digest":"sha256:e201e5697c21e1b9dc77d29bf95e993b8dd9fcccd78f714977a8dead08715243","observation_id":"4898b0ce-5d25-4f00-9f4e-81676808f6ba","resolution":{"observed_at":"2026-08-14T04:35:59.327134Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:35:59.352930Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.08569","last_updated":"2026-08-09T08:17:18Z","snapshot_observed_at":"2026-08-14T05:31:45.654940Z","submitted_at":"2026-08-09T08:17:18Z","title":"VoxZip: Semantic-Anchored Temporal KV Cache Compression for Long-Context Audio Inference","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-14T04:35:59.352930Z"},"links":{"citing_paper":"/paper/2608.08569"},"observation_digest":"sha256:a4f8142404dd6dbe4ef38dc5c0f50ca02840937529c15e69a99d896b5d333fae","observation_id":"d23cfef7-2407-4af4-9c6f-8a3231f10101","resolution":{"observed_at":"2026-08-14T04:35:59.352930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:36:02.554398Z","title":null,"venue":null,"work_id":"3f31ab0b-4d48-44a4-8a74-6aad955f7ffb","year":null},"citing_paper":{"arxiv_id":"2608.08569","last_updated":"2026-08-09T08:17:18Z","snapshot_observed_at":"2026-08-14T05:31:45.654940Z","submitted_at":"2026-08-09T08:17:18Z","title":"VoxZip: Semantic-Anchored Temporal KV Cache Compression for Long-Context Audio Inference","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-14T04:35:59.368173Z"},"links":{"citing_paper":"/paper/2608.08569"},"observation_digest":"sha256:97dc8fd90c49095233a5e7e3a33ebc955f6b3c07b1ca8ef558d2b47ca9bb5a31","observation_id":"4ebcdc74-358d-4fd6-b67c-62f879448c93","resolution":{"observed_at":"2026-08-14T04:36:02.587379Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:36:02.483264Z","title":null,"venue":null,"work_id":"11dd0e2f-ec4b-4c53-b0ec-d10ada73bc20","year":2025},"citing_paper":{"arxiv_id":"2608.08569","last_updated":"2026-08-09T08:17:18Z","snapshot_observed_at":"2026-08-14T05:31:45.654940Z","submitted_at":"2026-08-09T08:17:18Z","title":"VoxZip: Semantic-Anchored Temporal KV Cache Compression for Long-Context Audio Inference","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-14T04:35:59.404748Z"},"links":{"citing_paper":"/paper/2608.08569"},"observation_digest":"sha256:18eed79ff4e4ac3612f095cecaeb05a913047e4b74c217872485fdaf57316ddc","observation_id":"a7100730-5c06-41cc-bb73-06106ed8167f","resolution":{"observed_at":"2026-08-14T04:36:02.500868Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.13804","last_updated":"2026-04-15T12:39:03Z","snapshot_observed_at":"2026-08-15T08:40:26.674407Z","submitted_at":"2026-04-15T12:39:03Z","title":"Character Beyond Speech: Leveraging Role-Playing Evaluation in Audio Large Language Models via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2604.13804","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.13804","snapshot_observed_at":"2026-08-14T04:36:01.636349Z","title":"Character Beyond Speech: Leveraging Role-Playing Evaluation in Audio Large Language Models via Reinforcement Learning","venue":"cs.LG","work_id":"6daa6459-4f3c-46dd-b78a-0b441c1908ff","year":2026},"citing_paper":{"arxiv_id":"2608.08569","last_updated":"2026-08-09T08:17:18Z","snapshot_observed_at":"2026-08-14T05:31:45.654940Z","submitted_at":"2026-08-09T08:17:18Z","title":"VoxZip: Semantic-Anchored Temporal KV Cache Compression for Long-Context Audio Inference","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-14T04:35:59.377567Z"},"links":{"cited_paper":"/paper/2604.13804","citing_paper":"/paper/2608.08569"},"observation_digest":"sha256:1d1eac71ad7f4da4386ae43d85f876b0f0e21bedf88c6a4c9c9e4b7c45e28681","observation_id":"cdf360e2-33ff-49c3-8d6e-b49f737f99a4","resolution":{"observed_at":"2026-08-14T04:36:01.670418Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:35:59.472074Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.08569","last_updated":"2026-08-09T08:17:18Z","snapshot_observed_at":"2026-08-14T05:31:45.654940Z","submitted_at":"2026-08-09T08:17:18Z","title":"VoxZip: Semantic-Anchored Temporal KV Cache Compression for Long-Context Audio Inference","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-14T04:35:59.472074Z"},"links":{"citing_paper":"/paper/2608.08569"},"observation_digest":"sha256:1f5920879d3f30c81b0397bee1f5d5095eb23923400ff287fc5f45b6009d59f1","observation_id":"d08f5495-fd7b-4811-af8c-819c7640552e","resolution":{"observed_at":"2026-08-14T04:35:59.472074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03983","last_updated":"2025-03-06T00:10:26Z","snapshot_observed_at":"2026-08-07T17:26:13.091608Z","submitted_at":"2025-03-06T00:10:26Z","title":"Audio Flamingo 2: An Audio-Language Model with Long-Audio Understanding and Expert Reasoning Abilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.03983","snapshot_observed_at":"2026-08-14T04:35:59.434263Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.08569","last_updated":"2026-08-09T08:17:18Z","snapshot_observed_at":"2026-08-14T05:31:45.654940Z","submitted_at":"2026-08-09T08:17:18Z","title":"VoxZip: Semantic-Anchored Temporal KV Cache Compression for Long-Context Audio Inference","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-14T04:35:59.434263Z"},"links":{"cited_paper":"/paper/2503.03983","citing_paper":"/paper/2608.08569"},"observation_digest":"sha256:aa1d28867096c1628c18e70b0acdea2ba518499315cb1fe3dc392450d64280e1","observation_id":"a6654286-5e25-4ae2-b20f-3e67995c7063","resolution":{"observed_at":"2026-08-14T04:35:59.434263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.18425","last_updated":"2025-04-25T15:31:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-25T15:31:46Z","title":"Kimi-Audio Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.18425","snapshot_observed_at":"2026-08-14T04:35:59.534339Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.08569","last_updated":"2026-08-09T08:17:18Z","snapshot_observed_at":"2026-08-14T05:31:45.654940Z","submitted_at":"2026-08-09T08:17:18Z","title":"VoxZip: Semantic-Anchored Temporal KV Cache Compression for Long-Context Audio Inference","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-14T04:35:59.534339Z"},"links":{"cited_paper":"/paper/2504.18425","citing_paper":"/paper/2608.08569"},"observation_digest":"sha256:2126fafc8b377e602452a59331f9a78246d3e5fe488aec3237b4314135b0203f","observation_id":"84682da4-2c3d-4ba5-b441-da2f10704fd8","resolution":{"observed_at":"2026-08-14T04:35:59.534339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13577","snapshot_observed_at":"2026-08-14T04:35:59.509929Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.08569","last_updated":"2026-08-09T08:17:18Z","snapshot_observed_at":"2026-08-14T05:31:45.654940Z","submitted_at":"2026-08-09T08:17:18Z","title":"VoxZip: Semantic-Anchored Temporal KV Cache Compression for Long-Context Audio Inference","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-14T04:35:59.509929Z"},"links":{"cited_paper":"/paper/2411.13577","citing_paper":"/paper/2608.08569"},"observation_digest":"sha256:54e419aa0452c115d4900ba387dbd9c78fb8e7d7252e7759394c75473a53bde5","observation_id":"773619b2-f9bc-4a5f-aa97-df3bf5dc5ab0","resolution":{"observed_at":"2026-08-14T04:35:59.509929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:35:59.627643Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.08569","last_updated":"2026-08-09T08:17:18Z","snapshot_observed_at":"2026-08-14T05:31:45.654940Z","submitted_at":"2026-08-09T08:17:18Z","title":"VoxZip: Semantic-Anchored Temporal KV Cache Compression for Long-Context Audio Inference","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-14T04:35:59.627643Z"},"links":{"citing_paper":"/paper/2608.08569"},"observation_digest":"sha256:50911073b2c3a967743f1c9ef8d917a1299bbcbbab47dd288f0791696607db68","observation_id":"71af7256-631a-4979-b7cc-3f91a3ab4dfe","resolution":{"observed_at":"2026-08-14T04:35:59.627643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19442","last_updated":"2025-07-30T05:24:46Z","snapshot_observed_at":"2026-08-11T00:33:34.388194Z","submitted_at":"2024-12-27T04:17:57Z","title":"A Survey on Large Language Model Acceleration based on KV Cache Management","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19442","snapshot_observed_at":"2026-08-14T04:35:59.594771Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.08569","last_updated":"2026-08-09T08:17:18Z","snapshot_observed_at":"2026-08-14T05:31:45.654940Z","submitted_at":"2026-08-09T08:17:18Z","title":"VoxZip: Semantic-Anchored Temporal KV Cache Compression for Long-Context Audio Inference","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-14T04:35:59.594771Z"},"links":{"cited_paper":"/paper/2412.19442","citing_paper":"/paper/2608.08569"},"observation_digest":"sha256:4b6473b068dd41fd52820864ebd74e202d3026ea9c15ad26a535eccaf3927da4","observation_id":"5b5e3f43-ba4c-49f6-ba61-a86dd6316db8","resolution":{"observed_at":"2026-08-14T04:35:59.594771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:35:59.684748Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.08569","last_updated":"2026-08-09T08:17:18Z","snapshot_observed_at":"2026-08-14T05:31:45.654940Z","submitted_at":"2026-08-09T08:17:18Z","title":"VoxZip: Semantic-Anchored Temporal KV Cache Compression for Long-Context Audio Inference","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-14T04:35:59.684748Z"},"links":{"citing_paper":"/paper/2608.08569"},"observation_digest":"sha256:3dd0070083b3800466b6528e0272482d062c5e43aec7f28c083f3837be107839","observation_id":"0505164a-d716-4ea0-b601-0bd7a87cb4ef","resolution":{"observed_at":"2026-08-14T04:35:59.684748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12388","last_updated":"2024-10-17T04:09:09Z","snapshot_observed_at":"2026-08-12T22:22:01.458372Z","submitted_at":"2024-10-16T09:13:23Z","title":"Prompt Compression for Large Language Models: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.12388","snapshot_observed_at":"2026-08-14T04:35:59.645686Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.08569","last_updated":"2026-08-09T08:17:18Z","snapshot_observed_at":"2026-08-14T05:31:45.654940Z","submitted_at":"2026-08-09T08:17:18Z","title":"VoxZip: Semantic-Anchored Temporal KV Cache Compression for Long-Context Audio Inference","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-14T04:35:59.645686Z"},"links":{"cited_paper":"/paper/2410.12388","citing_paper":"/paper/2608.08569"},"observation_digest":"sha256:daeb21d73d37c4a896bf1c2cf29799f85f7cea754e77103bfe47809d6b3bc1f5","observation_id":"dbcdebf8-8dac-41d6-99aa-bd40e39b870d","resolution":{"observed_at":"2026-08-14T04:35:59.645686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.06297","last_updated":"2025-08-08T13:19:30Z","snapshot_observed_at":"2026-08-12T16:23:46.766364Z","submitted_at":"2025-08-08T13:19:30Z","title":"KV Cache Compression for Inference Efficiency in LLMs: A Review","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.06297","snapshot_observed_at":"2026-08-14T04:35:59.744750Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.08569","last_updated":"2026-08-09T08:17:18Z","snapshot_observed_at":"2026-08-14T05:31:45.654940Z","submitted_at":"2026-08-09T08:17:18Z","title":"VoxZip: Semantic-Anchored Temporal KV Cache Compression for Long-Context Audio Inference","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-14T04:35:59.744750Z"},"links":{"cited_paper":"/paper/2508.06297","citing_paper":"/paper/2608.08569"},"observation_digest":"sha256:a262d43ec62dcc9079f761b5528229077020badc24a365830958965986a57d98","observation_id":"a2aa5b23-ad49-4c74-8a54-e8d90d83590f","resolution":{"observed_at":"2026-08-14T04:35:59.744750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:35:59.709969Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.08569","last_updated":"2026-08-09T08:17:18Z","snapshot_observed_at":"2026-08-14T05:31:45.654940Z","submitted_at":"2026-08-09T08:17:18Z","title":"VoxZip: Semantic-Anchored Temporal KV Cache Compression for Long-Context Audio Inference","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-14T04:35:59.709969Z"},"links":{"citing_paper":"/paper/2608.08569"},"observation_digest":"sha256:f30c358207c854bf41a013d912b65e4539bf14fadbba504c22fc2f3cc3c2f58f","observation_id":"e492c1b9-fe2a-407c-98cc-d10769ba8d64","resolution":{"observed_at":"2026-08-14T04:35:59.709969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2025.36405","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:36:00.800246Z","title":null,"venue":null,"work_id":"57f82bbc-fac0-4705-abfa-98d8a471422c","year":2026},"citing_paper":{"arxiv_id":"2608.08569","last_updated":"2026-08-09T08:17:18Z","snapshot_observed_at":"2026-08-14T05:31:45.654940Z","submitted_at":"2026-08-09T08:17:18Z","title":"VoxZip: Semantic-Anchored Temporal KV Cache Compression for Long-Context Audio Inference","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-14T04:35:59.781005Z"},"links":{"citing_paper":"/paper/2608.08569"},"observation_digest":"sha256:dd9853e5eca6d9aefb2a9a0d0c616d6ef0e4b659146fd8cbffee1dab80270877","observation_id":"3eb3b94f-d2d7-4f6c-8cfd-26caed451a3b","resolution":{"observed_at":"2026-08-14T04:36:00.833589Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:36:02.400118Z","title":null,"venue":null,"work_id":"d1c1cfc9-6cf6-4003-85ca-9e2f456b9e06","year":2025},"citing_paper":{"arxiv_id":"2608.08569","last_updated":"2026-08-09T08:17:18Z","snapshot_observed_at":"2026-08-14T05:31:45.654940Z","submitted_at":"2026-08-09T08:17:18Z","title":"VoxZip: Semantic-Anchored Temporal KV Cache Compression for Long-Context Audio Inference","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-14T04:35:59.758443Z"},"links":{"citing_paper":"/paper/2608.08569"},"observation_digest":"sha256:798d6b12f51c56678064ba9d93ac39bb75612f36699cfb6a0925f4a45e04d5fa","observation_id":"6422601a-2fea-491a-a7d9-78e86e8ed548","resolution":{"observed_at":"2026-08-14T04:36:02.419300Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-14T04:35:59.819768Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.08569","last_updated":"2026-08-09T08:17:18Z","snapshot_observed_at":"2026-08-14T05:31:45.654940Z","submitted_at":"2026-08-09T08:17:18Z","title":"VoxZip: Semantic-Anchored Temporal KV Cache Compression for Long-Context Audio Inference","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-14T04:35:59.819768Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2608.08569"},"observation_digest":"sha256:6f7044d6f07dd40e1b458601f1238a0b7e9f67755d3dad37f23e1ab01032c8d4","observation_id":"62525a81-9df8-43a2-b160-82d477ebbc95","resolution":{"observed_at":"2026-08-14T04:35:59.819768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.05102","last_updated":"2022-11-09T18:50:38Z","snapshot_observed_at":"2026-08-14T10:12:46.907688Z","submitted_at":"2022-11-09T18:50:38Z","title":"Efficiently Scaling Transformer Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.05102","snapshot_observed_at":"2026-08-14T04:35:59.803368Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.08569","last_updated":"2026-08-09T08:17:18Z","snapshot_observed_at":"2026-08-14T05:31:45.654940Z","submitted_at":"2026-08-09T08:17:18Z","title":"VoxZip: Semantic-Anchored Temporal KV Cache Compression for Long-Context Audio Inference","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-14T04:35:59.803368Z"},"links":{"cited_paper":"/paper/2211.05102","citing_paper":"/paper/2608.08569"},"observation_digest":"sha256:ddaf40ad0de4e4188456cb956f475f2f90baa174f9f2ac24d46567c7f1e280e6","observation_id":"38d93a2f-d049-4842-a7ab-0c1bcbdb32c5","resolution":{"observed_at":"2026-08-14T04:35:59.803368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:36:02.219709Z","title":null,"venue":null,"work_id":"53b28ad0-b765-485c-b3bc-50dbb4b223b0","year":2025},"citing_paper":{"arxiv_id":"2608.08569","last_updated":"2026-08-09T08:17:18Z","snapshot_observed_at":"2026-08-14T05:31:45.654940Z","submitted_at":"2026-08-09T08:17:18Z","title":"VoxZip: Semantic-Anchored Temporal KV Cache Compression for Long-Context Audio Inference","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-14T04:35:59.867405Z"},"links":{"citing_paper":"/paper/2608.08569"},"observation_digest":"sha256:a77ac0aeaff1c98e422a026cf353c121639aadf12448c3708267ef92db64d12f","observation_id":"30b23636-8df7-4273-b309-1b3034a0a2e9","resolution":{"observed_at":"2026-08-14T04:36:02.244817Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:36:02.282442Z","title":null,"venue":null,"work_id":"c922c994-5586-43f5-a7c1-3cfb8e7c8dd8","year":2025},"citing_paper":{"arxiv_id":"2608.08569","last_updated":"2026-08-09T08:17:18Z","snapshot_observed_at":"2026-08-14T05:31:45.654940Z","submitted_at":"2026-08-09T08:17:18Z","title":"VoxZip: Semantic-Anchored Temporal KV Cache Compression for Long-Context Audio Inference","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-14T04:35:59.846536Z"},"links":{"citing_paper":"/paper/2608.08569"},"observation_digest":"sha256:bd9750baa00d0aaa5f68ec9d798b2e1ca0c46cdb28ff7124853940ec2c8f2a00","observation_id":"5d7a468f-babb-4142-8e4c-124abcecdbde","resolution":{"observed_at":"2026-08-14T04:36:02.312028Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:35:59.911894Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.08569","last_updated":"2026-08-09T08:17:18Z","snapshot_observed_at":"2026-08-14T05:31:45.654940Z","submitted_at":"2026-08-09T08:17:18Z","title":"VoxZip: Semantic-Anchored Temporal KV Cache Compression for Long-Context Audio Inference","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-14T04:35:59.911894Z"},"links":{"citing_paper":"/paper/2608.08569"},"observation_digest":"sha256:48e231b66d04e1ce3f47a0bdc7b7535ae7f53694f0d7dc22c73037b7bf97e7d1","observation_id":"0d18d722-0d89-4cc4-b4de-a49022addaba","resolution":{"observed_at":"2026-08-14T04:35:59.911894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.13035","last_updated":"2025-03-13T03:16:43Z","snapshot_observed_at":"2026-08-13T08:49:48.714090Z","submitted_at":"2024-06-18T20:01:51Z","title":"D2O: Dynamic Discriminative Operations for Efficient Long-Context Inference of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.13035","snapshot_observed_at":"2026-08-14T04:35:59.884815Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.08569","last_updated":"2026-08-09T08:17:18Z","snapshot_observed_at":"2026-08-14T05:31:45.654940Z","submitted_at":"2026-08-09T08:17:18Z","title":"VoxZip: Semantic-Anchored Temporal KV Cache Compression for Long-Context Audio Inference","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-14T04:35:59.884815Z"},"links":{"cited_paper":"/paper/2406.13035","citing_paper":"/paper/2608.08569"},"observation_digest":"sha256:a0058a8154b3ebf5b565480e985146d7ab31bcb03bb2de949ec2c8604d4e8167","observation_id":"db2e2fe0-179b-4441-877e-1012f8f9ff6c","resolution":{"observed_at":"2026-08-14T04:35:59.884815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:35:59.984189Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.08569","last_updated":"2026-08-09T08:17:18Z","snapshot_observed_at":"2026-08-14T05:31:45.654940Z","submitted_at":"2026-08-09T08:17:18Z","title":"VoxZip: Semantic-Anchored Temporal KV Cache Compression for Long-Context Audio Inference","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-14T04:35:59.984189Z"},"links":{"citing_paper":"/paper/2608.08569"},"observation_digest":"sha256:99d06eba39db498395e5938cae4356d5634475762afa04d6c1d257d4b5ca879d","observation_id":"6cfe361b-a139-4749-87ed-5bf120d048f8","resolution":{"observed_at":"2026-08-14T04:35:59.984189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:36:02.142155Z","title":null,"venue":null,"work_id":"b2d797eb-33cb-40d2-bb10-685dfd2926b0","year":2026},"citing_paper":{"arxiv_id":"2608.08569","last_updated":"2026-08-09T08:17:18Z","snapshot_observed_at":"2026-08-14T05:31:45.654940Z","submitted_at":"2026-08-09T08:17:18Z","title":"VoxZip: Semantic-Anchored Temporal KV Cache Compression for Long-Context Audio Inference","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-14T04:35:59.960485Z"},"links":{"citing_paper":"/paper/2608.08569"},"observation_digest":"sha256:ec4f5e86c26a62c9bde43f47562411562c3aefede1e93b7d21c6d3daae2757a8","observation_id":"619a889e-9dcf-41ab-b190-485031a0aff2","resolution":{"observed_at":"2026-08-14T04:36:02.164649Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.17765","last_updated":"2025-09-22T13:26:24Z","snapshot_observed_at":"2026-08-11T00:14:34.061687Z","submitted_at":"2025-09-22T13:26:24Z","title":"Qwen3-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.17765","snapshot_observed_at":"2026-08-14T04:36:00.044336Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.08569","last_updated":"2026-08-09T08:17:18Z","snapshot_observed_at":"2026-08-14T05:31:45.654940Z","submitted_at":"2026-08-09T08:17:18Z","title":"VoxZip: Semantic-Anchored Temporal KV Cache Compression for Long-Context Audio Inference","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-14T04:36:00.044336Z"},"links":{"cited_paper":"/paper/2509.17765","citing_paper":"/paper/2608.08569"},"observation_digest":"sha256:8e0f1dbc0eeeb8e2ba103b4b88f21d7651be02008b8312f4ca0826775903c99b","observation_id":"bc807f46-d886-4564-8bfb-066f9dfcb22d","resolution":{"observed_at":"2026-08-14T04:36:00.044336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-06T08:46:20.194739Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20215","snapshot_observed_at":"2026-08-14T04:36:00.025251Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.08569","last_updated":"2026-08-09T08:17:18Z","snapshot_observed_at":"2026-08-14T05:31:45.654940Z","submitted_at":"2026-08-09T08:17:18Z","title":"VoxZip: Semantic-Anchored Temporal KV Cache Compression for Long-Context Audio Inference","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-14T04:36:00.025251Z"},"links":{"cited_paper":"/paper/2503.20215","citing_paper":"/paper/2608.08569"},"observation_digest":"sha256:61e37adff26353e5e9448446fdf94c27f82666fedd0ee887f6d9559a2552db54","observation_id":"cb6dc702-9977-4bac-811e-a7cfb26cfe4e","resolution":{"observed_at":"2026-08-14T04:36:00.025251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:36:02.014616Z","title":null,"venue":null,"work_id":"e8fd5099-93c0-4980-aa07-45084c961d05","year":2023},"citing_paper":{"arxiv_id":"2608.08569","last_updated":"2026-08-09T08:17:18Z","snapshot_observed_at":"2026-08-14T05:31:45.654940Z","submitted_at":"2026-08-09T08:17:18Z","title":"VoxZip: Semantic-Anchored Temporal KV Cache Compression for Long-Context Audio Inference","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-14T04:36:00.093803Z"},"links":{"citing_paper":"/paper/2608.08569"},"observation_digest":"sha256:3ccb2ab1b5cc196ea0f75159dad1bdf0eb3e5c51917d65205b22ee376d6387ae","observation_id":"0f359433-4222-4f78-8f6e-48be67a7de39","resolution":{"observed_at":"2026-08-14T04:36:02.032918Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02612","last_updated":"2024-12-03T17:41:24Z","snapshot_observed_at":"2026-08-12T12:50:46.995038Z","submitted_at":"2024-12-03T17:41:24Z","title":"GLM-4-Voice: Towards Intelligent and Human-Like End-to-End Spoken Chatbot","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02612","snapshot_observed_at":"2026-08-14T04:36:00.066619Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.08569","last_updated":"2026-08-09T08:17:18Z","snapshot_observed_at":"2026-08-14T05:31:45.654940Z","submitted_at":"2026-08-09T08:17:18Z","title":"VoxZip: Semantic-Anchored Temporal KV Cache Compression for Long-Context Audio Inference","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-14T04:36:00.066619Z"},"links":{"cited_paper":"/paper/2412.02612","citing_paper":"/paper/2608.08569"},"observation_digest":"sha256:5f27b81752f27566c88a12dbacdad601034406489a621546a6f4d0aa77b9a7c0","observation_id":"ad237a4d-35af-4287-8592-1b627ad6e252","resolution":{"observed_at":"2026-08-14T04:36:00.066619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14294","last_updated":"2024-07-19T04:47:36Z","snapshot_observed_at":"2026-07-06T18:03:47.096406Z","submitted_at":"2024-04-22T15:53:08Z","title":"A Survey on Efficient Inference for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14294","snapshot_observed_at":"2026-08-14T04:36:00.112987Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.08569","last_updated":"2026-08-09T08:17:18Z","snapshot_observed_at":"2026-08-14T05:31:45.654940Z","submitted_at":"2026-08-09T08:17:18Z","title":"VoxZip: Semantic-Anchored Temporal KV Cache Compression for Long-Context Audio Inference","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-14T04:36:00.112987Z"},"links":{"cited_paper":"/paper/2404.14294","citing_paper":"/paper/2608.08569"},"observation_digest":"sha256:5846c838f831c8f33bdbcc20400f62daa1085fc95449cba7d6b795d345d6a680","observation_id":"77a99744-e2ad-495d-8c82-19322fe021c0","resolution":{"observed_at":"2026-08-14T04:36:00.112987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:36:02.649773Z","title":"https://openreview.net/forum?id=6dKwqnT7bu","venue":null,"work_id":"c05863a0-cbd9-4b8e-89fe-0ff944cea317","year":null},"citing_paper":{"arxiv_id":"2608.08569","last_updated":"2026-08-09T08:17:18Z","snapshot_observed_at":"2026-08-14T05:31:45.654940Z","submitted_at":"2026-08-09T08:17:18Z","title":"VoxZip: Semantic-Anchored Temporal KV Cache Compression for Long-Context Audio Inference","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-14T04:35:59.290286Z"},"links":{"citing_paper":"/paper/2608.08569"},"observation_digest":"sha256:636994585a5588eb234e114746e8d52cc42f3983b562da771cb24101ac70a63f","observation_id":"a55096f3-5cd8-451a-8580-40590122f32d","resolution":{"observed_at":"2026-08-14T04:36:02.678805Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.08569","last_updated":"2026-08-09T08:17:18Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-14T05:31:45.654940Z","submitted_at":"2026-08-09T08:17:18Z","title":"VoxZip: Semantic-Anchored Temporal KV Cache Compression for Long-Context Audio Inference"},"reference_resolution":{"displayed":36,"state_counts":{"malformed_identifier":1,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":32,"verified_exact":0,"verified_fuzzy":1},"total_outbound_references":36},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 0 inbound Pith citation observations for arXiv:2608.08569."}