{"as_of":"2026-08-07T19:36:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:957dbdb4ea5a69e3f230c4d12413ad87877faec2fa96b947efefe94a19e839f0","coverage":[{"denominator":49,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":49,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T22:36:39.894521Z","state":"measured"},{"denominator":49,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":49,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.21184/citation-record","integrity":"/paper/2506.21184/integrity","json":"/paper/2506.21184/citation-record.json","paper":"/paper/2506.21184"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:41.560937Z","title":"Flamingo: a visual language model for few-shot learning.NeurIPS, 2022","venue":null,"work_id":"7cad37d1-427e-4616-af72-46bf0808bbde","year":2022},"citing_paper":{"arxiv_id":"2506.21184","last_updated":"2025-06-26T12:43:43Z","snapshot_observed_at":"2026-08-07T05:11:16.145844Z","submitted_at":"2025-06-26T12:43:43Z","title":"Task-Aware KV Compression For Cost-Effective Long Video Understanding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:36.457741Z"},"links":{"citing_paper":"/paper/2506.21184"},"observation_digest":"sha256:520869aa35dd801a97f192412b32cbcd530a2a803a7395666ca5bb9b49e6589a","observation_id":"0bf89560-8927-4e62-a325-3ac8e3dc034c","resolution":{"observed_at":"2026-08-06T22:36:41.772060Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-06T22:36:36.521460Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21184","last_updated":"2025-06-26T12:43:43Z","snapshot_observed_at":"2026-08-07T05:11:16.145844Z","submitted_at":"2025-06-26T12:43:43Z","title":"Task-Aware KV Compression For Cost-Effective Long Video Understanding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:36.521460Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2506.21184"},"observation_digest":"sha256:6cd4020685ece5fbc2597a38d6227461228205cbb0422ede83e3a6d9b204e7cf","observation_id":"89ab8ae2-2bac-47c4-9175-999e557b1902","resolution":{"observed_at":"2026-08-06T22:36:36.521460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-07-06T18:26:42.010940Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-08-06T22:36:36.613827Z","title":"Sharegpt4video: Improving video understanding and generation with better captions.arXiv preprint arXiv:2406.04325, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21184","last_updated":"2025-06-26T12:43:43Z","snapshot_observed_at":"2026-08-07T05:11:16.145844Z","submitted_at":"2025-06-26T12:43:43Z","title":"Task-Aware KV Compression For Cost-Effective Long Video Understanding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:36.613827Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2506.21184"},"observation_digest":"sha256:469481bf3442e68b6d34664de8119e668c989105a9fd1820589cdd387fb6f3e9","observation_id":"3c9cd646-4ba3-44ce-8828-ca0f1aeea3ea","resolution":{"observed_at":"2026-08-06T22:36:36.613827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-06T22:36:36.671820Z","title":"How far are we to gpt-4v? closing the gap to commercial multimodal models with open-source suites.arXiv preprint arXiv:2404.16821, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21184","last_updated":"2025-06-26T12:43:43Z","snapshot_observed_at":"2026-08-07T05:11:16.145844Z","submitted_at":"2025-06-26T12:43:43Z","title":"Task-Aware KV Compression For Cost-Effective Long Video Understanding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:36.671820Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2506.21184"},"observation_digest":"sha256:b9aa2886a7648e07856384eb3d0f04775777e2af520828720c526bdb569ed0e1","observation_id":"636967fc-0fe2-4008-8d22-6ac784cd54cc","resolution":{"observed_at":"2026-08-06T22:36:36.671820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-06T22:36:36.711180Z","title":"Videollama 2: Advancing spatial-temporal modeling and audio understanding in video-llms.arXiv preprint arXiv:2406.07476, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21184","last_updated":"2025-06-26T12:43:43Z","snapshot_observed_at":"2026-08-07T05:11:16.145844Z","submitted_at":"2025-06-26T12:43:43Z","title":"Task-Aware KV Compression For Cost-Effective Long Video Understanding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:36.711180Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2506.21184"},"observation_digest":"sha256:50ed1b7b9d19ee147c8f51deb1faec771d335373bce1f1c558d08fec04f01cc7","observation_id":"df79a092-af4f-40f0-8f24-efedd0d61324","resolution":{"observed_at":"2026-08-06T22:36:36.711180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.11402","last_updated":"2024-10-22T23:13:34Z","snapshot_observed_at":"2026-07-06T19:17:02.745056Z","submitted_at":"2024-09-17T17:59:06Z","title":"NVLM: Open Frontier-Class Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.11402","snapshot_observed_at":"2026-08-06T22:36:36.783376Z","title":"Nvlm: Open frontier-class multimodal llms.arXiv preprint arXiv:2409.11402, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21184","last_updated":"2025-06-26T12:43:43Z","snapshot_observed_at":"2026-08-07T05:11:16.145844Z","submitted_at":"2025-06-26T12:43:43Z","title":"Task-Aware KV Compression For Cost-Effective Long Video Understanding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:36.783376Z"},"links":{"cited_paper":"/paper/2409.11402","citing_paper":"/paper/2506.21184"},"observation_digest":"sha256:f697578670c99d227c5b07837362c97dceb084a2c6a1f1d16fd21ae07fca685c","observation_id":"2e9a38c5-4775-4a78-91b0-82d2885203f9","resolution":{"observed_at":"2026-08-06T22:36:36.783376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.14023","last_updated":"2024-08-26T05:27:14Z","snapshot_observed_at":"2026-08-07T05:22:51.503928Z","submitted_at":"2024-08-26T05:27:14Z","title":"Video-CCAM: Enhancing Video-Language Understanding with Causal Cross-Attention Masks for Short and Long Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.14023","snapshot_observed_at":"2026-08-06T22:36:36.868717Z","title":"Video-ccam: Enhancing video-language understanding with causal cross-attention masks for short and long videos.arXiv preprint arXiv:2408.14023, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21184","last_updated":"2025-06-26T12:43:43Z","snapshot_observed_at":"2026-08-07T05:11:16.145844Z","submitted_at":"2025-06-26T12:43:43Z","title":"Task-Aware KV Compression For Cost-Effective Long Video Understanding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:36.868717Z"},"links":{"cited_paper":"/paper/2408.14023","citing_paper":"/paper/2506.21184"},"observation_digest":"sha256:34d8faed40160238df183ba546117b562f72f15f77c11ece4b97cec144846432","observation_id":"29079ea3-7f5a-45e3-b673-b96d566aed81","resolution":{"observed_at":"2026-08-06T22:36:36.868717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-06T22:36:36.961899Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis.arXiv preprint arXiv:2405.21075, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21184","last_updated":"2025-06-26T12:43:43Z","snapshot_observed_at":"2026-08-07T05:11:16.145844Z","submitted_at":"2025-06-26T12:43:43Z","title":"Task-Aware KV Compression For Cost-Effective Long Video Understanding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:36.961899Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2506.21184"},"observation_digest":"sha256:626768bd88221c97c877e5155b2fea627ff740393d55b93ce5831ce0644da153","observation_id":"ad67feca-2ef2-4227-929e-8d25852f59fd","resolution":{"observed_at":"2026-08-06T22:36:36.961899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05726","last_updated":"2024-04-24T15:38:48Z","snapshot_observed_at":"2026-07-06T17:57:19.117933Z","submitted_at":"2024-04-08T17:59:24Z","title":"MA-LMM: Memory-Augmented Large Multimodal Model for Long-Term Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.05726","snapshot_observed_at":"2026-08-06T22:36:37.020202Z","title":"Ma-lmm: Memory-augmented large multimodal model for long-term video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21184","last_updated":"2025-06-26T12:43:43Z","snapshot_observed_at":"2026-08-07T05:11:16.145844Z","submitted_at":"2025-06-26T12:43:43Z","title":"Task-Aware KV Compression For Cost-Effective Long Video Understanding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:37.020202Z"},"links":{"cited_paper":"/paper/2404.05726","citing_paper":"/paper/2506.21184"},"observation_digest":"sha256:6e126f63390f45c29cbde683e58e7296c131a99c1816100c938cb93362d2fe91","observation_id":"2800f197-06c6-49eb-bd7d-99a1b40740be","resolution":{"observed_at":"2026-08-06T22:36:37.020202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:37.156162Z","title":"Chat-univi: Unified visual representation empowers large language models with image and video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21184","last_updated":"2025-06-26T12:43:43Z","snapshot_observed_at":"2026-08-07T05:11:16.145844Z","submitted_at":"2025-06-26T12:43:43Z","title":"Task-Aware KV Compression For Cost-Effective Long Video Understanding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:37.156162Z"},"links":{"citing_paper":"/paper/2506.21184"},"observation_digest":"sha256:69cebd1948f8ca95d3fc493ef168a65acab91dc9082c5d9b2b2d338deff89927","observation_id":"2140fb08-a1a6-43e6-a721-ec067c175a23","resolution":{"observed_at":"2026-08-06T22:36:37.156162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-06T22:36:37.209127Z","title":"Llava-onevision: Easy visual task transfer.arXiv preprint arXiv:2408.03326, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21184","last_updated":"2025-06-26T12:43:43Z","snapshot_observed_at":"2026-08-07T05:11:16.145844Z","submitted_at":"2025-06-26T12:43:43Z","title":"Task-Aware KV Compression For Cost-Effective Long Video Understanding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:37.209127Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2506.21184"},"observation_digest":"sha256:3075de2f3b9327f3464d3000b738245c2838820a3404d64d5feb192283426570","observation_id":"f7a744d3-7a27-4fd3-be55-82d104ffe9b1","resolution":{"observed_at":"2026-08-06T22:36:37.209127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:41.266823Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models.ICML, 2023","venue":null,"work_id":"fc3cef79-b8bf-4fce-9ba0-d7dfdb5e7a07","year":2023},"citing_paper":{"arxiv_id":"2506.21184","last_updated":"2025-06-26T12:43:43Z","snapshot_observed_at":"2026-08-07T05:11:16.145844Z","submitted_at":"2025-06-26T12:43:43Z","title":"Task-Aware KV Compression For Cost-Effective Long Video Understanding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:37.288226Z"},"links":{"citing_paper":"/paper/2506.21184"},"observation_digest":"sha256:addebb10bb0b8f2cad87ab630f87ae1b70f9eb2fd87a7147f2561e9f5a9f997a","observation_id":"a35b2b65-cf45-416e-b0d5-41cc98cb33d9","resolution":{"observed_at":"2026-08-06T22:36:41.378601Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06355","last_updated":"2024-01-04T02:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-10T17:59:04Z","title":"VideoChat: Chat-Centric Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06355","snapshot_observed_at":"2026-08-06T22:36:37.359101Z","title":"Videochat: Chat-centric video understanding.arXiv preprint arXiv:2305.06355, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21184","last_updated":"2025-06-26T12:43:43Z","snapshot_observed_at":"2026-08-07T05:11:16.145844Z","submitted_at":"2025-06-26T12:43:43Z","title":"Task-Aware KV Compression For Cost-Effective Long Video Understanding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:37.359101Z"},"links":{"cited_paper":"/paper/2305.06355","citing_paper":"/paper/2506.21184"},"observation_digest":"sha256:314637a6e7787b852a505120004eeab0abaf7ac06e783759d5b96ae230809246","observation_id":"52d6f597-9a2e-40e1-8491-2f15f6a944e9","resolution":{"observed_at":"2026-08-06T22:36:37.359101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:37.422766Z","title":"Mvbench: A comprehensive multi-modal video understanding benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21184","last_updated":"2025-06-26T12:43:43Z","snapshot_observed_at":"2026-08-07T05:11:16.145844Z","submitted_at":"2025-06-26T12:43:43Z","title":"Task-Aware KV Compression For Cost-Effective Long Video Understanding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:37.422766Z"},"links":{"citing_paper":"/paper/2506.21184"},"observation_digest":"sha256:ff0e41dc0fe7087128f2ac3f59f1c69e324736a6c22c105eb2fa790ea1078e1b","observation_id":"e90a2db6-5f6f-4e3e-a0ed-6b1928ac8116","resolution":{"observed_at":"2026-08-06T22:36:37.422766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17043","last_updated":"2023-11-28T18:53:43Z","snapshot_observed_at":"2026-08-06T05:08:17.428238Z","submitted_at":"2023-11-28T18:53:43Z","title":"LLaMA-VID: An Image is Worth 2 Tokens in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17043","snapshot_observed_at":"2026-08-06T22:36:37.514961Z","title":"Llama-vid: An image is worth 2 tokens in large language models.arXiv preprint arXiv:2311.17043, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21184","last_updated":"2025-06-26T12:43:43Z","snapshot_observed_at":"2026-08-07T05:11:16.145844Z","submitted_at":"2025-06-26T12:43:43Z","title":"Task-Aware KV Compression For Cost-Effective Long Video Understanding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:37.514961Z"},"links":{"cited_paper":"/paper/2311.17043","citing_paper":"/paper/2506.21184"},"observation_digest":"sha256:aa982e7a158c0bc3d3a6858d8c1ac16677767596870ad44a806fa2a7bc7c3ab6","observation_id":"3de1bfdc-6e02-41d3-98f1-9a17c5964c27","resolution":{"observed_at":"2026-08-06T22:36:37.514961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:37.563665Z","title":"Llama-vid: An image is worth 2 tokens in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21184","last_updated":"2025-06-26T12:43:43Z","snapshot_observed_at":"2026-08-07T05:11:16.145844Z","submitted_at":"2025-06-26T12:43:43Z","title":"Task-Aware KV Compression For Cost-Effective Long Video Understanding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:37.563665Z"},"links":{"citing_paper":"/paper/2506.21184"},"observation_digest":"sha256:87b4c521682d3acedc8c7bafb181f764b8de0aebc2d50e561284415476bd4b00","observation_id":"2fa3dd12-bc54-41ac-8ae1-f4f037053790","resolution":{"observed_at":"2026-08-06T22:36:37.563665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-06T22:36:37.622776Z","title":"Video-llava: Learning united visual representation by alignment before projection.arXiv preprint arXiv:2311.10122, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21184","last_updated":"2025-06-26T12:43:43Z","snapshot_observed_at":"2026-08-07T05:11:16.145844Z","submitted_at":"2025-06-26T12:43:43Z","title":"Task-Aware KV Compression For Cost-Effective Long Video Understanding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:37.622776Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2506.21184"},"observation_digest":"sha256:5579bc7cde18807445171fed547a30bbd344fa189096e47ab51154d1e291e6f7","observation_id":"f8481452-cfd8-4211-b57b-d2ce89db70bc","resolution":{"observed_at":"2026-08-06T22:36:37.622776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:37.715027Z","title":"Llava-next: Improved reasoning, ocr, and world knowledge, January 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21184","last_updated":"2025-06-26T12:43:43Z","snapshot_observed_at":"2026-08-07T05:11:16.145844Z","submitted_at":"2025-06-26T12:43:43Z","title":"Task-Aware KV Compression For Cost-Effective Long Video Understanding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:37.715027Z"},"links":{"citing_paper":"/paper/2506.21184"},"observation_digest":"sha256:efdfcccf6d3b5cef3ac69e8e931eb5094b44a09616493265024e1204bce20b91","observation_id":"98d511ea-937f-486f-8f0b-2f0166c69cb9","resolution":{"observed_at":"2026-08-06T22:36:37.715027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08485","snapshot_observed_at":"2026-08-06T22:36:37.790351Z","title":"Visual instruction tuning.arXiv preprint arXiv:2304.08485, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21184","last_updated":"2025-06-26T12:43:43Z","snapshot_observed_at":"2026-08-07T05:11:16.145844Z","submitted_at":"2025-06-26T12:43:43Z","title":"Task-Aware KV Compression For Cost-Effective Long Video Understanding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:37.790351Z"},"links":{"cited_paper":"/paper/2304.08485","citing_paper":"/paper/2506.21184"},"observation_digest":"sha256:3fe326a3f546526e422ef36779c8250cf604df815fb2cac13e7c945fe178f062","observation_id":"b1f090d4-785c-47d6-aa1c-6eb6d28552d2","resolution":{"observed_at":"2026-08-06T22:36:37.790351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:37.899741Z","title":"Visual instruction tuning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21184","last_updated":"2025-06-26T12:43:43Z","snapshot_observed_at":"2026-08-07T05:11:16.145844Z","submitted_at":"2025-06-26T12:43:43Z","title":"Task-Aware KV Compression For Cost-Effective Long Video Understanding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:37.899741Z"},"links":{"citing_paper":"/paper/2506.21184"},"observation_digest":"sha256:48d3f6200f6ac4aa1d55dcdd3a0e9ff60502716ced2b3db426ed10d823103085","observation_id":"699307ac-b544-4401-aa11-366d012c7f29","resolution":{"observed_at":"2026-08-06T22:36:37.899741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00308","last_updated":"2024-03-30T10:11:26Z","snapshot_observed_at":"2026-08-03T16:21:15.084317Z","submitted_at":"2024-03-30T10:11:26Z","title":"ST-LLM: Large Language Models Are Effective Temporal Learners","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00308","snapshot_observed_at":"2026-08-06T22:36:37.979162Z","title":"St-llm: Large language models are effective temporal learners.arXiv:2404.00308, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21184","last_updated":"2025-06-26T12:43:43Z","snapshot_observed_at":"2026-08-07T05:11:16.145844Z","submitted_at":"2025-06-26T12:43:43Z","title":"Task-Aware KV Compression For Cost-Effective Long Video Understanding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:37.979162Z"},"links":{"cited_paper":"/paper/2404.00308","citing_paper":"/paper/2506.21184"},"observation_digest":"sha256:872aca68c02c44b8f73b7268c8ca699b5b6a25d3a29def7a6656e78ac69544c2","observation_id":"8e75c140-9583-4936-995e-a5ad9f726e48","resolution":{"observed_at":"2026-08-06T22:36:37.979162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18478","last_updated":"2025-04-27T10:39:51Z","snapshot_observed_at":"2026-08-07T16:41:53.661756Z","submitted_at":"2025-03-24T09:21:48Z","title":"Video-XL-Pro: Reconstructive Token Compression for Extremely Long Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.18478","snapshot_observed_at":"2026-08-06T22:36:38.084306Z","title":"Video-xl-pro: Reconstructive token compression for extremely long video understanding.arXiv preprint arXiv:2503.18478, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21184","last_updated":"2025-06-26T12:43:43Z","snapshot_observed_at":"2026-08-07T05:11:16.145844Z","submitted_at":"2025-06-26T12:43:43Z","title":"Task-Aware KV Compression For Cost-Effective Long Video Understanding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:38.084306Z"},"links":{"cited_paper":"/paper/2503.18478","citing_paper":"/paper/2506.21184"},"observation_digest":"sha256:c3cf3cf847b58bd9caf45c7b032372fb946bffa639d1f37e38ac61695775bd7a","observation_id":"7b1cea3d-234c-40a5-8664-57c158420a68","resolution":{"observed_at":"2026-08-06T22:36:38.084306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07207","last_updated":"2025-03-17T13:51:51Z","snapshot_observed_at":"2026-07-06T15:41:39.660811Z","submitted_at":"2023-06-12T16:11:10Z","title":"Valley: Video Assistant with Large Language model Enhanced abilitY","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.07207","snapshot_observed_at":"2026-08-06T22:36:38.176899Z","title":"Valley: Video assistant with large language model enhanced ability.arXiv preprint arXiv:2306.07207, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21184","last_updated":"2025-06-26T12:43:43Z","snapshot_observed_at":"2026-08-07T05:11:16.145844Z","submitted_at":"2025-06-26T12:43:43Z","title":"Task-Aware KV Compression For Cost-Effective Long Video Understanding","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:38.176899Z"},"links":{"cited_paper":"/paper/2306.07207","citing_paper":"/paper/2506.21184"},"observation_digest":"sha256:7e1b13f8e904731260459afbf62609fba6bf63543f8418af7f21637cb7408d6e","observation_id":"a50540c1-0041-4ace-8dd5-f98bb031f217","resolution":{"observed_at":"2026-08-06T22:36:38.176899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05424","last_updated":"2024-06-10T01:36:53Z","snapshot_observed_at":"2026-07-06T15:40:24.127663Z","submitted_at":"2023-06-08T17:59:56Z","title":"Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05424","snapshot_observed_at":"2026-08-06T22:36:38.221582Z","title":"Video-chatgpt: Towards detailed video understanding via large vision and language models.arXiv preprint arXiv:2306.05424, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21184","last_updated":"2025-06-26T12:43:43Z","snapshot_observed_at":"2026-08-07T05:11:16.145844Z","submitted_at":"2025-06-26T12:43:43Z","title":"Task-Aware KV Compression For Cost-Effective Long Video Understanding","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:38.221582Z"},"links":{"cited_paper":"/paper/2306.05424","citing_paper":"/paper/2506.21184"},"observation_digest":"sha256:00d7e6a9b1c3c7c709312a0492c9abb5a6431c37b55615b61df88a0672006201","observation_id":"450847d4-afc5-4fe9-9ad1-f79661ed5286","resolution":{"observed_at":"2026-08-06T22:36:38.221582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:38.276888Z","title":"Gpt-4 technical report, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21184","last_updated":"2025-06-26T12:43:43Z","snapshot_observed_at":"2026-08-07T05:11:16.145844Z","submitted_at":"2025-06-26T12:43:43Z","title":"Task-Aware KV Compression For Cost-Effective Long Video Understanding","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:38.276888Z"},"links":{"citing_paper":"/paper/2506.21184"},"observation_digest":"sha256:cd0cb16d7eac5d5d996a1ea42224d8ecd1961eba946930c8fef6ea6d22501546","observation_id":"0589e541-1a20-440f-a926-855b8c3b8573","resolution":{"observed_at":"2026-08-06T22:36:38.276888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:40.900560Z","title":"Gpt-4o.https://openai.com/index/hello-gpt-4o/, May 2024","venue":null,"work_id":"323fc97e-f713-45d5-aaa9-22cebdc280fb","year":2024},"citing_paper":{"arxiv_id":"2506.21184","last_updated":"2025-06-26T12:43:43Z","snapshot_observed_at":"2026-08-07T05:11:16.145844Z","submitted_at":"2025-06-26T12:43:43Z","title":"Task-Aware KV Compression For Cost-Effective Long Video Understanding","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:38.352178Z"},"links":{"citing_paper":"/paper/2506.21184"},"observation_digest":"sha256:f4568499f0f76f9102f6c0415a1a8ade6e9c0911ff656bb471a28cdc5a08201b","observation_id":"6b2c5357-e7ff-4183-bfbd-6f2f9be7bf05","resolution":{"observed_at":"2026-08-06T22:36:41.041465Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-06T22:36:38.387129Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context.arXiv preprint arXiv:2403.05530, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21184","last_updated":"2025-06-26T12:43:43Z","snapshot_observed_at":"2026-08-07T05:11:16.145844Z","submitted_at":"2025-06-26T12:43:43Z","title":"Task-Aware KV Compression For Cost-Effective Long Video Understanding","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:38.387129Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2506.21184"},"observation_digest":"sha256:16376c42c3850da6cc6caf6de3da41d7fd4c836051189547ec93c41a292710a6","observation_id":"92e400c0-ffa5-4f75-ac26-451ca4a7d5f8","resolution":{"observed_at":"2026-08-06T22:36:38.387129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17434","last_updated":"2024-10-22T21:21:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-22T21:21:37Z","title":"LongVU: Spatiotemporal Adaptive Compression for Long Video-Language Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17434","snapshot_observed_at":"2026-08-06T22:36:38.446461Z","title":"Longvu: Spatiotemporal adaptive compression for long video-language understanding.arXiv preprint arXiv:2410.17434, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.21184","last_updated":"2025-06-26T12:43:43Z","snapshot_observed_at":"2026-08-07T05:11:16.145844Z","submitted_at":"2025-06-26T12:43:43Z","title":"Task-Aware KV Compression For Cost-Effective Long Video Understanding","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:38.446461Z"},"links":{"cited_paper":"/paper/2410.17434","citing_paper":"/paper/2506.21184"},"observation_digest":"sha256:ec7adbe185fc1f7e3a96d06a8fba1e47ac9d6aa8afd030b4d63433aa8f7452b7","observation_id":"69f4681f-c7bd-4a2d-b978-8acdd833a70a","resolution":{"observed_at":"2026-08-06T22:36:38.446461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14485","last_updated":"2024-12-10T12:45:31Z","snapshot_observed_at":"2026-07-06T19:19:28.953455Z","submitted_at":"2024-09-22T15:13:31Z","title":"Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.14485","snapshot_observed_at":"2026-08-06T22:36:38.507321Z","title":"Video-xl: Extra-long vision language model for hour-scale video understanding.arXiv preprint arXiv:2409.14485, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21184","last_updated":"2025-06-26T12:43:43Z","snapshot_observed_at":"2026-08-07T05:11:16.145844Z","submitted_at":"2025-06-26T12:43:43Z","title":"Task-Aware KV Compression For Cost-Effective Long Video Understanding","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:38.507321Z"},"links":{"cited_paper":"/paper/2409.14485","citing_paper":"/paper/2506.21184"},"observation_digest":"sha256:501a237f69830202c0ccf4126e24bc4cb2c56f0eb0f218c2a27bc60d109e3a40","observation_id":"b3b21a56-e1ad-4778-a6ce-c322c3a42042","resolution":{"observed_at":"2026-08-06T22:36:38.507321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16449","last_updated":"2024-03-09T06:43:37Z","snapshot_observed_at":"2026-08-05T04:26:02.499259Z","submitted_at":"2023-07-31T07:15:45Z","title":"MovieChat: From Dense Token to Sparse Memory for Long Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16449","snapshot_observed_at":"2026-08-06T22:36:38.567659Z","title":"Moviechat: From dense token to sparse memory for long video understanding.arXiv preprint arXiv:2307.16449, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21184","last_updated":"2025-06-26T12:43:43Z","snapshot_observed_at":"2026-08-07T05:11:16.145844Z","submitted_at":"2025-06-26T12:43:43Z","title":"Task-Aware KV Compression For Cost-Effective Long Video Understanding","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:38.567659Z"},"links":{"cited_paper":"/paper/2307.16449","citing_paper":"/paper/2506.21184"},"observation_digest":"sha256:f3ee610d64191864408440052f955c509e57a78e9fd152f22522de8120548f4f","observation_id":"b25ca4dc-5cdc-466e-a600-f35ebdf1f7d5","resolution":{"observed_at":"2026-08-06T22:36:38.567659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:38.677891Z","title":"Cambrian-1: A fully open, vision-centric exploration of multimodal llms.Advances in Neural Information Processing Systems, 37:87310–87356, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21184","last_updated":"2025-06-26T12:43:43Z","snapshot_observed_at":"2026-08-07T05:11:16.145844Z","submitted_at":"2025-06-26T12:43:43Z","title":"Task-Aware KV Compression For Cost-Effective Long Video Understanding","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:38.677891Z"},"links":{"citing_paper":"/paper/2506.21184"},"observation_digest":"sha256:e80969615a753807a24a3439017ba35cb2fc9a64755b9a468eb6f049a912f3e5","observation_id":"55d743eb-1d52-4b25-92e5-2c110b521247","resolution":{"observed_at":"2026-08-06T22:36:38.677891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14786","last_updated":"2025-02-20T18:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-20T18:08:29Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14786","snapshot_observed_at":"2026-08-06T22:36:38.709295Z","title":"Siglip 2: Multilingual vision-language encoders with improved semantic understanding, localization, and dense features.arXiv preprint arXiv:2502.14786, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21184","last_updated":"2025-06-26T12:43:43Z","snapshot_observed_at":"2026-08-07T05:11:16.145844Z","submitted_at":"2025-06-26T12:43:43Z","title":"Task-Aware KV Compression For Cost-Effective Long Video Understanding","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:38.709295Z"},"links":{"cited_paper":"/paper/2502.14786","citing_paper":"/paper/2506.21184"},"observation_digest":"sha256:cec819d66d66ac07cc3781c27be6e39dafdf8df315b8b63989cf696b1bee777f","observation_id":"c0fe3f2f-7ee5-458f-9016-4aeb9d543755","resolution":{"observed_at":"2026-08-06T22:36:38.709295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-06T22:36:38.757096Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution.arXiv preprint arXiv:2409.12191, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21184","last_updated":"2025-06-26T12:43:43Z","snapshot_observed_at":"2026-08-07T05:11:16.145844Z","submitted_at":"2025-06-26T12:43:43Z","title":"Task-Aware KV Compression For Cost-Effective Long Video Understanding","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:38.757096Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2506.21184"},"observation_digest":"sha256:80033bdcf66118abb6ef6001b3e1ef50b354666feefad2898e7ab3f882b75d9f","observation_id":"be7b36a6-61cb-4357-be28-6e974b9a6c70","resolution":{"observed_at":"2026-08-06T22:36:38.757096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:38.823039Z","title":"Longllava: Scaling multi- modal llms to 1000 images efficiently via hybrid architecture.arXiv preprint arXiv:2409.02889, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21184","last_updated":"2025-06-26T12:43:43Z","snapshot_observed_at":"2026-08-07T05:11:16.145844Z","submitted_at":"2025-06-26T12:43:43Z","title":"Task-Aware KV Compression For Cost-Effective Long Video Understanding","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:38.823039Z"},"links":{"citing_paper":"/paper/2506.21184"},"observation_digest":"sha256:1ae0d79963b2a4bfe44db71891898273a2638384ffc641fd2aa67249a1a0f348","observation_id":"aad14b21-a422-405e-9593-c7614134390f","resolution":{"observed_at":"2026-08-06T22:36:38.823039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:38.922661Z","title":"Internvideo2: Scaling foundation models for multimodal video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21184","last_updated":"2025-06-26T12:43:43Z","snapshot_observed_at":"2026-08-07T05:11:16.145844Z","submitted_at":"2025-06-26T12:43:43Z","title":"Task-Aware KV Compression For Cost-Effective Long Video Understanding","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:38.922661Z"},"links":{"citing_paper":"/paper/2506.21184"},"observation_digest":"sha256:b57cd22af4dc8f22caf6bd887254720978cfc777982c3f44f77ea89de8bfb775","observation_id":"b69461d4-c78c-4c67-801a-af0204f757d2","resolution":{"observed_at":"2026-08-06T22:36:38.922661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05173","last_updated":"2025-05-30T03:54:16Z","snapshot_observed_at":"2026-07-06T20:33:01.960703Z","submitted_at":"2025-02-07T18:56:04Z","title":"VideoRoPE: What Makes for Good Video Rotary Position Embedding?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05173","snapshot_observed_at":"2026-08-06T22:36:38.968114Z","title":"Videorope: What makes for good video rotary position embedding?arXiv preprint arXiv:2502.05173, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21184","last_updated":"2025-06-26T12:43:43Z","snapshot_observed_at":"2026-08-07T05:11:16.145844Z","submitted_at":"2025-06-26T12:43:43Z","title":"Task-Aware KV Compression For Cost-Effective Long Video Understanding","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:38.968114Z"},"links":{"cited_paper":"/paper/2502.05173","citing_paper":"/paper/2506.21184"},"observation_digest":"sha256:2974dfbcd04edd415d38dff6fffd679864e174e8f5e7b6849716642e18cc8e7b","observation_id":"333a114b-7802-40da-aee7-bd656b079e76","resolution":{"observed_at":"2026-08-06T22:36:38.968114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15754","last_updated":"2024-07-22T16:00:55Z","snapshot_observed_at":"2026-08-06T14:12:05.548569Z","submitted_at":"2024-07-22T16:00:55Z","title":"LongVideoBench: A Benchmark for Long-context Interleaved Video-Language Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15754","snapshot_observed_at":"2026-08-06T22:36:39.027331Z","title":"Longvideobench: A benchmark for long-context interleaved video-language understanding.arXiv preprint arXiv:2407.15754, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21184","last_updated":"2025-06-26T12:43:43Z","snapshot_observed_at":"2026-08-07T05:11:16.145844Z","submitted_at":"2025-06-26T12:43:43Z","title":"Task-Aware KV Compression For Cost-Effective Long Video Understanding","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:39.027331Z"},"links":{"cited_paper":"/paper/2407.15754","citing_paper":"/paper/2506.21184"},"observation_digest":"sha256:7fb9e926960ef0ed62ec449687f070d56071922df7a6f87b611b2da698fecb17","observation_id":"dc1e9d7c-528b-49e6-9fda-5a5a44fc868c","resolution":{"observed_at":"2026-08-06T22:36:39.027331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10302","last_updated":"2024-12-13T17:37:48Z","snapshot_observed_at":"2026-08-07T03:01:29.031129Z","submitted_at":"2024-12-13T17:37:48Z","title":"DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10302","snapshot_observed_at":"2026-08-06T22:36:39.126615Z","title":"Deepseek-vl2: Mixture-of-experts vision-language models for advanced multimodal understanding.arXiv preprint arXiv:2412.10302, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21184","last_updated":"2025-06-26T12:43:43Z","snapshot_observed_at":"2026-08-07T05:11:16.145844Z","submitted_at":"2025-06-26T12:43:43Z","title":"Task-Aware KV Compression For Cost-Effective Long Video Understanding","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:39.126615Z"},"links":{"cited_paper":"/paper/2412.10302","citing_paper":"/paper/2506.21184"},"observation_digest":"sha256:851a379b5ee1b1c543f7c11990b99808ddc7f6fedd8dc783ac935ba553d08ce9","observation_id":"6124ce6e-9411-4742-a532-b56e838e24cf","resolution":{"observed_at":"2026-08-06T22:36:39.126615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04617","last_updated":"2024-05-28T12:05:12Z","snapshot_observed_at":"2026-07-06T17:26:39.109878Z","submitted_at":"2024-02-07T06:50:42Z","title":"InfLLM: Training-Free Long-Context Extrapolation for LLMs with an Efficient Context Memory","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04617","snapshot_observed_at":"2026-08-06T22:36:39.216006Z","title":"Infllm: Unveiling the intrinsic capacity of llms for understanding extremely long sequences with training-free memory.arXiv preprint arXiv:2402.04617, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21184","last_updated":"2025-06-26T12:43:43Z","snapshot_observed_at":"2026-08-07T05:11:16.145844Z","submitted_at":"2025-06-26T12:43:43Z","title":"Task-Aware KV Compression For Cost-Effective Long Video Understanding","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:39.216006Z"},"links":{"cited_paper":"/paper/2402.04617","citing_paper":"/paper/2506.21184"},"observation_digest":"sha256:170685df65881894390a578b1bdaed0d2c683266f888658b1c12bd4eebbae7c8","observation_id":"d34835d6-5ad3-46c6-b379-d68751029d8a","resolution":{"observed_at":"2026-08-06T22:36:39.216006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12275","last_updated":"2025-03-03T09:05:52Z","snapshot_observed_at":"2026-07-06T18:32:44.452493Z","submitted_at":"2024-06-18T05:05:12Z","title":"VoCo-LLaMA: Towards Vision Compression with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12275","snapshot_observed_at":"2026-08-06T22:36:39.267392Z","title":"V oco-llama: Towards vision compression with large language models.arXiv preprint arXiv:2406.12275, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21184","last_updated":"2025-06-26T12:43:43Z","snapshot_observed_at":"2026-08-07T05:11:16.145844Z","submitted_at":"2025-06-26T12:43:43Z","title":"Task-Aware KV Compression For Cost-Effective Long Video Understanding","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:39.267392Z"},"links":{"cited_paper":"/paper/2406.12275","citing_paper":"/paper/2506.21184"},"observation_digest":"sha256:d54d34a79762eeeeb57d4b8e2459ff367b8c1da94ff0bfdef1622942e05bf97d","observation_id":"68ed76ec-112b-4f43-92a6-a1c7b91af129","resolution":{"observed_at":"2026-08-06T22:36:39.267392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-07-06T15:38:39.712379Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-06T22:36:39.329386Z","title":"Video-llama: An instruction-tuned audio-visual language model for video understanding.arXiv preprint arXiv:2306.02858, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21184","last_updated":"2025-06-26T12:43:43Z","snapshot_observed_at":"2026-08-07T05:11:16.145844Z","submitted_at":"2025-06-26T12:43:43Z","title":"Task-Aware KV Compression For Cost-Effective Long Video Understanding","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:39.329386Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2506.21184"},"observation_digest":"sha256:70ea58130d6e49bf695c92510a1def201fa53c28231d73c1b8556afdb3be9d95","observation_id":"a48fd399-8528-405c-9c19-0202d1e113de","resolution":{"observed_at":"2026-08-06T22:36:39.329386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-06T22:36:39.426259Z","title":"Long context transfer from language to vision.arXiv preprint arXiv:2406.16852, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21184","last_updated":"2025-06-26T12:43:43Z","snapshot_observed_at":"2026-08-07T05:11:16.145844Z","submitted_at":"2025-06-26T12:43:43Z","title":"Task-Aware KV Compression For Cost-Effective Long Video Understanding","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:39.426259Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2506.21184"},"observation_digest":"sha256:6c3f2a4b5635a37db4ce58654245bc92170c88ce18ddd1d5992c6c22fd7b0092","observation_id":"122a666a-3a86-4f3c-a925-119f5f0a1358","resolution":{"observed_at":"2026-08-06T22:36:39.426259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:39.503476Z","title":"Llava-next: A strong zero-shot video understanding model, April 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21184","last_updated":"2025-06-26T12:43:43Z","snapshot_observed_at":"2026-08-07T05:11:16.145844Z","submitted_at":"2025-06-26T12:43:43Z","title":"Task-Aware KV Compression For Cost-Effective Long Video Understanding","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:39.503476Z"},"links":{"citing_paper":"/paper/2506.21184"},"observation_digest":"sha256:0d5091aa47cc86a8dd7c4c6bd051f596e18796be44e56f7aa3b992eba2eeddf0","observation_id":"2ddb7bf0-c48a-4da6-8128-73469e3d4e19","resolution":{"observed_at":"2026-08-06T22:36:39.503476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:39.551825Z","title":"H2o: Heavy-hitter oracle for efficient generative inference of large language models.Advances in Neural Information Processing Systems, 36:34661–34710, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21184","last_updated":"2025-06-26T12:43:43Z","snapshot_observed_at":"2026-08-07T05:11:16.145844Z","submitted_at":"2025-06-26T12:43:43Z","title":"Task-Aware KV Compression For Cost-Effective Long Video Understanding","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:39.551825Z"},"links":{"citing_paper":"/paper/2506.21184"},"observation_digest":"sha256:a540b8ba06909960d5dbe100a8883e7e5a4d6982a43b1787a5219c6749f09210","observation_id":"5360d085-0391-455f-b137-d4d1dc11a146","resolution":{"observed_at":"2026-08-06T22:36:39.551825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09367","last_updated":"2025-03-07T09:40:34Z","snapshot_observed_at":"2026-08-03T15:46:09.775614Z","submitted_at":"2024-06-13T17:50:05Z","title":"Needle In A Video Haystack: A Scalable Synthetic Evaluator for Video MLLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09367","snapshot_observed_at":"2026-08-06T22:36:39.601082Z","title":"Needle in a video haystack: A scalable synthetic framework for benchmarking video mllms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21184","last_updated":"2025-06-26T12:43:43Z","snapshot_observed_at":"2026-08-07T05:11:16.145844Z","submitted_at":"2025-06-26T12:43:43Z","title":"Task-Aware KV Compression For Cost-Effective Long Video Understanding","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:39.601082Z"},"links":{"cited_paper":"/paper/2406.09367","citing_paper":"/paper/2506.21184"},"observation_digest":"sha256:785abd64f592c133dae2b52129179d6222b8f2bb5323a14a114b90dcbdf33e0e","observation_id":"52688802-2f3f-46f2-8c31-bdd3aad996d9","resolution":{"observed_at":"2026-08-06T22:36:39.601082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04264","last_updated":"2025-01-01T15:53:58Z","snapshot_observed_at":"2026-08-03T20:38:36.602554Z","submitted_at":"2024-06-06T17:09:32Z","title":"MLVU: Benchmarking Multi-task Long Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04264","snapshot_observed_at":"2026-08-06T22:36:39.692207Z","title":"Mlvu: A comprehensive benchmark for multi-task long video understanding.arXiv preprint arXiv:2406.04264, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21184","last_updated":"2025-06-26T12:43:43Z","snapshot_observed_at":"2026-08-07T05:11:16.145844Z","submitted_at":"2025-06-26T12:43:43Z","title":"Task-Aware KV Compression For Cost-Effective Long Video Understanding","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:39.692207Z"},"links":{"cited_paper":"/paper/2406.04264","citing_paper":"/paper/2506.21184"},"observation_digest":"sha256:2074e3dce893768e790bd251ce6244c2676099663c6ec81da2c5b0686cdbb353","observation_id":"7ef244d8-c636-4f1a-8998-377c3e8507fa","resolution":{"observed_at":"2026-08-06T22:36:39.692207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01852","last_updated":"2024-01-22T03:11:15Z","snapshot_observed_at":"2026-08-07T05:10:33.059352Z","submitted_at":"2023-10-03T07:33:27Z","title":"LanguageBind: Extending Video-Language Pretraining to N-modality by Language-based Semantic Alignment","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01852","snapshot_observed_at":"2026-08-06T22:36:39.772187Z","title":"Languagebind: Extending video-language pretraining to n-modality by language- based semantic alignment.arXiv preprint arXiv:2310.01852, 2023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.21184","last_updated":"2025-06-26T12:43:43Z","snapshot_observed_at":"2026-08-07T05:11:16.145844Z","submitted_at":"2025-06-26T12:43:43Z","title":"Task-Aware KV Compression For Cost-Effective Long Video Understanding","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:39.772187Z"},"links":{"cited_paper":"/paper/2310.01852","citing_paper":"/paper/2506.21184"},"observation_digest":"sha256:e84feb2533114dbb9bd6c668fa670503c8fcfaa67faa64dce333589e45b58244","observation_id":"03bdf067-a8a2-409b-ace8-51dffb6b97b6","resolution":{"observed_at":"2026-08-06T22:36:39.772187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-06T22:36:39.829071Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models.arXiv preprint arXiv:2304.10592, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21184","last_updated":"2025-06-26T12:43:43Z","snapshot_observed_at":"2026-08-07T05:11:16.145844Z","submitted_at":"2025-06-26T12:43:43Z","title":"Task-Aware KV Compression For Cost-Effective Long Video Understanding","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:39.829071Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2506.21184"},"observation_digest":"sha256:3f770c7452edf54ea951093b2caa233e952b2cf3af6cd40d88d8c584aa2aeca4","observation_id":"0e76717b-f6d5-4173-ba86-00d49d6b5f0d","resolution":{"observed_at":"2026-08-06T22:36:39.829071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-06T22:36:39.894521Z","title":"Video-XL:2×","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21184","last_updated":"2025-06-26T12:43:43Z","snapshot_observed_at":"2026-08-07T05:11:16.145844Z","submitted_at":"2025-06-26T12:43:43Z","title":"Task-Aware KV Compression For Cost-Effective Long Video Understanding","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:39.894521Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2506.21184"},"observation_digest":"sha256:6331af12fc317e08d474d1d58109546b5788469908f35bab8b45ecc45c31e48e","observation_id":"349009e5-9f3b-4f1c-9ff6-80ab18e6d2ae","resolution":{"observed_at":"2026-08-06T22:36:39.894521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.21184","last_updated":"2025-06-26T12:43:43Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T05:11:16.145844Z","submitted_at":"2025-06-26T12:43:43Z","title":"Task-Aware KV Compression For Cost-Effective Long Video Understanding"},"reference_resolution":{"displayed":49,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":46,"verified_exact":0,"verified_fuzzy":3},"total_outbound_references":49},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 49 of 49 outbound references and 0 inbound Pith citation observations for arXiv:2506.21184."}