{"as_of":"2026-08-07T22:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:14c2d682602e3c7f14b4f3597156138f6483dddc66be478701fe28dbe363ea6f","coverage":[{"denominator":56,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":56,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:13:11.715462Z","state":"measured"},{"denominator":69,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":69,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":13,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":13,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:14:15.479594Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T16:39:58.312479Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.19225","last_updated":"2025-06-24T01:19:56Z","snapshot_observed_at":"2026-08-07T21:07:46.308380Z","submitted_at":"2025-06-24T01:19:56Z","title":"Video-XL-2: Towards Very Long-Video Understanding Through Task-Aware KV Sparsification","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.19225","snapshot_observed_at":"2026-08-06T18:10:13.072860Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-07T05:26:16.655495Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:13.072860Z"},"links":{"cited_paper":"/paper/2506.19225","citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:398be7f5ec59e0a7989dbe877066b088560eeefdca014b6fc80dd7fc41b5e3d1","observation_id":"af469056-2597-4916-802c-3e9a4e6eb44a","resolution":{"observed_at":"2026-08-06T18:10:13.072860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19225","last_updated":"2025-06-24T01:19:56Z","snapshot_observed_at":"2026-08-07T21:07:46.308380Z","submitted_at":"2025-06-24T01:19:56Z","title":"Video-XL-2: Towards Very Long-Video Understanding Through Task-Aware KV Sparsification","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.19225","snapshot_observed_at":"2026-08-05T15:40:40.477147Z","title":"Video-xl-2: Towards very long-video under- standing through task-aware kv sparsification.arXiv preprint arXiv:2506.19225, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-07T05:11:55.108109Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T15:40:40.477147Z"},"links":{"cited_paper":"/paper/2506.19225","citing_paper":"/paper/2508.19650"},"observation_digest":"sha256:05a9e684b8cc2b999ac63047d2e09d090b5421d58c8fe1410153920514cdc884","observation_id":"bb56a904-e9af-4aa6-bde5-e33822a78dcd","resolution":{"observed_at":"2026-08-05T15:40:40.477147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19225","last_updated":"2025-06-24T01:19:56Z","snapshot_observed_at":"2026-08-07T21:07:46.308380Z","submitted_at":"2025-06-24T01:19:56Z","title":"Video-XL-2: Towards Very Long-Video Understanding Through Task-Aware KV Sparsification","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.19225","snapshot_observed_at":"2026-08-03T14:57:29.149183Z","title":"Video-xl-2: Towards very long-video under- standing through task-aware kv sparsification.arXiv preprint arXiv:2506.19225, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.18735","last_updated":"2026-05-25T12:55:14Z","snapshot_observed_at":"2026-08-07T05:11:54.627363Z","submitted_at":"2025-12-21T13:50:26Z","title":"$M^3-Verse$: A \"Spot the Difference\" Challenge for Large Multimodal Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T14:57:29.149183Z"},"links":{"cited_paper":"/paper/2506.19225","citing_paper":"/paper/2512.18735"},"observation_digest":"sha256:b797bf8b9d0c53ebc18ef9b7f8008a728ce2ca0ebe71aa9d2638f74dbcb89e81","observation_id":"c6eec0db-231d-4e97-a023-493219000c2a","resolution":{"observed_at":"2026-08-03T14:57:29.149183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19225","last_updated":"2025-06-24T01:19:56Z","snapshot_observed_at":"2026-08-07T21:07:46.308380Z","submitted_at":"2025-06-24T01:19:56Z","title":"Video-XL-2: Towards Very Long-Video Understanding Through Task-Aware KV Sparsification","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.19225","snapshot_observed_at":"2026-07-13T09:09:32.932051Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.06035","last_updated":"2026-06-02T01:46:36Z","snapshot_observed_at":"2026-08-06T06:50:01.259424Z","submitted_at":"2026-04-07T16:30:54Z","title":"cuRAMSES: Scalable AMR Optimizations for Large-Scale Cosmological Simulations","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-13T09:09:32.932051Z"},"links":{"cited_paper":"/paper/2506.19225","citing_paper":"/paper/2604.06035"},"observation_digest":"sha256:1ed2d7acfe210b0871a80dffc19adf16d98a14394bed991b40a0b4ba7bd87fc8","observation_id":"7e1ac90b-963c-42f6-aea2-6103032d8c14","resolution":{"observed_at":"2026-07-13T09:09:32.932051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19225","last_updated":"2025-06-24T01:19:56Z","snapshot_observed_at":"2026-08-07T21:07:46.308380Z","submitted_at":"2025-06-24T01:19:56Z","title":"Video-XL-2: Towards Very Long-Video Understanding Through Task-Aware KV Sparsification","version":1},"cited_work":{"arxiv_id":"2506.19225","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.19225","snapshot_observed_at":"2026-07-04T16:39:58.312479Z","title":"Video-XL-2: Towards Very Long-Video Understanding Through Task-Aware KV Sparsification.arXiv preprint arXiv:2506.19225, 2025","venue":null,"work_id":"93f911f1-9747-4144-9975-027df0ac6da7","year":2025},"citing_paper":{"arxiv_id":"2604.06036","last_updated":"2026-04-09T09:40:36Z","snapshot_observed_at":"2026-07-06T22:54:34.877944Z","submitted_at":"2026-04-07T16:31:45Z","title":"CodecSight: Leveraging Video Codec Signals for Efficient Streaming VLM Inference","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-10T18:45:26.555395Z"},"links":{"cited_paper":"/paper/2506.19225","citing_paper":"/paper/2604.06036"},"observation_digest":"sha256:cc0ca9e0aa4d47d77881a226ce8c6a0ab799e2e85ba8e6dee664dfe87364c165","observation_id":"ddef1e6c-2631-451c-9f2b-f16c6b743166","resolution":{"observed_at":"2026-05-11T00:00:52.769031Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19225","last_updated":"2025-06-24T01:19:56Z","snapshot_observed_at":"2026-08-07T21:07:46.308380Z","submitted_at":"2025-06-24T01:19:56Z","title":"Video-XL-2: Towards Very Long-Video Understanding Through Task-Aware KV Sparsification","version":1},"cited_work":{"arxiv_id":"2506.19225","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.19225","snapshot_observed_at":"2026-07-04T16:39:58.312479Z","title":"Video-XL-2: Towards Very Long-Video Understanding Through Task-Aware KV Sparsification.arXiv preprint arXiv:2506.19225, 2025","venue":null,"work_id":"93f911f1-9747-4144-9975-027df0ac6da7","year":2025},"citing_paper":{"arxiv_id":"2605.25979","last_updated":"2026-05-25T15:54:04Z","snapshot_observed_at":"2026-07-06T23:35:50.787324Z","submitted_at":"2026-05-25T15:54:04Z","title":"LLaVA-OneVision-2: Towards Next-Generation Perceptual Intelligence","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-29T22:12:05.365596Z"},"links":{"cited_paper":"/paper/2506.19225","citing_paper":"/paper/2605.25979"},"observation_digest":"sha256:c1e2b1bb6429b2b4ede42bcc0c3ec4877397d56e40de0110ee386eb9fd2b2274","observation_id":"b87dd21e-68ef-4313-9a82-2ef1a7024db7","resolution":{"observed_at":"2026-06-29T22:13:59.566701Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19225","last_updated":"2025-06-24T01:19:56Z","snapshot_observed_at":"2026-08-07T21:07:46.308380Z","submitted_at":"2025-06-24T01:19:56Z","title":"Video-XL-2: Towards Very Long-Video Understanding Through Task-Aware KV Sparsification","version":1},"cited_work":{"arxiv_id":"2506.19225","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.19225","snapshot_observed_at":"2026-07-04T16:39:58.312479Z","title":"Video-XL-2: Towards Very Long-Video Understanding Through Task-Aware KV Sparsification.arXiv preprint arXiv:2506.19225, 2025","venue":null,"work_id":"93f911f1-9747-4144-9975-027df0ac6da7","year":2025},"citing_paper":{"arxiv_id":"2606.07433","last_updated":"2026-06-05T16:29:13Z","snapshot_observed_at":"2026-08-01T21:05:06.439607Z","submitted_at":"2026-06-05T16:29:13Z","title":"Watch, Remember, Reason: Human-View Video Understanding with MLLMs","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-27T22:00:28.350003Z"},"links":{"cited_paper":"/paper/2506.19225","citing_paper":"/paper/2606.07433"},"observation_digest":"sha256:92cabc2c155bc267e9d6480fc8e5408406761d354fd4c2a28323a972c617a14a","observation_id":"ae7501ad-991c-4e6e-8fac-cec4f55cf572","resolution":{"observed_at":"2026-07-02T17:27:15.628146Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19225","last_updated":"2025-06-24T01:19:56Z","snapshot_observed_at":"2026-08-07T21:07:46.308380Z","submitted_at":"2025-06-24T01:19:56Z","title":"Video-XL-2: Towards Very Long-Video Understanding Through Task-Aware KV Sparsification","version":1},"cited_work":{"arxiv_id":"2506.19225","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.19225","snapshot_observed_at":"2026-07-04T16:39:58.312479Z","title":"Video-XL-2: Towards Very Long-Video Understanding Through Task-Aware KV Sparsification.arXiv preprint arXiv:2506.19225, 2025","venue":null,"work_id":"93f911f1-9747-4144-9975-027df0ac6da7","year":2025},"citing_paper":{"arxiv_id":"2606.24477","last_updated":"2026-06-23T12:13:19Z","snapshot_observed_at":"2026-07-06T23:59:03.724013Z","submitted_at":"2026-06-23T12:13:19Z","title":"video-SALMONN-R$^3$: Learning to ReWatch, ReAsk, and ReAnswer for Efficient Video Understanding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-26T00:19:26.153682Z"},"links":{"cited_paper":"/paper/2506.19225","citing_paper":"/paper/2606.24477"},"observation_digest":"sha256:e2bab4fd3f0ea2aaf33a0aebc5e160fc8d7b129a814a6e5f6f84f8dc46761686","observation_id":"55fdb6c8-43b3-4cec-8dc1-257732f2f102","resolution":{"observed_at":"2026-07-04T16:39:58.314625Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19225","last_updated":"2025-06-24T01:19:56Z","snapshot_observed_at":"2026-08-07T21:07:46.308380Z","submitted_at":"2025-06-24T01:19:56Z","title":"Video-XL-2: Towards Very Long-Video Understanding Through Task-Aware KV Sparsification","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.19225","snapshot_observed_at":"2026-08-02T05:40:46.344843Z","title":"Video-xl-2: Towards very long-video under- standing through task-aware kv sparsification.arXiv preprint arXiv:2506.19225, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13298","last_updated":"2026-07-14T22:09:48Z","snapshot_observed_at":"2026-08-07T01:40:11.166031Z","submitted_at":"2026-07-14T22:09:48Z","title":"FOLIO: Focused Semantic Memory for Streaming Video Understanding","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:46.344843Z"},"links":{"cited_paper":"/paper/2506.19225","citing_paper":"/paper/2607.13298"},"observation_digest":"sha256:232100fbc27a84ebd06600d0c62f3e0d1d5a87ba8b988863ca383413aa3bca3d","observation_id":"605428c9-ced5-4e26-b65c-746de9d130bc","resolution":{"observed_at":"2026-08-02T05:40:46.344843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19225","last_updated":"2025-06-24T01:19:56Z","snapshot_observed_at":"2026-08-07T21:07:46.308380Z","submitted_at":"2025-06-24T01:19:56Z","title":"Video-XL-2: Towards Very Long-Video Understanding Through Task-Aware KV Sparsification","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.19225","snapshot_observed_at":"2026-08-02T00:44:41.162135Z","title":"Video-xl-2: Towards very long-video understanding through task-aware kv sparsification","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14935","last_updated":"2026-07-16T12:47:59Z","snapshot_observed_at":"2026-08-06T19:13:04.526298Z","submitted_at":"2026-07-16T12:47:59Z","title":"VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T00:44:41.162135Z"},"links":{"cited_paper":"/paper/2506.19225","citing_paper":"/paper/2607.14935"},"observation_digest":"sha256:8ad34313cb0324849a9783eb24254ba2c1eb8c71fcaf81030c91ee9dc69cc0c5","observation_id":"7e95a7ad-809f-46f5-8825-6b314a59a3ec","resolution":{"observed_at":"2026-08-02T00:44:41.162135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19225","last_updated":"2025-06-24T01:19:56Z","snapshot_observed_at":"2026-08-07T21:07:46.308380Z","submitted_at":"2025-06-24T01:19:56Z","title":"Video-XL-2: Towards Very Long-Video Understanding Through Task-Aware KV Sparsification","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.19225","snapshot_observed_at":"2026-08-01T22:26:24.782850Z","title":"Video-xl-2: Towards very long-video understanding through task-aware kv sparsification,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15778","last_updated":"2026-07-17T09:21:52Z","snapshot_observed_at":"2026-08-07T05:11:43.071607Z","submitted_at":"2026-07-17T09:21:52Z","title":"Modularized Dynamic-Granularity Video LLM for Multi-Event Long Video Understanding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T22:26:24.782850Z"},"links":{"cited_paper":"/paper/2506.19225","citing_paper":"/paper/2607.15778"},"observation_digest":"sha256:067cbf6a1b1e9ddef7b766e852d4a3979ae5be578248c2fa2466cab20ced8bad","observation_id":"3e370153-360e-4d06-9b8a-c84ad2d9ff37","resolution":{"observed_at":"2026-08-01T22:26:24.782850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19225","last_updated":"2025-06-24T01:19:56Z","snapshot_observed_at":"2026-08-07T21:07:46.308380Z","submitted_at":"2025-06-24T01:19:56Z","title":"Video-XL-2: Towards Very Long-Video Understanding Through Task-Aware KV Sparsification","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.19225","snapshot_observed_at":"2026-08-04T08:12:46.830446Z","title":"Ren, X.; Xu, L.; Xia, L.; Wang, S.; Yin, D.; and Huang, C","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02392","last_updated":"2026-08-05T05:29:45Z","snapshot_observed_at":"2026-08-07T21:16:41.099545Z","submitted_at":"2026-08-03T15:35:28Z","title":"GROVE: Growing and Reasoning over Temporally Stratified Memory from Streaming Video Experience","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T08:12:46.830446Z"},"links":{"cited_paper":"/paper/2506.19225","citing_paper":"/paper/2608.02392"},"observation_digest":"sha256:d153372dd40f5231b785852aff37a35d4644f25fb42e03806513533abf13c1a7","observation_id":"64f8a689-5d3e-49c2-b6f5-3ecbe11ffdf0","resolution":{"observed_at":"2026-08-04T08:12:46.830446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19225","last_updated":"2025-06-24T01:19:56Z","snapshot_observed_at":"2026-08-07T21:07:46.308380Z","submitted_at":"2025-06-24T01:19:56Z","title":"Video-XL-2: Towards Very Long-Video Understanding Through Task-Aware KV Sparsification","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.19225","snapshot_observed_at":"2026-08-07T00:14:15.479594Z","title":"Ren, X.; Xu, L.; Xia, L.; Wang, S.; Yin, D.; and Huang, C","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02392","last_updated":"2026-08-05T05:29:45Z","snapshot_observed_at":"2026-08-07T21:16:41.099545Z","submitted_at":"2026-08-03T15:35:28Z","title":"GROVE: Growing and Reasoning over Temporally Stratified Memory from Streaming Video Experience","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:15.479594Z"},"links":{"cited_paper":"/paper/2506.19225","citing_paper":"/paper/2608.02392"},"observation_digest":"sha256:c3a43eb9ffb604c95590c36128d4183a2bce0577a22a48dbc938d0b3335edab1","observation_id":"2bcfcad6-5456-4d17-b706-deb69eae8560","resolution":{"observed_at":"2026-08-07T00:14:15.479594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.19225/citation-record","integrity":"/paper/2506.19225/integrity","json":"/paper/2506.19225/citation-record.json","paper":"/paper/2506.19225"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-06T23:13:06.005716Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context.arXiv preprint arXiv:2403.05530, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19225","last_updated":"2025-06-24T01:19:56Z","snapshot_observed_at":"2026-08-07T21:07:46.308380Z","submitted_at":"2025-06-24T01:19:56Z","title":"Video-XL-2: Towards Very Long-Video Understanding Through Task-Aware KV Sparsification","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T23:13:06.005716Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2506.19225"},"observation_digest":"sha256:2756feb5feae84313c1e96c8ae17e415036b0a48bd76a00f564f6ef60524221c","observation_id":"2ac8c17c-ef6b-4bb5-b661-b76f7c694d18","resolution":{"observed_at":"2026-08-06T23:13:06.005716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:13:06.063644Z","title":"Gpt-4o.https://openai.com/index/hello-gpt-4o/, May 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19225","last_updated":"2025-06-24T01:19:56Z","snapshot_observed_at":"2026-08-07T21:07:46.308380Z","submitted_at":"2025-06-24T01:19:56Z","title":"Video-XL-2: Towards Very Long-Video Understanding Through Task-Aware KV Sparsification","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T23:13:06.063644Z"},"links":{"citing_paper":"/paper/2506.19225"},"observation_digest":"sha256:030ceb0cd571b9c0ccb5766a535b4f68f7edaf693d2a66827776c4788d6bb3be","observation_id":"b639ce59-0d16-4689-a0d5-feccc88d13f4","resolution":{"observed_at":"2026-08-06T23:13:06.063644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:13:14.378235Z","title":"Claude 3.https://www.anthropic.com/news/claude-3-family, March 2024","venue":null,"work_id":"f5682ad4-85f3-4edf-8adb-79617b952115","year":2024},"citing_paper":{"arxiv_id":"2506.19225","last_updated":"2025-06-24T01:19:56Z","snapshot_observed_at":"2026-08-07T21:07:46.308380Z","submitted_at":"2025-06-24T01:19:56Z","title":"Video-XL-2: Towards Very Long-Video Understanding Through Task-Aware KV Sparsification","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T23:13:06.126866Z"},"links":{"citing_paper":"/paper/2506.19225"},"observation_digest":"sha256:135bd65d25a831073382f039dc8e592bc8bd44bca5881c7f03a8bb080ccc9249","observation_id":"7e1378af-d07c-4fa4-a737-f20479b34dcf","resolution":{"observed_at":"2026-08-06T23:13:14.477127Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-06T23:13:06.296080Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.19225","last_updated":"2025-06-24T01:19:56Z","snapshot_observed_at":"2026-08-07T21:07:46.308380Z","submitted_at":"2025-06-24T01:19:56Z","title":"Video-XL-2: Towards Very Long-Video Understanding Through Task-Aware KV Sparsification","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T23:13:06.296080Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2506.19225"},"observation_digest":"sha256:afbb1bad090311f4c0d3d3431c3bd81735d74c56fe16a20d243161ea021accf4","observation_id":"f4fadd24-7603-4e0a-99b1-1f7d1ceb31ef","resolution":{"observed_at":"2026-08-06T23:13:06.296080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13106","last_updated":"2025-06-03T03:33:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T18:59:46Z","title":"VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13106","snapshot_observed_at":"2026-08-06T23:13:06.349713Z","title":"Videollama 3: Frontier multimodal foundation models for image and video understanding.arXiv preprint arXiv:2501.13106, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.19225","last_updated":"2025-06-24T01:19:56Z","snapshot_observed_at":"2026-08-07T21:07:46.308380Z","submitted_at":"2025-06-24T01:19:56Z","title":"Video-XL-2: Towards Very Long-Video Understanding Through Task-Aware KV Sparsification","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T23:13:06.349713Z"},"links":{"cited_paper":"/paper/2501.13106","citing_paper":"/paper/2506.19225"},"observation_digest":"sha256:9d33e7616596883f5baa5516a0bfef77b4dd83c7ebabe2cc8188433de6393cac","observation_id":"fee6a7a4-e6d5-40f7-8eb9-7aafec2469ab","resolution":{"observed_at":"2026-08-06T23:13:06.349713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00574","last_updated":"2025-07-13T16:21:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-31T18:01:23Z","title":"VideoChat-Flash: Hierarchical Compression for Long-Context Video Modeling","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00574","snapshot_observed_at":"2026-08-06T23:13:06.438610Z","title":"Videochat-flash: Hierarchical compression for long-context video modeling.arXiv preprint arXiv:2501.00574, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19225","last_updated":"2025-06-24T01:19:56Z","snapshot_observed_at":"2026-08-07T21:07:46.308380Z","submitted_at":"2025-06-24T01:19:56Z","title":"Video-XL-2: Towards Very Long-Video Understanding Through Task-Aware KV Sparsification","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T23:13:06.438610Z"},"links":{"cited_paper":"/paper/2501.00574","citing_paper":"/paper/2506.19225"},"observation_digest":"sha256:9383ff158f6386c7e5ee66fc0aa52bde8a15020484cabdac8c62c1f74b79929f","observation_id":"bdf7c58a-339b-43ed-9661-ce81ff93e999","resolution":{"observed_at":"2026-08-06T23:13:06.438610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:13:14.158140Z","title":"Nvila: Efficient frontier visual language models","venue":null,"work_id":"5e7a0102-beea-4a35-8718-a115f6acabd7","year":2025},"citing_paper":{"arxiv_id":"2506.19225","last_updated":"2025-06-24T01:19:56Z","snapshot_observed_at":"2026-08-07T21:07:46.308380Z","submitted_at":"2025-06-24T01:19:56Z","title":"Video-XL-2: Towards Very Long-Video Understanding Through Task-Aware KV Sparsification","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T23:13:06.555749Z"},"links":{"citing_paper":"/paper/2506.19225"},"observation_digest":"sha256:bea65781e8a87817a227ea43f576f84ae50abecf31ca110efab30e080099dd3a","observation_id":"700229ed-b13f-4ceb-9151-932718b384b3","resolution":{"observed_at":"2026-08-06T23:13:14.244169Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-06T23:13:06.733535Z","title":"Llava-onevision: Easy visual task transfer.arXiv preprint arXiv:2408.03326, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19225","last_updated":"2025-06-24T01:19:56Z","snapshot_observed_at":"2026-08-07T21:07:46.308380Z","submitted_at":"2025-06-24T01:19:56Z","title":"Video-XL-2: Towards Very Long-Video Understanding Through Task-Aware KV Sparsification","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T23:13:06.733535Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2506.19225"},"observation_digest":"sha256:1626ddf570746cb0ff820e2cb25d2f0aa823a2b14bb454d35e7971ae05b702c0","observation_id":"97be42b9-d35b-4687-a316-74b8b543f544","resolution":{"observed_at":"2026-08-06T23:13:06.733535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:13:06.878329Z","title":"Eagle 2.5: Boosting long-context post-training for frontier vision-language models.arXiv preprint arXiv:2504.15271, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.19225","last_updated":"2025-06-24T01:19:56Z","snapshot_observed_at":"2026-08-07T21:07:46.308380Z","submitted_at":"2025-06-24T01:19:56Z","title":"Video-XL-2: Towards Very Long-Video Understanding Through Task-Aware KV Sparsification","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T23:13:06.878329Z"},"links":{"citing_paper":"/paper/2506.19225"},"observation_digest":"sha256:498875e117d3df042fbc2d8d36340cf3fdfd431474b35fa7f267cec4acba5922","observation_id":"15d6f43c-d283-44e8-8993-c24db3336a95","resolution":{"observed_at":"2026-08-06T23:13:06.878329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:13:06.962953Z","title":"Longllava: Scaling multi- modal llms to 1000 images efficiently via hybrid architecture.arXiv preprint arXiv:2409.02889, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19225","last_updated":"2025-06-24T01:19:56Z","snapshot_observed_at":"2026-08-07T21:07:46.308380Z","submitted_at":"2025-06-24T01:19:56Z","title":"Video-XL-2: Towards Very Long-Video Understanding Through Task-Aware KV Sparsification","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T23:13:06.962953Z"},"links":{"citing_paper":"/paper/2506.19225"},"observation_digest":"sha256:87865950cda936fda64b781f1439f908b4e870f72018243f687217c83ad11842","observation_id":"db0a7ef3-0626-44b4-8c0a-303153eea28b","resolution":{"observed_at":"2026-08-06T23:13:06.962953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-06T23:13:07.042420Z","title":"Long context transfer from language to vision.arXiv preprint arXiv:2406.16852, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19225","last_updated":"2025-06-24T01:19:56Z","snapshot_observed_at":"2026-08-07T21:07:46.308380Z","submitted_at":"2025-06-24T01:19:56Z","title":"Video-XL-2: Towards Very Long-Video Understanding Through Task-Aware KV Sparsification","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T23:13:07.042420Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2506.19225"},"observation_digest":"sha256:3d848e974c78f9218197d8c7af124e14a8c9e02f947d9968abb227d30ef41e21","observation_id":"38fdb9fe-d313-4570-8f2b-565d97b42853","resolution":{"observed_at":"2026-08-06T23:13:07.042420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17043","last_updated":"2023-11-28T18:53:43Z","snapshot_observed_at":"2026-08-06T05:08:17.428238Z","submitted_at":"2023-11-28T18:53:43Z","title":"LLaMA-VID: An Image is Worth 2 Tokens in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17043","snapshot_observed_at":"2026-08-06T23:13:07.193817Z","title":"Llama-vid: An image is worth 2 tokens in large language models.arXiv preprint arXiv:2311.17043, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.19225","last_updated":"2025-06-24T01:19:56Z","snapshot_observed_at":"2026-08-07T21:07:46.308380Z","submitted_at":"2025-06-24T01:19:56Z","title":"Video-XL-2: Towards Very Long-Video Understanding Through Task-Aware KV Sparsification","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T23:13:07.193817Z"},"links":{"cited_paper":"/paper/2311.17043","citing_paper":"/paper/2506.19225"},"observation_digest":"sha256:78e3810cf477d91a2056b25ac903a872fdb0576dd2f136069e9cdd31ec15a7ca","observation_id":"f9bd112b-a33b-408d-b03c-4849703a8fb1","resolution":{"observed_at":"2026-08-06T23:13:07.193817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-07-06T15:38:39.712379Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-06T23:13:07.311670Z","title":"Video-llama: An instruction-tuned audio-visual language model for video understanding.arXiv preprint arXiv:2306.02858, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.19225","last_updated":"2025-06-24T01:19:56Z","snapshot_observed_at":"2026-08-07T21:07:46.308380Z","submitted_at":"2025-06-24T01:19:56Z","title":"Video-XL-2: Towards Very Long-Video Understanding Through Task-Aware KV Sparsification","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T23:13:07.311670Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2506.19225"},"observation_digest":"sha256:8700d40fa4903c5cecfe2650abbf84bf7f29d140ee6de5cf8a254d4aa092e9d1","observation_id":"42939bff-b41f-400e-a552-b7378b9660f8","resolution":{"observed_at":"2026-08-06T23:13:07.311670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06355","last_updated":"2024-01-04T02:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-10T17:59:04Z","title":"VideoChat: Chat-Centric Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06355","snapshot_observed_at":"2026-08-06T23:13:07.440858Z","title":"Videochat: Chat-centric video understanding.arXiv preprint arXiv:2305.06355, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.19225","last_updated":"2025-06-24T01:19:56Z","snapshot_observed_at":"2026-08-07T21:07:46.308380Z","submitted_at":"2025-06-24T01:19:56Z","title":"Video-XL-2: Towards Very Long-Video Understanding Through Task-Aware KV Sparsification","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T23:13:07.440858Z"},"links":{"cited_paper":"/paper/2305.06355","citing_paper":"/paper/2506.19225"},"observation_digest":"sha256:72a0803cfda2856163b6f83461ede0987e9854dc87ceb58905e041e094216a8d","observation_id":"a6344937-afcc-4870-aefa-9a1db9dde81f","resolution":{"observed_at":"2026-08-06T23:13:07.440858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16449","last_updated":"2024-03-09T06:43:37Z","snapshot_observed_at":"2026-08-05T04:26:02.499259Z","submitted_at":"2023-07-31T07:15:45Z","title":"MovieChat: From Dense Token to Sparse Memory for Long Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16449","snapshot_observed_at":"2026-08-06T23:13:07.554817Z","title":"Moviechat: From dense token to sparse memory for long video understanding.arXiv preprint arXiv:2307.16449, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.19225","last_updated":"2025-06-24T01:19:56Z","snapshot_observed_at":"2026-08-07T21:07:46.308380Z","submitted_at":"2025-06-24T01:19:56Z","title":"Video-XL-2: Towards Very Long-Video Understanding Through Task-Aware KV Sparsification","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T23:13:07.554817Z"},"links":{"cited_paper":"/paper/2307.16449","citing_paper":"/paper/2506.19225"},"observation_digest":"sha256:a03c4e8e3a3c1bb8fb6b496f279da7ce4eeff953afe31e22cb1ae9579864a8df","observation_id":"82ed5029-2983-493e-ab0a-c3a858ba68dc","resolution":{"observed_at":"2026-08-06T23:13:07.554817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18478","last_updated":"2025-04-27T10:39:51Z","snapshot_observed_at":"2026-08-07T16:41:53.661756Z","submitted_at":"2025-03-24T09:21:48Z","title":"Video-XL-Pro: Reconstructive Token Compression for Extremely Long Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.18478","snapshot_observed_at":"2026-08-06T23:13:07.690732Z","title":"Video-xl-pro: Reconstructive token compression for extremely long video understanding.arXiv preprint arXiv:2503.18478, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.19225","last_updated":"2025-06-24T01:19:56Z","snapshot_observed_at":"2026-08-07T21:07:46.308380Z","submitted_at":"2025-06-24T01:19:56Z","title":"Video-XL-2: Towards Very Long-Video Understanding Through Task-Aware KV Sparsification","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T23:13:07.690732Z"},"links":{"cited_paper":"/paper/2503.18478","citing_paper":"/paper/2506.19225"},"observation_digest":"sha256:905ccb6c5d9cf5c9d24e8da82d45167f4375d334aeb4742f54d60bdf299bcd9e","observation_id":"eb7cc081-46f7-4693-b683-5c2b592d35d0","resolution":{"observed_at":"2026-08-06T23:13:07.690732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02490","last_updated":"2024-10-30T14:53:22Z","snapshot_observed_at":"2026-08-07T20:59:29.819833Z","submitted_at":"2024-07-02T17:59:56Z","title":"MInference 1.0: Accelerating Pre-filling for Long-Context LLMs via Dynamic Sparse Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02490","snapshot_observed_at":"2026-08-06T23:13:07.794754Z","title":"Minference 1.0: Accelerating pre-filling for long-context llms via dynamic sparse attention, 2024.URL https://arxiv","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19225","last_updated":"2025-06-24T01:19:56Z","snapshot_observed_at":"2026-08-07T21:07:46.308380Z","submitted_at":"2025-06-24T01:19:56Z","title":"Video-XL-2: Towards Very Long-Video Understanding Through Task-Aware KV Sparsification","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T23:13:07.794754Z"},"links":{"cited_paper":"/paper/2407.02490","citing_paper":"/paper/2506.19225"},"observation_digest":"sha256:2f73f123d9864bf622c46ed061511b6a9ce64c9b90cc07781ef4086917c0024f","observation_id":"15d543b0-28aa-4420-97a8-ca925f1e9c4a","resolution":{"observed_at":"2026-08-06T23:13:07.794754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:13:07.926631Z","title":"Snapkv: Llm knows what you are looking for before generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19225","last_updated":"2025-06-24T01:19:56Z","snapshot_observed_at":"2026-08-07T21:07:46.308380Z","submitted_at":"2025-06-24T01:19:56Z","title":"Video-XL-2: Towards Very Long-Video Understanding Through Task-Aware KV Sparsification","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T23:13:07.926631Z"},"links":{"citing_paper":"/paper/2506.19225"},"observation_digest":"sha256:ad682a678ff0967d87a7830cd98c0cd72102b0f6520891a3f8e06a4e9bb3139c","observation_id":"ad403f34-6964-4c60-8b85-f105b25d7c35","resolution":{"observed_at":"2026-08-06T23:13:07.926631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17453","last_updated":"2024-04-07T00:56:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-29T17:59:56Z","title":"Efficient Streaming Language Models with Attention Sinks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17453","snapshot_observed_at":"2026-08-06T23:13:08.030081Z","title":"Efficient streaming language models with attention sinks.arXiv preprint arXiv:2309.17453, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.19225","last_updated":"2025-06-24T01:19:56Z","snapshot_observed_at":"2026-08-07T21:07:46.308380Z","submitted_at":"2025-06-24T01:19:56Z","title":"Video-XL-2: Towards Very Long-Video Understanding Through Task-Aware KV Sparsification","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T23:13:08.030081Z"},"links":{"cited_paper":"/paper/2309.17453","citing_paper":"/paper/2506.19225"},"observation_digest":"sha256:93fee434a28b63c75e624e9a8e2210f2176a7a975c30db8f2f018c64c4b88654","observation_id":"a44361d5-4a69-4341-adfa-b6cbd04d5bfb","resolution":{"observed_at":"2026-08-06T23:13:08.030081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:13:13.953274Z","title":"H2o: Heavy-hitter oracle for efficient generative inference of large language models.Advances in Neural Information Processing Systems, 36:34661–34710, 2023","venue":null,"work_id":"003b825f-97d5-494b-a151-bce313ffdb5a","year":2023},"citing_paper":{"arxiv_id":"2506.19225","last_updated":"2025-06-24T01:19:56Z","snapshot_observed_at":"2026-08-07T21:07:46.308380Z","submitted_at":"2025-06-24T01:19:56Z","title":"Video-XL-2: Towards Very Long-Video Understanding Through Task-Aware KV Sparsification","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T23:13:08.152487Z"},"links":{"citing_paper":"/paper/2506.19225"},"observation_digest":"sha256:185b0745ca13a7ded14fdaa03027553ce9da99d0cea2410af164dfe65cfd1790","observation_id":"36b84e53-46fd-45f3-9053-5d382c196328","resolution":{"observed_at":"2026-08-06T23:13:14.063101Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11089","last_updated":"2025-02-27T09:01:21Z","snapshot_observed_at":"2026-08-07T14:17:15.942844Z","submitted_at":"2025-02-16T11:53:44Z","title":"Native Sparse Attention: Hardware-Aligned and Natively Trainable Sparse Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11089","snapshot_observed_at":"2026-08-06T23:13:08.220997Z","title":"Native sparse attention: Hardware-aligned and natively trainable sparse attention.arXiv preprint arXiv:2502.11089, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.19225","last_updated":"2025-06-24T01:19:56Z","snapshot_observed_at":"2026-08-07T21:07:46.308380Z","submitted_at":"2025-06-24T01:19:56Z","title":"Video-XL-2: Towards Very Long-Video Understanding Through Task-Aware KV Sparsification","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T23:13:08.220997Z"},"links":{"cited_paper":"/paper/2502.11089","citing_paper":"/paper/2506.19225"},"observation_digest":"sha256:8246b7f3e64cae6c835f0287e7f4c646d0535f7cc661a1fae64d10c8e5ed8059","observation_id":"69586b48-fd67-484f-b4bf-51fc7821089c","resolution":{"observed_at":"2026-08-06T23:13:08.220997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13189","snapshot_observed_at":"2026-08-06T23:13:08.301692Z","title":"Moba: Mixture of block attention for long-context llms.arXiv preprint arXiv:2502.13189, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.19225","last_updated":"2025-06-24T01:19:56Z","snapshot_observed_at":"2026-08-07T21:07:46.308380Z","submitted_at":"2025-06-24T01:19:56Z","title":"Video-XL-2: Towards Very Long-Video Understanding Through Task-Aware KV Sparsification","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T23:13:08.301692Z"},"links":{"cited_paper":"/paper/2502.13189","citing_paper":"/paper/2506.19225"},"observation_digest":"sha256:07409dd7aee59638cdfae117c37aaeb8753f8a0d36d17c6808a40826b44a807e","observation_id":"7182a99b-e30f-4d2d-8389-98e59e56bd28","resolution":{"observed_at":"2026-08-06T23:13:08.301692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08485","snapshot_observed_at":"2026-08-06T23:13:08.356194Z","title":"Visual instruction tuning.arXiv preprint arXiv:2304.08485, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.19225","last_updated":"2025-06-24T01:19:56Z","snapshot_observed_at":"2026-08-07T21:07:46.308380Z","submitted_at":"2025-06-24T01:19:56Z","title":"Video-XL-2: Towards Very Long-Video Understanding Through Task-Aware KV Sparsification","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T23:13:08.356194Z"},"links":{"cited_paper":"/paper/2304.08485","citing_paper":"/paper/2506.19225"},"observation_digest":"sha256:3009cbdd2f69f2f2b43dc574d6c4b64e2c6f3654d1701aa8f4a39b3835fc0ae6","observation_id":"8140ec18-9ef6-4d59-a03d-33427aef3e36","resolution":{"observed_at":"2026-08-06T23:13:08.356194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-06T23:13:08.443107Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models.arXiv preprint arXiv:2304.10592, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.19225","last_updated":"2025-06-24T01:19:56Z","snapshot_observed_at":"2026-08-07T21:07:46.308380Z","submitted_at":"2025-06-24T01:19:56Z","title":"Video-XL-2: Towards Very Long-Video Understanding Through Task-Aware KV Sparsification","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T23:13:08.443107Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2506.19225"},"observation_digest":"sha256:a38706e87200df6cdeaada5bc1f1725cd2f20fe1ed8177a2d9b85eb6a8fdc475","observation_id":"57b1f109-c7b6-46c0-a018-99850cf9d76f","resolution":{"observed_at":"2026-08-06T23:13:08.443107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:13:08.491853Z","title":"Flamingo: a visual language model for few-shot learning.NeurIPS, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.19225","last_updated":"2025-06-24T01:19:56Z","snapshot_observed_at":"2026-08-07T21:07:46.308380Z","submitted_at":"2025-06-24T01:19:56Z","title":"Video-XL-2: Towards Very Long-Video Understanding Through Task-Aware KV Sparsification","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T23:13:08.491853Z"},"links":{"citing_paper":"/paper/2506.19225"},"observation_digest":"sha256:f9899590bc62de124beebc80112cd2d60b3656fe58904cbda74fb64478f8ffe2","observation_id":"c21a8a70-8e6a-4077-9023-624668c7e886","resolution":{"observed_at":"2026-08-06T23:13:08.491853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:13:08.548099Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models.ICML, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.19225","last_updated":"2025-06-24T01:19:56Z","snapshot_observed_at":"2026-08-07T21:07:46.308380Z","submitted_at":"2025-06-24T01:19:56Z","title":"Video-XL-2: Towards Very Long-Video Understanding Through Task-Aware KV Sparsification","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T23:13:08.548099Z"},"links":{"citing_paper":"/paper/2506.19225"},"observation_digest":"sha256:fd012043915da5acb6b5c791b1caa71d8f7dc2283763f3d6c9fca51bf787f6f1","observation_id":"78962752-4e28-4664-8d71-945f60701170","resolution":{"observed_at":"2026-08-06T23:13:08.548099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05424","last_updated":"2024-06-10T01:36:53Z","snapshot_observed_at":"2026-07-06T15:40:24.127663Z","submitted_at":"2023-06-08T17:59:56Z","title":"Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05424","snapshot_observed_at":"2026-08-06T23:13:08.631395Z","title":"Video-chatgpt: Towards detailed video understanding via large vision and language models.arXiv preprint arXiv:2306.05424, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.19225","last_updated":"2025-06-24T01:19:56Z","snapshot_observed_at":"2026-08-07T21:07:46.308380Z","submitted_at":"2025-06-24T01:19:56Z","title":"Video-XL-2: Towards Very Long-Video Understanding Through Task-Aware KV Sparsification","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T23:13:08.631395Z"},"links":{"cited_paper":"/paper/2306.05424","citing_paper":"/paper/2506.19225"},"observation_digest":"sha256:c4b7815357b45f1076d3a53baa198df1f1d083d7569f87244fdf88244cb5c9f2","observation_id":"892779bc-8de8-467a-9c2c-783d8d95eb7b","resolution":{"observed_at":"2026-08-06T23:13:08.631395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:13:08.728844Z","title":"Vidtext: Towards comprehensive evaluation for video text understanding.arXiv preprint arXiv:2505.22810, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.19225","last_updated":"2025-06-24T01:19:56Z","snapshot_observed_at":"2026-08-07T21:07:46.308380Z","submitted_at":"2025-06-24T01:19:56Z","title":"Video-XL-2: Towards Very Long-Video Understanding Through Task-Aware KV Sparsification","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T23:13:08.728844Z"},"links":{"citing_paper":"/paper/2506.19225"},"observation_digest":"sha256:c11ce0602c968a1c42ddb6c989aa999bfabd2e7f7657e479e7bcc3dc66721c29","observation_id":"b46f4c0f-ea63-49b5-b8b9-e65a78283748","resolution":{"observed_at":"2026-08-06T23:13:08.728844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03179","last_updated":"2025-05-29T13:17:25Z","snapshot_observed_at":"2026-08-07T12:43:54.194381Z","submitted_at":"2025-05-29T13:17:25Z","title":"Vid-SME: Membership Inference Attacks against Large Video Understanding Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03179","snapshot_observed_at":"2026-08-06T23:13:08.790871Z","title":"Vid-sme: Membership inference attacks against large video understanding models.arXiv preprint arXiv:2506.03179, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.19225","last_updated":"2025-06-24T01:19:56Z","snapshot_observed_at":"2026-08-07T21:07:46.308380Z","submitted_at":"2025-06-24T01:19:56Z","title":"Video-XL-2: Towards Very Long-Video Understanding Through Task-Aware KV Sparsification","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T23:13:08.790871Z"},"links":{"cited_paper":"/paper/2506.03179","citing_paper":"/paper/2506.19225"},"observation_digest":"sha256:2690fd12042849b3bc232c9ab9a353914d8c9be44984dbcc670e8d655ed5a5a3","observation_id":"cde2b3d5-766a-4eb8-98d8-c27cdfbdd032","resolution":{"observed_at":"2026-08-06T23:13:08.790871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05726","last_updated":"2024-04-24T15:38:48Z","snapshot_observed_at":"2026-07-06T17:57:19.117933Z","submitted_at":"2024-04-08T17:59:24Z","title":"MA-LMM: Memory-Augmented Large Multimodal Model for Long-Term Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.05726","snapshot_observed_at":"2026-08-06T23:13:08.857202Z","title":"Ma-lmm: Memory-augmented large multimodal model for long-term video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19225","last_updated":"2025-06-24T01:19:56Z","snapshot_observed_at":"2026-08-07T21:07:46.308380Z","submitted_at":"2025-06-24T01:19:56Z","title":"Video-XL-2: Towards Very Long-Video Understanding Through Task-Aware KV Sparsification","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T23:13:08.857202Z"},"links":{"cited_paper":"/paper/2404.05726","citing_paper":"/paper/2506.19225"},"observation_digest":"sha256:6d4022acbd9bb72c8f1e2b5b9c4d7f21edbc62ee0e3f5d3ad736edbc7df39b77","observation_id":"8ecbc304-40b5-428f-8234-871d5a1d251c","resolution":{"observed_at":"2026-08-06T23:13:08.857202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:13:08.928962Z","title":"Llama-vid: An image is worth 2 tokens in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19225","last_updated":"2025-06-24T01:19:56Z","snapshot_observed_at":"2026-08-07T21:07:46.308380Z","submitted_at":"2025-06-24T01:19:56Z","title":"Video-XL-2: Towards Very Long-Video Understanding Through Task-Aware KV Sparsification","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T23:13:08.928962Z"},"links":{"citing_paper":"/paper/2506.19225"},"observation_digest":"sha256:4dbe7fbcb902e33a7775242c1cb519c0cc5807d53cd8782c8ec7463a89459392","observation_id":"e61a192d-bfd2-4f6a-a674-b10c7a491ad3","resolution":{"observed_at":"2026-08-06T23:13:08.928962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.14023","last_updated":"2024-08-26T05:27:14Z","snapshot_observed_at":"2026-08-07T05:22:51.503928Z","submitted_at":"2024-08-26T05:27:14Z","title":"Video-CCAM: Enhancing Video-Language Understanding with Causal Cross-Attention Masks for Short and Long Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.14023","snapshot_observed_at":"2026-08-06T23:13:08.989110Z","title":"Video-ccam: Enhancing video-language understanding with causal cross-attention masks for short and long videos.arXiv preprint arXiv:2408.14023, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19225","last_updated":"2025-06-24T01:19:56Z","snapshot_observed_at":"2026-08-07T21:07:46.308380Z","submitted_at":"2025-06-24T01:19:56Z","title":"Video-XL-2: Towards Very Long-Video Understanding Through Task-Aware KV Sparsification","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T23:13:08.989110Z"},"links":{"cited_paper":"/paper/2408.14023","citing_paper":"/paper/2506.19225"},"observation_digest":"sha256:57fba7f69d7310b7dcd40e53052dd4666f7c577fa7d00aaa66af608cc34f0cf3","observation_id":"d632ca7f-a4c0-4de8-9889-4d3d58abaa42","resolution":{"observed_at":"2026-08-06T23:13:08.989110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.09461","last_updated":"2023-03-01T19:45:11Z","snapshot_observed_at":"2026-07-06T14:06:56.291161Z","submitted_at":"2022-10-17T22:23:40Z","title":"Token Merging: Your ViT But Faster","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.09461","snapshot_observed_at":"2026-08-06T23:13:09.033586Z","title":"Token merging: Your vit but faster.arXiv preprint arXiv:2210.09461, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.19225","last_updated":"2025-06-24T01:19:56Z","snapshot_observed_at":"2026-08-07T21:07:46.308380Z","submitted_at":"2025-06-24T01:19:56Z","title":"Video-XL-2: Towards Very Long-Video Understanding Through Task-Aware KV Sparsification","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T23:13:09.033586Z"},"links":{"cited_paper":"/paper/2210.09461","citing_paper":"/paper/2506.19225"},"observation_digest":"sha256:911ccb0719922f1d09304ace26632a48eab1c8151012b21465405855584e97e0","observation_id":"dc11cca0-5f31-4481-8d6d-72be0407d318","resolution":{"observed_at":"2026-08-06T23:13:09.033586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.03462","last_updated":"2024-10-11T02:18:24Z","snapshot_observed_at":"2026-08-05T14:53:23.650244Z","submitted_at":"2024-01-07T11:57:40Z","title":"Long Context Compression with Activation Beacon","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.03462","snapshot_observed_at":"2026-08-06T23:13:09.127706Z","title":"Long context compression with activation beacon.arXiv preprint arXiv:2401.03462, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19225","last_updated":"2025-06-24T01:19:56Z","snapshot_observed_at":"2026-08-07T21:07:46.308380Z","submitted_at":"2025-06-24T01:19:56Z","title":"Video-XL-2: Towards Very Long-Video Understanding Through Task-Aware KV Sparsification","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T23:13:09.127706Z"},"links":{"cited_paper":"/paper/2401.03462","citing_paper":"/paper/2506.19225"},"observation_digest":"sha256:bad31ff9d1a7f6b9d17a4165470f973cb871e608216ff72202d5bfa60376f128","observation_id":"0c1400bf-89e9-49e6-8860-b49ebd31ec38","resolution":{"observed_at":"2026-08-06T23:13:09.127706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:13:13.711885Z","title":"Lighter and better: Towards flexible context adaptation for retrieval augmented generation","venue":null,"work_id":"ce641611-d96a-4f8c-b735-430f18784295","year":2025},"citing_paper":{"arxiv_id":"2506.19225","last_updated":"2025-06-24T01:19:56Z","snapshot_observed_at":"2026-08-07T21:07:46.308380Z","submitted_at":"2025-06-24T01:19:56Z","title":"Video-XL-2: Towards Very Long-Video Understanding Through Task-Aware KV Sparsification","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T23:13:09.293482Z"},"links":{"citing_paper":"/paper/2506.19225"},"observation_digest":"sha256:48036fe60e4e77c6f2b7391d925c9a59b30aae4630f026767a44bd2f3b016043","observation_id":"6ae348ee-dcfc-42ba-8eb1-4c7c705acd17","resolution":{"observed_at":"2026-08-06T23:13:13.797703Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:13:09.457172Z","title":"An image is worth 1/2 tokens after layer 2: Plug-and-play inference acceleration for large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19225","last_updated":"2025-06-24T01:19:56Z","snapshot_observed_at":"2026-08-07T21:07:46.308380Z","submitted_at":"2025-06-24T01:19:56Z","title":"Video-XL-2: Towards Very Long-Video Understanding Through Task-Aware KV Sparsification","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T23:13:09.457172Z"},"links":{"citing_paper":"/paper/2506.19225"},"observation_digest":"sha256:9819fe858886bc7a51aed9da3579fd80f6f8d46eff19c7fa19c1eacd84f060dc","observation_id":"71970c1b-8b03-4058-a55e-e5b57db8986c","resolution":{"observed_at":"2026-08-06T23:13:09.457172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08584","last_updated":"2024-12-18T07:45:11Z","snapshot_observed_at":"2026-07-06T19:31:40.352383Z","submitted_at":"2024-10-11T07:24:21Z","title":"ZipVL: Efficient Large Vision-Language Models with Dynamic Token Sparsification","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08584","snapshot_observed_at":"2026-08-06T23:13:09.567257Z","title":"Zipvl: Efficient large vision-language models with dynamic token sparsification and kv cache compression.arXiv preprint arXiv:2410.08584, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.19225","last_updated":"2025-06-24T01:19:56Z","snapshot_observed_at":"2026-08-07T21:07:46.308380Z","submitted_at":"2025-06-24T01:19:56Z","title":"Video-XL-2: Towards Very Long-Video Understanding Through Task-Aware KV Sparsification","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T23:13:09.567257Z"},"links":{"cited_paper":"/paper/2410.08584","citing_paper":"/paper/2506.19225"},"observation_digest":"sha256:381d43d9f3fca8d049ff884b2a6561a045fe530de6029bdcabaf886c22f16177","observation_id":"be77acfd-9103-4b5b-8419-9107f89383fb","resolution":{"observed_at":"2026-08-06T23:13:09.567257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02069","last_updated":"2025-05-15T17:18:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T07:51:30Z","title":"PyramidKV: Dynamic KV Cache Compression based on Pyramidal Information Funneling","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02069","snapshot_observed_at":"2026-08-06T23:13:09.732084Z","title":"Pyramidkv: Dynamic kv cache compression based on pyramidal information funneling.arXiv preprint arXiv:2406.02069, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19225","last_updated":"2025-06-24T01:19:56Z","snapshot_observed_at":"2026-08-07T21:07:46.308380Z","submitted_at":"2025-06-24T01:19:56Z","title":"Video-XL-2: Towards Very Long-Video Understanding Through Task-Aware KV Sparsification","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T23:13:09.732084Z"},"links":{"cited_paper":"/paper/2406.02069","citing_paper":"/paper/2506.19225"},"observation_digest":"sha256:e183f1c9f3e68c8b85cb829e44b256b583f17d7eb6fa6bbeaeee24879d03499a","observation_id":"d4fe11e0-a9d9-4a45-832a-8ac68d19e073","resolution":{"observed_at":"2026-08-06T23:13:09.732084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16083","last_updated":"2025-05-23T10:09:51Z","snapshot_observed_at":"2026-08-07T16:00:09.338369Z","submitted_at":"2025-04-22T17:59:51Z","title":"MMInference: Accelerating Pre-filling for Long-Context VLMs via Modality-Aware Permutation Sparse Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16083","snapshot_observed_at":"2026-08-06T23:13:09.877936Z","title":"Mminference: Accelerating pre-filling for long-context vlms via modality-aware permutation sparse attention.arXiv preprint arXiv:2504.16083, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.19225","last_updated":"2025-06-24T01:19:56Z","snapshot_observed_at":"2026-08-07T21:07:46.308380Z","submitted_at":"2025-06-24T01:19:56Z","title":"Video-XL-2: Towards Very Long-Video Understanding Through Task-Aware KV Sparsification","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T23:13:09.877936Z"},"links":{"cited_paper":"/paper/2504.16083","citing_paper":"/paper/2506.19225"},"observation_digest":"sha256:4e6819a6e830a227754a194b1e45275f1f4dbcdc27c41c1a15ccda490bfcb6ca","observation_id":"7987dfb0-bcf0-4639-9fc3-122cf89bc1c1","resolution":{"observed_at":"2026-08-06T23:13:09.877936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:13:09.996456Z","title":"Video-xl: Extra-long vision language model for hour-scale video understanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.19225","last_updated":"2025-06-24T01:19:56Z","snapshot_observed_at":"2026-08-07T21:07:46.308380Z","submitted_at":"2025-06-24T01:19:56Z","title":"Video-XL-2: Towards Very Long-Video Understanding Through Task-Aware KV Sparsification","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T23:13:09.996456Z"},"links":{"citing_paper":"/paper/2506.19225"},"observation_digest":"sha256:d57adb156d5308df047f74030d1c57c5192c06b23b9aa6bca3545a698363c5a6","observation_id":"cb51bb97-22e8-4030-9768-4f0a8f198555","resolution":{"observed_at":"2026-08-06T23:13:09.996456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.20504","last_updated":"2025-03-24T02:17:34Z","snapshot_observed_at":"2026-07-06T20:14:22.094082Z","submitted_at":"2024-12-29T15:42:24Z","title":"ReTaKe: Reducing Temporal and Knowledge Redundancy for Long Video Understanding","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.20504","snapshot_observed_at":"2026-08-06T23:13:10.091131Z","title":"Retake: Reducing temporal and knowledge redundancy for long video understanding.arXiv preprint arXiv:2412.20504, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19225","last_updated":"2025-06-24T01:19:56Z","snapshot_observed_at":"2026-08-07T21:07:46.308380Z","submitted_at":"2025-06-24T01:19:56Z","title":"Video-XL-2: Towards Very Long-Video Understanding Through Task-Aware KV Sparsification","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T23:13:10.091131Z"},"links":{"cited_paper":"/paper/2412.20504","citing_paper":"/paper/2506.19225"},"observation_digest":"sha256:5d7e9e943e1ade9034e09f1087968ff1e05a55fac384719813b037df9f808eb9","observation_id":"afa52dc7-5d5a-4b51-8d3d-97c898209423","resolution":{"observed_at":"2026-08-06T23:13:10.091131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14786","last_updated":"2025-02-20T18:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-20T18:08:29Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14786","snapshot_observed_at":"2026-08-06T23:13:10.165153Z","title":"Siglip 2: Multilingual vision-language encoders with improved semantic understanding, localization, and dense features.arXiv preprint arXiv:2502.14786, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.19225","last_updated":"2025-06-24T01:19:56Z","snapshot_observed_at":"2026-08-07T21:07:46.308380Z","submitted_at":"2025-06-24T01:19:56Z","title":"Video-XL-2: Towards Very Long-Video Understanding Through Task-Aware KV Sparsification","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T23:13:10.165153Z"},"links":{"cited_paper":"/paper/2502.14786","citing_paper":"/paper/2506.19225"},"observation_digest":"sha256:3c37052c2c56e5992946bcff8b83889dac5e2991ab40f8124eec2732ff2eb51d","observation_id":"ff13dda0-1cb8-4aa8-a1d6-dbe5b2d43db2","resolution":{"observed_at":"2026-08-06T23:13:10.165153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:13:13.458695Z","title":"Qwen2.5 technical report","venue":null,"work_id":"cb2707ae-06cb-46a8-8d8e-c5e1b7202551","year":2025},"citing_paper":{"arxiv_id":"2506.19225","last_updated":"2025-06-24T01:19:56Z","snapshot_observed_at":"2026-08-07T21:07:46.308380Z","submitted_at":"2025-06-24T01:19:56Z","title":"Video-XL-2: Towards Very Long-Video Understanding Through Task-Aware KV Sparsification","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T23:13:10.225687Z"},"links":{"citing_paper":"/paper/2506.19225"},"observation_digest":"sha256:ab12bc24c62b73fb205aa988896090d269562ca49658e1a08fd2bffeecd5ab28","observation_id":"96e6cf11-c3aa-4c13-b51b-147e6c544cae","resolution":{"observed_at":"2026-08-06T23:13:13.570856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-08-06T23:13:10.317216Z","title":"Longvila: Scaling long-context visual language models for long videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19225","last_updated":"2025-06-24T01:19:56Z","snapshot_observed_at":"2026-08-07T21:07:46.308380Z","submitted_at":"2025-06-24T01:19:56Z","title":"Video-XL-2: Towards Very Long-Video Understanding Through Task-Aware KV Sparsification","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T23:13:10.317216Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2506.19225"},"observation_digest":"sha256:279cbe7bf911999e190ffb54b46134a8a9a31f4688147adf9fe7f7bb70384ac0","observation_id":"4ef0ce03-ebad-4ebd-8418-b74ff83892fe","resolution":{"observed_at":"2026-08-06T23:13:10.317216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01852","last_updated":"2024-01-22T03:11:15Z","snapshot_observed_at":"2026-08-07T05:10:33.059352Z","submitted_at":"2023-10-03T07:33:27Z","title":"LanguageBind: Extending Video-Language Pretraining to N-modality by Language-based Semantic Alignment","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01852","snapshot_observed_at":"2026-08-06T23:13:10.420868Z","title":"Languagebind: Extending video-language pretraining to n-modality by language- based semantic alignment.arXiv preprint arXiv:2310.01852, 2023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.19225","last_updated":"2025-06-24T01:19:56Z","snapshot_observed_at":"2026-08-07T21:07:46.308380Z","submitted_at":"2025-06-24T01:19:56Z","title":"Video-XL-2: Towards Very Long-Video Understanding Through Task-Aware KV Sparsification","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T23:13:10.420868Z"},"links":{"cited_paper":"/paper/2310.01852","citing_paper":"/paper/2506.19225"},"observation_digest":"sha256:b0fc31c4cd4af1b743b2241c5c3c339f3ff0960104268f3dc1927a7ecd57cb85","observation_id":"36d57352-bccc-4850-955c-2236ca62a090","resolution":{"observed_at":"2026-08-06T23:13:10.420868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:13:10.526472Z","title":"Internvideo2: Scaling foundation models for multimodal video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19225","last_updated":"2025-06-24T01:19:56Z","snapshot_observed_at":"2026-08-07T21:07:46.308380Z","submitted_at":"2025-06-24T01:19:56Z","title":"Video-XL-2: Towards Very Long-Video Understanding Through Task-Aware KV Sparsification","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T23:13:10.526472Z"},"links":{"citing_paper":"/paper/2506.19225"},"observation_digest":"sha256:12c8bc2983f742e08578e741fc8346b78bff1f00df5e81f2f98c1608c65de8eb","observation_id":"606b8738-b551-45d9-b74b-f46224ce850f","resolution":{"observed_at":"2026-08-06T23:13:10.526472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14475","last_updated":"2024-12-19T02:49:55Z","snapshot_observed_at":"2026-08-06T11:46:20.152196Z","submitted_at":"2024-12-19T02:49:55Z","title":"MegaPairs: Massive Data Synthesis For Universal Multimodal Retrieval","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14475","snapshot_observed_at":"2026-08-06T23:13:10.664784Z","title":"Megapairs: Massive data synthesis for universal multimodal retrieval.arXiv preprint arXiv:2412.14475, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19225","last_updated":"2025-06-24T01:19:56Z","snapshot_observed_at":"2026-08-07T21:07:46.308380Z","submitted_at":"2025-06-24T01:19:56Z","title":"Video-XL-2: Towards Very Long-Video Understanding Through Task-Aware KV Sparsification","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T23:13:10.664784Z"},"links":{"cited_paper":"/paper/2412.14475","citing_paper":"/paper/2506.19225"},"observation_digest":"sha256:43c6c4b6257df5afc5a3af5fbb6c94948293e597140e86222d4e49674087d960","observation_id":"817a48cc-2a7b-4f0d-a292-666c9c209a86","resolution":{"observed_at":"2026-08-06T23:13:10.664784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09149","last_updated":"2025-06-20T07:15:14Z","snapshot_observed_at":"2026-08-07T17:10:47.806172Z","submitted_at":"2025-03-12T08:23:32Z","title":"Memory-enhanced Retrieval Augmentation for Long Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09149","snapshot_observed_at":"2026-08-06T23:13:10.804795Z","title":"Memory- enhanced retrieval augmentation for long video understanding.arXiv preprint arXiv:2503.09149, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.19225","last_updated":"2025-06-24T01:19:56Z","snapshot_observed_at":"2026-08-07T21:07:46.308380Z","submitted_at":"2025-06-24T01:19:56Z","title":"Video-XL-2: Towards Very Long-Video Understanding Through Task-Aware KV Sparsification","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T23:13:10.804795Z"},"links":{"cited_paper":"/paper/2503.09149","citing_paper":"/paper/2506.19225"},"observation_digest":"sha256:647d9ec9512ba369327179b8145935d7d4d5e5d52957563ddbacfd71113315d4","observation_id":"b3b144f7-02c7-4305-af42-64cee1aca6f3","resolution":{"observed_at":"2026-08-06T23:13:10.804795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04264","last_updated":"2025-01-01T15:53:58Z","snapshot_observed_at":"2026-08-03T20:38:36.602554Z","submitted_at":"2024-06-06T17:09:32Z","title":"MLVU: Benchmarking Multi-task Long Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04264","snapshot_observed_at":"2026-08-06T23:13:10.893556Z","title":"Mlvu: A comprehensive benchmark for multi-task long video understanding.arXiv preprint arXiv:2406.04264, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19225","last_updated":"2025-06-24T01:19:56Z","snapshot_observed_at":"2026-08-07T21:07:46.308380Z","submitted_at":"2025-06-24T01:19:56Z","title":"Video-XL-2: Towards Very Long-Video Understanding Through Task-Aware KV Sparsification","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T23:13:10.893556Z"},"links":{"cited_paper":"/paper/2406.04264","citing_paper":"/paper/2506.19225"},"observation_digest":"sha256:86c056228fe822d5a077eaeb946414a01ebc44b61a3ddf9621d977a75f1e5cb3","observation_id":"a75ceb8b-10b7-4ebc-bc28-60f157a9b6ee","resolution":{"observed_at":"2026-08-06T23:13:10.893556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-06T23:13:11.007680Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis.arXiv preprint arXiv:2405.21075, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19225","last_updated":"2025-06-24T01:19:56Z","snapshot_observed_at":"2026-08-07T21:07:46.308380Z","submitted_at":"2025-06-24T01:19:56Z","title":"Video-XL-2: Towards Very Long-Video Understanding Through Task-Aware KV Sparsification","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T23:13:11.007680Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2506.19225"},"observation_digest":"sha256:12830fa0f5adc474997d1a10e017f19cad813512d89aca84f10203f26c35a57c","observation_id":"ed07ec05-ffd7-4a34-8c26-c952a8137a10","resolution":{"observed_at":"2026-08-06T23:13:11.007680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15754","last_updated":"2024-07-22T16:00:55Z","snapshot_observed_at":"2026-08-06T14:12:05.548569Z","submitted_at":"2024-07-22T16:00:55Z","title":"LongVideoBench: A Benchmark for Long-context Interleaved Video-Language Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15754","snapshot_observed_at":"2026-08-06T23:13:11.123012Z","title":"Longvideobench: A benchmark for long-context interleaved video-language understanding.arXiv preprint arXiv:2407.15754, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19225","last_updated":"2025-06-24T01:19:56Z","snapshot_observed_at":"2026-08-07T21:07:46.308380Z","submitted_at":"2025-06-24T01:19:56Z","title":"Video-XL-2: Towards Very Long-Video Understanding Through Task-Aware KV Sparsification","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T23:13:11.123012Z"},"links":{"cited_paper":"/paper/2407.15754","citing_paper":"/paper/2506.19225"},"observation_digest":"sha256:9849c33212ca2aaa5ae5c8c3e93d0f0cfeb9e920dbb78ca83e83395174a29309","observation_id":"21397d08-1c0d-4164-9c4f-9539c132815f","resolution":{"observed_at":"2026-08-06T23:13:11.123012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08035","last_updated":"2025-08-09T10:54:59Z","snapshot_observed_at":"2026-08-05T10:34:24.268925Z","submitted_at":"2024-06-12T09:36:52Z","title":"LVBench: An Extreme Long Video Understanding Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08035","snapshot_observed_at":"2026-08-06T23:13:11.200327Z","title":"Lvbench: An extreme long video understanding benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19225","last_updated":"2025-06-24T01:19:56Z","snapshot_observed_at":"2026-08-07T21:07:46.308380Z","submitted_at":"2025-06-24T01:19:56Z","title":"Video-XL-2: Towards Very Long-Video Understanding Through Task-Aware KV Sparsification","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T23:13:11.200327Z"},"links":{"cited_paper":"/paper/2406.08035","citing_paper":"/paper/2506.19225"},"observation_digest":"sha256:4b2aa38201ff1bde6fbb0fba03c1cf764c161729b6b2b24431ebdf9591f08eea","observation_id":"51b153dd-a8c3-4786-8d0b-f0d8d967a8e5","resolution":{"observed_at":"2026-08-06T23:13:11.200327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14640","last_updated":"2025-05-20T17:26:32Z","snapshot_observed_at":"2026-08-07T15:28:25.992115Z","submitted_at":"2025-05-20T17:26:32Z","title":"VideoEval-Pro: Robust and Realistic Long Video Understanding Evaluation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14640","snapshot_observed_at":"2026-08-06T23:13:11.304314Z","title":"Videoeval-pro: Robust and realistic long video understanding evaluation.arXiv preprint arXiv:2505.14640, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.19225","last_updated":"2025-06-24T01:19:56Z","snapshot_observed_at":"2026-08-07T21:07:46.308380Z","submitted_at":"2025-06-24T01:19:56Z","title":"Video-XL-2: Towards Very Long-Video Understanding Through Task-Aware KV Sparsification","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T23:13:11.304314Z"},"links":{"cited_paper":"/paper/2505.14640","citing_paper":"/paper/2506.19225"},"observation_digest":"sha256:d1d02b72ad653bf12590c4a3a0da4455fc825efd664aac78ce6e03ef39031ea4","observation_id":"c7fc560d-b42f-45f3-a437-4be1ade2a1d1","resolution":{"observed_at":"2026-08-06T23:13:11.304314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:13:13.208305Z","title":"Tall: Temporal activity localization via language query","venue":null,"work_id":"e334633b-4fc4-4689-b1c2-df8e79d24c96","year":2017},"citing_paper":{"arxiv_id":"2506.19225","last_updated":"2025-06-24T01:19:56Z","snapshot_observed_at":"2026-08-07T21:07:46.308380Z","submitted_at":"2025-06-24T01:19:56Z","title":"Video-XL-2: Towards Very Long-Video Understanding Through Task-Aware KV Sparsification","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T23:13:11.448061Z"},"links":{"citing_paper":"/paper/2506.19225"},"observation_digest":"sha256:56b4bd315186e5392617fd23648402a5389b15a64f0ac934e02e8ee98d330710","observation_id":"741a5211-f14f-4cc4-adce-e004e9b0feae","resolution":{"observed_at":"2026-08-06T23:13:13.313796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.11495","last_updated":"2025-03-14T15:21:44Z","snapshot_observed_at":"2026-08-07T17:03:39.921455Z","submitted_at":"2025-03-14T15:21:44Z","title":"V-STaR: Benchmarking Video-LLMs on Video Spatio-Temporal Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.11495","snapshot_observed_at":"2026-08-06T23:13:11.605015Z","title":"V-star: Benchmarking video-llms on video spatio-temporal reasoning.arXiv preprint arXiv:2503.11495, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.19225","last_updated":"2025-06-24T01:19:56Z","snapshot_observed_at":"2026-08-07T21:07:46.308380Z","submitted_at":"2025-06-24T01:19:56Z","title":"Video-XL-2: Towards Very Long-Video Understanding Through Task-Aware KV Sparsification","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T23:13:11.605015Z"},"links":{"cited_paper":"/paper/2503.11495","citing_paper":"/paper/2506.19225"},"observation_digest":"sha256:4151b9baea8b7f7c64e8aa68b12e037661793b3230df9d13d81466f572e7f113","observation_id":"0c4697dc-4d72-452b-95f8-863bae8de435","resolution":{"observed_at":"2026-08-06T23:13:11.605015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05173","last_updated":"2025-05-30T03:54:16Z","snapshot_observed_at":"2026-07-06T20:33:01.960703Z","submitted_at":"2025-02-07T18:56:04Z","title":"VideoRoPE: What Makes for Good Video Rotary Position Embedding?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05173","snapshot_observed_at":"2026-08-06T23:13:11.715462Z","title":"Videorope: What makes for good video rotary position embedding?arXiv preprint arXiv:2502.05173, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.19225","last_updated":"2025-06-24T01:19:56Z","snapshot_observed_at":"2026-08-07T21:07:46.308380Z","submitted_at":"2025-06-24T01:19:56Z","title":"Video-XL-2: Towards Very Long-Video Understanding Through Task-Aware KV Sparsification","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T23:13:11.715462Z"},"links":{"cited_paper":"/paper/2502.05173","citing_paper":"/paper/2506.19225"},"observation_digest":"sha256:9d6c86cbcd6c4e28ce47904b0b2fe281062694d4955b1516077141cc04f6abd8","observation_id":"4a909771-f00d-4697-acda-ccf2c2a7a875","resolution":{"observed_at":"2026-08-06T23:13:11.715462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.19225","last_updated":"2025-06-24T01:19:56Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T21:07:46.308380Z","submitted_at":"2025-06-24T01:19:56Z","title":"Video-XL-2: Towards Very Long-Video Understanding Through Task-Aware KV Sparsification"},"reference_resolution":{"displayed":56,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":50,"verified_exact":0,"verified_fuzzy":6},"total_outbound_references":56},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 56 of 56 outbound references and 13 inbound Pith citation observations for arXiv:2506.19225."}