{"as_of":"2026-08-07T09:05:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:85122168c7b702c32c4b7d1049bd818c59ab0bc86fc0a7aa04236d5f11b47583","coverage":[{"denominator":36,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T04:01:48.625937Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.23265/citation-record","integrity":"/paper/2607.23265/integrity","json":"/paper/2607.23265/citation-record.json","paper":"/paper/2607.23265"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-04T04:01:48.498396Z","title":"Qwen2.5-vl technical report.arXiv preprint arXiv:2502.13923, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23265","last_updated":"2026-08-03T14:35:14Z","snapshot_observed_at":"2026-08-06T23:32:32.715200Z","submitted_at":"2026-07-25T16:05:22Z","title":"WaveZip: Wavelet-Driven Space-Time Decoupling for Video Token Condensation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T04:01:48.498396Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2607.23265"},"observation_digest":"sha256:708734de537c430fc1b5a96a0ff38668a4b610090c4d0c2bcde2f8281eced000","observation_id":"44e2cbf1-01e8-4686-a792-913be99b683a","resolution":{"observed_at":"2026-08-04T04:01:48.498396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.09461","last_updated":"2023-03-01T19:45:11Z","snapshot_observed_at":"2026-07-06T14:06:56.291161Z","submitted_at":"2022-10-17T22:23:40Z","title":"Token Merging: Your ViT But Faster","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.09461","snapshot_observed_at":"2026-08-04T04:01:48.503555Z","title":"To- ken merging: Your vit but faster.arXiv preprint arXiv:2210.09461, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23265","last_updated":"2026-08-03T14:35:14Z","snapshot_observed_at":"2026-08-06T23:32:32.715200Z","submitted_at":"2026-07-25T16:05:22Z","title":"WaveZip: Wavelet-Driven Space-Time Decoupling for Video Token Condensation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T04:01:48.503555Z"},"links":{"cited_paper":"/paper/2210.09461","citing_paper":"/paper/2607.23265"},"observation_digest":"sha256:89f63e9fafd408212d36278a80c5168c5705233071315efa1ec082c5d76481cc","observation_id":"1fdae0b6-6e02-4163-9122-2a3b1334ee2b","resolution":{"observed_at":"2026-08-04T04:01:48.503555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:01:48.507558Z","title":"An image is worth 1/2 tokens after layer 2: Plug-and-play inference acceleration for large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23265","last_updated":"2026-08-03T14:35:14Z","snapshot_observed_at":"2026-08-06T23:32:32.715200Z","submitted_at":"2026-07-25T16:05:22Z","title":"WaveZip: Wavelet-Driven Space-Time Decoupling for Video Token Condensation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T04:01:48.507558Z"},"links":{"citing_paper":"/paper/2607.23265"},"observation_digest":"sha256:43d2a9c1212293b493da69a1d27f73ac08d5fa89dd66fc5c9a9b90bc88b7af7c","observation_id":"5f6a29bb-70d6-4dd3-8d81-cd39c0c5e2db","resolution":{"observed_at":"2026-08-04T04:01:48.507558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:01:48.511212Z","title":"Flashvid: Efficient video large lan- guage models via training-free tree-based spatiotemporal to- ken merging.arXiv preprint arXiv:2602.08024, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.23265","last_updated":"2026-08-03T14:35:14Z","snapshot_observed_at":"2026-08-06T23:32:32.715200Z","submitted_at":"2026-07-25T16:05:22Z","title":"WaveZip: Wavelet-Driven Space-Time Decoupling for Video Token Condensation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T04:01:48.511212Z"},"links":{"citing_paper":"/paper/2607.23265"},"observation_digest":"sha256:c4fe6d35444795f890720afddbaaba919b6631e59bf52e27d7b9647d230e71fd","observation_id":"78c3485c-74b5-4288-82fd-120e407d87bc","resolution":{"observed_at":"2026-08-04T04:01:48.511212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:01:48.514807Z","title":"Video-mme: The first-ever 8 comprehensive evaluation benchmark of multi-modal llms in video analysis","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23265","last_updated":"2026-08-03T14:35:14Z","snapshot_observed_at":"2026-08-06T23:32:32.715200Z","submitted_at":"2026-07-25T16:05:22Z","title":"WaveZip: Wavelet-Driven Space-Time Decoupling for Video Token Condensation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T04:01:48.514807Z"},"links":{"citing_paper":"/paper/2607.23265"},"observation_digest":"sha256:b012ed408433ac43299fd9c76b2194b3f43003880325e7cd8a5195f4c0129019","observation_id":"53dee95a-1806-44a1-b376-81e4ce862e8f","resolution":{"observed_at":"2026-08-04T04:01:48.514807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.20066","last_updated":"2025-06-24T23:58:20Z","snapshot_observed_at":"2026-08-06T22:55:09.041478Z","submitted_at":"2025-06-24T23:58:20Z","title":"ToSA: Token Merging with Spatial Awareness","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.20066","snapshot_observed_at":"2026-08-04T04:01:48.518353Z","title":"Tosa: To- ken merging with spatial awareness.arXiv preprint arXiv:2506.20066, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23265","last_updated":"2026-08-03T14:35:14Z","snapshot_observed_at":"2026-08-06T23:32:32.715200Z","submitted_at":"2026-07-25T16:05:22Z","title":"WaveZip: Wavelet-Driven Space-Time Decoupling for Video Token Condensation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T04:01:48.518353Z"},"links":{"cited_paper":"/paper/2506.20066","citing_paper":"/paper/2607.23265"},"observation_digest":"sha256:dd72bce795847dd0eb1bafe04415d3f851619c7d3fee41c4c67beac2e4a1fc79","observation_id":"974bb5d5-894c-4430-9d4f-4be4e26c6499","resolution":{"observed_at":"2026-08-04T04:01:48.518353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-04T04:01:48.522434Z","title":"Gpt-4o system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23265","last_updated":"2026-08-03T14:35:14Z","snapshot_observed_at":"2026-08-06T23:32:32.715200Z","submitted_at":"2026-07-25T16:05:22Z","title":"WaveZip: Wavelet-Driven Space-Time Decoupling for Video Token Condensation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T04:01:48.522434Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2607.23265"},"observation_digest":"sha256:b964efc5daf254e4a705caf41b38266516b1eb4518d199eff6d1de1e728f8f8e","observation_id":"18bebb59-76ba-4594-94a4-67a8a572192a","resolution":{"observed_at":"2026-08-04T04:01:48.522434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-04T04:01:48.526036Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23265","last_updated":"2026-08-03T14:35:14Z","snapshot_observed_at":"2026-08-06T23:32:32.715200Z","submitted_at":"2026-07-25T16:05:22Z","title":"WaveZip: Wavelet-Driven Space-Time Decoupling for Video Token Condensation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T04:01:48.526036Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2607.23265"},"observation_digest":"sha256:64b6ca0a4a142e7b6f616814c21c417169073e39d6f77585e4f65e2ee19ec0a9","observation_id":"328529b7-f3d2-4427-8bf9-350335e6e3f6","resolution":{"observed_at":"2026-08-04T04:01:48.526036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12086","last_updated":"2022-02-15T05:43:32Z","snapshot_observed_at":"2026-08-02T08:01:43.194717Z","submitted_at":"2022-01-28T12:49:48Z","title":"BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.12086","snapshot_observed_at":"2026-08-04T04:01:48.529655Z","title":"Blip: Bootstrapping language-image pre-training for uni- fied vision-language understanding and generation.arXiv preprint arXiv:2201.12086, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23265","last_updated":"2026-08-03T14:35:14Z","snapshot_observed_at":"2026-08-06T23:32:32.715200Z","submitted_at":"2026-07-25T16:05:22Z","title":"WaveZip: Wavelet-Driven Space-Time Decoupling for Video Token Condensation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T04:01:48.529655Z"},"links":{"cited_paper":"/paper/2201.12086","citing_paper":"/paper/2607.23265"},"observation_digest":"sha256:202bdb09891ef8df422b1abaee491565e3e3cd1c02fd200ae7cd03d7326f7ed6","observation_id":"0ad61f7e-cc04-463a-a242-3cbd1623810a","resolution":{"observed_at":"2026-08-04T04:01:48.529655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:01:48.533350Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23265","last_updated":"2026-08-03T14:35:14Z","snapshot_observed_at":"2026-08-06T23:32:32.715200Z","submitted_at":"2026-07-25T16:05:22Z","title":"WaveZip: Wavelet-Driven Space-Time Decoupling for Video Token Condensation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T04:01:48.533350Z"},"links":{"citing_paper":"/paper/2607.23265"},"observation_digest":"sha256:6ce1405097f7c0263e113355e508c771dc5a9e3813b2056c81399b4b924d550c","observation_id":"f210869a-2640-4a7e-9a62-7ea7291c484c","resolution":{"observed_at":"2026-08-04T04:01:48.533350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06355","last_updated":"2024-01-04T02:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-10T17:59:04Z","title":"VideoChat: Chat-Centric Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06355","snapshot_observed_at":"2026-08-04T04:01:48.536689Z","title":"Videochat: Chat-centric video understanding.arXiv preprint arXiv:2305.06355, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23265","last_updated":"2026-08-03T14:35:14Z","snapshot_observed_at":"2026-08-06T23:32:32.715200Z","submitted_at":"2026-07-25T16:05:22Z","title":"WaveZip: Wavelet-Driven Space-Time Decoupling for Video Token Condensation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T04:01:48.536689Z"},"links":{"cited_paper":"/paper/2305.06355","citing_paper":"/paper/2607.23265"},"observation_digest":"sha256:810b3fa2df87988f2da27ed3ed2c12a6e1f882852d0d42a8fff1585df84b1633","observation_id":"b8716d82-f30e-4be0-b6f8-33615a4b0f8c","resolution":{"observed_at":"2026-08-04T04:01:48.536689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:01:48.540425Z","title":"Llama-vid: An image is worth 2 tokens in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23265","last_updated":"2026-08-03T14:35:14Z","snapshot_observed_at":"2026-08-06T23:32:32.715200Z","submitted_at":"2026-07-25T16:05:22Z","title":"WaveZip: Wavelet-Driven Space-Time Decoupling for Video Token Condensation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T04:01:48.540425Z"},"links":{"citing_paper":"/paper/2607.23265"},"observation_digest":"sha256:42ef7a84235139fb94ec6db2fc99c96dc154a627e509c57c9fb16641e26be984","observation_id":"c47054be-7fe5-4001-a7a0-3c1377f61fbf","resolution":{"observed_at":"2026-08-04T04:01:48.540425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:01:48.544682Z","title":"Video-llava: Learning united visual repre- sentation by alignment before projection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23265","last_updated":"2026-08-03T14:35:14Z","snapshot_observed_at":"2026-08-06T23:32:32.715200Z","submitted_at":"2026-07-25T16:05:22Z","title":"WaveZip: Wavelet-Driven Space-Time Decoupling for Video Token Condensation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T04:01:48.544682Z"},"links":{"citing_paper":"/paper/2607.23265"},"observation_digest":"sha256:0dd6f844ee021503271882fa1a18befc8275db2533e6e15c63890aa4fe7d6b1c","observation_id":"21db5e46-752e-4f57-8a64-d2ded3633464","resolution":{"observed_at":"2026-08-04T04:01:48.544682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:01:48.548091Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23265","last_updated":"2026-08-03T14:35:14Z","snapshot_observed_at":"2026-08-06T23:32:32.715200Z","submitted_at":"2026-07-25T16:05:22Z","title":"WaveZip: Wavelet-Driven Space-Time Decoupling for Video Token Condensation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T04:01:48.548091Z"},"links":{"citing_paper":"/paper/2607.23265"},"observation_digest":"sha256:c3f807071232c39ab6a2e4f195429bf69ed18f66934eb233f471ddeb04e956a1","observation_id":"aa1ab547-1060-4554-8727-6b75540b0809","resolution":{"observed_at":"2026-08-04T04:01:48.548091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.00553","last_updated":"2026-04-20T01:01:28Z","snapshot_observed_at":"2026-08-02T05:49:04.586461Z","submitted_at":"2025-08-01T11:48:11Z","title":"HiPrune: Hierarchical Attention for Efficient Token Pruning in Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.00553","snapshot_observed_at":"2026-08-04T04:01:48.552316Z","title":"Hiprune: Training-free visual token pruning via hierarchical attention in vision-language models.arXiv preprint arXiv:2508.00553, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23265","last_updated":"2026-08-03T14:35:14Z","snapshot_observed_at":"2026-08-06T23:32:32.715200Z","submitted_at":"2026-07-25T16:05:22Z","title":"WaveZip: Wavelet-Driven Space-Time Decoupling for Video Token Condensation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T04:01:48.552316Z"},"links":{"cited_paper":"/paper/2508.00553","citing_paper":"/paper/2607.23265"},"observation_digest":"sha256:53ad2af3c1ea0c81f45f82daca31d2357cc17854b773670f81e151c038d965bd","observation_id":"b1b8d28e-7d83-408b-a3cc-124242cba75e","resolution":{"observed_at":"2026-08-04T04:01:48.552316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:01:48.555827Z","title":"St-llm: Large language models are effective tem- poral learners","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23265","last_updated":"2026-08-03T14:35:14Z","snapshot_observed_at":"2026-08-06T23:32:32.715200Z","submitted_at":"2026-07-25T16:05:22Z","title":"WaveZip: Wavelet-Driven Space-Time Decoupling for Video Token Condensation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T04:01:48.555827Z"},"links":{"citing_paper":"/paper/2607.23265"},"observation_digest":"sha256:9127ed3565b4c0ac269f2df3fb944d4fb07f8006636b5462d6e5a97dedf7ab64","observation_id":"f319d61c-aaeb-465f-a9e5-ab11449f5ee5","resolution":{"observed_at":"2026-08-04T04:01:48.555827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:01:48.559642Z","title":"Quota: Query-oriented token assign- ment via cot query decouple for long video comprehension","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.23265","last_updated":"2026-08-03T14:35:14Z","snapshot_observed_at":"2026-08-06T23:32:32.715200Z","submitted_at":"2026-07-25T16:05:22Z","title":"WaveZip: Wavelet-Driven Space-Time Decoupling for Video Token Condensation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T04:01:48.559642Z"},"links":{"citing_paper":"/paper/2607.23265"},"observation_digest":"sha256:04393f98eeecfa08cbaca479af7538ff9d7d3e7db0de797dff06cde3b33c5e78","observation_id":"eac30308-e9d8-4b64-866c-96827b195d1f","resolution":{"observed_at":"2026-08-04T04:01:48.559642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:01:48.562981Z","title":"Egoschema: A diagnostic benchmark for very long- form video language understanding.Advances in Neural In- formation Processing Systems, 36:46212–46244, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23265","last_updated":"2026-08-03T14:35:14Z","snapshot_observed_at":"2026-08-06T23:32:32.715200Z","submitted_at":"2026-07-25T16:05:22Z","title":"WaveZip: Wavelet-Driven Space-Time Decoupling for Video Token Condensation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T04:01:48.562981Z"},"links":{"citing_paper":"/paper/2607.23265"},"observation_digest":"sha256:1f50670fcbcd57a7e2d882d48055b8f0f60584a83476db8203edb04b234671a2","observation_id":"1aaadd5e-6331-453a-a5a3-c7d534396285","resolution":{"observed_at":"2026-08-04T04:01:48.562981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:01:48.566302Z","title":"Llava-prumerge: Adaptive token reduction for efficient large multimodal models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23265","last_updated":"2026-08-03T14:35:14Z","snapshot_observed_at":"2026-08-06T23:32:32.715200Z","submitted_at":"2026-07-25T16:05:22Z","title":"WaveZip: Wavelet-Driven Space-Time Decoupling for Video Token Condensation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T04:01:48.566302Z"},"links":{"citing_paper":"/paper/2607.23265"},"observation_digest":"sha256:d1246d90ab90ab6a01546000e271e8eee67e8eb36f786ec708a3de691e247bff","observation_id":"80e4d298-80ab-4d3f-947c-2cc9deafe599","resolution":{"observed_at":"2026-08-04T04:01:48.566302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:01:48.569757Z","title":"Holitom: Holistic token merging for fast video large language models.arXiv preprint arXiv:2505.21334,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23265","last_updated":"2026-08-03T14:35:14Z","snapshot_observed_at":"2026-08-06T23:32:32.715200Z","submitted_at":"2026-07-25T16:05:22Z","title":"WaveZip: Wavelet-Driven Space-Time Decoupling for Video Token Condensation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T04:01:48.569757Z"},"links":{"citing_paper":"/paper/2607.23265"},"observation_digest":"sha256:7908a20178b247e160192e92f963ac7c80f1832bebdfee944731912bd4c37068","observation_id":"867c1159-ffdf-499f-994e-29a705b326b0","resolution":{"observed_at":"2026-08-04T04:01:48.569757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.01156","last_updated":"2025-03-12T09:11:37Z","snapshot_observed_at":"2026-07-06T19:09:14.628371Z","submitted_at":"2024-09-02T10:42:30Z","title":"TempMe: Video Temporal Token Merging for Efficient Text-Video Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.01156","snapshot_observed_at":"2026-08-04T04:01:48.573191Z","title":"Tempme: Video temporal token merging for efficient text- video retrieval.arXiv preprint arXiv:2409.01156, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23265","last_updated":"2026-08-03T14:35:14Z","snapshot_observed_at":"2026-08-06T23:32:32.715200Z","submitted_at":"2026-07-25T16:05:22Z","title":"WaveZip: Wavelet-Driven Space-Time Decoupling for Video Token Condensation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T04:01:48.573191Z"},"links":{"cited_paper":"/paper/2409.01156","citing_paper":"/paper/2607.23265"},"observation_digest":"sha256:01fa80f643b9bcd82705b9cb059480e38148bfdc41edf3d074c8619e69adbf2a","observation_id":"bd2233ae-0764-4622-ba01-0bc71e99655c","resolution":{"observed_at":"2026-08-04T04:01:48.573191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:01:48.576697Z","title":"Fastvid: Dynamic density pruning for fast video large language mod- els.arXiv preprint arXiv:2503.11187, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23265","last_updated":"2026-08-03T14:35:14Z","snapshot_observed_at":"2026-08-06T23:32:32.715200Z","submitted_at":"2026-07-25T16:05:22Z","title":"WaveZip: Wavelet-Driven Space-Time Decoupling for Video Token Condensation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T04:01:48.576697Z"},"links":{"citing_paper":"/paper/2607.23265"},"observation_digest":"sha256:e93058f78f997129cdf115612edec37958ed9b1132266712028ef6454ada94c5","observation_id":"3200ee9a-b65a-4800-9985-973813bc3e5f","resolution":{"observed_at":"2026-08-04T04:01:48.576697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:01:48.580079Z","title":"Dycoke: Dynamic compression of tokens for fast video large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23265","last_updated":"2026-08-03T14:35:14Z","snapshot_observed_at":"2026-08-06T23:32:32.715200Z","submitted_at":"2026-07-25T16:05:22Z","title":"WaveZip: Wavelet-Driven Space-Time Decoupling for Video Token Condensation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T04:01:48.580079Z"},"links":{"citing_paper":"/paper/2607.23265"},"observation_digest":"sha256:42a9df89f050949d204c23113e1a0304811d7ad6adcc4b71bdbfe767d60244e0","observation_id":"9d925bb5-be95-46b0-9e07-dc9989631636","resolution":{"observed_at":"2026-08-04T04:01:48.580079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:01:48.583336Z","title":"LOOK-M: Look-once optimization in KV cache for efficient multi- modal long-context inference","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23265","last_updated":"2026-08-03T14:35:14Z","snapshot_observed_at":"2026-08-06T23:32:32.715200Z","submitted_at":"2026-07-25T16:05:22Z","title":"WaveZip: Wavelet-Driven Space-Time Decoupling for Video Token Condensation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T04:01:48.583336Z"},"links":{"citing_paper":"/paper/2607.23265"},"observation_digest":"sha256:3a50741241595e05e8b01beeb2d8dabb1fde465866d99c8574486e75b1e35357","observation_id":"2512aef0-09e6-40ec-a128-6c78c1d71e0d","resolution":{"observed_at":"2026-08-04T04:01:48.583336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.06038","last_updated":"2026-05-18T14:51:17Z","snapshot_observed_at":"2026-08-02T14:57:47.919020Z","submitted_at":"2025-08-08T05:49:42Z","title":"Fourier Compressor: Frequency-Domain Visual Token Compression for Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.06038","snapshot_observed_at":"2026-08-04T04:01:48.586722Z","title":"Fourier-vlm: Compressing vision tokens in the frequency domain for large vision-language models.arXiv preprint arXiv:2508.06038, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23265","last_updated":"2026-08-03T14:35:14Z","snapshot_observed_at":"2026-08-06T23:32:32.715200Z","submitted_at":"2026-07-25T16:05:22Z","title":"WaveZip: Wavelet-Driven Space-Time Decoupling for Video Token Condensation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T04:01:48.586722Z"},"links":{"cited_paper":"/paper/2508.06038","citing_paper":"/paper/2607.23265"},"observation_digest":"sha256:e2779e50b9cdd98f81cedcf263acfdc0880c2d018a18b5f51b0bf7c4d005f3f4","observation_id":"81fd0740-e503-445f-a570-13e1ead2dbda","resolution":{"observed_at":"2026-08-04T04:01:48.586722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18265","last_updated":"2025-08-27T14:39:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-25T17:58:17Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.18265","snapshot_observed_at":"2026-08-04T04:01:48.590655Z","title":"Internvl3","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23265","last_updated":"2026-08-03T14:35:14Z","snapshot_observed_at":"2026-08-06T23:32:32.715200Z","submitted_at":"2026-07-25T16:05:22Z","title":"WaveZip: Wavelet-Driven Space-Time Decoupling for Video Token Condensation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T04:01:48.590655Z"},"links":{"cited_paper":"/paper/2508.18265","citing_paper":"/paper/2607.23265"},"observation_digest":"sha256:14324510fe1f26d65730bd65302ff82c02fe0058ad4c7d2323f6cae96be07eec","observation_id":"a3d32d06-f585-474a-ab13-67d59a8b579e","resolution":{"observed_at":"2026-08-04T04:01:48.590655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:01:48.594179Z","title":"Lvbench: An extreme long video understanding benchmark","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23265","last_updated":"2026-08-03T14:35:14Z","snapshot_observed_at":"2026-08-06T23:32:32.715200Z","submitted_at":"2026-07-25T16:05:22Z","title":"WaveZip: Wavelet-Driven Space-Time Decoupling for Video Token Condensation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T04:01:48.594179Z"},"links":{"citing_paper":"/paper/2607.23265"},"observation_digest":"sha256:f12299d6002d4a6e56e68a11429b581f22764157583d279a0d357453a6413393","observation_id":"7d40669d-0f7f-4372-8775-f43c0d696663","resolution":{"observed_at":"2026-08-04T04:01:48.594179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:01:48.597987Z","title":"Longvideobench: A benchmark for long-context interleaved video-language understanding.Advances in Neural Informa- tion Processing Systems, 37:28828–28857, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23265","last_updated":"2026-08-03T14:35:14Z","snapshot_observed_at":"2026-08-06T23:32:32.715200Z","submitted_at":"2026-07-25T16:05:22Z","title":"WaveZip: Wavelet-Driven Space-Time Decoupling for Video Token Condensation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T04:01:48.597987Z"},"links":{"citing_paper":"/paper/2607.23265"},"observation_digest":"sha256:02ee3cc0ad00f0327735cc779d8ca798fd83524faf1a05836439ee8bdf9ae29c","observation_id":"cc6474f9-9105-4521-aed5-33b16a18475c","resolution":{"observed_at":"2026-08-04T04:01:48.597987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17247","last_updated":"2025-02-27T11:16:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-22T17:59:53Z","title":"PyramidDrop: Accelerating Your Large Vision-Language Models via Pyramid Visual Redundancy Reduction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17247","snapshot_observed_at":"2026-08-04T04:01:48.601334Z","title":"Pyramiddrop: Accelerating your large vision-language models via pyramid visual redundancy re- duction.arXiv preprint arXiv:2410.17247, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23265","last_updated":"2026-08-03T14:35:14Z","snapshot_observed_at":"2026-08-06T23:32:32.715200Z","submitted_at":"2026-07-25T16:05:22Z","title":"WaveZip: Wavelet-Driven Space-Time Decoupling for Video Token Condensation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T04:01:48.601334Z"},"links":{"cited_paper":"/paper/2410.17247","citing_paper":"/paper/2607.23265"},"observation_digest":"sha256:57bb5a631cb1871adc093242feab99947b73b8c56ce4372d2643433365afa58c","observation_id":"5cf8eaf9-3adf-41a1-aa63-a04b8662a820","resolution":{"observed_at":"2026-08-04T04:01:48.601334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:01:48.605144Z","title":"Visionzip: Longer 9 is better but not necessary in vision language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23265","last_updated":"2026-08-03T14:35:14Z","snapshot_observed_at":"2026-08-06T23:32:32.715200Z","submitted_at":"2026-07-25T16:05:22Z","title":"WaveZip: Wavelet-Driven Space-Time Decoupling for Video Token Condensation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T04:01:48.605144Z"},"links":{"citing_paper":"/paper/2607.23265"},"observation_digest":"sha256:2b4d875d413bcfbd83e185d9966f61f3d2da581f7f84aa5b1e12e15d69829372","observation_id":"30edd1d2-1f31-40a6-a0b5-1034d98c124f","resolution":{"observed_at":"2026-08-04T04:01:48.605144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:01:48.608428Z","title":"Vflowopt: A token pruning frame- work for lmms with visual information flow-guided opti- mization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23265","last_updated":"2026-08-03T14:35:14Z","snapshot_observed_at":"2026-08-06T23:32:32.715200Z","submitted_at":"2026-07-25T16:05:22Z","title":"WaveZip: Wavelet-Driven Space-Time Decoupling for Video Token Condensation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T04:01:48.608428Z"},"links":{"citing_paper":"/paper/2607.23265"},"observation_digest":"sha256:fa074f3c93b6f2b518f6c71de7049205d9a18ae820d8ff14b2b650da73c63014","observation_id":"fe0b34fd-c262-4970-970d-62920d28128d","resolution":{"observed_at":"2026-08-04T04:01:48.608428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:01:48.611796Z","title":"Wave-vit: Unifying wavelet and transformers for visual representation learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23265","last_updated":"2026-08-03T14:35:14Z","snapshot_observed_at":"2026-08-06T23:32:32.715200Z","submitted_at":"2026-07-25T16:05:22Z","title":"WaveZip: Wavelet-Driven Space-Time Decoupling for Video Token Condensation","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T04:01:48.611796Z"},"links":{"citing_paper":"/paper/2607.23265"},"observation_digest":"sha256:a4f1e89223ce1f45e857fbe41d58e20a84f3445fc4eb5a449eec84988507fb05","observation_id":"7d1800be-f5b8-4c39-90f5-c747fdf34328","resolution":{"observed_at":"2026-08-04T04:01:48.611796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.01548","last_updated":"2025-08-03T02:15:43Z","snapshot_observed_at":"2026-08-07T08:25:25.474549Z","submitted_at":"2025-08-03T02:15:43Z","title":"A Glimpse to Compress: Dynamic Visual Token Pruning for Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.01548","snapshot_observed_at":"2026-08-04T04:01:48.615080Z","title":"A glimpse to compress: Dynamic visual token prun- ing for large vision-language models.arXiv preprint arXiv:2508.01548, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23265","last_updated":"2026-08-03T14:35:14Z","snapshot_observed_at":"2026-08-06T23:32:32.715200Z","submitted_at":"2026-07-25T16:05:22Z","title":"WaveZip: Wavelet-Driven Space-Time Decoupling for Video Token Condensation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-04T04:01:48.615080Z"},"links":{"cited_paper":"/paper/2508.01548","citing_paper":"/paper/2607.23265"},"observation_digest":"sha256:5a53b4d638636ab05112bf0b92fa5d9de382dffc0a5090e00d27a41752ea2fc7","observation_id":"558d0d5d-1581-409f-98fb-9543daec9110","resolution":{"observed_at":"2026-08-04T04:01:48.615080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-07-06T15:38:39.712379Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-04T04:01:48.618509Z","title":"Video-llama: An instruction-tuned audio-visual language model for video un- derstanding.arXiv preprint arXiv:2306.02858, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23265","last_updated":"2026-08-03T14:35:14Z","snapshot_observed_at":"2026-08-06T23:32:32.715200Z","submitted_at":"2026-07-25T16:05:22Z","title":"WaveZip: Wavelet-Driven Space-Time Decoupling for Video Token Condensation","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T04:01:48.618509Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2607.23265"},"observation_digest":"sha256:c48a7bd54109039dca931c011734d1b74dd6526e101b4d919e7bf625ecf515f2","observation_id":"5631c45a-2fe2-4b42-830b-5889dc58e5cb","resolution":{"observed_at":"2026-08-04T04:01:48.618509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10967","last_updated":"2025-07-01T08:19:08Z","snapshot_observed_at":"2026-08-07T04:10:34.426874Z","submitted_at":"2025-06-12T17:59:09Z","title":"Beyond Attention or Similarity: Maximizing Conditional Diversity for Token Pruning in MLLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10967","snapshot_observed_at":"2026-08-04T04:01:48.622068Z","title":"Beyond attention or similarity: Maximizing conditional diversity for token pruning in mllms.arXiv preprint arXiv:2506.10967,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23265","last_updated":"2026-08-03T14:35:14Z","snapshot_observed_at":"2026-08-06T23:32:32.715200Z","submitted_at":"2026-07-25T16:05:22Z","title":"WaveZip: Wavelet-Driven Space-Time Decoupling for Video Token Condensation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-04T04:01:48.622068Z"},"links":{"cited_paper":"/paper/2506.10967","citing_paper":"/paper/2607.23265"},"observation_digest":"sha256:b3165297515ae27b5c8e3dd5513b03ef44a02fb82056384fc465de46051f2b5f","observation_id":"c940e4a4-e27a-4e34-b139-3498d8d14cc3","resolution":{"observed_at":"2026-08-04T04:01:48.622068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-02T12:24:31.329178Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02713","snapshot_observed_at":"2026-08-04T04:01:48.625937Z","title":"Video instruction tuning with synthetic data.arXiv preprint arXiv:2410.02713, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23265","last_updated":"2026-08-03T14:35:14Z","snapshot_observed_at":"2026-08-06T23:32:32.715200Z","submitted_at":"2026-07-25T16:05:22Z","title":"WaveZip: Wavelet-Driven Space-Time Decoupling for Video Token Condensation","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-04T04:01:48.625937Z"},"links":{"cited_paper":"/paper/2410.02713","citing_paper":"/paper/2607.23265"},"observation_digest":"sha256:917c4b4ac7cece5d86e5a72b7ee0b3ee1e6d355660e60990a30d830ad2b570ee","observation_id":"cca36352-5a8f-416b-ba86-639dfcbb76bb","resolution":{"observed_at":"2026-08-04T04:01:48.625937Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.23265","last_updated":"2026-08-03T14:35:14Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T23:32:32.715200Z","submitted_at":"2026-07-25T16:05:22Z","title":"WaveZip: Wavelet-Driven Space-Time Decoupling for Video Token Condensation"},"reference_resolution":{"displayed":36,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":35,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":36},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 0 inbound Pith citation observations for arXiv:2607.23265."}