{"as_of":"2026-08-08T22:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:41e35a285606195d6f703c0b99c13c4940e73eae740a76662a7a74f864167a46","coverage":[{"denominator":34,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T00:55:50.162416Z","state":"measured"},{"denominator":34,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":34,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.03112/citation-record","integrity":"/paper/2608.03112/integrity","json":"/paper/2608.03112/citation-record.json","paper":"/paper/2608.03112"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:55:50.720529Z","title":"Divprune: Diversity-based visual token pruning for large multimodal models","venue":null,"work_id":"ad5ba192-d67d-4339-82e9-8ed03f82e302","year":2025},"citing_paper":{"arxiv_id":"2608.03112","last_updated":"2026-08-04T04:32:48Z","snapshot_observed_at":"2026-08-08T00:50:14.056001Z","submitted_at":"2026-08-04T04:32:48Z","title":"Adaptive Two-Stage Visual Token Pruning for Efficient Inference in Video-Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-08T00:55:50.036588Z"},"links":{"citing_paper":"/paper/2608.03112"},"observation_digest":"sha256:a5c1cba3cea920f0eda5560da66ea3c734165426c7fc0c9cd1e7e1995aadefc8","observation_id":"6aa95c04-c4fd-424c-bf4e-5f080bb33dc9","resolution":{"observed_at":"2026-08-08T00:55:50.724195Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-08T00:55:50.040897Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03112","last_updated":"2026-08-04T04:32:48Z","snapshot_observed_at":"2026-08-08T00:50:14.056001Z","submitted_at":"2026-08-04T04:32:48Z","title":"Adaptive Two-Stage Visual Token Pruning for Efficient Inference in Video-Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-08T00:55:50.040897Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2608.03112"},"observation_digest":"sha256:4190b62c1bad014aa71d2dda1192c9984f147d2b61455a3bf34c777524edc1c7","observation_id":"42b15421-c221-4477-b3a9-e3a5bfdbbe09","resolution":{"observed_at":"2026-08-08T00:55:50.040897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16236","last_updated":"2025-07-03T06:59:56Z","snapshot_observed_at":"2026-08-04T14:59:50.724834Z","submitted_at":"2024-10-21T17:41:28Z","title":"LLaVA-KD: A Framework of Distilling Multimodal Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.16236","snapshot_observed_at":"2026-08-08T00:55:50.045305Z","title":"Llava-kd: A framework of distill- ing multimodal large language models.arXiv preprint arXiv:2410.16236, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03112","last_updated":"2026-08-04T04:32:48Z","snapshot_observed_at":"2026-08-08T00:50:14.056001Z","submitted_at":"2026-08-04T04:32:48Z","title":"Adaptive Two-Stage Visual Token Pruning for Efficient Inference in Video-Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-08T00:55:50.045305Z"},"links":{"cited_paper":"/paper/2410.16236","citing_paper":"/paper/2608.03112"},"observation_digest":"sha256:a0db2818b400dca02d6bb9c0553ebe2769a853f20c6787372b1222f4c406e867","observation_id":"0ec23800-fd5b-4476-8bc9-bb6b9304a4b7","resolution":{"observed_at":"2026-08-08T00:55:50.045305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:55:50.710027Z","title":"An image is worth 1/2 tokens after layer 2: Plug-and-play inference acceleration for large vision-language models","venue":null,"work_id":"773f39dd-14ca-4c56-94f6-ac0a49754d92","year":2024},"citing_paper":{"arxiv_id":"2608.03112","last_updated":"2026-08-04T04:32:48Z","snapshot_observed_at":"2026-08-08T00:50:14.056001Z","submitted_at":"2026-08-04T04:32:48Z","title":"Adaptive Two-Stage Visual Token Pruning for Efficient Inference in Video-Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-08T00:55:50.049443Z"},"links":{"citing_paper":"/paper/2608.03112"},"observation_digest":"sha256:72bbef898b3f28e9bbaf757353257982385195a5378f6f235fd1628988af0897","observation_id":"3a00e5f9-79d9-4cc1-b3a2-4b63c60a11b1","resolution":{"observed_at":"2026-08-08T00:55:50.713888Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-08T00:55:50.053363Z","title":"Videollama 2: Advancing spatial- temporal modeling and audio understanding in video-llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03112","last_updated":"2026-08-04T04:32:48Z","snapshot_observed_at":"2026-08-08T00:50:14.056001Z","submitted_at":"2026-08-04T04:32:48Z","title":"Adaptive Two-Stage Visual Token Pruning for Efficient Inference in Video-Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-08T00:55:50.053363Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2608.03112"},"observation_digest":"sha256:c16284d72b03b477f34d25089772a808ebc9f24ce60bd1b618a5802d51e95772","observation_id":"6aaaff18-9677-42cd-9ac8-98930dc07965","resolution":{"observed_at":"2026-08-08T00:55:50.053363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:55:50.057359Z","title":"Instructblip: Towards general-purpose vision- language models with instruction tuning.Advances in neural information processing systems, 36:49250–49267, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.03112","last_updated":"2026-08-04T04:32:48Z","snapshot_observed_at":"2026-08-08T00:50:14.056001Z","submitted_at":"2026-08-04T04:32:48Z","title":"Adaptive Two-Stage Visual Token Pruning for Efficient Inference in Video-Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-08T00:55:50.057359Z"},"links":{"citing_paper":"/paper/2608.03112"},"observation_digest":"sha256:68d1cae0b8d5a0c1823b0d92e1499b910cf8939ad4b3ca38eaa9cace2cc7d2bf","observation_id":"e04ecb77-5faa-4c3d-a1c5-ab31c2c5dd2b","resolution":{"observed_at":"2026-08-08T00:55:50.057359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:55:50.061082Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03112","last_updated":"2026-08-04T04:32:48Z","snapshot_observed_at":"2026-08-08T00:50:14.056001Z","submitted_at":"2026-08-04T04:32:48Z","title":"Adaptive Two-Stage Visual Token Pruning for Efficient Inference in Video-Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T00:55:50.061082Z"},"links":{"citing_paper":"/paper/2608.03112"},"observation_digest":"sha256:2a02c1a2dbb92ec35a92ff43ad59cdb4c7716747bde9dcdd0eb9403200a3cf80","observation_id":"43fb8f65-9a80-46fd-9c21-fc66ef589dfb","resolution":{"observed_at":"2026-08-08T00:55:50.061082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12335","last_updated":"2024-10-02T00:19:13Z","snapshot_observed_at":"2026-08-05T13:25:45.819642Z","submitted_at":"2024-06-18T07:01:11Z","title":"Attention Score is not All You Need for Token Importance Indicator in KV Cache Reduction: Value Also Matters","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12335","snapshot_observed_at":"2026-08-08T00:55:50.064934Z","title":"Atten- tion score is not all you need for token importance indicator in kv cache reduction: Value also matters.arXiv preprint arXiv:2406.12335, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03112","last_updated":"2026-08-04T04:32:48Z","snapshot_observed_at":"2026-08-08T00:50:14.056001Z","submitted_at":"2026-08-04T04:32:48Z","title":"Adaptive Two-Stage Visual Token Pruning for Efficient Inference in Video-Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T00:55:50.064934Z"},"links":{"cited_paper":"/paper/2406.12335","citing_paper":"/paper/2608.03112"},"observation_digest":"sha256:f308fe60aa5a10c42d8add2be9d1a78934698e8869f520cf4ea6566529d96fcb","observation_id":"126021bf-1271-4442-a0ca-2f14caebe633","resolution":{"observed_at":"2026-08-08T00:55:50.064934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:55:50.068691Z","title":"Filter, correlate, compress: Training-free to- ken reduction for mllm acceleration.arXiv preprint arXiv:2411.17686, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03112","last_updated":"2026-08-04T04:32:48Z","snapshot_observed_at":"2026-08-08T00:50:14.056001Z","submitted_at":"2026-08-04T04:32:48Z","title":"Adaptive Two-Stage Visual Token Pruning for Efficient Inference in Video-Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T00:55:50.068691Z"},"links":{"citing_paper":"/paper/2608.03112"},"observation_digest":"sha256:579998ba553d64d827fd85606da9e54d31568f25c6ad67e386a3bec83a0a9712","observation_id":"97536288-417c-4bb4-a920-90d2bcc1e097","resolution":{"observed_at":"2026-08-08T00:55:50.068691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11530","last_updated":"2024-07-22T09:54:40Z","snapshot_observed_at":"2026-07-06T17:31:45.847395Z","submitted_at":"2024-02-18T10:09:10Z","title":"Efficient Multimodal Learning from Data-centric Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11530","snapshot_observed_at":"2026-08-08T00:55:50.072148Z","title":"Efficient multi- modal learning from data-centric perspective.arXiv preprint arXiv:2402.11530, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03112","last_updated":"2026-08-04T04:32:48Z","snapshot_observed_at":"2026-08-08T00:50:14.056001Z","submitted_at":"2026-08-04T04:32:48Z","title":"Adaptive Two-Stage Visual Token Pruning for Efficient Inference in Video-Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T00:55:50.072148Z"},"links":{"cited_paper":"/paper/2402.11530","citing_paper":"/paper/2608.03112"},"observation_digest":"sha256:702c65d828bf1ed84af6578afab164d6ce33de35bf6ab4d4445fa3a61cc18334","observation_id":"7e115841-d1f7-4f52-aae3-970b7392d232","resolution":{"observed_at":"2026-08-08T00:55:50.072148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:55:50.687726Z","title":"Ivtp: Instruction-guided visual token pruning for large vision-language models","venue":null,"work_id":"47be3947-24f0-44e4-a2aa-ac8ede3e8bec","year":2024},"citing_paper":{"arxiv_id":"2608.03112","last_updated":"2026-08-04T04:32:48Z","snapshot_observed_at":"2026-08-08T00:50:14.056001Z","submitted_at":"2026-08-04T04:32:48Z","title":"Adaptive Two-Stage Visual Token Pruning for Efficient Inference in Video-Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T00:55:50.076060Z"},"links":{"citing_paper":"/paper/2608.03112"},"observation_digest":"sha256:f3d5005fedf9124b7df0ca216b5eb0d26ab25da5768a596f054685763960bead","observation_id":"9b88ced9-c6c7-4e39-8b1f-f92e6d2fd0e6","resolution":{"observed_at":"2026-08-08T00:55:50.691372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:55:50.677372Z","title":"Fast pruning using principal components.Advances in neural information processing systems, 6, 1993","venue":null,"work_id":"43679125-cfc4-4eb8-a85e-5eb6d300936c","year":1993},"citing_paper":{"arxiv_id":"2608.03112","last_updated":"2026-08-04T04:32:48Z","snapshot_observed_at":"2026-08-08T00:50:14.056001Z","submitted_at":"2026-08-04T04:32:48Z","title":"Adaptive Two-Stage Visual Token Pruning for Efficient Inference in Video-Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T00:55:50.079301Z"},"links":{"citing_paper":"/paper/2608.03112"},"observation_digest":"sha256:990d041097449b83ce814b60d7040713874dabd6e5e07d72ac708ce9e25ad6fb","observation_id":"475ef900-2adf-4dfa-aa48-3fb750537e2c","resolution":{"observed_at":"2026-08-08T00:55:50.680940Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-08T00:55:50.082897Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03112","last_updated":"2026-08-04T04:32:48Z","snapshot_observed_at":"2026-08-08T00:50:14.056001Z","submitted_at":"2026-08-04T04:32:48Z","title":"Adaptive Two-Stage Visual Token Pruning for Efficient Inference in Video-Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-08T00:55:50.082897Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2608.03112"},"observation_digest":"sha256:9a36347f0791ddc37dc26056f1be4f9a6de6f706b31b0b1c92b203f66c009aef","observation_id":"17d30c23-5d1b-4b62-b66b-5d3912721494","resolution":{"observed_at":"2026-08-08T00:55:50.082897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:55:50.086574Z","title":"Llama-vid: An image is worth 2 tokens in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03112","last_updated":"2026-08-04T04:32:48Z","snapshot_observed_at":"2026-08-08T00:50:14.056001Z","submitted_at":"2026-08-04T04:32:48Z","title":"Adaptive Two-Stage Visual Token Pruning for Efficient Inference in Video-Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T00:55:50.086574Z"},"links":{"citing_paper":"/paper/2608.03112"},"observation_digest":"sha256:be12effef23d4eb8279f477c93592bda5cb706cfecd158e4ef10d1540c79ce90","observation_id":"a2efe416-7b05-43a0-938b-57e1118d90c7","resolution":{"observed_at":"2026-08-08T00:55:50.086574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18478","last_updated":"2025-04-27T10:39:51Z","snapshot_observed_at":"2026-08-07T16:41:53.661756Z","submitted_at":"2025-03-24T09:21:48Z","title":"Video-XL-Pro: Reconstructive Token Compression for Extremely Long Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.18478","snapshot_observed_at":"2026-08-08T00:55:50.089925Z","title":"Video-xl-pro: Reconstructive token compres- sion for extremely long video understanding.arXiv preprint arXiv:2503.18478, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03112","last_updated":"2026-08-04T04:32:48Z","snapshot_observed_at":"2026-08-08T00:50:14.056001Z","submitted_at":"2026-08-04T04:32:48Z","title":"Adaptive Two-Stage Visual Token Pruning for Efficient Inference in Video-Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T00:55:50.089925Z"},"links":{"cited_paper":"/paper/2503.18478","citing_paper":"/paper/2608.03112"},"observation_digest":"sha256:60c3bc7e662092f369077f9f0eb0bcee6e7c1cbc6f0e1738b811cceebaa91f6a","observation_id":"a2fbb7ef-1df6-4de6-a5ce-e13c9d235442","resolution":{"observed_at":"2026-08-08T00:55:50.089925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:55:50.661552Z","title":"Video detail caption","venue":null,"work_id":"463397fa-a8ee-498a-ac86-a29a6c57abc5","year":2024},"citing_paper":{"arxiv_id":"2608.03112","last_updated":"2026-08-04T04:32:48Z","snapshot_observed_at":"2026-08-08T00:50:14.056001Z","submitted_at":"2026-08-04T04:32:48Z","title":"Adaptive Two-Stage Visual Token Pruning for Efficient Inference in Video-Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T00:55:50.093552Z"},"links":{"citing_paper":"/paper/2608.03112"},"observation_digest":"sha256:f237170ae7c40ad7143a0e23e3c9c5c793cc9a9f0164e629d0e6ef324ab3bc60","observation_id":"d0860654-ac66-4fdc-9b8d-f70b7d351ac5","resolution":{"observed_at":"2026-08-08T00:55:50.665223Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:55:50.651109Z","title":null,"venue":null,"work_id":"433c900a-7cba-4e46-b161-510176e06006","year":null},"citing_paper":{"arxiv_id":"2608.03112","last_updated":"2026-08-04T04:32:48Z","snapshot_observed_at":"2026-08-08T00:50:14.056001Z","submitted_at":"2026-08-04T04:32:48Z","title":"Adaptive Two-Stage Visual Token Pruning for Efficient Inference in Video-Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-08T00:55:50.096902Z"},"links":{"citing_paper":"/paper/2608.03112"},"observation_digest":"sha256:836b741d860c1da853aea2c7f3c59aab8201434c7291705031065e642eaf9f83","observation_id":"c51946b4-8667-4d8d-8930-2d124f6c9292","resolution":{"observed_at":"2026-08-08T00:55:50.654611Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05424","last_updated":"2024-06-10T01:36:53Z","snapshot_observed_at":"2026-07-06T15:40:24.127663Z","submitted_at":"2023-06-08T17:59:56Z","title":"Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05424","snapshot_observed_at":"2026-08-08T00:55:50.100827Z","title":"Video-chatgpt: Towards detailed video understanding via large vision and language models.arXiv preprint arXiv:2306.05424, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.03112","last_updated":"2026-08-04T04:32:48Z","snapshot_observed_at":"2026-08-08T00:50:14.056001Z","submitted_at":"2026-08-04T04:32:48Z","title":"Adaptive Two-Stage Visual Token Pruning for Efficient Inference in Video-Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T00:55:50.100827Z"},"links":{"cited_paper":"/paper/2306.05424","citing_paper":"/paper/2608.03112"},"observation_digest":"sha256:3b05cb64167eaac98bd537497fbbe86431a33a35aad6036ac9f944655ff2076c","observation_id":"08fe127c-bdcf-4157-b0ee-2d503c0556d9","resolution":{"observed_at":"2026-08-08T00:55:50.100827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:55:50.104780Z","title":"Per- ception test: A diagnostic benchmark for multimodal video models.Advances in Neural Information Processing Sys- tems, 36:42748–42761, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.03112","last_updated":"2026-08-04T04:32:48Z","snapshot_observed_at":"2026-08-08T00:50:14.056001Z","submitted_at":"2026-08-04T04:32:48Z","title":"Adaptive Two-Stage Visual Token Pruning for Efficient Inference in Video-Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T00:55:50.104780Z"},"links":{"citing_paper":"/paper/2608.03112"},"observation_digest":"sha256:011b243015a4bed3bf4a28141938482589c385595f73d26f1c2f654e4e7bfd0a","observation_id":"581c3805-4d45-4d1e-bd00-1602d8e60b17","resolution":{"observed_at":"2026-08-08T00:55:50.104780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:55:50.108437Z","title":"Llava-prumerge: Adaptive token reduction for efficient large multimodal models.arXiv preprint arXiv:2403.15388,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03112","last_updated":"2026-08-04T04:32:48Z","snapshot_observed_at":"2026-08-08T00:50:14.056001Z","submitted_at":"2026-08-04T04:32:48Z","title":"Adaptive Two-Stage Visual Token Pruning for Efficient Inference in Video-Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-08T00:55:50.108437Z"},"links":{"citing_paper":"/paper/2608.03112"},"observation_digest":"sha256:b17313680410449eadfa94dc09a7baa53fe8ce960acce0f5eadff0020ff51657","observation_id":"30bbac77-b536-4487-b583-6426e3c42043","resolution":{"observed_at":"2026-08-08T00:55:50.108437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:55:50.633655Z","title":"Imp: Highly capable large multimodal models for mobile devices.IEEE Transactions on Multime- dia, 2025","venue":null,"work_id":"cc240bb7-960c-401e-9d56-53b0fb7bd7d2","year":2025},"citing_paper":{"arxiv_id":"2608.03112","last_updated":"2026-08-04T04:32:48Z","snapshot_observed_at":"2026-08-08T00:50:14.056001Z","submitted_at":"2026-08-04T04:32:48Z","title":"Adaptive Two-Stage Visual Token Pruning for Efficient Inference in Video-Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-08T00:55:50.112464Z"},"links":{"citing_paper":"/paper/2608.03112"},"observation_digest":"sha256:66c6f4f90ca57eb9b122cafd5b310e591b8486c00d0d11c5424146c88f7d4719","observation_id":"1cad450f-7298-4506-beb1-ab398a6982d8","resolution":{"observed_at":"2026-08-08T00:55:50.638126Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17434","last_updated":"2024-10-22T21:21:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-22T21:21:37Z","title":"LongVU: Spatiotemporal Adaptive Compression for Long Video-Language Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17434","snapshot_observed_at":"2026-08-08T00:55:50.116104Z","title":"Longvu: Spa- tiotemporal adaptive compression for long video-language understanding.arXiv preprint arXiv:2410.17434, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03112","last_updated":"2026-08-04T04:32:48Z","snapshot_observed_at":"2026-08-08T00:50:14.056001Z","submitted_at":"2026-08-04T04:32:48Z","title":"Adaptive Two-Stage Visual Token Pruning for Efficient Inference in Video-Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-08T00:55:50.116104Z"},"links":{"cited_paper":"/paper/2410.17434","citing_paper":"/paper/2608.03112"},"observation_digest":"sha256:7f63f0bcdc7863b5e077e0f280dded0fa363d7bfca4e6dd69428d5ed3b2dccf2","observation_id":"346c318a-9fc1-49a1-8dd2-d59fbe86ab65","resolution":{"observed_at":"2026-08-08T00:55:50.116104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15881","last_updated":"2024-10-23T09:52:23Z","snapshot_observed_at":"2026-08-05T18:22:08.247118Z","submitted_at":"2024-08-28T15:52:23Z","title":"LLaVA-MoD: Making LLaVA Tiny via MoE Knowledge Distillation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15881","snapshot_observed_at":"2026-08-08T00:55:50.120232Z","title":"Llava-mod: Making llava tiny via moe knowledge distillation.arXiv preprint arXiv:2408.15881,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03112","last_updated":"2026-08-04T04:32:48Z","snapshot_observed_at":"2026-08-08T00:50:14.056001Z","submitted_at":"2026-08-04T04:32:48Z","title":"Adaptive Two-Stage Visual Token Pruning for Efficient Inference in Video-Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-08T00:55:50.120232Z"},"links":{"cited_paper":"/paper/2408.15881","citing_paper":"/paper/2608.03112"},"observation_digest":"sha256:7c75b46cb14cf23781c8aa1956bbd45fc5617807c5ee1c2eb517508332956fdd","observation_id":"afb7bdd5-f0d4-4314-9070-1171eb84c3f4","resolution":{"observed_at":"2026-08-08T00:55:50.120232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21862","last_updated":"2025-06-27T02:29:58Z","snapshot_observed_at":"2026-08-07T08:24:31.697101Z","submitted_at":"2025-06-27T02:29:58Z","title":"LLaVA-Scissor: Token Compression with Semantic Connected Components for Video LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.21862","snapshot_observed_at":"2026-08-08T00:55:50.124410Z","title":"Llava-scissor: Token compression with semantic con- nected components for video llms.arXiv preprint arXiv:2506.21862, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03112","last_updated":"2026-08-04T04:32:48Z","snapshot_observed_at":"2026-08-08T00:50:14.056001Z","submitted_at":"2026-08-04T04:32:48Z","title":"Adaptive Two-Stage Visual Token Pruning for Efficient Inference in Video-Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-08T00:55:50.124410Z"},"links":{"cited_paper":"/paper/2506.21862","citing_paper":"/paper/2608.03112"},"observation_digest":"sha256:34e9b22af6790364604f426b21aa7c9c31856267f65815f769f9fec0a1379842","observation_id":"636baae2-9a92-4e79-84c1-c37fdd4ea012","resolution":{"observed_at":"2026-08-08T00:55:50.124410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09530","last_updated":"2024-12-12T18:20:41Z","snapshot_observed_at":"2026-07-06T20:06:09.333397Z","submitted_at":"2024-12-12T18:20:41Z","title":"Dynamic-VLM: Simple Dynamic Visual Token Compression for VideoLLM","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09530","snapshot_observed_at":"2026-08-08T00:55:50.128159Z","title":"Dynamic-vlm: Simple dynamic visual token compression 9 for videollm.arXiv preprint arXiv:2412.09530, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03112","last_updated":"2026-08-04T04:32:48Z","snapshot_observed_at":"2026-08-08T00:50:14.056001Z","submitted_at":"2026-08-04T04:32:48Z","title":"Adaptive Two-Stage Visual Token Pruning for Efficient Inference in Video-Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-08T00:55:50.128159Z"},"links":{"cited_paper":"/paper/2412.09530","citing_paper":"/paper/2608.03112"},"observation_digest":"sha256:231b80e1107d78ad381c0aee912e9002b4a1653b595b2e5b3d427eb3b393933e","observation_id":"5449c859-83cf-4de4-87c8-6b5172039234","resolution":{"observed_at":"2026-08-08T00:55:50.128159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.01071","last_updated":"2025-08-02T13:32:09Z","snapshot_observed_at":"2026-07-06T19:09:10.244642Z","submitted_at":"2024-09-02T08:52:58Z","title":"VideoLLaMB: Long Streaming Video Understanding with Recurrent Memory Bridges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.01071","snapshot_observed_at":"2026-08-08T00:55:50.132180Z","title":"Videollamb: Long-context video understanding with recur- rent memory bridges.arXiv preprint arXiv:2409.01071,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03112","last_updated":"2026-08-04T04:32:48Z","snapshot_observed_at":"2026-08-08T00:50:14.056001Z","submitted_at":"2026-08-04T04:32:48Z","title":"Adaptive Two-Stage Visual Token Pruning for Efficient Inference in Video-Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-08T00:55:50.132180Z"},"links":{"cited_paper":"/paper/2409.01071","citing_paper":"/paper/2608.03112"},"observation_digest":"sha256:3a4c9fbfb6dc4a4dd38c428268eacd8df1c5a9fbca8ab48afc75e63bb9f81374","observation_id":"10cb08f1-eda7-487a-89fd-613ca4a412ab","resolution":{"observed_at":"2026-08-08T00:55:50.132180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:55:50.136531Z","title":"Next-qa: Next phase of question-answering to explaining temporal actions","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.03112","last_updated":"2026-08-04T04:32:48Z","snapshot_observed_at":"2026-08-08T00:50:14.056001Z","submitted_at":"2026-08-04T04:32:48Z","title":"Adaptive Two-Stage Visual Token Pruning for Efficient Inference in Video-Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-08T00:55:50.136531Z"},"links":{"citing_paper":"/paper/2608.03112"},"observation_digest":"sha256:461fe07c4213a202d2fb378ea4d705b6dbc5edf504334554ee3331df69de5fd0","observation_id":"637995de-1493-4280-9a81-4a9e02102bf0","resolution":{"observed_at":"2026-08-08T00:55:50.136531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:55:50.616539Z","title":"Topv: Compatible token pruning with infer- ence time optimization for fast and low-memory multimodal vision language model","venue":null,"work_id":"75cccbf5-eb42-4efe-860b-5b3ad656a1f3","year":2025},"citing_paper":{"arxiv_id":"2608.03112","last_updated":"2026-08-04T04:32:48Z","snapshot_observed_at":"2026-08-08T00:50:14.056001Z","submitted_at":"2026-08-04T04:32:48Z","title":"Adaptive Two-Stage Visual Token Pruning for Efficient Inference in Video-Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-08T00:55:50.140040Z"},"links":{"citing_paper":"/paper/2608.03112"},"observation_digest":"sha256:422cf8e284a9de7b0e7a739ab665c07ac0febec952a6a697921f91b1015c69b0","observation_id":"5c40ef14-ccdd-40e2-ba5e-56e629d10789","resolution":{"observed_at":"2026-08-08T00:55:50.620506Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:55:50.605045Z","title":"Atp-llava: Adaptive token pruning for large vision language models","venue":null,"work_id":"f2b9c0a3-f6c6-4377-8200-9550c81c3c53","year":2025},"citing_paper":{"arxiv_id":"2608.03112","last_updated":"2026-08-04T04:32:48Z","snapshot_observed_at":"2026-08-08T00:50:14.056001Z","submitted_at":"2026-08-04T04:32:48Z","title":"Adaptive Two-Stage Visual Token Pruning for Efficient Inference in Video-Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-08T00:55:50.144028Z"},"links":{"citing_paper":"/paper/2608.03112"},"observation_digest":"sha256:84a56b46655d7753086e4b1e2bccbfc5dde6d23826394a69e51317814d451f93","observation_id":"4f98ddbd-2456-4d52-bcca-2b69b771b108","resolution":{"observed_at":"2026-08-08T00:55:50.609139Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-02T12:24:31.329178Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02713","snapshot_observed_at":"2026-08-08T00:55:50.147700Z","title":"Video instruction tuning with synthetic data.arXiv preprint arXiv:2410.02713, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03112","last_updated":"2026-08-04T04:32:48Z","snapshot_observed_at":"2026-08-08T00:50:14.056001Z","submitted_at":"2026-08-04T04:32:48Z","title":"Adaptive Two-Stage Visual Token Pruning for Efficient Inference in Video-Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-08T00:55:50.147700Z"},"links":{"cited_paper":"/paper/2410.02713","citing_paper":"/paper/2608.03112"},"observation_digest":"sha256:06b1595ac11243f357adc34f9f97ea14b50841b54b901dea05592dec5d655e55","observation_id":"ed439344-4c14-4165-ae58-c54fe0510026","resolution":{"observed_at":"2026-08-08T00:55:50.147700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14289","last_updated":"2024-02-22T05:05:30Z","snapshot_observed_at":"2026-08-03T05:27:32.394774Z","submitted_at":"2024-02-22T05:05:30Z","title":"TinyLLaVA: A Framework of Small-scale Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14289","snapshot_observed_at":"2026-08-08T00:55:50.151584Z","title":"Tinyllava: A frame- work of small-scale large multimodal models.arXiv preprint arXiv:2402.14289, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03112","last_updated":"2026-08-04T04:32:48Z","snapshot_observed_at":"2026-08-08T00:50:14.056001Z","submitted_at":"2026-08-04T04:32:48Z","title":"Adaptive Two-Stage Visual Token Pruning for Efficient Inference in Video-Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-08T00:55:50.151584Z"},"links":{"cited_paper":"/paper/2402.14289","citing_paper":"/paper/2608.03112"},"observation_digest":"sha256:e3abbcb4321a9dc8425b31f9369650fc11a9779f4f09be90ab30b0afa0ffde77","observation_id":"f2b898cd-650a-4113-89c2-8fac10f34d16","resolution":{"observed_at":"2026-08-08T00:55:50.151584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-08T00:55:50.155447Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models.arXiv preprint arXiv:2504.10479, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03112","last_updated":"2026-08-04T04:32:48Z","snapshot_observed_at":"2026-08-08T00:50:14.056001Z","submitted_at":"2026-08-04T04:32:48Z","title":"Adaptive Two-Stage Visual Token Pruning for Efficient Inference in Video-Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-08T00:55:50.155447Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2608.03112"},"observation_digest":"sha256:a78dc273cf469f6ae28ee3fbedd1bb70d9952931e01536b66caa72e0d2988fd9","observation_id":"89dabbd2-75bb-43a6-9a2e-664507f1caa0","resolution":{"observed_at":"2026-08-08T00:55:50.155447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:55:50.593801Z","title":"Also, we use beam size of 1, and the number of maximum new to- kens is capped to 1024","venue":null,"work_id":"5a48ff70-f6a8-4583-8380-43d28fc796d3","year":null},"citing_paper":{"arxiv_id":"2608.03112","last_updated":"2026-08-04T04:32:48Z","snapshot_observed_at":"2026-08-08T00:50:14.056001Z","submitted_at":"2026-08-04T04:32:48Z","title":"Adaptive Two-Stage Visual Token Pruning for Efficient Inference in Video-Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-08T00:55:50.159058Z"},"links":{"citing_paper":"/paper/2608.03112"},"observation_digest":"sha256:00ae55f03203c32d47e5e373bfd1d72f7db5d603de9919c1c75f6d9f1ad7882c","observation_id":"e854eb82-62e2-4e56-8079-a8cc27b8091f","resolution":{"observed_at":"2026-08-08T00:55:50.597966Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:55:50.581616Z","title":null,"venue":null,"work_id":"adb42f26-b62f-428b-b3c8-398705ea9563","year":null},"citing_paper":{"arxiv_id":"2608.03112","last_updated":"2026-08-04T04:32:48Z","snapshot_observed_at":"2026-08-08T00:50:14.056001Z","submitted_at":"2026-08-04T04:32:48Z","title":"Adaptive Two-Stage Visual Token Pruning for Efficient Inference in Video-Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-08T00:55:50.162416Z"},"links":{"citing_paper":"/paper/2608.03112"},"observation_digest":"sha256:2ba8ba11c727b3ca702f85156965a2ec18c3e17a144948aedfec07df59d46a83","observation_id":"f25dd4a7-d912-47b3-91ad-b1909b26b579","resolution":{"observed_at":"2026-08-08T00:55:50.586532Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.03112","last_updated":"2026-08-04T04:32:48Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T00:50:14.056001Z","submitted_at":"2026-08-04T04:32:48Z","title":"Adaptive Two-Stage Visual Token Pruning for Efficient Inference in Video-Language Models"},"reference_resolution":{"displayed":34,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":25,"verified_exact":0,"verified_fuzzy":9},"total_outbound_references":34},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 34 of 34 outbound references and 0 inbound Pith citation observations for arXiv:2608.03112."}