{"as_of":"2026-08-08T12:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d19598614cb17e13cc2e29c44f2ef77a2274a91cf6867aaee39cc1107420fdee","coverage":[{"denominator":94,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":94,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T23:42:35.360123Z","state":"measured"},{"denominator":94,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":94,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.05780/citation-record","integrity":"/paper/2608.05780/integrity","json":"/paper/2608.05780/citation-record.json","paper":"/paper/2608.05780"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:34.967551Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-08T12:17:49.158099Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:34.967551Z"},"links":{"citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:811c356a8413f3c50caa5b8374ce7d14e0506f2171d47482cd35e3710297ff13","observation_id":"88193e5c-508a-4353-a368-0423a0a7db08","resolution":{"observed_at":"2026-08-07T23:42:34.967551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:34.972401Z","title":"2025 IEEE/CVF International Conference on Computer Vision (ICCV) , pages=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-08T12:17:49.158099Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:34.972401Z"},"links":{"citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:6b047ca2b400caeffd5bb5a04f92f96c9bb47cb671380df46b23af94c275bdb6","observation_id":"322731e2-edaa-4f28-8a97-e0626bd31fe9","resolution":{"observed_at":"2026-08-07T23:42:34.972401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:34.976757Z","title":"Proceedings of the AAAI Conference on Artificial Intelligence , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-08T12:17:49.158099Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:34.976757Z"},"links":{"citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:27d07d85eeb480bb3f985d6da5d29cc9ea80e243989d2f81e2343d0852cc9d95","observation_id":"95c97b24-1dcf-4dab-98bd-8c7ddd47d332","resolution":{"observed_at":"2026-08-07T23:42:34.976757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.22540","last_updated":"2026-06-25T01:18:44Z","snapshot_observed_at":"2026-07-06T23:57:23.574340Z","submitted_at":"2026-06-21T14:54:07Z","title":"PolicyTrim: Boosting Intrinsic Policy Efficiency of Vision-Language-Action Models","version":3},"cited_work":{"arxiv_id":"2606.22540","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.22540","snapshot_observed_at":"2026-08-07T23:42:38.257805Z","title":"PolicyTrim: Boosting Intrinsic Policy Efficiency of Vision-Language-Action Models","venue":"cs.CV","work_id":"861f24e4-9efa-45d3-90ca-500ca2759535","year":2026},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-08T12:17:49.158099Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:34.980982Z"},"links":{"cited_paper":"/paper/2606.22540","citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:eda54bc0bb210689119937f445f49690a2aaa1d8185f553312f02def6afedc78","observation_id":"fe9af7a0-9666-432a-bea8-55eb0c103604","resolution":{"observed_at":"2026-08-07T23:42:38.263471Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:34.986046Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-08T12:17:49.158099Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:34.986046Z"},"links":{"citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:59a2fadc163bfec7215f531dc0b5f5546969041b6236bbac0be190e678031dd7","observation_id":"95e3be72-963b-4e16-8dc1-e63d4aaedbf0","resolution":{"observed_at":"2026-08-07T23:42:34.986046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:34.990368Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-08T12:17:49.158099Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:34.990368Z"},"links":{"citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:84554f77dd4f1bf73cc3b7a53bf2caf512e9768613f792bd457daf39e37947d9","observation_id":"91da7fbf-cf4c-42e8-859b-57cdbc5c4565","resolution":{"observed_at":"2026-08-07T23:42:34.990368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02438","last_updated":"2025-09-10T04:22:46Z","snapshot_observed_at":"2026-08-07T16:12:02.851576Z","submitted_at":"2025-04-03T09:55:09Z","title":"Scaling Video-Language Models to 10K Frames via Hierarchical Differential Distillation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.02438","snapshot_observed_at":"2026-08-07T23:42:34.994738Z","title":"arXiv preprint arXiv:2504.02438 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-08T12:17:49.158099Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:34.994738Z"},"links":{"cited_paper":"/paper/2504.02438","citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:c877dac62d7ac989b94191508a372bf53f77b3014f21a6e9bcce1e6dcbf24dea","observation_id":"1468d980-9e42-4d3b-9c1b-9749f003a400","resolution":{"observed_at":"2026-08-07T23:42:34.994738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19225","last_updated":"2025-06-24T01:19:56Z","snapshot_observed_at":"2026-08-07T21:07:46.308380Z","submitted_at":"2025-06-24T01:19:56Z","title":"Video-XL-2: Towards Very Long-Video Understanding Through Task-Aware KV Sparsification","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.19225","snapshot_observed_at":"2026-08-07T23:42:34.999140Z","title":"arXiv preprint arXiv:2506.19225 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-08T12:17:49.158099Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:34.999140Z"},"links":{"cited_paper":"/paper/2506.19225","citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:7167b6c0b562bef0f1003e4dfaf6da7f368e2a5a61bdbf88e7cd9af8d5b29357","observation_id":"da832fe9-bd47-4155-84ab-af0c83ea644c","resolution":{"observed_at":"2026-08-07T23:42:34.999140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:35.003049Z","title":"arXiv preprint arXiv:2507.07966 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-08T12:17:49.158099Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.003049Z"},"links":{"citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:d219b144b0e6642031ca0d4df328f7327cfec6394a81dd2f0769c16f474c38f7","observation_id":"791ff586-6a7d-43bc-80a3-1bcf324214ed","resolution":{"observed_at":"2026-08-07T23:42:35.003049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12326","last_updated":"2025-01-21T17:48:10Z","snapshot_observed_at":"2026-07-06T20:23:58.426780Z","submitted_at":"2025-01-21T17:48:10Z","title":"UI-TARS: Pioneering Automated GUI Interaction with Native Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12326","snapshot_observed_at":"2026-08-07T23:42:35.006944Z","title":"arXiv preprint arXiv:2501.12326 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-08T12:17:49.158099Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.006944Z"},"links":{"cited_paper":"/paper/2501.12326","citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:161682f2438cef07a36cfa8854f4c9f590be326924c1fe0c32836664390c693c","observation_id":"1632a862-58f5-49aa-adfd-28d2d8552ee2","resolution":{"observed_at":"2026-08-07T23:42:35.006944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T23:42:35.011144Z","title":"5-vl technical report , author=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-08T12:17:49.158099Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.011144Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:7d99a3ea532f24c1c580f1aa32feb136e8f9fcbc11c55ddcab6c67466dec7b01","observation_id":"aece37f1-91a7-455a-af84-5edb8d9f13be","resolution":{"observed_at":"2026-08-07T23:42:35.011144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:35.019850Z","title":"Journal of Visual Communication and Image Representation , volume=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-08T12:17:49.158099Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.019850Z"},"links":{"citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:994fb1bf6c99b6c42164017b34d88f4593f08f3cd3fc83c500e9d30f8b723ec5","observation_id":"5e7d020c-7a32-4010-9062-a055c58b0abf","resolution":{"observed_at":"2026-08-07T23:42:35.019850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.06733","last_updated":"2026-05-10T12:54:52Z","snapshot_observed_at":"2026-07-06T22:44:51.126114Z","submitted_at":"2026-02-06T14:28:54Z","title":"Pairwise is Not Enough: Hypergraph Neural Networks for Multi-Agent Pathfinding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.06733","snapshot_observed_at":"2026-08-07T23:42:35.024660Z","title":"arXiv preprint arXiv:2602.06733 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-08T12:17:49.158099Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.024660Z"},"links":{"cited_paper":"/paper/2602.06733","citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:44f7de3d2d3fd8a666cc9e8bcf9eeb3990ff36732ba203d48f6b57a75cae7edc","observation_id":"93f062a9-c40d-4f58-b11d-11d09aa7a2b2","resolution":{"observed_at":"2026-08-07T23:42:35.024660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08813","last_updated":"2024-10-21T03:08:08Z","snapshot_observed_at":"2026-08-07T17:42:30.374808Z","submitted_at":"2024-05-14T17:59:02Z","title":"CinePile: A Long Video Question Answering Dataset and Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08813","snapshot_observed_at":"2026-08-07T23:42:35.029043Z","title":"URL https://arxiv","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-08T12:17:49.158099Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.029043Z"},"links":{"cited_paper":"/paper/2405.08813","citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:721885342d775bbc24994c6afb8b422d92304ddab8bdd7392baa98c4d00f4661","observation_id":"076c26d2-d334-4f85-ace0-5774c15b4a2e","resolution":{"observed_at":"2026-08-07T23:42:35.029043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12329","last_updated":"2025-03-16T02:56:09Z","snapshot_observed_at":"2026-08-07T17:01:14.327939Z","submitted_at":"2025-03-16T02:56:09Z","title":"CapArena: Benchmarking and Analyzing Detailed Image Captioning in the LLM Era","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.12329","snapshot_observed_at":"2026-08-07T23:42:35.033889Z","title":"arXiv preprint arXiv:2503.12329 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-08T12:17:49.158099Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.033889Z"},"links":{"cited_paper":"/paper/2503.12329","citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:a4f416c693d84bdfeb534d632981f3d6153ca67e6212ff1400801bffef76419b","observation_id":"e6977576-efe3-4033-b901-1ae2ef49a408","resolution":{"observed_at":"2026-08-07T23:42:35.033889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16072","last_updated":"2025-04-22T17:51:41Z","snapshot_observed_at":"2026-08-07T16:00:09.944765Z","submitted_at":"2025-04-22T17:51:41Z","title":"Describe Anything: Detailed Localized Image and Video Captioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16072","snapshot_observed_at":"2026-08-07T23:42:35.038915Z","title":"arXiv preprint arXiv:2504.16072 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-08T12:17:49.158099Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.038915Z"},"links":{"cited_paper":"/paper/2504.16072","citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:8ed904db24b0faceb303ee3adf03499edacf3504d71a1e6145292eac13fb8340","observation_id":"49e25a13-f186-45c8-85a8-c1ed82e9cc6e","resolution":{"observed_at":"2026-08-07T23:42:35.038915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:35.044026Z","title":"Proceedings of the IEEE/CVF conference on computer vision and pattern recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-08T12:17:49.158099Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.044026Z"},"links":{"citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:b6fdd0fdc9cdfde271b7f5080c3d315dc861a30b7f6f85acc5257920da42eb60","observation_id":"40435e09-dda2-458e-b446-000310e5d923","resolution":{"observed_at":"2026-08-07T23:42:35.044026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:35.047867Z","title":"Proceedings of the IEEE/CVF winter conference on applications of computer vision , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-08T12:17:49.158099Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.047867Z"},"links":{"citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:36b9ec87cf5cdf8d29b9a9833c635b3f49a92daf4b5d6f93fa2c16f4a2b1c190","observation_id":"b18ccfcd-fb5a-49d3-a109-90f2e479835f","resolution":{"observed_at":"2026-08-07T23:42:35.047867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:35.051735Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-08T12:17:49.158099Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.051735Z"},"links":{"citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:d5811b851c0f4e6f5a93531c21560acd6bd92815916100689bc0c680e79880c7","observation_id":"a50bf22f-14fb-4ea0-bc91-1d05444a9348","resolution":{"observed_at":"2026-08-07T23:42:35.051735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:35.055629Z","title":"arXiv e-prints , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-08T12:17:49.158099Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.055629Z"},"links":{"citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:bfeea88e0b13f9fbb49480fb0515d2bfe54a89c9aa00301390bf028b6ef57e6d","observation_id":"67558f6b-def8-4ec3-9a80-11676bf87a67","resolution":{"observed_at":"2026-08-07T23:42:35.055629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:35.060058Z","title":"Proceedings of the Computer Vision and Pattern Recognition Conference , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-08T12:17:49.158099Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.060058Z"},"links":{"citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:18c417023f227a2158f904ba590fa2f312a36e6d90b8ddcc958fd5247d7e69b4","observation_id":"532e0f22-be28-400e-b515-63fca5abadf7","resolution":{"observed_at":"2026-08-07T23:42:35.060058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:35.063900Z","title":"Proceedings of the IEEE/CVF International Conference on Computer Vision , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-08T12:17:49.158099Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.063900Z"},"links":{"citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:7d09472a17d203bcde193f7b38277076c676180467bd6dbcbdb21f0d8210a40d","observation_id":"bc3329b6-0a19-48fe-9578-f8319e3a2843","resolution":{"observed_at":"2026-08-07T23:42:35.063900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:35.067606Z","title":"arXiv preprint arXiv:2508.04369 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-08T12:17:49.158099Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.067606Z"},"links":{"citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:6c1157dfaa6be663bf599dafa852696626f59e8ab0f614d8585abe71bb77a93d","observation_id":"9b1d950f-353f-427b-b794-37e0b9e0cecf","resolution":{"observed_at":"2026-08-07T23:42:35.067606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:35.071742Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-08T12:17:49.158099Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.071742Z"},"links":{"citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:54a5da351fe311d2b8a33f62cdb71b4a38dae9db1d1d97ee9799dd821dd181e0","observation_id":"577608bd-94de-4b36-a3c6-6450c71c66ed","resolution":{"observed_at":"2026-08-07T23:42:35.071742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:35.075368Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-08T12:17:49.158099Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.075368Z"},"links":{"citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:32122513e6a8e20cb208b7d63ad366ba9c8620395de2d6eda50944fe8c9a5770","observation_id":"9fc0d62d-9555-459d-94bf-0351f54c83b0","resolution":{"observed_at":"2026-08-07T23:42:35.075368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-08-07T23:42:35.079279Z","title":"arXiv preprint arXiv:2507.06261 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-08T12:17:49.158099Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.079279Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:3f8ffbbf12f5a57155f53d22910236551fc532ccffe660a959f7eb5596ae836f","observation_id":"1df357a6-03e0-4789-a052-6628592dcd04","resolution":{"observed_at":"2026-08-07T23:42:35.079279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:35.083243Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-08T12:17:49.158099Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.083243Z"},"links":{"citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:e18ed26899430c71363c14f00a4a5e041c5efa6ffb1bcafb0a37253393b29dc0","observation_id":"a5af1714-1c85-4d3d-8b9e-8d47f4503caf","resolution":{"observed_at":"2026-08-07T23:42:35.083243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:35.086792Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-08T12:17:49.158099Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.086792Z"},"links":{"citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:1d1d6395f9213b51f34577ef6ce5812657d51c121f0dd667bbf6402617e8adfb","observation_id":"2faaf74f-9daf-450d-a617-3a4466d330b6","resolution":{"observed_at":"2026-08-07T23:42:35.086792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-08-07T23:42:35.091644Z","title":"arXiv preprint arXiv:2408.10188 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-08T12:17:49.158099Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.091644Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:f9d00f8d798cb7e4504422892fb383cd89cd52276e10db1e7101b092572dff25","observation_id":"5a542cce-ab43-4480-b6da-baf3ac9d6403","resolution":{"observed_at":"2026-08-07T23:42:35.091644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-07T23:42:35.096042Z","title":"arXiv preprint arXiv:2406.16852 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-08T12:17:49.158099Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.096042Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:1e2d720d3762dcc6fb5ff392e43325989144b566d6c7be5e1ca3f22155176fe9","observation_id":"308c53c7-5f8d-4242-8dec-85a3af4acfb3","resolution":{"observed_at":"2026-08-07T23:42:35.096042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:35.100870Z","title":"arXiv preprint arXiv:2502.05177 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-08T12:17:49.158099Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.100870Z"},"links":{"citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:04c02509d73cb078421871a3503085996dfa47afef731b4dae0c6845af1fff7b","observation_id":"1a34726a-c37f-4148-b236-4e7398ac6ccc","resolution":{"observed_at":"2026-08-07T23:42:35.100870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:35.104559Z","title":"European Conference on Computer Vision , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-08T12:17:49.158099Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.104559Z"},"links":{"citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:c5a6493a4730f82a150279d099533568670033978dd8a21f81a848659336514a","observation_id":"62eb75a8-496f-4c5b-9297-5a32e09166bc","resolution":{"observed_at":"2026-08-07T23:42:35.104559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:35.108718Z","title":"Proceedings of the Computer Vision and Pattern Recognition Conference , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-08T12:17:49.158099Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.108718Z"},"links":{"citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:941aec52a931378e7d81eaf56008fbf5e2b65d9901a1d13eebbe8e6a3d28cc3d","observation_id":"9d0d5924-46e1-4636-bc0c-4ef0ccd7060d","resolution":{"observed_at":"2026-08-07T23:42:35.108718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21862","last_updated":"2025-06-27T02:29:58Z","snapshot_observed_at":"2026-08-07T08:24:31.697101Z","submitted_at":"2025-06-27T02:29:58Z","title":"LLaVA-Scissor: Token Compression with Semantic Connected Components for Video LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.21862","snapshot_observed_at":"2026-08-07T23:42:35.112820Z","title":"arXiv preprint arXiv:2506.21862 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-08T12:17:49.158099Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.112820Z"},"links":{"cited_paper":"/paper/2506.21862","citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:025c4769d28b809c45fd03e4d1cdff4aa9e52ed117f3aa3bf8c3a00edc720653","observation_id":"23615e5f-63f5-473a-ae1e-29277313f056","resolution":{"observed_at":"2026-08-07T23:42:35.112820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-06T05:58:29.182448Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-07T23:42:35.116786Z","title":"arXiv preprint arXiv:2304.07193 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-08T12:17:49.158099Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.116786Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:37e1d0eecc23c420b8dc3a6a2d4b39b3ce8978606a982f47d93207b401046e82","observation_id":"3a363538-f653-4df9-86c7-043fdc5295c8","resolution":{"observed_at":"2026-08-07T23:42:35.116786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:35.120837Z","title":"Proceedings of the Computer Vision and Pattern Recognition Conference , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-08T12:17:49.158099Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.120837Z"},"links":{"citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:0d9f69f5a8fe2809e52480a559a34b9ac93ea9b79c9414a3f64078e6edf840d6","observation_id":"2528b329-713a-44be-acd8-f0ffde781769","resolution":{"observed_at":"2026-08-07T23:42:35.120837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:38.434829Z","title":"Proceedings of the Computer Vision and Pattern Recognition Conference , pages=","venue":null,"work_id":"22f49cf0-b0f5-49d3-b49b-84b3ab01e6c6","year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-08T12:17:49.158099Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.125004Z"},"links":{"citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:ae902ac6addbda4a7b4d990bd4817d7e285ee33bc8382e4aa3a8f86a7a34cbc0","observation_id":"31af810c-b90a-453a-8506-cbaa23064c22","resolution":{"observed_at":"2026-08-07T23:42:38.438990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16994","last_updated":"2024-04-29T14:52:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T19:29:55Z","title":"PLLaVA : Parameter-free LLaVA Extension from Images to Videos for Video Dense Captioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16994","snapshot_observed_at":"2026-08-07T23:42:35.128973Z","title":"arXiv preprint arXiv:2404.16994 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-08T12:17:49.158099Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.128973Z"},"links":{"cited_paper":"/paper/2404.16994","citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:9c3e3b9cd99c4fd4bb0e93844bdbb81a0c0f2391f9b005c6b7922218f2cb5636","observation_id":"fc745383-719e-47c8-9c37-c19f8d4f6247","resolution":{"observed_at":"2026-08-07T23:42:35.128973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:35.133666Z","title":"arXiv preprint arXiv:2510.27280 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-08T12:17:49.158099Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.133666Z"},"links":{"citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:dab55d187b4467427baf4c038fe18f56581fe56a969f8e283f45e70c0bb15289","observation_id":"dd591fcd-b595-4d6b-8978-6099f1586b65","resolution":{"observed_at":"2026-08-07T23:42:35.133666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.22139","last_updated":"2025-07-22T07:42:31Z","snapshot_observed_at":"2026-08-06T22:07:43.493361Z","submitted_at":"2025-06-27T11:30:51Z","title":"Q-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.22139","snapshot_observed_at":"2026-08-07T23:42:35.137666Z","title":"arXiv preprint arXiv:2506.22139 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-08T12:17:49.158099Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.137666Z"},"links":{"cited_paper":"/paper/2506.22139","citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:f6e2b056b523decc255f7e672dbfe32d202ac3ff6daef2c2146b45c351161547","observation_id":"83ce1718-bef9-4d79-a24a-13456167b10f","resolution":{"observed_at":"2026-08-07T23:42:35.137666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00993","last_updated":"2025-06-01T12:49:39Z","snapshot_observed_at":"2026-08-08T00:45:30.620269Z","submitted_at":"2025-06-01T12:49:39Z","title":"FlexSelect: Flexible Token Selection for Efficient Long Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.00993","snapshot_observed_at":"2026-08-07T23:42:35.141746Z","title":"arXiv preprint arXiv:2506.00993 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-08T12:17:49.158099Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.141746Z"},"links":{"cited_paper":"/paper/2506.00993","citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:2e5b4686dc3f6f86a23f9d2b839140b3e561a14a770b201978c277c69efde434","observation_id":"1b80a305-06b8-4a90-b461-e9b9d104db82","resolution":{"observed_at":"2026-08-07T23:42:35.141746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:38.421671Z","title":"Proceedings of the Computer Vision and Pattern Recognition Conference , pages=","venue":null,"work_id":"c3f47fe3-4359-47fd-b8f2-c45f19e0e5dd","year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-08T12:17:49.158099Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.146226Z"},"links":{"citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:aac3858d00fa6ca52906d2beb97cbb113b22c15d7236f34d356a4d5295d48b6c","observation_id":"d680571f-867a-4a75-881e-03ebc212f6d2","resolution":{"observed_at":"2026-08-07T23:42:38.426552Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:38.409745Z","title":"Proceedings of the Computer Vision and Pattern Recognition Conference , pages=","venue":null,"work_id":"79b1c8de-6c8b-41a8-abed-92c0db18c0c4","year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-08T12:17:49.158099Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.149849Z"},"links":{"citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:f51f1e2ecb7f888aa713031f9935b1b5136a8dee7097622aab64549f5879deeb","observation_id":"104a7dd4-af46-47c8-989c-76bb7ba2552c","resolution":{"observed_at":"2026-08-07T23:42:38.413824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:35.154446Z","title":"arXiv preprint arXiv:2510.13891 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-08T12:17:49.158099Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.154446Z"},"links":{"citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:935e7ed5bfd7c4fa92f9f6faf024df9fb7bc37665aca1a4fbb5a8f81f10f1308","observation_id":"9a674896-953e-4cc1-aae0-29c2ccddcae7","resolution":{"observed_at":"2026-08-07T23:42:35.154446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03226","last_updated":"2025-03-28T03:19:52Z","snapshot_observed_at":"2026-07-06T19:27:33.934338Z","submitted_at":"2024-10-04T08:26:06Z","title":"Frame-Voyager: Learning to Query Frames for Video Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03226","snapshot_observed_at":"2026-08-07T23:42:35.158387Z","title":"arXiv preprint arXiv:2410.03226 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-08T12:17:49.158099Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.158387Z"},"links":{"cited_paper":"/paper/2410.03226","citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:78f121910189be49c7205bb1814ef83260f17403eb50ec27fd65c6dc374aa145","observation_id":"949b5c8a-2cf7-4ce3-a17a-63fc99fbed09","resolution":{"observed_at":"2026-08-07T23:42:35.158387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01258","last_updated":"2024-04-02T12:47:49Z","snapshot_observed_at":"2026-08-08T06:22:53.769876Z","submitted_at":"2024-04-01T17:28:16Z","title":"Direct Preference Optimization of Video Large Multimodal Models from Language Model Reward","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01258","snapshot_observed_at":"2026-08-07T23:42:35.162434Z","title":"arXiv preprint arXiv:2404.01258 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-08T12:17:49.158099Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.162434Z"},"links":{"cited_paper":"/paper/2404.01258","citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:125362820dc12f70f798d73e4d0f9a079d0eb11773f8578e8ec52d3eafdec64a","observation_id":"b9026e97-5b11-4dc2-88ff-3fe443f527e5","resolution":{"observed_at":"2026-08-07T23:42:35.162434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T23:42:35.166581Z","title":"arXiv preprint arXiv:2503.14476 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-08T12:17:49.158099Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.166581Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:24d39fcbfa0895f96b36477200955b210426fb179440fd8f8d61db0d76e77a76","observation_id":"4ac55cbc-22b6-42bd-9fff-474e2edde272","resolution":{"observed_at":"2026-08-07T23:42:35.166581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:35.170212Z","title":"arXiv preprint arXiv:2512.11534 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-08T12:17:49.158099Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.170212Z"},"links":{"citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:3e0af51ddfd4fc6dcee475152370a273b26598aacd0980ede21aacdb9eaee8b5","observation_id":"a341499c-793e-48c2-9e41-3b2136d50295","resolution":{"observed_at":"2026-08-07T23:42:35.170212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T23:42:35.173910Z","title":"arXiv preprint arXiv:1707.06347 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-08T12:17:49.158099Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.173910Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:371dc5c532bbc0f16183af5f1131d91a58fd184f38dd4fe4a195c7f31acf2060","observation_id":"f24d6f3c-e584-445e-93d1-99d3b7bafd5b","resolution":{"observed_at":"2026-08-07T23:42:35.173910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:35.177728Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-08T12:17:49.158099Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.177728Z"},"links":{"citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:3e14d4129baba512cb947ae7ba7ab1b717dc4872268ad19672f2dfde2fde4c47","observation_id":"454c92c5-a9de-4550-9945-7fb52ba7f392","resolution":{"observed_at":"2026-08-07T23:42:35.177728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:35.181274Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-08T12:17:49.158099Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.181274Z"},"links":{"citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:31130cdd0dada9b38d601b7ae9867583bef30b192f9d6d96974a7e8e35dffaf9","observation_id":"ca11859a-759c-41e5-a5f9-85d0663ace74","resolution":{"observed_at":"2026-08-07T23:42:35.181274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T23:42:35.185360Z","title":"arXiv preprint arXiv:2402.03300 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-08T12:17:49.158099Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.185360Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:a37a6882923e8200908bf355b7dfcd4784cb152900da431a91dfc83bce504944","observation_id":"ef3320d5-b85e-4927-9168-7fd73b355b84","resolution":{"observed_at":"2026-08-07T23:42:35.185360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:35.190392Z","title":"Proceedings of the 2024 conference on empirical methods in natural language processing , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-08T12:17:49.158099Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.190392Z"},"links":{"citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:f0402169a8b125f9c0fe744ef577b1f875e46a64a63e762012a13ecccd44f09b","observation_id":"9acbfab0-4321-4bc9-b2a6-ab619266c7e4","resolution":{"observed_at":"2026-08-07T23:42:35.190392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:35.195518Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-08T12:17:49.158099Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.195518Z"},"links":{"citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:4892659f736cd1f36abe7209d6f4cc0472619628e16c3cfc9c2cf06579b6885f","observation_id":"0dfa2b5b-5896-496c-ba1e-69fde5afd8e0","resolution":{"observed_at":"2026-08-07T23:42:35.195518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:38.373309Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition , pages=","venue":null,"work_id":"0d72cbf6-d32a-4ebc-8117-0d0ee20dd748","year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-08T12:17:49.158099Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.199407Z"},"links":{"citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:c16c2e982e9ecc346f6c2a2a1aff4e7e7f3256a348517d252b8ca88e74e18029","observation_id":"a3fbdcb7-97d9-4efe-8d32-f232731bec8c","resolution":{"observed_at":"2026-08-07T23:42:38.376340Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-07T23:42:35.203009Z","title":"arXiv preprint arXiv:2406.07476 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-08T12:17:49.158099Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.203009Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:d454384099b814b2c71259ef26a3afac6cf93fb2700ac2f7ebbcc8ebe6ec1b64","observation_id":"b44f048c-53c6-4815-8e91-8912f439fc1a","resolution":{"observed_at":"2026-08-07T23:42:35.203009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:35.207163Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-08T12:17:49.158099Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.207163Z"},"links":{"citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:60efcf04ec844718bd3110a308ed5cc25d6fc219ffdd225ed53f0577d3f4eca9","observation_id":"dce91058-7b8c-47d8-99cd-fdaad28ec38e","resolution":{"observed_at":"2026-08-07T23:42:35.207163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-07T23:42:35.211189Z","title":"arXiv preprint arXiv:2408.03326 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-08T12:17:49.158099Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.211189Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:421f053c9245e3ff48add25f251ef05ea8520675880eb3882b7cd568ddf91a35","observation_id":"108275d8-c8cc-4622-9a7c-4a52af0a8537","resolution":{"observed_at":"2026-08-07T23:42:35.211189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.14023","last_updated":"2024-08-26T05:27:14Z","snapshot_observed_at":"2026-08-07T05:22:51.503928Z","submitted_at":"2024-08-26T05:27:14Z","title":"Video-CCAM: Enhancing Video-Language Understanding with Causal Cross-Attention Masks for Short and Long Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.14023","snapshot_observed_at":"2026-08-07T23:42:35.215228Z","title":"arXiv preprint arXiv:2408.14023 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-08T12:17:49.158099Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.215228Z"},"links":{"cited_paper":"/paper/2408.14023","citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:a381392766fad93336c6fd93d4e9c722bdec9d9e0c05cba9a8633809309662e8","observation_id":"2adaf088-b632-4f60-a978-61943e5b8a5f","resolution":{"observed_at":"2026-08-07T23:42:35.215228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:35.219360Z","title":"Proceedings of the IEEE/CVF conference on computer vision and pattern recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-08T12:17:49.158099Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.219360Z"},"links":{"citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:a6277d9303a1c580e3d1ae57f30f4875d6b3960cf4248d836a9d6f22826c4b93","observation_id":"735d3b90-9c25-467b-b563-83d0b51517eb","resolution":{"observed_at":"2026-08-07T23:42:35.219360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:38.350706Z","title":"GPT-4V(ision) system card , url=","venue":null,"work_id":"02a2fa94-1928-49ae-8b36-f0c1bf1f3c88","year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-08T12:17:49.158099Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.224392Z"},"links":{"citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:045aff29a2c7f0e80a14bc8960e33dffc61eeafbdf1f7016e9d5b6a92af5fc39","observation_id":"6ff40cdd-5706-4348-972a-deb5b3b8976f","resolution":{"observed_at":"2026-08-07T23:42:38.353966Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-07T23:42:35.228769Z","title":"arXiv preprint arXiv:2312.11805 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-08T12:17:49.158099Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.228769Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:fb3c561d3f1a4601cd8da8a426739f27dde7a09c818fc7520a87e3731533c66c","observation_id":"e7ee0b09-26c2-494a-9af5-f554f2efc499","resolution":{"observed_at":"2026-08-07T23:42:35.228769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12961","last_updated":"2025-02-27T06:09:46Z","snapshot_observed_at":"2026-07-06T19:18:17.523057Z","submitted_at":"2024-09-19T17:59:51Z","title":"Oryx MLLM: On-Demand Spatial-Temporal Understanding at Arbitrary Resolution","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12961","snapshot_observed_at":"2026-08-07T23:42:35.233288Z","title":"arXiv preprint arXiv:2409.12961 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-08T12:17:49.158099Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.233288Z"},"links":{"cited_paper":"/paper/2409.12961","citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:131b70a7e11c9015ba9bfb28fc57dd02e857de7d7df4f4956786dcd191f0ba60","observation_id":"acfb088c-807c-40ce-a2ea-8892e3ff6b96","resolution":{"observed_at":"2026-08-07T23:42:35.233288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:38.340589Z","title":"Proceedings of the Computer Vision and Pattern Recognition Conference , pages=","venue":null,"work_id":"6a5cef5a-e813-4650-b726-fa6f8eaf5a24","year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-08T12:17:49.158099Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.237827Z"},"links":{"citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:d334e29cab7c8be7d4a3551ea75793447ac65ea2c9e8bacf4001c41efdd98360","observation_id":"29663a2e-d21d-4b52-8965-a6238af709bf","resolution":{"observed_at":"2026-08-07T23:42:38.343764Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:38.330294Z","title":"Proceedings of the Computer Vision and Pattern Recognition Conference , pages=","venue":null,"work_id":"51be64f4-8518-48e0-b110-994b75d3c017","year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-08T12:17:49.158099Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.241909Z"},"links":{"citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:e08c97a0d46e837205492ebb014a8324c27aac1c506ef0488411b87649f33930","observation_id":"d3ac00bb-b2ca-4bee-bfe6-89ec6ab877b7","resolution":{"observed_at":"2026-08-07T23:42:38.333721Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04840","last_updated":"2024-08-13T08:10:32Z","snapshot_observed_at":"2026-07-06T18:58:39.334273Z","submitted_at":"2024-08-09T03:25:42Z","title":"mPLUG-Owl3: Towards Long Image-Sequence Understanding in Multi-Modal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04840","snapshot_observed_at":"2026-08-07T23:42:35.246208Z","title":"arXiv preprint arXiv:2408.04840 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-08T12:17:49.158099Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.246208Z"},"links":{"cited_paper":"/paper/2408.04840","citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:db4c179e01e2933cffe1ce28675cff1429c437de9ebd0dc04a9451b03e0201f3","observation_id":"1b31cd46-dfdf-4aac-94d0-baf39675fb3c","resolution":{"observed_at":"2026-08-07T23:42:35.246208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T23:42:35.250414Z","title":"arXiv preprint arXiv:2412.05271 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-08T12:17:49.158099Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.250414Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:cc8bd6f1ef300b4f392cc2595180e4a0effd2fba5be1f9bdd6acb950a22f80b3","observation_id":"4b778ed7-8140-41ab-a1f1-b6e80088b44b","resolution":{"observed_at":"2026-08-07T23:42:35.250414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17434","last_updated":"2024-10-22T21:21:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-22T21:21:37Z","title":"LongVU: Spatiotemporal Adaptive Compression for Long Video-Language Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17434","snapshot_observed_at":"2026-08-07T23:42:35.254789Z","title":"arXiv preprint arXiv:2410.17434 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-08T12:17:49.158099Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.254789Z"},"links":{"cited_paper":"/paper/2410.17434","citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:af54c5c7393b993874472be5ab75ad176fcb85a131bc3eabd43f05fd6e5b61b6","observation_id":"8be2849b-f821-4698-84c7-b874683bd49a","resolution":{"observed_at":"2026-08-07T23:42:35.254789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-07T23:42:35.259354Z","title":"arXiv preprint arXiv:2409.12191 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-08T12:17:49.158099Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.259354Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:5734083d17f9de7df659c5bc65f4118c7fda8b2aabb76301608edb65042b5c3b","observation_id":"2adc3bb7-81f2-47ca-942d-a0b06f11b82b","resolution":{"observed_at":"2026-08-07T23:42:35.259354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:35.263951Z","title":"Findings of the Association for Computational Linguistics: NAACL 2025 , pages=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-08T12:17:49.158099Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.263951Z"},"links":{"citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:42f549b9def14f256cee41ce4d63e8fe22b138dae9945c0efed9974f90d7e354","observation_id":"a3caf4fb-be58-49e2-ac26-315351eaeb75","resolution":{"observed_at":"2026-08-07T23:42:35.263951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:35.267788Z","title":"arXiv preprint arXiv:2510.20622 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-08T12:17:49.158099Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.267788Z"},"links":{"citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:3bdd6b743257ab52a4a272c5f022a52b50b41bdb437ec5de59e6e348434766bf","observation_id":"ce3af3d7-e684-4f93-85a3-4ea4f6cb84df","resolution":{"observed_at":"2026-08-07T23:42:35.267788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.03104","last_updated":"2024-08-10T14:57:37Z","snapshot_observed_at":"2026-07-06T18:40:57.362549Z","submitted_at":"2024-07-03T13:41:44Z","title":"KeyVideoLLM: Towards Large-scale Video Keyframe Selection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.03104","snapshot_observed_at":"2026-08-07T23:42:35.271317Z","title":"arXiv preprint arXiv:2407.03104 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-08T12:17:49.158099Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.271317Z"},"links":{"cited_paper":"/paper/2407.03104","citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:57eca007405cb19396bdc7401aecfe54bc79cc4c964d8a8fe53c91e52fe274e7","observation_id":"d5d5aada-913e-4dd2-af7c-e63665cd10d5","resolution":{"observed_at":"2026-08-07T23:42:35.271317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13189","snapshot_observed_at":"2026-08-07T23:42:35.275164Z","title":"arXiv preprint arXiv:2502.13189 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-08T12:17:49.158099Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.275164Z"},"links":{"cited_paper":"/paper/2502.13189","citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:76b2faa6e336eb491d4e96e1c5fac9a982ef8db039b4a28a19767f8e5414d038","observation_id":"3edf887e-ae98-487f-8ca2-118820cb80a6","resolution":{"observed_at":"2026-08-07T23:42:35.275164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08584","last_updated":"2024-12-18T07:45:11Z","snapshot_observed_at":"2026-07-06T19:31:40.352383Z","submitted_at":"2024-10-11T07:24:21Z","title":"ZipVL: Efficient Large Vision-Language Models with Dynamic Token Sparsification","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08584","snapshot_observed_at":"2026-08-07T23:42:35.279225Z","title":"arXiv preprint arXiv:2410.08584 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-08T12:17:49.158099Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.279225Z"},"links":{"cited_paper":"/paper/2410.08584","citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:ddf34cd7fbf096a294957955d4c9cc91286176d125dd45e5ca418e4d15e7bc65","observation_id":"ea224450-abc1-42c2-b9ae-bca17a4f097c","resolution":{"observed_at":"2026-08-07T23:42:35.279225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:35.282895Z","title":"European Conference on Computer Vision , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-08T12:17:49.158099Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.282895Z"},"links":{"citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:cca225f4c9bb972be61276b97fc4ba353ce7d67e902d4f0fd5b00e56f282d101","observation_id":"64354bbb-8bc1-43d1-8297-6a99e744addb","resolution":{"observed_at":"2026-08-07T23:42:35.282895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:35.286834Z","title":"arXiv preprint arXiv:2512.04000 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-08T12:17:49.158099Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.286834Z"},"links":{"citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:4e2f991e2cffbad5f0019e3c25bd759e41124cf95e35e29ef255ec3d1591c1db","observation_id":"70505639-07af-4d2d-ac65-935bf4ad9567","resolution":{"observed_at":"2026-08-07T23:42:35.286834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:35.290721Z","title":"Proceedings of the IEEE/CVF International Conference on Computer Vision , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-08T12:17:49.158099Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.290721Z"},"links":{"citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:a27dc8811d0cb743f2cd5e3d6c961b8a372ebb498838caf0aa319c428328544e","observation_id":"7231cc6d-7072-4e4c-bb8f-8dc3ddd4dd39","resolution":{"observed_at":"2026-08-07T23:42:35.290721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:38.298869Z","title":"Findings of the Association for Computational Linguistics: ACL 2024 , pages=","venue":null,"work_id":"87aae588-2c76-42ec-841e-9d5d83b6fe39","year":2024},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-08T12:17:49.158099Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.294520Z"},"links":{"citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:356aaeeaed1de392e1fc197dc7384bced53421b7f8db3b33862016b7c4754c95","observation_id":"0f75b74b-7551-4bf3-a952-b6523142cad7","resolution":{"observed_at":"2026-08-07T23:42:38.302472Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:35.298403Z","title":"arXiv preprint arXiv:2512.06866 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-08T12:17:49.158099Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.298403Z"},"links":{"citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:e89f1bc4f93aeac637a9744b5f501396fdcf65ca69abf12586212ae3d54001fe","observation_id":"3f747f0b-d0cf-4dcc-9a4d-28bae416a214","resolution":{"observed_at":"2026-08-07T23:42:35.298403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:35.302345Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-08T12:17:49.158099Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.302345Z"},"links":{"citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:ef63a97ce35e2a64a9d05ce04db2ee378a328e0e681eab646542fcf5ac33be2e","observation_id":"e82103f8-687e-4358-be36-fd9b36733719","resolution":{"observed_at":"2026-08-07T23:42:35.302345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.18234","last_updated":"2025-10-21T02:41:44Z","snapshot_observed_at":"2026-07-06T22:33:39.148066Z","submitted_at":"2025-10-21T02:41:44Z","title":"DeepSeek-OCR: Contexts Optical Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.18234","snapshot_observed_at":"2026-08-07T23:42:35.306068Z","title":"arXiv preprint arXiv:2510.18234 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-08T12:17:49.158099Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.306068Z"},"links":{"cited_paper":"/paper/2510.18234","citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:c133a763b038b89a863855d9949170adf7f7923f1f0aff1c76d410d32872e41e","observation_id":"386423a4-cb6a-4ec6-9647-fab143900a02","resolution":{"observed_at":"2026-08-07T23:42:35.306068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:35.310474Z","title":"arXiv preprint arXiv:2502.02770 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-08T12:17:49.158099Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.310474Z"},"links":{"citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:8aae414c605c8aff37ebc3d75698524ff5206d3706cf429b889488dff6473149","observation_id":"a8e0168f-e7cf-496b-be61-0b99e380d554","resolution":{"observed_at":"2026-08-07T23:42:35.310474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00574","last_updated":"2025-07-13T16:21:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-31T18:01:23Z","title":"VideoChat-Flash: Hierarchical Compression for Long-Context Video Modeling","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00574","snapshot_observed_at":"2026-08-07T23:42:35.314074Z","title":"arXiv preprint arXiv:2501.00574 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-08T12:17:49.158099Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.314074Z"},"links":{"cited_paper":"/paper/2501.00574","citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:357ece2d1995cc64a22564043a7eb9ca89d15280aa0365d40af410516a0188bc","observation_id":"8651f988-a6eb-478d-9397-9933409b53f1","resolution":{"observed_at":"2026-08-07T23:42:35.314074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:35.318166Z","title":"arXiv preprint arXiv:2601.22582 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-08T12:17:49.158099Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.318166Z"},"links":{"citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:9f4c914bfd72a6f79ed0711eae51c396fe5f7bbeb618e04cf2035fec8fff89d8","observation_id":"0c39dbf2-088b-4d6a-9299-72b5745b961d","resolution":{"observed_at":"2026-08-07T23:42:35.318166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06428","last_updated":"2025-02-11T14:59:25Z","snapshot_observed_at":"2026-08-03T22:34:50.903495Z","submitted_at":"2025-02-10T13:03:05Z","title":"CoS: Chain-of-Shot Prompting for Long Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06428","snapshot_observed_at":"2026-08-07T23:42:35.322337Z","title":"arXiv preprint arXiv:2502.06428 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-08T12:17:49.158099Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.322337Z"},"links":{"cited_paper":"/paper/2502.06428","citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:6467bc5c43add4648fd92ae248ff0e4ba51790d44cbf8d8d7a8f3a9bd9a23673","observation_id":"89644a61-823b-477b-9050-d893594e292f","resolution":{"observed_at":"2026-08-07T23:42:35.322337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-02T12:24:31.329178Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02713","snapshot_observed_at":"2026-08-07T23:42:35.326390Z","title":"arXiv preprint arXiv:2410.02713 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-08T12:17:49.158099Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.326390Z"},"links":{"cited_paper":"/paper/2410.02713","citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:29ad1f541a307768288abb0be13ff13e4ebca38ffcd34459c22662cabcf7302e","observation_id":"0f00d2cd-5d32-4612-8501-582a08c55afb","resolution":{"observed_at":"2026-08-07T23:42:35.326390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23747","last_updated":"2026-05-19T02:23:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-29T17:59:04Z","title":"Spatial-MLLM: Boosting MLLM Capabilities in Visual-based Spatial Intelligence","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23747","snapshot_observed_at":"2026-08-07T23:42:35.330473Z","title":"arXiv preprint arXiv:2505.23747 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-08T12:17:49.158099Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.330473Z"},"links":{"cited_paper":"/paper/2505.23747","citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:943a413e09a631c55a3b3b98a8da0405c34ea06d16a92a10c1acdfc312f6f08d","observation_id":"6e9bdbae-b87b-4365-9025-a400c1fbc98a","resolution":{"observed_at":"2026-08-07T23:42:35.330473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.10978","last_updated":"2025-10-28T15:11:36Z","snapshot_observed_at":"2026-07-29T19:20:21.974239Z","submitted_at":"2025-05-16T08:26:59Z","title":"Group-in-Group Policy Optimization for LLM Agent Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.10978","snapshot_observed_at":"2026-08-07T23:42:35.334661Z","title":"arXiv preprint arXiv:2505.10978 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-08T12:17:49.158099Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.334661Z"},"links":{"cited_paper":"/paper/2505.10978","citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:1d47541741317f04d6aeeccd70891bf139a2f8bc6ea05520a0c4cdb5bbdf9a60","observation_id":"ef3c325f-9b54-45f3-b907-81c8326c3dbb","resolution":{"observed_at":"2026-08-07T23:42:35.334661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01951","last_updated":"2025-08-09T19:48:07Z","snapshot_observed_at":"2026-08-05T12:42:42.956003Z","submitted_at":"2025-02-04T02:53:07Z","title":"On the Emergence of Position Bias in Transformers","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01951","snapshot_observed_at":"2026-08-07T23:42:35.338843Z","title":"arXiv preprint arXiv:2502.01951 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-08T12:17:49.158099Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.338843Z"},"links":{"cited_paper":"/paper/2502.01951","citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:a65768710203600d415f6429bc45eae967f85488aac36840add481b28095d6fe","observation_id":"a46cfd20-1e86-4467-b0c4-b3d875e8158c","resolution":{"observed_at":"2026-08-07T23:42:35.338843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:38.281679Z","title":"Proceedings of the Computer Vision and Pattern Recognition Conference , pages=","venue":null,"work_id":"5b1159e1-6419-4ce3-828c-8f659473396d","year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-08T12:17:49.158099Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.343208Z"},"links":{"citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:2149ca8059398421111b4026f053fba70391c1b1448072ed63bb83058df6b08a","observation_id":"df6bbcc7-9e88-4fbf-96b0-9b851f16bda6","resolution":{"observed_at":"2026-08-07T23:42:38.284992Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:38.271498Z","title":"Proceedings of the 2022 Conference on Empirical Methods in Natural Language Processing , pages=","venue":null,"work_id":"56e0a4c2-8a9c-47d1-aa07-a37c6acda30b","year":2022},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-08T12:17:49.158099Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.347966Z"},"links":{"citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:2eae671fd4a1ea88ae7630fd77e53266892b870d9fde4ad9e060fa4a40e1ef39","observation_id":"8aace232-8f19-4705-b6a3-084255d68645","resolution":{"observed_at":"2026-08-07T23:42:38.274866Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:35.351819Z","title":"arXiv preprint arXiv:2504.18579 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-08T12:17:49.158099Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.351819Z"},"links":{"citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:fd28354f94a96fc5dac216d7c824177a8867cb7f3f3226070f059ebaaa58d742","observation_id":"8a677408-6190-4db3-9c70-bd63b83027e4","resolution":{"observed_at":"2026-08-07T23:42:35.351819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:35.355809Z","title":"arXiv preprint arXiv:2603.06199 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-08T12:17:49.158099Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.355809Z"},"links":{"citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:582a50448505a29d09d385373eda57793102a2041a53bde6043b2ec0a45f77b3","observation_id":"f91a1cdf-23b2-4ce0-b2ec-332e7591b29c","resolution":{"observed_at":"2026-08-07T23:42:35.355809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.20766","last_updated":"2025-02-28T06:34:53Z","snapshot_observed_at":"2026-08-07T17:40:46.337382Z","submitted_at":"2025-02-28T06:34:53Z","title":"FlexPrefill: A Context-Aware Sparse Attention Mechanism for Efficient Long-Sequence Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.20766","snapshot_observed_at":"2026-08-07T23:42:35.360123Z","title":"arXiv preprint arXiv:2502.20766 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-08T12:17:49.158099Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.360123Z"},"links":{"cited_paper":"/paper/2502.20766","citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:195044eac32406298957b5cf0bd432f3bb44949181e99b7ab3370f2d2582b187","observation_id":"6083fe37-9c5f-40e6-97e3-d61f110a605a","resolution":{"observed_at":"2026-08-07T23:42:35.360123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T12:17:49.158099Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding"},"reference_resolution":{"displayed":94,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":83,"verified_exact":0,"verified_fuzzy":10},"total_outbound_references":94},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 94 of 94 outbound references and 0 inbound Pith citation observations for arXiv:2608.05780."}