{"as_of":"2026-08-09T15:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0e08fd88d815c257813783f28db61e3b88e7eea4e5a9d212ebe1a8a1130fe8cd","coverage":[{"denominator":52,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":52,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:59:11.354129Z","state":"measured"},{"denominator":57,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":57,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T23:42:35.141746Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-12T10:11:28.172880Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.00993","last_updated":"2025-06-01T12:49:39Z","snapshot_observed_at":"2026-08-08T18:44:33.509277Z","submitted_at":"2025-06-01T12:49:39Z","title":"FlexSelect: Flexible Token Selection for Efficient Long Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.00993","snapshot_observed_at":"2026-08-05T19:03:08.270295Z","title":"Flexselect: Flexible token selection for efficient long video understanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.13692","last_updated":"2025-08-19T09:52:04Z","snapshot_observed_at":"2026-08-09T03:24:13.317916Z","submitted_at":"2025-08-19T09:52:04Z","title":"HumanPCR: Probing MLLM Capabilities in Diverse Human-Centric Scenes","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-05T19:03:08.270295Z"},"links":{"cited_paper":"/paper/2506.00993","citing_paper":"/paper/2508.13692"},"observation_digest":"sha256:5896d84747b27c1f9414aa5117ecb6d0feefda0e42a01668a57448eb8269d282","observation_id":"aab852e4-f310-444f-81f7-d11913bbc228","resolution":{"observed_at":"2026-08-05T19:03:08.270295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00993","last_updated":"2025-06-01T12:49:39Z","snapshot_observed_at":"2026-08-08T18:44:33.509277Z","submitted_at":"2025-06-01T12:49:39Z","title":"FlexSelect: Flexible Token Selection for Efficient Long Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.00993","snapshot_observed_at":"2026-08-02T20:14:05.045461Z","title":"Flexselect: Flexible token selection for efficient long video understanding.arXiv preprint arXiv:2506.00993, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.00198","last_updated":"2026-07-01T00:40:56Z","snapshot_observed_at":"2026-08-08T00:25:26.077628Z","submitted_at":"2026-02-27T08:11:06Z","title":"Stateful Token Reduction for Long-Video Hybrid VLMs","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T20:14:05.045461Z"},"links":{"cited_paper":"/paper/2506.00993","citing_paper":"/paper/2603.00198"},"observation_digest":"sha256:11129d58cdfedac432db97b6346967ed9466a833698c278bc542b90be1e2e9b7","observation_id":"ad69ed62-b0a9-4128-bfef-26435c8257e2","resolution":{"observed_at":"2026-08-02T20:14:05.045461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00993","last_updated":"2025-06-01T12:49:39Z","snapshot_observed_at":"2026-08-08T18:44:33.509277Z","submitted_at":"2025-06-01T12:49:39Z","title":"FlexSelect: Flexible Token Selection for Efficient Long Video Understanding","version":1},"cited_work":{"arxiv_id":"2506.00993","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.00993","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2506.00993(2025)","venue":null,"work_id":"6894eb6b-fbd3-4f50-b46f-7875a4da803d","year":2025},"citing_paper":{"arxiv_id":"2604.27600","last_updated":"2026-04-30T08:50:03Z","snapshot_observed_at":"2026-07-06T23:13:02.921765Z","submitted_at":"2026-04-30T08:50:03Z","title":"Purifying Multimodal Retrieval: Fragment-Level Evidence Selection for RAG","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-07T07:19:44.125479Z"},"links":{"cited_paper":"/paper/2506.00993","citing_paper":"/paper/2604.27600"},"observation_digest":"sha256:1d2a6d0264fbbb3522d6b6161df342782ad980dd4495ecdb001124633d4a477d","observation_id":"8232cef7-438a-4279-b437-41f59df8bfab","resolution":{"observed_at":"2026-05-12T10:11:28.175133Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00993","last_updated":"2025-06-01T12:49:39Z","snapshot_observed_at":"2026-08-08T18:44:33.509277Z","submitted_at":"2025-06-01T12:49:39Z","title":"FlexSelect: Flexible Token Selection for Efficient Long Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.00993","snapshot_observed_at":"2026-08-02T09:17:00.719844Z","title":"arXiv preprint arXiv:2506.00993 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24794","last_updated":"2026-06-30T10:55:56Z","snapshot_observed_at":"2026-08-09T04:03:16.132660Z","submitted_at":"2026-06-30T10:55:56Z","title":"Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:00.719844Z"},"links":{"cited_paper":"/paper/2506.00993","citing_paper":"/paper/2607.24794"},"observation_digest":"sha256:1088fda50e0ee41459f11098e8f10e4f977f20c00504c5be82d7dcf8cd6da429","observation_id":"fd526ce5-1a3b-4b14-91b0-56a7c9883c5e","resolution":{"observed_at":"2026-08-02T09:17:00.719844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00993","last_updated":"2025-06-01T12:49:39Z","snapshot_observed_at":"2026-08-08T18:44:33.509277Z","submitted_at":"2025-06-01T12:49:39Z","title":"FlexSelect: Flexible Token Selection for Efficient Long Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.00993","snapshot_observed_at":"2026-08-07T23:42:35.141746Z","title":"arXiv preprint arXiv:2506.00993 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-09T14:10:59.379725Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.141746Z"},"links":{"cited_paper":"/paper/2506.00993","citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:03fb6d9108698c01b2f4a2cc3d66db4de49d098d186a9a04bad854a7289a5eb2","observation_id":"1b80a305-06b8-4a90-b461-e9b9d104db82","resolution":{"observed_at":"2026-08-07T23:42:35.141746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.00993/citation-record","integrity":"/paper/2506.00993/integrity","json":"/paper/2506.00993/citation-record.json","paper":"/paper/2506.00993"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:59:05.319800Z","title":"Qwen2.5-vl technical report,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.00993","last_updated":"2025-06-01T12:49:39Z","snapshot_observed_at":"2026-08-08T18:44:33.509277Z","submitted_at":"2025-06-01T12:49:39Z","title":"FlexSelect: Flexible Token Selection for Efficient Long Video Understanding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:59:05.319800Z"},"links":{"citing_paper":"/paper/2506.00993"},"observation_digest":"sha256:0d2f447368c7d673f7471a21a7ba1896573b686fc9cdb8e6f9930ed2b10cca80","observation_id":"a2b7e372-c127-4f3a-90d4-efd27c3a854d","resolution":{"observed_at":"2026-08-07T11:59:05.319800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.08871","last_updated":"2020-06-29T23:11:03Z","snapshot_observed_at":"2026-08-08T04:03:26.356056Z","submitted_at":"2020-02-20T17:11:09Z","title":"Fast Differentiable Sorting and Ranking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.08871","snapshot_observed_at":"2026-08-07T11:59:05.529141Z","title":"Fast differentiable sorting and ranking, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.00993","last_updated":"2025-06-01T12:49:39Z","snapshot_observed_at":"2026-08-08T18:44:33.509277Z","submitted_at":"2025-06-01T12:49:39Z","title":"FlexSelect: Flexible Token Selection for Efficient Long Video Understanding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:59:05.529141Z"},"links":{"cited_paper":"/paper/2002.08871","citing_paper":"/paper/2506.00993"},"observation_digest":"sha256:585ca44b484b87eb719e0fe283c3850e4fcf1b5d9eab0b8965a34cc3c125bd47","observation_id":"142e73d1-bebc-49bf-aba7-c98074de1e36","resolution":{"observed_at":"2026-08-07T11:59:05.529141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:59:13.198558Z","title":"Principal component analysis.Analytical methods, 6(9): 2812–2831, 2014","venue":null,"work_id":"3c68aeb3-03f5-4a8e-8c6d-7f9083f8f20a","year":2014},"citing_paper":{"arxiv_id":"2506.00993","last_updated":"2025-06-01T12:49:39Z","snapshot_observed_at":"2026-08-08T18:44:33.509277Z","submitted_at":"2025-06-01T12:49:39Z","title":"FlexSelect: Flexible Token Selection for Efficient Long Video Understanding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T11:59:05.644985Z"},"links":{"citing_paper":"/paper/2506.00993"},"observation_digest":"sha256:4134d01ae1dd252e56f38f77375ea665c25ac70a925a80e5f34654791ccf1268","observation_id":"0c9fb958-105e-4065-a867-de5b55fd6aa6","resolution":{"observed_at":"2026-08-07T11:59:13.275919Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06764","last_updated":"2024-09-02T05:48:54Z","snapshot_observed_at":"2026-08-08T22:33:21.852107Z","submitted_at":"2024-03-11T14:35:32Z","title":"An Image is Worth 1/2 Tokens After Layer 2: Plug-and-Play Inference Acceleration for Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.06764","snapshot_observed_at":"2026-08-07T11:59:05.780757Z","title":"An image is worth 1/2 tokens after layer 2: Plug-and-play inference acceleration for large vision-language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00993","last_updated":"2025-06-01T12:49:39Z","snapshot_observed_at":"2026-08-08T18:44:33.509277Z","submitted_at":"2025-06-01T12:49:39Z","title":"FlexSelect: Flexible Token Selection for Efficient Long Video Understanding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T11:59:05.780757Z"},"links":{"cited_paper":"/paper/2403.06764","citing_paper":"/paper/2506.00993"},"observation_digest":"sha256:1a8e04df9178356fc490b88e485099a6262aead5673b03e198f56da794181cdf","observation_id":"ec529799-0e10-4035-b845-b9cc040f1b06","resolution":{"observed_at":"2026-08-07T11:59:05.780757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-08-07T11:59:05.898445Z","title":"Longvila: Scaling long-context visual language models for long videos, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00993","last_updated":"2025-06-01T12:49:39Z","snapshot_observed_at":"2026-08-08T18:44:33.509277Z","submitted_at":"2025-06-01T12:49:39Z","title":"FlexSelect: Flexible Token Selection for Efficient Long Video Understanding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T11:59:05.898445Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2506.00993"},"observation_digest":"sha256:b844f5a1bba356bc51ae62f32c45347eebbfbb702984bb2ba9fd70a876e7458f","observation_id":"6fbfa54c-6909-484a-814c-ee2ecabe4087","resolution":{"observed_at":"2026-08-07T11:59:05.898445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T11:59:06.001743Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00993","last_updated":"2025-06-01T12:49:39Z","snapshot_observed_at":"2026-08-08T18:44:33.509277Z","submitted_at":"2025-06-01T12:49:39Z","title":"FlexSelect: Flexible Token Selection for Efficient Long Video Understanding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T11:59:06.001743Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2506.00993"},"observation_digest":"sha256:e75ab4b5bd4caa56cf8267705535a67c1cc424da31a66aff80fdddc825bb8f8d","observation_id":"765a8170-44c3-4b5f-8f69-cb30a2eebca8","resolution":{"observed_at":"2026-08-07T11:59:06.001743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02438","last_updated":"2025-09-10T04:22:46Z","snapshot_observed_at":"2026-08-07T16:12:02.851576Z","submitted_at":"2025-04-03T09:55:09Z","title":"Scaling Video-Language Models to 10K Frames via Hierarchical Differential Distillation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.02438","snapshot_observed_at":"2026-08-07T11:59:06.098310Z","title":"Scaling video-language models to 10k frames via hierarchical differential distillation, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00993","last_updated":"2025-06-01T12:49:39Z","snapshot_observed_at":"2026-08-08T18:44:33.509277Z","submitted_at":"2025-06-01T12:49:39Z","title":"FlexSelect: Flexible Token Selection for Efficient Long Video Understanding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:59:06.098310Z"},"links":{"cited_paper":"/paper/2504.02438","citing_paper":"/paper/2506.00993"},"observation_digest":"sha256:cd47f2aef53834e52ea57b1e083c5a15ca30b16638eed4e1fa07f26dcbc2cf00","observation_id":"d536abaf-3295-4fbb-a432-666bc4a20e34","resolution":{"observed_at":"2026-08-07T11:59:06.098310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15556","last_updated":"2025-03-27T23:05:29Z","snapshot_observed_at":"2026-07-06T19:55:55.658760Z","submitted_at":"2024-11-23T13:23:22Z","title":"ReWind: Understanding Long Videos with Instructed Learnable Memory","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15556","snapshot_observed_at":"2026-08-07T11:59:06.204066Z","title":"Rewind: Understanding long videos with instructed learnable memory, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00993","last_updated":"2025-06-01T12:49:39Z","snapshot_observed_at":"2026-08-08T18:44:33.509277Z","submitted_at":"2025-06-01T12:49:39Z","title":"FlexSelect: Flexible Token Selection for Efficient Long Video Understanding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T11:59:06.204066Z"},"links":{"cited_paper":"/paper/2411.15556","citing_paper":"/paper/2506.00993"},"observation_digest":"sha256:7539abf3797ba910ca0dd427ab0f952d2bfe27248c169065a86677dda09808b6","observation_id":"4a6a7819-c052-4f17-a2a0-c9e20b22d499","resolution":{"observed_at":"2026-08-07T11:59:06.204066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13180","last_updated":"2025-07-31T22:51:46Z","snapshot_observed_at":"2026-08-08T00:47:16.263621Z","submitted_at":"2024-12-17T18:56:50Z","title":"Feather the Throttle: Revisiting Visual Token Pruning for Vision-Language Model Acceleration","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.13180","snapshot_observed_at":"2026-08-07T11:59:06.327785Z","title":"Feather the throttle: Revisiting visual token pruning for vision-language model acceleration, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00993","last_updated":"2025-06-01T12:49:39Z","snapshot_observed_at":"2026-08-08T18:44:33.509277Z","submitted_at":"2025-06-01T12:49:39Z","title":"FlexSelect: Flexible Token Selection for Efficient Long Video Understanding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:59:06.327785Z"},"links":{"cited_paper":"/paper/2412.13180","citing_paper":"/paper/2506.00993"},"observation_digest":"sha256:1ca68ddc035b1441216f92acaed59cff19094eade9284b5553ea63024e3a7995","observation_id":"0cf1cc51-d3b1-4ccd-95ef-a55c6c0a8e66","resolution":{"observed_at":"2026-08-07T11:59:06.327785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.14023","last_updated":"2024-08-26T05:27:14Z","snapshot_observed_at":"2026-08-07T05:22:51.503928Z","submitted_at":"2024-08-26T05:27:14Z","title":"Video-CCAM: Enhancing Video-Language Understanding with Causal Cross-Attention Masks for Short and Long Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.14023","snapshot_observed_at":"2026-08-07T11:59:06.421786Z","title":"Video-ccam: Enhancing video-language understanding with causal cross-attention masks for short and long videos, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00993","last_updated":"2025-06-01T12:49:39Z","snapshot_observed_at":"2026-08-08T18:44:33.509277Z","submitted_at":"2025-06-01T12:49:39Z","title":"FlexSelect: Flexible Token Selection for Efficient Long Video Understanding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:59:06.421786Z"},"links":{"cited_paper":"/paper/2408.14023","citing_paper":"/paper/2506.00993"},"observation_digest":"sha256:e4aa85f75efe74274231067f167a8d09ad7eddb4ef4e3129dab30967dcfa4107","observation_id":"889779c6-2937-4cab-bb15-295b9ff8aeea","resolution":{"observed_at":"2026-08-07T11:59:06.421786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-07T11:59:06.561620Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00993","last_updated":"2025-06-01T12:49:39Z","snapshot_observed_at":"2026-08-08T18:44:33.509277Z","submitted_at":"2025-06-01T12:49:39Z","title":"FlexSelect: Flexible Token Selection for Efficient Long Video Understanding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T11:59:06.561620Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2506.00993"},"observation_digest":"sha256:a594edeedec49221ebaea25aaa8c7966f11858dc21baf7d36a0e1fb20e731c6e","observation_id":"edb3e71d-43c9-4f30-aeab-8340890c5497","resolution":{"observed_at":"2026-08-07T11:59:06.561620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:59:13.094734Z","title":"Framefusion: Combining similarity and importance for video token reduction on large visual language models, 2024","venue":null,"work_id":"713d3faa-a8b8-4f66-a747-1bebfcc142ca","year":2024},"citing_paper":{"arxiv_id":"2506.00993","last_updated":"2025-06-01T12:49:39Z","snapshot_observed_at":"2026-08-08T18:44:33.509277Z","submitted_at":"2025-06-01T12:49:39Z","title":"FlexSelect: Flexible Token Selection for Efficient Long Video Understanding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T11:59:06.662818Z"},"links":{"citing_paper":"/paper/2506.00993"},"observation_digest":"sha256:750b12f9967943dcbfd7b58188f30849c446c3fd6bb980eb321bc5860681470e","observation_id":"b1499470-2857-43b4-9b4a-d9b606b4758b","resolution":{"observed_at":"2026-08-07T11:59:13.133611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05185","last_updated":"2024-12-11T14:43:02Z","snapshot_observed_at":"2026-07-06T20:02:53.153763Z","submitted_at":"2024-12-06T17:04:42Z","title":"LinVT: Empower Your Image-level Large Language Model to Understand Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05185","snapshot_observed_at":"2026-08-07T11:59:06.759496Z","title":"Linvt: Empower your image-level large language model to understand videos, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00993","last_updated":"2025-06-01T12:49:39Z","snapshot_observed_at":"2026-08-08T18:44:33.509277Z","submitted_at":"2025-06-01T12:49:39Z","title":"FlexSelect: Flexible Token Selection for Efficient Long Video Understanding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:59:06.759496Z"},"links":{"cited_paper":"/paper/2412.05185","citing_paper":"/paper/2506.00993"},"observation_digest":"sha256:eeea32cc9b22810dccc987ec4802cd3f58325f263039c55ff1f5c63d153e7afd","observation_id":"7a28d731-d390-4e5c-9c8d-1465ae651bdd","resolution":{"observed_at":"2026-08-07T11:59:06.759496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:59:06.898702Z","title":"Llava-onevision: Easy visual task transfer,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.00993","last_updated":"2025-06-01T12:49:39Z","snapshot_observed_at":"2026-08-08T18:44:33.509277Z","submitted_at":"2025-06-01T12:49:39Z","title":"FlexSelect: Flexible Token Selection for Efficient Long Video Understanding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T11:59:06.898702Z"},"links":{"citing_paper":"/paper/2506.00993"},"observation_digest":"sha256:be1a14bb06f5a10385e9048f5c5fe58f9951827aeaf9b16859ad9682c146593b","observation_id":"e2fd70d1-368d-4c2e-a2d5-30a39a559de3","resolution":{"observed_at":"2026-08-07T11:59:06.898702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-08-09T05:22:43.395488Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-08-07T11:59:07.178112Z","title":"Aria: An open multimodal native mixture-of-experts model, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00993","last_updated":"2025-06-01T12:49:39Z","snapshot_observed_at":"2026-08-08T18:44:33.509277Z","submitted_at":"2025-06-01T12:49:39Z","title":"FlexSelect: Flexible Token Selection for Efficient Long Video Understanding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T11:59:07.178112Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2506.00993"},"observation_digest":"sha256:1732f7e89dfab3edc3781f437e69508ef6d40ed587f6414b42c732783d80d14c","observation_id":"21cc2dfd-dfd4-44a1-b1c5-5e5e52635d85","resolution":{"observed_at":"2026-08-07T11:59:07.178112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:59:07.303609Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00993","last_updated":"2025-06-01T12:49:39Z","snapshot_observed_at":"2026-08-08T18:44:33.509277Z","submitted_at":"2025-06-01T12:49:39Z","title":"FlexSelect: Flexible Token Selection for Efficient Long Video Understanding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T11:59:07.303609Z"},"links":{"citing_paper":"/paper/2506.00993"},"observation_digest":"sha256:8d24e127db0194fcd3c08fcb10a4bf2bcd98f6ba496f8ba58a9ec488147583ae","observation_id":"cade06a3-70a4-4910-80ba-31e38fac5da2","resolution":{"observed_at":"2026-08-07T11:59:07.303609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:59:12.941228Z","title":"Temporal preference optimization for long-form video understanding, 2025","venue":null,"work_id":"82ab279e-b944-4931-b2eb-eaf8b9749ba2","year":2025},"citing_paper":{"arxiv_id":"2506.00993","last_updated":"2025-06-01T12:49:39Z","snapshot_observed_at":"2026-08-08T18:44:33.509277Z","submitted_at":"2025-06-01T12:49:39Z","title":"FlexSelect: Flexible Token Selection for Efficient Long Video Understanding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T11:59:07.398143Z"},"links":{"citing_paper":"/paper/2506.00993"},"observation_digest":"sha256:4ed9f40b915965d746f0a4edde59e557479a1b6734852ece2c7d88cfc1e27432","observation_id":"c0f4db96-2152-4a32-8749-5ef93fdf9da5","resolution":{"observed_at":"2026-08-07T11:59:12.981096Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17043","last_updated":"2023-11-28T18:53:43Z","snapshot_observed_at":"2026-08-06T05:08:17.428238Z","submitted_at":"2023-11-28T18:53:43Z","title":"LLaMA-VID: An Image is Worth 2 Tokens in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17043","snapshot_observed_at":"2026-08-07T11:59:07.537007Z","title":"Llama-vid: An image is worth 2 tokens in large language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00993","last_updated":"2025-06-01T12:49:39Z","snapshot_observed_at":"2026-08-08T18:44:33.509277Z","submitted_at":"2025-06-01T12:49:39Z","title":"FlexSelect: Flexible Token Selection for Efficient Long Video Understanding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T11:59:07.537007Z"},"links":{"cited_paper":"/paper/2311.17043","citing_paper":"/paper/2506.00993"},"observation_digest":"sha256:beb8914c17c0bd767fc9d238f9f560fca25c7eb37faa70987f07a0b94beb240a","observation_id":"02ef2d55-2f23-47e2-b7f1-85fa1b1795f0","resolution":{"observed_at":"2026-08-07T11:59:07.537007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15542","last_updated":"2024-08-28T05:34:14Z","snapshot_observed_at":"2026-07-06T19:06:54.428910Z","submitted_at":"2024-08-28T05:34:14Z","title":"Kangaroo: A Powerful Video-Language Model Supporting Long-context Video Input","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15542","snapshot_observed_at":"2026-08-07T11:59:07.645844Z","title":"Kangaroo: A powerful video-language model supporting long-context video input, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00993","last_updated":"2025-06-01T12:49:39Z","snapshot_observed_at":"2026-08-08T18:44:33.509277Z","submitted_at":"2025-06-01T12:49:39Z","title":"FlexSelect: Flexible Token Selection for Efficient Long Video Understanding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T11:59:07.645844Z"},"links":{"cited_paper":"/paper/2408.15542","citing_paper":"/paper/2506.00993"},"observation_digest":"sha256:fb7d9a8c3663fa3e7b0ecfd5fa71f85f75b495a0fd312ed7246692c627ffe314","observation_id":"45e15b40-6cc5-4825-8b1a-1dea06352fcd","resolution":{"observed_at":"2026-08-07T11:59:07.645844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18478","last_updated":"2025-04-27T10:39:51Z","snapshot_observed_at":"2026-08-07T16:41:53.661756Z","submitted_at":"2025-03-24T09:21:48Z","title":"Video-XL-Pro: Reconstructive Token Compression for Extremely Long Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.18478","snapshot_observed_at":"2026-08-07T11:59:07.742693Z","title":"Video-xl-pro: Recon- structive token compression for extremely long video understanding, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00993","last_updated":"2025-06-01T12:49:39Z","snapshot_observed_at":"2026-08-08T18:44:33.509277Z","submitted_at":"2025-06-01T12:49:39Z","title":"FlexSelect: Flexible Token Selection for Efficient Long Video Understanding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T11:59:07.742693Z"},"links":{"cited_paper":"/paper/2503.18478","citing_paper":"/paper/2506.00993"},"observation_digest":"sha256:39b3fb58c2d0be802ad72fe3da7eef31b10466dcc58e994750fb34940da58c68","observation_id":"8b3bc549-41c2-46f4-95bc-16ad15f0b52f","resolution":{"observed_at":"2026-08-07T11:59:07.742693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04468","snapshot_observed_at":"2026-08-07T11:59:07.844726Z","title":"Nvila: Efficient frontier visual language models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00993","last_updated":"2025-06-01T12:49:39Z","snapshot_observed_at":"2026-08-08T18:44:33.509277Z","submitted_at":"2025-06-01T12:49:39Z","title":"FlexSelect: Flexible Token Selection for Efficient Long Video Understanding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T11:59:07.844726Z"},"links":{"cited_paper":"/paper/2412.04468","citing_paper":"/paper/2506.00993"},"observation_digest":"sha256:8f21f42dbae22846c4d4e0d8fd34fd70cfd258d14c69173f66ea5c1447dc349a","observation_id":"53815c49-612f-4fdc-ace2-72e165abdbdc","resolution":{"observed_at":"2026-08-07T11:59:07.844726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12961","last_updated":"2025-02-27T06:09:46Z","snapshot_observed_at":"2026-07-06T19:18:17.523057Z","submitted_at":"2024-09-19T17:59:51Z","title":"Oryx MLLM: On-Demand Spatial-Temporal Understanding at Arbitrary Resolution","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12961","snapshot_observed_at":"2026-08-07T11:59:07.957257Z","title":"Oryx mllm: On-demand spatial-temporal understanding at arbitrary resolution, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00993","last_updated":"2025-06-01T12:49:39Z","snapshot_observed_at":"2026-08-08T18:44:33.509277Z","submitted_at":"2025-06-01T12:49:39Z","title":"FlexSelect: Flexible Token Selection for Efficient Long Video Understanding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T11:59:07.957257Z"},"links":{"cited_paper":"/paper/2409.12961","citing_paper":"/paper/2506.00993"},"observation_digest":"sha256:ef36df010bd6a46ef5447717ea15311ac969bb14c15fcc6565ec5c1fa167bb02","observation_id":"76f94cf2-f665-450c-bbba-a82b44d337a1","resolution":{"observed_at":"2026-08-07T11:59:07.957257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.08689","last_updated":"2025-03-11T17:59:57Z","snapshot_observed_at":"2026-08-07T17:12:08.483913Z","submitted_at":"2025-03-11T17:59:57Z","title":"QuoTA: Query-oriented Token Assignment via CoT Query Decouple for Long Video Comprehension","version":1},"cited_work":{"arxiv_id":"2503.08689","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.08689","snapshot_observed_at":"2026-08-07T11:59:11.640056Z","title":"QuoTA: Query-oriented Token Assignment via CoT Query Decouple for Long Video Comprehension","venue":"cs.CV","work_id":"a21f33f0-f436-457e-9994-a38b03aa64c0","year":2025},"citing_paper":{"arxiv_id":"2506.00993","last_updated":"2025-06-01T12:49:39Z","snapshot_observed_at":"2026-08-08T18:44:33.509277Z","submitted_at":"2025-06-01T12:49:39Z","title":"FlexSelect: Flexible Token Selection for Efficient Long Video Understanding","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T11:59:08.080043Z"},"links":{"cited_paper":"/paper/2503.08689","citing_paper":"/paper/2506.00993"},"observation_digest":"sha256:d75df5df143bb9946cc8a2687771673a3d3f9ad4697189f3589bb5c704795335","observation_id":"b223a9c7-6b65-4bea-8703-b7752342912c","resolution":{"observed_at":"2026-08-07T11:59:11.720174Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:59:12.715909Z","title":"Hello GPT-4o, 5 2024","venue":null,"work_id":"0fe8d5ef-c7c1-408e-803e-838e60cffcae","year":2024},"citing_paper":{"arxiv_id":"2506.00993","last_updated":"2025-06-01T12:49:39Z","snapshot_observed_at":"2026-08-08T18:44:33.509277Z","submitted_at":"2025-06-01T12:49:39Z","title":"FlexSelect: Flexible Token Selection for Efficient Long Video Understanding","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T11:59:08.188771Z"},"links":{"citing_paper":"/paper/2506.00993"},"observation_digest":"sha256:ed7f450d3b83ba157da2286c3ead16bc4387e95a907cd301770b03bb3d47ad17","observation_id":"8c88a420-dec8-4220-ae5d-15760d672cf5","resolution":{"observed_at":"2026-08-07T11:59:12.829537Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:59:12.469177Z","title":"Yarn: Efficient context window extension of large language models, 2023","venue":null,"work_id":"0e561655-e873-4a52-b3d8-3e0a906a4fdf","year":2023},"citing_paper":{"arxiv_id":"2506.00993","last_updated":"2025-06-01T12:49:39Z","snapshot_observed_at":"2026-08-08T18:44:33.509277Z","submitted_at":"2025-06-01T12:49:39Z","title":"FlexSelect: Flexible Token Selection for Efficient Long Video Understanding","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T11:59:08.296154Z"},"links":{"citing_paper":"/paper/2506.00993"},"observation_digest":"sha256:48dfdcef913b15b31bad706afd9933ec702863859f13ee5582852f30acab06ce","observation_id":"b5051d15-0865-43d9-a9a2-a195f343f37b","resolution":{"observed_at":"2026-08-07T11:59:12.565984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12326","last_updated":"2025-01-21T17:48:10Z","snapshot_observed_at":"2026-07-06T20:23:58.426780Z","submitted_at":"2025-01-21T17:48:10Z","title":"UI-TARS: Pioneering Automated GUI Interaction with Native Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12326","snapshot_observed_at":"2026-08-07T11:59:08.402346Z","title":"Ui-tars: Pioneering automated gui interaction with native agents, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00993","last_updated":"2025-06-01T12:49:39Z","snapshot_observed_at":"2026-08-08T18:44:33.509277Z","submitted_at":"2025-06-01T12:49:39Z","title":"FlexSelect: Flexible Token Selection for Efficient Long Video Understanding","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T11:59:08.402346Z"},"links":{"cited_paper":"/paper/2501.12326","citing_paper":"/paper/2506.00993"},"observation_digest":"sha256:7f9373fc397edd592479af5b165703492cadb92f734a20eb7bebee4fb69a907d","observation_id":"44eec4db-7d7a-43fd-86e8-4d3f6f8c8d70","resolution":{"observed_at":"2026-08-07T11:59:08.402346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:59:12.333614Z","title":"Video-xl: Extra-long vision language model for hour-scale video understanding,","venue":null,"work_id":"9d44597d-1688-449a-8e36-6ad14504eac0","year":null},"citing_paper":{"arxiv_id":"2506.00993","last_updated":"2025-06-01T12:49:39Z","snapshot_observed_at":"2026-08-08T18:44:33.509277Z","submitted_at":"2025-06-01T12:49:39Z","title":"FlexSelect: Flexible Token Selection for Efficient Long Video Understanding","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T11:59:08.534974Z"},"links":{"citing_paper":"/paper/2506.00993"},"observation_digest":"sha256:939a24c0dfff36210089f33bd692fbc093e4d58b27afadaf76e835b42ce609df","observation_id":"1367ce42-ec36-4505-b7ec-4aae10fc5a3b","resolution":{"observed_at":"2026-08-07T11:59:12.397566Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:59:08.752562Z","title":"The proof and measurement of association between two things","venue":null,"work_id":null,"year":1961},"citing_paper":{"arxiv_id":"2506.00993","last_updated":"2025-06-01T12:49:39Z","snapshot_observed_at":"2026-08-08T18:44:33.509277Z","submitted_at":"2025-06-01T12:49:39Z","title":"FlexSelect: Flexible Token Selection for Efficient Long Video Understanding","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T11:59:08.752562Z"},"links":{"citing_paper":"/paper/2506.00993"},"observation_digest":"sha256:e98d26e5be19e4fb23d0392b6e8c5cd55f72933b0fd63eedc6dc059281a9b5ba","observation_id":"ac8e8494-8784-4eee-8003-c3e14569b47c","resolution":{"observed_at":"2026-08-07T11:59:08.752562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:59:12.199568Z","title":"Dycoke: Dynamic compression of tokens for fast video large language models, 2025","venue":null,"work_id":"d0883e1a-7d14-4a0b-bb31-015e3ed08f0d","year":2025},"citing_paper":{"arxiv_id":"2506.00993","last_updated":"2025-06-01T12:49:39Z","snapshot_observed_at":"2026-08-08T18:44:33.509277Z","submitted_at":"2025-06-01T12:49:39Z","title":"FlexSelect: Flexible Token Selection for Efficient Long Video Understanding","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T11:59:08.868437Z"},"links":{"citing_paper":"/paper/2506.00993"},"observation_digest":"sha256:4300dc6307f403e1576782496f85e14c9747753a3ef8403558a7624fb274f34a","observation_id":"44971cd9-b215-45e0-bfe9-0d8d6dc5fc3c","resolution":{"observed_at":"2026-08-07T11:59:12.268873Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14485","last_updated":"2024-12-10T12:45:31Z","snapshot_observed_at":"2026-07-06T19:19:28.953455Z","submitted_at":"2024-09-22T15:13:31Z","title":"Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.14485","snapshot_observed_at":"2026-08-07T11:59:08.637236Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.00993","last_updated":"2025-06-01T12:49:39Z","snapshot_observed_at":"2026-08-08T18:44:33.509277Z","submitted_at":"2025-06-01T12:49:39Z","title":"FlexSelect: Flexible Token Selection for Efficient Long Video Understanding","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T11:59:08.637236Z"},"links":{"cited_paper":"/paper/2409.14485","citing_paper":"/paper/2506.00993"},"observation_digest":"sha256:73c4e6caab121d9d9fedc05cf61482703aa68f5f4de1600e2eface77f2c2a84a","observation_id":"358355fd-9998-444c-aae7-b87c1418de3a","resolution":{"observed_at":"2026-08-07T11:59:08.637236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T11:59:09.068469Z","title":"Qwen2.5 technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00993","last_updated":"2025-06-01T12:49:39Z","snapshot_observed_at":"2026-08-08T18:44:33.509277Z","submitted_at":"2025-06-01T12:49:39Z","title":"FlexSelect: Flexible Token Selection for Efficient Long Video Understanding","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T11:59:09.068469Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2506.00993"},"observation_digest":"sha256:c36b732fc26d83b5fb956ef8346d8bf5013d3900d912df23a279bd03c2e21256","observation_id":"f1b035eb-1fbc-4349-8fb3-6a2e48470e27","resolution":{"observed_at":"2026-08-07T11:59:09.068469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-07T11:59:09.173823Z","title":"Qwen2-vl: Enhancing vision- language model’s perception of the world at any resolution, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00993","last_updated":"2025-06-01T12:49:39Z","snapshot_observed_at":"2026-08-08T18:44:33.509277Z","submitted_at":"2025-06-01T12:49:39Z","title":"FlexSelect: Flexible Token Selection for Efficient Long Video Understanding","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T11:59:09.173823Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2506.00993"},"observation_digest":"sha256:2e9be4f6fc36fa40543cf6570668975439bd3d2ba6d00b5e07069aa762f86560","observation_id":"5ee70352-c5af-403b-9cb6-f1beddcc5450","resolution":{"observed_at":"2026-08-07T11:59:09.173823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-07T11:59:08.992098Z","title":"Dai, Anja Hauth, and et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00993","last_updated":"2025-06-01T12:49:39Z","snapshot_observed_at":"2026-08-08T18:44:33.509277Z","submitted_at":"2025-06-01T12:49:39Z","title":"FlexSelect: Flexible Token Selection for Efficient Long Video Understanding","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T11:59:08.992098Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2506.00993"},"observation_digest":"sha256:b49259d226c8bc574ac265fd6bb44baa46b6ef947793dde1ed99dc6f6d565ed8","observation_id":"8e3b39db-a13d-4434-9faa-b797beceb8ab","resolution":{"observed_at":"2026-08-07T11:59:08.992098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12559","last_updated":"2025-06-08T05:57:12Z","snapshot_observed_at":"2026-08-07T17:00:27.328884Z","submitted_at":"2025-03-16T16:14:52Z","title":"AdaReTaKe: Adaptive Redundancy Reduction to Perceive Longer for Video-language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.12559","snapshot_observed_at":"2026-08-07T11:59:09.407693Z","title":"Adaretake: Adaptive redundancy reduction to perceive longer for video-language understanding, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00993","last_updated":"2025-06-01T12:49:39Z","snapshot_observed_at":"2026-08-08T18:44:33.509277Z","submitted_at":"2025-06-01T12:49:39Z","title":"FlexSelect: Flexible Token Selection for Efficient Long Video Understanding","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T11:59:09.407693Z"},"links":{"cited_paper":"/paper/2503.12559","citing_paper":"/paper/2506.00993"},"observation_digest":"sha256:4fc9b7eae6fa97ea096ca8c9fbb608df8eb01e8092860a14e72bc944c2bf618e","observation_id":"59d56e0e-84dd-4318-9897-74785c7466c4","resolution":{"observed_at":"2026-08-07T11:59:09.407693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11494","last_updated":"2025-06-08T08:35:58Z","snapshot_observed_at":"2026-08-08T00:45:20.646947Z","submitted_at":"2025-02-17T06:56:28Z","title":"Stop Looking for Important Tokens in Multimodal Language Models: Duplication Matters More","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11494","snapshot_observed_at":"2026-08-07T11:59:09.565561Z","title":"Stop looking for important tokens in multimodal language models: Duplication matters more, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00993","last_updated":"2025-06-01T12:49:39Z","snapshot_observed_at":"2026-08-08T18:44:33.509277Z","submitted_at":"2025-06-01T12:49:39Z","title":"FlexSelect: Flexible Token Selection for Efficient Long Video Understanding","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T11:59:09.565561Z"},"links":{"cited_paper":"/paper/2502.11494","citing_paper":"/paper/2506.00993"},"observation_digest":"sha256:450d935c860c6055dd6ca326fa75b49ee22f2b78f0fbe6580bf55563d1fa4183","observation_id":"f35f5d8d-1efb-41e6-96bd-6b0121220b77","resolution":{"observed_at":"2026-08-07T11:59:09.565561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08035","last_updated":"2025-08-09T10:54:59Z","snapshot_observed_at":"2026-08-08T19:38:26.415599Z","submitted_at":"2024-06-12T09:36:52Z","title":"LVBench: An Extreme Long Video Understanding Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08035","snapshot_observed_at":"2026-08-07T11:59:09.320069Z","title":"Lvbench: An extreme long video understanding benchmark, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00993","last_updated":"2025-06-01T12:49:39Z","snapshot_observed_at":"2026-08-08T18:44:33.509277Z","submitted_at":"2025-06-01T12:49:39Z","title":"FlexSelect: Flexible Token Selection for Efficient Long Video Understanding","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T11:59:09.320069Z"},"links":{"cited_paper":"/paper/2406.08035","citing_paper":"/paper/2506.00993"},"observation_digest":"sha256:cd3a7b92b3d364809961da1b2f017ac413d8035c1415f874652d876f4cd9f491","observation_id":"85466586-ec1c-4645-8ef9-f0792b8a866d","resolution":{"observed_at":"2026-08-07T11:59:09.320069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17247","last_updated":"2025-02-27T11:16:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-22T17:59:53Z","title":"PyramidDrop: Accelerating Your Large Vision-Language Models via Pyramid Visual Redundancy Reduction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17247","snapshot_observed_at":"2026-08-07T11:59:09.820042Z","title":"Pyramiddrop: Accelerating your large vision-language models via pyramid visual redundancy reduction, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00993","last_updated":"2025-06-01T12:49:39Z","snapshot_observed_at":"2026-08-08T18:44:33.509277Z","submitted_at":"2025-06-01T12:49:39Z","title":"FlexSelect: Flexible Token Selection for Efficient Long Video Understanding","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T11:59:09.820042Z"},"links":{"cited_paper":"/paper/2410.17247","citing_paper":"/paper/2506.00993"},"observation_digest":"sha256:fd54d8dcc1b0df11353fce91fda2f8f8234f20e806311f728517e57703021c5a","observation_id":"03995c8e-38cc-42d9-8556-b7994c2b04e9","resolution":{"observed_at":"2026-08-07T11:59:09.820042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18943","last_updated":"2025-03-27T17:34:06Z","snapshot_observed_at":"2026-08-07T16:40:26.625260Z","submitted_at":"2025-03-24T17:59:07Z","title":"SlowFast-LLaVA-1.5: A Family of Token-Efficient Video Large Language Models for Long-Form Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.18943","snapshot_observed_at":"2026-08-07T11:59:09.935958Z","title":"Slowfast-llava-1.5: A family of token-efficient video large language models for long-form video understanding, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00993","last_updated":"2025-06-01T12:49:39Z","snapshot_observed_at":"2026-08-08T18:44:33.509277Z","submitted_at":"2025-06-01T12:49:39Z","title":"FlexSelect: Flexible Token Selection for Efficient Long Video Understanding","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T11:59:09.935958Z"},"links":{"cited_paper":"/paper/2503.18943","citing_paper":"/paper/2506.00993"},"observation_digest":"sha256:1088e904c96c83682c7389344fb807627e01442a824115d14a71ecc6bd4287ad","observation_id":"fdd0506c-935c-43ec-b472-bfb3ddaf2094","resolution":{"observed_at":"2026-08-07T11:59:09.935958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15754","last_updated":"2024-07-22T16:00:55Z","snapshot_observed_at":"2026-08-06T14:12:05.548569Z","submitted_at":"2024-07-22T16:00:55Z","title":"LongVideoBench: A Benchmark for Long-context Interleaved Video-Language Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15754","snapshot_observed_at":"2026-08-07T11:59:09.727032Z","title":"Longvideobench: A benchmark for long- context interleaved video-language understanding, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00993","last_updated":"2025-06-01T12:49:39Z","snapshot_observed_at":"2026-08-08T18:44:33.509277Z","submitted_at":"2025-06-01T12:49:39Z","title":"FlexSelect: Flexible Token Selection for Efficient Long Video Understanding","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T11:59:09.727032Z"},"links":{"cited_paper":"/paper/2407.15754","citing_paper":"/paper/2506.00993"},"observation_digest":"sha256:de20268ec46a56727cbc5d3f4ee812c00be0be44f6b3c387ef949403ea7ca519","observation_id":"07b2a234-bd0f-4ea4-832d-8429a0bf96d2","resolution":{"observed_at":"2026-08-07T11:59:09.727032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13106","last_updated":"2025-06-03T03:33:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T18:59:46Z","title":"VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13106","snapshot_observed_at":"2026-08-07T11:59:10.291998Z","title":"Videollama 3: Frontier multimodal foundation models for image and video understanding, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00993","last_updated":"2025-06-01T12:49:39Z","snapshot_observed_at":"2026-08-08T18:44:33.509277Z","submitted_at":"2025-06-01T12:49:39Z","title":"FlexSelect: Flexible Token Selection for Efficient Long Video Understanding","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T11:59:10.291998Z"},"links":{"cited_paper":"/paper/2501.13106","citing_paper":"/paper/2506.00993"},"observation_digest":"sha256:19b05a7a99e41e180002da2a6b9e2763f1db86fc7200c45bf144fdaa560d172e","observation_id":"98b0f7b4-8bb5-4331-ba7a-d661b7b8ed23","resolution":{"observed_at":"2026-08-07T11:59:10.291998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04840","last_updated":"2024-08-13T08:10:32Z","snapshot_observed_at":"2026-07-06T18:58:39.334273Z","submitted_at":"2024-08-09T03:25:42Z","title":"mPLUG-Owl3: Towards Long Image-Sequence Understanding in Multi-Modal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04840","snapshot_observed_at":"2026-08-07T11:59:10.075062Z","title":"mplug-owl3: Towards long image-sequence understanding in multi-modal large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00993","last_updated":"2025-06-01T12:49:39Z","snapshot_observed_at":"2026-08-08T18:44:33.509277Z","submitted_at":"2025-06-01T12:49:39Z","title":"FlexSelect: Flexible Token Selection for Efficient Long Video Understanding","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T11:59:10.075062Z"},"links":{"cited_paper":"/paper/2408.04840","citing_paper":"/paper/2506.00993"},"observation_digest":"sha256:0d0ffdfd61c8b8b6548f34864939312d01dbdf4aa605d1d0cdb8f8cb33cc0b78","observation_id":"317dbfad-ce0d-4ebf-b807-df11483ea597","resolution":{"observed_at":"2026-08-07T11:59:10.075062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:59:11.985258Z","title":"Long context transfer from language to vision,","venue":null,"work_id":"108e1984-946d-45e2-a744-7c4b52a3189b","year":null},"citing_paper":{"arxiv_id":"2506.00993","last_updated":"2025-06-01T12:49:39Z","snapshot_observed_at":"2026-08-08T18:44:33.509277Z","submitted_at":"2025-06-01T12:49:39Z","title":"FlexSelect: Flexible Token Selection for Efficient Long Video Understanding","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T11:59:10.503442Z"},"links":{"citing_paper":"/paper/2506.00993"},"observation_digest":"sha256:f74df6e5c1ecb06cd2cc66de6199afb330042385582e6f021317a4921b3c7751","observation_id":"b56cbe40-4a7d-4461-89f2-913ff3f5f7bc","resolution":{"observed_at":"2026-08-07T11:59:12.081596Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01818","last_updated":"2025-05-11T17:45:02Z","snapshot_observed_at":"2026-08-08T00:45:04.947316Z","submitted_at":"2024-12-02T18:57:40Z","title":"Beyond Text-Visual Attention: Exploiting Visual Cues for Effective Token Pruning in VLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01818","snapshot_observed_at":"2026-08-07T11:59:10.721952Z","title":"[cls] attention is all you need for training-free visual token pruning: Make vlm inference faster, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00993","last_updated":"2025-06-01T12:49:39Z","snapshot_observed_at":"2026-08-08T18:44:33.509277Z","submitted_at":"2025-06-01T12:49:39Z","title":"FlexSelect: Flexible Token Selection for Efficient Long Video Understanding","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T11:59:10.721952Z"},"links":{"cited_paper":"/paper/2412.01818","citing_paper":"/paper/2506.00993"},"observation_digest":"sha256:d3c3433b8fa13ab06e89e19277d6997141bcc4f646773b90c7ba3314d81752ca","observation_id":"dfa4e81f-0ea0-49af-aad9-41a331e93e78","resolution":{"observed_at":"2026-08-07T11:59:10.721952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12772","snapshot_observed_at":"2026-08-07T11:59:10.390042Z","title":"Lmms-eval: Reality check on the evaluation of large multimodal models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00993","last_updated":"2025-06-01T12:49:39Z","snapshot_observed_at":"2026-08-08T18:44:33.509277Z","submitted_at":"2025-06-01T12:49:39Z","title":"FlexSelect: Flexible Token Selection for Efficient Long Video Understanding","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T11:59:10.390042Z"},"links":{"cited_paper":"/paper/2407.12772","citing_paper":"/paper/2506.00993"},"observation_digest":"sha256:3da2bdca981f8b01d7fc563889bf01c4196535335b1fcf3acb8b3c01849956ba","observation_id":"8826dfff-bcbe-4a51-859c-962a6a42fd2b","resolution":{"observed_at":"2026-08-07T11:59:10.390042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04417","snapshot_observed_at":"2026-08-07T11:59:10.962445Z","title":"Sparsevlm: Visual token sparsification for efficient vision-language model inference, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00993","last_updated":"2025-06-01T12:49:39Z","snapshot_observed_at":"2026-08-08T18:44:33.509277Z","submitted_at":"2025-06-01T12:49:39Z","title":"FlexSelect: Flexible Token Selection for Efficient Long Video Understanding","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T11:59:10.962445Z"},"links":{"cited_paper":"/paper/2410.04417","citing_paper":"/paper/2506.00993"},"observation_digest":"sha256:b12c7b2a091f1616a525a1c483d19a64c9e4396049c4ccb04df19a2b10146e00","observation_id":"947f0de2-438a-4d18-be4e-eb00dfad343f","resolution":{"observed_at":"2026-08-07T11:59:10.962445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-07T11:59:10.606703Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.00993","last_updated":"2025-06-01T12:49:39Z","snapshot_observed_at":"2026-08-08T18:44:33.509277Z","submitted_at":"2025-06-01T12:49:39Z","title":"FlexSelect: Flexible Token Selection for Efficient Long Video Understanding","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T11:59:10.606703Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2506.00993"},"observation_digest":"sha256:fa97cbf1a3708f94ff20260ca82f2a4cd49235477d2d170bf72262c6d525368d","observation_id":"31892af6-6997-4b2c-9b72-0e9cc0709858","resolution":{"observed_at":"2026-08-07T11:59:10.606703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04264","last_updated":"2025-01-01T15:53:58Z","snapshot_observed_at":"2026-08-03T20:38:36.602554Z","submitted_at":"2024-06-06T17:09:32Z","title":"MLVU: Benchmarking Multi-task Long Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04264","snapshot_observed_at":"2026-08-07T11:59:11.232538Z","title":"Mlvu: Benchmarking multi-task long video understanding, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00993","last_updated":"2025-06-01T12:49:39Z","snapshot_observed_at":"2026-08-08T18:44:33.509277Z","submitted_at":"2025-06-01T12:49:39Z","title":"FlexSelect: Flexible Token Selection for Efficient Long Video Understanding","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T11:59:11.232538Z"},"links":{"cited_paper":"/paper/2406.04264","citing_paper":"/paper/2506.00993"},"observation_digest":"sha256:7c106066ea9b7659cfb9e2b961101b5f28fcee2ce66b33da04d605fc1b35cc4d","observation_id":"28156de9-2eef-4bfc-95fd-494707660083","resolution":{"observed_at":"2026-08-07T11:59:11.232538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03895","last_updated":"2025-03-02T15:55:07Z","snapshot_observed_at":"2026-07-06T20:17:43.203959Z","submitted_at":"2025-01-07T16:03:14Z","title":"LLaVA-Mini: Efficient Image and Video Large Multimodal Models with One Vision Token","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03895","snapshot_observed_at":"2026-08-07T11:59:10.869569Z","title":"Llava-mini: Efficient image and video large multimodal models with one vision token.arXiv preprint arXiv:2501.03895, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00993","last_updated":"2025-06-01T12:49:39Z","snapshot_observed_at":"2026-08-08T18:44:33.509277Z","submitted_at":"2025-06-01T12:49:39Z","title":"FlexSelect: Flexible Token Selection for Efficient Long Video Understanding","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T11:59:10.869569Z"},"links":{"cited_paper":"/paper/2501.03895","citing_paper":"/paper/2506.00993"},"observation_digest":"sha256:df2068ff427f28be464743505cc1aa7439503ea08d50ca03efc33452576833c1","observation_id":"cb4cd5d7-3937-4748-ae83-c7fe93378ead","resolution":{"observed_at":"2026-08-07T11:59:10.869569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-02T12:24:31.329178Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02713","snapshot_observed_at":"2026-08-07T11:59:11.136490Z","title":"Video instruction tuning with synthetic data, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00993","last_updated":"2025-06-01T12:49:39Z","snapshot_observed_at":"2026-08-08T18:44:33.509277Z","submitted_at":"2025-06-01T12:49:39Z","title":"FlexSelect: Flexible Token Selection for Efficient Long Video Understanding","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T11:59:11.136490Z"},"links":{"cited_paper":"/paper/2410.02713","citing_paper":"/paper/2506.00993"},"observation_digest":"sha256:bdd10d53518fb4c240c9aef01a47ae99828d79144f8f3dc9a41c0243362164a3","observation_id":"7f6d8b62-bb23-49b7-b3fc-4b9f9fd99e74","resolution":{"observed_at":"2026-08-07T11:59:11.136490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10360","last_updated":"2024-12-13T18:53:24Z","snapshot_observed_at":"2026-08-06T08:59:28.938249Z","submitted_at":"2024-12-13T18:53:24Z","title":"Apollo: An Exploration of Video Understanding in Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10360","snapshot_observed_at":"2026-08-07T11:59:11.354129Z","title":"Apollo: An exploration of video understanding in large multimodal models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00993","last_updated":"2025-06-01T12:49:39Z","snapshot_observed_at":"2026-08-08T18:44:33.509277Z","submitted_at":"2025-06-01T12:49:39Z","title":"FlexSelect: Flexible Token Selection for Efficient Long Video Understanding","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T11:59:11.354129Z"},"links":{"cited_paper":"/paper/2412.10360","citing_paper":"/paper/2506.00993"},"observation_digest":"sha256:ffaf46d96c552297efd5ba478ca4fb56f95424a24c600ec937af4a2532454f32","observation_id":"0ff19277-4d81-42ea-a6ca-e0b1fdb91644","resolution":{"observed_at":"2026-08-07T11:59:11.354129Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-07T11:59:07.050092Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.00993","last_updated":"2025-06-01T12:49:39Z","snapshot_observed_at":"2026-08-08T18:44:33.509277Z","submitted_at":"2025-06-01T12:49:39Z","title":"FlexSelect: Flexible Token Selection for Efficient Long Video Understanding","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T11:59:07.050092Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2506.00993"},"observation_digest":"sha256:ca1ddcb8875c8cf7e17413ee5cc1b65daa61764ca2b8b3d6c68859e6f733e2f2","observation_id":"6e10be65-1ea8-4a7a-b4ef-a848e5b51ac4","resolution":{"observed_at":"2026-08-07T11:59:07.050092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T11:59:05.425676Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.00993","last_updated":"2025-06-01T12:49:39Z","snapshot_observed_at":"2026-08-08T18:44:33.509277Z","submitted_at":"2025-06-01T12:49:39Z","title":"FlexSelect: Flexible Token Selection for Efficient Long Video Understanding","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T11:59:05.425676Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2506.00993"},"observation_digest":"sha256:85248ce143a7eac71e8e680fd44582f6066a354b16e8ce9732621d7515cc60f8","observation_id":"0add14b5-d3c4-4cbf-becc-c9a872c9f851","resolution":{"observed_at":"2026-08-07T11:59:05.425676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.00993","last_updated":"2025-06-01T12:49:39Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T18:44:33.509277Z","submitted_at":"2025-06-01T12:49:39Z","title":"FlexSelect: Flexible Token Selection for Efficient Long Video Understanding"},"reference_resolution":{"displayed":52,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":42,"verified_exact":1,"verified_fuzzy":8},"total_outbound_references":52},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 52 of 52 outbound references and 5 inbound Pith citation observations for arXiv:2506.00993."}