{"as_of":"2026-08-04T19:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fc6f9ae9eff1a76f99af088576dfede88d3b4325ca2c4f021f911eb8fca03ee2","coverage":[{"denominator":73,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":73,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-08T19:17:20.745425Z","state":"measured"},{"denominator":74,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":74,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T16:16:51.254681Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.01662","last_updated":"2026-05-03T01:30:29Z","snapshot_observed_at":"2026-07-06T23:14:52.417213Z","submitted_at":"2026-05-03T01:30:29Z","title":"Video Active Perception: Effective Inference-Time Long-Form Video Understanding with Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.01662","snapshot_observed_at":"2026-08-04T16:16:51.254681Z","title":"Ma, Willis Guo, Aditya Agrawal, Ankit Gupta, Paul Pu Liang, Ruslan Salakhutdinov, and Louis-Philippe Morency","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02039","last_updated":"2026-08-03T10:34:42Z","snapshot_observed_at":"2026-08-04T19:31:32.761948Z","submitted_at":"2026-08-03T10:34:42Z","title":"RSVideo: Are Your Vision-Language Models Ready for Remote Sensing Videos?","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T16:16:51.254681Z"},"links":{"cited_paper":"/paper/2605.01662","citing_paper":"/paper/2608.02039"},"observation_digest":"sha256:d081e3e32795b306470b249ba8fc7d01662945ca4361acf859dffe3720bf3545","observation_id":"b977cab4-e1ab-4819-829d-695c14c02af6","resolution":{"observed_at":"2026-08-04T16:16:51.254681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2605.01662/citation-record","integrity":"/paper/2605.01662/integrity","json":"/paper/2605.01662/citation-record.json","paper":"/paper/2605.01662"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":"2303.08774","doi":"10.1002/tea.20265","metadata_source":"pith","pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"GPT-4 Technical Report","venue":"cs.CL","work_id":"b928e041-6991-4c08-8c81-0359e4097c7b","year":2023},"citing_paper":{"arxiv_id":"2605.01662","last_updated":"2026-05-03T01:30:29Z","snapshot_observed_at":"2026-07-06T23:14:52.417213Z","submitted_at":"2026-05-03T01:30:29Z","title":"Video Active Perception: Effective Inference-Time Long-Form Video Understanding with Vision-Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-08T19:17:20.745425Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2605.01662"},"observation_digest":"sha256:235171db0c072eee3b7f5532896a3fb262615228bd13dbd9f77f834138184a0b","observation_id":"ce2e797f-d450-4d35-94f5-cb930986bfd6","resolution":{"observed_at":"2026-05-09T05:55:31.666045Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Psychology Press","venue":null,"work_id":"78acc92b-f8d9-4738-8798-c9aa9bad913b","year":null},"citing_paper":{"arxiv_id":"2605.01662","last_updated":"2026-05-03T01:30:29Z","snapshot_observed_at":"2026-07-06T23:14:52.417213Z","submitted_at":"2026-05-03T01:30:29Z","title":"Video Active Perception: Effective Inference-Time Long-Form Video Understanding with Vision-Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-08T19:17:20.745425Z"},"links":{"citing_paper":"/paper/2605.01662"},"observation_digest":"sha256:9525551bfdda9b94b7313831d3755009686587c8c8aa56eda4436a6a39709116","observation_id":"cf96cc15-4114-47fa-a1f5-b32fa019df95","resolution":{"observed_at":"2026-05-26T03:11:36.080570Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Active perception.Proceedings of the IEEE, 76(8):966–1005","venue":null,"work_id":"7cf1e32a-ee06-40c7-a80b-55c643d5d2f4","year":1988},"citing_paper":{"arxiv_id":"2605.01662","last_updated":"2026-05-03T01:30:29Z","snapshot_observed_at":"2026-07-06T23:14:52.417213Z","submitted_at":"2026-05-03T01:30:29Z","title":"Video Active Perception: Effective Inference-Time Long-Form Video Understanding with Vision-Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-08T19:17:20.745425Z"},"links":{"citing_paper":"/paper/2605.01662"},"observation_digest":"sha256:a34f8f319ecdaa2aaddb07a9d65a8ea50fd954497df6057916a7f1b6ca3b1350","observation_id":"dd7e063a-af38-48bb-9927-890f171fb4c1","resolution":{"observed_at":"2026-05-26T03:11:36.037518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Revisiting active perception.Autonomous Robots, 42:177– 196","venue":null,"work_id":"b92fb3de-280c-4190-a3e8-e0ec46e713d1","year":2018},"citing_paper":{"arxiv_id":"2605.01662","last_updated":"2026-05-03T01:30:29Z","snapshot_observed_at":"2026-07-06T23:14:52.417213Z","submitted_at":"2026-05-03T01:30:29Z","title":"Video Active Perception: Effective Inference-Time Long-Form Video Understanding with Vision-Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-08T19:17:20.745425Z"},"links":{"citing_paper":"/paper/2605.01662"},"observation_digest":"sha256:99a3d65acedd4e4cc8e4e8b05ba50421db5ba5572585d654d9444406e3f658da","observation_id":"709ce9dd-cfc9-4231-840a-3029cb23cd1f","resolution":{"observed_at":"2026-05-26T03:11:35.960694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Activitynet: A large-scale video bench- mark for human activity understanding","venue":null,"work_id":"ac3d47e6-b7a5-4d43-979a-9bc109692c2d","year":2015},"citing_paper":{"arxiv_id":"2605.01662","last_updated":"2026-05-03T01:30:29Z","snapshot_observed_at":"2026-07-06T23:14:52.417213Z","submitted_at":"2026-05-03T01:30:29Z","title":"Video Active Perception: Effective Inference-Time Long-Form Video Understanding with Vision-Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-08T19:17:20.745425Z"},"links":{"citing_paper":"/paper/2605.01662"},"observation_digest":"sha256:c149bd47c46c4c84d62bd041392fcb6e91655967a90f0cb1b46f3321885089c5","observation_id":"d5e2eb7f-f225-4aeb-baff-79bb96e3df92","resolution":{"observed_at":"2026-05-26T03:11:36.083827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The perception-behavior expressway: Auto- maticeffectsofsocialperceptiononsocialbehavior.Advances in Experimental Social Psychology/Academic Press","venue":null,"work_id":"a5bc3763-cb55-4f4e-b617-b6d4f55d0056","year":2001},"citing_paper":{"arxiv_id":"2605.01662","last_updated":"2026-05-03T01:30:29Z","snapshot_observed_at":"2026-07-06T23:14:52.417213Z","submitted_at":"2026-05-03T01:30:29Z","title":"Video Active Perception: Effective Inference-Time Long-Form Video Understanding with Vision-Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-08T19:17:20.745425Z"},"links":{"citing_paper":"/paper/2605.01662"},"observation_digest":"sha256:41db5e643198d51fd5dbc4433994a21128a7cbcd675e2e57e399f1d0e06657b5","observation_id":"9a3f3610-568d-4b6c-b370-3290297c9f52","resolution":{"observed_at":"2026-05-26T03:11:36.071575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11481","last_updated":"2024-07-15T09:54:30Z","snapshot_observed_at":"2026-07-06T17:46:04.063798Z","submitted_at":"2024-03-18T05:07:59Z","title":"VideoAgent: A Memory-augmented Multimodal Agent for Video Understanding","version":2},"cited_work":{"arxiv_id":"2403.11481","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.11481","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Videoagent: A memory- augmented multimodal agent for video understanding","venue":null,"work_id":"c019785f-6738-417b-9505-bb2a56e5a27c","year":2024},"citing_paper":{"arxiv_id":"2605.01662","last_updated":"2026-05-03T01:30:29Z","snapshot_observed_at":"2026-07-06T23:14:52.417213Z","submitted_at":"2026-05-03T01:30:29Z","title":"Video Active Perception: Effective Inference-Time Long-Form Video Understanding with Vision-Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-08T19:17:20.745425Z"},"links":{"cited_paper":"/paper/2403.11481","citing_paper":"/paper/2605.01662"},"observation_digest":"sha256:ced99de96234081ffedde42bf3a8724f725e955198dc79d009ba390f5bb58d44","observation_id":"4c8a43a9-a33f-41e1-bdc1-6dc4586347d7","resolution":{"observed_at":"2026-05-09T05:55:31.659733Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":"2405.21075","doi":"10.1609/icwsm.v17i1.22209","metadata_source":"pith","pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","venue":"cs.CV","work_id":"77fd5ac9-ae98-4846-9d83-e9c73c8f2a52","year":2024},"citing_paper":{"arxiv_id":"2605.01662","last_updated":"2026-05-03T01:30:29Z","snapshot_observed_at":"2026-07-06T23:14:52.417213Z","submitted_at":"2026-05-03T01:30:29Z","title":"Video Active Perception: Effective Inference-Time Long-Form Video Understanding with Vision-Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-08T19:17:20.745425Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2605.01662"},"observation_digest":"sha256:474b335870b5b966fa41289704b7a80def1c5650259c0b4ccf911fc7ddfb9e3c","observation_id":"06bb5e40-0395-4daa-8df7-db205946974d","resolution":{"observed_at":"2026-05-11T01:58:42.298802Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"06aa42af-ec48-402c-8762-83f2aeb39968","year":null},"citing_paper":{"arxiv_id":"2605.01662","last_updated":"2026-05-03T01:30:29Z","snapshot_observed_at":"2026-07-06T23:14:52.417213Z","submitted_at":"2026-05-03T01:30:29Z","title":"Video Active Perception: Effective Inference-Time Long-Form Video Understanding with Vision-Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-08T19:17:20.745425Z"},"links":{"citing_paper":"/paper/2605.01662"},"observation_digest":"sha256:15194865652ce67d6a6e2cd6c236b858dcec2d6cd2df98c0be7713254c704f19","observation_id":"13146a99-53d0-40b6-8d45-5b85be2eb64f","resolution":{"observed_at":"2026-05-26T03:11:35.942275Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Video diffusion models.Advances in Neural Information Processing Systems, 35:8633–8646","venue":null,"work_id":"8e0bd3f6-c43c-4de2-afc6-5b0f17d9ea30","year":2022},"citing_paper":{"arxiv_id":"2605.01662","last_updated":"2026-05-03T01:30:29Z","snapshot_observed_at":"2026-07-06T23:14:52.417213Z","submitted_at":"2026-05-03T01:30:29Z","title":"Video Active Perception: Effective Inference-Time Long-Form Video Understanding with Vision-Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-08T19:17:20.745425Z"},"links":{"citing_paper":"/paper/2605.01662"},"observation_digest":"sha256:643d79a05374436ff5275ca6a3767985a7abd6169f583bc6ac102eb99c832939","observation_id":"1bc0fe3e-f829-48f8-b39a-2714959ba37e","resolution":{"observed_at":"2026-05-26T03:11:36.141895Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.15868","last_updated":"2022-05-29T19:02:15Z","snapshot_observed_at":"2026-07-06T13:15:58.303738Z","submitted_at":"2022-05-29T19:02:15Z","title":"CogVideo: Large-scale Pretraining for Text-to-Video Generation via Transformers","version":1},"cited_work":{"arxiv_id":"2205.15868","doi":"10.48550/arxiv.2205.15868","metadata_source":"pith","pith_arxiv_id":"2205.15868","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"CogVideo: Large-scale Pretraining for Text-to-Video Generation via Transformers","venue":"cs.CV","work_id":"2dbd6bcd-fc98-4fbf-b586-f6d94fe1abd2","year":2022},"citing_paper":{"arxiv_id":"2605.01662","last_updated":"2026-05-03T01:30:29Z","snapshot_observed_at":"2026-07-06T23:14:52.417213Z","submitted_at":"2026-05-03T01:30:29Z","title":"Video Active Perception: Effective Inference-Time Long-Form Video Understanding with Vision-Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-08T19:17:20.745425Z"},"links":{"cited_paper":"/paper/2205.15868","citing_paper":"/paper/2605.01662"},"observation_digest":"sha256:53497fa7a91cf77538e54a4b8e737207424f13ef2532e4546feaf8ff9a55324b","observation_id":"8a5109d8-fdbd-4bdb-909f-60461c6da5da","resolution":{"observed_at":"2026-05-11T12:24:30.435137Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Real-time intermediate flow estimation for video frame interpolation","venue":null,"work_id":"6866b72d-57dc-49a1-862c-ba1b363b5e69","year":2022},"citing_paper":{"arxiv_id":"2605.01662","last_updated":"2026-05-03T01:30:29Z","snapshot_observed_at":"2026-07-06T23:14:52.417213Z","submitted_at":"2026-05-03T01:30:29Z","title":"Video Active Perception: Effective Inference-Time Long-Form Video Understanding with Vision-Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-08T19:17:20.745425Z"},"links":{"citing_paper":"/paper/2605.01662"},"observation_digest":"sha256:b9ac3b8c6c76ea4e5145adfec654b47b13cc96655ebc9454f21fa7b9633d4c02","observation_id":"45567afd-c411-48d6-aafd-5be69a8bfeea","resolution":{"observed_at":"2026-05-26T03:11:35.990837Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Building a mind palace: Structuring environment- grounded semantic graphs for effective long video analysis with llms","venue":null,"work_id":"16758a8e-7d50-4a48-a72c-f1474583c0a7","year":2025},"citing_paper":{"arxiv_id":"2605.01662","last_updated":"2026-05-03T01:30:29Z","snapshot_observed_at":"2026-07-06T23:14:52.417213Z","submitted_at":"2026-05-03T01:30:29Z","title":"Video Active Perception: Effective Inference-Time Long-Form Video Understanding with Vision-Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-08T19:17:20.745425Z"},"links":{"citing_paper":"/paper/2605.01662"},"observation_digest":"sha256:1155029fc682d073cff72f8160f27cf4611c0403695dd870b8f0dce93a877273","observation_id":"a8868eec-f52f-467c-b308-bbfa81ddf0bc","resolution":{"observed_at":"2026-05-26T03:11:36.032537Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Adaptivevideounderstanding agent: Enhancing efficiency with dynamic frame sampling and feedback-driven reasoning","venue":null,"work_id":"1bfee267-fb9b-48eb-aa5c-4d1d97a9ba64","year":2024},"citing_paper":{"arxiv_id":"2605.01662","last_updated":"2026-05-03T01:30:29Z","snapshot_observed_at":"2026-07-06T23:14:52.417213Z","submitted_at":"2026-05-03T01:30:29Z","title":"Video Active Perception: Effective Inference-Time Long-Form Video Understanding with Vision-Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-08T19:17:20.745425Z"},"links":{"citing_paper":"/paper/2605.01662"},"observation_digest":"sha256:2d44bc61ba6c4736eb9bc655b5169d240dd9ce103831e903e4277b178dbf5ae0","observation_id":"9b2f6a14-ebc1-4b1a-b8c5-7995a2857a84","resolution":{"observed_at":"2026-05-26T03:11:36.046062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cost-sensitive feature acquisi- tionandclassification.PatternRecognition,40(5):1474–1485","venue":null,"work_id":"b2d7c86c-a025-4bc5-a944-cbc991933d9a","year":null},"citing_paper":{"arxiv_id":"2605.01662","last_updated":"2026-05-03T01:30:29Z","snapshot_observed_at":"2026-07-06T23:14:52.417213Z","submitted_at":"2026-05-03T01:30:29Z","title":"Video Active Perception: Effective Inference-Time Long-Form Video Understanding with Vision-Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-08T19:17:20.745425Z"},"links":{"citing_paper":"/paper/2605.01662"},"observation_digest":"sha256:09662985ecee9f0c084ef8c75f15952d3f4f93d5396cf5604c1dffa10d382343","observation_id":"5d7fa9f5-5917-45cc-af1b-e1899bf07194","resolution":{"observed_at":"2026-05-26T03:11:35.917041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Egoschema leaderboard.Kaggle Leaderboard","venue":null,"work_id":"e5189f70-8c4c-410f-948e-459690bb33a2","year":2024},"citing_paper":{"arxiv_id":"2605.01662","last_updated":"2026-05-03T01:30:29Z","snapshot_observed_at":"2026-07-06T23:14:52.417213Z","submitted_at":"2026-05-03T01:30:29Z","title":"Video Active Perception: Effective Inference-Time Long-Form Video Understanding with Vision-Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-08T19:17:20.745425Z"},"links":{"citing_paper":"/paper/2605.01662"},"observation_digest":"sha256:e1bd04af024979cbc205112929bf6db93cffd75dbb52eb57c4f3fe7141ae35c1","observation_id":"0d7fc838-0364-463c-8dcd-219658f94108","resolution":{"observed_at":"2026-05-26T03:11:36.067395Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.18406","last_updated":"2024-03-27T09:48:23Z","snapshot_observed_at":"2026-07-06T17:51:48.378864Z","submitted_at":"2024-03-27T09:48:23Z","title":"An Image Grid Can Be Worth a Video: Zero-shot Video Question Answering Using a VLM","version":1},"cited_work":{"arxiv_id":"2403.18406","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.18406","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"An image grid can be worth a video: Zero- shot video question answering using a vlm","venue":null,"work_id":"decceb39-79ff-489d-abd8-ea32453311f5","year":2024},"citing_paper":{"arxiv_id":"2605.01662","last_updated":"2026-05-03T01:30:29Z","snapshot_observed_at":"2026-07-06T23:14:52.417213Z","submitted_at":"2026-05-03T01:30:29Z","title":"Video Active Perception: Effective Inference-Time Long-Form Video Understanding with Vision-Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-08T19:17:20.745425Z"},"links":{"cited_paper":"/paper/2403.18406","citing_paper":"/paper/2605.01662"},"observation_digest":"sha256:e5d989cf33f7c31f44a06c260ff4abf0088e3b2d260a54e7cdecde3d06481392","observation_id":"71b9b300-e04e-4249-bfa0-b5a8df08b993","resolution":{"observed_at":"2026-05-09T05:55:31.716021Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.05039","last_updated":"2023-07-03T14:47:18Z","snapshot_observed_at":"2026-07-30T23:47:48.478302Z","submitted_at":"2022-11-09T17:16:36Z","title":"Active Acquisition for Multimodal Temporal Data: A Challenging Decision-Making Task","version":2},"cited_work":{"arxiv_id":"2211.05039","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2211.05039","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2211.05039 , year=","venue":null,"work_id":"adc5b49b-00e2-40cf-b159-06595bed75d1","year":2022},"citing_paper":{"arxiv_id":"2605.01662","last_updated":"2026-05-03T01:30:29Z","snapshot_observed_at":"2026-07-06T23:14:52.417213Z","submitted_at":"2026-05-03T01:30:29Z","title":"Video Active Perception: Effective Inference-Time Long-Form Video Understanding with Vision-Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-08T19:17:20.745425Z"},"links":{"cited_paper":"/paper/2211.05039","citing_paper":"/paper/2605.01662"},"observation_digest":"sha256:ab47e5089da3b0943b011e57c4e5ef34e30f70068bf7021aace8e0b2027ad815","observation_id":"9037d6a7-2e45-4b58-9f13-29c4cd34cda2","resolution":{"observed_at":"2026-05-09T05:55:31.670146Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13923","last_updated":"2023-06-24T10:07:35Z","snapshot_observed_at":"2026-07-06T15:46:13.880066Z","submitted_at":"2023-06-24T10:07:35Z","title":"Active Data Acquisition in Autonomous Driving Simulation","version":1},"cited_work":{"arxiv_id":"2306.13923","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.13923","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Active data acqui- sition in autonomous driving simulation","venue":null,"work_id":"9354616c-61ae-40c1-8e18-5153d7bc2bb7","year":2023},"citing_paper":{"arxiv_id":"2605.01662","last_updated":"2026-05-03T01:30:29Z","snapshot_observed_at":"2026-07-06T23:14:52.417213Z","submitted_at":"2026-05-03T01:30:29Z","title":"Video Active Perception: Effective Inference-Time Long-Form Video Understanding with Vision-Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-08T19:17:20.745425Z"},"links":{"cited_paper":"/paper/2306.13923","citing_paper":"/paper/2605.01662"},"observation_digest":"sha256:360c6af300a493c18f287f603c583d35600a94e36ca72e97c01418214398f66e","observation_id":"7d72b43c-e4d0-475d-9d19-20b2d94a7185","resolution":{"observed_at":"2026-05-09T05:55:31.718988Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Accurateimputationandefficientdataacquisitionwith transformer-based vaes","venue":null,"work_id":"ca26d034-0d59-441c-b508-04d630ddf976","year":2021},"citing_paper":{"arxiv_id":"2605.01662","last_updated":"2026-05-03T01:30:29Z","snapshot_observed_at":"2026-07-06T23:14:52.417213Z","submitted_at":"2026-05-03T01:30:29Z","title":"Video Active Perception: Effective Inference-Time Long-Form Video Understanding with Vision-Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-08T19:17:20.745425Z"},"links":{"citing_paper":"/paper/2605.01662"},"observation_digest":"sha256:06648033184b09f9135cad2827085d607bf8a9606fa6dffeace94700916977a4","observation_id":"b58129b5-a744-45f4-a04a-d389436fbe33","resolution":{"observed_at":"2026-05-26T03:11:35.964705Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lmms-eval: Accelerating the development of large multimoal models","venue":null,"work_id":"45f5af99-c42d-4560-9ddc-034c72cb30b8","year":2024},"citing_paper":{"arxiv_id":"2605.01662","last_updated":"2026-05-03T01:30:29Z","snapshot_observed_at":"2026-07-06T23:14:52.417213Z","submitted_at":"2026-05-03T01:30:29Z","title":"Video Active Perception: Effective Inference-Time Long-Form Video Understanding with Vision-Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-08T19:17:20.745425Z"},"links":{"citing_paper":"/paper/2605.01662"},"observation_digest":"sha256:d0fcceb225e784a450c6036efe507650b2a222aa0084a91a2347fb595ca6d481","observation_id":"e0ceafe7-78bc-42a5-8464-a0a72126412a","resolution":{"observed_at":"2026-05-26T03:11:36.117369Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":"2408.03326","doi":"10.48550/arxiv.2408.03326","metadata_source":"pith","pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-07-10T13:27:05.574543Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","venue":"cs.CV","work_id":"f5f2452b-f2a9-49ac-b38d-c76e18cdfe49","year":2024},"citing_paper":{"arxiv_id":"2605.01662","last_updated":"2026-05-03T01:30:29Z","snapshot_observed_at":"2026-07-06T23:14:52.417213Z","submitted_at":"2026-05-03T01:30:29Z","title":"Video Active Perception: Effective Inference-Time Long-Form Video Understanding with Vision-Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-08T19:17:20.745425Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2605.01662"},"observation_digest":"sha256:00bcbe07db32a6ae1111b97e61079869c73585473c46d39282b73a02be653898","observation_id":"075bbe11-cfd6-45f2-8a1e-3aad7457b462","resolution":{"observed_at":"2026-05-09T05:55:31.663235Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Intentqa: Context-aware video intent reasoning","venue":null,"work_id":"50fbe627-f018-476c-a78a-3760f8297a71","year":2023},"citing_paper":{"arxiv_id":"2605.01662","last_updated":"2026-05-03T01:30:29Z","snapshot_observed_at":"2026-07-06T23:14:52.417213Z","submitted_at":"2026-05-03T01:30:29Z","title":"Video Active Perception: Effective Inference-Time Long-Form Video Understanding with Vision-Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-08T19:17:20.745425Z"},"links":{"citing_paper":"/paper/2605.01662"},"observation_digest":"sha256:18f419fd7292504388a8e3fb2061f36098b5e8b62488b91adfe49ccdefbe1c57","observation_id":"14800086-7ba6-4d6b-bcfb-7a988035f45e","resolution":{"observed_at":"2026-05-26T03:11:36.003594Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mvbench: Acomprehensivemulti-modalvideounderstanding benchmark","venue":null,"work_id":"3fefb969-867c-4a58-8bfc-2994bb170c2d","year":2024},"citing_paper":{"arxiv_id":"2605.01662","last_updated":"2026-05-03T01:30:29Z","snapshot_observed_at":"2026-07-06T23:14:52.417213Z","submitted_at":"2026-05-03T01:30:29Z","title":"Video Active Perception: Effective Inference-Time Long-Form Video Understanding with Vision-Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-08T19:17:20.745425Z"},"links":{"citing_paper":"/paper/2605.01662"},"observation_digest":"sha256:8e39fc8c9349c69ee4fc435bd22c94a8e520fec54635f77d6ea16009291637ac","observation_id":"d28fd3c5-02a7-4686-9a77-795a12fef6aa","resolution":{"observed_at":"2026-05-26T03:11:35.938574Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Foundations & trends in multimodal machine learning: Prin- ciples, challenges, and open questions.ACM Computing Surveys, 56(10):1–42","venue":null,"work_id":"f103351d-de75-430e-9df0-902ef5f0e0d3","year":2024},"citing_paper":{"arxiv_id":"2605.01662","last_updated":"2026-05-03T01:30:29Z","snapshot_observed_at":"2026-07-06T23:14:52.417213Z","submitted_at":"2026-05-03T01:30:29Z","title":"Video Active Perception: Effective Inference-Time Long-Form Video Understanding with Vision-Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-08T19:17:20.745425Z"},"links":{"citing_paper":"/paper/2605.01662"},"observation_digest":"sha256:bfac98fdec540677351465a9b9a6a674b18bafb2be3e9b548d4d2839a4f987e9","observation_id":"f5d3bc76-2c7a-4f85-a395-2d6392101f73","resolution":{"observed_at":"2026-05-26T03:11:36.076925Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Videoinsta: Zero-shot long video understanding via informative spatial- temporal reasoning with llms","venue":null,"work_id":"0c945fb9-d94a-4518-9ac6-ea4ac773a4ae","year":2024},"citing_paper":{"arxiv_id":"2605.01662","last_updated":"2026-05-03T01:30:29Z","snapshot_observed_at":"2026-07-06T23:14:52.417213Z","submitted_at":"2026-05-03T01:30:29Z","title":"Video Active Perception: Effective Inference-Time Long-Form Video Understanding with Vision-Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-08T19:17:20.745425Z"},"links":{"citing_paper":"/paper/2605.01662"},"observation_digest":"sha256:ee78ee4e1b1cddc3523914c2179cca0dfd7181c36e17bf724de00b0a12a61ec7","observation_id":"918d1069-ca0e-42e7-8737-9b6fb13fc9c0","resolution":{"observed_at":"2026-05-26T03:11:35.950383Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Video-rag: Visually-aligned retrieval-augmented long video comprehension","venue":null,"work_id":"60609efc-acb4-4d1a-a695-3386c6fcd304","year":2024},"citing_paper":{"arxiv_id":"2605.01662","last_updated":"2026-05-03T01:30:29Z","snapshot_observed_at":"2026-07-06T23:14:52.417213Z","submitted_at":"2026-05-03T01:30:29Z","title":"Video Active Perception: Effective Inference-Time Long-Form Video Understanding with Vision-Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-08T19:17:20.745425Z"},"links":{"citing_paper":"/paper/2605.01662"},"observation_digest":"sha256:a02154ed87825df25845a1f63cac7f2929ce9d23afa6626b0bac0f5132c2e7a9","observation_id":"2744caf3-5bfd-4538-841a-9d57203b1203","resolution":{"observed_at":"2026-05-26T03:11:36.092283Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Drvideo: Document retrieval based long video understanding","venue":null,"work_id":"301e313f-c3b7-44c4-ba5c-f44f5fdf585b","year":2024},"citing_paper":{"arxiv_id":"2605.01662","last_updated":"2026-05-03T01:30:29Z","snapshot_observed_at":"2026-07-06T23:14:52.417213Z","submitted_at":"2026-05-03T01:30:29Z","title":"Video Active Perception: Effective Inference-Time Long-Form Video Understanding with Vision-Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-08T19:17:20.745425Z"},"links":{"citing_paper":"/paper/2605.01662"},"observation_digest":"sha256:c3bee68d4bc843ba9760ee54d23b9ecba05195624a0832815d0387f3475ffb12","observation_id":"9f332021-f86c-44eb-933a-166e2130c0ff","resolution":{"observed_at":"2026-05-26T03:11:35.946090Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05424","last_updated":"2024-06-10T01:36:53Z","snapshot_observed_at":"2026-07-06T15:40:24.127663Z","submitted_at":"2023-06-08T17:59:56Z","title":"Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models","version":2},"cited_work":{"arxiv_id":"2306.05424","doi":"10.48550/arxiv.2306.05424","metadata_source":"pith","pith_arxiv_id":"2306.05424","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models","venue":"cs.CV","work_id":"51f627f4-8fae-4882-a3e9-abdf932ef27b","year":2023},"citing_paper":{"arxiv_id":"2605.01662","last_updated":"2026-05-03T01:30:29Z","snapshot_observed_at":"2026-07-06T23:14:52.417213Z","submitted_at":"2026-05-03T01:30:29Z","title":"Video Active Perception: Effective Inference-Time Long-Form Video Understanding with Vision-Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-08T19:17:20.745425Z"},"links":{"cited_paper":"/paper/2306.05424","citing_paper":"/paper/2605.01662"},"observation_digest":"sha256:a454ea7a81b8538bbc042a4950e0973a279c1b910e09a29522eb27efac627206","observation_id":"347b50f8-096c-4186-bdad-cf71a0de69e1","resolution":{"observed_at":"2026-05-15T03:36:18.685087Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Egoschema: A diagnostic benchmark for very long- form video language understanding.Advances in Neural Information Processing Systems, 36","venue":null,"work_id":"0c79365e-0aa9-4081-a420-d79563e2946c","year":2024},"citing_paper":{"arxiv_id":"2605.01662","last_updated":"2026-05-03T01:30:29Z","snapshot_observed_at":"2026-07-06T23:14:52.417213Z","submitted_at":"2026-05-03T01:30:29Z","title":"Video Active Perception: Effective Inference-Time Long-Form Video Understanding with Vision-Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-08T19:17:20.745425Z"},"links":{"citing_paper":"/paper/2605.01662"},"observation_digest":"sha256:fa6e71611386ecbef571144a62e21a2d7c8b744ad47a3733231aae5ffb1766e1","observation_id":"ee9374e1-f65d-4d21-80a6-25b3a9ee1123","resolution":{"observed_at":"2026-05-26T03:11:36.058546Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"98e8a9a1-f1ba-4510-a1bf-90db84437d49","year":null},"citing_paper":{"arxiv_id":"2605.01662","last_updated":"2026-05-03T01:30:29Z","snapshot_observed_at":"2026-07-06T23:14:52.417213Z","submitted_at":"2026-05-03T01:30:29Z","title":"Video Active Perception: Effective Inference-Time Long-Form Video Understanding with Vision-Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-08T19:17:20.745425Z"},"links":{"citing_paper":"/paper/2605.01662"},"observation_digest":"sha256:b52d9368fa2817ae7892c9ba5eabc39c3ebf4a0d53c1f5951b38bde9eef28559","observation_id":"0d5845ac-fee2-461b-ac51-b1e55371dbd6","resolution":{"observed_at":"2026-05-26T03:11:35.981872Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Morevqa: Exploring modular reasoning models for video question answering","venue":null,"work_id":"35c54591-4f3d-4a70-b619-78cd02f2b2f0","year":2024},"citing_paper":{"arxiv_id":"2605.01662","last_updated":"2026-05-03T01:30:29Z","snapshot_observed_at":"2026-07-06T23:14:52.417213Z","submitted_at":"2026-05-03T01:30:29Z","title":"Video Active Perception: Effective Inference-Time Long-Form Video Understanding with Vision-Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-08T19:17:20.745425Z"},"links":{"citing_paper":"/paper/2605.01662"},"observation_digest":"sha256:401130b8d8b25ce260f40392f747c1c10ca8f734128949a49a5bafe1717dfd3b","observation_id":"ff96e788-ecd0-420a-a400-de6a8e9219bb","resolution":{"observed_at":"2026-05-26T03:11:36.054444Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gpt-4o blog: Hello gpt-4o","venue":null,"work_id":"42ff7d8c-41bd-4c64-a01f-0538226da428","year":2024},"citing_paper":{"arxiv_id":"2605.01662","last_updated":"2026-05-03T01:30:29Z","snapshot_observed_at":"2026-07-06T23:14:52.417213Z","submitted_at":"2026-05-03T01:30:29Z","title":"Video Active Perception: Effective Inference-Time Long-Form Video Understanding with Vision-Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-08T19:17:20.745425Z"},"links":{"citing_paper":"/paper/2605.01662"},"observation_digest":"sha256:b484855b290036823b1c60151c2ed13820f2f2105992525f1670d0f5ae6d5905","observation_id":"cf4c8499-f989-4bec-b0d6-6c90de6f7152","resolution":{"observed_at":"2026-05-26T03:11:36.012441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2406.09396","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T12:46:56.885070Z","title":"Too many frames, not all useful: Efficient strategies for long-form video qa","venue":null,"work_id":"da9bcc3b-3d6d-4d40-9327-180f8aaa0972","year":2024},"citing_paper":{"arxiv_id":"2605.01662","last_updated":"2026-05-03T01:30:29Z","snapshot_observed_at":"2026-07-06T23:14:52.417213Z","submitted_at":"2026-05-03T01:30:29Z","title":"Video Active Perception: Effective Inference-Time Long-Form Video Understanding with Vision-Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-08T19:17:20.745425Z"},"links":{"citing_paper":"/paper/2605.01662"},"observation_digest":"sha256:855d085fc0f3e6a8f8b988c8b12ba8dc0be1729909f5b441c7863bd6f5925bc3","observation_id":"50b021f1-5f33-43a3-ae69-91eb1321c503","resolution":{"observed_at":"2026-05-09T05:55:31.736782Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":"c04a8d5a-c07d-48e9-b74b-78cfc8e16f32","year":null},"citing_paper":{"arxiv_id":"2605.01662","last_updated":"2026-05-03T01:30:29Z","snapshot_observed_at":"2026-07-06T23:14:52.417213Z","submitted_at":"2026-05-03T01:30:29Z","title":"Video Active Perception: Effective Inference-Time Long-Form Video Understanding with Vision-Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-08T19:17:20.745425Z"},"links":{"citing_paper":"/paper/2605.01662"},"observation_digest":"sha256:8fafdfcfe03afc6f78033fd9dc8a0e53b1872169be8ad89a5c78cf8fe572772a","observation_id":"50fcf6c8-8ed9-4a60-a74a-026e58887ad9","resolution":{"observed_at":"2026-05-26T03:11:35.956408Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Active percep- tion: sensorimotor circuits as a cortical basis for language","venue":null,"work_id":"ff336940-7a8d-4f76-a9fb-0de5272024e3","year":2010},"citing_paper":{"arxiv_id":"2605.01662","last_updated":"2026-05-03T01:30:29Z","snapshot_observed_at":"2026-07-06T23:14:52.417213Z","submitted_at":"2026-05-03T01:30:29Z","title":"Video Active Perception: Effective Inference-Time Long-Form Video Understanding with Vision-Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-08T19:17:20.745425Z"},"links":{"citing_paper":"/paper/2605.01662"},"observation_digest":"sha256:147e9eca3543f0e95729d694040e93f24b52c64b1df9dd8aad1639e3ad583552","observation_id":"14004e7a-64c2-44c6-88eb-3c91636cf148","resolution":{"observed_at":"2026-05-26T03:11:35.973168Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer.Journal of machine learning research, 21(140):1–67","venue":null,"work_id":"1091912c-c059-49f8-a009-d26585aa00aa","year":2020},"citing_paper":{"arxiv_id":"2605.01662","last_updated":"2026-05-03T01:30:29Z","snapshot_observed_at":"2026-07-06T23:14:52.417213Z","submitted_at":"2026-05-03T01:30:29Z","title":"Video Active Perception: Effective Inference-Time Long-Form Video Understanding with Vision-Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-08T19:17:20.745425Z"},"links":{"citing_paper":"/paper/2605.01662"},"observation_digest":"sha256:5bfc95fdbf80fa00dfb69fdf72de1837ef6e119ef942ae322f1274b421c809f2","observation_id":"949a800e-5209-4b33-b563-6e0aa5f4eb68","resolution":{"observed_at":"2026-05-26T03:11:36.062882Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":"2403.05530","doi":"10.48550/arxiv.2403.05530","metadata_source":"pith","pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-07-11T03:37:46.178537Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","venue":"cs.CL","work_id":"80e3e977-f1bb-4c83-8d0c-1ab0a0c5c3f1","year":2024},"citing_paper":{"arxiv_id":"2605.01662","last_updated":"2026-05-03T01:30:29Z","snapshot_observed_at":"2026-07-06T23:14:52.417213Z","submitted_at":"2026-05-03T01:30:29Z","title":"Video Active Perception: Effective Inference-Time Long-Form Video Understanding with Vision-Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-08T19:17:20.745425Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2605.01662"},"observation_digest":"sha256:e01cb71514c17475c9ab1f09fcee56aa631507294f8514587406cba6a681b31b","observation_id":"16fce5a7-3ba6-4cd1-9247-f9ab32c70935","resolution":{"observed_at":"2026-05-10T14:35:23.646633Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-02T03:08:14.426583+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-02T03:08:14.426583+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Active feature-value acquisition.Management Science, 55(4): 664–684","venue":null,"work_id":"cbeef3b6-df5e-4aef-8e14-0988554192aa","year":2009},"citing_paper":{"arxiv_id":"2605.01662","last_updated":"2026-05-03T01:30:29Z","snapshot_observed_at":"2026-07-06T23:14:52.417213Z","submitted_at":"2026-05-03T01:30:29Z","title":"Video Active Perception: Effective Inference-Time Long-Form Video Understanding with Vision-Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-08T19:17:20.745425Z"},"links":{"citing_paper":"/paper/2605.01662"},"observation_digest":"sha256:aa02f4a5a77313aa4e47d4259e4e04489706ae4cb7d612db50b7f0e7bfa7c5fd","observation_id":"45deb8c5-0c72-44eb-b45f-dbc578ce3ed2","resolution":{"observed_at":"2026-05-26T03:11:36.088324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"An ecological approach to personality: Psycholog- ical traits as drivers and consequences of active perception","venue":null,"work_id":"f67839cd-4c5e-4d10-854d-f313ca963f3c","year":null},"citing_paper":{"arxiv_id":"2605.01662","last_updated":"2026-05-03T01:30:29Z","snapshot_observed_at":"2026-07-06T23:14:52.417213Z","submitted_at":"2026-05-03T01:30:29Z","title":"Video Active Perception: Effective Inference-Time Long-Form Video Understanding with Vision-Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-08T19:17:20.745425Z"},"links":{"citing_paper":"/paper/2605.01662"},"observation_digest":"sha256:4e071e08b60284417ed8843ac6b98329c924767f76ee057c2bc7b7f0082d57f6","observation_id":"2b954211-0a04-4145-995b-8d0b29936c70","resolution":{"observed_at":"2026-05-26T03:11:35.986520Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.04912","last_updated":"2020-05-11T08:13:49Z","snapshot_observed_at":"2026-07-06T09:19:14.291342Z","submitted_at":"2020-05-11T08:13:49Z","title":"Maximizing Information Gain in Partially Observable Environments via Prediction Reward","version":1},"cited_work":{"arxiv_id":"2005.04912","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2005.04912","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Maximizing information gain in partially observable environments via prediction reward","venue":null,"work_id":"2de0fa5f-7ea3-4c11-818a-95ccd92ee8e0","year":2005},"citing_paper":{"arxiv_id":"2605.01662","last_updated":"2026-05-03T01:30:29Z","snapshot_observed_at":"2026-07-06T23:14:52.417213Z","submitted_at":"2026-05-03T01:30:29Z","title":"Video Active Perception: Effective Inference-Time Long-Form Video Understanding with Vision-Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-08T19:17:20.745425Z"},"links":{"cited_paper":"/paper/2005.04912","citing_paper":"/paper/2605.01662"},"observation_digest":"sha256:a31eff1463c71cfccdbea4491c8483012fb91c3c2d2f8ba4099a2c584a9f83e9","observation_id":"ddd73909-1e2c-4225-a0de-19fe7adfd299","resolution":{"observed_at":"2026-05-09T05:55:31.712709Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Traveler: A modular multi-lmm agent framework for video question-answering","venue":null,"work_id":"bdad0bab-ee60-4fae-aa1e-2049b6d7f34e","year":2024},"citing_paper":{"arxiv_id":"2605.01662","last_updated":"2026-05-03T01:30:29Z","snapshot_observed_at":"2026-07-06T23:14:52.417213Z","submitted_at":"2026-05-03T01:30:29Z","title":"Video Active Perception: Effective Inference-Time Long-Form Video Understanding with Vision-Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-08T19:17:20.745425Z"},"links":{"citing_paper":"/paper/2605.01662"},"observation_digest":"sha256:adb58abe93a8cd2b5b339a4e7a65615b18000cacf52d0bee4073745e5917eb29","observation_id":"f0c0b2b5-76d3-4261-9bc9-be0d93d8cf86","resolution":{"observed_at":"2026-05-26T03:11:35.977258Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Joint active feature acquisition and classification with variable-size set encoding.Advancesinneuralinformationprocessingsystems, 31","venue":null,"work_id":"98d6b39e-8fc3-4562-b863-a0849e6dd0b8","year":2018},"citing_paper":{"arxiv_id":"2605.01662","last_updated":"2026-05-03T01:30:29Z","snapshot_observed_at":"2026-07-06T23:14:52.417213Z","submitted_at":"2026-05-03T01:30:29Z","title":"Video Active Perception: Effective Inference-Time Long-Form Video Understanding with Vision-Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-08T19:17:20.745425Z"},"links":{"citing_paper":"/paper/2605.01662"},"observation_digest":"sha256:7bbaef204bcaa37a6115bd7cf385de166823c88b71297fcf3ed021ef574cb161","observation_id":"8e21caea-f888-4a0d-8adb-79d7baf086a0","resolution":{"observed_at":"2026-05-26T03:11:36.041817Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Roformer: Enhanced transformer with rotary position embedding.Neurocomputing, 568:127063","venue":null,"work_id":"d1af47bd-dd90-4dff-826b-302fd98831d3","year":null},"citing_paper":{"arxiv_id":"2605.01662","last_updated":"2026-05-03T01:30:29Z","snapshot_observed_at":"2026-07-06T23:14:52.417213Z","submitted_at":"2026-05-03T01:30:29Z","title":"Video Active Perception: Effective Inference-Time Long-Form Video Understanding with Vision-Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-08T19:17:20.745425Z"},"links":{"citing_paper":"/paper/2605.01662"},"observation_digest":"sha256:36725636ee730c0e2dff01e91a96a47c8106cebc41934d7b4526c1b3f27b4a5d","observation_id":"aa3a7a44-82f4-4d86-bc40-dfd3cefffa77","resolution":{"observed_at":"2026-05-26T03:11:35.923878Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Stanford University","venue":null,"work_id":"e038f280-f626-44ba-9a81-9dcec2c68a61","year":1971},"citing_paper":{"arxiv_id":"2605.01662","last_updated":"2026-05-03T01:30:29Z","snapshot_observed_at":"2026-07-06T23:14:52.417213Z","submitted_at":"2026-05-03T01:30:29Z","title":"Video Active Perception: Effective Inference-Time Long-Form Video Understanding with Vision-Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-08T19:17:20.745425Z"},"links":{"citing_paper":"/paper/2605.01662"},"observation_digest":"sha256:591de079d9eccd32068aa3b46b1e10d91c099f99574c19d284d6bd9ae3719918","observation_id":"41eef350-d07b-450c-b82c-9b8e3edc65d7","resolution":{"observed_at":"2026-05-26T03:11:36.120944Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.10517","last_updated":"2024-03-15T17:57:52Z","snapshot_observed_at":"2026-07-06T17:45:23.748539Z","submitted_at":"2024-03-15T17:57:52Z","title":"VideoAgent: Long-form Video Understanding with Large Language Model as Agent","version":1},"cited_work":{"arxiv_id":"2403.10517","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.10517","snapshot_observed_at":"2026-07-04T06:39:37.670946Z","title":"Videoagent: Long-form video understand- ing with large language model as agent","venue":null,"work_id":"ac5fbfb3-2847-4398-a34b-59a13ae8a25f","year":2024},"citing_paper":{"arxiv_id":"2605.01662","last_updated":"2026-05-03T01:30:29Z","snapshot_observed_at":"2026-07-06T23:14:52.417213Z","submitted_at":"2026-05-03T01:30:29Z","title":"Video Active Perception: Effective Inference-Time Long-Form Video Understanding with Vision-Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-08T19:17:20.745425Z"},"links":{"cited_paper":"/paper/2403.10517","citing_paper":"/paper/2605.01662"},"observation_digest":"sha256:33379e214e97545d389e099cd6a734a0d062eab9c90059e0c9b43cbc0c80b8bb","observation_id":"bd15e77c-f160-475d-99b8-5cb61f3dc4b4","resolution":{"observed_at":"2026-05-09T05:55:31.693563Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19209","last_updated":"2025-03-14T13:57:16Z","snapshot_observed_at":"2026-07-06T18:22:05.757775Z","submitted_at":"2024-05-29T15:49:09Z","title":"VideoTree: Adaptive Tree-based Video Representation for LLM Reasoning on Long Videos","version":3},"cited_work":{"arxiv_id":"2405.19209","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.19209","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Videotree: Adaptive tree-based video representation for llm reasoning on long videos","venue":null,"work_id":"e68024d4-8bd3-4e50-a45b-d0d58d446dba","year":2025},"citing_paper":{"arxiv_id":"2605.01662","last_updated":"2026-05-03T01:30:29Z","snapshot_observed_at":"2026-07-06T23:14:52.417213Z","submitted_at":"2026-05-03T01:30:29Z","title":"Video Active Perception: Effective Inference-Time Long-Form Video Understanding with Vision-Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-08T19:17:20.745425Z"},"links":{"cited_paper":"/paper/2405.19209","citing_paper":"/paper/2605.01662"},"observation_digest":"sha256:d68f759ae3be6ef3d27c78b478c14a5f3657d34e2a44f1291da559e823618a0f","observation_id":"01fe7a43-bdd3-4e21-a48d-92919b0efde8","resolution":{"observed_at":"2026-05-09T05:55:31.687909Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Network mechanisms of ongoing brain activity’s influence on conscious visual perception.Nature Communications, 15(1): 5720","venue":null,"work_id":"21ddc841-94aa-47bb-81c3-516a549cdea2","year":2024},"citing_paper":{"arxiv_id":"2605.01662","last_updated":"2026-05-03T01:30:29Z","snapshot_observed_at":"2026-07-06T23:14:52.417213Z","submitted_at":"2026-05-03T01:30:29Z","title":"Video Active Perception: Effective Inference-Time Long-Form Video Understanding with Vision-Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-08T19:17:20.745425Z"},"links":{"citing_paper":"/paper/2605.01662"},"observation_digest":"sha256:e2cf97be1d1b0dcb8d09f2bbd98d1a5c767777e5ca6060174978b47ede38253c","observation_id":"89895639-7621-42d4-9830-a2cde7fdf635","resolution":{"observed_at":"2026-05-26T03:11:36.129658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Next-qa: Next phase of question-answering to explaining temporalactions","venue":null,"work_id":"e02e646e-d60a-47a9-bb6c-beae71c12217","year":null},"citing_paper":{"arxiv_id":"2605.01662","last_updated":"2026-05-03T01:30:29Z","snapshot_observed_at":"2026-07-06T23:14:52.417213Z","submitted_at":"2026-05-03T01:30:29Z","title":"Video Active Perception: Effective Inference-Time Long-Form Video Understanding with Vision-Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-08T19:17:20.745425Z"},"links":{"citing_paper":"/paper/2605.01662"},"observation_digest":"sha256:a0cc324d860cdf5c6975e83f1837e07113106ac111e667becf8752b239b5ec44","observation_id":"ceae1ef3-5e0f-4ade-bc64-11b529f55834","resolution":{"observed_at":"2026-05-26T03:11:36.097657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Slowfast-llava: A strong training-free baseline for video large language models","venue":null,"work_id":"0e9c2b36-8d88-4aaf-b3c1-8f5775d1bfb0","year":2024},"citing_paper":{"arxiv_id":"2605.01662","last_updated":"2026-05-03T01:30:29Z","snapshot_observed_at":"2026-07-06T23:14:52.417213Z","submitted_at":"2026-05-03T01:30:29Z","title":"Video Active Perception: Effective Inference-Time Long-Form Video Understanding with Vision-Language Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-08T19:17:20.745425Z"},"links":{"citing_paper":"/paper/2605.01662"},"observation_digest":"sha256:c3522b1c4e9d6a0e990c6c26b4ba158424bdd2ba69bfe215d5ec146c4d94cef0","observation_id":"526113ce-1e40-46e2-af1c-e6c8b50c2d24","resolution":{"observed_at":"2026-05-26T03:11:36.105435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Evalai: Towards better evalua- tion systems for ai agents","venue":null,"work_id":"f546caad-4d8a-4956-9a15-1b035d8e76bd","year":2019},"citing_paper":{"arxiv_id":"2605.01662","last_updated":"2026-05-03T01:30:29Z","snapshot_observed_at":"2026-07-06T23:14:52.417213Z","submitted_at":"2026-05-03T01:30:29Z","title":"Video Active Perception: Effective Inference-Time Long-Form Video Understanding with Vision-Language Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-08T19:17:20.745425Z"},"links":{"citing_paper":"/paper/2605.01662"},"observation_digest":"sha256:22a2deb6248eda3aa0abcb2c4e19789d92cae7e09763c322d42dfcc476051f70","observation_id":"3fc1a1a1-25ca-4c17-be13-44cfab9930e2","resolution":{"observed_at":"2026-05-26T03:11:36.113039Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Active sensing in the categorization of visual patterns.Elife, 5:e12215","venue":null,"work_id":"3ac85365-bc0d-4b80-b4bd-cc9f80170200","year":2016},"citing_paper":{"arxiv_id":"2605.01662","last_updated":"2026-05-03T01:30:29Z","snapshot_observed_at":"2026-07-06T23:14:52.417213Z","submitted_at":"2026-05-03T01:30:29Z","title":"Video Active Perception: Effective Inference-Time Long-Form Video Understanding with Vision-Language Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-08T19:17:20.745425Z"},"links":{"citing_paper":"/paper/2605.01662"},"observation_digest":"sha256:8e7c6b303c4f41826e0a37f0cdb55e8c116b16983fb0652671ee2cab2991c215","observation_id":"78fe61ae-b9e5-4928-b71c-7613f598bfca","resolution":{"observed_at":"2026-05-26T03:11:36.137850Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vca: Video curious agent for long video understanding","venue":null,"work_id":"3b1df866-70f4-49f1-9da9-d1821662b89d","year":2024},"citing_paper":{"arxiv_id":"2605.01662","last_updated":"2026-05-03T01:30:29Z","snapshot_observed_at":"2026-07-06T23:14:52.417213Z","submitted_at":"2026-05-03T01:30:29Z","title":"Video Active Perception: Effective Inference-Time Long-Form Video Understanding with Vision-Language Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-08T19:17:20.745425Z"},"links":{"citing_paper":"/paper/2605.01662"},"observation_digest":"sha256:02b70f1c164fae471d4a91a36b282c6d07ea4aaeac00d7b206684b7e025a9373","observation_id":"e9154b44-e78d-459e-b865-96d65919d340","resolution":{"observed_at":"2026-05-26T03:11:36.101504Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":"2408.06072","doi":"10.48550/arxiv.2408.06072","metadata_source":"pith","pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-07-11T00:07:42.878250Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","venue":"cs.CV","work_id":"f38fc088-12aa-4bf4-9ecd-08d3e797ccb7","year":2024},"citing_paper":{"arxiv_id":"2605.01662","last_updated":"2026-05-03T01:30:29Z","snapshot_observed_at":"2026-07-06T23:14:52.417213Z","submitted_at":"2026-05-03T01:30:29Z","title":"Video Active Perception: Effective Inference-Time Long-Form Video Understanding with Vision-Language Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-08T19:17:20.745425Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2605.01662"},"observation_digest":"sha256:4d74e4e7a64045cc4a9f5fdd2723c08e37b12b6528f6b053616d2d38f9b10f8c","observation_id":"d0ace8d5-ce54-4560-86bd-8b84845abce8","resolution":{"observed_at":"2026-05-10T18:26:22.534732Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01442","last_updated":"2020-03-08T00:09:07Z","snapshot_observed_at":"2026-07-06T08:26:38.349660Z","submitted_at":"2019-10-03T13:16:36Z","title":"CLEVRER: CoLlision Events for Video REpresentation and Reasoning","version":2},"cited_work":{"arxiv_id":"1910.01442","doi":"10.48550/arxiv.1910.01442","metadata_source":"pith","pith_arxiv_id":"1910.01442","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"CLEVRER: CoLlision Events for Video REpresentation and Reasoning","venue":"cs.CV","work_id":"595fdbf7-89d5-4593-8f57-24e8b469a43c","year":2019},"citing_paper":{"arxiv_id":"2605.01662","last_updated":"2026-05-03T01:30:29Z","snapshot_observed_at":"2026-07-06T23:14:52.417213Z","submitted_at":"2026-05-03T01:30:29Z","title":"Video Active Perception: Effective Inference-Time Long-Form Video Understanding with Vision-Language Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-08T19:17:20.745425Z"},"links":{"cited_paper":"/paper/1910.01442","citing_paper":"/paper/2605.01662"},"observation_digest":"sha256:67a28ef993958faa4d8aa4d90dfc0b6621e54a39967b9d35467d1577148747c0","observation_id":"69b7c51e-3217-4686-86c7-6b892ff83e4b","resolution":{"observed_at":"2026-05-16T18:01:50.618167Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-23T20:53:53.698369+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T20:53:53.698369+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.00825","last_updated":"2020-11-02T08:46:27Z","snapshot_observed_at":"2026-07-06T10:10:46.148347Z","submitted_at":"2020-11-02T08:46:27Z","title":"Reinforcement Learning with Efficient Active Feature Acquisition","version":1},"cited_work":{"arxiv_id":"2011.00825","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2011.00825","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reinforcementlearningwithefficient active feature acquisition.arXiv preprint arXiv:2011.00825","venue":null,"work_id":"97c13d56-8d2e-4b39-9aca-ad0f71bfc85e","year":2011},"citing_paper":{"arxiv_id":"2605.01662","last_updated":"2026-05-03T01:30:29Z","snapshot_observed_at":"2026-07-06T23:14:52.417213Z","submitted_at":"2026-05-03T01:30:29Z","title":"Video Active Perception: Effective Inference-Time Long-Form Video Understanding with Vision-Language Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-08T19:17:20.745425Z"},"links":{"cited_paper":"/paper/2011.00825","citing_paper":"/paper/2605.01662"},"observation_digest":"sha256:af210f23cccd1a824129fb6e4aa82ca1616c723f1f4f06bde5a0c772ddb7f4c3","observation_id":"7df06415-8597-4de5-b8da-a03ff47487a1","resolution":{"observed_at":"2026-05-09T05:55:31.684974Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":"2310.05737","doi":"10.48550/arxiv.2310.05737","metadata_source":"pith","pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","venue":"cs.CV","work_id":"c81c5be2-0655-4234-a3e9-6c32753f136b","year":2023},"citing_paper":{"arxiv_id":"2605.01662","last_updated":"2026-05-03T01:30:29Z","snapshot_observed_at":"2026-07-06T23:14:52.417213Z","submitted_at":"2026-05-03T01:30:29Z","title":"Video Active Perception: Effective Inference-Time Long-Form Video Understanding with Vision-Language Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-08T19:17:20.745425Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2605.01662"},"observation_digest":"sha256:2e0263978207fffee38ae52a8975503573d7a1e8e4ba2d68a3c8a5a6fc8f0974","observation_id":"1edb73f1-2eec-447e-914b-f89d4cf37902","resolution":{"observed_at":"2026-05-13T20:06:45.090605Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Active sensing","venue":null,"work_id":"db0a340b-44b5-43e6-b8f8-079eb1385825","year":2009},"citing_paper":{"arxiv_id":"2605.01662","last_updated":"2026-05-03T01:30:29Z","snapshot_observed_at":"2026-07-06T23:14:52.417213Z","submitted_at":"2026-05-03T01:30:29Z","title":"Video Active Perception: Effective Inference-Time Long-Form Video Understanding with Vision-Language Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-08T19:17:20.745425Z"},"links":{"citing_paper":"/paper/2605.01662"},"observation_digest":"sha256:dc49931818f4a07492d0a29bcf1159d5ad10b8cebd646d99e56540d8b805d75e","observation_id":"1065da24-55b8-496d-98b2-8391869bce17","resolution":{"observed_at":"2026-05-26T03:11:35.994976Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Activitynet-qa: A dataset for understandingcomplexwebvideosviaquestionanswering","venue":null,"work_id":"ad3a00e3-628f-402c-a9e6-3a0e15f7912e","year":2019},"citing_paper":{"arxiv_id":"2605.01662","last_updated":"2026-05-03T01:30:29Z","snapshot_observed_at":"2026-07-06T23:14:52.417213Z","submitted_at":"2026-05-03T01:30:29Z","title":"Video Active Perception: Effective Inference-Time Long-Form Video Understanding with Vision-Language Models","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-08T19:17:20.745425Z"},"links":{"citing_paper":"/paper/2605.01662"},"observation_digest":"sha256:70035d3eca1467ddbdee7a59dc8545de3e750b1d2cf30e8504c17de357d6a978","observation_id":"e1df9adc-b2d5-457f-a911-213fce65abab","resolution":{"observed_at":"2026-05-26T03:11:35.929678Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2003.06734","last_updated":"2020-03-15T01:43:51Z","snapshot_observed_at":"2026-08-03T18:11:39.400581Z","submitted_at":"2020-03-15T01:43:51Z","title":"Active Perception and Representation for Robotic Manipulation","version":1},"cited_work":{"arxiv_id":"2003.06734","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2003.06734","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Active perception and representation for robotic manipulation","venue":null,"work_id":"6ce8c2ae-2e78-4238-8c91-5c37563bfdcc","year":2003},"citing_paper":{"arxiv_id":"2605.01662","last_updated":"2026-05-03T01:30:29Z","snapshot_observed_at":"2026-07-06T23:14:52.417213Z","submitted_at":"2026-05-03T01:30:29Z","title":"Video Active Perception: Effective Inference-Time Long-Form Video Understanding with Vision-Language Models","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-08T19:17:20.745425Z"},"links":{"cited_paper":"/paper/2003.06734","citing_paper":"/paper/2605.01662"},"observation_digest":"sha256:9c0d862c13afda12cd6eeb9c2afc06d0e4cfdbc96df75cd4a2399dc15091dcbe","observation_id":"2fef03a1-0e95-4b77-949b-833037f68e2a","resolution":{"observed_at":"2026-05-09T05:55:31.646806Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A simple llmframeworkforlong-rangevideoquestion-answering","venue":null,"work_id":"6e8610f4-5fe5-4028-9f05-633be1abdf38","year":2024},"citing_paper":{"arxiv_id":"2605.01662","last_updated":"2026-05-03T01:30:29Z","snapshot_observed_at":"2026-07-06T23:14:52.417213Z","submitted_at":"2026-05-03T01:30:29Z","title":"Video Active Perception: Effective Inference-Time Long-Form Video Understanding with Vision-Language Models","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-08T19:17:20.745425Z"},"links":{"citing_paper":"/paper/2605.01662"},"observation_digest":"sha256:633c737c2513672f01fcaee1ef09935a88c5735643e3de8d5a2af0a522f3cad1","observation_id":"e15f4043-62b2-46b3-9d2a-6ec710a8141d","resolution":{"observed_at":"2026-05-26T03:11:36.124998Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.08169","last_updated":"2021-06-27T23:41:35Z","snapshot_observed_at":"2026-07-06T11:10:17.453429Z","submitted_at":"2021-05-17T21:19:30Z","title":"Safe Occlusion-aware Autonomous Driving via Game-Theoretic Active Perception","version":2},"cited_work":{"arxiv_id":"2105.08169","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2105.08169","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Safe occlusion-aware au- tonomousdrivingviagame-theoreticactiveperception","venue":null,"work_id":"3117bd26-286b-45ad-a54c-9232ceba7413","year":2021},"citing_paper":{"arxiv_id":"2605.01662","last_updated":"2026-05-03T01:30:29Z","snapshot_observed_at":"2026-07-06T23:14:52.417213Z","submitted_at":"2026-05-03T01:30:29Z","title":"Video Active Perception: Effective Inference-Time Long-Form Video Understanding with Vision-Language Models","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-08T19:17:20.745425Z"},"links":{"cited_paper":"/paper/2105.08169","citing_paper":"/paper/2605.01662"},"observation_digest":"sha256:d1b6571a0d0bb08d62688a32283888963fed0549db65faaf0bfa0c96c056ff2d","observation_id":"7b06da63-8fe3-4fc4-8bd2-69d84e1a9f45","resolution":{"observed_at":"2026-05-09T05:55:31.681923Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04264","last_updated":"2025-01-01T15:53:58Z","snapshot_observed_at":"2026-08-03T20:38:36.602554Z","submitted_at":"2024-06-06T17:09:32Z","title":"MLVU: Benchmarking Multi-task Long Video Understanding","version":3},"cited_work":{"arxiv_id":"2406.04264","doi":"10.48550/arxiv.2406.04264","metadata_source":"pith","pith_arxiv_id":"2406.04264","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"MLVU: Benchmarking Multi-task Long Video Understanding","venue":"cs.CV","work_id":"346256da-dd21-4cc3-9a98-519467614854","year":2024},"citing_paper":{"arxiv_id":"2605.01662","last_updated":"2026-05-03T01:30:29Z","snapshot_observed_at":"2026-07-06T23:14:52.417213Z","submitted_at":"2026-05-03T01:30:29Z","title":"Video Active Perception: Effective Inference-Time Long-Form Video Understanding with Vision-Language Models","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-08T19:17:20.745425Z"},"links":{"cited_paper":"/paper/2406.04264","citing_paper":"/paper/2605.01662"},"observation_digest":"sha256:e020d80b2eab5a04204b87707b2eb571a46a4cb52fe196d22a458cb7e8832dda","observation_id":"5e93fbef-b51c-4c4a-a725-6f99990aac5d","resolution":{"observed_at":"2026-05-14T19:55:26.650724Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Weprovideadetailedpromptwithexamplestoleverage the video generation model’s capacity as much as possi- ble","venue":null,"work_id":"ffb541cc-cfc2-4c14-830a-a4d48911488c","year":null},"citing_paper":{"arxiv_id":"2605.01662","last_updated":"2026-05-03T01:30:29Z","snapshot_observed_at":"2026-07-06T23:14:52.417213Z","submitted_at":"2026-05-03T01:30:29Z","title":"Video Active Perception: Effective Inference-Time Long-Form Video Understanding with Vision-Language Models","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-08T19:17:20.745425Z"},"links":{"citing_paper":"/paper/2605.01662"},"observation_digest":"sha256:c9a789c869bf5996918f6a2fc810997ee8f30771f26e2fa281d0e30a9a06f313","observation_id":"1eee0626-5379-4ccf-b776-4d3934a28137","resolution":{"observed_at":"2026-05-26T03:11:36.023935Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"1b)Extract visual cues that indicate the environment (e.g., indoor, outdoor, time of day) and participants (e.g., people, animals, objects)","venue":null,"work_id":"f3f15f9a-7380-4de8-8651-30c5c2839091","year":null},"citing_paper":{"arxiv_id":"2605.01662","last_updated":"2026-05-03T01:30:29Z","snapshot_observed_at":"2026-07-06T23:14:52.417213Z","submitted_at":"2026-05-03T01:30:29Z","title":"Video Active Perception: Effective Inference-Time Long-Form Video Understanding with Vision-Language Models","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-08T19:17:20.745425Z"},"links":{"citing_paper":"/paper/2605.01662"},"observation_digest":"sha256:39fa7d89da8d3e99ee696934e5b2966d58a28bec08a82e61362c3cfa2c0a030b","observation_id":"a41c8e9c-96fd-4a29-a2b4-522e594ebfc1","resolution":{"observed_at":"2026-05-26T03:11:36.050545Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2b) Consider each possible answer to understand different potential outcomes or scenarios","venue":null,"work_id":"fd2f2f1a-4525-44c6-96c8-64db3d0f643d","year":null},"citing_paper":{"arxiv_id":"2605.01662","last_updated":"2026-05-03T01:30:29Z","snapshot_observed_at":"2026-07-06T23:14:52.417213Z","submitted_at":"2026-05-03T01:30:29Z","title":"Video Active Perception: Effective Inference-Time Long-Form Video Understanding with Vision-Language Models","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-08T19:17:20.745425Z"},"links":{"citing_paper":"/paper/2605.01662"},"observation_digest":"sha256:354cd6c5381ae6eb809c24a82694099ac640f66b4343164e98bfc0dcc3aae446","observation_id":"28658935-4fb8-454c-9ba1-91088bd5029a","resolution":{"observed_at":"2026-05-26T03:11:35.934272Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"3b) Focus on generating dynamics that would lead to scenarios described in the possible answers","venue":null,"work_id":"36ef5efe-3f90-450c-8230-20bb9c04f9c7","year":null},"citing_paper":{"arxiv_id":"2605.01662","last_updated":"2026-05-03T01:30:29Z","snapshot_observed_at":"2026-07-06T23:14:52.417213Z","submitted_at":"2026-05-03T01:30:29Z","title":"Video Active Perception: Effective Inference-Time Long-Form Video Understanding with Vision-Language Models","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-08T19:17:20.745425Z"},"links":{"citing_paper":"/paper/2605.01662"},"observation_digest":"sha256:0dfe05e9e7a7b2f9d8468233df377c5909bf265db38bd981e7e75202f3ac3d7c","observation_id":"eea959ae-ae5d-4947-80e5-b8c646c7928c","resolution":{"observed_at":"2026-05-26T03:11:36.008002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"7a7772fe-206b-4da9-ac14-c5f9334a756c","year":null},"citing_paper":{"arxiv_id":"2605.01662","last_updated":"2026-05-03T01:30:29Z","snapshot_observed_at":"2026-07-06T23:14:52.417213Z","submitted_at":"2026-05-03T01:30:29Z","title":"Video Active Perception: Effective Inference-Time Long-Form Video Understanding with Vision-Language Models","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-08T19:17:20.745425Z"},"links":{"citing_paper":"/paper/2605.01662"},"observation_digest":"sha256:ae80757dc4a534069636c11f662e04fb54371455f4d7192e33f83a65e3d1c564","observation_id":"0b002e87-c3c0-435b-9953-97047572d18b","resolution":{"observed_at":"2026-05-26T03:11:36.133711Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"52446c48-b566-4af6-a955-72d5d14e0088","year":null},"citing_paper":{"arxiv_id":"2605.01662","last_updated":"2026-05-03T01:30:29Z","snapshot_observed_at":"2026-07-06T23:14:52.417213Z","submitted_at":"2026-05-03T01:30:29Z","title":"Video Active Perception: Effective Inference-Time Long-Form Video Understanding with Vision-Language Models","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-08T19:17:20.745425Z"},"links":{"citing_paper":"/paper/2605.01662"},"observation_digest":"sha256:3bf17ca119de5af03e974da1a8ac364abf28970d71dfc6dabbdbf79015b7b1ab","observation_id":"88229131-0c9c-424a-85a2-c7c015f61943","resolution":{"observed_at":"2026-05-26T03:11:36.109028Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"c9989a5e-2be2-48c9-a97e-c18e45b6b3f4","year":null},"citing_paper":{"arxiv_id":"2605.01662","last_updated":"2026-05-03T01:30:29Z","snapshot_observed_at":"2026-07-06T23:14:52.417213Z","submitted_at":"2026-05-03T01:30:29Z","title":"Video Active Perception: Effective Inference-Time Long-Form Video Understanding with Vision-Language Models","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-08T19:17:20.745425Z"},"links":{"citing_paper":"/paper/2605.01662"},"observation_digest":"sha256:36879a084183a8f3a7bae5c08a893e798cda86fc6da2dc5833fe83f3abd3f7fe","observation_id":"f27a14a8-eeb1-49a7-a4d7-cc7fd7fba306","resolution":{"observed_at":"2026-05-26T03:11:35.968728Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"1b) Incorporate common sense and logical reasoning to predict what is likely to happen next","venue":null,"work_id":"1b40591e-9253-4eb6-856a-477be8ab723c","year":null},"citing_paper":{"arxiv_id":"2605.01662","last_updated":"2026-05-03T01:30:29Z","snapshot_observed_at":"2026-07-06T23:14:52.417213Z","submitted_at":"2026-05-03T01:30:29Z","title":"Video Active Perception: Effective Inference-Time Long-Form Video Understanding with Vision-Language Models","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-08T19:17:20.745425Z"},"links":{"citing_paper":"/paper/2605.01662"},"observation_digest":"sha256:1e14802031494805afe0825e05407f1e88dcd3daf5fa42f4e134c79a7efa2eb7","observation_id":"34b523ee-c76f-439d-8963-ab4721446afc","resolution":{"observed_at":"2026-05-26T03:11:36.028199Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2b) Highlight events or actions that would help distinguish between the different answers","venue":null,"work_id":"e4048d91-612e-42c4-ab22-feb55e0aa251","year":null},"citing_paper":{"arxiv_id":"2605.01662","last_updated":"2026-05-03T01:30:29Z","snapshot_observed_at":"2026-07-06T23:14:52.417213Z","submitted_at":"2026-05-03T01:30:29Z","title":"Video Active Perception: Effective Inference-Time Long-Form Video Understanding with Vision-Language Models","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-08T19:17:20.745425Z"},"links":{"citing_paper":"/paper/2605.01662"},"observation_digest":"sha256:0cfdab8b0dd9452c4d5c2ece8b6a11dd88e19882e29bcaf44dff62c537bc0178","observation_id":"2b2eb67a-7416-4987-bcde-7a30a63eb63b","resolution":{"observed_at":"2026-05-26T03:11:35.999526Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"What does the person do after the light turns green?","venue":null,"work_id":"0f6c163b-d7f3-4ad3-a4ea-f038249f1cae","year":null},"citing_paper":{"arxiv_id":"2605.01662","last_updated":"2026-05-03T01:30:29Z","snapshot_observed_at":"2026-07-06T23:14:52.417213Z","submitted_at":"2026-05-03T01:30:29Z","title":"Video Active Perception: Effective Inference-Time Long-Form Video Understanding with Vision-Language Models","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-08T19:17:20.745425Z"},"links":{"citing_paper":"/paper/2605.01662"},"observation_digest":"sha256:2ed8a4b13bd21513a49d37ebc3b4bfaca44b50a6a35bc03dc06d9321aede3710","observation_id":"4a3581e0-c858-4a56-ab44-17e19e2f2cd3","resolution":{"observed_at":"2026-05-26T03:11:36.019864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.01662","last_updated":"2026-05-03T01:30:29Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T23:14:52.417213Z","submitted_at":"2026-05-03T01:30:29Z","title":"Video Active Perception: Effective Inference-Time Long-Form Video Understanding with Vision-Language Models"},"reference_resolution":{"displayed":73,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":5,"verified_exact":21,"verified_fuzzy":47},"total_outbound_references":73},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 73 of 73 outbound references and 1 inbound Pith citation observation for arXiv:2605.01662."}