{"as_of":"2026-08-22T09:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:af90443b2c6c150441a2b3344a20594bc623738bcb659ac767b979c2054e75af","coverage":[{"denominator":85,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":85,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T18:22:33.231784Z","state":"measured"},{"denominator":96,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":96,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":11,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":11,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T04:35:26.623428Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-03T15:28:33.947770Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2512.05774","last_updated":"2026-06-04T07:27:00Z","snapshot_observed_at":"2026-08-03T18:22:22.611333Z","submitted_at":"2025-12-05T15:03:48Z","title":"Active Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding","version":2},"cited_work":{"arxiv_id":"2512.05774","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.05774","snapshot_observed_at":"2026-07-03T15:28:33.947770Z","title":"Ryoo, and Juan Carlos Niebles","venue":"cs.CV","work_id":"bf5222ba-5372-497c-9650-80e916f754ab","year":2025},"citing_paper":{"arxiv_id":"2605.09874","last_updated":"2026-08-18T20:07:49Z","snapshot_observed_at":"2026-08-22T09:09:37.682086Z","submitted_at":"2026-05-11T01:59:59Z","title":"EgoMemReason: A Memory-Driven Reasoning Benchmark for Long-Horizon Egocentric Video Understanding","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-05-12T04:37:46.090777Z"},"links":{"cited_paper":"/paper/2512.05774","citing_paper":"/paper/2605.09874"},"observation_digest":"sha256:6586075797f1cbdfd04100d9a6b3b427f5718125005a16c760092edc3ce93327","observation_id":"1912ee73-8485-4f2d-9144-2047a4d59586","resolution":{"observed_at":"2026-06-05T02:15:31.456438Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.05774","last_updated":"2026-06-04T07:27:00Z","snapshot_observed_at":"2026-08-03T18:22:22.611333Z","submitted_at":"2025-12-05T15:03:48Z","title":"Active Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding","version":2},"cited_work":{"arxiv_id":"2512.05774","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.05774","snapshot_observed_at":"2026-07-03T15:28:33.947770Z","title":"Ryoo, and Juan Carlos Niebles","venue":"cs.CV","work_id":"bf5222ba-5372-497c-9650-80e916f754ab","year":2025},"citing_paper":{"arxiv_id":"2605.10936","last_updated":"2026-05-11T17:59:17Z","snapshot_observed_at":"2026-08-11T01:45:29.741032Z","submitted_at":"2026-05-11T17:59:17Z","title":"Personal Visual Context Learning in Large Multimodal Models","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-12T03:42:15.402131Z"},"links":{"cited_paper":"/paper/2512.05774","citing_paper":"/paper/2605.10936"},"observation_digest":"sha256:b7fc3943c0363ae4b1abe1fc2997eea78f02eddf45f3b41ca02cb97db0459fbc","observation_id":"86164427-32ac-4232-b257-fb932e53e883","resolution":{"observed_at":"2026-06-05T02:15:31.456438Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.05774","last_updated":"2026-06-04T07:27:00Z","snapshot_observed_at":"2026-08-03T18:22:22.611333Z","submitted_at":"2025-12-05T15:03:48Z","title":"Active Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding","version":2},"cited_work":{"arxiv_id":"2512.05774","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.05774","snapshot_observed_at":"2026-07-03T15:28:33.947770Z","title":"Ryoo, and Juan Carlos Niebles","venue":"cs.CV","work_id":"bf5222ba-5372-497c-9650-80e916f754ab","year":2025},"citing_paper":{"arxiv_id":"2605.23826","last_updated":"2026-07-06T23:24:40Z","snapshot_observed_at":"2026-08-19T19:06:13.791990Z","submitted_at":"2026-05-22T16:29:51Z","title":"Decomposing Queries into Tool Calls for Long-Video Keyframe Retrieval","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-25T04:18:58.470652Z"},"links":{"cited_paper":"/paper/2512.05774","citing_paper":"/paper/2605.23826"},"observation_digest":"sha256:74f5125a54d646b3305ecc2538614d0393f318410c73db35b554420907ef4030","observation_id":"734bca2d-c3c2-43d1-bad0-151018abff92","resolution":{"observed_at":"2026-06-05T02:15:31.456438Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.05774","last_updated":"2026-06-04T07:27:00Z","snapshot_observed_at":"2026-08-03T18:22:22.611333Z","submitted_at":"2025-12-05T15:03:48Z","title":"Active Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding","version":2},"cited_work":{"arxiv_id":"2512.05774","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.05774","snapshot_observed_at":"2026-07-03T15:28:33.947770Z","title":"Ryoo, and Juan Carlos Niebles","venue":"cs.CV","work_id":"bf5222ba-5372-497c-9650-80e916f754ab","year":2025},"citing_paper":{"arxiv_id":"2606.03920","last_updated":"2026-06-02T17:12:05Z","snapshot_observed_at":"2026-08-13T01:52:56.143396Z","submitted_at":"2026-06-02T17:12:05Z","title":"Benchmarking Visual State Tracking in Multimodal Video Understanding","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-06-28T10:43:06.811228Z"},"links":{"cited_paper":"/paper/2512.05774","citing_paper":"/paper/2606.03920"},"observation_digest":"sha256:a0883a6c4f7632bff105707f1a03d1cfe9cf5319fbe55fd3a968527745bf22ce","observation_id":"f96c7881-8649-401f-973e-f129e244a4c6","resolution":{"observed_at":"2026-07-02T02:46:28.019866Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.05774","last_updated":"2026-06-04T07:27:00Z","snapshot_observed_at":"2026-08-03T18:22:22.611333Z","submitted_at":"2025-12-05T15:03:48Z","title":"Active Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding","version":2},"cited_work":{"arxiv_id":"2512.05774","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.05774","snapshot_observed_at":"2026-07-03T15:28:33.947770Z","title":"Ryoo, and Juan Carlos Niebles","venue":"cs.CV","work_id":"bf5222ba-5372-497c-9650-80e916f754ab","year":2025},"citing_paper":{"arxiv_id":"2606.07433","last_updated":"2026-06-05T16:29:13Z","snapshot_observed_at":"2026-08-01T21:05:06.439607Z","submitted_at":"2026-06-05T16:29:13Z","title":"Watch, Remember, Reason: Human-View Video Understanding with MLLMs","version":1},"reference_index":230,"source":"pdf_text","source_observed_at":"2026-06-27T22:00:28.350003Z"},"links":{"cited_paper":"/paper/2512.05774","citing_paper":"/paper/2606.07433"},"observation_digest":"sha256:328df44bcc03a93969e4bd75792d6b59bcc069e1f7f094809ed5adab4019828a","observation_id":"b81f57c6-b73c-4239-8309-38574c2ad9a9","resolution":{"observed_at":"2026-07-02T17:27:15.077171Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.05774","last_updated":"2026-06-04T07:27:00Z","snapshot_observed_at":"2026-08-03T18:22:22.611333Z","submitted_at":"2025-12-05T15:03:48Z","title":"Active Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding","version":2},"cited_work":{"arxiv_id":"2512.05774","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.05774","snapshot_observed_at":"2026-07-03T15:28:33.947770Z","title":"Ryoo, and Juan Carlos Niebles","venue":"cs.CV","work_id":"bf5222ba-5372-497c-9650-80e916f754ab","year":2025},"citing_paper":{"arxiv_id":"2606.13141","last_updated":"2026-06-11T10:05:49Z","snapshot_observed_at":"2026-08-21T22:23:05.314696Z","submitted_at":"2026-06-11T10:05:49Z","title":"Rethinking RAG in Long Videos: What to Retrieve and How to Use It?","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-06-27T06:30:33.428489Z"},"links":{"cited_paper":"/paper/2512.05774","citing_paper":"/paper/2606.13141"},"observation_digest":"sha256:cacd76c905ea78e0710841252973563cd3448797c687eed50da087512f272566","observation_id":"dfab930b-09ce-410f-b217-5ca8bc44e275","resolution":{"observed_at":"2026-07-03T15:28:33.949814Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.05774","last_updated":"2026-06-04T07:27:00Z","snapshot_observed_at":"2026-08-03T18:22:22.611333Z","submitted_at":"2025-12-05T15:03:48Z","title":"Active Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.05774","snapshot_observed_at":"2026-08-01T21:09:45.205921Z","title":"Ryoo, and Juan Carlos Niebles","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16189","last_updated":"2026-07-17T17:59:27Z","snapshot_observed_at":"2026-08-18T12:35:21.022591Z","submitted_at":"2026-07-17T17:59:27Z","title":"Searching Videos as Trees: Self-Correcting Agents for Grounded Long Video QA","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-01T21:09:45.205921Z"},"links":{"cited_paper":"/paper/2512.05774","citing_paper":"/paper/2607.16189"},"observation_digest":"sha256:2d3f1a195b55d80a532d4e9373ea860d2e6936474094a65c9ec816e34c7b442d","observation_id":"b2160f28-107f-4777-aa54-4fcf8fa980b3","resolution":{"observed_at":"2026-08-01T21:09:45.205921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.05774","last_updated":"2026-06-04T07:27:00Z","snapshot_observed_at":"2026-08-03T18:22:22.611333Z","submitted_at":"2025-12-05T15:03:48Z","title":"Active Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.05774","snapshot_observed_at":"2026-08-01T02:59:25.213497Z","title":"https://arxiv","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25266","last_updated":"2026-07-30T21:59:18Z","snapshot_observed_at":"2026-08-19T19:58:42.828956Z","submitted_at":"2026-07-28T04:09:49Z","title":"FORGE: Frame Orthogonality in Relevance Geometry for Long-Form Video Understanding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T02:59:25.213497Z"},"links":{"cited_paper":"/paper/2512.05774","citing_paper":"/paper/2607.25266"},"observation_digest":"sha256:96922ce1344091089eb3b7ac021b83fc8a658162753f9945434df84604042b45","observation_id":"46a95a9a-82d5-4324-8595-74302ef3e2b5","resolution":{"observed_at":"2026-08-01T02:59:25.213497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.05774","last_updated":"2026-06-04T07:27:00Z","snapshot_observed_at":"2026-08-03T18:22:22.611333Z","submitted_at":"2025-12-05T15:03:48Z","title":"Active Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.05774","snapshot_observed_at":"2026-08-03T01:46:07.582823Z","title":"https://arxiv","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25266","last_updated":"2026-07-30T21:59:18Z","snapshot_observed_at":"2026-08-19T19:58:42.828956Z","submitted_at":"2026-07-28T04:09:49Z","title":"FORGE: Frame Orthogonality in Relevance Geometry for Long-Form Video Understanding","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T01:46:07.582823Z"},"links":{"cited_paper":"/paper/2512.05774","citing_paper":"/paper/2607.25266"},"observation_digest":"sha256:040bb47105f25e480ac7b61c6c7b23c5f8f8e6ced1a3ed66c3fccbfc7a2c9aaf","observation_id":"0dbe0cc8-4ad6-44f9-a539-8402412a25ad","resolution":{"observed_at":"2026-08-03T01:46:07.582823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.05774","last_updated":"2026-06-04T07:27:00Z","snapshot_observed_at":"2026-08-03T18:22:22.611333Z","submitted_at":"2025-12-05T15:03:48Z","title":"Active Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.05774","snapshot_observed_at":"2026-08-12T00:43:38.391136Z","title":"Ryoo, and Juan Carlos Niebles","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07959","last_updated":"2026-08-08T06:48:08Z","snapshot_observed_at":"2026-08-15T15:20:26.837217Z","submitted_at":"2026-08-08T06:48:08Z","title":"SCOUT: Self-Checking and Recovery-Aware Tool-Thought Agents for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T00:43:38.391136Z"},"links":{"cited_paper":"/paper/2512.05774","citing_paper":"/paper/2608.07959"},"observation_digest":"sha256:fd210d5332d2d3405b7a9f275672ef94e41c7ba69aa134fc590b77e6891c4ced","observation_id":"73d96fa0-a39a-4bc8-b68c-deef7daed697","resolution":{"observed_at":"2026-08-12T00:43:38.391136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.05774","last_updated":"2026-06-04T07:27:00Z","snapshot_observed_at":"2026-08-03T18:22:22.611333Z","submitted_at":"2025-12-05T15:03:48Z","title":"Active Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.05774","snapshot_observed_at":"2026-08-14T04:35:26.623428Z","title":"arXiv preprint arXiv:2512.05774 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08612","last_updated":"2026-08-09T09:55:42Z","snapshot_observed_at":"2026-08-19T12:29:05.025543Z","submitted_at":"2026-08-09T09:55:42Z","title":"REVEAL: A Rubric-Guided Agent for Explicit Evidence Sufficiency Verificationin Long-Video Question Answering","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-14T04:35:26.623428Z"},"links":{"cited_paper":"/paper/2512.05774","citing_paper":"/paper/2608.08612"},"observation_digest":"sha256:89a2f8768e3e99142beef96c11e691259fce7a749f814717474c2be136e07f41","observation_id":"7f4451c8-e1d5-4fe0-8868-2e4a348865b4","resolution":{"observed_at":"2026-08-14T04:35:26.623428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2512.05774/citation-record","integrity":"/paper/2512.05774/integrity","json":"/paper/2512.05774/citation-record.json","paper":"/paper/2512.05774"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:22:23.527845Z","title":"Psychology Press,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.05774","last_updated":"2026-06-04T07:27:00Z","snapshot_observed_at":"2026-08-03T18:22:22.611333Z","submitted_at":"2025-12-05T15:03:48Z","title":"Active Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T18:22:23.527845Z"},"links":{"citing_paper":"/paper/2512.05774"},"observation_digest":"sha256:469793d1f0e19f3fd72a1aa18e834082ea8985414ea65e354d02cdf1ed62281e","observation_id":"ab07ad85-2248-4752-af36-3559ed0356f4","resolution":{"observed_at":"2026-08-03T18:22:23.527845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:22:23.597949Z","title":"Temporal chain of thought: Long-video understanding by thinking in frames, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.05774","last_updated":"2026-06-04T07:27:00Z","snapshot_observed_at":"2026-08-03T18:22:22.611333Z","submitted_at":"2025-12-05T15:03:48Z","title":"Active Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T18:22:23.597949Z"},"links":{"citing_paper":"/paper/2512.05774"},"observation_digest":"sha256:950f193b57ddc9e83fa70548ac64330c855c72bec96b3605347c2f3a932b565c","observation_id":"0979b839-73ae-4a52-8a19-cc714b8676c9","resolution":{"observed_at":"2026-08-03T18:22:23.597949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-21T16:02:41.546193Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-03T18:22:23.657740Z","title":"Qwen2.5- vl technical report.arXiv preprint arXiv:2502.13923, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.05774","last_updated":"2026-06-04T07:27:00Z","snapshot_observed_at":"2026-08-03T18:22:22.611333Z","submitted_at":"2025-12-05T15:03:48Z","title":"Active Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T18:22:23.657740Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2512.05774"},"observation_digest":"sha256:96bce7f397a96ac9b9e7cc37776b41ece381e6cd4ad0c21467da84016e4b6aef","observation_id":"4f03292c-2032-4565-b079-2752b514e104","resolution":{"observed_at":"2026-08-03T18:22:23.657740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:22:23.725387Z","title":"Active perception.Proceedings of the IEEE, 76(8):966–1005, 1988","venue":null,"work_id":null,"year":1988},"citing_paper":{"arxiv_id":"2512.05774","last_updated":"2026-06-04T07:27:00Z","snapshot_observed_at":"2026-08-03T18:22:22.611333Z","submitted_at":"2025-12-05T15:03:48Z","title":"Active Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T18:22:23.725387Z"},"links":{"citing_paper":"/paper/2512.05774"},"observation_digest":"sha256:22cd0455d46c6550fc3062eba1c02dae30de12f612963c2e7c1e7cb9adf944ad","observation_id":"d99e710b-87bc-46e2-b2bb-08b3c58d2bcd","resolution":{"observed_at":"2026-08-03T18:22:23.725387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:22:23.836886Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2512.05774","last_updated":"2026-06-04T07:27:00Z","snapshot_observed_at":"2026-08-03T18:22:22.611333Z","submitted_at":"2025-12-05T15:03:48Z","title":"Active Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T18:22:23.836886Z"},"links":{"citing_paper":"/paper/2512.05774"},"observation_digest":"sha256:fd69813910016f0d07893018d5921c343de0a83aa39f587c283eaea3e45273c1","observation_id":"8a5e3cfe-1e3b-4420-b5a3-e6927aeb36be","resolution":{"observed_at":"2026-08-03T18:22:23.836886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:22:23.954077Z","title":"Revisiting the “Video” in Video-Language Understanding","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.05774","last_updated":"2026-06-04T07:27:00Z","snapshot_observed_at":"2026-08-03T18:22:22.611333Z","submitted_at":"2025-12-05T15:03:48Z","title":"Active Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T18:22:23.954077Z"},"links":{"citing_paper":"/paper/2512.05774"},"observation_digest":"sha256:e138739479e170a956d8a9a66b2213e824a98975af19a1fa45e50f2c2ad63245","observation_id":"8550eae5-9bca-4c99-8114-ea05c2beb871","resolution":{"observed_at":"2026-08-03T18:22:23.954077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:22:24.071228Z","title":"Hadzic, Taran Kota, Jimming He, Cristobal Eyzaguirre, Zane Durante, Manling Li, Jiajun Wu, and Li Fei-Fei","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.05774","last_updated":"2026-06-04T07:27:00Z","snapshot_observed_at":"2026-08-03T18:22:22.611333Z","submitted_at":"2025-12-05T15:03:48Z","title":"Active Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T18:22:24.071228Z"},"links":{"citing_paper":"/paper/2512.05774"},"observation_digest":"sha256:4a0c4835a4b1a2a68e35421e1580409ec20f9fb420083a8569d164f8dbffc6e2","observation_id":"e5b78b50-cced-4924-b0c2-b7cbc42108e1","resolution":{"observed_at":"2026-08-03T18:22:24.071228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:22:24.284882Z","title":"Lvagent: Long video under- standing by multi-round dynamical collaboration of mllm agents.arXiv preprint arXiv:2503.10200, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.05774","last_updated":"2026-06-04T07:27:00Z","snapshot_observed_at":"2026-08-03T18:22:22.611333Z","submitted_at":"2025-12-05T15:03:48Z","title":"Active Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T18:22:24.284882Z"},"links":{"citing_paper":"/paper/2512.05774"},"observation_digest":"sha256:6841594d145e85a34cc18c6c688233cf55f0ff86a22f04902d5ae373cd7ebd68","observation_id":"ee6c8446-6848-47c6-9f25-d3ddc059263b","resolution":{"observed_at":"2026-08-03T18:22:24.284882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:22:24.500550Z","title":"Longvila: Scaling long-context visual language models for long videos,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.05774","last_updated":"2026-06-04T07:27:00Z","snapshot_observed_at":"2026-08-03T18:22:22.611333Z","submitted_at":"2025-12-05T15:03:48Z","title":"Active Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T18:22:24.500550Z"},"links":{"citing_paper":"/paper/2512.05774"},"observation_digest":"sha256:6aad20cd5e981e5728ee20a3d80febf333c62bdaf8dddcc6114e4d3d7dc54fd1","observation_id":"deaf634e-0f3c-48a4-949b-3bffd6c46c17","resolution":{"observed_at":"2026-08-03T18:22:24.500550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:22:24.635886Z","title":"Deepseek-r1: Incentivizing reasoning capabil- ity in llms via reinforcement learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.05774","last_updated":"2026-06-04T07:27:00Z","snapshot_observed_at":"2026-08-03T18:22:22.611333Z","submitted_at":"2025-12-05T15:03:48Z","title":"Active Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T18:22:24.635886Z"},"links":{"citing_paper":"/paper/2512.05774"},"observation_digest":"sha256:eae0eb30860444ead20a083cef9f96141bd71dc5d0023ac8f52d1868bd5e55bf","observation_id":"2ab6de7d-87f0-45bd-942a-646db4b28c65","resolution":{"observed_at":"2026-08-03T18:22:24.635886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:22:24.740213Z","title":"See what you need: Query-aware visual intelligence through reasoning-perception loops, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.05774","last_updated":"2026-06-04T07:27:00Z","snapshot_observed_at":"2026-08-03T18:22:22.611333Z","submitted_at":"2025-12-05T15:03:48Z","title":"Active Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T18:22:24.740213Z"},"links":{"citing_paper":"/paper/2512.05774"},"observation_digest":"sha256:147c2358b59e2fec025375c4803bc047757c4fd723f586633db6dadd5c74e1f0","observation_id":"bb4b9c68-1c53-4556-b642-dc18befe91d5","resolution":{"observed_at":"2026-08-03T18:22:24.740213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:22:24.903019Z","title":"Agentic keyframe search for video question answering, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.05774","last_updated":"2026-06-04T07:27:00Z","snapshot_observed_at":"2026-08-03T18:22:22.611333Z","submitted_at":"2025-12-05T15:03:48Z","title":"Active Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T18:22:24.903019Z"},"links":{"citing_paper":"/paper/2512.05774"},"observation_digest":"sha256:6b28e2c43b2836da8f7333b01ff0c500884f90811739f4196819413cd228fd00","observation_id":"a8c5a29f-c674-4f3f-9044-c2efc0b0b7d9","resolution":{"observed_at":"2026-08-03T18:22:24.903019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:22:25.067335Z","title":"Videoagent: A memory-augmented multi- modal agent for video understanding, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.05774","last_updated":"2026-06-04T07:27:00Z","snapshot_observed_at":"2026-08-03T18:22:22.611333Z","submitted_at":"2025-12-05T15:03:48Z","title":"Active Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T18:22:25.067335Z"},"links":{"citing_paper":"/paper/2512.05774"},"observation_digest":"sha256:70a6b9bf08279f6c58ea9902f5c69672185231cd2afed92eaea90604e76efe16","observation_id":"1a9f88bc-a7c9-455e-9640-acddcc9f2a6c","resolution":{"observed_at":"2026-08-03T18:22:25.067335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21776","last_updated":"2025-10-22T16:42:24Z","snapshot_observed_at":"2026-08-05T07:15:29.998948Z","submitted_at":"2025-03-27T17:59:51Z","title":"Video-R1: Reinforcing Video Reasoning in MLLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21776","snapshot_observed_at":"2026-08-03T18:22:25.203479Z","title":"Video-r1: Reinforcing video reasoning in mllms.arXiv preprint arXiv:2503.21776, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.05774","last_updated":"2026-06-04T07:27:00Z","snapshot_observed_at":"2026-08-03T18:22:22.611333Z","submitted_at":"2025-12-05T15:03:48Z","title":"Active Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T18:22:25.203479Z"},"links":{"cited_paper":"/paper/2503.21776","citing_paper":"/paper/2512.05774"},"observation_digest":"sha256:a2eb75df649ddcef4d1f4e229250eb519c91c7240aa93939e3725d6a1d82452e","observation_id":"39d9c632-a053-4ba3-ae37-12a08dfcbd05","resolution":{"observed_at":"2026-08-03T18:22:25.203479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:22:25.296291Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.05774","last_updated":"2026-06-04T07:27:00Z","snapshot_observed_at":"2026-08-03T18:22:22.611333Z","submitted_at":"2025-12-05T15:03:48Z","title":"Active Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T18:22:25.296291Z"},"links":{"citing_paper":"/paper/2512.05774"},"observation_digest":"sha256:c7705feeb44bb01078b82e8fb25d972bedf996fddef6a2c76b95b32ecc4759a1","observation_id":"5f3990bf-f693-454b-9f2b-671870d8e6a7","resolution":{"observed_at":"2026-08-03T18:22:25.296291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:22:25.458253Z","title":"Love-r1: Advancing long video understanding with an adaptive zoom-in mechanism via multi- step reasoning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.05774","last_updated":"2026-06-04T07:27:00Z","snapshot_observed_at":"2026-08-03T18:22:22.611333Z","submitted_at":"2025-12-05T15:03:48Z","title":"Active Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T18:22:25.458253Z"},"links":{"citing_paper":"/paper/2512.05774"},"observation_digest":"sha256:41c4f8adf2c4f6ac65e10d4634f5db93507dfb3a4a9d2f286920c6a5d2e9291c","observation_id":"c0038f4c-31d6-4a46-993d-fff38859e842","resolution":{"observed_at":"2026-08-03T18:22:25.458253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:22:25.562342Z","title":"Framemind: Frame-interleaved video reasoning via reinforcement learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.05774","last_updated":"2026-06-04T07:27:00Z","snapshot_observed_at":"2026-08-03T18:22:22.611333Z","submitted_at":"2025-12-05T15:03:48Z","title":"Active Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T18:22:25.562342Z"},"links":{"citing_paper":"/paper/2512.05774"},"observation_digest":"sha256:47642006908516abff6afae1001041cde8b8494680345ae125adaa9d7b07f6a4","observation_id":"766d3b5e-c281-4990-b36b-46392ae6fc2e","resolution":{"observed_at":"2026-08-03T18:22:25.562342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:22:25.668330Z","title":"Framethinker: Learning to think with long videos via multi-turn frame spotlighting, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.05774","last_updated":"2026-06-04T07:27:00Z","snapshot_observed_at":"2026-08-03T18:22:22.611333Z","submitted_at":"2025-12-05T15:03:48Z","title":"Active Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T18:22:25.668330Z"},"links":{"citing_paper":"/paper/2512.05774"},"observation_digest":"sha256:b2ee2736995c8defc81d00be3ed4097950a77e8fc6c00d97be785e4da0417cd1","observation_id":"5f2603e6-7635-4503-9759-a25615faac7a","resolution":{"observed_at":"2026-08-03T18:22:25.668330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:22:25.818730Z","title":"Adaptive video understanding agent: Enhancing efficiency with dynamic frame sampling and feedback-driven reasoning, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.05774","last_updated":"2026-06-04T07:27:00Z","snapshot_observed_at":"2026-08-03T18:22:22.611333Z","submitted_at":"2025-12-05T15:03:48Z","title":"Active Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T18:22:25.818730Z"},"links":{"citing_paper":"/paper/2512.05774"},"observation_digest":"sha256:9da8f428bdad506488ad3a3f448f941eb894e120b57adf8a4e92ac55d5519dbd","observation_id":"382a94c5-c17e-4d1b-8216-c14d2a5dc0ae","resolution":{"observed_at":"2026-08-03T18:22:25.818730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:22:25.912949Z","title":"Language repository for long video understanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.05774","last_updated":"2026-06-04T07:27:00Z","snapshot_observed_at":"2026-08-03T18:22:22.611333Z","submitted_at":"2025-12-05T15:03:48Z","title":"Active Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T18:22:25.912949Z"},"links":{"citing_paper":"/paper/2512.05774"},"observation_digest":"sha256:99497aed50ac1abba8fca0d28ddc3a84d557d114a4040befaa6a1fb2aad6bc51","observation_id":"890b45a3-048d-4226-b78d-f82a5079b549","resolution":{"observed_at":"2026-08-03T18:22:25.912949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:22:25.998750Z","title":"Videomultiagents: A multi-agent framework for video question answering, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.05774","last_updated":"2026-06-04T07:27:00Z","snapshot_observed_at":"2026-08-03T18:22:22.611333Z","submitted_at":"2025-12-05T15:03:48Z","title":"Active Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T18:22:25.998750Z"},"links":{"citing_paper":"/paper/2512.05774"},"observation_digest":"sha256:dcce786dc0d381b4e378f64850d119b22cd7d62c445cef67bb6a8121e54e77a6","observation_id":"a609a22e-1532-431d-874e-840a93ff94d5","resolution":{"observed_at":"2026-08-03T18:22:25.998750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:22:26.168260Z","title":"Aria: An open multimodal native mixture-of- experts model, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.05774","last_updated":"2026-06-04T07:27:00Z","snapshot_observed_at":"2026-08-03T18:22:22.611333Z","submitted_at":"2025-12-05T15:03:48Z","title":"Active Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T18:22:26.168260Z"},"links":{"citing_paper":"/paper/2512.05774"},"observation_digest":"sha256:69493f032778380e53134b74d71e8ee3f22900039f05461dc61f52ab94494619","observation_id":"262ee400-c61d-4a27-bdf0-8b6e971c0587","resolution":{"observed_at":"2026-08-03T18:22:26.168260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:22:26.390300Z","title":"BLIP: Bootstrapping language-image pre-training for unified vision- language understanding and generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.05774","last_updated":"2026-06-04T07:27:00Z","snapshot_observed_at":"2026-08-03T18:22:22.611333Z","submitted_at":"2025-12-05T15:03:48Z","title":"Active Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T18:22:26.390300Z"},"links":{"citing_paper":"/paper/2512.05774"},"observation_digest":"sha256:c65f4c7f96175fd4b992b0efcd308b8f806e4b666b45fb1b874fea1811d84e7b","observation_id":"0443557b-3779-4956-8287-b4338890baad","resolution":{"observed_at":"2026-08-03T18:22:26.390300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:22:26.553542Z","title":"Blip- 2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.05774","last_updated":"2026-06-04T07:27:00Z","snapshot_observed_at":"2026-08-03T18:22:22.611333Z","submitted_at":"2025-12-05T15:03:48Z","title":"Active Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T18:22:26.553542Z"},"links":{"citing_paper":"/paper/2512.05774"},"observation_digest":"sha256:43f5e302612b79d2a12ffaa4c85edad3275b15fdd6f4763c61a637e2c6e7a4a1","observation_id":"f5e69584-5200-4fa3-af81-4031da93e4d1","resolution":{"observed_at":"2026-08-03T18:22:26.553542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00574","last_updated":"2025-07-13T16:21:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-31T18:01:23Z","title":"VideoChat-Flash: Hierarchical Compression for Long-Context Video Modeling","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00574","snapshot_observed_at":"2026-08-03T18:22:26.641945Z","title":"Videochat-flash: Hierarchical compression for long-context video modeling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.05774","last_updated":"2026-06-04T07:27:00Z","snapshot_observed_at":"2026-08-03T18:22:22.611333Z","submitted_at":"2025-12-05T15:03:48Z","title":"Active Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T18:22:26.641945Z"},"links":{"cited_paper":"/paper/2501.00574","citing_paper":"/paper/2512.05774"},"observation_digest":"sha256:7531a0be9cd48d181c62ef53f0cb3012df36b5114dfa7b72f728c60750e6cab6","observation_id":"001a86da-c99c-44df-80e1-33be32c08153","resolution":{"observed_at":"2026-08-03T18:22:26.641945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-03T18:22:26.762749Z","title":"Video-llava: Learning united visual represen- tation by alignment before projection.arXiv preprint arXiv:2311.10122, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.05774","last_updated":"2026-06-04T07:27:00Z","snapshot_observed_at":"2026-08-03T18:22:22.611333Z","submitted_at":"2025-12-05T15:03:48Z","title":"Active Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T18:22:26.762749Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2512.05774"},"observation_digest":"sha256:81dba92066d44d2f34265ee7f76829ebc99847982dcb8642da657cbd710dbb77","observation_id":"5f810102-3f8f-484f-9f81-e56ce2ae8592","resolution":{"observed_at":"2026-08-03T18:22:26.762749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:22:26.967561Z","title":"Videomind: A chain-of-lora agent for long video reasoning.arXiv preprint arXiv:2503.13444, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.05774","last_updated":"2026-06-04T07:27:00Z","snapshot_observed_at":"2026-08-03T18:22:22.611333Z","submitted_at":"2025-12-05T15:03:48Z","title":"Active Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T18:22:26.967561Z"},"links":{"citing_paper":"/paper/2512.05774"},"observation_digest":"sha256:7352e29ff01f019dc57039fb30ef644f0fa1ec4ae90e14e3969072722c6b5d38","observation_id":"26962856-9399-4286-ac5d-1ca9184f4e80","resolution":{"observed_at":"2026-08-03T18:22:26.967561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:22:27.084218Z","title":"Video-rag: Visually-aligned retrieval-augmented long video comprehension, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.05774","last_updated":"2026-06-04T07:27:00Z","snapshot_observed_at":"2026-08-03T18:22:22.611333Z","submitted_at":"2025-12-05T15:03:48Z","title":"Active Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T18:22:27.084218Z"},"links":{"citing_paper":"/paper/2512.05774"},"observation_digest":"sha256:d98f48e5fe4eefe835d22c4aec5556814ca6a6db9646373c6d140aae1a5f6691","observation_id":"7c8a033b-4daa-4509-a97c-29ee15866f44","resolution":{"observed_at":"2026-08-03T18:22:27.084218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:22:27.138082Z","title":"Video active perception: Efficient inference-time long-form video understanding with vision-language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.05774","last_updated":"2026-06-04T07:27:00Z","snapshot_observed_at":"2026-08-03T18:22:22.611333Z","submitted_at":"2025-12-05T15:03:48Z","title":"Active Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T18:22:27.138082Z"},"links":{"citing_paper":"/paper/2512.05774"},"observation_digest":"sha256:79437567b67da9d33b5b96a83169504a887386736367f763abe70b998fa675fe","observation_id":"1a637fc8-5cf3-487b-a4c9-cf1a96e1e427","resolution":{"observed_at":"2026-08-03T18:22:27.138082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:22:27.224491Z","title":"Drvideo: Document retrieval based long video understanding, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.05774","last_updated":"2026-06-04T07:27:00Z","snapshot_observed_at":"2026-08-03T18:22:22.611333Z","submitted_at":"2025-12-05T15:03:48Z","title":"Active Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T18:22:27.224491Z"},"links":{"citing_paper":"/paper/2512.05774"},"observation_digest":"sha256:8d480159a481bfe6a6e38d5b5d28c990d9facb84656b0a5c8753bc5808649d15","observation_id":"2cee4a0c-a239-4bad-b23a-d498d99d529c","resolution":{"observed_at":"2026-08-03T18:22:27.224491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:22:27.307201Z","title":"Caviar: Critic- augmented video agentic reasoning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.05774","last_updated":"2026-06-04T07:27:00Z","snapshot_observed_at":"2026-08-03T18:22:22.611333Z","submitted_at":"2025-12-05T15:03:48Z","title":"Active Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T18:22:27.307201Z"},"links":{"citing_paper":"/paper/2512.05774"},"observation_digest":"sha256:2c6310577b857e64736e9a7f62444a266a1e746aed160f8faaba1410e8ebf67b","observation_id":"05599ce7-37fc-452c-abec-68d460b0c9e9","resolution":{"observed_at":"2026-08-03T18:22:27.307201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:22:27.377043Z","title":"Morevqa: Exploring modular reasoning models for video question answering, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.05774","last_updated":"2026-06-04T07:27:00Z","snapshot_observed_at":"2026-08-03T18:22:22.611333Z","submitted_at":"2025-12-05T15:03:48Z","title":"Active Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T18:22:27.377043Z"},"links":{"citing_paper":"/paper/2512.05774"},"observation_digest":"sha256:3a744f280ca9d51047b64679b1bdb76e74e31a99748a4d93ec4ae1f042ef85cd","observation_id":"49631c8e-88ed-4461-a3c3-7fc26d48f1c2","resolution":{"observed_at":"2026-08-03T18:22:27.377043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:22:27.424656Z","title":"Minerva: Evaluating complex video reasoning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.05774","last_updated":"2026-06-04T07:27:00Z","snapshot_observed_at":"2026-08-03T18:22:22.611333Z","submitted_at":"2025-12-05T15:03:48Z","title":"Active Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T18:22:27.424656Z"},"links":{"citing_paper":"/paper/2512.05774"},"observation_digest":"sha256:c13378e0eb3075b3f39865ed08d34cb7b101dda128a389da191fa042ccabe3b1","observation_id":"a6f4cec4-ea96-4fd3-9f37-7fdb3c242dbd","resolution":{"observed_at":"2026-08-03T18:22:27.424656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:22:27.486611Z","title":"Gpt-4o system card, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.05774","last_updated":"2026-06-04T07:27:00Z","snapshot_observed_at":"2026-08-03T18:22:22.611333Z","submitted_at":"2025-12-05T15:03:48Z","title":"Active Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-03T18:22:27.486611Z"},"links":{"citing_paper":"/paper/2512.05774"},"observation_digest":"sha256:c8366aaee5b2841512066bb2178c35ec2deefac62b274fbacd0017320f440484","observation_id":"2ff1b48f-623d-4978-845b-eb7449aa3c95","resolution":{"observed_at":"2026-08-03T18:22:27.486611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:22:27.558715Z","title":"Gpt-5 system card","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.05774","last_updated":"2026-06-04T07:27:00Z","snapshot_observed_at":"2026-08-03T18:22:22.611333Z","submitted_at":"2025-12-05T15:03:48Z","title":"Active Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-03T18:22:27.558715Z"},"links":{"citing_paper":"/paper/2512.05774"},"observation_digest":"sha256:003ab164c4e35f5c7667038cd722337c6bc94486c07c0a15d81c844dc28c2ed0","observation_id":"132af810-d857-4e6f-a1eb-be56ab1e266f","resolution":{"observed_at":"2026-08-03T18:22:27.558715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:22:27.648141Z","title":"Introducing gpt-4.1 in the api","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.05774","last_updated":"2026-06-04T07:27:00Z","snapshot_observed_at":"2026-08-03T18:22:22.611333Z","submitted_at":"2025-12-05T15:03:48Z","title":"Active Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-03T18:22:27.648141Z"},"links":{"citing_paper":"/paper/2512.05774"},"observation_digest":"sha256:07197ba7faa5e8eb82e72dcdc41a2fc7a0aab7cf77b4fcdf07593c9776ed7335","observation_id":"99181d7a-f852-4af0-8980-2471e20ddb0a","resolution":{"observed_at":"2026-08-03T18:22:27.648141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:22:27.738975Z","title":"Openai o3 and o4-mini system card","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.05774","last_updated":"2026-06-04T07:27:00Z","snapshot_observed_at":"2026-08-03T18:22:22.611333Z","submitted_at":"2025-12-05T15:03:48Z","title":"Active Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-03T18:22:27.738975Z"},"links":{"citing_paper":"/paper/2512.05774"},"observation_digest":"sha256:2612639f8343e034da068e9064eae3066e9d00ebb51e4d173499c5b67d003bbc","observation_id":"911c8666-d36a-4a65-b883-971d8ce3b972","resolution":{"observed_at":"2026-08-03T18:22:27.738975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:22:27.892470Z","title":"Conan: Progressive learning to reason like a detective over multi-scale visual evidence, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.05774","last_updated":"2026-06-04T07:27:00Z","snapshot_observed_at":"2026-08-03T18:22:22.611333Z","submitted_at":"2025-12-05T15:03:48Z","title":"Active Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-03T18:22:27.892470Z"},"links":{"citing_paper":"/paper/2512.05774"},"observation_digest":"sha256:3f3e31d0dcb49fb926f44c268567e234b8f089bd6bd1092aacfb3167935e1900","observation_id":"2dd44134-331c-4ae9-af8e-7cf9453fe103","resolution":{"observed_at":"2026-08-03T18:22:27.892470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:22:28.061767Z","title":"mapreduce","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.05774","last_updated":"2026-06-04T07:27:00Z","snapshot_observed_at":"2026-08-03T18:22:22.611333Z","submitted_at":"2025-12-05T15:03:48Z","title":"Active Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-03T18:22:28.061767Z"},"links":{"citing_paper":"/paper/2512.05774"},"observation_digest":"sha256:58e022c1473cab8c2264822d33e6e8dbe293882eebf2502311308d6a3a854fcc","observation_id":"e77f76e3-50af-4a2a-8762-2e1d9b573389","resolution":{"observed_at":"2026-08-03T18:22:28.061767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:22:28.145393Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.05774","last_updated":"2026-06-04T07:27:00Z","snapshot_observed_at":"2026-08-03T18:22:22.611333Z","submitted_at":"2025-12-05T15:03:48Z","title":"Active Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-03T18:22:28.145393Z"},"links":{"citing_paper":"/paper/2512.05774"},"observation_digest":"sha256:65873641de86f56e2b8d865e6073720dc299573def21636d6fb1ce6e3c45e669","observation_id":"af23dfd3-3c97-4ace-a30a-6c7158542e7e","resolution":{"observed_at":"2026-08-03T18:22:28.145393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:22:28.284376Z","title":"Understanding long videos in one multimodal language model pass","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.05774","last_updated":"2026-06-04T07:27:00Z","snapshot_observed_at":"2026-08-03T18:22:22.611333Z","submitted_at":"2025-12-05T15:03:48Z","title":"Active Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-03T18:22:28.284376Z"},"links":{"citing_paper":"/paper/2512.05774"},"observation_digest":"sha256:c17503096b1c79ea8383eb9bb4d51b681c2bbaa049f5788a899008c3a9acb657","observation_id":"619ddfdf-c83b-45bd-a8c6-fc89ff2b5cdf","resolution":{"observed_at":"2026-08-03T18:22:28.284376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:22:28.409448Z","title":"Ryoo, Honglu Zhou, Shrikant Kendre, Can Qin, Le Xue, Manli Shu, Jongwoo Park, Kanchana Ranasinghe, Silvio Savarese, Ran Xu, Caiming Xiong, and Juan Carlos Niebles","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.05774","last_updated":"2026-06-04T07:27:00Z","snapshot_observed_at":"2026-08-03T18:22:22.611333Z","submitted_at":"2025-12-05T15:03:48Z","title":"Active Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-03T18:22:28.409448Z"},"links":{"citing_paper":"/paper/2512.05774"},"observation_digest":"sha256:078d61d8d8b8d44cc9c8b6021abfa1c0177a9ff7009a6fa906c336cae41af2c7","observation_id":"12dd4acb-da3c-436d-b321-44e1a56ecbb5","resolution":{"observed_at":"2026-08-03T18:22:28.409448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:22:28.572270Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.05774","last_updated":"2026-06-04T07:27:00Z","snapshot_observed_at":"2026-08-03T18:22:22.611333Z","submitted_at":"2025-12-05T15:03:48Z","title":"Active Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-03T18:22:28.572270Z"},"links":{"citing_paper":"/paper/2512.05774"},"observation_digest":"sha256:18f44d0bbf97d8ca729360aa60e7b165224feaa293ecf2fe06fa09554da397cc","observation_id":"087a47bf-97b4-4a42-aae8-c0b9f794f8db","resolution":{"observed_at":"2026-08-03T18:22:28.572270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17434","last_updated":"2024-10-22T21:21:37Z","snapshot_observed_at":"2026-08-13T11:36:11.821356Z","submitted_at":"2024-10-22T21:21:37Z","title":"LongVU: Spatiotemporal Adaptive Compression for Long Video-Language Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17434","snapshot_observed_at":"2026-08-03T18:22:28.724700Z","title":"Kim, Bilge Soran, Raghuraman Krishnamoorthi, Mohamed Elhoseiny, and Vikas Chandra","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.05774","last_updated":"2026-06-04T07:27:00Z","snapshot_observed_at":"2026-08-03T18:22:22.611333Z","submitted_at":"2025-12-05T15:03:48Z","title":"Active Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-03T18:22:28.724700Z"},"links":{"cited_paper":"/paper/2410.17434","citing_paper":"/paper/2512.05774"},"observation_digest":"sha256:da86b4294adc882100f5e06a2c90f35f27f90f1af9706d9bffb3bdd48c2fb51e","observation_id":"e21123ba-21f9-4d4f-a740-e8356176de58","resolution":{"observed_at":"2026-08-03T18:22:28.724700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:22:28.882214Z","title":"Vgent: Graph-based retrieval-reasoning-augmented generation for long video understanding, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.05774","last_updated":"2026-06-04T07:27:00Z","snapshot_observed_at":"2026-08-03T18:22:22.611333Z","submitted_at":"2025-12-05T15:03:48Z","title":"Active Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-03T18:22:28.882214Z"},"links":{"citing_paper":"/paper/2512.05774"},"observation_digest":"sha256:bba15048c3aff3c521e1b68f0c9492da16e2d2b28c766938840c0c3225f7870a","observation_id":"490429ce-0cf9-43c4-be67-7f09c0650180","resolution":{"observed_at":"2026-08-03T18:22:28.882214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:22:28.991847Z","title":"Enhanc- ing video-llm reasoning via agent-of-thoughts distillation,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.05774","last_updated":"2026-06-04T07:27:00Z","snapshot_observed_at":"2026-08-03T18:22:22.611333Z","submitted_at":"2025-12-05T15:03:48Z","title":"Active Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-03T18:22:28.991847Z"},"links":{"citing_paper":"/paper/2512.05774"},"observation_digest":"sha256:9409c2388a4fbe7fc4ab8c6bc23616fb0456a4ebea2361036cd161fd92bf9c4d","observation_id":"f7ddc866-bff3-4019-abdb-451f732f8fd9","resolution":{"observed_at":"2026-08-03T18:22:28.991847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14485","last_updated":"2024-12-10T12:45:31Z","snapshot_observed_at":"2026-08-21T21:09:12.772866Z","submitted_at":"2024-09-22T15:13:31Z","title":"Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.14485","snapshot_observed_at":"2026-08-03T18:22:29.150095Z","title":"Video- xl: Extra-long vision language model for hour-scale video understanding.arXiv preprint arXiv:2409.14485, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.05774","last_updated":"2026-06-04T07:27:00Z","snapshot_observed_at":"2026-08-03T18:22:22.611333Z","submitted_at":"2025-12-05T15:03:48Z","title":"Active Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-03T18:22:29.150095Z"},"links":{"cited_paper":"/paper/2409.14485","citing_paper":"/paper/2512.05774"},"observation_digest":"sha256:6a455f093524c27091c2d751c6b25aef1a6e361fe38d98d56a3aa4f4d17046c0","observation_id":"b0b2081b-5f53-4d21-8b42-08d2cc83303b","resolution":{"observed_at":"2026-08-03T18:22:29.150095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:22:29.221334Z","title":"Scene exploration by vision-language models,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.05774","last_updated":"2026-06-04T07:27:00Z","snapshot_observed_at":"2026-08-03T18:22:22.611333Z","submitted_at":"2025-12-05T15:03:48Z","title":"Active Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-03T18:22:29.221334Z"},"links":{"citing_paper":"/paper/2512.05774"},"observation_digest":"sha256:4824d23fa4131ce555cd1a1d425a27754305663e58d864b04505e2fe3bd4b2b5","observation_id":"1e234f49-5701-4ddd-9fb5-01a86e983313","resolution":{"observed_at":"2026-08-03T18:22:29.221334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:22:29.372562Z","title":"Adaptive keyframe sampling for long video understanding, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.05774","last_updated":"2026-06-04T07:27:00Z","snapshot_observed_at":"2026-08-03T18:22:22.611333Z","submitted_at":"2025-12-05T15:03:48Z","title":"Active Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-03T18:22:29.372562Z"},"links":{"citing_paper":"/paper/2512.05774"},"observation_digest":"sha256:3d28caeffff910db19ced6ea8214cad9f64a2c96c8a0d744fe78df889fe75b3f","observation_id":"fa5167e0-e596-42fc-a9fd-4e1682a1dbce","resolution":{"observed_at":"2026-08-03T18:22:29.372562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:22:29.477922Z","title":"Moss-chatv: Reinforcement learning with process reasoning reward for video temporal reasoning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.05774","last_updated":"2026-06-04T07:27:00Z","snapshot_observed_at":"2026-08-03T18:22:22.611333Z","submitted_at":"2025-12-05T15:03:48Z","title":"Active Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-03T18:22:29.477922Z"},"links":{"citing_paper":"/paper/2512.05774"},"observation_digest":"sha256:5bffead4ce2e3b556d1d71d51ee113a9e3e5374fb05337fa85116b5f1ffe7c0f","observation_id":"2d5d6bbf-c1e9-4f25-9bfb-b5f651670046","resolution":{"observed_at":"2026-08-03T18:22:29.477922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:22:29.633102Z","title":"Gemini 2.5: Pushing the frontier with advanced reasoning, multimodality, long context, and next generation agentic capabilities, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.05774","last_updated":"2026-06-04T07:27:00Z","snapshot_observed_at":"2026-08-03T18:22:22.611333Z","submitted_at":"2025-12-05T15:03:48Z","title":"Active Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-03T18:22:29.633102Z"},"links":{"citing_paper":"/paper/2512.05774"},"observation_digest":"sha256:a90e59c0642fde7389ce01881686cb9bde95d03a1c246add0e6e9ea8c3a59f7a","observation_id":"87eb7486-4da8-47a0-b224-99d022bbcb82","resolution":{"observed_at":"2026-08-03T18:22:29.633102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:22:29.838794Z","title":"Qwen3-vl: A general vision-language model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.05774","last_updated":"2026-06-04T07:27:00Z","snapshot_observed_at":"2026-08-03T18:22:22.611333Z","submitted_at":"2025-12-05T15:03:48Z","title":"Active Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-03T18:22:29.838794Z"},"links":{"citing_paper":"/paper/2512.05774"},"observation_digest":"sha256:68d6310909b4841150676553d9af6144cedc2fad59cabdc90a1154b4a6c17b75","observation_id":"18b20e16-d5a0-4109-86bd-9bc1c76dc5e9","resolution":{"observed_at":"2026-08-03T18:22:29.838794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:22:30.027703Z","title":"Seed1.5-vl technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.05774","last_updated":"2026-06-04T07:27:00Z","snapshot_observed_at":"2026-08-03T18:22:22.611333Z","submitted_at":"2025-12-05T15:03:48Z","title":"Active Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-03T18:22:30.027703Z"},"links":{"citing_paper":"/paper/2512.05774"},"observation_digest":"sha256:5d982168bc52bdbba5e4a8992c3267ab15c4373d76c417349e9cd3dd4cd3991d","observation_id":"e776a9fe-6365-4d5a-9a4f-f9700f38a5e4","resolution":{"observed_at":"2026-08-03T18:22:30.027703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:22:30.241779Z","title":"Tarsier: Recipes for training and evaluating large video description models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.05774","last_updated":"2026-06-04T07:27:00Z","snapshot_observed_at":"2026-08-03T18:22:22.611333Z","submitted_at":"2025-12-05T15:03:48Z","title":"Active Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-03T18:22:30.241779Z"},"links":{"citing_paper":"/paper/2512.05774"},"observation_digest":"sha256:539689c2c1f612ed238c13d2fbe1e957a74ea8401309f52cd37da0c2b79e1ace","observation_id":"38cae0a9-08a6-4b36-b17d-45cc3b815ccb","resolution":{"observed_at":"2026-08-03T18:22:30.241779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:22:30.363995Z","title":"Videorft: Incentivizing video reasoning capability in mllms via reinforced fine-tuning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.05774","last_updated":"2026-06-04T07:27:00Z","snapshot_observed_at":"2026-08-03T18:22:22.611333Z","submitted_at":"2025-12-05T15:03:48Z","title":"Active Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-03T18:22:30.363995Z"},"links":{"citing_paper":"/paper/2512.05774"},"observation_digest":"sha256:aef3f5b641117d284b5b4eba833d1faf239c350e916cd6f9fe9a0716d100b837","observation_id":"f36d90b2-6847-4ac8-beb3-1267664dc549","resolution":{"observed_at":"2026-08-03T18:22:30.363995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:22:30.550128Z","title":"Vamos: Versatile action models for video understanding, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.05774","last_updated":"2026-06-04T07:27:00Z","snapshot_observed_at":"2026-08-03T18:22:22.611333Z","submitted_at":"2025-12-05T15:03:48Z","title":"Active Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-03T18:22:30.550128Z"},"links":{"citing_paper":"/paper/2512.05774"},"observation_digest":"sha256:120db8842062cea54deaf13253e6899c26366cd65c1f55492b1fccc55036b5d3","observation_id":"d1f8c0b5-cc6a-4f5d-af24-f97a3fe5713f","resolution":{"observed_at":"2026-08-03T18:22:30.550128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:22:30.715885Z","title":"Alvarez, Lei Zhang, and Zhiding Yu","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.05774","last_updated":"2026-06-04T07:27:00Z","snapshot_observed_at":"2026-08-03T18:22:22.611333Z","submitted_at":"2025-12-05T15:03:48Z","title":"Active Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-03T18:22:30.715885Z"},"links":{"citing_paper":"/paper/2512.05774"},"observation_digest":"sha256:c2c80aa4a3f6dcfd9bdc205e208c64075ed40d06e917d991c4de7d7681490439","observation_id":"6265b3ef-4462-417f-9743-97636983d1a9","resolution":{"observed_at":"2026-08-03T18:22:30.715885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:22:30.823378Z","title":"thinking with videos","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.05774","last_updated":"2026-06-04T07:27:00Z","snapshot_observed_at":"2026-08-03T18:22:22.611333Z","submitted_at":"2025-12-05T15:03:48Z","title":"Active Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-03T18:22:30.823378Z"},"links":{"citing_paper":"/paper/2512.05774"},"observation_digest":"sha256:c4db22f92a61a3a2bd425bef30b954ef2ea42ecef6401d18262d997562383d6c","observation_id":"ff1aabae-64f4-4165-a500-5d40bcea4c2f","resolution":{"observed_at":"2026-08-03T18:22:30.823378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18265","last_updated":"2025-08-27T14:39:45Z","snapshot_observed_at":"2026-08-17T12:32:16.575866Z","submitted_at":"2025-08-25T17:58:17Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.18265","snapshot_observed_at":"2026-08-03T18:22:30.883136Z","title":"Internvl3.5: Advancing open-source multimodal models in versatility, reasoning, and efficiency","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.05774","last_updated":"2026-06-04T07:27:00Z","snapshot_observed_at":"2026-08-03T18:22:22.611333Z","submitted_at":"2025-12-05T15:03:48Z","title":"Active Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-03T18:22:30.883136Z"},"links":{"cited_paper":"/paper/2508.18265","citing_paper":"/paper/2512.05774"},"observation_digest":"sha256:eb7d7f265bb202faeb521edc3d813e084888e3179b60db776786b634980d1347","observation_id":"71804053-5966-4169-a2a3-7532df86e9e2","resolution":{"observed_at":"2026-08-03T18:22:30.883136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:22:31.006785Z","title":"Videoagent: Long-form video understanding with large language model as agent, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.05774","last_updated":"2026-06-04T07:27:00Z","snapshot_observed_at":"2026-08-03T18:22:22.611333Z","submitted_at":"2025-12-05T15:03:48Z","title":"Active Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-03T18:22:31.006785Z"},"links":{"citing_paper":"/paper/2512.05774"},"observation_digest":"sha256:130b263485f8e30ecbc5abb2ad53c41ae2ff1c6ef9950fd7e01f8ea85cf4e1e7","observation_id":"b39fdc55-995d-479d-8887-7be32c9ce189","resolution":{"observed_at":"2026-08-03T18:22:31.006785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:22:31.129405Z","title":"Adaretake: Adaptive redundancy reduction to perceive longer for video-language understanding, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.05774","last_updated":"2026-06-04T07:27:00Z","snapshot_observed_at":"2026-08-03T18:22:22.611333Z","submitted_at":"2025-12-05T15:03:48Z","title":"Active Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-03T18:22:31.129405Z"},"links":{"citing_paper":"/paper/2512.05774"},"observation_digest":"sha256:31530a61c272c935551ccdca93ef98938eec8b2fef25e42ba594a97b93e3c620","observation_id":"cf36da34-5af5-4ead-bb12-041df948da16","resolution":{"observed_at":"2026-08-03T18:22:31.129405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-14T02:35:09.273544Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.13377","snapshot_observed_at":"2026-08-03T18:22:31.236016Z","title":"Timezero: Temporal video grounding with reasoning-guided lvlm.arXiv preprint arXiv:2503.13377, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.05774","last_updated":"2026-06-04T07:27:00Z","snapshot_observed_at":"2026-08-03T18:22:22.611333Z","submitted_at":"2025-12-05T15:03:48Z","title":"Active Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-03T18:22:31.236016Z"},"links":{"cited_paper":"/paper/2503.13377","citing_paper":"/paper/2512.05774"},"observation_digest":"sha256:0f67d85dec02f105aef6ac98e6145064e1296c92e28777f3df2ad4ecc86ca2bd","observation_id":"092753b1-aab3-4aee-806c-3130dd836dc9","resolution":{"observed_at":"2026-08-03T18:22:31.236016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19209","last_updated":"2025-03-14T13:57:16Z","snapshot_observed_at":"2026-08-17T21:35:27.995630Z","submitted_at":"2024-05-29T15:49:09Z","title":"VideoTree: Adaptive Tree-based Video Representation for LLM Reasoning on Long Videos","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19209","snapshot_observed_at":"2026-08-03T18:22:31.365284Z","title":"Videotree: Adaptive tree-based video representation for llm reasoning on long videos.arXiv preprint arXiv:2405.19209,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.05774","last_updated":"2026-06-04T07:27:00Z","snapshot_observed_at":"2026-08-03T18:22:22.611333Z","submitted_at":"2025-12-05T15:03:48Z","title":"Active Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-03T18:22:31.365284Z"},"links":{"cited_paper":"/paper/2405.19209","citing_paper":"/paper/2512.05774"},"observation_digest":"sha256:1bd65a80a9f6478f30d049070bc35cc93b0a2aabeb0cca05da240fef4e00b8d3","observation_id":"ecc2491c-45b2-4cab-bf74-e1e0057f03fa","resolution":{"observed_at":"2026-08-03T18:22:31.365284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:22:31.498639Z","title":"Videochat-a1: Thinking with long videos by chain-of-shot reasoning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.05774","last_updated":"2026-06-04T07:27:00Z","snapshot_observed_at":"2026-08-03T18:22:22.611333Z","submitted_at":"2025-12-05T15:03:48Z","title":"Active Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-03T18:22:31.498639Z"},"links":{"citing_paper":"/paper/2512.05774"},"observation_digest":"sha256:7c50edd8d02b959f1405f6e6eb801af556297b3ca87d23a4d5a64fecd5d68a1e","observation_id":"b369d48e-fe31-46df-bd24-a9df4d21cbb2","resolution":{"observed_at":"2026-08-03T18:22:31.498639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:22:31.638487Z","title":"Video-RTS: Re- thinking reinforcement learning and test-time scaling for ef- ficient and enhanced video reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.05774","last_updated":"2026-06-04T07:27:00Z","snapshot_observed_at":"2026-08-03T18:22:22.611333Z","submitted_at":"2025-12-05T15:03:48Z","title":"Active Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-03T18:22:31.638487Z"},"links":{"citing_paper":"/paper/2512.05774"},"observation_digest":"sha256:b9c758418dc29c4ee38af05d7dfcbe8bdf9d9484ccb50abee8538d83d6711efe","observation_id":"89b3596d-ed6b-4f1a-9adb-0972a57588e4","resolution":{"observed_at":"2026-08-03T18:22:31.638487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:22:31.768007Z","title":"Longvideobench: A benchmark for long-context interleaved video-language understanding.Advances in Neural Informa- tion Processing Systems, 37:28828–28857, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.05774","last_updated":"2026-06-04T07:27:00Z","snapshot_observed_at":"2026-08-03T18:22:22.611333Z","submitted_at":"2025-12-05T15:03:48Z","title":"Active Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-03T18:22:31.768007Z"},"links":{"citing_paper":"/paper/2512.05774"},"observation_digest":"sha256:4e99d0657147ee31b67e1594452fd77e1f898106d10896ae211ff8ee6685ebaf","observation_id":"fce5a10f-891c-46f8-8bad-75a845ac952b","resolution":{"observed_at":"2026-08-03T18:22:31.768007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:22:31.863417Z","title":"Vision in action: Learning active perception from human demonstrations, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.05774","last_updated":"2026-06-04T07:27:00Z","snapshot_observed_at":"2026-08-03T18:22:22.611333Z","submitted_at":"2025-12-05T15:03:48Z","title":"Active Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-03T18:22:31.863417Z"},"links":{"citing_paper":"/paper/2512.05774"},"observation_digest":"sha256:b1aa38736a210aff90332291f1f60086eaa2e48707fe3c30dbe92eccbb503c40","observation_id":"149c61bb-fc16-4a96-9749-ad062f8d1013","resolution":{"observed_at":"2026-08-03T18:22:31.863417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08035","last_updated":"2025-08-09T10:54:59Z","snapshot_observed_at":"2026-08-08T19:38:26.415599Z","submitted_at":"2024-06-12T09:36:52Z","title":"LVBench: An Extreme Long Video Understanding Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08035","snapshot_observed_at":"2026-08-03T18:22:31.984503Z","title":"Lvbench: An extreme long video under- standing benchmark.arXiv preprint arXiv:2406.08035, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.05774","last_updated":"2026-06-04T07:27:00Z","snapshot_observed_at":"2026-08-03T18:22:22.611333Z","submitted_at":"2025-12-05T15:03:48Z","title":"Active Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-03T18:22:31.984503Z"},"links":{"cited_paper":"/paper/2406.08035","citing_paper":"/paper/2512.05774"},"observation_digest":"sha256:41a8a9d1fcbc787f5c7c9e80402d13ae2c2da7d6cca4357fdf5c81f409153e9a","observation_id":"c8f813f9-4627-43ba-a7b0-2668afa96c4c","resolution":{"observed_at":"2026-08-03T18:22:31.984503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:22:32.088897Z","title":"Ava: To- wards agentic video analytics with vision language models,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.05774","last_updated":"2026-06-04T07:27:00Z","snapshot_observed_at":"2026-08-03T18:22:22.611333Z","submitted_at":"2025-12-05T15:03:48Z","title":"Active Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-03T18:22:32.088897Z"},"links":{"citing_paper":"/paper/2512.05774"},"observation_digest":"sha256:0e41600e8a3c99c5fa6890f9f920ef02690bcd64d2cc7400a313f1e1d4a75e86","observation_id":"86733491-3b8a-4b3c-809b-1c36a5df3da9","resolution":{"observed_at":"2026-08-03T18:22:32.088897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09146","last_updated":"2025-09-02T09:52:40Z","snapshot_observed_at":"2026-08-16T22:28:31.759830Z","submitted_at":"2025-03-12T08:16:39Z","title":"Generative Frame Sampler for Long Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09146","snapshot_observed_at":"2026-08-03T18:22:32.132710Z","title":"Generative frame sampler for long video understanding.arXiv preprint arXiv:2503.09146, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.05774","last_updated":"2026-06-04T07:27:00Z","snapshot_observed_at":"2026-08-03T18:22:22.611333Z","submitted_at":"2025-12-05T15:03:48Z","title":"Active Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-03T18:22:32.132710Z"},"links":{"cited_paper":"/paper/2503.09146","citing_paper":"/paper/2512.05774"},"observation_digest":"sha256:07c151676d8ba7c8241f5885d1701672cb816e1f680d1aac9d2ada8d77b483dc","observation_id":"2c3b0acc-dca0-43c3-8a5e-8d78aea8b37e","resolution":{"observed_at":"2026-08-03T18:22:32.132710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:22:32.183016Z","title":"Re-thinking temporal search for long- form video understanding, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.05774","last_updated":"2026-06-04T07:27:00Z","snapshot_observed_at":"2026-08-03T18:22:22.611333Z","submitted_at":"2025-12-05T15:03:48Z","title":"Active Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-03T18:22:32.183016Z"},"links":{"citing_paper":"/paper/2512.05774"},"observation_digest":"sha256:b27e6764b7da416602570821fb7908fddf15f95782f2ecbc8483429c6e5d3354","observation_id":"38331be7-93c8-4c26-bff3-c5e9b0faef54","resolution":{"observed_at":"2026-08-03T18:22:32.183016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:22:32.259304Z","title":"End-to-end learning of action detection from frame glimpses in videos","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2512.05774","last_updated":"2026-06-04T07:27:00Z","snapshot_observed_at":"2026-08-03T18:22:22.611333Z","submitted_at":"2025-12-05T15:03:48Z","title":"Active Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-03T18:22:32.259304Z"},"links":{"citing_paper":"/paper/2512.05774"},"observation_digest":"sha256:f4228672c4cced376d4b66e2b10beeda7e8902a5018b10f7a4d2d74103a438c6","observation_id":"f8569c7d-3f0f-4825-8be2-47c14e8f7893","resolution":{"observed_at":"2026-08-03T18:22:32.259304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:22:32.320679Z","title":"Self-chained image-language model for video localization and question answering","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.05774","last_updated":"2026-06-04T07:27:00Z","snapshot_observed_at":"2026-08-03T18:22:22.611333Z","submitted_at":"2025-12-05T15:03:48Z","title":"Active Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-03T18:22:32.320679Z"},"links":{"citing_paper":"/paper/2512.05774"},"observation_digest":"sha256:d2980e878b9d188138b600a050880a78d7735d43bce14c9da985a452485e5b1f","observation_id":"2aac6a72-52bf-480a-951c-0ed00dfe12b4","resolution":{"observed_at":"2026-08-03T18:22:32.320679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:22:32.363429Z","title":"Videoex- plorer: Think with videos for agentic long-video understand- ing, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.05774","last_updated":"2026-06-04T07:27:00Z","snapshot_observed_at":"2026-08-03T18:22:22.611333Z","submitted_at":"2025-12-05T15:03:48Z","title":"Active Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-03T18:22:32.363429Z"},"links":{"citing_paper":"/paper/2512.05774"},"observation_digest":"sha256:ec7b9aff762197af3e2eb6957b3dd39562848895418559cdbafe2be9f6f715ee","observation_id":"0414c75e-1cd8-4249-b2e6-2879148ed658","resolution":{"observed_at":"2026-08-03T18:22:32.363429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:22:32.419785Z","title":"A simple llm framework for long-range video question-answering, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.05774","last_updated":"2026-06-04T07:27:00Z","snapshot_observed_at":"2026-08-03T18:22:22.611333Z","submitted_at":"2025-12-05T15:03:48Z","title":"Active Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-03T18:22:32.419785Z"},"links":{"citing_paper":"/paper/2512.05774"},"observation_digest":"sha256:0abe5b41c7731614db8be7fe60c7d0fe7d62c8ccf5b58937d2c94aee433525c7","observation_id":"0a4a2750-876e-4854-b316-4c81608b8cc8","resolution":{"observed_at":"2026-08-03T18:22:32.419785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:22:32.473110Z","title":"Silvr: A simple language-based video rea- soning framework, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.05774","last_updated":"2026-06-04T07:27:00Z","snapshot_observed_at":"2026-08-03T18:22:22.611333Z","submitted_at":"2025-12-05T15:03:48Z","title":"Active Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-03T18:22:32.473110Z"},"links":{"citing_paper":"/paper/2512.05774"},"observation_digest":"sha256:24cb06b4bdb59531848e9f424e4ad0d5b7fe48ec5e5430b20b97e57d1300ad40","observation_id":"980d2234-069b-411b-86f1-5cef7ff19c02","resolution":{"observed_at":"2026-08-03T18:22:32.473110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:22:32.545083Z","title":"Thinking with videos: Multimodal tool- augmented reinforcement learning for long video reasoning,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.05774","last_updated":"2026-06-04T07:27:00Z","snapshot_observed_at":"2026-08-03T18:22:22.611333Z","submitted_at":"2025-12-05T15:03:48Z","title":"Active Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-03T18:22:32.545083Z"},"links":{"citing_paper":"/paper/2512.05774"},"observation_digest":"sha256:494e1fed9d58a81ebc456daf77241b71c21ce899e81f27b2201760fd7d33cf68","observation_id":"ab704eb6-7243-428e-b602-cab8b96c728c","resolution":{"observed_at":"2026-08-03T18:22:32.545083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-03T18:22:32.646227Z","title":"Long context transfer from language to vision.arXiv preprint arXiv:2406.16852, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.05774","last_updated":"2026-06-04T07:27:00Z","snapshot_observed_at":"2026-08-03T18:22:22.611333Z","submitted_at":"2025-12-05T15:03:48Z","title":"Active Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-03T18:22:32.646227Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2512.05774"},"observation_digest":"sha256:29b4c67593163c667325a2ab822d5921dea0274ca303ebe82c4790bfeebba388","observation_id":"82e609f1-d849-4451-89ca-dde64e8fbb9e","resolution":{"observed_at":"2026-08-03T18:22:32.646227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:22:32.730480Z","title":"Deep video discovery: Agentic search with tool use for long-form video understanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.05774","last_updated":"2026-06-04T07:27:00Z","snapshot_observed_at":"2026-08-03T18:22:22.611333Z","submitted_at":"2025-12-05T15:03:48Z","title":"Active Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-03T18:22:32.730480Z"},"links":{"citing_paper":"/paper/2512.05774"},"observation_digest":"sha256:19e617e434705043b08a0a9c1fc2d20265a12425e90d9d65f4bd0322e72a1f09","observation_id":"769280f2-ed68-4882-8a21-12a21bf414ea","resolution":{"observed_at":"2026-08-03T18:22:32.730480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-19T14:11:01.412437Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02713","snapshot_observed_at":"2026-08-03T18:22:32.845533Z","title":"Video instruction tuning with synthetic data.arXiv preprint arXiv:2410.02713, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.05774","last_updated":"2026-06-04T07:27:00Z","snapshot_observed_at":"2026-08-03T18:22:22.611333Z","submitted_at":"2025-12-05T15:03:48Z","title":"Active Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-03T18:22:32.845533Z"},"links":{"cited_paper":"/paper/2410.02713","citing_paper":"/paper/2512.05774"},"observation_digest":"sha256:dd9e159a9afeb6df5b0e9fbba31d99f7e0ac44fdf5294201d272b5e8cf07dd74","observation_id":"67934772-bf1f-4c7c-b7cf-dd600c3842b5","resolution":{"observed_at":"2026-08-03T18:22:32.845533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04264","last_updated":"2025-01-01T15:53:58Z","snapshot_observed_at":"2026-08-03T20:38:36.602554Z","submitted_at":"2024-06-06T17:09:32Z","title":"MLVU: Benchmarking Multi-task Long Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04264","snapshot_observed_at":"2026-08-03T18:22:32.900214Z","title":"Mlvu: A comprehensive benchmark for multi-task long video understanding.arXiv preprint arXiv:2406.04264, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.05774","last_updated":"2026-06-04T07:27:00Z","snapshot_observed_at":"2026-08-03T18:22:22.611333Z","submitted_at":"2025-12-05T15:03:48Z","title":"Active Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-03T18:22:32.900214Z"},"links":{"cited_paper":"/paper/2406.04264","citing_paper":"/paper/2512.05774"},"observation_digest":"sha256:70bb0c16bf8859f2206ae15325544d3753277dcffbd11c2b8fe7303efef9c806","observation_id":"f027c173-a06d-429c-a644-f5f35ad74c61","resolution":{"observed_at":"2026-08-03T18:22:32.900214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:22:32.953045Z","title":"Reagent-v: A reward-driven multi-agent framework for video understand- ing, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.05774","last_updated":"2026-06-04T07:27:00Z","snapshot_observed_at":"2026-08-03T18:22:22.611333Z","submitted_at":"2025-12-05T15:03:48Z","title":"Active Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-03T18:22:32.953045Z"},"links":{"citing_paper":"/paper/2512.05774"},"observation_digest":"sha256:cf5ba01e200c5925a0f0ded0ebad1a56c889127e690703ff70275cd90fa79bb9","observation_id":"200105ba-b457-4315-ac7d-5d04921ef0d5","resolution":{"observed_at":"2026-08-03T18:22:32.953045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:22:33.016012Z","title":"Active-o3: Empowering multimodal large language models with active perception via grpo, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.05774","last_updated":"2026-06-04T07:27:00Z","snapshot_observed_at":"2026-08-03T18:22:22.611333Z","submitted_at":"2025-12-05T15:03:48Z","title":"Active Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-03T18:22:33.016012Z"},"links":{"citing_paper":"/paper/2512.05774"},"observation_digest":"sha256:2ab34f93b9d14459630fe4910a2be0a84328fb18edee9da712b7d55d1bfc2cc0","observation_id":"73c19dd3-b2f3-42dc-a70c-1abfcae64bf0","resolution":{"observed_at":"2026-08-03T18:22:33.016012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:22:33.147794Z","title":"A.i.r.: Enabling adaptive, iterative, and reasoning-based frame selection for video question answering,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.05774","last_updated":"2026-06-04T07:27:00Z","snapshot_observed_at":"2026-08-03T18:22:22.611333Z","submitted_at":"2025-12-05T15:03:48Z","title":"Active Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-03T18:22:33.147794Z"},"links":{"citing_paper":"/paper/2512.05774"},"observation_digest":"sha256:0b3993a22fe7206ff4418a8e22aaae138e4ddc990b72ee9a311af08cd321adb1","observation_id":"c8804358-9b18-4108-8265-4f6569830d65","resolution":{"observed_at":"2026-08-03T18:22:33.147794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:22:33.231784Z","title":"usually range from 4 to 5 feet in length","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.05774","last_updated":"2026-06-04T07:27:00Z","snapshot_observed_at":"2026-08-03T18:22:22.611333Z","submitted_at":"2025-12-05T15:03:48Z","title":"Active Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-03T18:22:33.231784Z"},"links":{"citing_paper":"/paper/2512.05774"},"observation_digest":"sha256:b55494a1b31f25dfe2c2983eb4d54bfcb07c87ad0955d7fb885f8f3e0cf19bf5","observation_id":"17bc61a3-56c6-4fe4-ad3b-890354a3163c","resolution":{"observed_at":"2026-08-03T18:22:33.231784Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2512.05774","last_updated":"2026-06-04T07:27:00Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-03T18:22:22.611333Z","submitted_at":"2025-12-05T15:03:48Z","title":"Active Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding"},"reference_resolution":{"displayed":85,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":84,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":85},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 85 of 85 outbound references and 11 inbound Pith citation observations for arXiv:2512.05774."}