{"as_of":"2026-08-09T16:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8c800da06fcdda791af300e37d25bc8670ddbc51262b6e6965dbe6403b8287e6","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T21:27:36.485905Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-11T12:10:52.100410Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.07680","last_updated":"2025-09-09T17:59:39Z","snapshot_observed_at":"2026-08-04T21:27:30.632810Z","submitted_at":"2025-09-09T17:59:39Z","title":"CAViAR: Critic-Augmented Video Agentic Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.07680","snapshot_observed_at":"2026-07-11T12:10:52.100410Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04872","last_updated":"2026-07-06T09:47:23Z","snapshot_observed_at":"2026-08-09T06:09:59.502332Z","submitted_at":"2026-07-06T09:47:23Z","title":"EventCoT: Event-centric Video Chain-of-thought for Reasoning Temporal Localization","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-07-11T12:10:52.100410Z"},"links":{"cited_paper":"/paper/2509.07680","citing_paper":"/paper/2607.04872"},"observation_digest":"sha256:9a0c07072b41ac7c099e3db190e552479dd14ca930473aee2c305464ed23b9b0","observation_id":"8c9e2c2c-f4c5-4319-9144-045b73a1fd8c","resolution":{"observed_at":"2026-07-11T12:10:52.100410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2509.07680/citation-record","integrity":"/paper/2509.07680/integrity","json":"/paper/2509.07680/citation-record.json","paper":"/paper/2509.07680"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:27:33.487697Z","title":"Egoschema: A diagnostic benchmark for very long-form video language understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.07680","last_updated":"2025-09-09T17:59:39Z","snapshot_observed_at":"2026-08-04T21:27:30.632810Z","submitted_at":"2025-09-09T17:59:39Z","title":"CAViAR: Critic-Augmented Video Agentic Reasoning","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-04T21:27:33.487697Z"},"links":{"citing_paper":"/paper/2509.07680"},"observation_digest":"sha256:611298b4192d77161426003a97aa43b45194f91aeb7a921e80df7ac8dcfde8dd","observation_id":"049fe0d7-f676-4ee8-a644-fb49a454e9c4","resolution":{"observed_at":"2026-08-04T21:27:33.487697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:27:39.433148Z","title":"Videoagent: Long-form video understanding with large language model as agent","venue":null,"work_id":"98c82fc1-54b4-417b-aa9e-fa3604443ba0","year":2024},"citing_paper":{"arxiv_id":"2509.07680","last_updated":"2025-09-09T17:59:39Z","snapshot_observed_at":"2026-08-04T21:27:30.632810Z","submitted_at":"2025-09-09T17:59:39Z","title":"CAViAR: Critic-Augmented Video Agentic Reasoning","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-04T21:27:33.532164Z"},"links":{"citing_paper":"/paper/2509.07680"},"observation_digest":"sha256:5b1a87b528702a354c9d69ab8b7255000e6ab4a171e2298fc83088eb5558f50b","observation_id":"b25f5195-6d7e-4ad1-828a-26e7aa2bef37","resolution":{"observed_at":"2026-08-04T21:27:39.555502Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:27:39.179261Z","title":"Self-chained image-language model for video localization and question answering","venue":null,"work_id":"bbe09684-eca1-4443-9c2f-aa06b8e08199","year":2023},"citing_paper":{"arxiv_id":"2509.07680","last_updated":"2025-09-09T17:59:39Z","snapshot_observed_at":"2026-08-04T21:27:30.632810Z","submitted_at":"2025-09-09T17:59:39Z","title":"CAViAR: Critic-Augmented Video Agentic Reasoning","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-04T21:27:33.685027Z"},"links":{"citing_paper":"/paper/2509.07680"},"observation_digest":"sha256:a3c376952ac105bc3a88d3dc2bf41083537d4587f6b930496dcea4888b4fc23b","observation_id":"eb4beec8-12f7-4875-8dcd-ff4ba7c6fc2d","resolution":{"observed_at":"2026-08-04T21:27:39.282949Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.17235","last_updated":"2024-10-10T05:17:00Z","snapshot_observed_at":"2026-07-06T17:09:24.271573Z","submitted_at":"2023-12-28T18:58:01Z","title":"A Simple LLM Framework for Long-Range Video Question-Answering","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.17235","snapshot_observed_at":"2026-08-04T21:27:33.767446Z","title":"A simple llm framework for long-range video question-answering","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.07680","last_updated":"2025-09-09T17:59:39Z","snapshot_observed_at":"2026-08-04T21:27:30.632810Z","submitted_at":"2025-09-09T17:59:39Z","title":"CAViAR: Critic-Augmented Video Agentic Reasoning","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-04T21:27:33.767446Z"},"links":{"cited_paper":"/paper/2312.17235","citing_paper":"/paper/2509.07680"},"observation_digest":"sha256:6cbbedcf2196e006a4587e2edd40a89747a6958ed7661f0e8f9107b7a1487a85","observation_id":"4c6df0f6-e239-4eee-b50c-4bf0e9b1d78f","resolution":{"observed_at":"2026-08-04T21:27:33.767446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-04T21:27:33.848649Z","title":"Qwen2.5-vl technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.07680","last_updated":"2025-09-09T17:59:39Z","snapshot_observed_at":"2026-08-04T21:27:30.632810Z","submitted_at":"2025-09-09T17:59:39Z","title":"CAViAR: Critic-Augmented Video Agentic Reasoning","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-04T21:27:33.848649Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2509.07680"},"observation_digest":"sha256:a2c896aa34f3dbcdfbebd9e4ea5987d6458eb08ce2a6fa9387e9c03cd3b5b26d","observation_id":"cbf5aef3-9f65-4bac-b025-27198498e1e4","resolution":{"observed_at":"2026-08-04T21:27:33.848649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-04T21:27:33.916746Z","title":"How far are we to gpt-4v? closing the gap to commercial multimodal models with open-source suites","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.07680","last_updated":"2025-09-09T17:59:39Z","snapshot_observed_at":"2026-08-04T21:27:30.632810Z","submitted_at":"2025-09-09T17:59:39Z","title":"CAViAR: Critic-Augmented Video Agentic Reasoning","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-04T21:27:33.916746Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2509.07680"},"observation_digest":"sha256:76f80f73b367da87be1334f9b790d30008502025668cbb100682e22f8f2bcdab","observation_id":"23865ffd-44b1-412e-9dd3-e5d1537515b8","resolution":{"observed_at":"2026-08-04T21:27:33.916746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-04T21:27:33.985149Z","title":"Videollama 2: Advancing spatial-temporal modeling and audio understanding in video-llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.07680","last_updated":"2025-09-09T17:59:39Z","snapshot_observed_at":"2026-08-04T21:27:30.632810Z","submitted_at":"2025-09-09T17:59:39Z","title":"CAViAR: Critic-Augmented Video Agentic Reasoning","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-04T21:27:33.985149Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2509.07680"},"observation_digest":"sha256:2df7fbfeca13c06b25fe974f65d7fc2f7ea457182ffb5fc687b0a9d9e926a077","observation_id":"f014ec7f-807a-4c89-9dce-1e96c8687105","resolution":{"observed_at":"2026-08-04T21:27:33.985149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:27:34.023884Z","title":"Deep reinforcement learning from human preferences","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.07680","last_updated":"2025-09-09T17:59:39Z","snapshot_observed_at":"2026-08-04T21:27:30.632810Z","submitted_at":"2025-09-09T17:59:39Z","title":"CAViAR: Critic-Augmented Video Agentic Reasoning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-04T21:27:34.023884Z"},"links":{"citing_paper":"/paper/2509.07680"},"observation_digest":"sha256:5101c2eb90b4586b9d92a66f8ee14bad1e96d9840f64d03a426fef2184c1b4d4","observation_id":"3e73f29b-c5a7-439b-93ef-64ed5b7c8f48","resolution":{"observed_at":"2026-08-04T21:27:34.023884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-04T21:27:34.093889Z","title":"Training verifiers to solve math word problems, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.07680","last_updated":"2025-09-09T17:59:39Z","snapshot_observed_at":"2026-08-04T21:27:30.632810Z","submitted_at":"2025-09-09T17:59:39Z","title":"CAViAR: Critic-Augmented Video Agentic Reasoning","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-04T21:27:34.093889Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2509.07680"},"observation_digest":"sha256:928f8a7959ebbae02d3020e56aba8a8a069247131c02419bebbb64b5ee2734ab","observation_id":"d3df2e3e-85dc-41b4-b9d9-24229e70ff67","resolution":{"observed_at":"2026-08-04T21:27:34.093889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:27:39.029194Z","title":"Visual programming: Compositional visual reasoning without training","venue":null,"work_id":"8d2773bb-0055-40c9-86c2-09c357ee1e7c","year":2023},"citing_paper":{"arxiv_id":"2509.07680","last_updated":"2025-09-09T17:59:39Z","snapshot_observed_at":"2026-08-04T21:27:30.632810Z","submitted_at":"2025-09-09T17:59:39Z","title":"CAViAR: Critic-Augmented Video Agentic Reasoning","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-04T21:27:34.162507Z"},"links":{"citing_paper":"/paper/2509.07680"},"observation_digest":"sha256:32df33a5cb0cf7cde08524f31d870b7966995e7d05725d89c4229eb5eee2e115","observation_id":"c6da55a7-b82c-4eb5-8146-49450b656c1a","resolution":{"observed_at":"2026-08-04T21:27:39.076824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.06457","last_updated":"2024-08-14T02:41:48Z","snapshot_observed_at":"2026-07-06T17:28:02.037844Z","submitted_at":"2024-02-09T15:02:56Z","title":"V-STaR: Training Verifiers for Self-Taught Reasoners","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.06457","snapshot_observed_at":"2026-08-04T21:27:34.250664Z","title":"V-star: Training verifiers for self-taught reasoners","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.07680","last_updated":"2025-09-09T17:59:39Z","snapshot_observed_at":"2026-08-04T21:27:30.632810Z","submitted_at":"2025-09-09T17:59:39Z","title":"CAViAR: Critic-Augmented Video Agentic Reasoning","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-04T21:27:34.250664Z"},"links":{"cited_paper":"/paper/2402.06457","citing_paper":"/paper/2509.07680"},"observation_digest":"sha256:ea801ac7d52941ddf2a793c8bc72780d9ef4eeac979cacbf03123080131760ae","observation_id":"716ce33e-8ff0-40c2-9706-7aa442423d74","resolution":{"observed_at":"2026-08-04T21:27:34.250664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:27:38.714262Z","title":"Avis: Autonomous visual information seeking with large language model agent","venue":null,"work_id":"bc703f41-e4ea-44b7-bd3b-79be28f6ed9e","year":2023},"citing_paper":{"arxiv_id":"2509.07680","last_updated":"2025-09-09T17:59:39Z","snapshot_observed_at":"2026-08-04T21:27:30.632810Z","submitted_at":"2025-09-09T17:59:39Z","title":"CAViAR: Critic-Augmented Video Agentic Reasoning","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-04T21:27:34.344479Z"},"links":{"citing_paper":"/paper/2509.07680"},"observation_digest":"sha256:f5d130c4482b2b901f2b57836511b28aaec6bbf37fb0ad70cd33d5ac3385ad4a","observation_id":"71085a8d-143a-4a89-a7f0-7ae194f3080f","resolution":{"observed_at":"2026-08-04T21:27:38.815122Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:27:38.450098Z","title":"Lita: Language instructed temporal-localization assistant","venue":null,"work_id":"e44c04a0-bd96-4366-91b6-61824b534392","year":2024},"citing_paper":{"arxiv_id":"2509.07680","last_updated":"2025-09-09T17:59:39Z","snapshot_observed_at":"2026-08-04T21:27:30.632810Z","submitted_at":"2025-09-09T17:59:39Z","title":"CAViAR: Critic-Augmented Video Agentic Reasoning","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-04T21:27:34.432709Z"},"links":{"citing_paper":"/paper/2509.07680"},"observation_digest":"sha256:4437154ca6fa5397d0f5fc56b39a58b5c7710e35dac606086e83ef6d939e615f","observation_id":"95a9f6aa-4510-4836-bd13-cebc99fc83d3","resolution":{"observed_at":"2026-08-04T21:27:38.562817Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01798","last_updated":"2024-03-14T04:27:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-03T04:56:12Z","title":"Large Language Models Cannot Self-Correct Reasoning Yet","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01798","snapshot_observed_at":"2026-08-04T21:27:34.505356Z","title":"Large language models cannot self-correct reasoning yet","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.07680","last_updated":"2025-09-09T17:59:39Z","snapshot_observed_at":"2026-08-04T21:27:30.632810Z","submitted_at":"2025-09-09T17:59:39Z","title":"CAViAR: Critic-Augmented Video Agentic Reasoning","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-04T21:27:34.505356Z"},"links":{"cited_paper":"/paper/2310.01798","citing_paper":"/paper/2509.07680"},"observation_digest":"sha256:7a7bf91d0af7da962ca15b3d8ce4b42ef66018166139a872e8895a4b635701bc","observation_id":"3eec420b-cac0-4f66-8a0f-3c9e2c41339a","resolution":{"observed_at":"2026-08-04T21:27:34.505356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-04T21:27:34.584209Z","title":"Gpt-4o system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.07680","last_updated":"2025-09-09T17:59:39Z","snapshot_observed_at":"2026-08-04T21:27:30.632810Z","submitted_at":"2025-09-09T17:59:39Z","title":"CAViAR: Critic-Augmented Video Agentic Reasoning","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-04T21:27:34.584209Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2509.07680"},"observation_digest":"sha256:3bce4d9195df38c6151a732e76a2fcc8f77618cfa563296cee9f804a42eaa85a","observation_id":"95e4685d-f480-447b-a7b7-9fa7fc7b395f","resolution":{"observed_at":"2026-08-04T21:27:34.584209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:27:38.130964Z","title":"Inferring and executing programs for visual reasoning","venue":null,"work_id":"ca5636f4-c3a5-4801-8df8-ae2f50b44b89","year":2017},"citing_paper":{"arxiv_id":"2509.07680","last_updated":"2025-09-09T17:59:39Z","snapshot_observed_at":"2026-08-04T21:27:30.632810Z","submitted_at":"2025-09-09T17:59:39Z","title":"CAViAR: Critic-Augmented Video Agentic Reasoning","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-04T21:27:34.663781Z"},"links":{"citing_paper":"/paper/2509.07680"},"observation_digest":"sha256:9e1b48379700105205ac2998d30de66e57081dff7bebca848aef4c9a7c4a1749","observation_id":"50ef2bbd-3407-46a4-9341-3bbdc84bbcb1","resolution":{"observed_at":"2026-08-04T21:27:38.217645Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:27:34.720565Z","title":"When can llms actually correct their own mistakes? a critical survey of self-correction of llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.07680","last_updated":"2025-09-09T17:59:39Z","snapshot_observed_at":"2026-08-04T21:27:30.632810Z","submitted_at":"2025-09-09T17:59:39Z","title":"CAViAR: Critic-Augmented Video Agentic Reasoning","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-04T21:27:34.720565Z"},"links":{"citing_paper":"/paper/2509.07680"},"observation_digest":"sha256:d97d2e4ceb07022d31c4edf174ead43ac4b1591f691a4d363b4da65e1efaf375","observation_id":"023c8a3d-9bce-4b6a-a381-2ccb8e96d831","resolution":{"observed_at":"2026-08-04T21:27:34.720565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.06411","last_updated":"2023-11-10T22:14:26Z","snapshot_observed_at":"2026-08-05T10:52:53.465679Z","submitted_at":"2023-11-10T22:14:26Z","title":"Analyzing Modular Approaches for Visual Question Decomposition","version":1},"cited_work":{"arxiv_id":"2311.06411","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.06411","snapshot_observed_at":"2026-08-04T21:27:36.697980Z","title":"Analyzing Modular Approaches for Visual Question Decomposition","venue":"cs.CV","work_id":"f28e505f-d177-456f-9d41-b7e7d41466b3","year":2023},"citing_paper":{"arxiv_id":"2509.07680","last_updated":"2025-09-09T17:59:39Z","snapshot_observed_at":"2026-08-04T21:27:30.632810Z","submitted_at":"2025-09-09T17:59:39Z","title":"CAViAR: Critic-Augmented Video Agentic Reasoning","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-04T21:27:34.772715Z"},"links":{"cited_paper":"/paper/2311.06411","citing_paper":"/paper/2509.07680"},"observation_digest":"sha256:c0c25c3bddee4cfbb704de87f5371fd497ac274eb4117782375ee649c520822b","observation_id":"5541fcc5-e5a6-4d80-9f2f-79a137d62e86","resolution":{"observed_at":"2026-08-04T21:27:36.771441Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-04T21:27:34.850328Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.07680","last_updated":"2025-09-09T17:59:39Z","snapshot_observed_at":"2026-08-04T21:27:30.632810Z","submitted_at":"2025-09-09T17:59:39Z","title":"CAViAR: Critic-Augmented Video Agentic Reasoning","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-04T21:27:34.850328Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2509.07680"},"observation_digest":"sha256:53864628592b3f8bebcd4bb6046d2f168bf1920a54029794be4ac2721d8e74c1","observation_id":"99d14adb-1b33-4738-b1ac-f9cad089bc02","resolution":{"observed_at":"2026-08-04T21:27:34.850328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:27:34.906290Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.07680","last_updated":"2025-09-09T17:59:39Z","snapshot_observed_at":"2026-08-04T21:27:30.632810Z","submitted_at":"2025-09-09T17:59:39Z","title":"CAViAR: Critic-Augmented Video Agentic Reasoning","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-04T21:27:34.906290Z"},"links":{"citing_paper":"/paper/2509.07680"},"observation_digest":"sha256:45d4d5da0bb120c46e00e329b3b961b1b47dfaba00175b44bd7ad35ccb4aea7e","observation_id":"b74080bd-de62-4cc1-a0af-725f2ad4bb48","resolution":{"observed_at":"2026-08-04T21:27:34.906290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15542","last_updated":"2024-08-28T05:34:14Z","snapshot_observed_at":"2026-07-06T19:06:54.428910Z","submitted_at":"2024-08-28T05:34:14Z","title":"Kangaroo: A Powerful Video-Language Model Supporting Long-context Video Input","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15542","snapshot_observed_at":"2026-08-04T21:27:34.988625Z","title":"Kangaroo: A powerful video-language model supporting long-context video input","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.07680","last_updated":"2025-09-09T17:59:39Z","snapshot_observed_at":"2026-08-04T21:27:30.632810Z","submitted_at":"2025-09-09T17:59:39Z","title":"CAViAR: Critic-Augmented Video Agentic Reasoning","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-04T21:27:34.988625Z"},"links":{"cited_paper":"/paper/2408.15542","citing_paper":"/paper/2509.07680"},"observation_digest":"sha256:527b069523c021bba0d42b7ca00d8b6ad3e81e444104ea4ff8e73ffc30cd284c","observation_id":"9faf2417-4896-46ee-9883-69e0bdcc3e56","resolution":{"observed_at":"2026-08-04T21:27:34.988625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:27:37.810532Z","title":"Morevqa: Exploring modular reasoning models for video question answering","venue":null,"work_id":"5bd99acf-b2fd-4c7d-bc67-e30d28bb477c","year":2024},"citing_paper":{"arxiv_id":"2509.07680","last_updated":"2025-09-09T17:59:39Z","snapshot_observed_at":"2026-08-04T21:27:30.632810Z","submitted_at":"2025-09-09T17:59:39Z","title":"CAViAR: Critic-Augmented Video Agentic Reasoning","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-04T21:27:35.082929Z"},"links":{"citing_paper":"/paper/2509.07680"},"observation_digest":"sha256:dc71b65f7f9a710c41ea8c120a7fe31653951bee1dd9717576baaaf2f979fe8e","observation_id":"880be053-394e-41c9-ab1e-f23542e56d5c","resolution":{"observed_at":"2026-08-04T21:27:37.924087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09582","last_updated":"2025-01-18T00:52:42Z","snapshot_observed_at":"2026-07-06T20:06:09.333397Z","submitted_at":"2024-12-12T18:54:48Z","title":"Neptune: The Long Orbit to Benchmarking Long Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09582","snapshot_observed_at":"2026-08-04T21:27:35.156049Z","title":"Neptune: The long orbit to benchmarking long video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.07680","last_updated":"2025-09-09T17:59:39Z","snapshot_observed_at":"2026-08-04T21:27:30.632810Z","submitted_at":"2025-09-09T17:59:39Z","title":"CAViAR: Critic-Augmented Video Agentic Reasoning","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-04T21:27:35.156049Z"},"links":{"cited_paper":"/paper/2412.09582","citing_paper":"/paper/2509.07680"},"observation_digest":"sha256:16492bbdb01bb89a18d555c9332b451841d316dd8cfa77270ed110025d045b56","observation_id":"63d47165-15d3-4cd5-91aa-91e43c1180a2","resolution":{"observed_at":"2026-08-04T21:27:35.156049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00020","last_updated":"2021-02-26T19:04:58Z","snapshot_observed_at":"2026-07-06T10:45:03.059688Z","submitted_at":"2021-02-26T19:04:58Z","title":"Learning Transferable Visual Models From Natural Language Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.00020","snapshot_observed_at":"2026-08-04T21:27:35.240767Z","title":"Learning Transferable Visual Models From Natural Language Supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.07680","last_updated":"2025-09-09T17:59:39Z","snapshot_observed_at":"2026-08-04T21:27:30.632810Z","submitted_at":"2025-09-09T17:59:39Z","title":"CAViAR: Critic-Augmented Video Agentic Reasoning","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-04T21:27:35.240767Z"},"links":{"cited_paper":"/paper/2103.00020","citing_paper":"/paper/2509.07680"},"observation_digest":"sha256:a7b043417ed1a43a3e83ef905a594492ea12c2d20a1174af74d026b30e924b2c","observation_id":"265e53e3-d135-4834-b8b0-50bf400f7b8d","resolution":{"observed_at":"2026-08-04T21:27:35.240767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:27:37.567745Z","title":"Towards truly zero-shot compositional visual reasoning with llms as programmers","venue":null,"work_id":"6edecc88-c502-4500-b014-c29be3074ab1","year":2024},"citing_paper":{"arxiv_id":"2509.07680","last_updated":"2025-09-09T17:59:39Z","snapshot_observed_at":"2026-08-04T21:27:30.632810Z","submitted_at":"2025-09-09T17:59:39Z","title":"CAViAR: Critic-Augmented Video Agentic Reasoning","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-04T21:27:35.300020Z"},"links":{"citing_paper":"/paper/2509.07680"},"observation_digest":"sha256:bbfe9ab1313dc47c736bdff1c2dba5ce2a1b3a7856866ce86c5686d25e3880c9","observation_id":"69a3f923-2596-4a81-87e0-50deecf14655","resolution":{"observed_at":"2026-08-04T21:27:37.693313Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:27:37.399902Z","title":"Vipergpt: Visual inference via python execution for reasoning","venue":null,"work_id":"0a08387d-a3db-4a31-80ba-3d49465e6d2f","year":2023},"citing_paper":{"arxiv_id":"2509.07680","last_updated":"2025-09-09T17:59:39Z","snapshot_observed_at":"2026-08-04T21:27:30.632810Z","submitted_at":"2025-09-09T17:59:39Z","title":"CAViAR: Critic-Augmented Video Agentic Reasoning","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-04T21:27:35.383420Z"},"links":{"citing_paper":"/paper/2509.07680"},"observation_digest":"sha256:6c1a9b47225385adf8efaacc5effd2cb4fd07aa43f38f104dd80d385189c53a7","observation_id":"8a3db425-0d2f-4e69-8bff-727904329d93","resolution":{"observed_at":"2026-08-04T21:27:37.461547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-04T21:27:35.470462Z","title":"Gemini: a family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.07680","last_updated":"2025-09-09T17:59:39Z","snapshot_observed_at":"2026-08-04T21:27:30.632810Z","submitted_at":"2025-09-09T17:59:39Z","title":"CAViAR: Critic-Augmented Video Agentic Reasoning","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-04T21:27:35.470462Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2509.07680"},"observation_digest":"sha256:3a6db043fc6bb67a6c3d479c32ffe122ef96e60c641e4ec198c60caa2ada4ff9","observation_id":"db927cdf-c630-4c20-bc8a-a8182517c755","resolution":{"observed_at":"2026-08-04T21:27:35.470462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-04T21:27:35.557978Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.07680","last_updated":"2025-09-09T17:59:39Z","snapshot_observed_at":"2026-08-04T21:27:30.632810Z","submitted_at":"2025-09-09T17:59:39Z","title":"CAViAR: Critic-Augmented Video Agentic Reasoning","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-04T21:27:35.557978Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2509.07680"},"observation_digest":"sha256:4a0f032be1ab866d3c4d8a1c731f5a02d630e96a6eef9a4fa6bebd58c6a5e422","observation_id":"a690c6b8-d0b8-41e9-96a8-8ebb40ec52a0","resolution":{"observed_at":"2026-08-04T21:27:35.557978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:27:37.186072Z","title":"Eyes wide shut? exploring the visual shortcomings of multimodal llms","venue":null,"work_id":"faa59a90-ada5-4d76-bdec-16b1b52edc75","year":2024},"citing_paper":{"arxiv_id":"2509.07680","last_updated":"2025-09-09T17:59:39Z","snapshot_observed_at":"2026-08-04T21:27:30.632810Z","submitted_at":"2025-09-09T17:59:39Z","title":"CAViAR: Critic-Augmented Video Agentic Reasoning","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-04T21:27:35.656988Z"},"links":{"citing_paper":"/paper/2509.07680"},"observation_digest":"sha256:2a6762fc2a1990ae7ac24f083b6058e4c543dca5abaa326908efecc338eb39c8","observation_id":"586c35f5-5129-415a-8c77-c46ab18dac95","resolution":{"observed_at":"2026-08-04T21:27:37.258238Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18272","last_updated":"2024-02-28T12:04:05Z","snapshot_observed_at":"2026-07-06T17:36:49.021071Z","submitted_at":"2024-02-28T12:04:05Z","title":"Rethinking the Bounds of LLM Reasoning: Are Multi-Agent Discussions the Key?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.18272","snapshot_observed_at":"2026-08-04T21:27:35.715349Z","title":"Rethinking the bounds of llm reasoning: Are multi-agent discussions the key?, 2024 a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.07680","last_updated":"2025-09-09T17:59:39Z","snapshot_observed_at":"2026-08-04T21:27:30.632810Z","submitted_at":"2025-09-09T17:59:39Z","title":"CAViAR: Critic-Augmented Video Agentic Reasoning","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-04T21:27:35.715349Z"},"links":{"cited_paper":"/paper/2402.18272","citing_paper":"/paper/2509.07680"},"observation_digest":"sha256:df311319cd9e2798530ef16f959ce5ad9add638230f8564b9fad7d5767d5f8f6","observation_id":"bd1bf8a3-3a4b-460c-9550-4b478d18e79d","resolution":{"observed_at":"2026-08-04T21:27:35.715349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:27:35.764777Z","title":"Cogvlm: Visual expert for pretrained language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.07680","last_updated":"2025-09-09T17:59:39Z","snapshot_observed_at":"2026-08-04T21:27:30.632810Z","submitted_at":"2025-09-09T17:59:39Z","title":"CAViAR: Critic-Augmented Video Agentic Reasoning","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-04T21:27:35.764777Z"},"links":{"citing_paper":"/paper/2509.07680"},"observation_digest":"sha256:6b3e1201700b800832bdf807cd8a08fab6dfa508c46f090e67141c43bdf03167","observation_id":"528a6cee-34cb-4c96-8bef-8f2c879b270d","resolution":{"observed_at":"2026-08-04T21:27:35.764777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08035","last_updated":"2025-08-09T10:54:59Z","snapshot_observed_at":"2026-08-08T19:38:26.415599Z","submitted_at":"2024-06-12T09:36:52Z","title":"LVBench: An Extreme Long Video Understanding Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08035","snapshot_observed_at":"2026-08-04T21:27:35.879398Z","title":"Lvbench: An extreme long video understanding benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.07680","last_updated":"2025-09-09T17:59:39Z","snapshot_observed_at":"2026-08-04T21:27:30.632810Z","submitted_at":"2025-09-09T17:59:39Z","title":"CAViAR: Critic-Augmented Video Agentic Reasoning","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-04T21:27:35.879398Z"},"links":{"cited_paper":"/paper/2406.08035","citing_paper":"/paper/2509.07680"},"observation_digest":"sha256:5f646fbb463d20c8fb7a9cc4cbb24788c958f887751616b14539c6f637f22f12","observation_id":"299ce0ad-3cbb-4ac5-853d-24923866c794","resolution":{"observed_at":"2026-08-04T21:27:35.879398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:27:36.980711Z","title":"Videoagent: Long-form video understanding with large language model as agent","venue":null,"work_id":"c9f1dfef-0143-48e3-8a4b-66c2bfc6cd73","year":2024},"citing_paper":{"arxiv_id":"2509.07680","last_updated":"2025-09-09T17:59:39Z","snapshot_observed_at":"2026-08-04T21:27:30.632810Z","submitted_at":"2025-09-09T17:59:39Z","title":"CAViAR: Critic-Augmented Video Agentic Reasoning","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-04T21:27:35.890132Z"},"links":{"citing_paper":"/paper/2509.07680"},"observation_digest":"sha256:971c557ba92a62d01b43341c3fce51a501d0a1a2e936b01746e21281b88864bc","observation_id":"504c5fee-dfba-40a0-a62d-89d70448a760","resolution":{"observed_at":"2026-08-04T21:27:37.058131Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19209","last_updated":"2025-03-14T13:57:16Z","snapshot_observed_at":"2026-08-05T17:33:53.862042Z","submitted_at":"2024-05-29T15:49:09Z","title":"VideoTree: Adaptive Tree-based Video Representation for LLM Reasoning on Long Videos","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19209","snapshot_observed_at":"2026-08-04T21:27:35.899881Z","title":"Videotree: Adaptive tree-based video representation for llm reasoning on long videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.07680","last_updated":"2025-09-09T17:59:39Z","snapshot_observed_at":"2026-08-04T21:27:30.632810Z","submitted_at":"2025-09-09T17:59:39Z","title":"CAViAR: Critic-Augmented Video Agentic Reasoning","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-04T21:27:35.899881Z"},"links":{"cited_paper":"/paper/2405.19209","citing_paper":"/paper/2509.07680"},"observation_digest":"sha256:85fe8231e9b850505e94d4090c5d983e278d0f2bbb985592e7ce4904f28cc49f","observation_id":"d7f41027-5e6f-4fd2-b83f-dcac4abe59d1","resolution":{"observed_at":"2026-08-04T21:27:35.899881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-04T21:27:35.993623Z","title":"Minicpm-v: A gpt-4v level mllm on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.07680","last_updated":"2025-09-09T17:59:39Z","snapshot_observed_at":"2026-08-04T21:27:30.632810Z","submitted_at":"2025-09-09T17:59:39Z","title":"CAViAR: Critic-Augmented Video Agentic Reasoning","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-04T21:27:35.993623Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2509.07680"},"observation_digest":"sha256:a36a5c90093c244a4902cdc77d1e6022f9134a458a8c103a177d9f593451470a","observation_id":"4feab88e-c7aa-4056-a943-b782fd904b82","resolution":{"observed_at":"2026-08-04T21:27:35.993623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04840","last_updated":"2024-08-13T08:10:32Z","snapshot_observed_at":"2026-07-06T18:58:39.334273Z","submitted_at":"2024-08-09T03:25:42Z","title":"mPLUG-Owl3: Towards Long Image-Sequence Understanding in Multi-Modal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04840","snapshot_observed_at":"2026-08-04T21:27:36.085495Z","title":"mplug-owl3: Towards long image-sequence understanding in multi-modal large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.07680","last_updated":"2025-09-09T17:59:39Z","snapshot_observed_at":"2026-08-04T21:27:30.632810Z","submitted_at":"2025-09-09T17:59:39Z","title":"CAViAR: Critic-Augmented Video Agentic Reasoning","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-04T21:27:36.085495Z"},"links":{"cited_paper":"/paper/2408.04840","citing_paper":"/paper/2509.07680"},"observation_digest":"sha256:4630fcfabb5a9520e55386beaca8aeb8f071b907aceb7d6dad52b223f9e1db7e","observation_id":"ee04e35f-2e5d-4c03-a0ba-e946184a1057","resolution":{"observed_at":"2026-08-04T21:27:36.085495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:27:36.221921Z","title":"Star: Bootstrapping reasoning with reasoning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.07680","last_updated":"2025-09-09T17:59:39Z","snapshot_observed_at":"2026-08-04T21:27:30.632810Z","submitted_at":"2025-09-09T17:59:39Z","title":"CAViAR: Critic-Augmented Video Agentic Reasoning","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-04T21:27:36.221921Z"},"links":{"citing_paper":"/paper/2509.07680"},"observation_digest":"sha256:2bbe9e355e7c459c5f45cf8f288a55eb998d4a882c7afcdb5ac77a10bdcb8af3","observation_id":"1d399245-0291-4f27-94ce-e11d4405cf26","resolution":{"observed_at":"2026-08-04T21:27:36.221921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15240","last_updated":"2025-02-22T10:21:46Z","snapshot_observed_at":"2026-07-06T19:06:41.697671Z","submitted_at":"2024-08-27T17:57:45Z","title":"Generative Verifiers: Reward Modeling as Next-Token Prediction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15240","snapshot_observed_at":"2026-08-04T21:27:36.323801Z","title":"Generative verifiers: Reward modeling as next-token prediction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.07680","last_updated":"2025-09-09T17:59:39Z","snapshot_observed_at":"2026-08-04T21:27:30.632810Z","submitted_at":"2025-09-09T17:59:39Z","title":"CAViAR: Critic-Augmented Video Agentic Reasoning","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-04T21:27:36.323801Z"},"links":{"cited_paper":"/paper/2408.15240","citing_paper":"/paper/2509.07680"},"observation_digest":"sha256:d0a8c5e4777b0dad192bb0fe4a353c50abfab3152fba9cb350e41a9b272876ec","observation_id":"277939ff-dd2b-4604-af9b-c3836914d89b","resolution":{"observed_at":"2026-08-04T21:27:36.323801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-02T12:24:31.329178Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02713","snapshot_observed_at":"2026-08-04T21:27:36.408216Z","title":"Video instruction tuning with synthetic data","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.07680","last_updated":"2025-09-09T17:59:39Z","snapshot_observed_at":"2026-08-04T21:27:30.632810Z","submitted_at":"2025-09-09T17:59:39Z","title":"CAViAR: Critic-Augmented Video Agentic Reasoning","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-04T21:27:36.408216Z"},"links":{"cited_paper":"/paper/2410.02713","citing_paper":"/paper/2509.07680"},"observation_digest":"sha256:6032a78d9c94a784ab504c9ab443e3099d529684057e8fbd0bcb77b42840397d","observation_id":"61073f3f-8553-4916-b6cb-ec7067afd79e","resolution":{"observed_at":"2026-08-04T21:27:36.408216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04406","last_updated":"2024-06-06T02:51:17Z","snapshot_observed_at":"2026-08-06T23:53:10.606737Z","submitted_at":"2023-10-06T17:55:11Z","title":"Language Agent Tree Search Unifies Reasoning Acting and Planning in Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.04406","snapshot_observed_at":"2026-08-04T21:27:36.485905Z","title":"Language agent tree search unifies reasoning acting and planning in language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.07680","last_updated":"2025-09-09T17:59:39Z","snapshot_observed_at":"2026-08-04T21:27:30.632810Z","submitted_at":"2025-09-09T17:59:39Z","title":"CAViAR: Critic-Augmented Video Agentic Reasoning","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-04T21:27:36.485905Z"},"links":{"cited_paper":"/paper/2310.04406","citing_paper":"/paper/2509.07680"},"observation_digest":"sha256:02dcf5245e03c2633276c9387561d281626d7e13750494f76990c00f9c97f9a8","observation_id":"f0aa01ba-00b7-4a5d-83f6-8b028f9903ae","resolution":{"observed_at":"2026-08-04T21:27:36.485905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.07680","last_updated":"2025-09-09T17:59:39Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-04T21:27:30.632810Z","submitted_at":"2025-09-09T17:59:39Z","title":"CAViAR: Critic-Augmented Video Agentic Reasoning"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":28,"verified_exact":1,"verified_fuzzy":11},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 1 inbound Pith citation observation for arXiv:2509.07680."}