{"as_of":"2026-08-07T15:45:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:078f30d21d8401fbf823fa001120ef278ba2f7172d43bdea876c3c038fb4550a","coverage":[{"denominator":122,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T04:22:56.139701Z","state":"measured"},{"denominator":111,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":111,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":11,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":11,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T20:23:08.702909Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T00:49:17.495045Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-07T04:13:50.591653Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10857","snapshot_observed_at":"2026-08-03T20:23:08.702909Z","title":"Vrbench: A benchmark for multi-step reasoning in long narrative videos.arXiv preprint arXiv:2506.10857,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.20272","last_updated":"2026-07-03T06:27:17Z","snapshot_observed_at":"2026-08-03T20:22:57.328566Z","submitted_at":"2025-11-25T12:58:32Z","title":"VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs","version":2},"reference_index":106,"source":"pdf_text","source_observed_at":"2026-08-03T20:23:08.702909Z"},"links":{"cited_paper":"/paper/2506.10857","citing_paper":"/paper/2511.20272"},"observation_digest":"sha256:95cb82960ee82e54d6d4a086d967cd5d6e2a253707f8652a123a6dd9111aa014","observation_id":"f7cca12f-0ef3-48ae-8da9-24c49c949add","resolution":{"observed_at":"2026-08-03T20:23:08.702909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-07T04:13:50.591653Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"cited_work":{"arxiv_id":"2506.10857","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.10857","snapshot_observed_at":"2026-07-04T00:49:17.495045Z","title":"Vrbench: A benchmark for multi-step reasoning in long nar- rative videos","venue":null,"work_id":"5ff34ad0-8179-49bb-9f70-4b2cd18b4aa8","year":2025},"citing_paper":{"arxiv_id":"2601.06943","last_updated":"2026-05-18T06:58:21Z","snapshot_observed_at":"2026-08-02T18:32:02.969277Z","submitted_at":"2026-01-11T15:07:37Z","title":"Watching, Reasoning, and Searching: A Video Deep Research Benchmark on Open Web for Agentic Video Reasoning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-21T16:35:24.557809Z"},"links":{"cited_paper":"/paper/2506.10857","citing_paper":"/paper/2601.06943"},"observation_digest":"sha256:fc2bbc956673154b845c27906be07c0b8172006af1539caaa1004357d47878fe","observation_id":"26f4061c-be93-4ade-b1a7-a088468f27ca","resolution":{"observed_at":"2026-05-21T16:40:22.769581Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-07T04:13:50.591653Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10857","snapshot_observed_at":"2026-07-13T15:29:31.834566Z","title":"arXiv preprint arXiv:2506.10857 (2025) 1, 4, 5 18 F","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.29943","last_updated":"2026-07-10T15:58:11Z","snapshot_observed_at":"2026-08-07T09:23:25.859554Z","submitted_at":"2026-03-31T16:16:17Z","title":"Diagnosing Long-Video Quantitative Reasoning in Multimodal LLMs via Enumeration and Counting","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-13T15:29:31.834566Z"},"links":{"cited_paper":"/paper/2506.10857","citing_paper":"/paper/2603.29943"},"observation_digest":"sha256:8b4067bae886ea410790853bf3fec84bbc563cc8529ce226ae1aee054e43fabb","observation_id":"ca25f97a-b15e-4692-acc8-dac577a40f42","resolution":{"observed_at":"2026-07-13T15:29:31.834566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-07T04:13:50.591653Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"cited_work":{"arxiv_id":"2506.10857","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.10857","snapshot_observed_at":"2026-07-04T00:49:17.495045Z","title":"Vrbench: A benchmark for multi-step reasoning in long nar- rative videos","venue":null,"work_id":"5ff34ad0-8179-49bb-9f70-4b2cd18b4aa8","year":2025},"citing_paper":{"arxiv_id":"2604.14692","last_updated":"2026-05-15T12:00:53Z","snapshot_observed_at":"2026-08-03T05:41:26.768501Z","submitted_at":"2026-04-16T06:50:20Z","title":"Chain-of-Glimpse: Search-Guided Progressive Object-Grounded Reasoning for Video Understanding","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-10T12:03:09.408019Z"},"links":{"cited_paper":"/paper/2506.10857","citing_paper":"/paper/2604.14692"},"observation_digest":"sha256:d8f0cd375816d0c3463bdb1b02b5af2c231895017382d19060826590f207f50b","observation_id":"73a3b076-d662-48e9-9632-ba373fc1cdd5","resolution":{"observed_at":"2026-05-10T12:05:22.183158Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-07T04:13:50.591653Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"cited_work":{"arxiv_id":"2506.10857","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.10857","snapshot_observed_at":"2026-07-04T00:49:17.495045Z","title":"Vrbench: A benchmark for multi-step reasoning in long nar- rative videos","venue":null,"work_id":"5ff34ad0-8179-49bb-9f70-4b2cd18b4aa8","year":2025},"citing_paper":{"arxiv_id":"2604.14692","last_updated":"2026-05-15T12:00:53Z","snapshot_observed_at":"2026-08-03T05:41:26.768501Z","submitted_at":"2026-04-16T06:50:20Z","title":"Chain-of-Glimpse: Search-Guided Progressive Object-Grounded Reasoning for Video Understanding","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-19T17:34:10.344111Z"},"links":{"cited_paper":"/paper/2506.10857","citing_paper":"/paper/2604.14692"},"observation_digest":"sha256:989cae30315e8827fe30f1ae4f0ba9e8f96ffe9f8dde7192fe263f8ca779f3ff","observation_id":"80897de9-8c46-48d2-a396-247283b3bc12","resolution":{"observed_at":"2026-05-19T17:37:41.712156Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-07T04:13:50.591653Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10857","snapshot_observed_at":"2026-07-14T19:27:29.843866Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.22226","last_updated":"2026-07-13T04:05:34Z","snapshot_observed_at":"2026-07-16T23:18:42.650626Z","submitted_at":"2026-04-24T05:02:03Z","title":"Towards Temporal Compositional Reasoning in Long-Form Sports Videos","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-14T19:27:29.843866Z"},"links":{"cited_paper":"/paper/2506.10857","citing_paper":"/paper/2604.22226"},"observation_digest":"sha256:0041ff2f8d9501af27cd1797079f2254fd533a4e3ad1d63c524bb928b083c498","observation_id":"606a425b-9f9f-4c25-bfa8-494342b57fef","resolution":{"observed_at":"2026-07-14T19:27:29.843866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-07T04:13:50.591653Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"cited_work":{"arxiv_id":"2506.10857","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.10857","snapshot_observed_at":"2026-07-04T00:49:17.495045Z","title":"Vrbench: A benchmark for multi-step reasoning in long nar- rative videos","venue":null,"work_id":"5ff34ad0-8179-49bb-9f70-4b2cd18b4aa8","year":2025},"citing_paper":{"arxiv_id":"2605.23216","last_updated":"2026-07-02T06:54:56Z","snapshot_observed_at":"2026-08-03T00:30:19.785022Z","submitted_at":"2026-05-22T04:19:29Z","title":"CaST-Bench: Benchmarking Causal Chain-Grounded Spatio-Temporal Reasoning for Video Question Answering","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-25T04:54:23.077914Z"},"links":{"cited_paper":"/paper/2506.10857","citing_paper":"/paper/2605.23216"},"observation_digest":"sha256:20a5b2a2349e931905452b83000658dbb6e528f9447647b8b077c5a99c413b77","observation_id":"a78e151e-b2dd-460d-a4f0-a06fc516a95f","resolution":{"observed_at":"2026-05-25T04:55:23.211651Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-07T04:13:50.591653Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"cited_work":{"arxiv_id":"2506.10857","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.10857","snapshot_observed_at":"2026-07-04T00:49:17.495045Z","title":"Vrbench: A benchmark for multi-step reasoning in long nar- rative videos","venue":null,"work_id":"5ff34ad0-8179-49bb-9f70-4b2cd18b4aa8","year":2025},"citing_paper":{"arxiv_id":"2605.23216","last_updated":"2026-07-02T06:54:56Z","snapshot_observed_at":"2026-08-03T00:30:19.785022Z","submitted_at":"2026-05-22T04:19:29Z","title":"CaST-Bench: Benchmarking Causal Chain-Grounded Spatio-Temporal Reasoning for Video Question Answering","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-04T00:41:02.284215Z"},"links":{"cited_paper":"/paper/2506.10857","citing_paper":"/paper/2605.23216"},"observation_digest":"sha256:8ab5ba9026e4f916316be5ac8ad4e2459dd93bd6a1b7c9edd5cdb4cef5be29b1","observation_id":"b8993290-6c4d-4334-9dc6-93555f599665","resolution":{"observed_at":"2026-07-04T00:49:17.498640Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-07T04:13:50.591653Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"cited_work":{"arxiv_id":"2506.10857","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.10857","snapshot_observed_at":"2026-07-04T00:49:17.495045Z","title":"Vrbench: A benchmark for multi-step reasoning in long nar- rative videos","venue":null,"work_id":"5ff34ad0-8179-49bb-9f70-4b2cd18b4aa8","year":2025},"citing_paper":{"arxiv_id":"2606.03301","last_updated":"2026-06-02T08:14:01Z","snapshot_observed_at":"2026-07-31T12:31:45.258722Z","submitted_at":"2026-06-02T08:14:01Z","title":"SagaQA: A Multi-hop Reasoning Benchmark for Long-form Narrative Understanding in TV Series","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-28T10:14:48.103490Z"},"links":{"cited_paper":"/paper/2506.10857","citing_paper":"/paper/2606.03301"},"observation_digest":"sha256:49d8f1341478783f465a5ce98b33658fedfb01516eb5c2339ecfa6e5accbad69","observation_id":"8827aa6c-7368-48d9-bb61-1f90ba55de1a","resolution":{"observed_at":"2026-07-02T03:16:33.477641Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-07T04:13:50.591653Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"cited_work":{"arxiv_id":"2506.10857","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.10857","snapshot_observed_at":"2026-07-04T00:49:17.495045Z","title":"Vrbench: A benchmark for multi-step reasoning in long nar- rative videos","venue":null,"work_id":"5ff34ad0-8179-49bb-9f70-4b2cd18b4aa8","year":2025},"citing_paper":{"arxiv_id":"2606.06338","last_updated":"2026-06-04T16:12:43Z","snapshot_observed_at":"2026-07-06T23:46:10.612537Z","submitted_at":"2026-06-04T16:12:43Z","title":"StoryVideoQA: Scaling Deep Video Understanding with a Large-Scale, Multi-Genre and Auto-Generated Dataset","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-28T02:05:47.810096Z"},"links":{"cited_paper":"/paper/2506.10857","citing_paper":"/paper/2606.06338"},"observation_digest":"sha256:1b1ca5485bffaafd7ea66898e472562e0498a4808d4fe8937595c7dd2c703d9e","observation_id":"6c116fb8-6802-400d-9428-98c7b1178a58","resolution":{"observed_at":"2026-07-02T12:26:57.158892Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-07T04:13:50.591653Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"cited_work":{"arxiv_id":"2506.10857","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.10857","snapshot_observed_at":"2026-07-04T00:49:17.495045Z","title":"Vrbench: A benchmark for multi-step reasoning in long nar- rative videos","venue":null,"work_id":"5ff34ad0-8179-49bb-9f70-4b2cd18b4aa8","year":2025},"citing_paper":{"arxiv_id":"2606.07433","last_updated":"2026-06-05T16:29:13Z","snapshot_observed_at":"2026-08-01T21:05:06.439607Z","submitted_at":"2026-06-05T16:29:13Z","title":"Watch, Remember, Reason: Human-View Video Understanding with MLLMs","version":1},"reference_index":279,"source":"pdf_text","source_observed_at":"2026-06-27T22:00:28.350003Z"},"links":{"cited_paper":"/paper/2506.10857","citing_paper":"/paper/2606.07433"},"observation_digest":"sha256:31c05dd070dd001beaecbde2629a5cbaa4143eed0217ddd2f8934f4e79269288","observation_id":"97e2e6a3-bea5-46fb-bea7-8b7f1ff6b6a4","resolution":{"observed_at":"2026-07-02T17:27:15.118543Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.10857/citation-record","integrity":"/paper/2506.10857/integrity","json":"/paper/2506.10857/citation-record.json","paper":"/paper/2506.10857"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-07-06T18:03:47.096406Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-07T04:22:55.794507Z","title":"Phi-3 technical report: A highly capable language model locally on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-07T04:13:50.591653Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.794507Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:bd1d1671f5a57d18f1fd4f4e3bca922889fc73ce23050e8ee3c60c0f58933d04","observation_id":"67bf88f4-239b-4a02-b712-e4ca6827f655","resolution":{"observed_at":"2026-08-07T04:22:55.794507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T04:22:55.798358Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-07T04:13:50.591653Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.798358Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:b3e0ec38d52c75486035d91ac4db989a2a72b9a6afee5accfb209ac9724f2d2f","observation_id":"6e9ab553-3fcc-48c8-9150-e56adf8fecbb","resolution":{"observed_at":"2026-08-07T04:22:55.798358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17297","last_updated":"2024-03-26T00:53:24Z","snapshot_observed_at":"2026-08-02T11:10:24.263044Z","submitted_at":"2024-03-26T00:53:24Z","title":"InternLM2 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17297","snapshot_observed_at":"2026-08-07T04:22:55.801744Z","title":"Internlm2 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-07T04:13:50.591653Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.801744Z"},"links":{"cited_paper":"/paper/2403.17297","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:1519a7d8a1d060c283a0f82855322780ee35d4fae59d736df5bb4d7430cfc297","observation_id":"cd844921-0989-4044-aa69-dbffdb445ed8","resolution":{"observed_at":"2026-08-07T04:22:55.801744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.12075","last_updated":"2024-12-16T18:46:45Z","snapshot_observed_at":"2026-07-06T20:07:58.873037Z","submitted_at":"2024-12-16T18:46:45Z","title":"CG-Bench: Clue-grounded Question Answering Benchmark for Long Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.12075","snapshot_observed_at":"2026-08-07T04:22:55.805315Z","title":"Cg- bench: Clue-grounded question answering benchmark for long video understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-07T04:13:50.591653Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.805315Z"},"links":{"cited_paper":"/paper/2412.12075","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:c530bd5dffe45ec3216051413b8b9842360ab5a68a1ab89b1570c2caa09ac4ec","observation_id":"aa3c841a-826e-4063-b441-59d7aee0678b","resolution":{"observed_at":"2026-08-07T04:22:55.805315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.12524","last_updated":"2023-12-06T03:02:45Z","snapshot_observed_at":"2026-07-06T15:30:18.137347Z","submitted_at":"2023-05-21T17:51:35Z","title":"TheoremQA: A Theorem-driven Question Answering dataset","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.12524","snapshot_observed_at":"2026-08-07T04:22:55.808811Z","title":"Theo- remqa: A theorem-driven question answering dataset","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-07T04:13:50.591653Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.808811Z"},"links":{"cited_paper":"/paper/2305.12524","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:1da557a54b3e78767ce678464bd330d0739a15c7abfd18545df0d73c50bf185d","observation_id":"db6db4af-9926-4f46-9e83-3b382a3516cf","resolution":{"observed_at":"2026-08-07T04:22:55.808811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:22:55.812841Z","title":"Autoeval-video: An automatic benchmark for assessing large vision language models in open-ended video question answering","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-07T04:13:50.591653Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.812841Z"},"links":{"citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:875b1f4f755a6e185cbbb24c99db309f608ede7cb22cc3f8f939537ed381e3cb","observation_id":"9acc9133-3f9c-41c5-a370-c8ca38e496ea","resolution":{"observed_at":"2026-08-07T04:22:55.812841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T04:22:55.815725Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test- time scaling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-07T04:13:50.591653Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.815725Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:4031d9a33c889886819731b120b7536312a25eac991c46168bf5128793aad7ba","observation_id":"4eef8657-de74-4207-a670-d3d40a65939f","resolution":{"observed_at":"2026-08-07T04:22:55.815725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-07T04:22:55.819219Z","title":"Train- ing verifiers to solve math word problems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-07T04:13:50.591653Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.819219Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:c2e830cad8c2ceff67e75554f4507af16f3728dacb781f61abb920115e57c5b1","observation_id":"5ee2aabb-d15d-4471-8307-85557ae27857","resolution":{"observed_at":"2026-08-07T04:22:55.819219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07752","last_updated":"2025-03-25T09:46:02Z","snapshot_observed_at":"2026-08-05T14:33:12.627325Z","submitted_at":"2024-10-10T09:28:36Z","title":"Lost in Time: A New Temporal Benchmark for VideoLLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07752","snapshot_observed_at":"2026-08-07T04:22:55.823070Z","title":"Tvbench: Re- designing video-language evaluation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-07T04:13:50.591653Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.823070Z"},"links":{"cited_paper":"/paper/2410.07752","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:c4c64689aea3d2d7dbd8ad9a2f1806f8f450631306d402b970308673070b7819","observation_id":"3f7009cb-616d-44a6-bd44-2b6e59c6e59e","resolution":{"observed_at":"2026-08-07T04:22:55.823070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.10378","last_updated":"2024-03-15T15:08:39Z","snapshot_observed_at":"2026-07-06T17:45:19.668165Z","submitted_at":"2024-03-15T15:08:39Z","title":"EXAMS-V: A Multi-Discipline Multilingual Multimodal Exam Benchmark for Evaluating Vision Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.10378","snapshot_observed_at":"2026-08-07T04:22:55.826579Z","title":"Exams-v: A multi-discipline multilingual multi- modal exam benchmark for evaluating vision language mod- els","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-07T04:13:50.591653Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.826579Z"},"links":{"cited_paper":"/paper/2403.10378","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:a7eecd4d7f12185423051670677f6b24e9d3dbabd59f18d991028ae14d5e2beb","observation_id":"f75212c6-a201-462d-8cf5-5bfabcb1e49c","resolution":{"observed_at":"2026-08-07T04:22:55.826579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:22:55.829651Z","title":"Deepl translate: The world’s most accurate trans- lator","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-07T04:13:50.591653Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.829651Z"},"links":{"citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:5d3ef09042505c59ae3f26e61010ca106f3415f353c16fa30671455f630efc43","observation_id":"37ddbae0-b8c6-41f9-935a-b57fe314946b","resolution":{"observed_at":"2026-08-07T04:22:55.829651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:22:55.832779Z","title":"Gemini 2.0 flash thinking","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-07T04:13:50.591653Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.832779Z"},"links":{"citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:ac9b6bc07a9e4ba0eec3362383b39a26d9bccb616e63d8e6d1e8b92f3d9b5e56","observation_id":"a950fbf6-7e2b-427b-a098-4b7e970c0926","resolution":{"observed_at":"2026-08-07T04:22:55.832779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:22:55.835477Z","title":"Mmbench-video: A long-form multi-shot benchmark for holistic video under- standing","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-07T04:13:50.591653Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.835477Z"},"links":{"citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:ff27afb08d23716f6328933431cfb3bd0b49d5e0e8ad3259a49ba8b8f4da11a0","observation_id":"5e3f8b0f-833d-40b8-a89f-00cee31d231b","resolution":{"observed_at":"2026-08-07T04:22:55.835477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03230","last_updated":"2024-05-07T11:55:10Z","snapshot_observed_at":"2026-07-06T20:17:15.995064Z","submitted_at":"2024-05-07T11:55:10Z","title":"Video-of-Thought: Step-by-Step Video Reasoning from Perception to Cognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03230","snapshot_observed_at":"2026-08-07T04:22:55.838095Z","title":"Video-of-thought: Step-by-step video reasoning from perception to cognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-07T04:13:50.591653Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.838095Z"},"links":{"cited_paper":"/paper/2501.03230","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:f2b867bc1ad19662e05b7704bf27cfd2eee2b610dba9521303ee02a2954cf882","observation_id":"9675d94b-f65d-4fbb-a217-82b0059f9647","resolution":{"observed_at":"2026-08-07T04:22:55.838095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:22:55.841030Z","title":"Sciknoweval: Evaluating multi- level scientific knowledge of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-07T04:13:50.591653Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.841030Z"},"links":{"citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:5c909f62429928f9e3e9ee7d1c6bdc33e696b3f1de6dd3b4c302f83d4c51f94f","observation_id":"753a87c7-a443-46e3-9bce-90ba8d4e2f5c","resolution":{"observed_at":"2026-08-07T04:22:55.841030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-07T04:22:55.843902Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-07T04:13:50.591653Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.843902Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:53e5cc114af02a0b88f3a7629fa5b5d021239d77ca4820b9bec07ee2a491091d","observation_id":"0849dd15-06d7-43fd-adfe-969771bbac93","resolution":{"observed_at":"2026-08-07T04:22:55.843902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13611","last_updated":"2024-10-17T14:46:34Z","snapshot_observed_at":"2026-07-06T19:35:21.868885Z","submitted_at":"2024-10-17T14:46:34Z","title":"H2OVL-Mississippi Vision Language Models Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13611","snapshot_observed_at":"2026-08-07T04:22:55.846897Z","title":"H2ovl-mississippi vision language models technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-07T04:13:50.591653Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.846897Z"},"links":{"cited_paper":"/paper/2410.13611","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:d4b1913949fb3fbee2da2f82274eb50336e2101c07aceff71185ab1062ed0986","observation_id":"2695ae24-3a76-4e1f-a39a-35dc60f54fbe","resolution":{"observed_at":"2026-08-07T04:22:55.846897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T04:22:55.849759Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-07T04:13:50.591653Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.849759Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:526b0ce0095b4af3252892ff9a013489ecdee1d63d9a6d2aaacc6dfd4540ed25","observation_id":"c4859939-007a-444d-aa0b-c725f89ac507","resolution":{"observed_at":"2026-08-07T04:22:55.849759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14794","last_updated":"2024-11-22T08:33:36Z","snapshot_observed_at":"2026-08-03T12:43:16.262641Z","submitted_at":"2024-11-22T08:33:36Z","title":"VideoEspresso: A Large-Scale Chain-of-Thought Dataset for Fine-Grained Video Reasoning via Core Frame Selection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14794","snapshot_observed_at":"2026-08-07T04:22:55.852974Z","title":"Videoespresso: A large-scale chain-of-thought dataset for fine-grained video reasoning via core frame selection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-07T04:13:50.591653Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.852974Z"},"links":{"cited_paper":"/paper/2411.14794","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:95caa38107b9d282ba402c90547ef2d9b00851dddb25cc4372b591e3fc201d09","observation_id":"7c58fbad-de91-4d02-b625-61d4030b97fa","resolution":{"observed_at":"2026-08-07T04:22:55.852974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08407","last_updated":"2024-07-30T03:15:55Z","snapshot_observed_at":"2026-08-03T12:24:31.311692Z","submitted_at":"2024-06-12T16:54:54Z","title":"MMWorld: Towards Multi-discipline Multi-faceted World Model Evaluation in Videos","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08407","snapshot_observed_at":"2026-08-07T04:22:55.856234Z","title":"Mmworld: Towards multi-discipline multi-faceted world model evaluation in videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-07T04:13:50.591653Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.856234Z"},"links":{"cited_paper":"/paper/2406.08407","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:ceaf43b58bcb81d30dd6ee2553955b7e3bf777e25852e1225cba8ace2ba5b0dd","observation_id":"4f68f3c2-48fb-4c88-9dc4-c9e4b0a985d6","resolution":{"observed_at":"2026-08-07T04:22:55.856234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-07T04:22:55.859652Z","title":"Mea- suring massive multitask language understanding","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-07T04:13:50.591653Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.859652Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:4710e022c2b2f0974c2b66b9938c3f2d1bffd0b40a6d63c8f42f0f6b2fa2dc76","observation_id":"c0f4926b-9b3f-4e21-967e-b95936779a4a","resolution":{"observed_at":"2026-08-07T04:22:55.859652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13826","last_updated":"2025-01-23T16:51:47Z","snapshot_observed_at":"2026-07-06T20:25:03.950783Z","submitted_at":"2025-01-23T16:51:47Z","title":"Video-MMMU: Evaluating Knowledge Acquisition from Multi-Discipline Professional Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13826","snapshot_observed_at":"2026-08-07T04:22:55.863069Z","title":"Video-mmmu: Evaluating knowledge acquisition from multi-discipline pro- fessional videos","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-07T04:13:50.591653Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.863069Z"},"links":{"cited_paper":"/paper/2501.13826","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:68bc02efe1b4a4cfacd058fc871a491a05321ac27f45594fc448d2d61ae4c651","observation_id":"23b5364e-be60-48e2-8e6d-77a1ca0006f8","resolution":{"observed_at":"2026-08-07T04:22:55.863069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:22:55.866065Z","title":"C-eval: A multi-level multi-discipline chinese evaluation suite for foundation models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-07T04:13:50.591653Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.866065Z"},"links":{"citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:69dc5bcb1adbed8640470fad7c42f8754885bd0af2cdd1594dba91ec703eadf1","observation_id":"495389a9-ed4f-40c5-a39a-4467210737a0","resolution":{"observed_at":"2026-08-07T04:22:55.866065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:22:55.869308Z","title":"Vbench: Comprehensive bench- mark suite for video generative models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-07T04:13:50.591653Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.869308Z"},"links":{"citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:10c3bae141f3d62e5a3e639c7db52d59433177702369127c8ce60fb3166e3c47","observation_id":"aa0582dd-d1da-43cb-af60-a13f67595808","resolution":{"observed_at":"2026-08-07T04:22:55.869308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:22:55.872434Z","title":"Olympicarena: Benchmark- ing multi-discipline cognitive reasoning for superintelligent ai","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-07T04:13:50.591653Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.872434Z"},"links":{"citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:21ba98af776f6ebe1c56d51aafa9a936d8892d1d9c59077d42e553bb782035c0","observation_id":"251dc541-9fc2-4f9d-9e0f-43a43d65d45b","resolution":{"observed_at":"2026-08-07T04:22:55.872434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07974","last_updated":"2024-06-06T17:41:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-12T17:58:04Z","title":"LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07974","snapshot_observed_at":"2026-08-07T04:22:55.875498Z","title":"Livecodebench: Holistic and contamination free evaluation of large language models for code","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-07T04:13:50.591653Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.875498Z"},"links":{"cited_paper":"/paper/2403.07974","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:ced915e9c9be8c7f95db9c5ce6f2c488dcf444166523114d1529c35be222087a","observation_id":"bb48fda0-189a-4e90-a294-989e03148d7a","resolution":{"observed_at":"2026-08-07T04:22:55.875498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.13730","last_updated":"2024-12-02T15:11:23Z","snapshot_observed_at":"2026-07-06T19:18:53.582890Z","submitted_at":"2024-09-10T01:20:26Z","title":"VisScience: An Extensive Benchmark for Evaluating K12 Educational Multi-modal Scientific Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.13730","snapshot_observed_at":"2026-08-07T04:22:55.878707Z","title":"Vis- science: An extensive benchmark for evaluating k12 ed- ucational multi-modal scientific reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-07T04:13:50.591653Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.878707Z"},"links":{"cited_paper":"/paper/2409.13730","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:963f1937f05e69678c992fb2b6a467955f5c4e80f7760fe2ff306af75bd873bb","observation_id":"172d0c3b-4e7a-4db9-adac-bce723c074a9","resolution":{"observed_at":"2026-08-07T04:22:55.878707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1809.01696","last_updated":"2019-05-07T21:34:05Z","snapshot_observed_at":"2026-07-06T06:59:26.080263Z","submitted_at":"2018-09-05T19:14:11Z","title":"TVQA: Localized, Compositional Video Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.01696","snapshot_observed_at":"2026-08-07T04:22:55.882019Z","title":"Tvqa: Localized, compositional video question answering","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-07T04:13:50.591653Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.882019Z"},"links":{"cited_paper":"/paper/1809.01696","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:db850b275c649bc0cc288809389e9b2c34a4759d4e49ebd8f1a35ca64f538bf3","observation_id":"7eae764e-27d8-42d7-a2e7-8a04c60c7397","resolution":{"observed_at":"2026-08-07T04:22:55.882019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:22:55.885036Z","title":"Veu-bench: Towards comprehensive under- standing of video editing","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-07T04:13:50.591653Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.885036Z"},"links":{"citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:4b7691dba34caaa97106d20baa4124aa4aed7446b9eb28077b36f7e5fdb16fd7","observation_id":"dd312b7a-59eb-4997-941c-a8f1f084af16","resolution":{"observed_at":"2026-08-07T04:22:55.885036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-07-06T19:29:46.997580Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-08-07T04:22:55.888224Z","title":"Aria: An open multimodal native mixture-of- experts model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-07T04:13:50.591653Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.888224Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:22bd3377b3a47b87d2f1c7ed87fb171563ef3188ba87f3b163770bc65f1b6a41","observation_id":"bdeedada-c8a1-4732-8f62-8830251ce4c6","resolution":{"observed_at":"2026-08-07T04:22:55.888224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:22:55.891513Z","title":"Mvbench: A comprehensive multi-modal video understand- ing benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-07T04:13:50.591653Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.891513Z"},"links":{"citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:8075ea1f09460f5cddd8b0d9beeadba507899f73ef6abbe04b95e6f536972af4","observation_id":"f76134e5-71df-41ac-80c0-b4b20c61c9f5","resolution":{"observed_at":"2026-08-07T04:22:55.891513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00574","last_updated":"2025-07-13T16:21:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-31T18:01:23Z","title":"VideoChat-Flash: Hierarchical Compression for Long-Context Video Modeling","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00574","snapshot_observed_at":"2026-08-07T04:22:55.894485Z","title":"Videochat-flash: Hierarchical com- pression for long-context video modeling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-07T04:13:50.591653Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.894485Z"},"links":{"cited_paper":"/paper/2501.00574","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:f5df20c775db45bfd17e5d4e5d367d7fe469215c5f83a137c057f81d80876959","observation_id":"464c5e5e-07f5-46f0-ae02-fcf6e2b9ff09","resolution":{"observed_at":"2026-08-07T04:22:55.894485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-08-07T04:22:55.898375Z","title":"Videochat-r1: Enhancing spatio-temporal perception via reinforcement fine-tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-07T04:13:50.591653Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.898375Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:93273b7620dc05e0b94df228aa718764c96b95e265b128acd086359033a83e44","observation_id":"96a7f6a6-d097-497d-887f-4378e5386efb","resolution":{"observed_at":"2026-08-07T04:22:55.898375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11303","last_updated":"2024-06-17T08:09:00Z","snapshot_observed_at":"2026-08-04T15:53:11.168523Z","submitted_at":"2024-06-17T08:09:00Z","title":"VideoVista: A Versatile Benchmark for Video Understanding and Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11303","snapshot_observed_at":"2026-08-07T04:22:55.901902Z","title":"Videovista: A versatile bench- mark for video understanding and reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-07T04:13:50.591653Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.901902Z"},"links":{"cited_paper":"/paper/2406.11303","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:40717b5534310419db283e3c6ac84ef0bff3e382ef7978fdb9be9b9101bd1c25","observation_id":"72944cf2-74c2-4dd2-91fa-073fcf1672fa","resolution":{"observed_at":"2026-08-07T04:22:55.901902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:22:55.905354Z","title":"Mmsci: A multimodal multi-discipline dataset for phd-level scientific comprehen- sion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-07T04:13:50.591653Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.905354Z"},"links":{"citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:48d987c9b40c204d86651b890d251b3a314f5fdb251db398b5be2500173ffd10","observation_id":"8d67a2a2-fdbe-4af4-ba1b-bf14d005537b","resolution":{"observed_at":"2026-08-07T04:22:55.905354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05138","last_updated":"2024-02-06T19:16:55Z","snapshot_observed_at":"2026-07-06T17:27:03.686119Z","submitted_at":"2024-02-06T19:16:55Z","title":"SceMQA: A Scientific College Entrance Level Multimodal Question Answering Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05138","snapshot_observed_at":"2026-08-07T04:22:55.908709Z","title":"Scemqa: A scientific col- lege entrance level multimodal question answering bench- mark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-07T04:13:50.591653Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.908709Z"},"links":{"cited_paper":"/paper/2402.05138","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:4c8dfc3e2d2983a0f0f12fb2147f06039a6a92a1ca0ad072bd3cce3da74b39c9","observation_id":"777b0caa-5f9e-4163-8fe5-9811e7a48d40","resolution":{"observed_at":"2026-08-07T04:22:55.908709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:22:55.912456Z","title":"Vila: On pre-training for vi- sual language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-07T04:13:50.591653Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.912456Z"},"links":{"citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:db43e8352d0cc1a7cac88327c767ac9841532357a3486107b3721c55d616f9e2","observation_id":"d3686116-b77e-4086-86e6-93a127e3afbf","resolution":{"observed_at":"2026-08-07T04:22:55.912456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-07T04:22:55.915660Z","title":"Deepseek-v3 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-07T04:13:50.591653Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.915660Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:22a232f9f3736fc5359529e7e90e90dbeda4cd61e5c8347b2b02e8bd6e88b711","observation_id":"4a99a1ed-4c12-4cf3-b715-9a75287a794a","resolution":{"observed_at":"2026-08-07T04:22:55.915660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.00476","last_updated":"2024-06-03T04:13:39Z","snapshot_observed_at":"2026-08-04T21:17:37.211833Z","submitted_at":"2024-03-01T12:02:19Z","title":"TempCompass: Do Video LLMs Really Understand Videos?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.00476","snapshot_observed_at":"2026-08-07T04:22:55.919117Z","title":"Tempcom- pass: Do video llms really understand videos?arXiv preprint arXiv:2403.00476, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-07T04:13:50.591653Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.919117Z"},"links":{"cited_paper":"/paper/2403.00476","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:8979602eef630e2ffd8023181bd49e5530d96ea064b98a85b92c3d4124b3ddb7","observation_id":"b4aacb62-809e-4ff1-8917-6c9b2db81e35","resolution":{"observed_at":"2026-08-07T04:22:55.919117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18111","last_updated":"2024-09-26T17:53:04Z","snapshot_observed_at":"2026-07-06T19:22:58.341345Z","submitted_at":"2024-09-26T17:53:04Z","title":"E.T. Bench: Towards Open-Ended Event-Level Video-Language Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18111","snapshot_observed_at":"2026-08-07T04:22:55.922688Z","title":"Et bench: Towards open-ended event-level video-language understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-07T04:13:50.591653Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.922688Z"},"links":{"cited_paper":"/paper/2409.18111","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:5bafc83ae8eff0f3bcf721177d0ee29d153e0f171fb30cc7133ccf085dcc0e5f","observation_id":"ca08579a-f769-47a9-87cc-a7bb7a4e650c","resolution":{"observed_at":"2026-08-07T04:22:55.922688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:22:55.926445Z","title":"Llama-3.3-70b-instruct","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-07T04:13:50.591653Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.926445Z"},"links":{"citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:3e5ace90cccfb0499547b782d4b6cb7905466715cbdea7c4fd7b3b473c4c3d4e","observation_id":"ea1b2c88-4fb8-4786-841f-074d073c603c","resolution":{"observed_at":"2026-08-07T04:22:55.926445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-07-06T16:27:15.027202Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-08-07T04:22:55.929946Z","title":"Mathvista: Evaluating mathemat- ical reasoning of foundation models in visual contexts.arXiv preprint arXiv:2310.02255, 2023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-07T04:13:50.591653Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.929946Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:7f174556f12dc5319f632cd2a8abc79c8f9dd76780200714d60628996d2bf746","observation_id":"cafefa2f-9f66-49de-9955-28857541679a","resolution":{"observed_at":"2026-08-07T04:22:55.929946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:22:55.933948Z","title":"Egoschema: A diagnostic benchmark for very long- form video language understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-07T04:13:50.591653Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.933948Z"},"links":{"citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:2b8a38a76eb40ee9abcff6d8f86726e9edde939c9cd71f5eb3e951cc9655a38d","observation_id":"4bc8e262-74ec-44bc-ae1e-02b2b7c087ab","resolution":{"observed_at":"2026-08-07T04:22:55.933948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.10244","last_updated":"2022-03-19T05:00:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-19T05:00:30Z","title":"ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.10244","snapshot_observed_at":"2026-08-07T04:22:55.937385Z","title":"Chartqa: A benchmark for question an- swering about charts with visual and logical reasoning.arXiv preprint arXiv:2203.10244, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-07T04:13:50.591653Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.937385Z"},"links":{"cited_paper":"/paper/2203.10244","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:2d15563df06c3cc6a781290b942b6e501f14494ce86a8f225f1ce282bc9b0448","observation_id":"4288717a-c077-4503-8d0f-6b943dc16086","resolution":{"observed_at":"2026-08-07T04:22:55.937385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:22:55.941480Z","title":"Plotqa: Reasoning over scientific plots","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-07T04:13:50.591653Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.941480Z"},"links":{"citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:d09a47c1ed9b781b880547224f1fec80d887d0f026b3e79ef036f9ba9f565bd4","observation_id":"f4dd8165-bd5e-4613-a574-b558d5fe57e6","resolution":{"observed_at":"2026-08-07T04:22:55.941480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16103","last_updated":"2023-11-28T18:16:29Z","snapshot_observed_at":"2026-08-05T15:15:57.768787Z","submitted_at":"2023-11-27T18:59:58Z","title":"Video-Bench: A Comprehensive Benchmark and Toolkit for Evaluating Video-based Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16103","snapshot_observed_at":"2026-08-07T04:22:55.944763Z","title":"Video-bench: A com- prehensive benchmark and toolkit for evaluating video-based large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-07T04:13:50.591653Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.944763Z"},"links":{"cited_paper":"/paper/2311.16103","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:b2d770533819293bc8a794cb7eca45d7bbd66cd06b1cb915279876c9146d07f0","observation_id":"ad1ab0a5-8d56-42b7-abc7-9ab6202c0e16","resolution":{"observed_at":"2026-08-07T04:22:55.944763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:22:55.948741Z","title":"Hello gpt4-o","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-07T04:13:50.591653Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.948741Z"},"links":{"citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:5d78aed34a19a547cf5b73cdf275a6d04be4cefcafbf1beb6635bea0f0a8e002","observation_id":"90e2f9bc-4a34-40b3-b521-86f6f1ad70c6","resolution":{"observed_at":"2026-08-07T04:22:55.948741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:22:55.951948Z","title":"Introducing openai o1","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-07T04:13:50.591653Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.951948Z"},"links":{"citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:f6580f2cfe0603cb2d1988e1fbfc886842ad0a5a8b2d78dd748779e11c8e4faa","observation_id":"9514c253-91e1-4207-9685-bde03caf9b22","resolution":{"observed_at":"2026-08-07T04:22:55.951948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:22:55.955676Z","title":"Openai o3-mini","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-07T04:13:50.591653Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.955676Z"},"links":{"citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:847e1a206dc6e30863e9a00b061d7fe5f36d545e73fa25e309aa34da0da185fe","observation_id":"f039a56a-1291-4aa6-8310-e8a13a0b95b8","resolution":{"observed_at":"2026-08-07T04:22:55.955676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:22:55.959241Z","title":"Per- ception test: A diagnostic benchmark for multimodal video models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-07T04:13:50.591653Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.959241Z"},"links":{"citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:d9dc8433657358ca76bcd4bb3da32176e3e0373a586d301033d3e6fc2805e597","observation_id":"e8356cf3-7c1c-489f-b74f-cd3836ef58e5","resolution":{"observed_at":"2026-08-07T04:22:55.959241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:22:55.962613Z","title":"Robust speech recognition via large-scale weak supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-07T04:13:50.591653Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.962613Z"},"links":{"citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:1bd7ee6417239f17d233707b35ad112458af2de3576679d84dc45f57679178eb","observation_id":"8456456e-a978-4287-883a-6bb39db100b2","resolution":{"observed_at":"2026-08-07T04:22:55.962613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:22:55.965834Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-07T04:13:50.591653Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.965834Z"},"links":{"citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:c646160ec861f94e5c75f63a04fe4572926cacd868c0bb1bec1815e3ff2ffeb1","observation_id":"248a203e-e894-4ac2-9ce7-d528e407e952","resolution":{"observed_at":"2026-08-07T04:22:55.965834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08813","last_updated":"2024-10-21T03:08:08Z","snapshot_observed_at":"2026-07-06T18:14:20.889736Z","submitted_at":"2024-05-14T17:59:02Z","title":"CinePile: A Long Video Question Answering Dataset and Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08813","snapshot_observed_at":"2026-08-07T04:22:55.969084Z","title":"Cinepile: A long video question answering dataset and benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-07T04:13:50.591653Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.969084Z"},"links":{"cited_paper":"/paper/2405.08813","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:27e776121f8cec2ee2924350d56256ff5b6c33c39f4c210736705d8cde5465a7","observation_id":"2bce9224-a4cb-41a3-853a-88f33fd1a58b","resolution":{"observed_at":"2026-08-07T04:22:55.969084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:22:55.972753Z","title":"Scienceqa: A novel resource for question answering on scholarly articles","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-07T04:13:50.591653Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.972753Z"},"links":{"citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:8fb54a65a9eb692045ce4dc09b55ca462a4a57048896720efe54cbac76b34fb9","observation_id":"0403ef84-b2cc-4ba8-b7ea-606cd2b175b1","resolution":{"observed_at":"2026-08-07T04:22:55.972753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T04:22:55.976330Z","title":"Proximal policy optimization algo- rithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-07T04:13:50.591653Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.976330Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:2df853d358c6c1e1cd09d72653878b0bd408bc0c4bad59793d15e30319b0f863","observation_id":"b7567d2a-afe6-49ac-87b3-75bdf9b6cba0","resolution":{"observed_at":"2026-08-07T04:22:55.976330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:22:55.979783Z","title":"Moviechat: From dense token to sparse memory for long video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-07T04:13:50.591653Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.979783Z"},"links":{"citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:2bdc6eb54c5d74ecc7c11b6008899ee5c62c7528a14f3e58c0161fd3fe3315bf","observation_id":"d67660f1-c14d-4565-a888-d47027a2f72c","resolution":{"observed_at":"2026-08-07T04:22:55.979783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:22:55.983472Z","title":"Scieval: A multi-level large language model evaluation benchmark for scientific re- search","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-07T04:13:50.591653Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.983472Z"},"links":{"citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:bf4cc2d2e6d39cb3a5ad3f5e82191bceb5d9e45b4c66755003a07e49b849ebcb","observation_id":"91aa0012-efe1-4a8b-ba32-15907154c07b","resolution":{"observed_at":"2026-08-07T04:22:55.983472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:22:55.986695Z","title":"Movieqa: Understanding stories in movies through question- answering","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-07T04:13:50.591653Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.986695Z"},"links":{"citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:43cdc9e5fb628e62865bd2ecefc2bba1cf21529776ab98ea472c8cbbb996da42","observation_id":"20738237-2470-4115-95df-50ad77de4008","resolution":{"observed_at":"2026-08-07T04:22:55.986695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:22:55.990171Z","title":"Claude Team","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-07T04:13:50.591653Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.990171Z"},"links":{"citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:806308c67c3506075ba61a400e8bedaea8ada39bcc90f917a83984aa632d9db9","observation_id":"a2c0df03-ede1-4de7-8286-ca5772f806c0","resolution":{"observed_at":"2026-08-07T04:22:55.990171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03569","snapshot_observed_at":"2026-08-07T04:22:55.993691Z","title":"Mimo-vl technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-07T04:13:50.591653Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.993691Z"},"links":{"cited_paper":"/paper/2506.03569","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:42d8a698cf014932d8283acfcc7273e6c026bed7f5a01bedff7f82a9a6238a03","observation_id":"61343ccd-0658-4382-8a41-57d7baedba20","resolution":{"observed_at":"2026-08-07T04:22:55.993691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-07T04:22:55.997443Z","title":"Gemini: a family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-07T04:13:50.591653Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.997443Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:615330249f0e5db134eb859b3935ad459832f2754244dfddafb4b497c200f5fa","observation_id":"0fc8315a-a995-42eb-a74d-b37f89622c28","resolution":{"observed_at":"2026-08-07T04:22:55.997443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-08-07T04:22:56.001192Z","title":"Kimi-vl technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-07T04:13:50.591653Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:56.001192Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:48529a9cec16288b4f75ebb13f91c6977c51ac88b48cf16325f2b427c1b542ec","observation_id":"223a5ac8-47d9-4218-9aed-c491e5c2d770","resolution":{"observed_at":"2026-08-07T04:22:56.001192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01949","last_updated":"2025-07-02T17:57:28Z","snapshot_observed_at":"2026-08-06T20:37:19.866170Z","submitted_at":"2025-07-02T17:57:28Z","title":"Kwai Keye-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.01949","snapshot_observed_at":"2026-08-07T04:22:56.004930Z","title":"Kwai keye-vl technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-07T04:13:50.591653Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:56.004930Z"},"links":{"cited_paper":"/paper/2507.01949","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:c60ef0a2ebf47670313dccc67e273ebabb9cb61e56e5c720ecc9406778402b57","observation_id":"574deb97-d5bb-408c-a6d8-0403b5d74e9d","resolution":{"observed_at":"2026-08-07T04:22:56.004930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:22:56.008810Z","title":"Qwq: Reflect deeply on the boundaries of the unknown","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-07T04:13:50.591653Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:56.008810Z"},"links":{"citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:3046d90c589f11482b7c20f0d45eb23cebbdc49c9d681d95f386b1756ed5d60c","observation_id":"a8ba791d-667a-4b4d-a2bf-a7ef871bb11d","resolution":{"observed_at":"2026-08-07T04:22:56.008810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:22:56.012332Z","title":"Qwq-32b: Embracing the power of reinforce- ment learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-07T04:13:50.591653Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:56.012332Z"},"links":{"citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:3004c552c38ca17eb404228fde940613ab8198a09368b0c00c21d3971d7e5fbb","observation_id":"0cc786e6-eb01-4356-9800-19c9bfa5dc5f","resolution":{"observed_at":"2026-08-07T04:22:56.012332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06186","last_updated":"2025-01-10T18:59:51Z","snapshot_observed_at":"2026-07-06T20:19:26.003822Z","submitted_at":"2025-01-10T18:59:51Z","title":"LlamaV-o1: Rethinking Step-by-step Visual Reasoning in LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.06186","snapshot_observed_at":"2026-08-07T04:22:56.015726Z","title":"Llamav- o1: Rethinking step-by-step visual reasoning in llms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-07T04:13:50.591653Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:56.015726Z"},"links":{"cited_paper":"/paper/2501.06186","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:6f916fba335dc04c4f4180ccbb9a4ce6cca8990e39d8f569b00c454b9228d466","observation_id":"998bdf44-fffa-4ad1-a2a1-5fda2aa5c176","resolution":{"observed_at":"2026-08-07T04:22:56.015726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:22:56.019503Z","title":"Mea- suring multimodal mathematical reasoning with math-vision dataset","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-07T04:13:50.591653Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:56.019503Z"},"links":{"citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:e4e2a2c3858b769f266426bbda5ca24265da0cbcd0b0d13bff5ae37cc8da5eb9","observation_id":"12d08530-1010-4849-ad8f-3a52100a62b0","resolution":{"observed_at":"2026-08-07T04:22:56.019503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-07T04:22:56.022809Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-07T04:13:50.591653Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:56.022809Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:45a398b0893f91a199ea38ddf1f1e2332ce5dcedd57a70842b025f969e36095e","observation_id":"a733ad3b-02c9-4ce9-ab71-cf3ee71ca713","resolution":{"observed_at":"2026-08-07T04:22:56.022809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10442","last_updated":"2025-04-07T09:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-15T18:59:27Z","title":"Enhancing the Reasoning Ability of Multimodal Large Language Models via Mixed Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10442","snapshot_observed_at":"2026-08-07T04:22:56.026472Z","title":"Enhancing the reasoning ability of multimodal large language models via mixed preference optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-07T04:13:50.591653Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:56.026472Z"},"links":{"cited_paper":"/paper/2411.10442","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:c74e6a42a129f7329f1ab673c342f24f9e23413726375136f35e2ad74ddaccc3","observation_id":"b61e18b8-a4b4-41a3-9831-f60c6e691041","resolution":{"observed_at":"2026-08-07T04:22:56.026472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08035","last_updated":"2025-08-09T10:54:59Z","snapshot_observed_at":"2026-08-05T10:34:24.268925Z","submitted_at":"2024-06-12T09:36:52Z","title":"LVBench: An Extreme Long Video Understanding Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08035","snapshot_observed_at":"2026-08-07T04:22:56.029698Z","title":"Lvbench: An extreme long video understanding benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-07T04:13:50.591653Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:56.029698Z"},"links":{"cited_paper":"/paper/2406.08035","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:0762e1607811dcfa97d454133cadbda46fd99d25ca6c6d9058e4be5986e27512","observation_id":"9c63bfad-d6e4-44f8-a6d1-0365e150803d","resolution":{"observed_at":"2026-08-07T04:22:56.029698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:22:56.033273Z","title":"Internvideo2: Scaling foundation models for mul- timodal video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-07T04:13:50.591653Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:56.033273Z"},"links":{"citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:025a69f616302bf47b2141833e5b54f1a9c4125a6f55b2e01b032db2f61c5fda","observation_id":"7721589c-31dc-49cd-85bc-14090328f51d","resolution":{"observed_at":"2026-08-07T04:22:56.033273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:22:56.036599Z","title":"Mmlu-pro: A more robust and challenging multi-task language understanding benchmark","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-07T04:13:50.591653Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:56.036599Z"},"links":{"citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:7958fcbc7633a7bf22760b7ffb6ca43d5bdfc1db7b7cbb29b2253203fa05f2c9","observation_id":"35576631-0d20-440c-93e9-b78340cdeae2","resolution":{"observed_at":"2026-08-07T04:22:56.036599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12386","last_updated":"2025-07-13T18:57:17Z","snapshot_observed_at":"2026-08-06T07:17:05.291678Z","submitted_at":"2025-01-21T18:59:00Z","title":"InternVideo2.5: Empowering Video MLLMs with Long and Rich Context Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12386","snapshot_observed_at":"2026-08-07T04:22:56.040389Z","title":"Internvideo2","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-07T04:13:50.591653Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:56.040389Z"},"links":{"cited_paper":"/paper/2501.12386","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:de88c239457ef95cd44c5c18dd33eeeb8ad69d4891223f24201ca55e10432620","observation_id":"a8c1bebf-3b71-4951-8ed2-20c1839bf3c5","resolution":{"observed_at":"2026-08-07T04:22:56.040389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:22:56.044092Z","title":"Charxiv: Charting gaps in realistic chart understanding in multimodal llms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-07T04:13:50.591653Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:56.044092Z"},"links":{"citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:873a5b96f3a22612fb63449291ee182a6b6d17cdb68473dd4235457b1204e2d8","observation_id":"d70a7195-8eeb-4046-a743-304badfbdd03","resolution":{"observed_at":"2026-08-07T04:22:56.044092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:22:56.048025Z","title":"Chain-of-thought prompting elicits reasoning in large lan- guage models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-07T04:13:50.591653Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:56.048025Z"},"links":{"citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:d96a0eb93bf78d354f78aa5a27b093c4e07a00ab93078de656f30916d137009f","observation_id":"80c7b20b-7eaa-440d-a569-3db0431d1f06","resolution":{"observed_at":"2026-08-07T04:22:56.048025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09711","last_updated":"2024-05-15T21:53:54Z","snapshot_observed_at":"2026-08-03T10:25:11.936842Z","submitted_at":"2024-05-15T21:53:54Z","title":"STAR: A Benchmark for Situated Reasoning in Real-World Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09711","snapshot_observed_at":"2026-08-07T04:22:56.051254Z","title":"Star: A benchmark for situated reason- ing in real-world videos","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-07T04:13:50.591653Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:56.051254Z"},"links":{"cited_paper":"/paper/2405.09711","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:ff529c708d55d84ca1921de5c9da461830e493e53a10fd416fc1c1b28691b5a6","observation_id":"9a8e578c-f3ed-4db6-b45f-5eba1d035eca","resolution":{"observed_at":"2026-08-07T04:22:56.051254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:22:56.054587Z","title":"Longvideobench: A benchmark for long-context interleaved video-language understanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-07T04:13:50.591653Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:56.054587Z"},"links":{"citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:06f95844f2c98af6b5102ae72bf9409f12c19dc2889717c6927171ecdd54c55a","observation_id":"09d024e8-859c-4f80-b3c1-2e52fbef5d7b","resolution":{"observed_at":"2026-08-07T04:22:56.054587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.07001","last_updated":"2024-11-06T13:56:28Z","snapshot_observed_at":"2026-07-06T18:12:59.925736Z","submitted_at":"2024-05-11T12:33:46Z","title":"ChartInsights: Evaluating Multimodal Large Language Models for Low-Level Chart Question Answering","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.07001","snapshot_observed_at":"2026-08-07T04:22:56.057630Z","title":"Chartinsights: Evaluating multimodal large language models for low-level chart question answer- ing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-07T04:13:50.591653Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:56.057630Z"},"links":{"cited_paper":"/paper/2405.07001","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:2e552c87c6447efb73a7be19a4b918d71e13e5dede18cacfad15886b45d325db","observation_id":"48a6e6e0-2b1a-4f35-8642-cb8ada73e42d","resolution":{"observed_at":"2026-08-07T04:22:56.057630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10302","last_updated":"2024-12-13T17:37:48Z","snapshot_observed_at":"2026-08-07T03:01:29.031129Z","submitted_at":"2024-12-13T17:37:48Z","title":"DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10302","snapshot_observed_at":"2026-08-07T04:22:56.061641Z","title":"Deepseek-vl2: Mixture-of- experts vision-language models for advanced multimodal understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-07T04:13:50.591653Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:56.061641Z"},"links":{"cited_paper":"/paper/2412.10302","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:e6d46b5f7e014cb95c8b7f0805494ca0c6b5e8d30e402c7f154d094c1106ee2d","observation_id":"c9615c86-c7a2-4a34-872b-ee5f4d09608c","resolution":{"observed_at":"2026-08-07T04:22:56.061641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:22:56.065135Z","title":"Next-qa: Next phase of question-answering to explaining temporal actions","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-07T04:13:50.591653Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:56.065135Z"},"links":{"citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:7375b0c3b9990e5422386f71f9216ddc444d38f709a68621e8625e90d13608b7","observation_id":"34c6a477-35c9-4891-a79d-16c5ff0e1c75","resolution":{"observed_at":"2026-08-07T04:22:56.065135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10440","last_updated":"2025-07-21T03:53:30Z","snapshot_observed_at":"2026-08-07T09:36:29.319006Z","submitted_at":"2024-11-15T18:58:31Z","title":"LLaVA-CoT: Let Vision Language Models Reason Step-by-Step","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10440","snapshot_observed_at":"2026-08-07T04:22:56.068528Z","title":"Llava-o1: Let vision language models reason step- by-step","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-07T04:13:50.591653Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:56.068528Z"},"links":{"cited_paper":"/paper/2411.10440","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:35995dacb8839f5caee6f7a4cddc74182e8a281933e5ebc9a68ebb148124521a","observation_id":"f499c913-d804-40f1-819d-bf2eaee718d1","resolution":{"observed_at":"2026-08-07T04:22:56.068528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-07T04:22:56.072007Z","title":"Qwen2 technical report, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-07T04:13:50.591653Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:56.072007Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:0b4dd4f036b41986f9f7136a690b9ddfd6ddc3dd58df50de08213071519aa7e6","observation_id":"9e523dc1-8827-4b22-a657-8ce90271cccb","resolution":{"observed_at":"2026-08-07T04:22:56.072007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T04:22:56.075817Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-07T04:13:50.591653Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:56.075817Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:d4b6defdb19f2396ad66d2bb7505cb0e57bc8694caa2e400ad2bd07f957579e0","observation_id":"baf03061-74b5-4672-9873-f22e3c60fa29","resolution":{"observed_at":"2026-08-07T04:22:56.075817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:22:56.079943Z","title":"Vript: A video is worth thousands of words","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-07T04:13:50.591653Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:56.079943Z"},"links":{"citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:0fe1a13233fef796d66cd7ac38f06f3d2adbf41a62c7d209f3622775a916dc69","observation_id":"63efaa54-d18b-432f-8376-97fd9af0a511","resolution":{"observed_at":"2026-08-07T04:22:56.079943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:22:56.083505Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for ex- pert agi","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-07T04:13:50.591653Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:56.083505Z"},"links":{"citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:93e511354f9fe18add814b784674c5ad9cb53ab3f1e0302578584d63e7d95982","observation_id":"b5a02474-e2ec-4826-bc43-a1a96178e9c0","resolution":{"observed_at":"2026-08-07T04:22:56.083505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02813","last_updated":"2025-05-22T08:22:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-04T15:31:26Z","title":"MMMU-Pro: A More Robust Multi-discipline Multimodal Understanding Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.02813","snapshot_observed_at":"2026-08-07T04:22:56.086963Z","title":"Mmmu-pro: A more robust multi- discipline multimodal understanding benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-07T04:13:50.591653Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:56.086963Z"},"links":{"cited_paper":"/paper/2409.02813","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:8d05c4ddc58492d45e93083a3af6f8499fd67654f2822160c4622b0b3e6ead5f","observation_id":"9c644f51-4323-42f6-9942-e752d92768b3","resolution":{"observed_at":"2026-08-07T04:22:56.086963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.17080","last_updated":"2024-06-05T04:05:42Z","snapshot_observed_at":"2026-08-04T14:21:38.334498Z","submitted_at":"2023-12-28T15:49:43Z","title":"MR-GSM8K: A Meta-Reasoning Benchmark for Large Language Model Evaluation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.17080","snapshot_observed_at":"2026-08-07T04:22:56.090625Z","title":"Mr-gsm8k: A meta-reasoning bench- mark for large language model evaluation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-07T04:13:50.591653Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:56.090625Z"},"links":{"cited_paper":"/paper/2312.17080","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:01e5cd8c428ded823d9726e664d02f2e85a3d47e8e793d9c152a8c1d5a1210e8","observation_id":"3352a403-d713-4bc4-8714-334ec1debcbf","resolution":{"observed_at":"2026-08-07T04:22:56.090625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13106","last_updated":"2025-06-03T03:33:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T18:59:46Z","title":"VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13106","snapshot_observed_at":"2026-08-07T04:22:56.094091Z","title":"Videollama 3: Frontier multi- modal foundation models for image and video understand- ing","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-07T04:13:50.591653Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:56.094091Z"},"links":{"cited_paper":"/paper/2501.13106","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:bd68e30e8eda29a4eb5dc9588c766430a2d924f4ae6f00ff836a0b08ba65990f","observation_id":"425c0e8d-d767-487e-9278-d7c6bfd58ae2","resolution":{"observed_at":"2026-08-07T04:22:56.094091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.11944","last_updated":"2024-11-04T13:28:48Z","snapshot_observed_at":"2026-07-06T17:18:44.456380Z","submitted_at":"2024-01-22T13:34:34Z","title":"CMMMU: A Chinese Massive Multi-discipline Multimodal Understanding Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.11944","snapshot_observed_at":"2026-08-07T04:22:56.098198Z","title":"Cmmmu: A chinese massive multi- discipline multimodal understanding benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-07T04:13:50.591653Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:56.098198Z"},"links":{"cited_paper":"/paper/2401.11944","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:8855f2c6280307bbc90cd9bd569b92e53b796b745575625e842233fd1c458c92","observation_id":"5aff777f-413d-4142-9836-e8741bc8053b","resolution":{"observed_at":"2026-08-07T04:22:56.098198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.04817","last_updated":"2025-09-01T05:09:27Z","snapshot_observed_at":"2026-07-06T16:58:39.949453Z","submitted_at":"2023-12-08T03:33:38Z","title":"LvBench: A Benchmark for Long-form Video Understanding with Versatile Multi-modal Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.04817","snapshot_observed_at":"2026-08-07T04:22:56.102015Z","title":"Movqa: A benchmark of versatile question-answering for long-form movie understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-07T04:13:50.591653Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:56.102015Z"},"links":{"cited_paper":"/paper/2312.04817","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:fd2914774d55370d41d19c102c46fa43d2e86108bbea58e26024e6e66ad2b347","observation_id":"636a398c-4161-4ff9-b1c1-fda5a06ae8a4","resolution":{"observed_at":"2026-08-07T04:22:56.102015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-07T04:22:56.105590Z","title":"Long context transfer from language to vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-07T04:13:50.591653Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:56.105590Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:2103a73f82e68966bfa2154da2faf9e8e16fbca896f92f6b00af3bff01bf58b0","observation_id":"780e01ce-6412-459e-9e7b-5403e03752ce","resolution":{"observed_at":"2026-08-07T04:22:56.105590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12380","last_updated":"2025-01-21T18:56:18Z","snapshot_observed_at":"2026-07-06T20:24:03.105038Z","submitted_at":"2025-01-21T18:56:18Z","title":"MMVU: Measuring Expert-Level Multi-Discipline Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12380","snapshot_observed_at":"2026-08-07T04:22:56.109578Z","title":"Mmvu: Measuring expert- level multi-discipline video understanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-07T04:13:50.591653Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:56.109578Z"},"links":{"cited_paper":"/paper/2501.12380","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:2bd6ce6038b3f11b4b69e51b1406f4c3e5b32b0996b0d199d8f3abf34f51d511","observation_id":"737f9633-f141-463b-b19e-f15e39a533b1","resolution":{"observed_at":"2026-08-07T04:22:56.109578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04264","last_updated":"2025-01-01T15:53:58Z","snapshot_observed_at":"2026-08-03T20:38:36.602554Z","submitted_at":"2024-06-06T17:09:32Z","title":"MLVU: Benchmarking Multi-task Long Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04264","snapshot_observed_at":"2026-08-07T04:22:56.113344Z","title":"Mlvu: A comprehensive benchmark for multi-task long video understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-07T04:13:50.591653Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:56.113344Z"},"links":{"cited_paper":"/paper/2406.04264","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:51bfdcaf1ffa7b866e107adc895593f86134995c80af82a52600e3c5f9a80bf8","observation_id":"aae769e7-ed42-4d67-b01c-f74bb405cab7","resolution":{"observed_at":"2026-08-07T04:22:56.113344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:22:56.117140Z","title":"Au- toshot: A short video dataset and state-of-the-art shot bound- ary detection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-07T04:13:50.591653Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:56.117140Z"},"links":{"citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:089d2198470f432b2b840d87021f76a3e4ebf4c5722f42f1d53ae75cb327c111","observation_id":"759fdcf6-4d27-45f7-b53b-2c2bedb2cbd5","resolution":{"observed_at":"2026-08-07T04:22:56.117140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:22:56.121263Z","title":"• Multi-step process 1: A → B → C → D","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-07T04:13:50.591653Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:56.121263Z"},"links":{"citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:afff9512ef05e12253ab155ca13d202544399543a8d32129f63e24d592611ff5","observation_id":"c9b0cd36-2a4d-4ce0-b797-719a13978b05","resolution":{"observed_at":"2026-08-07T04:22:56.121263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:22:56.124805Z","title":"• Multi-step process 1: A → B → C → D","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-07T04:13:50.591653Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:56.124805Z"},"links":{"citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:6f1ac09b942bd18f542a6a7353cb224bba55a04bc6dadbfad54e4c20d41990c1","observation_id":"d2abdced-fcf3-4473-80e9-510a730d7196","resolution":{"observed_at":"2026-08-07T04:22:56.124805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:22:56.128206Z","title":"• Multi-step process: D → C → B → A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-07T04:13:50.591653Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:56.128206Z"},"links":{"citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:712fbad97d03bd7194cdc61642ff463e53ab300ac6878d0c18faf9030550c2f3","observation_id":"054d7390-470b-43cd-8851-e4691ff87b5e","resolution":{"observed_at":"2026-08-07T04:22:56.128206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:22:56.132146Z","title":"• Multi-step process: D → C → B → A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-07T04:13:50.591653Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:56.132146Z"},"links":{"citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:111170f52d570cefa79f3f91fad7f5ee0d5f168380a0077c348d43bc73cf93a9","observation_id":"b8bd4edb-813b-4535-9876-4ea20b8ee2d5","resolution":{"observed_at":"2026-08-07T04:22:56.132146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:22:56.135839Z","title":"• Multi-step process: A → C → D → B","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-07T04:13:50.591653Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:56.135839Z"},"links":{"citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:3c1a717f6c793ad0750e605bd77c2b97442c29b6951e5665563c2a41bd84ce43","observation_id":"ee36e1ad-397c-49c7-8fa2-1440431e6943","resolution":{"observed_at":"2026-08-07T04:22:56.135839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:22:57.181090Z","title":null,"venue":null,"work_id":"7ebd4b14-4199-4436-8ad1-3d3290212dfa","year":null},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-07T04:13:50.591653Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:56.139701Z"},"links":{"citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:c22f63fb59ede14204b4f72bf6f690f87ae22a5b9dd3592aa28c063077a68625","observation_id":"1081268f-4dd7-4e6c-a68f-7147abad3086","resolution":{"observed_at":"2026-08-07T04:22:57.184540Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T04:13:50.591653Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":100,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":122},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 100 of 122 outbound references and 11 inbound Pith citation observations for arXiv:2506.10857."}