{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:CBOPKMGAHLHI4VEG375ZIC7ISH","short_pith_number":"pith:CBOPKMGA","schema_version":"1.0","canonical_sha256":"105cf530c03ace8e5486dffb940be891ff14f4767c669ffb44c7fec7218e3393","source":{"kind":"arxiv","id":"2506.10857","version":2},"attestation_state":"computed","paper":{"title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","license":"http://creativecommons.org/licenses/by-nc-sa/4.0/","headline":"","cross_cats":["cs.AI","cs.MM"],"primary_cat":"cs.CV","authors_text":"Conghui He, Jiashuo Yu, Limin Wang, Meng Chu, Pei Chu, Qirui Li, Ruijie Zhang, Songze Li, Yali Wang, Yinan He, Yi Wang, Yue Wu, Yu Qiao, Zhenxiang Li, Zhifei Ren, Zhongying Tu, Zizheng Huang","submitted_at":"2025-06-12T16:17:17Z","abstract_excerpt":"We present VRBench, the first long narrative video benchmark crafted for evaluating large models' multi-step reasoning capabilities, addressing limitations in existing evaluations that overlook temporal reasoning and procedural validity. It comprises 960 long videos (with an average duration of 1.6 hours), along with 8,243 human-labeled multi-step question-answering pairs and 25,106 reasoning steps with timestamps. These videos are curated via a multi-stage filtering process including expert inter-rater reviewing to prioritize plot coherence. We develop a human-AI collaborative framework that "},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2506.10857","kind":"arxiv","version":2},"metadata":{"license":"http://creativecommons.org/licenses/by-nc-sa/4.0/","primary_cat":"cs.CV","submitted_at":"2025-06-12T16:17:17Z","cross_cats_sorted":["cs.AI","cs.MM"],"title_canon_sha256":"78396739d1d47a516fbb40ce5bbe52429754e5987468fe372414ebe4f6175b0e","abstract_canon_sha256":"f0fc8bdd1d3a1cb7df651bf3221717be231fb7751ff83176966f024bc16b8ed8"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:48:04.659872Z","signature_b64":"1opT8DfjuOHcNadwj/zQhIiEMLCyWgNLK8vnRAoeEB8+EPmf/G2OdJESGDdEBGBo1cIDb+jXwoNWwvWcs18sAQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"105cf530c03ace8e5486dffb940be891ff14f4767c669ffb44c7fec7218e3393","last_reissued_at":"2026-07-05T11:48:04.659374Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:48:04.659374Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","license":"http://creativecommons.org/licenses/by-nc-sa/4.0/","headline":"","cross_cats":["cs.AI","cs.MM"],"primary_cat":"cs.CV","authors_text":"Conghui He, Jiashuo Yu, Limin Wang, Meng Chu, Pei Chu, Qirui Li, Ruijie Zhang, Songze Li, Yali Wang, Yinan He, Yi Wang, Yue Wu, Yu Qiao, Zhenxiang Li, Zhifei Ren, Zhongying Tu, Zizheng Huang","submitted_at":"2025-06-12T16:17:17Z","abstract_excerpt":"We present VRBench, the first long narrative video benchmark crafted for evaluating large models' multi-step reasoning capabilities, addressing limitations in existing evaluations that overlook temporal reasoning and procedural validity. It comprises 960 long videos (with an average duration of 1.6 hours), along with 8,243 human-labeled multi-step question-answering pairs and 25,106 reasoning steps with timestamps. These videos are curated via a multi-stage filtering process including expert inter-rater reviewing to prioritize plot coherence. We develop a human-AI collaborative framework that "},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2506.10857","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2506.10857/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2506.10857","created_at":"2026-07-05T11:48:04.659436+00:00"},{"alias_kind":"arxiv_version","alias_value":"2506.10857v2","created_at":"2026-07-05T11:48:04.659436+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2506.10857","created_at":"2026-07-05T11:48:04.659436+00:00"},{"alias_kind":"pith_short_12","alias_value":"CBOPKMGAHLHI","created_at":"2026-07-05T11:48:04.659436+00:00"},{"alias_kind":"pith_short_16","alias_value":"CBOPKMGAHLHI4VEG","created_at":"2026-07-05T11:48:04.659436+00:00"},{"alias_kind":"pith_short_8","alias_value":"CBOPKMGA","created_at":"2026-07-05T11:48:04.659436+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":8,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2605.23216","citing_title":"CaST-Bench: Benchmarking Causal Chain-Grounded Spatio-Temporal Reasoning for Video Question Answering","ref_index":42,"is_internal_anchor":false},{"citing_arxiv_id":"2606.07433","citing_title":"Watch, Remember, Reason: Human-View Video Understanding with MLLMs","ref_index":279,"is_internal_anchor":false},{"citing_arxiv_id":"2606.06338","citing_title":"StoryVideoQA: Scaling Deep Video Understanding with a Large-Scale, Multi-Genre and Auto-Generated Dataset","ref_index":32,"is_internal_anchor":false},{"citing_arxiv_id":"2606.03301","citing_title":"SagaQA: A Multi-hop Reasoning Benchmark for Long-form Narrative Understanding in TV Series","ref_index":5,"is_internal_anchor":false},{"citing_arxiv_id":"2605.23216","citing_title":"CaST-Bench: Benchmarking Causal Chain-Grounded Spatio-Temporal Reasoning for Video Question Answering","ref_index":42,"is_internal_anchor":false},{"citing_arxiv_id":"2601.06943","citing_title":"Watching, Reasoning, and Searching: A Video Deep Research Benchmark on Open Web for Agentic Video Reasoning","ref_index":16,"is_internal_anchor":false},{"citing_arxiv_id":"2604.14692","citing_title":"Chain-of-Glimpse: Search-Guided Progressive Object-Grounded Reasoning for Video Understanding","ref_index":53,"is_internal_anchor":false},{"citing_arxiv_id":"2604.14692","citing_title":"Chain-of-Glimpse: Search-Guided Progressive Object-Grounded Reasoning for Video Understanding","ref_index":53,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/CBOPKMGAHLHI4VEG375ZIC7ISH","json":"https://pith.science/pith/CBOPKMGAHLHI4VEG375ZIC7ISH.json","graph_json":"https://pith.science/api/pith-number/CBOPKMGAHLHI4VEG375ZIC7ISH/graph.json","events_json":"https://pith.science/api/pith-number/CBOPKMGAHLHI4VEG375ZIC7ISH/events.json","paper":"https://pith.science/paper/CBOPKMGA"},"agent_actions":{"view_html":"https://pith.science/pith/CBOPKMGAHLHI4VEG375ZIC7ISH","download_json":"https://pith.science/pith/CBOPKMGAHLHI4VEG375ZIC7ISH.json","view_paper":"https://pith.science/paper/CBOPKMGA","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2506.10857&json=true","fetch_graph":"https://pith.science/api/pith-number/CBOPKMGAHLHI4VEG375ZIC7ISH/graph.json","fetch_events":"https://pith.science/api/pith-number/CBOPKMGAHLHI4VEG375ZIC7ISH/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/CBOPKMGAHLHI4VEG375ZIC7ISH/action/timestamp_anchor","attest_storage":"https://pith.science/pith/CBOPKMGAHLHI4VEG375ZIC7ISH/action/storage_attestation","attest_author":"https://pith.science/pith/CBOPKMGAHLHI4VEG375ZIC7ISH/action/author_attestation","sign_citation":"https://pith.science/pith/CBOPKMGAHLHI4VEG375ZIC7ISH/action/citation_signature","submit_replication":"https://pith.science/pith/CBOPKMGAHLHI4VEG375ZIC7ISH/action/replication_record"}},"created_at":"2026-07-05T11:48:04.659436+00:00","updated_at":"2026-07-05T11:48:04.659436+00:00"}