{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:KCFWQIZNTCGIKMTU4B2P7YN4XW","short_pith_number":"pith:KCFWQIZN","schema_version":"1.0","canonical_sha256":"508b68232d988c853274e074ffe1bcbd8dc388e7ff53caa4b46bebc9ee1e92f9","source":{"kind":"arxiv","id":"2503.11495","version":1},"attestation_state":"computed","paper":{"title":"V-STaR: Benchmarking Video-LLMs on Video Spatio-Temporal Reasoning","license":"http://creativecommons.org/licenses/by-nc-sa/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Chenyang Si, Jian Hu, Shaogang Gong, Wei Li, Ziquan Liu, Zixu Cheng","submitted_at":"2025-03-14T15:21:44Z","abstract_excerpt":"Human processes video reasoning in a sequential spatio-temporal reasoning logic, we first identify the relevant frames (\"when\") and then analyse the spatial relationships (\"where\") between key objects, and finally leverage these relationships to draw inferences (\"what\"). However, can Video Large Language Models (Video-LLMs) also \"reason through a sequential spatio-temporal logic\" in videos? Existing Video-LLM benchmarks primarily focus on assessing object presence, neglecting relational reasoning. Consequently, it is difficult to measure whether a model truly comprehends object interactions (a"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2503.11495","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by-nc-sa/4.0/","primary_cat":"cs.CV","submitted_at":"2025-03-14T15:21:44Z","cross_cats_sorted":[],"title_canon_sha256":"e5d53799fbcffe03569350f4846f01d9e2c54490ed4e7279bc8efccf69719f25","abstract_canon_sha256":"b76c0d26d6c387f1ba413f5458398d0f03aeebe2d6be94e8878b3514756d4b13"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T10:31:32.967607Z","signature_b64":"jWv2VOD1f8eJayX2Ed0wrW77MUCRtCcPHC7M1/W4RHwOZQVhdKsWyee0Y47FMfdVgO3YUb+CcX13zT0LnclYAQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"508b68232d988c853274e074ffe1bcbd8dc388e7ff53caa4b46bebc9ee1e92f9","last_reissued_at":"2026-07-05T10:31:32.966808Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T10:31:32.966808Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"V-STaR: Benchmarking Video-LLMs on Video Spatio-Temporal Reasoning","license":"http://creativecommons.org/licenses/by-nc-sa/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Chenyang Si, Jian Hu, Shaogang Gong, Wei Li, Ziquan Liu, Zixu Cheng","submitted_at":"2025-03-14T15:21:44Z","abstract_excerpt":"Human processes video reasoning in a sequential spatio-temporal reasoning logic, we first identify the relevant frames (\"when\") and then analyse the spatial relationships (\"where\") between key objects, and finally leverage these relationships to draw inferences (\"what\"). However, can Video Large Language Models (Video-LLMs) also \"reason through a sequential spatio-temporal logic\" in videos? Existing Video-LLM benchmarks primarily focus on assessing object presence, neglecting relational reasoning. Consequently, it is difficult to measure whether a model truly comprehends object interactions (a"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2503.11495","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2503.11495/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2503.11495","created_at":"2026-07-05T10:31:32.966910+00:00"},{"alias_kind":"arxiv_version","alias_value":"2503.11495v1","created_at":"2026-07-05T10:31:32.966910+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2503.11495","created_at":"2026-07-05T10:31:32.966910+00:00"},{"alias_kind":"pith_short_12","alias_value":"KCFWQIZNTCGI","created_at":"2026-07-05T10:31:32.966910+00:00"},{"alias_kind":"pith_short_16","alias_value":"KCFWQIZNTCGIKMTU","created_at":"2026-07-05T10:31:32.966910+00:00"},{"alias_kind":"pith_short_8","alias_value":"KCFWQIZN","created_at":"2026-07-05T10:31:32.966910+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":29,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.19927","citing_title":"CARE: Competence-Aware Reward Shaping for Adaptive Reasoning Length in Video-MLLMs","ref_index":16,"is_internal_anchor":false},{"citing_arxiv_id":"2607.02269","citing_title":"AnyGroundBench: A Specialized-Domain Benchmark for Video Grounding in Vision-Language Models","ref_index":7,"is_internal_anchor":false},{"citing_arxiv_id":"2606.02482","citing_title":"X-Stream: Exploring MLLMs as Multiplexers for Multi-Stream Understanding","ref_index":13,"is_internal_anchor":false},{"citing_arxiv_id":"2606.02482","citing_title":"X-Stream: Exploring MLLMs as Multiplexers for Multi-Stream Understanding","ref_index":13,"is_internal_anchor":false},{"citing_arxiv_id":"2606.27828","citing_title":"Video-MME-Logical: A Controlled Diagnostic Benchmark for Video Temporal-Logical Reasoning","ref_index":28,"is_internal_anchor":false},{"citing_arxiv_id":"2605.06094","citing_title":"VISD: Enhancing Video Reasoning via Structured Self-Distillation","ref_index":7,"is_internal_anchor":false},{"citing_arxiv_id":"2605.22177","citing_title":"Maestro: Reinforcement Learning to Orchestrate Hierarchical Model-Skill Ensembles","ref_index":9,"is_internal_anchor":false},{"citing_arxiv_id":"2605.18641","citing_title":"Leveraging Latent Visual Reasoning in Silence","ref_index":4,"is_internal_anchor":false},{"citing_arxiv_id":"2605.19559","citing_title":"EgoCoT-Bench: Benchmarking Grounded and Verifiable Operation-Centric Chain of Thought Reasoning for MLLMs","ref_index":8,"is_internal_anchor":false},{"citing_arxiv_id":"2605.10057","citing_title":"STAR: Failure-Aware Markovian Routing for Multi-Agent Spatiotemporal Reasoning","ref_index":3,"is_internal_anchor":false},{"citing_arxiv_id":"2505.20715","citing_title":"MUSEG: Reinforcing Video Temporal Understanding via Timestamp-Aware Multi-Segment Grounding","ref_index":3,"is_internal_anchor":false},{"citing_arxiv_id":"2505.21374","citing_title":"Video-Holmes: Can MLLM Think Like Holmes for Complex Video Reasoning?","ref_index":17,"is_internal_anchor":false},{"citing_arxiv_id":"2511.20814","citing_title":"SPHINX: A Synthetic Environment for Visual Perception and Reasoning","ref_index":10,"is_internal_anchor":false},{"citing_arxiv_id":"2512.03666","citing_title":"ToG-Bench: Task-Oriented Spatio-Temporal Grounding in Egocentric Videos","ref_index":5,"is_internal_anchor":false},{"citing_arxiv_id":"2512.06673","citing_title":"Detector-Empowered Video Large Language Model for Efficient Spatio-Temporal Grounding","ref_index":11,"is_internal_anchor":false},{"citing_arxiv_id":"2602.17555","citing_title":"GraphThinker: Reinforcing Temporally Grounded Video Reasoning with Event Graph Thinking","ref_index":8,"is_internal_anchor":false},{"citing_arxiv_id":"2603.13091","citing_title":"Reasoning over Video: Evaluating How MLLMs Extract, Integrate, and Reconstruct Spatiotemporal Evidence","ref_index":5,"is_internal_anchor":false},{"citing_arxiv_id":"2604.08991","citing_title":"PinpointQA: A Dataset and Benchmark for Small Object-Centric Spatial Understanding in Indoor Videos","ref_index":5,"is_internal_anchor":false},{"citing_arxiv_id":"2605.10057","citing_title":"STAR: Failure-Aware Markovian Routing for Multi-Agent Spatiotemporal Reasoning","ref_index":3,"is_internal_anchor":false},{"citing_arxiv_id":"2604.26614","citing_title":"State Beyond Appearance: Diagnosing and Improving State Consistency in Dial-Based Measurement Reading","ref_index":5,"is_internal_anchor":false},{"citing_arxiv_id":"2605.08974","citing_title":"Tracking the Truth: Object-Centric Spatio-Temporal Monitoring for Video Large Language Models","ref_index":4,"is_internal_anchor":false},{"citing_arxiv_id":"2605.10057","citing_title":"STAR: Failure-Aware Markovian Routing for Multi-Agent Spatiotemporal Reasoning","ref_index":3,"is_internal_anchor":false},{"citing_arxiv_id":"2605.06094","citing_title":"VISD: Enhancing Video Reasoning via Structured Self-Distillation","ref_index":7,"is_internal_anchor":false},{"citing_arxiv_id":"2605.06094","citing_title":"VISD: Enhancing Video Reasoning via Structured Self-Distillation","ref_index":7,"is_internal_anchor":false},{"citing_arxiv_id":"2604.08991","citing_title":"PinpointQA: A Dataset and Benchmark for Small Object-Centric Spatial Understanding in Indoor Videos","ref_index":5,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/KCFWQIZNTCGIKMTU4B2P7YN4XW","json":"https://pith.science/pith/KCFWQIZNTCGIKMTU4B2P7YN4XW.json","graph_json":"https://pith.science/api/pith-number/KCFWQIZNTCGIKMTU4B2P7YN4XW/graph.json","events_json":"https://pith.science/api/pith-number/KCFWQIZNTCGIKMTU4B2P7YN4XW/events.json","paper":"https://pith.science/paper/KCFWQIZN"},"agent_actions":{"view_html":"https://pith.science/pith/KCFWQIZNTCGIKMTU4B2P7YN4XW","download_json":"https://pith.science/pith/KCFWQIZNTCGIKMTU4B2P7YN4XW.json","view_paper":"https://pith.science/paper/KCFWQIZN","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2503.11495&json=true","fetch_graph":"https://pith.science/api/pith-number/KCFWQIZNTCGIKMTU4B2P7YN4XW/graph.json","fetch_events":"https://pith.science/api/pith-number/KCFWQIZNTCGIKMTU4B2P7YN4XW/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/KCFWQIZNTCGIKMTU4B2P7YN4XW/action/timestamp_anchor","attest_storage":"https://pith.science/pith/KCFWQIZNTCGIKMTU4B2P7YN4XW/action/storage_attestation","attest_author":"https://pith.science/pith/KCFWQIZNTCGIKMTU4B2P7YN4XW/action/author_attestation","sign_citation":"https://pith.science/pith/KCFWQIZNTCGIKMTU4B2P7YN4XW/action/citation_signature","submit_replication":"https://pith.science/pith/KCFWQIZNTCGIKMTU4B2P7YN4XW/action/replication_record"}},"created_at":"2026-07-05T10:31:32.966910+00:00","updated_at":"2026-07-05T10:31:32.966910+00:00"}