{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:YE6SKFD7N3B3WDUWK7MR4CO4BD","short_pith_number":"pith:YE6SKFD7","schema_version":"1.0","canonical_sha256":"c13d25147f6ec3bb0e9657d91e09dc08f54d5c8b303c117fcc16e34934db867c","source":{"kind":"arxiv","id":"2507.14784","version":2},"attestation_state":"computed","paper":{"title":"LeAdQA: LLM-Driven Context-Aware Temporal Grounding for Video Question Answering","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.CV","authors_text":"Baoyun Peng, Fei Hu, Haokai Ma, Xiaodong Wang, Xinxin Dong, Yufei Wang, Zixuan Dong","submitted_at":"2025-07-20T01:57:00Z","abstract_excerpt":"Video Question Answering (VideoQA) requires identifying sparse critical moments in long videos and reasoning about their causal relationships to answer semantically complex questions. While recent advances in multimodal learning have improved alignment and fusion, current approaches remain limited by two prevalent but fundamentally flawed strategies: (1) task-agnostic sampling indiscriminately processes all frames, overwhelming key events with irrelevant content; and (2) heuristic retrieval captures superficial patterns but misses causal-temporal structures needed for complex reasoning. To add"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2507.14784","kind":"arxiv","version":2},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CV","submitted_at":"2025-07-20T01:57:00Z","cross_cats_sorted":["cs.AI"],"title_canon_sha256":"1b3d6a5a41427db949367c4b548d433c27defb06eb8b9e6343ad5a10ea7c75c8","abstract_canon_sha256":"c0a9da6387ecab398b82b1e319f8628adeeab260ee14cbab4d0d6dde85743b1c"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:55:20.507377Z","signature_b64":"olFwNj66mZSxjYvcHox1DTk8OFHSPURjwyBFVp0qskniO7rwVoGcatDmgnGXGGnXR3mKHyUtLA7cj3C2oPq4DA==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"c13d25147f6ec3bb0e9657d91e09dc08f54d5c8b303c117fcc16e34934db867c","last_reissued_at":"2026-07-05T11:55:20.506842Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:55:20.506842Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"LeAdQA: LLM-Driven Context-Aware Temporal Grounding for Video Question Answering","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.CV","authors_text":"Baoyun Peng, Fei Hu, Haokai Ma, Xiaodong Wang, Xinxin Dong, Yufei Wang, Zixuan Dong","submitted_at":"2025-07-20T01:57:00Z","abstract_excerpt":"Video Question Answering (VideoQA) requires identifying sparse critical moments in long videos and reasoning about their causal relationships to answer semantically complex questions. While recent advances in multimodal learning have improved alignment and fusion, current approaches remain limited by two prevalent but fundamentally flawed strategies: (1) task-agnostic sampling indiscriminately processes all frames, overwhelming key events with irrelevant content; and (2) heuristic retrieval captures superficial patterns but misses causal-temporal structures needed for complex reasoning. To add"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2507.14784","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2507.14784/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2507.14784","created_at":"2026-07-05T11:55:20.506903+00:00"},{"alias_kind":"arxiv_version","alias_value":"2507.14784v2","created_at":"2026-07-05T11:55:20.506903+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2507.14784","created_at":"2026-07-05T11:55:20.506903+00:00"},{"alias_kind":"pith_short_12","alias_value":"YE6SKFD7N3B3","created_at":"2026-07-05T11:55:20.506903+00:00"},{"alias_kind":"pith_short_16","alias_value":"YE6SKFD7N3B3WDUW","created_at":"2026-07-05T11:55:20.506903+00:00"},{"alias_kind":"pith_short_8","alias_value":"YE6SKFD7","created_at":"2026-07-05T11:55:20.506903+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":3,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.09181","citing_title":"Counterfactual Reasoning for Fine-Grained Evidence Disentanglement in VideoQA","ref_index":8,"is_internal_anchor":false},{"citing_arxiv_id":"2606.05736","citing_title":"VTI-CoT: Visual-Textual Interleaved Chain of Thought for Video Reasoning","ref_index":7,"is_internal_anchor":false},{"citing_arxiv_id":"2604.23145","citing_title":"UpstreamQA: A Modular Framework for Explicit Reasoning on Video Question Answering Tasks","ref_index":13,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/YE6SKFD7N3B3WDUWK7MR4CO4BD","json":"https://pith.science/pith/YE6SKFD7N3B3WDUWK7MR4CO4BD.json","graph_json":"https://pith.science/api/pith-number/YE6SKFD7N3B3WDUWK7MR4CO4BD/graph.json","events_json":"https://pith.science/api/pith-number/YE6SKFD7N3B3WDUWK7MR4CO4BD/events.json","paper":"https://pith.science/paper/YE6SKFD7"},"agent_actions":{"view_html":"https://pith.science/pith/YE6SKFD7N3B3WDUWK7MR4CO4BD","download_json":"https://pith.science/pith/YE6SKFD7N3B3WDUWK7MR4CO4BD.json","view_paper":"https://pith.science/paper/YE6SKFD7","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2507.14784&json=true","fetch_graph":"https://pith.science/api/pith-number/YE6SKFD7N3B3WDUWK7MR4CO4BD/graph.json","fetch_events":"https://pith.science/api/pith-number/YE6SKFD7N3B3WDUWK7MR4CO4BD/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/YE6SKFD7N3B3WDUWK7MR4CO4BD/action/timestamp_anchor","attest_storage":"https://pith.science/pith/YE6SKFD7N3B3WDUWK7MR4CO4BD/action/storage_attestation","attest_author":"https://pith.science/pith/YE6SKFD7N3B3WDUWK7MR4CO4BD/action/author_attestation","sign_citation":"https://pith.science/pith/YE6SKFD7N3B3WDUWK7MR4CO4BD/action/citation_signature","submit_replication":"https://pith.science/pith/YE6SKFD7N3B3WDUWK7MR4CO4BD/action/replication_record"}},"created_at":"2026-07-05T11:55:20.506903+00:00","updated_at":"2026-07-05T11:55:20.506903+00:00"}