{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:LXNJCFI7ROGJUBFSTAGX776SJI","short_pith_number":"pith:LXNJCFI7","schema_version":"1.0","canonical_sha256":"5dda91151f8b8c9a04b2980d7fffd24a3888ac7d04a27f770f2d6117cacfc337","source":{"kind":"arxiv","id":"2410.06166","version":1},"attestation_state":"computed","paper":{"title":"Temporal Reasoning Transfer from Text to Video","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.CL"],"primary_cat":"cs.CV","authors_text":"Chenxin An, Lean Wang, Lei Li, Lingpeng Kong, Linli Yao, Peiyuan Zhang, Qi Liu, Xu Sun, Yuanxin Liu","submitted_at":"2024-10-08T16:10:29Z","abstract_excerpt":"Video Large Language Models (Video LLMs) have shown promising capabilities in video comprehension, yet they struggle with tracking temporal changes and reasoning about temporal relationships. While previous research attributed this limitation to the ineffective temporal encoding of visual inputs, our diagnostic study reveals that video representations contain sufficient information for even small probing classifiers to achieve perfect accuracy. Surprisingly, we find that the key bottleneck in Video LLMs' temporal reasoning capability stems from the underlying LLM's inherent difficulty with tem"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2410.06166","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.CV","submitted_at":"2024-10-08T16:10:29Z","cross_cats_sorted":["cs.CL"],"title_canon_sha256":"932b618a1efcf89aca4499043c2eaac71b53c9d387d77e7845a53e5865dbc20a","abstract_canon_sha256":"11b1c14aecd4c499705e579c86ee02833fee6f5c5873ec7828b202562c1e9f7d"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T09:17:56.948248Z","signature_b64":"y2iiSSzBIBFL4TyHJfb3anRr16SrfXLDK6GnINJnQH9aAsLiyZaFz8L66Q/canCHQQ4jmkNjioWGjkKh27FXBQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"5dda91151f8b8c9a04b2980d7fffd24a3888ac7d04a27f770f2d6117cacfc337","last_reissued_at":"2026-07-05T09:17:56.947766Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T09:17:56.947766Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Temporal Reasoning Transfer from Text to Video","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.CL"],"primary_cat":"cs.CV","authors_text":"Chenxin An, Lean Wang, Lei Li, Lingpeng Kong, Linli Yao, Peiyuan Zhang, Qi Liu, Xu Sun, Yuanxin Liu","submitted_at":"2024-10-08T16:10:29Z","abstract_excerpt":"Video Large Language Models (Video LLMs) have shown promising capabilities in video comprehension, yet they struggle with tracking temporal changes and reasoning about temporal relationships. While previous research attributed this limitation to the ineffective temporal encoding of visual inputs, our diagnostic study reveals that video representations contain sufficient information for even small probing classifiers to achieve perfect accuracy. Surprisingly, we find that the key bottleneck in Video LLMs' temporal reasoning capability stems from the underlying LLM's inherent difficulty with tem"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2410.06166","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2410.06166/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2410.06166","created_at":"2026-07-05T09:17:56.947840+00:00"},{"alias_kind":"arxiv_version","alias_value":"2410.06166v1","created_at":"2026-07-05T09:17:56.947840+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2410.06166","created_at":"2026-07-05T09:17:56.947840+00:00"},{"alias_kind":"pith_short_12","alias_value":"LXNJCFI7ROGJ","created_at":"2026-07-05T09:17:56.947840+00:00"},{"alias_kind":"pith_short_16","alias_value":"LXNJCFI7ROGJUBFS","created_at":"2026-07-05T09:17:56.947840+00:00"},{"alias_kind":"pith_short_8","alias_value":"LXNJCFI7","created_at":"2026-07-05T09:17:56.947840+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":5,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.23256","citing_title":"P-JEPA: Procedural Video Representation Learning via Joint Embedding Predictive Architecture","ref_index":23,"is_internal_anchor":false},{"citing_arxiv_id":"2606.11470","citing_title":"The Periodic Table of LLM Reasoning: A Structured Survey of Reasoning Paradigms, Methods, and Failure Modes","ref_index":139,"is_internal_anchor":false},{"citing_arxiv_id":"2602.17555","citing_title":"GraphThinker: Reinforcing Temporally Grounded Video Reasoning with Event Graph Thinking","ref_index":35,"is_internal_anchor":false},{"citing_arxiv_id":"2604.11399","citing_title":"Reasoning Resides in Layers: Restoring Temporal Reasoning in Video-Language Models with Layer-Selective Merging","ref_index":9,"is_internal_anchor":false},{"citing_arxiv_id":"2605.07568","citing_title":"Tracing the Arrow of Time: Diagnosing Temporal Information Flow in Video-LLMs","ref_index":26,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/LXNJCFI7ROGJUBFSTAGX776SJI","json":"https://pith.science/pith/LXNJCFI7ROGJUBFSTAGX776SJI.json","graph_json":"https://pith.science/api/pith-number/LXNJCFI7ROGJUBFSTAGX776SJI/graph.json","events_json":"https://pith.science/api/pith-number/LXNJCFI7ROGJUBFSTAGX776SJI/events.json","paper":"https://pith.science/paper/LXNJCFI7"},"agent_actions":{"view_html":"https://pith.science/pith/LXNJCFI7ROGJUBFSTAGX776SJI","download_json":"https://pith.science/pith/LXNJCFI7ROGJUBFSTAGX776SJI.json","view_paper":"https://pith.science/paper/LXNJCFI7","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2410.06166&json=true","fetch_graph":"https://pith.science/api/pith-number/LXNJCFI7ROGJUBFSTAGX776SJI/graph.json","fetch_events":"https://pith.science/api/pith-number/LXNJCFI7ROGJUBFSTAGX776SJI/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/LXNJCFI7ROGJUBFSTAGX776SJI/action/timestamp_anchor","attest_storage":"https://pith.science/pith/LXNJCFI7ROGJUBFSTAGX776SJI/action/storage_attestation","attest_author":"https://pith.science/pith/LXNJCFI7ROGJUBFSTAGX776SJI/action/author_attestation","sign_citation":"https://pith.science/pith/LXNJCFI7ROGJUBFSTAGX776SJI/action/citation_signature","submit_replication":"https://pith.science/pith/LXNJCFI7ROGJUBFSTAGX776SJI/action/replication_record"}},"created_at":"2026-07-05T09:17:56.947840+00:00","updated_at":"2026-07-05T09:17:56.947840+00:00"}