{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2021:623UVX2H45CLBNMRGUFX3J7YAK","short_pith_number":"pith:623UVX2H","schema_version":"1.0","canonical_sha256":"f6b74adf47e744b0b591350b7da7f802935dac47663883940a7bbd9bd1b125b1","source":{"kind":"arxiv","id":"2109.04735","version":1},"attestation_state":"computed","paper":{"title":"Temporal Pyramid Transformer with Multimodal Interaction for Video Question Answering","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Chongyang Wang, Min Peng, Xiang-Dong Zhou, Yuan Gao, Yu Shi","submitted_at":"2021-09-10T08:31:58Z","abstract_excerpt":"Video question answering (VideoQA) is challenging given its multimodal combination of visual understanding and natural language understanding. While existing approaches seldom leverage the appearance-motion information in the video at multiple temporal scales, the interaction between the question and the visual information for textual semantics extraction is frequently ignored. Targeting these issues, this paper proposes a novel Temporal Pyramid Transformer (TPT) model with multimodal interaction for VideoQA. The TPT model comprises two modules, namely Question-specific Transformer (QT) and Vi"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2109.04735","kind":"arxiv","version":1},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CV","submitted_at":"2021-09-10T08:31:58Z","cross_cats_sorted":[],"title_canon_sha256":"bf28ec099fe1a3982e1b6e0c8fe48dd2ea2904b734865e42ec9b551a43a8f57f","abstract_canon_sha256":"fc5c6e1e2f98625d65396acf4b59d9de2b711c18c6f20c95322b506823584466"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T03:13:09.535377Z","signature_b64":"Zum4ZNNui0Gqrld7l0DPJgdneixYvf+ixhYFP5ptzbd3whF0Xi1OBGFTEjGRJEGXF32dP/ivjpkeSpK1HsB1Cg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"f6b74adf47e744b0b591350b7da7f802935dac47663883940a7bbd9bd1b125b1","last_reissued_at":"2026-07-05T03:13:09.534865Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T03:13:09.534865Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Temporal Pyramid Transformer with Multimodal Interaction for Video Question Answering","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Chongyang Wang, Min Peng, Xiang-Dong Zhou, Yuan Gao, Yu Shi","submitted_at":"2021-09-10T08:31:58Z","abstract_excerpt":"Video question answering (VideoQA) is challenging given its multimodal combination of visual understanding and natural language understanding. While existing approaches seldom leverage the appearance-motion information in the video at multiple temporal scales, the interaction between the question and the visual information for textual semantics extraction is frequently ignored. Targeting these issues, this paper proposes a novel Temporal Pyramid Transformer (TPT) model with multimodal interaction for VideoQA. The TPT model comprises two modules, namely Question-specific Transformer (QT) and Vi"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2109.04735","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2109.04735/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2109.04735","created_at":"2026-07-05T03:13:09.534925+00:00"},{"alias_kind":"arxiv_version","alias_value":"2109.04735v1","created_at":"2026-07-05T03:13:09.534925+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2109.04735","created_at":"2026-07-05T03:13:09.534925+00:00"},{"alias_kind":"pith_short_12","alias_value":"623UVX2H45CL","created_at":"2026-07-05T03:13:09.534925+00:00"},{"alias_kind":"pith_short_16","alias_value":"623UVX2H45CLBNMR","created_at":"2026-07-05T03:13:09.534925+00:00"},{"alias_kind":"pith_short_8","alias_value":"623UVX2H","created_at":"2026-07-05T03:13:09.534925+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":0,"internal_anchor_count":0,"sample":[]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/623UVX2H45CLBNMRGUFX3J7YAK","json":"https://pith.science/pith/623UVX2H45CLBNMRGUFX3J7YAK.json","graph_json":"https://pith.science/api/pith-number/623UVX2H45CLBNMRGUFX3J7YAK/graph.json","events_json":"https://pith.science/api/pith-number/623UVX2H45CLBNMRGUFX3J7YAK/events.json","paper":"https://pith.science/paper/623UVX2H"},"agent_actions":{"view_html":"https://pith.science/pith/623UVX2H45CLBNMRGUFX3J7YAK","download_json":"https://pith.science/pith/623UVX2H45CLBNMRGUFX3J7YAK.json","view_paper":"https://pith.science/paper/623UVX2H","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2109.04735&json=true","fetch_graph":"https://pith.science/api/pith-number/623UVX2H45CLBNMRGUFX3J7YAK/graph.json","fetch_events":"https://pith.science/api/pith-number/623UVX2H45CLBNMRGUFX3J7YAK/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/623UVX2H45CLBNMRGUFX3J7YAK/action/timestamp_anchor","attest_storage":"https://pith.science/pith/623UVX2H45CLBNMRGUFX3J7YAK/action/storage_attestation","attest_author":"https://pith.science/pith/623UVX2H45CLBNMRGUFX3J7YAK/action/author_attestation","sign_citation":"https://pith.science/pith/623UVX2H45CLBNMRGUFX3J7YAK/action/citation_signature","submit_replication":"https://pith.science/pith/623UVX2H45CLBNMRGUFX3J7YAK/action/replication_record"}},"created_at":"2026-07-05T03:13:09.534925+00:00","updated_at":"2026-07-05T03:13:09.534925+00:00"}