{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2023:VEJYCBSZMUOGN6Z723FFDVYI7F","short_pith_number":"pith:VEJYCBSZ","schema_version":"1.0","canonical_sha256":"a913810659651c66fb3fd6ca51d708f94c2a9e5dcb042db8e076a26dd9e2be0a","source":{"kind":"arxiv","id":"2305.03347","version":1},"attestation_state":"computed","paper":{"title":"A Large Cross-Modal Video Retrieval Dataset with Reading Comprehension","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Hong Zhou, Jiahong Li, Mike Zheng Shou, Weijia Wu, Xiang Bai, Yuzhong Zhao, Zhuang Li","submitted_at":"2023-05-05T08:00:14Z","abstract_excerpt":"Most existing cross-modal language-to-video retrieval (VR) research focuses on single-modal input from video, i.e., visual representation, while the text is omnipresent in human environments and frequently critical to understand video. To study how to retrieve video with both modal inputs, i.e., visual and text semantic representations, we first introduce a large-scale and cross-modal Video Retrieval dataset with text reading comprehension, TextVR, which contains 42.2k sentence queries for 10.5k videos of 8 scenario domains, i.e., Street View (indoor), Street View (outdoor), Games, Sports, Dri"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2305.03347","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.CV","submitted_at":"2023-05-05T08:00:14Z","cross_cats_sorted":[],"title_canon_sha256":"71b063464350f1b6dd785448a2563dc4bd6f5e049ec40262439faf9cc4cdc293","abstract_canon_sha256":"7a467b3f67713c5b79259d634a6f00c902e6fe0a09b5ca8cf08388af53042ac7"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T06:07:22.214719Z","signature_b64":"AOcNknPjrB2yX3r8jBJnhsLKzuJ/2dZ5TaWcEnH/s3nPT/vRkPWLJRl4NrWbFWh8l7/Ufgd+AW/OxAwTg2/FBw==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"a913810659651c66fb3fd6ca51d708f94c2a9e5dcb042db8e076a26dd9e2be0a","last_reissued_at":"2026-07-05T06:07:22.214270Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T06:07:22.214270Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"A Large Cross-Modal Video Retrieval Dataset with Reading Comprehension","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Hong Zhou, Jiahong Li, Mike Zheng Shou, Weijia Wu, Xiang Bai, Yuzhong Zhao, Zhuang Li","submitted_at":"2023-05-05T08:00:14Z","abstract_excerpt":"Most existing cross-modal language-to-video retrieval (VR) research focuses on single-modal input from video, i.e., visual representation, while the text is omnipresent in human environments and frequently critical to understand video. To study how to retrieve video with both modal inputs, i.e., visual and text semantic representations, we first introduce a large-scale and cross-modal Video Retrieval dataset with text reading comprehension, TextVR, which contains 42.2k sentence queries for 10.5k videos of 8 scenario domains, i.e., Street View (indoor), Street View (outdoor), Games, Sports, Dri"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2305.03347","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2305.03347/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2305.03347","created_at":"2026-07-05T06:07:22.214324+00:00"},{"alias_kind":"arxiv_version","alias_value":"2305.03347v1","created_at":"2026-07-05T06:07:22.214324+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2305.03347","created_at":"2026-07-05T06:07:22.214324+00:00"},{"alias_kind":"pith_short_12","alias_value":"VEJYCBSZMUOG","created_at":"2026-07-05T06:07:22.214324+00:00"},{"alias_kind":"pith_short_16","alias_value":"VEJYCBSZMUOGN6Z7","created_at":"2026-07-05T06:07:22.214324+00:00"},{"alias_kind":"pith_short_8","alias_value":"VEJYCBSZ","created_at":"2026-07-05T06:07:22.214324+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":4,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.02569","citing_title":"AdaCodec: A Predictive Visual Code for Video MLLMs","ref_index":77,"is_internal_anchor":false},{"citing_arxiv_id":"2606.02569","citing_title":"AdaCodec: A Predictive Visual Code for Video MLLMs","ref_index":78,"is_internal_anchor":false},{"citing_arxiv_id":"2311.17005","citing_title":"MVBench: A Comprehensive Multi-modal Video Understanding Benchmark","ref_index":83,"is_internal_anchor":false},{"citing_arxiv_id":"2404.16994","citing_title":"PLLaVA : Parameter-free LLaVA Extension from Images to Videos for Video Dense Captioning","ref_index":42,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/VEJYCBSZMUOGN6Z723FFDVYI7F","json":"https://pith.science/pith/VEJYCBSZMUOGN6Z723FFDVYI7F.json","graph_json":"https://pith.science/api/pith-number/VEJYCBSZMUOGN6Z723FFDVYI7F/graph.json","events_json":"https://pith.science/api/pith-number/VEJYCBSZMUOGN6Z723FFDVYI7F/events.json","paper":"https://pith.science/paper/VEJYCBSZ"},"agent_actions":{"view_html":"https://pith.science/pith/VEJYCBSZMUOGN6Z723FFDVYI7F","download_json":"https://pith.science/pith/VEJYCBSZMUOGN6Z723FFDVYI7F.json","view_paper":"https://pith.science/paper/VEJYCBSZ","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2305.03347&json=true","fetch_graph":"https://pith.science/api/pith-number/VEJYCBSZMUOGN6Z723FFDVYI7F/graph.json","fetch_events":"https://pith.science/api/pith-number/VEJYCBSZMUOGN6Z723FFDVYI7F/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/VEJYCBSZMUOGN6Z723FFDVYI7F/action/timestamp_anchor","attest_storage":"https://pith.science/pith/VEJYCBSZMUOGN6Z723FFDVYI7F/action/storage_attestation","attest_author":"https://pith.science/pith/VEJYCBSZMUOGN6Z723FFDVYI7F/action/author_attestation","sign_citation":"https://pith.science/pith/VEJYCBSZMUOGN6Z723FFDVYI7F/action/citation_signature","submit_replication":"https://pith.science/pith/VEJYCBSZMUOGN6Z723FFDVYI7F/action/replication_record"}},"created_at":"2026-07-05T06:07:22.214324+00:00","updated_at":"2026-07-05T06:07:22.214324+00:00"}