{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:QFUH2T7IXDDWXWJDXYKAGUXXOC","short_pith_number":"pith:QFUH2T7I","schema_version":"1.0","canonical_sha256":"81687d4fe8b8c76bd923be140352f770ae6e98bfe13e904726f9bb9f98f1e120","source":{"kind":"arxiv","id":"2407.12341","version":2},"attestation_state":"computed","paper":{"title":"Multimodal LLM-based Query Paraphrasing for Video Search","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.MM","authors_text":"Chong-Wah Ngo, Jiaxin Wu, Qing Li, Sheng-hua Zhong, Wing-Kwong Chan, Xiong-Yong Wei","submitted_at":"2024-07-17T06:33:51Z","abstract_excerpt":"Text-to-video retrieval answers user queries through searches based on concepts and embeddings. However, due to limitations in the size of the concept bank and the amount of training data, answering queries in the wild is not always effective because of the out-of-vocabulary problem. Furthermore, neither concept-based nor embedding-based search can perform reasoning to consolidate search results for complex queries that include logical and spatial constraints. To address these challenges, we leverage large language models (LLMs) to paraphrase queries using text-to-text (T2T), text-to-image (T2"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2407.12341","kind":"arxiv","version":2},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.MM","submitted_at":"2024-07-17T06:33:51Z","cross_cats_sorted":[],"title_canon_sha256":"0ca879ba802b1bf3fac69df6d80237f213ef955847516561124b93fe6671a1ab","abstract_canon_sha256":"28b21962e35a468661b8eca398b942c674176ac26e13133e18bb7224b045adc2"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:52:56.183696Z","signature_b64":"91AbU1bPdT/IZfvcHMTRR4Gf0oCTqgIbgpA/iIDHx6IS7JtwmNxvZUHcttylJpNlrPG9BmrxTXDh1A9ERhPgDA==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"81687d4fe8b8c76bd923be140352f770ae6e98bfe13e904726f9bb9f98f1e120","last_reissued_at":"2026-07-05T11:52:56.183250Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:52:56.183250Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Multimodal LLM-based Query Paraphrasing for Video Search","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.MM","authors_text":"Chong-Wah Ngo, Jiaxin Wu, Qing Li, Sheng-hua Zhong, Wing-Kwong Chan, Xiong-Yong Wei","submitted_at":"2024-07-17T06:33:51Z","abstract_excerpt":"Text-to-video retrieval answers user queries through searches based on concepts and embeddings. However, due to limitations in the size of the concept bank and the amount of training data, answering queries in the wild is not always effective because of the out-of-vocabulary problem. Furthermore, neither concept-based nor embedding-based search can perform reasoning to consolidate search results for complex queries that include logical and spatial constraints. To address these challenges, we leverage large language models (LLMs) to paraphrase queries using text-to-text (T2T), text-to-image (T2"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2407.12341","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2407.12341/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2407.12341","created_at":"2026-07-05T11:52:56.183305+00:00"},{"alias_kind":"arxiv_version","alias_value":"2407.12341v2","created_at":"2026-07-05T11:52:56.183305+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2407.12341","created_at":"2026-07-05T11:52:56.183305+00:00"},{"alias_kind":"pith_short_12","alias_value":"QFUH2T7IXDDW","created_at":"2026-07-05T11:52:56.183305+00:00"},{"alias_kind":"pith_short_16","alias_value":"QFUH2T7IXDDWXWJD","created_at":"2026-07-05T11:52:56.183305+00:00"},{"alias_kind":"pith_short_8","alias_value":"QFUH2T7I","created_at":"2026-07-05T11:52:56.183305+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":1,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2605.09836","citing_title":"ReCoVR: Closing the Loop in Interactive Composed Video Retrieval","ref_index":39,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/QFUH2T7IXDDWXWJDXYKAGUXXOC","json":"https://pith.science/pith/QFUH2T7IXDDWXWJDXYKAGUXXOC.json","graph_json":"https://pith.science/api/pith-number/QFUH2T7IXDDWXWJDXYKAGUXXOC/graph.json","events_json":"https://pith.science/api/pith-number/QFUH2T7IXDDWXWJDXYKAGUXXOC/events.json","paper":"https://pith.science/paper/QFUH2T7I"},"agent_actions":{"view_html":"https://pith.science/pith/QFUH2T7IXDDWXWJDXYKAGUXXOC","download_json":"https://pith.science/pith/QFUH2T7IXDDWXWJDXYKAGUXXOC.json","view_paper":"https://pith.science/paper/QFUH2T7I","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2407.12341&json=true","fetch_graph":"https://pith.science/api/pith-number/QFUH2T7IXDDWXWJDXYKAGUXXOC/graph.json","fetch_events":"https://pith.science/api/pith-number/QFUH2T7IXDDWXWJDXYKAGUXXOC/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/QFUH2T7IXDDWXWJDXYKAGUXXOC/action/timestamp_anchor","attest_storage":"https://pith.science/pith/QFUH2T7IXDDWXWJDXYKAGUXXOC/action/storage_attestation","attest_author":"https://pith.science/pith/QFUH2T7IXDDWXWJDXYKAGUXXOC/action/author_attestation","sign_citation":"https://pith.science/pith/QFUH2T7IXDDWXWJDXYKAGUXXOC/action/citation_signature","submit_replication":"https://pith.science/pith/QFUH2T7IXDDWXWJDXYKAGUXXOC/action/replication_record"}},"created_at":"2026-07-05T11:52:56.183305+00:00","updated_at":"2026-07-05T11:52:56.183305+00:00"}