{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:VP7NED63X2BXLID2727BKS2TJE","short_pith_number":"pith:VP7NED63","schema_version":"1.0","canonical_sha256":"abfed20fdbbe8375a07afebe154b53493ed6b7b2973a0d6b8d3703a92e4b72d8","source":{"kind":"arxiv","id":"2411.02851","version":1},"attestation_state":"computed","paper":{"title":"Learning to Unify Audio, Visual and Text for Audio-Enhanced Multilingual Visual Answer Localization","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI","cs.CL","cs.HC","cs.IR"],"primary_cat":"cs.MM","authors_text":"Bin Li, Zhibin Wen","submitted_at":"2024-11-05T06:49:14Z","abstract_excerpt":"The goal of Multilingual Visual Answer Localization (MVAL) is to locate a video segment that answers a given multilingual question. Existing methods either focus solely on visual modality or integrate visual and subtitle modalities. However, these methods neglect the audio modality in videos, consequently leading to incomplete input information and poor performance in the MVAL task. In this paper, we propose a unified Audio-Visual-Textual Span Localization (AVTSL) method that incorporates audio modality to augment both visual and textual representations for the MVAL task. Specifically, we inte"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2411.02851","kind":"arxiv","version":1},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.MM","submitted_at":"2024-11-05T06:49:14Z","cross_cats_sorted":["cs.AI","cs.CL","cs.HC","cs.IR"],"title_canon_sha256":"b8d40ec676bbafddfc16d46836770ea0d16d5403cbd29302137d40fc4801b6ae","abstract_canon_sha256":"160e85b8e8ae585d4a0b822854a223d6e42800d5e74a1d32ec302ee8cdb84f1c"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T09:31:19.067111Z","signature_b64":"q7A/ZVpqRFdnL6hH0XbVUcKOsoUfsvw3v9pGASvnghm4Gh5Bb6uG1ctsCnS4F44QSL9UDc0ubTXXA9gvJtmFBQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"abfed20fdbbe8375a07afebe154b53493ed6b7b2973a0d6b8d3703a92e4b72d8","last_reissued_at":"2026-07-05T09:31:19.066537Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T09:31:19.066537Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Learning to Unify Audio, Visual and Text for Audio-Enhanced Multilingual Visual Answer Localization","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI","cs.CL","cs.HC","cs.IR"],"primary_cat":"cs.MM","authors_text":"Bin Li, Zhibin Wen","submitted_at":"2024-11-05T06:49:14Z","abstract_excerpt":"The goal of Multilingual Visual Answer Localization (MVAL) is to locate a video segment that answers a given multilingual question. Existing methods either focus solely on visual modality or integrate visual and subtitle modalities. However, these methods neglect the audio modality in videos, consequently leading to incomplete input information and poor performance in the MVAL task. In this paper, we propose a unified Audio-Visual-Textual Span Localization (AVTSL) method that incorporates audio modality to augment both visual and textual representations for the MVAL task. Specifically, we inte"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2411.02851","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2411.02851/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2411.02851","created_at":"2026-07-05T09:31:19.066618+00:00"},{"alias_kind":"arxiv_version","alias_value":"2411.02851v1","created_at":"2026-07-05T09:31:19.066618+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2411.02851","created_at":"2026-07-05T09:31:19.066618+00:00"},{"alias_kind":"pith_short_12","alias_value":"VP7NED63X2BX","created_at":"2026-07-05T09:31:19.066618+00:00"},{"alias_kind":"pith_short_16","alias_value":"VP7NED63X2BXLID2","created_at":"2026-07-05T09:31:19.066618+00:00"},{"alias_kind":"pith_short_8","alias_value":"VP7NED63","created_at":"2026-07-05T09:31:19.066618+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":1,"internal_anchor_count":1,"sample":[{"citing_arxiv_id":"2507.04289","citing_title":"M$^3$-Med: A Benchmark for Multi-lingual, Multi-modal, and Multi-hop Reasoning in Medical Instructional Video Understanding","ref_index":2024,"is_internal_anchor":true}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/VP7NED63X2BXLID2727BKS2TJE","json":"https://pith.science/pith/VP7NED63X2BXLID2727BKS2TJE.json","graph_json":"https://pith.science/api/pith-number/VP7NED63X2BXLID2727BKS2TJE/graph.json","events_json":"https://pith.science/api/pith-number/VP7NED63X2BXLID2727BKS2TJE/events.json","paper":"https://pith.science/paper/VP7NED63"},"agent_actions":{"view_html":"https://pith.science/pith/VP7NED63X2BXLID2727BKS2TJE","download_json":"https://pith.science/pith/VP7NED63X2BXLID2727BKS2TJE.json","view_paper":"https://pith.science/paper/VP7NED63","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2411.02851&json=true","fetch_graph":"https://pith.science/api/pith-number/VP7NED63X2BXLID2727BKS2TJE/graph.json","fetch_events":"https://pith.science/api/pith-number/VP7NED63X2BXLID2727BKS2TJE/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/VP7NED63X2BXLID2727BKS2TJE/action/timestamp_anchor","attest_storage":"https://pith.science/pith/VP7NED63X2BXLID2727BKS2TJE/action/storage_attestation","attest_author":"https://pith.science/pith/VP7NED63X2BXLID2727BKS2TJE/action/author_attestation","sign_citation":"https://pith.science/pith/VP7NED63X2BXLID2727BKS2TJE/action/citation_signature","submit_replication":"https://pith.science/pith/VP7NED63X2BXLID2727BKS2TJE/action/replication_record"}},"created_at":"2026-07-05T09:31:19.066618+00:00","updated_at":"2026-07-05T09:31:19.066618+00:00"}