{"work":{"id":"ec79607c-bea2-4879-85ed-00db057adcc7","openalex_id":null,"doi":"10.48550/arxiv.2503.10522","arxiv_id":"2503.10522","raw_key":null,"title":"AudioX: A Unified Framework for Anything-to-Audio Generation","authors":null,"authors_text":null,"year":2025,"venue":"cs.MM","abstract":"Audio and music generation based on flexible multimodal control signals is a widely applicable topic, with the following key challenges: 1) a unified multimodal modeling framework, and 2) large-scale, high-quality training data. As such, we propose AudioX, a unified framework for anything-to-audio generation that integrates varied multimodal conditions (i.e., text, video, and audio signals) in this work. The core design in this framework is a Multimodal Adaptive Fusion module, which enables the effective fusion of diverse multimodal inputs, enhancing cross-modal alignment and improving overall generation quality. To train this unified model, we construct a large-scale, high-quality dataset, IF-caps, comprising over 7 million samples curated through a structured data annotation pipeline. This dataset provides comprehensive supervision for multimodal-conditioned audio generation. We benchmark AudioX against state-of-the-art methods across a wide range of tasks, finding that our model achieves superior performance, especially in text-to-audio and text-to-music generation. These results demonstrate our method is capable of audio generation under multimodal control signals, showing powerful instruction-following potential. The code and datasets will be available at https://zeyuet.github.io/AudioX/.","external_url":"https://arxiv.org/abs/2503.10522","cited_by_count":null,"metadata_source":"pith","metadata_fetched_at":"2026-07-10T12:15:01.137692+00:00","pith_arxiv_id":"2503.10522","created_at":"2026-05-10T09:23:37.068077+00:00","updated_at":"2026-07-10T12:15:01.137692+00:00","title_quality_ok":true,"display_title":"AudioX: A Unified Framework for Anything-to-Audio Generation","render_title":"AudioX: A Unified Framework for Anything-to-Audio Generation"},"hub":{"state":{"work_id":"ec79607c-bea2-4879-85ed-00db057adcc7","tier":"hub","tier_reason":"10+ Pith inbound or 1,000+ external citations","pith_inbound_count":13,"external_cited_by_count":null,"distinct_field_count":3,"first_pith_cited_at":"2025-09-22T18:00:54+00:00","last_pith_cited_at":"2026-06-03T17:26:11+00:00","author_build_status":"not_needed","summary_status":"needed","contexts_status":"needed","graph_status":"needed","ask_index_status":"not_needed","reader_status":"not_needed","recognition_status":"not_needed","updated_at":"2026-07-02T18:22:51.924548+00:00","tier_text":"hub"},"tier":"hub","role_counts":[{"context_role":"background","n":1}],"polarity_counts":[{"context_polarity":"background","n":1}],"runs":{},"summary":{},"graph":{},"authors":[]}}