{"work":{"id":"042bbb99-f912-4aa4-aa7a-252c7b6379a8","openalex_id":"https://openalex.org/W3087665158","doi":"10.48550/arxiv.2009.09761","arxiv_id":"2009.09761","raw_key":null,"title":"DiffWave: A Versatile Diffusion Model for Audio Synthesis","authors":null,"authors_text":"Zhifeng Kong, Wei Ping, Jiaji Huang, Kexin Zhao, Bryan Catanzaro","year":2020,"venue":"eess.AS","abstract":"In this work, we propose DiffWave, a versatile diffusion probabilistic model for conditional and unconditional waveform generation. The model is non-autoregressive, and converts the white noise signal into structured waveform through a Markov chain with a constant number of steps at synthesis. It is efficiently trained by optimizing a variant of variational bound on the data likelihood. DiffWave produces high-fidelity audios in different waveform generation tasks, including neural vocoding conditioned on mel spectrogram, class-conditional generation, and unconditional generation. We demonstrate that DiffWave matches a strong WaveNet vocoder in terms of speech quality (MOS: 4.44 versus 4.43), while synthesizing orders of magnitude faster. In particular, it significantly outperforms autoregressive and GAN-based waveform models in the challenging unconditional generation task in terms of audio quality and sample diversity from various automatic and human evaluations.","external_url":"https://arxiv.org/abs/2009.09761","cited_by_count":121,"metadata_source":"pith","metadata_fetched_at":"2026-08-05T02:28:24.338817+00:00","pith_arxiv_id":"2009.09761","created_at":"2026-05-10T06:46:37.443072+00:00","updated_at":"2026-08-05T02:28:24.338817+00:00","title_quality_ok":true,"display_title":"DiffWave: A Versatile Diffusion Model for Audio Synthesis","render_title":"DiffWave: A Versatile Diffusion Model for Audio Synthesis"},"hub":{"state":{"work_id":"042bbb99-f912-4aa4-aa7a-252c7b6379a8","tier":"hub","tier_reason":"10+ Pith inbound or 1,000+ external citations","pith_inbound_count":43,"external_cited_by_count":121,"distinct_field_count":14,"first_pith_cited_at":"2020-11-26T19:39:10+00:00","last_pith_cited_at":"2026-06-28T19:22:40+00:00","author_build_status":"not_needed","summary_status":"needed","contexts_status":"needed","graph_status":"needed","ask_index_status":"not_needed","reader_status":"not_needed","recognition_status":"not_needed","updated_at":"2026-08-22T14:49:31.721291+00:00","tier_text":"hub"},"tier":"hub","role_counts":[{"context_role":"background","n":6},{"context_role":"baseline","n":1},{"context_role":"dataset","n":1},{"context_role":"other","n":1}],"polarity_counts":[{"context_polarity":"background","n":6},{"context_polarity":"baseline","n":1},{"context_polarity":"unclear","n":1},{"context_polarity":"use_dataset","n":1}],"runs":{},"summary":{},"graph":{},"authors":[]}}