Pith. sign in

Paper Citation Record · LEDGER

Qwen-Audio-3.0-Gen-Preview Technical Report

As of 5 August 2026, this Paper Citation Record lists 66 of 66 outbound references and 0 inbound Pith citation observations for arXiv:2607.27011.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2607.27011 v2

Coverage vector

measured 66 of 66 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-01T10:17:28.260156Z

measured 66 of 66 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-05T06:32:48.257954+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

66 of 66 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved66
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 506e5225-c9d6-4243-81cc-8c15eefdde8f · outbound

This paper cites MusicLM: Generating Music From Text.

Qwen-Audio-3.0-Gen-Preview Technical Report MusicLM: Generating Music From Text

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:22.487525Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:22.487525Z digest=sha256:9f9af8aa3de893130976f216e1c6d01e3eadaf6a96a936b652e3a0ab05644ca5

Observation a46f2807-32b6-422f-900d-14e96376af32 · outbound

This paper cites Seed-TTS: A family of high-quality versatile speech generation models, 2024.

Qwen-Audio-3.0-Gen-Preview Technical Report Seed-TTS: A family of high-quality versatile speech generation models, 2024

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:22.529628Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:22.529628Z digest=sha256:19b4e270255cecbd6722bf8f737a8451da1ed8d518dbccdf51dda71edf8cb4da

Observation 571238a2-8fe4-426c-a2e6-561df36dc1c1 · outbound

This paper cites Neural codec language models are zero-shot text to speech synthesizers.

Qwen-Audio-3.0-Gen-Preview Technical Report Neural codec language models are zero-shot text to speech synthesizers

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:22.616114Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:22.616114Z digest=sha256:cb7530ffd71cc32c5cd4bc51e4b990c5544970b7a0a606832149a1773c928632

Observation 399657bb-fc47-4d67-b213-0facfc60978c · outbound

This paper cites F5-TTS: A fairytaler that fakes fluent and faithful speech with flow matching.

Qwen-Audio-3.0-Gen-Preview Technical Report F5-TTS: A fairytaler that fakes fluent and faithful speech with flow matching

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:22.707593Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:22.707593Z digest=sha256:3ec4e4d6615dc7b72dccee2f5a28549f3b55e15fc2f3f20f65c3164bf3e86e03

Observation 6aa75e47-0324-4170-ad01-cf3379c6abf8 · outbound

This paper cites MMAudio: Taming multimodal joint training for high-quality video-to-audio synthesis, 2025.

Qwen-Audio-3.0-Gen-Preview Technical Report MMAudio: Taming multimodal joint training for high-quality video-to-audio synthesis, 2025

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:22.772056Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:22.772056Z digest=sha256:2622e2af7e27b436e27a88e9ca32c7b0ffe3a02a2d3a82f6fd977554c897e7f5

Observation 6f789e2c-bf5c-48c4-927e-fdd2b64b9cad · outbound

This paper cites Simple and controllable music generation.

Qwen-Audio-3.0-Gen-Preview Technical Report Simple and controllable music generation

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:22.861724Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:22.861724Z digest=sha256:c62c383d0596012f62ba68978234340cb3aee73d19880be08635689f588ccfca

Observation 9124b13d-8210-4db4-90f6-5dcd7675ff24 · outbound

This paper cites Pushing the frontier of full-song generation: Hierarchical autoregressive planning meets flow-matching rendering, 2026.

Qwen-Audio-3.0-Gen-Preview Technical Report Pushing the frontier of full-song generation: Hierarchical autoregressive planning meets flow-matching rendering, 2026

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:22.950470Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:22.950470Z digest=sha256:ab91b051405b9476fe13c2c5929e4399eba84a8b116c90951a217df5b2c0e4bf

Observation 559b2844-9070-4cf3-82fe-d2fb17e524fa · outbound

This paper cites CosyV oice 3: Towards in-the-wild speech generation via scaling-up and post-training, 2025.

Qwen-Audio-3.0-Gen-Preview Technical Report CosyV oice 3: Towards in-the-wild speech generation via scaling-up and post-training, 2025

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:23.098536Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:23.098536Z digest=sha256:b960496834174e65e11165456276c0096af4e3416933cb699243473b38275f4f

Observation 50fc7bfc-07bd-404b-898d-d6bcd9e6194d · outbound

This paper cites Audio-Oscar: A Multi-Agent System for Complex Audio Scene Generation, Orchestration, and Refinement.

Qwen-Audio-3.0-Gen-Preview Technical Report Audio-Oscar: A Multi-Agent System for Complex Audio Scene Generation, Orchestration, and Refinement

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:23.216775Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:23.216775Z digest=sha256:ad8626dcec823b4462b890fca07e37972ddc35afc929140c0d347f09a5e68213

Observation 1c1ea40e-2747-4209-8c63-a91e2855608e · outbound

This paper cites Stable Audio Open.

Qwen-Audio-3.0-Gen-Preview Technical Report Stable Audio Open

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:23.360198Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:23.360198Z digest=sha256:7b4788228a09d7185cfb97a9d5bd20af250a31ee7b0de7feb5d6e34ed4bbca91

Observation 908822d6-a2d9-471f-a6be-2704ccb034da · outbound

This paper cites Text-to-audio generation using instruction guided latent diffusion model.

Qwen-Audio-3.0-Gen-Preview Technical Report Text-to-audio generation using instruction guided latent diffusion model

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:23.511168Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:23.511168Z digest=sha256:81d4796fe6d2aed0e1490207041524ce38a2d81542177ab401cc8613eabecfc2

Observation 649f3337-45fc-4fbd-ab70-b4c5d393151a · outbound

This paper cites Qwen3-TTS technical report, 2026.

Qwen-Audio-3.0-Gen-Preview Technical Report Qwen3-TTS technical report, 2026

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:23.634596Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:23.634596Z digest=sha256:21d01bc5c5fba4bc703e92d94122b03a8b3f5dfc36efddf65934f444ca261f7c

Observation 1a877c28-b456-4422-b7ef-20c3774796b9 · outbound

This paper cites Make-An-Audio 2: Temporal-Enhanced Text-to-Audio Generation.

Qwen-Audio-3.0-Gen-Preview Technical Report Make-An-Audio 2: Temporal-Enhanced Text-to-Audio Generation

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:23.739972Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:23.739972Z digest=sha256:1a0fdab1071ece13708555e12d8adb4f5f73b99b59d28121aec1485bfa001f03

Observation 918f5643-c159-4f51-b0f6-a4920efb92eb · outbound

This paper cites Algorithms to measure audio programme loudness and true-peak audio level.

Qwen-Audio-3.0-Gen-Preview Technical Report Algorithms to measure audio programme loudness and true-peak audio level

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:23.861861Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:23.861861Z digest=sha256:f02cce94f94148426ec343ac082d8ba0419eead5f55c4b4b17ec7fdc3714b536

Observation bdb5a1c3-91e5-40f3-8571-8b9c2973ab33 · outbound

This paper cites ControlAudio: Tackling text-guided, timing-indicated and intelligible audio generation via progressive diffusion modeling.

Qwen-Audio-3.0-Gen-Preview Technical Report ControlAudio: Tackling text-guided, timing-indicated and intelligible audio generation via progressive diffusion modeling

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:23.997580Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:23.997580Z digest=sha256:a35a3166cb2095057ce85e76e090517acf2a1c0d08146ee06893c30c4ce8bf9c

Observation 34b7adc2-dbc5-4ef7-a62a-0117b0267918 · outbound

This paper cites AudioCaps: Generating captions for audios in the wild.

Qwen-Audio-3.0-Gen-Preview Technical Report AudioCaps: Generating captions for audios in the wild

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:24.117926Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:24.117926Z digest=sha256:66144b356984be2a0aaa7d418a299f063c47088bc1baddfac6a9044bc8f727a5

Observation a98c2186-ab36-4733-9c07-05177109401a · outbound

This paper cites High-fidelity audio compression with improved RVQGAN.Advances in Neural Information Processing Systems, 36:27980–27993, 2023.

Qwen-Audio-3.0-Gen-Preview Technical Report High-fidelity audio compression with improved RVQGAN.Advances in Neural Information Processing Systems, 36:27980–27993, 2023

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:24.267366Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:24.267366Z digest=sha256:61a272a734dbf8bab3fb01e0a8860d2e7858c59504944eb2130e00bf32021c82

Observation 3f8d524d-a15b-4cfa-91e0-554c26c1d62f · outbound

This paper cites V oicebox: Text-guided multilingual universal speech generation at scale.Advances in Neural Information Processing Systems, 36:14005–14034, 2023.

Qwen-Audio-3.0-Gen-Preview Technical Report V oicebox: Text-guided multilingual universal speech generation at scale.Advances in Neural Information Processing Systems, 36:14005–14034, 2023

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:24.385005Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:24.385005Z digest=sha256:722fa724fad5d0c9f9b52a1184321c2d5132a023645f7c2a0bd9723b36ba6f42

Observation a4772290-af44-48b9-9494-a3e1ee86784b · outbound

This paper cites HoliTok:A Coutinuous Holistic Tokenization with Robust Dual Capabilities of Speech Generation and Understanding.

Qwen-Audio-3.0-Gen-Preview Technical Report HoliTok:A Coutinuous Holistic Tokenization with Robust Dual Capabilities of Speech Generation and Understanding

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:24.439149Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:24.439149Z digest=sha256:c15aea6620324b0f64565de4d5e8d2f433078ced36bbf748b19995faa0ea9921

Observation 32c33759-9f18-43eb-a923-fa8c07c07fac · outbound

This paper cites UNISON: A Unified Sound Generation and Editing Framework via Deep LLM Fusion.

Qwen-Audio-3.0-Gen-Preview Technical Report UNISON: A Unified Sound Generation and Editing Framework via Deep LLM Fusion

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:24.502786Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:24.502786Z digest=sha256:4858d4b350b686ae69f109847c2c9c80823d275568447773fa3014ca86ac98a5

Observation 488ddc19-8962-4c2c-b4a3-f2cd8294aef1 · outbound

This paper cites AudioLDM: text-to-audio generation with latent diffusion models.

Qwen-Audio-3.0-Gen-Preview Technical Report AudioLDM: text-to-audio generation with latent diffusion models

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:24.551894Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:24.551894Z digest=sha256:a5c70554711d3586bdc211685f6cc59124f7b51f99898497d14102b876f43fc8

Observation a1ea7b7a-1e63-4a91-98e6-913236c357c4 · outbound

This paper cites AudioLDM 2: Learning holistic audio generation with self- supervised pretraining.IEEE/ACM Transactions on Audio, Speech, and Language Processing, 32:2871– 2883, 2024.

Qwen-Audio-3.0-Gen-Preview Technical Report AudioLDM 2: Learning holistic audio generation with self- supervised pretraining.IEEE/ACM Transactions on Audio, Speech, and Language Processing, 32:2871– 2883, 2024

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:24.609517Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:24.609517Z digest=sha256:64ab287041b9fc26e603fe66fb50cf07918a84768e6911dddc388af66159359a

Observation 6b0f1623-307a-4354-aa3f-18bfb283f993 · outbound

This paper cites WavJourney: Compositional audio creation with large language models.

Qwen-Audio-3.0-Gen-Preview Technical Report WavJourney: Compositional audio creation with large language models

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:24.675398Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:24.675398Z digest=sha256:a9d1460eda185e01ad61bc8e61bb17481cc820e1dd26ea4da78295e842a6a60b

Observation 3f108f7c-28a8-4cab-90af-39bd440f6e69 · outbound

This paper cites UniMoE-Audio: Unified speech and music generation with dynamic-capacity MoE, 2025.

Qwen-Audio-3.0-Gen-Preview Technical Report UniMoE-Audio: Unified speech and music generation with dynamic-capacity MoE, 2025

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:24.734732Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:24.734732Z digest=sha256:8bdfab15a37d291b5ae41f2ef7c789b53a20b314034297c828e2c1874c88957b

Observation 6a7be74d-50e3-4437-a25c-bb32e0a5353e · outbound

This paper cites The Song Describer Dataset: a Corpus of Audio Captions for Music-and-Language Evaluation.

Qwen-Audio-3.0-Gen-Preview Technical Report The Song Describer Dataset: a Corpus of Audio Captions for Music-and-Language Evaluation

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:24.791254Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:24.791254Z digest=sha256:39132c49447eaee2e3551093a8f2fcee856e8d66d82b2f8846d7cf92563d7b77

Observation c8279863-c476-4a39-839c-9ca3c40aa482 · outbound

This paper cites Dasheng AudioGen: A Unified Model for Generating Coherent Audio Scenes from Text.

Qwen-Audio-3.0-Gen-Preview Technical Report Dasheng AudioGen: A Unified Model for Generating Coherent Audio Scenes from Text

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:24.849493Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:24.849493Z digest=sha256:70093b293d26722db8a92bcf86d44a8ad5041d009af2d68075f5815165cb18aa

Observation 24688499-59ac-41fc-a9b7-904c60937d8a · outbound

This paper cites Semantic-V AE: Semantic-alignment latent representation for better speech synthesis.arXiv preprint arXiv:2509.22167, 2025.

Qwen-Audio-3.0-Gen-Preview Technical Report Semantic-V AE: Semantic-alignment latent representation for better speech synthesis.arXiv preprint arXiv:2509.22167, 2025

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:24.931937Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:24.931937Z digest=sha256:e306c7f18ec18f85b435f048370675ebaf04adb2d809a7c03a610e533c36b820

Observation 4cc9cd39-4fcf-425f-97ed-979f9ad00833 · outbound

This paper cites LibriSpeech: An ASR corpus based on public domain audio books.

Qwen-Audio-3.0-Gen-Preview Technical Report LibriSpeech: An ASR corpus based on public domain audio books

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:24.998661Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:24.998661Z digest=sha256:83c6d546f4fb6cf866bace069d1ace568753b9265023a6bc31e6954958f6c8d6

Observation b4620f63-e242-4900-acfc-50dc690bca6b · outbound

This paper cites SAME: A Semantically-Aligned Music Autoencoder.

Qwen-Audio-3.0-Gen-Preview Technical Report SAME: A Semantically-Aligned Music Autoencoder

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:25.066467Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:25.066467Z digest=sha256:14dc50dccfdd621c2cab6950c2606572e76c79d3518267577bed0d3d0ad5ef91

Observation f5d43403-7e90-42b5-ab88-eab86becbd06 · outbound

This paper cites VibeV oice: Expressive podcast generation with next-token diffusion.

Qwen-Audio-3.0-Gen-Preview Technical Report VibeV oice: Expressive podcast generation with next-token diffusion

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:25.146653Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:25.146653Z digest=sha256:5d2c49a6e524bedded47af35b56d1681adcd8e3a6b1ce6f9d61c76e36f477452

Observation 57c13025-0f5b-4f24-83d3-2905c2adf977 · outbound

This paper cites UniSonate: A unified model for speech, music, and sound effect generation with text instructions.

Qwen-Audio-3.0-Gen-Preview Technical Report UniSonate: A unified model for speech, music, and sound effect generation with text instructions

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:25.298092Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:25.298092Z digest=sha256:5e7fcad75a30810a0531522d1869f6c02ef92db0c3451a685fad971f0e5c9385

Observation caca9060-b16f-4511-b0b1-699fe3144e56 · outbound

This paper cites Roman, Christopher Ick, Sivan Ding, Adrian S.

Qwen-Audio-3.0-Gen-Preview Technical Report Roman, Christopher Ick, Sivan Ding, Adrian S

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:25.386539Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:25.386539Z digest=sha256:987b99134dc971de06aa952004e81d6d1262cd2f4a9cf8a6f63ee7ab6581c213

Observation 90680f8f-0407-4dd7-864c-9e771caff121 · outbound

This paper cites Scaper: A library for soundscape synthesis and augmentation.

Qwen-Audio-3.0-Gen-Preview Technical Report Scaper: A library for soundscape synthesis and augmentation

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:25.484261Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:25.484261Z digest=sha256:8eeb9738c83abc6a6e248449e26ce2349fe94500b29104944fa71e851e17e2d7

Observation 7afcc044-010a-4536-965e-faab9a9064fa · outbound

This paper cites NaturalSpeech 2: Latent diffusion models are natural and zero-shot speech and singing synthesizers.

Qwen-Audio-3.0-Gen-Preview Technical Report NaturalSpeech 2: Latent diffusion models are natural and zero-shot speech and singing synthesizers

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:25.576399Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:25.576399Z digest=sha256:9e7d71a13f1a0875fd28a0c8a3c3f63f3dc398c6634a3a0ab21523594090eb5e

Observation 146f7151-ba20-49ed-beed-69abb25a8011 · outbound

This paper cites Borderless Long Speech Synthesis.

Qwen-Audio-3.0-Gen-Preview Technical Report Borderless Long Speech Synthesis

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:25.666173Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:25.666173Z digest=sha256:1f0ceae48366136678dafe75175fb6e86fe33150bfbd125cd19413ae41b554b0

Observation 9c1ffba2-04b1-453a-bea8-375646529e51 · outbound

This paper cites F5R-TTS: Improving flow-matching based text-to-speech with group relative policy optimization, 2025.

Qwen-Audio-3.0-Gen-Preview Technical Report F5R-TTS: Improving flow-matching based text-to-speech with group relative policy optimization, 2025

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:25.786509Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:25.786509Z digest=sha256:e58a1a07ca461006a7a6c7343ac15d6fbb4d41e7ff18ddc3c5619361fb5ade4e

Observation 00eae277-ad11-46e0-b217-7f0d97936aa7 · outbound

This paper cites Foley-Omni: A Unified Multimodal Generation Model from Task-Level Audio Synthesis to Complete Video Soundtrack Generation.

Qwen-Audio-3.0-Gen-Preview Technical Report Foley-Omni: A Unified Multimodal Generation Model from Task-Level Audio Synthesis to Complete Video Soundtrack Generation

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:25.957181Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:25.957181Z digest=sha256:0e48d321b6af22928aef25621da38835a8ee3967ffd3d93adcfe47433e05aca0

Observation 82b3aead-c6c7-4e08-a7f4-f8435bcd69bd · outbound

This paper cites MiMo-Audio: Audio language models are few-shot learners, 2025.

Qwen-Audio-3.0-Gen-Preview Technical Report MiMo-Audio: Audio language models are few-shot learners, 2025

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:26.065757Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:26.065757Z digest=sha256:374eba477d20a3325b34df1bd95491695ee2b9dc9fc8bbed3ba8008d1f76eb1f

Observation 14c4f44c-7394-4a0b-a5a2-08ea3b89ad89 · outbound

This paper cites Qwen3.5-Omni technical report, 2026.

Qwen-Audio-3.0-Gen-Preview Technical Report Qwen3.5-Omni technical report, 2026

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:26.153534Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:26.153534Z digest=sha256:360cf243bb5a66db2e8962039cd105b4a7684edfa2fe355145f5b80f40b7fbb8

Observation 3bb4c030-5a72-463c-9709-fd96937ecdca · outbound

This paper cites Bagpiper: Solving Open-Ended Audio Tasks via Rich Captions.

Qwen-Audio-3.0-Gen-Preview Technical Report Bagpiper: Solving Open-Ended Audio Tasks via Rich Captions

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:26.206244Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:26.206244Z digest=sha256:93edad79fc0d46a093df2383a0472fe82962845dbad2799cc38cdcb206343a8b

Observation db043c97-9178-46f6-a245-c9813ea56194 · outbound

This paper cites AudioX: A Unified Framework for Anything-to-Audio Generation.

Qwen-Audio-3.0-Gen-Preview Technical Report AudioX: A Unified Framework for Anything-to-Audio Generation

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:26.295186Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:26.295186Z digest=sha256:26bf29ae614be4a7d4ec12ebc3b5c71e81adb620aeda747f2010f2bf535e28bd

Observation dab84040-62d1-44e9-8333-e1d56672a6fc · outbound

This paper cites Audio-Omni: Extending multi-modal understanding to versatile audio generation and editing.

Qwen-Audio-3.0-Gen-Preview Technical Report Audio-Omni: Extending multi-modal understanding to versatile audio generation and editing

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:26.367282Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:26.367282Z digest=sha256:7b2bf7a470dc1ab4b95cf7c16726524a3b15b30985b6046fb7b1766a94d8ae06

Observation 83543aec-9eb5-4cb2-b2da-c1a0b0cffac5 · outbound

This paper cites Meta Audiobox Aesthetics: Unified Automatic Quality Assessment for Speech, Music, and Sound.

Qwen-Audio-3.0-Gen-Preview Technical Report Meta Audiobox Aesthetics: Unified Automatic Quality Assessment for Speech, Music, and Sound

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:26.447751Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:26.447751Z digest=sha256:699cbcb54ae129764fc92093c221bb5d728c9c0cd0dec5df8b0d073ceb032f56

Observation d9acd1e7-5f6d-46d4-8603-af9b1d27b2c7 · outbound

This paper cites Sound event detection in domestic environments with weakly labeled data and soundscape synthesis.

Qwen-Audio-3.0-Gen-Preview Technical Report Sound event detection in domestic environments with weakly labeled data and soundscape synthesis

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:26.508324Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:26.508324Z digest=sha256:498fc43c50b88e916304e38f7c0218099f2a9c745c9668ad8f44f1c0c714fd63

Observation e525aefd-e97b-4c32-93ce-dc1f3fa08ff8 · outbound

This paper cites Audiobox: Unified Audio Generation with Natural Language Prompts.

Qwen-Audio-3.0-Gen-Preview Technical Report Audiobox: Unified Audio Generation with Natural Language Prompts

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:26.573299Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:26.573299Z digest=sha256:1496f461a9679a92da26fc788b08a10b3ad5eeac9aa3852a5ce36f0a219441a3

Observation 57127be6-4a80-4ffd-ae61-3d18154f0bf6 · outbound

This paper cites Back to ear: Perceptually driven high fidelity music reconstruction.arXiv preprint arXiv:2509.14912, 2025.

Qwen-Audio-3.0-Gen-Preview Technical Report Back to ear: Perceptually driven high fidelity music reconstruction.arXiv preprint arXiv:2509.14912, 2025

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:26.635563Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:26.635563Z digest=sha256:2d71dc8841466236c6cbb86795cfcf843c4d040e83833e8dae469daf81016516

Observation b4aa9d1d-9861-4cef-8e4b-0548686ec53b · outbound

This paper cites MaskGCT: Zero-shot text-to-speech with masked generative codec transformer.

Qwen-Audio-3.0-Gen-Preview Technical Report MaskGCT: Zero-shot text-to-speech with masked generative codec transformer

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:26.689047Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:26.689047Z digest=sha256:6b2c47d87ec14a7644e825bb05f9fd783fd50c7826a813e14f6c097ff2924268

Observation 6d2d7cd0-36d1-444d-8359-b5c767d84b25 · outbound

This paper cites T2A-Feedback: Improving basic capabilities of text-to-audio generation via fine-grained AI feedback.

Qwen-Audio-3.0-Gen-Preview Technical Report T2A-Feedback: Improving basic capabilities of text-to-audio generation via fine-grained AI feedback

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:26.747262Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:26.747262Z digest=sha256:a990e3288150685c5cf6c83747caf77c34b6b18f8ab5abc4fd8fb551d94f7679

Observation 156f046e-0a83-4824-98dc-6cd6e8161118 · outbound

This paper cites MuChin: A Chinese Colloquial Description Benchmark for Evaluating Language Models in the Field of Music.

Qwen-Audio-3.0-Gen-Preview Technical Report MuChin: A Chinese Colloquial Description Benchmark for Evaluating Language Models in the Field of Music

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:26.795638Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:26.795638Z digest=sha256:de454317a516bad95d3fa08e3b17bd6e64314841edf14ea32119b387ee644659

Observation a88406e0-3ec9-4202-89df-41240fc1d1d4 · outbound

This paper cites an unresolved cited work.

Qwen-Audio-3.0-Gen-Preview Technical Report Unresolved cited work

Reference 50

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:26.850478Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:26.850478Z digest=sha256:4c4c6366e28183c665c8bf99b761e3a3fedba36a432555680b92dbb240912d67

Observation 81d56944-f84f-4556-9aa3-f5b66fb74e28 · outbound

This paper cites Step-Audio 2 technical report, 2025.

Qwen-Audio-3.0-Gen-Preview Technical Report Step-Audio 2 technical report, 2025

Reference 51

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:26.905195Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:26.905195Z digest=sha256:78ba1e5e7c8e3ac41b52d792728e4e517cf3bb7d15eb05efc2436c4517a976e1

Observation f557683b-bebe-4083-b6fb-c666f8b4ff7a · outbound

This paper cites SongBench: A Fine-Grained Multi-Aspect Benchmark for Song Quality Assessment.

Qwen-Audio-3.0-Gen-Preview Technical Report SongBench: A Fine-Grained Multi-Aspect Benchmark for Song Quality Assessment

Reference 52

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:27.033181Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:27.033181Z digest=sha256:cd9abedd1a30a059b8c6cc58f45c12795697587bba7a02a5188bd8216393ddfd

Observation 19dcdb3e-a643-47f2-8b55-8b436ea9c748 · outbound

This paper cites Qwen-Audio-3.0-TTS: Freely controllable and highly robust speech synthesis with multi-stage training paradigm, 2026.

Qwen-Audio-3.0-Gen-Preview Technical Report Qwen-Audio-3.0-TTS: Freely controllable and highly robust speech synthesis with multi-stage training paradigm, 2026

Reference 53

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:27.092382Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:27.092382Z digest=sha256:fea441eeae8c27b6403b4c0638eca020bae94fcf4959e2791d60dc6a4f818552

Observation d40af82c-65ae-410f-98f7-8c43a16c6f99 · outbound

This paper cites FireRedTTS-2: Towards long conversational speech generation for podcast and chatbot, 2025.

Qwen-Audio-3.0-Gen-Preview Technical Report FireRedTTS-2: Towards long conversational speech generation for podcast and chatbot, 2025

Reference 54

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:27.150116Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:27.150116Z digest=sha256:4939e723c580d5cfe84fbe03ef847960be9de1f7c8be5a7a410afa721a976b07

Observation 91888c30-2bf3-4f61-a36e-f577327a5173 · outbound

This paper cites AudioTime: A temporally-aligned audio-text benchmark dataset.

Qwen-Audio-3.0-Gen-Preview Technical Report AudioTime: A temporally-aligned audio-text benchmark dataset

Reference 55

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:27.211924Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:27.211924Z digest=sha256:48a4379793bca616ea30ff896dc52d29271c6abc14c5ea8112ab6be01f2e0bc5

Observation 90be1984-ca7f-4df1-b88e-721d526812dd · outbound

This paper cites PicoAudio: Enabling precise temporal control- lability in text-to-audio generation.

Qwen-Audio-3.0-Gen-Preview Technical Report PicoAudio: Enabling precise temporal control- lability in text-to-audio generation

Reference 56

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:27.263551Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:27.263551Z digest=sha256:9cb78a0a95a5cef6f5b6d4dbb52a7e1fa0522d7b09f9a42d1b98f8428cc472c7

Observation cfb54e2d-7cf5-499e-80e2-7baa3ac3bbaf · outbound

This paper cites LongCat-AudioDiT: High-fidelity diffusion text-to-speech in the waveform latent space, 2026.

Qwen-Audio-3.0-Gen-Preview Technical Report LongCat-AudioDiT: High-fidelity diffusion text-to-speech in the waveform latent space, 2026

Reference 57

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:27.339629Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:27.339629Z digest=sha256:bc33282a0a384b201aaaf0320c2e1eb59aeb7c18906e27c1eb21c9bf5cc14c5e

Observation eeaf2ec1-ef1f-4ba1-acc8-c26b5e89467c · outbound

This paper cites Qwen3-Omni technical report, 2025.

Qwen-Audio-3.0-Gen-Preview Technical Report Qwen3-Omni technical report, 2025

Reference 58

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:27.419812Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:27.419812Z digest=sha256:71be10d2652046def4355d703aa774f10ad9826ec074fd9839f9cfc22e4e3e67

Observation 63553ad5-8f05-41ed-8c4a-1a99eb56d355 · outbound

This paper cites UniFlow-Audio: Unified flow matching for audio generation from omni-modalities.

Qwen-Audio-3.0-Gen-Preview Technical Report UniFlow-Audio: Unified flow matching for audio generation from omni-modalities

Reference 59

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:27.473442Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:27.473442Z digest=sha256:3bcc43c5c263c04ed69117af6363e4fbede485086f266149083661ec7e5979bc

Observation 4808a534-3806-41fc-9a0f-1c071d4f21f2 · outbound

This paper cites Ming-UniAudio: Speech LLM for joint understanding, generation and editing with unified representation, 2025.

Qwen-Audio-3.0-Gen-Preview Technical Report Ming-UniAudio: Speech LLM for joint understanding, generation and editing with unified representation, 2025

Reference 60

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:27.562348Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:27.562348Z digest=sha256:b60f69efd5e5d8a07d34eeca40264f1fe20be95292b77eec38f8166672b745e9

Observation e8563ad7-2fc0-47f6-abc6-efa67a33c4ee · outbound

This paper cites UniAudio: An Audio Foundation Model Toward Universal Audio Generation.

Qwen-Audio-3.0-Gen-Preview Technical Report UniAudio: An Audio Foundation Model Toward Universal Audio Generation

Reference 61

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:27.671246Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:27.671246Z digest=sha256:f32be0ca8f1316b029c162004751ca9c9b67430efca654478b8d5809e04207ff

Observation f655ec0b-3cab-4f0b-bab2-4d273d4b5237 · outbound

This paper cites MiniMax-Speech: Intrinsic zero-shot text-to-speech with a learnable speaker encoder, 2025.

Qwen-Audio-3.0-Gen-Preview Technical Report MiniMax-Speech: Intrinsic zero-shot text-to-speech with a learnable speaker encoder, 2025

Reference 62

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:27.833311Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:27.833311Z digest=sha256:de3dc8f3a9343ec194ad6851c22607e49970b64d0303ec0b6e5c6c8508cf5825

Observation 15f6d30a-dbdd-4e62-a223-a7b9b07521af · outbound

This paper cites LoSATok: Low-dimensional Semantic-Acoustic Tokenizer for Cross-Domain Audio Understanding and Generation.

Qwen-Audio-3.0-Gen-Preview Technical Report LoSATok: Low-dimensional Semantic-Acoustic Tokenizer for Cross-Domain Audio Understanding and Generation

Reference 63

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:27.945454Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:27.945454Z digest=sha256:f37c5d2f59ad9f529eb728967877fbffad04379e422c0f6dc45acd652f3206d7

Observation 456441f0-d541-4f23-9631-989e123b8ba4 · outbound

This paper cites PicoAudio2: Temporal controllable text-to-audio generation with natural language description.

Qwen-Audio-3.0-Gen-Preview Technical Report PicoAudio2: Temporal controllable text-to-audio generation with natural language description

Reference 64

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:28.105753Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:28.105753Z digest=sha256:f3fe2dc39ea8130e2a2d654f3a47c55a2024b9bcdf103596b8c80e477ae9fe80

Observation ffaa0108-ed1c-425b-b5f6-2c178d8c08d4 · outbound

This paper cites V oxCPM2 technical report, 2026.

Qwen-Audio-3.0-Gen-Preview Technical Report V oxCPM2 technical report, 2026

Reference 65

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:28.260156Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:28.260156Z digest=sha256:cb22ae124f7bd89b9ad4fcc5e51534b8db20c9d3c7a0c2d3e3d2a64fa9385143

Observation 4b4c814f-5bfb-4d8d-85b7-90e2353d9b59 · outbound

This paper cites an unresolved cited work.

Qwen-Audio-3.0-Gen-Preview Technical Report Unresolved cited work

Reference 2019

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:24.203243Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:24.203243Z digest=sha256:db8356484a3f73fea49843f4cd46b827e49011c5b58355aa4e870b4bd457d4cc

Pith citing papers

No inbound Pith citation observations are available.