Pith. sign in

Paper Citation Record · LEDGER

Qwen-Audio-3.0-Gen-Preview Technical Report

As of 23 August 2026, this Paper Citation Record lists 66 of 66 outbound references and 0 inbound Pith citation observations for arXiv:2607.27011.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2607.27011 v2

Coverage vector

measured 66 of 66 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-01T10:17:28.260156Z

measured 66 of 66 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-23T06:30:58.430688+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

66 of 66 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved66
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 506e5225-c9d6-4243-81cc-8c15eefdde8f · outbound

This paper cites MusicLM: Generating Music From Text.

Qwen-Audio-3.0-Gen-Preview Technical Report MusicLM: Generating Music From Text

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:22.487525Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:22.487525Z digest=sha256:2253a7b469bf4647dbebf9c470e1216e48f2dc887c0df85fca377575962e7d2b

Observation a46f2807-32b6-422f-900d-14e96376af32 · outbound

This paper cites Seed-TTS: A family of high-quality versatile speech generation models, 2024.

Qwen-Audio-3.0-Gen-Preview Technical Report Seed-TTS: A family of high-quality versatile speech generation models, 2024

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:22.529628Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:22.529628Z digest=sha256:eb388ff861dc4b91bb70548e8db594860fb9587a3e8d8e6c2dcda2b747c233f0

Observation 571238a2-8fe4-426c-a2e6-561df36dc1c1 · outbound

This paper cites Neural codec language models are zero-shot text to speech synthesizers.

Qwen-Audio-3.0-Gen-Preview Technical Report Neural codec language models are zero-shot text to speech synthesizers

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:22.616114Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:22.616114Z digest=sha256:232d0a82f57243eac5799cc06c06a5d5c46fbfe13782ec4a7032619100f492b2

Observation 399657bb-fc47-4d67-b213-0facfc60978c · outbound

This paper cites F5-TTS: A fairytaler that fakes fluent and faithful speech with flow matching.

Qwen-Audio-3.0-Gen-Preview Technical Report F5-TTS: A fairytaler that fakes fluent and faithful speech with flow matching

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:22.707593Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:22.707593Z digest=sha256:9ae56412b32b0892089c7e27b20db5f0461ad4596ba1bb3b43de08d1108ad0e9

Observation 6aa75e47-0324-4170-ad01-cf3379c6abf8 · outbound

This paper cites MMAudio: Taming multimodal joint training for high-quality video-to-audio synthesis, 2025.

Qwen-Audio-3.0-Gen-Preview Technical Report MMAudio: Taming multimodal joint training for high-quality video-to-audio synthesis, 2025

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:22.772056Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:22.772056Z digest=sha256:f9daf81f6fedeced323a4a30a23b097404f6c04ef47ad5620690f33231329081

Observation 6f789e2c-bf5c-48c4-927e-fdd2b64b9cad · outbound

This paper cites Simple and controllable music generation.

Qwen-Audio-3.0-Gen-Preview Technical Report Simple and controllable music generation

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:22.861724Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:22.861724Z digest=sha256:fcc4c70d711984561900b7da9bc991a22b3a2e4a7f26454cdad3707381967aab

Observation 9124b13d-8210-4db4-90f6-5dcd7675ff24 · outbound

This paper cites Pushing the frontier of full-song generation: Hierarchical autoregressive planning meets flow-matching rendering, 2026.

Qwen-Audio-3.0-Gen-Preview Technical Report Pushing the frontier of full-song generation: Hierarchical autoregressive planning meets flow-matching rendering, 2026

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:22.950470Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:22.950470Z digest=sha256:d5d9198598f993965dd89068101826f9e26584170e8eee9ad7b797d8e8c5b692

Observation 559b2844-9070-4cf3-82fe-d2fb17e524fa · outbound

This paper cites CosyV oice 3: Towards in-the-wild speech generation via scaling-up and post-training, 2025.

Qwen-Audio-3.0-Gen-Preview Technical Report CosyV oice 3: Towards in-the-wild speech generation via scaling-up and post-training, 2025

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:23.098536Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:23.098536Z digest=sha256:b650ea8aa4a1f8d2dad5230d6ccd694a49f2e00cb53a53838a261bd2b7d11ca1

Observation 50fc7bfc-07bd-404b-898d-d6bcd9e6194d · outbound

This paper cites Audio-Oscar: A Multi-Agent System for Complex Audio Scene Generation, Orchestration, and Refinement.

Qwen-Audio-3.0-Gen-Preview Technical Report Audio-Oscar: A Multi-Agent System for Complex Audio Scene Generation, Orchestration, and Refinement

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:23.216775Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:23.216775Z digest=sha256:ed9090118d5b51cd6433ce87a04ac39088fb201ed7eeecc3860b3f67cef0926e

Observation 1c1ea40e-2747-4209-8c63-a91e2855608e · outbound

This paper cites Stable Audio Open.

Qwen-Audio-3.0-Gen-Preview Technical Report Stable Audio Open

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:23.360198Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:23.360198Z digest=sha256:06f822b73185a36c65cadcf8ec497fb493ef5e0f817a6994bf3e06b1ab1438d8

Observation 908822d6-a2d9-471f-a6be-2704ccb034da · outbound

This paper cites Text-to-audio generation using instruction guided latent diffusion model.

Qwen-Audio-3.0-Gen-Preview Technical Report Text-to-audio generation using instruction guided latent diffusion model

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:23.511168Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:23.511168Z digest=sha256:de5ae1fc45e7611362780212b04becc130b5d5f099b6b7fc5da393b746e52372

Observation 649f3337-45fc-4fbd-ab70-b4c5d393151a · outbound

This paper cites Qwen3-TTS technical report, 2026.

Qwen-Audio-3.0-Gen-Preview Technical Report Qwen3-TTS technical report, 2026

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:23.634596Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:23.634596Z digest=sha256:988350248ec4b980700b2b0cd62d94f79051e64bb0fb99b5a6b129943794984a

Observation 1a877c28-b456-4422-b7ef-20c3774796b9 · outbound

This paper cites Make-An-Audio 2: Temporal-Enhanced Text-to-Audio Generation.

Qwen-Audio-3.0-Gen-Preview Technical Report Make-An-Audio 2: Temporal-Enhanced Text-to-Audio Generation

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:23.739972Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:23.739972Z digest=sha256:4ac1304b3d78b4812b275103e53de4ec249ec77c55106a97a5b3ca703cd58578

Observation 918f5643-c159-4f51-b0f6-a4920efb92eb · outbound

This paper cites Algorithms to measure audio programme loudness and true-peak audio level.

Qwen-Audio-3.0-Gen-Preview Technical Report Algorithms to measure audio programme loudness and true-peak audio level

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:23.861861Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:23.861861Z digest=sha256:664df9eb1b6da1ee95a8159f3ec1e88e469bf6f2726a54affd5b27c058793833

Observation bdb5a1c3-91e5-40f3-8571-8b9c2973ab33 · outbound

This paper cites ControlAudio: Tackling text-guided, timing-indicated and intelligible audio generation via progressive diffusion modeling.

Qwen-Audio-3.0-Gen-Preview Technical Report ControlAudio: Tackling text-guided, timing-indicated and intelligible audio generation via progressive diffusion modeling

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:23.997580Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:23.997580Z digest=sha256:72e3b791beabe78be867b996132a09c14c868f1ed9e3618f317da2242691f617

Observation 34b7adc2-dbc5-4ef7-a62a-0117b0267918 · outbound

This paper cites AudioCaps: Generating captions for audios in the wild.

Qwen-Audio-3.0-Gen-Preview Technical Report AudioCaps: Generating captions for audios in the wild

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:24.117926Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:24.117926Z digest=sha256:921be3d11f942e8189a497d2ed2076613c23e9095e6ef62e56f1c052410c6781

Observation a98c2186-ab36-4733-9c07-05177109401a · outbound

This paper cites High-fidelity audio compression with improved RVQGAN.Advances in Neural Information Processing Systems, 36:27980–27993, 2023.

Qwen-Audio-3.0-Gen-Preview Technical Report High-fidelity audio compression with improved RVQGAN.Advances in Neural Information Processing Systems, 36:27980–27993, 2023

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:24.267366Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:24.267366Z digest=sha256:16f1dd65c862eff39842f783d298d1d25f7b997da3e4319346159466e7717039

Observation 3f8d524d-a15b-4cfa-91e0-554c26c1d62f · outbound

This paper cites V oicebox: Text-guided multilingual universal speech generation at scale.Advances in Neural Information Processing Systems, 36:14005–14034, 2023.

Qwen-Audio-3.0-Gen-Preview Technical Report V oicebox: Text-guided multilingual universal speech generation at scale.Advances in Neural Information Processing Systems, 36:14005–14034, 2023

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:24.385005Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:24.385005Z digest=sha256:77e7e0487f596482b4b22b294c32bd2699ea5d9884008bdfdf1a3059e3e3df42

Observation a4772290-af44-48b9-9494-a3e1ee86784b · outbound

This paper cites HoliTok:A Coutinuous Holistic Tokenization with Robust Dual Capabilities of Speech Generation and Understanding.

Qwen-Audio-3.0-Gen-Preview Technical Report HoliTok:A Coutinuous Holistic Tokenization with Robust Dual Capabilities of Speech Generation and Understanding

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:24.439149Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:24.439149Z digest=sha256:b133fe481a2d620406543ac79c9dcd04ef5ba1b493f747b3d24171f8c7028594

Observation 32c33759-9f18-43eb-a923-fa8c07c07fac · outbound

This paper cites UNISON: A Unified Sound Generation and Editing Framework via Deep LLM Fusion.

Qwen-Audio-3.0-Gen-Preview Technical Report UNISON: A Unified Sound Generation and Editing Framework via Deep LLM Fusion

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:24.502786Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:24.502786Z digest=sha256:7ac5b2ce42e25e6f337d65dbcd99b53cb0e27e6c0cd271913c6c2bb9ec02e7a3

Observation 488ddc19-8962-4c2c-b4a3-f2cd8294aef1 · outbound

This paper cites AudioLDM: text-to-audio generation with latent diffusion models.

Qwen-Audio-3.0-Gen-Preview Technical Report AudioLDM: text-to-audio generation with latent diffusion models

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:24.551894Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:24.551894Z digest=sha256:419cef4530dcfc8c6eec15668a67324184882f8f501aa8272611a4bffe37d59f

Observation a1ea7b7a-1e63-4a91-98e6-913236c357c4 · outbound

This paper cites AudioLDM 2: Learning holistic audio generation with self- supervised pretraining.IEEE/ACM Transactions on Audio, Speech, and Language Processing, 32:2871– 2883, 2024.

Qwen-Audio-3.0-Gen-Preview Technical Report AudioLDM 2: Learning holistic audio generation with self- supervised pretraining.IEEE/ACM Transactions on Audio, Speech, and Language Processing, 32:2871– 2883, 2024

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:24.609517Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:24.609517Z digest=sha256:8210ea92b77bab87457352232348625b80265623de2ca18eac61e6e81cae6df8

Observation 6b0f1623-307a-4354-aa3f-18bfb283f993 · outbound

This paper cites WavJourney: Compositional audio creation with large language models.

Qwen-Audio-3.0-Gen-Preview Technical Report WavJourney: Compositional audio creation with large language models

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:24.675398Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:24.675398Z digest=sha256:e44488c20ec74f882da3618935f389327f109bfdacab3008ea62c6c941458bf7

Observation 3f108f7c-28a8-4cab-90af-39bd440f6e69 · outbound

This paper cites UniMoE-Audio: Unified speech and music generation with dynamic-capacity MoE, 2025.

Qwen-Audio-3.0-Gen-Preview Technical Report UniMoE-Audio: Unified speech and music generation with dynamic-capacity MoE, 2025

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:24.734732Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:24.734732Z digest=sha256:697ec5542fecb02c8623ede3500a17600f40fe127a86d10b277f44efbc31455b

Observation 6a7be74d-50e3-4437-a25c-bb32e0a5353e · outbound

This paper cites The Song Describer Dataset: a Corpus of Audio Captions for Music-and-Language Evaluation.

Qwen-Audio-3.0-Gen-Preview Technical Report The Song Describer Dataset: a Corpus of Audio Captions for Music-and-Language Evaluation

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:24.791254Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:24.791254Z digest=sha256:be9d4d7dcba76d1429ac603bed464ca6ef4ea6e923b78b80affef3f49fc51de3

Observation c8279863-c476-4a39-839c-9ca3c40aa482 · outbound

This paper cites Dasheng AudioGen: A Unified Model for Generating Coherent Audio Scenes from Text.

Qwen-Audio-3.0-Gen-Preview Technical Report Dasheng AudioGen: A Unified Model for Generating Coherent Audio Scenes from Text

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:24.849493Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:24.849493Z digest=sha256:9cf37db966b0feb653a9906236eb79f0d245a80151aaa33fe248d36939ceaa46

Observation 24688499-59ac-41fc-a9b7-904c60937d8a · outbound

This paper cites Semantic-V AE: Semantic-alignment latent representation for better speech synthesis.arXiv preprint arXiv:2509.22167, 2025.

Qwen-Audio-3.0-Gen-Preview Technical Report Semantic-V AE: Semantic-alignment latent representation for better speech synthesis.arXiv preprint arXiv:2509.22167, 2025

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:24.931937Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:24.931937Z digest=sha256:ec142b6000d7666181639c43a8321d73be8595d370376ccaf70d6cae46129939

Observation 4cc9cd39-4fcf-425f-97ed-979f9ad00833 · outbound

This paper cites LibriSpeech: An ASR corpus based on public domain audio books.

Qwen-Audio-3.0-Gen-Preview Technical Report LibriSpeech: An ASR corpus based on public domain audio books

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:24.998661Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:24.998661Z digest=sha256:45d0f5f21850e9e592cb46a2bba4e80b1309aef9d1a7ef97ba44c0f772f5a9e5

Observation b4620f63-e242-4900-acfc-50dc690bca6b · outbound

This paper cites SAME: A Semantically-Aligned Music Autoencoder.

Qwen-Audio-3.0-Gen-Preview Technical Report SAME: A Semantically-Aligned Music Autoencoder

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:25.066467Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:25.066467Z digest=sha256:29c3f1c2bfd926290e6ba3447eba0f8eff8fcca245688eb7c7b8c9854279eab7

Observation f5d43403-7e90-42b5-ab88-eab86becbd06 · outbound

This paper cites VibeV oice: Expressive podcast generation with next-token diffusion.

Qwen-Audio-3.0-Gen-Preview Technical Report VibeV oice: Expressive podcast generation with next-token diffusion

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:25.146653Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:25.146653Z digest=sha256:0bfe6f1b131679ddcc2167a4bbea916a4e335a95af26baf9cb0fb09417a29cec

Observation 57c13025-0f5b-4f24-83d3-2905c2adf977 · outbound

This paper cites UniSonate: A unified model for speech, music, and sound effect generation with text instructions.

Qwen-Audio-3.0-Gen-Preview Technical Report UniSonate: A unified model for speech, music, and sound effect generation with text instructions

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:25.298092Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:25.298092Z digest=sha256:9d576f8de57539ea7597442833f706717e5a0aae635f78063d55545b4cfe1253

Observation caca9060-b16f-4511-b0b1-699fe3144e56 · outbound

This paper cites Roman, Christopher Ick, Sivan Ding, Adrian S.

Qwen-Audio-3.0-Gen-Preview Technical Report Roman, Christopher Ick, Sivan Ding, Adrian S

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:25.386539Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:25.386539Z digest=sha256:eaa6559ea50575a1c4d098dc5bf0c4aa34b84d095a0d8318990fdb55c161a4be

Observation 90680f8f-0407-4dd7-864c-9e771caff121 · outbound

This paper cites Scaper: A library for soundscape synthesis and augmentation.

Qwen-Audio-3.0-Gen-Preview Technical Report Scaper: A library for soundscape synthesis and augmentation

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:25.484261Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:25.484261Z digest=sha256:87d142a0aaa38294dee632182c08e2c201aab12a6c3d15de78a95759def60435

Observation 7afcc044-010a-4536-965e-faab9a9064fa · outbound

This paper cites NaturalSpeech 2: Latent diffusion models are natural and zero-shot speech and singing synthesizers.

Qwen-Audio-3.0-Gen-Preview Technical Report NaturalSpeech 2: Latent diffusion models are natural and zero-shot speech and singing synthesizers

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:25.576399Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:25.576399Z digest=sha256:9645d63da3e1177314014ea3d23aeb43c7df1a47f058e8d3df5505c9d4e12646

Observation 146f7151-ba20-49ed-beed-69abb25a8011 · outbound

This paper cites Borderless Long Speech Synthesis.

Qwen-Audio-3.0-Gen-Preview Technical Report Borderless Long Speech Synthesis

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:25.666173Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:25.666173Z digest=sha256:dba0e8852cc61bcbf7a714fb38de25a66bab5f3bb634248c1c5c456cb5320e72

Observation 9c1ffba2-04b1-453a-bea8-375646529e51 · outbound

This paper cites F5R-TTS: Improving flow-matching based text-to-speech with group relative policy optimization, 2025.

Qwen-Audio-3.0-Gen-Preview Technical Report F5R-TTS: Improving flow-matching based text-to-speech with group relative policy optimization, 2025

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:25.786509Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:25.786509Z digest=sha256:91505f22afeb26bbfb02fa9c8e71b4cffc982c214ecd77301fc3f96499caff61

Observation 00eae277-ad11-46e0-b217-7f0d97936aa7 · outbound

This paper cites Foley-Omni: A Unified Multimodal Generation Model from Task-Level Audio Synthesis to Complete Video Soundtrack Generation.

Qwen-Audio-3.0-Gen-Preview Technical Report Foley-Omni: A Unified Multimodal Generation Model from Task-Level Audio Synthesis to Complete Video Soundtrack Generation

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:25.957181Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:25.957181Z digest=sha256:0844f1a8fdd3bd50be8a64bf4364b1aa1b92b4e425ec7b26fb20fd64cbf4a120

Observation 82b3aead-c6c7-4e08-a7f4-f8435bcd69bd · outbound

This paper cites MiMo-Audio: Audio language models are few-shot learners, 2025.

Qwen-Audio-3.0-Gen-Preview Technical Report MiMo-Audio: Audio language models are few-shot learners, 2025

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:26.065757Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:26.065757Z digest=sha256:94515320858031225475482bea05d9ceaa4ef8619eded848cff91dded4d56d9b

Observation 14c4f44c-7394-4a0b-a5a2-08ea3b89ad89 · outbound

This paper cites Qwen3.5-Omni technical report, 2026.

Qwen-Audio-3.0-Gen-Preview Technical Report Qwen3.5-Omni technical report, 2026

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:26.153534Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:26.153534Z digest=sha256:00397e536753bedde2c83b2618950314330d62f9e44dce140ca9baa8e510c08e

Observation 3bb4c030-5a72-463c-9709-fd96937ecdca · outbound

This paper cites Bagpiper: Solving Open-Ended Audio Tasks via Rich Captions.

Qwen-Audio-3.0-Gen-Preview Technical Report Bagpiper: Solving Open-Ended Audio Tasks via Rich Captions

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:26.206244Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:26.206244Z digest=sha256:21a1195114899f8aec0c5a9decf9a193e68d11dc9b01dbd8b7c9b337601853dc

Observation db043c97-9178-46f6-a245-c9813ea56194 · outbound

This paper cites AudioX: A Unified Framework for Anything-to-Audio Generation.

Qwen-Audio-3.0-Gen-Preview Technical Report AudioX: A Unified Framework for Anything-to-Audio Generation

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:26.295186Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:26.295186Z digest=sha256:93de57d2d414efdf61837b0b16fdc9c01e9af70622fab93ab3e1e010d02512eb

Observation dab84040-62d1-44e9-8333-e1d56672a6fc · outbound

This paper cites Audio-Omni: Extending multi-modal understanding to versatile audio generation and editing.

Qwen-Audio-3.0-Gen-Preview Technical Report Audio-Omni: Extending multi-modal understanding to versatile audio generation and editing

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:26.367282Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:26.367282Z digest=sha256:27eba6ce112f7850eb5921d688073e9d0893e050741ef55d290f5802d6814237

Observation 83543aec-9eb5-4cb2-b2da-c1a0b0cffac5 · outbound

This paper cites Meta Audiobox Aesthetics: Unified Automatic Quality Assessment for Speech, Music, and Sound.

Qwen-Audio-3.0-Gen-Preview Technical Report Meta Audiobox Aesthetics: Unified Automatic Quality Assessment for Speech, Music, and Sound

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:26.447751Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:26.447751Z digest=sha256:0e1ad14fa1a39985f1c3ec97dc3f601be67f1b28db43f444cdb0b9218f4da3ae

Observation d9acd1e7-5f6d-46d4-8603-af9b1d27b2c7 · outbound

This paper cites Sound event detection in domestic environments with weakly labeled data and soundscape synthesis.

Qwen-Audio-3.0-Gen-Preview Technical Report Sound event detection in domestic environments with weakly labeled data and soundscape synthesis

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:26.508324Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:26.508324Z digest=sha256:c79c35893bf2bdb64cad863ef9952d321469c51560da015fcbc4a28637a9dd13

Observation e525aefd-e97b-4c32-93ce-dc1f3fa08ff8 · outbound

This paper cites Audiobox: Unified Audio Generation with Natural Language Prompts.

Qwen-Audio-3.0-Gen-Preview Technical Report Audiobox: Unified Audio Generation with Natural Language Prompts

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:26.573299Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:26.573299Z digest=sha256:2ab45bdf1aeae40f9aae935f31326934b1048ee2ec48650d6d51e54cffcd471a

Observation 57127be6-4a80-4ffd-ae61-3d18154f0bf6 · outbound

This paper cites Back to ear: Perceptually driven high fidelity music reconstruction.arXiv preprint arXiv:2509.14912, 2025.

Qwen-Audio-3.0-Gen-Preview Technical Report Back to ear: Perceptually driven high fidelity music reconstruction.arXiv preprint arXiv:2509.14912, 2025

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:26.635563Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:26.635563Z digest=sha256:43073587bb09bfd123b820d3305394b031c60f0d261816534f6a17f5ad87acb5

Observation b4aa9d1d-9861-4cef-8e4b-0548686ec53b · outbound

This paper cites MaskGCT: Zero-shot text-to-speech with masked generative codec transformer.

Qwen-Audio-3.0-Gen-Preview Technical Report MaskGCT: Zero-shot text-to-speech with masked generative codec transformer

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:26.689047Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:26.689047Z digest=sha256:47b20b2705d310df9295eaf1a1075b6f243a4b2f80451d499ce14a518ad6b1c1

Observation 6d2d7cd0-36d1-444d-8359-b5c767d84b25 · outbound

This paper cites T2A-Feedback: Improving basic capabilities of text-to-audio generation via fine-grained AI feedback.

Qwen-Audio-3.0-Gen-Preview Technical Report T2A-Feedback: Improving basic capabilities of text-to-audio generation via fine-grained AI feedback

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:26.747262Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:26.747262Z digest=sha256:844b067d7cbadcdd13499b317c1b8e715b5ae23e9f1f9a351c42abc0995172a2

Observation 156f046e-0a83-4824-98dc-6cd6e8161118 · outbound

This paper cites MuChin: A Chinese Colloquial Description Benchmark for Evaluating Language Models in the Field of Music.

Qwen-Audio-3.0-Gen-Preview Technical Report MuChin: A Chinese Colloquial Description Benchmark for Evaluating Language Models in the Field of Music

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:26.795638Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:26.795638Z digest=sha256:810bb889c2705a12a1a3ac9062489197de9945ccaeeb5079e98c62da2dfbd043

Observation a88406e0-3ec9-4202-89df-41240fc1d1d4 · outbound

This paper cites an unresolved cited work.

Qwen-Audio-3.0-Gen-Preview Technical Report Unresolved cited work

Reference 50

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:26.850478Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:26.850478Z digest=sha256:aa6e54d0b08f404b1593e57ca807756c4491874b2b49fedaf500576442a5a277

Observation 81d56944-f84f-4556-9aa3-f5b66fb74e28 · outbound

This paper cites Step-Audio 2 technical report, 2025.

Qwen-Audio-3.0-Gen-Preview Technical Report Step-Audio 2 technical report, 2025

Reference 51

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:26.905195Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:26.905195Z digest=sha256:178a9cc9fcbb9c0c52ae1abecddf79b4676c6b56fe80d25d6e0340e77519b6f8

Observation f557683b-bebe-4083-b6fb-c666f8b4ff7a · outbound

This paper cites SongBench: A Fine-Grained Multi-Aspect Benchmark for Song Quality Assessment.

Qwen-Audio-3.0-Gen-Preview Technical Report SongBench: A Fine-Grained Multi-Aspect Benchmark for Song Quality Assessment

Reference 52

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:27.033181Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:27.033181Z digest=sha256:29cff2d5b2b4110fb9378fed10efae0701143aeaea4d8c113ee7988c29aafe9f

Observation 19dcdb3e-a643-47f2-8b55-8b436ea9c748 · outbound

This paper cites Qwen-Audio-3.0-TTS: Freely controllable and highly robust speech synthesis with multi-stage training paradigm, 2026.

Qwen-Audio-3.0-Gen-Preview Technical Report Qwen-Audio-3.0-TTS: Freely controllable and highly robust speech synthesis with multi-stage training paradigm, 2026

Reference 53

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:27.092382Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:27.092382Z digest=sha256:3717f441bbd5055abf3df9e9dcab17504935e76df855d3c7d7e7f803a9c073ed

Observation d40af82c-65ae-410f-98f7-8c43a16c6f99 · outbound

This paper cites FireRedTTS-2: Towards long conversational speech generation for podcast and chatbot, 2025.

Qwen-Audio-3.0-Gen-Preview Technical Report FireRedTTS-2: Towards long conversational speech generation for podcast and chatbot, 2025

Reference 54

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:27.150116Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:27.150116Z digest=sha256:b5bae88edc1cd3024206d4cee24cbb1f6bc7a9976e52df45d2f8ddba2b614b15

Observation 91888c30-2bf3-4f61-a36e-f577327a5173 · outbound

This paper cites AudioTime: A temporally-aligned audio-text benchmark dataset.

Qwen-Audio-3.0-Gen-Preview Technical Report AudioTime: A temporally-aligned audio-text benchmark dataset

Reference 55

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:27.211924Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:27.211924Z digest=sha256:4c2feff85694833b21d8ce084615b35559c7b2c71c9ac698ebae95cd2f9d0339

Observation 90be1984-ca7f-4df1-b88e-721d526812dd · outbound

This paper cites PicoAudio: Enabling precise temporal control- lability in text-to-audio generation.

Qwen-Audio-3.0-Gen-Preview Technical Report PicoAudio: Enabling precise temporal control- lability in text-to-audio generation

Reference 56

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:27.263551Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:27.263551Z digest=sha256:7fb15a31a8d86f121c237fc788b0f9b279a1f4b52066c88fa73ddae9c37cd784

Observation cfb54e2d-7cf5-499e-80e2-7baa3ac3bbaf · outbound

This paper cites LongCat-AudioDiT: High-fidelity diffusion text-to-speech in the waveform latent space, 2026.

Qwen-Audio-3.0-Gen-Preview Technical Report LongCat-AudioDiT: High-fidelity diffusion text-to-speech in the waveform latent space, 2026

Reference 57

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:27.339629Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:27.339629Z digest=sha256:c6d0f481475939c8a1ed40fe516d4c86d3120d38d2879f7e79b5ae1059bc85e6

Observation eeaf2ec1-ef1f-4ba1-acc8-c26b5e89467c · outbound

This paper cites Qwen3-Omni technical report, 2025.

Qwen-Audio-3.0-Gen-Preview Technical Report Qwen3-Omni technical report, 2025

Reference 58

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:27.419812Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:27.419812Z digest=sha256:2a96541a5592957e702a0eec480fda4804032d74927511a6ea91563b8f09e7d4

Observation 63553ad5-8f05-41ed-8c4a-1a99eb56d355 · outbound

This paper cites UniFlow-Audio: Unified flow matching for audio generation from omni-modalities.

Qwen-Audio-3.0-Gen-Preview Technical Report UniFlow-Audio: Unified flow matching for audio generation from omni-modalities

Reference 59

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:27.473442Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:27.473442Z digest=sha256:ab9d167056fcef2282d8a317b40507ce8a85f0c9c60f7e1cba365c516c83c1fe

Observation 4808a534-3806-41fc-9a0f-1c071d4f21f2 · outbound

This paper cites Ming-UniAudio: Speech LLM for joint understanding, generation and editing with unified representation, 2025.

Qwen-Audio-3.0-Gen-Preview Technical Report Ming-UniAudio: Speech LLM for joint understanding, generation and editing with unified representation, 2025

Reference 60

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:27.562348Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:27.562348Z digest=sha256:b97c892d992daf09846a82a3be0c7cedbf8b72b92219bfcb81dd8ad370018ae2

Observation e8563ad7-2fc0-47f6-abc6-efa67a33c4ee · outbound

This paper cites UniAudio: An Audio Foundation Model Toward Universal Audio Generation.

Qwen-Audio-3.0-Gen-Preview Technical Report UniAudio: An Audio Foundation Model Toward Universal Audio Generation

Reference 61

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:27.671246Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:27.671246Z digest=sha256:d2576b954ba6b84c67bbc858b12c9c8bcefb9a40aa4aea11ce5e6df648cc89ea

Observation f655ec0b-3cab-4f0b-bab2-4d273d4b5237 · outbound

This paper cites MiniMax-Speech: Intrinsic zero-shot text-to-speech with a learnable speaker encoder, 2025.

Qwen-Audio-3.0-Gen-Preview Technical Report MiniMax-Speech: Intrinsic zero-shot text-to-speech with a learnable speaker encoder, 2025

Reference 62

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:27.833311Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:27.833311Z digest=sha256:696c8ea6e1a7b68c925d37e6de13287cdf68c8cde4b2f9db67740f6474d1325f

Observation 15f6d30a-dbdd-4e62-a223-a7b9b07521af · outbound

This paper cites LoSATok: Low-dimensional Semantic-Acoustic Tokenizer for Cross-Domain Audio Understanding and Generation.

Qwen-Audio-3.0-Gen-Preview Technical Report LoSATok: Low-dimensional Semantic-Acoustic Tokenizer for Cross-Domain Audio Understanding and Generation

Reference 63

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:27.945454Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:27.945454Z digest=sha256:cff2753c07af7e891c1aaecabe4c2c5f9dcaa6a002d0a76e4501cca0855177ef

Observation 456441f0-d541-4f23-9631-989e123b8ba4 · outbound

This paper cites PicoAudio2: Temporal controllable text-to-audio generation with natural language description.

Qwen-Audio-3.0-Gen-Preview Technical Report PicoAudio2: Temporal controllable text-to-audio generation with natural language description

Reference 64

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:28.105753Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:28.105753Z digest=sha256:a9b2944a117aeadd2053faf779053c73d3399b09e7aac600cd3e87448e26cbd5

Observation ffaa0108-ed1c-425b-b5f6-2c178d8c08d4 · outbound

This paper cites V oxCPM2 technical report, 2026.

Qwen-Audio-3.0-Gen-Preview Technical Report V oxCPM2 technical report, 2026

Reference 65

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:28.260156Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:28.260156Z digest=sha256:f40cde2ec8e78047c7fe6c212f91271e14e4f5d137adda64e63c6e25efb55b2f

Observation 4b4c814f-5bfb-4d8d-85b7-90e2353d9b59 · outbound

This paper cites an unresolved cited work.

Qwen-Audio-3.0-Gen-Preview Technical Report Unresolved cited work

Reference 2019

Resolution
unresolved
no resolver link, observed 2026-08-01T10:17:24.203243Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:17:24.203243Z digest=sha256:9dccae6fb308458644413afcd4a3edcce6a62e7d40d18099e61da53cf40ec69d

Pith citing papers

No inbound Pith citation observations are available.