Pith. sign in

Paper Citation Record · LEDGER

MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching

As of 22 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 0 inbound Pith citation observations for arXiv:2608.11804.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2608.11804 v1

Coverage vector

measured 44 of 44 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-16T00:30:28.634356Z

measured 44 of 44 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-22T06:32:14.747728+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

44 of 44 outbound references displayed

  • verified exact0
  • verified fuzzy25
  • unresolved19
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 49513efb-d097-47fb-b871-d9a39cea64a6 · outbound

This paper cites Qwen3-TTS Technical Report.

MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching Qwen3-TTS Technical Report

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-16T00:30:28.169548Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T00:30:28.169548Z digest=sha256:3983105002dbfdf510484740b2a5db843d0c682730113f1e89a4a2da49f488b7

Observation e7f71a3a-1b2a-483b-a1d8-229a4b02c2ab · outbound

This paper cites Seed-TTS: A Family of High-Quality Versatile Speech Generation Models.

MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching Seed-TTS: A Family of High-Quality Versatile Speech Generation Models

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-16T00:30:28.176713Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T00:30:28.176713Z digest=sha256:bec60f9d0a7e8091192b5a2d7074e9f3ec9b06bb2c9bad7ce7bfcdf69565a93b

Observation dd007df7-276f-474c-83e2-e61e28ac6a4c · outbound

This paper cites Simple and controllable music generation.

MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching Simple and controllable music generation

Reference 3

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T00:30:30.597343Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-16T00:30:28.186096Z digest=sha256:896bb95c946aa2f9034b2759ec1621e1dc11346ebe4cb01e48fe95702e14b202

Observation a10e29e7-2f4c-46bf-95c2-09b9deee3180 · outbound

This paper cites Denk, Zalán Borsos, Jesse Engel, Mauro Verzetti, Antoine Caillon, Qingqing Huang, Aren Jansen, Adam Roberts, Marco Tagliasacchi, Matt Sharifi, Neil Zeghidour, and Christian Frank.

MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching Denk, Zalán Borsos, Jesse Engel, Mauro Verzetti, Antoine Caillon, Qingqing Huang, Aren Jansen, Adam Roberts, Marco Tagliasacchi, Matt Sharifi, Neil Zeghidour, and Christian Frank

Reference 4

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T00:30:30.563940Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-16T00:30:28.194909Z digest=sha256:f4fb68d25e515da6ca0132d92319852c262fcd1d78957e3f91e206d01a4a7ab7

Observation ebcbf914-76d8-4740-8bf8-243e6e424550 · outbound

This paper cites Plumbley.

MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching Plumbley

Reference 5

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T00:30:30.529806Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-16T00:30:28.215321Z digest=sha256:209beb357f76add7b26eb7b09eaefbfd0175a66bc2ade22443ccee1ab20ee051

Observation 57b22c66-ff37-4d62-80bf-81d474c6a82c · outbound

This paper cites TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization.

MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-16T00:30:28.222670Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T00:30:28.222670Z digest=sha256:f8bb9dbb6336614480e0c4ce906057fa04300eadf7ce475566741edda14a9bc5

Observation 60677b62-7417-4406-aba3-835b57ab905a · outbound

This paper cites Uniaudio: An audio foundation model toward universal audio generation.

MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching Uniaudio: An audio foundation model toward universal audio generation

Reference 7

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T00:30:30.494811Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-16T00:30:28.235963Z digest=sha256:2c5ba61c5af763ecb98ff493d4bee713f0c7051e8017a3c832fe91f052d9c7b2

Observation 77868152-0428-4b36-afb3-d429fd9569fa · outbound

This paper cites Uniflow-audio: Unified flow matching for audio generation from omni-modalities.

MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching Uniflow-audio: Unified flow matching for audio generation from omni-modalities

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-16T00:30:28.244051Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T00:30:28.244051Z digest=sha256:e9da9713e2d922e8d50258844b86c03159dce6f9f811c5e56471c1212298c16e

Observation cae037ee-52d5-4000-84d6-e6b0176c55a7 · outbound

This paper cites Dasheng AudioGen: A Unified Model for Generating Coherent Audio Scenes from Text.

MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching Dasheng AudioGen: A Unified Model for Generating Coherent Audio Scenes from Text

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-16T00:30:28.252205Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T00:30:28.252205Z digest=sha256:010470780875e901e4ae2cae4cc5e9217c828758cd39d969762568d07c97c381

Observation 796550f7-6ab1-49e1-928b-9aa1b2377ad4 · outbound

This paper cites Denoising diffusion probabilistic models.

MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching Denoising diffusion probabilistic models

Reference 10

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T00:30:30.446348Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-16T00:30:28.260201Z digest=sha256:d7196b16100ee033559313142898efaf92aff0b2047d6aba1ea616495d4fefa6

Observation d7d8ba55-c3b2-46a0-8519-4afd5d5ea09d · outbound

This paper cites Flow Matching for Generative Modeling.

MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching Flow Matching for Generative Modeling

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-16T00:30:28.265065Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T00:30:28.265065Z digest=sha256:b7350284dc9d981c5003b265853c4843173c4f34a65f5d237920fc73f99d7442

Observation 36ef1c8c-d0e2-4081-bc38-5d86f77e6cbe · outbound

This paper cites Make-an-audio: Text-to-audio generation with prompt- enhanced diffusion models.

MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching Make-an-audio: Text-to-audio generation with prompt- enhanced diffusion models

Reference 12

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T00:30:30.416583Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-16T00:30:28.280692Z digest=sha256:f2ff1c63b18e5f0d84e37f37ff0043acb357ceb4dfa5b27b3e5090a79547fc63

Observation 1bad4996-86e6-441c-92aa-77005dadf0e2 · outbound

This paper cites Plumbley.

MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching Plumbley

Reference 13

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T00:30:30.376413Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-16T00:30:28.288603Z digest=sha256:3541cbf70abf8a104b85258da2fe3af9795212a4c963671621065a62a0049e68

Observation 631d52ea-1269-42cb-9413-5192c6206da9 · outbound

This paper cites JEN-1: Text-Guided Universal Music Generation with Omnidirectional Diffusion Models.

MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching JEN-1: Text-Guided Universal Music Generation with Omnidirectional Diffusion Models

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-16T00:30:28.299836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T00:30:28.299836Z digest=sha256:37415b0b87079e5afab0dbaa59cad9e4f428075a0243515be75af412962ac9c9

Observation aaecdde2-311a-49e3-8d02-fc7b577efd91 · outbound

This paper cites Weiss, Mike Schuster, Navdeep Jaitly, Zongheng Yang, Zhifeng Chen, Yu Zhang, Yuxuan Wang, Rj Skerrv-Ryan, Rif A.

MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching Weiss, Mike Schuster, Navdeep Jaitly, Zongheng Yang, Zhifeng Chen, Yu Zhang, Yuxuan Wang, Rj Skerrv-Ryan, Rif A

Reference 15

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T00:30:30.345742Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-16T00:30:28.320721Z digest=sha256:9fae385c9c2330446bf67b1b15887e9e0035987ae987c50ea0b2839b0a81396a

Observation d73faa25-f3c3-4d75-bc6d-3707a6aa2f05 · outbound

This paper cites Fastspeech: Fast, robust and controllable text to speech.

MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching Fastspeech: Fast, robust and controllable text to speech

Reference 16

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T00:30:30.315999Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-16T00:30:28.326595Z digest=sha256:ac318af20d1a0ddfb5efd0f7443bd2733fe0777d4057a145469c3de7ddccf5a4

Observation 4b019842-1e32-4dfa-9ee5-318bd915d314 · outbound

This paper cites Conditional variational autoencoder with adversarial learning for end-to-end text-to-speech.

MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching Conditional variational autoencoder with adversarial learning for end-to-end text-to-speech

Reference 17

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T00:30:30.291282Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-16T00:30:28.334219Z digest=sha256:697f38984c4143e1af30ace88328d9a8f0d8eb1991983802650b7bc990c27923

Observation b0c8f966-b356-460a-a49a-5603eb964d90 · outbound

This paper cites Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers.

MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-16T00:30:28.342866Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T00:30:28.342866Z digest=sha256:1bc2362df0293f403256f8b4b7764b9d0cf831c1028365913af37f74f346e06e

Observation 8321aa47-6ff7-445e-8ea1-1c43ba56aee3 · outbound

This paper cites Soundstorm: Efficient parallel audio generation.

MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching Soundstorm: Efficient parallel audio generation

Reference 19

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T00:30:30.257562Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-16T00:30:28.349501Z digest=sha256:d69ac7a7ba9dcc103666923497559390e508ce80110b0fecf80a202ccb1d8a9a

Observation 4b8ed3be-f1d0-4fc9-9555-fdace64326e2 · outbound

This paper cites MiniMax-Speech: Intrinsic Zero-Shot Text-to-Speech with a Learnable Speaker Encoder.

MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching MiniMax-Speech: Intrinsic Zero-Shot Text-to-Speech with a Learnable Speaker Encoder

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-16T00:30:28.369540Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T00:30:28.369540Z digest=sha256:5bce89c6e6e83b079ab6b3872a9ee1a47d8ee6eac1eb8dc8a349d3af9cb05575

Observation 1e123b37-f8cc-4fa7-836b-5a7229c2ad20 · outbound

This paper cites F5-TTS: A Fairytaler that Fakes Fluent and Faithful Speech with Flow Matching.

MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching F5-TTS: A Fairytaler that Fakes Fluent and Faithful Speech with Flow Matching

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-16T00:30:28.379942Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T00:30:28.379942Z digest=sha256:cbd42a844e1acf36e7e1fe1f371c0a0bf684b4b0adaeaa30ea83b79a4cfcb071

Observation a4ec0dec-25ef-4c2b-b013-10c15af19ffc · outbound

This paper cites CosyVoice 3: Towards In-the-wild Speech Generation via Scaling-up and Post-training.

MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching CosyVoice 3: Towards In-the-wild Speech Generation via Scaling-up and Post-training

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-16T00:30:28.389087Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T00:30:28.389087Z digest=sha256:d3243e9ef156e975db9e01fd19e3c2919180c059d8e9f126de9ff2131722a88a

Observation f7c0e266-9abb-4532-b032-9591ba55ea7b · outbound

This paper cites AudioX: A Unified Framework for Anything-to-Audio Generation.

MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching AudioX: A Unified Framework for Anything-to-Audio Generation

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-16T00:30:28.394868Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T00:30:28.394868Z digest=sha256:b67d3eec463990812eeeee494d1392f06385a3d481652f8ebb8df7548275d5d5

Observation b29ad2ff-f47b-42ed-b075-6cf5e0977a17 · outbound

This paper cites Bagpiper: Solving Open-Ended Audio Tasks via Rich Captions.

MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching Bagpiper: Solving Open-Ended Audio Tasks via Rich Captions

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-16T00:30:28.402056Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T00:30:28.402056Z digest=sha256:5628091bcb43940602dda6bc686a0a430a5c8c0b3361988a8ee0bf1001788ef6

Observation 48aa3da9-8602-4426-b95d-9ed4dd885a1e · outbound

This paper cites Dashengtokenizer: One layer is enough for unified audio understanding and generation.

MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching Dashengtokenizer: One layer is enough for unified audio understanding and generation

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-16T00:30:28.414269Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T00:30:28.414269Z digest=sha256:213f78f662c0b40a73cfd9da347604d0eb9aef7e2850a29d47d2e8c45fffac93

Observation 5a2f8247-8e77-4c18-abd8-2d0c12de5c9a · outbound

This paper cites Qwen3 Technical Report.

MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching Qwen3 Technical Report

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-16T00:30:28.426800Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T00:30:28.426800Z digest=sha256:716869b01ab27e0966ac0a3fb55154eacb4058ae016db4e5251aad64c096c560

Observation 37be04c0-5fb6-46e9-ae4a-785c43c5bdcc · outbound

This paper cites Midashenglm: Efficient audio understanding with general audio captions.

MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching Midashenglm: Efficient audio understanding with general audio captions

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-16T00:30:28.438428Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T00:30:28.438428Z digest=sha256:1a4428bab315de836a60b114dfdc42c16437ae7cde51310530a0539721a7ba6c

Observation 469c3f21-0d6c-4c8f-87ba-d32002ac8415 · outbound

This paper cites Vocos: Closing the gap between time-domain and fourier-based neural vocoders for high-quality audio synthesis.

MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching Vocos: Closing the gap between time-domain and fourier-based neural vocoders for high-quality audio synthesis

Reference 28

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T00:30:30.207138Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-16T00:30:28.448106Z digest=sha256:0636554b04b11937cc19b563dd55a6e3dd6e74e645d804b1764f095a734e3a19

Observation c811b625-a07e-4eba-a17f-496f7967e13f · outbound

This paper cites Llm.int8(): 8-bit matrix multiplication for transformers at scale.

MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching Llm.int8(): 8-bit matrix multiplication for transformers at scale

Reference 29

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T00:30:30.179318Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-16T00:30:28.459569Z digest=sha256:3e87a0996a578c2364fbf7a082d44e7dc93be8fd744f5b77e0f5433ebb23c587

Observation 61d182ff-7b49-421d-a8f7-f79e7b32f9e0 · outbound

This paper cites Acavcaps: Enabling large-scale training for fine-grained and diverse audio understanding.

MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching Acavcaps: Enabling large-scale training for fine-grained and diverse audio understanding

Reference 30

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T00:30:30.131992Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-16T00:30:28.465592Z digest=sha256:dfe9abe1bc9e7e9761ccab1530a6f4483de9cf62db91f6a02a176123b736998b

Observation fe1dbb88-ccba-4ffc-9a7b-b43e914c5418 · outbound

This paper cites Acav100m: Automatic curation of large-scale datasets for audio-visual video represen- tation learning.

MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching Acav100m: Automatic curation of large-scale datasets for audio-visual video represen- tation learning

Reference 31

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T00:30:30.096173Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-16T00:30:28.473822Z digest=sha256:b60775bfb4ab6eb571022431321c103854ff7f93065b908145361ea78d19a3f9

Observation 4c113222-091f-4011-b810-1a24b3d474cd · outbound

This paper cites Emilia: An extensive, multilingual, and diverse speech dataset for large-scale speech generation.

MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching Emilia: An extensive, multilingual, and diverse speech dataset for large-scale speech generation

Reference 32

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T00:30:30.070374Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-16T00:30:28.484544Z digest=sha256:cb8b1bbea02d45cc48a97eff2ee553310ad68ef6a0bd9fa76a9964f982cc136c

Observation 17f418fc-35eb-4d64-bd47-9bbe2cb43f24 · outbound

This paper cites Weiss, Viet Dang, Ye Jia, Yonghui Wu, Yu Zhang, and Zhifeng Chen.

MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching Weiss, Viet Dang, Ye Jia, Yonghui Wu, Yu Zhang, and Zhifeng Chen

Reference 33

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T00:30:30.029878Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-16T00:30:28.497954Z digest=sha256:446b6f0a2b5dadc050924cc794cd51976aa9fb8fb3ce8278352c4a8190aed72c

Observation bffdba0b-d3e2-4685-960e-41d456e1b5a4 · outbound

This paper cites The LJ speech dataset.

MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching The LJ speech dataset

Reference 34

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T00:30:29.993793Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-16T00:30:28.507120Z digest=sha256:e72abfcbf62b7f65ddfa0392ee7f0b1fece1de02fa3691ffe339edf070b798f9

Observation 47a7f023-72fc-43ca-a8b0-275e440e8d0d · outbound

This paper cites AISHELL-3: A multi-speaker mandarin TTS corpus and the baselines.

MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching AISHELL-3: A multi-speaker mandarin TTS corpus and the baselines

Reference 35

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T00:30:29.949709Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-16T00:30:28.526935Z digest=sha256:12a3f065e4912f31f784e81a56b41dffc14112c97af60d1b9555ba687a246738

Observation 1b034a7c-808d-4d31-9264-1b997031e92e · outbound

This paper cites WenetSpeech4TTS: A 12,800-hour mandarin TTS corpus for large-scale speech generation.

MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching WenetSpeech4TTS: A 12,800-hour mandarin TTS corpus for large-scale speech generation

Reference 36

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T00:30:29.912337Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-16T00:30:28.540193Z digest=sha256:dc6360dcc2a2af04356a69e976ea2e269ccccd550647e3b9e87ce747d607fc9f

Observation 61559e0b-027d-483f-b059-51f8342b1cf2 · outbound

This paper cites Audiocaps: Gener- ating captions for audios in the wild.

MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching Audiocaps: Gener- ating captions for audios in the wild

Reference 37

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T00:30:29.878407Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-16T00:30:28.553870Z digest=sha256:979378135886a201ac98430ef93b54381090b90621e0d7aaabc47db32ee25f5d

Observation ecd7bb0f-f42f-4a99-880a-25ba3510719f · outbound

This paper cites Funasr: A fundamental end-to-end speech recognition toolkit.

MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching Funasr: A fundamental end-to-end speech recognition toolkit

Reference 38

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T00:30:29.843453Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-16T00:30:28.573890Z digest=sha256:b58b3cdecce8b8d16a64902de28e9b9f343d1103d1d2525177bcd6d7a00cd7bc

Observation 66393fa3-c722-4d97-8490-3fe132374c71 · outbound

This paper cites Robust speech recognition via large-scale weak supervision.

MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching Robust speech recognition via large-scale weak supervision

Reference 39

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T00:30:29.796329Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-16T00:30:28.588194Z digest=sha256:3350687e044815279fd0cb5a55c81bf4a383448f187e4454ebf27ce99c3b5055

Observation 73cdd2f1-b259-455a-af2d-98b2b7c70361 · outbound

This paper cites emotion2vec: Self-Supervised Pre-Training for Speech Emotion Representation.

MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching emotion2vec: Self-Supervised Pre-Training for Speech Emotion Representation

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-16T00:30:28.595710Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T00:30:28.595710Z digest=sha256:e2800aebfaabb6701670c9730ae6da2dcf3cab1b7005381aa8ebae0a4a653e50

Observation 5052416e-0a7f-4ad4-9d34-374d2109c4d6 · outbound

This paper cites MECAT: A Multi-Experts Constructed Benchmark for Fine-Grained Audio Understanding Tasks.

MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching MECAT: A Multi-Experts Constructed Benchmark for Fine-Grained Audio Understanding Tasks

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-16T00:30:28.603866Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T00:30:28.603866Z digest=sha256:9dc44386838d921033d9b19f9c01243745da58f9290cd8a79ed0df70ef0024fa

Observation ed95e110-236d-41b6-8119-0b99312a354c · outbound

This paper cites Fréchet audio distance: A reference-free metric for evaluating music enhancement algorithms.

MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching Fréchet audio distance: A reference-free metric for evaluating music enhancement algorithms

Reference 42

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T00:30:29.754138Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-16T00:30:28.611712Z digest=sha256:bbb613d6cc2b26a6b31f4e946c38ab954c9c31fff3619a4e8fff6c7d88021ae2

Observation be771b3b-814f-45dd-bc59-50befd136b65 · outbound

This paper cites CLAP: Learn- ing audio concepts from natural language supervision.

MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching CLAP: Learn- ing audio concepts from natural language supervision

Reference 43

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T00:30:29.720290Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-16T00:30:28.622612Z digest=sha256:6c6b48715059e65943c8c69e9a98182fb73da2885e61bb652c8f0d242312942b

Observation ec1babc5-bebc-41e9-b24d-f2cce33d0a61 · outbound

This paper cites Diffusion Transformers with Representation Autoencoders.

MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching Diffusion Transformers with Representation Autoencoders

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-16T00:30:28.634356Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T00:30:28.634356Z digest=sha256:9018ac9a330dddca57f2212caca1253cd2abc5db0817e4b4b6324ba9aa5f403b

Pith citing papers

No inbound Pith citation observations are available.