Pith. sign in

Paper Citation Record · LEDGER

MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching

As of 18 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 0 inbound Pith citation observations for arXiv:2608.11804.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2608.11804 v1

Coverage vector

measured 44 of 44 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-16T00:30:28.634356Z

measured 44 of 44 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-18T06:34:40.430872+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

44 of 44 outbound references displayed

  • verified exact0
  • verified fuzzy25
  • unresolved19
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 49513efb-d097-47fb-b871-d9a39cea64a6 · outbound

This paper cites Qwen3-TTS Technical Report.

MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching Qwen3-TTS Technical Report

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-16T00:30:28.169548Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T00:30:28.169548Z digest=sha256:6eaad3607178cfa523f77c7b8b44999cb0678d6043308df59e617d7d0a392cd6

Observation e7f71a3a-1b2a-483b-a1d8-229a4b02c2ab · outbound

This paper cites Seed-TTS: A Family of High-Quality Versatile Speech Generation Models.

MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching Seed-TTS: A Family of High-Quality Versatile Speech Generation Models

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-16T00:30:28.176713Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T00:30:28.176713Z digest=sha256:d03bd057a09a30e284762c4ac3a2c3b759a47f73cefbb7a90dd4cf3526c30896

Observation dd007df7-276f-474c-83e2-e61e28ac6a4c · outbound

This paper cites Simple and controllable music generation.

MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching Simple and controllable music generation

Reference 3

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T00:30:30.597343Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-16T00:30:28.186096Z digest=sha256:c1a127391bb7379b3464e155462060693bac833a7c4d68d89d36b0aac64fa780

Observation a10e29e7-2f4c-46bf-95c2-09b9deee3180 · outbound

This paper cites Denk, Zalán Borsos, Jesse Engel, Mauro Verzetti, Antoine Caillon, Qingqing Huang, Aren Jansen, Adam Roberts, Marco Tagliasacchi, Matt Sharifi, Neil Zeghidour, and Christian Frank.

MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching Denk, Zalán Borsos, Jesse Engel, Mauro Verzetti, Antoine Caillon, Qingqing Huang, Aren Jansen, Adam Roberts, Marco Tagliasacchi, Matt Sharifi, Neil Zeghidour, and Christian Frank

Reference 4

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T00:30:30.563940Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-16T00:30:28.194909Z digest=sha256:d7c8ba3c103a55be8427ae5021209932ddd822558d1f8218125dadba4a3ffbf4

Observation ebcbf914-76d8-4740-8bf8-243e6e424550 · outbound

This paper cites Plumbley.

MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching Plumbley

Reference 5

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T00:30:30.529806Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-16T00:30:28.215321Z digest=sha256:72c520bc3a194196a8f4f86874aaca33afbb33aa87a8281a5d40d0761d9272b8

Observation 57b22c66-ff37-4d62-80bf-81d474c6a82c · outbound

This paper cites TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization.

MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-16T00:30:28.222670Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T00:30:28.222670Z digest=sha256:ffbf4127bb4ee1aaeedd6bee0bc3d9b2d5b14797a690a2e3f1ee8bd34c2166e8

Observation 60677b62-7417-4406-aba3-835b57ab905a · outbound

This paper cites Uniaudio: An audio foundation model toward universal audio generation.

MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching Uniaudio: An audio foundation model toward universal audio generation

Reference 7

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T00:30:30.494811Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-16T00:30:28.235963Z digest=sha256:d1dab58140cb02c303d6fe150cd34549519b267fd07e01ff925cabd05ae8bd43

Observation 77868152-0428-4b36-afb3-d429fd9569fa · outbound

This paper cites Uniflow-audio: Unified flow matching for audio generation from omni-modalities.

MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching Uniflow-audio: Unified flow matching for audio generation from omni-modalities

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-16T00:30:28.244051Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T00:30:28.244051Z digest=sha256:a93643787460a3a3acd7778c93190d65ec60c2385be032dfd06d7569a0e43e10

Observation cae037ee-52d5-4000-84d6-e6b0176c55a7 · outbound

This paper cites Dasheng AudioGen: A Unified Model for Generating Coherent Audio Scenes from Text.

MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching Dasheng AudioGen: A Unified Model for Generating Coherent Audio Scenes from Text

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-16T00:30:28.252205Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T00:30:28.252205Z digest=sha256:8086054eefd92c7af791f4c3b18fbe2a68600a98d0bed4f5bd5e9efc463ce6c8

Observation 796550f7-6ab1-49e1-928b-9aa1b2377ad4 · outbound

This paper cites Denoising diffusion probabilistic models.

MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching Denoising diffusion probabilistic models

Reference 10

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T00:30:30.446348Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-16T00:30:28.260201Z digest=sha256:425b0ed4f94db181818306d3af9d5d0ab3d7e6dcd1153aa01a07cbc3c1e099de

Observation d7d8ba55-c3b2-46a0-8519-4afd5d5ea09d · outbound

This paper cites Flow Matching for Generative Modeling.

MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching Flow Matching for Generative Modeling

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-16T00:30:28.265065Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T00:30:28.265065Z digest=sha256:ff1a621b54e1579b2829f203c488f105d59c69ce031d058226da80152ade191b

Observation 36ef1c8c-d0e2-4081-bc38-5d86f77e6cbe · outbound

This paper cites Make-an-audio: Text-to-audio generation with prompt- enhanced diffusion models.

MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching Make-an-audio: Text-to-audio generation with prompt- enhanced diffusion models

Reference 12

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T00:30:30.416583Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-16T00:30:28.280692Z digest=sha256:9d747b1544284883d45dcb6e2f4267d2b6bf9fbac012b164d5c1551addce9797

Observation 1bad4996-86e6-441c-92aa-77005dadf0e2 · outbound

This paper cites Plumbley.

MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching Plumbley

Reference 13

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T00:30:30.376413Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-16T00:30:28.288603Z digest=sha256:32048508ed52b1658fa851dea7445c77b83ecdd0187347383240cdcfe7112ac6

Observation 631d52ea-1269-42cb-9413-5192c6206da9 · outbound

This paper cites JEN-1: Text-Guided Universal Music Generation with Omnidirectional Diffusion Models.

MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching JEN-1: Text-Guided Universal Music Generation with Omnidirectional Diffusion Models

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-16T00:30:28.299836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T00:30:28.299836Z digest=sha256:3abb4b8150e159adfd402ecedbc49281cbed7b6e46a86f2a95a23bf039f66fd8

Observation aaecdde2-311a-49e3-8d02-fc7b577efd91 · outbound

This paper cites Weiss, Mike Schuster, Navdeep Jaitly, Zongheng Yang, Zhifeng Chen, Yu Zhang, Yuxuan Wang, Rj Skerrv-Ryan, Rif A.

MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching Weiss, Mike Schuster, Navdeep Jaitly, Zongheng Yang, Zhifeng Chen, Yu Zhang, Yuxuan Wang, Rj Skerrv-Ryan, Rif A

Reference 15

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T00:30:30.345742Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-16T00:30:28.320721Z digest=sha256:ee726ddb8105d14fdbe862193486145a6ccdb13d8e5bbbb7b7d245aebe521f19

Observation d73faa25-f3c3-4d75-bc6d-3707a6aa2f05 · outbound

This paper cites Fastspeech: Fast, robust and controllable text to speech.

MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching Fastspeech: Fast, robust and controllable text to speech

Reference 16

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T00:30:30.315999Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-16T00:30:28.326595Z digest=sha256:3ec6b0a9b52fd5fb9093cb7d44eaa02ffc7bde848b8fea043e95997188b1d789

Observation 4b019842-1e32-4dfa-9ee5-318bd915d314 · outbound

This paper cites Conditional variational autoencoder with adversarial learning for end-to-end text-to-speech.

MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching Conditional variational autoencoder with adversarial learning for end-to-end text-to-speech

Reference 17

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T00:30:30.291282Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-16T00:30:28.334219Z digest=sha256:66fc0848b20491ec4098a8b563d2e0be29c0022fed6426026e954c0a19eacdcc

Observation b0c8f966-b356-460a-a49a-5603eb964d90 · outbound

This paper cites Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers.

MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-16T00:30:28.342866Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T00:30:28.342866Z digest=sha256:00f150f39775971ee4982019c860ff2ebdb2d4f5657f5b077eaff4ec794a6dbb

Observation 8321aa47-6ff7-445e-8ea1-1c43ba56aee3 · outbound

This paper cites Soundstorm: Efficient parallel audio generation.

MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching Soundstorm: Efficient parallel audio generation

Reference 19

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T00:30:30.257562Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-16T00:30:28.349501Z digest=sha256:f3ebab83f5ca0e2261f3dc410632a267ecb699a12a1da2b69742814a4ba4c1d9

Observation 4b8ed3be-f1d0-4fc9-9555-fdace64326e2 · outbound

This paper cites MiniMax-Speech: Intrinsic Zero-Shot Text-to-Speech with a Learnable Speaker Encoder.

MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching MiniMax-Speech: Intrinsic Zero-Shot Text-to-Speech with a Learnable Speaker Encoder

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-16T00:30:28.369540Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T00:30:28.369540Z digest=sha256:ec91dc338bcfe9c13828a4125efa472f6515d0aef037201e92674f89527e4cdc

Observation 1e123b37-f8cc-4fa7-836b-5a7229c2ad20 · outbound

This paper cites F5-TTS: A Fairytaler that Fakes Fluent and Faithful Speech with Flow Matching.

MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching F5-TTS: A Fairytaler that Fakes Fluent and Faithful Speech with Flow Matching

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-16T00:30:28.379942Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T00:30:28.379942Z digest=sha256:e2170814eed0df70f2bafacc9cc1f3a37202768f4f2bf43cc8fddf872df1beb8

Observation a4ec0dec-25ef-4c2b-b013-10c15af19ffc · outbound

This paper cites CosyVoice 3: Towards In-the-wild Speech Generation via Scaling-up and Post-training.

MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching CosyVoice 3: Towards In-the-wild Speech Generation via Scaling-up and Post-training

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-16T00:30:28.389087Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T00:30:28.389087Z digest=sha256:2ffa1d86fbcb0485833259f58237de2dab55d94ae1238bc3a072b81fc858e00d

Observation f7c0e266-9abb-4532-b032-9591ba55ea7b · outbound

This paper cites AudioX: A Unified Framework for Anything-to-Audio Generation.

MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching AudioX: A Unified Framework for Anything-to-Audio Generation

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-16T00:30:28.394868Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T00:30:28.394868Z digest=sha256:f5abfaed56139f464c09e7a10fb83f5020514711f665002f2539fd918bf50c7c

Observation b29ad2ff-f47b-42ed-b075-6cf5e0977a17 · outbound

This paper cites Bagpiper: Solving Open-Ended Audio Tasks via Rich Captions.

MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching Bagpiper: Solving Open-Ended Audio Tasks via Rich Captions

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-16T00:30:28.402056Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T00:30:28.402056Z digest=sha256:0913461d054e81a48cb1b7d875024024855068f9c52f7f54920d3f036cb34b31

Observation 48aa3da9-8602-4426-b95d-9ed4dd885a1e · outbound

This paper cites Dashengtokenizer: One layer is enough for unified audio understanding and generation.

MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching Dashengtokenizer: One layer is enough for unified audio understanding and generation

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-16T00:30:28.414269Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T00:30:28.414269Z digest=sha256:783651f8d68937ef773a31eb7933cfbaeea544dac6e52bb9da0180ed3b5b271d

Observation 5a2f8247-8e77-4c18-abd8-2d0c12de5c9a · outbound

This paper cites Qwen3 Technical Report.

MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching Qwen3 Technical Report

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-16T00:30:28.426800Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T00:30:28.426800Z digest=sha256:c4ca469f1c3ef9b3e3bf8bcfd4dcb121eecdb113a53efa0ce26d45bc0f07d26d

Observation 37be04c0-5fb6-46e9-ae4a-785c43c5bdcc · outbound

This paper cites Midashenglm: Efficient audio understanding with general audio captions.

MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching Midashenglm: Efficient audio understanding with general audio captions

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-16T00:30:28.438428Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T00:30:28.438428Z digest=sha256:c4bfd10c1c8e1f51578b743c315300b386676611e1e56c1ee960bdeec79a0a0d

Observation 469c3f21-0d6c-4c8f-87ba-d32002ac8415 · outbound

This paper cites Vocos: Closing the gap between time-domain and fourier-based neural vocoders for high-quality audio synthesis.

MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching Vocos: Closing the gap between time-domain and fourier-based neural vocoders for high-quality audio synthesis

Reference 28

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T00:30:30.207138Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-16T00:30:28.448106Z digest=sha256:ce8e3a420cc41fa1795b642be88db1f6991c90a8fbb959079c6b75b66f8c3ecd

Observation c811b625-a07e-4eba-a17f-496f7967e13f · outbound

This paper cites Llm.int8(): 8-bit matrix multiplication for transformers at scale.

MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching Llm.int8(): 8-bit matrix multiplication for transformers at scale

Reference 29

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T00:30:30.179318Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-16T00:30:28.459569Z digest=sha256:16df0b88f3781bdbc85a60fb9ce9e3c08b0ae8b83e3d022f2acd97c49d4b6b99

Observation 61d182ff-7b49-421d-a8f7-f79e7b32f9e0 · outbound

This paper cites Acavcaps: Enabling large-scale training for fine-grained and diverse audio understanding.

MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching Acavcaps: Enabling large-scale training for fine-grained and diverse audio understanding

Reference 30

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T00:30:30.131992Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-16T00:30:28.465592Z digest=sha256:7a62a8227b71adaf598c1eb524c264124bafe03ca6003cd0bd4282c353cd0e4e

Observation fe1dbb88-ccba-4ffc-9a7b-b43e914c5418 · outbound

This paper cites Acav100m: Automatic curation of large-scale datasets for audio-visual video represen- tation learning.

MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching Acav100m: Automatic curation of large-scale datasets for audio-visual video represen- tation learning

Reference 31

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T00:30:30.096173Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-16T00:30:28.473822Z digest=sha256:29d8833daab14bf90c3873ca803b93297e33de1596685e872ff3064fdae2fb56

Observation 4c113222-091f-4011-b810-1a24b3d474cd · outbound

This paper cites Emilia: An extensive, multilingual, and diverse speech dataset for large-scale speech generation.

MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching Emilia: An extensive, multilingual, and diverse speech dataset for large-scale speech generation

Reference 32

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T00:30:30.070374Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-16T00:30:28.484544Z digest=sha256:92c06f614cefae458a59b3a76cc6dcb0697d69f221811e2923e57ca01d8417a0

Observation 17f418fc-35eb-4d64-bd47-9bbe2cb43f24 · outbound

This paper cites Weiss, Viet Dang, Ye Jia, Yonghui Wu, Yu Zhang, and Zhifeng Chen.

MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching Weiss, Viet Dang, Ye Jia, Yonghui Wu, Yu Zhang, and Zhifeng Chen

Reference 33

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T00:30:30.029878Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-16T00:30:28.497954Z digest=sha256:06760fb1845047a185a098a569c34ae203d938888f8bcd1124e37f6682b79d4f

Observation bffdba0b-d3e2-4685-960e-41d456e1b5a4 · outbound

This paper cites The LJ speech dataset.

MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching The LJ speech dataset

Reference 34

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T00:30:29.993793Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-16T00:30:28.507120Z digest=sha256:321d1185718f4411eeaf9009db3a170378866859652eea49aaa15b2777a9ef0c

Observation 47a7f023-72fc-43ca-a8b0-275e440e8d0d · outbound

This paper cites AISHELL-3: A multi-speaker mandarin TTS corpus and the baselines.

MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching AISHELL-3: A multi-speaker mandarin TTS corpus and the baselines

Reference 35

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T00:30:29.949709Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-16T00:30:28.526935Z digest=sha256:e32dd64c53498673ab42c40f36e6f9f464fd22084ed9eb035f23d3d21b58cc6d

Observation 1b034a7c-808d-4d31-9264-1b997031e92e · outbound

This paper cites WenetSpeech4TTS: A 12,800-hour mandarin TTS corpus for large-scale speech generation.

MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching WenetSpeech4TTS: A 12,800-hour mandarin TTS corpus for large-scale speech generation

Reference 36

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T00:30:29.912337Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-16T00:30:28.540193Z digest=sha256:82a9537c646e1a11e9e6c0a8c52559608621ebfbf9b1b859e9524be6fd3c0487

Observation 61559e0b-027d-483f-b059-51f8342b1cf2 · outbound

This paper cites Audiocaps: Gener- ating captions for audios in the wild.

MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching Audiocaps: Gener- ating captions for audios in the wild

Reference 37

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T00:30:29.878407Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-16T00:30:28.553870Z digest=sha256:4e4cdc7ba1bcc0e90cec900662bf102328ae752366b95d4b4ff0a7eb9dd9e2f0

Observation ecd7bb0f-f42f-4a99-880a-25ba3510719f · outbound

This paper cites Funasr: A fundamental end-to-end speech recognition toolkit.

MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching Funasr: A fundamental end-to-end speech recognition toolkit

Reference 38

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T00:30:29.843453Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-16T00:30:28.573890Z digest=sha256:10f14158c1504eb4faf08dc62af3dda02f753f0a28f35bb3a79cdea45d56eb68

Observation 66393fa3-c722-4d97-8490-3fe132374c71 · outbound

This paper cites Robust speech recognition via large-scale weak supervision.

MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching Robust speech recognition via large-scale weak supervision

Reference 39

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T00:30:29.796329Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-16T00:30:28.588194Z digest=sha256:22985538dae9d65b9fb213bda1ce5eb0a1eb833d1d22a374f0166cebba9e0c30

Observation 73cdd2f1-b259-455a-af2d-98b2b7c70361 · outbound

This paper cites emotion2vec: Self-Supervised Pre-Training for Speech Emotion Representation.

MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching emotion2vec: Self-Supervised Pre-Training for Speech Emotion Representation

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-16T00:30:28.595710Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T00:30:28.595710Z digest=sha256:0e30e3efdd2569a0fc40aaf32dcdb8f0476d4c722953c6d12640da263c39027a

Observation 5052416e-0a7f-4ad4-9d34-374d2109c4d6 · outbound

This paper cites MECAT: A Multi-Experts Constructed Benchmark for Fine-Grained Audio Understanding Tasks.

MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching MECAT: A Multi-Experts Constructed Benchmark for Fine-Grained Audio Understanding Tasks

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-16T00:30:28.603866Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T00:30:28.603866Z digest=sha256:89b041e344cd7ca2a5a8878e921633ad43855e32102dcc5b471e608117df1210

Observation ed95e110-236d-41b6-8119-0b99312a354c · outbound

This paper cites Fréchet audio distance: A reference-free metric for evaluating music enhancement algorithms.

MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching Fréchet audio distance: A reference-free metric for evaluating music enhancement algorithms

Reference 42

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T00:30:29.754138Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-16T00:30:28.611712Z digest=sha256:bd587f8d18af64ff566bedf6c9b756283133edb8c893aa5a78e9730917be1a1e

Observation be771b3b-814f-45dd-bc59-50befd136b65 · outbound

This paper cites CLAP: Learn- ing audio concepts from natural language supervision.

MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching CLAP: Learn- ing audio concepts from natural language supervision

Reference 43

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T00:30:29.720290Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-16T00:30:28.622612Z digest=sha256:e048088b0dd849a7f2006417c3141c83646ae9964208d556530c6ac26e0a5cf1

Observation ec1babc5-bebc-41e9-b24d-f2cce33d0a61 · outbound

This paper cites Diffusion Transformers with Representation Autoencoders.

MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching Diffusion Transformers with Representation Autoencoders

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-16T00:30:28.634356Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T00:30:28.634356Z digest=sha256:99245784cfce9a53f104453a772308cc65d39e5b43549f93a95b69a3a049e58b

Pith citing papers

No inbound Pith citation observations are available.