{"as_of":"2026-08-18T10:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:659c3a22e4e86c6b34768ba93dd7224a88344c7ae2cdc4e700054f969b40cd7d","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T00:30:28.634356Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.11804/citation-record","integrity":"/paper/2608.11804/integrity","json":"/paper/2608.11804/citation-record.json","paper":"/paper/2608.11804"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2601.15621","last_updated":"2026-01-22T03:51:43Z","snapshot_observed_at":"2026-08-13T01:33:42.158497Z","submitted_at":"2026-01-22T03:51:43Z","title":"Qwen3-TTS Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.15621","snapshot_observed_at":"2026-08-16T00:30:28.169548Z","title":"Qwen3-tts technical report","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.11804","last_updated":"2026-08-12T08:46:28Z","snapshot_observed_at":"2026-08-17T05:00:24.362963Z","submitted_at":"2026-08-12T08:46:28Z","title":"MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T00:30:28.169548Z"},"links":{"cited_paper":"/paper/2601.15621","citing_paper":"/paper/2608.11804"},"observation_digest":"sha256:6eaad3607178cfa523f77c7b8b44999cb0678d6043308df59e617d7d0a392cd6","observation_id":"49513efb-d097-47fb-b871-d9a39cea64a6","resolution":{"observed_at":"2026-08-16T00:30:28.169548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-08-15T11:55:32.600679Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-16T00:30:28.176713Z","title":"Seed-tts: A family of high-quality versatile speech generation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11804","last_updated":"2026-08-12T08:46:28Z","snapshot_observed_at":"2026-08-17T05:00:24.362963Z","submitted_at":"2026-08-12T08:46:28Z","title":"MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T00:30:28.176713Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2608.11804"},"observation_digest":"sha256:d03bd057a09a30e284762c4ac3a2c3b759a47f73cefbb7a90dd4cf3526c30896","observation_id":"e7f71a3a-1b2a-483b-a1d8-229a4b02c2ab","resolution":{"observed_at":"2026-08-16T00:30:28.176713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:30:30.588931Z","title":"Simple and controllable music generation","venue":null,"work_id":"ccf3dac2-b8b7-4992-92c5-57a36fac048a","year":2023},"citing_paper":{"arxiv_id":"2608.11804","last_updated":"2026-08-12T08:46:28Z","snapshot_observed_at":"2026-08-17T05:00:24.362963Z","submitted_at":"2026-08-12T08:46:28Z","title":"MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T00:30:28.186096Z"},"links":{"citing_paper":"/paper/2608.11804"},"observation_digest":"sha256:c1a127391bb7379b3464e155462060693bac833a7c4d68d89d36b0aac64fa780","observation_id":"dd007df7-276f-474c-83e2-e61e28ac6a4c","resolution":{"observed_at":"2026-08-16T00:30:30.597343Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:30:30.556055Z","title":"Denk, Zalán Borsos, Jesse Engel, Mauro Verzetti, Antoine Caillon, Qingqing Huang, Aren Jansen, Adam Roberts, Marco Tagliasacchi, Matt Sharifi, Neil Zeghidour, and Christian Frank","venue":null,"work_id":"cc29c43b-1092-4de5-9cb9-a20374ca9c55","year":2023},"citing_paper":{"arxiv_id":"2608.11804","last_updated":"2026-08-12T08:46:28Z","snapshot_observed_at":"2026-08-17T05:00:24.362963Z","submitted_at":"2026-08-12T08:46:28Z","title":"MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T00:30:28.194909Z"},"links":{"citing_paper":"/paper/2608.11804"},"observation_digest":"sha256:d7c8ba3c103a55be8427ae5021209932ddd822558d1f8218125dadba4a3ffbf4","observation_id":"a10e29e7-2f4c-46bf-95c2-09b9deee3180","resolution":{"observed_at":"2026-08-16T00:30:30.563940Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:30:30.522196Z","title":"Plumbley","venue":null,"work_id":"b397c2e6-8a6b-4fe8-950d-a2dd14db4465","year":2023},"citing_paper":{"arxiv_id":"2608.11804","last_updated":"2026-08-12T08:46:28Z","snapshot_observed_at":"2026-08-17T05:00:24.362963Z","submitted_at":"2026-08-12T08:46:28Z","title":"MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T00:30:28.215321Z"},"links":{"citing_paper":"/paper/2608.11804"},"observation_digest":"sha256:72c520bc3a194196a8f4f86874aaca33afbb33aa87a8281a5d40d0761d9272b8","observation_id":"ebcbf914-76d8-4740-8bf8-243e6e424550","resolution":{"observed_at":"2026-08-16T00:30:30.529806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.21037","last_updated":"2025-04-10T05:01:32Z","snapshot_observed_at":"2026-08-18T08:51:59.333838Z","submitted_at":"2024-12-30T16:02:44Z","title":"TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.21037","snapshot_observed_at":"2026-08-16T00:30:28.222670Z","title":"Tangoflux: Super fast and faith- ful text to audio generation with flow matching and clap-ranked preference optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11804","last_updated":"2026-08-12T08:46:28Z","snapshot_observed_at":"2026-08-17T05:00:24.362963Z","submitted_at":"2026-08-12T08:46:28Z","title":"MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T00:30:28.222670Z"},"links":{"cited_paper":"/paper/2412.21037","citing_paper":"/paper/2608.11804"},"observation_digest":"sha256:39d98412c54db1a8d79238e77d28879be1ddc87affb80a9660c9b49440af60d2","observation_id":"57b22c66-ff37-4d62-80bf-81d474c6a82c","resolution":{"observed_at":"2026-08-16T00:30:28.222670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:30:30.478754Z","title":"Uniaudio: An audio foundation model toward universal audio generation","venue":null,"work_id":"23943b7a-8694-4684-8c19-f5edc4476966","year":2024},"citing_paper":{"arxiv_id":"2608.11804","last_updated":"2026-08-12T08:46:28Z","snapshot_observed_at":"2026-08-17T05:00:24.362963Z","submitted_at":"2026-08-12T08:46:28Z","title":"MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T00:30:28.235963Z"},"links":{"citing_paper":"/paper/2608.11804"},"observation_digest":"sha256:d1dab58140cb02c303d6fe150cd34549519b267fd07e01ff925cabd05ae8bd43","observation_id":"60677b62-7417-4406-aba3-835b57ab905a","resolution":{"observed_at":"2026-08-16T00:30:30.494811Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:30:28.244051Z","title":"Uniflow-audio: Unified flow matching for audio generation from omni-modalities","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11804","last_updated":"2026-08-12T08:46:28Z","snapshot_observed_at":"2026-08-17T05:00:24.362963Z","submitted_at":"2026-08-12T08:46:28Z","title":"MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T00:30:28.244051Z"},"links":{"citing_paper":"/paper/2608.11804"},"observation_digest":"sha256:a93643787460a3a3acd7778c93190d65ec60c2385be032dfd06d7569a0e43e10","observation_id":"77868152-0428-4b36-afb3-d429fd9569fa","resolution":{"observed_at":"2026-08-16T00:30:28.244051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.27838","last_updated":"2026-05-27T01:50:29Z","snapshot_observed_at":"2026-08-18T03:40:38.590853Z","submitted_at":"2026-05-27T01:50:29Z","title":"Dasheng AudioGen: A Unified Model for Generating Coherent Audio Scenes from Text","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.27838","snapshot_observed_at":"2026-08-16T00:30:28.252205Z","title":"Dasheng audiogen: A unified model for generating coherent audio scenes from text","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.11804","last_updated":"2026-08-12T08:46:28Z","snapshot_observed_at":"2026-08-17T05:00:24.362963Z","submitted_at":"2026-08-12T08:46:28Z","title":"MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T00:30:28.252205Z"},"links":{"cited_paper":"/paper/2605.27838","citing_paper":"/paper/2608.11804"},"observation_digest":"sha256:8086054eefd92c7af791f4c3b18fbe2a68600a98d0bed4f5bd5e9efc463ce6c8","observation_id":"cae037ee-52d5-4000-84d6-e6b0176c55a7","resolution":{"observed_at":"2026-08-16T00:30:28.252205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:30:30.437869Z","title":"Denoising diffusion probabilistic models","venue":null,"work_id":"b259890f-4cb4-4cf8-946f-ed04add20c15","year":2020},"citing_paper":{"arxiv_id":"2608.11804","last_updated":"2026-08-12T08:46:28Z","snapshot_observed_at":"2026-08-17T05:00:24.362963Z","submitted_at":"2026-08-12T08:46:28Z","title":"MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T00:30:28.260201Z"},"links":{"citing_paper":"/paper/2608.11804"},"observation_digest":"sha256:425b0ed4f94db181818306d3af9d5d0ab3d7e6dcd1153aa01a07cbc3c1e099de","observation_id":"796550f7-6ab1-49e1-928b-9aa1b2377ad4","resolution":{"observed_at":"2026-08-16T00:30:30.446348Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-16T02:30:42.660030Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-16T00:30:28.265065Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.11804","last_updated":"2026-08-12T08:46:28Z","snapshot_observed_at":"2026-08-17T05:00:24.362963Z","submitted_at":"2026-08-12T08:46:28Z","title":"MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T00:30:28.265065Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2608.11804"},"observation_digest":"sha256:ff1a621b54e1579b2829f203c488f105d59c69ce031d058226da80152ade191b","observation_id":"d7d8ba55-c3b2-46a0-8519-4afd5d5ea09d","resolution":{"observed_at":"2026-08-16T00:30:28.265065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:30:30.405916Z","title":"Make-an-audio: Text-to-audio generation with prompt- enhanced diffusion models","venue":null,"work_id":"63848e64-03a4-420a-90c2-fa6770e71dcb","year":2023},"citing_paper":{"arxiv_id":"2608.11804","last_updated":"2026-08-12T08:46:28Z","snapshot_observed_at":"2026-08-17T05:00:24.362963Z","submitted_at":"2026-08-12T08:46:28Z","title":"MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T00:30:28.280692Z"},"links":{"citing_paper":"/paper/2608.11804"},"observation_digest":"sha256:9d747b1544284883d45dcb6e2f4267d2b6bf9fbac012b164d5c1551addce9797","observation_id":"36ef1c8c-d0e2-4081-bc38-5d86f77e6cbe","resolution":{"observed_at":"2026-08-16T00:30:30.416583Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:30:30.367525Z","title":"Plumbley","venue":null,"work_id":"c46475fc-1435-499d-a170-3907afa54c0d","year":2023},"citing_paper":{"arxiv_id":"2608.11804","last_updated":"2026-08-12T08:46:28Z","snapshot_observed_at":"2026-08-17T05:00:24.362963Z","submitted_at":"2026-08-12T08:46:28Z","title":"MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T00:30:28.288603Z"},"links":{"citing_paper":"/paper/2608.11804"},"observation_digest":"sha256:32048508ed52b1658fa851dea7445c77b83ecdd0187347383240cdcfe7112ac6","observation_id":"1bad4996-86e6-441c-92aa-77005dadf0e2","resolution":{"observed_at":"2026-08-16T00:30:30.376413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.04729","last_updated":"2025-05-07T07:09:38Z","snapshot_observed_at":"2026-08-16T15:09:46.038011Z","submitted_at":"2023-08-09T06:27:24Z","title":"JEN-1: Text-Guided Universal Music Generation with Omnidirectional Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.04729","snapshot_observed_at":"2026-08-16T00:30:28.299836Z","title":"Jen-1: Text-guided universal music generation with omnidirectional diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.11804","last_updated":"2026-08-12T08:46:28Z","snapshot_observed_at":"2026-08-17T05:00:24.362963Z","submitted_at":"2026-08-12T08:46:28Z","title":"MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T00:30:28.299836Z"},"links":{"cited_paper":"/paper/2308.04729","citing_paper":"/paper/2608.11804"},"observation_digest":"sha256:3abb4b8150e159adfd402ecedbc49281cbed7b6e46a86f2a95a23bf039f66fd8","observation_id":"631d52ea-1269-42cb-9413-5192c6206da9","resolution":{"observed_at":"2026-08-16T00:30:28.299836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:30:30.338660Z","title":"Weiss, Mike Schuster, Navdeep Jaitly, Zongheng Yang, Zhifeng Chen, Yu Zhang, Yuxuan Wang, Rj Skerrv-Ryan, Rif A","venue":null,"work_id":"08b0dfa5-9996-43b8-8f1d-01e6f9e363bc","year":2018},"citing_paper":{"arxiv_id":"2608.11804","last_updated":"2026-08-12T08:46:28Z","snapshot_observed_at":"2026-08-17T05:00:24.362963Z","submitted_at":"2026-08-12T08:46:28Z","title":"MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T00:30:28.320721Z"},"links":{"citing_paper":"/paper/2608.11804"},"observation_digest":"sha256:ee726ddb8105d14fdbe862193486145a6ccdb13d8e5bbbb7b7d245aebe521f19","observation_id":"aaecdde2-311a-49e3-8d02-fc7b577efd91","resolution":{"observed_at":"2026-08-16T00:30:30.345742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:30:30.307874Z","title":"Fastspeech: Fast, robust and controllable text to speech","venue":null,"work_id":"02d7b554-7670-487f-867d-fe330d47ef0d","year":2019},"citing_paper":{"arxiv_id":"2608.11804","last_updated":"2026-08-12T08:46:28Z","snapshot_observed_at":"2026-08-17T05:00:24.362963Z","submitted_at":"2026-08-12T08:46:28Z","title":"MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T00:30:28.326595Z"},"links":{"citing_paper":"/paper/2608.11804"},"observation_digest":"sha256:3ec6b0a9b52fd5fb9093cb7d44eaa02ffc7bde848b8fea043e95997188b1d789","observation_id":"d73faa25-f3c3-4d75-bc6d-3707a6aa2f05","resolution":{"observed_at":"2026-08-16T00:30:30.315999Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:30:30.282103Z","title":"Conditional variational autoencoder with adversarial learning for end-to-end text-to-speech","venue":null,"work_id":"6010137b-a635-4d81-afcc-dbbbb709dd6e","year":2021},"citing_paper":{"arxiv_id":"2608.11804","last_updated":"2026-08-12T08:46:28Z","snapshot_observed_at":"2026-08-17T05:00:24.362963Z","submitted_at":"2026-08-12T08:46:28Z","title":"MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T00:30:28.334219Z"},"links":{"citing_paper":"/paper/2608.11804"},"observation_digest":"sha256:66fc0848b20491ec4098a8b563d2e0be29c0022fed6426026e954c0a19eacdcc","observation_id":"4b019842-1e32-4dfa-9ee5-318bd915d314","resolution":{"observed_at":"2026-08-16T00:30:30.291282Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-16T00:30:28.342866Z","title":"Neural codec language models are zero-shot text to speech synthesizers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.11804","last_updated":"2026-08-12T08:46:28Z","snapshot_observed_at":"2026-08-17T05:00:24.362963Z","submitted_at":"2026-08-12T08:46:28Z","title":"MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T00:30:28.342866Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2608.11804"},"observation_digest":"sha256:00f150f39775971ee4982019c860ff2ebdb2d4f5657f5b077eaff4ec794a6dbb","observation_id":"b0c8f966-b356-460a-a49a-5603eb964d90","resolution":{"observed_at":"2026-08-16T00:30:28.342866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:30:30.241942Z","title":"Soundstorm: Efficient parallel audio generation","venue":null,"work_id":"2c7bd90c-fbe9-46c8-96b1-6485a6399a0d","year":2023},"citing_paper":{"arxiv_id":"2608.11804","last_updated":"2026-08-12T08:46:28Z","snapshot_observed_at":"2026-08-17T05:00:24.362963Z","submitted_at":"2026-08-12T08:46:28Z","title":"MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T00:30:28.349501Z"},"links":{"citing_paper":"/paper/2608.11804"},"observation_digest":"sha256:f3ebab83f5ca0e2261f3dc410632a267ecb699a12a1da2b69742814a4ba4c1d9","observation_id":"8321aa47-6ff7-445e-8ea1-1c43ba56aee3","resolution":{"observed_at":"2026-08-16T00:30:30.257562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07916","last_updated":"2025-05-12T14:25:20Z","snapshot_observed_at":"2026-08-17T19:35:47.077535Z","submitted_at":"2025-05-12T14:25:20Z","title":"MiniMax-Speech: Intrinsic Zero-Shot Text-to-Speech with a Learnable Speaker Encoder","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07916","snapshot_observed_at":"2026-08-16T00:30:28.369540Z","title":"Minimax- speech: Intrinsic zero-shot text-to-speech with a learnable speaker encoder","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11804","last_updated":"2026-08-12T08:46:28Z","snapshot_observed_at":"2026-08-17T05:00:24.362963Z","submitted_at":"2026-08-12T08:46:28Z","title":"MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T00:30:28.369540Z"},"links":{"cited_paper":"/paper/2505.07916","citing_paper":"/paper/2608.11804"},"observation_digest":"sha256:ec91dc338bcfe9c13828a4125efa472f6515d0aef037201e92674f89527e4cdc","observation_id":"4b8ed3be-f1d0-4fc9-9555-fdace64326e2","resolution":{"observed_at":"2026-08-16T00:30:28.369540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06885","last_updated":"2025-05-20T15:53:10Z","snapshot_observed_at":"2026-08-16T05:58:47.061997Z","submitted_at":"2024-10-09T13:46:34Z","title":"F5-TTS: A Fairytaler that Fakes Fluent and Faithful Speech with Flow Matching","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06885","snapshot_observed_at":"2026-08-16T00:30:28.379942Z","title":"F5-tts: A fairytaler that fakes fluent and faithful speech with flow matching","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11804","last_updated":"2026-08-12T08:46:28Z","snapshot_observed_at":"2026-08-17T05:00:24.362963Z","submitted_at":"2026-08-12T08:46:28Z","title":"MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T00:30:28.379942Z"},"links":{"cited_paper":"/paper/2410.06885","citing_paper":"/paper/2608.11804"},"observation_digest":"sha256:e2170814eed0df70f2bafacc9cc1f3a37202768f4f2bf43cc8fddf872df1beb8","observation_id":"1e123b37-f8cc-4fa7-836b-5a7229c2ad20","resolution":{"observed_at":"2026-08-16T00:30:28.379942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17589","last_updated":"2025-05-27T07:48:34Z","snapshot_observed_at":"2026-08-16T06:12:24.457686Z","submitted_at":"2025-05-23T07:55:21Z","title":"CosyVoice 3: Towards In-the-wild Speech Generation via Scaling-up and Post-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.17589","snapshot_observed_at":"2026-08-16T00:30:28.389087Z","title":"Cosyvoice 3: Multi-lingual multi-timbre multi-style speech generation with controllable emotion","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11804","last_updated":"2026-08-12T08:46:28Z","snapshot_observed_at":"2026-08-17T05:00:24.362963Z","submitted_at":"2026-08-12T08:46:28Z","title":"MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T00:30:28.389087Z"},"links":{"cited_paper":"/paper/2505.17589","citing_paper":"/paper/2608.11804"},"observation_digest":"sha256:2ffa1d86fbcb0485833259f58237de2dab55d94ae1238bc3a072b81fc858e00d","observation_id":"a4ec0dec-25ef-4c2b-b013-10c15af19ffc","resolution":{"observed_at":"2026-08-16T00:30:28.389087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10522","last_updated":"2026-04-15T16:32:32Z","snapshot_observed_at":"2026-07-31T02:51:01.521373Z","submitted_at":"2025-03-13T16:30:59Z","title":"AudioX: A Unified Framework for Anything-to-Audio Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10522","snapshot_observed_at":"2026-08-16T00:30:28.394868Z","title":"Audiox: Diffusion transformer for anything-to-audio generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11804","last_updated":"2026-08-12T08:46:28Z","snapshot_observed_at":"2026-08-17T05:00:24.362963Z","submitted_at":"2026-08-12T08:46:28Z","title":"MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T00:30:28.394868Z"},"links":{"cited_paper":"/paper/2503.10522","citing_paper":"/paper/2608.11804"},"observation_digest":"sha256:f5abfaed56139f464c09e7a10fb83f5020514711f665002f2539fd918bf50c7c","observation_id":"f7c0e266-9abb-4532-b032-9591ba55ea7b","resolution":{"observed_at":"2026-08-16T00:30:28.394868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.05220","last_updated":"2026-08-01T20:53:01Z","snapshot_observed_at":"2026-08-13T11:38:11.408601Z","submitted_at":"2026-02-05T02:20:07Z","title":"Bagpiper: Solving Open-Ended Audio Tasks via Rich Captions","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.05220","snapshot_observed_at":"2026-08-16T00:30:28.402056Z","title":"Bagpiper: Solving open-ended audio tasks via rich captions","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.11804","last_updated":"2026-08-12T08:46:28Z","snapshot_observed_at":"2026-08-17T05:00:24.362963Z","submitted_at":"2026-08-12T08:46:28Z","title":"MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T00:30:28.402056Z"},"links":{"cited_paper":"/paper/2602.05220","citing_paper":"/paper/2608.11804"},"observation_digest":"sha256:0913461d054e81a48cb1b7d875024024855068f9c52f7f54920d3f036cb34b31","observation_id":"b29ad2ff-f47b-42ed-b075-6cf5e0977a17","resolution":{"observed_at":"2026-08-16T00:30:28.402056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:30:28.414269Z","title":"Dashengtokenizer: One layer is enough for unified audio understanding and generation","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.11804","last_updated":"2026-08-12T08:46:28Z","snapshot_observed_at":"2026-08-17T05:00:24.362963Z","submitted_at":"2026-08-12T08:46:28Z","title":"MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T00:30:28.414269Z"},"links":{"citing_paper":"/paper/2608.11804"},"observation_digest":"sha256:783651f8d68937ef773a31eb7933cfbaeea544dac6e52bb9da0180ed3b5b271d","observation_id":"48aa3da9-8602-4426-b95d-9ed4dd885a1e","resolution":{"observed_at":"2026-08-16T00:30:28.414269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-16T00:30:28.426800Z","title":"Qwen3 technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11804","last_updated":"2026-08-12T08:46:28Z","snapshot_observed_at":"2026-08-17T05:00:24.362963Z","submitted_at":"2026-08-12T08:46:28Z","title":"MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T00:30:28.426800Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2608.11804"},"observation_digest":"sha256:c4ca469f1c3ef9b3e3bf8bcfd4dcb121eecdb113a53efa0ce26d45bc0f07d26d","observation_id":"5a2f8247-8e77-4c18-abd8-2d0c12de5c9a","resolution":{"observed_at":"2026-08-16T00:30:28.426800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:30:28.438428Z","title":"Midashenglm: Efficient audio understanding with general audio captions","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11804","last_updated":"2026-08-12T08:46:28Z","snapshot_observed_at":"2026-08-17T05:00:24.362963Z","submitted_at":"2026-08-12T08:46:28Z","title":"MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T00:30:28.438428Z"},"links":{"citing_paper":"/paper/2608.11804"},"observation_digest":"sha256:c4bfd10c1c8e1f51578b743c315300b386676611e1e56c1ee960bdeec79a0a0d","observation_id":"37be04c0-5fb6-46e9-ae4a-785c43c5bdcc","resolution":{"observed_at":"2026-08-16T00:30:28.438428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:30:30.198000Z","title":"Vocos: Closing the gap between time-domain and fourier-based neural vocoders for high-quality audio synthesis","venue":null,"work_id":"54833b83-31d2-45e3-84ae-f24845f3acd0","year":2024},"citing_paper":{"arxiv_id":"2608.11804","last_updated":"2026-08-12T08:46:28Z","snapshot_observed_at":"2026-08-17T05:00:24.362963Z","submitted_at":"2026-08-12T08:46:28Z","title":"MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T00:30:28.448106Z"},"links":{"citing_paper":"/paper/2608.11804"},"observation_digest":"sha256:ce8e3a420cc41fa1795b642be88db1f6991c90a8fbb959079c6b75b66f8c3ecd","observation_id":"469c3f21-0d6c-4c8f-87ba-d32002ac8415","resolution":{"observed_at":"2026-08-16T00:30:30.207138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:30:30.159898Z","title":"Llm.int8(): 8-bit matrix multiplication for transformers at scale","venue":null,"work_id":"a7e24b2b-bcc1-4d01-9ff1-d46c0c4f89f5","year":2022},"citing_paper":{"arxiv_id":"2608.11804","last_updated":"2026-08-12T08:46:28Z","snapshot_observed_at":"2026-08-17T05:00:24.362963Z","submitted_at":"2026-08-12T08:46:28Z","title":"MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T00:30:28.459569Z"},"links":{"citing_paper":"/paper/2608.11804"},"observation_digest":"sha256:16df0b88f3781bdbc85a60fb9ce9e3c08b0ae8b83e3d022f2acd97c49d4b6b99","observation_id":"c811b625-a07e-4eba-a17f-496f7967e13f","resolution":{"observed_at":"2026-08-16T00:30:30.179318Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:30:30.123635Z","title":"Acavcaps: Enabling large-scale training for fine-grained and diverse audio understanding","venue":null,"work_id":"9cdc8323-be33-4b6d-b692-1f77649f03bb","year":2026},"citing_paper":{"arxiv_id":"2608.11804","last_updated":"2026-08-12T08:46:28Z","snapshot_observed_at":"2026-08-17T05:00:24.362963Z","submitted_at":"2026-08-12T08:46:28Z","title":"MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T00:30:28.465592Z"},"links":{"citing_paper":"/paper/2608.11804"},"observation_digest":"sha256:7a62a8227b71adaf598c1eb524c264124bafe03ca6003cd0bd4282c353cd0e4e","observation_id":"61d182ff-7b49-421d-a8f7-f79e7b32f9e0","resolution":{"observed_at":"2026-08-16T00:30:30.131992Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:30:30.089364Z","title":"Acav100m: Automatic curation of large-scale datasets for audio-visual video represen- tation learning","venue":null,"work_id":"30538a9c-e611-4cd9-8892-cf04c620e3af","year":2021},"citing_paper":{"arxiv_id":"2608.11804","last_updated":"2026-08-12T08:46:28Z","snapshot_observed_at":"2026-08-17T05:00:24.362963Z","submitted_at":"2026-08-12T08:46:28Z","title":"MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T00:30:28.473822Z"},"links":{"citing_paper":"/paper/2608.11804"},"observation_digest":"sha256:29d8833daab14bf90c3873ca803b93297e33de1596685e872ff3064fdae2fb56","observation_id":"fe1dbb88-ccba-4ffc-9a7b-b43e914c5418","resolution":{"observed_at":"2026-08-16T00:30:30.096173Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:30:30.059972Z","title":"Emilia: An extensive, multilingual, and diverse speech dataset for large-scale speech generation","venue":null,"work_id":"f866ea42-0bad-4710-aaec-0026041f1a00","year":2024},"citing_paper":{"arxiv_id":"2608.11804","last_updated":"2026-08-12T08:46:28Z","snapshot_observed_at":"2026-08-17T05:00:24.362963Z","submitted_at":"2026-08-12T08:46:28Z","title":"MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T00:30:28.484544Z"},"links":{"citing_paper":"/paper/2608.11804"},"observation_digest":"sha256:92c06f614cefae458a59b3a76cc6dcb0697d69f221811e2923e57ca01d8417a0","observation_id":"4c113222-091f-4011-b810-1a24b3d474cd","resolution":{"observed_at":"2026-08-16T00:30:30.070374Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:30:30.020816Z","title":"Weiss, Viet Dang, Ye Jia, Yonghui Wu, Yu Zhang, and Zhifeng Chen","venue":null,"work_id":"c6b512e3-8885-43f1-92b8-596a99e6148b","year":2019},"citing_paper":{"arxiv_id":"2608.11804","last_updated":"2026-08-12T08:46:28Z","snapshot_observed_at":"2026-08-17T05:00:24.362963Z","submitted_at":"2026-08-12T08:46:28Z","title":"MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T00:30:28.497954Z"},"links":{"citing_paper":"/paper/2608.11804"},"observation_digest":"sha256:06760fb1845047a185a098a569c34ae203d938888f8bcd1124e37f6682b79d4f","observation_id":"17f418fc-35eb-4d64-bd47-9bbe2cb43f24","resolution":{"observed_at":"2026-08-16T00:30:30.029878Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:30:29.976095Z","title":"The LJ speech dataset","venue":null,"work_id":"2b1dfd05-2278-4678-a472-7e247cca2ce2","year":2017},"citing_paper":{"arxiv_id":"2608.11804","last_updated":"2026-08-12T08:46:28Z","snapshot_observed_at":"2026-08-17T05:00:24.362963Z","submitted_at":"2026-08-12T08:46:28Z","title":"MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T00:30:28.507120Z"},"links":{"citing_paper":"/paper/2608.11804"},"observation_digest":"sha256:321d1185718f4411eeaf9009db3a170378866859652eea49aaa15b2777a9ef0c","observation_id":"bffdba0b-d3e2-4685-960e-41d456e1b5a4","resolution":{"observed_at":"2026-08-16T00:30:29.993793Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:30:29.930507Z","title":"AISHELL-3: A multi-speaker mandarin TTS corpus and the baselines","venue":null,"work_id":"b2b888a1-0168-47fd-94aa-af657a9c21bf","year":2021},"citing_paper":{"arxiv_id":"2608.11804","last_updated":"2026-08-12T08:46:28Z","snapshot_observed_at":"2026-08-17T05:00:24.362963Z","submitted_at":"2026-08-12T08:46:28Z","title":"MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T00:30:28.526935Z"},"links":{"citing_paper":"/paper/2608.11804"},"observation_digest":"sha256:e32dd64c53498673ab42c40f36e6f9f464fd22084ed9eb035f23d3d21b58cc6d","observation_id":"47a7f023-72fc-43ca-a8b0-275e440e8d0d","resolution":{"observed_at":"2026-08-16T00:30:29.949709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:30:29.900662Z","title":"WenetSpeech4TTS: A 12,800-hour mandarin TTS corpus for large-scale speech generation","venue":null,"work_id":"d46e4bcf-e612-4d67-8c3e-d145023bf33e","year":2024},"citing_paper":{"arxiv_id":"2608.11804","last_updated":"2026-08-12T08:46:28Z","snapshot_observed_at":"2026-08-17T05:00:24.362963Z","submitted_at":"2026-08-12T08:46:28Z","title":"MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T00:30:28.540193Z"},"links":{"citing_paper":"/paper/2608.11804"},"observation_digest":"sha256:82a9537c646e1a11e9e6c0a8c52559608621ebfbf9b1b859e9524be6fd3c0487","observation_id":"1b034a7c-808d-4d31-9264-1b997031e92e","resolution":{"observed_at":"2026-08-16T00:30:29.912337Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:30:29.864589Z","title":"Audiocaps: Gener- ating captions for audios in the wild","venue":null,"work_id":"358463e0-e765-47cd-bf89-1d51111cf71d","year":2019},"citing_paper":{"arxiv_id":"2608.11804","last_updated":"2026-08-12T08:46:28Z","snapshot_observed_at":"2026-08-17T05:00:24.362963Z","submitted_at":"2026-08-12T08:46:28Z","title":"MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T00:30:28.553870Z"},"links":{"citing_paper":"/paper/2608.11804"},"observation_digest":"sha256:4e4cdc7ba1bcc0e90cec900662bf102328ae752366b95d4b4ff0a7eb9dd9e2f0","observation_id":"61559e0b-027d-483f-b059-51f8342b1cf2","resolution":{"observed_at":"2026-08-16T00:30:29.878407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:30:29.831726Z","title":"Funasr: A fundamental end-to-end speech recognition toolkit","venue":null,"work_id":"5da343a5-6a37-40e0-b334-e7bdf485467b","year":2023},"citing_paper":{"arxiv_id":"2608.11804","last_updated":"2026-08-12T08:46:28Z","snapshot_observed_at":"2026-08-17T05:00:24.362963Z","submitted_at":"2026-08-12T08:46:28Z","title":"MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T00:30:28.573890Z"},"links":{"citing_paper":"/paper/2608.11804"},"observation_digest":"sha256:10f14158c1504eb4faf08dc62af3dda02f753f0a28f35bb3a79cdea45d56eb68","observation_id":"ecd7bb0f-f42f-4a99-880a-25ba3510719f","resolution":{"observed_at":"2026-08-16T00:30:29.843453Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:30:29.787798Z","title":"Robust speech recognition via large-scale weak supervision","venue":null,"work_id":"af95b5fd-e89a-4fcf-afe4-418235e3680d","year":2023},"citing_paper":{"arxiv_id":"2608.11804","last_updated":"2026-08-12T08:46:28Z","snapshot_observed_at":"2026-08-17T05:00:24.362963Z","submitted_at":"2026-08-12T08:46:28Z","title":"MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T00:30:28.588194Z"},"links":{"citing_paper":"/paper/2608.11804"},"observation_digest":"sha256:22985538dae9d65b9fb213bda1ce5eb0a1eb833d1d22a374f0166cebba9e0c30","observation_id":"66393fa3-c722-4d97-8490-3fe132374c71","resolution":{"observed_at":"2026-08-16T00:30:29.796329Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15185","last_updated":"2023-12-23T07:46:55Z","snapshot_observed_at":"2026-08-16T20:32:52.299526Z","submitted_at":"2023-12-23T07:46:55Z","title":"emotion2vec: Self-Supervised Pre-Training for Speech Emotion Representation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15185","snapshot_observed_at":"2026-08-16T00:30:28.595710Z","title":"emotion2vec: Self-supervised pre-training for speech emotion representation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11804","last_updated":"2026-08-12T08:46:28Z","snapshot_observed_at":"2026-08-17T05:00:24.362963Z","submitted_at":"2026-08-12T08:46:28Z","title":"MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T00:30:28.595710Z"},"links":{"cited_paper":"/paper/2312.15185","citing_paper":"/paper/2608.11804"},"observation_digest":"sha256:0e30e3efdd2569a0fc40aaf32dcdb8f0476d4c722953c6d12640da263c39027a","observation_id":"73cdd2f1-b259-455a-af2d-98b2b7c70361","resolution":{"observed_at":"2026-08-16T00:30:28.595710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.23511","last_updated":"2026-05-11T14:54:52Z","snapshot_observed_at":"2026-08-15T03:45:58.298182Z","submitted_at":"2025-07-31T12:47:43Z","title":"MECAT: A Multi-Experts Constructed Benchmark for Fine-Grained Audio Understanding Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.23511","snapshot_observed_at":"2026-08-16T00:30:28.603866Z","title":"Mecat: A multi-experts constructed benchmark for fine-grained audio understanding tasks","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11804","last_updated":"2026-08-12T08:46:28Z","snapshot_observed_at":"2026-08-17T05:00:24.362963Z","submitted_at":"2026-08-12T08:46:28Z","title":"MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-16T00:30:28.603866Z"},"links":{"cited_paper":"/paper/2507.23511","citing_paper":"/paper/2608.11804"},"observation_digest":"sha256:89b041e344cd7ca2a5a8878e921633ad43855e32102dcc5b471e608117df1210","observation_id":"5052416e-0a7f-4ad4-9d34-374d2109c4d6","resolution":{"observed_at":"2026-08-16T00:30:28.603866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:30:29.741643Z","title":"Fréchet audio distance: A reference-free metric for evaluating music enhancement algorithms","venue":null,"work_id":"a142ea07-14e4-4ff0-8afe-b4df4ac2a1d8","year":2019},"citing_paper":{"arxiv_id":"2608.11804","last_updated":"2026-08-12T08:46:28Z","snapshot_observed_at":"2026-08-17T05:00:24.362963Z","submitted_at":"2026-08-12T08:46:28Z","title":"MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-16T00:30:28.611712Z"},"links":{"citing_paper":"/paper/2608.11804"},"observation_digest":"sha256:bd587f8d18af64ff566bedf6c9b756283133edb8c893aa5a78e9730917be1a1e","observation_id":"ed95e110-236d-41b6-8119-0b99312a354c","resolution":{"observed_at":"2026-08-16T00:30:29.754138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:30:29.705832Z","title":"CLAP: Learn- ing audio concepts from natural language supervision","venue":null,"work_id":"bf5a45e1-da77-469e-a189-3d3da171c0ea","year":2023},"citing_paper":{"arxiv_id":"2608.11804","last_updated":"2026-08-12T08:46:28Z","snapshot_observed_at":"2026-08-17T05:00:24.362963Z","submitted_at":"2026-08-12T08:46:28Z","title":"MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-16T00:30:28.622612Z"},"links":{"citing_paper":"/paper/2608.11804"},"observation_digest":"sha256:e048088b0dd849a7f2006417c3141c83646ae9964208d556530c6ac26e0a5cf1","observation_id":"be771b3b-814f-45dd-bc59-50befd136b65","resolution":{"observed_at":"2026-08-16T00:30:29.720290Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.11690","last_updated":"2025-10-13T17:51:39Z","snapshot_observed_at":"2026-08-13T23:51:28.874833Z","submitted_at":"2025-10-13T17:51:39Z","title":"Diffusion Transformers with Representation Autoencoders","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.11690","snapshot_observed_at":"2026-08-16T00:30:28.634356Z","title":"Diffusion transformers with rep- resentation autoencoders","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11804","last_updated":"2026-08-12T08:46:28Z","snapshot_observed_at":"2026-08-17T05:00:24.362963Z","submitted_at":"2026-08-12T08:46:28Z","title":"MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-16T00:30:28.634356Z"},"links":{"cited_paper":"/paper/2510.11690","citing_paper":"/paper/2608.11804"},"observation_digest":"sha256:99245784cfce9a53f104453a772308cc65d39e5b43549f93a95b69a3a049e58b","observation_id":"ec1babc5-bebc-41e9-b24d-f2cce33d0a61","resolution":{"observed_at":"2026-08-16T00:30:28.634356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.11804","last_updated":"2026-08-12T08:46:28Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-17T05:00:24.362963Z","submitted_at":"2026-08-12T08:46:28Z","title":"MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":19,"verified_exact":0,"verified_fuzzy":25},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 0 inbound Pith citation observations for arXiv:2608.11804."}