{"as_of":"2026-08-05T17:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:344c283bab41a861d9b4409d681c64b17cfcb07da8efb812201e33dc735a80a0","coverage":[{"denominator":66,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":66,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T10:17:28.260156Z","state":"measured"},{"denominator":66,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":66,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.27011/citation-record","integrity":"/paper/2607.27011/integrity","json":"/paper/2607.27011/citation-record.json","paper":"/paper/2607.27011"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2301.11325","last_updated":"2023-01-26T18:58:53Z","snapshot_observed_at":"2026-07-06T14:45:00.730733Z","submitted_at":"2023-01-26T18:58:53Z","title":"MusicLM: Generating Music From Text","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.11325","snapshot_observed_at":"2026-08-01T10:17:22.487525Z","title":"MusicLM: Generating music from text","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.27011","last_updated":"2026-07-30T08:12:52Z","snapshot_observed_at":"2026-08-04T22:37:07.722518Z","submitted_at":"2026-07-29T15:06:58Z","title":"Qwen-Audio-3.0-Gen-Preview Technical Report","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T10:17:22.487525Z"},"links":{"cited_paper":"/paper/2301.11325","citing_paper":"/paper/2607.27011"},"observation_digest":"sha256:9f9af8aa3de893130976f216e1c6d01e3eadaf6a96a936b652e3a0ab05644ca5","observation_id":"506e5225-c9d6-4243-81cc-8c15eefdde8f","resolution":{"observed_at":"2026-08-01T10:17:22.487525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:17:22.529628Z","title":"Seed-TTS: A family of high-quality versatile speech generation models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.27011","last_updated":"2026-07-30T08:12:52Z","snapshot_observed_at":"2026-08-04T22:37:07.722518Z","submitted_at":"2026-07-29T15:06:58Z","title":"Qwen-Audio-3.0-Gen-Preview Technical Report","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T10:17:22.529628Z"},"links":{"citing_paper":"/paper/2607.27011"},"observation_digest":"sha256:19b4e270255cecbd6722bf8f737a8451da1ed8d518dbccdf51dda71edf8cb4da","observation_id":"a46f2807-32b6-422f-900d-14e96376af32","resolution":{"observed_at":"2026-08-01T10:17:22.529628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:17:22.616114Z","title":"Neural codec language models are zero-shot text to speech synthesizers","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27011","last_updated":"2026-07-30T08:12:52Z","snapshot_observed_at":"2026-08-04T22:37:07.722518Z","submitted_at":"2026-07-29T15:06:58Z","title":"Qwen-Audio-3.0-Gen-Preview Technical Report","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T10:17:22.616114Z"},"links":{"citing_paper":"/paper/2607.27011"},"observation_digest":"sha256:cb7530ffd71cc32c5cd4bc51e4b990c5544970b7a0a606832149a1773c928632","observation_id":"571238a2-8fe4-426c-a2e6-561df36dc1c1","resolution":{"observed_at":"2026-08-01T10:17:22.616114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:17:22.707593Z","title":"F5-TTS: A fairytaler that fakes fluent and faithful speech with flow matching","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27011","last_updated":"2026-07-30T08:12:52Z","snapshot_observed_at":"2026-08-04T22:37:07.722518Z","submitted_at":"2026-07-29T15:06:58Z","title":"Qwen-Audio-3.0-Gen-Preview Technical Report","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T10:17:22.707593Z"},"links":{"citing_paper":"/paper/2607.27011"},"observation_digest":"sha256:3ec4e4d6615dc7b72dccee2f5a28549f3b55e15fc2f3f20f65c3164bf3e86e03","observation_id":"399657bb-fc47-4d67-b213-0facfc60978c","resolution":{"observed_at":"2026-08-01T10:17:22.707593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:17:22.772056Z","title":"MMAudio: Taming multimodal joint training for high-quality video-to-audio synthesis, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27011","last_updated":"2026-07-30T08:12:52Z","snapshot_observed_at":"2026-08-04T22:37:07.722518Z","submitted_at":"2026-07-29T15:06:58Z","title":"Qwen-Audio-3.0-Gen-Preview Technical Report","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T10:17:22.772056Z"},"links":{"citing_paper":"/paper/2607.27011"},"observation_digest":"sha256:2622e2af7e27b436e27a88e9ca32c7b0ffe3a02a2d3a82f6fd977554c897e7f5","observation_id":"6aa75e47-0324-4170-ad01-cf3379c6abf8","resolution":{"observed_at":"2026-08-01T10:17:22.772056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:17:22.861724Z","title":"Simple and controllable music generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.27011","last_updated":"2026-07-30T08:12:52Z","snapshot_observed_at":"2026-08-04T22:37:07.722518Z","submitted_at":"2026-07-29T15:06:58Z","title":"Qwen-Audio-3.0-Gen-Preview Technical Report","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T10:17:22.861724Z"},"links":{"citing_paper":"/paper/2607.27011"},"observation_digest":"sha256:c62c383d0596012f62ba68978234340cb3aee73d19880be08635689f588ccfca","observation_id":"6f789e2c-bf5c-48c4-927e-fdd2b64b9cad","resolution":{"observed_at":"2026-08-01T10:17:22.861724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:17:22.950470Z","title":"Pushing the frontier of full-song generation: Hierarchical autoregressive planning meets flow-matching rendering, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.27011","last_updated":"2026-07-30T08:12:52Z","snapshot_observed_at":"2026-08-04T22:37:07.722518Z","submitted_at":"2026-07-29T15:06:58Z","title":"Qwen-Audio-3.0-Gen-Preview Technical Report","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T10:17:22.950470Z"},"links":{"citing_paper":"/paper/2607.27011"},"observation_digest":"sha256:ab91b051405b9476fe13c2c5929e4399eba84a8b116c90951a217df5b2c0e4bf","observation_id":"9124b13d-8210-4db4-90f6-5dcd7675ff24","resolution":{"observed_at":"2026-08-01T10:17:22.950470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:17:23.098536Z","title":"CosyV oice 3: Towards in-the-wild speech generation via scaling-up and post-training, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27011","last_updated":"2026-07-30T08:12:52Z","snapshot_observed_at":"2026-08-04T22:37:07.722518Z","submitted_at":"2026-07-29T15:06:58Z","title":"Qwen-Audio-3.0-Gen-Preview Technical Report","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T10:17:23.098536Z"},"links":{"citing_paper":"/paper/2607.27011"},"observation_digest":"sha256:b960496834174e65e11165456276c0096af4e3416933cb699243473b38275f4f","observation_id":"559b2844-9070-4cf3-82fe-d2fb17e524fa","resolution":{"observed_at":"2026-08-01T10:17:23.098536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.07397","last_updated":"2026-06-05T15:38:08Z","snapshot_observed_at":"2026-08-03T17:34:16.563583Z","submitted_at":"2026-06-05T15:38:08Z","title":"Audio-Oscar: A Multi-Agent System for Complex Audio Scene Generation, Orchestration, and Refinement","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.07397","snapshot_observed_at":"2026-08-01T10:17:23.216775Z","title":"Audio-Oscar: A multi-agent system for complex audio scene generation, orchestration, and refinement.arXiv preprint arXiv:2606.07397, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.27011","last_updated":"2026-07-30T08:12:52Z","snapshot_observed_at":"2026-08-04T22:37:07.722518Z","submitted_at":"2026-07-29T15:06:58Z","title":"Qwen-Audio-3.0-Gen-Preview Technical Report","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T10:17:23.216775Z"},"links":{"cited_paper":"/paper/2606.07397","citing_paper":"/paper/2607.27011"},"observation_digest":"sha256:ad8626dcec823b4462b890fca07e37972ddc35afc929140c0d347f09a5e68213","observation_id":"50fc7bfc-07bd-404b-898d-d6bcd9e6194d","resolution":{"observed_at":"2026-08-01T10:17:23.216775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:17:23.360198Z","title":"Stable Audio Open","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27011","last_updated":"2026-07-30T08:12:52Z","snapshot_observed_at":"2026-08-04T22:37:07.722518Z","submitted_at":"2026-07-29T15:06:58Z","title":"Qwen-Audio-3.0-Gen-Preview Technical Report","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T10:17:23.360198Z"},"links":{"citing_paper":"/paper/2607.27011"},"observation_digest":"sha256:7b4788228a09d7185cfb97a9d5bd20af250a31ee7b0de7feb5d6e34ed4bbca91","observation_id":"1c1ea40e-2747-4209-8c63-a91e2855608e","resolution":{"observed_at":"2026-08-01T10:17:23.360198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:17:23.511168Z","title":"Text-to-audio generation using instruction guided latent diffusion model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.27011","last_updated":"2026-07-30T08:12:52Z","snapshot_observed_at":"2026-08-04T22:37:07.722518Z","submitted_at":"2026-07-29T15:06:58Z","title":"Qwen-Audio-3.0-Gen-Preview Technical Report","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T10:17:23.511168Z"},"links":{"citing_paper":"/paper/2607.27011"},"observation_digest":"sha256:81d4796fe6d2aed0e1490207041524ce38a2d81542177ab401cc8613eabecfc2","observation_id":"908822d6-a2d9-471f-a6be-2704ccb034da","resolution":{"observed_at":"2026-08-01T10:17:23.511168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:17:23.634596Z","title":"Qwen3-TTS technical report, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.27011","last_updated":"2026-07-30T08:12:52Z","snapshot_observed_at":"2026-08-04T22:37:07.722518Z","submitted_at":"2026-07-29T15:06:58Z","title":"Qwen-Audio-3.0-Gen-Preview Technical Report","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T10:17:23.634596Z"},"links":{"citing_paper":"/paper/2607.27011"},"observation_digest":"sha256:21d01bc5c5fba4bc703e92d94122b03a8b3f5dfc36efddf65934f444ca261f7c","observation_id":"649f3337-45fc-4fbd-ab70-b4c5d393151a","resolution":{"observed_at":"2026-08-01T10:17:23.634596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18474","last_updated":"2023-05-29T10:41:28Z","snapshot_observed_at":"2026-07-06T15:34:59.457879Z","submitted_at":"2023-05-29T10:41:28Z","title":"Make-An-Audio 2: Temporal-Enhanced Text-to-Audio Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18474","snapshot_observed_at":"2026-08-01T10:17:23.739972Z","title":"Make-An-Audio 2: Temporal-enhanced text-to-audio generation.arXiv preprint arXiv:2305.18474, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.27011","last_updated":"2026-07-30T08:12:52Z","snapshot_observed_at":"2026-08-04T22:37:07.722518Z","submitted_at":"2026-07-29T15:06:58Z","title":"Qwen-Audio-3.0-Gen-Preview Technical Report","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T10:17:23.739972Z"},"links":{"cited_paper":"/paper/2305.18474","citing_paper":"/paper/2607.27011"},"observation_digest":"sha256:1a0fdab1071ece13708555e12d8adb4f5f73b99b59d28121aec1485bfa001f03","observation_id":"1a877c28-b456-4422-b7ef-20c3774796b9","resolution":{"observed_at":"2026-08-01T10:17:23.739972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:17:23.861861Z","title":"Algorithms to measure audio programme loudness and true-peak audio level","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.27011","last_updated":"2026-07-30T08:12:52Z","snapshot_observed_at":"2026-08-04T22:37:07.722518Z","submitted_at":"2026-07-29T15:06:58Z","title":"Qwen-Audio-3.0-Gen-Preview Technical Report","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T10:17:23.861861Z"},"links":{"citing_paper":"/paper/2607.27011"},"observation_digest":"sha256:f02cce94f94148426ec343ac082d8ba0419eead5f55c4b4b17ec7fdc3714b536","observation_id":"918f5643-c159-4f51-b0f6-a4920efb92eb","resolution":{"observed_at":"2026-08-01T10:17:23.861861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:17:23.997580Z","title":"ControlAudio: Tackling text-guided, timing-indicated and intelligible audio generation via progressive diffusion modeling","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.27011","last_updated":"2026-07-30T08:12:52Z","snapshot_observed_at":"2026-08-04T22:37:07.722518Z","submitted_at":"2026-07-29T15:06:58Z","title":"Qwen-Audio-3.0-Gen-Preview Technical Report","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T10:17:23.997580Z"},"links":{"citing_paper":"/paper/2607.27011"},"observation_digest":"sha256:a35a3166cb2095057ce85e76e090517acf2a1c0d08146ee06893c30c4ce8bf9c","observation_id":"bdb5a1c3-91e5-40f3-8571-8b9c2973ab33","resolution":{"observed_at":"2026-08-01T10:17:23.997580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:17:24.117926Z","title":"AudioCaps: Generating captions for audios in the wild","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.27011","last_updated":"2026-07-30T08:12:52Z","snapshot_observed_at":"2026-08-04T22:37:07.722518Z","submitted_at":"2026-07-29T15:06:58Z","title":"Qwen-Audio-3.0-Gen-Preview Technical Report","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T10:17:24.117926Z"},"links":{"citing_paper":"/paper/2607.27011"},"observation_digest":"sha256:66144b356984be2a0aaa7d418a299f063c47088bc1baddfac6a9044bc8f727a5","observation_id":"34b7adc2-dbc5-4ef7-a62a-0117b0267918","resolution":{"observed_at":"2026-08-01T10:17:24.117926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:17:24.267366Z","title":"High-fidelity audio compression with improved RVQGAN.Advances in Neural Information Processing Systems, 36:27980–27993, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.27011","last_updated":"2026-07-30T08:12:52Z","snapshot_observed_at":"2026-08-04T22:37:07.722518Z","submitted_at":"2026-07-29T15:06:58Z","title":"Qwen-Audio-3.0-Gen-Preview Technical Report","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T10:17:24.267366Z"},"links":{"citing_paper":"/paper/2607.27011"},"observation_digest":"sha256:61a272a734dbf8bab3fb01e0a8860d2e7858c59504944eb2130e00bf32021c82","observation_id":"a98c2186-ab36-4733-9c07-05177109401a","resolution":{"observed_at":"2026-08-01T10:17:24.267366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:17:24.385005Z","title":"V oicebox: Text-guided multilingual universal speech generation at scale.Advances in Neural Information Processing Systems, 36:14005–14034, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.27011","last_updated":"2026-07-30T08:12:52Z","snapshot_observed_at":"2026-08-04T22:37:07.722518Z","submitted_at":"2026-07-29T15:06:58Z","title":"Qwen-Audio-3.0-Gen-Preview Technical Report","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T10:17:24.385005Z"},"links":{"citing_paper":"/paper/2607.27011"},"observation_digest":"sha256:722fa724fad5d0c9f9b52a1184321c2d5132a023645f7c2a0bd9723b36ba6f42","observation_id":"3f8d524d-a15b-4cfa-91e0-554c26c1d62f","resolution":{"observed_at":"2026-08-01T10:17:24.385005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.29948","last_updated":"2026-06-01T07:03:07Z","snapshot_observed_at":"2026-07-06T23:39:20.085961Z","submitted_at":"2026-05-28T13:55:19Z","title":"HoliTok:A Coutinuous Holistic Tokenization with Robust Dual Capabilities of Speech Generation and Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.29948","snapshot_observed_at":"2026-08-01T10:17:24.439149Z","title":"HoliTok: A coutinuous holistic tokenization with robust dual capabilities of speech generation and understanding.arXiv preprint arXiv:2605.29948, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.27011","last_updated":"2026-07-30T08:12:52Z","snapshot_observed_at":"2026-08-04T22:37:07.722518Z","submitted_at":"2026-07-29T15:06:58Z","title":"Qwen-Audio-3.0-Gen-Preview Technical Report","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T10:17:24.439149Z"},"links":{"cited_paper":"/paper/2605.29948","citing_paper":"/paper/2607.27011"},"observation_digest":"sha256:c15aea6620324b0f64565de4d5e8d2f433078ced36bbf748b19995faa0ea9921","observation_id":"a4772290-af44-48b9-9494-a3e1ee86784b","resolution":{"observed_at":"2026-08-01T10:17:24.439149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.31530","last_updated":"2026-06-02T14:24:03Z","snapshot_observed_at":"2026-08-04T13:05:35.009507Z","submitted_at":"2026-05-29T16:43:07Z","title":"UNISON: A Unified Sound Generation and Editing Framework via Deep LLM Fusion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.31530","snapshot_observed_at":"2026-08-01T10:17:24.502786Z","title":"UNISON: A unified sound generation and editing framework via deep LLM fusion.arXiv preprint arXiv:2605.31530, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.27011","last_updated":"2026-07-30T08:12:52Z","snapshot_observed_at":"2026-08-04T22:37:07.722518Z","submitted_at":"2026-07-29T15:06:58Z","title":"Qwen-Audio-3.0-Gen-Preview Technical Report","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T10:17:24.502786Z"},"links":{"cited_paper":"/paper/2605.31530","citing_paper":"/paper/2607.27011"},"observation_digest":"sha256:4858d4b350b686ae69f109847c2c9c80823d275568447773fa3014ca86ac98a5","observation_id":"32c33759-9f18-43eb-a923-fa8c07c07fac","resolution":{"observed_at":"2026-08-01T10:17:24.502786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:17:24.551894Z","title":"AudioLDM: text-to-audio generation with latent diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.27011","last_updated":"2026-07-30T08:12:52Z","snapshot_observed_at":"2026-08-04T22:37:07.722518Z","submitted_at":"2026-07-29T15:06:58Z","title":"Qwen-Audio-3.0-Gen-Preview Technical Report","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T10:17:24.551894Z"},"links":{"citing_paper":"/paper/2607.27011"},"observation_digest":"sha256:a5c70554711d3586bdc211685f6cc59124f7b51f99898497d14102b876f43fc8","observation_id":"488ddc19-8962-4c2c-b4a3-f2cd8294aef1","resolution":{"observed_at":"2026-08-01T10:17:24.551894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:17:24.609517Z","title":"AudioLDM 2: Learning holistic audio generation with self- supervised pretraining.IEEE/ACM Transactions on Audio, Speech, and Language Processing, 32:2871– 2883, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.27011","last_updated":"2026-07-30T08:12:52Z","snapshot_observed_at":"2026-08-04T22:37:07.722518Z","submitted_at":"2026-07-29T15:06:58Z","title":"Qwen-Audio-3.0-Gen-Preview Technical Report","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T10:17:24.609517Z"},"links":{"citing_paper":"/paper/2607.27011"},"observation_digest":"sha256:64ab287041b9fc26e603fe66fb50cf07918a84768e6911dddc388af66159359a","observation_id":"a1ea7b7a-1e63-4a91-98e6-913236c357c4","resolution":{"observed_at":"2026-08-01T10:17:24.609517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:17:24.675398Z","title":"WavJourney: Compositional audio creation with large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27011","last_updated":"2026-07-30T08:12:52Z","snapshot_observed_at":"2026-08-04T22:37:07.722518Z","submitted_at":"2026-07-29T15:06:58Z","title":"Qwen-Audio-3.0-Gen-Preview Technical Report","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T10:17:24.675398Z"},"links":{"citing_paper":"/paper/2607.27011"},"observation_digest":"sha256:a9d1460eda185e01ad61bc8e61bb17481cc820e1dd26ea4da78295e842a6a60b","observation_id":"6b0f1623-307a-4354-aa3f-18bfb283f993","resolution":{"observed_at":"2026-08-01T10:17:24.675398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:17:24.734732Z","title":"UniMoE-Audio: Unified speech and music generation with dynamic-capacity MoE, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27011","last_updated":"2026-07-30T08:12:52Z","snapshot_observed_at":"2026-08-04T22:37:07.722518Z","submitted_at":"2026-07-29T15:06:58Z","title":"Qwen-Audio-3.0-Gen-Preview Technical Report","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T10:17:24.734732Z"},"links":{"citing_paper":"/paper/2607.27011"},"observation_digest":"sha256:8bdfab15a37d291b5ae41f2ef7c789b53a20b314034297c828e2c1874c88957b","observation_id":"3f108f7c-28a8-4cab-90af-39bd440f6e69","resolution":{"observed_at":"2026-08-01T10:17:24.734732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10057","last_updated":"2023-11-22T21:22:11Z","snapshot_observed_at":"2026-07-06T16:48:44.861171Z","submitted_at":"2023-11-16T17:52:21Z","title":"The Song Describer Dataset: a Corpus of Audio Captions for Music-and-Language Evaluation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10057","snapshot_observed_at":"2026-08-01T10:17:24.791254Z","title":"The Song Describer Dataset: A corpus of audio captions for music-and-language evaluation.arXiv preprint arXiv:2311.10057, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.27011","last_updated":"2026-07-30T08:12:52Z","snapshot_observed_at":"2026-08-04T22:37:07.722518Z","submitted_at":"2026-07-29T15:06:58Z","title":"Qwen-Audio-3.0-Gen-Preview Technical Report","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T10:17:24.791254Z"},"links":{"cited_paper":"/paper/2311.10057","citing_paper":"/paper/2607.27011"},"observation_digest":"sha256:39132c49447eaee2e3551093a8f2fcee856e8d66d82b2f8846d7cf92563d7b77","observation_id":"6a7be74d-50e3-4437-a25c-bb32e0a5353e","resolution":{"observed_at":"2026-08-01T10:17:24.791254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.27838","last_updated":"2026-05-27T01:50:29Z","snapshot_observed_at":"2026-08-02T04:38:50.454330Z","submitted_at":"2026-05-27T01:50:29Z","title":"Dasheng AudioGen: A Unified Model for Generating Coherent Audio Scenes from Text","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.27838","snapshot_observed_at":"2026-08-01T10:17:24.849493Z","title":"Dasheng AudioGen: A unified model for generating coherent audio scenes from text.arXiv preprint arXiv:2605.27838, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.27011","last_updated":"2026-07-30T08:12:52Z","snapshot_observed_at":"2026-08-04T22:37:07.722518Z","submitted_at":"2026-07-29T15:06:58Z","title":"Qwen-Audio-3.0-Gen-Preview Technical Report","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T10:17:24.849493Z"},"links":{"cited_paper":"/paper/2605.27838","citing_paper":"/paper/2607.27011"},"observation_digest":"sha256:70093b293d26722db8a92bcf86d44a8ad5041d009af2d68075f5815165cb18aa","observation_id":"c8279863-c476-4a39-839c-9ca3c40aa482","resolution":{"observed_at":"2026-08-01T10:17:24.849493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:17:24.931937Z","title":"Semantic-V AE: Semantic-alignment latent representation for better speech synthesis.arXiv preprint arXiv:2509.22167, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27011","last_updated":"2026-07-30T08:12:52Z","snapshot_observed_at":"2026-08-04T22:37:07.722518Z","submitted_at":"2026-07-29T15:06:58Z","title":"Qwen-Audio-3.0-Gen-Preview Technical Report","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T10:17:24.931937Z"},"links":{"citing_paper":"/paper/2607.27011"},"observation_digest":"sha256:e306c7f18ec18f85b435f048370675ebaf04adb2d809a7c03a610e533c36b820","observation_id":"24688499-59ac-41fc-a9b7-904c60937d8a","resolution":{"observed_at":"2026-08-01T10:17:24.931937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:17:24.998661Z","title":"LibriSpeech: An ASR corpus based on public domain audio books","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.27011","last_updated":"2026-07-30T08:12:52Z","snapshot_observed_at":"2026-08-04T22:37:07.722518Z","submitted_at":"2026-07-29T15:06:58Z","title":"Qwen-Audio-3.0-Gen-Preview Technical Report","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T10:17:24.998661Z"},"links":{"citing_paper":"/paper/2607.27011"},"observation_digest":"sha256:83c6d546f4fb6cf866bace069d1ace568753b9265023a6bc31e6954958f6c8d6","observation_id":"4cc9cd39-4fcf-425f-97ed-979f9ad00833","resolution":{"observed_at":"2026-08-01T10:17:24.998661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.18613","last_updated":"2026-05-18T16:23:16Z","snapshot_observed_at":"2026-08-02T15:17:07.119149Z","submitted_at":"2026-05-18T16:23:16Z","title":"SAME: A Semantically-Aligned Music Autoencoder","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.18613","snapshot_observed_at":"2026-08-01T10:17:25.066467Z","title":"SAME: A semantically-aligned music autoencoder.arXiv preprint arXiv:2605.18613, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.27011","last_updated":"2026-07-30T08:12:52Z","snapshot_observed_at":"2026-08-04T22:37:07.722518Z","submitted_at":"2026-07-29T15:06:58Z","title":"Qwen-Audio-3.0-Gen-Preview Technical Report","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-01T10:17:25.066467Z"},"links":{"cited_paper":"/paper/2605.18613","citing_paper":"/paper/2607.27011"},"observation_digest":"sha256:14dc50dccfdd621c2cab6950c2606572e76c79d3518267577bed0d3d0ad5ef91","observation_id":"b4620f63-e242-4900-acfc-50dc690bca6b","resolution":{"observed_at":"2026-08-01T10:17:25.066467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:17:25.146653Z","title":"VibeV oice: Expressive podcast generation with next-token diffusion","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.27011","last_updated":"2026-07-30T08:12:52Z","snapshot_observed_at":"2026-08-04T22:37:07.722518Z","submitted_at":"2026-07-29T15:06:58Z","title":"Qwen-Audio-3.0-Gen-Preview Technical Report","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T10:17:25.146653Z"},"links":{"citing_paper":"/paper/2607.27011"},"observation_digest":"sha256:5d2c49a6e524bedded47af35b56d1681adcd8e3a6b1ce6f9d61c76e36f477452","observation_id":"f5d43403-7e90-42b5-ab88-eab86becbd06","resolution":{"observed_at":"2026-08-01T10:17:25.146653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:17:25.298092Z","title":"UniSonate: A unified model for speech, music, and sound effect generation with text instructions","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.27011","last_updated":"2026-07-30T08:12:52Z","snapshot_observed_at":"2026-08-04T22:37:07.722518Z","submitted_at":"2026-07-29T15:06:58Z","title":"Qwen-Audio-3.0-Gen-Preview Technical Report","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-01T10:17:25.298092Z"},"links":{"citing_paper":"/paper/2607.27011"},"observation_digest":"sha256:5e7fcad75a30810a0531522d1869f6c02ef92db0c3451a685fad971f0e5c9385","observation_id":"57c13025-0f5b-4f24-83d3-2905c2adf977","resolution":{"observed_at":"2026-08-01T10:17:25.298092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:17:25.386539Z","title":"Roman, Christopher Ick, Sivan Ding, Adrian S","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.27011","last_updated":"2026-07-30T08:12:52Z","snapshot_observed_at":"2026-08-04T22:37:07.722518Z","submitted_at":"2026-07-29T15:06:58Z","title":"Qwen-Audio-3.0-Gen-Preview Technical Report","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-01T10:17:25.386539Z"},"links":{"citing_paper":"/paper/2607.27011"},"observation_digest":"sha256:987b99134dc971de06aa952004e81d6d1262cd2f4a9cf8a6f63ee7ab6581c213","observation_id":"caca9060-b16f-4511-b0b1-699fe3144e56","resolution":{"observed_at":"2026-08-01T10:17:25.386539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:17:25.484261Z","title":"Scaper: A library for soundscape synthesis and augmentation","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.27011","last_updated":"2026-07-30T08:12:52Z","snapshot_observed_at":"2026-08-04T22:37:07.722518Z","submitted_at":"2026-07-29T15:06:58Z","title":"Qwen-Audio-3.0-Gen-Preview Technical Report","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-01T10:17:25.484261Z"},"links":{"citing_paper":"/paper/2607.27011"},"observation_digest":"sha256:8eeb9738c83abc6a6e248449e26ce2349fe94500b29104944fa71e851e17e2d7","observation_id":"90680f8f-0407-4dd7-864c-9e771caff121","resolution":{"observed_at":"2026-08-01T10:17:25.484261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:17:25.576399Z","title":"NaturalSpeech 2: Latent diffusion models are natural and zero-shot speech and singing synthesizers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.27011","last_updated":"2026-07-30T08:12:52Z","snapshot_observed_at":"2026-08-04T22:37:07.722518Z","submitted_at":"2026-07-29T15:06:58Z","title":"Qwen-Audio-3.0-Gen-Preview Technical Report","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-01T10:17:25.576399Z"},"links":{"citing_paper":"/paper/2607.27011"},"observation_digest":"sha256:9e7d71a13f1a0875fd28a0c8a3c3f63f3dc398c6634a3a0ab21523594090eb5e","observation_id":"7afcc044-010a-4536-965e-faab9a9064fa","resolution":{"observed_at":"2026-08-01T10:17:25.576399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.19798","last_updated":"2026-04-03T08:41:19Z","snapshot_observed_at":"2026-07-06T22:49:52.077931Z","submitted_at":"2026-03-20T09:37:54Z","title":"Borderless Long Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.19798","snapshot_observed_at":"2026-08-01T10:17:25.666173Z","title":"Borderless long speech synthesis.arXiv preprint arXiv:2603.19798, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.27011","last_updated":"2026-07-30T08:12:52Z","snapshot_observed_at":"2026-08-04T22:37:07.722518Z","submitted_at":"2026-07-29T15:06:58Z","title":"Qwen-Audio-3.0-Gen-Preview Technical Report","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-01T10:17:25.666173Z"},"links":{"cited_paper":"/paper/2603.19798","citing_paper":"/paper/2607.27011"},"observation_digest":"sha256:1f0ceae48366136678dafe75175fb6e86fe33150bfbd125cd19413ae41b554b0","observation_id":"146f7151-ba20-49ed-beed-69abb25a8011","resolution":{"observed_at":"2026-08-01T10:17:25.666173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:17:25.786509Z","title":"F5R-TTS: Improving flow-matching based text-to-speech with group relative policy optimization, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27011","last_updated":"2026-07-30T08:12:52Z","snapshot_observed_at":"2026-08-04T22:37:07.722518Z","submitted_at":"2026-07-29T15:06:58Z","title":"Qwen-Audio-3.0-Gen-Preview Technical Report","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-01T10:17:25.786509Z"},"links":{"citing_paper":"/paper/2607.27011"},"observation_digest":"sha256:e58a1a07ca461006a7a6c7343ac15d6fbb4d41e7ff18ddc3c5619361fb5ade4e","observation_id":"9c1ffba2-04b1-453a-bea8-375646529e51","resolution":{"observed_at":"2026-08-01T10:17:25.786509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.03672","last_updated":"2026-06-02T13:56:31Z","snapshot_observed_at":"2026-07-06T23:43:55.632508Z","submitted_at":"2026-06-02T13:56:31Z","title":"Foley-Omni: A Unified Multimodal Generation Model from Task-Level Audio Synthesis to Complete Video Soundtrack Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.03672","snapshot_observed_at":"2026-08-01T10:17:25.957181Z","title":"Foley-Omni: A unified multimodal generation model from task-level audio synthesis to complete video soundtrack generation.arXiv preprint arXiv:2606.03672, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.27011","last_updated":"2026-07-30T08:12:52Z","snapshot_observed_at":"2026-08-04T22:37:07.722518Z","submitted_at":"2026-07-29T15:06:58Z","title":"Qwen-Audio-3.0-Gen-Preview Technical Report","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-01T10:17:25.957181Z"},"links":{"cited_paper":"/paper/2606.03672","citing_paper":"/paper/2607.27011"},"observation_digest":"sha256:0e48d321b6af22928aef25621da38835a8ee3967ffd3d93adcfe47433e05aca0","observation_id":"00eae277-ad11-46e0-b217-7f0d97936aa7","resolution":{"observed_at":"2026-08-01T10:17:25.957181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:17:26.065757Z","title":"MiMo-Audio: Audio language models are few-shot learners, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27011","last_updated":"2026-07-30T08:12:52Z","snapshot_observed_at":"2026-08-04T22:37:07.722518Z","submitted_at":"2026-07-29T15:06:58Z","title":"Qwen-Audio-3.0-Gen-Preview Technical Report","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-01T10:17:26.065757Z"},"links":{"citing_paper":"/paper/2607.27011"},"observation_digest":"sha256:374eba477d20a3325b34df1bd95491695ee2b9dc9fc8bbed3ba8008d1f76eb1f","observation_id":"82b3aead-c6c7-4e08-a7f4-f8435bcd69bd","resolution":{"observed_at":"2026-08-01T10:17:26.065757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:17:26.153534Z","title":"Qwen3.5-Omni technical report, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.27011","last_updated":"2026-07-30T08:12:52Z","snapshot_observed_at":"2026-08-04T22:37:07.722518Z","submitted_at":"2026-07-29T15:06:58Z","title":"Qwen-Audio-3.0-Gen-Preview Technical Report","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-01T10:17:26.153534Z"},"links":{"citing_paper":"/paper/2607.27011"},"observation_digest":"sha256:360cf243bb5a66db2e8962039cd105b4a7684edfa2fe355145f5b80f40b7fbb8","observation_id":"14c4f44c-7394-4a0b-a5a2-08ea3b89ad89","resolution":{"observed_at":"2026-08-01T10:17:26.153534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.05220","last_updated":"2026-08-01T20:53:01Z","snapshot_observed_at":"2026-08-05T17:23:09.816851Z","submitted_at":"2026-02-05T02:20:07Z","title":"Bagpiper: Solving Open-Ended Audio Tasks via Rich Captions","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.05220","snapshot_observed_at":"2026-08-01T10:17:26.206244Z","title":"Bagpiper: Solving open-ended audio tasks via rich captions","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.27011","last_updated":"2026-07-30T08:12:52Z","snapshot_observed_at":"2026-08-04T22:37:07.722518Z","submitted_at":"2026-07-29T15:06:58Z","title":"Qwen-Audio-3.0-Gen-Preview Technical Report","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-01T10:17:26.206244Z"},"links":{"cited_paper":"/paper/2602.05220","citing_paper":"/paper/2607.27011"},"observation_digest":"sha256:ff1a5936ca6f7061971a370cf124b4fcbd6e8748def5527e8f960bb912f07ec5","observation_id":"3bb4c030-5a72-463c-9709-fd96937ecdca","resolution":{"observed_at":"2026-08-01T10:17:26.206244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10522","last_updated":"2026-04-15T16:32:32Z","snapshot_observed_at":"2026-07-31T02:51:01.521373Z","submitted_at":"2025-03-13T16:30:59Z","title":"AudioX: A Unified Framework for Anything-to-Audio Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10522","snapshot_observed_at":"2026-08-01T10:17:26.295186Z","title":"AudioX: Diffusion transformer for anything-to-audio generation.arXiv preprint arXiv:2503.10522, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27011","last_updated":"2026-07-30T08:12:52Z","snapshot_observed_at":"2026-08-04T22:37:07.722518Z","submitted_at":"2026-07-29T15:06:58Z","title":"Qwen-Audio-3.0-Gen-Preview Technical Report","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-01T10:17:26.295186Z"},"links":{"cited_paper":"/paper/2503.10522","citing_paper":"/paper/2607.27011"},"observation_digest":"sha256:26bf29ae614be4a7d4ec12ebc3b5c71e81adb620aeda747f2010f2bf535e28bd","observation_id":"db043c97-9178-46f6-a245-c9813ea56194","resolution":{"observed_at":"2026-08-01T10:17:26.295186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:17:26.367282Z","title":"Audio-Omni: Extending multi-modal understanding to versatile audio generation and editing","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.27011","last_updated":"2026-07-30T08:12:52Z","snapshot_observed_at":"2026-08-04T22:37:07.722518Z","submitted_at":"2026-07-29T15:06:58Z","title":"Qwen-Audio-3.0-Gen-Preview Technical Report","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-01T10:17:26.367282Z"},"links":{"citing_paper":"/paper/2607.27011"},"observation_digest":"sha256:7b2bf7a470dc1ab4b95cf7c16726524a3b15b30985b6046fb7b1766a94d8ae06","observation_id":"dab84040-62d1-44e9-8333-e1d56672a6fc","resolution":{"observed_at":"2026-08-01T10:17:26.367282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05139","last_updated":"2025-02-07T18:15:57Z","snapshot_observed_at":"2026-07-06T20:33:01.960703Z","submitted_at":"2025-02-07T18:15:57Z","title":"Meta Audiobox Aesthetics: Unified Automatic Quality Assessment for Speech, Music, and Sound","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05139","snapshot_observed_at":"2026-08-01T10:17:26.447751Z","title":"Meta Au- diobox Aesthetics: Unified automatic quality assessment for speech, music, and sound.arXiv preprint arXiv:2502.05139, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27011","last_updated":"2026-07-30T08:12:52Z","snapshot_observed_at":"2026-08-04T22:37:07.722518Z","submitted_at":"2026-07-29T15:06:58Z","title":"Qwen-Audio-3.0-Gen-Preview Technical Report","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-01T10:17:26.447751Z"},"links":{"cited_paper":"/paper/2502.05139","citing_paper":"/paper/2607.27011"},"observation_digest":"sha256:699cbcb54ae129764fc92093c221bb5d728c9c0cd0dec5df8b0d073ceb032f56","observation_id":"83543aec-9eb5-4cb2-b2da-c1a0b0cffac5","resolution":{"observed_at":"2026-08-01T10:17:26.447751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:17:26.508324Z","title":"Sound event detection in domestic environments with weakly labeled data and soundscape synthesis","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.27011","last_updated":"2026-07-30T08:12:52Z","snapshot_observed_at":"2026-08-04T22:37:07.722518Z","submitted_at":"2026-07-29T15:06:58Z","title":"Qwen-Audio-3.0-Gen-Preview Technical Report","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-01T10:17:26.508324Z"},"links":{"citing_paper":"/paper/2607.27011"},"observation_digest":"sha256:498fc43c50b88e916304e38f7c0218099f2a9c745c9668ad8f44f1c0c714fd63","observation_id":"d9acd1e7-5f6d-46d4-8603-af9b1d27b2c7","resolution":{"observed_at":"2026-08-01T10:17:26.508324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-05T03:40:24.447729Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-01T10:17:26.573299Z","title":"Audiobox: Unified audio generation with natural language prompts.arXiv preprint arXiv:2312.15821, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.27011","last_updated":"2026-07-30T08:12:52Z","snapshot_observed_at":"2026-08-04T22:37:07.722518Z","submitted_at":"2026-07-29T15:06:58Z","title":"Qwen-Audio-3.0-Gen-Preview Technical Report","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-01T10:17:26.573299Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2607.27011"},"observation_digest":"sha256:1496f461a9679a92da26fc788b08a10b3ad5eeac9aa3852a5ce36f0a219441a3","observation_id":"e525aefd-e97b-4c32-93ce-dc1f3fa08ff8","resolution":{"observed_at":"2026-08-01T10:17:26.573299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:17:26.635563Z","title":"Back to ear: Perceptually driven high fidelity music reconstruction.arXiv preprint arXiv:2509.14912, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27011","last_updated":"2026-07-30T08:12:52Z","snapshot_observed_at":"2026-08-04T22:37:07.722518Z","submitted_at":"2026-07-29T15:06:58Z","title":"Qwen-Audio-3.0-Gen-Preview Technical Report","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-01T10:17:26.635563Z"},"links":{"citing_paper":"/paper/2607.27011"},"observation_digest":"sha256:2d71dc8841466236c6cbb86795cfcf843c4d040e83833e8dae469daf81016516","observation_id":"57127be6-4a80-4ffd-ae61-3d18154f0bf6","resolution":{"observed_at":"2026-08-01T10:17:26.635563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:17:26.689047Z","title":"MaskGCT: Zero-shot text-to-speech with masked generative codec transformer","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27011","last_updated":"2026-07-30T08:12:52Z","snapshot_observed_at":"2026-08-04T22:37:07.722518Z","submitted_at":"2026-07-29T15:06:58Z","title":"Qwen-Audio-3.0-Gen-Preview Technical Report","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-01T10:17:26.689047Z"},"links":{"citing_paper":"/paper/2607.27011"},"observation_digest":"sha256:6b2c47d87ec14a7644e825bb05f9fd783fd50c7826a813e14f6c097ff2924268","observation_id":"b4aa9d1d-9861-4cef-8e4b-0548686ec53b","resolution":{"observed_at":"2026-08-01T10:17:26.689047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:17:26.747262Z","title":"T2A-Feedback: Improving basic capabilities of text-to-audio generation via fine-grained AI feedback","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27011","last_updated":"2026-07-30T08:12:52Z","snapshot_observed_at":"2026-08-04T22:37:07.722518Z","submitted_at":"2026-07-29T15:06:58Z","title":"Qwen-Audio-3.0-Gen-Preview Technical Report","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-01T10:17:26.747262Z"},"links":{"citing_paper":"/paper/2607.27011"},"observation_digest":"sha256:a990e3288150685c5cf6c83747caf77c34b6b18f8ab5abc4fd8fb551d94f7679","observation_id":"6d2d7cd0-36d1-444d-8359-b5c767d84b25","resolution":{"observed_at":"2026-08-01T10:17:26.747262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09871","last_updated":"2024-06-13T13:36:28Z","snapshot_observed_at":"2026-07-06T17:30:34.153488Z","submitted_at":"2024-02-15T10:55:01Z","title":"MuChin: A Chinese Colloquial Description Benchmark for Evaluating Language Models in the Field of Music","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09871","snapshot_observed_at":"2026-08-01T10:17:26.795638Z","title":"MuChin: A Chinese colloquial description benchmark for evaluating language models in the field of music.arXiv preprint arXiv:2402.09871, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.27011","last_updated":"2026-07-30T08:12:52Z","snapshot_observed_at":"2026-08-04T22:37:07.722518Z","submitted_at":"2026-07-29T15:06:58Z","title":"Qwen-Audio-3.0-Gen-Preview Technical Report","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-01T10:17:26.795638Z"},"links":{"cited_paper":"/paper/2402.09871","citing_paper":"/paper/2607.27011"},"observation_digest":"sha256:de454317a516bad95d3fa08e3b17bd6e64314841edf14ea32119b387ee644659","observation_id":"156f046e-0a83-4824-98dc-6cd6e8161118","resolution":{"observed_at":"2026-08-01T10:17:26.795638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:17:26.850478Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.27011","last_updated":"2026-07-30T08:12:52Z","snapshot_observed_at":"2026-08-04T22:37:07.722518Z","submitted_at":"2026-07-29T15:06:58Z","title":"Qwen-Audio-3.0-Gen-Preview Technical Report","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-01T10:17:26.850478Z"},"links":{"citing_paper":"/paper/2607.27011"},"observation_digest":"sha256:4c4c6366e28183c665c8bf99b761e3a3fedba36a432555680b92dbb240912d67","observation_id":"a88406e0-3ec9-4202-89df-41240fc1d1d4","resolution":{"observed_at":"2026-08-01T10:17:26.850478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:17:26.905195Z","title":"Step-Audio 2 technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27011","last_updated":"2026-07-30T08:12:52Z","snapshot_observed_at":"2026-08-04T22:37:07.722518Z","submitted_at":"2026-07-29T15:06:58Z","title":"Qwen-Audio-3.0-Gen-Preview Technical Report","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-01T10:17:26.905195Z"},"links":{"citing_paper":"/paper/2607.27011"},"observation_digest":"sha256:78ba1e5e7c8e3ac41b52d792728e4e517cf3bb7d15eb05efc2436c4517a976e1","observation_id":"81d56944-f84f-4556-9aa3-f5b66fb74e28","resolution":{"observed_at":"2026-08-01T10:17:26.905195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.25937","last_updated":"2026-04-16T04:26:34Z","snapshot_observed_at":"2026-08-04T04:34:28.014298Z","submitted_at":"2026-04-16T04:26:34Z","title":"SongBench: A Fine-Grained Multi-Aspect Benchmark for Song Quality Assessment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.25937","snapshot_observed_at":"2026-08-01T10:17:27.033181Z","title":"SongBench: A fine-grained multi-aspect benchmark for song quality assessment.arXiv preprint arXiv:2604.25937, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.27011","last_updated":"2026-07-30T08:12:52Z","snapshot_observed_at":"2026-08-04T22:37:07.722518Z","submitted_at":"2026-07-29T15:06:58Z","title":"Qwen-Audio-3.0-Gen-Preview Technical Report","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-01T10:17:27.033181Z"},"links":{"cited_paper":"/paper/2604.25937","citing_paper":"/paper/2607.27011"},"observation_digest":"sha256:cd9abedd1a30a059b8c6cc58f45c12795697587bba7a02a5188bd8216393ddfd","observation_id":"f557683b-bebe-4083-b6fb-c666f8b4ff7a","resolution":{"observed_at":"2026-08-01T10:17:27.033181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:17:27.092382Z","title":"Qwen-Audio-3.0-TTS: Freely controllable and highly robust speech synthesis with multi-stage training paradigm, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.27011","last_updated":"2026-07-30T08:12:52Z","snapshot_observed_at":"2026-08-04T22:37:07.722518Z","submitted_at":"2026-07-29T15:06:58Z","title":"Qwen-Audio-3.0-Gen-Preview Technical Report","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-01T10:17:27.092382Z"},"links":{"citing_paper":"/paper/2607.27011"},"observation_digest":"sha256:fea441eeae8c27b6403b4c0638eca020bae94fcf4959e2791d60dc6a4f818552","observation_id":"19dcdb3e-a643-47f2-8b55-8b436ea9c748","resolution":{"observed_at":"2026-08-01T10:17:27.092382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:17:27.150116Z","title":"FireRedTTS-2: Towards long conversational speech generation for podcast and chatbot, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27011","last_updated":"2026-07-30T08:12:52Z","snapshot_observed_at":"2026-08-04T22:37:07.722518Z","submitted_at":"2026-07-29T15:06:58Z","title":"Qwen-Audio-3.0-Gen-Preview Technical Report","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-01T10:17:27.150116Z"},"links":{"citing_paper":"/paper/2607.27011"},"observation_digest":"sha256:4939e723c580d5cfe84fbe03ef847960be9de1f7c8be5a7a410afa721a976b07","observation_id":"d40af82c-65ae-410f-98f7-8c43a16c6f99","resolution":{"observed_at":"2026-08-01T10:17:27.150116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:17:27.211924Z","title":"AudioTime: A temporally-aligned audio-text benchmark dataset","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27011","last_updated":"2026-07-30T08:12:52Z","snapshot_observed_at":"2026-08-04T22:37:07.722518Z","submitted_at":"2026-07-29T15:06:58Z","title":"Qwen-Audio-3.0-Gen-Preview Technical Report","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-01T10:17:27.211924Z"},"links":{"citing_paper":"/paper/2607.27011"},"observation_digest":"sha256:48a4379793bca616ea30ff896dc52d29271c6abc14c5ea8112ab6be01f2e0bc5","observation_id":"91888c30-2bf3-4f61-a36e-f577327a5173","resolution":{"observed_at":"2026-08-01T10:17:27.211924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:17:27.263551Z","title":"PicoAudio: Enabling precise temporal control- lability in text-to-audio generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27011","last_updated":"2026-07-30T08:12:52Z","snapshot_observed_at":"2026-08-04T22:37:07.722518Z","submitted_at":"2026-07-29T15:06:58Z","title":"Qwen-Audio-3.0-Gen-Preview Technical Report","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-01T10:17:27.263551Z"},"links":{"citing_paper":"/paper/2607.27011"},"observation_digest":"sha256:9cb78a0a95a5cef6f5b6d4dbb52a7e1fa0522d7b09f9a42d1b98f8428cc472c7","observation_id":"90be1984-ca7f-4df1-b88e-721d526812dd","resolution":{"observed_at":"2026-08-01T10:17:27.263551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:17:27.339629Z","title":"LongCat-AudioDiT: High-fidelity diffusion text-to-speech in the waveform latent space, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.27011","last_updated":"2026-07-30T08:12:52Z","snapshot_observed_at":"2026-08-04T22:37:07.722518Z","submitted_at":"2026-07-29T15:06:58Z","title":"Qwen-Audio-3.0-Gen-Preview Technical Report","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-01T10:17:27.339629Z"},"links":{"citing_paper":"/paper/2607.27011"},"observation_digest":"sha256:bc33282a0a384b201aaaf0320c2e1eb59aeb7c18906e27c1eb21c9bf5cc14c5e","observation_id":"cfb54e2d-7cf5-499e-80e2-7baa3ac3bbaf","resolution":{"observed_at":"2026-08-01T10:17:27.339629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:17:27.419812Z","title":"Qwen3-Omni technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27011","last_updated":"2026-07-30T08:12:52Z","snapshot_observed_at":"2026-08-04T22:37:07.722518Z","submitted_at":"2026-07-29T15:06:58Z","title":"Qwen-Audio-3.0-Gen-Preview Technical Report","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-01T10:17:27.419812Z"},"links":{"citing_paper":"/paper/2607.27011"},"observation_digest":"sha256:71be10d2652046def4355d703aa774f10ad9826ec074fd9839f9cfc22e4e3e67","observation_id":"eeaf2ec1-ef1f-4ba1-acc8-c26b5e89467c","resolution":{"observed_at":"2026-08-01T10:17:27.419812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:17:27.473442Z","title":"UniFlow-Audio: Unified flow matching for audio generation from omni-modalities","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27011","last_updated":"2026-07-30T08:12:52Z","snapshot_observed_at":"2026-08-04T22:37:07.722518Z","submitted_at":"2026-07-29T15:06:58Z","title":"Qwen-Audio-3.0-Gen-Preview Technical Report","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-01T10:17:27.473442Z"},"links":{"citing_paper":"/paper/2607.27011"},"observation_digest":"sha256:3bcc43c5c263c04ed69117af6363e4fbede485086f266149083661ec7e5979bc","observation_id":"63553ad5-8f05-41ed-8c4a-1a99eb56d355","resolution":{"observed_at":"2026-08-01T10:17:27.473442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:17:27.562348Z","title":"Ming-UniAudio: Speech LLM for joint understanding, generation and editing with unified representation, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27011","last_updated":"2026-07-30T08:12:52Z","snapshot_observed_at":"2026-08-04T22:37:07.722518Z","submitted_at":"2026-07-29T15:06:58Z","title":"Qwen-Audio-3.0-Gen-Preview Technical Report","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-01T10:17:27.562348Z"},"links":{"citing_paper":"/paper/2607.27011"},"observation_digest":"sha256:b60f69efd5e5d8a07d34eeca40264f1fe20be95292b77eec38f8166672b745e9","observation_id":"4808a534-3806-41fc-9a0f-1c071d4f21f2","resolution":{"observed_at":"2026-08-01T10:17:27.562348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","snapshot_observed_at":"2026-07-06T16:26:09.878745Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00704","snapshot_observed_at":"2026-08-01T10:17:27.671246Z","title":"UniAudio: An audio foundation model toward universal audio generation.arXiv preprint arXiv:2310.00704, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.27011","last_updated":"2026-07-30T08:12:52Z","snapshot_observed_at":"2026-08-04T22:37:07.722518Z","submitted_at":"2026-07-29T15:06:58Z","title":"Qwen-Audio-3.0-Gen-Preview Technical Report","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-01T10:17:27.671246Z"},"links":{"cited_paper":"/paper/2310.00704","citing_paper":"/paper/2607.27011"},"observation_digest":"sha256:f32be0ca8f1316b029c162004751ca9c9b67430efca654478b8d5809e04207ff","observation_id":"e8563ad7-2fc0-47f6-abc6-efa67a33c4ee","resolution":{"observed_at":"2026-08-01T10:17:27.671246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:17:27.833311Z","title":"MiniMax-Speech: Intrinsic zero-shot text-to-speech with a learnable speaker encoder, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27011","last_updated":"2026-07-30T08:12:52Z","snapshot_observed_at":"2026-08-04T22:37:07.722518Z","submitted_at":"2026-07-29T15:06:58Z","title":"Qwen-Audio-3.0-Gen-Preview Technical Report","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-01T10:17:27.833311Z"},"links":{"citing_paper":"/paper/2607.27011"},"observation_digest":"sha256:de3dc8f3a9343ec194ad6851c22607e49970b64d0303ec0b6e5c6c8508cf5825","observation_id":"f655ec0b-3cab-4f0b-bab2-4d273d4b5237","resolution":{"observed_at":"2026-08-01T10:17:27.833311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.27840","last_updated":"2026-05-27T01:56:45Z","snapshot_observed_at":"2026-08-04T06:27:21.447155Z","submitted_at":"2026-05-27T01:56:45Z","title":"LoSATok: Low-dimensional Semantic-Acoustic Tokenizer for Cross-Domain Audio Understanding and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.27840","snapshot_observed_at":"2026-08-01T10:17:27.945454Z","title":"LoSATok: Low- dimensional semantic-acoustic tokenizer for cross-domain audio understanding and generation.arXiv preprint arXiv:2605.27840, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.27011","last_updated":"2026-07-30T08:12:52Z","snapshot_observed_at":"2026-08-04T22:37:07.722518Z","submitted_at":"2026-07-29T15:06:58Z","title":"Qwen-Audio-3.0-Gen-Preview Technical Report","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-01T10:17:27.945454Z"},"links":{"cited_paper":"/paper/2605.27840","citing_paper":"/paper/2607.27011"},"observation_digest":"sha256:f37c5d2f59ad9f529eb728967877fbffad04379e422c0f6dc45acd652f3206d7","observation_id":"15f6d30a-dbdd-4e62-a223-a7b9b07521af","resolution":{"observed_at":"2026-08-01T10:17:27.945454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:17:28.105753Z","title":"PicoAudio2: Temporal controllable text-to-audio generation with natural language description","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.27011","last_updated":"2026-07-30T08:12:52Z","snapshot_observed_at":"2026-08-04T22:37:07.722518Z","submitted_at":"2026-07-29T15:06:58Z","title":"Qwen-Audio-3.0-Gen-Preview Technical Report","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-01T10:17:28.105753Z"},"links":{"citing_paper":"/paper/2607.27011"},"observation_digest":"sha256:f3fe2dc39ea8130e2a2d654f3a47c55a2024b9bcdf103596b8c80e477ae9fe80","observation_id":"456441f0-d541-4f23-9631-989e123b8ba4","resolution":{"observed_at":"2026-08-01T10:17:28.105753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:17:28.260156Z","title":"V oxCPM2 technical report, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.27011","last_updated":"2026-07-30T08:12:52Z","snapshot_observed_at":"2026-08-04T22:37:07.722518Z","submitted_at":"2026-07-29T15:06:58Z","title":"Qwen-Audio-3.0-Gen-Preview Technical Report","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-01T10:17:28.260156Z"},"links":{"citing_paper":"/paper/2607.27011"},"observation_digest":"sha256:cb22ae124f7bd89b9ad4fcc5e51534b8db20c9d3c7a0c2d3e3d2a64fa9385143","observation_id":"ffaa0108-ed1c-425b-b5f6-2c178d8c08d4","resolution":{"observed_at":"2026-08-01T10:17:28.260156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:17:24.203243Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27011","last_updated":"2026-07-30T08:12:52Z","snapshot_observed_at":"2026-08-04T22:37:07.722518Z","submitted_at":"2026-07-29T15:06:58Z","title":"Qwen-Audio-3.0-Gen-Preview Technical Report","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-01T10:17:24.203243Z"},"links":{"citing_paper":"/paper/2607.27011"},"observation_digest":"sha256:db8356484a3f73fea49843f4cd46b827e49011c5b58355aa4e870b4bd457d4cc","observation_id":"4b4c814f-5bfb-4d8d-85b7-90e2353d9b59","resolution":{"observed_at":"2026-08-01T10:17:24.203243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.27011","last_updated":"2026-07-30T08:12:52Z","latest_version":2,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-04T22:37:07.722518Z","submitted_at":"2026-07-29T15:06:58Z","title":"Qwen-Audio-3.0-Gen-Preview Technical Report"},"reference_resolution":{"displayed":66,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":66,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":66},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 66 of 66 outbound references and 0 inbound Pith citation observations for arXiv:2607.27011."}