{"as_of":"2026-08-06T21:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8781fc5478c33615dd4af24e693d293233781923984832a9a19bc773cc915b32","coverage":[{"denominator":81,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":81,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-18T18:26:51.583145Z","state":"measured"},{"denominator":81,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":81,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2509.06027/citation-record","integrity":"/paper/2509.06027/integrity","json":"/paper/2509.06027/citation-record.json","paper":"/paper/2509.06027"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.04226","last_updated":"2023-03-07T20:36:13Z","snapshot_observed_at":"2026-07-06T14:59:53.901528Z","submitted_at":"2023-03-07T20:36:13Z","title":"A Comprehensive Survey of AI-Generated Content (AIGC): A History of Generative AI from GAN to ChatGPT","version":1},"cited_work":{"arxiv_id":"2303.04226","doi":"10.48550/arxiv.2303.04226","metadata_source":"arxiv_reference","pith_arxiv_id":"2303.04226","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A comprehensive survey of ai-generated content (aigc): A history of generative ai from gan to chatgpt","venue":"arXiv (Cornell University)","work_id":"7eda166a-6bc6-48c3-be6c-f302e8014f50","year":2023},"citing_paper":{"arxiv_id":"2509.06027","last_updated":"2026-04-27T10:03:51Z","snapshot_observed_at":"2026-07-06T22:25:11.957177Z","submitted_at":"2025-09-07T12:06:21Z","title":"DreamAudio: Customized Text-to-Audio Generation with Diffusion Models","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-18T18:26:51.583145Z"},"links":{"cited_paper":"/paper/2303.04226","citing_paper":"/paper/2509.06027"},"observation_digest":"sha256:09f1a3767084e421c029f5a458ae3369973b1b0870d884d9ad60657d3020a223","observation_id":"7642b494-c035-44cc-ac4a-b05c2e9aefa6","resolution":{"observed_at":"2026-05-18T18:31:44.735534Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"AudioLDM: Text-to-Audio generation with latent diffusion models","venue":null,"work_id":"729085c7-9567-4f03-9db9-97944e7a5c0c","year":2023},"citing_paper":{"arxiv_id":"2509.06027","last_updated":"2026-04-27T10:03:51Z","snapshot_observed_at":"2026-07-06T22:25:11.957177Z","submitted_at":"2025-09-07T12:06:21Z","title":"DreamAudio: Customized Text-to-Audio Generation with Diffusion Models","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-18T18:26:51.583145Z"},"links":{"citing_paper":"/paper/2509.06027"},"observation_digest":"sha256:1eeb14042a6048b966f74b4c1c23bb3731b4096d48bdb4fb22e545cf22864b83","observation_id":"0773b260-04c7-47f6-aa98-4d3df8433028","resolution":{"observed_at":"2026-05-18T18:32:48.255407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sound to visual scene generation by audio-to-visual latent alignment","venue":null,"work_id":"0ba8aeec-58df-4d0e-98f3-00b87c0954bd","year":2023},"citing_paper":{"arxiv_id":"2509.06027","last_updated":"2026-04-27T10:03:51Z","snapshot_observed_at":"2026-07-06T22:25:11.957177Z","submitted_at":"2025-09-07T12:06:21Z","title":"DreamAudio: Customized Text-to-Audio Generation with Diffusion Models","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-18T18:26:51.583145Z"},"links":{"citing_paper":"/paper/2509.06027"},"observation_digest":"sha256:d48526575c915e9d237dfcb795d01143042620c5caea9ce29bc61c02f227a2c0","observation_id":"00ec06bb-1478-4b21-8bae-2f70238bbc95","resolution":{"observed_at":"2026-05-18T18:32:48.288142Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"I hear your true colors: Image guided audio gen- eration","venue":null,"work_id":"f56d1868-9135-4882-8438-6338cad02425","year":2023},"citing_paper":{"arxiv_id":"2509.06027","last_updated":"2026-04-27T10:03:51Z","snapshot_observed_at":"2026-07-06T22:25:11.957177Z","submitted_at":"2025-09-07T12:06:21Z","title":"DreamAudio: Customized Text-to-Audio Generation with Diffusion Models","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-18T18:26:51.583145Z"},"links":{"citing_paper":"/paper/2509.06027"},"observation_digest":"sha256:fc862f671f5d03272750a0a638205950b84db526adc769dc80737092eeef83d9","observation_id":"4375c37f-95b2-4e0d-b1f0-6abff235761e","resolution":{"observed_at":"2026-05-18T18:32:48.263743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"FoleyGen: Visually-guided audio generation","venue":null,"work_id":"b3b08444-7707-4c86-95d6-480bd840d2d4","year":2024},"citing_paper":{"arxiv_id":"2509.06027","last_updated":"2026-04-27T10:03:51Z","snapshot_observed_at":"2026-07-06T22:25:11.957177Z","submitted_at":"2025-09-07T12:06:21Z","title":"DreamAudio: Customized Text-to-Audio Generation with Diffusion Models","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-18T18:26:51.583145Z"},"links":{"citing_paper":"/paper/2509.06027"},"observation_digest":"sha256:71a3d2929137482d43458ed521c745fccf2f01854857362496fe4f94a4bce89d","observation_id":"f7977440-22bd-44ea-9fc1-4d2afd73ba7c","resolution":{"observed_at":"2026-05-18T18:32:48.277812Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Taming visually guided sound generation","venue":null,"work_id":"82ea2893-d149-48cc-ac19-5364c72218f4","year":2021},"citing_paper":{"arxiv_id":"2509.06027","last_updated":"2026-04-27T10:03:51Z","snapshot_observed_at":"2026-07-06T22:25:11.957177Z","submitted_at":"2025-09-07T12:06:21Z","title":"DreamAudio: Customized Text-to-Audio Generation with Diffusion Models","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-18T18:26:51.583145Z"},"links":{"citing_paper":"/paper/2509.06027"},"observation_digest":"sha256:9f581af2e717547013d7fdd1a5e83c52d9e312fadfe2ac3590789a17680e6dcd","observation_id":"645bc478-5778-45cd-b982-ce51f867ddd1","resolution":{"observed_at":"2026-05-18T18:32:48.259089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"AudioGen: Textually guided audio generation","venue":null,"work_id":"8c3cf3f0-8676-4030-8dcb-9821adff1b83","year":2022},"citing_paper":{"arxiv_id":"2509.06027","last_updated":"2026-04-27T10:03:51Z","snapshot_observed_at":"2026-07-06T22:25:11.957177Z","submitted_at":"2025-09-07T12:06:21Z","title":"DreamAudio: Customized Text-to-Audio Generation with Diffusion Models","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-18T18:26:51.583145Z"},"links":{"citing_paper":"/paper/2509.06027"},"observation_digest":"sha256:ae27f32aa3303d303284c013478d263a59a61056e87417ca1019b4f49b426603","observation_id":"269b90b1-4d25-4a80-9380-b3f3faa91e60","resolution":{"observed_at":"2026-05-18T18:32:48.270694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Riffusion: Stable diffusion for real-time music generation","venue":null,"work_id":"48f09306-38a3-47d3-9111-f1b42ce5ab69","year":2022},"citing_paper":{"arxiv_id":"2509.06027","last_updated":"2026-04-27T10:03:51Z","snapshot_observed_at":"2026-07-06T22:25:11.957177Z","submitted_at":"2025-09-07T12:06:21Z","title":"DreamAudio: Customized Text-to-Audio Generation with Diffusion Models","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-18T18:26:51.583145Z"},"links":{"citing_paper":"/paper/2509.06027"},"observation_digest":"sha256:4ecde93b281c6b0b469fc2f48f0ce5f74e844d41d356b7257e744262607c6553","observation_id":"773c6459-989e-4f7b-b31d-317b2f504356","resolution":{"observed_at":"2026-05-18T18:32:48.291649Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.14335","last_updated":"2023-11-26T14:12:37Z","snapshot_observed_at":"2026-07-06T15:58:55.330444Z","submitted_at":"2023-07-26T17:54:04Z","title":"WavJourney: Compositional Audio Creation with Large Language Models","version":2},"cited_work":{"arxiv_id":"2307.14335","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2307.14335","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"WavJourney: Compositional audio creation with large language models","venue":null,"work_id":"d80f0de6-8f51-4dfe-b6b9-72f01e438fc5","year":2023},"citing_paper":{"arxiv_id":"2509.06027","last_updated":"2026-04-27T10:03:51Z","snapshot_observed_at":"2026-07-06T22:25:11.957177Z","submitted_at":"2025-09-07T12:06:21Z","title":"DreamAudio: Customized Text-to-Audio Generation with Diffusion Models","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-18T18:26:51.583145Z"},"links":{"cited_paper":"/paper/2307.14335","citing_paper":"/paper/2509.06027"},"observation_digest":"sha256:2bef6695afcbf3d237c92d0d7bd2467c994443b03c1c85f9c0ec159783c8a86b","observation_id":"9440ba7a-6b32-4097-9fea-fe0e6e52c4a4","resolution":{"observed_at":"2026-05-18T18:31:44.730268Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Denoising diffusion implicit models","venue":null,"work_id":"7db6fdff-26e4-445d-aab7-2bcfe01076c2","year":2020},"citing_paper":{"arxiv_id":"2509.06027","last_updated":"2026-04-27T10:03:51Z","snapshot_observed_at":"2026-07-06T22:25:11.957177Z","submitted_at":"2025-09-07T12:06:21Z","title":"DreamAudio: Customized Text-to-Audio Generation with Diffusion Models","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-18T18:26:51.583145Z"},"links":{"citing_paper":"/paper/2509.06027"},"observation_digest":"sha256:a69d841950fa7917280d54bb36f2fe9500d8da75dd267e0650650caa4fe0b444","observation_id":"59d5ca74-22ca-4bfe-821a-d0f16ad18ccf","resolution":{"observed_at":"2026-05-18T18:32:48.281587Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T13:16:16.257347Z","title":"Denoising diffusion probabilistic models","venue":null,"work_id":"c4cf16f1-ef0e-46ca-b395-41b305598794","year":2020},"citing_paper":{"arxiv_id":"2509.06027","last_updated":"2026-04-27T10:03:51Z","snapshot_observed_at":"2026-07-06T22:25:11.957177Z","submitted_at":"2025-09-07T12:06:21Z","title":"DreamAudio: Customized Text-to-Audio Generation with Diffusion Models","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-18T18:26:51.583145Z"},"links":{"citing_paper":"/paper/2509.06027"},"observation_digest":"sha256:5aaa8dab6dc374d93bb97d85db8ba2c2a310065ad674067baed4ada553875328","observation_id":"fec0267d-85c8-4d47-a872-d6c970337aa8","resolution":{"observed_at":"2026-05-18T18:32:48.267445Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"AudioSet: An ontology and human-labeled dataset for audio events","venue":null,"work_id":"a67b35bd-083c-44ab-8288-bfa23af16f54","year":2017},"citing_paper":{"arxiv_id":"2509.06027","last_updated":"2026-04-27T10:03:51Z","snapshot_observed_at":"2026-07-06T22:25:11.957177Z","submitted_at":"2025-09-07T12:06:21Z","title":"DreamAudio: Customized Text-to-Audio Generation with Diffusion Models","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-18T18:26:51.583145Z"},"links":{"citing_paper":"/paper/2509.06027"},"observation_digest":"sha256:2fc4878eeefaed0c44e8025e3b7056927ffca218e7553d6659000d45cfd3fe83","observation_id":"4e2dd7ff-7dd3-4af5-8423-79fc92a1e248","resolution":{"observed_at":"2026-05-18T18:32:48.284844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"WavCaps: A ChatGPT-assisted weakly-labelled audio captioning dataset for audio-language multimodal research","venue":null,"work_id":"02c4d486-1f2c-44f6-9338-f96d900142d8","year":2024},"citing_paper":{"arxiv_id":"2509.06027","last_updated":"2026-04-27T10:03:51Z","snapshot_observed_at":"2026-07-06T22:25:11.957177Z","submitted_at":"2025-09-07T12:06:21Z","title":"DreamAudio: Customized Text-to-Audio Generation with Diffusion Models","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-18T18:26:51.583145Z"},"links":{"citing_paper":"/paper/2509.06027"},"observation_digest":"sha256:4c48efcca78b185d0a0a7ea998bcd58def4643d26104aff584dc8a9cde542b4e","observation_id":"485879b3-bd6e-4a4b-af0a-6cadf46c17b8","resolution":{"observed_at":"2026-05-18T18:32:48.251951Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11500","last_updated":"2024-09-09T14:52:15Z","snapshot_observed_at":"2026-07-06T16:21:25.401345Z","submitted_at":"2023-09-20T17:59:32Z","title":"Auto-ACD: A Large-scale Dataset for Audio-Language Representation Learning","version":4},"cited_work":{"arxiv_id":"2309.11500","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.11500","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A large-scale dataset for audio- language representation learning","venue":null,"work_id":"fb467635-59dc-4b06-8f78-b36b09c42a02","year":2023},"citing_paper":{"arxiv_id":"2509.06027","last_updated":"2026-04-27T10:03:51Z","snapshot_observed_at":"2026-07-06T22:25:11.957177Z","submitted_at":"2025-09-07T12:06:21Z","title":"DreamAudio: Customized Text-to-Audio Generation with Diffusion Models","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-18T18:26:51.583145Z"},"links":{"cited_paper":"/paper/2309.11500","citing_paper":"/paper/2509.06027"},"observation_digest":"sha256:bd0d376f32b50462d9ef65e095735c6d0bee8d02cd7ced99caf35dedae4c189f","observation_id":"4771f2ac-97a3-40ef-b2a2-46101ba00a32","resolution":{"observed_at":"2026-05-18T18:31:44.659445Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sound-VECaps: Improving audio generation with visual enhanced captions","venue":null,"work_id":"945bdfdf-d147-4a26-b711-64087e241963","year":2024},"citing_paper":{"arxiv_id":"2509.06027","last_updated":"2026-04-27T10:03:51Z","snapshot_observed_at":"2026-07-06T22:25:11.957177Z","submitted_at":"2025-09-07T12:06:21Z","title":"DreamAudio: Customized Text-to-Audio Generation with Diffusion Models","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-18T18:26:51.583145Z"},"links":{"citing_paper":"/paper/2509.06027"},"observation_digest":"sha256:cb4c2d03cd9e1e3a993c6f5bd17dcec90c5c66c46125f3d9eacd487f0972b136","observation_id":"def8acb9-1deb-4742-84b3-da6f5c0bc2eb","resolution":{"observed_at":"2026-05-18T18:32:48.171759Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"AudioGen: textually guided audio generation","venue":null,"work_id":"37ce291e-140a-4cbb-9bb6-ffe17784d23c","year":2023},"citing_paper":{"arxiv_id":"2509.06027","last_updated":"2026-04-27T10:03:51Z","snapshot_observed_at":"2026-07-06T22:25:11.957177Z","submitted_at":"2025-09-07T12:06:21Z","title":"DreamAudio: Customized Text-to-Audio Generation with Diffusion Models","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-18T18:26:51.583145Z"},"links":{"citing_paper":"/paper/2509.06027"},"observation_digest":"sha256:4055700fcf5e81a3b4c4ef58ae4bbd3d5525883bc947c6723e7c12e370f8e240","observation_id":"c93ab04c-7266-4c66-9671-a3440115c573","resolution":{"observed_at":"2026-05-18T18:32:48.077274Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Diffsound: Discrete diffusion model for text-to-sound generation","venue":null,"work_id":"38753f37-7bbe-4f95-a10d-c2531f471844","year":2023},"citing_paper":{"arxiv_id":"2509.06027","last_updated":"2026-04-27T10:03:51Z","snapshot_observed_at":"2026-07-06T22:25:11.957177Z","submitted_at":"2025-09-07T12:06:21Z","title":"DreamAudio: Customized Text-to-Audio Generation with Diffusion Models","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-18T18:26:51.583145Z"},"links":{"citing_paper":"/paper/2509.06027"},"observation_digest":"sha256:1491fa342ef74d779e9efa0243f108cfd244393701c31ebb5267d2cb362a8bc4","observation_id":"64d810fb-0c2c-4331-918b-1500e8870872","resolution":{"observed_at":"2026-05-18T18:32:48.199051Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18474","last_updated":"2023-05-29T10:41:28Z","snapshot_observed_at":"2026-07-06T15:34:59.457879Z","submitted_at":"2023-05-29T10:41:28Z","title":"Make-An-Audio 2: Temporal-Enhanced Text-to-Audio Generation","version":1},"cited_work":{"arxiv_id":"2305.18474","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.18474","snapshot_observed_at":"2026-07-08T00:04:22.531379Z","title":"Make-An-Audio 2: Temporal-enhanced text-to- audio generation","venue":"cs.SD","work_id":"860b091c-0421-40ba-b119-b64c00ee453d","year":2023},"citing_paper":{"arxiv_id":"2509.06027","last_updated":"2026-04-27T10:03:51Z","snapshot_observed_at":"2026-07-06T22:25:11.957177Z","submitted_at":"2025-09-07T12:06:21Z","title":"DreamAudio: Customized Text-to-Audio Generation with Diffusion Models","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-18T18:26:51.583145Z"},"links":{"cited_paper":"/paper/2305.18474","citing_paper":"/paper/2509.06027"},"observation_digest":"sha256:1b5211332062df4513f09a4a7431a3383a5be6c9be6e221b026f3225fd4e2e85","observation_id":"0648e3b5-858d-4cb1-a28f-fa27f9d9e31d","resolution":{"observed_at":"2026-05-18T18:31:44.725561Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Retrieval-augmented text-to-audio generation","venue":null,"work_id":"1d065487-581d-496a-9ebf-b3e8ccde1a36","year":2024},"citing_paper":{"arxiv_id":"2509.06027","last_updated":"2026-04-27T10:03:51Z","snapshot_observed_at":"2026-07-06T22:25:11.957177Z","submitted_at":"2025-09-07T12:06:21Z","title":"DreamAudio: Customized Text-to-Audio Generation with Diffusion Models","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-18T18:26:51.583145Z"},"links":{"citing_paper":"/paper/2509.06027"},"observation_digest":"sha256:d1c929cedd5df52e04dca1b842321f13d5f8310d7f82e0529d65402ecb68c3c6","observation_id":"dd7f6c52-3483-4957-b4a3-9fc7c3949ada","resolution":{"observed_at":"2026-05-18T18:32:48.222572Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Audioldm 2: Learning holistic audio generation with self-supervised pretraining","venue":null,"work_id":"c0af7ba3-a2ed-402e-8cc5-ab7a4c9e9945","year":2024},"citing_paper":{"arxiv_id":"2509.06027","last_updated":"2026-04-27T10:03:51Z","snapshot_observed_at":"2026-07-06T22:25:11.957177Z","submitted_at":"2025-09-07T12:06:21Z","title":"DreamAudio: Customized Text-to-Audio Generation with Diffusion Models","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-18T18:26:51.583145Z"},"links":{"citing_paper":"/paper/2509.06027"},"observation_digest":"sha256:94b742113a26c7d6c6f82309d76ed496135978adabe7996120c1761c245537de","observation_id":"b36eea5b-daff-4566-8a17-df09558ee8d2","resolution":{"observed_at":"2026-05-18T18:32:48.149148Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"DreamBooth: Fine tuning text-to-image diffusion models for subject- driven generation","venue":null,"work_id":"7216410e-4fe3-4021-933e-b3246ddc04fd","year":2023},"citing_paper":{"arxiv_id":"2509.06027","last_updated":"2026-04-27T10:03:51Z","snapshot_observed_at":"2026-07-06T22:25:11.957177Z","submitted_at":"2025-09-07T12:06:21Z","title":"DreamAudio: Customized Text-to-Audio Generation with Diffusion Models","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-18T18:26:51.583145Z"},"links":{"citing_paper":"/paper/2509.06027"},"observation_digest":"sha256:5b7c7e4cff448295317446c06ff714b6868b145eab74355a72fe9eed796233e0","observation_id":"9f715069-664e-4936-8233-34602905603d","resolution":{"observed_at":"2026-05-18T18:32:48.064854Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Zero-shot text-to-image generation","venue":null,"work_id":"9ae74c81-b7b3-4fbc-87ba-c66cc35fc170","year":2021},"citing_paper":{"arxiv_id":"2509.06027","last_updated":"2026-04-27T10:03:51Z","snapshot_observed_at":"2026-07-06T22:25:11.957177Z","submitted_at":"2025-09-07T12:06:21Z","title":"DreamAudio: Customized Text-to-Audio Generation with Diffusion Models","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-18T18:26:51.583145Z"},"links":{"citing_paper":"/paper/2509.06027"},"observation_digest":"sha256:bf59e23f2cbdd2d17edeb58b4da20014d480392a6c6022af54a94836aedeb715","observation_id":"7cf666c1-444d-4e0e-b017-5323d65fc174","resolution":{"observed_at":"2026-05-18T18:32:48.213731Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":"2204.06125","doi":"10.48550/arxiv.2204.06125","metadata_source":"pith","pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","venue":"cs.CV","work_id":"0c6a768b-70b8-4242-bb0e-459f1008c9fc","year":2022},"citing_paper":{"arxiv_id":"2509.06027","last_updated":"2026-04-27T10:03:51Z","snapshot_observed_at":"2026-07-06T22:25:11.957177Z","submitted_at":"2025-09-07T12:06:21Z","title":"DreamAudio: Customized Text-to-Audio Generation with Diffusion Models","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-18T18:26:51.583145Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2509.06027"},"observation_digest":"sha256:d58cf5cdf6f924e354d2203358e051f2f3610067ca235845697deb370d78f43c","observation_id":"5120f924-e567-4640-93cd-3b921fcf7ec3","resolution":{"observed_at":"2026-05-18T18:31:44.720702Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:50:02.412412+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:50:02.412412+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Improving image generation with better captions","venue":null,"work_id":"e63335d0-7f74-40d4-9a71-7bf015d165e1","year":2023},"citing_paper":{"arxiv_id":"2509.06027","last_updated":"2026-04-27T10:03:51Z","snapshot_observed_at":"2026-07-06T22:25:11.957177Z","submitted_at":"2025-09-07T12:06:21Z","title":"DreamAudio: Customized Text-to-Audio Generation with Diffusion Models","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-18T18:26:51.583145Z"},"links":{"citing_paper":"/paper/2509.06027"},"observation_digest":"sha256:24489db42f9d883980636af6b70a0162cc3679753551d31c128f8f96c6ae728b","observation_id":"f4a4da49-f86a-44ed-a980-95547428161b","resolution":{"observed_at":"2026-05-18T18:32:48.058062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T21:42:56.810910Z","title":"High- resolution image synthesis with latent diffusion models","venue":null,"work_id":"04555979-787e-4c28-a876-ca130e9105d3","year":2022},"citing_paper":{"arxiv_id":"2509.06027","last_updated":"2026-04-27T10:03:51Z","snapshot_observed_at":"2026-07-06T22:25:11.957177Z","submitted_at":"2025-09-07T12:06:21Z","title":"DreamAudio: Customized Text-to-Audio Generation with Diffusion Models","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-18T18:26:51.583145Z"},"links":{"citing_paper":"/paper/2509.06027"},"observation_digest":"sha256:d0cca80e17d4ad8ab3a31491985fc142f736eff59f6e1b2ec8ffad743a71085d","observation_id":"364242a6-1d18-4c1e-9b59-56f5b7d5c23d","resolution":{"observed_at":"2026-05-18T18:32:48.139169Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scaling rectified flow transformers for high-resolution image synthesis","venue":null,"work_id":"a9e02a91-ce6a-4a7f-a904-8bfa3e948356","year":2024},"citing_paper":{"arxiv_id":"2509.06027","last_updated":"2026-04-27T10:03:51Z","snapshot_observed_at":"2026-07-06T22:25:11.957177Z","submitted_at":"2025-09-07T12:06:21Z","title":"DreamAudio: Customized Text-to-Audio Generation with Diffusion Models","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-18T18:26:51.583145Z"},"links":{"citing_paper":"/paper/2509.06027"},"observation_digest":"sha256:a3b91bb49684e10c621964635e8afce55e27a60d2ad7f833f6daba2272ae5501","observation_id":"33e205bb-794a-4203-adae-f27bbdb5611d","resolution":{"observed_at":"2026-05-18T18:32:48.047641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18503","last_updated":"2025-03-10T15:51:47Z","snapshot_observed_at":"2026-07-06T18:21:35.476139Z","submitted_at":"2024-05-28T18:14:52Z","title":"SoundCTM: Unifying Score-based and Consistency Models for Full-band Text-to-Sound Generation","version":3},"cited_work":{"arxiv_id":"2405.18503","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.18503","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"SoundCTM: Uniting score-based and consistency models for text-to-sound generation","venue":null,"work_id":"fc1734cd-1637-4cc1-919e-2e1825faa172","year":2024},"citing_paper":{"arxiv_id":"2509.06027","last_updated":"2026-04-27T10:03:51Z","snapshot_observed_at":"2026-07-06T22:25:11.957177Z","submitted_at":"2025-09-07T12:06:21Z","title":"DreamAudio: Customized Text-to-Audio Generation with Diffusion Models","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-18T18:26:51.583145Z"},"links":{"cited_paper":"/paper/2405.18503","citing_paper":"/paper/2509.06027"},"observation_digest":"sha256:dd0b8d23de21b17a4f5844cf7ab67329e5dad8f863762f9554afb1630b405d20","observation_id":"e97f410b-3b57-4ae2-99d8-bf9f93baad3b","resolution":{"observed_at":"2026-05-18T18:31:44.716748Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.05141","last_updated":"2025-06-06T05:50:30Z","snapshot_observed_at":"2026-08-06T12:32:49.173114Z","submitted_at":"2024-11-07T19:50:28Z","title":"Audiobox TTA-RAG: Improving Zero-Shot and Few-Shot Text-To-Audio with Retrieval-Augmented Generation","version":2},"cited_work":{"arxiv_id":"2411.05141","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.05141","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Audiobox TTA- RAG: Improving zero-shot and few-shot text-to-audio with retrieval- augmented generation","venue":null,"work_id":"4e113c53-9c3e-4d05-a12b-0d8be0638683","year":2024},"citing_paper":{"arxiv_id":"2509.06027","last_updated":"2026-04-27T10:03:51Z","snapshot_observed_at":"2026-07-06T22:25:11.957177Z","submitted_at":"2025-09-07T12:06:21Z","title":"DreamAudio: Customized Text-to-Audio Generation with Diffusion Models","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-18T18:26:51.583145Z"},"links":{"cited_paper":"/paper/2411.05141","citing_paper":"/paper/2509.06027"},"observation_digest":"sha256:ecac0dd5a1998351fa6b48f8cac53d79f6a7c2ba6a43cffff2baa0c9b0a9dd87","observation_id":"84c253a3-6161-48a6-9596-a06b6dd60bf5","resolution":{"observed_at":"2026-05-18T18:31:44.712246Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Adding conditional control to text-to-image diffusion models","venue":null,"work_id":"0b2aa579-69c4-4f95-a744-d332eb5d7ad3","year":2023},"citing_paper":{"arxiv_id":"2509.06027","last_updated":"2026-04-27T10:03:51Z","snapshot_observed_at":"2026-07-06T22:25:11.957177Z","submitted_at":"2025-09-07T12:06:21Z","title":"DreamAudio: Customized Text-to-Audio Generation with Diffusion Models","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-18T18:26:51.583145Z"},"links":{"citing_paper":"/paper/2509.06027"},"observation_digest":"sha256:565721cea375eaf82e665ccc57684834c98967684807de40f5fce3061b434db4","observation_id":"9bfe36c9-d573-45d4-8b7f-1b632c67435f","resolution":{"observed_at":"2026-05-18T18:32:48.227898Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"AudioCaps: Generating captions for audios in the wild","venue":null,"work_id":"2cad818c-1baf-4ce4-9ac7-6db8941e7a4f","year":2019},"citing_paper":{"arxiv_id":"2509.06027","last_updated":"2026-04-27T10:03:51Z","snapshot_observed_at":"2026-07-06T22:25:11.957177Z","submitted_at":"2025-09-07T12:06:21Z","title":"DreamAudio: Customized Text-to-Audio Generation with Diffusion Models","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-18T18:26:51.583145Z"},"links":{"citing_paper":"/paper/2509.06027"},"observation_digest":"sha256:b83f189a44937167c96223b90f772128c301c139cb8f94057aaa2456d21c852c","observation_id":"e0ff90d9-8a31-48ba-8bcf-767b4036f3d9","resolution":{"observed_at":"2026-05-18T18:32:48.248530Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Score-based generative modeling through stochastic differen- tial equations","venue":null,"work_id":"064d4957-a8e2-4214-a96d-9b84baa8cb0b","year":2021},"citing_paper":{"arxiv_id":"2509.06027","last_updated":"2026-04-27T10:03:51Z","snapshot_observed_at":"2026-07-06T22:25:11.957177Z","submitted_at":"2025-09-07T12:06:21Z","title":"DreamAudio: Customized Text-to-Audio Generation with Diffusion Models","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-18T18:26:51.583145Z"},"links":{"citing_paper":"/paper/2509.06027"},"observation_digest":"sha256:417f8482b8567a48a5347319d03218000e2f1e2940e77201f1fa54942c681d3f","observation_id":"da4eef81-fa20-46f1-b060-f66cd40e8b9d","resolution":{"observed_at":"2026-05-18T18:32:48.239914Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Diffusion models beat GANs on image synthesis","venue":null,"work_id":"80285f8c-3ffa-42e3-886c-3513fc951606","year":2021},"citing_paper":{"arxiv_id":"2509.06027","last_updated":"2026-04-27T10:03:51Z","snapshot_observed_at":"2026-07-06T22:25:11.957177Z","submitted_at":"2025-09-07T12:06:21Z","title":"DreamAudio: Customized Text-to-Audio Generation with Diffusion Models","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-18T18:26:51.583145Z"},"links":{"citing_paper":"/paper/2509.06027"},"observation_digest":"sha256:bc4aeb3bcc11d0006a007dc3799618ebf3452a9442cd37b577918f4331ab753d","observation_id":"84db829c-4ee8-4434-8338-b9890dda6842","resolution":{"observed_at":"2026-05-18T18:32:48.235929Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.11487","last_updated":"2022-05-23T17:42:53Z","snapshot_observed_at":"2026-07-06T13:12:59.688989Z","submitted_at":"2022-05-23T17:42:53Z","title":"Photorealistic Text-to-Image Diffusion Models with Deep Language Understanding","version":1},"cited_work":{"arxiv_id":"2205.11487","doi":"10.48550/arxiv.2205.11487","metadata_source":"pith","pith_arxiv_id":"2205.11487","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Photorealistic Text-to-Image Diffusion Models with Deep Language Understanding","venue":"cs.CV","work_id":"af16442b-a46f-469d-8818-c37b53a504c7","year":2022},"citing_paper":{"arxiv_id":"2509.06027","last_updated":"2026-04-27T10:03:51Z","snapshot_observed_at":"2026-07-06T22:25:11.957177Z","submitted_at":"2025-09-07T12:06:21Z","title":"DreamAudio: Customized Text-to-Audio Generation with Diffusion Models","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-18T18:26:51.583145Z"},"links":{"cited_paper":"/paper/2205.11487","citing_paper":"/paper/2509.06027"},"observation_digest":"sha256:8e8ee25837a6b900129464bbb37356da9f27ca3ec143a4bcfcee96c28d7997e5","observation_id":"2b328429-a9ad-4b12-8d30-6ef250b20ba0","resolution":{"observed_at":"2026-05-18T18:31:44.708027Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:50:02.677+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:50:02.677+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Image super-resolution via iterative refinement","venue":null,"work_id":"6539cd33-1a4f-4407-b43c-9a747b6d25a2","year":2022},"citing_paper":{"arxiv_id":"2509.06027","last_updated":"2026-04-27T10:03:51Z","snapshot_observed_at":"2026-07-06T22:25:11.957177Z","submitted_at":"2025-09-07T12:06:21Z","title":"DreamAudio: Customized Text-to-Audio Generation with Diffusion Models","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-18T18:26:51.583145Z"},"links":{"citing_paper":"/paper/2509.06027"},"observation_digest":"sha256:b28cfdc3e2ecbe0434b70e5b877b57a03f8076bb7c8010ffdd70e7fce5adfb20","observation_id":"191cfcc0-b6c5-46b6-886f-464dbf33bad8","resolution":{"observed_at":"2026-05-18T18:32:48.231941Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Wave- Grad: Estimating gradients for waveform generation","venue":null,"work_id":"7df431f4-66b9-4bfa-b3db-23e7f28703ae","year":2021},"citing_paper":{"arxiv_id":"2509.06027","last_updated":"2026-04-27T10:03:51Z","snapshot_observed_at":"2026-07-06T22:25:11.957177Z","submitted_at":"2025-09-07T12:06:21Z","title":"DreamAudio: Customized Text-to-Audio Generation with Diffusion Models","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-18T18:26:51.583145Z"},"links":{"citing_paper":"/paper/2509.06027"},"observation_digest":"sha256:044d92cf97adb35cec9ea0854b5a7b347bb0db52991e8a3b74da71425285a853","observation_id":"14c63d36-f194-4579-9abb-1ddd971ec3c4","resolution":{"observed_at":"2026-05-18T18:32:48.223960Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"DiffWave: A versatile diffusion model for audio synthesis","venue":null,"work_id":"01567e98-150a-4fdd-8ce4-9d8cfb874094","year":2021},"citing_paper":{"arxiv_id":"2509.06027","last_updated":"2026-04-27T10:03:51Z","snapshot_observed_at":"2026-07-06T22:25:11.957177Z","submitted_at":"2025-09-07T12:06:21Z","title":"DreamAudio: Customized Text-to-Audio Generation with Diffusion Models","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-18T18:26:51.583145Z"},"links":{"citing_paper":"/paper/2509.06027"},"observation_digest":"sha256:91597e14bfb4c0f17a2d816479ea38fe6dbcdef2cadc3625f4ab3ad64ba3867c","observation_id":"36ee6ca8-46eb-431f-8f47-4f546174e7e3","resolution":{"observed_at":"2026-05-18T18:32:48.220618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Make-A-Video: Text-to-video generation without text-video data","venue":null,"work_id":"6bd98dee-966d-435a-9ed9-cc2281a9dab6","year":2022},"citing_paper":{"arxiv_id":"2509.06027","last_updated":"2026-04-27T10:03:51Z","snapshot_observed_at":"2026-07-06T22:25:11.957177Z","submitted_at":"2025-09-07T12:06:21Z","title":"DreamAudio: Customized Text-to-Audio Generation with Diffusion Models","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-18T18:26:51.583145Z"},"links":{"citing_paper":"/paper/2509.06027"},"observation_digest":"sha256:f4b7ff84fb11d9d635cc2fa8df5a26fc70aa6b7286e379777a90bf2c1a796b8b","observation_id":"09fdeafa-e13e-400f-a6fe-1852dfad22c6","resolution":{"observed_at":"2026-05-18T18:32:48.217378Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02303","last_updated":"2022-10-05T14:41:38Z","snapshot_observed_at":"2026-07-06T13:59:57.800591Z","submitted_at":"2022-10-05T14:41:38Z","title":"Imagen Video: High Definition Video Generation with Diffusion Models","version":1},"cited_work":{"arxiv_id":"2210.02303","doi":"10.48550/arxiv.2210.02303","metadata_source":"pith","pith_arxiv_id":"2210.02303","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Imagen Video: High Definition Video Generation with Diffusion Models","venue":"cs.CV","work_id":"bb20d241-dc6f-4b0a-b071-fd43a2cbd57f","year":2022},"citing_paper":{"arxiv_id":"2509.06027","last_updated":"2026-04-27T10:03:51Z","snapshot_observed_at":"2026-07-06T22:25:11.957177Z","submitted_at":"2025-09-07T12:06:21Z","title":"DreamAudio: Customized Text-to-Audio Generation with Diffusion Models","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-18T18:26:51.583145Z"},"links":{"cited_paper":"/paper/2210.02303","citing_paper":"/paper/2509.06027"},"observation_digest":"sha256:0f8dc4c43db6794b927d3a479d671c556f9f8f31194757df36526d1ba86a37ce","observation_id":"2ca7df0f-7703-4f87-88ae-f0aaf1961e51","resolution":{"observed_at":"2026-05-18T18:31:44.703532Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:49:59.676131+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:49:59.676131+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Grad- TTS: A diffusion probabilistic model for text-to-speech","venue":null,"work_id":"d31131f2-a5b1-468e-95e7-cf32d35a3ff0","year":2021},"citing_paper":{"arxiv_id":"2509.06027","last_updated":"2026-04-27T10:03:51Z","snapshot_observed_at":"2026-07-06T22:25:11.957177Z","submitted_at":"2025-09-07T12:06:21Z","title":"DreamAudio: Customized Text-to-Audio Generation with Diffusion Models","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-18T18:26:51.583145Z"},"links":{"citing_paper":"/paper/2509.06027"},"observation_digest":"sha256:c8ca4edf2e8a045d167a95f19bb7ec0942a609a322adac367231e1ecb6f618e4","observation_id":"01ab0f5c-9026-496f-a7e5-1e2af8b3f46d","resolution":{"observed_at":"2026-05-18T18:32:48.112359Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.14518","last_updated":"2022-12-30T02:31:35Z","snapshot_observed_at":"2026-07-06T14:36:01.830787Z","submitted_at":"2022-12-30T02:31:35Z","title":"ResGrad: Residual Denoising Diffusion Probabilistic Models for Text to Speech","version":1},"cited_work":{"arxiv_id":"2212.14518","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2212.14518","snapshot_observed_at":"2026-07-02T02:36:27.517412Z","title":"ResGrad: Residual denoising diffusion probabilistic models for text to speech","venue":null,"work_id":"8b5c44d1-fd56-46a9-9f24-1a9dff097318","year":2022},"citing_paper":{"arxiv_id":"2509.06027","last_updated":"2026-04-27T10:03:51Z","snapshot_observed_at":"2026-07-06T22:25:11.957177Z","submitted_at":"2025-09-07T12:06:21Z","title":"DreamAudio: Customized Text-to-Audio Generation with Diffusion Models","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-18T18:26:51.583145Z"},"links":{"cited_paper":"/paper/2212.14518","citing_paper":"/paper/2509.06027"},"observation_digest":"sha256:b463221aa2ac256c09787c96b9fb41847546f48e2bdf390ca2adf2861bd3d963","observation_id":"691bc4c5-fe5a-4381-94cf-5955b2957f4d","resolution":{"observed_at":"2026-05-18T18:31:44.699231Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bilateral denoising diffusion models","venue":null,"work_id":"f7890137-2c03-4252-a867-eb0f5aa60b62","year":2022},"citing_paper":{"arxiv_id":"2509.06027","last_updated":"2026-04-27T10:03:51Z","snapshot_observed_at":"2026-07-06T22:25:11.957177Z","submitted_at":"2025-09-07T12:06:21Z","title":"DreamAudio: Customized Text-to-Audio Generation with Diffusion Models","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-18T18:26:51.583145Z"},"links":{"citing_paper":"/paper/2509.06027"},"observation_digest":"sha256:172c7754bb4b545ae4d7b7e8bf21dba5422566c7e9114c32701fcef7dcc3059a","observation_id":"ddcd019c-fbd3-4b3f-be77-f134ddea8e19","resolution":{"observed_at":"2026-05-18T18:32:48.209647Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Priorgrad: Improving conditional denoising diffu- sion models with data-driven adaptive prior","venue":null,"work_id":"367a1f84-9a4a-47e2-9569-f14cd8239536","year":2022},"citing_paper":{"arxiv_id":"2509.06027","last_updated":"2026-04-27T10:03:51Z","snapshot_observed_at":"2026-07-06T22:25:11.957177Z","submitted_at":"2025-09-07T12:06:21Z","title":"DreamAudio: Customized Text-to-Audio Generation with Diffusion Models","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-18T18:26:51.583145Z"},"links":{"citing_paper":"/paper/2509.06027"},"observation_digest":"sha256:6095e017df319ea6bda4a4b6dff6c17f057f10a6d0588845e1c46f93f4b1c1be","observation_id":"ff22e81a-af69-4650-a305-93bbca2d53b6","resolution":{"observed_at":"2026-05-18T18:32:48.206407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"InferGrad: Improving diffusion models for vocoder by considering inference in training","venue":null,"work_id":"f4e9bcd1-1478-4231-85c2-6e84811261e6","year":2022},"citing_paper":{"arxiv_id":"2509.06027","last_updated":"2026-04-27T10:03:51Z","snapshot_observed_at":"2026-07-06T22:25:11.957177Z","submitted_at":"2025-09-07T12:06:21Z","title":"DreamAudio: Customized Text-to-Audio Generation with Diffusion Models","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-18T18:26:51.583145Z"},"links":{"citing_paper":"/paper/2509.06027"},"observation_digest":"sha256:38aed17d42d807b35cb3d6e9eeb13d8bf007cfa4e926e37358f3b8295a3f38c1","observation_id":"417d6878-168b-4a50-8ed0-6f717f805481","resolution":{"observed_at":"2026-05-18T18:32:48.202371Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Acoustic scene generation with conditional SampleRNN","venue":null,"work_id":"33165bd4-e84c-4ff4-ab6f-34a11159db1b","year":2019},"citing_paper":{"arxiv_id":"2509.06027","last_updated":"2026-04-27T10:03:51Z","snapshot_observed_at":"2026-07-06T22:25:11.957177Z","submitted_at":"2025-09-07T12:06:21Z","title":"DreamAudio: Customized Text-to-Audio Generation with Diffusion Models","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-18T18:26:51.583145Z"},"links":{"citing_paper":"/paper/2509.06027"},"observation_digest":"sha256:bdd19e433f050fac7d31866d77135b5bd680c9f5ec3b43fcd54611a717fa5fdf","observation_id":"543ca49d-1415-45cc-855a-9ad53852bbfb","resolution":{"observed_at":"2026-05-18T18:32:48.102246Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Conditional sound generation using neural discrete time-frequency representation learning","venue":null,"work_id":"64ce0f3d-3701-4fba-b61b-5bde859189fa","year":2021},"citing_paper":{"arxiv_id":"2509.06027","last_updated":"2026-04-27T10:03:51Z","snapshot_observed_at":"2026-07-06T22:25:11.957177Z","submitted_at":"2025-09-07T12:06:21Z","title":"DreamAudio: Customized Text-to-Audio Generation with Diffusion Models","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-18T18:26:51.583145Z"},"links":{"citing_paper":"/paper/2509.06027"},"observation_digest":"sha256:b6b986a3db921158f3afa6736a78c1b235c0a214078929997a4dc7370384c280","observation_id":"74c6d451-8002-4d7d-995e-6ab1e3746b46","resolution":{"observed_at":"2026-05-18T18:32:48.195191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Leveraging pre-trained AudioLDM for sound generation: A benchmark study","venue":null,"work_id":"f29450de-27e7-4c84-a425-7b61b4e7df64","year":2023},"citing_paper":{"arxiv_id":"2509.06027","last_updated":"2026-04-27T10:03:51Z","snapshot_observed_at":"2026-07-06T22:25:11.957177Z","submitted_at":"2025-09-07T12:06:21Z","title":"DreamAudio: Customized Text-to-Audio Generation with Diffusion Models","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-18T18:26:51.583145Z"},"links":{"citing_paper":"/paper/2509.06027"},"observation_digest":"sha256:4255829dac91ddb7f1e2953db549c55aa8f928a07f10019351010bb8d05c6d38","observation_id":"537d1a66-23fe-4838-befe-b91f941ab9b8","resolution":{"observed_at":"2026-05-18T18:32:48.191439Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"HiFi-GAN: generative adversarial networks for efficient and high fidelity speech synthesis","venue":null,"work_id":"f3f83995-eff2-4e45-9ef8-f73f7a75990b","year":2020},"citing_paper":{"arxiv_id":"2509.06027","last_updated":"2026-04-27T10:03:51Z","snapshot_observed_at":"2026-07-06T22:25:11.957177Z","submitted_at":"2025-09-07T12:06:21Z","title":"DreamAudio: Customized Text-to-Audio Generation with Diffusion Models","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-18T18:26:51.583145Z"},"links":{"citing_paper":"/paper/2509.06027"},"observation_digest":"sha256:4ede5b19f8517022986275c84fb213387c0f9838d2a882f2da48d4400ad8883e","observation_id":"857f599a-caa6-44ab-844a-a0b7ea530df5","resolution":{"observed_at":"2026-05-18T18:32:48.187239Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"MelGAN: Generative adversarial networks for conditional waveform synthesis","venue":null,"work_id":"e46bdd30-1e77-4346-86b9-e95c11051643","year":2019},"citing_paper":{"arxiv_id":"2509.06027","last_updated":"2026-04-27T10:03:51Z","snapshot_observed_at":"2026-07-06T22:25:11.957177Z","submitted_at":"2025-09-07T12:06:21Z","title":"DreamAudio: Customized Text-to-Audio Generation with Diffusion Models","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-18T18:26:51.583145Z"},"links":{"citing_paper":"/paper/2509.06027"},"observation_digest":"sha256:861483e256a1e9205a528d175d50df2398440b483c5fa681323f8a2464966eba","observation_id":"78d9861a-4240-427d-9df8-433ea6bbe7da","resolution":{"observed_at":"2026-05-18T18:32:48.152572Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"BigVGAN: A universal neural vocoder with large-scale training","venue":null,"work_id":"84f30c1f-18cb-4a67-87ab-a911597659fa","year":2022},"citing_paper":{"arxiv_id":"2509.06027","last_updated":"2026-04-27T10:03:51Z","snapshot_observed_at":"2026-07-06T22:25:11.957177Z","submitted_at":"2025-09-07T12:06:21Z","title":"DreamAudio: Customized Text-to-Audio Generation with Diffusion Models","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-18T18:26:51.583145Z"},"links":{"citing_paper":"/paper/2509.06027"},"observation_digest":"sha256:406c08bab30d6b2c0351394b7855f1e2331ec076f3f8675690abaf5cd8f75041","observation_id":"96a9e711-5b24-45b1-b03a-09daa8c6fbe0","resolution":{"observed_at":"2026-05-18T18:32:48.183521Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Large-scale contrastive language-audio pretraining with feature fusion and keyword-to-caption augmentation","venue":null,"work_id":"e3a8a12a-2a9c-47a9-8dee-5920ee88798e","year":2023},"citing_paper":{"arxiv_id":"2509.06027","last_updated":"2026-04-27T10:03:51Z","snapshot_observed_at":"2026-07-06T22:25:11.957177Z","submitted_at":"2025-09-07T12:06:21Z","title":"DreamAudio: Customized Text-to-Audio Generation with Diffusion Models","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-18T18:26:51.583145Z"},"links":{"citing_paper":"/paper/2509.06027"},"observation_digest":"sha256:f6e92ab7932fe2797673049eb0ec3875ac6f4b51133527126a9fe2b2079aac1f","observation_id":"7fcf4245-4b64-4aba-b077-49330d394572","resolution":{"observed_at":"2026-05-18T18:32:48.179907Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13731","last_updated":"2023-05-29T12:09:08Z","snapshot_observed_at":"2026-07-06T15:20:25.388057Z","submitted_at":"2023-04-24T07:45:28Z","title":"Text-to-Audio Generation using Instruction-Tuned LLM and Latent Diffusion Model","version":2},"cited_work":{"arxiv_id":"2304.13731","doi":"10.48550/arxiv.2304.13731","metadata_source":"arxiv_reference","pith_arxiv_id":"2304.13731","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Text-to-audio generation using instruction- tuned LLM and latent diffusion model","venue":"arXiv (Cornell University)","work_id":"492d96c3-fca9-41b7-a64d-3e3313ff9da1","year":2023},"citing_paper":{"arxiv_id":"2509.06027","last_updated":"2026-04-27T10:03:51Z","snapshot_observed_at":"2026-07-06T22:25:11.957177Z","submitted_at":"2025-09-07T12:06:21Z","title":"DreamAudio: Customized Text-to-Audio Generation with Diffusion Models","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-18T18:26:51.583145Z"},"links":{"cited_paper":"/paper/2304.13731","citing_paper":"/paper/2509.06027"},"observation_digest":"sha256:ece8913f858603421284afcaa75e981905aa1da80923539271620ecd3a16bc14","observation_id":"eb26b8d8-ce1c-4a41-a413-4f98fe9b0774","resolution":{"observed_at":"2026-05-18T18:31:44.694499Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer","venue":null,"work_id":"ce78cb5a-7f0a-4e14-86b1-ab6033abb554","year":2020},"citing_paper":{"arxiv_id":"2509.06027","last_updated":"2026-04-27T10:03:51Z","snapshot_observed_at":"2026-07-06T22:25:11.957177Z","submitted_at":"2025-09-07T12:06:21Z","title":"DreamAudio: Customized Text-to-Audio Generation with Diffusion Models","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-18T18:26:51.583145Z"},"links":{"citing_paper":"/paper/2509.06027"},"observation_digest":"sha256:f9fc7209ba42f1c940d06bb7098df584932a2b620a6baa0804487c020ee777a8","observation_id":"6f77b52d-fb04-4bf7-9477-8242d499816e","resolution":{"observed_at":"2026-05-18T18:32:48.175751Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Using pre-training can improve model robustness and uncertainty","venue":null,"work_id":"be0e60d4-1f0b-41c3-9252-f76042b14b7a","year":2019},"citing_paper":{"arxiv_id":"2509.06027","last_updated":"2026-04-27T10:03:51Z","snapshot_observed_at":"2026-07-06T22:25:11.957177Z","submitted_at":"2025-09-07T12:06:21Z","title":"DreamAudio: Customized Text-to-Audio Generation with Diffusion Models","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-18T18:26:51.583145Z"},"links":{"citing_paper":"/paper/2509.06027"},"observation_digest":"sha256:5cce5acb137ed004d9a5d0f687aa5670e13b7c5458d440d4ac26bcd445353f65","observation_id":"fbc9a665-1a62-406d-83f5-f360db4e653a","resolution":{"observed_at":"2026-05-18T18:32:48.172322Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Text-driven Foley sound generation with latent diffusion model","venue":null,"work_id":"26d4246b-b7a8-4298-8c43-38f3bccc252d","year":2023},"citing_paper":{"arxiv_id":"2509.06027","last_updated":"2026-04-27T10:03:51Z","snapshot_observed_at":"2026-07-06T22:25:11.957177Z","submitted_at":"2025-09-07T12:06:21Z","title":"DreamAudio: Customized Text-to-Audio Generation with Diffusion Models","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-18T18:26:51.583145Z"},"links":{"citing_paper":"/paper/2509.06027"},"observation_digest":"sha256:4860aebc8c5981012c62a045b195373ca2e9652fbb6ea216b577063261bb4f3b","observation_id":"444931a6-241a-4c8d-bdd2-c112456962b4","resolution":{"observed_at":"2026-05-18T18:32:48.168789Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T16:15:06.809546Z","title":"Masactrl: Tuning-free mutual self-attention control for consistent image synthesis and editing","venue":null,"work_id":"90f83d98-c283-4024-9832-5463b3e9044f","year":2023},"citing_paper":{"arxiv_id":"2509.06027","last_updated":"2026-04-27T10:03:51Z","snapshot_observed_at":"2026-07-06T22:25:11.957177Z","submitted_at":"2025-09-07T12:06:21Z","title":"DreamAudio: Customized Text-to-Audio Generation with Diffusion Models","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-18T18:26:51.583145Z"},"links":{"citing_paper":"/paper/2509.06027"},"observation_digest":"sha256:2c166debe56e90dcda9682d74e2fb72da9c5a36ef40111396b90192c98ad5c3b","observation_id":"ed599b40-1961-4146-9fb4-d896182b6c5f","resolution":{"observed_at":"2026-05-18T18:32:48.165167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Anydoor: Zero-shot object-level image customization","venue":null,"work_id":"83f75c1a-5b0b-42b6-987e-b5ebd417a421","year":2024},"citing_paper":{"arxiv_id":"2509.06027","last_updated":"2026-04-27T10:03:51Z","snapshot_observed_at":"2026-07-06T22:25:11.957177Z","submitted_at":"2025-09-07T12:06:21Z","title":"DreamAudio: Customized Text-to-Audio Generation with Diffusion Models","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-18T18:26:51.583145Z"},"links":{"citing_paper":"/paper/2509.06027"},"observation_digest":"sha256:20e2f20de9a2dd81565f2700bae8d98f5be456463e197c21e4c0396c3ea922a9","observation_id":"3f07dc39-3e6e-4fd0-982c-760fdc705d64","resolution":{"observed_at":"2026-05-18T18:32:48.161780Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Encoder-based domain tuning for fast personalization of text-to- image models","venue":null,"work_id":"9cd3c1de-ff51-40ad-99ed-8c6200c7b77e","year":2023},"citing_paper":{"arxiv_id":"2509.06027","last_updated":"2026-04-27T10:03:51Z","snapshot_observed_at":"2026-07-06T22:25:11.957177Z","submitted_at":"2025-09-07T12:06:21Z","title":"DreamAudio: Customized Text-to-Audio Generation with Diffusion Models","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-18T18:26:51.583145Z"},"links":{"citing_paper":"/paper/2509.06027"},"observation_digest":"sha256:6d8e98330a1e8797cad4ed95d92df9f0aaa271650cfc51028dd8f6f44fb318c7","observation_id":"14f12460-1806-4595-bed6-305bc8ae34ca","resolution":{"observed_at":"2026-05-18T18:32:48.095618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Imagic: Text-based real image editing with diffusion models","venue":null,"work_id":"2dd2ba74-0672-46f8-b2d9-cae00c6a6cea","year":2023},"citing_paper":{"arxiv_id":"2509.06027","last_updated":"2026-04-27T10:03:51Z","snapshot_observed_at":"2026-07-06T22:25:11.957177Z","submitted_at":"2025-09-07T12:06:21Z","title":"DreamAudio: Customized Text-to-Audio Generation with Diffusion Models","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-18T18:26:51.583145Z"},"links":{"citing_paper":"/paper/2509.06027"},"observation_digest":"sha256:b988dced54dd0c3f6a599e090c43adf4c62d0da7dd0e7f5640716ee0fd91b9a0","observation_id":"e1a6eb64-33f7-4f90-94af-c29f4d27a22f","resolution":{"observed_at":"2026-05-18T18:32:48.216582Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Key-locked rank one editing for text-to-image personalization","venue":null,"work_id":"ed0c878b-8b5b-4d89-8752-2827618f0f7e","year":2023},"citing_paper":{"arxiv_id":"2509.06027","last_updated":"2026-04-27T10:03:51Z","snapshot_observed_at":"2026-07-06T22:25:11.957177Z","submitted_at":"2025-09-07T12:06:21Z","title":"DreamAudio: Customized Text-to-Audio Generation with Diffusion Models","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-18T18:26:51.583145Z"},"links":{"citing_paper":"/paper/2509.06027"},"observation_digest":"sha256:205d7b0fe8287215c516a8230160a6190a6674b2adeaa01b569943642e7ec859","observation_id":"2c003200-8fff-4523-9e5d-cb5e4ffe0f69","resolution":{"observed_at":"2026-05-18T18:32:48.154507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.01618","last_updated":"2022-08-02T17:50:36Z","snapshot_observed_at":"2026-08-02T23:40:32.342515Z","submitted_at":"2022-08-02T17:50:36Z","title":"An Image is Worth One Word: Personalizing Text-to-Image Generation using Textual Inversion","version":1},"cited_work":{"arxiv_id":"2208.01618","doi":"10.48550/arxiv.2208.01618","metadata_source":"pith","pith_arxiv_id":"2208.01618","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"An Image is Worth One Word: Personalizing Text-to-Image Generation using Textual Inversion","venue":"cs.CV","work_id":"ca618c21-3ba6-448e-bd86-bcecff3cdeb5","year":2022},"citing_paper":{"arxiv_id":"2509.06027","last_updated":"2026-04-27T10:03:51Z","snapshot_observed_at":"2026-07-06T22:25:11.957177Z","submitted_at":"2025-09-07T12:06:21Z","title":"DreamAudio: Customized Text-to-Audio Generation with Diffusion Models","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-18T18:26:51.583145Z"},"links":{"cited_paper":"/paper/2208.01618","citing_paper":"/paper/2509.06027"},"observation_digest":"sha256:a78230ad0d2042fd16715a645fed28a05fb9adc5a792d5dec7a11458bd2e49d9","observation_id":"2b10d3fb-e10f-48e3-adcc-de599506b002","resolution":{"observed_at":"2026-05-18T18:31:44.689048Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.09522","last_updated":"2023-07-15T15:48:48Z","snapshot_observed_at":"2026-08-06T13:58:29.349698Z","submitted_at":"2023-03-16T17:38:15Z","title":"P+: Extended Textual Conditioning in Text-to-Image Generation","version":3},"cited_work":{"arxiv_id":"2303.09522","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2303.09522","snapshot_observed_at":"2026-07-02T16:07:08.994009Z","title":"p+: Ex- tended textual conditioning in text-to-image generation","venue":null,"work_id":"9b12ea52-1c4d-492a-a8db-b0de42ec81a6","year":2023},"citing_paper":{"arxiv_id":"2509.06027","last_updated":"2026-04-27T10:03:51Z","snapshot_observed_at":"2026-07-06T22:25:11.957177Z","submitted_at":"2025-09-07T12:06:21Z","title":"DreamAudio: Customized Text-to-Audio Generation with Diffusion Models","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-18T18:26:51.583145Z"},"links":{"cited_paper":"/paper/2303.09522","citing_paper":"/paper/2509.06027"},"observation_digest":"sha256:802e192f885420229f03910317085426c96fc3ac6716f5bbaa855f3e4d331bc1","observation_id":"e7b12b0a-e3c5-4b2e-9019-f47054e01250","resolution":{"observed_at":"2026-05-18T18:31:44.684811Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A neural space- time representation for text-to-image personalization","venue":null,"work_id":"338cb999-89ac-4751-9eaf-62fe67b03255","year":2023},"citing_paper":{"arxiv_id":"2509.06027","last_updated":"2026-04-27T10:03:51Z","snapshot_observed_at":"2026-07-06T22:25:11.957177Z","submitted_at":"2025-09-07T12:06:21Z","title":"DreamAudio: Customized Text-to-Audio Generation with Diffusion Models","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-18T18:26:51.583145Z"},"links":{"citing_paper":"/paper/2509.06027"},"observation_digest":"sha256:cede8c0624a0723f311c8024b2798395faafc94b5a30cbc4efcac329e2ae2d1c","observation_id":"a2bd4efc-ed42-4966-8ea1-b39a580a0ea4","resolution":{"observed_at":"2026-05-18T18:32:48.150864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Improving expressivity of GNNs with subgraph- specific factor embedded normalization","venue":null,"work_id":"4680febc-37d0-4eb4-bf9e-475590b4c581","year":2023},"citing_paper":{"arxiv_id":"2509.06027","last_updated":"2026-04-27T10:03:51Z","snapshot_observed_at":"2026-07-06T22:25:11.957177Z","submitted_at":"2025-09-07T12:06:21Z","title":"DreamAudio: Customized Text-to-Audio Generation with Diffusion Models","version":3},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-18T18:26:51.583145Z"},"links":{"citing_paper":"/paper/2509.06027"},"observation_digest":"sha256:94f050417943efcf17478714cc6e73d0998f73bb5777492e97d0902fca35a458","observation_id":"77c16b7b-85b5-4c3c-a481-32fc4b828583","resolution":{"observed_at":"2026-05-18T18:32:48.098795Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"BLIP-Diffusion: Pre-trained subject represen- tation for controllable text-to-image generation and editing","venue":null,"work_id":"f857022d-5390-43a2-9da3-d0bd7464d4fd","year":2024},"citing_paper":{"arxiv_id":"2509.06027","last_updated":"2026-04-27T10:03:51Z","snapshot_observed_at":"2026-07-06T22:25:11.957177Z","submitted_at":"2025-09-07T12:06:21Z","title":"DreamAudio: Customized Text-to-Audio Generation with Diffusion Models","version":3},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-18T18:26:51.583145Z"},"links":{"citing_paper":"/paper/2509.06027"},"observation_digest":"sha256:5f3daf2916a8f8e35961cc22ea7138cbcad738570b1c5e1616f2294b82d804f3","observation_id":"9512552a-da7f-476a-a087-55485301f2cf","resolution":{"observed_at":"2026-05-18T18:32:48.175579Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05125","last_updated":"2023-03-09T09:16:04Z","snapshot_observed_at":"2026-07-06T15:00:31.814027Z","submitted_at":"2023-03-09T09:16:04Z","title":"Cones: Concept Neurons in Diffusion Models for Customized Generation","version":1},"cited_work":{"arxiv_id":"2303.05125","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2303.05125","snapshot_observed_at":"2026-07-03T14:28:32.154047Z","title":"Cones: Concept neurons in diffusion models for customized generation","venue":null,"work_id":"a60025e8-a55a-4f33-8b79-1dcb8a3177b2","year":2023},"citing_paper":{"arxiv_id":"2509.06027","last_updated":"2026-04-27T10:03:51Z","snapshot_observed_at":"2026-07-06T22:25:11.957177Z","submitted_at":"2025-09-07T12:06:21Z","title":"DreamAudio: Customized Text-to-Audio Generation with Diffusion Models","version":3},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-18T18:26:51.583145Z"},"links":{"cited_paper":"/paper/2303.05125","citing_paper":"/paper/2509.06027"},"observation_digest":"sha256:17887336eae140332fe8f89bcf862903fb224bdfbb1dc48d9be04dcb64431f70","observation_id":"1acfa72d-c962-432c-b7c6-241f855422f3","resolution":{"observed_at":"2026-05-18T18:31:44.680433Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"HyperDreamBooth: Hypernetworks for fast personalization of text-to-image models","venue":null,"work_id":"abaac980-adf5-4605-a8a3-594e650a5517","year":2024},"citing_paper":{"arxiv_id":"2509.06027","last_updated":"2026-04-27T10:03:51Z","snapshot_observed_at":"2026-07-06T22:25:11.957177Z","submitted_at":"2025-09-07T12:06:21Z","title":"DreamAudio: Customized Text-to-Audio Generation with Diffusion Models","version":3},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-18T18:26:51.583145Z"},"links":{"citing_paper":"/paper/2509.06027"},"observation_digest":"sha256:6b6f8cef372936bc1ea39656790364f401029a1a5ca9b4621ccad1aa0d7c1b76","observation_id":"c23d6596-551d-4d67-98b4-26d5b4bbaafb","resolution":{"observed_at":"2026-05-18T18:32:48.142967Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Elite: Encoding visual concepts into textual embeddings for customized text-to-image generation","venue":null,"work_id":"fe7a3900-7220-4c36-87b7-3221f5f6678d","year":2023},"citing_paper":{"arxiv_id":"2509.06027","last_updated":"2026-04-27T10:03:51Z","snapshot_observed_at":"2026-07-06T22:25:11.957177Z","submitted_at":"2025-09-07T12:06:21Z","title":"DreamAudio: Customized Text-to-Audio Generation with Diffusion Models","version":3},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-18T18:26:51.583145Z"},"links":{"citing_paper":"/paper/2509.06027"},"observation_digest":"sha256:eb68f5fedb99d1601b0c3feda51c8c239a4510228b5f15108ee37fb1892d616e","observation_id":"42c3d6ff-c572-4bc6-8a63-59e6597a2bcc","resolution":{"observed_at":"2026-05-18T18:32:48.139736Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"FreeCustom: Tuning-free customized image generation for multi- concept composition","venue":null,"work_id":"c9ed1b30-a8b1-4689-ba76-a3379cde99cd","year":2024},"citing_paper":{"arxiv_id":"2509.06027","last_updated":"2026-04-27T10:03:51Z","snapshot_observed_at":"2026-07-06T22:25:11.957177Z","submitted_at":"2025-09-07T12:06:21Z","title":"DreamAudio: Customized Text-to-Audio Generation with Diffusion Models","version":3},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-18T18:26:51.583145Z"},"links":{"citing_paper":"/paper/2509.06027"},"observation_digest":"sha256:91f6e8ede823f4222d7f007870baa5642a8ce43b4efdbfeeedbb757bbae3ad43","observation_id":"7609e581-e592-4a54-a4b9-7e49d379e565","resolution":{"observed_at":"2026-05-18T18:32:48.102619Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"KNN-Diffusion: Image generation via large-scale retrieval","venue":null,"work_id":"71c0f138-a36e-4a29-afd2-cd9f332bf088","year":2023},"citing_paper":{"arxiv_id":"2509.06027","last_updated":"2026-04-27T10:03:51Z","snapshot_observed_at":"2026-07-06T22:25:11.957177Z","submitted_at":"2025-09-07T12:06:21Z","title":"DreamAudio: Customized Text-to-Audio Generation with Diffusion Models","version":3},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-18T18:26:51.583145Z"},"links":{"citing_paper":"/paper/2509.06027"},"observation_digest":"sha256:c1e676dd8a30ef3378791b6a7056b39d4c6910228c3217540fd9ab6befc58a0d","observation_id":"075329c6-7c43-4340-8b2c-a121b080ab41","resolution":{"observed_at":"2026-05-18T18:32:48.135256Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Re-Imagen: Retrieval- augmented text-to-image generator","venue":null,"work_id":"9803a50d-259a-41e2-9cb1-c46b757071b4","year":2023},"citing_paper":{"arxiv_id":"2509.06027","last_updated":"2026-04-27T10:03:51Z","snapshot_observed_at":"2026-07-06T22:25:11.957177Z","submitted_at":"2025-09-07T12:06:21Z","title":"DreamAudio: Customized Text-to-Audio Generation with Diffusion Models","version":3},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-18T18:26:51.583145Z"},"links":{"citing_paper":"/paper/2509.06027"},"observation_digest":"sha256:09df8857cd825b418ed8ecdf12113e9f33357011eb22fd615179e58aa430edbd","observation_id":"459a3b5d-3726-49e3-8aae-289612e1e60d","resolution":{"observed_at":"2026-05-18T18:32:48.131509Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"3eae197e-f27b-43a8-a481-0cdb40efda29","year":2021},"citing_paper":{"arxiv_id":"2509.06027","last_updated":"2026-04-27T10:03:51Z","snapshot_observed_at":"2026-07-06T22:25:11.957177Z","submitted_at":"2025-09-07T12:06:21Z","title":"DreamAudio: Customized Text-to-Audio Generation with Diffusion Models","version":3},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-18T18:26:51.583145Z"},"links":{"citing_paper":"/paper/2509.06027"},"observation_digest":"sha256:7d6dba0facf14f1a1c83465bab04a8222498423bf4907d51bcadc8e377d0ecdd","observation_id":"0467721d-c8af-4480-8ed4-312651b5084a","resolution":{"observed_at":"2026-05-18T18:32:48.128285Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"T-CLAP: Temporal-enhanced contrastive language- audio pretraining","venue":null,"work_id":"d391fa9c-576d-46ec-8fea-d77b4e14f54e","year":2024},"citing_paper":{"arxiv_id":"2509.06027","last_updated":"2026-04-27T10:03:51Z","snapshot_observed_at":"2026-07-06T22:25:11.957177Z","submitted_at":"2025-09-07T12:06:21Z","title":"DreamAudio: Customized Text-to-Audio Generation with Diffusion Models","version":3},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-18T18:26:51.583145Z"},"links":{"citing_paper":"/paper/2509.06027"},"observation_digest":"sha256:1bb52eecddc1280bdab3705c8c6203630e985329b21bf3db07ec512dc411e0c5","observation_id":"0cfe089f-498b-465b-a01e-706c264240d9","resolution":{"observed_at":"2026-05-18T18:32:48.124995Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.07614","last_updated":"2025-01-09T15:48:23Z","snapshot_observed_at":"2026-08-06T19:09:08.527380Z","submitted_at":"2024-09-11T20:54:23Z","title":"FlowSep: Language-Queried Sound Separation with Rectified Flow Matching","version":3},"cited_work":{"arxiv_id":"2409.07614","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.07614","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Flowsep: Language-queried sound separation with rectified flow matching","venue":null,"work_id":"0ebd74d0-7c7b-4d77-b867-e41b8662a35f","year":2024},"citing_paper":{"arxiv_id":"2509.06027","last_updated":"2026-04-27T10:03:51Z","snapshot_observed_at":"2026-07-06T22:25:11.957177Z","submitted_at":"2025-09-07T12:06:21Z","title":"DreamAudio: Customized Text-to-Audio Generation with Diffusion Models","version":3},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-18T18:26:51.583145Z"},"links":{"cited_paper":"/paper/2409.07614","citing_paper":"/paper/2509.06027"},"observation_digest":"sha256:618208022f1b481bf9c1b484c1c0202583c66a84564838f8ca52ff9ad81dead7","observation_id":"49fb1234-c08f-4517-9e35-0a821f1f329f","resolution":{"observed_at":"2026-05-18T18:31:44.676201Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-05T03:40:24.447729Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":"2312.15821","doi":"10.48550/arxiv.2312.15821","metadata_source":"pith","pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Audiobox: Unified audio generation with natural language prompts","venue":"cs.SD","work_id":"f7d2982e-a068-43ac-85f8-a5d3fb631fa2","year":2023},"citing_paper":{"arxiv_id":"2509.06027","last_updated":"2026-04-27T10:03:51Z","snapshot_observed_at":"2026-07-06T22:25:11.957177Z","submitted_at":"2025-09-07T12:06:21Z","title":"DreamAudio: Customized Text-to-Audio Generation with Diffusion Models","version":3},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-18T18:26:51.583145Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2509.06027"},"observation_digest":"sha256:6e3607891eb72e6bba48590d2fce11d283d7f577a6dbf64a1be9c498a70f8d37","observation_id":"5e1be8c0-385a-42bf-8d7f-0378490c6428","resolution":{"observed_at":"2026-05-18T18:31:44.672162Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Freesound technical demo","venue":null,"work_id":"f6092aab-1b41-4bdf-a591-96690b7654fe","year":2013},"citing_paper":{"arxiv_id":"2509.06027","last_updated":"2026-04-27T10:03:51Z","snapshot_observed_at":"2026-07-06T22:25:11.957177Z","submitted_at":"2025-09-07T12:06:21Z","title":"DreamAudio: Customized Text-to-Audio Generation with Diffusion Models","version":3},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-18T18:26:51.583145Z"},"links":{"citing_paper":"/paper/2509.06027"},"observation_digest":"sha256:8a3e9bf6bdef4e96984893fdff22d50b2c26220f45e5c3eca618a4a8e1a4f90b","observation_id":"5fb89305-277b-4cd3-bd86-c922a56c7183","resolution":{"observed_at":"2026-05-18T18:32:48.219526Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deep convolutional neural networks and data augmentation for environmental sound classification","venue":null,"work_id":"4c4b8cb6-ac7f-4776-9870-d34a7c7e8338","year":2017},"citing_paper":{"arxiv_id":"2509.06027","last_updated":"2026-04-27T10:03:51Z","snapshot_observed_at":"2026-07-06T22:25:11.957177Z","submitted_at":"2025-09-07T12:06:21Z","title":"DreamAudio: Customized Text-to-Audio Generation with Diffusion Models","version":3},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-18T18:26:51.583145Z"},"links":{"citing_paper":"/paper/2509.06027"},"observation_digest":"sha256:958cc0308e83edd0960b14743746f99a3ce8604b952c4adb02a60fd21d335ccd","observation_id":"84c444cc-11ee-4fd7-bbce-5413f5578203","resolution":{"observed_at":"2026-05-18T18:32:48.118109Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ESC: dataset for environmental sound classification","venue":null,"work_id":"7354abf8-d87c-460c-b290-83d2c29b4bcb","year":2015},"citing_paper":{"arxiv_id":"2509.06027","last_updated":"2026-04-27T10:03:51Z","snapshot_observed_at":"2026-07-06T22:25:11.957177Z","submitted_at":"2025-09-07T12:06:21Z","title":"DreamAudio: Customized Text-to-Audio Generation with Diffusion Models","version":3},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-18T18:26:51.583145Z"},"links":{"citing_paper":"/paper/2509.06027"},"observation_digest":"sha256:c46ad692308ec1f0f04bfb4152608acb1b10399822feb765a42cec9781c84739","observation_id":"d3f86821-871c-41b9-b778-5ede1e142f95","resolution":{"observed_at":"2026-05-18T18:32:48.113602Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1409.1556","last_updated":"2015-04-10T16:25:04Z","snapshot_observed_at":"2026-07-06T03:53:32.549552Z","submitted_at":"2014-09-04T19:48:04Z","title":"Very Deep Convolutional Networks for Large-Scale Image Recognition","version":6},"cited_work":{"arxiv_id":"1409.1556","doi":"10.48550/arxiv.1409.1556","metadata_source":"pith","pith_arxiv_id":"1409.1556","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Very Deep Convolutional Networks for Large-Scale Image Recognition","venue":"cs.CV","work_id":"1c4b4409-c14b-488b-a086-c57a5aab8a29","year":2014},"citing_paper":{"arxiv_id":"2509.06027","last_updated":"2026-04-27T10:03:51Z","snapshot_observed_at":"2026-07-06T22:25:11.957177Z","submitted_at":"2025-09-07T12:06:21Z","title":"DreamAudio: Customized Text-to-Audio Generation with Diffusion Models","version":3},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-18T18:26:51.583145Z"},"links":{"cited_paper":"/paper/1409.1556","citing_paper":"/paper/2509.06027"},"observation_digest":"sha256:35322c93ef5e63092154b9b7bde539e8de38eb7d6f501c00b1d63da34737e5ea","observation_id":"ce1c6aea-1512-4e81-a7d3-9dee95468717","resolution":{"observed_at":"2026-05-18T18:31:44.667863Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-12T23:51:07.915518+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T23:51:07.915518+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"PANNs: Large-scale pretrained audio neural networks for audio pattern recognition","venue":null,"work_id":"cd7076c7-c2ea-486e-9e57-606be5131f03","year":2020},"citing_paper":{"arxiv_id":"2509.06027","last_updated":"2026-04-27T10:03:51Z","snapshot_observed_at":"2026-07-06T22:25:11.957177Z","submitted_at":"2025-09-07T12:06:21Z","title":"DreamAudio: Customized Text-to-Audio Generation with Diffusion Models","version":3},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-18T18:26:51.583145Z"},"links":{"citing_paper":"/paper/2509.06027"},"observation_digest":"sha256:168e5b0d756fdfed65f2e3ffb630df7df87bf739b9dd9ab83023bacc17bc0e26","observation_id":"76c90938-b373-480b-a22d-50c109742089","resolution":{"observed_at":"2026-05-18T18:32:48.106034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05139","last_updated":"2025-02-07T18:15:57Z","snapshot_observed_at":"2026-07-06T20:33:01.960703Z","submitted_at":"2025-02-07T18:15:57Z","title":"Meta Audiobox Aesthetics: Unified Automatic Quality Assessment for Speech, Music, and Sound","version":1},"cited_work":{"arxiv_id":"2502.05139","doi":"10.48550/arxiv.2502.05139","metadata_source":"pith","pith_arxiv_id":"2502.05139","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Meta Audiobox Aesthetics: Unified Automatic Quality Assessment for Speech, Music, and Sound","venue":"cs.SD","work_id":"7cba92d8-f51e-4a64-8d1d-6d4cf1f56377","year":2025},"citing_paper":{"arxiv_id":"2509.06027","last_updated":"2026-04-27T10:03:51Z","snapshot_observed_at":"2026-07-06T22:25:11.957177Z","submitted_at":"2025-09-07T12:06:21Z","title":"DreamAudio: Customized Text-to-Audio Generation with Diffusion Models","version":3},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-05-18T18:26:51.583145Z"},"links":{"cited_paper":"/paper/2502.05139","citing_paper":"/paper/2509.06027"},"observation_digest":"sha256:fc3421eb39614150fc55390e594a47bceaa9f7ef31b0cdff06b080b94d2fc222","observation_id":"16758743-0c6b-4c28-9a98-1d1d0c64bac3","resolution":{"observed_at":"2026-05-18T18:31:44.663554Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Decoupled weight decay regularization","venue":null,"work_id":"47db615f-95ee-4de1-9908-81926fe359ca","year":2019},"citing_paper":{"arxiv_id":"2509.06027","last_updated":"2026-04-27T10:03:51Z","snapshot_observed_at":"2026-07-06T22:25:11.957177Z","submitted_at":"2025-09-07T12:06:21Z","title":"DreamAudio: Customized Text-to-Audio Generation with Diffusion Models","version":3},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-05-18T18:26:51.583145Z"},"links":{"citing_paper":"/paper/2509.06027"},"observation_digest":"sha256:2d1ad77ce53d420c77037c9713e38e202041b5867b50411de68fb1641e8d9c16","observation_id":"f7f62ca0-6b6e-430a-a541-7281f3a6cea0","resolution":{"observed_at":"2026-05-18T18:32:48.110090Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2509.06027","last_updated":"2026-04-27T10:03:51Z","latest_version":3,"primary_category":"cs.SD","snapshot_observed_at":"2026-07-06T22:25:11.957177Z","submitted_at":"2025-09-07T12:06:21Z","title":"DreamAudio: Customized Text-to-Audio Generation with Diffusion Models"},"reference_resolution":{"displayed":81,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":18,"verified_fuzzy":63},"total_outbound_references":81},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 81 of 81 outbound references and 0 inbound Pith citation observations for arXiv:2509.06027."}