{"as_of":"2026-08-11T14:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:eed13f633a52d4b34bf9928dea27d448b5c9db23900fcf6eeebbfa4280595884","coverage":[{"denominator":81,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":81,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T00:45:19.924941Z","state":"measured"},{"denominator":82,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":82,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T18:29:47.889339Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-10T18:29:48.781610Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.19351","last_updated":"2025-06-30T23:24:17Z","snapshot_observed_at":"2026-08-11T01:06:54.161560Z","submitted_at":"2024-12-26T21:13:12Z","title":"ETTA: Elucidating the Design Space of Text-to-Audio Models","version":2},"cited_work":{"arxiv_id":"2412.19351","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.19351","snapshot_observed_at":"2026-08-10T18:29:48.781610Z","title":"ETTA: Elucidating the Design Space of Text-to-Audio Models","venue":"cs.SD","work_id":"99c7d0a7-9e79-4742-b49e-4103b05056a4","year":2024},"citing_paper":{"arxiv_id":"2501.11311","last_updated":"2025-08-13T01:53:03Z","snapshot_observed_at":"2026-08-10T18:22:45.472222Z","submitted_at":"2025-01-20T07:28:41Z","title":"A2SB: Audio-to-Audio Schrodinger Bridges","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-10T18:29:47.889339Z"},"links":{"cited_paper":"/paper/2412.19351","citing_paper":"/paper/2501.11311"},"observation_digest":"sha256:68b9a4c02a015141f9a2cbbef96f0f51f6039a2f911f3d0f165505383e7fb0d7","observation_id":"0c7febed-d781-4472-864a-180d04a118a1","resolution":{"observed_at":"2026-08-10T18:29:48.785905Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.19351/citation-record","integrity":"/paper/2412.19351/integrity","json":"/paper/2412.19351/citation-record.json","paper":"/paper/2412.19351"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:45:19.665859Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.19351","last_updated":"2025-06-30T23:24:17Z","snapshot_observed_at":"2026-08-11T01:06:54.161560Z","submitted_at":"2024-12-26T21:13:12Z","title":"ETTA: Elucidating the Design Space of Text-to-Audio Models","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-11T00:45:19.665859Z"},"links":{"citing_paper":"/paper/2412.19351"},"observation_digest":"sha256:7421b345a6e60cb0fa2922acc7535bededc05ca47e1d9d42509b5a381bbcded5","observation_id":"38a0f702-0c4e-4914-b2e9-c39311c56b32","resolution":{"observed_at":"2026-08-11T00:45:19.665859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.11325","last_updated":"2023-01-26T18:58:53Z","snapshot_observed_at":"2026-07-06T14:45:00.730733Z","submitted_at":"2023-01-26T18:58:53Z","title":"MusicLM: Generating Music From Text","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.11325","snapshot_observed_at":"2026-08-11T00:45:19.670861Z","title":"Musiclm: Generating music from text","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.19351","last_updated":"2025-06-30T23:24:17Z","snapshot_observed_at":"2026-08-11T01:06:54.161560Z","submitted_at":"2024-12-26T21:13:12Z","title":"ETTA: Elucidating the Design Space of Text-to-Audio Models","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-11T00:45:19.670861Z"},"links":{"cited_paper":"/paper/2301.11325","citing_paper":"/paper/2412.19351"},"observation_digest":"sha256:719798d21d103043c8f51ae758ae906487aee599ddd31cd2599e4cb9737ee829","observation_id":"0e949966-c858-4c17-bdc1-99c277bce3f6","resolution":{"observed_at":"2026-08-11T00:45:19.670861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:45:19.675207Z","title":"Improving image generation with better captions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.19351","last_updated":"2025-06-30T23:24:17Z","snapshot_observed_at":"2026-08-11T01:06:54.161560Z","submitted_at":"2024-12-26T21:13:12Z","title":"ETTA: Elucidating the Design Space of Text-to-Audio Models","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-11T00:45:19.675207Z"},"links":{"citing_paper":"/paper/2412.19351"},"observation_digest":"sha256:964ebc8b995444d01c9e76ea882c46156fd8fdbc9dc24bf0eb630cc3c0217ac4","observation_id":"6bf6b427-dfef-4d06-bac4-0ccc9c0c2280","resolution":{"observed_at":"2026-08-11T00:45:19.675207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:45:20.557167Z","title":"Audiolm: a language modeling approach to audio generation","venue":null,"work_id":"2227a699-076c-4389-a31b-a0b99b89f345","year":2023},"citing_paper":{"arxiv_id":"2412.19351","last_updated":"2025-06-30T23:24:17Z","snapshot_observed_at":"2026-08-11T01:06:54.161560Z","submitted_at":"2024-12-26T21:13:12Z","title":"ETTA: Elucidating the Design Space of Text-to-Audio Models","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-11T00:45:19.678777Z"},"links":{"citing_paper":"/paper/2412.19351"},"observation_digest":"sha256:3f3f1d7c0e5995f20bea591b2c761af1c51e37d48a135582f9e03e63f85fb179","observation_id":"79dc3aeb-1cd7-4c70-99b8-612df2b5bbb8","resolution":{"observed_at":"2026-08-11T00:45:20.560211Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:45:19.682436Z","title":"Vggsound: A large-scale audio-visual dataset","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.19351","last_updated":"2025-06-30T23:24:17Z","snapshot_observed_at":"2026-08-11T01:06:54.161560Z","submitted_at":"2024-12-26T21:13:12Z","title":"ETTA: Elucidating the Design Space of Text-to-Audio Models","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-11T00:45:19.682436Z"},"links":{"citing_paper":"/paper/2412.19351"},"observation_digest":"sha256:765bbc72baea16abaa3662a79788af3de61da13a9faf2a3662e8390a520497d3","observation_id":"b26f449e-3485-4050-89b5-d163165cd51c","resolution":{"observed_at":"2026-08-11T00:45:19.682436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:45:19.686200Z","title":"Scaling instruction-finetuned language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19351","last_updated":"2025-06-30T23:24:17Z","snapshot_observed_at":"2026-08-11T01:06:54.161560Z","submitted_at":"2024-12-26T21:13:12Z","title":"ETTA: Elucidating the Design Space of Text-to-Audio Models","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-11T00:45:19.686200Z"},"links":{"citing_paper":"/paper/2412.19351"},"observation_digest":"sha256:e2e25fba39c1c0d7c633f258593934f14e9a3364231546e1e808110fa6db58a7","observation_id":"6494ed4b-99c6-42fb-9346-7567e34056d1","resolution":{"observed_at":"2026-08-11T00:45:19.686200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:45:19.689887Z","title":"Simple and controllable music generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19351","last_updated":"2025-06-30T23:24:17Z","snapshot_observed_at":"2026-08-11T01:06:54.161560Z","submitted_at":"2024-12-26T21:13:12Z","title":"ETTA: Elucidating the Design Space of Text-to-Audio Models","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-11T00:45:19.689887Z"},"links":{"citing_paper":"/paper/2412.19351"},"observation_digest":"sha256:4670bef81c28a1212ef99321797f347c67c518962b6d3ead9b1d885e069c5307","observation_id":"81419a77-4f44-471c-a957-a01daf729252","resolution":{"observed_at":"2026-08-11T00:45:19.689887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:45:20.532855Z","title":"Look, listen, and learn more: Design choices for deep audio embeddings","venue":null,"work_id":"20f66133-da94-41f1-b9ac-6e04fd5eaccd","year":2019},"citing_paper":{"arxiv_id":"2412.19351","last_updated":"2025-06-30T23:24:17Z","snapshot_observed_at":"2026-08-11T01:06:54.161560Z","submitted_at":"2024-12-26T21:13:12Z","title":"ETTA: Elucidating the Design Space of Text-to-Audio Models","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-11T00:45:19.693569Z"},"links":{"citing_paper":"/paper/2412.19351"},"observation_digest":"sha256:a5aef9d1bee6e067a9376b359261d38feb51ca99708b516c39b1becf962591a8","observation_id":"5318ae30-fa95-4658-8ecb-75886942d59d","resolution":{"observed_at":"2026-08-11T00:45:20.535951Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:45:19.696800Z","title":"Flashattention: Fast and memory-efficient exact attention with io-awareness","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.19351","last_updated":"2025-06-30T23:24:17Z","snapshot_observed_at":"2026-08-11T01:06:54.161560Z","submitted_at":"2024-12-26T21:13:12Z","title":"ETTA: Elucidating the Design Space of Text-to-Audio Models","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-11T00:45:19.696800Z"},"links":{"citing_paper":"/paper/2412.19351"},"observation_digest":"sha256:379d8f8db1459756b64c1028ca885dfec7afe415614693bcb4895c8d254e0649","observation_id":"176eb31a-d2b6-43b9-8be9-8694f0afd531","resolution":{"observed_at":"2026-08-11T00:45:19.696800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:45:19.700431Z","title":"High fidelity neural audio compression","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.19351","last_updated":"2025-06-30T23:24:17Z","snapshot_observed_at":"2026-08-11T01:06:54.161560Z","submitted_at":"2024-12-26T21:13:12Z","title":"ETTA: Elucidating the Design Space of Text-to-Audio Models","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-11T00:45:19.700431Z"},"links":{"citing_paper":"/paper/2412.19351"},"observation_digest":"sha256:dfdd406d32794fbe290a5313ebc63ab2679312fe5063eef327a1a653a254b640","observation_id":"31aeb629-08cb-44a1-b4f6-94cf929500b3","resolution":{"observed_at":"2026-08-11T00:45:19.700431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:45:19.703776Z","title":"Diffusion models beat gans on image synthesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.19351","last_updated":"2025-06-30T23:24:17Z","snapshot_observed_at":"2026-08-11T01:06:54.161560Z","submitted_at":"2024-12-26T21:13:12Z","title":"ETTA: Elucidating the Design Space of Text-to-Audio Models","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-11T00:45:19.703776Z"},"links":{"citing_paper":"/paper/2412.19351"},"observation_digest":"sha256:2ed017aa34ce648d8b370c361b61988d3e04c6ed0f864ff9abe1fb10b50015b4","observation_id":"9ea64442-a818-405c-a818-802cd5450134","resolution":{"observed_at":"2026-08-11T00:45:19.703776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05767","last_updated":"2024-02-06T21:42:03Z","snapshot_observed_at":"2026-08-10T11:18:27.309853Z","submitted_at":"2023-09-11T18:50:21Z","title":"Natural Language Supervision for General-Purpose Audio Representations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05767","snapshot_observed_at":"2026-08-11T00:45:19.707054Z","title":"Natural language supervision for general-purpose audio representations, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.19351","last_updated":"2025-06-30T23:24:17Z","snapshot_observed_at":"2026-08-11T01:06:54.161560Z","submitted_at":"2024-12-26T21:13:12Z","title":"ETTA: Elucidating the Design Space of Text-to-Audio Models","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-11T00:45:19.707054Z"},"links":{"cited_paper":"/paper/2309.05767","citing_paper":"/paper/2412.19351"},"observation_digest":"sha256:b9d2935ac1c7370eb3b6f14c18e58060ffdd107fab1ada2e5d924320dd9da93d","observation_id":"e0fe67b9-e09e-4f8e-bbc3-5ba7e3f01ba1","resolution":{"observed_at":"2026-08-11T00:45:19.707054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:45:19.710257Z","title":"Scaling rectified flow transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19351","last_updated":"2025-06-30T23:24:17Z","snapshot_observed_at":"2026-08-11T01:06:54.161560Z","submitted_at":"2024-12-26T21:13:12Z","title":"ETTA: Elucidating the Design Space of Text-to-Audio Models","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-11T00:45:19.710257Z"},"links":{"citing_paper":"/paper/2412.19351"},"observation_digest":"sha256:1aeabe0732bfc2eee6c1767f6022ec223d4051b230b009ae8f250c1c45f39b48","observation_id":"e2388ac5-ad3e-4afe-92c1-8884cc9c6897","resolution":{"observed_at":"2026-08-11T00:45:19.710257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:45:20.499785Z","title":"Fast timing-conditioned latent audio diffusion","venue":null,"work_id":"ed0ab292-7a84-42d4-b3f8-4093728e4dd0","year":null},"citing_paper":{"arxiv_id":"2412.19351","last_updated":"2025-06-30T23:24:17Z","snapshot_observed_at":"2026-08-11T01:06:54.161560Z","submitted_at":"2024-12-26T21:13:12Z","title":"ETTA: Elucidating the Design Space of Text-to-Audio Models","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-11T00:45:19.712927Z"},"links":{"citing_paper":"/paper/2412.19351"},"observation_digest":"sha256:270a745e638473bf2e1447e78c64af5435e97991d7cbdd5c360cda2042f7f13d","observation_id":"e68c8769-783a-4b13-888c-6a9d48d3cb7d","resolution":{"observed_at":"2026-08-11T00:45:20.503006Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.10301","last_updated":"2024-07-29T14:52:26Z","snapshot_observed_at":"2026-08-08T11:05:56.363956Z","submitted_at":"2024-04-16T06:09:33Z","title":"Long-form music generation with latent diffusion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.10301","snapshot_observed_at":"2026-08-11T00:45:19.716105Z","title":"Long-form music generation with latent diffusion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19351","last_updated":"2025-06-30T23:24:17Z","snapshot_observed_at":"2026-08-11T01:06:54.161560Z","submitted_at":"2024-12-26T21:13:12Z","title":"ETTA: Elucidating the Design Space of Text-to-Audio Models","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-11T00:45:19.716105Z"},"links":{"cited_paper":"/paper/2404.10301","citing_paper":"/paper/2412.19351"},"observation_digest":"sha256:d432fdc5914b34e04abf51d469e947f71d0ba0ded6a4c084886542079bd3fbf2","observation_id":"b4cf4c1b-afda-4ac7-bf37-dbac0f24533b","resolution":{"observed_at":"2026-08-11T00:45:19.716105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14358","last_updated":"2024-07-31T16:22:42Z","snapshot_observed_at":"2026-08-06T16:30:00.821754Z","submitted_at":"2024-07-19T14:40:23Z","title":"Stable Audio Open","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14358","snapshot_observed_at":"2026-08-11T00:45:19.719211Z","title":"Stable audio open","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19351","last_updated":"2025-06-30T23:24:17Z","snapshot_observed_at":"2026-08-11T01:06:54.161560Z","submitted_at":"2024-12-26T21:13:12Z","title":"ETTA: Elucidating the Design Space of Text-to-Audio Models","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-11T00:45:19.719211Z"},"links":{"cited_paper":"/paper/2407.14358","citing_paper":"/paper/2412.19351"},"observation_digest":"sha256:5501de8b53a816d10132aadc34f3f472435f7d5c62324bcc82531c51d44d8f66","observation_id":"1bdeabe8-3bd5-4d4d-8216-902399c5c10b","resolution":{"observed_at":"2026-08-11T00:45:19.719211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00587","last_updated":"2024-12-20T11:22:01Z","snapshot_observed_at":"2026-08-05T15:59:56.280627Z","submitted_at":"2024-09-01T02:43:33Z","title":"FLUX that Plays Music","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00587","snapshot_observed_at":"2026-08-11T00:45:19.722159Z","title":"Flux that plays music","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19351","last_updated":"2025-06-30T23:24:17Z","snapshot_observed_at":"2026-08-11T01:06:54.161560Z","submitted_at":"2024-12-26T21:13:12Z","title":"ETTA: Elucidating the Design Space of Text-to-Audio Models","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-11T00:45:19.722159Z"},"links":{"cited_paper":"/paper/2409.00587","citing_paper":"/paper/2412.19351"},"observation_digest":"sha256:f7b6431280967559d81d26c8f97465bd985d04959a6dcfab3fdc3b7d1441acfd","observation_id":"f7b5a11b-d485-4276-bed9-a1fd84d7200e","resolution":{"observed_at":"2026-08-11T00:45:19.722159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:45:19.725729Z","title":"Audio set: An ontology and human-labeled dataset for audio events","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.19351","last_updated":"2025-06-30T23:24:17Z","snapshot_observed_at":"2026-08-11T01:06:54.161560Z","submitted_at":"2024-12-26T21:13:12Z","title":"ETTA: Elucidating the Design Space of Text-to-Audio Models","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-11T00:45:19.725729Z"},"links":{"citing_paper":"/paper/2412.19351"},"observation_digest":"sha256:8289ffa71c89eac0b0ab7326e6d9bdff44743988a74420c713f0befd172f3f2f","observation_id":"5ba8e9df-13c1-4f38-820a-23d50bc64b5e","resolution":{"observed_at":"2026-08-11T00:45:19.725729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:45:20.483890Z","title":"Text-to-audio generation using instruction guided latent diffusion model","venue":null,"work_id":"a75b84d9-520e-4c49-8b46-a37cb4dacfeb","year":2023},"citing_paper":{"arxiv_id":"2412.19351","last_updated":"2025-06-30T23:24:17Z","snapshot_observed_at":"2026-08-11T01:06:54.161560Z","submitted_at":"2024-12-26T21:13:12Z","title":"ETTA: Elucidating the Design Space of Text-to-Audio Models","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-11T00:45:19.728509Z"},"links":{"citing_paper":"/paper/2412.19351"},"observation_digest":"sha256:1b52e61db3a354b5c29f50a9f6ec9f27694e462f0b16a1673cf0da810848d25f","observation_id":"febe2422-9f4d-443b-8096-6e1f6397f52f","resolution":{"observed_at":"2026-08-11T00:45:20.487304Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10819","last_updated":"2025-06-19T04:44:02Z","snapshot_observed_at":"2026-07-06T19:16:28.014017Z","submitted_at":"2024-09-17T01:27:28Z","title":"EzAudio: Enhancing Text-to-Audio Generation with Efficient Diffusion Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.10819","snapshot_observed_at":"2026-08-11T00:45:19.731205Z","title":"Ezaudio: Enhancing text-to-audio generation with efficient diffusion transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19351","last_updated":"2025-06-30T23:24:17Z","snapshot_observed_at":"2026-08-11T01:06:54.161560Z","submitted_at":"2024-12-26T21:13:12Z","title":"ETTA: Elucidating the Design Space of Text-to-Audio Models","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-11T00:45:19.731205Z"},"links":{"cited_paper":"/paper/2409.10819","citing_paper":"/paper/2412.19351"},"observation_digest":"sha256:132d7c67951c42db9d89b6a28f0bf44641ccdb89a5d43bea67b36a62008dc915","observation_id":"19c8c6b2-6272-46a0-9a48-d7cf7a87aa43","resolution":{"observed_at":"2026-08-11T00:45:19.731205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19388","last_updated":"2025-04-16T17:40:22Z","snapshot_observed_at":"2026-08-10T03:27:46.172940Z","submitted_at":"2024-06-27T17:58:54Z","title":"Taming Data and Transformers for Audio Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19388","snapshot_observed_at":"2026-08-11T00:45:19.734377Z","title":"Taming data and transformers for audio generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19351","last_updated":"2025-06-30T23:24:17Z","snapshot_observed_at":"2026-08-11T01:06:54.161560Z","submitted_at":"2024-12-26T21:13:12Z","title":"ETTA: Elucidating the Design Space of Text-to-Audio Models","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-11T00:45:19.734377Z"},"links":{"cited_paper":"/paper/2406.19388","citing_paper":"/paper/2412.19351"},"observation_digest":"sha256:d22d71f715e64496e1814873fe4ac49f87d59cc1d186294fc56a7a3aba613c17","observation_id":"252aef73-a3a0-4225-925a-957d08ea0c46","resolution":{"observed_at":"2026-08-11T00:45:19.734377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:45:20.474370Z","title":"Efficient diffusion training via min-snr weighting strategy","venue":null,"work_id":"80559501-3936-4e60-98b9-6a9d1cb55411","year":2023},"citing_paper":{"arxiv_id":"2412.19351","last_updated":"2025-06-30T23:24:17Z","snapshot_observed_at":"2026-08-11T01:06:54.161560Z","submitted_at":"2024-12-26T21:13:12Z","title":"ETTA: Elucidating the Design Space of Text-to-Audio Models","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-11T00:45:19.737454Z"},"links":{"citing_paper":"/paper/2412.19351"},"observation_digest":"sha256:56bbe32d21739bd33e4191a2074739b254072329ff54433c653a2176a4d0c4fb","observation_id":"5d3b283e-dbf0-4bbb-bab5-91c692844f7c","resolution":{"observed_at":"2026-08-11T00:45:20.478033Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.08415","last_updated":"2023-06-06T01:53:32Z","snapshot_observed_at":"2026-07-06T05:01:27.910364Z","submitted_at":"2016-06-27T19:20:40Z","title":"Gaussian Error Linear Units (GELUs)","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.08415","snapshot_observed_at":"2026-08-11T00:45:19.740226Z","title":"Gaussian error linear units (gelus)","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.19351","last_updated":"2025-06-30T23:24:17Z","snapshot_observed_at":"2026-08-11T01:06:54.161560Z","submitted_at":"2024-12-26T21:13:12Z","title":"ETTA: Elucidating the Design Space of Text-to-Audio Models","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-11T00:45:19.740226Z"},"links":{"cited_paper":"/paper/1606.08415","citing_paper":"/paper/2412.19351"},"observation_digest":"sha256:f525f25e4f4289d6afcd4ceffc61961f40dc7e5e8decf4858dfeb5b31f86c2c0","observation_id":"ccebd0fd-8948-4f10-be94-e676e7ef8baf","resolution":{"observed_at":"2026-08-11T00:45:19.740226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-11T00:45:19.743569Z","title":"Classifier-free diffusion guidance","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.19351","last_updated":"2025-06-30T23:24:17Z","snapshot_observed_at":"2026-08-11T01:06:54.161560Z","submitted_at":"2024-12-26T21:13:12Z","title":"ETTA: Elucidating the Design Space of Text-to-Audio Models","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-11T00:45:19.743569Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2412.19351"},"observation_digest":"sha256:b02e0588ca00b3905610db686c25f3482affb0c265b98a112880790017b8d493","observation_id":"b5f71e10-a9c7-467a-95ff-7ac8edaac624","resolution":{"observed_at":"2026-08-11T00:45:19.743569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:45:19.747082Z","title":"Denoising diffusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.19351","last_updated":"2025-06-30T23:24:17Z","snapshot_observed_at":"2026-08-11T01:06:54.161560Z","submitted_at":"2024-12-26T21:13:12Z","title":"ETTA: Elucidating the Design Space of Text-to-Audio Models","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-11T00:45:19.747082Z"},"links":{"citing_paper":"/paper/2412.19351"},"observation_digest":"sha256:d21a4f788d3f1d5d3289196c6ac8c5a6355845c55871303ca0f049fff3c1592a","observation_id":"aa9cc778-8f86-43dc-bcdd-3e76505e4626","resolution":{"observed_at":"2026-08-11T00:45:19.747082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18474","last_updated":"2023-05-29T10:41:28Z","snapshot_observed_at":"2026-08-08T06:05:53.280034Z","submitted_at":"2023-05-29T10:41:28Z","title":"Make-An-Audio 2: Temporal-Enhanced Text-to-Audio Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18474","snapshot_observed_at":"2026-08-11T00:45:19.751403Z","title":"Make-an-audio 2: Temporal-enhanced text-to-audio generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.19351","last_updated":"2025-06-30T23:24:17Z","snapshot_observed_at":"2026-08-11T01:06:54.161560Z","submitted_at":"2024-12-26T21:13:12Z","title":"ETTA: Elucidating the Design Space of Text-to-Audio Models","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-11T00:45:19.751403Z"},"links":{"cited_paper":"/paper/2305.18474","citing_paper":"/paper/2412.19351"},"observation_digest":"sha256:de0980bdb0b49dd9058f86b36c5a09976aec4927d3e200184f274189b2852dcf","observation_id":"cce53328-e6b5-416d-8390-c24d099da666","resolution":{"observed_at":"2026-08-11T00:45:19.751403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.03917","last_updated":"2023-03-06T18:09:56Z","snapshot_observed_at":"2026-08-07T18:29:25.356544Z","submitted_at":"2023-02-08T07:27:27Z","title":"Noise2Music: Text-conditioned Music Generation with Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.03917","snapshot_observed_at":"2026-08-11T00:45:19.755042Z","title":"Noise2music: Text-conditioned music generation with diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.19351","last_updated":"2025-06-30T23:24:17Z","snapshot_observed_at":"2026-08-11T01:06:54.161560Z","submitted_at":"2024-12-26T21:13:12Z","title":"ETTA: Elucidating the Design Space of Text-to-Audio Models","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-11T00:45:19.755042Z"},"links":{"cited_paper":"/paper/2302.03917","citing_paper":"/paper/2412.19351"},"observation_digest":"sha256:5a0ae30bb72205376eb68ca17c9437de2854d3b04b0c278ae5ff4dca8d82a911","observation_id":"1ae4b6d1-0c62-45de-b91b-a1aa2d975d35","resolution":{"observed_at":"2026-08-11T00:45:19.755042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:45:20.459360Z","title":"Make-an-audio: Text-to-audio generation with prompt-enhanced diffusion models","venue":null,"work_id":"3bde1c9c-554a-4c26-a9c9-07dc42612402","year":2023},"citing_paper":{"arxiv_id":"2412.19351","last_updated":"2025-06-30T23:24:17Z","snapshot_observed_at":"2026-08-11T01:06:54.161560Z","submitted_at":"2024-12-26T21:13:12Z","title":"ETTA: Elucidating the Design Space of Text-to-Audio Models","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-11T00:45:19.758831Z"},"links":{"citing_paper":"/paper/2412.19351"},"observation_digest":"sha256:f8e7377668f589ab93064d17f9ed3c5b9d15d9b31171341044bd3d0c98554903","observation_id":"9d1d2ba8-4f67-4685-a5c4-a13af216205c","resolution":{"observed_at":"2026-08-11T00:45:20.462914Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:45:19.762087Z","title":"Elucidating the design space of diffusion-based generative models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.19351","last_updated":"2025-06-30T23:24:17Z","snapshot_observed_at":"2026-08-11T01:06:54.161560Z","submitted_at":"2024-12-26T21:13:12Z","title":"ETTA: Elucidating the Design Space of Text-to-Audio Models","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-11T00:45:19.762087Z"},"links":{"citing_paper":"/paper/2412.19351"},"observation_digest":"sha256:8c9c3c88fd8062f703584c0097efc72ee5e68865076241aa1d02c069d432c041","observation_id":"9e6614b3-f58f-4196-894f-eba9dae087ce","resolution":{"observed_at":"2026-08-11T00:45:19.762087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02507","last_updated":"2024-12-19T10:43:11Z","snapshot_observed_at":"2026-07-06T18:25:18.469656Z","submitted_at":"2024-06-04T17:25:59Z","title":"Guiding a Diffusion Model with a Bad Version of Itself","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02507","snapshot_observed_at":"2026-08-11T00:45:19.765403Z","title":"Guiding a diffusion model with a bad version of itself","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19351","last_updated":"2025-06-30T23:24:17Z","snapshot_observed_at":"2026-08-11T01:06:54.161560Z","submitted_at":"2024-12-26T21:13:12Z","title":"ETTA: Elucidating the Design Space of Text-to-Audio Models","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-11T00:45:19.765403Z"},"links":{"cited_paper":"/paper/2406.02507","citing_paper":"/paper/2412.19351"},"observation_digest":"sha256:3d3bf03a95f4a9b5628c5aabbac21825a092052b04ca46033040ef95d79e923d","observation_id":"0e0e4154-1a28-4081-ba3b-4e396ee4a461","resolution":{"observed_at":"2026-08-11T00:45:19.765403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.08466","last_updated":"2019-01-17T16:12:43Z","snapshot_observed_at":"2026-08-08T16:07:44.435146Z","submitted_at":"2018-12-20T10:28:00Z","title":"Fr\\'echet Audio Distance: A Metric for Evaluating Music Enhancement Algorithms","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.08466","snapshot_observed_at":"2026-08-11T00:45:19.768891Z","title":"Fr 'echet audio distance: A metric for evaluating music enhancement algorithms","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.19351","last_updated":"2025-06-30T23:24:17Z","snapshot_observed_at":"2026-08-11T01:06:54.161560Z","submitted_at":"2024-12-26T21:13:12Z","title":"ETTA: Elucidating the Design Space of Text-to-Audio Models","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-11T00:45:19.768891Z"},"links":{"cited_paper":"/paper/1812.08466","citing_paper":"/paper/2412.19351"},"observation_digest":"sha256:fe6dbf3679c9117f89db1af45c79e594f7e65f43a5b26aafaff5886f35f96ff2","observation_id":"c41df97c-8c19-483b-b8f6-bf7d50b0b82f","resolution":{"observed_at":"2026-08-11T00:45:19.768891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:45:19.772358Z","title":"Audiocaps: Generating captions for audios in the wild","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.19351","last_updated":"2025-06-30T23:24:17Z","snapshot_observed_at":"2026-08-11T01:06:54.161560Z","submitted_at":"2024-12-26T21:13:12Z","title":"ETTA: Elucidating the Design Space of Text-to-Audio Models","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-11T00:45:19.772358Z"},"links":{"citing_paper":"/paper/2412.19351"},"observation_digest":"sha256:3bbaea6510e0760cd9eeaa1d40b177c8b482f7aeb2e726965fa312cfc077983d","observation_id":"ae9893b9-a990-452b-b519-6d748d3122ef","resolution":{"observed_at":"2026-08-11T00:45:19.772358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:45:20.437634Z","title":"Enclap: Combining neural audio codec and audio-text joint embedding for automated audio captioning","venue":null,"work_id":"f15f269c-1587-4634-ba9a-b4f3cf4282a4","year":2024},"citing_paper":{"arxiv_id":"2412.19351","last_updated":"2025-06-30T23:24:17Z","snapshot_observed_at":"2026-08-11T01:06:54.161560Z","submitted_at":"2024-12-26T21:13:12Z","title":"ETTA: Elucidating the Design Space of Text-to-Audio Models","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-11T00:45:19.775405Z"},"links":{"citing_paper":"/paper/2412.19351"},"observation_digest":"sha256:bcacc76d69d61227795126dfb3be0a479b98feee649e3a8fcb7c0c6703b91576","observation_id":"c628301e-5e5f-40fe-b64d-e867819ac69a","resolution":{"observed_at":"2026-08-11T00:45:20.441346Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:45:19.778901Z","title":"Variational diffusion models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.19351","last_updated":"2025-06-30T23:24:17Z","snapshot_observed_at":"2026-08-11T01:06:54.161560Z","submitted_at":"2024-12-26T21:13:12Z","title":"ETTA: Elucidating the Design Space of Text-to-Audio Models","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-11T00:45:19.778901Z"},"links":{"citing_paper":"/paper/2412.19351"},"observation_digest":"sha256:c09cbe5abf42004813cc428235a109995f8b0f06362608f7e0510ed8e5f5cc5c","observation_id":"6e596195-28a8-4d5c-a951-c396965664fb","resolution":{"observed_at":"2026-08-11T00:45:19.778901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:45:19.782110Z","title":"Kingma and Max Welling","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2412.19351","last_updated":"2025-06-30T23:24:17Z","snapshot_observed_at":"2026-08-11T01:06:54.161560Z","submitted_at":"2024-12-26T21:13:12Z","title":"ETTA: Elucidating the Design Space of Text-to-Audio Models","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-11T00:45:19.782110Z"},"links":{"citing_paper":"/paper/2412.19351"},"observation_digest":"sha256:2a019ad36a00d6ec92a0a64121ac18c95beaaed390f74ab4e8ba49c9c40f5838","observation_id":"751e8003-63d4-44d2-b6d6-8da49c09525a","resolution":{"observed_at":"2026-08-11T00:45:19.782110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:45:20.416806Z","title":"Panns: Large-scale pretrained audio neural networks for audio pattern recognition","venue":null,"work_id":"1af7ea96-a158-411d-b5c6-085d70b950e6","year":2020},"citing_paper":{"arxiv_id":"2412.19351","last_updated":"2025-06-30T23:24:17Z","snapshot_observed_at":"2026-08-11T01:06:54.161560Z","submitted_at":"2024-12-26T21:13:12Z","title":"ETTA: Elucidating the Design Space of Text-to-Audio Models","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-11T00:45:19.785253Z"},"links":{"citing_paper":"/paper/2412.19351"},"observation_digest":"sha256:74b9b9d521996f1a0118de6a0f3a67ebcbfc5b67abd4dd6d1e3f89117bd10b34","observation_id":"f2b717ad-6b0c-4f07-b1c9-d715030bd0c4","resolution":{"observed_at":"2026-08-11T00:45:20.420576Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:45:19.788372Z","title":"Diffwave: A versatile diffusion model for audio synthesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.19351","last_updated":"2025-06-30T23:24:17Z","snapshot_observed_at":"2026-08-11T01:06:54.161560Z","submitted_at":"2024-12-26T21:13:12Z","title":"ETTA: Elucidating the Design Space of Text-to-Audio Models","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-11T00:45:19.788372Z"},"links":{"citing_paper":"/paper/2412.19351"},"observation_digest":"sha256:9029e41de9620a1484210c01ac96536c2653e83784badfbe732ac245e1dbdf41","observation_id":"4f4cc80e-6c47-4dd4-b606-13ce4387c1ed","resolution":{"observed_at":"2026-08-11T00:45:19.788372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:45:20.401306Z","title":"Audio flamingo: A novel audio language model with few-shot learning and dialogue abilities","venue":null,"work_id":"1340f38f-9081-4a48-8771-a3d2eda09680","year":2024},"citing_paper":{"arxiv_id":"2412.19351","last_updated":"2025-06-30T23:24:17Z","snapshot_observed_at":"2026-08-11T01:06:54.161560Z","submitted_at":"2024-12-26T21:13:12Z","title":"ETTA: Elucidating the Design Space of Text-to-Audio Models","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-11T00:45:19.791322Z"},"links":{"citing_paper":"/paper/2412.19351"},"observation_digest":"sha256:0ad93f630e1c86e544a53624925eacbf2f93c779819d9c68987e660900fac822","observation_id":"06599a77-24f1-49a4-8e98-00979612c6cb","resolution":{"observed_at":"2026-08-11T00:45:20.404608Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15487","last_updated":"2024-07-08T20:15:33Z","snapshot_observed_at":"2026-07-06T18:35:08.874127Z","submitted_at":"2024-06-18T00:02:15Z","title":"Improving Text-To-Audio Models with Synthetic Captions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15487","snapshot_observed_at":"2026-08-11T00:45:19.794354Z","title":"Improving text-to-audio models with synthetic captions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19351","last_updated":"2025-06-30T23:24:17Z","snapshot_observed_at":"2026-08-11T01:06:54.161560Z","submitted_at":"2024-12-26T21:13:12Z","title":"ETTA: Elucidating the Design Space of Text-to-Audio Models","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-11T00:45:19.794354Z"},"links":{"cited_paper":"/paper/2406.15487","citing_paper":"/paper/2412.19351"},"observation_digest":"sha256:8d424301c1386269d22a53510c74b703486922853b8920a44f5c890af30bcba7","observation_id":"b58e351c-68d9-4742-a8bd-d02e5e6ce317","resolution":{"observed_at":"2026-08-11T00:45:19.794354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:45:19.797269Z","title":"Efficient training of audio transformers with patchout","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.19351","last_updated":"2025-06-30T23:24:17Z","snapshot_observed_at":"2026-08-11T01:06:54.161560Z","submitted_at":"2024-12-26T21:13:12Z","title":"ETTA: Elucidating the Design Space of Text-to-Audio Models","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-11T00:45:19.797269Z"},"links":{"citing_paper":"/paper/2412.19351"},"observation_digest":"sha256:677ada1d4e33f3e26c37e7e2d7a04b7d60f44d82e188395e7eb4fdc5ce91fdb5","observation_id":"8c75c390-6775-4c6a-aa0b-9ae16fe73eed","resolution":{"observed_at":"2026-08-11T00:45:19.797269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15352","last_updated":"2023-03-05T09:14:16Z","snapshot_observed_at":"2026-08-07T16:54:38.689558Z","submitted_at":"2022-09-30T10:17:05Z","title":"AudioGen: Textually Guided Audio Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.15352","snapshot_observed_at":"2026-08-11T00:45:19.799997Z","title":"Audiogen: Textually guided audio generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.19351","last_updated":"2025-06-30T23:24:17Z","snapshot_observed_at":"2026-08-11T01:06:54.161560Z","submitted_at":"2024-12-26T21:13:12Z","title":"ETTA: Elucidating the Design Space of Text-to-Audio Models","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-11T00:45:19.799997Z"},"links":{"cited_paper":"/paper/2209.15352","citing_paper":"/paper/2412.19351"},"observation_digest":"sha256:6fef83669922ff7b474287d401e0f4490196c1187f8bfb8f9ecee65569326c0b","observation_id":"40aa2056-1b35-4ee2-bf0d-1365d5d79202","resolution":{"observed_at":"2026-08-11T00:45:19.799997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07724","last_updated":"2024-11-06T14:29:36Z","snapshot_observed_at":"2026-08-10T01:37:20.737480Z","submitted_at":"2024-04-11T13:16:47Z","title":"Applying Guidance in a Limited Interval Improves Sample and Distribution Quality in Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07724","snapshot_observed_at":"2026-08-11T00:45:19.803276Z","title":"Applying guidance in a limited interval improves sample and distribution quality in diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19351","last_updated":"2025-06-30T23:24:17Z","snapshot_observed_at":"2026-08-11T01:06:54.161560Z","submitted_at":"2024-12-26T21:13:12Z","title":"ETTA: Elucidating the Design Space of Text-to-Audio Models","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-11T00:45:19.803276Z"},"links":{"cited_paper":"/paper/2404.07724","citing_paper":"/paper/2412.19351"},"observation_digest":"sha256:26876d5f18fb2845fb0364bf3c02cab3fa1cc7b870bd2b29061fbf08b40246fa","observation_id":"15833d4c-6bf7-41c5-a062-7be1a6f70a18","resolution":{"observed_at":"2026-08-11T00:45:19.803276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:45:20.391938Z","title":"Efficient neural music generation","venue":null,"work_id":"0c5d3fb9-d1ca-43c6-8f9e-904d35a459ca","year":2024},"citing_paper":{"arxiv_id":"2412.19351","last_updated":"2025-06-30T23:24:17Z","snapshot_observed_at":"2026-08-11T01:06:54.161560Z","submitted_at":"2024-12-26T21:13:12Z","title":"ETTA: Elucidating the Design Space of Text-to-Audio Models","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-11T00:45:19.806092Z"},"links":{"citing_paper":"/paper/2412.19351"},"observation_digest":"sha256:934e3786671cbd571711da0f429081be6dc9dac4995abee5a53631bc5a5685ac","observation_id":"434b7642-ce13-487e-9721-c7a5fbee995b","resolution":{"observed_at":"2026-08-11T00:45:20.395195Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.03648","last_updated":"2024-10-16T14:24:53Z","snapshot_observed_at":"2026-08-11T07:05:30.267326Z","submitted_at":"2024-07-04T05:38:49Z","title":"High Fidelity Text-Guided Music Editing via Single-Stage Flow Matching","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.03648","snapshot_observed_at":"2026-08-11T00:45:19.809107Z","title":"High fidelity text-guided music generation and editing via single-stage flow matching","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19351","last_updated":"2025-06-30T23:24:17Z","snapshot_observed_at":"2026-08-11T01:06:54.161560Z","submitted_at":"2024-12-26T21:13:12Z","title":"ETTA: Elucidating the Design Space of Text-to-Audio Models","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-11T00:45:19.809107Z"},"links":{"cited_paper":"/paper/2407.03648","citing_paper":"/paper/2412.19351"},"observation_digest":"sha256:93402ec419bfc64c605b5eb193ef9e14ed8c94bcaab143ff6854ff2926227de4","observation_id":"d3f9a6ff-0611-4c05-bf12-fc1470453737","resolution":{"observed_at":"2026-08-11T00:45:19.809107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:45:19.812514Z","title":"Bigvgan: A universal neural vocoder with large-scale training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.19351","last_updated":"2025-06-30T23:24:17Z","snapshot_observed_at":"2026-08-11T01:06:54.161560Z","submitted_at":"2024-12-26T21:13:12Z","title":"ETTA: Elucidating the Design Space of Text-to-Audio Models","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-11T00:45:19.812514Z"},"links":{"citing_paper":"/paper/2412.19351"},"observation_digest":"sha256:01207a84391164fa029505d676d62edafc51bb898817eb345399cc1c62efcccd","observation_id":"c8ce5c63-f03b-446b-9ab1-a5b6fca078ee","resolution":{"observed_at":"2026-08-11T00:45:19.812514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15863","last_updated":"2025-06-17T13:38:59Z","snapshot_observed_at":"2026-08-07T07:14:49.181102Z","submitted_at":"2024-05-24T18:09:27Z","title":"Quality-aware Masked Diffusion Transformer for Enhanced Music Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.15863","snapshot_observed_at":"2026-08-11T00:45:19.815204Z","title":"Quality-aware masked diffusion transformer for enhanced music generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19351","last_updated":"2025-06-30T23:24:17Z","snapshot_observed_at":"2026-08-11T01:06:54.161560Z","submitted_at":"2024-12-26T21:13:12Z","title":"ETTA: Elucidating the Design Space of Text-to-Audio Models","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-11T00:45:19.815204Z"},"links":{"cited_paper":"/paper/2405.15863","citing_paper":"/paper/2412.19351"},"observation_digest":"sha256:62f10132d7efabc37f7e453bc32509b2bcd4587b9a46a04dcc8a47cb431f9982","observation_id":"2e89695d-468a-438f-ac72-036c0e3b04b3","resolution":{"observed_at":"2026-08-11T00:45:19.815204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:45:19.818270Z","title":"Jen-1: Text-guided universal music generation with omnidirectional diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19351","last_updated":"2025-06-30T23:24:17Z","snapshot_observed_at":"2026-08-11T01:06:54.161560Z","submitted_at":"2024-12-26T21:13:12Z","title":"ETTA: Elucidating the Design Space of Text-to-Audio Models","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-11T00:45:19.818270Z"},"links":{"citing_paper":"/paper/2412.19351"},"observation_digest":"sha256:36e242143f1a98b8da9b8898e9b7749b31a4ebba3d2f4fdf591e2e02bf162e58","observation_id":"0309a060-3e82-41b2-b31b-7b2bd48de87e","resolution":{"observed_at":"2026-08-11T00:45:19.818270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-11T00:45:19.821204Z","title":"Flow matching for generative modeling","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.19351","last_updated":"2025-06-30T23:24:17Z","snapshot_observed_at":"2026-08-11T01:06:54.161560Z","submitted_at":"2024-12-26T21:13:12Z","title":"ETTA: Elucidating the Design Space of Text-to-Audio Models","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-11T00:45:19.821204Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2412.19351"},"observation_digest":"sha256:47fedee8374e2480f106e4d481a8252e90f18bd2be0bd513e089e42f66beb6d8","observation_id":"2631d82b-9bc2-4180-ad83-bca00b1c4835","resolution":{"observed_at":"2026-08-11T00:45:19.821204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.16338","last_updated":"2024-03-25T18:18:40Z","snapshot_observed_at":"2026-07-06T16:38:09.978805Z","submitted_at":"2023-10-25T03:40:50Z","title":"Generative Pre-training for Speech with Flow Matching","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.16338","snapshot_observed_at":"2026-08-11T00:45:19.824145Z","title":"Generative pre-training for speech with flow matching","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.19351","last_updated":"2025-06-30T23:24:17Z","snapshot_observed_at":"2026-08-11T01:06:54.161560Z","submitted_at":"2024-12-26T21:13:12Z","title":"ETTA: Elucidating the Design Space of Text-to-Audio Models","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-11T00:45:19.824145Z"},"links":{"cited_paper":"/paper/2310.16338","citing_paper":"/paper/2412.19351"},"observation_digest":"sha256:f00bc11f91c7edf2e2ebce8697d331c8325a9988d7348bb58b4f84b24fb4fc0d","observation_id":"eb2046cb-c949-4ddb-b41b-20cec4608d34","resolution":{"observed_at":"2026-08-11T00:45:19.824145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:45:20.370118Z","title":"Audioldm: Text-to-audio generation with latent diffusion models","venue":null,"work_id":"09bc1104-3f40-4b76-b3c8-df83ad144903","year":2023},"citing_paper":{"arxiv_id":"2412.19351","last_updated":"2025-06-30T23:24:17Z","snapshot_observed_at":"2026-08-11T01:06:54.161560Z","submitted_at":"2024-12-26T21:13:12Z","title":"ETTA: Elucidating the Design Space of Text-to-Audio Models","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-11T00:45:19.827269Z"},"links":{"citing_paper":"/paper/2412.19351"},"observation_digest":"sha256:f8a9865cff790b4886d84f446079e304d30ebd9acef48470717d63880e09fe8d","observation_id":"4a28a237-5297-4e46-b9a9-8cea9619ae13","resolution":{"observed_at":"2026-08-11T00:45:20.373890Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:45:19.830318Z","title":"Audioldm 2: Learning holistic audio generation with self-supervised pretraining","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19351","last_updated":"2025-06-30T23:24:17Z","snapshot_observed_at":"2026-08-11T01:06:54.161560Z","submitted_at":"2024-12-26T21:13:12Z","title":"ETTA: Elucidating the Design Space of Text-to-Audio Models","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-11T00:45:19.830318Z"},"links":{"citing_paper":"/paper/2412.19351"},"observation_digest":"sha256:6a6b90eb0168df80cd29022510d93ad6fabb07f281c87630e3a70cf1fea24e6c","observation_id":"45117569-e7f0-4991-bf7d-81a43543f2ee","resolution":{"observed_at":"2026-08-11T00:45:19.830318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-09T20:34:52.923500Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-11T00:45:19.833498Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.19351","last_updated":"2025-06-30T23:24:17Z","snapshot_observed_at":"2026-08-11T01:06:54.161560Z","submitted_at":"2024-12-26T21:13:12Z","title":"ETTA: Elucidating the Design Space of Text-to-Audio Models","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-11T00:45:19.833498Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2412.19351"},"observation_digest":"sha256:6ccf4412426cdc7f6c937f454c960d22cebf62cd2a3056ba9b58c6754e1333ea","observation_id":"0f419579-be39-41dd-aa00-00ed85b49656","resolution":{"observed_at":"2026-08-11T00:45:19.833498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09956","last_updated":"2024-07-17T16:17:50Z","snapshot_observed_at":"2026-07-06T18:00:30.424554Z","submitted_at":"2024-04-15T17:31:22Z","title":"Tango 2: Aligning Diffusion-based Text-to-Audio Generations through Direct Preference Optimization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09956","snapshot_observed_at":"2026-08-11T00:45:19.837772Z","title":"Tango 2: Aligning diffusion-based text-to-audio generations through direct preference optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19351","last_updated":"2025-06-30T23:24:17Z","snapshot_observed_at":"2026-08-11T01:06:54.161560Z","submitted_at":"2024-12-26T21:13:12Z","title":"ETTA: Elucidating the Design Space of Text-to-Audio Models","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-11T00:45:19.837772Z"},"links":{"cited_paper":"/paper/2404.09956","citing_paper":"/paper/2412.19351"},"observation_digest":"sha256:601ad44572966f3a1038b1be5a671cebb276c08c2e685eb14a5c66d1a3a45ba1","observation_id":"79d787dc-de0b-4ed0-b48f-810684e6a027","resolution":{"observed_at":"2026-08-11T00:45:19.837772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:45:20.356270Z","title":"The song describer dataset: a corpus of audio captions for music-and-language evaluation","venue":null,"work_id":"2cb7ed70-68b9-4edc-b871-cce4f319e02d","year":2023},"citing_paper":{"arxiv_id":"2412.19351","last_updated":"2025-06-30T23:24:17Z","snapshot_observed_at":"2026-08-11T01:06:54.161560Z","submitted_at":"2024-12-26T21:13:12Z","title":"ETTA: Elucidating the Design Space of Text-to-Audio Models","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-11T00:45:19.841204Z"},"links":{"citing_paper":"/paper/2412.19351"},"observation_digest":"sha256:da76c5453b8eb41b9332e66d6879422666500f7c84e2a2e780af99ed653095b9","observation_id":"e98e2b40-e347-4d99-a31a-ac6cb5924f74","resolution":{"observed_at":"2026-08-11T00:45:20.359446Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:45:19.844437Z","title":"Wavcaps: A chatgpt-assisted weakly-labelled audio captioning dataset for audio-language multimodal research","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19351","last_updated":"2025-06-30T23:24:17Z","snapshot_observed_at":"2026-08-11T01:06:54.161560Z","submitted_at":"2024-12-26T21:13:12Z","title":"ETTA: Elucidating the Design Space of Text-to-Audio Models","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-11T00:45:19.844437Z"},"links":{"citing_paper":"/paper/2412.19351"},"observation_digest":"sha256:363cccbebc83acb2b0054bb934847e4939e28e34d2d8dcc080b3a4e6e5363d66","observation_id":"0ddf404a-7328-4679-9b8f-bcc20eacfdc9","resolution":{"observed_at":"2026-08-11T00:45:19.844437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08355","last_updated":"2024-06-03T07:56:23Z","snapshot_observed_at":"2026-08-06T19:39:54.540216Z","submitted_at":"2023-11-14T17:54:38Z","title":"Mustango: Toward Controllable Text-to-Music Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08355","snapshot_observed_at":"2026-08-11T00:45:19.847605Z","title":"Mustango: Toward controllable text-to-music generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.19351","last_updated":"2025-06-30T23:24:17Z","snapshot_observed_at":"2026-08-11T01:06:54.161560Z","submitted_at":"2024-12-26T21:13:12Z","title":"ETTA: Elucidating the Design Space of Text-to-Audio Models","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-11T00:45:19.847605Z"},"links":{"cited_paper":"/paper/2311.08355","citing_paper":"/paper/2412.19351"},"observation_digest":"sha256:1ec60b895cfce7f348fe55578212e25bdd0d80ad096f8b3f3266a60e4e02521e","observation_id":"bc78afad-bff9-43ca-be72-4027c2db333b","resolution":{"observed_at":"2026-08-11T00:45:19.847605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.03740","snapshot_observed_at":"2026-08-11T00:45:19.851038Z","title":"Mixed precision training","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.19351","last_updated":"2025-06-30T23:24:17Z","snapshot_observed_at":"2026-08-11T01:06:54.161560Z","submitted_at":"2024-12-26T21:13:12Z","title":"ETTA: Elucidating the Design Space of Text-to-Audio Models","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-11T00:45:19.851038Z"},"links":{"cited_paper":"/paper/1710.03740","citing_paper":"/paper/2412.19351"},"observation_digest":"sha256:c402ebdf8bf5b2a329a9cde490adc7dbc8d076e064a23812e98f401ca43a16d5","observation_id":"c9baac49-05ac-4991-b9ee-b7bbb970e9a0","resolution":{"observed_at":"2026-08-11T00:45:19.851038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:45:20.342008Z","title":"Improving multimodal datasets with image captioning","venue":null,"work_id":"e34491dc-bb7a-4f3b-9684-0b5098ae349e","year":2024},"citing_paper":{"arxiv_id":"2412.19351","last_updated":"2025-06-30T23:24:17Z","snapshot_observed_at":"2026-08-11T01:06:54.161560Z","submitted_at":"2024-12-26T21:13:12Z","title":"ETTA: Elucidating the Design Space of Text-to-Audio Models","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-11T00:45:19.854997Z"},"links":{"citing_paper":"/paper/2412.19351"},"observation_digest":"sha256:4de5dbe5d3fbf9c588d5923b32e81035b8b3ca05983b9b5c25168890eb8c5bfe","observation_id":"877599ef-0ac9-4456-b80b-34f271828853","resolution":{"observed_at":"2026-08-11T00:45:20.345071Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:45:20.332974Z","title":"Gpt-4o: A powerful multimodal language model","venue":null,"work_id":"08d3e65a-834a-45b9-b179-41c3f11dcdb6","year":2024},"citing_paper":{"arxiv_id":"2412.19351","last_updated":"2025-06-30T23:24:17Z","snapshot_observed_at":"2026-08-11T01:06:54.161560Z","submitted_at":"2024-12-26T21:13:12Z","title":"ETTA: Elucidating the Design Space of Text-to-Audio Models","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-11T00:45:19.858283Z"},"links":{"citing_paper":"/paper/2412.19351"},"observation_digest":"sha256:d142c9d0f72d3f6cf9349d8ce330f08d833e61a00cb38a0499f370429d57d72a","observation_id":"15d34930-2554-46a9-b17d-d1ef2d63eac5","resolution":{"observed_at":"2026-08-11T00:45:20.335939Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:45:19.861427Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.19351","last_updated":"2025-06-30T23:24:17Z","snapshot_observed_at":"2026-08-11T01:06:54.161560Z","submitted_at":"2024-12-26T21:13:12Z","title":"ETTA: Elucidating the Design Space of Text-to-Audio Models","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-11T00:45:19.861427Z"},"links":{"citing_paper":"/paper/2412.19351"},"observation_digest":"sha256:427bacc75fb6b95ef82dd70abfbf10f35c2c6be1730473a77da7187235f3b51b","observation_id":"4241cba8-4b8e-4b62-86f5-7adaaf966ad7","resolution":{"observed_at":"2026-08-11T00:45:19.861427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:45:19.864621Z","title":"Language models are unsupervised multitask learners","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.19351","last_updated":"2025-06-30T23:24:17Z","snapshot_observed_at":"2026-08-11T01:06:54.161560Z","submitted_at":"2024-12-26T21:13:12Z","title":"ETTA: Elucidating the Design Space of Text-to-Audio Models","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-11T00:45:19.864621Z"},"links":{"citing_paper":"/paper/2412.19351"},"observation_digest":"sha256:472e11c1045a23868135897ff56222051450ed3e8b24c6d2b1c9f0e0746d2114","observation_id":"5f5c2ea2-defe-4769-a2ad-5c8fb70ec2be","resolution":{"observed_at":"2026-08-11T00:45:19.864621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:45:19.867788Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.19351","last_updated":"2025-06-30T23:24:17Z","snapshot_observed_at":"2026-08-11T01:06:54.161560Z","submitted_at":"2024-12-26T21:13:12Z","title":"ETTA: Elucidating the Design Space of Text-to-Audio Models","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-11T00:45:19.867788Z"},"links":{"citing_paper":"/paper/2412.19351"},"observation_digest":"sha256:867e30fc6642fd3f5fbb6c0d6f65e4a9db050e051b02f0cc2b73434fe5601e3d","observation_id":"f88baeb1-f7a2-4f7f-baf7-a6b3bdc47293","resolution":{"observed_at":"2026-08-11T00:45:19.867788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:45:20.305684Z","title":"The musdb18 corpus for music separation","venue":null,"work_id":"065dcf00-a436-42d2-9167-79d2a0ce5ecf","year":2017},"citing_paper":{"arxiv_id":"2412.19351","last_updated":"2025-06-30T23:24:17Z","snapshot_observed_at":"2026-08-11T01:06:54.161560Z","submitted_at":"2024-12-26T21:13:12Z","title":"ETTA: Elucidating the Design Space of Text-to-Audio Models","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-11T00:45:19.870873Z"},"links":{"citing_paper":"/paper/2412.19351"},"observation_digest":"sha256:9a365569acff00a52f04ce493e3d88008ec01e9ccf24350f2cf4b9c231d4deff","observation_id":"edb6bce3-9d89-404a-97da-5f7c813628e6","resolution":{"observed_at":"2026-08-11T00:45:20.309155Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:45:19.873975Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.19351","last_updated":"2025-06-30T23:24:17Z","snapshot_observed_at":"2026-08-11T01:06:54.161560Z","submitted_at":"2024-12-26T21:13:12Z","title":"ETTA: Elucidating the Design Space of Text-to-Audio Models","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-11T00:45:19.873975Z"},"links":{"citing_paper":"/paper/2412.19351"},"observation_digest":"sha256:ff26b410ebc81c42ec60bc75762179e5c8face2b988d1a94b7dafcd58bd53f49","observation_id":"28c4716d-3ec0-4b15-b5aa-a296b03921c1","resolution":{"observed_at":"2026-08-11T00:45:19.873975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.00512","last_updated":"2022-06-07T09:17:35Z","snapshot_observed_at":"2026-08-09T18:51:51.917654Z","submitted_at":"2022-02-01T16:07:25Z","title":"Progressive Distillation for Fast Sampling of Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.00512","snapshot_observed_at":"2026-08-11T00:45:19.877014Z","title":"Progressive distillation for fast sampling of diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.19351","last_updated":"2025-06-30T23:24:17Z","snapshot_observed_at":"2026-08-11T01:06:54.161560Z","submitted_at":"2024-12-26T21:13:12Z","title":"ETTA: Elucidating the Design Space of Text-to-Audio Models","version":2},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-11T00:45:19.877014Z"},"links":{"cited_paper":"/paper/2202.00512","citing_paper":"/paper/2412.19351"},"observation_digest":"sha256:5633d31622a6a3bd87ecc0d480f79d8986818ec4bb5d5c29dd683206f7444f02","observation_id":"b1f96203-c3cf-455f-b6a5-cdc7bcb28adc","resolution":{"observed_at":"2026-08-11T00:45:19.877014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:45:20.288122Z","title":"Mo \\^u sai: Efficient text-to-music diffusion models","venue":null,"work_id":"b8d29450-1a80-4297-b03c-1ab854625455","year":2024},"citing_paper":{"arxiv_id":"2412.19351","last_updated":"2025-06-30T23:24:17Z","snapshot_observed_at":"2026-08-11T01:06:54.161560Z","submitted_at":"2024-12-26T21:13:12Z","title":"ETTA: Elucidating the Design Space of Text-to-Audio Models","version":2},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-11T00:45:19.880569Z"},"links":{"citing_paper":"/paper/2412.19351"},"observation_digest":"sha256:c4dc1a4733c598a6b19061bff3cc4045d463e8195ad8983f11a00a92e65a15c6","observation_id":"b379d49e-be66-494c-a4a4-9a68ceeb91e4","resolution":{"observed_at":"2026-08-11T00:45:20.292206Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:45:19.883342Z","title":"Score-based generative modeling through stochastic differential equations","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.19351","last_updated":"2025-06-30T23:24:17Z","snapshot_observed_at":"2026-08-11T01:06:54.161560Z","submitted_at":"2024-12-26T21:13:12Z","title":"ETTA: Elucidating the Design Space of Text-to-Audio Models","version":2},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-11T00:45:19.883342Z"},"links":{"citing_paper":"/paper/2412.19351"},"observation_digest":"sha256:6441c9eaa361e57fde4efd9c1c06dc51c2b3ba0c33857b05961b270942c0b25f","observation_id":"3010030e-b093-4861-8e03-ce84cb7aea29","resolution":{"observed_at":"2026-08-11T00:45:19.883342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:45:20.272280Z","title":"auraloss: Audio focused loss functions in pytorch","venue":null,"work_id":"e62026c3-304a-43ee-8132-15781e89a7d7","year":2020},"citing_paper":{"arxiv_id":"2412.19351","last_updated":"2025-06-30T23:24:17Z","snapshot_observed_at":"2026-08-11T01:06:54.161560Z","submitted_at":"2024-12-26T21:13:12Z","title":"ETTA: Elucidating the Design Space of Text-to-Audio Models","version":2},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-11T00:45:19.885821Z"},"links":{"citing_paper":"/paper/2412.19351"},"observation_digest":"sha256:4f932e191d33054893073e0c0418c348130bc1b8176bf20e3dcc2521f06303da","observation_id":"846d28ab-e886-49cc-bb39-4d6a2735d0ed","resolution":{"observed_at":"2026-08-11T00:45:20.275969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:45:20.259167Z","title":"Automatic multitrack mixing with a differentiable mixing console of neural audio effects","venue":null,"work_id":"0a138691-aee5-456d-956c-56f8ed7fbc8f","year":2021},"citing_paper":{"arxiv_id":"2412.19351","last_updated":"2025-06-30T23:24:17Z","snapshot_observed_at":"2026-08-11T01:06:54.161560Z","submitted_at":"2024-12-26T21:13:12Z","title":"ETTA: Elucidating the Design Space of Text-to-Audio Models","version":2},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-11T00:45:19.888546Z"},"links":{"citing_paper":"/paper/2412.19351"},"observation_digest":"sha256:04852aac586957819298cac0928f8bfdd730e525f4666a091e40e21607a702e6","observation_id":"0160a295-6494-4ec1-8bb8-2b88f4d68bb1","resolution":{"observed_at":"2026-08-11T00:45:20.264696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:45:19.891408Z","title":"Roformer: Enhanced transformer with rotary position embedding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19351","last_updated":"2025-06-30T23:24:17Z","snapshot_observed_at":"2026-08-11T01:06:54.161560Z","submitted_at":"2024-12-26T21:13:12Z","title":"ETTA: Elucidating the Design Space of Text-to-Audio Models","version":2},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-11T00:45:19.891408Z"},"links":{"citing_paper":"/paper/2412.19351"},"observation_digest":"sha256:bed6a30743695bb21542b702167438d54a10073f2b370b7f1ef51059ba2bbfda","observation_id":"7a763d9b-71cb-4685-a43b-a7803e2a0743","resolution":{"observed_at":"2026-08-11T00:45:19.891408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00482","last_updated":"2024-03-11T14:27:48Z","snapshot_observed_at":"2026-07-06T14:47:04.817434Z","submitted_at":"2023-02-01T14:47:17Z","title":"Improving and generalizing flow-based generative models with minibatch optimal transport","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00482","snapshot_observed_at":"2026-08-11T00:45:19.894207Z","title":"Conditional flow matching: Simulation-free dynamic optimal transport","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.19351","last_updated":"2025-06-30T23:24:17Z","snapshot_observed_at":"2026-08-11T01:06:54.161560Z","submitted_at":"2024-12-26T21:13:12Z","title":"ETTA: Elucidating the Design Space of Text-to-Audio Models","version":2},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-11T00:45:19.894207Z"},"links":{"cited_paper":"/paper/2302.00482","citing_paper":"/paper/2412.19351"},"observation_digest":"sha256:648d448341ae77eb88320d8988a282c02326d37b69dc509c528d2206b149a72c","observation_id":"2ded199f-618f-4ce6-b8dd-9ee467885d8a","resolution":{"observed_at":"2026-08-11T00:45:19.894207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:45:19.897329Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.19351","last_updated":"2025-06-30T23:24:17Z","snapshot_observed_at":"2026-08-11T01:06:54.161560Z","submitted_at":"2024-12-26T21:13:12Z","title":"ETTA: Elucidating the Design Space of Text-to-Audio Models","version":2},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-11T00:45:19.897329Z"},"links":{"citing_paper":"/paper/2412.19351"},"observation_digest":"sha256:e45a1c24e7d915d2088028c88dfc0f2275ca146cacd9205dc29e79eab59c9b3a","observation_id":"a28daef5-c711-4649-a51b-a06146b427f9","resolution":{"observed_at":"2026-08-11T00:45:19.897329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-05T03:40:24.447729Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-11T00:45:19.900293Z","title":"Audiobox: Unified audio generation with natural language prompts","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.19351","last_updated":"2025-06-30T23:24:17Z","snapshot_observed_at":"2026-08-11T01:06:54.161560Z","submitted_at":"2024-12-26T21:13:12Z","title":"ETTA: Elucidating the Design Space of Text-to-Audio Models","version":2},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-11T00:45:19.900293Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2412.19351"},"observation_digest":"sha256:c1220faf3fb9815c0b605ff683ac1b9627d908090438f60916c9e54865376d01","observation_id":"72c87f90-3104-4ca3-aaaf-cd187fc35c2a","resolution":{"observed_at":"2026-08-11T00:45:19.900293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-11T00:45:19.903369Z","title":"Cogvlm: Visual expert for pretrained language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.19351","last_updated":"2025-06-30T23:24:17Z","snapshot_observed_at":"2026-08-11T01:06:54.161560Z","submitted_at":"2024-12-26T21:13:12Z","title":"ETTA: Elucidating the Design Space of Text-to-Audio Models","version":2},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-11T00:45:19.903369Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2412.19351"},"observation_digest":"sha256:be230bacacf0037d0dd200252e8746b39f3eec687ce6a6da9641c893887d161b","observation_id":"1b1ceba9-f1e3-476b-9189-44c649c5b49d","resolution":{"observed_at":"2026-08-11T00:45:19.903369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:45:19.906235Z","title":"Large-scale contrastive language-audio pretraining with feature fusion and keyword-to-caption augmentation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.19351","last_updated":"2025-06-30T23:24:17Z","snapshot_observed_at":"2026-08-11T01:06:54.161560Z","submitted_at":"2024-12-26T21:13:12Z","title":"ETTA: Elucidating the Design Space of Text-to-Audio Models","version":2},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-11T00:45:19.906235Z"},"links":{"citing_paper":"/paper/2412.19351"},"observation_digest":"sha256:2d706504a016d8cc6f0a7e773abeed39710990b8f6f56784d8550818ed3f0f82","observation_id":"ace7a19c-5d75-47b2-9b37-e27c2a52372a","resolution":{"observed_at":"2026-08-11T00:45:19.906235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01044","last_updated":"2024-01-02T05:42:14Z","snapshot_observed_at":"2026-08-09T15:48:23.364963Z","submitted_at":"2024-01-02T05:42:14Z","title":"Auffusion: Leveraging the Power of Diffusion and Large Language Models for Text-to-Audio Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.01044","snapshot_observed_at":"2026-08-11T00:45:19.908979Z","title":"Auffusion: Leveraging the power of diffusion and large language models for text-to-audio generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19351","last_updated":"2025-06-30T23:24:17Z","snapshot_observed_at":"2026-08-11T01:06:54.161560Z","submitted_at":"2024-12-26T21:13:12Z","title":"ETTA: Elucidating the Design Space of Text-to-Audio Models","version":2},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-11T00:45:19.908979Z"},"links":{"cited_paper":"/paper/2401.01044","citing_paper":"/paper/2412.19351"},"observation_digest":"sha256:7a60ae40395b5e2e16d84b692f9b2ffe9330a782ffff1d89b69d5957e04b064e","observation_id":"375f9341-8308-4fab-b4da-e3e22a06ffb4","resolution":{"observed_at":"2026-08-11T00:45:19.908979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04416","last_updated":"2025-01-01T13:46:37Z","snapshot_observed_at":"2026-07-06T18:41:53.152987Z","submitted_at":"2024-07-05T11:07:13Z","title":"Sound-VECaps: Improving Audio Generation with Visual Enhanced Captions","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04416","snapshot_observed_at":"2026-08-11T00:45:19.911892Z","title":"Improving audio generation with visual enhanced caption","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19351","last_updated":"2025-06-30T23:24:17Z","snapshot_observed_at":"2026-08-11T01:06:54.161560Z","submitted_at":"2024-12-26T21:13:12Z","title":"ETTA: Elucidating the Design Space of Text-to-Audio Models","version":2},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-11T00:45:19.911892Z"},"links":{"cited_paper":"/paper/2407.04416","citing_paper":"/paper/2412.19351"},"observation_digest":"sha256:194b2fc561f9fde22f274da1b0a92d33f3a3b4edc5ad2812329fc7f32b830cbd","observation_id":"c81f82fa-c6b0-4067-9217-595cf16890a9","resolution":{"observed_at":"2026-08-11T00:45:19.911892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.02882","last_updated":"2019-04-05T06:05:00Z","snapshot_observed_at":"2026-08-10T09:39:47.608323Z","submitted_at":"2019-04-05T06:05:00Z","title":"LibriTTS: A Corpus Derived from LibriSpeech for Text-to-Speech","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.02882","snapshot_observed_at":"2026-08-11T00:45:19.914938Z","title":"Libritts: A corpus derived from librispeech for text-to-speech","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2412.19351","last_updated":"2025-06-30T23:24:17Z","snapshot_observed_at":"2026-08-11T01:06:54.161560Z","submitted_at":"2024-12-26T21:13:12Z","title":"ETTA: Elucidating the Design Space of Text-to-Audio Models","version":2},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-11T00:45:19.914938Z"},"links":{"cited_paper":"/paper/1904.02882","citing_paper":"/paper/2412.19351"},"observation_digest":"sha256:38e9a03eae8b4cd9fc09fd619913ef41c225c83d0fb408242bc45bc7a77fd87d","observation_id":"43d9a63d-6bc0-4c65-b402-f1a61547b6ae","resolution":{"observed_at":"2026-08-11T00:45:19.914938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:45:19.917979Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.19351","last_updated":"2025-06-30T23:24:17Z","snapshot_observed_at":"2026-08-11T01:06:54.161560Z","submitted_at":"2024-12-26T21:13:12Z","title":"ETTA: Elucidating the Design Space of Text-to-Audio Models","version":2},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-11T00:45:19.917979Z"},"links":{"citing_paper":"/paper/2412.19351"},"observation_digest":"sha256:48d37c4840c3e007d20f5f5f3deed12ada1d507b8ccae95e7d1133bf7fbf3a64","observation_id":"38af1539-d2ab-48a6-a29a-3a4df938e4e4","resolution":{"observed_at":"2026-08-11T00:45:19.917979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:45:19.921516Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.19351","last_updated":"2025-06-30T23:24:17Z","snapshot_observed_at":"2026-08-11T01:06:54.161560Z","submitted_at":"2024-12-26T21:13:12Z","title":"ETTA: Elucidating the Design Space of Text-to-Audio Models","version":2},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-11T00:45:19.921516Z"},"links":{"citing_paper":"/paper/2412.19351"},"observation_digest":"sha256:f63eb3fc1761e022c6e28854375aaf75387f8d7c2af757194c5fe63e72ee8c3e","observation_id":"afe2ca9c-508c-489f-99db-a579f9037f64","resolution":{"observed_at":"2026-08-11T00:45:19.921516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16372","last_updated":"2023-07-31T02:32:02Z","snapshot_observed_at":"2026-07-06T16:00:29.832559Z","submitted_at":"2023-07-31T02:32:02Z","title":"LP-MusicCaps: LLM-Based Pseudo Music Captioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16372","snapshot_observed_at":"2026-08-11T00:45:19.924941Z","title":"Spotify\", title =","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2412.19351","last_updated":"2025-06-30T23:24:17Z","snapshot_observed_at":"2026-08-11T01:06:54.161560Z","submitted_at":"2024-12-26T21:13:12Z","title":"ETTA: Elucidating the Design Space of Text-to-Audio Models","version":2},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-11T00:45:19.924941Z"},"links":{"cited_paper":"/paper/2307.16372","citing_paper":"/paper/2412.19351"},"observation_digest":"sha256:0a47d57e6f9ce484b838bf9ab8cf174695ecf30e5c5aacc15591696c1f36c8ab","observation_id":"50b30830-190f-4d5d-8ae1-efca20564ce1","resolution":{"observed_at":"2026-08-11T00:45:19.924941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.19351","last_updated":"2025-06-30T23:24:17Z","latest_version":2,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-11T01:06:54.161560Z","submitted_at":"2024-12-26T21:13:12Z","title":"ETTA: Elucidating the Design Space of Text-to-Audio Models"},"reference_resolution":{"displayed":81,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":63,"verified_exact":0,"verified_fuzzy":18},"total_outbound_references":81},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 81 of 81 outbound references and 1 inbound Pith citation observation for arXiv:2412.19351."}