{"as_of":"2026-08-07T07:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bb7e40dea79b24293de7401e930bbf03c2eba9674716578a8bb9bebb4d61f4bd","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":62,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":62,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":62,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":62,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T04:45:18.973851Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T11:59:50.469153Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":"2301.12503","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-07-04T11:59:50.469153Z","title":"Audioldm: Text-to-audio generation with latent diffusion models","venue":null,"work_id":"b44ebce5-47f1-4f14-b13b-b5b4eb072d2c","year":2023},"citing_paper":{"arxiv_id":"2411.12363","last_updated":"2026-04-20T02:56:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-19T09:23:22Z","title":"DGSNA: Dynamic Generative Scene-based Noise Addition method","version":6},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-23T17:43:47.086524Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2411.12363"},"observation_digest":"sha256:696b18be5845e8b6845a0038eb09020a041883616caf050e3e73d28c0a9aa433","observation_id":"4244a785-d3d1-4482-8f44-0db941ed88c7","resolution":{"observed_at":"2026-05-23T17:45:46.270816Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":"2301.12503","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-07-04T11:59:50.469153Z","title":"Audioldm: Text-to-audio generation with latent diffusion models","venue":null,"work_id":"b44ebce5-47f1-4f14-b13b-b5b4eb072d2c","year":2023},"citing_paper":{"arxiv_id":"2506.03530","last_updated":"2026-05-22T06:55:17Z","snapshot_observed_at":"2026-08-01T13:49:24.957131Z","submitted_at":"2025-06-04T03:22:44Z","title":"How Far Are We from Generating Missing Modalities with Foundation Models?","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-25T08:15:12.947854Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2506.03530"},"observation_digest":"sha256:808a153ffb455aba7b415edee43b2f1930ff5d782b9079e6b7c69969be26a4e1","observation_id":"833355d6-6bc7-45e7-b768-abac05b45178","resolution":{"observed_at":"2026-05-25T08:15:33.620840Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-08-07T04:45:18.973851Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09874","last_updated":"2025-07-10T19:47:47Z","snapshot_observed_at":"2026-08-07T04:35:57.664574Z","submitted_at":"2025-06-11T15:43:08Z","title":"UmbraTTS: Adapting Text-to-Speech to Environmental Contexts with Flow Matching","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:18.973851Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2506.09874"},"observation_digest":"sha256:54cd179c683c6f23525efc9813e136367410c88e01d0cc411793f67f7e44226b","observation_id":"87fd9334-847c-4c91-abcb-77ad8bf938a9","resolution":{"observed_at":"2026-08-07T04:45:18.973851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-08-06T23:58:34.577052Z","title":"Audioldm: Text-to-audio genera- tion with latent diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.15530","last_updated":"2025-06-18T15:01:25Z","snapshot_observed_at":"2026-08-06T23:51:33.760840Z","submitted_at":"2025-06-18T15:01:25Z","title":"Diff-TONE: Timestep Optimization for iNstrument Editing in Text-to-Music Diffusion Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T23:58:34.577052Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2506.15530"},"observation_digest":"sha256:f9b77a28fa7f016060e806bc31d34bdbdbaa17041dd180a8ed1c4b9b3766256d","observation_id":"401ae98b-4024-41b3-ad2e-c5b3acd1d977","resolution":{"observed_at":"2026-08-06T23:58:34.577052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-08-06T19:39:54.589254Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04959","last_updated":"2025-07-13T09:31:19Z","snapshot_observed_at":"2026-08-06T19:32:54.121865Z","submitted_at":"2025-07-07T13:01:50Z","title":"Hear-Your-Click: Interactive Object-Specific Video-to-Audio Generation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T19:39:54.589254Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2507.04959"},"observation_digest":"sha256:7532f5ff07919958cd6bc61416451c7d729484f3510767f5cf5e2315b8892b8a","observation_id":"3384e3c5-011a-4867-b15e-0451f2ba050a","resolution":{"observed_at":"2026-08-06T19:39:54.589254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-08-06T19:26:42.399897Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.05624","last_updated":"2026-07-02T13:55:00Z","snapshot_observed_at":"2026-08-06T19:19:17.831766Z","submitted_at":"2025-07-08T03:08:52Z","title":"ADMC: Attention-based Diffusion Model for Missing Modalities Feature Completion","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T19:26:42.399897Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2507.05624"},"observation_digest":"sha256:31274dd398f2637c117ed331da451cfba5890fccccecc3902a5677f91fe2c19d","observation_id":"8afa710d-257f-449e-a116-60b3e028de26","resolution":{"observed_at":"2026-08-06T19:26:42.399897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-08-06T15:58:50.494374Z","title":"Audioldm: Text-to-audio generation with latent diffusion models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.14507","last_updated":"2025-08-31T10:48:07Z","snapshot_observed_at":"2026-08-06T15:51:43.761093Z","submitted_at":"2025-07-19T07:04:04Z","title":"Diffusion Models for Time Series Forecasting: A Survey","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T15:58:50.494374Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2507.14507"},"observation_digest":"sha256:0a321fc264ac57fab14e8dff51d048a52294a3a8bcb91fcdc78651652821e81d","observation_id":"c1a90ca5-8730-466f-96ed-44324b7d35cd","resolution":{"observed_at":"2026-08-06T15:58:50.494374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-08-06T15:47:02.687551Z","title":"Audi- oldm: Text-to-audio generation with latent diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15260","last_updated":"2025-07-21T05:48:47Z","snapshot_observed_at":"2026-08-06T15:34:06.041582Z","submitted_at":"2025-07-21T05:48:47Z","title":"CHORDS: Diffusion Sampling Accelerator with Multi-core Hierarchical ODE Solvers","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T15:47:02.687551Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2507.15260"},"observation_digest":"sha256:592d2c1e1e3b1ba66241c7a50fc14fb5ad1d7056ddcb3dd7ca8f499a94559ec9","observation_id":"9139e409-ca8c-43d2-9ce7-0a57256d1a80","resolution":{"observed_at":"2026-08-06T15:47:02.687551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-08-06T14:04:00.776212Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.19835","last_updated":"2025-07-26T07:12:02Z","snapshot_observed_at":"2026-08-06T14:03:57.296216Z","submitted_at":"2025-07-26T07:12:02Z","title":"SonicGauss: Position-Aware Physical Sound Synthesis for 3D Gaussian Representations","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T14:04:00.776212Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2507.19835"},"observation_digest":"sha256:c9139731dcb2faf6bccb66fc4ac5054062827f3d13592f06f54868a1d707adca","observation_id":"035f79e7-9d79-4d62-83f6-e690c2962950","resolution":{"observed_at":"2026-08-06T14:04:00.776212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-08-06T13:07:09.495265Z","title":"Plumbley","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-06T23:30:25.733150Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:09.495265Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2507.21053"},"observation_digest":"sha256:4ccc3729ed06cc85c64995db72cdddd60538a973dfe6c969e601dc9bab0da136","observation_id":"511d80a0-aa90-46af-93dc-954e0950af30","resolution":{"observed_at":"2026-08-06T13:07:09.495265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-08-06T12:19:01.944976Z","title":"Audioldm: Text-to- audio generation with latent diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21893","last_updated":"2025-08-05T14:01:48Z","snapshot_observed_at":"2026-08-06T12:19:01.505019Z","submitted_at":"2025-07-29T15:01:31Z","title":"Aether Weaver: Multimodal Affective Narrative Co-Generation with Dynamic Scene Graphs","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T12:19:01.944976Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2507.21893"},"observation_digest":"sha256:d39e9244be59318be298f414456c01529fed4cf45e214b794a9504c0a5cf8da5","observation_id":"d212bfcf-8c24-4765-b564-a318947e4b00","resolution":{"observed_at":"2026-08-06T12:19:01.944976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-08-06T11:14:46.151866Z","title":"Audioldm: Text-to-audio generation with latent diffusion models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22995","last_updated":"2025-07-30T18:00:09Z","snapshot_observed_at":"2026-08-07T05:00:27.384082Z","submitted_at":"2025-07-30T18:00:09Z","title":"Balancing Information Preservation and Disentanglement in Self-Supervised Music Representation Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T11:14:46.151866Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2507.22995"},"observation_digest":"sha256:7c00a1d8138f2e8441b926cb94137985a78dd7a61f2b2eec4fa460322b419397","observation_id":"eae0bf53-89bc-4d9b-adb5-4745a5dce62d","resolution":{"observed_at":"2026-08-06T11:14:46.151866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-08-06T06:04:29.913997Z","title":"Audioldm: Text-to-audio generation with latent diffusion models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.00733","last_updated":"2025-08-07T04:31:04Z","snapshot_observed_at":"2026-08-06T20:34:36.422314Z","submitted_at":"2025-08-01T16:03:57Z","title":"AudioGen-Omni: A Unified Multimodal Diffusion Transformer for Video-Synchronized Audio, Speech, and Song Generation","version":4},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T06:04:29.913997Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2508.00733"},"observation_digest":"sha256:f99f9838561d34f4dea01b2525977224e0283509cc7a7b8c0380fd496955f089","observation_id":"1d75771a-4415-4798-b175-2d463d71af6d","resolution":{"observed_at":"2026-08-06T06:04:29.913997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-08-06T05:40:56.915651Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.01394","last_updated":"2025-08-02T14:58:34Z","snapshot_observed_at":"2026-08-06T16:12:20.880690Z","submitted_at":"2025-08-02T14:58:34Z","title":"Via Score to Performance: Efficient Human-Controllable Long Song Generation with Bar-Level Symbolic Notation","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T05:40:56.915651Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2508.01394"},"observation_digest":"sha256:bbc02b98923f8027ce1214edd2fc3afca2dc93833d49004c0a1fd3cb335f6ae9","observation_id":"64148a22-c14a-43ff-a71a-acb113314683","resolution":{"observed_at":"2026-08-06T05:40:56.915651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-08-06T05:05:27.134039Z","title":"Audioldm: Text-to-audio generation with latent diffusion models.arXiv preprint arXiv:2301.12503, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.02391","last_updated":"2025-08-04T13:17:49Z","snapshot_observed_at":"2026-08-06T10:09:31.929948Z","submitted_at":"2025-08-04T13:17:49Z","title":"Inference-time Scaling for Diffusion-based Audio Super-resolution","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T05:05:27.134039Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2508.02391"},"observation_digest":"sha256:37aa0637dfb357878b3eefad7275b875dd715999c63834c45d70242a466cc992","observation_id":"e0fee5c5-370f-447c-94d1-65406a061189","resolution":{"observed_at":"2026-08-06T05:05:27.134039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-08-05T22:54:55.090118Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-07T06:21:33.903026Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:55.090118Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:6af849543149a4311d704275c470ff8ae2a8d774af10d9af2cc2d4955e3d0614","observation_id":"986d2272-7240-4034-913a-4c095f3bd0ca","resolution":{"observed_at":"2026-08-05T22:54:55.090118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-08-05T17:45:10.648281Z","title":"Audioldm: Text-to-audio generation with latent diffusion models.arXiv preprint arXiv:2301.12503 , 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.16306","last_updated":"2025-08-22T11:29:06Z","snapshot_observed_at":"2026-08-07T04:54:54.775407Z","submitted_at":"2025-08-22T11:29:06Z","title":"A Sharp KL-Convergence Analysis for Diffusion Models under Minimal Assumptions","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T17:45:10.648281Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2508.16306"},"observation_digest":"sha256:43801ede7a0b742bf82f1ce21381ca33106d19181118148b77bd8f4055eb6cc2","observation_id":"b40285ca-fcc7-4c76-86fb-d4cc7f16590e","resolution":{"observed_at":"2026-08-05T17:45:10.648281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-08-05T15:10:31.753877Z","title":"Audioldm: Text-to-audio generation with latent diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20379","last_updated":"2025-08-28T03:00:30Z","snapshot_observed_at":"2026-08-06T15:18:10.014754Z","submitted_at":"2025-08-28T03:00:30Z","title":"Audio-Guided Visual Editing with Complex Multi-Modal Prompts","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:31.753877Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2508.20379"},"observation_digest":"sha256:a073ee3d3eec2f323e98ab89b07f5f8d356f0bd54dbc866f82f6fa309b569956","observation_id":"b0ef9092-7b6a-45a5-a957-900a8070585c","resolution":{"observed_at":"2026-08-05T15:10:31.753877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-08-05T14:36:37.617270Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.21153","last_updated":"2025-08-28T18:38:42Z","snapshot_observed_at":"2026-08-05T14:36:36.276620Z","submitted_at":"2025-08-28T18:38:42Z","title":"WaveLLDM: Design and Development of a Lightweight Latent Diffusion Model for Speech Enhancement and Restoration","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T14:36:37.617270Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2508.21153"},"observation_digest":"sha256:89f7187b0b256b66e5865814104ebead5077a5394b2c8087aaa7a4567505c809","observation_id":"01204637-e03e-46bd-86aa-ef69bf55b79c","resolution":{"observed_at":"2026-08-05T14:36:37.617270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":"2301.12503","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-07-04T11:59:50.469153Z","title":"Audioldm: Text-to-audio generation with latent diffusion models","venue":null,"work_id":"b44ebce5-47f1-4f14-b13b-b5b4eb072d2c","year":2023},"citing_paper":{"arxiv_id":"2509.23727","last_updated":"2026-04-09T14:19:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T08:12:43Z","title":"AudioMoG: Guiding Audio Generation with Mixture-of-Guidance","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-05-18T13:10:18.700497Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2509.23727"},"observation_digest":"sha256:003132f78af1489bea71a9a619d6b6b5891404b14bfe6bfe55b2da41f3b49a7b","observation_id":"29112a42-28a7-48ca-a089-aee4158f9105","resolution":{"observed_at":"2026-05-18T13:11:23.790250Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-08-04T12:38:58.198477Z","title":"Audioldm: Text-to-audio generation with latent diffusion models.arXiv preprint arXiv:2301.12503,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.03117","last_updated":"2026-06-26T03:58:11Z","snapshot_observed_at":"2026-08-07T05:08:17.345661Z","submitted_at":"2025-10-03T15:43:56Z","title":"Taming Text-to-Sounding Video Generation via Advanced Modality Condition and Interaction","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T12:38:58.198477Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2510.03117"},"observation_digest":"sha256:f05399bd0a62602a46e72551080b5d7df2fdb7543d5586d2e28de7e8524de3fd","observation_id":"cf197551-189e-4413-bfbb-75800a2a5d56","resolution":{"observed_at":"2026-08-04T12:38:58.198477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-08-04T11:29:33.883026Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.04593","last_updated":"2026-06-08T05:49:30Z","snapshot_observed_at":"2026-08-06T08:55:28.794308Z","submitted_at":"2025-10-06T08:47:38Z","title":"UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models","version":3},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-04T11:29:33.883026Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2510.04593"},"observation_digest":"sha256:ee22a0794d3709c77f274e7eea22911d6edf7ce275355891c9ef40335c820e0c","observation_id":"9ba08cfd-6e72-4426-9c96-74149d070b56","resolution":{"observed_at":"2026-08-04T11:29:33.883026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":"2301.12503","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-07-04T11:59:50.469153Z","title":"Audioldm: Text-to-audio generation with latent diffusion models","venue":null,"work_id":"b44ebce5-47f1-4f14-b13b-b5b4eb072d2c","year":2023},"citing_paper":{"arxiv_id":"2510.13293","last_updated":"2026-06-10T05:54:25Z","snapshot_observed_at":"2026-08-04T09:49:40.217695Z","submitted_at":"2025-10-15T08:37:16Z","title":"Cross-modal Consistency Guidance for Robust Emotion Control in Auto-Regressive TTS Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-18T07:42:43.077644Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2510.13293"},"observation_digest":"sha256:cff949c34b97b280f49c9e0e3575e9f60f760f4d58f34d8269a6d7cae79e8479","observation_id":"5cab15e9-428c-48d5-8f1c-1590be20ebf8","resolution":{"observed_at":"2026-05-18T07:46:03.658946Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":"2301.12503","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-07-04T11:59:50.469153Z","title":"Audioldm: Text-to-audio generation with latent diffusion models","venue":null,"work_id":"b44ebce5-47f1-4f14-b13b-b5b4eb072d2c","year":2023},"citing_paper":{"arxiv_id":"2510.13293","last_updated":"2026-06-10T05:54:25Z","snapshot_observed_at":"2026-08-04T09:49:40.217695Z","submitted_at":"2025-10-15T08:37:16Z","title":"Cross-modal Consistency Guidance for Robust Emotion Control in Auto-Regressive TTS Models","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-21T20:56:37.533183Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2510.13293"},"observation_digest":"sha256:d42d9eff285e10cbffd1bae5170381844c4d1488ac797e8a3db34de690531c33","observation_id":"7f33acef-db98-43a1-926c-d821ecfb8475","resolution":{"observed_at":"2026-05-21T21:00:39.130192Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-08-04T09:49:43.654091Z","title":"Audi- oldm: Text-to-audio generation with latent diffusion models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.13293","last_updated":"2026-06-10T05:54:25Z","snapshot_observed_at":"2026-08-04T09:49:40.217695Z","submitted_at":"2025-10-15T08:37:16Z","title":"Cross-modal Consistency Guidance for Robust Emotion Control in Auto-Regressive TTS Models","version":4},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T09:49:43.654091Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2510.13293"},"observation_digest":"sha256:267f38b55f218a5eee65e7d96713e8d157e3bd4874968b8b65beafa8d5d33761","observation_id":"34d78cc4-a91d-4143-a1b0-bab32f6be7fa","resolution":{"observed_at":"2026-08-04T09:49:43.654091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":"2301.12503","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-07-04T11:59:50.469153Z","title":"Audioldm: Text-to-audio generation with latent diffusion models","venue":null,"work_id":"b44ebce5-47f1-4f14-b13b-b5b4eb072d2c","year":2023},"citing_paper":{"arxiv_id":"2601.22143","last_updated":"2026-05-11T12:30:46Z","snapshot_observed_at":"2026-07-06T22:43:35.226546Z","submitted_at":"2026-01-29T18:57:13Z","title":"JUST-DUB-IT: Video Dubbing via Joint Audio-Visual Diffusion","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-16T09:55:32.044506Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2601.22143"},"observation_digest":"sha256:4275bef735bcd4e457cbfcc07f0689976553c929446d7e64a6aa6f873ee93ce6","observation_id":"ad9ddeab-612d-4c4d-806d-6591e5de0714","resolution":{"observed_at":"2026-05-16T09:57:42.900012Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":"2301.12503","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-07-04T11:59:50.469153Z","title":"Audioldm: Text-to-audio generation with latent diffusion models","venue":null,"work_id":"b44ebce5-47f1-4f14-b13b-b5b4eb072d2c","year":2023},"citing_paper":{"arxiv_id":"2602.10764","last_updated":"2026-06-28T05:06:30Z","snapshot_observed_at":"2026-08-03T01:04:17.228395Z","submitted_at":"2026-02-11T11:51:01Z","title":"Dual-End Consistency Model","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-16T05:40:36.406150Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2602.10764"},"observation_digest":"sha256:2bec9f5f0592704c1e0717aa8eb9c46fd7f20fb5ca491f139473c00198ac6ae4","observation_id":"ad26e427-935b-4ab3-bf78-e31e4327eb8f","resolution":{"observed_at":"2026-05-16T05:40:39.814660Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-08-03T01:04:20.684172Z","title":"arXiv preprint arXiv:2301.12503 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.10764","last_updated":"2026-06-28T05:06:30Z","snapshot_observed_at":"2026-08-03T01:04:17.228395Z","submitted_at":"2026-02-11T11:51:01Z","title":"Dual-End Consistency Model","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T01:04:20.684172Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2602.10764"},"observation_digest":"sha256:c9cf02877bbf759587c9d7ddbb94fdc2c1c6cfecfe23773846713b880175a6fc","observation_id":"a5fe170f-ff47-4c70-9b9d-e78aba20a207","resolution":{"observed_at":"2026-08-03T01:04:20.684172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":"2301.12503","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-07-04T11:59:50.469153Z","title":"Audioldm: Text-to-audio generation with latent diffusion models","venue":null,"work_id":"b44ebce5-47f1-4f14-b13b-b5b4eb072d2c","year":2023},"citing_paper":{"arxiv_id":"2603.13419","last_updated":"2026-05-20T10:08:19Z","snapshot_observed_at":"2026-07-06T22:48:57.474272Z","submitted_at":"2026-03-12T21:02:17Z","title":"Diffusion Models Memorize in Training -- and Generalize in Inference","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-21T10:52:31.849094Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2603.13419"},"observation_digest":"sha256:d747208c2568c50249c304d4a09aafb4bfdffabe4c27cca1d3c9f3e71c714195","observation_id":"d8e4dd18-5751-40fe-bcf0-56855f426025","resolution":{"observed_at":"2026-05-21T10:54:07.907159Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-08-02T18:03:40.092528Z","title":"Audioldm: Text-to-audio generation with latent diffusion models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.16805","last_updated":"2026-07-16T07:47:56Z","snapshot_observed_at":"2026-08-05T04:44:49.504243Z","submitted_at":"2026-03-17T17:09:45Z","title":"Making Separation-First Multi-Stream Audio Watermarking Feasible via Joint Training","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T18:03:40.092528Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2603.16805"},"observation_digest":"sha256:26f54f046814e2fedc6f61e4d26f099992ee5fff0545e9aa51ad09bcd744c1ac","observation_id":"6f6fbe12-1056-481f-a394-17d714e80274","resolution":{"observed_at":"2026-08-02T18:03:40.092528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":"2301.12503","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-07-04T11:59:50.469153Z","title":"Audioldm: Text-to-audio generation with latent diffusion models","venue":null,"work_id":"b44ebce5-47f1-4f14-b13b-b5b4eb072d2c","year":2023},"citing_paper":{"arxiv_id":"2604.01929","last_updated":"2026-04-29T10:54:09Z","snapshot_observed_at":"2026-07-06T22:51:40.181565Z","submitted_at":"2026-04-02T11:49:00Z","title":"Woosh: A Sound Effects Foundation Model","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-13T20:51:08.144573Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2604.01929"},"observation_digest":"sha256:20a5d5a26fd5713f197e6bbd3a347eda241f8a98b47bc31a52cad348760df79c","observation_id":"7d8d74b6-99e3-412b-a589-d61ee8b439db","resolution":{"observed_at":"2026-05-13T20:53:15.805338Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":"2301.12503","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-07-04T11:59:50.469153Z","title":"Audioldm: Text-to-audio generation with latent diffusion models","venue":null,"work_id":"b44ebce5-47f1-4f14-b13b-b5b4eb072d2c","year":2023},"citing_paper":{"arxiv_id":"2604.05731","last_updated":"2026-04-07T11:34:04Z","snapshot_observed_at":"2026-07-06T22:54:21.571606Z","submitted_at":"2026-04-07T11:34:04Z","title":"FoleyDesigner: Immersive Stereo Foley Generation with Precise Spatio-Temporal Alignment for Film Clips","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-10T18:57:21.434793Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2604.05731"},"observation_digest":"sha256:0c0d6c649d81e95dfe0eac6b4cd90b8d6494b2b12cb620910e132f01034db4df","observation_id":"01351671-3543-4f01-a0f1-0ac538ec27e2","resolution":{"observed_at":"2026-05-10T23:40:51.725801Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":"2301.12503","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-07-04T11:59:50.469153Z","title":"Audioldm: Text-to-audio generation with latent diffusion models","venue":null,"work_id":"b44ebce5-47f1-4f14-b13b-b5b4eb072d2c","year":2023},"citing_paper":{"arxiv_id":"2604.08184","last_updated":"2026-04-09T12:38:19Z","snapshot_observed_at":"2026-08-02T08:09:42.022596Z","submitted_at":"2026-04-09T12:38:19Z","title":"AT-ADD: All-Type Audio Deepfake Detection Challenge Evaluation Plan","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-10T17:40:10.657590Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2604.08184"},"observation_digest":"sha256:2f43e108ede243f2329abab8686f151f6a416fc59c0196dc94750c119be85b13","observation_id":"7a567944-8d5b-41e9-8911-b1b29291eb45","resolution":{"observed_at":"2026-05-11T06:21:00.633260Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":"2301.12503","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-07-04T11:59:50.469153Z","title":"Audioldm: Text-to-audio generation with latent diffusion models","venue":null,"work_id":"b44ebce5-47f1-4f14-b13b-b5b4eb072d2c","year":2023},"citing_paper":{"arxiv_id":"2604.17986","last_updated":"2026-04-20T09:08:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-20T09:08:13Z","title":"Latent Fourier Transform","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-10T03:45:07.892234Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2604.17986"},"observation_digest":"sha256:8e15a45d42fbaf49636f2cd89b27a16f28221c1dc1e67a2a40615d67357093b6","observation_id":"29ea7c1a-3e59-4755-a1a7-e76c6cf6c59b","resolution":{"observed_at":"2026-05-11T12:21:07.061004Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":"2301.12503","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-07-04T11:59:50.469153Z","title":"Audioldm: Text-to-audio generation with latent diffusion models","venue":null,"work_id":"b44ebce5-47f1-4f14-b13b-b5b4eb072d2c","year":2023},"citing_paper":{"arxiv_id":"2604.19055","last_updated":"2026-04-23T13:29:24Z","snapshot_observed_at":"2026-08-02T20:24:54.657148Z","submitted_at":"2026-04-21T04:01:36Z","title":"ATRIE: Adaptive Tuning for Robust Inference and Emotion in Persona-Driven Speech Synthesis","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-10T02:11:12.460695Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2604.19055"},"observation_digest":"sha256:3cb61589c61e810ef6be8cb34dab4d9d61e03af782eebc4ab67e2b76ff8a493e","observation_id":"01797019-b68d-4ae6-ac3f-1015173d9bd7","resolution":{"observed_at":"2026-05-11T13:11:22.315786Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":"2301.12503","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-07-04T11:59:50.469153Z","title":"Audioldm: Text-to-audio generation with latent diffusion models","venue":null,"work_id":"b44ebce5-47f1-4f14-b13b-b5b4eb072d2c","year":2023},"citing_paper":{"arxiv_id":"2605.00329","last_updated":"2026-05-01T01:13:50Z","snapshot_observed_at":"2026-08-04T21:56:38.114801Z","submitted_at":"2026-05-01T01:13:50Z","title":"Fast Text-to-Audio Generation with One-Step Sampling via Energy-Scoring and Auxiliary Contextual Representation Distillation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-09T19:17:09.247932Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2605.00329"},"observation_digest":"sha256:302be4dc042537210578029eb0ec32633ddcd1f6d1d7345f5d593481973ac961","observation_id":"39d88a97-f0b0-48b8-9ac7-7861846c0866","resolution":{"observed_at":"2026-05-11T15:46:44.540336Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":"2301.12503","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-07-04T11:59:50.469153Z","title":"Audioldm: Text-to-audio generation with latent diffusion models","venue":null,"work_id":"b44ebce5-47f1-4f14-b13b-b5b4eb072d2c","year":2023},"citing_paper":{"arxiv_id":"2605.04547","last_updated":"2026-05-06T06:54:00Z","snapshot_observed_at":"2026-07-06T23:17:18.486586Z","submitted_at":"2026-05-06T06:54:00Z","title":"Stage-adaptive audio diffusion modeling","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-08T17:21:34.140699Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2605.04547"},"observation_digest":"sha256:b57ed09cbd10a11d28b0afe7577532720f0aa50d9d3ac805e282d7e10c99adc0","observation_id":"2d7908dd-aed0-4ad3-87ba-adc684434783","resolution":{"observed_at":"2026-05-11T17:41:06.288613Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":"2301.12503","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-07-04T11:59:50.469153Z","title":"Audioldm: Text-to-audio generation with latent diffusion models","venue":null,"work_id":"b44ebce5-47f1-4f14-b13b-b5b4eb072d2c","year":2023},"citing_paper":{"arxiv_id":"2605.09259","last_updated":"2026-05-10T02:08:07Z","snapshot_observed_at":"2026-07-06T23:21:21.560069Z","submitted_at":"2026-05-10T02:08:07Z","title":"Remix the Timbre: Diffusion-Based Style Transfer Across Polyphonic Stems","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-12T04:58:26.634355Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2605.09259"},"observation_digest":"sha256:d9634c36e76b53653d4a7cca27f34a603affe7c64941cc294a4e65b5ee531e86","observation_id":"9213e690-cbd2-494a-b509-1434c2bb22a9","resolution":{"observed_at":"2026-05-12T05:46:28.002815Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":"2301.12503","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-07-04T11:59:50.469153Z","title":"Audioldm: Text-to-audio generation with latent diffusion models","venue":null,"work_id":"b44ebce5-47f1-4f14-b13b-b5b4eb072d2c","year":2023},"citing_paper":{"arxiv_id":"2605.09275","last_updated":"2026-05-10T02:53:43Z","snapshot_observed_at":"2026-07-06T23:21:26.017420Z","submitted_at":"2026-05-10T02:53:43Z","title":"DiffATS: Diffusion in Aligned Tensor Space","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-12T04:38:12.633086Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2605.09275"},"observation_digest":"sha256:6e4281e07569d17d141b26bdf8550e00f4bc0969f8b3b64887cb8f26c6d75d60","observation_id":"a8c7fa61-6d59-4926-9f7a-96b99a4fd859","resolution":{"observed_at":"2026-05-12T06:01:26.589603Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":"2301.12503","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-07-04T11:59:50.469153Z","title":"Audioldm: Text-to-audio generation with latent diffusion models","venue":null,"work_id":"b44ebce5-47f1-4f14-b13b-b5b4eb072d2c","year":2023},"citing_paper":{"arxiv_id":"2605.09971","last_updated":"2026-05-11T04:26:51Z","snapshot_observed_at":"2026-07-06T23:21:59.096464Z","submitted_at":"2026-05-11T04:26:51Z","title":"HapticLDM: A Diffusion Model for Text-to-Vibrotactile Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-12T04:11:29.782569Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2605.09971"},"observation_digest":"sha256:6fee959facf06438ff363463a15cfb00543b72db18c81e17d35b4dbb894a6244","observation_id":"a5609b5b-8f1c-4de5-8d38-02ceb2028256","resolution":{"observed_at":"2026-05-12T06:31:28.188916Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":"2301.12503","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-07-04T11:59:50.469153Z","title":"Audioldm: Text-to-audio generation with latent diffusion models","venue":null,"work_id":"b44ebce5-47f1-4f14-b13b-b5b4eb072d2c","year":2023},"citing_paper":{"arxiv_id":"2605.10084","last_updated":"2026-05-11T07:05:11Z","snapshot_observed_at":"2026-07-06T23:22:03.830881Z","submitted_at":"2026-05-11T07:05:11Z","title":"PoDAR: Power-Disentangled Audio Representation for Generative Modeling","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-12T04:04:08.420600Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2605.10084"},"observation_digest":"sha256:a727847268e51d9e7422cd0fe3e14ebd93960db69c268a09d12f823ea312504c","observation_id":"1e51d76d-72e3-48e3-9143-9a44fa42d66a","resolution":{"observed_at":"2026-05-12T06:41:35.176549Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":"2301.12503","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-07-04T11:59:50.469153Z","title":"Audioldm: Text-to-audio generation with latent diffusion models","venue":null,"work_id":"b44ebce5-47f1-4f14-b13b-b5b4eb072d2c","year":2023},"citing_paper":{"arxiv_id":"2605.18749","last_updated":"2026-05-18T17:59:10Z","snapshot_observed_at":"2026-08-01T11:03:45.027975Z","submitted_at":"2026-05-18T17:59:10Z","title":"WavFlow: Audio Generation in Waveform Space","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-20T07:33:35.243337Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2605.18749"},"observation_digest":"sha256:3352b4bc5d0900cd0aa1f1bb2e24677385dc8747381916f0af9a17766bc0c1eb","observation_id":"875fd0db-094b-4cac-a577-9f4e223b7d81","resolution":{"observed_at":"2026-05-20T07:38:09.626883Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":"2301.12503","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-07-04T11:59:50.469153Z","title":"Audioldm: Text-to-audio generation with latent diffusion models","venue":null,"work_id":"b44ebce5-47f1-4f14-b13b-b5b4eb072d2c","year":2023},"citing_paper":{"arxiv_id":"2605.28101","last_updated":"2026-05-27T07:54:47Z","snapshot_observed_at":"2026-08-01T20:36:16.545203Z","submitted_at":"2026-05-27T07:54:47Z","title":"EigeNet: Geometry-Informed Multi-Modal Learning for Few-shot Novel View RIR Prediction","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-29T10:25:14.873276Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2605.28101"},"observation_digest":"sha256:8633f8ec446bf35bf4bb57c10379dd475eadf5a0135208e818fe2fee25b4da13","observation_id":"9e9be8ae-4fc9-4935-9355-e05862a46376","resolution":{"observed_at":"2026-06-29T13:33:28.537734Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":"2301.12503","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-07-04T11:59:50.469153Z","title":"Audioldm: Text-to-audio generation with latent diffusion models","venue":null,"work_id":"b44ebce5-47f1-4f14-b13b-b5b4eb072d2c","year":2023},"citing_paper":{"arxiv_id":"2605.30365","last_updated":"2026-05-18T02:11:57Z","snapshot_observed_at":"2026-07-06T23:39:38.845840Z","submitted_at":"2026-05-18T02:11:57Z","title":"Mental Damage: Caption Poisoning Attacks on Retrieval-Augmented Text-to-Music Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-30T18:57:35.126894Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2605.30365"},"observation_digest":"sha256:6488c00b8df0068ce1b33f334cbaac80840ec4d29f74328f5ff087fb5b0bfecf","observation_id":"917ed80e-e9b2-4838-8169-7486d16d7403","resolution":{"observed_at":"2026-06-30T19:15:01.184596Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":"2301.12503","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-07-04T11:59:50.469153Z","title":"Audioldm: Text-to-audio generation with latent diffusion models","venue":null,"work_id":"b44ebce5-47f1-4f14-b13b-b5b4eb072d2c","year":2023},"citing_paper":{"arxiv_id":"2605.30876","last_updated":"2026-06-20T08:46:49Z","snapshot_observed_at":"2026-08-03T23:34:59.657375Z","submitted_at":"2026-05-29T06:03:50Z","title":"dMoE: dLLMs with Learnable Block Experts","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-28T22:50:51.900169Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2605.30876"},"observation_digest":"sha256:07eab3acc0cc1fe7dea11d45f12fe55353e2d8eb771b66887345f60342288229","observation_id":"d8b7e1ac-56f6-48d5-9137-35997613f8c2","resolution":{"observed_at":"2026-06-28T22:52:45.089912Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":"2301.12503","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-07-04T11:59:50.469153Z","title":"Audioldm: Text-to-audio generation with latent diffusion models","venue":null,"work_id":"b44ebce5-47f1-4f14-b13b-b5b4eb072d2c","year":2023},"citing_paper":{"arxiv_id":"2606.07207","last_updated":"2026-06-05T12:19:00Z","snapshot_observed_at":"2026-08-03T23:58:51.636454Z","submitted_at":"2026-06-05T12:19:00Z","title":"Entropy as a Structural Prior: How a Log-Barrier on DiT Belief Space Drives Musical Diversity and Development","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-27T21:06:45.886467Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2606.07207"},"observation_digest":"sha256:ae1fcf2567b9ffb1a701e1767717151d983d2832b2c9784849d4b8bbf6a3a002","observation_id":"b957d6e4-935a-412e-a3f5-2f0b3e30d1e4","resolution":{"observed_at":"2026-07-02T19:57:20.253964Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":"2301.12503","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-07-04T11:59:50.469153Z","title":"Audioldm: Text-to-audio generation with latent diffusion models","venue":null,"work_id":"b44ebce5-47f1-4f14-b13b-b5b4eb072d2c","year":2023},"citing_paper":{"arxiv_id":"2606.11833","last_updated":"2026-06-10T09:15:33Z","snapshot_observed_at":"2026-08-07T05:35:12.067325Z","submitted_at":"2026-06-10T09:15:33Z","title":"Flow Matching with In-Context Priors for Out-of-Distribution Brain Dynamics","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-27T10:44:39.810293Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2606.11833"},"observation_digest":"sha256:233c947b6d3735dff69d05340f5e1e5902284ddcdedab24475a95cc9982602b7","observation_id":"2987213b-e846-46ff-9bad-cb73d2f87e50","resolution":{"observed_at":"2026-07-03T08:27:46.755613Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":"2301.12503","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-07-04T11:59:50.469153Z","title":"Audioldm: Text-to-audio generation with latent diffusion models","venue":null,"work_id":"b44ebce5-47f1-4f14-b13b-b5b4eb072d2c","year":2023},"citing_paper":{"arxiv_id":"2606.12494","last_updated":"2026-06-10T12:41:17Z","snapshot_observed_at":"2026-08-03T00:00:48.277372Z","submitted_at":"2026-06-10T12:41:17Z","title":"Net-Ev$^2$: A Generative Simulator for Network Event Evolution","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-27T10:09:20.657051Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2606.12494"},"observation_digest":"sha256:5b3ddbb6fbdde4d2ce1d4ac15035b190adb4830ff842b488ddf9118248e72b3b","observation_id":"b2be330d-b942-43c6-81c4-adebd15d638f","resolution":{"observed_at":"2026-07-03T10:17:57.609498Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":"2301.12503","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-07-04T11:59:50.469153Z","title":"Audioldm: Text-to-audio generation with latent diffusion models","venue":null,"work_id":"b44ebce5-47f1-4f14-b13b-b5b4eb072d2c","year":2023},"citing_paper":{"arxiv_id":"2606.23064","last_updated":"2026-06-22T09:13:57Z","snapshot_observed_at":"2026-08-06T08:41:01.968593Z","submitted_at":"2026-06-22T09:13:57Z","title":"STAR-VAE: Structured Topology-Aware Regularization for Audio Reconstruction and Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-26T07:26:28.527338Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2606.23064"},"observation_digest":"sha256:34a15a99f8fb161d9da9d4208b06b0cec88bc02ee9f2f0db37a83da5a4ce77a0","observation_id":"6553f382-ad31-49dd-8943-a4627ad387a8","resolution":{"observed_at":"2026-07-04T11:59:50.471182Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":"2301.12503","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-07-04T11:59:50.469153Z","title":"Audioldm: Text-to-audio generation with latent diffusion models","venue":null,"work_id":"b44ebce5-47f1-4f14-b13b-b5b4eb072d2c","year":2023},"citing_paper":{"arxiv_id":"2606.23898","last_updated":"2026-06-22T19:54:25Z","snapshot_observed_at":"2026-08-03T19:05:46.469138Z","submitted_at":"2026-06-22T19:54:25Z","title":"ARIA: Adaptive Region-Based Importance Allocation for Conditional Diffusion Distillation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-26T08:41:11.951712Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2606.23898"},"observation_digest":"sha256:a4743357ea12138f31549eaa1bc3a8bb2513acd81fad3d1cb8ec115f47b7c5d0","observation_id":"201afcc3-58ad-49f4-b226-f6f680c2fc2d","resolution":{"observed_at":"2026-07-04T10:39:44.954421Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":"2301.12503","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-07-04T11:59:50.469153Z","title":"Audioldm: Text-to-audio generation with latent diffusion models","venue":null,"work_id":"b44ebce5-47f1-4f14-b13b-b5b4eb072d2c","year":2023},"citing_paper":{"arxiv_id":"2606.29473","last_updated":"2026-07-13T12:28:13Z","snapshot_observed_at":"2026-07-16T23:19:38.740232Z","submitted_at":"2026-06-28T16:01:04Z","title":"MAVIN: Multi-Shot Audio-Visual Generation with Customized Narrative Control","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-30T07:18:20.501369Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2606.29473"},"observation_digest":"sha256:5a6b13349333dab1a6dd39e3b327c57a758c6c3b76a3de24ac576f5499b85fcc","observation_id":"1f58b6b3-7635-4d6a-b9b4-127dc290554b","resolution":{"observed_at":"2026-06-30T07:24:21.554371Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-07-14T17:03:01.432145Z","title":"arXiv preprint arXiv:2301.12503 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.29473","last_updated":"2026-07-13T12:28:13Z","snapshot_observed_at":"2026-07-16T23:19:38.740232Z","submitted_at":"2026-06-28T16:01:04Z","title":"MAVIN: Multi-Shot Audio-Visual Generation with Customized Narrative Control","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-14T17:03:01.432145Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2606.29473"},"observation_digest":"sha256:034f93c08765df087e9de93fbb87442246eb15c4c9e0c841e150f3887728615b","observation_id":"d870af0f-cf64-45bc-add2-1507338a977b","resolution":{"observed_at":"2026-07-14T17:03:01.432145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":"2301.12503","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-07-04T11:59:50.469153Z","title":"Audioldm: Text-to-audio generation with latent diffusion models","venue":null,"work_id":"b44ebce5-47f1-4f14-b13b-b5b4eb072d2c","year":2023},"citing_paper":{"arxiv_id":"2606.30682","last_updated":"2026-06-27T03:56:57Z","snapshot_observed_at":"2026-07-07T00:04:29.879877Z","submitted_at":"2026-06-27T03:56:57Z","title":"ALM2Vec: Learning Audio Embeddings for Universal Audio Retrieval with Large Audio-Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-01T06:47:53.308909Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2606.30682"},"observation_digest":"sha256:4f50d1632dfc541037b8cf4e12492e6c6784e274166d485f5bf5081cd6a376be","observation_id":"09db36e7-d0b1-4508-9387-bb85347cb181","resolution":{"observed_at":"2026-07-01T09:05:37.221480Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":"2301.12503","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-07-04T11:59:50.469153Z","title":"Audioldm: Text-to-audio generation with latent diffusion models","venue":null,"work_id":"b44ebce5-47f1-4f14-b13b-b5b4eb072d2c","year":2023},"citing_paper":{"arxiv_id":"2607.02119","last_updated":"2026-07-02T12:55:11Z","snapshot_observed_at":"2026-08-04T18:11:17.418102Z","submitted_at":"2026-07-02T12:55:11Z","title":"An Efficient vLLM-Based Inference Pipeline for Unified Audio Understanding and Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-03T05:04:23.295592Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2607.02119"},"observation_digest":"sha256:3b70c85334a2cc5ffb3e42c34139f7039ede46550c8b16b26cf0dcc08f3ee98b","observation_id":"eda6be9b-5c73-4779-a2c7-3b4ba7304da7","resolution":{"observed_at":"2026-07-03T05:07:38.292439Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-07-11T12:34:20.057072Z","title":"Audioldm: Text-to-audio generation with latent diffusion models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04848","last_updated":"2026-07-06T09:19:03Z","snapshot_observed_at":"2026-08-07T07:26:18.976803Z","submitted_at":"2026-07-06T09:19:03Z","title":"SynSFX: Multi-Model Sound Effects Synthesis Dataset for Deepfake Detection and Evaluation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-11T12:34:20.057072Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2607.04848"},"observation_digest":"sha256:1e80ab8e058effdcb9b74bdc49bc3d442e813ca1a13122b4d750c0127dbf8f41","observation_id":"6b618a80-5245-450a-b915-ba7b6712dcc8","resolution":{"observed_at":"2026-07-11T12:34:20.057072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-07-14T10:59:22.914974Z","title":"AudioLDM: Text-to-audio generation with la- tent diffusion models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.10537","last_updated":"2026-07-12T02:40:27Z","snapshot_observed_at":"2026-08-07T05:57:25.851473Z","submitted_at":"2026-07-12T02:40:27Z","title":"Dance to Music Generation leveraging Pre-training with Unpaired data and Contrastive Alignment","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-14T10:59:22.914974Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2607.10537"},"observation_digest":"sha256:d1a6f296a61338631e6ea3f0763ef474bad4f12cbc0d2fb3610413dbda67405f","observation_id":"46dabe77-610a-4901-8c3c-bfea8c1bbebd","resolution":{"observed_at":"2026-07-14T10:59:22.914974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-08-02T06:45:40.274605Z","title":"Plumbley","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.12121","last_updated":"2026-07-15T22:00:17Z","snapshot_observed_at":"2026-08-02T06:45:34.904229Z","submitted_at":"2026-07-13T20:00:39Z","title":"FlashDiff: Efficient Regional Execution and Scheduling for Diffusion Model Serving","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T06:45:40.274605Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2607.12121"},"observation_digest":"sha256:b16c033d826cfa016f11a59ffebdb597feaf8d1c9b06cb918a576eff7503e3d9","observation_id":"c0eb786b-3987-46b9-8017-92c2c3547882","resolution":{"observed_at":"2026-08-02T06:45:40.274605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-08-01T11:59:45.840064Z","title":"Audioldm: Text-to-audio generation with latent diffusion models.arXiv preprint arXiv:2301.12503, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.19725","last_updated":"2026-08-06T15:36:22Z","snapshot_observed_at":"2026-08-07T06:39:29.942509Z","submitted_at":"2026-07-22T03:53:07Z","title":"Analytic Distribution of Classifier-Free Guidance for Schedule Design","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T11:59:45.840064Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2607.19725"},"observation_digest":"sha256:290fd96ac6b8c84bef68c7216ade665fab859db40c0a75ec2f31a800f009ee59","observation_id":"961127b7-5d90-47d2-a72e-207eddba16ef","resolution":{"observed_at":"2026-08-01T11:59:45.840064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-08-01T11:48:09.922353Z","title":"Audioldm: Text-to- audio generation with latent diffusion models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.19776","last_updated":"2026-07-22T05:50:47Z","snapshot_observed_at":"2026-08-01T11:48:07.549356Z","submitted_at":"2026-07-22T05:50:47Z","title":"RPPNet: Perceptually-Grouped Rhythm-Pitch Primitives for Long-Term Structure Melody Generation via Boundary-Aware Modeling","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T11:48:09.922353Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2607.19776"},"observation_digest":"sha256:fec0cec8f17249eafe7b009f4583d1a211bd73ac745972501824d610b1225fcf","observation_id":"09755735-db25-461a-a381-ef03fee5233a","resolution":{"observed_at":"2026-08-01T11:48:09.922353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-07-30T18:58:28.076405Z","title":"arXiv preprint arXiv:2301.12503 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26860","last_updated":"2026-07-29T12:44:19Z","snapshot_observed_at":"2026-08-06T09:28:43.159690Z","submitted_at":"2026-07-29T12:44:19Z","title":"Amortized Moment Matching for Visual Generation","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-07-30T18:58:28.076405Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2607.26860"},"observation_digest":"sha256:7d702124b8c73038920b2712be2fe8dc9c3f38b397e9d24b2d7a7f2474435b97","observation_id":"9bbb7541-3030-47ac-9cc4-64cb3ef81e9f","resolution":{"observed_at":"2026-07-30T18:58:28.076405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-08-03T12:46:58.947785Z","title":"Audioldm: Text-to-audio genera- tion with latent diffusion models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.29148","last_updated":"2026-07-31T08:30:23Z","snapshot_observed_at":"2026-08-05T23:12:45.941183Z","submitted_at":"2026-07-31T08:30:23Z","title":"Exploring Efficient Waveform Diffusion Models for Foley Sound Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T12:46:58.947785Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2607.29148"},"observation_digest":"sha256:6e20778d80cc65517819e27fc2df3ee0d816c78f22276399dba7b060875319f9","observation_id":"8e6509e6-dac5-48c8-9391-0c7876ebc211","resolution":{"observed_at":"2026-08-03T12:46:58.947785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-08-05T13:43:18.242065Z","title":"DOI 10.48550/arXiv.2301.12503","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.03742","last_updated":"2026-08-04T14:36:34Z","snapshot_observed_at":"2026-08-07T06:20:13.493257Z","submitted_at":"2026-08-04T14:36:34Z","title":"AI-Based Sound Effect Generation: A Narrative Review of Generative Models Across Input Modalities","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T13:43:18.242065Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2608.03742"},"observation_digest":"sha256:d8dffdcfeaea90ce0ed212ad9ad5ad9ad5746827fe5ac5699e9a74cdb4035fd4","observation_id":"5c16e57b-094a-4a42-a1dd-9b50a8f604f0","resolution":{"observed_at":"2026-08-05T13:43:18.242065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2301.12503/citation-record","integrity":"/paper/2301.12503/integrity","json":"/paper/2301.12503/citation-record.json","paper":"/paper/2301.12503"},"outbound":[],"paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","latest_version":3,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 62 inbound Pith citation observations for arXiv:2301.12503."}