{"as_of":"2026-08-08T03:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6d0cf8e4b0e7ab12554caa7b561db66c20bb01db68927078f4de4b109b364f89","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":14,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":14,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":14,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":14,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T21:10:02.504068Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T20:20:07.950402Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.13336","last_updated":"2023-04-02T09:27:20Z","snapshot_observed_at":"2026-07-06T15:07:11.623462Z","submitted_at":"2023-03-23T15:17:15Z","title":"A Survey on Audio Diffusion Models: Text To Speech Synthesis and Enhancement in Generative AI","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.13336","snapshot_observed_at":"2026-08-07T21:10:02.504068Z","title":"Available: https://doi.org/10.48550/arXiv.2303.13336","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09553","last_updated":"2025-02-13T18:05:12Z","snapshot_observed_at":"2026-08-07T21:00:13.315110Z","submitted_at":"2025-02-13T18:05:12Z","title":"SyntheticPop: Attacking Speaker Verification Systems With Synthetic VoicePops","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T21:10:02.504068Z"},"links":{"cited_paper":"/paper/2303.13336","citing_paper":"/paper/2502.09553"},"observation_digest":"sha256:ed92d50911ff1da206bdf9a8d34693e12e54ba5721c488eda1ba1e74677d5dd0","observation_id":"c57031df-7dd5-4e0b-8e73-f699b9d5cf01","resolution":{"observed_at":"2026-08-07T21:10:02.504068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.13336","last_updated":"2023-04-02T09:27:20Z","snapshot_observed_at":"2026-07-06T15:07:11.623462Z","submitted_at":"2023-03-23T15:17:15Z","title":"A Survey on Audio Diffusion Models: Text To Speech Synthesis and Enhancement in Generative AI","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.13336","snapshot_observed_at":"2026-08-07T11:26:58.845200Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02698","last_updated":"2025-06-06T03:14:26Z","snapshot_observed_at":"2026-08-07T11:15:42.841737Z","submitted_at":"2025-06-03T09:47:22Z","title":"Smoothed Preference Optimization via ReNoise Inversion for Aligning Diffusion Models with Varied Human Preferences","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:58.845200Z"},"links":{"cited_paper":"/paper/2303.13336","citing_paper":"/paper/2506.02698"},"observation_digest":"sha256:af694aca18eaaafb1765b27082777416326d4a307d8f19078a2a3968873362c0","observation_id":"decb9ae9-765b-439a-8be8-2b9f73f8a154","resolution":{"observed_at":"2026-08-07T11:26:58.845200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.13336","last_updated":"2023-04-02T09:27:20Z","snapshot_observed_at":"2026-07-06T15:07:11.623462Z","submitted_at":"2023-03-23T15:17:15Z","title":"A Survey on Audio Diffusion Models: Text To Speech Synthesis and Enhancement in Generative AI","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.13336","snapshot_observed_at":"2026-08-07T04:45:19.307090Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09874","last_updated":"2025-07-10T19:47:47Z","snapshot_observed_at":"2026-08-07T16:56:30.600491Z","submitted_at":"2025-06-11T15:43:08Z","title":"UmbraTTS: Adapting Text-to-Speech to Environmental Contexts with Flow Matching","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:19.307090Z"},"links":{"cited_paper":"/paper/2303.13336","citing_paper":"/paper/2506.09874"},"observation_digest":"sha256:39ed86cdb57479cba38c5f6ddcc969fad8e35cfd7a3e2ab95da5495f942da446","observation_id":"ba40f52d-e387-48a7-9d1b-dcec9d791bdd","resolution":{"observed_at":"2026-08-07T04:45:19.307090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.13336","last_updated":"2023-04-02T09:27:20Z","snapshot_observed_at":"2026-07-06T15:07:11.623462Z","submitted_at":"2023-03-23T15:17:15Z","title":"A Survey on Audio Diffusion Models: Text To Speech Synthesis and Enhancement in Generative AI","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.13336","snapshot_observed_at":"2026-08-07T04:17:40.247061Z","title":"Zhang, C","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11378","last_updated":"2026-07-16T14:14:55Z","snapshot_observed_at":"2026-08-07T05:42:26.661480Z","submitted_at":"2025-06-13T01:01:07Z","title":"The Effect of Stochasticity in Score-Based Diffusion Sampling: a KL Divergence Analysis","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T04:17:40.247061Z"},"links":{"cited_paper":"/paper/2303.13336","citing_paper":"/paper/2506.11378"},"observation_digest":"sha256:2ff55a3c78f5421edc09a9c3f3e34e69a05062dc50e4d9e1f33d5a33988cea43","observation_id":"ed6b3a6c-29f5-478f-83a8-d6b4cdc25168","resolution":{"observed_at":"2026-08-07T04:17:40.247061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.13336","last_updated":"2023-04-02T09:27:20Z","snapshot_observed_at":"2026-07-06T15:07:11.623462Z","submitted_at":"2023-03-23T15:17:15Z","title":"A Survey on Audio Diffusion Models: Text To Speech Synthesis and Enhancement in Generative AI","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.13336","snapshot_observed_at":"2026-08-06T19:57:18.263678Z","title":"A survey on audio diffusion models: Text to speech synthesis and enhancement in generative ai,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04290","last_updated":"2025-07-06T08:16:50Z","snapshot_observed_at":"2026-08-07T03:07:44.319031Z","submitted_at":"2025-07-06T08:16:50Z","title":"MPQ-DMv2: Flexible Residual Mixed Precision Quantization for Low-Bit Diffusion Models with Temporal Distillation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T19:57:18.263678Z"},"links":{"cited_paper":"/paper/2303.13336","citing_paper":"/paper/2507.04290"},"observation_digest":"sha256:d987e3a5d6095625bebc7fd884b32ed153e0325d5fe73812b4bbae0a838e95e1","observation_id":"bdb366e9-50f0-4711-99f6-962014b3a2e2","resolution":{"observed_at":"2026-08-06T19:57:18.263678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.13336","last_updated":"2023-04-02T09:27:20Z","snapshot_observed_at":"2026-07-06T15:07:11.623462Z","submitted_at":"2023-03-23T15:17:15Z","title":"A Survey on Audio Diffusion Models: Text To Speech Synthesis and Enhancement in Generative AI","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.13336","snapshot_observed_at":"2026-08-06T05:17:06.655722Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.02038","last_updated":"2025-08-14T01:47:28Z","snapshot_observed_at":"2026-08-08T00:25:19.301459Z","submitted_at":"2025-08-04T04:08:22Z","title":"Marco-Voice Technical Report","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T05:17:06.655722Z"},"links":{"cited_paper":"/paper/2303.13336","citing_paper":"/paper/2508.02038"},"observation_digest":"sha256:e1aeb91f46c98db0537d8e29a53779a78af93b85c25769a9c78e4155c7379915","observation_id":"605f7043-c24c-42d9-82e5-de471472d079","resolution":{"observed_at":"2026-08-06T05:17:06.655722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.13336","last_updated":"2023-04-02T09:27:20Z","snapshot_observed_at":"2026-07-06T15:07:11.623462Z","submitted_at":"2023-03-23T15:17:15Z","title":"A Survey on Audio Diffusion Models: Text To Speech Synthesis and Enhancement in Generative AI","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.13336","snapshot_observed_at":"2026-08-04T10:49:26.632802Z","title":"A Survey on Audio Diffusion Models: Text To Speech Synthesis and Enhancement in Generative AI.arXiv preprint arXiv:2303.13336,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.08535","last_updated":"2026-05-28T17:45:39Z","snapshot_observed_at":"2026-08-04T10:49:24.401603Z","submitted_at":"2025-10-09T17:52:19Z","title":"Permutation-Invariant Spectral Learning via Dyson Diffusion","version":2},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-04T10:49:26.632802Z"},"links":{"cited_paper":"/paper/2303.13336","citing_paper":"/paper/2510.08535"},"observation_digest":"sha256:fd16a250491d4736369bb0ab99fe653532914ef39571fba7b63510803d974c1a","observation_id":"c4712f20-4b91-46b7-81db-1de49dcf08e2","resolution":{"observed_at":"2026-08-04T10:49:26.632802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.13336","last_updated":"2023-04-02T09:27:20Z","snapshot_observed_at":"2026-07-06T15:07:11.623462Z","submitted_at":"2023-03-23T15:17:15Z","title":"A Survey on Audio Diffusion Models: Text To Speech Synthesis and Enhancement in Generative AI","version":2},"cited_work":{"arxiv_id":"2303.13336","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2303.13336","snapshot_observed_at":"2026-07-04T20:20:07.950402Z","title":"arXiv preprint arXiv:2303.13336 , year=","venue":null,"work_id":"cab0d1bb-3d8c-4a20-82d1-92a7bca9f83e","year":2023},"citing_paper":{"arxiv_id":"2604.10074","last_updated":"2026-04-11T07:46:15Z","snapshot_observed_at":"2026-07-06T22:58:47.599383Z","submitted_at":"2026-04-11T07:46:15Z","title":"Transformers Learn the Optimal DDPM Denoiser for Multi-Token GMMs","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-05-10T16:23:50.751356Z"},"links":{"cited_paper":"/paper/2303.13336","citing_paper":"/paper/2604.10074"},"observation_digest":"sha256:a4e301e9e694ec6505505d7cc04f7c5e5e4116955ea9ea754c3e789563a27116","observation_id":"f121603c-f82c-4356-bc00-ee365d68637c","resolution":{"observed_at":"2026-05-11T08:56:02.720588Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.13336","last_updated":"2023-04-02T09:27:20Z","snapshot_observed_at":"2026-07-06T15:07:11.623462Z","submitted_at":"2023-03-23T15:17:15Z","title":"A Survey on Audio Diffusion Models: Text To Speech Synthesis and Enhancement in Generative AI","version":2},"cited_work":{"arxiv_id":"2303.13336","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2303.13336","snapshot_observed_at":"2026-07-04T20:20:07.950402Z","title":"arXiv preprint arXiv:2303.13336 , year=","venue":null,"work_id":"cab0d1bb-3d8c-4a20-82d1-92a7bca9f83e","year":2023},"citing_paper":{"arxiv_id":"2604.17673","last_updated":"2026-04-20T00:02:00Z","snapshot_observed_at":"2026-07-06T23:04:41.564912Z","submitted_at":"2026-04-20T00:02:00Z","title":"Grokking of Diffusion Models: Case Study on Modular Addition","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-10T05:28:08.221886Z"},"links":{"cited_paper":"/paper/2303.13336","citing_paper":"/paper/2604.17673"},"observation_digest":"sha256:92fa2b9eef7bba0c05ef9c272c0eebea394d8a3070399af7791b1322da62de06","observation_id":"e561caa1-c2cb-4966-adf2-af054f964a90","resolution":{"observed_at":"2026-05-10T06:56:47.869487Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.13336","last_updated":"2023-04-02T09:27:20Z","snapshot_observed_at":"2026-07-06T15:07:11.623462Z","submitted_at":"2023-03-23T15:17:15Z","title":"A Survey on Audio Diffusion Models: Text To Speech Synthesis and Enhancement in Generative AI","version":2},"cited_work":{"arxiv_id":"2303.13336","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2303.13336","snapshot_observed_at":"2026-07-04T20:20:07.950402Z","title":"arXiv preprint arXiv:2303.13336 , year=","venue":null,"work_id":"cab0d1bb-3d8c-4a20-82d1-92a7bca9f83e","year":2023},"citing_paper":{"arxiv_id":"2605.02973","last_updated":"2026-05-12T16:45:17Z","snapshot_observed_at":"2026-07-06T23:15:55.848885Z","submitted_at":"2026-05-03T16:17:38Z","title":"Structured Diffusion Bridges: Inductive Bias for Denoising Diffusion Bridges","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-05-10T15:21:02.100545Z"},"links":{"cited_paper":"/paper/2303.13336","citing_paper":"/paper/2605.02973"},"observation_digest":"sha256:cf31b06b44108b8286bbabb5dc77082ef20f622730e3528bc95bba33bb8ac66a","observation_id":"b9d300d0-be12-4912-819b-708ed15ab9dc","resolution":{"observed_at":"2026-05-11T10:46:01.259983Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.13336","last_updated":"2023-04-02T09:27:20Z","snapshot_observed_at":"2026-07-06T15:07:11.623462Z","submitted_at":"2023-03-23T15:17:15Z","title":"A Survey on Audio Diffusion Models: Text To Speech Synthesis and Enhancement in Generative AI","version":2},"cited_work":{"arxiv_id":"2303.13336","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2303.13336","snapshot_observed_at":"2026-07-04T20:20:07.950402Z","title":"arXiv preprint arXiv:2303.13336 , year=","venue":null,"work_id":"cab0d1bb-3d8c-4a20-82d1-92a7bca9f83e","year":2023},"citing_paper":{"arxiv_id":"2605.02973","last_updated":"2026-05-12T16:45:17Z","snapshot_observed_at":"2026-07-06T23:15:55.848885Z","submitted_at":"2026-05-03T16:17:38Z","title":"Structured Diffusion Bridges: Inductive Bias for Denoising Diffusion Bridges","version":3},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-05-13T07:08:43.088643Z"},"links":{"cited_paper":"/paper/2303.13336","citing_paper":"/paper/2605.02973"},"observation_digest":"sha256:644213c96a42462d02b5092422be9ac4256ca691d1917dfecf5a184e207310af","observation_id":"94a39d1e-6cab-447d-8a3e-e1ea1d83cc1b","resolution":{"observed_at":"2026-05-13T07:12:28.683468Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.13336","last_updated":"2023-04-02T09:27:20Z","snapshot_observed_at":"2026-07-06T15:07:11.623462Z","submitted_at":"2023-03-23T15:17:15Z","title":"A Survey on Audio Diffusion Models: Text To Speech Synthesis and Enhancement in Generative AI","version":2},"cited_work":{"arxiv_id":"2303.13336","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2303.13336","snapshot_observed_at":"2026-07-04T20:20:07.950402Z","title":"arXiv preprint arXiv:2303.13336 , year=","venue":null,"work_id":"cab0d1bb-3d8c-4a20-82d1-92a7bca9f83e","year":2023},"citing_paper":{"arxiv_id":"2605.09439","last_updated":"2026-05-10T09:27:55Z","snapshot_observed_at":"2026-07-06T23:21:30.897592Z","submitted_at":"2026-05-10T09:27:55Z","title":"Inverse Design for Conditional Distribution Matching","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-12T04:46:08.232616Z"},"links":{"cited_paper":"/paper/2303.13336","citing_paper":"/paper/2605.09439"},"observation_digest":"sha256:da27a5057395b82d337876ec22145d1f3f0de8083cfc2f1c7b50589b6d948e98","observation_id":"ea88926b-e53f-435c-8d21-638ff2aa0b9c","resolution":{"observed_at":"2026-05-12T05:56:29.547249Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.13336","last_updated":"2023-04-02T09:27:20Z","snapshot_observed_at":"2026-07-06T15:07:11.623462Z","submitted_at":"2023-03-23T15:17:15Z","title":"A Survey on Audio Diffusion Models: Text To Speech Synthesis and Enhancement in Generative AI","version":2},"cited_work":{"arxiv_id":"2303.13336","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2303.13336","snapshot_observed_at":"2026-07-04T20:20:07.950402Z","title":"arXiv preprint arXiv:2303.13336 , year=","venue":null,"work_id":"cab0d1bb-3d8c-4a20-82d1-92a7bca9f83e","year":2023},"citing_paper":{"arxiv_id":"2606.00673","last_updated":"2026-05-30T11:03:58Z","snapshot_observed_at":"2026-08-06T23:09:43.745772Z","submitted_at":"2026-05-30T11:03:58Z","title":"T-CLIP: Enabling Thermal Perception for Contrastive Language-Image Pretraining","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-06-28T18:53:10.978631Z"},"links":{"cited_paper":"/paper/2303.13336","citing_paper":"/paper/2606.00673"},"observation_digest":"sha256:198c63c405df9ce268b147281f3b97f04f71385ac8e3bab76d5bb0cc8f1d5550","observation_id":"3af78a66-4dca-439b-a3ff-dd229d8d4773","resolution":{"observed_at":"2026-06-28T19:52:35.108279Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.13336","last_updated":"2023-04-02T09:27:20Z","snapshot_observed_at":"2026-07-06T15:07:11.623462Z","submitted_at":"2023-03-23T15:17:15Z","title":"A Survey on Audio Diffusion Models: Text To Speech Synthesis and Enhancement in Generative AI","version":2},"cited_work":{"arxiv_id":"2303.13336","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2303.13336","snapshot_observed_at":"2026-07-04T20:20:07.950402Z","title":"arXiv preprint arXiv:2303.13336 , year=","venue":null,"work_id":"cab0d1bb-3d8c-4a20-82d1-92a7bca9f83e","year":2023},"citing_paper":{"arxiv_id":"2606.25424","last_updated":"2026-06-24T05:32:20Z","snapshot_observed_at":"2026-08-06T20:58:04.719575Z","submitted_at":"2026-06-24T05:32:20Z","title":"Adaptive Oscillatory Inductive Bias for Modeling Sharp Prosodic Dynamics in Diffusion-Based TTS","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-25T20:11:18.045777Z"},"links":{"cited_paper":"/paper/2303.13336","citing_paper":"/paper/2606.25424"},"observation_digest":"sha256:30506008c2889daa7ac125395903bfb8eb751a03421306b8b6cbf2420bbaff03","observation_id":"62e40a7a-ec40-46d4-98a8-9300c21c4415","resolution":{"observed_at":"2026-07-04T20:20:07.953940Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2303.13336/citation-record","integrity":"/paper/2303.13336/integrity","json":"/paper/2303.13336/citation-record.json","paper":"/paper/2303.13336"},"outbound":[],"paper":{"arxiv_id":"2303.13336","last_updated":"2023-04-02T09:27:20Z","latest_version":2,"primary_category":"cs.SD","snapshot_observed_at":"2026-07-06T15:07:11.623462Z","submitted_at":"2023-03-23T15:17:15Z","title":"A Survey on Audio Diffusion Models: Text To Speech Synthesis and Enhancement in Generative AI"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 14 inbound Pith citation observations for arXiv:2303.13336."}