{"as_of":"2026-08-08T05:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e31173557637aee6a95eb1d84fb5f6f49ca6689d39574841fc32fb0af9daf6d7","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:21:11.797874Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:21:08.234057Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T15:46:43.538548Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.22106","last_updated":"2025-05-28T08:33:58Z","snapshot_observed_at":"2026-08-07T13:12:43.270911Z","submitted_at":"2025-05-28T08:33:58Z","title":"AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22106","snapshot_observed_at":"2026-08-07T13:21:08.234057Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22106","last_updated":"2025-05-28T08:33:58Z","snapshot_observed_at":"2026-08-07T13:12:43.270911Z","submitted_at":"2025-05-28T08:33:58Z","title":"AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:08.234057Z"},"links":{"cited_paper":"/paper/2505.22106","citing_paper":"/paper/2505.22106"},"observation_digest":"sha256:f47d35c5fa486047067a0995cb53845ac6724364749ae6e99614f23671c31d6a","observation_id":"16b46a8c-60f9-4f40-b30b-ba41836a6fb7","resolution":{"observed_at":"2026-08-07T13:21:08.234057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22106","last_updated":"2025-05-28T08:33:58Z","snapshot_observed_at":"2026-08-07T13:12:43.270911Z","submitted_at":"2025-05-28T08:33:58Z","title":"AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion","version":1},"cited_work":{"arxiv_id":"2505.22106","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22106","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Audioturbo: Fast text-to- audio generation with rectified diffusion.arXiv preprint arXiv:2505.22106","venue":null,"work_id":"68455081-6c5e-450f-93ae-61584afeb0f1","year":null},"citing_paper":{"arxiv_id":"2605.00329","last_updated":"2026-05-01T01:13:50Z","snapshot_observed_at":"2026-08-04T21:56:38.114801Z","submitted_at":"2026-05-01T01:13:50Z","title":"Fast Text-to-Audio Generation with One-Step Sampling via Energy-Scoring and Auxiliary Contextual Representation Distillation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-09T19:17:09.247932Z"},"links":{"cited_paper":"/paper/2505.22106","citing_paper":"/paper/2605.00329"},"observation_digest":"sha256:4b8a0f6973de0efb0bd2c63a7545a247e465ba007ff51bb378ae723cdf2c5494","observation_id":"e1c9d323-e989-4711-81ed-a990793ad6f7","resolution":{"observed_at":"2026-05-11T15:46:43.615417Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22106","last_updated":"2025-05-28T08:33:58Z","snapshot_observed_at":"2026-08-07T13:12:43.270911Z","submitted_at":"2025-05-28T08:33:58Z","title":"AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22106","snapshot_observed_at":"2026-07-14T11:52:50.598080Z","title":"Audioturbo: Fast text-to-audio generation with rectified diffusion,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10421","last_updated":"2026-07-11T17:59:32Z","snapshot_observed_at":"2026-08-07T22:08:00.566907Z","submitted_at":"2026-07-11T17:59:32Z","title":"FdAudio: MeanFlow-Anchored Fr\\'echet-Distance Post-Training for One-Step Text-to-Audio Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-14T11:52:50.598080Z"},"links":{"cited_paper":"/paper/2505.22106","citing_paper":"/paper/2607.10421"},"observation_digest":"sha256:86f5ab90615e885aff29b91a17e381974e68079a279b23ccf52e7f9bdee41771","observation_id":"4836bf38-4f4a-4b3e-974a-49ec1ab4827e","resolution":{"observed_at":"2026-07-14T11:52:50.598080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.22106/citation-record","integrity":"/paper/2505.22106/integrity","json":"/paper/2505.22106/citation-record.json","paper":"/paper/2505.22106"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:21:16.771179Z","title":"The audio generated by TTA systems is primarily categorized into three types: speech, sound effects, and music","venue":null,"work_id":"a3506633-8a25-4f72-adf8-742cf1ab04b8","year":null},"citing_paper":{"arxiv_id":"2505.22106","last_updated":"2025-05-28T08:33:58Z","snapshot_observed_at":"2026-08-07T13:12:43.270911Z","submitted_at":"2025-05-28T08:33:58Z","title":"AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:08.126646Z"},"links":{"citing_paper":"/paper/2505.22106"},"observation_digest":"sha256:4f012da4b2fc9e74dc2ccaedf73f02525099bd319d191e27cd401f57e1968bc7","observation_id":"d6304768-44fd-463d-9ff2-886fe2eee27b","resolution":{"observed_at":"2026-08-07T13:21:16.912318Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:21:16.535497Z","title":null,"venue":null,"work_id":"1e6d6de2-82e4-4213-8189-80adae3c51e2","year":null},"citing_paper":{"arxiv_id":"2505.22106","last_updated":"2025-05-28T08:33:58Z","snapshot_observed_at":"2026-08-07T13:12:43.270911Z","submitted_at":"2025-05-28T08:33:58Z","title":"AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:08.315871Z"},"links":{"citing_paper":"/paper/2505.22106"},"observation_digest":"sha256:3f47b60b988460f26d9a7f6d5525878576ea7b20c82ebb6a1a164ac5b2fa4bf6","observation_id":"3cff68ac-83e2-4e74-a213-17a4a2a700b8","resolution":{"observed_at":"2026-08-07T13:21:16.657206Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:21:16.319728Z","title":null,"venue":null,"work_id":"aec91d30-0ee8-4883-8767-5138390cc02d","year":null},"citing_paper":{"arxiv_id":"2505.22106","last_updated":"2025-05-28T08:33:58Z","snapshot_observed_at":"2026-08-07T13:12:43.270911Z","submitted_at":"2025-05-28T08:33:58Z","title":"AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:08.381010Z"},"links":{"citing_paper":"/paper/2505.22106"},"observation_digest":"sha256:5a779acff7eeb6c908af34724731b29182f8e787fef501b96a22e3badd1d14b9","observation_id":"188b390f-9bf8-4812-a1e7-2cb7eeafea2e","resolution":{"observed_at":"2026-08-07T13:21:16.369102Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:21:16.165015Z","title":"Experimental Setup 4.1.1","venue":null,"work_id":"7ed2af7d-7129-4ff6-95c2-72f14ab1f6e4","year":null},"citing_paper":{"arxiv_id":"2505.22106","last_updated":"2025-05-28T08:33:58Z","snapshot_observed_at":"2026-08-07T13:12:43.270911Z","submitted_at":"2025-05-28T08:33:58Z","title":"AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:08.490860Z"},"links":{"citing_paper":"/paper/2505.22106"},"observation_digest":"sha256:f482fbd9f3195f4e723e51707fb1fef06b493f763715fb0afa41fa72e864079d","observation_id":"449c3509-6295-4986-8fa8-3428ff23a207","resolution":{"observed_at":"2026-08-07T13:21:16.256670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:21:15.933166Z","title":"Experiments show that by combining SOTA TTA models with rectified dif- fusion, AudioTurbo surpasses baseline models in both objec- tive and subjective evaluations","venue":null,"work_id":"a0c9d34a-8201-4c8b-936b-3342c2cb184f","year":null},"citing_paper":{"arxiv_id":"2505.22106","last_updated":"2025-05-28T08:33:58Z","snapshot_observed_at":"2026-08-07T13:12:43.270911Z","submitted_at":"2025-05-28T08:33:58Z","title":"AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:08.604528Z"},"links":{"citing_paper":"/paper/2505.22106"},"observation_digest":"sha256:ee5c926ed506211a4b1ee6bb782c18e2ecbd999d4e4b83a08e5a40a6479bbea4","observation_id":"70c680c0-050c-49b8-9323-c2f85c9414c3","resolution":{"observed_at":"2026-08-07T13:21:16.014805Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:21:15.331563Z","title":"Text-to- speech and speech-to-text converter—voice assistant,","venue":null,"work_id":"dc936632-3870-4f83-8315-5ae67b57f3c0","year":2023},"citing_paper":{"arxiv_id":"2505.22106","last_updated":"2025-05-28T08:33:58Z","snapshot_observed_at":"2026-08-07T13:12:43.270911Z","submitted_at":"2025-05-28T08:33:58Z","title":"AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:09.174219Z"},"links":{"citing_paper":"/paper/2505.22106"},"observation_digest":"sha256:42ad2d6d1dc4bc89a6b5840ac7301485efb6daabda4d9f1918e02669f4b71e52","observation_id":"e18e24ed-cd8b-4d7d-8e63-2bf24d17ae8d","resolution":{"observed_at":"2026-08-07T13:21:15.393706Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:21:15.766670Z","title":"AudioGen: Textu- ally guided audio generation,","venue":null,"work_id":"f2776aec-198d-43bb-85d3-6102790918cd","year":null},"citing_paper":{"arxiv_id":"2505.22106","last_updated":"2025-05-28T08:33:58Z","snapshot_observed_at":"2026-08-07T13:12:43.270911Z","submitted_at":"2025-05-28T08:33:58Z","title":"AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:08.694625Z"},"links":{"citing_paper":"/paper/2505.22106"},"observation_digest":"sha256:e6fd3b9ce8d692abf3eee3cde7af1fd929fe80c119549f26c0112d923aa8ea74","observation_id":"996763e3-ead4-4ff1-ac9d-5384786a0b32","resolution":{"observed_at":"2026-08-07T13:21:15.840924Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","snapshot_observed_at":"2026-07-06T16:26:09.878745Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00704","snapshot_observed_at":"2026-08-07T13:21:08.829562Z","title":"UniAudio: An audio founda- tion model toward universal audio generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22106","last_updated":"2025-05-28T08:33:58Z","snapshot_observed_at":"2026-08-07T13:12:43.270911Z","submitted_at":"2025-05-28T08:33:58Z","title":"AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:08.829562Z"},"links":{"cited_paper":"/paper/2310.00704","citing_paper":"/paper/2505.22106"},"observation_digest":"sha256:e3be8ac2f9a478b00f9ae265387bbd2b509c8411e2af5b355121471923f02efc","observation_id":"48e7124c-05e4-43c9-bb0d-10ed4f8b5f88","resolution":{"observed_at":"2026-08-07T13:21:08.829562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:21:15.528350Z","title":"Diffsound: Discrete diffusion model for text-to-sound genera- tion,","venue":null,"work_id":"4c3fcd21-cff9-40b6-8828-fb319c2bc338","year":2023},"citing_paper":{"arxiv_id":"2505.22106","last_updated":"2025-05-28T08:33:58Z","snapshot_observed_at":"2026-08-07T13:12:43.270911Z","submitted_at":"2025-05-28T08:33:58Z","title":"AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:08.918467Z"},"links":{"citing_paper":"/paper/2505.22106"},"observation_digest":"sha256:10a08a4a3b993eb3860cd97169eedf23ad31343da463b3f55225214eb24aa78e","observation_id":"a410e71b-55ac-4f22-90e5-3cddaabb01e0","resolution":{"observed_at":"2026-08-07T13:21:15.636832Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:21:08.977066Z","title":"AudioLDM: text-to-audio generation with latent diffusion models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22106","last_updated":"2025-05-28T08:33:58Z","snapshot_observed_at":"2026-08-07T13:12:43.270911Z","submitted_at":"2025-05-28T08:33:58Z","title":"AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:08.977066Z"},"links":{"citing_paper":"/paper/2505.22106"},"observation_digest":"sha256:9be6420ed901993d446d388e9dcdc30d0e5ce518477d562648b7cafe8afbefaf","observation_id":"8fa498a3-943f-43af-bedc-20bed2a17b9e","resolution":{"observed_at":"2026-08-07T13:21:08.977066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:21:15.453145Z","title":"Text-to- audio generation using instruction guided latent diffusion model,","venue":null,"work_id":"e4b4f333-7d2c-4cda-95fc-6b9dd4417300","year":2023},"citing_paper":{"arxiv_id":"2505.22106","last_updated":"2025-05-28T08:33:58Z","snapshot_observed_at":"2026-08-07T13:12:43.270911Z","submitted_at":"2025-05-28T08:33:58Z","title":"AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:09.067774Z"},"links":{"citing_paper":"/paper/2505.22106"},"observation_digest":"sha256:3603aae292bb8651e1e3d7614aa90d30ca6422fa71c298f162915c1c05561ebc","observation_id":"ecd636f1-098b-43a6-bcfa-3be362a7d582","resolution":{"observed_at":"2026-08-07T13:21:15.474788Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:21:14.894634Z","title":"Auffusion: Leveraging the power of diffusion and large language models for text-to-audio generation,","venue":null,"work_id":"fbdee150-129c-4a67-8ffe-47ca47902007","year":2024},"citing_paper":{"arxiv_id":"2505.22106","last_updated":"2025-05-28T08:33:58Z","snapshot_observed_at":"2026-08-07T13:12:43.270911Z","submitted_at":"2025-05-28T08:33:58Z","title":"AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:09.576858Z"},"links":{"citing_paper":"/paper/2505.22106"},"observation_digest":"sha256:8f9eca981b774e0e32c1b2234052444d2cb205b743b613bf5a02955e03e58d87","observation_id":"324cf7b1-8a97-45d3-b539-fe17446ad53e","resolution":{"observed_at":"2026-08-07T13:21:14.965027Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00146","last_updated":"2024-05-31T19:20:27Z","snapshot_observed_at":"2026-07-06T18:23:35.715237Z","submitted_at":"2024-05-31T19:20:27Z","title":"A Survey of Deep Learning Audio Generation Methods","version":1},"cited_work":{"arxiv_id":"2406.00146","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.00146","snapshot_observed_at":"2026-08-07T13:21:12.403378Z","title":"A Survey of Deep Learning Audio Generation Methods","venue":"cs.SD","work_id":"6898fd66-44d7-428b-aaf5-247b342f9235","year":2024},"citing_paper":{"arxiv_id":"2505.22106","last_updated":"2025-05-28T08:33:58Z","snapshot_observed_at":"2026-08-07T13:12:43.270911Z","submitted_at":"2025-05-28T08:33:58Z","title":"AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:09.219476Z"},"links":{"cited_paper":"/paper/2406.00146","citing_paper":"/paper/2505.22106"},"observation_digest":"sha256:485d9dcfb25401efedffd8391c48fecd2c61720262ca3de9b2a92f41f176d41f","observation_id":"2364a185-a311-47ac-8138-ba5b99cdf58f","resolution":{"observed_at":"2026-08-07T13:21:12.508986Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.17018","last_updated":"2024-04-25T20:24:08Z","snapshot_observed_at":"2026-08-07T16:55:52.914150Z","submitted_at":"2024-04-25T20:24:08Z","title":"Leveraging AI to Generate Audio for User-generated Content in Video Games","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.17018","snapshot_observed_at":"2026-08-07T13:21:09.271962Z","title":"Lever- aging AI to generate audio for user-generated content in video games,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22106","last_updated":"2025-05-28T08:33:58Z","snapshot_observed_at":"2026-08-07T13:12:43.270911Z","submitted_at":"2025-05-28T08:33:58Z","title":"AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:09.271962Z"},"links":{"cited_paper":"/paper/2404.17018","citing_paper":"/paper/2505.22106"},"observation_digest":"sha256:c5080fbca1c40e5f729a9fcb90781a6d11fc22e1efc8f473d1ae8ab512989d7a","observation_id":"1dc413e4-7aa3-4b26-939f-d7aa7b8798a4","resolution":{"observed_at":"2026-08-07T13:21:09.271962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.11325","last_updated":"2023-01-26T18:58:53Z","snapshot_observed_at":"2026-07-06T14:45:00.730733Z","submitted_at":"2023-01-26T18:58:53Z","title":"MusicLM: Generating Music From Text","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.11325","snapshot_observed_at":"2026-08-07T13:21:09.317308Z","title":"MusicLM: Generating music from text,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22106","last_updated":"2025-05-28T08:33:58Z","snapshot_observed_at":"2026-08-07T13:12:43.270911Z","submitted_at":"2025-05-28T08:33:58Z","title":"AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:09.317308Z"},"links":{"cited_paper":"/paper/2301.11325","citing_paper":"/paper/2505.22106"},"observation_digest":"sha256:1895f73afecf839f9ae35abf968d16dc43e60db6b532c4ce28432198f6d32b43","observation_id":"f5385b2f-81a6-4a07-ba71-c9234fdec4b1","resolution":{"observed_at":"2026-08-07T13:21:09.317308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:21:15.171918Z","title":"Neural discrete representa- tion learning,","venue":null,"work_id":"ecdd865d-045f-4e9e-82db-04e40517a10e","year":2017},"citing_paper":{"arxiv_id":"2505.22106","last_updated":"2025-05-28T08:33:58Z","snapshot_observed_at":"2026-08-07T13:12:43.270911Z","submitted_at":"2025-05-28T08:33:58Z","title":"AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:09.421624Z"},"links":{"citing_paper":"/paper/2505.22106"},"observation_digest":"sha256:f76f7089e34b62f8fb9d9b5aa60efac00225d69ed1e5304dd4f80f71b044f979","observation_id":"abab167c-2d2b-4f13-b3c8-cd455917149c","resolution":{"observed_at":"2026-08-07T13:21:15.252714Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:21:15.058021Z","title":"High-resolution image synthesis with latent diffusion models,","venue":null,"work_id":"fa659ad1-00e4-4938-b4f7-bdb437ecc356","year":2022},"citing_paper":{"arxiv_id":"2505.22106","last_updated":"2025-05-28T08:33:58Z","snapshot_observed_at":"2026-08-07T13:12:43.270911Z","submitted_at":"2025-05-28T08:33:58Z","title":"AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:09.522549Z"},"links":{"citing_paper":"/paper/2505.22106"},"observation_digest":"sha256:e2732a58448adc8c255d0eb56e07f410c1f44fea0ac664c9ea3d39065ea3e141","observation_id":"5bc62098-92a7-45ed-b6b2-9cba5573bef3","resolution":{"observed_at":"2026-08-07T13:21:15.108186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:21:14.366702Z","title":"FlashSpeech: Efficient zero-shot speech synthesis,","venue":null,"work_id":"6ae64f64-02cd-4132-8d0c-0af41120d638","year":2024},"citing_paper":{"arxiv_id":"2505.22106","last_updated":"2025-05-28T08:33:58Z","snapshot_observed_at":"2026-08-07T13:12:43.270911Z","submitted_at":"2025-05-28T08:33:58Z","title":"AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:10.261567Z"},"links":{"citing_paper":"/paper/2505.22106"},"observation_digest":"sha256:283deaa140f5c9be6d65d5636ccfb713c518d62dc7361b9e28423c4c5386b780","observation_id":"46e480b0-65a8-49e1-ab75-95129389b619","resolution":{"observed_at":"2026-08-07T13:21:14.428965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:21:09.620536Z","title":"AudioLDM 2: Learn- ing holistic audio generation with self-supervised pretraining,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22106","last_updated":"2025-05-28T08:33:58Z","snapshot_observed_at":"2026-08-07T13:12:43.270911Z","submitted_at":"2025-05-28T08:33:58Z","title":"AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:09.620536Z"},"links":{"citing_paper":"/paper/2505.22106"},"observation_digest":"sha256:27daec99a6495f031a0917318d70f454b1b5f5f5d2bca738b9c55ba599d0e264","observation_id":"0e16c682-6918-498c-b935-cff2bebc2bca","resolution":{"observed_at":"2026-08-07T13:21:09.620536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22106","last_updated":"2025-05-28T08:33:58Z","snapshot_observed_at":"2026-08-07T13:12:43.270911Z","submitted_at":"2025-05-28T08:33:58Z","title":"AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22106","snapshot_observed_at":"2026-08-07T13:21:08.234057Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22106","last_updated":"2025-05-28T08:33:58Z","snapshot_observed_at":"2026-08-07T13:12:43.270911Z","submitted_at":"2025-05-28T08:33:58Z","title":"AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:08.234057Z"},"links":{"cited_paper":"/paper/2505.22106","citing_paper":"/paper/2505.22106"},"observation_digest":"sha256:f47d35c5fa486047067a0995cb53845ac6724364749ae6e99614f23671c31d6a","observation_id":"16b46a8c-60f9-4f40-b30b-ba41836a6fb7","resolution":{"observed_at":"2026-08-07T13:21:08.234057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:21:14.769161Z","title":"Make-an-Audio: Text-to-audio generation with prompt-enhanced diffusion models,","venue":null,"work_id":"9982f7b1-0e4b-4ca7-aa10-026eb8489508","year":2023},"citing_paper":{"arxiv_id":"2505.22106","last_updated":"2025-05-28T08:33:58Z","snapshot_observed_at":"2026-08-07T13:12:43.270911Z","submitted_at":"2025-05-28T08:33:58Z","title":"AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:09.651250Z"},"links":{"citing_paper":"/paper/2505.22106"},"observation_digest":"sha256:630b53807d7cae7a9419e8f9636f739044dc8ccc3e4954755e24c8c40b253b1a","observation_id":"a2f193fd-a9b1-4eb2-ac91-66b71ca819eb","resolution":{"observed_at":"2026-08-07T13:21:14.820084Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18474","last_updated":"2023-05-29T10:41:28Z","snapshot_observed_at":"2026-07-06T15:34:59.457879Z","submitted_at":"2023-05-29T10:41:28Z","title":"Make-An-Audio 2: Temporal-Enhanced Text-to-Audio Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18474","snapshot_observed_at":"2026-08-07T13:21:09.950564Z","title":"Make-an-Audio 2: Temporal-enhanced text-to-audio generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22106","last_updated":"2025-05-28T08:33:58Z","snapshot_observed_at":"2026-08-07T13:12:43.270911Z","submitted_at":"2025-05-28T08:33:58Z","title":"AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:09.950564Z"},"links":{"cited_paper":"/paper/2305.18474","citing_paper":"/paper/2505.22106"},"observation_digest":"sha256:7022436a42ab87b435be4481bfb6bcb15d0846ba2fba3163fced552eef492cb6","observation_id":"b2d9abc9-eb29-49b2-ae2a-6724abd38d96","resolution":{"observed_at":"2026-08-07T13:21:09.950564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:21:14.592729Z","title":"ProDiff: Progressive fast diffusion model for high-quality text-to-speech,","venue":null,"work_id":"65e636fb-609f-44fe-b208-34d1230d44ba","year":2022},"citing_paper":{"arxiv_id":"2505.22106","last_updated":"2025-05-28T08:33:58Z","snapshot_observed_at":"2026-08-07T13:12:43.270911Z","submitted_at":"2025-05-28T08:33:58Z","title":"AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:10.029525Z"},"links":{"citing_paper":"/paper/2505.22106"},"observation_digest":"sha256:8fe1c649ebe4a4282ed2c0d55035637370f15fe125ccf8e7abc9f20eb7b83a72","observation_id":"a13c1315-f2f5-4809-80ad-cd8b0256f01e","resolution":{"observed_at":"2026-08-07T13:21:14.635611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:21:14.504422Z","title":"Matcha-TTS: A fast TTS architecture with conditional flow matching,","venue":null,"work_id":"0824b052-ac60-4340-8c50-d3f3e8c02589","year":2024},"citing_paper":{"arxiv_id":"2505.22106","last_updated":"2025-05-28T08:33:58Z","snapshot_observed_at":"2026-08-07T13:12:43.270911Z","submitted_at":"2025-05-28T08:33:58Z","title":"AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:10.165933Z"},"links":{"citing_paper":"/paper/2505.22106"},"observation_digest":"sha256:891372368ef15212d7674c6eee09a15308a4f0c95b2205a606ab800ca578ae21","observation_id":"3ada13ed-a7d1-4caa-9419-a39c7fc9f046","resolution":{"observed_at":"2026-08-07T13:21:14.540426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08203","last_updated":"2024-06-12T13:36:03Z","snapshot_observed_at":"2026-07-06T18:29:34.538901Z","submitted_at":"2024-06-12T13:36:03Z","title":"LAFMA: A Latent Flow Matching Model for Text-to-Audio Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08203","snapshot_observed_at":"2026-08-07T13:21:10.350455Z","title":"LAFMA: A latent flow matching model for text-to-audio generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22106","last_updated":"2025-05-28T08:33:58Z","snapshot_observed_at":"2026-08-07T13:12:43.270911Z","submitted_at":"2025-05-28T08:33:58Z","title":"AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:10.350455Z"},"links":{"cited_paper":"/paper/2406.08203","citing_paper":"/paper/2505.22106"},"observation_digest":"sha256:cda1dc2bcb4353a7e9435c0ebd841c56f202c6a8cf7a5510e3730f73fb312f90","observation_id":"5ffc9e00-4f0e-45d8-b9bc-1fe82064984c","resolution":{"observed_at":"2026-08-07T13:21:10.350455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:21:14.238255Z","title":"Flow matching for generative modeling,","venue":null,"work_id":"8a941491-48f9-4892-8f18-46274e7b0d31","year":null},"citing_paper":{"arxiv_id":"2505.22106","last_updated":"2025-05-28T08:33:58Z","snapshot_observed_at":"2026-08-07T13:12:43.270911Z","submitted_at":"2025-05-28T08:33:58Z","title":"AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:10.475766Z"},"links":{"citing_paper":"/paper/2505.22106"},"observation_digest":"sha256:ea00e2c9fb4a55c3bd22e5ccf0a28503c573f629fab92c2e5aa9e8c3c60a0241","observation_id":"7ec3dad7-ef41-4a30-9919-bcc876b8f32d","resolution":{"observed_at":"2026-08-07T13:21:14.285099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07303","last_updated":"2024-10-11T16:17:53Z","snapshot_observed_at":"2026-08-04T05:49:55.554735Z","submitted_at":"2024-10-09T17:43:38Z","title":"Rectified Diffusion: Straightness Is Not Your Need in Rectified Flow","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07303","snapshot_observed_at":"2026-08-07T13:21:10.583271Z","title":"Rectified diffusion: Straightness is not your need in rectified flow,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22106","last_updated":"2025-05-28T08:33:58Z","snapshot_observed_at":"2026-08-07T13:12:43.270911Z","submitted_at":"2025-05-28T08:33:58Z","title":"AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:10.583271Z"},"links":{"cited_paper":"/paper/2410.07303","citing_paper":"/paper/2505.22106"},"observation_digest":"sha256:239f9937a9f16ae7857b00a037c6522daae925a658b191adbb58616615794e84","observation_id":"fbe88115-e341-4950-bd3f-e90f055a59e9","resolution":{"observed_at":"2026-08-07T13:21:10.583271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.03003","last_updated":"2022-09-07T08:59:55Z","snapshot_observed_at":"2026-07-06T13:49:40.974495Z","submitted_at":"2022-09-07T08:59:55Z","title":"Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.03003","snapshot_observed_at":"2026-08-07T13:21:10.677989Z","title":"Flow straight and fast: Learning to generate and transfer data with rectified flow,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22106","last_updated":"2025-05-28T08:33:58Z","snapshot_observed_at":"2026-08-07T13:12:43.270911Z","submitted_at":"2025-05-28T08:33:58Z","title":"AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:10.677989Z"},"links":{"cited_paper":"/paper/2209.03003","citing_paper":"/paper/2505.22106"},"observation_digest":"sha256:aa8ed25c73a44ae0abd594ef478a55b6e58e7c390c59363158d16d2ce750dda9","observation_id":"f9c77d8b-0246-4051-a7e4-d45db0f0135c","resolution":{"observed_at":"2026-08-07T13:21:10.677989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-07T13:21:10.774097Z","title":"Classifier-free diffusion guidance,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22106","last_updated":"2025-05-28T08:33:58Z","snapshot_observed_at":"2026-08-07T13:12:43.270911Z","submitted_at":"2025-05-28T08:33:58Z","title":"AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:10.774097Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2505.22106"},"observation_digest":"sha256:08728f22afeecd0619207c94629ae5702f95ee63e6ed9164cd71f2cd95e95339","observation_id":"0a6d5771-71db-472b-82bb-92b006bdf3e7","resolution":{"observed_at":"2026-08-07T13:21:10.774097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:21:14.066421Z","title":"Score-based generative modeling through stochas- tic differential equations,","venue":null,"work_id":"97c1122d-8e1a-43a5-b2a2-d567689ac3f8","year":2021},"citing_paper":{"arxiv_id":"2505.22106","last_updated":"2025-05-28T08:33:58Z","snapshot_observed_at":"2026-08-07T13:12:43.270911Z","submitted_at":"2025-05-28T08:33:58Z","title":"AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:10.866890Z"},"links":{"citing_paper":"/paper/2505.22106"},"observation_digest":"sha256:0dd7a45b20671f29926e5674c7e0a53bd8bc132b3f0c068eb7d1fa22ba93fd9c","observation_id":"6763064e-4091-4233-8841-c78fdc0626aa","resolution":{"observed_at":"2026-08-07T13:21:14.116228Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:21:13.948783Z","title":"DPM-Solver: A fast ODE solver for diffusion probabilistic model sampling in around 10 steps,","venue":null,"work_id":"ad250cb6-d4ee-4228-86ec-149052518faa","year":2022},"citing_paper":{"arxiv_id":"2505.22106","last_updated":"2025-05-28T08:33:58Z","snapshot_observed_at":"2026-08-07T13:12:43.270911Z","submitted_at":"2025-05-28T08:33:58Z","title":"AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:10.950164Z"},"links":{"citing_paper":"/paper/2505.22106"},"observation_digest":"sha256:6e42a7b199c3f60310a77e78daf0f37d8cf0e7a6f251c0339f9f770f452bfcd4","observation_id":"9943b528-6d4d-4b51-9a29-6f2cf98a9b33","resolution":{"observed_at":"2026-08-07T13:21:13.983818Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:21:13.804524Z","title":"Large-scale contrastive language-audio pretraining with feature fusion and keyword-to-caption augmentation,","venue":null,"work_id":"70e3d6a7-2caa-498b-90d2-0c27111e3978","year":2023},"citing_paper":{"arxiv_id":"2505.22106","last_updated":"2025-05-28T08:33:58Z","snapshot_observed_at":"2026-08-07T13:12:43.270911Z","submitted_at":"2025-05-28T08:33:58Z","title":"AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:11.066100Z"},"links":{"citing_paper":"/paper/2505.22106"},"observation_digest":"sha256:4599c3b7eee1e4d2b0f65d5060d0f25bf1fbf70d15651e3824ae6025047871f5","observation_id":"523944d1-a27b-4916-bfa7-6d27f49aa0ce","resolution":{"observed_at":"2026-08-07T13:21:13.872434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:21:13.656672Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":"b204bc59-4d68-4ce6-9fe1-70eeef75405f","year":2021},"citing_paper":{"arxiv_id":"2505.22106","last_updated":"2025-05-28T08:33:58Z","snapshot_observed_at":"2026-08-07T13:12:43.270911Z","submitted_at":"2025-05-28T08:33:58Z","title":"AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:11.139122Z"},"links":{"citing_paper":"/paper/2505.22106"},"observation_digest":"sha256:26191a4410156c5d91f11ffdd23114ddf4e8360036864ab62ee9e0e402671fe3","observation_id":"e986f037-d254-4f90-ae00-b759ad7727fe","resolution":{"observed_at":"2026-08-07T13:21:13.716985Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:21:13.551082Z","title":"U-Net: Convolutional networks for biomedical image segmentation,","venue":null,"work_id":"f03b9bcd-89d6-47e3-a1f8-0303dfd201d1","year":2015},"citing_paper":{"arxiv_id":"2505.22106","last_updated":"2025-05-28T08:33:58Z","snapshot_observed_at":"2026-08-07T13:12:43.270911Z","submitted_at":"2025-05-28T08:33:58Z","title":"AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:11.211420Z"},"links":{"citing_paper":"/paper/2505.22106"},"observation_digest":"sha256:eb306fa006a37eb0f7d5e38274a7266b9684686d6c4abbb114f07fb0b5ceb835","observation_id":"9cdd219a-716d-46a8-bdd4-f91de6dcc23d","resolution":{"observed_at":"2026-08-07T13:21:13.596152Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:21:13.392146Z","title":"Denoising diffusion implicit models,","venue":null,"work_id":"da8decea-1f72-4e17-b38f-afc6765bae41","year":2021},"citing_paper":{"arxiv_id":"2505.22106","last_updated":"2025-05-28T08:33:58Z","snapshot_observed_at":"2026-08-07T13:12:43.270911Z","submitted_at":"2025-05-28T08:33:58Z","title":"AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:11.294535Z"},"links":{"citing_paper":"/paper/2505.22106"},"observation_digest":"sha256:10dcbd6520716e7fb8302fce512f5a0d94451f1c079ea33cebe69b7cf8acacbf","observation_id":"96918202-d1eb-4c71-8db5-fdef4e68f3a3","resolution":{"observed_at":"2026-08-07T13:21:13.437880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:21:11.382160Z","title":"Pseudo numerical methods for diffusion models on manifolds,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22106","last_updated":"2025-05-28T08:33:58Z","snapshot_observed_at":"2026-08-07T13:12:43.270911Z","submitted_at":"2025-05-28T08:33:58Z","title":"AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:11.382160Z"},"links":{"citing_paper":"/paper/2505.22106"},"observation_digest":"sha256:7fe7232ab283463fa0cfc8cbbdeacee1e2eac5ed77023a917825eceb3edec221","observation_id":"9bda180c-d77b-43b2-a26f-7612f08fa36a","resolution":{"observed_at":"2026-08-07T13:21:11.382160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:21:13.215906Z","title":"AudioCaps: Generat- ing captions for audios in the wild,","venue":null,"work_id":"4fe0d97c-3c2f-412b-8b53-a99ef142073b","year":2019},"citing_paper":{"arxiv_id":"2505.22106","last_updated":"2025-05-28T08:33:58Z","snapshot_observed_at":"2026-08-07T13:12:43.270911Z","submitted_at":"2025-05-28T08:33:58Z","title":"AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:11.427230Z"},"links":{"citing_paper":"/paper/2505.22106"},"observation_digest":"sha256:42330a119fe91e867b76ffe26167bbd0442b2a23fa2edcaabeeb81e9f5f1b556","observation_id":"2a330639-1401-4678-853c-985e8a1b624b","resolution":{"observed_at":"2026-08-07T13:21:13.304432Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:21:13.032053Z","title":"PANNs: Large-scale pretrained audio neural networks for audio pattern recognition,","venue":null,"work_id":"81b666dc-3d7f-426d-8efb-3e65366791bb","year":2020},"citing_paper":{"arxiv_id":"2505.22106","last_updated":"2025-05-28T08:33:58Z","snapshot_observed_at":"2026-08-07T13:12:43.270911Z","submitted_at":"2025-05-28T08:33:58Z","title":"AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:11.509960Z"},"links":{"citing_paper":"/paper/2505.22106"},"observation_digest":"sha256:17d05c0ac89fceb4077252f69a5d589fb7bed001cffb54bfa03ca0562dca9659","observation_id":"a975a37b-535a-496c-97cb-93161ad656b1","resolution":{"observed_at":"2026-08-07T13:21:13.105140Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:21:12.888312Z","title":"Diffusion models beat GANs on im- age synthesis,","venue":null,"work_id":"7ccd6a7f-2805-4e5d-b048-27dd76033865","year":2021},"citing_paper":{"arxiv_id":"2505.22106","last_updated":"2025-05-28T08:33:58Z","snapshot_observed_at":"2026-08-07T13:12:43.270911Z","submitted_at":"2025-05-28T08:33:58Z","title":"AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:11.594091Z"},"links":{"citing_paper":"/paper/2505.22106"},"observation_digest":"sha256:731163f35c0387b06f46213cc6846886b1be1e9756e079817072802845266775","observation_id":"6f32bb52-1ab9-450c-b936-ce9cdc111e65","resolution":{"observed_at":"2026-08-07T13:21:12.950137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:21:12.663769Z","title":"Universal sound separation with self-supervised audio masked autoencoder,","venue":null,"work_id":"37bd98e3-fefb-40f5-9ed9-bcf286391b42","year":2024},"citing_paper":{"arxiv_id":"2505.22106","last_updated":"2025-05-28T08:33:58Z","snapshot_observed_at":"2026-08-07T13:12:43.270911Z","submitted_at":"2025-05-28T08:33:58Z","title":"AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:11.717342Z"},"links":{"citing_paper":"/paper/2505.22106"},"observation_digest":"sha256:58e918ae193876a0ccad54550780ddc9f0d0aa241345cae6a484898eb62c5aa6","observation_id":"95b6400c-3078-4e02-9dba-45955906ecd4","resolution":{"observed_at":"2026-08-07T13:21:12.731719Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.08425","last_updated":"2025-01-02T03:34:22Z","snapshot_observed_at":"2026-08-01T21:00:39.966928Z","submitted_at":"2024-09-12T23:12:25Z","title":"SoloAudio: Target Sound Extraction with Language-oriented Audio Diffusion Transformer","version":2},"cited_work":{"arxiv_id":"2409.08425","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.08425","snapshot_observed_at":"2026-08-07T13:21:11.941728Z","title":"SoloAudio: Target Sound Extraction with Language-oriented Audio Diffusion Transformer","venue":"eess.AS","work_id":"55e11492-6d0c-4235-898a-ccb2dda72e86","year":2024},"citing_paper":{"arxiv_id":"2505.22106","last_updated":"2025-05-28T08:33:58Z","snapshot_observed_at":"2026-08-07T13:12:43.270911Z","submitted_at":"2025-05-28T08:33:58Z","title":"AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:11.797874Z"},"links":{"cited_paper":"/paper/2409.08425","citing_paper":"/paper/2505.22106"},"observation_digest":"sha256:3357ccc457dc6684425992b5ef4fe465bf0eb42132888b695c4214ce96e5d66d","observation_id":"35bd27e7-b1db-4ae1-8f9d-d0c34ea7aa96","resolution":{"observed_at":"2026-08-07T13:21:12.016943Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.22106","last_updated":"2025-05-28T08:33:58Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-07T13:12:43.270911Z","submitted_at":"2025-05-28T08:33:58Z","title":"AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":14,"verified_exact":2,"verified_fuzzy":25},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 3 inbound Pith citation observations for arXiv:2505.22106."}