{"as_of":"2026-07-26T12:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8d55b9aa7ea65bd30feae374faab59e96dd46a5d9784b333855c2e4f1693342e","coverage":[{"denominator":42,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":42,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-09T19:17:09.247932Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-07-26T06:30:07.085553+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-14T11:52:50.598080Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.00329","last_updated":"2026-05-01T01:13:50Z","snapshot_observed_at":"2026-07-06T23:13:47.082550Z","submitted_at":"2026-05-01T01:13:50Z","title":"Fast Text-to-Audio Generation with One-Step Sampling via Energy-Scoring and Auxiliary Contextual Representation Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.00329","snapshot_observed_at":"2026-07-14T11:52:50.598080Z","title":"Fast text-to-audio generation with one-step sampling via energy-scoring and auxiliary contextual representation distillation,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.10421","last_updated":"2026-07-11T17:59:32Z","snapshot_observed_at":"2026-07-16T23:18:22.255962Z","submitted_at":"2026-07-11T17:59:32Z","title":"FdAudio: MeanFlow-Anchored Fr\\'echet-Distance Post-Training for One-Step Text-to-Audio Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-14T11:52:50.598080Z"},"links":{"cited_paper":"/paper/2605.00329","citing_paper":"/paper/2607.10421"},"observation_digest":"sha256:62826cfa359416cfb59c90b373360fec4b38ea228e5b49764e26ddf422c9b8f1","observation_id":"79a2d7b3-b564-4331-a444-46dfa7549aa6","resolution":{"observed_at":"2026-07-14T11:52:50.598080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2605.00329/citation-record","integrity":"/paper/2605.00329/integrity","json":"/paper/2605.00329/citation-record.json","paper":"/paper/2605.00329"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2309.10740","last_updated":"2024-06-24T06:51:55Z","snapshot_observed_at":"2026-07-06T16:20:36.866744Z","submitted_at":"2023-09-19T16:36:33Z","title":"ConsistencyTTA: Accelerating Diffusion-Based Text-to-Audio Generation with Consistency Distillation","version":3},"cited_work":{"arxiv_id":"2309.10740","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.10740","snapshot_observed_at":"2026-07-04T18:40:02.607681Z","title":"Consistencytta: Accelerating diffusion-based text- to-audio generation with consistency distillation.arXiv preprint arXiv:2309.10740","venue":null,"work_id":"b291ad29-305a-40e1-a500-21ef6e05d23a","year":2023},"citing_paper":{"arxiv_id":"2605.00329","last_updated":"2026-05-01T01:13:50Z","snapshot_observed_at":"2026-07-06T23:13:47.082550Z","submitted_at":"2026-05-01T01:13:50Z","title":"Fast Text-to-Audio Generation with One-Step Sampling via Energy-Scoring and Auxiliary Contextual Representation Distillation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-09T19:17:09.247932Z"},"links":{"cited_paper":"/paper/2309.10740","citing_paper":"/paper/2605.00329"},"observation_digest":"sha256:164d44d84b33b7f196a0dc1723b98b0d7d48638f17276499b90026ed34958c3d","observation_id":"0663f690-9b7f-48ed-a116-c353285dea62","resolution":{"observed_at":"2026-05-11T15:46:46.557602Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.06503","last_updated":"2022-05-03T08:05:54Z","snapshot_observed_at":"2026-07-06T12:28:03.630719Z","submitted_at":"2022-01-17T16:28:12Z","title":"Analytic-DPM: an Analytic Estimate of the Optimal Reverse Variance in Diffusion Probabilistic Models","version":3},"cited_work":{"arxiv_id":"2201.06503","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2201.06503","snapshot_observed_at":"2026-07-04T12:49:52.501376Z","title":"Analytic-dpm: an an- alytic estimate of the optimal reverse variance in diffusion probabilistic models","venue":null,"work_id":"2cec8148-2818-442d-9f52-4f50f61ea90b","year":2022},"citing_paper":{"arxiv_id":"2605.00329","last_updated":"2026-05-01T01:13:50Z","snapshot_observed_at":"2026-07-06T23:13:47.082550Z","submitted_at":"2026-05-01T01:13:50Z","title":"Fast Text-to-Audio Generation with One-Step Sampling via Energy-Scoring and Auxiliary Contextual Representation Distillation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-09T19:17:09.247932Z"},"links":{"cited_paper":"/paper/2201.06503","citing_paper":"/paper/2605.00329"},"observation_digest":"sha256:a5d323bc1122fb6513a4be5e850b6218609393c3d85bfea58130f9069a6c879a","observation_id":"88d0bdc9-221b-434c-b9b7-cbc5271fc023","resolution":{"observed_at":"2026-05-11T15:46:46.867408Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.10743","last_updated":"2017-05-30T16:53:12Z","snapshot_observed_at":"2026-07-06T05:44:52.660633Z","submitted_at":"2017-05-30T16:53:12Z","title":"The Cramer Distance as a Solution to Biased Wasserstein Gradients","version":1},"cited_work":{"arxiv_id":"1705.10743","doi":null,"metadata_source":"pith","pith_arxiv_id":"1705.10743","snapshot_observed_at":"2026-07-03T04:27:37.276179Z","title":"The Cramer Distance as a Solution to Biased Wasserstein Gradients","venue":"cs.LG","work_id":"5dfdb668-ff19-4c96-acc8-bc352a3ec469","year":2017},"citing_paper":{"arxiv_id":"2605.00329","last_updated":"2026-05-01T01:13:50Z","snapshot_observed_at":"2026-07-06T23:13:47.082550Z","submitted_at":"2026-05-01T01:13:50Z","title":"Fast Text-to-Audio Generation with One-Step Sampling via Energy-Scoring and Auxiliary Contextual Representation Distillation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-09T19:17:09.247932Z"},"links":{"cited_paper":"/paper/1705.10743","citing_paper":"/paper/2605.00329"},"observation_digest":"sha256:bdde4b2d26cc9228f9bdcbd62c98df054c971cae7d8616f16cf1908306c9dc90","observation_id":"44b831ed-a124-4380-917d-6fc54cf0ea0d","resolution":{"observed_at":"2026-05-11T15:46:47.137466Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.09636","last_updated":"2023-05-16T17:41:25Z","snapshot_observed_at":"2026-07-06T15:28:16.998343Z","submitted_at":"2023-05-16T17:41:25Z","title":"SoundStorm: Efficient Parallel Audio Generation","version":1},"cited_work":{"arxiv_id":"2305.09636","doi":"10.48550/arxiv.2305.09636","metadata_source":"pith","pith_arxiv_id":"2305.09636","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"AudioLM: A language modeling approach to audio generation.IEEE/ACM Trans","venue":"cs.SD","work_id":"c68926d8-7cb2-4b44-9b10-396551c6bb67","year":2023},"citing_paper":{"arxiv_id":"2605.00329","last_updated":"2026-05-01T01:13:50Z","snapshot_observed_at":"2026-07-06T23:13:47.082550Z","submitted_at":"2026-05-01T01:13:50Z","title":"Fast Text-to-Audio Generation with One-Step Sampling via Energy-Scoring and Auxiliary Contextual Representation Distillation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-09T19:17:09.247932Z"},"links":{"cited_paper":"/paper/2305.09636","citing_paper":"/paper/2605.00329"},"observation_digest":"sha256:20eebb0101b661d67e89c2cbd389c5bc03b0927b2de66b9455f3ea403852f88c","observation_id":"d115dd5f-bd38-4580-a00b-cb411e473a62","resolution":{"observed_at":"2026-05-11T15:46:48.083389Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06909","last_updated":"2021-06-13T04:09:16Z","snapshot_observed_at":"2026-07-06T11:18:44.145746Z","submitted_at":"2021-06-13T04:09:16Z","title":"GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio","version":1},"cited_work":{"arxiv_id":"2106.06909","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.06909","snapshot_observed_at":"2026-07-07T20:34:09.701797Z","title":"Gigaspeech: An evolving, multi-domain asr corpus with 10,000 hours of transcribed audio","venue":"cs.SD","work_id":"d786d96c-26ba-4c99-a2e9-9da6984c3cb2","year":2021},"citing_paper":{"arxiv_id":"2605.00329","last_updated":"2026-05-01T01:13:50Z","snapshot_observed_at":"2026-07-06T23:13:47.082550Z","submitted_at":"2026-05-01T01:13:50Z","title":"Fast Text-to-Audio Generation with One-Step Sampling via Energy-Scoring and Auxiliary Contextual Representation Distillation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-09T19:17:09.247932Z"},"links":{"cited_paper":"/paper/2106.06909","citing_paper":"/paper/2605.00329"},"observation_digest":"sha256:bef1d737b8ee80d29862b6200b1df3973c116c08aa76834fe7f644073a884d53","observation_id":"a16c3f7f-e9ca-40e2-bb3e-6f23844d1146","resolution":{"observed_at":"2026-05-11T15:46:46.275282Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1612.01840","last_updated":"2017-09-05T18:38:33Z","snapshot_observed_at":"2026-07-06T05:21:33.309016Z","submitted_at":"2016-12-06T14:58:59Z","title":"FMA: A Dataset For Music Analysis","version":3},"cited_work":{"arxiv_id":"1612.01840","doi":null,"metadata_source":"pith","pith_arxiv_id":"1612.01840","snapshot_observed_at":"2026-07-04T14:39:57.208412Z","title":"FMA: A Dataset For Music Analysis","venue":"cs.SD","work_id":"ded6f28d-171f-48d7-861a-9d653fccecb4","year":2016},"citing_paper":{"arxiv_id":"2605.00329","last_updated":"2026-05-01T01:13:50Z","snapshot_observed_at":"2026-07-06T23:13:47.082550Z","submitted_at":"2026-05-01T01:13:50Z","title":"Fast Text-to-Audio Generation with One-Step Sampling via Energy-Scoring and Auxiliary Contextual Representation Distillation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-09T19:17:09.247932Z"},"links":{"cited_paper":"/paper/1612.01840","citing_paper":"/paper/2605.00329"},"observation_digest":"sha256:86c2387c895cef09d84bab4c65d2fb16a64812ef3e71507a57979fb81719a0b6","observation_id":"9ad26cf3-fc44-4db2-88c2-495bf41a42b2","resolution":{"observed_at":"2026-05-11T15:46:47.351380Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14275","last_updated":"2022-09-28T17:39:26Z","snapshot_observed_at":"2026-07-06T13:57:24.527958Z","submitted_at":"2022-09-28T17:39:26Z","title":"Audio Retrieval with WavText5K and CLAP Training","version":1},"cited_work":{"arxiv_id":"2209.14275","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2209.14275","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deshmukh, B","venue":null,"work_id":"9f77678e-bfd1-45b3-b2a5-6e3b4c808b3b","year":2022},"citing_paper":{"arxiv_id":"2605.00329","last_updated":"2026-05-01T01:13:50Z","snapshot_observed_at":"2026-07-06T23:13:47.082550Z","submitted_at":"2026-05-01T01:13:50Z","title":"Fast Text-to-Audio Generation with One-Step Sampling via Energy-Scoring and Auxiliary Contextual Representation Distillation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-09T19:17:09.247932Z"},"links":{"cited_paper":"/paper/2209.14275","citing_paper":"/paper/2605.00329"},"observation_digest":"sha256:f97722466c284e19119757ab14f9c487bc4659fe8d959504eb32d6613910a5fd","observation_id":"2dcd9ac9-5278-48a6-87c5-5d891fd2540b","resolution":{"observed_at":"2026-05-11T15:46:47.697378Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T01:53:08.987125Z","title":"Clotho: An audio captioning dataset","venue":null,"work_id":"7502844b-7a8f-419f-a745-950ad9fad7b1","year":2020},"citing_paper":{"arxiv_id":"2605.00329","last_updated":"2026-05-01T01:13:50Z","snapshot_observed_at":"2026-07-06T23:13:47.082550Z","submitted_at":"2026-05-01T01:13:50Z","title":"Fast Text-to-Audio Generation with One-Step Sampling via Energy-Scoring and Auxiliary Contextual Representation Distillation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-09T19:17:09.247932Z"},"links":{"citing_paper":"/paper/2605.00329"},"observation_digest":"sha256:9eddd39ee0984a96e6bf97b3570ffac031943b821bae7ebc13195cc2d41807a2","observation_id":"b06a06d0-96a2-4d06-b089-3466c113a9f0","resolution":{"observed_at":"2026-05-25T21:51:16.679073Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23660","last_updated":"2025-05-29T17:09:25Z","snapshot_observed_at":"2026-07-06T21:33:02.686798Z","submitted_at":"2025-05-29T17:09:25Z","title":"D-AR: Diffusion via Autoregressive Models","version":1},"cited_work":{"arxiv_id":"2505.23660","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23660","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"and Shou, M","venue":null,"work_id":"da4ea99f-1792-4399-b770-340b2e3fdb08","year":null},"citing_paper":{"arxiv_id":"2605.00329","last_updated":"2026-05-01T01:13:50Z","snapshot_observed_at":"2026-07-06T23:13:47.082550Z","submitted_at":"2026-05-01T01:13:50Z","title":"Fast Text-to-Audio Generation with One-Step Sampling via Energy-Scoring and Auxiliary Contextual Representation Distillation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-09T19:17:09.247932Z"},"links":{"cited_paper":"/paper/2505.23660","citing_paper":"/paper/2605.00329"},"observation_digest":"sha256:d8449de781b697a97a299ba023c18c405e759faad34a357ed8efa4d56fcab06b","observation_id":"e2cea1fd-b2c2-48a6-beb6-07a389a3d921","resolution":{"observed_at":"2026-05-11T15:46:47.878360Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13447","last_updated":"2025-05-19T17:59:42Z","snapshot_observed_at":"2026-07-06T21:26:30.087184Z","submitted_at":"2025-05-19T17:59:42Z","title":"Mean Flows for One-step Generative Modeling","version":1},"cited_work":{"arxiv_id":"2505.13447","doi":"10.48550/arxiv.2505.13447","metadata_source":"pith","pith_arxiv_id":"2505.13447","snapshot_observed_at":"2026-07-11T02:27:49.401808Z","title":"Mean Flows for One-step Generative Modeling","venue":"cs.LG","work_id":"07a52ad5-0f82-4095-9a66-559b09fea1ae","year":2025},"citing_paper":{"arxiv_id":"2605.00329","last_updated":"2026-05-01T01:13:50Z","snapshot_observed_at":"2026-07-06T23:13:47.082550Z","submitted_at":"2026-05-01T01:13:50Z","title":"Fast Text-to-Audio Generation with One-Step Sampling via Energy-Scoring and Auxiliary Contextual Representation Distillation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-09T19:17:09.247932Z"},"links":{"cited_paper":"/paper/2505.13447","citing_paper":"/paper/2605.00329"},"observation_digest":"sha256:dc7f062cf128a502f2da38f453ed23db7e17ee060b88eee838073b1ea1bffe03","observation_id":"899a539f-3246-4b00-86f5-064ca22ed729","resolution":{"observed_at":"2026-05-11T15:46:44.154479Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10819","last_updated":"2025-06-19T04:44:02Z","snapshot_observed_at":"2026-07-06T19:16:28.014017Z","submitted_at":"2024-09-17T01:27:28Z","title":"EzAudio: Enhancing Text-to-Audio Generation with Efficient Diffusion Transformer","version":2},"cited_work":{"arxiv_id":"2409.10819","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.10819","snapshot_observed_at":"2026-07-08T00:04:22.555412Z","title":"Ezaudio: Enhancing text-to-audio genera- tion with efficient diffusion transformer.arXiv preprint arXiv:2409.10819","venue":"eess.AS","work_id":"c2151683-bbda-4d2f-a5a0-30348d7e3650","year":2024},"citing_paper":{"arxiv_id":"2605.00329","last_updated":"2026-05-01T01:13:50Z","snapshot_observed_at":"2026-07-06T23:13:47.082550Z","submitted_at":"2026-05-01T01:13:50Z","title":"Fast Text-to-Audio Generation with One-Step Sampling via Energy-Scoring and Auxiliary Contextual Representation Distillation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-09T19:17:09.247932Z"},"links":{"cited_paper":"/paper/2409.10819","citing_paper":"/paper/2605.00329"},"observation_digest":"sha256:3e7f0ce5fc83a24b3e7e9795d7d307eedc2269f0ec05ef12f095fa617df710fe","observation_id":"3b1d4a25-fb5e-4e64-b0d5-26e232db8224","resolution":{"observed_at":"2026-05-11T15:46:45.778288Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-07-06T04:11:24.157003Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":"1503.02531","doi":"10.1109/cvpr52733.2024.01515","metadata_source":"pith","pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Distilling the Knowledge in a Neural Network","venue":"stat.ML","work_id":"d927ab1f-17b8-4002-9d09-c3d55764fbad","year":2015},"citing_paper":{"arxiv_id":"2605.00329","last_updated":"2026-05-01T01:13:50Z","snapshot_observed_at":"2026-07-06T23:13:47.082550Z","submitted_at":"2026-05-01T01:13:50Z","title":"Fast Text-to-Audio Generation with One-Step Sampling via Energy-Scoring and Auxiliary Contextual Representation Distillation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-09T19:17:09.247932Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2605.00329"},"observation_digest":"sha256:093d1bc6bad089126535b1f04dfc3c5e4e95c5af664071664abcf82e4980cef8","observation_id":"ef66f485-ee69-4016-8a72-159f0ede2af4","resolution":{"observed_at":"2026-05-11T15:46:45.044460Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":"2207.12598","doi":"10.1109/cvpr52733.2024.02494","metadata_source":"pith","pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Classifier-Free Diffusion Guidance","venue":"cs.LG","work_id":"acf2c588-c088-4a6c-938e-150ad7c666d7","year":2022},"citing_paper":{"arxiv_id":"2605.00329","last_updated":"2026-05-01T01:13:50Z","snapshot_observed_at":"2026-07-06T23:13:47.082550Z","submitted_at":"2026-05-01T01:13:50Z","title":"Fast Text-to-Audio Generation with One-Step Sampling via Energy-Scoring and Auxiliary Contextual Representation Distillation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-09T19:17:09.247932Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2605.00329"},"observation_digest":"sha256:189ec639e4d5d6624643098832626af1f35eb5b5184e5cd4eea1f38dd139c69e","observation_id":"ebf1c355-e682-4cc3-8eff-7761ef0424ba","resolution":{"observed_at":"2026-05-11T15:46:42.935094Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18474","last_updated":"2023-05-29T10:41:28Z","snapshot_observed_at":"2026-07-06T15:34:59.457879Z","submitted_at":"2023-05-29T10:41:28Z","title":"Make-An-Audio 2: Temporal-Enhanced Text-to-Audio Generation","version":1},"cited_work":{"arxiv_id":"2305.18474","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.18474","snapshot_observed_at":"2026-07-08T00:04:22.531379Z","title":"Make-An-Audio 2: Temporal-enhanced text-to- audio generation","venue":"cs.SD","work_id":"860b091c-0421-40ba-b119-b64c00ee453d","year":2023},"citing_paper":{"arxiv_id":"2605.00329","last_updated":"2026-05-01T01:13:50Z","snapshot_observed_at":"2026-07-06T23:13:47.082550Z","submitted_at":"2026-05-01T01:13:50Z","title":"Fast Text-to-Audio Generation with One-Step Sampling via Energy-Scoring and Auxiliary Contextual Representation Distillation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-09T19:17:09.247932Z"},"links":{"cited_paper":"/paper/2305.18474","citing_paper":"/paper/2605.00329"},"observation_digest":"sha256:068ada7403fb923eb91d026821fe679428bbc0385b668e35950b006ef31b01b5","observation_id":"80b227e9-feab-41f6-9f16-c5d79b4727ba","resolution":{"observed_at":"2026-05-11T15:46:43.397088Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.21037","last_updated":"2025-04-10T05:01:32Z","snapshot_observed_at":"2026-07-06T20:14:45.295346Z","submitted_at":"2024-12-30T16:02:44Z","title":"TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization","version":2},"cited_work":{"arxiv_id":"2412.21037","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.21037","snapshot_observed_at":"2026-07-08T00:04:22.484714Z","title":"Tangoflux: Super fast and faithful text to audio generation with flow matching and clap-ranked preference optimization","venue":"cs.SD","work_id":"00a970af-6ebd-49c3-86db-337517696f53","year":2024},"citing_paper":{"arxiv_id":"2605.00329","last_updated":"2026-05-01T01:13:50Z","snapshot_observed_at":"2026-07-06T23:13:47.082550Z","submitted_at":"2026-05-01T01:13:50Z","title":"Fast Text-to-Audio Generation with One-Step Sampling via Energy-Scoring and Auxiliary Contextual Representation Distillation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-09T19:17:09.247932Z"},"links":{"cited_paper":"/paper/2412.21037","citing_paper":"/paper/2605.00329"},"observation_digest":"sha256:91fa84796026999b49cde53e041d0126194ec3dbfd3f83e67ee385285c4b13bc","observation_id":"2a3f17f9-1852-4239-ae25-f01a34248660","resolution":{"observed_at":"2026-05-11T15:46:44.885236Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.08466","last_updated":"2019-01-17T16:12:43Z","snapshot_observed_at":"2026-07-06T07:22:29.205966Z","submitted_at":"2018-12-20T10:28:00Z","title":"Fr\\'echet Audio Distance: A Metric for Evaluating Music Enhancement Algorithms","version":4},"cited_work":{"arxiv_id":"1812.08466","doi":null,"metadata_source":"pith","pith_arxiv_id":"1812.08466","snapshot_observed_at":"2026-07-08T00:04:22.632355Z","title":"Fr\\'echet Audio Distance: A Metric for Evaluating Music Enhancement Algorithms","venue":"eess.AS","work_id":"64a43367-ac07-49b0-ab37-b8797c50e9d7","year":2018},"citing_paper":{"arxiv_id":"2605.00329","last_updated":"2026-05-01T01:13:50Z","snapshot_observed_at":"2026-07-06T23:13:47.082550Z","submitted_at":"2026-05-01T01:13:50Z","title":"Fast Text-to-Audio Generation with One-Step Sampling via Energy-Scoring and Auxiliary Contextual Representation Distillation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-09T19:17:09.247932Z"},"links":{"cited_paper":"/paper/1812.08466","citing_paper":"/paper/2605.00329"},"observation_digest":"sha256:7e30908f9c2c4664e9009583ca5678fdeac56b1360b7583044a8ab52e0c94d78","observation_id":"90dfe4d6-8b09-4e3b-a6a5-dc334e82d3c0","resolution":{"observed_at":"2026-05-11T15:46:44.686232Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"D., Kim, B., Lee, H., and Kim, G","venue":null,"work_id":"be8ace07-23fe-4301-bc28-d1ac05bd1f7a","year":2019},"citing_paper":{"arxiv_id":"2605.00329","last_updated":"2026-05-01T01:13:50Z","snapshot_observed_at":"2026-07-06T23:13:47.082550Z","submitted_at":"2026-05-01T01:13:50Z","title":"Fast Text-to-Audio Generation with One-Step Sampling via Energy-Scoring and Auxiliary Contextual Representation Distillation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-09T19:17:09.247932Z"},"links":{"citing_paper":"/paper/2605.00329"},"observation_digest":"sha256:ba02601159118309ad7817389becdb21a92a3d49c420764446aacd4760633589","observation_id":"4e448ce7-d7b4-4467-a516-16c129be942e","resolution":{"observed_at":"2026-05-25T21:51:16.650211Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-07-06T14:45:48.434072Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":"2301.12503","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-07-04T11:59:50.469153Z","title":"Audioldm: Text-to-audio generation with latent diffusion models","venue":null,"work_id":"b44ebce5-47f1-4f14-b13b-b5b4eb072d2c","year":2023},"citing_paper":{"arxiv_id":"2605.00329","last_updated":"2026-05-01T01:13:50Z","snapshot_observed_at":"2026-07-06T23:13:47.082550Z","submitted_at":"2026-05-01T01:13:50Z","title":"Fast Text-to-Audio Generation with One-Step Sampling via Energy-Scoring and Auxiliary Contextual Representation Distillation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-09T19:17:09.247932Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2605.00329"},"observation_digest":"sha256:83fc536e29e9ad7795ab5db89239d179d9ba632b325c2fbc059a48f263c2c04e","observation_id":"39d88a97-f0b0-48b8-9ac7-7861846c0866","resolution":{"observed_at":"2026-05-11T15:46:44.540336Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.09778","last_updated":"2022-10-31T09:05:25Z","snapshot_observed_at":"2026-07-06T12:39:36.604492Z","submitted_at":"2022-02-20T10:37:52Z","title":"Pseudo Numerical Methods for Diffusion Models on Manifolds","version":2},"cited_work":{"arxiv_id":"2202.09778","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2202.09778","snapshot_observed_at":"2026-07-02T16:37:09.182860Z","title":"Pseudo numerical methods for diffusion models on manifolds","venue":null,"work_id":"a381acd0-117e-4e82-8d12-5ebd800fc382","year":2022},"citing_paper":{"arxiv_id":"2605.00329","last_updated":"2026-05-01T01:13:50Z","snapshot_observed_at":"2026-07-06T23:13:47.082550Z","submitted_at":"2026-05-01T01:13:50Z","title":"Fast Text-to-Audio Generation with One-Step Sampling via Energy-Scoring and Auxiliary Contextual Representation Distillation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-09T19:17:09.247932Z"},"links":{"cited_paper":"/paper/2202.09778","citing_paper":"/paper/2605.00329"},"observation_digest":"sha256:3d5394f95b475c36b2c92b912843840e4bc25debb5d5f52e70e4078badf24029","observation_id":"dc385cff-e34c-4667-ad7d-253fca6ea776","resolution":{"observed_at":"2026-05-11T15:46:45.210173Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.13181","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Efficient speech language modeling via en- ergy distance in continuous latent space.arXiv preprint arXiv:2505.13181","venue":null,"work_id":"a0bcf848-4813-4be0-a22f-e6683eea8dc7","year":null},"citing_paper":{"arxiv_id":"2605.00329","last_updated":"2026-05-01T01:13:50Z","snapshot_observed_at":"2026-07-06T23:13:47.082550Z","submitted_at":"2026-05-01T01:13:50Z","title":"Fast Text-to-Audio Generation with One-Step Sampling via Energy-Scoring and Auxiliary Contextual Representation Distillation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-09T19:17:09.247932Z"},"links":{"citing_paper":"/paper/2605.00329"},"observation_digest":"sha256:e0fb3c465825ec467693403097fe33152697e35f1f7fa1941e981e8c39278770","observation_id":"432160ed-03b1-4f91-a0c6-ce44519b2ecb","resolution":{"observed_at":"2026-05-11T15:46:43.954400Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.15784","last_updated":"2022-05-31T13:32:55Z","snapshot_observed_at":"2026-07-06T13:15:54.743540Z","submitted_at":"2022-05-31T13:32:55Z","title":"Likelihood-Free Inference with Generative Neural Networks via Scoring Rule Minimization","version":1},"cited_work":{"arxiv_id":"2205.15784","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2205.15784","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pacchiardi, L., Adewoyin, R","venue":null,"work_id":"0f5c7a85-0466-4176-9aed-4c0577be5839","year":null},"citing_paper":{"arxiv_id":"2605.00329","last_updated":"2026-05-01T01:13:50Z","snapshot_observed_at":"2026-07-06T23:13:47.082550Z","submitted_at":"2026-05-01T01:13:50Z","title":"Fast Text-to-Audio Generation with One-Step Sampling via Energy-Scoring and Auxiliary Contextual Representation Distillation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-09T19:17:09.247932Z"},"links":{"cited_paper":"/paper/2205.15784","citing_paper":"/paper/2605.00329"},"observation_digest":"sha256:8e778840e1c401fafc2a26d640dcdf4c027008c44a078cc6822cfe346e82ec07","observation_id":"96e78ea2-aa46-438e-ad0d-31167e781a3b","resolution":{"observed_at":"2026-05-11T15:46:42.685402Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07615","last_updated":"2025-07-16T17:59:28Z","snapshot_observed_at":"2026-07-06T21:22:35.652600Z","submitted_at":"2025-05-12T14:36:47Z","title":"Diffused Responsibility: Analyzing the Energy Consumption of Generative Text-to-Audio Diffusion Models","version":2},"cited_work":{"arxiv_id":"2505.07615","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.07615","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Diffused responsibility: Analyzing the energy consumption of generative text-to-audio diffusion models.arXiv preprint arXiv:2505.07615","venue":null,"work_id":"b5393c4b-8daa-4882-a3c8-d1619f4335ab","year":null},"citing_paper":{"arxiv_id":"2605.00329","last_updated":"2026-05-01T01:13:50Z","snapshot_observed_at":"2026-07-06T23:13:47.082550Z","submitted_at":"2026-05-01T01:13:50Z","title":"Fast Text-to-Audio Generation with One-Step Sampling via Energy-Scoring and Auxiliary Contextual Representation Distillation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-09T19:17:09.247932Z"},"links":{"cited_paper":"/paper/2505.07615","citing_paper":"/paper/2605.00329"},"observation_digest":"sha256:6d51cba49e2dd4e3835a0334c2f1dd27f9e77effe6db5b03370b4fe01d8d6bd4","observation_id":"359e4848-4225-4bdd-bacc-5d6ac371349e","resolution":{"observed_at":"2026-05-11T15:46:42.234377Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6550","last_updated":"2015-03-27T11:52:28Z","snapshot_observed_at":"2026-07-06T04:04:16.777653Z","submitted_at":"2014-12-19T22:40:51Z","title":"FitNets: Hints for Thin Deep Nets","version":4},"cited_work":{"arxiv_id":"1412.6550","doi":"10.48550/arxiv.1412.6550","metadata_source":"pith","pith_arxiv_id":"1412.6550","snapshot_observed_at":"2026-07-10T21:17:35.904852Z","title":"FitNets: Hints for Thin Deep Nets","venue":"cs.LG","work_id":"057e16e2-a9fd-4a16-8fa3-8806ac7d3165","year":2014},"citing_paper":{"arxiv_id":"2605.00329","last_updated":"2026-05-01T01:13:50Z","snapshot_observed_at":"2026-07-06T23:13:47.082550Z","submitted_at":"2026-05-01T01:13:50Z","title":"Fast Text-to-Audio Generation with One-Step Sampling via Energy-Scoring and Auxiliary Contextual Representation Distillation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-09T19:17:09.247932Z"},"links":{"cited_paper":"/paper/1412.6550","citing_paper":"/paper/2605.00329"},"observation_digest":"sha256:8204930d6e03921874c52aca2b204ea7b2dacb2486583978ebd3debe42486c48","observation_id":"b0d4c629-b08d-42e0-ad9a-b2a7ddd94947","resolution":{"observed_at":"2026-05-14T01:46:30.917443Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-11T19:50:21.382784+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T19:50:21.382784+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.00512","last_updated":"2022-06-07T09:17:35Z","snapshot_observed_at":"2026-07-06T12:33:23.843893Z","submitted_at":"2022-02-01T16:07:25Z","title":"Progressive Distillation for Fast Sampling of Diffusion Models","version":2},"cited_work":{"arxiv_id":"2202.00512","doi":"10.48550/arxiv.2202.00512","metadata_source":"pith","pith_arxiv_id":"2202.00512","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Progressive Distillation for Fast Sampling of Diffusion Models","venue":"cs.LG","work_id":"fd04f498-ff85-4de3-bcc7-31ef072b2ceb","year":2022},"citing_paper":{"arxiv_id":"2605.00329","last_updated":"2026-05-01T01:13:50Z","snapshot_observed_at":"2026-07-06T23:13:47.082550Z","submitted_at":"2026-05-01T01:13:50Z","title":"Fast Text-to-Audio Generation with One-Step Sampling via Energy-Scoring and Auxiliary Contextual Representation Distillation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-09T19:17:09.247932Z"},"links":{"cited_paper":"/paper/2202.00512","citing_paper":"/paper/2605.00329"},"observation_digest":"sha256:59f337cbe3ee0cb1a49076326588c1e436ebe27dbf7031658b8851b6e7a63759","observation_id":"13b3eb1d-f8e4-487f-8801-14cafbf05cee","resolution":{"observed_at":"2026-05-11T15:46:43.118360Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.01469","last_updated":"2023-05-31T06:17:10Z","snapshot_observed_at":"2026-07-06T14:58:02.852672Z","submitted_at":"2023-03-02T18:30:16Z","title":"Consistency Models","version":2},"cited_work":{"arxiv_id":"2303.01469","doi":"10.48550/arxiv.2303.01469","metadata_source":"pith","pith_arxiv_id":"2303.01469","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Consistency Models","venue":"cs.LG","work_id":"502bf494-8fcd-434f-828f-0566ab606719","year":2023},"citing_paper":{"arxiv_id":"2605.00329","last_updated":"2026-05-01T01:13:50Z","snapshot_observed_at":"2026-07-06T23:13:47.082550Z","submitted_at":"2026-05-01T01:13:50Z","title":"Fast Text-to-Audio Generation with One-Step Sampling via Energy-Scoring and Auxiliary Contextual Representation Distillation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-09T19:17:09.247932Z"},"links":{"cited_paper":"/paper/2303.01469","citing_paper":"/paper/2605.00329"},"observation_digest":"sha256:942fb5945b6ca37806405540580963ea1d5fd5b3e00314994ecf6a53803feb69","observation_id":"e6569c8a-08f6-4014-819d-d37a0819cc39","resolution":{"observed_at":"2026-05-13T15:47:29.003852Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-05-23T20:53:56.48998+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T20:53:56.48998+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.09355","last_updated":"2019-08-25T16:13:24Z","snapshot_observed_at":"2026-07-06T08:16:39.915426Z","submitted_at":"2019-08-25T16:13:24Z","title":"Patient Knowledge Distillation for BERT Model Compression","version":1},"cited_work":{"arxiv_id":"1908.09355","doi":"10.48550/arxiv.1908.09355","metadata_source":"pith","pith_arxiv_id":"1908.09355","snapshot_observed_at":"2026-07-10T21:17:35.850483Z","title":"arXiv preprint arXiv:1908.09355 (2019)","venue":"cs.CL","work_id":"15b142b1-fae1-4e20-b8d4-3af74cb8825a","year":2019},"citing_paper":{"arxiv_id":"2605.00329","last_updated":"2026-05-01T01:13:50Z","snapshot_observed_at":"2026-07-06T23:13:47.082550Z","submitted_at":"2026-05-01T01:13:50Z","title":"Fast Text-to-Audio Generation with One-Step Sampling via Energy-Scoring and Auxiliary Contextual Representation Distillation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-09T19:17:09.247932Z"},"links":{"cited_paper":"/paper/1908.09355","citing_paper":"/paper/2605.00329"},"observation_digest":"sha256:50e8a651655b6060d507e2f12cc74d172b5edfc35a3f9888c806c814e305c92a","observation_id":"44dd3aee-e895-49b9-a19f-10385be2c025","resolution":{"observed_at":"2026-05-11T15:46:42.823215Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08635","last_updated":"2024-12-11T18:57:32Z","snapshot_observed_at":"2026-07-06T20:05:28.003434Z","submitted_at":"2024-12-11T18:57:32Z","title":"Multimodal Latent Language Modeling with Next-Token Diffusion","version":1},"cited_work":{"arxiv_id":"2412.08635","doi":"10.48550/arxiv.2412.08635","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.08635","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Multimodal latent language modeling with next- token diffusion","venue":null,"work_id":"c031cf7f-98b5-48ae-97e2-3f49e949fdd1","year":2024},"citing_paper":{"arxiv_id":"2605.00329","last_updated":"2026-05-01T01:13:50Z","snapshot_observed_at":"2026-07-06T23:13:47.082550Z","submitted_at":"2026-05-01T01:13:50Z","title":"Fast Text-to-Audio Generation with One-Step Sampling via Energy-Scoring and Auxiliary Contextual Representation Distillation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-09T19:17:09.247932Z"},"links":{"cited_paper":"/paper/2412.08635","citing_paper":"/paper/2605.00329"},"observation_digest":"sha256:bf2d1d29ab987132fc5f142430bd161ae864d0e19f656f656b8330989c0aeab7","observation_id":"7bd1ae22-7544-4de1-90fc-a0f62d34b403","resolution":{"observed_at":"2026-05-11T15:46:44.347336Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.10699","last_updated":"2022-01-24T19:12:34Z","snapshot_observed_at":"2026-07-06T08:31:42.308496Z","submitted_at":"2019-10-23T17:59:18Z","title":"Contrastive Representation Distillation","version":3},"cited_work":{"arxiv_id":"1910.10699","doi":"10.48550/arxiv.1910.10699","metadata_source":"pith","pith_arxiv_id":"1910.10699","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"URLhttps://arxiv.org/abs/1910.10699","venue":"cs.LG","work_id":"e0fc4057-ac4f-4c73-b04b-cc944c7701ad","year":2019},"citing_paper":{"arxiv_id":"2605.00329","last_updated":"2026-05-01T01:13:50Z","snapshot_observed_at":"2026-07-06T23:13:47.082550Z","submitted_at":"2026-05-01T01:13:50Z","title":"Fast Text-to-Audio Generation with One-Step Sampling via Energy-Scoring and Auxiliary Contextual Representation Distillation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-09T19:17:09.247932Z"},"links":{"cited_paper":"/paper/1910.10699","citing_paper":"/paper/2605.00329"},"observation_digest":"sha256:6c941926cbc6e7abdf88da278ecf7740edc21575a71bc51fe9bb20f895b5198f","observation_id":"1c96f253-6e4a-4ca4-881f-7f45e0b53fcd","resolution":{"observed_at":"2026-05-11T15:46:45.999848Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-11T19:50:21.864262+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T19:50:21.864262+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-07-06T17:07:56.107331Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":"2312.15821","doi":"10.48550/arxiv.2312.15821","metadata_source":"pith","pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Audiobox: Unified audio generation with natural language prompts","venue":"cs.SD","work_id":"f7d2982e-a068-43ac-85f8-a5d3fb631fa2","year":2023},"citing_paper":{"arxiv_id":"2605.00329","last_updated":"2026-05-01T01:13:50Z","snapshot_observed_at":"2026-07-06T23:13:47.082550Z","submitted_at":"2026-05-01T01:13:50Z","title":"Fast Text-to-Audio Generation with One-Step Sampling via Energy-Scoring and Auxiliary Contextual Representation Distillation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-09T19:17:09.247932Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2605.00329"},"observation_digest":"sha256:e1d13dc2cb290a1199d14f2ca41ae4b0172745ea9f903929110044be40934d97","observation_id":"1d819b93-7627-48bd-b92b-619c12b3a0ee","resolution":{"observed_at":"2026-05-11T15:46:41.933376Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Large-scale contrastive language-audio pretraining with feature fusion and keyword-to-caption augmentation","venue":null,"work_id":"31506ddd-6cd6-466e-8525-9817369db56c","year":2023},"citing_paper":{"arxiv_id":"2605.00329","last_updated":"2026-05-01T01:13:50Z","snapshot_observed_at":"2026-07-06T23:13:47.082550Z","submitted_at":"2026-05-01T01:13:50Z","title":"Fast Text-to-Audio Generation with One-Step Sampling via Energy-Scoring and Auxiliary Contextual Representation Distillation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-09T19:17:09.247932Z"},"links":{"citing_paper":"/paper/2605.00329"},"observation_digest":"sha256:355404eebf51157b220659405b7aed39c4f8fc6f1839e2a8923b98d86cbbdfb9","observation_id":"47dce838-5b98-45e7-8a9f-9a71731b854b","resolution":{"observed_at":"2026-05-25T21:51:16.662379Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Comparing discrete and continuous space llms for speech recognition","venue":null,"work_id":"ab613162-bb3d-427d-8270-45ccb64ced20","year":2024},"citing_paper":{"arxiv_id":"2605.00329","last_updated":"2026-05-01T01:13:50Z","snapshot_observed_at":"2026-07-06T23:13:47.082550Z","submitted_at":"2026-05-01T01:13:50Z","title":"Fast Text-to-Audio Generation with One-Step Sampling via Energy-Scoring and Auxiliary Contextual Representation Distillation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-09T19:17:09.247932Z"},"links":{"citing_paper":"/paper/2605.00329"},"observation_digest":"sha256:213732bcee629b2b17448340ef393f3429b4b9d1b041deada51dcb384e6d0bdd","observation_id":"6e270299-926a-4d1b-97f0-4b6fab95171f","resolution":{"observed_at":"2026-05-25T21:51:16.674760Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04917","last_updated":"2024-12-06T10:16:04Z","snapshot_observed_at":"2026-07-06T20:02:43.795985Z","submitted_at":"2024-12-06T10:16:04Z","title":"Continuous Speech Tokens Makes LLMs Robust Multi-Modality Learners","version":1},"cited_work":{"arxiv_id":"2412.04917","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.04917","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Continuous speech tokens makes llms robust multi- modality learners","venue":null,"work_id":"cf498e69-60dd-4133-8dc1-1542e2790668","year":null},"citing_paper":{"arxiv_id":"2605.00329","last_updated":"2026-05-01T01:13:50Z","snapshot_observed_at":"2026-07-06T23:13:47.082550Z","submitted_at":"2026-05-01T01:13:50Z","title":"Fast Text-to-Audio Generation with One-Step Sampling via Energy-Scoring and Auxiliary Contextual Representation Distillation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-09T19:17:09.247932Z"},"links":{"cited_paper":"/paper/2412.04917","citing_paper":"/paper/2605.00329"},"observation_digest":"sha256:336957a78ae2bc4bd597955c1438b43cc56206ed738b825e62a7c2b459e2c4a8","observation_id":"ebd68a4c-3872-4398-9419-19b1b8df4f0f","resolution":{"observed_at":"2026-05-11T15:46:42.075264Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02612","last_updated":"2024-12-03T17:41:24Z","snapshot_observed_at":"2026-07-06T20:01:01.384985Z","submitted_at":"2024-12-03T17:41:24Z","title":"GLM-4-Voice: Towards Intelligent and Human-Like End-to-End Spoken Chatbot","version":1},"cited_work":{"arxiv_id":"2412.02612","doi":"10.48550/arxiv.2412.02612","metadata_source":"pith","pith_arxiv_id":"2412.02612","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"GLM-4-Voice: Towards Intelligent and Human-Like End-to-End Spoken Chatbot","venue":"cs.CL","work_id":"1d250ff4-6ca5-4eb5-b561-48106b630d8b","year":2024},"citing_paper":{"arxiv_id":"2605.00329","last_updated":"2026-05-01T01:13:50Z","snapshot_observed_at":"2026-07-06T23:13:47.082550Z","submitted_at":"2026-05-01T01:13:50Z","title":"Fast Text-to-Audio Generation with One-Step Sampling via Energy-Scoring and Auxiliary Contextual Representation Distillation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-09T19:17:09.247932Z"},"links":{"cited_paper":"/paper/2412.02612","citing_paper":"/paper/2605.00329"},"observation_digest":"sha256:023e55714b22d29af1370e6367b1370886b18cb2fd477bc92a1059285f233205","observation_id":"a3e5a554-578a-4010-801a-8c6f61e5d8d6","resolution":{"observed_at":"2026-05-16T03:53:47.697648Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:58.621725+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:58.621725+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"and Chen, Y","venue":null,"work_id":"34b93aa0-e0d5-48b7-b6a0-23686cdaf2c1","year":2022},"citing_paper":{"arxiv_id":"2605.00329","last_updated":"2026-05-01T01:13:50Z","snapshot_observed_at":"2026-07-06T23:13:47.082550Z","submitted_at":"2026-05-01T01:13:50Z","title":"Fast Text-to-Audio Generation with One-Step Sampling via Energy-Scoring and Auxiliary Contextual Representation Distillation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-09T19:17:09.247932Z"},"links":{"citing_paper":"/paper/2605.00329"},"observation_digest":"sha256:6357347e9b809e7aebdef07b63f09d8286fa0469be16081203b1fe20f4ac2438","observation_id":"0bee8e78-bee5-4d02-9283-0c283a87ae61","resolution":{"observed_at":"2026-05-25T21:51:16.653895Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.07344","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2505.07344 , year=","venue":null,"work_id":"eadf17f5-cd37-4465-8457-fdfd12ac2898","year":2025},"citing_paper":{"arxiv_id":"2605.00329","last_updated":"2026-05-01T01:13:50Z","snapshot_observed_at":"2026-07-06T23:13:47.082550Z","submitted_at":"2026-05-01T01:13:50Z","title":"Fast Text-to-Audio Generation with One-Step Sampling via Energy-Scoring and Auxiliary Contextual Representation Distillation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-09T19:17:09.247932Z"},"links":{"citing_paper":"/paper/2605.00329"},"observation_digest":"sha256:fa4dd0f96c06616f0e0bcbc8a57663861b54e6b457f101cfacbaa3ff2173cfc8","observation_id":"28852967-1c73-45bd-92a5-d1d156638e8e","resolution":{"observed_at":"2026-05-11T15:46:45.575659Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22106","last_updated":"2025-05-28T08:33:58Z","snapshot_observed_at":"2026-07-06T21:32:04.296403Z","submitted_at":"2025-05-28T08:33:58Z","title":"AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion","version":1},"cited_work":{"arxiv_id":"2505.22106","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22106","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Audioturbo: Fast text-to- audio generation with rectified diffusion.arXiv preprint arXiv:2505.22106","venue":null,"work_id":"68455081-6c5e-450f-93ae-61584afeb0f1","year":null},"citing_paper":{"arxiv_id":"2605.00329","last_updated":"2026-05-01T01:13:50Z","snapshot_observed_at":"2026-07-06T23:13:47.082550Z","submitted_at":"2026-05-01T01:13:50Z","title":"Fast Text-to-Audio Generation with One-Step Sampling via Energy-Scoring and Auxiliary Contextual Representation Distillation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-09T19:17:09.247932Z"},"links":{"cited_paper":"/paper/2505.22106","citing_paper":"/paper/2605.00329"},"observation_digest":"sha256:224119028101bc3f78c6a5e8f7fded5e534746b2ec6eb0da6fe6bf05352d16cc","observation_id":"e1c9d323-e989-4711-81ed-a990793ad6f7","resolution":{"observed_at":"2026-05-11T15:46:43.615417Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Energy-distance The following content lists out the definitions and theorems required to prove Corollary 1, stated as follows","venue":null,"work_id":"63685306-9817-4035-b7e1-d69bcfa32528","year":2005},"citing_paper":{"arxiv_id":"2605.00329","last_updated":"2026-05-01T01:13:50Z","snapshot_observed_at":"2026-07-06T23:13:47.082550Z","submitted_at":"2026-05-01T01:13:50Z","title":"Fast Text-to-Audio Generation with One-Step Sampling via Energy-Scoring and Auxiliary Contextual Representation Distillation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-09T19:17:09.247932Z"},"links":{"citing_paper":"/paper/2605.00329"},"observation_digest":"sha256:7c181ced6090c3b8021bbdfc149ae5e48ebdb3e6ad6dd4ca9a8d82547117bf12","observation_id":"9dd64dcb-bdc1-4abb-82d1-a8071cb81648","resolution":{"observed_at":"2026-05-25T21:51:16.666883Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The equality holds if and only ifP=Q","venue":null,"work_id":"0cdf6dc4-71dc-4c40-976d-db7b72e0b556","year":2005},"citing_paper":{"arxiv_id":"2605.00329","last_updated":"2026-05-01T01:13:50Z","snapshot_observed_at":"2026-07-06T23:13:47.082550Z","submitted_at":"2026-05-01T01:13:50Z","title":"Fast Text-to-Audio Generation with One-Step Sampling via Energy-Scoring and Auxiliary Contextual Representation Distillation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-09T19:17:09.247932Z"},"links":{"citing_paper":"/paper/2605.00329"},"observation_digest":"sha256:e9b7352e6365e876b8b731108c326ef1375b975c6df360e46beded9cc4b985c6","observation_id":"bd54c241-ca2e-439a-bb82-080877b47316","resolution":{"observed_at":"2026-05-25T21:51:16.646255Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Text Embeddings Table 6 examines how different text embedding choices affect the performance of our one-step energy-scoring model with representation distillation","venue":null,"work_id":"2da25db5-bb71-48aa-9761-9429afda0b0c","year":2022},"citing_paper":{"arxiv_id":"2605.00329","last_updated":"2026-05-01T01:13:50Z","snapshot_observed_at":"2026-07-06T23:13:47.082550Z","submitted_at":"2026-05-01T01:13:50Z","title":"Fast Text-to-Audio Generation with One-Step Sampling via Energy-Scoring and Auxiliary Contextual Representation Distillation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-09T19:17:09.247932Z"},"links":{"citing_paper":"/paper/2605.00329"},"observation_digest":"sha256:d4a941fe68efe8e59c8554394bac397bf859619dedea83b124b28e6f588ec6f6","observation_id":"22c3f3d2-1116-41bb-b205-815112fa4521","resolution":{"observed_at":"2026-05-25T21:51:16.658264Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"stdev” stands for standard deviation. “stderr","venue":null,"work_id":"117aac06-85a7-402c-aa81-edbeff2d2656","year":2020},"citing_paper":{"arxiv_id":"2605.00329","last_updated":"2026-05-01T01:13:50Z","snapshot_observed_at":"2026-07-06T23:13:47.082550Z","submitted_at":"2026-05-01T01:13:50Z","title":"Fast Text-to-Audio Generation with One-Step Sampling via Energy-Scoring and Auxiliary Contextual Representation Distillation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-09T19:17:09.247932Z"},"links":{"citing_paper":"/paper/2605.00329"},"observation_digest":"sha256:17ab835c59e513e5e1b3bdfa7212055e54ff19fc754a86190df5a83dfeea6247","observation_id":"ceea380d-752a-4c9e-8915-e86a52833eec","resolution":{"observed_at":"2026-05-25T21:51:16.670780Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"records/4060432","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"093bce4f-d94d-4ed0-84ba-134b3bf5cbb5","year":2023},"citing_paper":{"arxiv_id":"2605.00329","last_updated":"2026-05-01T01:13:50Z","snapshot_observed_at":"2026-07-06T23:13:47.082550Z","submitted_at":"2026-05-01T01:13:50Z","title":"Fast Text-to-Audio Generation with One-Step Sampling via Energy-Scoring and Auxiliary Contextual Representation Distillation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-09T19:17:09.247932Z"},"links":{"citing_paper":"/paper/2605.00329"},"observation_digest":"sha256:c60d981adffb1c1d68c8fcdb7977d9c5639cbf5ff132f46c31a6cc2429980f6b","observation_id":"9cdd082d-6473-41a4-8531-54fa61461d04","resolution":{"observed_at":"2026-05-11T15:46:45.473367Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"This 1024-dimensional vector is duplicated 78 times to form the conditioning sequence","venue":null,"work_id":"b3e92eaa-0941-4554-9a8d-6e7ab80c32a0","year":2025},"citing_paper":{"arxiv_id":"2605.00329","last_updated":"2026-05-01T01:13:50Z","snapshot_observed_at":"2026-07-06T23:13:47.082550Z","submitted_at":"2026-05-01T01:13:50Z","title":"Fast Text-to-Audio Generation with One-Step Sampling via Energy-Scoring and Auxiliary Contextual Representation Distillation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-09T19:17:09.247932Z"},"links":{"citing_paper":"/paper/2605.00329"},"observation_digest":"sha256:ac7711b88662063f48eb29ecc37ea4fa149e9872dbbaac527ed1a0807dbb1fda","observation_id":"16bfc16b-5280-4629-9ebe-b30f486e06dd","resolution":{"observed_at":"2026-05-25T21:51:16.642501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.00329","last_updated":"2026-05-01T01:13:50Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-07-06T23:13:47.082550Z","submitted_at":"2026-05-01T01:13:50Z","title":"Fast Text-to-Audio Generation with One-Step Sampling via Energy-Scoring and Auxiliary Contextual Representation Distillation"},"reference_resolution":{"displayed":42,"state_counts":{"malformed_identifier":1,"metadata_mismatch":6,"parse_uncertain":0,"unresolved":0,"verified_exact":26,"verified_fuzzy":9},"total_outbound_references":42},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"thesis":"As of 26 July 2026, this Paper Citation Record lists 42 of 42 outbound references and 1 inbound Pith citation observation for arXiv:2605.00329."}