{"as_of":"2026-08-11T08:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3243db1353a70c93f65823639ac4d224d22c7abf748d74db0d3c13fe7d40bc63","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T15:59:21.187694Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T13:26:14.455424Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T13:26:14.665558Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.13465","last_updated":"2025-01-23T08:27:01Z","snapshot_observed_at":"2026-08-11T02:34:18.430606Z","submitted_at":"2025-01-23T08:27:01Z","title":"Neural Vocoders as Speech Enhancers","version":1},"cited_work":{"arxiv_id":"2501.13465","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.13465","snapshot_observed_at":"2026-08-06T13:26:14.665558Z","title":"Neural Vocoders as Speech Enhancers","venue":"cs.SD","work_id":"cb3fd2f0-cf0e-41ea-8842-a8273dab867c","year":2025},"citing_paper":{"arxiv_id":"2507.20731","last_updated":"2025-07-28T11:30:22Z","snapshot_observed_at":"2026-08-06T13:26:13.538119Z","submitted_at":"2025-07-28T11:30:22Z","title":"Learning Neural Vocoder from Range-Null Space Decomposition","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T13:26:14.455424Z"},"links":{"cited_paper":"/paper/2501.13465","citing_paper":"/paper/2507.20731"},"observation_digest":"sha256:52820396353c4de608326bbe9be54a9b7d7c2e038ab7f57f636971e7123790b1","observation_id":"be508643-0f5c-4216-9195-6bd4526e9ed7","resolution":{"observed_at":"2026-08-06T13:26:14.670112Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.13465/citation-record","integrity":"/paper/2501.13465/integrity","json":"/paper/2501.13465/citation-record.json","paper":"/paper/2501.13465"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:59:21.893919Z","title":"Tacotron: Towards End- to-End Speech Synthesis,","venue":null,"work_id":"26f53d28-7f54-424f-abaa-664a39735dd2","year":2017},"citing_paper":{"arxiv_id":"2501.13465","last_updated":"2025-01-23T08:27:01Z","snapshot_observed_at":"2026-08-11T02:34:18.430606Z","submitted_at":"2025-01-23T08:27:01Z","title":"Neural Vocoders as Speech Enhancers","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T15:59:21.012497Z"},"links":{"citing_paper":"/paper/2501.13465"},"observation_digest":"sha256:e5d36c62f542601b2bd6fe1cd0f4d23b74c763756eb7c77b322fd75275f7c3fa","observation_id":"50155a97-1f65-4130-bc0b-585f06fe892b","resolution":{"observed_at":"2026-08-10T15:59:21.899071Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:59:21.879347Z","title":"Naturalspeech 2: Latent Diffusion Models are Natural and Zero-Shot Speech and Singing Synthesizers,","venue":null,"work_id":"5eddc318-137e-48c3-a332-bec88b4def49","year":null},"citing_paper":{"arxiv_id":"2501.13465","last_updated":"2025-01-23T08:27:01Z","snapshot_observed_at":"2026-08-11T02:34:18.430606Z","submitted_at":"2025-01-23T08:27:01Z","title":"Neural Vocoders as Speech Enhancers","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T15:59:21.017287Z"},"links":{"citing_paper":"/paper/2501.13465"},"observation_digest":"sha256:ccc65f60b0a39a3b5bb2778672a4eddc71628f2e9e3f6881cf650340cd65f0ce","observation_id":"9641153f-a24c-4db8-8a19-488f0a1e1d36","resolution":{"observed_at":"2026-08-10T15:59:21.884553Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:59:21.865442Z","title":"Natural TTS Synthesis by Conditioning WaveNet on Mel Spectrogram Predictions,","venue":null,"work_id":"86435f4a-31f5-4405-a13d-76565fefe779","year":2018},"citing_paper":{"arxiv_id":"2501.13465","last_updated":"2025-01-23T08:27:01Z","snapshot_observed_at":"2026-08-11T02:34:18.430606Z","submitted_at":"2025-01-23T08:27:01Z","title":"Neural Vocoders as Speech Enhancers","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T15:59:21.021720Z"},"links":{"citing_paper":"/paper/2501.13465"},"observation_digest":"sha256:d79e734b62b8f1373df859d1ebdf4ea9e6cd336b7b4c9efb59f1463c230bcfd4","observation_id":"4cae6b1a-aceb-4419-9e4e-715fd046e7b6","resolution":{"observed_at":"2026-08-10T15:59:21.870198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13731","last_updated":"2023-05-29T12:09:08Z","snapshot_observed_at":"2026-08-10T11:18:06.491859Z","submitted_at":"2023-04-24T07:45:28Z","title":"Text-to-Audio Generation using Instruction-Tuned LLM and Latent Diffusion Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.13731","snapshot_observed_at":"2026-08-10T15:59:21.026366Z","title":"Text-to-audio generation using instruction-tuned llm and latent diffusion model,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.13465","last_updated":"2025-01-23T08:27:01Z","snapshot_observed_at":"2026-08-11T02:34:18.430606Z","submitted_at":"2025-01-23T08:27:01Z","title":"Neural Vocoders as Speech Enhancers","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T15:59:21.026366Z"},"links":{"cited_paper":"/paper/2304.13731","citing_paper":"/paper/2501.13465"},"observation_digest":"sha256:41e7adc9d793cd91b1f47eb1ae82a3d2bfed06a84f7010d1a0ad9230a9e5831d","observation_id":"fa2e99e3-c5b0-481b-8d65-5d64ab32c365","resolution":{"observed_at":"2026-08-10T15:59:21.026366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:59:21.852313Z","title":"Audit: Audio editing by following instructions with latent diffusion models,","venue":null,"work_id":"f1859b06-0a39-463d-bfd3-af9e2b62cbee","year":2023},"citing_paper":{"arxiv_id":"2501.13465","last_updated":"2025-01-23T08:27:01Z","snapshot_observed_at":"2026-08-11T02:34:18.430606Z","submitted_at":"2025-01-23T08:27:01Z","title":"Neural Vocoders as Speech Enhancers","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T15:59:21.031198Z"},"links":{"citing_paper":"/paper/2501.13465"},"observation_digest":"sha256:4b79409462dbb5e8e9084ea50e5bc7476a042884ee1ee4919485c138a8bf541c","observation_id":"a0e9c67a-7a5f-4146-bd1a-b4486a43fb32","resolution":{"observed_at":"2026-08-10T15:59:21.856694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:59:21.837845Z","title":"V oicefixer: Toward general speech restoration with neural vocoder,","venue":null,"work_id":"cc0a5a64-7dff-4339-b505-c253de512fbe","year":2022},"citing_paper":{"arxiv_id":"2501.13465","last_updated":"2025-01-23T08:27:01Z","snapshot_observed_at":"2026-08-11T02:34:18.430606Z","submitted_at":"2025-01-23T08:27:01Z","title":"Neural Vocoders as Speech Enhancers","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T15:59:21.036549Z"},"links":{"citing_paper":"/paper/2501.13465"},"observation_digest":"sha256:a0b802c2b79872f915e98c6293fd18e48da9cb20a8ef50c37193f1c252adc3a6","observation_id":"5dc0b2d6-4012-46a5-bbe2-e65dabe9e93f","resolution":{"observed_at":"2026-08-10T15:59:21.842545Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13511","last_updated":"2024-02-22T02:33:22Z","snapshot_observed_at":"2026-07-06T17:33:13.106468Z","submitted_at":"2024-02-21T03:48:53Z","title":"Mel-FullSubNet: Mel-Spectrogram Enhancement for Improving Both Speech Quality and ASR","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13511","snapshot_observed_at":"2026-08-10T15:59:21.041151Z","title":"Mel-FullSubNet: Mel-Spectrogram Enhancement for Improving Both Speech Quality and Asr,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.13465","last_updated":"2025-01-23T08:27:01Z","snapshot_observed_at":"2026-08-11T02:34:18.430606Z","submitted_at":"2025-01-23T08:27:01Z","title":"Neural Vocoders as Speech Enhancers","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T15:59:21.041151Z"},"links":{"cited_paper":"/paper/2402.13511","citing_paper":"/paper/2501.13465"},"observation_digest":"sha256:42b4cb90c5622e947d2ca935c8ce8c8308ac54cc77781b152ae374cae490a204","observation_id":"8176fbe7-d7d8-4e38-8d29-e512dccc5614","resolution":{"observed_at":"2026-08-10T15:59:21.041151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-10T15:59:21.046334Z","title":"Wavenet: A gener- ative model for raw audio,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.13465","last_updated":"2025-01-23T08:27:01Z","snapshot_observed_at":"2026-08-11T02:34:18.430606Z","submitted_at":"2025-01-23T08:27:01Z","title":"Neural Vocoders as Speech Enhancers","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T15:59:21.046334Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/2501.13465"},"observation_digest":"sha256:459c7c5f12106f5f256560d6b59dc91e516626cb4df64097c61b5f4366acf4b7","observation_id":"18582bdb-2f48-44fc-9078-8e3f6501fe95","resolution":{"observed_at":"2026-08-10T15:59:21.046334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:59:21.823046Z","title":"SampleRNN: An Unconditional End-to- End Neural Audio Generation Model,","venue":null,"work_id":"95f7225c-abba-4216-9967-30a55db5d3b6","year":2022},"citing_paper":{"arxiv_id":"2501.13465","last_updated":"2025-01-23T08:27:01Z","snapshot_observed_at":"2026-08-11T02:34:18.430606Z","submitted_at":"2025-01-23T08:27:01Z","title":"Neural Vocoders as Speech Enhancers","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T15:59:21.051193Z"},"links":{"citing_paper":"/paper/2501.13465"},"observation_digest":"sha256:4f5346aa24ce1e582d143bf8052c6dd7ddd86ae4fe667f929f8e4fd070e59e20","observation_id":"47be0e05-e25d-495e-8805-3b262ae0c533","resolution":{"observed_at":"2026-08-10T15:59:21.828162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:59:21.806452Z","title":"Hifi-gan: Generative adversarial networks for efficient and high fidelity speech synthesis,","venue":null,"work_id":"d893083f-7161-4ce0-9e2d-0103bffdfb9d","year":2020},"citing_paper":{"arxiv_id":"2501.13465","last_updated":"2025-01-23T08:27:01Z","snapshot_observed_at":"2026-08-11T02:34:18.430606Z","submitted_at":"2025-01-23T08:27:01Z","title":"Neural Vocoders as Speech Enhancers","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T15:59:21.055510Z"},"links":{"citing_paper":"/paper/2501.13465"},"observation_digest":"sha256:2f7a63957d2159bf574bf0d6f0c2d3dccdd2eb76657e984e4794efc5bf34fce4","observation_id":"2d54026a-825d-4114-aeb5-38b2557aa627","resolution":{"observed_at":"2026-08-10T15:59:21.811940Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:59:21.791920Z","title":"iSTFTNet: Fast and lightweight mel-spectrogram vocoder incorporating inverse short-time Fourier transform,","venue":null,"work_id":"2b792083-108c-4162-8950-c54187e032d0","year":2022},"citing_paper":{"arxiv_id":"2501.13465","last_updated":"2025-01-23T08:27:01Z","snapshot_observed_at":"2026-08-11T02:34:18.430606Z","submitted_at":"2025-01-23T08:27:01Z","title":"Neural Vocoders as Speech Enhancers","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T15:59:21.059647Z"},"links":{"citing_paper":"/paper/2501.13465"},"observation_digest":"sha256:4a73c130b23eef82cd3f88a42e1e48b1a723125c45daaa62d14608f63ff0fe55","observation_id":"c67f2daa-de5d-4609-8852-60ece6565016","resolution":{"observed_at":"2026-08-10T15:59:21.796963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:59:21.778675Z","title":"APNet: An all-frame-level neural vocoder incor- porating direct prediction of amplitude and phase spectra,","venue":null,"work_id":"ea422c6f-0797-4648-bcc3-acb13562c4ea","year":2023},"citing_paper":{"arxiv_id":"2501.13465","last_updated":"2025-01-23T08:27:01Z","snapshot_observed_at":"2026-08-11T02:34:18.430606Z","submitted_at":"2025-01-23T08:27:01Z","title":"Neural Vocoders as Speech Enhancers","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T15:59:21.063815Z"},"links":{"citing_paper":"/paper/2501.13465"},"observation_digest":"sha256:7f438489ae95bbca32b3510410a158ab381aab341173df22594145197d0de2aa","observation_id":"d007f8bd-e0f6-46c2-89e8-d38e634ef73e","resolution":{"observed_at":"2026-08-10T15:59:21.783048Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:59:21.764458Z","title":"V ocos: Closing the gap between time-domain and Fourier- based neural vocoders for high-quality audio synthesis,","venue":null,"work_id":"7a50322a-2605-4c17-bf02-0d9323e6c3f6","year":null},"citing_paper":{"arxiv_id":"2501.13465","last_updated":"2025-01-23T08:27:01Z","snapshot_observed_at":"2026-08-11T02:34:18.430606Z","submitted_at":"2025-01-23T08:27:01Z","title":"Neural Vocoders as Speech Enhancers","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T15:59:21.067920Z"},"links":{"citing_paper":"/paper/2501.13465"},"observation_digest":"sha256:2c140fcd76befed2d7ed264077f9064ececfd955772b9893c69d6a45c23bfc43","observation_id":"50b1ac9b-8551-451f-a989-21a903c92490","resolution":{"observed_at":"2026-08-10T15:59:21.770094Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:59:21.750122Z","title":"APNet2: High-Quality and High-Efficiency Neural Vocoder with Direct Prediction of Amplitude and Phase Spectra,","venue":null,"work_id":"6a6b740f-3236-4f7c-8f17-0b22386068b1","year":2023},"citing_paper":{"arxiv_id":"2501.13465","last_updated":"2025-01-23T08:27:01Z","snapshot_observed_at":"2026-08-11T02:34:18.430606Z","submitted_at":"2025-01-23T08:27:01Z","title":"Neural Vocoders as Speech Enhancers","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T15:59:21.072366Z"},"links":{"citing_paper":"/paper/2501.13465"},"observation_digest":"sha256:93479d723a56230dc99afe02582eeff23e32dea35d2175d9a9384eaf151e5ef0","observation_id":"4e31c8fd-e0fc-49c8-a39b-345ce45fcac7","resolution":{"observed_at":"2026-08-10T15:59:21.755334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08196","last_updated":"2024-06-12T13:29:36Z","snapshot_observed_at":"2026-08-10T09:04:15.877827Z","submitted_at":"2024-06-12T13:29:36Z","title":"FreeV: Free Lunch For Vocoders Through Pseudo Inversed Mel Filter","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08196","snapshot_observed_at":"2026-08-10T15:59:21.076701Z","title":"FreeV: Free Lunch For Vocoders Through Pseudo Inversed Mel Filter,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.13465","last_updated":"2025-01-23T08:27:01Z","snapshot_observed_at":"2026-08-11T02:34:18.430606Z","submitted_at":"2025-01-23T08:27:01Z","title":"Neural Vocoders as Speech Enhancers","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T15:59:21.076701Z"},"links":{"cited_paper":"/paper/2406.08196","citing_paper":"/paper/2501.13465"},"observation_digest":"sha256:45708131d81e93c8d6e1be791f09eb6c1a1e7e42b38dacc8bd58eedf303689cb","observation_id":"ab271f4e-3348-44b9-8e85-9f87715b70ad","resolution":{"observed_at":"2026-08-10T15:59:21.076701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:59:21.735929Z","title":"Speech dereverberation using non- negative convolutive transfer function and spectro-temporal modeling,","venue":null,"work_id":"c2730863-76bb-4137-be4b-9c1557768fed","year":2015},"citing_paper":{"arxiv_id":"2501.13465","last_updated":"2025-01-23T08:27:01Z","snapshot_observed_at":"2026-08-11T02:34:18.430606Z","submitted_at":"2025-01-23T08:27:01Z","title":"Neural Vocoders as Speech Enhancers","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T15:59:21.081100Z"},"links":{"citing_paper":"/paper/2501.13465"},"observation_digest":"sha256:a693ff04c2b02c872a348e8e0e400a33893ffb562d42eae76d979d3cffa279d5","observation_id":"e6ca9a22-90c2-4f04-a719-f60a5940126a","resolution":{"observed_at":"2026-08-10T15:59:21.740376Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:59:21.721005Z","title":"The voice bank corpus: Design, collection and data analysis of a large regional accent speech database,","venue":null,"work_id":"df6ca7c6-d534-4ce7-961f-e8de8906fcff","year":2013},"citing_paper":{"arxiv_id":"2501.13465","last_updated":"2025-01-23T08:27:01Z","snapshot_observed_at":"2026-08-11T02:34:18.430606Z","submitted_at":"2025-01-23T08:27:01Z","title":"Neural Vocoders as Speech Enhancers","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T15:59:21.085495Z"},"links":{"citing_paper":"/paper/2501.13465"},"observation_digest":"sha256:e8c9fbbfde703a509a73cccaf6b13bfd76dbb7a926f775478dfb227222aba4f9","observation_id":"2a1e85ea-65f8-48a0-8792-13d8d8490c32","resolution":{"observed_at":"2026-08-10T15:59:21.726069Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:59:21.707018Z","title":"On training targets for su- pervised speech separation,","venue":null,"work_id":"58acf00b-89b2-49a6-860d-ff41c05a669d","year":2014},"citing_paper":{"arxiv_id":"2501.13465","last_updated":"2025-01-23T08:27:01Z","snapshot_observed_at":"2026-08-11T02:34:18.430606Z","submitted_at":"2025-01-23T08:27:01Z","title":"Neural Vocoders as Speech Enhancers","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T15:59:21.090147Z"},"links":{"citing_paper":"/paper/2501.13465"},"observation_digest":"sha256:ea05d6eca3db09755cf33573a84ba626d2e26d282023a1f5287c3d518f97b0ae","observation_id":"b7795b0f-5b6e-4681-9a5a-078a3b19950f","resolution":{"observed_at":"2026-08-10T15:59:21.711872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:59:21.691973Z","title":"Signal estimation from modified short-time Fourier transform,","venue":null,"work_id":"d55562bd-2d5b-40a5-abd5-361fc8483e26","year":1984},"citing_paper":{"arxiv_id":"2501.13465","last_updated":"2025-01-23T08:27:01Z","snapshot_observed_at":"2026-08-11T02:34:18.430606Z","submitted_at":"2025-01-23T08:27:01Z","title":"Neural Vocoders as Speech Enhancers","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T15:59:21.095936Z"},"links":{"citing_paper":"/paper/2501.13465"},"observation_digest":"sha256:e21cfd418f7011194c14a20a47a21fbbd7e52e4e3edf52b0e4c33ead93165941","observation_id":"da323225-110a-42a1-9b80-e7d015544269","resolution":{"observed_at":"2026-08-10T15:59:21.697078Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:59:21.676679Z","title":"Libritts: A Corpus Derived from LibriSpeech for Text-to- Speech,","venue":null,"work_id":"a682f3d0-cb6d-41e6-b56b-75110190e15d","year":2019},"citing_paper":{"arxiv_id":"2501.13465","last_updated":"2025-01-23T08:27:01Z","snapshot_observed_at":"2026-08-11T02:34:18.430606Z","submitted_at":"2025-01-23T08:27:01Z","title":"Neural Vocoders as Speech Enhancers","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T15:59:21.100279Z"},"links":{"citing_paper":"/paper/2501.13465"},"observation_digest":"sha256:a81c7bd354229b2eb412dc943376d149bb216c2e6e52ec5a939c97c667e73a68","observation_id":"e0f6f397-d193-4ab3-8d43-17767c17751e","resolution":{"observed_at":"2026-08-10T15:59:21.681383Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:59:21.660700Z","title":"ICASSP 2023 deep noise suppression challenge,","venue":null,"work_id":"7247e65d-6628-4de9-99eb-3b727b5771ee","year":2023},"citing_paper":{"arxiv_id":"2501.13465","last_updated":"2025-01-23T08:27:01Z","snapshot_observed_at":"2026-08-11T02:34:18.430606Z","submitted_at":"2025-01-23T08:27:01Z","title":"Neural Vocoders as Speech Enhancers","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T15:59:21.104366Z"},"links":{"citing_paper":"/paper/2501.13465"},"observation_digest":"sha256:87ad5326819fb99bab94aa531aa898e478beb5b5f0530227b755392d2b2925c9","observation_id":"04cc6a3a-1a3f-40d9-bebc-635a2359253c","resolution":{"observed_at":"2026-08-10T15:59:21.666483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1510.08484","last_updated":"2015-10-28T20:59:04Z","snapshot_observed_at":"2026-07-06T04:34:36.474437Z","submitted_at":"2015-10-28T20:59:04Z","title":"MUSAN: A Music, Speech, and Noise Corpus","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1510.08484","snapshot_observed_at":"2026-08-10T15:59:21.109056Z","title":"MUSAN: A music, speech, and noise corpus,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.13465","last_updated":"2025-01-23T08:27:01Z","snapshot_observed_at":"2026-08-11T02:34:18.430606Z","submitted_at":"2025-01-23T08:27:01Z","title":"Neural Vocoders as Speech Enhancers","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T15:59:21.109056Z"},"links":{"cited_paper":"/paper/1510.08484","citing_paper":"/paper/2501.13465"},"observation_digest":"sha256:5dd68b0bd927c7fafb55f0d0230727b39411268874ccf8e5e2e19c5117fbda30","observation_id":"28154813-8b3c-4a6b-82f4-006e5936a3ea","resolution":{"observed_at":"2026-08-10T15:59:21.109056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:59:21.645042Z","title":"Hd-demucs: General speech restoration with heterogeneous decoders,","venue":null,"work_id":"cd3e4270-4a57-481f-aa9e-7c36d68a56c7","year":2023},"citing_paper":{"arxiv_id":"2501.13465","last_updated":"2025-01-23T08:27:01Z","snapshot_observed_at":"2026-08-11T02:34:18.430606Z","submitted_at":"2025-01-23T08:27:01Z","title":"Neural Vocoders as Speech Enhancers","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T15:59:21.113850Z"},"links":{"citing_paper":"/paper/2501.13465"},"observation_digest":"sha256:cefc83d762426d0afd9757a88f2de52253bd5c1b179d2f621e7ae804a8020ba6","observation_id":"e3a7e9ef-c499-42c1-82e0-d99dcbf247fd","resolution":{"observed_at":"2026-08-10T15:59:21.650977Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:59:21.631191Z","title":"Conv-TasNet: Surpassing ideal time– frequency magnitude masking for speech separation,","venue":null,"work_id":"1554856f-aea5-41ba-a35a-4f5baadb0e57","year":2019},"citing_paper":{"arxiv_id":"2501.13465","last_updated":"2025-01-23T08:27:01Z","snapshot_observed_at":"2026-08-11T02:34:18.430606Z","submitted_at":"2025-01-23T08:27:01Z","title":"Neural Vocoders as Speech Enhancers","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T15:59:21.118289Z"},"links":{"citing_paper":"/paper/2501.13465"},"observation_digest":"sha256:80361decdd56eca4eb70814a94b6d4f0a289e911ddf4971b937dd52895bc2473","observation_id":"dabe3c41-406c-4c34-aa0d-c94eff7bca45","resolution":{"observed_at":"2026-08-10T15:59:21.635834Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:59:21.617272Z","title":"Learning complex spectral mapping with gated convolutional recurrent networks for monaural speech enhancement,","venue":null,"work_id":"26a8b41b-a2c5-42c8-8cb5-29df7f301685","year":2019},"citing_paper":{"arxiv_id":"2501.13465","last_updated":"2025-01-23T08:27:01Z","snapshot_observed_at":"2026-08-11T02:34:18.430606Z","submitted_at":"2025-01-23T08:27:01Z","title":"Neural Vocoders as Speech Enhancers","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T15:59:21.122596Z"},"links":{"citing_paper":"/paper/2501.13465"},"observation_digest":"sha256:b25bdb030199de048b9b98f4a8a63dd24fb152c707aa40342e71876082ca3adc","observation_id":"5efbd59f-3f4f-411d-8898-3e9f878c89bf","resolution":{"observed_at":"2026-08-10T15:59:21.621936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:59:21.126814Z","title":"Music source separation with band-split RNN,","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2501.13465","last_updated":"2025-01-23T08:27:01Z","snapshot_observed_at":"2026-08-11T02:34:18.430606Z","submitted_at":"2025-01-23T08:27:01Z","title":"Neural Vocoders as Speech Enhancers","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T15:59:21.126814Z"},"links":{"citing_paper":"/paper/2501.13465"},"observation_digest":"sha256:8d4b2ac84ee7c1fbd559c4da0a91dd1b18828eb9dcc81515ea23f8ef93b2267d","observation_id":"64722f43-6755-44ae-9a9b-24be607c4ed2","resolution":{"observed_at":"2026-08-10T15:59:21.126814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:59:21.594098Z","title":"Bandwidth extension for hierarchical speech and audio coding in itu-t rec. g. 729.1,","venue":null,"work_id":"3e8bc4ed-9a88-4fbb-abd4-6b5cb49ae0a5","year":2007},"citing_paper":{"arxiv_id":"2501.13465","last_updated":"2025-01-23T08:27:01Z","snapshot_observed_at":"2026-08-11T02:34:18.430606Z","submitted_at":"2025-01-23T08:27:01Z","title":"Neural Vocoders as Speech Enhancers","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T15:59:21.131058Z"},"links":{"citing_paper":"/paper/2501.13465"},"observation_digest":"sha256:e7ffb54fa5e78f6385753f7d8d9e74c37ae6af54d263adeb5ed26a7a240698f4","observation_id":"ae23a299-cecb-4849-8023-e9590dcfeb8b","resolution":{"observed_at":"2026-08-10T15:59:21.599254Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:59:21.579839Z","title":"A short- time objective intelligibility measure for time-frequency weighted noisy speech,","venue":null,"work_id":"c9771562-0446-4960-a1b3-cbff3e08bab8","year":2010},"citing_paper":{"arxiv_id":"2501.13465","last_updated":"2025-01-23T08:27:01Z","snapshot_observed_at":"2026-08-11T02:34:18.430606Z","submitted_at":"2025-01-23T08:27:01Z","title":"Neural Vocoders as Speech Enhancers","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T15:59:21.135377Z"},"links":{"citing_paper":"/paper/2501.13465"},"observation_digest":"sha256:66419e8318166660344fa6d4233a0ca38dee0f1cdebd68ae4895a0d9b4e11282","observation_id":"38d59a38-f141-4ed9-9366-17486fa1286f","resolution":{"observed_at":"2026-08-10T15:59:21.584723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:59:21.564754Z","title":"UTMOS: Utokyo-Sarulab System for V oiceMOS Chal- lenge 2022,","venue":null,"work_id":"bd2af57d-6621-4f97-b3cb-a1e6b10d3c9f","year":2022},"citing_paper":{"arxiv_id":"2501.13465","last_updated":"2025-01-23T08:27:01Z","snapshot_observed_at":"2026-08-11T02:34:18.430606Z","submitted_at":"2025-01-23T08:27:01Z","title":"Neural Vocoders as Speech Enhancers","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T15:59:21.139600Z"},"links":{"citing_paper":"/paper/2501.13465"},"observation_digest":"sha256:8dde215407b8a51aa914e9c93462182587aba747881cdd3dc9de4eebd90bb2fd","observation_id":"dda61654-01f6-401f-84ed-1f46ae9204d0","resolution":{"observed_at":"2026-08-10T15:59:21.570063Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:59:21.550579Z","title":"PHASEN: A phase-and- harmonics-aware speech enhancement network,","venue":null,"work_id":"2f3cb8b2-9e73-483f-a144-3f3f88e6fc4e","year":2020},"citing_paper":{"arxiv_id":"2501.13465","last_updated":"2025-01-23T08:27:01Z","snapshot_observed_at":"2026-08-11T02:34:18.430606Z","submitted_at":"2025-01-23T08:27:01Z","title":"Neural Vocoders as Speech Enhancers","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T15:59:21.144136Z"},"links":{"citing_paper":"/paper/2501.13465"},"observation_digest":"sha256:617c964f87bce704d77df1704bba8a74e5ebbb11567e62ef98380db18f86f598","observation_id":"04ad661b-3be8-4936-815d-4a6e5c5f0baf","resolution":{"observed_at":"2026-08-10T15:59:21.555189Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:59:21.536413Z","title":"TF-GridNet: Making time-frequency domain models great again for monaural speaker separation,","venue":null,"work_id":"cccb9a5b-9769-4c27-9630-a3e2b8e3702a","year":2023},"citing_paper":{"arxiv_id":"2501.13465","last_updated":"2025-01-23T08:27:01Z","snapshot_observed_at":"2026-08-11T02:34:18.430606Z","submitted_at":"2025-01-23T08:27:01Z","title":"Neural Vocoders as Speech Enhancers","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T15:59:21.148505Z"},"links":{"citing_paper":"/paper/2501.13465"},"observation_digest":"sha256:a6c67e10ac320f85d20c92300248e1efa797fd83d29118d349ea735366afb0d5","observation_id":"223100d5-9e10-4b34-acf4-ab9f49af78f0","resolution":{"observed_at":"2026-08-10T15:59:21.541346Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:59:21.521303Z","title":"Taylor, can you hear me now? a taylor-unfolding framework for monaural speech enhancement,","venue":null,"work_id":"e202121d-5b00-41a3-be48-95d1b3680542","year":2022},"citing_paper":{"arxiv_id":"2501.13465","last_updated":"2025-01-23T08:27:01Z","snapshot_observed_at":"2026-08-11T02:34:18.430606Z","submitted_at":"2025-01-23T08:27:01Z","title":"Neural Vocoders as Speech Enhancers","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T15:59:21.152894Z"},"links":{"citing_paper":"/paper/2501.13465"},"observation_digest":"sha256:700d68ae809d49e2924cb630140092d6fd98b2882f68a275ae821f6fdfd62c9c","observation_id":"3886dc37-d724-41ed-a8b7-6c3e035d9902","resolution":{"observed_at":"2026-08-10T15:59:21.526462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:59:21.504126Z","title":"Two heads are better than one: A two-stage complex spectral mapping approach for monaural speech enhancement,","venue":null,"work_id":"df50dbe3-56ff-42e3-bbd3-d35864a5b51a","year":2021},"citing_paper":{"arxiv_id":"2501.13465","last_updated":"2025-01-23T08:27:01Z","snapshot_observed_at":"2026-08-11T02:34:18.430606Z","submitted_at":"2025-01-23T08:27:01Z","title":"Neural Vocoders as Speech Enhancers","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T15:59:21.157064Z"},"links":{"citing_paper":"/paper/2501.13465"},"observation_digest":"sha256:72862eea3fa1848d368b90908aa2ccba2ba4f1e5fb05dcd3ffd3db8b15385af4","observation_id":"a1a5da00-86ab-4e3b-8249-c9cd0daae650","resolution":{"observed_at":"2026-08-10T15:59:21.509917Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:59:21.488378Z","title":"Sixty years of frequency-domain monaural speech enhance- ment: From traditional to deep learning methods,","venue":null,"work_id":"a8ab7aee-268c-4e87-9506-372aa693bbed","year":2023},"citing_paper":{"arxiv_id":"2501.13465","last_updated":"2025-01-23T08:27:01Z","snapshot_observed_at":"2026-08-11T02:34:18.430606Z","submitted_at":"2025-01-23T08:27:01Z","title":"Neural Vocoders as Speech Enhancers","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T15:59:21.161070Z"},"links":{"citing_paper":"/paper/2501.13465"},"observation_digest":"sha256:6e705a722faf57ec1321996599e27d8ea8e4cf5a469a1fae9abac6a52fb6be4c","observation_id":"7b5b4f4d-28c2-4bb9-83f5-517d5e76446e","resolution":{"observed_at":"2026-08-10T15:59:21.493373Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:59:21.471523Z","title":"DNSMOS P. 835: A non- intrusive perceptual objective speech quality metric to evaluate noise suppressors,","venue":null,"work_id":"e373145d-9a3d-4592-9c1b-0f172c0cd347","year":2022},"citing_paper":{"arxiv_id":"2501.13465","last_updated":"2025-01-23T08:27:01Z","snapshot_observed_at":"2026-08-11T02:34:18.430606Z","submitted_at":"2025-01-23T08:27:01Z","title":"Neural Vocoders as Speech Enhancers","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T15:59:21.165356Z"},"links":{"citing_paper":"/paper/2501.13465"},"observation_digest":"sha256:e644911d78e179291c0def4d0fa5bd75dadcc44c2c4f0425ba8a80bc5860d932","observation_id":"03b58b7f-5e4d-4285-8e85-e209b3bc2802","resolution":{"observed_at":"2026-08-10T15:59:21.477456Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:59:21.455959Z","title":"ViSQOL v3: An open source production ready objective speech and audio metric,","venue":null,"work_id":"2fc0380a-932d-42f6-9c8b-6f3b2b15e9e3","year":2020},"citing_paper":{"arxiv_id":"2501.13465","last_updated":"2025-01-23T08:27:01Z","snapshot_observed_at":"2026-08-11T02:34:18.430606Z","submitted_at":"2025-01-23T08:27:01Z","title":"Neural Vocoders as Speech Enhancers","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T15:59:21.169757Z"},"links":{"citing_paper":"/paper/2501.13465"},"observation_digest":"sha256:433aa233994f2453f403970e1710c0843dbee1be318cc506068d62d618ad511a","observation_id":"6507eafe-f2bd-418e-8376-9bfd2375fbee","resolution":{"observed_at":"2026-08-10T15:59:21.460993Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02813","last_updated":"2021-11-04T12:26:34Z","snapshot_observed_at":"2026-07-06T12:05:25.336577Z","submitted_at":"2021-11-04T12:26:34Z","title":"WaveFake: A Data Set to Facilitate Audio Deepfake Detection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.02813","snapshot_observed_at":"2026-08-10T15:59:21.174133Z","title":"Wavefake: A data set to facilitate audio deepfake detection,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.13465","last_updated":"2025-01-23T08:27:01Z","snapshot_observed_at":"2026-08-11T02:34:18.430606Z","submitted_at":"2025-01-23T08:27:01Z","title":"Neural Vocoders as Speech Enhancers","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T15:59:21.174133Z"},"links":{"cited_paper":"/paper/2111.02813","citing_paper":"/paper/2501.13465"},"observation_digest":"sha256:5b06b567a8de69a8bf27a43a88b589808c4668b7bd91e58608ac46c7b2923ade","observation_id":"f6c9f0b6-5b8a-4c42-add6-756df69dee41","resolution":{"observed_at":"2026-08-10T15:59:21.174133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.05441","last_updated":"2019-04-14T11:38:32Z","snapshot_observed_at":"2026-07-06T07:45:20.666021Z","submitted_at":"2019-04-09T15:12:52Z","title":"ASVspoof 2019: Future Horizons in Spoofed and Fake Audio Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.05441","snapshot_observed_at":"2026-08-10T15:59:21.178977Z","title":"ASVspoof 2019: Future horizons in spoofed and fake audio detection,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.13465","last_updated":"2025-01-23T08:27:01Z","snapshot_observed_at":"2026-08-11T02:34:18.430606Z","submitted_at":"2025-01-23T08:27:01Z","title":"Neural Vocoders as Speech Enhancers","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T15:59:21.178977Z"},"links":{"cited_paper":"/paper/1904.05441","citing_paper":"/paper/2501.13465"},"observation_digest":"sha256:8f6e5beb6a02c922012edafef53b31de618c0632d35520fd2eeaeae473499e22","observation_id":"94edbe0a-9ce7-4ed5-9e8d-949e3b47bc87","resolution":{"observed_at":"2026-08-10T15:59:21.178977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:59:21.439693Z","title":"Singfake: Singing voice deepfake detection,","venue":null,"work_id":"e1b640eb-8ef4-478e-85aa-1230cdef753c","year":2024},"citing_paper":{"arxiv_id":"2501.13465","last_updated":"2025-01-23T08:27:01Z","snapshot_observed_at":"2026-08-11T02:34:18.430606Z","submitted_at":"2025-01-23T08:27:01Z","title":"Neural Vocoders as Speech Enhancers","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T15:59:21.183546Z"},"links":{"citing_paper":"/paper/2501.13465"},"observation_digest":"sha256:4180b750f766f46c3295daf4ace41d689cf14052cb19cabca9636b9daf898539","observation_id":"3636e44f-b18c-4f6f-a8b3-dcedea3161c7","resolution":{"observed_at":"2026-08-10T15:59:21.446096Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02438","last_updated":"2024-06-18T04:21:52Z","snapshot_observed_at":"2026-08-04T22:28:16.482904Z","submitted_at":"2024-06-04T16:00:18Z","title":"CtrSVDD: A Benchmark Dataset and Baseline Analysis for Controlled Singing Voice Deepfake Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02438","snapshot_observed_at":"2026-08-10T15:59:21.187694Z","title":"CtrSVDD: A Benchmark Dataset and Baseline Analysis for Controlled Singing Voice Deepfake Detection,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.13465","last_updated":"2025-01-23T08:27:01Z","snapshot_observed_at":"2026-08-11T02:34:18.430606Z","submitted_at":"2025-01-23T08:27:01Z","title":"Neural Vocoders as Speech Enhancers","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T15:59:21.187694Z"},"links":{"cited_paper":"/paper/2406.02438","citing_paper":"/paper/2501.13465"},"observation_digest":"sha256:b6c0b190126f9b23c2088029ef3738d99ecd5304c0379747c8a6a386db01d182","observation_id":"85fe2d22-0e3d-4e95-990a-34ee7b0a1f38","resolution":{"observed_at":"2026-08-10T15:59:21.187694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.13465","last_updated":"2025-01-23T08:27:01Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-11T02:34:18.430606Z","submitted_at":"2025-01-23T08:27:01Z","title":"Neural Vocoders as Speech Enhancers"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":9,"verified_exact":0,"verified_fuzzy":31},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 1 inbound Pith citation observation for arXiv:2501.13465."}