{"as_of":"2026-08-15T04:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:35d5656a603c85b26cdaabb48b46fecfa9f425d72570f85d3069118ef53c8a7b","coverage":[{"denominator":73,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":73,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T18:47:51.689848Z","state":"measured"},{"denominator":73,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":73,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.11258/citation-record","integrity":"/paper/2411.11258/integrity","json":"/paper/2411.11258/citation-record.json","paper":"/paper/2411.11258"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.10533","last_updated":"2024-09-24T01:14:07Z","snapshot_observed_at":"2026-08-13T04:17:45.090636Z","submitted_at":"2024-02-16T09:38:16Z","title":"APCodec: A Neural Audio Codec with Parallel Amplitude and Phase Spectrum Encoding and Decoding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10533","snapshot_observed_at":"2026-08-12T18:47:51.288451Z","title":"Apcodec: A neural audio codec with parallel amplitude and phase spectrum encoding and decoding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-15T01:57:56.506162Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.288451Z"},"links":{"cited_paper":"/paper/2402.10533","citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:f5fb8d8b10bfc80e9e894af22b455ff88f532cbbd70283783153785cea5ac7e0","observation_id":"c47f90a2-7987-4b51-b815-cbf24766bb4a","resolution":{"observed_at":"2026-08-12T18:47:51.288451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:53.116558Z","title":null,"venue":null,"work_id":"28ef1642-466b-450e-af5e-c93b9bc953b9","year":2020},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-15T01:57:56.506162Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.295087Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:bab01128feedfbeb10db5d317abe85a8888f6c42dfb435f174eb90cd3eac2abc","observation_id":"4b56eaca-498e-458e-ab90-63622f40485e","resolution":{"observed_at":"2026-08-12T18:47:53.122993Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:53.099529Z","title":"APNet: An all-frame-level neural vocoder incorpo- rating direct prediction of amplitude and phase spectra.IEEE/ACM Transactions on Audio, Speech, and Language Processing , 2023","venue":null,"work_id":"45540826-8058-4253-a69a-c03473f47ccf","year":2023},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-15T01:57:56.506162Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.300069Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:3eecb6c10cd31830ee73f9c5bd6b00cd350a5ae29cc8998445ad644042f34e93","observation_id":"e5a4ab15-641f-4883-a496-1466aaef0844","resolution":{"observed_at":"2026-08-12T18:47:53.104762Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:53.083438Z","title":"Neural speech phase prediction based on parallel estimation architecture and anti-wrapping losses","venue":null,"work_id":"b5a8fab0-4520-4df8-a570-7164e656b917","year":2023},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-15T01:57:56.506162Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.305152Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:b46916d10461656d9af3ee3f4567773a51cdf75c4760ca4d3736418e9e0118d7","observation_id":"941397a5-4586-4567-b8d9-13954a1f2a18","resolution":{"observed_at":"2026-08-12T18:47:53.089020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:53.066186Z","title":"Long-frame-shift neural speech phase prediction with spectral continuity enhancement and interpolation error compen- sation","venue":null,"work_id":"b4397973-71bd-4065-8f75-f37fe697a242","year":2023},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-15T01:57:56.506162Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.310478Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:3eab951030ebef003dd32f9bc75c5d0676ebc34458022dd6e9b50a6080da2286","observation_id":"8acb7ca0-f313-455d-9cff-e87352053c20","resolution":{"observed_at":"2026-08-12T18:47:53.071416Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.05453","last_updated":"2020-02-16T18:35:27Z","snapshot_observed_at":"2026-08-11T05:38:01.369830Z","submitted_at":"2019-10-12T00:55:06Z","title":"vq-wav2vec: Self-Supervised Learning of Discrete Speech Representations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.05453","snapshot_observed_at":"2026-08-12T18:47:51.315555Z","title":"vq-wav2vec: Self-supervised learning of discrete speech representations.arXiv preprint arXiv:1910.05453, 2019","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-15T01:57:56.506162Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.315555Z"},"links":{"cited_paper":"/paper/1910.05453","citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:f6a79cbad991f35733da04079ac147d3fb7fe3336d92a6d2431166dce53cd1ae","observation_id":"1ed81267-acbe-47a6-b11a-49bbf046eafd","resolution":{"observed_at":"2026-08-12T18:47:51.315555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:53.047475Z","title":"Audiolm: a language modeling approach to audio generation","venue":null,"work_id":"d6768a10-43bb-4518-99f0-e6030b0a7dbe","year":2023},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-15T01:57:56.506162Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.321616Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:3a0a001fd8e79d46f0d9324184602bebb163bb2e65ae854dbaa7d5d57c05f532","observation_id":"697d32cd-6f82-431f-8350-602e496b66b5","resolution":{"observed_at":"2026-08-12T18:47:53.053852Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:53.026554Z","title":"Iso/mpeg-1 audio: A generic standard for coding of high-quality digital audio.Journal of the Audio Engineering Society , 42(10):780–792, 1994","venue":null,"work_id":"62e5fe6c-ff0b-4419-b916-b9261c615b70","year":1994},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-15T01:57:56.506162Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.326911Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:71c659d7476632ae64b0d76b4af4a199689698a6027f40b1f98c22ef4c4d2fe8","observation_id":"9bbf6214-0846-452c-8ca2-5aa583c8fc1b","resolution":{"observed_at":"2026-08-12T18:47:53.032029Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:53.009451Z","title":"Crowdsourcing preference tests, and how to detect cheating","venue":null,"work_id":"68ff311a-d6de-4d00-8365-933ace8e4ef5","year":2011},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-15T01:57:56.506162Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.331806Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:88e6ec8d444ca3729931288d81a42c52766ffd4f705cadfc645893f12f2dc895","observation_id":"f992542b-b0d6-4b1a-801a-b6db205cd865","resolution":{"observed_at":"2026-08-12T18:47:53.014682Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:52.991650Z","title":"ViSQOL v3: An open source production ready objective speech and audio metric","venue":null,"work_id":"48851148-5fde-4f08-bf81-108eaddbf161","year":2020},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-15T01:57:56.506162Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.337005Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:c4cb7ce4be4be1f9fed6e2a4dd74719f6466a71f6c022bd4e3deb7e495a6d95a","observation_id":"3cb54547-c291-4b60-aed2-294195bd0fe2","resolution":{"observed_at":"2026-08-12T18:47:52.997282Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:52.975049Z","title":"High fidelity neural audio compression","venue":null,"work_id":"e2ca7784-9239-4c51-9cb2-0e661b123889","year":2023},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-15T01:57:56.506162Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.342222Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:b9981d1646062191061949a86ff4bddbf884e74437b928cf1a6acbc8b5f12bbb","observation_id":"96a17bfa-ada3-48f8-ace9-120a324aa15e","resolution":{"observed_at":"2026-08-12T18:47:52.980738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:52.958958Z","title":"Overview of the evs codec architecture","venue":null,"work_id":"49c784a4-8e5f-4ae4-8202-c897ea64a27c","year":2015},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-15T01:57:56.506162Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.347324Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:ed6c898bbfa9f47859dcbddec76a3d1934e7b781ec28d1c880bc35da84108332","observation_id":"2b2e2821-aa0f-491d-8f20-500d520096b7","resolution":{"observed_at":"2026-08-12T18:47:52.964100Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:51.352694Z","title":"Adversarial audio synthesis","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-15T01:57:56.506162Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.352694Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:174a1771153e1792719a990afeda271d31bff4de584f1064b12a843cb1fba6b3","observation_id":"76fcf08f-aaab-403a-9db2-d61b6e5653d0","resolution":{"observed_at":"2026-08-12T18:47:51.352694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.00768","last_updated":"2024-10-24T04:54:27Z","snapshot_observed_at":"2026-08-13T16:09:53.714749Z","submitted_at":"2022-04-02T05:28:48Z","title":"VQTTS: High-Fidelity Text-to-Speech Synthesis with Self-Supervised VQ Acoustic Feature","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.00768","snapshot_observed_at":"2026-08-12T18:47:51.357279Z","title":"Vqtts: High-fidelity text- to-speech synthesis with self-supervised vq acoustic feature","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-15T01:57:56.506162Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.357279Z"},"links":{"cited_paper":"/paper/2204.00768","citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:dc378aef436cfc2d1e93a05fba6cd38a88df5f30f72dc9e273384e371f464585","observation_id":"3a511ba9-fbc4-4dca-870e-1e75faf706da","resolution":{"observed_at":"2026-08-12T18:47:51.357279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:52.932311Z","title":"Apnet2: High-quality and high-efficiency neural vocoder with direct prediction of amplitude and phase spectra","venue":null,"work_id":"d0367a1c-21bd-49dd-a80a-76742568226a","year":2023},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-15T01:57:56.506162Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.363643Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:e2e5508acd74f6b5e1e3643aea4ea6a4566071c424b7ea910e7cfd25abe78a2c","observation_id":"ed038733-e9fb-42d2-b396-b4060d4c58c0","resolution":{"observed_at":"2026-08-12T18:47:52.937121Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:52.917141Z","title":"Generative adversarial nets","venue":null,"work_id":"10fe47f6-512b-4b3c-9b8d-414015e4d904","year":2014},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-15T01:57:56.506162Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.369873Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:5909e2da9a7f5d6765ac47278b643d955d147f3e45ddc7225661a08359cc5c1a","observation_id":"d6403e04-e83a-4a2c-992e-ab1a71551444","resolution":{"observed_at":"2026-08-12T18:47:52.921959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:52.900379Z","title":"Long short-term memory","venue":null,"work_id":"95d93099-4288-44c2-8978-2bf4f16e7d71","year":2012},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-15T01:57:56.506162Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.375651Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:fa06bdff296762d3834cc2729953802719f47bac8dab9d0a97fce132221457fe","observation_id":"c04a2b58-0840-49c9-b290-0f5e592b06a0","resolution":{"observed_at":"2026-08-12T18:47:52.905221Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:52.884496Z","title":"A spectral energy distance for parallel speech synthesis","venue":null,"work_id":"013c3a27-9e3f-43dc-ba06-9813d52cb777","year":2020},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-15T01:57:56.506162Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.381364Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:00279af5950cebae60d253e389b81eaa15e884c6d318bfefafeae330c2316d95","observation_id":"4865663c-5a24-4fed-8618-85e055c53f84","resolution":{"observed_at":"2026-08-12T18:47:52.889445Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.10887","last_updated":"2022-09-22T09:43:17Z","snapshot_observed_at":"2026-08-13T14:21:51.903254Z","submitted_at":"2022-09-22T09:43:17Z","title":"A Multi-Stage Multi-Codebook VQ-VAE Approach to High-Performance Neural TTS","version":1},"cited_work":{"arxiv_id":"2209.10887","doi":null,"metadata_source":"pith","pith_arxiv_id":"2209.10887","snapshot_observed_at":"2026-08-12T18:47:51.894840Z","title":"A Multi-Stage Multi-Codebook VQ-VAE Approach to High-Performance Neural TTS","venue":"cs.SD","work_id":"7653d5e6-eb2a-491a-947b-4bcece15f07a","year":2022},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-15T01:57:56.506162Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.386579Z"},"links":{"cited_paper":"/paper/2209.10887","citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:1fc3ba111a5e83a4b9302410124cba99234295b9024cfe44ea4009cdc1830952","observation_id":"c6074c2d-65be-49b0-aeb0-ebc65e1dcb41","resolution":{"observed_at":"2026-08-12T18:47:51.902113Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:51.393319Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-15T01:57:56.506162Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.393319Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:43e79797ded9c8827182976ca0e62e048f8fb3c9be4ca0ab1ccb299be41d3b3c","observation_id":"d03e39e0-be2c-4a5f-9454-7870c72894c8","resolution":{"observed_at":"2026-08-12T18:47:51.393319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:52.857058Z","title":"Gaussian error linear units (GELUs)","venue":null,"work_id":"0020718d-27da-48f1-906b-da179f822d18","year":2017},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-15T01:57:56.506162Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.398742Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:7311a70848a42728f16391dfe10539f6462eaf18ee0f80dea10332f93fa26199","observation_id":"55f6247c-120e-4e43-8e06-93bea41fbc63","resolution":{"observed_at":"2026-08-12T18:47:52.862310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:52.840159Z","title":"Hubert: Self-supervised speech repre- sentation learning by masked prediction of hidden units.IEEE/ACM Transactions on Audio, Speech, and Language Processing , 29:3451–3460, 2021","venue":null,"work_id":"a514f13a-2a54-4ea9-bf43-0ae00c912b48","year":2021},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-15T01:57:56.506162Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.403526Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:76fc2155a6bb354fd148775257079dd505d4b08b910acb87da47608d9ebc4b67","observation_id":"a225fc0b-6077-4c5f-9413-b594abc6ca26","resolution":{"observed_at":"2026-08-12T18:47:52.845446Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00169","last_updated":"2024-07-22T09:53:44Z","snapshot_observed_at":"2026-08-13T10:22:57.576596Z","submitted_at":"2023-08-31T23:26:10Z","title":"RepCodec: A Speech Representation Codec for Speech Tokenization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00169","snapshot_observed_at":"2026-08-12T18:47:51.409362Z","title":"Repcodec: A speech representation codec for speech tokenization.arXiv preprint arXiv:2309.00169 , 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-15T01:57:56.506162Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.409362Z"},"links":{"cited_paper":"/paper/2309.00169","citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:e78f185e5ace443ae7969d12cb23b0c3f892cbfe22cdbeb2662d762653983a43","observation_id":"220e17b8-b852-496c-9776-fb4f4a0d4001","resolution":{"observed_at":"2026-08-12T18:47:51.409362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:52.824912Z","title":"The LJ speech dataset","venue":null,"work_id":"e146cab4-d659-4ca4-80c0-6fe1aac016b7","year":2017},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-15T01:57:56.506162Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.414859Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:fd7ea57d4992cd265a0c06d0d42c4e6347c48661ff1100354ab37b0c3bd97188","observation_id":"194898d2-e1b8-4824-9575-de9a4ccab147","resolution":{"observed_at":"2026-08-12T18:47:52.829906Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:52.809632Z","title":"Univnet:Aneuralvocoder with multi-resolution spectrogram discriminators for high-fidelity waveform gener- ation","venue":null,"work_id":"c672d082-5a8b-49cb-8310-1c5b417968d9","year":2021},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-15T01:57:56.506162Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.419681Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:977c5bc2ef4426c1dda665689a38ccf841eb0ab4831b3c16c35da2b0422278ad","observation_id":"5843b434-5ecb-4fc7-91d5-ce407d34d7eb","resolution":{"observed_at":"2026-08-12T18:47:52.814549Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:52.793890Z","title":"GlotNet—a raw waveform model for the glottal excitation in statistical parametric speech synthesis","venue":null,"work_id":"d258c357-bc02-4691-9893-afdff3385222","year":2019},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-15T01:57:56.506162Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.425218Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:358ef0b6b0ba7cc13fe8d115d8dfe72a62e6bc2b7cd646721dd863c8a9dd2d26","observation_id":"0f21d5a1-6e49-49fc-a94a-538caa4c5177","resolution":{"observed_at":"2026-08-12T18:47:52.798943Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:52.777212Z","title":"iSTFTNet: Fast and lightweight mel-spectrogram vocoder incorporating inverse short-time Fourier transform","venue":null,"work_id":"21414bc8-9bbf-4e10-af70-d339d5dba09b","year":2022},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-15T01:57:56.506162Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.430599Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:675b1e0f864b99e6bde9146b34f8806ff0c1a8d04be890614124bfec86ca8e64","observation_id":"b4063528-f205-44e2-b288-744ca791cc66","resolution":{"observed_at":"2026-08-12T18:47:52.783108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:52.759704Z","title":null,"venue":null,"work_id":"30acca06-f5fb-42ec-9a3b-1dddda1000a5","year":1999},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-15T01:57:56.506162Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.437083Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:6f0b3a1138cfcc14e78d0a441ede6328490769595dc0b54ffabcf60da521d840","observation_id":"ccc19170-6be2-4ceb-8727-b9059f02950c","resolution":{"observed_at":"2026-08-12T18:47:52.764666Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:52.743008Z","title":"HiFi-GAN: Generative adver- sarial networks for efficient and high fidelity speech synthesis","venue":null,"work_id":"271cbd9b-57cc-474c-b309-3d6ecd7f702c","year":2020},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-15T01:57:56.506162Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.442900Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:1c55a08223eece0de748c4e4768f83d1a250956f37eca0503cd9fab481920798","observation_id":"499348de-367a-4e3d-b0c0-1b7306d3e7cb","resolution":{"observed_at":"2026-08-12T18:47:52.748534Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:52.726278Z","title":null,"venue":null,"work_id":"3b1c2dfa-ad64-4d69-9c14-83fa4b2bac2c","year":1986},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-15T01:57:56.506162Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.448372Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:f82fcbc9204d954c8ce43384a829abfbb1622ae376bb35b022d6513f9b6c35e0","observation_id":"a5ab773e-2581-48cb-a717-aa434258e7e0","resolution":{"observed_at":"2026-08-12T18:47:52.731393Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:52.710175Z","title":"MelGAN: generative adversarial networks for conditional waveform synthesis","venue":null,"work_id":"716f373c-136c-46f4-bd4b-66ace4484175","year":2019},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-15T01:57:56.506162Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.453836Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:795f643414f8b1365f9e35ce0121da73f39c14fd735fe56b1fa5a5a8de482fc0","observation_id":"4fdfc843-8109-4659-ab48-0fae4904b63d","resolution":{"observed_at":"2026-08-12T18:47:52.715308Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:52.694878Z","title":"PHASEAUG: A differentiable augmentation for speech synthesis to simulate one-to-many mapping","venue":null,"work_id":"d923c3f0-3de2-4e11-a11c-f16b815366bc","year":2023},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-15T01:57:56.506162Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.459021Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:46e6cd56f563fbef31a5e0b775f9cbe5c45e1363db0b307b79f4b615d113fe10","observation_id":"cce4f8fb-943f-431b-9f79-c3c1df243fa0","resolution":{"observed_at":"2026-08-12T18:47:52.699637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:52.678259Z","title":"Neural vocoder is all you need for speech super-resolution, 2022","venue":null,"work_id":"14f8e5b5-0862-4c27-9839-dda9b70bcbdd","year":2022},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-15T01:57:56.506162Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.464048Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:cc720a8df0b82e363f61473734d04764eb25af4dc5b66e964f3050b2742e3571","observation_id":"430f0ddd-fbfb-465c-921b-6aaaf1760bc2","resolution":{"observed_at":"2026-08-12T18:47:52.683429Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11972","last_updated":"2022-01-28T07:41:10Z","snapshot_observed_at":"2026-08-13T16:51:15.585651Z","submitted_at":"2022-01-28T07:41:10Z","title":"DiffGAN-TTS: High-Fidelity and Efficient Text-to-Speech with Denoising Diffusion GANs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.11972","snapshot_observed_at":"2026-08-12T18:47:51.471319Z","title":"Diffgan-tts: High-fidelity and efficient text- to-speech with denoising diffusion gans.arXiv preprint arXiv:2201.11972 , 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-15T01:57:56.506162Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.471319Z"},"links":{"cited_paper":"/paper/2201.11972","citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:42b6a2809846009dffcec021c82985ebd739f8fbbb9f88e2140b6ce7b9df50e8","observation_id":"7cc61c9e-f6aa-4b7b-bfcf-c4d1f4a034e3","resolution":{"observed_at":"2026-08-12T18:47:51.471319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:52.660697Z","title":"A convnet for the 2020s","venue":null,"work_id":"a5812eac-708f-4c8f-b5c0-af3b1d1e05ab","year":2022},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-15T01:57:56.506162Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.477762Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:6bdd93a5effde3ce5779dba7f7c096509ea69796c1d7199c27d074a1464a8748","observation_id":"bf4bcccb-b280-4870-ac60-957f1ff73308","resolution":{"observed_at":"2026-08-12T18:47:52.666050Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:52.644442Z","title":"Decoupled weight decay regularization","venue":null,"work_id":"678810ea-3a6c-4a2a-ba47-7f888918cb2b","year":2018},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-15T01:57:56.506162Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.483846Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:71fc6d5422265e1d1f49a7eba22c1b8ee31f57ae09f3d2435682a60757c806cb","observation_id":"2653fa72-aaf2-41f2-9b47-7d3f33b439a8","resolution":{"observed_at":"2026-08-12T18:47:52.649809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:52.626526Z","title":"Source-filter-based generative adversarial neural vocoder for high fidelity speech synthesis","venue":null,"work_id":"9a0bd4bb-89e2-4a84-a5e5-d3cfdec8022e","year":2022},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-15T01:57:56.506162Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.489915Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:4e68356bdbdd3d86b08534918635a25d7ef1a5bb463bafdf864259b7ef298d06","observation_id":"ec25e984-31ea-416e-a5ea-549839a9ae5b","resolution":{"observed_at":"2026-08-12T18:47:52.632295Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13686","last_updated":"2023-05-23T04:48:51Z","snapshot_observed_at":"2026-08-13T11:35:58.254748Z","submitted_at":"2023-05-23T04:48:51Z","title":"MP-SENet: A Speech Enhancement Model with Parallel Denoising of Magnitude and Phase Spectra","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13686","snapshot_observed_at":"2026-08-12T18:47:51.494938Z","title":"Mp-senet: A speech enhancement model with parallel denoising of magnitude and phase spectra","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-15T01:57:56.506162Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.494938Z"},"links":{"cited_paper":"/paper/2305.13686","citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:29188ddbb98a0a32077c923931f92cc90010f373993d5d9dcd5432396518fe31","observation_id":"8b4c81a1-b1bc-4688-99b2-95a34b50ec34","resolution":{"observed_at":"2026-08-12T18:47:51.494938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:52.609280Z","title":"Rectifier nonlinearities improve neural network acoustic models","venue":null,"work_id":"92691d5f-03ba-4171-99ba-5b5cbcb18afd","year":2013},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-15T01:57:56.506162Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.500806Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:d1251ec8b3e7950dff48321062f2268847eca31bd1c789b532e649fb025fa15e","observation_id":"c2e6fa0c-9703-4bbc-93e8-b54035ab2da8","resolution":{"observed_at":"2026-08-12T18:47:52.614586Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:52.593108Z","title":"SampleRNN: An unconditional end-to-end neural audio generation model","venue":null,"work_id":"f9366022-354c-444e-9b1f-7ec6d936c359","year":2016},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-15T01:57:56.506162Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.505578Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:208386fb57f61eb8b3f2d5a5fda1e42017b9fffd4121de2c37b17a7e0adc7bca","observation_id":"28320407-d618-4955-9d2c-260111eaf5c5","resolution":{"observed_at":"2026-08-12T18:47:52.598385Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:52.575446Z","title":"Finite scalar quantization: Vq-vae made simple","venue":null,"work_id":"e49cd39b-a3a3-464d-abaf-120248df63ef","year":2023},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-15T01:57:56.506162Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.510632Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:44d04486fe8437d70a26b79c789dfddd0221164f28cdbbc8582dde86d10eaa23","observation_id":"a8c7ddc5-5a83-458b-81dd-b176c47734f2","resolution":{"observed_at":"2026-08-12T18:47:52.580994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:52.556365Z","title":"WORLD: A vocoder-based high-quality speech synthesis system for real-time applications.IEICE Transac- tions on Information and Systems , 99(7):1877–1884, 2016","venue":null,"work_id":"9a646dcf-5071-4110-9f04-65b93fb0f27e","year":2016},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-15T01:57:56.506162Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.515933Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:6a02482c341d13780a775f0cb7b7cb2c8d60bcd44983b9239594edfc77a5ad03","observation_id":"c4024053-0c4c-4cc2-bc87-1602d3a5a2aa","resolution":{"observed_at":"2026-08-12T18:47:52.562869Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:52.536100Z","title":"Expediting tts synthesis with adversarial vocoding","venue":null,"work_id":"0e0316c9-bdb8-49f8-8818-2add74caf3a6","year":2019},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-15T01:57:56.506162Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.521474Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:ffeabd171ab13d7b67052256e6ff5537a77dec52a4084d4fa3d6248c2a8e6420","observation_id":"c421bbc6-cd07-49eb-b690-2329909c9f50","resolution":{"observed_at":"2026-08-12T18:47:52.542031Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.05725","last_updated":"2023-08-10T17:41:19Z","snapshot_observed_at":"2026-08-13T10:37:03.795815Z","submitted_at":"2023-08-10T17:41:19Z","title":"EXPRESSO: A Benchmark and Analysis of Discrete Expressive Speech Resynthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.05725","snapshot_observed_at":"2026-08-12T18:47:51.527155Z","title":"Ex- presso: A benchmark and analysis of discrete expressive speech resynthesis.arXiv preprint arXiv:2308.05725, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-15T01:57:56.506162Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.527155Z"},"links":{"cited_paper":"/paper/2308.05725","citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:6573e0b574c7b0e9a2049fbff6e688d488b1a7836af5269ff6bbc11055b70574","observation_id":"a2a8e21e-e2b5-44d8-babd-9337ca96c34f","resolution":{"observed_at":"2026-08-12T18:47:51.527155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:52.518106Z","title":"Parallel WaveNet: Fast high-fidelity speech synthesis","venue":null,"work_id":"38b92b74-f972-440b-84ee-a81c1a13452f","year":2018},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-15T01:57:56.506162Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.534346Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:ef39a53b968a453a033190c062cd69fd2709b9dd1cc52265801e5c273fb1510c","observation_id":"446f2159-383d-447f-9972-00152859cf80","resolution":{"observed_at":"2026-08-12T18:47:52.525246Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:52.501948Z","title":"WaveNet: A generative model for raw audio","venue":null,"work_id":"3999b8ef-3a78-435e-adab-e089448d4d51","year":2016},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-15T01:57:56.506162Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.540109Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:41e61a3502a97cfef58eb078e3817ac5a57403098cb5da670e1a3a9f10207492","observation_id":"846bffcc-0a1a-4ed1-8977-3dbd2776866c","resolution":{"observed_at":"2026-08-12T18:47:52.507049Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:52.484727Z","title":"Linear predictive coding","venue":null,"work_id":"8c3eef80-4a61-4cc6-8fb5-39b13043e80b","year":1988},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-15T01:57:56.506162Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.544982Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:82a1cbb48c605672a7307c2c30c719be45763ec7ab30b82c7e8aad24a09d8a30","observation_id":"f1ca97b6-c3cf-4cdf-9b5b-4aaeba487477","resolution":{"observed_at":"2026-08-12T18:47:52.489617Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:52.464835Z","title":"Generativeadversarialnetwork-basedapproachtosignal reconstruction from magnitude spectrogram","venue":null,"work_id":"ee295884-605c-4479-8922-7998ef69f9f4","year":2018},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-15T01:57:56.506162Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.549935Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:7dccc0578b53369a74bd8009896f0c375713a53fce69babf2c86fda85448c115","observation_id":"ee2e052b-9e6d-4b35-b7e3-f2e102498c0f","resolution":{"observed_at":"2026-08-12T18:47:52.472077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:52.446487Z","title":"Wave-gan: a deep learning approach for the prediction of nonlinear regular wave loads and run-up on a fixed cylinder.Coastal Engineering, 167:103902, 2021","venue":null,"work_id":"dc236f83-4295-431f-9204-988da29f4c52","year":2021},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-15T01:57:56.506162Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.554746Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:32cf54a3ddf334514bbf3b40ec1c78c874d27e0b76b9e2b3fb430bf22cde77ad","observation_id":"88d59813-fc92-40cf-8001-f5b6c91ff54a","resolution":{"observed_at":"2026-08-12T18:47:52.452183Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:52.423456Z","title":"ClariNet: Parallel wave generation in end-to-end text-to-speech","venue":null,"work_id":"f2137fef-4ca8-43d0-8a6d-3aac91406e7d","year":2018},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-15T01:57:56.506162Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.559532Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:ae98921e5457d6c1094e2d6e9438ed714e6b2dd532893ca39f59194c8bc19587","observation_id":"1cefcd94-0c6d-4474-bd30-1d4e6dffccf9","resolution":{"observed_at":"2026-08-12T18:47:52.433624Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:52.401118Z","title":"Waveflow: A compact flow- based model for raw audio","venue":null,"work_id":"99167fec-dbe9-43b5-8f5c-2c13adabbdd0","year":2020},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-15T01:57:56.506162Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.564487Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:b63ee01dbfb87997d685899d240909df87e760465bdbba65731e6e56694094f2","observation_id":"8e4a7480-60ac-4177-892d-27b0e8a90bbc","resolution":{"observed_at":"2026-08-12T18:47:52.406461Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:52.383452Z","title":"Waveglow: A flow-based gen- erative network for speech synthesis","venue":null,"work_id":"96c5142d-8149-4a0f-8b25-fef654739d6c","year":2019},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-15T01:57:56.506162Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.570862Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:d51916283afee480f70b2d4467d1a7a9841613a096d5b9ca83294955fc3d280c","observation_id":"a57b22a4-2418-4bee-8c32-e4bb6897a897","resolution":{"observed_at":"2026-08-12T18:47:52.389077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:52.367460Z","title":null,"venue":null,"work_id":"ff90cc1f-2c98-43b6-ba6c-575a91816f93","year":2007},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-15T01:57:56.506162Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.576285Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:8da370ee4dcbfc68d45ed838b390071f59ca5636fbca4407ed18048928851fd4","observation_id":"0ab47423-2800-45be-9f89-3af3eb931652","resolution":{"observed_at":"2026-08-12T18:47:52.372286Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:52.349950Z","title":"Fastspeech 2: Fast and high-quality end-to-end text to speech","venue":null,"work_id":"51940b21-d5c1-4d4b-8a00-adb120238aa5","year":2020},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-15T01:57:56.506162Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.582351Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:9433a57c5fc0b9ff8b4e017a9af096a0d67fa457e6a4d0d8d8aac036e2347eb6","observation_id":"4a9d6b56-0a72-4a98-acf0-3178a7d499ff","resolution":{"observed_at":"2026-08-12T18:47:52.356217Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:52.332932Z","title":"Fewer-token neural speech codec with time-invariant codes","venue":null,"work_id":"23bded05-fed8-4bb5-bfd0-5c491481480d","year":2024},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-15T01:57:56.506162Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.587468Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:d183ecd2a3b1660ac4b8d669a68f418104f5763231bff2484939663a3240b0d0","observation_id":"cce7f17d-e7df-428f-9ddd-745085f93a16","resolution":{"observed_at":"2026-08-12T18:47:52.338323Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:51.592094Z","title":"Utmos: Utokyo-sarulab system for voicemos challenge 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-15T01:57:56.506162Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.592094Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:02c2ce5e0132b885fbe7063b34d6ff83c9b165ed11bc0ce27fefdb13dc656890","observation_id":"f35e040f-1fb3-4a21-bda6-ba0a552839fb","resolution":{"observed_at":"2026-08-12T18:47:51.592094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:52.305666Z","title":"A toll quality 8 kb/s speech codec for the personal communications system (pcs).IEEE Transactions on Vehicular Technology, 43(3):808–816, 1994","venue":null,"work_id":"984260ad-92d0-442d-9100-2e280374dc66","year":1994},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-15T01:57:56.506162Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.597654Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:a0544dd521eee6d03a57237a372428659b628964d78bfe294bb51c9fcb8663f2","observation_id":"6d485cd0-18c6-4f42-be48-006957a13a47","resolution":{"observed_at":"2026-08-12T18:47:52.311192Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:52.289451Z","title":null,"venue":null,"work_id":"35c20509-c5b6-4c5e-93ef-95a785eace1b","year":2018},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-15T01:57:56.506162Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.603829Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:3f6f7230c43a22b3f232ad331b9656cfbdb0f1e84eede9709e3f8c48dd2ea969","observation_id":"ad724549-5b05-493f-a20e-c0f221caf14f","resolution":{"observed_at":"2026-08-12T18:47:52.294500Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00814","last_updated":"2024-05-29T14:21:47Z","snapshot_observed_at":"2026-08-13T11:27:10.322532Z","submitted_at":"2023-06-01T15:40:32Z","title":"Vocos: Closing the gap between time-domain and Fourier-based neural vocoders for high-quality audio synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.00814","snapshot_observed_at":"2026-08-12T18:47:51.609553Z","title":"Vocos: Closing the gap between time-domain and fourier-based neural vocoders for high-quality audio synthesis.arXiv preprint arXiv:2306.00814, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-15T01:57:56.506162Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.609553Z"},"links":{"cited_paper":"/paper/2306.00814","citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:15a1c42e61cd70b33bbae74ef590fb4764e18f3aa7162b9405382962e02599a1","observation_id":"223fd8ff-ccae-411d-ad3f-1723c05de0e4","resolution":{"observed_at":"2026-08-12T18:47:51.609553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:52.272478Z","title":"Linear predictive coding systems","venue":null,"work_id":"2df62705-cec1-40c4-89a6-56f00e001587","year":1976},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-15T01:57:56.506162Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.615331Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:a6d8d0153f383de91d9903eaed5f82a4068154ab03b26eec7289cbf049e9d0d8","observation_id":"d25f7265-a625-4703-a6c3-af82bb254f83","resolution":{"observed_at":"2026-08-12T18:47:52.277542Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:52.256227Z","title":"High- quality, low-delay music coding in the opus codec","venue":null,"work_id":"841c026b-f6ff-4072-80ec-a605a84d3b13","year":2013},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-15T01:57:56.506162Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.621588Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:ae892c4330dc63a441ae2741e0eaeb67a99eb9d78002790e39d4c24c8f6f6054","observation_id":"536dd418-5b3b-4fec-8080-3cb6b22ec255","resolution":{"observed_at":"2026-08-12T18:47:52.261629Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:52.237237Z","title":"LPCNet: Improving neural speech synthesis through linear prediction","venue":null,"work_id":"4da16504-3731-418e-b989-d61547b51d62","year":2019},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-15T01:57:56.506162Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.627258Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:d49d32c4fef66b5eb1be06290725f7eb3bfd94e153ffc64b5ba45e6c1723094b","observation_id":"455395df-d923-45ba-a8fc-d65ea5869f46","resolution":{"observed_at":"2026-08-12T18:47:52.242851Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:52.220908Z","title":"A review of vector quantization techniques","venue":null,"work_id":"89ce1cdb-f525-431c-8566-f0cb0cb62aa2","year":2006},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-15T01:57:56.506162Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.632471Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:cc850df85cdad4d63142821bc6c6df6988cc02875a37faa7f143f583104f9b67","observation_id":"5f834bf8-7453-4c3d-8c24-85198c114358","resolution":{"observed_at":"2026-08-12T18:47:52.226450Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-12T18:47:51.637690Z","title":"Neural codec lan- guage models are zero-shot text to speech synthesizers.(2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-15T01:57:56.506162Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.637690Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:6b27cc994f5d24fbcb1f459d6391b5973003c78370d766bbe71a88a789f1df41","observation_id":"165e37aa-c693-4d38-a038-f46bb45f28ad","resolution":{"observed_at":"2026-08-12T18:47:51.637690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:52.203542Z","title":"Neural source-filter-based wave- form model for statistical parametric speech synthesis","venue":null,"work_id":"9da307f3-0154-4c3b-91ea-ec789807194f","year":2019},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-15T01:57:56.506162Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.644418Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:3e8281dacfe78bbda843ff8e1c9879abc05cf76f52a74cb4ebead429b643b667","observation_id":"6da65fae-c7cc-433d-92dd-8627fff1668a","resolution":{"observed_at":"2026-08-12T18:47:52.209143Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:52.185251Z","title":"Tacotron: Towards end-to-end speech synthesis.Interspeech 2017, 2017","venue":null,"work_id":"f6648187-0d6d-4d2d-92ee-9501d887d1ab","year":2017},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-15T01:57:56.506162Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.650301Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:03c49b1dd7b97e6909167d3f2afb0dafe613023c381d645255bb3a76a3b258fc","observation_id":"88c238f5-05fd-4d7b-b651-67814202c71e","resolution":{"observed_at":"2026-08-12T18:47:52.191451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:52.166332Z","title":"Convnext v2: Co-designing and scaling convnets with masked autoencoders","venue":null,"work_id":"29f11669-18e1-4aa9-9bb4-e5ca71263ece","year":2023},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-15T01:57:56.506162Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.655870Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:9f53979de69b2090b83c40d0a104ae2f87ea4fb742d02ee7c31ba2a9408ed293","observation_id":"1bdeb114-39a5-4218-8e64-b04765d03778","resolution":{"observed_at":"2026-08-12T18:47:52.172141Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:52.148863Z","title":"Audiodec: An open-source streaming high-fidelity neural audio codec","venue":null,"work_id":"b137cb40-2e5b-45cc-a6ae-51dd8ab0d0e9","year":2023},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-15T01:57:56.506162Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.662140Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:ba540f2e0d0f4e93fb819920c1994f85580e92fda47cbc28cd13043a62ee5210","observation_id":"dac23bcf-ef23-4e67-8590-0c402b8028b5","resolution":{"observed_at":"2026-08-12T18:47:52.154250Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:52.001047Z","title":"Cstr vctk corpus: English multi-speaker corpus for cstr voice cloning toolkit (version 0.92)","venue":null,"work_id":"93335f45-dc71-4aa0-99c2-ec72280fb80c","year":2019},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-15T01:57:56.506162Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.668031Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:07fe3dfe3068e8c6b8152bb29872ec393c0e5fe0ba9ab5ead42882f56875ba7d","observation_id":"48aca32e-1094-499e-ad7a-dccea276c529","resolution":{"observed_at":"2026-08-12T18:47:52.136766Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.02765","last_updated":"2023-05-07T09:22:04Z","snapshot_observed_at":"2026-08-13T11:49:24.433450Z","submitted_at":"2023-05-04T12:11:13Z","title":"HiFi-Codec: Group-residual Vector quantization for High Fidelity Audio Codec","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.02765","snapshot_observed_at":"2026-08-12T18:47:51.673711Z","title":"Hifi-codec: Group-residual vector quantization for high fidelity audio codec","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-15T01:57:56.506162Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.673711Z"},"links":{"cited_paper":"/paper/2305.02765","citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:5a223c5a77d3cdbec7530858f32415655a1344648e5640655c53fdff44bfe8e0","observation_id":"eccdc361-0a0e-40e0-aae4-1271ce9acdc2","resolution":{"observed_at":"2026-08-12T18:47:51.673711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:51.983461Z","title":"Source-filter hifi-gan: Fast and pitch controllable high-fidelity neural vocoder","venue":null,"work_id":"f311553b-edf0-4eee-a193-306527fe33be","year":2023},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-15T01:57:56.506162Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.678726Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:bab51167960cac690b773700b1596f581b7095b9980fe2118f675a131f7c1c34","observation_id":"db58b2bc-4a36-4a1d-a59c-9283c5753b11","resolution":{"observed_at":"2026-08-12T18:47:51.989129Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:51.964934Z","title":"Soundstream: An end-to-end neural audio codec.IEEE/ACM Trans- actions on Audio, Speech, and Language Processing , 30:495–507, 2021","venue":null,"work_id":"59d9a4c2-2a03-496c-8f40-56bf208edebe","year":2021},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-15T01:57:56.506162Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.683963Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:92e53e3318ade1db566894718709679c0ac4a61b9907cfac597a8c94f3d72b53","observation_id":"e86c4863-6802-4197-ad1c-3619e1441c71","resolution":{"observed_at":"2026-08-12T18:47:51.970628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16692","last_updated":"2024-01-23T01:56:57Z","snapshot_observed_at":"2026-08-15T00:22:53.406062Z","submitted_at":"2023-08-31T12:53:09Z","title":"SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.16692","snapshot_observed_at":"2026-08-12T18:47:51.689848Z","title":"Speechtok- enizer: Unified speech tokenizer for speech large language models.arXiv preprint arXiv:2308.16692, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-15T01:57:56.506162Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.689848Z"},"links":{"cited_paper":"/paper/2308.16692","citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:4ba245a71a79259986ebed9423ba957cf29d4196629fcdc989f7dee6e8bb5c10","observation_id":"0a7a1dab-4a31-4b46-9b73-f62714c0ae11","resolution":{"observed_at":"2026-08-12T18:47:51.689848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-15T01:57:56.506162Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram"},"reference_resolution":{"displayed":73,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":19,"verified_exact":1,"verified_fuzzy":53},"total_outbound_references":73},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 73 of 73 outbound references and 0 inbound Pith citation observations for arXiv:2411.11258."}