{"as_of":"2026-08-08T12:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c2ce990f8defbe44f46aaeb52bd0892d0ea874b49893cf1eda1314315fa9599d","coverage":[{"denominator":48,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":48,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:03:09.237635Z","state":"measured"},{"denominator":49,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":49,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:03:09.067600Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T11:03:09.354907Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.03554","last_updated":"2025-06-04T04:18:15Z","snapshot_observed_at":"2026-08-07T12:15:15.073669Z","submitted_at":"2025-06-04T04:18:15Z","title":"Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments","version":1},"cited_work":{"arxiv_id":"2506.03554","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.03554","snapshot_observed_at":"2026-08-07T11:03:09.354907Z","title":"Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments","venue":"cs.SD","work_id":"c29092f4-e14d-413b-80ea-ff394476df06","year":2025},"citing_paper":{"arxiv_id":"2506.03554","last_updated":"2025-06-04T04:18:15Z","snapshot_observed_at":"2026-08-07T12:15:15.073669Z","submitted_at":"2025-06-04T04:18:15Z","title":"Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:09.067600Z"},"links":{"cited_paper":"/paper/2506.03554","citing_paper":"/paper/2506.03554"},"observation_digest":"sha256:a3b599459cadfe1bda9d40c72f1e9322f868ca2915abc73c45406433d54d1d0f","observation_id":"a8644e48-5651-4605-8c30-96adb3581fc6","resolution":{"observed_at":"2026-08-07T11:03:09.358217Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.03554/citation-record","integrity":"/paper/2506.03554/integrity","json":"/paper/2506.03554/citation-record.json","paper":"/paper/2506.03554"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:09.751330Z","title":"One key component of this progress is neural vocoders, which synthesize audio waveforms from acoustic fea- tures","venue":null,"work_id":"5083f74d-e3b9-4bd2-9d9c-d53443c2a5b2","year":null},"citing_paper":{"arxiv_id":"2506.03554","last_updated":"2025-06-04T04:18:15Z","snapshot_observed_at":"2026-08-07T12:15:15.073669Z","submitted_at":"2025-06-04T04:18:15Z","title":"Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:09.063905Z"},"links":{"citing_paper":"/paper/2506.03554"},"observation_digest":"sha256:548e2d286bb046fcd09eff7422a1a89ee72ade97f7bbcf2a9d6497564723509f","observation_id":"2efe9a14-4863-4878-84fe-2e09512cdfbe","resolution":{"observed_at":"2026-08-07T11:03:09.753919Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03554","last_updated":"2025-06-04T04:18:15Z","snapshot_observed_at":"2026-08-07T12:15:15.073669Z","submitted_at":"2025-06-04T04:18:15Z","title":"Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments","version":1},"cited_work":{"arxiv_id":"2506.03554","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.03554","snapshot_observed_at":"2026-08-07T11:03:09.354907Z","title":"Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments","venue":"cs.SD","work_id":"c29092f4-e14d-413b-80ea-ff394476df06","year":2025},"citing_paper":{"arxiv_id":"2506.03554","last_updated":"2025-06-04T04:18:15Z","snapshot_observed_at":"2026-08-07T12:15:15.073669Z","submitted_at":"2025-06-04T04:18:15Z","title":"Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:09.067600Z"},"links":{"cited_paper":"/paper/2506.03554","citing_paper":"/paper/2506.03554"},"observation_digest":"sha256:a3b599459cadfe1bda9d40c72f1e9322f868ca2915abc73c45406433d54d1d0f","observation_id":"a8644e48-5651-4605-8c30-96adb3581fc6","resolution":{"observed_at":"2026-08-07T11:03:09.358217Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:09.743692Z","title":"throughput We analyze the relationship between latency and throughput via block streaming synthesis using several neural vocoders","venue":null,"work_id":"334fbbe4-ba0d-4c96-84ca-e62684474ea0","year":null},"citing_paper":{"arxiv_id":"2506.03554","last_updated":"2025-06-04T04:18:15Z","snapshot_observed_at":"2026-08-07T12:15:15.073669Z","submitted_at":"2025-06-04T04:18:15Z","title":"Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:09.070559Z"},"links":{"citing_paper":"/paper/2506.03554"},"observation_digest":"sha256:d9c8fe1df1046259f5919ff918892db1bae2589fd78cb595b4172eb5f1b523c3","observation_id":"8c077676-0d9f-4557-8c55-2aa96aa17995","resolution":{"observed_at":"2026-08-07T11:03:09.747067Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:09.736145Z","title":"Wavehax and MS-Wavehax utilized F0 for generating prior signals, whereas other models concate- nate it with the mel-spectrogram, resulting in a 101-dimensional input feature","venue":null,"work_id":"73d7b77a-0bc0-4c60-8155-0064751d3042","year":null},"citing_paper":{"arxiv_id":"2506.03554","last_updated":"2025-06-04T04:18:15Z","snapshot_observed_at":"2026-08-07T12:15:15.073669Z","submitted_at":"2025-06-04T04:18:15Z","title":"Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:09.073128Z"},"links":{"citing_paper":"/paper/2506.03554"},"observation_digest":"sha256:db7622602c3c403996c5f2fe80e8bfdc107bcc32a562bb026c5223492f048fdf","observation_id":"b598b463-06d1-4f0e-8c14-9b8e05cc4152","resolution":{"observed_at":"2026-08-07T11:03:09.739379Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:09.728939Z","title":"Next, we evaluate its speech quality under causal and non-causal condi- tions, compared to the vocoders described in Section 3.1","venue":null,"work_id":"faa6916d-13af-42b4-83c1-bdb70fd41955","year":null},"citing_paper":{"arxiv_id":"2506.03554","last_updated":"2025-06-04T04:18:15Z","snapshot_observed_at":"2026-08-07T12:15:15.073669Z","submitted_at":"2025-06-04T04:18:15Z","title":"Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:09.075967Z"},"links":{"citing_paper":"/paper/2506.03554"},"observation_digest":"sha256:e823e48b1ba8538d022078ba10f172e0e461a97fc513b3729ea9ac161b2019ee","observation_id":"8a563839-47b6-4221-ad58-b0e62c571d16","resolution":{"observed_at":"2026-08-07T11:03:09.731975Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:09.700459Z","title":null,"venue":null,"work_id":"dae9c06f-cf91-4470-b564-89fd45c21f2c","year":null},"citing_paper":{"arxiv_id":"2506.03554","last_updated":"2025-06-04T04:18:15Z","snapshot_observed_at":"2026-08-07T12:15:15.073669Z","submitted_at":"2025-06-04T04:18:15Z","title":"Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:09.084068Z"},"links":{"citing_paper":"/paper/2506.03554"},"observation_digest":"sha256:222f084cf9a90765c7c2f0bf4e9b0ca94494e3b983d6edba62f46f159479ceed","observation_id":"494c870b-c8e6-48d0-ac85-86a610e4cf49","resolution":{"observed_at":"2026-08-07T11:03:09.704463Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:09.710136Z","title":"Our analysis revealed that streaming throughput de- pends on overhead from data and parameter loading as well as computational complexity","venue":null,"work_id":"74d121de-845e-4590-bd52-26962b66f601","year":null},"citing_paper":{"arxiv_id":"2506.03554","last_updated":"2025-06-04T04:18:15Z","snapshot_observed_at":"2026-08-07T12:15:15.073669Z","submitted_at":"2025-06-04T04:18:15Z","title":"Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:09.081498Z"},"links":{"citing_paper":"/paper/2506.03554"},"observation_digest":"sha256:614da706f1c6c4a4ec522a1f1cfbe588d454d22186458ba9471e4c03865d8f9e","observation_id":"13749803-0ece-4dba-907e-46532bc52575","resolution":{"observed_at":"2026-08-07T11:03:09.714250Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:09.690732Z","title":"Generative Ad- versarial Nets,","venue":null,"work_id":"312182f3-39fc-48f5-8aae-9bf41fda47aa","year":2014},"citing_paper":{"arxiv_id":"2506.03554","last_updated":"2025-06-04T04:18:15Z","snapshot_observed_at":"2026-08-07T12:15:15.073669Z","submitted_at":"2025-06-04T04:18:15Z","title":"Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:09.086457Z"},"links":{"citing_paper":"/paper/2506.03554"},"observation_digest":"sha256:df64dee72de345c1cd0c4a4c177bc4f9e8f089b815b6aafe331257abe2b436c4","observation_id":"740076dc-5257-4382-91a1-d16bf60bde88","resolution":{"observed_at":"2026-08-07T11:03:09.694699Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:09.681209Z","title":"MelGAN: Generative Adversarial Networks for Conditional Waveform Synthesis,","venue":null,"work_id":"c2e2e419-0405-43f8-ab3d-51ded6ba3c98","year":2019},"citing_paper":{"arxiv_id":"2506.03554","last_updated":"2025-06-04T04:18:15Z","snapshot_observed_at":"2026-08-07T12:15:15.073669Z","submitted_at":"2025-06-04T04:18:15Z","title":"Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:09.089020Z"},"links":{"citing_paper":"/paper/2506.03554"},"observation_digest":"sha256:e1f721217ea656ecb6c8a05c807f0e8a7c2baf1ab0fa8375cba9841c1a78bd11","observation_id":"1fa39c74-ec56-4793-a3e2-f68e742d76e0","resolution":{"observed_at":"2026-08-07T11:03:09.685081Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:09.671378Z","title":"HiFi-GAN: Generative Adversarial Networks for Efficient and High Fidelity Speech Synthesis,","venue":null,"work_id":"5fed0ffd-7de4-4d70-91c5-c19e92898006","year":2020},"citing_paper":{"arxiv_id":"2506.03554","last_updated":"2025-06-04T04:18:15Z","snapshot_observed_at":"2026-08-07T12:15:15.073669Z","submitted_at":"2025-06-04T04:18:15Z","title":"Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:09.091510Z"},"links":{"citing_paper":"/paper/2506.03554"},"observation_digest":"sha256:b8b83ae8ad6d3492fd7c9217a8764d3cdb6240352218a9ae332e4b4e49685f78","observation_id":"a7037021-c55d-4037-ae5e-bf7ddcf94ce2","resolution":{"observed_at":"2026-08-07T11:03:09.675221Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:09.660277Z","title":"iSTFTNet: Fast and Lightweight Mel-Spectrogram V ocoder Incorporating Inverse Short-Time Fourier Transform,","venue":null,"work_id":"ed9611dd-6253-43da-b3db-880a9f19c2ab","year":2022},"citing_paper":{"arxiv_id":"2506.03554","last_updated":"2025-06-04T04:18:15Z","snapshot_observed_at":"2026-08-07T12:15:15.073669Z","submitted_at":"2025-06-04T04:18:15Z","title":"Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:09.095332Z"},"links":{"citing_paper":"/paper/2506.03554"},"observation_digest":"sha256:25f379971e94cb26b031cbfde974859cf178f76605bd4b1c5bbf6a955f77b2a8","observation_id":"f31581db-3072-41f3-9d29-a576c8f35400","resolution":{"observed_at":"2026-08-07T11:03:09.664184Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:09.650286Z","title":"iSTFTNet2: Faster and More Lightweight iSTFT-Based Neural V ocoder Using 1D- 2D CNN,","venue":null,"work_id":"f49d5b3e-6d5e-43ad-a2cc-3355d4e49cab","year":2023},"citing_paper":{"arxiv_id":"2506.03554","last_updated":"2025-06-04T04:18:15Z","snapshot_observed_at":"2026-08-07T12:15:15.073669Z","submitted_at":"2025-06-04T04:18:15Z","title":"Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:09.098995Z"},"links":{"citing_paper":"/paper/2506.03554"},"observation_digest":"sha256:cc442949f9b1ed7d059d00dfeed0ca3fd2a41448dea8994aa327b9b6c88d2602","observation_id":"d080a97c-771d-4f78-a9d7-2ee0952f5583","resolution":{"observed_at":"2026-08-07T11:03:09.654149Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:09.640345Z","title":"APNet: An All-Frame-Level Neural V ocoder Incorporating Direct Prediction of Amplitude and Phase Spectra,","venue":null,"work_id":"93001a2b-8021-410f-8f04-167fc32086ee","year":2023},"citing_paper":{"arxiv_id":"2506.03554","last_updated":"2025-06-04T04:18:15Z","snapshot_observed_at":"2026-08-07T12:15:15.073669Z","submitted_at":"2025-06-04T04:18:15Z","title":"Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:09.102904Z"},"links":{"citing_paper":"/paper/2506.03554"},"observation_digest":"sha256:2ec52bc483430eef47117d01032453199b2be04ed45bfbfd73c8eaafe538a27c","observation_id":"8574965a-ee7c-4caa-b7cf-233f52f36f98","resolution":{"observed_at":"2026-08-07T11:03:09.644340Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:09.630706Z","title":"V ocos: Closing the gap between time-domain and Fourier-based neural vocoders for high-quality audio synthesis,","venue":null,"work_id":"106da819-9f35-47d1-999b-3262b8711d83","year":2024},"citing_paper":{"arxiv_id":"2506.03554","last_updated":"2025-06-04T04:18:15Z","snapshot_observed_at":"2026-08-07T12:15:15.073669Z","submitted_at":"2025-06-04T04:18:15Z","title":"Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:09.106552Z"},"links":{"citing_paper":"/paper/2506.03554"},"observation_digest":"sha256:55ad574a42e156832c56784ef1b1aae75dc8136a6fd23d0d8a87eef728127b3c","observation_id":"ba0011ed-c82a-492f-b77c-94be19529883","resolution":{"observed_at":"2026-08-07T11:03:09.634797Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:09.569978Z","title":"AC-VC: Non-Parallel Low La- tency Phonetic Posteriorgrams Based V oice Conversion,","venue":null,"work_id":"d45e298c-48b8-43e0-8742-33fe1602136f","year":2021},"citing_paper":{"arxiv_id":"2506.03554","last_updated":"2025-06-04T04:18:15Z","snapshot_observed_at":"2026-08-07T12:15:15.073669Z","submitted_at":"2025-06-04T04:18:15Z","title":"Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:09.140221Z"},"links":{"citing_paper":"/paper/2506.03554"},"observation_digest":"sha256:633207ddbb44a6aa281fe7a027f6e2b2bb5cb11234c1aae1dff6aff20a600104","observation_id":"05937b8d-3552-4d4a-97ab-122d250385ef","resolution":{"observed_at":"2026-08-07T11:03:09.574398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:09.620591Z","title":"Low-latency real-time non-parallel voice conversion based on cyclic variational autoencoder and multiband WaveRNN with data-driven linear prediction,","venue":null,"work_id":"e442a7e6-5c82-4a05-a31b-4c086fed6b4a","year":2021},"citing_paper":{"arxiv_id":"2506.03554","last_updated":"2025-06-04T04:18:15Z","snapshot_observed_at":"2026-08-07T12:15:15.073669Z","submitted_at":"2025-06-04T04:18:15Z","title":"Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:09.113880Z"},"links":{"citing_paper":"/paper/2506.03554"},"observation_digest":"sha256:440caf1821252b0041c97894e7a8be8feb81b1d4f92d816661e3b0f1848c2183","observation_id":"dcec3a08-34b7-45bf-a098-15219e497a6e","resolution":{"observed_at":"2026-08-07T11:03:09.625084Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:09.611310Z","title":"An Investigation of Streaming Non-Autoregressive sequence-to-sequence V oice Con- version,","venue":null,"work_id":"87c693f6-eedd-425a-8eac-327c460855cf","year":2022},"citing_paper":{"arxiv_id":"2506.03554","last_updated":"2025-06-04T04:18:15Z","snapshot_observed_at":"2026-08-07T12:15:15.073669Z","submitted_at":"2025-06-04T04:18:15Z","title":"Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:09.117576Z"},"links":{"citing_paper":"/paper/2506.03554"},"observation_digest":"sha256:ab2827f04d84abc2411ebe0fca1193b9264962fef0d197ebc7d1bc68241abce5","observation_id":"cad249c8-ffe8-45be-a510-2acefc71d38f","resolution":{"observed_at":"2026-08-07T11:03:09.615267Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.07288","last_updated":"2022-06-15T04:04:14Z","snapshot_observed_at":"2026-07-06T13:20:58.801332Z","submitted_at":"2022-06-15T04:04:14Z","title":"Streaming non-autoregressive model for any-to-many voice conversion","version":1},"cited_work":{"arxiv_id":"2206.07288","doi":null,"metadata_source":"pith","pith_arxiv_id":"2206.07288","snapshot_observed_at":"2026-08-07T11:03:09.339873Z","title":"Streaming non-autoregressive model for any-to-many voice conversion","venue":"cs.SD","work_id":"99f51134-bd20-48b0-9914-647d4adcf170","year":2022},"citing_paper":{"arxiv_id":"2506.03554","last_updated":"2025-06-04T04:18:15Z","snapshot_observed_at":"2026-08-07T12:15:15.073669Z","submitted_at":"2025-06-04T04:18:15Z","title":"Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:09.121069Z"},"links":{"cited_paper":"/paper/2206.07288","citing_paper":"/paper/2506.03554"},"observation_digest":"sha256:750fc0d0ac8aa2fdf441dd8a06258f3634656022611f4f16996b4e4c53465e54","observation_id":"6ed446e1-84ab-4cac-9979-056845733a0b","resolution":{"observed_at":"2026-08-07T11:03:09.347294Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:09.124691Z","title":"Wavehax: Aliasing-Free Neural Waveform Synthesis Based on 2D Convo- lution and Harmonic Prior for Reliable Complex Spectrogram Es- timation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03554","last_updated":"2025-06-04T04:18:15Z","snapshot_observed_at":"2026-08-07T12:15:15.073669Z","submitted_at":"2025-06-04T04:18:15Z","title":"Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:09.124691Z"},"links":{"citing_paper":"/paper/2506.03554"},"observation_digest":"sha256:464100a0f876a5ee59d1708dfa17f3672227f361046b6bf8acefe1300448f824","observation_id":"a06f59ae-1390-4505-ac30-b3f3a3e5baa3","resolution":{"observed_at":"2026-08-07T11:03:09.124691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:09.601785Z","title":"Multi-Stream HiFi-GAN with Data-Driven Waveform Decomposition,","venue":null,"work_id":"3130f8e1-22fe-46b4-b80c-c852d2804d8d","year":2021},"citing_paper":{"arxiv_id":"2506.03554","last_updated":"2025-06-04T04:18:15Z","snapshot_observed_at":"2026-08-07T12:15:15.073669Z","submitted_at":"2025-06-04T04:18:15Z","title":"Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:09.128505Z"},"links":{"citing_paper":"/paper/2506.03554"},"observation_digest":"sha256:231b64c810871a38014548e2f4a3d1787421266202bd766e4b770a2f066385d5","observation_id":"374ba3cc-00c5-42de-9e55-74dce93c86fe","resolution":{"observed_at":"2026-08-07T11:03:09.605762Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:09.591599Z","title":"Implementation of DNN-based real-time voice conversion and its improvements by audio data augmentation and mask-shaped device,","venue":null,"work_id":"090e4846-3cbf-4021-9c50-8163a733eb37","year":2019},"citing_paper":{"arxiv_id":"2506.03554","last_updated":"2025-06-04T04:18:15Z","snapshot_observed_at":"2026-08-07T12:15:15.073669Z","submitted_at":"2025-06-04T04:18:15Z","title":"Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:09.132327Z"},"links":{"citing_paper":"/paper/2506.03554"},"observation_digest":"sha256:36ba759be47262146b16939e639635fd1cd60c8618b5b43d92475df731690cde","observation_id":"6dd36464-7ac6-40f8-b187-9d9a403187c4","resolution":{"observed_at":"2026-08-07T11:03:09.595860Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:09.581421Z","title":"Real-Time, Full-Band, Online DNN-Based V oice Conversion System Using a Single CPU,","venue":null,"work_id":"457b88c1-68c9-4aad-9636-f58ccd74b119","year":2020},"citing_paper":{"arxiv_id":"2506.03554","last_updated":"2025-06-04T04:18:15Z","snapshot_observed_at":"2026-08-07T12:15:15.073669Z","submitted_at":"2025-06-04T04:18:15Z","title":"Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:09.136347Z"},"links":{"citing_paper":"/paper/2506.03554"},"observation_digest":"sha256:c2754c77010c17fa43deefbb321561db250086a3ccfd26f71a42713fcb54f4be","observation_id":"edb05948-0859-4b18-ab05-6af0f6f97abd","resolution":{"observed_at":"2026-08-07T11:03:09.585450Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:09.491859Z","title":"Fregrad: Lightweight and Fast Frequency-Aware Diffusion V ocoder,","venue":null,"work_id":"434d9543-b852-40a2-8b32-f5bab8279fee","year":2024},"citing_paper":{"arxiv_id":"2506.03554","last_updated":"2025-06-04T04:18:15Z","snapshot_observed_at":"2026-08-07T12:15:15.073669Z","submitted_at":"2025-06-04T04:18:15Z","title":"Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:09.169405Z"},"links":{"citing_paper":"/paper/2506.03554"},"observation_digest":"sha256:52e408b874a7894f732126f01e2ee1fc416ab940e27c0cac925964c59086e980","observation_id":"21d67325-1765-4f3a-ace1-81d526740d34","resolution":{"observed_at":"2026-08-07T11:03:09.495782Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:09.559725Z","title":"Incremental Text-to-Speech Syn- thesis with Prefix-to-Prefix Framework,","venue":null,"work_id":"aab3bf09-9f69-4d67-8751-1311c2a95331","year":2020},"citing_paper":{"arxiv_id":"2506.03554","last_updated":"2025-06-04T04:18:15Z","snapshot_observed_at":"2026-08-07T12:15:15.073669Z","submitted_at":"2025-06-04T04:18:15Z","title":"Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:09.144149Z"},"links":{"citing_paper":"/paper/2506.03554"},"observation_digest":"sha256:26973b30021ce4bfdd7213275ff48d7ebcf266a4e8bf0e10c2101bbc93db47c7","observation_id":"1e4c5a7c-83fe-45ba-8011-8ee975ddc3de","resolution":{"observed_at":"2026-08-07T11:03:09.563771Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:09.550049Z","title":"Neural iTTS: Toward Synthesizing Speech in Real-time with End-to-end Neural Text- to-Speech Framework,","venue":null,"work_id":"c6a0d403-af25-4352-bc22-9af2026b6338","year":2019},"citing_paper":{"arxiv_id":"2506.03554","last_updated":"2025-06-04T04:18:15Z","snapshot_observed_at":"2026-08-07T12:15:15.073669Z","submitted_at":"2025-06-04T04:18:15Z","title":"Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:09.147888Z"},"links":{"citing_paper":"/paper/2506.03554"},"observation_digest":"sha256:12789666eeed43d6d3470f2ef7c2453ad827681b1464f6c925a616dcf87c271b","observation_id":"6adba2ad-acc7-4c00-8f9e-fcfce809fe87","resolution":{"observed_at":"2026-08-07T11:03:09.554309Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:09.540014Z","title":"High Qual- ity Streaming Speech Synthesis with Low, Sentence-Length- Independent Latency,","venue":null,"work_id":"f47d29e5-d5c7-4cdc-967f-3e725e1e45e6","year":2020},"citing_paper":{"arxiv_id":"2506.03554","last_updated":"2025-06-04T04:18:15Z","snapshot_observed_at":"2026-08-07T12:15:15.073669Z","submitted_at":"2025-06-04T04:18:15Z","title":"Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:09.151384Z"},"links":{"citing_paper":"/paper/2506.03554"},"observation_digest":"sha256:8af69970d493bd47b24cc8ba1841bec85eb3d9a05c1de66acb49c0e97dafd02a","observation_id":"8cf19f83-7642-40c9-a31d-c81d3184e6f2","resolution":{"observed_at":"2026-08-07T11:03:09.544086Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:09.530749Z","title":"A ConvNet for the 2020s,","venue":null,"work_id":"7da78f2c-a22b-480f-acca-7fdd60d54286","year":2022},"citing_paper":{"arxiv_id":"2506.03554","last_updated":"2025-06-04T04:18:15Z","snapshot_observed_at":"2026-08-07T12:15:15.073669Z","submitted_at":"2025-06-04T04:18:15Z","title":"Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:09.155362Z"},"links":{"citing_paper":"/paper/2506.03554"},"observation_digest":"sha256:205d44d316b19c103a0ac138479889f26fa36653ec94c967f0e7022531c1abfc","observation_id":"f573e596-7e4c-4d92-942e-0198c6822814","resolution":{"observed_at":"2026-08-07T11:03:09.534826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:09.520956Z","title":"Design and evaluation of parallel quadrature mirror filters (PQMF),","venue":null,"work_id":"6886d0f5-ba7c-4f39-b674-e52fbcdcfce8","year":1983},"citing_paper":{"arxiv_id":"2506.03554","last_updated":"2025-06-04T04:18:15Z","snapshot_observed_at":"2026-08-07T12:15:15.073669Z","submitted_at":"2025-06-04T04:18:15Z","title":"Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:09.159040Z"},"links":{"citing_paper":"/paper/2506.03554"},"observation_digest":"sha256:831678dc07b042c6f7af72c03b496f214e0575b7529830bf57605b3aaa8a6c51","observation_id":"58d7f9f8-d176-4597-b13b-69bfbb865c2b","resolution":{"observed_at":"2026-08-07T11:03:09.524902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:09.510606Z","title":"Multi-band MelGAN: Faster Waveform Generation for High-Quality Text-to-Speech,","venue":null,"work_id":"7549a8cb-f9c2-4ebd-b571-8baf14bc96c4","year":2021},"citing_paper":{"arxiv_id":"2506.03554","last_updated":"2025-06-04T04:18:15Z","snapshot_observed_at":"2026-08-07T12:15:15.073669Z","submitted_at":"2025-06-04T04:18:15Z","title":"Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:09.162515Z"},"links":{"citing_paper":"/paper/2506.03554"},"observation_digest":"sha256:cbb59ceaf8a04f1ecb85d426ca12646266bfcb7e1139dd9ad5be0783b67f003a","observation_id":"79ddeef0-150f-4f4b-8d6b-192b688b8db6","resolution":{"observed_at":"2026-08-07T11:03:09.514584Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:09.500930Z","title":"Fre-GAN: Adversar- ial Frequency-Consistent Audio Synthesis,","venue":null,"work_id":"e6209eb7-c165-4729-978a-6a5e1f4560b2","year":2021},"citing_paper":{"arxiv_id":"2506.03554","last_updated":"2025-06-04T04:18:15Z","snapshot_observed_at":"2026-08-07T12:15:15.073669Z","submitted_at":"2025-06-04T04:18:15Z","title":"Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:09.165700Z"},"links":{"citing_paper":"/paper/2506.03554"},"observation_digest":"sha256:49c1fa4f1ca3d631974e8a80c93955b209a9d187ae69fe6292e10f3c2c924a71","observation_id":"4a2daaeb-b25f-4cfd-ae22-8b1c61441a2b","resolution":{"observed_at":"2026-08-07T11:03:09.505221Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:09.434670Z","title":"Harvest: A High-Performance Fundamental Fre- quency Estimator from Speech Signals,","venue":null,"work_id":"111ac268-6577-4310-bcc3-4153e611be07","year":2017},"citing_paper":{"arxiv_id":"2506.03554","last_updated":"2025-06-04T04:18:15Z","snapshot_observed_at":"2026-08-07T12:15:15.073669Z","submitted_at":"2025-06-04T04:18:15Z","title":"Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:09.202363Z"},"links":{"citing_paper":"/paper/2506.03554"},"observation_digest":"sha256:07d5bd40446c5f9a8155b28ba2e5126ab524ab7e0db4aad7b31f5e290f337565","observation_id":"6edea2f9-de32-41e3-b0d2-d48901f5b0bf","resolution":{"observed_at":"2026-08-07T11:03:09.438612Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:09.482121Z","title":"Perceptual evaluation of speech quality (PESQ)-a new method for speech quality assess- ment of telephone networks and codecs,","venue":null,"work_id":"2efc4218-fdf1-4718-b9fb-da41778f0fc0","year":2001},"citing_paper":{"arxiv_id":"2506.03554","last_updated":"2025-06-04T04:18:15Z","snapshot_observed_at":"2026-08-07T12:15:15.073669Z","submitted_at":"2025-06-04T04:18:15Z","title":"Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:09.175261Z"},"links":{"citing_paper":"/paper/2506.03554"},"observation_digest":"sha256:da82d67a621c95b7a2b6c860bba23480a356bad70b7e558288100e611a9a6eed","observation_id":"dbbbdaa0-e510-4d26-9275-092f49970bb8","resolution":{"observed_at":"2026-08-07T11:03:09.486771Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:09.472995Z","title":"UTMOS: UTokyo-SaruLab System for V oiceMOS Challenge 2022,","venue":null,"work_id":"70c746fd-7c3a-417b-9fc0-27184395b868","year":2022},"citing_paper":{"arxiv_id":"2506.03554","last_updated":"2025-06-04T04:18:15Z","snapshot_observed_at":"2026-08-07T12:15:15.073669Z","submitted_at":"2025-06-04T04:18:15Z","title":"Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:09.179126Z"},"links":{"citing_paper":"/paper/2506.03554"},"observation_digest":"sha256:0eccad2c1d239feb98f70c19e4beda6c2779c20f9b23e1a10d3649760e67ee00","observation_id":"d1992397-2144-459f-bdb1-fbcb3c816a92","resolution":{"observed_at":"2026-08-07T11:03:09.476818Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:09.463901Z","title":"Lightweight and High-Fidelity End-to-End Text-to-Speech with Multi-Band Generation and Inverse Short-Time Fourier Transform,","venue":null,"work_id":"ca76bf0f-6236-49b0-912a-ad5dadaae12b","year":2023},"citing_paper":{"arxiv_id":"2506.03554","last_updated":"2025-06-04T04:18:15Z","snapshot_observed_at":"2026-08-07T12:15:15.073669Z","submitted_at":"2025-06-04T04:18:15Z","title":"Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:09.183017Z"},"links":{"citing_paper":"/paper/2506.03554"},"observation_digest":"sha256:04631fca8aaa8120f513214731457bb7e91b674663790a9f93a72b420e00e9f4","observation_id":"4269562f-f098-431a-b358-b1c06ec36040","resolution":{"observed_at":"2026-08-07T11:03:09.467769Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:09.719702Z","title":"Aggregate","venue":null,"work_id":"99fb27ec-ccff-4ba4-95ec-7da2b469de09","year":null},"citing_paper":{"arxiv_id":"2506.03554","last_updated":"2025-06-04T04:18:15Z","snapshot_observed_at":"2026-08-07T12:15:15.073669Z","submitted_at":"2025-06-04T04:18:15Z","title":"Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:09.078818Z"},"links":{"citing_paper":"/paper/2506.03554"},"observation_digest":"sha256:e11e3248e2b4c8fd3d309d060774cda9fc720a791c210183b5a1c6d9e570a054","observation_id":"bfbb5934-af47-45e0-97ac-8b70ef0a9ed6","resolution":{"observed_at":"2026-08-07T11:03:09.723585Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:09.454298Z","title":"Developing Real-Time Stream- ing Transformer Transducer for Speech Recognition on Large- Scale Dataset,","venue":null,"work_id":"20535a4d-60d0-4d16-97f6-2526915c901b","year":2021},"citing_paper":{"arxiv_id":"2506.03554","last_updated":"2025-06-04T04:18:15Z","snapshot_observed_at":"2026-08-07T12:15:15.073669Z","submitted_at":"2025-06-04T04:18:15Z","title":"Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:09.186530Z"},"links":{"citing_paper":"/paper/2506.03554"},"observation_digest":"sha256:e9eebd93a7d928c094eb67c8065b874a6d2b3e07c6df649007aa464cbc4a684e","observation_id":"627f44c1-21ec-4db1-b577-10cc0ac60fb8","resolution":{"observed_at":"2026-08-07T11:03:09.458455Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1607.06450","last_updated":"2016-07-21T19:57:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-07-21T19:57:52Z","title":"Layer Normalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.06450","snapshot_observed_at":"2026-08-07T11:03:09.190271Z","title":"Layer Normalization,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.03554","last_updated":"2025-06-04T04:18:15Z","snapshot_observed_at":"2026-08-07T12:15:15.073669Z","submitted_at":"2025-06-04T04:18:15Z","title":"Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:09.190271Z"},"links":{"cited_paper":"/paper/1607.06450","citing_paper":"/paper/2506.03554"},"observation_digest":"sha256:9bff6a2c9d2dd62b74634d33a5ace37cc76a405a328cf017a180e3e479f5e9e8","observation_id":"de3f64f1-3a9d-4411-a7e0-03fffb896ebe","resolution":{"observed_at":"2026-08-07T11:03:09.190271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:09.444823Z","title":"Batch Normalization: Accelerating Deep Network Training by Reducing Internal Covariate Shift,","venue":null,"work_id":"4d4fcd99-f538-473b-8772-ceb496af06d7","year":2015},"citing_paper":{"arxiv_id":"2506.03554","last_updated":"2025-06-04T04:18:15Z","snapshot_observed_at":"2026-08-07T12:15:15.073669Z","submitted_at":"2025-06-04T04:18:15Z","title":"Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:09.194351Z"},"links":{"citing_paper":"/paper/2506.03554"},"observation_digest":"sha256:6b87fad0d1813761b547dec6d91ce6e8b56fdb47757791b497d4362278a4cc21","observation_id":"98d3165d-2e01-430b-a263-ff9dd63d3cf4","resolution":{"observed_at":"2026-08-07T11:03:09.448743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.06248","last_updated":"2019-08-17T06:04:46Z","snapshot_observed_at":"2026-08-04T18:00:26.763973Z","submitted_at":"2019-08-17T06:04:46Z","title":"JVS corpus: free Japanese multi-speaker voice corpus","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.06248","snapshot_observed_at":"2026-08-07T11:03:09.198316Z","title":"JVS corpus: free Japanese multi-speaker voice corpus,","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2506.03554","last_updated":"2025-06-04T04:18:15Z","snapshot_observed_at":"2026-08-07T12:15:15.073669Z","submitted_at":"2025-06-04T04:18:15Z","title":"Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:09.198316Z"},"links":{"cited_paper":"/paper/1908.06248","citing_paper":"/paper/2506.03554"},"observation_digest":"sha256:c14f80c110c2cbf0d3bc6ba4bb8127e61a471ebf6427ee830fb7a6ffa7c1fb5d","observation_id":"cd0c716b-1b79-40bb-9899-f87c7b297c54","resolution":{"observed_at":"2026-08-07T11:03:09.198316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:09.424676Z","title":"BigVGAN: A Universal Neural V ocoder with Large-Scale Training,","venue":null,"work_id":"a65e1954-8f37-436b-b9e0-d7227ba3319f","year":2023},"citing_paper":{"arxiv_id":"2506.03554","last_updated":"2025-06-04T04:18:15Z","snapshot_observed_at":"2026-08-07T12:15:15.073669Z","submitted_at":"2025-06-04T04:18:15Z","title":"Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:09.206313Z"},"links":{"citing_paper":"/paper/2506.03554"},"observation_digest":"sha256:7def01f63e3942b19cced718c31f5f52152104353eebb23df8eb759d290ff932","observation_id":"4b513dda-1176-4d8c-ab2c-e07f04eb3d9d","resolution":{"observed_at":"2026-08-07T11:03:09.428879Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:09.414800Z","title":"UnivNet: A Neural V ocoder with Multi-Resolution Spectrogram Discriminators for High-Fidelity Waveform Generation,","venue":null,"work_id":"54aef059-4f46-43d2-bfe8-b17a51dce3ad","year":2021},"citing_paper":{"arxiv_id":"2506.03554","last_updated":"2025-06-04T04:18:15Z","snapshot_observed_at":"2026-08-07T12:15:15.073669Z","submitted_at":"2025-06-04T04:18:15Z","title":"Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:09.210135Z"},"links":{"citing_paper":"/paper/2506.03554"},"observation_digest":"sha256:196bf4a254064be55fe5f95bcce1f2ce2c31851f6afdef091f4df0ce4341a48d","observation_id":"5128eaf3-493a-497b-9c95-2a6f70845f3a","resolution":{"observed_at":"2026-08-07T11:03:09.418774Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.00354","last_updated":"2017-10-28T05:28:01Z","snapshot_observed_at":"2026-08-07T12:14:00.547338Z","submitted_at":"2017-10-28T05:28:01Z","title":"JSUT corpus: free large-scale Japanese speech corpus for end-to-end speech synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.00354","snapshot_observed_at":"2026-08-07T11:03:09.213625Z","title":"JSUT corpus: free large-scale Japanese speech corpus for end-to-end speech synthe- sis,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.03554","last_updated":"2025-06-04T04:18:15Z","snapshot_observed_at":"2026-08-07T12:15:15.073669Z","submitted_at":"2025-06-04T04:18:15Z","title":"Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:09.213625Z"},"links":{"cited_paper":"/paper/1711.00354","citing_paper":"/paper/2506.03554"},"observation_digest":"sha256:d452d62250aed064e10a357e9018e721e90bd79dd1ea2750695adcadf2c44811","observation_id":"467c237e-279d-48b1-87dd-b5a5fb64ba68","resolution":{"observed_at":"2026-08-07T11:03:09.213625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:09.404880Z","title":"Matcha-TTS: A Fast TTS Architecture with Conditional Flow Matching,","venue":null,"work_id":"8e140e12-2396-453c-bde3-199631f8d204","year":2024},"citing_paper":{"arxiv_id":"2506.03554","last_updated":"2025-06-04T04:18:15Z","snapshot_observed_at":"2026-08-07T12:15:15.073669Z","submitted_at":"2025-06-04T04:18:15Z","title":"Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:09.217924Z"},"links":{"citing_paper":"/paper/2506.03554"},"observation_digest":"sha256:04aeb788f45a2898042dc8d7a77086ed419f143d2e8f66a429e1ec91b1d6ead9","observation_id":"9c145dd8-8aec-461c-b1cf-893d1d63cae1","resolution":{"observed_at":"2026-08-07T11:03:09.408771Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:09.397697Z","title":"Attention is All you Need,","venue":null,"work_id":"3b48dff0-3b98-4d7c-885c-a94172086e73","year":2017},"citing_paper":{"arxiv_id":"2506.03554","last_updated":"2025-06-04T04:18:15Z","snapshot_observed_at":"2026-08-07T12:15:15.073669Z","submitted_at":"2025-06-04T04:18:15Z","title":"Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:09.221656Z"},"links":{"citing_paper":"/paper/2506.03554"},"observation_digest":"sha256:fc3fd843dce8e154f0fd5167f5fbe981086c9911fdba9a9700c6056a73024eea","observation_id":"81d8bd2e-2a86-4167-b268-d0ff0e89b1a6","resolution":{"observed_at":"2026-08-07T11:03:09.400038Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:09.388619Z","title":"Flow Matching for Generative Modeling,","venue":null,"work_id":"13053606-bde8-4465-9e95-2818ebc1b7d3","year":2023},"citing_paper":{"arxiv_id":"2506.03554","last_updated":"2025-06-04T04:18:15Z","snapshot_observed_at":"2026-08-07T12:15:15.073669Z","submitted_at":"2025-06-04T04:18:15Z","title":"Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:09.225535Z"},"links":{"citing_paper":"/paper/2506.03554"},"observation_digest":"sha256:c4322eeeedefda80d536116584a31a4228488796c9ea85e839e05b996318952a","observation_id":"a7c8b92f-06ea-41dc-a53e-f2366fc7cbe3","resolution":{"observed_at":"2026-08-07T11:03:09.392214Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:09.379764Z","title":"Matcha-tts","venue":null,"work_id":"b9a9396a-1e62-4c88-8d3b-846462fedc25","year":null},"citing_paper":{"arxiv_id":"2506.03554","last_updated":"2025-06-04T04:18:15Z","snapshot_observed_at":"2026-08-07T12:15:15.073669Z","submitted_at":"2025-06-04T04:18:15Z","title":"Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:09.229084Z"},"links":{"citing_paper":"/paper/2506.03554"},"observation_digest":"sha256:f2da8e9fc829fd8d71fc9e507f70a8bd464c7a36cbccd609bdd2512ae36e6ac3","observation_id":"567c61dd-d2d7-4d1b-99f0-b6810a1a0687","resolution":{"observed_at":"2026-08-07T11:03:09.382954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:09.371208Z","title":"jsut-label","venue":null,"work_id":"5cc391fc-6316-4aaf-95c7-b25d2f295564","year":null},"citing_paper":{"arxiv_id":"2506.03554","last_updated":"2025-06-04T04:18:15Z","snapshot_observed_at":"2026-08-07T12:15:15.073669Z","submitted_at":"2025-06-04T04:18:15Z","title":"Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:09.232821Z"},"links":{"citing_paper":"/paper/2506.03554"},"observation_digest":"sha256:0b1d12463bd4601dd8a4870814cfc979c204763f85a7d267e116d7f346ccb8a6","observation_id":"7d0d27f3-920b-440a-b8bc-65fd66d3f718","resolution":{"observed_at":"2026-08-07T11:03:09.374466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:09.363001Z","title":"What the Future Brings: Investigating the Impact of Lookahead for Incremental Neural TTS,","venue":null,"work_id":"210cb04c-5ca7-4c5b-b4fa-c950aea868fc","year":2020},"citing_paper":{"arxiv_id":"2506.03554","last_updated":"2025-06-04T04:18:15Z","snapshot_observed_at":"2026-08-07T12:15:15.073669Z","submitted_at":"2025-06-04T04:18:15Z","title":"Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:09.237635Z"},"links":{"citing_paper":"/paper/2506.03554"},"observation_digest":"sha256:14695aad4f2ad2c55135135cf8ed00d4adc9023c6eea00735b8cc51e29ddce60","observation_id":"17222672-317a-478c-8678-94b2f5604230","resolution":{"observed_at":"2026-08-07T11:03:09.366129Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.03554","last_updated":"2025-06-04T04:18:15Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-07T12:15:15.073669Z","submitted_at":"2025-06-04T04:18:15Z","title":"Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments"},"reference_resolution":{"displayed":48,"state_counts":{"malformed_identifier":3,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":5,"verified_exact":2,"verified_fuzzy":38},"total_outbound_references":48},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 48 of 48 outbound references and 1 inbound Pith citation observation for arXiv:2506.03554."}