{"as_of":"2026-08-07T02:29:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:441f0f8a2493e09a168871377605056ec557def099b922aff5486f6e5e7fd0e7","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":25,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":25,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":25,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":25,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:30:35.396683Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":11,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2306.00814","last_updated":"2024-05-29T14:21:47Z","snapshot_observed_at":"2026-07-06T15:36:41.266003Z","submitted_at":"2023-06-01T15:40:32Z","title":"Vocos: Closing the gap between time-domain and Fourier-based neural vocoders for high-quality audio synthesis","version":3},"cited_work":{"arxiv_id":"2306.00814","doi":"10.48550/arxiv.2306.00814","metadata_source":"pith","pith_arxiv_id":"2306.00814","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Vocos: Closing the gap between time-domain and fourier-based neural vocoders for high-quality audio synthesis","venue":"cs.SD","work_id":"dfb28242-44a0-4f86-bb57-65dd1aae8947","year":2023},"citing_paper":{"arxiv_id":"2410.06885","last_updated":"2025-05-20T15:53:10Z","snapshot_observed_at":"2026-08-01T23:52:25.071174Z","submitted_at":"2024-10-09T13:46:34Z","title":"F5-TTS: A Fairytaler that Fakes Fluent and Faithful Speech with Flow Matching","version":3},"reference_index":140,"source":"arxiv_source","source_observed_at":"2026-05-16T06:06:41.348728Z"},"links":{"cited_paper":"/paper/2306.00814","citing_paper":"/paper/2410.06885"},"observation_digest":"sha256:64f4451b19a2dcab23678136bca3f0e3ac3c0be2413e4493b2f0e2f17854a6e9","observation_id":"a45dbe55-9889-4076-9708-b7e7239e9345","resolution":{"observed_at":"2026-05-16T06:06:41.521748Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00814","last_updated":"2024-05-29T14:21:47Z","snapshot_observed_at":"2026-07-06T15:36:41.266003Z","submitted_at":"2023-06-01T15:40:32Z","title":"Vocos: Closing the gap between time-domain and Fourier-based neural vocoders for high-quality audio synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.00814","snapshot_observed_at":"2026-08-07T00:30:35.396683Z","title":"V ocos: Closing the gap between time-domain and fourier-based neural vocoders for high-quality audio synthesis,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13709","last_updated":"2025-06-16T17:19:04Z","snapshot_observed_at":"2026-08-07T00:24:52.631170Z","submitted_at":"2025-06-16T17:19:04Z","title":"SpeechRefiner: Towards Perceptual Quality Refinement for Front-End Algorithms","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T00:30:35.396683Z"},"links":{"cited_paper":"/paper/2306.00814","citing_paper":"/paper/2506.13709"},"observation_digest":"sha256:68b21e5c9884d8a80ab478f7bb402891a3b513a6dfa2316211b8bbf77d2418af","observation_id":"513f7c56-5181-4066-ab7d-01fffc8e987d","resolution":{"observed_at":"2026-08-07T00:30:35.396683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00814","last_updated":"2024-05-29T14:21:47Z","snapshot_observed_at":"2026-07-06T15:36:41.266003Z","submitted_at":"2023-06-01T15:40:32Z","title":"Vocos: Closing the gap between time-domain and Fourier-based neural vocoders for high-quality audio synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.00814","snapshot_observed_at":"2026-08-06T21:51:35.862909Z","title":"V ocos: Closing the gap between time-domain and fourier-based neural vocoders for high-quality audio synthesis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23325","last_updated":"2025-07-09T17:40:35Z","snapshot_observed_at":"2026-08-06T21:43:27.652465Z","submitted_at":"2025-06-29T16:51:50Z","title":"XY-Tokenizer: Mitigating the Semantic-Acoustic Conflict in Low-Bitrate Speech Codecs","version":2},"reference_index":2001,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:35.862909Z"},"links":{"cited_paper":"/paper/2306.00814","citing_paper":"/paper/2506.23325"},"observation_digest":"sha256:6f69aa98bf403f7e30a153e66dc63ab74152f50ee396011a648bba04ed44d2d4","observation_id":"16507183-20b4-4104-8119-91ffd070184e","resolution":{"observed_at":"2026-08-06T21:51:35.862909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00814","last_updated":"2024-05-29T14:21:47Z","snapshot_observed_at":"2026-07-06T15:36:41.266003Z","submitted_at":"2023-06-01T15:40:32Z","title":"Vocos: Closing the gap between time-domain and Fourier-based neural vocoders for high-quality audio synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.00814","snapshot_observed_at":"2026-08-06T20:06:18.832332Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.03887","last_updated":"2025-07-05T03:59:17Z","snapshot_observed_at":"2026-08-06T19:57:56.309669Z","submitted_at":"2025-07-05T03:59:17Z","title":"Traceable TTS: Toward Watermark-Free TTS with Strong Traceability","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T20:06:18.832332Z"},"links":{"cited_paper":"/paper/2306.00814","citing_paper":"/paper/2507.03887"},"observation_digest":"sha256:3a38597e268bf6532ec77cc4715cfaec6dad8f8a8074b6736b2d289c6695709e","observation_id":"18874d1a-a21c-4683-8636-141d30755463","resolution":{"observed_at":"2026-08-06T20:06:18.832332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00814","last_updated":"2024-05-29T14:21:47Z","snapshot_observed_at":"2026-07-06T15:36:41.266003Z","submitted_at":"2023-06-01T15:40:32Z","title":"Vocos: Closing the gap between time-domain and Fourier-based neural vocoders for high-quality audio synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.00814","snapshot_observed_at":"2026-08-06T16:41:24.295671Z","title":"V ocos: Closing the gap between time-domain and fourier- based neural vocoders for high-quality audio synthesis,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-06T16:35:20.423512Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:24.295671Z"},"links":{"cited_paper":"/paper/2306.00814","citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:7adddaa36e76c17de78b2fe74527d1d18562ac8675bfc399cc24d1d365e795bc","observation_id":"5b2c4a59-bc6d-40f7-8ffb-889dc66184bc","resolution":{"observed_at":"2026-08-06T16:41:24.295671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00814","last_updated":"2024-05-29T14:21:47Z","snapshot_observed_at":"2026-07-06T15:36:41.266003Z","submitted_at":"2023-06-01T15:40:32Z","title":"Vocos: Closing the gap between time-domain and Fourier-based neural vocoders for high-quality audio synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.00814","snapshot_observed_at":"2026-08-06T15:48:22.435245Z","title":"V ocos: Closing the gap between time-domain and fourier-based neural vocoders for high-quality audio synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.14988","last_updated":"2025-07-20T14:48:48Z","snapshot_observed_at":"2026-08-06T20:34:40.446355Z","submitted_at":"2025-07-20T14:48:48Z","title":"DMOSpeech 2: Reinforcement Learning for Duration Prediction in Metric-Optimized Speech Synthesis","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:22.435245Z"},"links":{"cited_paper":"/paper/2306.00814","citing_paper":"/paper/2507.14988"},"observation_digest":"sha256:c15fa88931bdce6e588606c282cda33fa45e42f61ee70fc485acfdd1dd469aa4","observation_id":"676782b7-0ac9-4013-aa6c-2f897b0f37d4","resolution":{"observed_at":"2026-08-06T15:48:22.435245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00814","last_updated":"2024-05-29T14:21:47Z","snapshot_observed_at":"2026-07-06T15:36:41.266003Z","submitted_at":"2023-06-01T15:40:32Z","title":"Vocos: Closing the gap between time-domain and Fourier-based neural vocoders for high-quality audio synthesis","version":3},"cited_work":{"arxiv_id":"2306.00814","doi":"10.48550/arxiv.2306.00814","metadata_source":"pith","pith_arxiv_id":"2306.00814","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Vocos: Closing the gap between time-domain and fourier-based neural vocoders for high-quality audio synthesis","venue":"cs.SD","work_id":"dfb28242-44a0-4f86-bb57-65dd1aae8947","year":2023},"citing_paper":{"arxiv_id":"2509.24708","last_updated":"2026-04-05T03:27:11Z","snapshot_observed_at":"2026-08-04T09:40:49.585423Z","submitted_at":"2025-09-29T12:34:58Z","title":"SenSE: Semantic-Aware High-Fidelity Universal Speech Enhancement","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-18T12:35:19.023045Z"},"links":{"cited_paper":"/paper/2306.00814","citing_paper":"/paper/2509.24708"},"observation_digest":"sha256:bd2c532b4183b0ce6c9012ccaff1a1d2f3ea5b3becc4627d95384e1949cdbcfe","observation_id":"68a7a26e-2885-4c50-9e47-7653efdfdfa9","resolution":{"observed_at":"2026-05-18T12:36:22.339938Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00814","last_updated":"2024-05-29T14:21:47Z","snapshot_observed_at":"2026-07-06T15:36:41.266003Z","submitted_at":"2023-06-01T15:40:32Z","title":"Vocos: Closing the gap between time-domain and Fourier-based neural vocoders for high-quality audio synthesis","version":3},"cited_work":{"arxiv_id":"2306.00814","doi":"10.48550/arxiv.2306.00814","metadata_source":"pith","pith_arxiv_id":"2306.00814","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Vocos: Closing the gap between time-domain and fourier-based neural vocoders for high-quality audio synthesis","venue":"cs.SD","work_id":"dfb28242-44a0-4f86-bb57-65dd1aae8947","year":2023},"citing_paper":{"arxiv_id":"2512.01537","last_updated":"2026-05-18T17:15:31Z","snapshot_observed_at":"2026-07-06T22:37:26.652349Z","submitted_at":"2025-12-01T11:06:38Z","title":"Two-Dimensional Quantization for Geometry-Aware Audio Coding","version":3},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-05-21T18:16:51.486807Z"},"links":{"cited_paper":"/paper/2306.00814","citing_paper":"/paper/2512.01537"},"observation_digest":"sha256:fc4b407ef8f923a3a6e1972d749662fcb1fefc61833068880cf3546f217e4eb3","observation_id":"62936d30-161f-4588-b923-eb3c1dbe8c65","resolution":{"observed_at":"2026-05-21T18:20:29.314335Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00814","last_updated":"2024-05-29T14:21:47Z","snapshot_observed_at":"2026-07-06T15:36:41.266003Z","submitted_at":"2023-06-01T15:40:32Z","title":"Vocos: Closing the gap between time-domain and Fourier-based neural vocoders for high-quality audio synthesis","version":3},"cited_work":{"arxiv_id":"2306.00814","doi":"10.48550/arxiv.2306.00814","metadata_source":"pith","pith_arxiv_id":"2306.00814","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Vocos: Closing the gap between time-domain and fourier-based neural vocoders for high-quality audio synthesis","venue":"cs.SD","work_id":"dfb28242-44a0-4f86-bb57-65dd1aae8947","year":2023},"citing_paper":{"arxiv_id":"2604.01929","last_updated":"2026-04-29T10:54:09Z","snapshot_observed_at":"2026-07-06T22:51:40.181565Z","submitted_at":"2026-04-02T11:49:00Z","title":"Woosh: A Sound Effects Foundation Model","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-13T20:51:08.144573Z"},"links":{"cited_paper":"/paper/2306.00814","citing_paper":"/paper/2604.01929"},"observation_digest":"sha256:6130457c26ee6161a9c19faa86e1bc217a1f752252a9cfab0178d75afc5aa118","observation_id":"178320c8-2265-497d-8752-ec691fc40ac4","resolution":{"observed_at":"2026-05-13T20:53:15.813464Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00814","last_updated":"2024-05-29T14:21:47Z","snapshot_observed_at":"2026-07-06T15:36:41.266003Z","submitted_at":"2023-06-01T15:40:32Z","title":"Vocos: Closing the gap between time-domain and Fourier-based neural vocoders for high-quality audio synthesis","version":3},"cited_work":{"arxiv_id":"2306.00814","doi":"10.48550/arxiv.2306.00814","metadata_source":"pith","pith_arxiv_id":"2306.00814","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Vocos: Closing the gap between time-domain and fourier-based neural vocoders for high-quality audio synthesis","venue":"cs.SD","work_id":"dfb28242-44a0-4f86-bb57-65dd1aae8947","year":2023},"citing_paper":{"arxiv_id":"2604.14606","last_updated":"2026-07-20T08:55:18Z","snapshot_observed_at":"2026-08-07T02:25:30.629622Z","submitted_at":"2026-04-16T04:25:03Z","title":"UniPASE: A Generative Model for Universal Speech Enhancement with High Fidelity and Low Hallucinations","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-10T10:18:16.972414Z"},"links":{"cited_paper":"/paper/2306.00814","citing_paper":"/paper/2604.14606"},"observation_digest":"sha256:befcd1030cf42ef8f16ce3f13b6988f8bb4ab94e0ebaab15156a9ad19b0b81a2","observation_id":"a0c32f32-2706-4912-86a0-4f01aa865198","resolution":{"observed_at":"2026-05-10T10:19:19.976408Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00814","last_updated":"2024-05-29T14:21:47Z","snapshot_observed_at":"2026-07-06T15:36:41.266003Z","submitted_at":"2023-06-01T15:40:32Z","title":"Vocos: Closing the gap between time-domain and Fourier-based neural vocoders for high-quality audio synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.00814","snapshot_observed_at":"2026-08-02T16:16:37.406485Z","title":"V ocos: Closing the gap between time-domain and fourier- based neural vocoders for high-quality audio synthesis,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.14606","last_updated":"2026-07-20T08:55:18Z","snapshot_observed_at":"2026-08-07T02:25:30.629622Z","submitted_at":"2026-04-16T04:25:03Z","title":"UniPASE: A Generative Model for Universal Speech Enhancement with High Fidelity and Low Hallucinations","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T16:16:37.406485Z"},"links":{"cited_paper":"/paper/2306.00814","citing_paper":"/paper/2604.14606"},"observation_digest":"sha256:cd54dca536a4c13762d7ff8b444091b0c07ad34e3681a88504f3affcd195b18f","observation_id":"9a992810-63b1-45e6-81b4-95ddc09f16ff","resolution":{"observed_at":"2026-08-02T16:16:37.406485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00814","last_updated":"2024-05-29T14:21:47Z","snapshot_observed_at":"2026-07-06T15:36:41.266003Z","submitted_at":"2023-06-01T15:40:32Z","title":"Vocos: Closing the gap between time-domain and Fourier-based neural vocoders for high-quality audio synthesis","version":3},"cited_work":{"arxiv_id":"2306.00814","doi":"10.48550/arxiv.2306.00814","metadata_source":"pith","pith_arxiv_id":"2306.00814","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Vocos: Closing the gap between time-domain and fourier-based neural vocoders for high-quality audio synthesis","venue":"cs.SD","work_id":"dfb28242-44a0-4f86-bb57-65dd1aae8947","year":2023},"citing_paper":{"arxiv_id":"2606.03455","last_updated":"2026-06-02T10:33:20Z","snapshot_observed_at":"2026-08-05T18:48:21.902772Z","submitted_at":"2026-06-02T10:33:20Z","title":"WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-06-28T08:18:42.002083Z"},"links":{"cited_paper":"/paper/2306.00814","citing_paper":"/paper/2606.03455"},"observation_digest":"sha256:348b563af993f83273ae394880317c753c3bc351efc93b8e24436bd409e6ebc1","observation_id":"311e960d-e47a-4882-9ac5-9415515192ac","resolution":{"observed_at":"2026-07-02T05:16:39.843462Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00814","last_updated":"2024-05-29T14:21:47Z","snapshot_observed_at":"2026-07-06T15:36:41.266003Z","submitted_at":"2023-06-01T15:40:32Z","title":"Vocos: Closing the gap between time-domain and Fourier-based neural vocoders for high-quality audio synthesis","version":3},"cited_work":{"arxiv_id":"2306.00814","doi":"10.48550/arxiv.2306.00814","metadata_source":"pith","pith_arxiv_id":"2306.00814","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Vocos: Closing the gap between time-domain and fourier-based neural vocoders for high-quality audio synthesis","venue":"cs.SD","work_id":"dfb28242-44a0-4f86-bb57-65dd1aae8947","year":2023},"citing_paper":{"arxiv_id":"2606.09048","last_updated":"2026-06-08T05:36:42Z","snapshot_observed_at":"2026-07-06T23:48:26.076260Z","submitted_at":"2026-06-08T05:36:42Z","title":"BareWave: Waveform-Native Flow-Matching Text-to-Speech","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-27T15:14:03.681833Z"},"links":{"cited_paper":"/paper/2306.00814","citing_paper":"/paper/2606.09048"},"observation_digest":"sha256:05f1cc57073415c7cad363b0b8f4e1cf9c40c9f0f44b5ca00ed265086a35e20f","observation_id":"648201a4-36d9-4773-a494-e62e2afccb2f","resolution":{"observed_at":"2026-07-03T03:37:35.201518Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00814","last_updated":"2024-05-29T14:21:47Z","snapshot_observed_at":"2026-07-06T15:36:41.266003Z","submitted_at":"2023-06-01T15:40:32Z","title":"Vocos: Closing the gap between time-domain and Fourier-based neural vocoders for high-quality audio synthesis","version":3},"cited_work":{"arxiv_id":"2306.00814","doi":"10.48550/arxiv.2306.00814","metadata_source":"pith","pith_arxiv_id":"2306.00814","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Vocos: Closing the gap between time-domain and fourier-based neural vocoders for high-quality audio synthesis","venue":"cs.SD","work_id":"dfb28242-44a0-4f86-bb57-65dd1aae8947","year":2023},"citing_paper":{"arxiv_id":"2606.11219","last_updated":"2026-05-11T20:27:40Z","snapshot_observed_at":"2026-08-05T20:46:41.277498Z","submitted_at":"2026-05-11T20:27:40Z","title":"Afrispeech Semantics: Evaluating Audio Semantic Reasoning in Spoken Language Models Across Domains and Accents","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-06-30T22:11:44.891731Z"},"links":{"cited_paper":"/paper/2306.00814","citing_paper":"/paper/2606.11219"},"observation_digest":"sha256:d6b4f94aeee0b3156457e333304b57c2728f9462e4f7b075e734cca254df7212","observation_id":"99123b19-0579-4663-b5b5-e39575b762bb","resolution":{"observed_at":"2026-06-30T22:15:05.635697Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00814","last_updated":"2024-05-29T14:21:47Z","snapshot_observed_at":"2026-07-06T15:36:41.266003Z","submitted_at":"2023-06-01T15:40:32Z","title":"Vocos: Closing the gap between time-domain and Fourier-based neural vocoders for high-quality audio synthesis","version":3},"cited_work":{"arxiv_id":"2306.00814","doi":"10.48550/arxiv.2306.00814","metadata_source":"pith","pith_arxiv_id":"2306.00814","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Vocos: Closing the gap between time-domain and fourier-based neural vocoders for high-quality audio synthesis","venue":"cs.SD","work_id":"dfb28242-44a0-4f86-bb57-65dd1aae8947","year":2023},"citing_paper":{"arxiv_id":"2606.11611","last_updated":"2026-06-10T03:23:21Z","snapshot_observed_at":"2026-08-02T19:31:55.030656Z","submitted_at":"2026-06-10T03:23:21Z","title":"SARA: A Dual-Stream VAE for High-Fidelity Speech Generation via Integrating Semantic and Acoustic Representations","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-27T08:38:51.371500Z"},"links":{"cited_paper":"/paper/2306.00814","citing_paper":"/paper/2606.11611"},"observation_digest":"sha256:781fda16b99d3c4e445d7d950d4f3b6a9ddfaa5e131a25f82a0b73c5f5f7efee","observation_id":"6c09b5b2-5213-461a-bda2-ccf89aa39fb3","resolution":{"observed_at":"2026-07-03T12:58:08.358364Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00814","last_updated":"2024-05-29T14:21:47Z","snapshot_observed_at":"2026-07-06T15:36:41.266003Z","submitted_at":"2023-06-01T15:40:32Z","title":"Vocos: Closing the gap between time-domain and Fourier-based neural vocoders for high-quality audio synthesis","version":3},"cited_work":{"arxiv_id":"2306.00814","doi":"10.48550/arxiv.2306.00814","metadata_source":"pith","pith_arxiv_id":"2306.00814","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Vocos: Closing the gap between time-domain and fourier-based neural vocoders for high-quality audio synthesis","venue":"cs.SD","work_id":"dfb28242-44a0-4f86-bb57-65dd1aae8947","year":2023},"citing_paper":{"arxiv_id":"2606.17806","last_updated":"2026-06-16T11:28:29Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:28:29Z","title":"PhASE-Flow: Phonetic-Conditioned Acoustic Flow Matching in SSL Representation Domain for Speech Enhancement","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-26T23:05:08.894347Z"},"links":{"cited_paper":"/paper/2306.00814","citing_paper":"/paper/2606.17806"},"observation_digest":"sha256:d03b5b93e8a792c036bfcc763713ca3aee77df0fb987bb0ded4625bef0638841","observation_id":"8dec23c5-03d7-4633-a10e-3d92de0d2bad","resolution":{"observed_at":"2026-07-03T23:09:00.912005Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00814","last_updated":"2024-05-29T14:21:47Z","snapshot_observed_at":"2026-07-06T15:36:41.266003Z","submitted_at":"2023-06-01T15:40:32Z","title":"Vocos: Closing the gap between time-domain and Fourier-based neural vocoders for high-quality audio synthesis","version":3},"cited_work":{"arxiv_id":"2306.00814","doi":"10.48550/arxiv.2306.00814","metadata_source":"pith","pith_arxiv_id":"2306.00814","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Vocos: Closing the gap between time-domain and fourier-based neural vocoders for high-quality audio synthesis","venue":"cs.SD","work_id":"dfb28242-44a0-4f86-bb57-65dd1aae8947","year":2023},"citing_paper":{"arxiv_id":"2606.21372","last_updated":"2026-06-19T12:24:49Z","snapshot_observed_at":"2026-08-01T15:59:11.712537Z","submitted_at":"2026-06-19T12:24:49Z","title":"NAC: Neural Action Codec for Vision-Language-Action Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-26T13:59:53.484305Z"},"links":{"cited_paper":"/paper/2306.00814","citing_paper":"/paper/2606.21372"},"observation_digest":"sha256:f29cac8c881b534ad2e85e2795f4d05c0806a3527025d638989a0f4081648719","observation_id":"432d4ae4-8932-40ba-b173-96e958d3901b","resolution":{"observed_at":"2026-07-04T06:59:37.890291Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00814","last_updated":"2024-05-29T14:21:47Z","snapshot_observed_at":"2026-07-06T15:36:41.266003Z","submitted_at":"2023-06-01T15:40:32Z","title":"Vocos: Closing the gap between time-domain and Fourier-based neural vocoders for high-quality audio synthesis","version":3},"cited_work":{"arxiv_id":"2306.00814","doi":"10.48550/arxiv.2306.00814","metadata_source":"pith","pith_arxiv_id":"2306.00814","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Vocos: Closing the gap between time-domain and fourier-based neural vocoders for high-quality audio synthesis","venue":"cs.SD","work_id":"dfb28242-44a0-4f86-bb57-65dd1aae8947","year":2023},"citing_paper":{"arxiv_id":"2606.23176","last_updated":"2026-06-22T11:14:22Z","snapshot_observed_at":"2026-07-06T23:57:57.606047Z","submitted_at":"2026-06-22T11:14:22Z","title":"Synthesizing the Lombard Effect: Multi-Level Control of Speech Clarity and Vocal Effort in TTS","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-26T06:49:45.405554Z"},"links":{"cited_paper":"/paper/2306.00814","citing_paper":"/paper/2606.23176"},"observation_digest":"sha256:fee30641c065ba61f58d4fd20252bc6f05c5337e6f8f1bc7f0372dc28dcea2a1","observation_id":"662649d3-2a3e-464e-aed4-30e1c9418328","resolution":{"observed_at":"2026-07-04T12:29:51.743004Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00814","last_updated":"2024-05-29T14:21:47Z","snapshot_observed_at":"2026-07-06T15:36:41.266003Z","submitted_at":"2023-06-01T15:40:32Z","title":"Vocos: Closing the gap between time-domain and Fourier-based neural vocoders for high-quality audio synthesis","version":3},"cited_work":{"arxiv_id":"2306.00814","doi":"10.48550/arxiv.2306.00814","metadata_source":"pith","pith_arxiv_id":"2306.00814","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Vocos: Closing the gap between time-domain and fourier-based neural vocoders for high-quality audio synthesis","venue":"cs.SD","work_id":"dfb28242-44a0-4f86-bb57-65dd1aae8947","year":2023},"citing_paper":{"arxiv_id":"2606.23190","last_updated":"2026-07-08T11:35:21Z","snapshot_observed_at":"2026-08-01T13:42:52.335393Z","submitted_at":"2026-06-22T11:37:45Z","title":"FlowTTS-GRPO: Online Reinforcement Learning with Multi-Objective Reward Optimization for Flow-Matching Based Text-to-Speech","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-26T07:02:36.499424Z"},"links":{"cited_paper":"/paper/2306.00814","citing_paper":"/paper/2606.23190"},"observation_digest":"sha256:9eb61db98b353d061e9a808858335772299c35528a1545f950a8252778f4476d","observation_id":"cd3727ec-abf2-4b56-94b8-836d6b00c7f6","resolution":{"observed_at":"2026-07-04T12:19:49.654721Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00814","last_updated":"2024-05-29T14:21:47Z","snapshot_observed_at":"2026-07-06T15:36:41.266003Z","submitted_at":"2023-06-01T15:40:32Z","title":"Vocos: Closing the gap between time-domain and Fourier-based neural vocoders for high-quality audio synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.00814","snapshot_observed_at":"2026-07-12T12:44:20.831164Z","title":"V ocos: Closing the gap between time-domain and fourier-based neural vocoders for high-quality audio synthesis,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.23190","last_updated":"2026-07-08T11:35:21Z","snapshot_observed_at":"2026-08-01T13:42:52.335393Z","submitted_at":"2026-06-22T11:37:45Z","title":"FlowTTS-GRPO: Online Reinforcement Learning with Multi-Objective Reward Optimization for Flow-Matching Based Text-to-Speech","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-12T12:44:20.831164Z"},"links":{"cited_paper":"/paper/2306.00814","citing_paper":"/paper/2606.23190"},"observation_digest":"sha256:175293d1b9b37f7c8a6334c71ea4bf9c64b429c08b1a755b8764cccb831af2d1","observation_id":"4c3a6dcd-7094-4446-ad5e-af2b5c4292ab","resolution":{"observed_at":"2026-07-12T12:44:20.831164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00814","last_updated":"2024-05-29T14:21:47Z","snapshot_observed_at":"2026-07-06T15:36:41.266003Z","submitted_at":"2023-06-01T15:40:32Z","title":"Vocos: Closing the gap between time-domain and Fourier-based neural vocoders for high-quality audio synthesis","version":3},"cited_work":{"arxiv_id":"2306.00814","doi":"10.48550/arxiv.2306.00814","metadata_source":"pith","pith_arxiv_id":"2306.00814","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Vocos: Closing the gap between time-domain and fourier-based neural vocoders for high-quality audio synthesis","venue":"cs.SD","work_id":"dfb28242-44a0-4f86-bb57-65dd1aae8947","year":2023},"citing_paper":{"arxiv_id":"2606.31247","last_updated":"2026-06-30T07:24:10Z","snapshot_observed_at":"2026-07-07T00:04:58.486133Z","submitted_at":"2026-06-30T07:24:10Z","title":"FlexiSLM: A Dynamic and Controllable Frame Rate Spoken Language Model","version":1},"reference_index":116,"source":"arxiv_source","source_observed_at":"2026-07-01T03:50:26.873406Z"},"links":{"cited_paper":"/paper/2306.00814","citing_paper":"/paper/2606.31247"},"observation_digest":"sha256:88ec376b9d3f00353d5235416a79a1b6cf7c4e4fa28ff1a3012f8ce659324c85","observation_id":"3d2018f4-9fdd-48aa-9fc2-f2f9f6ddbafc","resolution":{"observed_at":"2026-07-01T11:55:42.189973Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00814","last_updated":"2024-05-29T14:21:47Z","snapshot_observed_at":"2026-07-06T15:36:41.266003Z","submitted_at":"2023-06-01T15:40:32Z","title":"Vocos: Closing the gap between time-domain and Fourier-based neural vocoders for high-quality audio synthesis","version":3},"cited_work":{"arxiv_id":"2306.00814","doi":"10.48550/arxiv.2306.00814","metadata_source":"pith","pith_arxiv_id":"2306.00814","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Vocos: Closing the gap between time-domain and fourier-based neural vocoders for high-quality audio synthesis","venue":"cs.SD","work_id":"dfb28242-44a0-4f86-bb57-65dd1aae8947","year":2023},"citing_paper":{"arxiv_id":"2607.05196","last_updated":"2026-07-07T15:36:48Z","snapshot_observed_at":"2026-07-11T07:46:45.098798Z","submitted_at":"2026-07-06T15:11:57Z","title":"Unified Audio Intelligence Without Regressing on Text Intelligence","version":1},"reference_index":167,"source":"arxiv_source","source_observed_at":"2026-07-07T23:59:38.702609Z"},"links":{"cited_paper":"/paper/2306.00814","citing_paper":"/paper/2607.05196"},"observation_digest":"sha256:4a1c713ef58f542c9f6a83a63820436536292b652a76be90a1b632fb3cc0087f","observation_id":"898e4653-2033-4961-a5d5-9e5126652721","resolution":{"observed_at":"2026-07-08T00:04:22.674104Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00814","last_updated":"2024-05-29T14:21:47Z","snapshot_observed_at":"2026-07-06T15:36:41.266003Z","submitted_at":"2023-06-01T15:40:32Z","title":"Vocos: Closing the gap between time-domain and Fourier-based neural vocoders for high-quality audio synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.00814","snapshot_observed_at":"2026-07-11T07:46:49.059192Z","title":"arXiv preprint arXiv:2306.00814 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05196","last_updated":"2026-07-07T15:36:48Z","snapshot_observed_at":"2026-07-11T07:46:45.098798Z","submitted_at":"2026-07-06T15:11:57Z","title":"Unified Audio Intelligence Without Regressing on Text Intelligence","version":2},"reference_index":167,"source":"arxiv_source","source_observed_at":"2026-07-11T07:46:49.059192Z"},"links":{"cited_paper":"/paper/2306.00814","citing_paper":"/paper/2607.05196"},"observation_digest":"sha256:eba3e67f2e53e49d91db950dacbf81af2c81ece081ebdc0a636f7413a13272d4","observation_id":"824fa72a-15bd-48fd-ae54-090373c1d9e3","resolution":{"observed_at":"2026-07-11T07:46:49.059192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00814","last_updated":"2024-05-29T14:21:47Z","snapshot_observed_at":"2026-07-06T15:36:41.266003Z","submitted_at":"2023-06-01T15:40:32Z","title":"Vocos: Closing the gap between time-domain and Fourier-based neural vocoders for high-quality audio synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.00814","snapshot_observed_at":"2026-08-02T06:31:32.258567Z","title":"V ocos: Closing the gap between time-domain and fourier-based neural vocoders for high-quality audio synthesis,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.12496","last_updated":"2026-07-15T05:26:04Z","snapshot_observed_at":"2026-08-06T04:10:43.064264Z","submitted_at":"2026-07-14T08:28:48Z","title":"ZipL-Dialog: Memory-Efficient Long-Form Spoken Dialog Synthesis via Latent Flow Matching","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T06:31:32.258567Z"},"links":{"cited_paper":"/paper/2306.00814","citing_paper":"/paper/2607.12496"},"observation_digest":"sha256:c5c281d436451d72a3e395905188c82918e49bd9ba534d62d96505b849f95403","observation_id":"cf042f65-49d9-4778-b6aa-65d59d4f3b99","resolution":{"observed_at":"2026-08-02T06:31:32.258567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00814","last_updated":"2024-05-29T14:21:47Z","snapshot_observed_at":"2026-07-06T15:36:41.266003Z","submitted_at":"2023-06-01T15:40:32Z","title":"Vocos: Closing the gap between time-domain and Fourier-based neural vocoders for high-quality audio synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.00814","snapshot_observed_at":"2026-08-01T18:46:14.038134Z","title":"Vocos: Closing the gap between time-domain and fourier-based neural vocoders for high-quality audio synthesis.arXiv preprint arXiv:2306.00814, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.18662","last_updated":"2026-07-19T11:20:25Z","snapshot_observed_at":"2026-08-06T18:14:48.659162Z","submitted_at":"2026-07-19T11:20:25Z","title":"Staged Depth-Pruning Distillation of a Flow-Matching Text-to-Speech Teacher: A Compact Hindi Speech Synthesizer","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T18:46:14.038134Z"},"links":{"cited_paper":"/paper/2306.00814","citing_paper":"/paper/2607.18662"},"observation_digest":"sha256:79f661da77772f4646b0bf3ac5d68bda0338485d9abc6ccec439f2ab5ce85f69","observation_id":"4922feff-a1cd-4b7e-97b4-377f7cebfe07","resolution":{"observed_at":"2026-08-01T18:46:14.038134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2306.00814/citation-record","integrity":"/paper/2306.00814/integrity","json":"/paper/2306.00814/citation-record.json","paper":"/paper/2306.00814"},"outbound":[],"paper":{"arxiv_id":"2306.00814","last_updated":"2024-05-29T14:21:47Z","latest_version":3,"primary_category":"cs.SD","snapshot_observed_at":"2026-07-06T15:36:41.266003Z","submitted_at":"2023-06-01T15:40:32Z","title":"Vocos: Closing the gap between time-domain and Fourier-based neural vocoders for high-quality audio synthesis"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 25 inbound Pith citation observations for arXiv:2306.00814."}