{"as_of":"2026-08-20T10:31:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3045b0c8ae78de96bff0df1b3fe95a94ee3b8762a055d5963d2e73ef7b14f049","coverage":[{"denominator":38,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T18:09:51.065507Z","state":"measured"},{"denominator":39,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":39,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T18:09:50.397590Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2607.24323","last_updated":"2026-07-27T12:02:42Z","snapshot_observed_at":"2026-08-02T15:15:31.811108Z","submitted_at":"2026-07-27T12:02:42Z","title":"Revisiting Vocos: That Phasiness Business in Time-Frequency Neural Vocoding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.24323","snapshot_observed_at":"2026-07-31T18:09:50.397590Z","title":"Input representation We use 80-band log mel spectrograms (for the frequency range 0– 8 kHz) as input, at a sampling rate of 22.05 kHz","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.24323","last_updated":"2026-07-27T12:02:42Z","snapshot_observed_at":"2026-08-02T15:15:31.811108Z","submitted_at":"2026-07-27T12:02:42Z","title":"Revisiting Vocos: That Phasiness Business in Time-Frequency Neural Vocoding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-31T18:09:50.397590Z"},"links":{"cited_paper":"/paper/2607.24323","citing_paper":"/paper/2607.24323"},"observation_digest":"sha256:f8dc8e4c025ed7ed022c081b77f734828f1116cc2611537871d5aab17be39d84","observation_id":"5209250e-d653-46fc-af09-d8351e72b7f4","resolution":{"observed_at":"2026-07-31T18:09:50.397590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2607.24323/citation-record","integrity":"/paper/2607.24323/integrity","json":"/paper/2607.24323/citation-record.json","paper":"/paper/2607.24323"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T18:09:50.346265Z","title":"They play a key role in speech synthesis, such as in voice conversion and speaker anonymization systems [1, 2]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24323","last_updated":"2026-07-27T12:02:42Z","snapshot_observed_at":"2026-08-02T15:15:31.811108Z","submitted_at":"2026-07-27T12:02:42Z","title":"Revisiting Vocos: That Phasiness Business in Time-Frequency Neural Vocoding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-31T18:09:50.346265Z"},"links":{"citing_paper":"/paper/2607.24323"},"observation_digest":"sha256:23a6867397a025848e64b87544383218260ff479260d8ce78e8e36fae7dcdc14","observation_id":"bbabebf4-d898-42b9-9f15-9da5b725c5d8","resolution":{"observed_at":"2026-07-31T18:09:50.346265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.24323","last_updated":"2026-07-27T12:02:42Z","snapshot_observed_at":"2026-08-02T15:15:31.811108Z","submitted_at":"2026-07-27T12:02:42Z","title":"Revisiting Vocos: That Phasiness Business in Time-Frequency Neural Vocoding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.24323","snapshot_observed_at":"2026-07-31T18:09:50.397590Z","title":"Input representation We use 80-band log mel spectrograms (for the frequency range 0– 8 kHz) as input, at a sampling rate of 22.05 kHz","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.24323","last_updated":"2026-07-27T12:02:42Z","snapshot_observed_at":"2026-08-02T15:15:31.811108Z","submitted_at":"2026-07-27T12:02:42Z","title":"Revisiting Vocos: That Phasiness Business in Time-Frequency Neural Vocoding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-31T18:09:50.397590Z"},"links":{"cited_paper":"/paper/2607.24323","citing_paper":"/paper/2607.24323"},"observation_digest":"sha256:f8dc8e4c025ed7ed022c081b77f734828f1116cc2611537871d5aab17be39d84","observation_id":"5209250e-d653-46fc-af09-d8351e72b7f4","resolution":{"observed_at":"2026-07-31T18:09:50.397590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T18:09:50.479550Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24323","last_updated":"2026-07-27T12:02:42Z","snapshot_observed_at":"2026-08-02T15:15:31.811108Z","submitted_at":"2026-07-27T12:02:42Z","title":"Revisiting Vocos: That Phasiness Business in Time-Frequency Neural Vocoding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-31T18:09:50.479550Z"},"links":{"citing_paper":"/paper/2607.24323"},"observation_digest":"sha256:0c1c04bdfc9690df63894538a53dd30aa394bfb98ec25c59e9f6aca9e3237154","observation_id":"791c9053-d405-4802-bc8b-82343483a2b2","resolution":{"observed_at":"2026-07-31T18:09:50.479550Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T18:09:50.539665Z","title":"Datasets For our trainings, we used LibriTTS [27] subsets (train-clean-100, train-clean-360, train-other-500), similar to BigVGAN and V ocos [3, 6]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24323","last_updated":"2026-07-27T12:02:42Z","snapshot_observed_at":"2026-08-02T15:15:31.811108Z","submitted_at":"2026-07-27T12:02:42Z","title":"Revisiting Vocos: That Phasiness Business in Time-Frequency Neural Vocoding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-31T18:09:50.539665Z"},"links":{"citing_paper":"/paper/2607.24323"},"observation_digest":"sha256:a60431b5778a7f345870794b051746fbed1ffca397e655047d448c947ead2dc5","observation_id":"ce1e616f-4106-4413-9e82-7d366c67e624","resolution":{"observed_at":"2026-07-31T18:09:50.539665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T18:09:50.623116Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24323","last_updated":"2026-07-27T12:02:42Z","snapshot_observed_at":"2026-08-02T15:15:31.811108Z","submitted_at":"2026-07-27T12:02:42Z","title":"Revisiting Vocos: That Phasiness Business in Time-Frequency Neural Vocoding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-31T18:09:50.623116Z"},"links":{"citing_paper":"/paper/2607.24323"},"observation_digest":"sha256:bc1e9456a86e263eeb75e4de75915c5e6a81538e8f317e6dbd645efd3dc00003","observation_id":"1ee9fef3-de81-488e-938c-df9434ac0d40","resolution":{"observed_at":"2026-07-31T18:09:50.623116Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T18:09:50.710272Z","title":"The results, reported in the bot- tom rows of Table 2, highlight that V ocos-Mag outperforms almost any other experiment in this paper, while V ocos-Phase performs the worst","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24323","last_updated":"2026-07-27T12:02:42Z","snapshot_observed_at":"2026-08-02T15:15:31.811108Z","submitted_at":"2026-07-27T12:02:42Z","title":"Revisiting Vocos: That Phasiness Business in Time-Frequency Neural Vocoding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-31T18:09:50.710272Z"},"links":{"citing_paper":"/paper/2607.24323"},"observation_digest":"sha256:9779140cecea669a2d09cfec4619ed0271b0cec99c6aabb4b849b860953a6aa2","observation_id":"c1127f58-7893-4fae-a8a2-a35440b356ea","resolution":{"observed_at":"2026-07-31T18:09:50.710272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T18:09:50.807124Z","title":"not a bug, but a feature","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24323","last_updated":"2026-07-27T12:02:42Z","snapshot_observed_at":"2026-08-02T15:15:31.811108Z","submitted_at":"2026-07-27T12:02:42Z","title":"Revisiting Vocos: That Phasiness Business in Time-Frequency Neural Vocoding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-31T18:09:50.807124Z"},"links":{"citing_paper":"/paper/2607.24323"},"observation_digest":"sha256:ab568b4d5227332b1bfb2782291adfc3a4273ed3a1a9fa0a86492f8abd5f4159","observation_id":"cecb3492-20c5-4563-bab3-63cc8fc908ea","resolution":{"observed_at":"2026-07-31T18:09:50.807124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T18:09:50.888769Z","title":"How should we extract discrete audio tokens from self-supervised models?","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24323","last_updated":"2026-07-27T12:02:42Z","snapshot_observed_at":"2026-08-02T15:15:31.811108Z","submitted_at":"2026-07-27T12:02:42Z","title":"Revisiting Vocos: That Phasiness Business in Time-Frequency Neural Vocoding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-31T18:09:50.888769Z"},"links":{"citing_paper":"/paper/2607.24323"},"observation_digest":"sha256:6342b3dccabeadc2a1d854b25b77dea2955e42bb19cd5284bc9fbf65b2536c3f","observation_id":"1584c7a9-6c23-419f-9d5d-381ebbd1f827","resolution":{"observed_at":"2026-07-31T18:09:50.888769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T18:09:50.957953Z","title":"Why disentanglement- based speaker anonymization systems fail at preserving emo- tions?","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24323","last_updated":"2026-07-27T12:02:42Z","snapshot_observed_at":"2026-08-02T15:15:31.811108Z","submitted_at":"2026-07-27T12:02:42Z","title":"Revisiting Vocos: That Phasiness Business in Time-Frequency Neural Vocoding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-31T18:09:50.957953Z"},"links":{"citing_paper":"/paper/2607.24323"},"observation_digest":"sha256:b5fd203b71f2c0698223094dd8229336639a0101002cf62ec87dd038737a06e3","observation_id":"b555ceaf-201f-4734-b28b-b27adff4f809","resolution":{"observed_at":"2026-07-31T18:09:50.957953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T18:09:50.962206Z","title":"BigVGAN: A universal neural vocoder with large-scale training,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24323","last_updated":"2026-07-27T12:02:42Z","snapshot_observed_at":"2026-08-02T15:15:31.811108Z","submitted_at":"2026-07-27T12:02:42Z","title":"Revisiting Vocos: That Phasiness Business in Time-Frequency Neural Vocoding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-31T18:09:50.962206Z"},"links":{"citing_paper":"/paper/2607.24323"},"observation_digest":"sha256:532efaa435ebe0475af5649e2f1c7b8404ac52a64d1816d773dc469e35b996df","observation_id":"9469bfd7-1a98-4415-864e-7155575e51cb","resolution":{"observed_at":"2026-07-31T18:09:50.962206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T18:09:50.966452Z","title":"A streamwise GAN vocoder for wideband speech coding at very low bit rate,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.24323","last_updated":"2026-07-27T12:02:42Z","snapshot_observed_at":"2026-08-02T15:15:31.811108Z","submitted_at":"2026-07-27T12:02:42Z","title":"Revisiting Vocos: That Phasiness Business in Time-Frequency Neural Vocoding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-31T18:09:50.966452Z"},"links":{"citing_paper":"/paper/2607.24323"},"observation_digest":"sha256:927ae9d920719a3c6378a48cefb9f04b199e860d7f074c27a5870052f74f7cf0","observation_id":"3f7cf53c-aad0-4b93-9dba-affa46b3ca30","resolution":{"observed_at":"2026-07-31T18:09:50.966452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T18:09:50.970491Z","title":"Lightweight and high-fidelity end-to-end text-to-speech with multi-band generation and inverse short-time Fourier transform,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24323","last_updated":"2026-07-27T12:02:42Z","snapshot_observed_at":"2026-08-02T15:15:31.811108Z","submitted_at":"2026-07-27T12:02:42Z","title":"Revisiting Vocos: That Phasiness Business in Time-Frequency Neural Vocoding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-31T18:09:50.970491Z"},"links":{"citing_paper":"/paper/2607.24323"},"observation_digest":"sha256:3c2a65991688306dde500f398113a2c241852087701f2d64e2048b8af55f3eac","observation_id":"d18aa35e-2e41-4ff3-a5a9-c41c87a47778","resolution":{"observed_at":"2026-07-31T18:09:50.970491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T18:09:50.974999Z","title":"V ocos: Closing the gap between time-domain and Fourier-based neural vocoders for high-quality audio synthesis,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24323","last_updated":"2026-07-27T12:02:42Z","snapshot_observed_at":"2026-08-02T15:15:31.811108Z","submitted_at":"2026-07-27T12:02:42Z","title":"Revisiting Vocos: That Phasiness Business in Time-Frequency Neural Vocoding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-31T18:09:50.974999Z"},"links":{"citing_paper":"/paper/2607.24323"},"observation_digest":"sha256:ba156153fb2417709ae883fcdb2162c0652cad00fae113188e8f3500af78af23","observation_id":"5a3ba894-b7d9-4001-ae47-bdd82ce0a65f","resolution":{"observed_at":"2026-07-31T18:09:50.974999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T18:09:50.978461Z","title":"WaveNeXt: ConvNeXt-based fast neural vocoder without ISTFT layer,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24323","last_updated":"2026-07-27T12:02:42Z","snapshot_observed_at":"2026-08-02T15:15:31.811108Z","submitted_at":"2026-07-27T12:02:42Z","title":"Revisiting Vocos: That Phasiness Business in Time-Frequency Neural Vocoding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-31T18:09:50.978461Z"},"links":{"citing_paper":"/paper/2607.24323"},"observation_digest":"sha256:3ba854f513c330b4138ec955e77da0eb97c74b9cf7bb919b52667617b2985216","observation_id":"e07aa6db-3cc1-4121-a499-82213eb85c95","resolution":{"observed_at":"2026-07-31T18:09:50.978461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T18:09:50.982225Z","title":"Phase-vocoder: About this phasi- ness business,","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2607.24323","last_updated":"2026-07-27T12:02:42Z","snapshot_observed_at":"2026-08-02T15:15:31.811108Z","submitted_at":"2026-07-27T12:02:42Z","title":"Revisiting Vocos: That Phasiness Business in Time-Frequency Neural Vocoding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-31T18:09:50.982225Z"},"links":{"citing_paper":"/paper/2607.24323"},"observation_digest":"sha256:3e3055de4de5143b0a3b21434d8355769e19dbe1d2bd5b69ef67b6174746a0df","observation_id":"ae61b670-08f2-4623-ad5d-4210f1ac1738","resolution":{"observed_at":"2026-07-31T18:09:50.982225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T18:09:50.985679Z","title":"Chunked autoregressive GAN for condi- tional waveform synthesis,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.24323","last_updated":"2026-07-27T12:02:42Z","snapshot_observed_at":"2026-08-02T15:15:31.811108Z","submitted_at":"2026-07-27T12:02:42Z","title":"Revisiting Vocos: That Phasiness Business in Time-Frequency Neural Vocoding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-31T18:09:50.985679Z"},"links":{"citing_paper":"/paper/2607.24323"},"observation_digest":"sha256:023438549b260ebe37c78f409f21f2396e7946c449e0fcebf92503cbe57c0d42","observation_id":"23a6fed3-26cd-4808-9446-a17f063b6b0d","resolution":{"observed_at":"2026-07-31T18:09:50.985679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T18:09:50.989107Z","title":"Wavehax: Aliasing-free neural waveform synthesis based on 2d convolution and harmonic prior for reliable complex spectrogram estimation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24323","last_updated":"2026-07-27T12:02:42Z","snapshot_observed_at":"2026-08-02T15:15:31.811108Z","submitted_at":"2026-07-27T12:02:42Z","title":"Revisiting Vocos: That Phasiness Business in Time-Frequency Neural Vocoding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-31T18:09:50.989107Z"},"links":{"citing_paper":"/paper/2607.24323"},"observation_digest":"sha256:9c1ef8a0d05f08d9a68de9dcd7edf3e40cf9e76f4adf6b60288fbdbc24af0529","observation_id":"a2dd9e85-f6da-472e-b516-b42055f1ac88","resolution":{"observed_at":"2026-07-31T18:09:50.989107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T18:09:50.992368Z","title":"Signal estimation from modified short-time Fourier transform,","venue":null,"work_id":null,"year":1984},"citing_paper":{"arxiv_id":"2607.24323","last_updated":"2026-07-27T12:02:42Z","snapshot_observed_at":"2026-08-02T15:15:31.811108Z","submitted_at":"2026-07-27T12:02:42Z","title":"Revisiting Vocos: That Phasiness Business in Time-Frequency Neural Vocoding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-31T18:09:50.992368Z"},"links":{"citing_paper":"/paper/2607.24323"},"observation_digest":"sha256:a740aa584ead9a51afcdb4b180b01328684ee9bc269b26214b974db617dc1e90","observation_id":"7ff4e064-92dd-485d-ad44-895e286f7eee","resolution":{"observed_at":"2026-07-31T18:09:50.992368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T18:09:50.995943Z","title":"FreeV: Free lunch for vocoders through pseudo inversed mel filter,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24323","last_updated":"2026-07-27T12:02:42Z","snapshot_observed_at":"2026-08-02T15:15:31.811108Z","submitted_at":"2026-07-27T12:02:42Z","title":"Revisiting Vocos: That Phasiness Business in Time-Frequency Neural Vocoding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-31T18:09:50.995943Z"},"links":{"citing_paper":"/paper/2607.24323"},"observation_digest":"sha256:97ffc5592a088803f056fcefb0970daaf7106e5ce3e81f4a27ecadc3e5b7ea13","observation_id":"3caa0ea2-4aa4-465c-8891-8c09bbada452","resolution":{"observed_at":"2026-07-31T18:09:50.995943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T18:09:50.999423Z","title":"Is GAN necessary for mel-spectrogram-based neural vocoder?","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24323","last_updated":"2026-07-27T12:02:42Z","snapshot_observed_at":"2026-08-02T15:15:31.811108Z","submitted_at":"2026-07-27T12:02:42Z","title":"Revisiting Vocos: That Phasiness Business in Time-Frequency Neural Vocoding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-31T18:09:50.999423Z"},"links":{"citing_paper":"/paper/2607.24323"},"observation_digest":"sha256:6a4e6bce7367b328af26ccd1b40090bf39b415832ccfa49ef7f0b7947212a6c8","observation_id":"9f652638-ceb5-423d-8503-dd080e84c37d","resolution":{"observed_at":"2026-07-31T18:09:50.999423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T18:09:51.003460Z","title":"Learning neural vocoder from range-null space decomposition,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24323","last_updated":"2026-07-27T12:02:42Z","snapshot_observed_at":"2026-08-02T15:15:31.811108Z","submitted_at":"2026-07-27T12:02:42Z","title":"Revisiting Vocos: That Phasiness Business in Time-Frequency Neural Vocoding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-31T18:09:51.003460Z"},"links":{"citing_paper":"/paper/2607.24323"},"observation_digest":"sha256:0cceb7fc3ece0e109ea00294f0f676e889c982d8cccfea91b54da0d8b89677d1","observation_id":"c0362bfc-c3d0-4ae9-8aca-18d7e38f6645","resolution":{"observed_at":"2026-07-31T18:09:51.003460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T18:09:51.007248Z","title":"A ConvNet for the 2020s,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.24323","last_updated":"2026-07-27T12:02:42Z","snapshot_observed_at":"2026-08-02T15:15:31.811108Z","submitted_at":"2026-07-27T12:02:42Z","title":"Revisiting Vocos: That Phasiness Business in Time-Frequency Neural Vocoding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-31T18:09:51.007248Z"},"links":{"citing_paper":"/paper/2607.24323"},"observation_digest":"sha256:75778106083d54c1359259dbbca7a6561c79576cf66c1c0b3551495410e535ee","observation_id":"e22b716f-f82b-4e33-b140-e4c24fd781f5","resolution":{"observed_at":"2026-07-31T18:09:51.007248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T18:09:51.011123Z","title":"High-fidelity audio compression with improved RVQGAN,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24323","last_updated":"2026-07-27T12:02:42Z","snapshot_observed_at":"2026-08-02T15:15:31.811108Z","submitted_at":"2026-07-27T12:02:42Z","title":"Revisiting Vocos: That Phasiness Business in Time-Frequency Neural Vocoding","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-31T18:09:51.011123Z"},"links":{"citing_paper":"/paper/2607.24323"},"observation_digest":"sha256:23021b08a54b21396c01509f4cdd85ebd485a7a9a4108b7dc3e96bae36b23256","observation_id":"e5210d1f-5bf0-49ed-af12-84d56046f728","resolution":{"observed_at":"2026-07-31T18:09:51.011123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T18:09:51.014875Z","title":"High fi- delity neural audio compression,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24323","last_updated":"2026-07-27T12:02:42Z","snapshot_observed_at":"2026-08-02T15:15:31.811108Z","submitted_at":"2026-07-27T12:02:42Z","title":"Revisiting Vocos: That Phasiness Business in Time-Frequency Neural Vocoding","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-31T18:09:51.014875Z"},"links":{"citing_paper":"/paper/2607.24323"},"observation_digest":"sha256:988043de92b74ccee9aa6b929f613e777696efdfa5eb932328d44bf5d5086e26","observation_id":"6c931f07-3bc6-4565-9f1e-2f0f78aaef08","resolution":{"observed_at":"2026-07-31T18:09:51.014875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T18:09:51.018578Z","title":"Multi-scale sub- band constant-q transform discriminator for high-fidelity vocoder,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24323","last_updated":"2026-07-27T12:02:42Z","snapshot_observed_at":"2026-08-02T15:15:31.811108Z","submitted_at":"2026-07-27T12:02:42Z","title":"Revisiting Vocos: That Phasiness Business in Time-Frequency Neural Vocoding","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-31T18:09:51.018578Z"},"links":{"citing_paper":"/paper/2607.24323"},"observation_digest":"sha256:e25478879f241924c399fdd51c6359c15ad5b93e5e14ef3a34f25ca97942356b","observation_id":"3652aa80-0d1e-4b9c-afb2-586ac1c7f0b6","resolution":{"observed_at":"2026-07-31T18:09:51.018578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T18:09:51.021804Z","title":"On phase- magnitude relationships in the short-time Fourier transform,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2607.24323","last_updated":"2026-07-27T12:02:42Z","snapshot_observed_at":"2026-08-02T15:15:31.811108Z","submitted_at":"2026-07-27T12:02:42Z","title":"Revisiting Vocos: That Phasiness Business in Time-Frequency Neural Vocoding","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-31T18:09:51.021804Z"},"links":{"citing_paper":"/paper/2607.24323"},"observation_digest":"sha256:02b016c5331591f397fbd4692a0f4712ea1d729e7fa2d28a0ca670e250818631","observation_id":"68fda27e-a2f7-424e-8212-b94f2cf19d2d","resolution":{"observed_at":"2026-07-31T18:09:51.021804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T18:09:51.025454Z","title":"A noniterative method for reconstruction of phase from STFT magnitude,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.24323","last_updated":"2026-07-27T12:02:42Z","snapshot_observed_at":"2026-08-02T15:15:31.811108Z","submitted_at":"2026-07-27T12:02:42Z","title":"Revisiting Vocos: That Phasiness Business in Time-Frequency Neural Vocoding","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-31T18:09:51.025454Z"},"links":{"citing_paper":"/paper/2607.24323"},"observation_digest":"sha256:00e15e31444fd693baadedbdffd064f1342e2f62f5cd3a4cee6a3f46d8af36a3","observation_id":"be4ce4a2-e7f8-4ec4-9b4f-a10d3373f3de","resolution":{"observed_at":"2026-07-31T18:09:51.025454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T18:09:51.029061Z","title":"Adversarial generation of time-frequency features with ap- plication in audio synthesis,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.24323","last_updated":"2026-07-27T12:02:42Z","snapshot_observed_at":"2026-08-02T15:15:31.811108Z","submitted_at":"2026-07-27T12:02:42Z","title":"Revisiting Vocos: That Phasiness Business in Time-Frequency Neural Vocoding","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-31T18:09:51.029061Z"},"links":{"citing_paper":"/paper/2607.24323"},"observation_digest":"sha256:de0ea1cef5b3660ab8c490ffd339ee2155741f8a945fc9cea5577988a204d80a","observation_id":"7b705d3c-6f79-4bed-b6a0-b0df0f267072","resolution":{"observed_at":"2026-07-31T18:09:51.029061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T18:09:51.033402Z","title":"Mel spectrogram in- version with stable pitch,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.24323","last_updated":"2026-07-27T12:02:42Z","snapshot_observed_at":"2026-08-02T15:15:31.811108Z","submitted_at":"2026-07-27T12:02:42Z","title":"Revisiting Vocos: That Phasiness Business in Time-Frequency Neural Vocoding","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-31T18:09:51.033402Z"},"links":{"citing_paper":"/paper/2607.24323"},"observation_digest":"sha256:1c056ea3aea46e4c97b546da4cf68ef2311083baa67d5f0f9789cf6872f864b5","observation_id":"89b19adb-4edf-436f-b2c2-67617e828977","resolution":{"observed_at":"2026-07-31T18:09:51.033402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T18:09:51.036739Z","title":"Online phase reconstruction via DNN-based phase differ- ences estimation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24323","last_updated":"2026-07-27T12:02:42Z","snapshot_observed_at":"2026-08-02T15:15:31.811108Z","submitted_at":"2026-07-27T12:02:42Z","title":"Revisiting Vocos: That Phasiness Business in Time-Frequency Neural Vocoding","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-31T18:09:51.036739Z"},"links":{"citing_paper":"/paper/2607.24323"},"observation_digest":"sha256:62fcc488106a5a141515fdfb022f7f891dce5be56f9606fda1d1fd305afb97f9","observation_id":"e870f822-db8d-4612-85a9-a986be067233","resolution":{"observed_at":"2026-07-31T18:09:51.036739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T18:09:51.040713Z","title":"Efficient neural and numerical methods for high-quality on- line speech spectrogram inversion via gradient theorem,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24323","last_updated":"2026-07-27T12:02:42Z","snapshot_observed_at":"2026-08-02T15:15:31.811108Z","submitted_at":"2026-07-27T12:02:42Z","title":"Revisiting Vocos: That Phasiness Business in Time-Frequency Neural Vocoding","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-31T18:09:51.040713Z"},"links":{"citing_paper":"/paper/2607.24323"},"observation_digest":"sha256:6ec4b342809efdc87de90352d290ce13c52973da58913864d69f7ece8c49c6c9","observation_id":"1644b215-3130-43de-9d2e-232ddb4a4aab","resolution":{"observed_at":"2026-07-31T18:09:51.040713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T18:09:51.044447Z","title":"STFT phase reconstruc- tion in voiced speech for an improved single-channel speech enhancement,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2607.24323","last_updated":"2026-07-27T12:02:42Z","snapshot_observed_at":"2026-08-02T15:15:31.811108Z","submitted_at":"2026-07-27T12:02:42Z","title":"Revisiting Vocos: That Phasiness Business in Time-Frequency Neural Vocoding","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-31T18:09:51.044447Z"},"links":{"citing_paper":"/paper/2607.24323"},"observation_digest":"sha256:17949ec33740e0a39f919aef1dbc58bdf6ee08b6aeb4e75df918ade417bed3aa","observation_id":"fddb1083-3750-4256-8095-5086da14f7e7","resolution":{"observed_at":"2026-07-31T18:09:51.044447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T18:09:51.047967Z","title":"Low-latency neural speech phase pre- diction based on parallel estimation architecture and anti- wrapping losses for speech generation tasks,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24323","last_updated":"2026-07-27T12:02:42Z","snapshot_observed_at":"2026-08-02T15:15:31.811108Z","submitted_at":"2026-07-27T12:02:42Z","title":"Revisiting Vocos: That Phasiness Business in Time-Frequency Neural Vocoding","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-31T18:09:51.047967Z"},"links":{"citing_paper":"/paper/2607.24323"},"observation_digest":"sha256:18b5b2a03ed61566733797d525e5d39214e048d2cc6aba18d9951817541001dc","observation_id":"15b4aeaf-850f-4031-a722-9965eeb30553","resolution":{"observed_at":"2026-07-31T18:09:51.047967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T18:09:51.051386Z","title":"LibriTTS: A corpus derived from LibriSpeech for text-to-speech,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.24323","last_updated":"2026-07-27T12:02:42Z","snapshot_observed_at":"2026-08-02T15:15:31.811108Z","submitted_at":"2026-07-27T12:02:42Z","title":"Revisiting Vocos: That Phasiness Business in Time-Frequency Neural Vocoding","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-31T18:09:51.051386Z"},"links":{"citing_paper":"/paper/2607.24323"},"observation_digest":"sha256:e6196d1b2f4862f543e49081292d6c8321a46fc5f35fe7c4849cd117ebc0a3db","observation_id":"1f07031d-5317-4f50-9c10-bed8be8490a3","resolution":{"observed_at":"2026-07-31T18:09:51.051386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T18:09:51.054655Z","title":"SCOREQ: Speech quality assessment with contrastive regression,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24323","last_updated":"2026-07-27T12:02:42Z","snapshot_observed_at":"2026-08-02T15:15:31.811108Z","submitted_at":"2026-07-27T12:02:42Z","title":"Revisiting Vocos: That Phasiness Business in Time-Frequency Neural Vocoding","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-31T18:09:51.054655Z"},"links":{"citing_paper":"/paper/2607.24323"},"observation_digest":"sha256:0ff6cf43aa11bcc7a77c3cda6692a11e2c4bf7525f6da79f327e0153b42494e0","observation_id":"9a694100-93a9-4d90-8f69-6aedf4c9fe07","resolution":{"observed_at":"2026-07-31T18:09:51.054655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T18:09:51.058376Z","title":"webMUSHRA — a comprehensive framework for web-based listening tests,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.24323","last_updated":"2026-07-27T12:02:42Z","snapshot_observed_at":"2026-08-02T15:15:31.811108Z","submitted_at":"2026-07-27T12:02:42Z","title":"Revisiting Vocos: That Phasiness Business in Time-Frequency Neural Vocoding","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-31T18:09:51.058376Z"},"links":{"citing_paper":"/paper/2607.24323"},"observation_digest":"sha256:8d66b8182f6bbf2543aef59acdd3cf111e2b8dad3580b11f2ad4d22dec38f6af","observation_id":"321f1128-d2b3-40c1-93cf-31bdcbdf42e8","resolution":{"observed_at":"2026-07-31T18:09:51.058376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T18:09:51.062202Z","title":"A com- parison of recent neural vocoders for speech signal recon- struction,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.24323","last_updated":"2026-07-27T12:02:42Z","snapshot_observed_at":"2026-08-02T15:15:31.811108Z","submitted_at":"2026-07-27T12:02:42Z","title":"Revisiting Vocos: That Phasiness Business in Time-Frequency Neural Vocoding","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-31T18:09:51.062202Z"},"links":{"citing_paper":"/paper/2607.24323"},"observation_digest":"sha256:3a1f257e371fdd7e68e3e49ec572516af75c1a8fbeced834871618ada59f8605","observation_id":"630ce190-b480-407f-8386-e75059294d8f","resolution":{"observed_at":"2026-07-31T18:09:51.062202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T18:09:51.065507Z","title":"APNet2: High- quality and high-efficiency neural vocoder with direct predic- tion of amplitude and phase spectra,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24323","last_updated":"2026-07-27T12:02:42Z","snapshot_observed_at":"2026-08-02T15:15:31.811108Z","submitted_at":"2026-07-27T12:02:42Z","title":"Revisiting Vocos: That Phasiness Business in Time-Frequency Neural Vocoding","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-31T18:09:51.065507Z"},"links":{"citing_paper":"/paper/2607.24323"},"observation_digest":"sha256:336380c504519467f7a98a35dc1d6d49fa8b37fe42282933fb577d680af90cc2","observation_id":"5d38dc6b-72dd-490f-9e89-25bab4e65b1a","resolution":{"observed_at":"2026-07-31T18:09:51.065507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.24323","last_updated":"2026-07-27T12:02:42Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-02T15:15:31.811108Z","submitted_at":"2026-07-27T12:02:42Z","title":"Revisiting Vocos: That Phasiness Business in Time-Frequency Neural Vocoding"},"reference_resolution":{"displayed":38,"state_counts":{"malformed_identifier":2,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":36,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":38},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 38 of 38 outbound references and 1 inbound Pith citation observation for arXiv:2607.24323."}