{"as_of":"2026-08-08T03:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a94a80a67a666b3b04f1967bd5487e4c4bc5bd052c6d96ee50d498d89ef14a87","coverage":[{"denominator":36,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:30:40.211506Z","state":"measured"},{"denominator":37,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":37,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:30:37.536147Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T12:30:40.292035Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.24336","last_updated":"2025-05-30T08:24:41Z","snapshot_observed_at":"2026-08-07T12:22:45.083507Z","submitted_at":"2025-05-30T08:24:41Z","title":"When Humans Growl and Birds Speak: High-Fidelity Voice Conversion from Human to Animal and Designed Sounds","version":1},"cited_work":{"arxiv_id":"2505.24336","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.24336","snapshot_observed_at":"2026-08-07T12:30:40.292035Z","title":"When Humans Growl and Birds Speak: High-Fidelity Voice Conversion from Human to Animal and Designed Sounds","venue":"eess.AS","work_id":"bc970a77-311a-4e16-82e6-d2d92b4eee87","year":2025},"citing_paper":{"arxiv_id":"2505.24336","last_updated":"2025-05-30T08:24:41Z","snapshot_observed_at":"2026-08-07T12:22:45.083507Z","submitted_at":"2025-05-30T08:24:41Z","title":"When Humans Growl and Birds Speak: High-Fidelity Voice Conversion from Human to Animal and Designed Sounds","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:37.536147Z"},"links":{"cited_paper":"/paper/2505.24336","citing_paper":"/paper/2505.24336"},"observation_digest":"sha256:1fcaf3f4dc94242a71004ed9fb59da7408c55b8f28d6cfae2297d7405ac276f0","observation_id":"ce1e0469-2921-4255-99b6-dbf3dd596347","resolution":{"observed_at":"2026-08-07T12:30:40.356114Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.24336/citation-record","integrity":"/paper/2505.24336/integrity","json":"/paper/2505.24336/citation-record.json","paper":"/paper/2505.24336"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.24336","last_updated":"2025-05-30T08:24:41Z","snapshot_observed_at":"2026-08-07T12:22:45.083507Z","submitted_at":"2025-05-30T08:24:41Z","title":"When Humans Growl and Birds Speak: High-Fidelity Voice Conversion from Human to Animal and Designed Sounds","version":1},"cited_work":{"arxiv_id":"2505.24336","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.24336","snapshot_observed_at":"2026-08-07T12:30:40.292035Z","title":"When Humans Growl and Birds Speak: High-Fidelity Voice Conversion from Human to Animal and Designed Sounds","venue":"eess.AS","work_id":"bc970a77-311a-4e16-82e6-d2d92b4eee87","year":2025},"citing_paper":{"arxiv_id":"2505.24336","last_updated":"2025-05-30T08:24:41Z","snapshot_observed_at":"2026-08-07T12:22:45.083507Z","submitted_at":"2025-05-30T08:24:41Z","title":"When Humans Growl and Birds Speak: High-Fidelity Voice Conversion from Human to Animal and Designed Sounds","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:37.536147Z"},"links":{"cited_paper":"/paper/2505.24336","citing_paper":"/paper/2505.24336"},"observation_digest":"sha256:1fcaf3f4dc94242a71004ed9fb59da7408c55b8f28d6cfae2297d7405ac276f0","observation_id":"ce1e0469-2921-4255-99b6-dbf3dd596347","resolution":{"observed_at":"2026-08-07T12:30:40.356114Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:30:46.438904Z","title":"designed voices","venue":null,"work_id":"8ace4ed1-b8e2-41bf-9f1a-d549b0b477af","year":null},"citing_paper":{"arxiv_id":"2505.24336","last_updated":"2025-05-30T08:24:41Z","snapshot_observed_at":"2026-08-07T12:22:45.083507Z","submitted_at":"2025-05-30T08:24:41Z","title":"When Humans Growl and Birds Speak: High-Fidelity Voice Conversion from Human to Animal and Designed Sounds","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:37.627362Z"},"links":{"citing_paper":"/paper/2505.24336"},"observation_digest":"sha256:278d9e9c7f83f5195d677b411a5fa42356dcd7ec38bbdca0a32537119c3b8014","observation_id":"ce5c8d29-6113-4bdf-ba07-9b0dde979e60","resolution":{"observed_at":"2026-08-07T12:30:46.525352Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:30:46.279865Z","title":"Figure 2 presents an overview of the workflow of the system","venue":null,"work_id":"6297aeaa-ed2d-4d8b-af57-9a8e77945011","year":null},"citing_paper":{"arxiv_id":"2505.24336","last_updated":"2025-05-30T08:24:41Z","snapshot_observed_at":"2026-08-07T12:22:45.083507Z","submitted_at":"2025-05-30T08:24:41Z","title":"When Humans Growl and Birds Speak: High-Fidelity Voice Conversion from Human to Animal and Designed Sounds","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:37.720404Z"},"links":{"citing_paper":"/paper/2505.24336"},"observation_digest":"sha256:298c5132171dd2cbcc4a367b935a7ba411cd823b703f6635e0d75bd315c828a1","observation_id":"2ed239d4-430e-48be-b6e8-06d96807855c","resolution":{"observed_at":"2026-08-07T12:30:46.353849Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:30:46.131986Z","title":"w/o PP” indicates the proposed model using conventional (speech-focused) preprocessing method instead of our proposed pipeline, “w/ SEED","venue":null,"work_id":"f2aa9be3-b080-4ff7-aadb-9ccc86c51769","year":null},"citing_paper":{"arxiv_id":"2505.24336","last_updated":"2025-05-30T08:24:41Z","snapshot_observed_at":"2026-08-07T12:22:45.083507Z","submitted_at":"2025-05-30T08:24:41Z","title":"When Humans Growl and Birds Speak: High-Fidelity Voice Conversion from Human to Animal and Designed Sounds","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:37.814312Z"},"links":{"citing_paper":"/paper/2505.24336"},"observation_digest":"sha256:bcb1df25e610e9570fb8ef7b1cb436df537c89e68ff4aad1b2239181a71947a0","observation_id":"3ea5963b-3398-47b5-8a84-626c63b2b273","resolution":{"observed_at":"2026-08-07T12:30:46.208169Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:30:45.947614Z","title":"It accu- rately captured transient-rich signals and wide-frequency–range of non-human sounds","venue":null,"work_id":"3a67ec39-83cf-45a0-97aa-592c2751c170","year":null},"citing_paper":{"arxiv_id":"2505.24336","last_updated":"2025-05-30T08:24:41Z","snapshot_observed_at":"2026-08-07T12:22:45.083507Z","submitted_at":"2025-05-30T08:24:41Z","title":"When Humans Growl and Birds Speak: High-Fidelity Voice Conversion from Human to Animal and Designed Sounds","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:37.934981Z"},"links":{"citing_paper":"/paper/2505.24336"},"observation_digest":"sha256:b1c6ab569f19930c571dae5238819f235c8a7cac34ffeb1567ba04c28cdea984","observation_id":"65575883-45c6-4fdb-bde1-57649d26e2c2","resolution":{"observed_at":"2026-08-07T12:30:46.033796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:30:45.817756Z","title":null,"venue":null,"work_id":"6dbac8da-e1bb-408e-8a0d-8e55435dccbb","year":2024},"citing_paper":{"arxiv_id":"2505.24336","last_updated":"2025-05-30T08:24:41Z","snapshot_observed_at":"2026-08-07T12:22:45.083507Z","submitted_at":"2025-05-30T08:24:41Z","title":"When Humans Growl and Birds Speak: High-Fidelity Voice Conversion from Human to Animal and Designed Sounds","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:38.010806Z"},"links":{"citing_paper":"/paper/2505.24336"},"observation_digest":"sha256:9f1ca94f4e529c5468a9cebb6a2ce4db1a32c3e6b1272452d832c8ff3282a4bb","observation_id":"34b340fd-8d36-4971-ba1f-6580f5437c6f","resolution":{"observed_at":"2026-08-07T12:30:45.875286Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:30:45.694650Z","title":"Neural anal- ysis and synthesis: Reconstructing speech from self-supervised representations,","venue":null,"work_id":"baaab4e2-2c1d-43d9-b0e5-ca411e975096","year":2021},"citing_paper":{"arxiv_id":"2505.24336","last_updated":"2025-05-30T08:24:41Z","snapshot_observed_at":"2026-08-07T12:22:45.083507Z","submitted_at":"2025-05-30T08:24:41Z","title":"When Humans Growl and Birds Speak: High-Fidelity Voice Conversion from Human to Animal and Designed Sounds","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:38.074547Z"},"links":{"citing_paper":"/paper/2505.24336"},"observation_digest":"sha256:c4375bd19b18b943526f0efde33526601c1be6fcec29b9307e1d07975f2c5c35","observation_id":"afd7a08d-8a6f-4a2b-8c3d-ab7056e6f3e2","resolution":{"observed_at":"2026-08-07T12:30:45.766768Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:30:45.544105Z","title":"Dddm-vc: Decoupled denoising dif- fusion models with disentangled representation and prior mixup for verified robust voice conversion,","venue":null,"work_id":"2c03e81e-f1aa-4944-a6c7-309d05dcfbf8","year":2024},"citing_paper":{"arxiv_id":"2505.24336","last_updated":"2025-05-30T08:24:41Z","snapshot_observed_at":"2026-08-07T12:22:45.083507Z","submitted_at":"2025-05-30T08:24:41Z","title":"When Humans Growl and Birds Speak: High-Fidelity Voice Conversion from Human to Animal and Designed Sounds","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:38.150161Z"},"links":{"citing_paper":"/paper/2505.24336"},"observation_digest":"sha256:5cabdb5388cde567fb8946269d8bcf4c0b2ae6f8a3c1a62129205b101780b165","observation_id":"8c33a3df-cd0c-4308-a0d6-a0a40642fb4c","resolution":{"observed_at":"2026-08-07T12:30:45.625448Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:30:45.401760Z","title":"Diff-hiervc: Diffusion-based hierar- chical voice conversion with robust pitch generation and masked prior for zero-shot speaker adaptation,","venue":null,"work_id":"31e8ede5-ec91-4b86-8332-adbc58bd0bb0","year":2023},"citing_paper":{"arxiv_id":"2505.24336","last_updated":"2025-05-30T08:24:41Z","snapshot_observed_at":"2026-08-07T12:22:45.083507Z","submitted_at":"2025-05-30T08:24:41Z","title":"When Humans Growl and Birds Speak: High-Fidelity Voice Conversion from Human to Animal and Designed Sounds","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:38.207028Z"},"links":{"citing_paper":"/paper/2505.24336"},"observation_digest":"sha256:9c2935d095a8c8fc28be9199f6de37b8bad8d2638b8abcac545cf79ed4813c85","observation_id":"616ff8cc-6499-4ff3-9fb0-56b2e7d1dca3","resolution":{"observed_at":"2026-08-07T12:30:45.477131Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:30:45.269602Z","title":"Hiervst: Hierarchical adap- tive zero-shot voice style transfer,","venue":null,"work_id":"2bc89647-2da0-4db6-b8c5-f9d18e4b055d","year":2023},"citing_paper":{"arxiv_id":"2505.24336","last_updated":"2025-05-30T08:24:41Z","snapshot_observed_at":"2026-08-07T12:22:45.083507Z","submitted_at":"2025-05-30T08:24:41Z","title":"When Humans Growl and Birds Speak: High-Fidelity Voice Conversion from Human to Animal and Designed Sounds","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:38.246277Z"},"links":{"citing_paper":"/paper/2505.24336"},"observation_digest":"sha256:efba318bdaa24c374ad28c09412dca1e9a698a89c15f500060e89b56749d2417","observation_id":"12ead880-7eaa-4d05-8fee-8d91af3271b7","resolution":{"observed_at":"2026-08-07T12:30:45.320632Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:30:45.131102Z","title":"FreeVC: Towards high-quality text- free one-shot voice conversion,","venue":null,"work_id":"b1bfab27-895d-41b6-8429-c5ce7847e492","year":2023},"citing_paper":{"arxiv_id":"2505.24336","last_updated":"2025-05-30T08:24:41Z","snapshot_observed_at":"2026-08-07T12:22:45.083507Z","submitted_at":"2025-05-30T08:24:41Z","title":"When Humans Growl and Birds Speak: High-Fidelity Voice Conversion from Human to Animal and Designed Sounds","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:38.294734Z"},"links":{"citing_paper":"/paper/2505.24336"},"observation_digest":"sha256:3a51f961fbbb20678b9114255689a8d64b76584c7455fa00e73536a3237c4759","observation_id":"8c3bc694-73bc-4dbf-88aa-a93f29d78fe0","resolution":{"observed_at":"2026-08-07T12:30:45.167592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:30:44.997134Z","title":"Speak like a dog: Human to non-human creature voice conversion,","venue":null,"work_id":"efe249cc-b069-41fb-b09d-6a9160ba722d","year":2022},"citing_paper":{"arxiv_id":"2505.24336","last_updated":"2025-05-30T08:24:41Z","snapshot_observed_at":"2026-08-07T12:22:45.083507Z","submitted_at":"2025-05-30T08:24:41Z","title":"When Humans Growl and Birds Speak: High-Fidelity Voice Conversion from Human to Animal and Designed Sounds","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:38.371345Z"},"links":{"citing_paper":"/paper/2505.24336"},"observation_digest":"sha256:fe0b831f5053c5a9e46794711ade906656a1a54a0cac3da45c0c01269c46dc30","observation_id":"9c860285-8e4d-4fb4-8e35-b57f923964e7","resolution":{"observed_at":"2026-08-07T12:30:45.060722Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:30:44.887000Z","title":"High-fidelity audio compression with improved rvqgan,","venue":null,"work_id":"d71e05cb-3290-4faf-9d00-01062c01a2d3","year":2023},"citing_paper":{"arxiv_id":"2505.24336","last_updated":"2025-05-30T08:24:41Z","snapshot_observed_at":"2026-08-07T12:22:45.083507Z","submitted_at":"2025-05-30T08:24:41Z","title":"When Humans Growl and Birds Speak: High-Fidelity Voice Conversion from Human to Animal and Designed Sounds","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:38.464196Z"},"links":{"citing_paper":"/paper/2505.24336"},"observation_digest":"sha256:6a179d9a7c9dd40ca5221fb2d3619c381a599a41a50c49b1b48eeec0485989e0","observation_id":"bb14cb09-195f-4854-9453-ebb30ce6e28c","resolution":{"observed_at":"2026-08-07T12:30:44.928302Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:30:44.737819Z","title":"DDSP-SFX: Acoustically-guided sound ef- fects generation with differentiable digital signal processing,","venue":null,"work_id":"4e4c5847-ca4c-4558-b784-20b47e44d405","year":2024},"citing_paper":{"arxiv_id":"2505.24336","last_updated":"2025-05-30T08:24:41Z","snapshot_observed_at":"2026-08-07T12:22:45.083507Z","submitted_at":"2025-05-30T08:24:41Z","title":"When Humans Growl and Birds Speak: High-Fidelity Voice Conversion from Human to Animal and Designed Sounds","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:38.556266Z"},"links":{"citing_paper":"/paper/2505.24336"},"observation_digest":"sha256:a4be6c4b1e195611cdbfadbc88ff316d34cc47d374afa8dcd7b2915581070ec3","observation_id":"2cce21f5-3ca7-4eae-a73b-202bc91d8348","resolution":{"observed_at":"2026-08-07T12:30:44.826311Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:30:44.594819Z","title":"T-FOLEY: A controllable waveform-domain diffusion model for temporal-event-guided fo- ley sound synthesis,","venue":null,"work_id":"9ba6a6d1-23a5-4fd0-b627-2899c30be12f","year":2024},"citing_paper":{"arxiv_id":"2505.24336","last_updated":"2025-05-30T08:24:41Z","snapshot_observed_at":"2026-08-07T12:22:45.083507Z","submitted_at":"2025-05-30T08:24:41Z","title":"When Humans Growl and Birds Speak: High-Fidelity Voice Conversion from Human to Animal and Designed Sounds","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:38.655167Z"},"links":{"citing_paper":"/paper/2505.24336"},"observation_digest":"sha256:6dcaa95e178e2861898f37ffe8d22f505e14a75b8712ef1b5bd73a6ed017c2b4","observation_id":"da9aadb5-e5db-4be9-abbb-e49a6bd62450","resolution":{"observed_at":"2026-08-07T12:30:44.679612Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:30:44.289446Z","title":"Dehumaniser2 - creature & monster sound design","venue":null,"work_id":"9ca28855-0863-4170-a72b-712c12f89d17","year":null},"citing_paper":{"arxiv_id":"2505.24336","last_updated":"2025-05-30T08:24:41Z","snapshot_observed_at":"2026-08-07T12:22:45.083507Z","submitted_at":"2025-05-30T08:24:41Z","title":"When Humans Growl and Birds Speak: High-Fidelity Voice Conversion from Human to Animal and Designed Sounds","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:38.713623Z"},"links":{"citing_paper":"/paper/2505.24336"},"observation_digest":"sha256:bf245055545d3866fc9b01dd5bf3bcbea226b4f5ac53423286101d2e7b10db11","observation_id":"2d893310-cb1c-4b26-92d0-16dc827ec744","resolution":{"observed_at":"2026-08-07T12:30:44.431287Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:30:44.038098Z","title":"Conditional variational autoencoder with adversarial learning for end-to-end text-to-speech,","venue":null,"work_id":"97aee69b-ef0e-42e8-aa40-fbb96d699430","year":2021},"citing_paper":{"arxiv_id":"2505.24336","last_updated":"2025-05-30T08:24:41Z","snapshot_observed_at":"2026-08-07T12:22:45.083507Z","submitted_at":"2025-05-30T08:24:41Z","title":"When Humans Growl and Birds Speak: High-Fidelity Voice Conversion from Human to Animal and Designed Sounds","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:38.791781Z"},"links":{"citing_paper":"/paper/2505.24336"},"observation_digest":"sha256:97d1b26a3df7fa2abb3c7cfbbf4dbe11159cdf0bb9a2ca40e0f29567588ee4d5","observation_id":"4f2c9c77-7bd6-4d98-8a89-e2e6cbfc3759","resolution":{"observed_at":"2026-08-07T12:30:44.162873Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:30:43.737435Z","title":"Wave-tacotron: Spectrogram-free end-to-end text- to-speech synthesis,","venue":null,"work_id":"935e8db1-7786-4317-8ee7-0202b00edb0f","year":2021},"citing_paper":{"arxiv_id":"2505.24336","last_updated":"2025-05-30T08:24:41Z","snapshot_observed_at":"2026-08-07T12:22:45.083507Z","submitted_at":"2025-05-30T08:24:41Z","title":"When Humans Growl and Birds Speak: High-Fidelity Voice Conversion from Human to Animal and Designed Sounds","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:38.886114Z"},"links":{"citing_paper":"/paper/2505.24336"},"observation_digest":"sha256:4993f876b9e860f721702985146931a24508a852a3bc0d33db7b81aec2a0260b","observation_id":"3d8050ef-7d75-4ee6-828b-0903422fb25f","resolution":{"observed_at":"2026-08-07T12:30:43.858160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:30:43.498913Z","title":"A systematic explo- ration of joint-training for singing voice synthesis,","venue":null,"work_id":"5c154eb0-c3b5-431e-90b5-c4df3cfcbc5b","year":2024},"citing_paper":{"arxiv_id":"2505.24336","last_updated":"2025-05-30T08:24:41Z","snapshot_observed_at":"2026-08-07T12:22:45.083507Z","submitted_at":"2025-05-30T08:24:41Z","title":"When Humans Growl and Birds Speak: High-Fidelity Voice Conversion from Human to Animal and Designed Sounds","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:38.972288Z"},"links":{"citing_paper":"/paper/2505.24336"},"observation_digest":"sha256:584927023dde42f19831155661b770a8101afad9b8b8dfb493a7962225ed5e19","observation_id":"3a0db536-09c8-4875-899e-52043bb6d076","resolution":{"observed_at":"2026-08-07T12:30:43.614823Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:30:43.329580Z","title":"Audioldm: Text-to-audio generation with latent diffusion models,","venue":null,"work_id":"afe05c35-d85b-4322-9486-1dc11ba37eb8","year":2023},"citing_paper":{"arxiv_id":"2505.24336","last_updated":"2025-05-30T08:24:41Z","snapshot_observed_at":"2026-08-07T12:22:45.083507Z","submitted_at":"2025-05-30T08:24:41Z","title":"When Humans Growl and Birds Speak: High-Fidelity Voice Conversion from Human to Animal and Designed Sounds","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:39.069329Z"},"links":{"citing_paper":"/paper/2505.24336"},"observation_digest":"sha256:562ee2b812bbcf988cc136c977ded95ffc4f1291b8eb2215de3ebf1747264253","observation_id":"a3578694-ab93-4a68-a18f-bfcc9d1b6fbf","resolution":{"observed_at":"2026-08-07T12:30:43.423797Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:30:43.105120Z","title":"V AE with a vampprior,","venue":null,"work_id":"ed53409e-02e8-4e7b-b556-97d85e28e085","year":2018},"citing_paper":{"arxiv_id":"2505.24336","last_updated":"2025-05-30T08:24:41Z","snapshot_observed_at":"2026-08-07T12:22:45.083507Z","submitted_at":"2025-05-30T08:24:41Z","title":"When Humans Growl and Birds Speak: High-Fidelity Voice Conversion from Human to Animal and Designed Sounds","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:39.202650Z"},"links":{"citing_paper":"/paper/2505.24336"},"observation_digest":"sha256:b565036e9f883d88560bacde0ef594ee0ae04ce2999f4c88c435e727a8b9aa17","observation_id":"47f788c6-406e-49f5-aa01-c01ad0e19694","resolution":{"observed_at":"2026-08-07T12:30:43.227352Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:30:42.830998Z","title":"Flowtron: an autoregressive flow-based generative network for text-to- speech synthesis,","venue":null,"work_id":"08784155-18b3-4a1d-bcb7-1522c78a396f","year":2021},"citing_paper":{"arxiv_id":"2505.24336","last_updated":"2025-05-30T08:24:41Z","snapshot_observed_at":"2026-08-07T12:22:45.083507Z","submitted_at":"2025-05-30T08:24:41Z","title":"When Humans Growl and Birds Speak: High-Fidelity Voice Conversion from Human to Animal and Designed Sounds","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:39.250419Z"},"links":{"citing_paper":"/paper/2505.24336"},"observation_digest":"sha256:addcf7449f5a03f03ab660da36bd1ed20cbc3e31b7207e8a83655dae260d0cfc","observation_id":"f3a8ba71-ace4-4c55-bd7e-560ecb0ed47a","resolution":{"observed_at":"2026-08-07T12:30:43.013472Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:30:42.636202Z","title":"Meta-stylespeech: Multi-speaker adaptive text-to-speech generation,","venue":null,"work_id":"d999d67a-c094-47ca-98d1-c7244464c1ce","year":2021},"citing_paper":{"arxiv_id":"2505.24336","last_updated":"2025-05-30T08:24:41Z","snapshot_observed_at":"2026-08-07T12:22:45.083507Z","submitted_at":"2025-05-30T08:24:41Z","title":"When Humans Growl and Birds Speak: High-Fidelity Voice Conversion from Human to Animal and Designed Sounds","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:39.326861Z"},"links":{"citing_paper":"/paper/2505.24336"},"observation_digest":"sha256:7804affe829c7d521338c383d274f0bafdec66e6f9ba304823b306685538d637","observation_id":"897c58e1-6066-48dd-bdf2-776706484c74","resolution":{"observed_at":"2026-08-07T12:30:42.725905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:30:42.426060Z","title":"XLS-R: Self-supervised cross-lingual speech representation learning at scale,","venue":null,"work_id":"69b4245f-4826-4389-b71d-10ae6145aafb","year":2022},"citing_paper":{"arxiv_id":"2505.24336","last_updated":"2025-05-30T08:24:41Z","snapshot_observed_at":"2026-08-07T12:22:45.083507Z","submitted_at":"2025-05-30T08:24:41Z","title":"When Humans Growl and Birds Speak: High-Fidelity Voice Conversion from Human to Animal and Designed Sounds","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:39.388254Z"},"links":{"citing_paper":"/paper/2505.24336"},"observation_digest":"sha256:aee1f777593469d7b70d051ff85474e92a373ad8d8c8b23aa371052f80387ded","observation_id":"3d08d1db-b1fc-490e-b86e-eea02b4d5870","resolution":{"observed_at":"2026-08-07T12:30:42.507870Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:30:42.190838Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech representa- tions,","venue":null,"work_id":"62bd1ea2-2f12-4006-9a41-b98abfec1f5a","year":2020},"citing_paper":{"arxiv_id":"2505.24336","last_updated":"2025-05-30T08:24:41Z","snapshot_observed_at":"2026-08-07T12:22:45.083507Z","submitted_at":"2025-05-30T08:24:41Z","title":"When Humans Growl and Birds Speak: High-Fidelity Voice Conversion from Human to Animal and Designed Sounds","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:39.440296Z"},"links":{"citing_paper":"/paper/2505.24336"},"observation_digest":"sha256:04795ed03a4ac5a9f857039da627ea521eb15a8fc590c76ada33a21edb08dab8","observation_id":"8e9ed2a6-93eb-42e2-99f7-502a94a8842c","resolution":{"observed_at":"2026-08-07T12:30:42.282016Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:30:41.969659Z","title":"Praat: doing phonetics by computer (Computer program),","venue":null,"work_id":"5d8008a9-4ebf-40df-80f9-213a78a44540","year":2021},"citing_paper":{"arxiv_id":"2505.24336","last_updated":"2025-05-30T08:24:41Z","snapshot_observed_at":"2026-08-07T12:22:45.083507Z","submitted_at":"2025-05-30T08:24:41Z","title":"When Humans Growl and Birds Speak: High-Fidelity Voice Conversion from Human to Animal and Designed Sounds","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:39.515800Z"},"links":{"citing_paper":"/paper/2505.24336"},"observation_digest":"sha256:4996012d00c69408c800d9491c3c74ae0b31815edc679f65d45bb773fcd6b2f8","observation_id":"3997f8f2-f4a4-458b-822e-191ae80f84b4","resolution":{"observed_at":"2026-08-07T12:30:42.085126Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:30:39.581396Z","title":"Yet another algorithm for pitch tracking,","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2505.24336","last_updated":"2025-05-30T08:24:41Z","snapshot_observed_at":"2026-08-07T12:22:45.083507Z","submitted_at":"2025-05-30T08:24:41Z","title":"When Humans Growl and Birds Speak: High-Fidelity Voice Conversion from Human to Animal and Designed Sounds","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:39.581396Z"},"links":{"citing_paper":"/paper/2505.24336"},"observation_digest":"sha256:ee7d67d1a8441e24e9eb302a7052421539ed9756db8904e0c8b94eebac47ce70","observation_id":"730b4df6-32ed-4e68-b513-296b8b8c32b0","resolution":{"observed_at":"2026-08-07T12:30:39.581396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:30:41.770372Z","title":"Crepe: A convolu- tional representation for pitch estimation,","venue":null,"work_id":"6b6f6787-92f2-4dff-be7a-42f6c5fbd8a9","year":2018},"citing_paper":{"arxiv_id":"2505.24336","last_updated":"2025-05-30T08:24:41Z","snapshot_observed_at":"2026-08-07T12:22:45.083507Z","submitted_at":"2025-05-30T08:24:41Z","title":"When Humans Growl and Birds Speak: High-Fidelity Voice Conversion from Human to Animal and Designed Sounds","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:39.683835Z"},"links":{"citing_paper":"/paper/2505.24336"},"observation_digest":"sha256:c1c4bf30b0d0f4c2d8df53eef15baa80a2435736934e4a49c83a8fb808912a04","observation_id":"d9a875a8-8f6c-43ba-9fff-cdb6ca32b708","resolution":{"observed_at":"2026-08-07T12:30:41.883587Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:30:41.523811Z","title":"SPICE: Self-supervised pitch estimation,","venue":null,"work_id":"e193157c-e9c3-4300-a934-9648768e8b22","year":2020},"citing_paper":{"arxiv_id":"2505.24336","last_updated":"2025-05-30T08:24:41Z","snapshot_observed_at":"2026-08-07T12:22:45.083507Z","submitted_at":"2025-05-30T08:24:41Z","title":"When Humans Growl and Birds Speak: High-Fidelity Voice Conversion from Human to Animal and Designed Sounds","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:39.740688Z"},"links":{"citing_paper":"/paper/2505.24336"},"observation_digest":"sha256:fb044775fe3172e264961c8ee2c0c2b630d24fa85ffbf5bb0afcd60455cd51bc","observation_id":"e408e754-2ed8-4c3b-b63d-c526218b226c","resolution":{"observed_at":"2026-08-07T12:30:41.665000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:30:41.268916Z","title":"PESTO: Pitch estimation with self-supervised transposition-equivariant objec- tive,","venue":null,"work_id":"5e697655-e18f-4c00-8e52-81a31652d862","year":2023},"citing_paper":{"arxiv_id":"2505.24336","last_updated":"2025-05-30T08:24:41Z","snapshot_observed_at":"2026-08-07T12:22:45.083507Z","submitted_at":"2025-05-30T08:24:41Z","title":"When Humans Growl and Birds Speak: High-Fidelity Voice Conversion from Human to Animal and Designed Sounds","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:39.796020Z"},"links":{"citing_paper":"/paper/2505.24336"},"observation_digest":"sha256:70179b9b12a32fdafb5d0ff0593e955338c33d262837e85831661f64d11bd61f","observation_id":"c8d0484b-7abb-4003-a8ba-58bd678d2958","resolution":{"observed_at":"2026-08-07T12:30:41.417805Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:30:40.950253Z","title":"Autoencoding beyond pixels using a learned similarity metric,","venue":null,"work_id":"91577596-c078-463a-bb93-65fd44ea8e5e","year":2016},"citing_paper":{"arxiv_id":"2505.24336","last_updated":"2025-05-30T08:24:41Z","snapshot_observed_at":"2026-08-07T12:22:45.083507Z","submitted_at":"2025-05-30T08:24:41Z","title":"When Humans Growl and Birds Speak: High-Fidelity Voice Conversion from Human to Animal and Designed Sounds","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:39.852908Z"},"links":{"citing_paper":"/paper/2505.24336"},"observation_digest":"sha256:090183b8b13534ecd65d87a27017e8a1a93ac8212da8e1cc99f182f35b14f8f7","observation_id":"e0481ced-f44c-401f-bd49-53ffd9c136ea","resolution":{"observed_at":"2026-08-07T12:30:41.141141Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:30:40.940057Z","title":"Least squares generative adversarial networks,","venue":null,"work_id":"a4d6d8d1-eccc-4666-afb9-cf46a5cc7958","year":2017},"citing_paper":{"arxiv_id":"2505.24336","last_updated":"2025-05-30T08:24:41Z","snapshot_observed_at":"2026-08-07T12:22:45.083507Z","submitted_at":"2025-05-30T08:24:41Z","title":"When Humans Growl and Birds Speak: High-Fidelity Voice Conversion from Human to Animal and Designed Sounds","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:39.952430Z"},"links":{"citing_paper":"/paper/2505.24336"},"observation_digest":"sha256:a7db45748621318a4e592576034d21c15c045ae0b6121a29eea821c81d3aec62","observation_id":"70e3a205-8925-49ed-9247-09f0d98c6cf3","resolution":{"observed_at":"2026-08-07T12:30:40.942889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:30:40.830075Z","title":"Learning discourse-level di- versity for neural dialog models using conditional variational au- toencoders,","venue":null,"work_id":"b31abbe3-a02d-4d3d-b25b-5010c5f61648","year":2017},"citing_paper":{"arxiv_id":"2505.24336","last_updated":"2025-05-30T08:24:41Z","snapshot_observed_at":"2026-08-07T12:22:45.083507Z","submitted_at":"2025-05-30T08:24:41Z","title":"When Humans Growl and Birds Speak: High-Fidelity Voice Conversion from Human to Animal and Designed Sounds","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:40.022568Z"},"links":{"citing_paper":"/paper/2505.24336"},"observation_digest":"sha256:d57ad0025b7be720c52bbcde8f0eea64d1bd523bfdeee38197c55921fb46cede","observation_id":"dae955db-4b70-4757-9a85-fbd62b8fafdc","resolution":{"observed_at":"2026-08-07T12:30:40.875316Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:30:40.695569Z","title":"Pro sound effects - core 6 library","venue":null,"work_id":"b37c19b9-69b9-4755-8660-edc002ca5b56","year":null},"citing_paper":{"arxiv_id":"2505.24336","last_updated":"2025-05-30T08:24:41Z","snapshot_observed_at":"2026-08-07T12:22:45.083507Z","submitted_at":"2025-05-30T08:24:41Z","title":"When Humans Growl and Birds Speak: High-Fidelity Voice Conversion from Human to Animal and Designed Sounds","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:40.077343Z"},"links":{"citing_paper":"/paper/2505.24336"},"observation_digest":"sha256:d3d2b030df892a7c908f5162f55fadae596b099d5de47a0a5f8bab07fc2130d3","observation_id":"a32ec00f-3a89-454b-aebd-ceb903e25868","resolution":{"observed_at":"2026-08-07T12:30:40.754692Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:30:40.561498Z","title":"Robust speech recognition via large-scale weak su- pervision,","venue":null,"work_id":"74b79540-f12a-493f-a403-e28e108f5c68","year":2023},"citing_paper":{"arxiv_id":"2505.24336","last_updated":"2025-05-30T08:24:41Z","snapshot_observed_at":"2026-08-07T12:22:45.083507Z","submitted_at":"2025-05-30T08:24:41Z","title":"When Humans Growl and Birds Speak: High-Fidelity Voice Conversion from Human to Animal and Designed Sounds","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:40.153968Z"},"links":{"citing_paper":"/paper/2505.24336"},"observation_digest":"sha256:6ee7f8687cd89fedc08d84880a7c77bc402d8d909c61247d5f3f724ec506d231","observation_id":"2ffab1d5-8140-435e-9450-43d62567711c","resolution":{"observed_at":"2026-08-07T12:30:40.611219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:30:40.436278Z","title":"HiFi-GAN: Generative adversarial networks for efficient and high fidelity speech synthesis,","venue":null,"work_id":"9368f95c-c4c0-498e-a069-c664c242b5d0","year":2020},"citing_paper":{"arxiv_id":"2505.24336","last_updated":"2025-05-30T08:24:41Z","snapshot_observed_at":"2026-08-07T12:22:45.083507Z","submitted_at":"2025-05-30T08:24:41Z","title":"When Humans Growl and Birds Speak: High-Fidelity Voice Conversion from Human to Animal and Designed Sounds","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:40.211506Z"},"links":{"citing_paper":"/paper/2505.24336"},"observation_digest":"sha256:28c3dbbb38d07abd582a452e7889d3e4e6bcfa287a8ad9e01a0fd150f5da1f76","observation_id":"bcabf7a6-6a07-4780-a4e3-01db46a49f3f","resolution":{"observed_at":"2026-08-07T12:30:40.497679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.24336","last_updated":"2025-05-30T08:24:41Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-07T12:22:45.083507Z","submitted_at":"2025-05-30T08:24:41Z","title":"When Humans Growl and Birds Speak: High-Fidelity Voice Conversion from Human to Animal and Designed Sounds"},"reference_resolution":{"displayed":36,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":2,"verified_exact":0,"verified_fuzzy":32},"total_outbound_references":36},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 1 inbound Pith citation observation for arXiv:2505.24336."}