{"as_of":"2026-08-22T07:28:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a1ffecc44220af48ebcfb372a16bdf980e8b73d0a29db0b8f267aa59904233cb","coverage":[{"denominator":29,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T08:57:41.015800Z","state":"measured"},{"denominator":30,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":30,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T08:57:38.957612Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2607.20951","last_updated":"2026-07-23T06:04:10Z","snapshot_observed_at":"2026-08-14T19:57:11.361105Z","submitted_at":"2026-07-23T06:04:10Z","title":"Designed Vocalizations Dataset: Sound-Designed Human and Animal Voices for Non-human Voice Conversion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.20951","snapshot_observed_at":"2026-08-01T08:57:38.957612Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.20951","last_updated":"2026-07-23T06:04:10Z","snapshot_observed_at":"2026-08-14T19:57:11.361105Z","submitted_at":"2026-07-23T06:04:10Z","title":"Designed Vocalizations Dataset: Sound-Designed Human and Animal Voices for Non-human Voice Conversion","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T08:57:38.957612Z"},"links":{"cited_paper":"/paper/2607.20951","citing_paper":"/paper/2607.20951"},"observation_digest":"sha256:0a45a4ff8113c2f450db2ebc91617b5aa5e204fbc1054c5d58e228fe240f49f0","observation_id":"db0ef954-6acb-451c-be74-158df5ec607b","resolution":{"observed_at":"2026-08-01T08:57:38.957612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2607.20951/citation-record","integrity":"/paper/2607.20951/integrity","json":"/paper/2607.20951/citation-record.json","paper":"/paper/2607.20951"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2607.20951","last_updated":"2026-07-23T06:04:10Z","snapshot_observed_at":"2026-08-14T19:57:11.361105Z","submitted_at":"2026-07-23T06:04:10Z","title":"Designed Vocalizations Dataset: Sound-Designed Human and Animal Voices for Non-human Voice Conversion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.20951","snapshot_observed_at":"2026-08-01T08:57:38.957612Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.20951","last_updated":"2026-07-23T06:04:10Z","snapshot_observed_at":"2026-08-14T19:57:11.361105Z","submitted_at":"2026-07-23T06:04:10Z","title":"Designed Vocalizations Dataset: Sound-Designed Human and Animal Voices for Non-human Voice Conversion","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T08:57:38.957612Z"},"links":{"cited_paper":"/paper/2607.20951","citing_paper":"/paper/2607.20951"},"observation_digest":"sha256:0a45a4ff8113c2f450db2ebc91617b5aa5e204fbc1054c5d58e228fe240f49f0","observation_id":"db0ef954-6acb-451c-be74-158df5ec607b","resolution":{"observed_at":"2026-08-01T08:57:38.957612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:57:39.036247Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20951","last_updated":"2026-07-23T06:04:10Z","snapshot_observed_at":"2026-08-14T19:57:11.361105Z","submitted_at":"2026-07-23T06:04:10Z","title":"Designed Vocalizations Dataset: Sound-Designed Human and Animal Voices for Non-human Voice Conversion","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T08:57:39.036247Z"},"links":{"citing_paper":"/paper/2607.20951"},"observation_digest":"sha256:19e002c635de3f1dd5d775596574e12b7cdda1ff3bf879e9ba4876459612b2d6","observation_id":"15f88e8d-1b25-4ea3-97d5-f4f3af235d39","resolution":{"observed_at":"2026-08-01T08:57:39.036247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:57:39.120104Z","title":"The experiments assessed model performance on the four seen/unseen combinations of sourcex s and reference xr =x (p) using the test set, following training on the train- ing set","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20951","last_updated":"2026-07-23T06:04:10Z","snapshot_observed_at":"2026-08-14T19:57:11.361105Z","submitted_at":"2026-07-23T06:04:10Z","title":"Designed Vocalizations Dataset: Sound-Designed Human and Animal Voices for Non-human Voice Conversion","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T08:57:39.120104Z"},"links":{"citing_paper":"/paper/2607.20951"},"observation_digest":"sha256:b26fe512eca3bb185619db8e704c96cf319c26823f89bcdb3519770a2a62f4ec","observation_id":"051019da-42f9-46a2-bddb-b71140df6a91","resolution":{"observed_at":"2026-08-01T08:57:39.120104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:57:39.206188Z","title":"The dataset in- cludes raw audio and preset-specific designed variants gener- ated through sound-design operators, covering diverse linguistic and non-linguistic sources","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20951","last_updated":"2026-07-23T06:04:10Z","snapshot_observed_at":"2026-08-14T19:57:11.361105Z","submitted_at":"2026-07-23T06:04:10Z","title":"Designed Vocalizations Dataset: Sound-Designed Human and Animal Voices for Non-human Voice Conversion","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T08:57:39.206188Z"},"links":{"citing_paper":"/paper/2607.20951"},"observation_digest":"sha256:3839add3d1d07571c563b9d2297af933d478adb9fc61df5b283985a4f8efe08a","observation_id":"f59ee706-1af8-4933-b177-1f22d4d9501f","resolution":{"observed_at":"2026-08-01T08:57:39.206188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:57:39.300620Z","title":"RS-2025- 25441313, Professional AI Talent Development Program for Multimodal AI Agents, Contribution: 50%)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20951","last_updated":"2026-07-23T06:04:10Z","snapshot_observed_at":"2026-08-14T19:57:11.361105Z","submitted_at":"2026-07-23T06:04:10Z","title":"Designed Vocalizations Dataset: Sound-Designed Human and Animal Voices for Non-human Voice Conversion","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T08:57:39.300620Z"},"links":{"citing_paper":"/paper/2607.20951"},"observation_digest":"sha256:3ccac19fc0163e4d78249a5367e049a87c940db983975c4bcf833db30dc49a5f","observation_id":"593894c0-3926-4da9-9b04-1e1d95d07344","resolution":{"observed_at":"2026-08-01T08:57:39.300620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:57:39.414624Z","title":"The scientific content, analysis, and conclusions were developed by the authors","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20951","last_updated":"2026-07-23T06:04:10Z","snapshot_observed_at":"2026-08-14T19:57:11.361105Z","submitted_at":"2026-07-23T06:04:10Z","title":"Designed Vocalizations Dataset: Sound-Designed Human and Animal Voices for Non-human Voice Conversion","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T08:57:39.414624Z"},"links":{"citing_paper":"/paper/2607.20951"},"observation_digest":"sha256:6cb04143da53d502b87c276114ec4607c36aad409a69f56abf07ddd3abd284d3","observation_id":"bf667cdd-f6c7-4d0a-9a1f-e3d438921604","resolution":{"observed_at":"2026-08-01T08:57:39.414624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:57:39.500161Z","title":"Speak like a dog: Human to non-human creature voice conversion,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.20951","last_updated":"2026-07-23T06:04:10Z","snapshot_observed_at":"2026-08-14T19:57:11.361105Z","submitted_at":"2026-07-23T06:04:10Z","title":"Designed Vocalizations Dataset: Sound-Designed Human and Animal Voices for Non-human Voice Conversion","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T08:57:39.500161Z"},"links":{"citing_paper":"/paper/2607.20951"},"observation_digest":"sha256:76519a529ac17c5034b1955f88dc6680f1ef524e236d11859bc02674a50d7118","observation_id":"1ceec710-28fe-4844-8cea-c06ab3379490","resolution":{"observed_at":"2026-08-01T08:57:39.500161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.24963/ijcai.2025/1135","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ai-assisted human-pet artistic musical co-creation for wellness therapy,","venue":null,"work_id":"b1e9fe80-de61-41dd-a075-11bd5e82123c","year":2025},"citing_paper":{"arxiv_id":"2607.20951","last_updated":"2026-07-23T06:04:10Z","snapshot_observed_at":"2026-08-14T19:57:11.361105Z","submitted_at":"2026-07-23T06:04:10Z","title":"Designed Vocalizations Dataset: Sound-Designed Human and Animal Voices for Non-human Voice Conversion","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T08:57:39.612881Z"},"links":{"citing_paper":"/paper/2607.20951"},"observation_digest":"sha256:dbc196a6ce2b75fb8ec2dbde0dd9e3616184b8fbc4ab9cae14b0417d39a1e23f","observation_id":"6f2899f6-01ed-416d-aced-8c7f40098eef","resolution":{"observed_at":"2026-08-01T08:58:18.734855Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:57:39.694495Z","title":"When humans growl and birds speak: High-fidelity voice conversion from human to animal and designed sounds,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20951","last_updated":"2026-07-23T06:04:10Z","snapshot_observed_at":"2026-08-14T19:57:11.361105Z","submitted_at":"2026-07-23T06:04:10Z","title":"Designed Vocalizations Dataset: Sound-Designed Human and Animal Voices for Non-human Voice Conversion","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T08:57:39.694495Z"},"links":{"citing_paper":"/paper/2607.20951"},"observation_digest":"sha256:0994d5a53fbf5d98f7e456b158808eb49475cbec6e812098105fa80cdde07643","observation_id":"1144d8a0-7adc-41d8-ac45-9783f7f3d21e","resolution":{"observed_at":"2026-08-01T08:57:39.694495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:57:39.775443Z","title":"Cartoonsing: Unifying human and nonhuman timbres in singing generation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20951","last_updated":"2026-07-23T06:04:10Z","snapshot_observed_at":"2026-08-14T19:57:11.361105Z","submitted_at":"2026-07-23T06:04:10Z","title":"Designed Vocalizations Dataset: Sound-Designed Human and Animal Voices for Non-human Voice Conversion","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T08:57:39.775443Z"},"links":{"citing_paper":"/paper/2607.20951"},"observation_digest":"sha256:c2438e5bd6a429c970c0b10c5363e8e8a260f6f9db33a7ca021918c46d455015","observation_id":"37fa11f5-8eee-4cec-be53-b6045c1b30d0","resolution":{"observed_at":"2026-08-01T08:57:39.775443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:57:39.838048Z","title":"Cstr vctk corpus: English multi-speaker corpus for cstr voice cloning toolkit,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.20951","last_updated":"2026-07-23T06:04:10Z","snapshot_observed_at":"2026-08-14T19:57:11.361105Z","submitted_at":"2026-07-23T06:04:10Z","title":"Designed Vocalizations Dataset: Sound-Designed Human and Animal Voices for Non-human Voice Conversion","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T08:57:39.838048Z"},"links":{"citing_paper":"/paper/2607.20951"},"observation_digest":"sha256:6748dbff9634a53430a5f2aac53539e8eae75f7779391d0ce87a8d9f50bcbd37","observation_id":"793b03e8-ea3c-4056-8974-2bb816976678","resolution":{"observed_at":"2026-08-01T08:57:39.838048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.02882","last_updated":"2019-04-05T06:05:00Z","snapshot_observed_at":"2026-08-15T16:44:02.859541Z","submitted_at":"2019-04-05T06:05:00Z","title":"LibriTTS: A Corpus Derived from LibriSpeech for Text-to-Speech","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.02882","snapshot_observed_at":"2026-08-01T08:57:39.910949Z","title":"Libritts: A corpus derived from librispeech for text- to-speech,","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2607.20951","last_updated":"2026-07-23T06:04:10Z","snapshot_observed_at":"2026-08-14T19:57:11.361105Z","submitted_at":"2026-07-23T06:04:10Z","title":"Designed Vocalizations Dataset: Sound-Designed Human and Animal Voices for Non-human Voice Conversion","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T08:57:39.910949Z"},"links":{"cited_paper":"/paper/1904.02882","citing_paper":"/paper/2607.20951"},"observation_digest":"sha256:ff6118f57398e7ee7ab60f48dd08b48fde7f13f488b690c4c1e79f06a3a172ec","observation_id":"cbb2ffe4-b744-4ad8-a5a3-a5177518c525","resolution":{"observed_at":"2026-08-01T08:57:39.910949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:57:39.984092Z","title":"Libri-light: A benchmark for asr with limited or no su- pervision,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.20951","last_updated":"2026-07-23T06:04:10Z","snapshot_observed_at":"2026-08-14T19:57:11.361105Z","submitted_at":"2026-07-23T06:04:10Z","title":"Designed Vocalizations Dataset: Sound-Designed Human and Animal Voices for Non-human Voice Conversion","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T08:57:39.984092Z"},"links":{"citing_paper":"/paper/2607.20951"},"observation_digest":"sha256:b445216363057d704e5cd91e235943397eadecf95ac93046c176e20a1fb07b64","observation_id":"60afadfa-bd4f-4d70-b88f-0ed7d2ae4e28","resolution":{"observed_at":"2026-08-01T08:57:39.984092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.01497","last_updated":"2021-06-14T19:20:10Z","snapshot_observed_at":"2026-08-21T20:45:43.127433Z","submitted_at":"2021-04-03T23:19:50Z","title":"Hi-Fi Multi-Speaker English TTS Dataset","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.01497","snapshot_observed_at":"2026-08-01T08:57:40.034274Z","title":"Hi-fi multi-speaker english tts dataset,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.20951","last_updated":"2026-07-23T06:04:10Z","snapshot_observed_at":"2026-08-14T19:57:11.361105Z","submitted_at":"2026-07-23T06:04:10Z","title":"Designed Vocalizations Dataset: Sound-Designed Human and Animal Voices for Non-human Voice Conversion","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T08:57:40.034274Z"},"links":{"cited_paper":"/paper/2104.01497","citing_paper":"/paper/2607.20951"},"observation_digest":"sha256:6d268cb0311ea8b39536b2a1438ff6b6f5f3678ab26f657782eddafb396f9ba1","observation_id":"0c4ec660-1768-463d-8887-34e4cb624f23","resolution":{"observed_at":"2026-08-01T08:57:40.034274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:57:40.144985Z","title":"Natural tts synthesis by conditioning wavenet on mel spectrogram pre- dictions,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.20951","last_updated":"2026-07-23T06:04:10Z","snapshot_observed_at":"2026-08-14T19:57:11.361105Z","submitted_at":"2026-07-23T06:04:10Z","title":"Designed Vocalizations Dataset: Sound-Designed Human and Animal Voices for Non-human Voice Conversion","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T08:57:40.144985Z"},"links":{"citing_paper":"/paper/2607.20951"},"observation_digest":"sha256:cb1be9ad33247cf70d3a93b5e7ec1409ec43eea050f2a0133d9f74462069f8f8","observation_id":"80d95c99-fb0b-480a-a397-11d413eb16be","resolution":{"observed_at":"2026-08-01T08:57:40.144985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04558","last_updated":"2022-08-08T01:53:05Z","snapshot_observed_at":"2026-08-20T03:31:53.345681Z","submitted_at":"2020-06-08T13:05:40Z","title":"FastSpeech 2: Fast and High-Quality End-to-End Text to Speech","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.04558","snapshot_observed_at":"2026-08-01T08:57:40.230200Z","title":"Fastspeech 2: Fast and high-quality end-to-end text to speech,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2607.20951","last_updated":"2026-07-23T06:04:10Z","snapshot_observed_at":"2026-08-14T19:57:11.361105Z","submitted_at":"2026-07-23T06:04:10Z","title":"Designed Vocalizations Dataset: Sound-Designed Human and Animal Voices for Non-human Voice Conversion","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T08:57:40.230200Z"},"links":{"cited_paper":"/paper/2006.04558","citing_paper":"/paper/2607.20951"},"observation_digest":"sha256:d3f46507e8067a947467feb55caca82721eeb9244933819db9710547d0a740ba","observation_id":"d0c683b4-48b1-4d44-8145-b7b42e8bd38a","resolution":{"observed_at":"2026-08-01T08:57:40.230200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:57:40.280776Z","title":"Conditional variational autoencoder with adversarial learning for end-to-end text-to-speech,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.20951","last_updated":"2026-07-23T06:04:10Z","snapshot_observed_at":"2026-08-14T19:57:11.361105Z","submitted_at":"2026-07-23T06:04:10Z","title":"Designed Vocalizations Dataset: Sound-Designed Human and Animal Voices for Non-human Voice Conversion","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T08:57:40.280776Z"},"links":{"citing_paper":"/paper/2607.20951"},"observation_digest":"sha256:7795f53c126d0967248788c1d6239094c5b4c282ab8958b962088e4614febac0","observation_id":"20d865b3-da13-42d9-9b48-84dc2c9eb5f8","resolution":{"observed_at":"2026-08-01T08:57:40.280776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:57:40.344794Z","title":"Yourtts: Towards zero-shot multi-speaker tts and zero-shot voice conversion for everyone,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.20951","last_updated":"2026-07-23T06:04:10Z","snapshot_observed_at":"2026-08-14T19:57:11.361105Z","submitted_at":"2026-07-23T06:04:10Z","title":"Designed Vocalizations Dataset: Sound-Designed Human and Animal Voices for Non-human Voice Conversion","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T08:57:40.344794Z"},"links":{"citing_paper":"/paper/2607.20951"},"observation_digest":"sha256:8f3c2683671fcb74cc9eb210972b99010946bd19e249275dc928a5ed5557c2f7","observation_id":"f9a22e12-cc4b-4fce-b4a7-5872891e0f9a","resolution":{"observed_at":"2026-08-01T08:57:40.344794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:57:40.401540Z","title":"Freevc: Towards high-quality text-free one-shot voice conversion,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.20951","last_updated":"2026-07-23T06:04:10Z","snapshot_observed_at":"2026-08-14T19:57:11.361105Z","submitted_at":"2026-07-23T06:04:10Z","title":"Designed Vocalizations Dataset: Sound-Designed Human and Animal Voices for Non-human Voice Conversion","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T08:57:40.401540Z"},"links":{"citing_paper":"/paper/2607.20951"},"observation_digest":"sha256:88aacb2e104c30f8258fc981a0489b09c906a432b4218b087d7fd420ede62b35","observation_id":"5c022861-d44f-439c-9d20-6c63466a45e7","resolution":{"observed_at":"2026-08-01T08:57:40.401540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:57:40.503856Z","title":"Hiervst: Hierarchical adap- tive zero-shot voice style transfer,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.20951","last_updated":"2026-07-23T06:04:10Z","snapshot_observed_at":"2026-08-14T19:57:11.361105Z","submitted_at":"2026-07-23T06:04:10Z","title":"Designed Vocalizations Dataset: Sound-Designed Human and Animal Voices for Non-human Voice Conversion","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T08:57:40.503856Z"},"links":{"citing_paper":"/paper/2607.20951"},"observation_digest":"sha256:290d67261cdfcc37e4d6fcb9f1e68ae0034c0a9655ffbaf1518556a3db5a0d83","observation_id":"a057cb02-5773-45ea-9a64-40046e056c16","resolution":{"observed_at":"2026-08-01T08:57:40.503856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:57:40.555395Z","title":"Diff-hiervc: Diffusion-based hierar- chical voice conversion with robust pitch generation and masked prior for zero-shot speaker adaptation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.20951","last_updated":"2026-07-23T06:04:10Z","snapshot_observed_at":"2026-08-14T19:57:11.361105Z","submitted_at":"2026-07-23T06:04:10Z","title":"Designed Vocalizations Dataset: Sound-Designed Human and Animal Voices for Non-human Voice Conversion","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T08:57:40.555395Z"},"links":{"citing_paper":"/paper/2607.20951"},"observation_digest":"sha256:9f4e6e889849e5630b0d898ce339c1751eb50b00a6dffcd300922e8c754f321e","observation_id":"fdae1ef9-568e-4abf-90f2-275fe77d8098","resolution":{"observed_at":"2026-08-01T08:57:40.555395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:57:40.623523Z","title":"Dddm-vc: Decoupled denoising dif- fusion models with disentangled representation and prior mixup for verified robust voice conversion,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20951","last_updated":"2026-07-23T06:04:10Z","snapshot_observed_at":"2026-08-14T19:57:11.361105Z","submitted_at":"2026-07-23T06:04:10Z","title":"Designed Vocalizations Dataset: Sound-Designed Human and Animal Voices for Non-human Voice Conversion","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T08:57:40.623523Z"},"links":{"citing_paper":"/paper/2607.20951"},"observation_digest":"sha256:e0354ee4a8c3cb200e78fbca7196884f2ec8e26c1d84a5f2aedb0c2041943105","observation_id":"c6a4aa27-03e1-4842-a9ea-0ce169265804","resolution":{"observed_at":"2026-08-01T08:57:40.623523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:57:40.663277Z","title":"Dehumaniser 2,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20951","last_updated":"2026-07-23T06:04:10Z","snapshot_observed_at":"2026-08-14T19:57:11.361105Z","submitted_at":"2026-07-23T06:04:10Z","title":"Designed Vocalizations Dataset: Sound-Designed Human and Animal Voices for Non-human Voice Conversion","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T08:57:40.663277Z"},"links":{"citing_paper":"/paper/2607.20951"},"observation_digest":"sha256:0544f5e5c508870640df43f781e55fe2c860691406769a8ee772aac1e6bc6438","observation_id":"93a88d64-2b22-4b1b-b43a-123f6ca52a72","resolution":{"observed_at":"2026-08-01T08:57:40.663277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:57:40.726035Z","title":"Cubase 12 pro,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20951","last_updated":"2026-07-23T06:04:10Z","snapshot_observed_at":"2026-08-14T19:57:11.361105Z","submitted_at":"2026-07-23T06:04:10Z","title":"Designed Vocalizations Dataset: Sound-Designed Human and Animal Voices for Non-human Voice Conversion","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T08:57:40.726035Z"},"links":{"citing_paper":"/paper/2607.20951"},"observation_digest":"sha256:6ef268e75d182f9df9b2174c999fcac643c5d8363466a50ba247702f37559f9b","observation_id":"d3e89e7e-e71e-4a87-82f1-0b82b29f7774","resolution":{"observed_at":"2026-08-01T08:57:40.726035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:57:40.783472Z","title":"Freesound datasets: a platform for the creation of open audio datasets,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.20951","last_updated":"2026-07-23T06:04:10Z","snapshot_observed_at":"2026-08-14T19:57:11.361105Z","submitted_at":"2026-07-23T06:04:10Z","title":"Designed Vocalizations Dataset: Sound-Designed Human and Animal Voices for Non-human Voice Conversion","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T08:57:40.783472Z"},"links":{"citing_paper":"/paper/2607.20951"},"observation_digest":"sha256:9d97c331d5d0af2b4a4ed4ebe37eaf175c0dcbbe32929c03db2e3d98ec66ada0","observation_id":"456411ab-7685-4a32-94ae-9c8bf1fd4f03","resolution":{"observed_at":"2026-08-01T08:57:40.783472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:57:40.848500Z","title":"High-fidelity audio compression with improved rvqgan,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.20951","last_updated":"2026-07-23T06:04:10Z","snapshot_observed_at":"2026-08-14T19:57:11.361105Z","submitted_at":"2026-07-23T06:04:10Z","title":"Designed Vocalizations Dataset: Sound-Designed Human and Animal Voices for Non-human Voice Conversion","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T08:57:40.848500Z"},"links":{"citing_paper":"/paper/2607.20951"},"observation_digest":"sha256:bdfe6698acc7273a4f5843adfb53d1f2ffef15fb5bc08e09b94b4b4225df7d4c","observation_id":"d2fd2a91-f5a8-40ae-8901-be636268fbd9","resolution":{"observed_at":"2026-08-01T08:57:40.848500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:57:40.903670Z","title":"BEATs: Audio pre-training with acoustic tokenizers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.20951","last_updated":"2026-07-23T06:04:10Z","snapshot_observed_at":"2026-08-14T19:57:11.361105Z","submitted_at":"2026-07-23T06:04:10Z","title":"Designed Vocalizations Dataset: Sound-Designed Human and Animal Voices for Non-human Voice Conversion","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T08:57:40.903670Z"},"links":{"citing_paper":"/paper/2607.20951"},"observation_digest":"sha256:cd92bf74ae00efd3b65e9e9876b0e967fdbe08f5023d740f65bd730ea5052a28","observation_id":"7dcfb2ee-e89a-494d-bece-fd29b75b586f","resolution":{"observed_at":"2026-08-01T08:57:40.903670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:57:40.958939Z","title":"SALMONN: Towards generic hearing abilities for large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20951","last_updated":"2026-07-23T06:04:10Z","snapshot_observed_at":"2026-08-14T19:57:11.361105Z","submitted_at":"2026-07-23T06:04:10Z","title":"Designed Vocalizations Dataset: Sound-Designed Human and Animal Voices for Non-human Voice Conversion","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T08:57:40.958939Z"},"links":{"citing_paper":"/paper/2607.20951"},"observation_digest":"sha256:ba49d247e6c365f872691fd061ac2c6dddc83480989c90577e7f41feef7cdec7","observation_id":"8a3178cb-68dc-4196-bb47-a2b9f0436af3","resolution":{"observed_at":"2026-08-01T08:57:40.958939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:57:41.015800Z","title":"Robust speech recognition via large-scale weak su- pervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.20951","last_updated":"2026-07-23T06:04:10Z","snapshot_observed_at":"2026-08-14T19:57:11.361105Z","submitted_at":"2026-07-23T06:04:10Z","title":"Designed Vocalizations Dataset: Sound-Designed Human and Animal Voices for Non-human Voice Conversion","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-01T08:57:41.015800Z"},"links":{"citing_paper":"/paper/2607.20951"},"observation_digest":"sha256:f515c4c545af07cafdcd41e9afc854ccdecf0549ee4e9630f25f16130d02683a","observation_id":"b08caead-7770-44e2-bb24-01fdd9c45c2c","resolution":{"observed_at":"2026-08-01T08:57:41.015800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.20951","last_updated":"2026-07-23T06:04:10Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-14T19:57:11.361105Z","submitted_at":"2026-07-23T06:04:10Z","title":"Designed Vocalizations Dataset: Sound-Designed Human and Animal Voices for Non-human Voice Conversion"},"reference_resolution":{"displayed":29,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":28,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":29},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 29 of 29 outbound references and 1 inbound Pith citation observation for arXiv:2607.20951."}