{"as_of":"2026-08-13T02:05:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c8867079f3fdd04305d232f2a7c226a5491d359bee9d2d835602a31ab926c2ff","coverage":[{"denominator":11,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":11,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T18:01:14.189712Z","state":"measured"},{"denominator":11,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":11,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.08312/citation-record","integrity":"/paper/2412.08312/integrity","json":"/paper/2412.08312/citation-record.json","paper":"/paper/2412.08312"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21437/interspeech.2020-3056","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:01:14.235563Z","title":"V oice Conversion Using Speech-to-Speech Neuro-Style Transfer,","venue":null,"work_id":"c1cbba4e-51cc-453e-a28d-8dc8917e893e","year":2020},"citing_paper":{"arxiv_id":"2412.08312","last_updated":"2024-12-11T11:47:39Z","snapshot_observed_at":"2026-08-11T17:55:24.067349Z","submitted_at":"2024-12-11T11:47:39Z","title":"A Unified Model For Voice and Accent Conversion In Speech and Singing using Self-Supervised Learning and Feature Extraction","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T18:01:14.150058Z"},"links":{"citing_paper":"/paper/2412.08312"},"observation_digest":"sha256:554a39732330567dda25c85de88defcad8cb6ec84745b40a70e8592c6afaef98","observation_id":"affa0bbf-aa0c-41c6-9d4c-edc366dbaa46","resolution":{"observed_at":"2026-08-11T18:01:14.239345Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.5120/ijca2015906965","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:01:14.222852Z","title":"Hidden Markov Model based Speech Synthesis: A Review,","venue":null,"work_id":"fd987782-44a1-4d39-ba5c-71aed1a24aa0","year":2015},"citing_paper":{"arxiv_id":"2412.08312","last_updated":"2024-12-11T11:47:39Z","snapshot_observed_at":"2026-08-11T17:55:24.067349Z","submitted_at":"2024-12-11T11:47:39Z","title":"A Unified Model For Voice and Accent Conversion In Speech and Singing using Self-Supervised Learning and Feature Extraction","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T18:01:14.155113Z"},"links":{"citing_paper":"/paper/2412.08312"},"observation_digest":"sha256:429af24faecb07dff4897618d959c9431912788a5bb4c294a4a10b07652cd769","observation_id":"65d994bd-5d78-46e2-81c0-712836bda15b","resolution":{"observed_at":"2026-08-11T18:01:14.228230Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:01:14.158669Z","title":"Phoneme independent HMM voice conversion,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2412.08312","last_updated":"2024-12-11T11:47:39Z","snapshot_observed_at":"2026-08-11T17:55:24.067349Z","submitted_at":"2024-12-11T11:47:39Z","title":"A Unified Model For Voice and Accent Conversion In Speech and Singing using Self-Supervised Learning and Feature Extraction","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T18:01:14.158669Z"},"links":{"citing_paper":"/paper/2412.08312"},"observation_digest":"sha256:83321164e712b22388b7c2f6c1023e4cf368ef4d5281e1b8d8d99433c2d388b3","observation_id":"7c77385d-2cfa-4a3e-87ab-510a47805779","resolution":{"observed_at":"2026-08-11T18:01:14.158669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2008.05289","last_updated":"2020-08-09T13:54:46Z","snapshot_observed_at":"2026-08-10T10:14:57.271484Z","submitted_at":"2020-08-09T13:54:46Z","title":"Speaker Conditional WaveRNN: Towards Universal Neural Vocoder for Unseen Speaker and Recording Conditions","version":1},"cited_work":{"arxiv_id":"2008.05289","doi":null,"metadata_source":"pith","pith_arxiv_id":"2008.05289","snapshot_observed_at":"2026-08-11T18:01:14.550851Z","title":"Speaker Conditional WaveRNN: Towards Universal Neural Vocoder for Unseen Speaker and Recording Conditions","venue":"eess.AS","work_id":"f8376418-4652-425c-a073-6fc91ecae29b","year":2020},"citing_paper":{"arxiv_id":"2412.08312","last_updated":"2024-12-11T11:47:39Z","snapshot_observed_at":"2026-08-11T17:55:24.067349Z","submitted_at":"2024-12-11T11:47:39Z","title":"A Unified Model For Voice and Accent Conversion In Speech and Singing using Self-Supervised Learning and Feature Extraction","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T18:01:14.169233Z"},"links":{"cited_paper":"/paper/2008.05289","citing_paper":"/paper/2412.08312"},"observation_digest":"sha256:c34456f88907c13d275a0c921b879ba6a8dfb0c187d9ed3e0236375def7b8f51","observation_id":"90bfa4a8-776e-4ceb-8586-f4d93b773065","resolution":{"observed_at":"2026-08-11T18:01:14.554582Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:01:14.660691Z","title":"Hifi-gan: Generative adversarial networks for efficient and high fidelity speech synthesis,","venue":null,"work_id":"bbba09c4-a705-4035-bd2e-98c0c1941ac1","year":2020},"citing_paper":{"arxiv_id":"2412.08312","last_updated":"2024-12-11T11:47:39Z","snapshot_observed_at":"2026-08-11T17:55:24.067349Z","submitted_at":"2024-12-11T11:47:39Z","title":"A Unified Model For Voice and Accent Conversion In Speech and Singing using Self-Supervised Learning and Feature Extraction","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T18:01:14.172936Z"},"links":{"citing_paper":"/paper/2412.08312"},"observation_digest":"sha256:43aef2e31ae051bceef2cf133bde768dc23a37ba8e0e2153621294890aa5c207","observation_id":"1e29502a-4ac9-4648-9efb-8095c9b5a254","resolution":{"observed_at":"2026-08-11T18:01:14.664464Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:01:14.176542Z","title":"Pitchnet: Unsupervised Singing V oice Conversion with Pitch Adversarial Network,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.08312","last_updated":"2024-12-11T11:47:39Z","snapshot_observed_at":"2026-08-11T17:55:24.067349Z","submitted_at":"2024-12-11T11:47:39Z","title":"A Unified Model For Voice and Accent Conversion In Speech and Singing using Self-Supervised Learning and Feature Extraction","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T18:01:14.176542Z"},"links":{"citing_paper":"/paper/2412.08312"},"observation_digest":"sha256:750534f36f8e72551bf628a761c34e89958445c8406ecc2bc5411a594340c11e","observation_id":"81cec743-1e60-4d39-9f40-b9812f65c084","resolution":{"observed_at":"2026-08-11T18:01:14.176542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:01:14.180207Z","title":"The Singing V oice Conversion Challenge 2023,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08312","last_updated":"2024-12-11T11:47:39Z","snapshot_observed_at":"2026-08-11T17:55:24.067349Z","submitted_at":"2024-12-11T11:47:39Z","title":"A Unified Model For Voice and Accent Conversion In Speech and Singing using Self-Supervised Learning and Feature Extraction","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T18:01:14.180207Z"},"links":{"citing_paper":"/paper/2412.08312"},"observation_digest":"sha256:8a42576a0eeb14aef14ebebfef12e99da0f61c745cf0595b7dfdde607db862f8","observation_id":"1c988329-89a3-4978-b8d4-eddebdb09724","resolution":{"observed_at":"2026-08-11T18:01:14.180207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:01:14.183333Z","title":"Accent modification for speech recognition of non-native speakers using neural style transfer,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.08312","last_updated":"2024-12-11T11:47:39Z","snapshot_observed_at":"2026-08-11T17:55:24.067349Z","submitted_at":"2024-12-11T11:47:39Z","title":"A Unified Model For Voice and Accent Conversion In Speech and Singing using Self-Supervised Learning and Feature Extraction","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T18:01:14.183333Z"},"links":{"citing_paper":"/paper/2412.08312"},"observation_digest":"sha256:c1fea390cf17d71a3b8d3818ecd71654bdb16316be92173b5c03f922d3d2748a","observation_id":"6f8c64be-2ab8-4f7c-adc2-3729cc37203e","resolution":{"observed_at":"2026-08-11T18:01:14.183333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2022.10527","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:01:14.315779Z","title":"Parallel voice conversion with limited training data using stochastic variational deep kernel learning,","venue":null,"work_id":"e2ffaca5-cff2-460d-aed9-9f42ba3453ba","year":2022},"citing_paper":{"arxiv_id":"2412.08312","last_updated":"2024-12-11T11:47:39Z","snapshot_observed_at":"2026-08-11T17:55:24.067349Z","submitted_at":"2024-12-11T11:47:39Z","title":"A Unified Model For Voice and Accent Conversion In Speech and Singing using Self-Supervised Learning and Feature Extraction","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T18:01:14.186523Z"},"links":{"citing_paper":"/paper/2412.08312"},"observation_digest":"sha256:b6de7f903aee97f8718f61b1f1435e5517463aeb3e5f3d9ce12d65cdd45a1002","observation_id":"c53006fd-4790-4d99-a374-4bf61e3464a2","resolution":{"observed_at":"2026-08-11T18:01:14.321204Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:01:14.649173Z","title":"Speech Accent Archive,","venue":null,"work_id":"1871bee7-4783-4036-813e-7cd34380e626","year":2015},"citing_paper":{"arxiv_id":"2412.08312","last_updated":"2024-12-11T11:47:39Z","snapshot_observed_at":"2026-08-11T17:55:24.067349Z","submitted_at":"2024-12-11T11:47:39Z","title":"A Unified Model For Voice and Accent Conversion In Speech and Singing using Self-Supervised Learning and Feature Extraction","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T18:01:14.189712Z"},"links":{"citing_paper":"/paper/2412.08312"},"observation_digest":"sha256:805967bb238a9a6aa71465be7b0dcb422b88d219adc708dcb2939fbaa841df94","observation_id":"87d2e52d-d352-4f62-86f8-998a3a8a111a","resolution":{"observed_at":"2026-08-11T18:01:14.653144Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-08-13T01:24:25.628327Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-11T18:01:14.165761Z","title":"Available: https://arxiv.org/abs/1609.03499","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08312","last_updated":"2024-12-11T11:47:39Z","snapshot_observed_at":"2026-08-11T17:55:24.067349Z","submitted_at":"2024-12-11T11:47:39Z","title":"A Unified Model For Voice and Accent Conversion In Speech and Singing using Self-Supervised Learning and Feature Extraction","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-11T18:01:14.165761Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/2412.08312"},"observation_digest":"sha256:755d14b77f335d5fbd5d4cbb223ed1ee79ed85676552cf304c0b6c7addabfadb","observation_id":"53f5181f-6cc7-4fd9-b5e0-d53044501f8d","resolution":{"observed_at":"2026-08-11T18:01:14.165761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.08312","last_updated":"2024-12-11T11:47:39Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-11T17:55:24.067349Z","submitted_at":"2024-12-11T11:47:39Z","title":"A Unified Model For Voice and Accent Conversion In Speech and Singing using Self-Supervised Learning and Feature Extraction"},"reference_resolution":{"displayed":11,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":5,"verified_exact":3,"verified_fuzzy":2},"total_outbound_references":11},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 11 of 11 outbound references and 0 inbound Pith citation observations for arXiv:2412.08312."}