{"as_of":"2026-08-05T12:31:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:87c42cc4bb6e12811e3a9969604d2f589caa030a05140abea97849dda86a18aa","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-22T11:35:58.050305Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T18:00:27.852836Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2601.18094","last_updated":"2026-05-21T07:34:45Z","snapshot_observed_at":"2026-08-04T13:38:41.751748Z","submitted_at":"2026-01-26T03:11:56Z","title":"OneVoice: One Model, Triple Scenarios-Towards Unified Zero-shot Voice Conversion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.18094","snapshot_observed_at":"2026-08-03T18:00:27.852836Z","title":"Onevoice: One model, triple scenarios-towards unified zero-shot voice con- version,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2512.07352","last_updated":"2026-06-09T12:53:03Z","snapshot_observed_at":"2026-08-04T12:59:20.361467Z","submitted_at":"2025-12-08T09:43:30Z","title":"MultiAPI Spoof: A Multi-API Dataset and Local-Attention Network for Speech Anti-spoofing Detection","version":5},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T18:00:27.852836Z"},"links":{"cited_paper":"/paper/2601.18094","citing_paper":"/paper/2512.07352"},"observation_digest":"sha256:759d037ae5babd2fdcdd5009b3adb2d611f3a32e11e03df29382089e1dd46d52","observation_id":"a47df495-4001-4464-829e-102a64b06aad","resolution":{"observed_at":"2026-08-03T18:00:27.852836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2601.18094/citation-record","integrity":"/paper/2601.18094/integrity","json":"/paper/2601.18094/citation-record.json","paper":"/paper/2601.18094"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Streaming voice con- version via intermediate bottleneck features and non- streaming teacher guidance","venue":null,"work_id":"92f067c3-354e-4b9c-9141-32c233b0eeef","year":2023},"citing_paper":{"arxiv_id":"2601.18094","last_updated":"2026-05-21T07:34:45Z","snapshot_observed_at":"2026-08-04T13:38:41.751748Z","submitted_at":"2026-01-26T03:11:56Z","title":"OneVoice: One Model, Triple Scenarios-Towards Unified Zero-shot Voice Conversion","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-22T11:35:58.050305Z"},"links":{"citing_paper":"/paper/2601.18094"},"observation_digest":"sha256:63de71cdf83f6b64fb65d7f27e178aaf51a9b109c444ecc6979812fe4deb3f80","observation_id":"19c87387-2e29-4079-8009-eae1873d6d4a","resolution":{"observed_at":"2026-05-22T11:36:29.271534Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Yingmusic-svc: Real- world robust zero-shot singing voice conversion with flow- grpo and singing-specific inductive biases.Arxiv","venue":null,"work_id":"facb3a0d-43cd-4ce3-99e2-5d39d6f81a19","year":2025},"citing_paper":{"arxiv_id":"2601.18094","last_updated":"2026-05-21T07:34:45Z","snapshot_observed_at":"2026-08-04T13:38:41.751748Z","submitted_at":"2026-01-26T03:11:56Z","title":"OneVoice: One Model, Triple Scenarios-Towards Unified Zero-shot Voice Conversion","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-22T11:35:58.050305Z"},"links":{"citing_paper":"/paper/2601.18094"},"observation_digest":"sha256:3c467f7f3ef7ccc9c999a7d51d9fc903b3c1bb55245b10984df01e3bf3240dea","observation_id":"91d816af-a723-4002-afea-6fabc1640502","resolution":{"observed_at":"2026-05-22T11:36:29.178893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Neural analysis and synthesis: Reconstructing speech from self-supervised representations","venue":null,"work_id":"4d5bfcf0-77ab-4104-8ff2-128b986618c2","year":2021},"citing_paper":{"arxiv_id":"2601.18094","last_updated":"2026-05-21T07:34:45Z","snapshot_observed_at":"2026-08-04T13:38:41.751748Z","submitted_at":"2026-01-26T03:11:56Z","title":"OneVoice: One Model, Triple Scenarios-Towards Unified Zero-shot Voice Conversion","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-22T11:35:58.050305Z"},"links":{"citing_paper":"/paper/2601.18094"},"observation_digest":"sha256:4a36a0bb4a9a8749f425d395b4219bf40e15c267c8beff1eafac9e46a10a43d6","observation_id":"9f190ef8-61d3-433d-a157-c20f0831b08c","resolution":{"observed_at":"2026-05-22T11:36:29.290104Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"60042596-8eec-4d6b-a53f-6318caae1b8f","year":2024},"citing_paper":{"arxiv_id":"2601.18094","last_updated":"2026-05-21T07:34:45Z","snapshot_observed_at":"2026-08-04T13:38:41.751748Z","submitted_at":"2026-01-26T03:11:56Z","title":"OneVoice: One Model, Triple Scenarios-Towards Unified Zero-shot Voice Conversion","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-22T11:35:58.050305Z"},"links":{"citing_paper":"/paper/2601.18094"},"observation_digest":"sha256:faba81eee4bb16b22a2a9a75b5826ed0fd0bcf55d77c7983ea0751514f0adbf9","observation_id":"8b30aaee-f30f-4754-8ea4-0e9033182326","resolution":{"observed_at":"2026-05-22T11:36:29.217619Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The nus sung and spoken lyrics corpus: A quantitative comparison of singing and speech","venue":null,"work_id":"224fc78e-1acf-4857-a424-fdc28afcfa49","year":2013},"citing_paper":{"arxiv_id":"2601.18094","last_updated":"2026-05-21T07:34:45Z","snapshot_observed_at":"2026-08-04T13:38:41.751748Z","submitted_at":"2026-01-26T03:11:56Z","title":"OneVoice: One Model, Triple Scenarios-Towards Unified Zero-shot Voice Conversion","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-22T11:35:58.050305Z"},"links":{"citing_paper":"/paper/2601.18094"},"observation_digest":"sha256:ec9efc9614e5746c785c57aade5f8d23e3b1ad369d5f628cb782b00d10f7d538","observation_id":"b498b656-2ec5-4a15-ad9b-f63a3b024ab6","resolution":{"observed_at":"2026-05-22T11:36:29.202283Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Moshi: a speech-text foundation model for real-time dialogue","venue":null,"work_id":"2f5e28e5-b6ac-463d-9767-f14a86c30943","year":2024},"citing_paper":{"arxiv_id":"2601.18094","last_updated":"2026-05-21T07:34:45Z","snapshot_observed_at":"2026-08-04T13:38:41.751748Z","submitted_at":"2026-01-26T03:11:56Z","title":"OneVoice: One Model, Triple Scenarios-Towards Unified Zero-shot Voice Conversion","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-22T11:35:58.050305Z"},"links":{"citing_paper":"/paper/2601.18094"},"observation_digest":"sha256:31652335f9e981404012331e5b46f3b5ceb9275ac1736fbb21a05e87b41bea39","observation_id":"88d8c067-597a-447c-85a9-736238fd5692","resolution":{"observed_at":"2026-05-22T11:36:29.278134Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Switch transformers: scaling to trillion parame- ter models with simple and efficient sparsity.Journal of Machine Learning Research, 23","venue":null,"work_id":"de72340e-d972-4e04-94ab-4b489b60e63e","year":2022},"citing_paper":{"arxiv_id":"2601.18094","last_updated":"2026-05-21T07:34:45Z","snapshot_observed_at":"2026-08-04T13:38:41.751748Z","submitted_at":"2026-01-26T03:11:56Z","title":"OneVoice: One Model, Triple Scenarios-Towards Unified Zero-shot Voice Conversion","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-22T11:35:58.050305Z"},"links":{"citing_paper":"/paper/2601.18094"},"observation_digest":"sha256:aa094bb80f932d695264c9354f0253e18b23a5d0ffa6b18ac4714bdf26843b6e","observation_id":"5bb3d4b0-ccc1-4000-b6cb-903dd435bc0f","resolution":{"observed_at":"2026-05-22T11:36:29.298051Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Zico Kolter, and Kaiming He","venue":null,"work_id":"19e541e9-ee16-4ba7-82f0-94805e08baaf","year":2025},"citing_paper":{"arxiv_id":"2601.18094","last_updated":"2026-05-21T07:34:45Z","snapshot_observed_at":"2026-08-04T13:38:41.751748Z","submitted_at":"2026-01-26T03:11:56Z","title":"OneVoice: One Model, Triple Scenarios-Towards Unified Zero-shot Voice Conversion","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-22T11:35:58.050305Z"},"links":{"citing_paper":"/paper/2601.18094"},"observation_digest":"sha256:f846210afad3b356ef1296149a4ac8c8a8b1d997971482cc06abe5e56ba97233","observation_id":"3998f120-7296-481b-9081-a875bb7c3e99","resolution":{"observed_at":"2026-05-22T11:36:29.195657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bigvgan: A universal neural vocoder with large-scale training.Arxiv","venue":null,"work_id":"0e16d298-26a4-4d85-95a3-29f28ab6c15b","year":2023},"citing_paper":{"arxiv_id":"2601.18094","last_updated":"2026-05-21T07:34:45Z","snapshot_observed_at":"2026-08-04T13:38:41.751748Z","submitted_at":"2026-01-26T03:11:56Z","title":"OneVoice: One Model, Triple Scenarios-Towards Unified Zero-shot Voice Conversion","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-22T11:35:58.050305Z"},"links":{"citing_paper":"/paper/2601.18094"},"observation_digest":"sha256:229a927b5ad198af5ad0d30819d4ffa67039347967d9ad28ad1f038332edda14","observation_id":"f88b34bf-2489-41e1-aa3f-91ed6ca779bc","resolution":{"observed_at":"2026-05-22T11:36:29.188972Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Emilia: A large-scale, extensive, multilingual, and diverse dataset for speech generation.Transactions on Audio, Speech and Language Processing, 33:4044–4054","venue":null,"work_id":"99e09c0e-a202-4de3-b274-1b10f58cddb8","year":2025},"citing_paper":{"arxiv_id":"2601.18094","last_updated":"2026-05-21T07:34:45Z","snapshot_observed_at":"2026-08-04T13:38:41.751748Z","submitted_at":"2026-01-26T03:11:56Z","title":"OneVoice: One Model, Triple Scenarios-Towards Unified Zero-shot Voice Conversion","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-22T11:35:58.050305Z"},"links":{"citing_paper":"/paper/2601.18094"},"observation_digest":"sha256:9dce6a2b32c46ce191dc03676ba87d4db0daa397a854a36a4a734c812f66f302","observation_id":"297ec85a-436d-4898-8281-49a3721bcb25","resolution":{"observed_at":"2026-05-22T11:36:29.185821Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"HuBERT: Self- supervised speech representation learning by masked pre- diction of hidden units.Transactions on Audio, Speech, and Language Processing, 29:3451–3460","venue":null,"work_id":"77902bf4-13b1-42ff-bef8-aff85f9857fa","year":2021},"citing_paper":{"arxiv_id":"2601.18094","last_updated":"2026-05-21T07:34:45Z","snapshot_observed_at":"2026-08-04T13:38:41.751748Z","submitted_at":"2026-01-26T03:11:56Z","title":"OneVoice: One Model, Triple Scenarios-Towards Unified Zero-shot Voice Conversion","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-22T11:35:58.050305Z"},"links":{"citing_paper":"/paper/2601.18094"},"observation_digest":"sha256:3c0be2cd5ba905af4fafa28ca89362133f50c24ae3278333f716ea4d030b3668","observation_id":"1c320591-e7cc-4d2c-b6c1-cc75f5a69cc1","resolution":{"observed_at":"2026-05-22T11:36:29.205561Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"LoRA: Low-rank adaptation of large language models","venue":null,"work_id":"d76efb99-5393-4e2a-b11f-80fef89e80fb","year":2022},"citing_paper":{"arxiv_id":"2601.18094","last_updated":"2026-05-21T07:34:45Z","snapshot_observed_at":"2026-08-04T13:38:41.751748Z","submitted_at":"2026-01-26T03:11:56Z","title":"OneVoice: One Model, Triple Scenarios-Towards Unified Zero-shot Voice Conversion","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-22T11:35:58.050305Z"},"links":{"citing_paper":"/paper/2601.18094"},"observation_digest":"sha256:b1947e96aa4361d2d83f23deec90f2786e7f3b50bd48bb751fb2311b8d07c567","observation_id":"cfecea9d-92bc-453f-9db6-89d94ecbdf42","resolution":{"observed_at":"2026-05-22T11:36:29.192479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multi-singer: Fast multi-singer singing voice vocoder with a large-scale corpus","venue":null,"work_id":"d51b05fb-30ae-489e-9d4b-570f1fca3fd0","year":2021},"citing_paper":{"arxiv_id":"2601.18094","last_updated":"2026-05-21T07:34:45Z","snapshot_observed_at":"2026-08-04T13:38:41.751748Z","submitted_at":"2026-01-26T03:11:56Z","title":"OneVoice: One Model, Triple Scenarios-Towards Unified Zero-shot Voice Conversion","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-22T11:35:58.050305Z"},"links":{"citing_paper":"/paper/2601.18094"},"observation_digest":"sha256:63bf9b3b4083bd778f0cb15832c141cc0a939ffb10b0a95ebf07d05774b8e9c5","observation_id":"29be1a8e-c65e-4da5-9f2c-aa131a215253","resolution":{"observed_at":"2026-05-22T11:36:29.232832Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The singing voice conversion challenge","venue":null,"work_id":"36e6720f-eadc-442f-8a2e-9241ef1a5df1","year":2023},"citing_paper":{"arxiv_id":"2601.18094","last_updated":"2026-05-21T07:34:45Z","snapshot_observed_at":"2026-08-04T13:38:41.751748Z","submitted_at":"2026-01-26T03:11:56Z","title":"OneVoice: One Model, Triple Scenarios-Towards Unified Zero-shot Voice Conversion","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-22T11:35:58.050305Z"},"links":{"citing_paper":"/paper/2601.18094"},"observation_digest":"sha256:9dcf9ff06a90b938a77f25d5f25fce21d495245e849eedcdd74e09c235d2358f","observation_id":"70f90b48-c7f0-4bf2-b541-b2e68a123495","resolution":{"observed_at":"2026-05-22T11:36:29.268487Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"DiTAR: Diffusion transformer autoregressive modeling for speech generation","venue":null,"work_id":"59dda2c0-de01-4e74-9ab7-410a4f4d49f4","year":2025},"citing_paper":{"arxiv_id":"2601.18094","last_updated":"2026-05-21T07:34:45Z","snapshot_observed_at":"2026-08-04T13:38:41.751748Z","submitted_at":"2026-01-26T03:11:56Z","title":"OneVoice: One Model, Triple Scenarios-Towards Unified Zero-shot Voice Conversion","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-22T11:35:58.050305Z"},"links":{"citing_paper":"/paper/2601.18094"},"observation_digest":"sha256:7d21afdaa425e9d9e89f4dcb50cc0a16a95ff9aa668bfe83ae779b7641a870a0","observation_id":"87851fa9-cddf-444d-b4b4-bf994d401481","resolution":{"observed_at":"2026-05-22T11:36:29.199239Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ref-vc: Robust, expressive and fast zero-shot voice conversion with diffusion trans- formers.Arxiv","venue":null,"work_id":"b4bbd389-31eb-4c85-9c70-664ed943984e","year":2025},"citing_paper":{"arxiv_id":"2601.18094","last_updated":"2026-05-21T07:34:45Z","snapshot_observed_at":"2026-08-04T13:38:41.751748Z","submitted_at":"2026-01-26T03:11:56Z","title":"OneVoice: One Model, Triple Scenarios-Towards Unified Zero-shot Voice Conversion","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-22T11:35:58.050305Z"},"links":{"citing_paper":"/paper/2601.18094"},"observation_digest":"sha256:301f7b1b9235d9198fa8883df1e6a0ea6a79466ebeab259aa38e6eb2c93e346e","observation_id":"227dce47-46fc-4752-9625-517637dab163","resolution":{"observed_at":"2026-05-22T11:36:29.214582Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Naturalspeech 3: Zero-shot speech synthesis with factorized codec and diffusion mod- els","venue":null,"work_id":"62518d9e-8622-4fea-90da-b8eed9bb21cf","year":2024},"citing_paper":{"arxiv_id":"2601.18094","last_updated":"2026-05-21T07:34:45Z","snapshot_observed_at":"2026-08-04T13:38:41.751748Z","submitted_at":"2026-01-26T03:11:56Z","title":"OneVoice: One Model, Triple Scenarios-Towards Unified Zero-shot Voice Conversion","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-22T11:35:58.050305Z"},"links":{"citing_paper":"/paper/2601.18094"},"observation_digest":"sha256:39d91cabb4ab99d36ea4ed7ed7c93badadc9dff62780f6ac6f7b77f5e42947d1","observation_id":"31ad7fda-1618-49d6-903c-3f66cefd5260","resolution":{"observed_at":"2026-05-22T11:36:29.262253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Efficient multilingual asr finetuning via lora language ex- perts","venue":null,"work_id":"4e347368-be00-443a-9ab5-0d472cd6968f","year":2025},"citing_paper":{"arxiv_id":"2601.18094","last_updated":"2026-05-21T07:34:45Z","snapshot_observed_at":"2026-08-04T13:38:41.751748Z","submitted_at":"2026-01-26T03:11:56Z","title":"OneVoice: One Model, Triple Scenarios-Towards Unified Zero-shot Voice Conversion","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-22T11:35:58.050305Z"},"links":{"citing_paper":"/paper/2601.18094"},"observation_digest":"sha256:771bc62eaa9dc6345c02bf35f638f27be44cdd2fd4dfb249f043c12b81426a90","observation_id":"88103a3d-4d45-4173-840b-2f6a1c657f1b","resolution":{"observed_at":"2026-05-22T11:36:29.249541Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"ded35e4b-a926-43be-a168-1461c158f03b","year":2023},"citing_paper":{"arxiv_id":"2601.18094","last_updated":"2026-05-21T07:34:45Z","snapshot_observed_at":"2026-08-04T13:38:41.751748Z","submitted_at":"2026-01-26T03:11:56Z","title":"OneVoice: One Model, Triple Scenarios-Towards Unified Zero-shot Voice Conversion","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-22T11:35:58.050305Z"},"links":{"citing_paper":"/paper/2601.18094"},"observation_digest":"sha256:82683269c96953ed0682f2e230e06e2135370ac5af77bd576c3b896e0662c49e","observation_id":"48720ead-b5b8-4888-93f9-7e690c4a353e","resolution":{"observed_at":"2026-05-22T11:36:29.211144Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Transferring source style in non-parallel voice conversion","venue":null,"work_id":"24904abb-78d7-40e6-a3fd-b2fa31b73189","year":2020},"citing_paper":{"arxiv_id":"2601.18094","last_updated":"2026-05-21T07:34:45Z","snapshot_observed_at":"2026-08-04T13:38:41.751748Z","submitted_at":"2026-01-26T03:11:56Z","title":"OneVoice: One Model, Triple Scenarios-Towards Unified Zero-shot Voice Conversion","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-22T11:35:58.050305Z"},"links":{"citing_paper":"/paper/2601.18094"},"observation_digest":"sha256:6bc7b2515a5d352dd41cce5e047febe94dfaecc3a05da2ae0b3a1191edbffb6d","observation_id":"8db6212e-b3fc-4c1b-9f32-357467838f71","resolution":{"observed_at":"2026-05-22T11:36:29.208336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning the beauty in songs: Neural singing voice beautifier","venue":null,"work_id":"5e9ef4fb-c518-48f8-b14d-9a25ee89ed11","year":2022},"citing_paper":{"arxiv_id":"2601.18094","last_updated":"2026-05-21T07:34:45Z","snapshot_observed_at":"2026-08-04T13:38:41.751748Z","submitted_at":"2026-01-26T03:11:56Z","title":"OneVoice: One Model, Triple Scenarios-Towards Unified Zero-shot Voice Conversion","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-22T11:35:58.050305Z"},"links":{"citing_paper":"/paper/2601.18094"},"observation_digest":"sha256:96f202dc24fc09f29a0f8e22ea06820a42dce0201b241688f6da8937bc0c0750","observation_id":"481fda3a-022a-4a31-a607-7f7d42905c77","resolution":{"observed_at":"2026-05-22T11:36:29.182168Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Zero-shot voice conversion with diffusion transformers.Arxiv","venue":null,"work_id":"a3a69550-c8a4-4789-9e05-25811c50414d","year":2024},"citing_paper":{"arxiv_id":"2601.18094","last_updated":"2026-05-21T07:34:45Z","snapshot_observed_at":"2026-08-04T13:38:41.751748Z","submitted_at":"2026-01-26T03:11:56Z","title":"OneVoice: One Model, Triple Scenarios-Towards Unified Zero-shot Voice Conversion","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-22T11:35:58.050305Z"},"links":{"citing_paper":"/paper/2601.18094"},"observation_digest":"sha256:e9c0b8fc3d995641a862cbf616115155d0bf9c1f65b6698f60693ffa1f0923ba","observation_id":"45127fd4-855c-48d2-8891-cb7ac3ec736e","resolution":{"observed_at":"2026-05-22T11:36:29.258872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hdmole: Mixture of lora experts with hi- erarchical routing and dynamic thresholds for fine-tuning llm-based asr models","venue":null,"work_id":"041cb7fd-e6c5-4b03-b2d2-b34094fdde2f","year":2025},"citing_paper":{"arxiv_id":"2601.18094","last_updated":"2026-05-21T07:34:45Z","snapshot_observed_at":"2026-08-04T13:38:41.751748Z","submitted_at":"2026-01-26T03:11:56Z","title":"OneVoice: One Model, Triple Scenarios-Towards Unified Zero-shot Voice Conversion","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-22T11:35:58.050305Z"},"links":{"citing_paper":"/paper/2601.18094"},"observation_digest":"sha256:d66f835ba2672b017f1fa9ebd5dfb4d3f842a5889636d116943e98b6121acb46","observation_id":"bd7e4782-d2d0-47c4-8dfd-529a7a296c17","resolution":{"observed_at":"2026-05-22T11:36:29.255874Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scalable diffusion models with transformers.Arxiv","venue":null,"work_id":"9aa01481-f236-49b0-bc64-a82fa24b8974","year":2023},"citing_paper":{"arxiv_id":"2601.18094","last_updated":"2026-05-21T07:34:45Z","snapshot_observed_at":"2026-08-04T13:38:41.751748Z","submitted_at":"2026-01-26T03:11:56Z","title":"OneVoice: One Model, Triple Scenarios-Towards Unified Zero-shot Voice Conversion","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-22T11:35:58.050305Z"},"links":{"citing_paper":"/paper/2601.18094"},"observation_digest":"sha256:38421b76290d41c32cb7142572afb2a21708bd8a1aeece9e1885c4c6c93f2a5c","observation_id":"5dc1f525-bcf4-4776-991a-63a43de8933a","resolution":{"observed_at":"2026-05-22T11:36:29.242735Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vibevoice technical report.Arxiv","venue":null,"work_id":"9b5092b8-32ca-461c-bb4a-81601b102336","year":2025},"citing_paper":{"arxiv_id":"2601.18094","last_updated":"2026-05-21T07:34:45Z","snapshot_observed_at":"2026-08-04T13:38:41.751748Z","submitted_at":"2026-01-26T03:11:56Z","title":"OneVoice: One Model, Triple Scenarios-Towards Unified Zero-shot Voice Conversion","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-22T11:35:58.050305Z"},"links":{"citing_paper":"/paper/2601.18094"},"observation_digest":"sha256:f22f48056292b8bb9dfa023dda8aa2a5f2f99af83a807fa657c401058841116b","observation_id":"2b7133db-176d-4531-8ea3-5d03cfea5c38","resolution":{"observed_at":"2026-05-22T11:36:29.229863Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Outrageously large neural networks: The sparsely-gated mixture-of-experts layer","venue":null,"work_id":"a56d4c9f-f548-4c94-a15e-929ff363fe3e","year":2017},"citing_paper":{"arxiv_id":"2601.18094","last_updated":"2026-05-21T07:34:45Z","snapshot_observed_at":"2026-08-04T13:38:41.751748Z","submitted_at":"2026-01-26T03:11:56Z","title":"OneVoice: One Model, Triple Scenarios-Towards Unified Zero-shot Voice Conversion","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-22T11:35:58.050305Z"},"links":{"citing_paper":"/paper/2601.18094"},"observation_digest":"sha256:9d53e4ec9466fa59750b4f4236b29ceb705af219db8ceece1b8ac3767a2d7d62","observation_id":"b0e87392-298a-4c8b-b905-679510ad55c8","resolution":{"observed_at":"2026-05-22T11:36:29.265309Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Singing voice data scaling-up: An intro- duction to ace-opencpop and ace-kising.Arxiv","venue":null,"work_id":"ed32b55f-c7b7-495d-9694-cf1c0e0ca5dc","year":2024},"citing_paper":{"arxiv_id":"2601.18094","last_updated":"2026-05-21T07:34:45Z","snapshot_observed_at":"2026-08-04T13:38:41.751748Z","submitted_at":"2026-01-26T03:11:56Z","title":"OneVoice: One Model, Triple Scenarios-Towards Unified Zero-shot Voice Conversion","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-22T11:35:58.050305Z"},"links":{"citing_paper":"/paper/2601.18094"},"observation_digest":"sha256:24dd874e2a23c28aa680a5344bb9164634a4d83543d7a66b358de0df382862d2","observation_id":"e6c60e03-6bee-4aef-86bb-5d839e6f9ab2","resolution":{"observed_at":"2026-05-22T11:36:29.294575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Li, Hao Wang, Shiyin Kang, and H","venue":null,"work_id":"5e81dfc1-7496-47ae-810d-e1e5406de3f0","year":2016},"citing_paper":{"arxiv_id":"2601.18094","last_updated":"2026-05-21T07:34:45Z","snapshot_observed_at":"2026-08-04T13:38:41.751748Z","submitted_at":"2026-01-26T03:11:56Z","title":"OneVoice: One Model, Triple Scenarios-Towards Unified Zero-shot Voice Conversion","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-22T11:35:58.050305Z"},"links":{"citing_paper":"/paper/2601.18094"},"observation_digest":"sha256:394f8d725359b33f854b30f0b4ec6934ae6583d35654988d31c453e674edc2ea","observation_id":"6d6c033f-3228-4f13-b64a-ff0bd6371b28","resolution":{"observed_at":"2026-05-22T11:36:29.235876Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multimodal latent language modeling with next-token diffusion.Arxiv","venue":null,"work_id":"1d82cfbd-b7c5-4f01-bca9-957c6c5751fc","year":2024},"citing_paper":{"arxiv_id":"2601.18094","last_updated":"2026-05-21T07:34:45Z","snapshot_observed_at":"2026-08-04T13:38:41.751748Z","submitted_at":"2026-01-26T03:11:56Z","title":"OneVoice: One Model, Triple Scenarios-Towards Unified Zero-shot Voice Conversion","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-22T11:35:58.050305Z"},"links":{"citing_paper":"/paper/2601.18094"},"observation_digest":"sha256:fc5acece840a36864aba7fbab7b3043c4e8f0e32d00b98ad30f9f65e9e904b5a","observation_id":"d3d40483-91aa-4c07-b1a5-855490497f68","resolution":{"observed_at":"2026-05-22T11:36:29.287788Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Opencpop: A high-quality open source chinese popular song corpus for singing voice synthesis.Arxiv","venue":null,"work_id":"04b4967a-1c75-499a-8035-3a197ac79ab3","year":2022},"citing_paper":{"arxiv_id":"2601.18094","last_updated":"2026-05-21T07:34:45Z","snapshot_observed_at":"2026-08-04T13:38:41.751748Z","submitted_at":"2026-01-26T03:11:56Z","title":"OneVoice: One Model, Triple Scenarios-Towards Unified Zero-shot Voice Conversion","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-22T11:35:58.050305Z"},"links":{"citing_paper":"/paper/2601.18094"},"observation_digest":"sha256:469adb11db5d52e992d155708ab5950d8c04745ac5ba9e1999dbdaa1b1f9bc1c","observation_id":"867c0439-611b-47dd-ae25-1ad9952d47dd","resolution":{"observed_at":"2026-05-22T11:36:29.239273Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Metis: A foundation speech generation model with masked generative pre-training.Arxiv","venue":null,"work_id":"dd672889-eb15-4c9e-af0f-0c1992562c57","year":2025},"citing_paper":{"arxiv_id":"2601.18094","last_updated":"2026-05-21T07:34:45Z","snapshot_observed_at":"2026-08-04T13:38:41.751748Z","submitted_at":"2026-01-26T03:11:56Z","title":"OneVoice: One Model, Triple Scenarios-Towards Unified Zero-shot Voice Conversion","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-22T11:35:58.050305Z"},"links":{"citing_paper":"/paper/2601.18094"},"observation_digest":"sha256:912af49839d2b2f9808b61cc1808d45e11600b6a7a2016e01603a5a696797a98","observation_id":"32192538-672b-41e9-b944-09775968a27b","resolution":{"observed_at":"2026-05-22T11:36:29.246299Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Moe-tts: Enhancing out-of-domain text understanding for description-based tts via mixture-of-experts.Arxiv","venue":null,"work_id":"d47363bf-81e5-408e-8404-67521664879d","year":2025},"citing_paper":{"arxiv_id":"2601.18094","last_updated":"2026-05-21T07:34:45Z","snapshot_observed_at":"2026-08-04T13:38:41.751748Z","submitted_at":"2026-01-26T03:11:56Z","title":"OneVoice: One Model, Triple Scenarios-Towards Unified Zero-shot Voice Conversion","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-22T11:35:58.050305Z"},"links":{"citing_paper":"/paper/2601.18094"},"observation_digest":"sha256:aebcd81fdcb08d361d567baf21fe56e9bf8b28962edba6c902463d5af4d74f06","observation_id":"74b166b9-f8bb-4336-9097-cb386f322334","resolution":{"observed_at":"2026-05-22T11:36:29.252744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Uniaudio: An audio foundation model to- ward universal audio generation","venue":null,"work_id":"823925eb-e607-4946-af27-df8a003bd131","year":2023},"citing_paper":{"arxiv_id":"2601.18094","last_updated":"2026-05-21T07:34:45Z","snapshot_observed_at":"2026-08-04T13:38:41.751748Z","submitted_at":"2026-01-26T03:11:56Z","title":"OneVoice: One Model, Triple Scenarios-Towards Unified Zero-shot Voice Conversion","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-22T11:35:58.050305Z"},"links":{"citing_paper":"/paper/2601.18094"},"observation_digest":"sha256:ef8111a75370f172e68ed6f4e1b9c68c260594e4735beabd8a68a5ce88be38c8","observation_id":"d61cd101-c106-486f-b5f5-cbcdb990159a","resolution":{"observed_at":"2026-05-22T11:36:29.284992Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Llasa: Scal- ing train-time and inference-time compute for llama-based speech synthesis.Arxiv","venue":null,"work_id":"be6bf6d3-c434-43a4-9591-c261b37b7dbb","year":2025},"citing_paper":{"arxiv_id":"2601.18094","last_updated":"2026-05-21T07:34:45Z","snapshot_observed_at":"2026-08-04T13:38:41.751748Z","submitted_at":"2026-01-26T03:11:56Z","title":"OneVoice: One Model, Triple Scenarios-Towards Unified Zero-shot Voice Conversion","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-22T11:35:58.050305Z"},"links":{"citing_paper":"/paper/2601.18094"},"observation_digest":"sha256:2b1e1a54937620070a2ff6a847683fb2f90d26362e0a992240d5215532d74fef","observation_id":"48d0ee07-9e78-4e2c-88c5-b5cb466be1ab","resolution":{"observed_at":"2026-05-22T11:36:29.281589Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Megabyte: Predicting million-byte sequences with multi- scale transformers","venue":null,"work_id":"19fd14a1-aa86-401c-a118-ad633553cacc","year":2023},"citing_paper":{"arxiv_id":"2601.18094","last_updated":"2026-05-21T07:34:45Z","snapshot_observed_at":"2026-08-04T13:38:41.751748Z","submitted_at":"2026-01-26T03:11:56Z","title":"OneVoice: One Model, Triple Scenarios-Towards Unified Zero-shot Voice Conversion","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-22T11:35:58.050305Z"},"links":{"citing_paper":"/paper/2601.18094"},"observation_digest":"sha256:5d2e806286d825009bd58aed43274bae586a053bbbd14a655960a131f5c85054","observation_id":"802ef9e6-633e-41de-9018-be6165b51762","resolution":{"observed_at":"2026-05-22T11:36:29.223750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Takin-VC: Expressive zero-shot voice conversion via adaptive hybrid content encoding and en- hanced timbre modeling","venue":null,"work_id":"89eabc2c-e32d-4901-9a61-967fc3270da9","year":2025},"citing_paper":{"arxiv_id":"2601.18094","last_updated":"2026-05-21T07:34:45Z","snapshot_observed_at":"2026-08-04T13:38:41.751748Z","submitted_at":"2026-01-26T03:11:56Z","title":"OneVoice: One Model, Triple Scenarios-Towards Unified Zero-shot Voice Conversion","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-22T11:35:58.050305Z"},"links":{"citing_paper":"/paper/2601.18094"},"observation_digest":"sha256:a2ba5950a918d30d0fa67ba17a25a0f0e181ddace75d492facc25c2b5b670229","observation_id":"7fc96d1b-709d-462f-9f00-d01719115e12","resolution":{"observed_at":"2026-05-22T11:36:29.292338Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"SoundStream: An end-to-end neural audio codec.Trans- actions on Audio, Speech, and Language Processing, 30:495–507","venue":null,"work_id":"0adf41e9-091e-4db3-952e-67daac9b4e92","year":2021},"citing_paper":{"arxiv_id":"2601.18094","last_updated":"2026-05-21T07:34:45Z","snapshot_observed_at":"2026-08-04T13:38:41.751748Z","submitted_at":"2026-01-26T03:11:56Z","title":"OneVoice: One Model, Triple Scenarios-Towards Unified Zero-shot Voice Conversion","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-22T11:35:58.050305Z"},"links":{"citing_paper":"/paper/2601.18094"},"observation_digest":"sha256:d80e37afd66e5a61fd9c6a28d448d17b67dc35df87b0748cb078d4716963f6a5","observation_id":"6c6efad3-e0fc-4932-8e3c-7e772ddf3c82","resolution":{"observed_at":"2026-05-22T11:36:29.226774Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"M4singer: A multi-style, multi-singer and musical score provided mandarin singing corpus","venue":null,"work_id":"cf85f948-05ad-4d58-b299-3d3a1f22a5cf","year":2022},"citing_paper":{"arxiv_id":"2601.18094","last_updated":"2026-05-21T07:34:45Z","snapshot_observed_at":"2026-08-04T13:38:41.751748Z","submitted_at":"2026-01-26T03:11:56Z","title":"OneVoice: One Model, Triple Scenarios-Towards Unified Zero-shot Voice Conversion","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-22T11:35:58.050305Z"},"links":{"citing_paper":"/paper/2601.18094"},"observation_digest":"sha256:9e0cd105cea7b553331f53ed3ed10512bfccac2b1ec159199c7b5164861adefc","observation_id":"3f3a50f3-1873-4b26-8585-e27c36a65171","resolution":{"observed_at":"2026-05-22T11:36:29.220666Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Transfusion: Predict the next token and diffuse images with one multi-modal model","venue":null,"work_id":"ae9939c3-4abf-4b7b-98e4-ed63840f1f04","year":2025},"citing_paper":{"arxiv_id":"2601.18094","last_updated":"2026-05-21T07:34:45Z","snapshot_observed_at":"2026-08-04T13:38:41.751748Z","submitted_at":"2026-01-26T03:11:56Z","title":"OneVoice: One Model, Triple Scenarios-Towards Unified Zero-shot Voice Conversion","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-22T11:35:58.050305Z"},"links":{"citing_paper":"/paper/2601.18094"},"observation_digest":"sha256:21b3208e2da246362f8624829ae6f68d4aaf7799b4ecbd9d1ac75f79bf11db32","observation_id":"ece65de7-8748-4a7a-8970-0fc1230d80fc","resolution":{"observed_at":"2026-05-22T11:36:29.274768Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2601.18094","last_updated":"2026-05-21T07:34:45Z","latest_version":2,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-04T13:38:41.751748Z","submitted_at":"2026-01-26T03:11:56Z","title":"OneVoice: One Model, Triple Scenarios-Towards Unified Zero-shot Voice Conversion"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":2,"verified_exact":0,"verified_fuzzy":37},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 1 inbound Pith citation observation for arXiv:2601.18094."}