{"as_of":"2026-08-06T03:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:65a90048f853b5f28b83fceedd91df7a433b3ad483259b5049e52cc0140b1cdb","coverage":[{"denominator":47,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":47,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T14:20:01.885544Z","state":"measured"},{"denominator":49,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":49,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T00:31:12.284791Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-05-19T23:47:52.026535Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2604.12456","last_updated":"2026-04-22T07:37:41Z","snapshot_observed_at":"2026-07-06T23:00:37.144068Z","submitted_at":"2026-04-14T08:42:10Z","title":"X-VC: Zero-shot Streaming Voice Conversion in Codec Space","version":2},"cited_work":{"arxiv_id":"2604.12456","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.12456","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"X-VC: Zero-shot Streaming Voice Conversion in Codec Space","venue":"eess.AS","work_id":"99481ebe-cad0-4ce9-ab20-26bd94e3d83a","year":2026},"citing_paper":{"arxiv_id":"2605.18409","last_updated":"2026-05-18T13:48:52Z","snapshot_observed_at":"2026-07-06T23:29:20.279470Z","submitted_at":"2026-05-18T13:48:52Z","title":"EnvTriCascade: An Environment-Aware Tri-Stage Cascaded Framework for ESDD2 2026 Challenge","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-19T23:45:03.154037Z"},"links":{"cited_paper":"/paper/2604.12456","citing_paper":"/paper/2605.18409"},"observation_digest":"sha256:927ee13236f38c65790b6fb25ed8a1c74406889f7d73377affdba73d0a301751","observation_id":"f4c13d6f-55d8-474d-99ac-2220e5c77154","resolution":{"observed_at":"2026-05-19T23:47:52.028071Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.12456","last_updated":"2026-04-22T07:37:41Z","snapshot_observed_at":"2026-07-06T23:00:37.144068Z","submitted_at":"2026-04-14T08:42:10Z","title":"X-VC: Zero-shot Streaming Voice Conversion in Codec Space","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.12456","snapshot_observed_at":"2026-08-03T00:31:12.284791Z","title":"X-VC: Zero-shot streaming voice conversion in codec space,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28770","last_updated":"2026-07-30T18:44:22Z","snapshot_observed_at":"2026-08-05T23:11:43.010611Z","submitted_at":"2026-07-30T18:44:22Z","title":"Cloned Voices, Real Consequences: Evaluating Bias in Political Deepfake Detection for Electoral Integrity in Brazil","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T00:31:12.284791Z"},"links":{"cited_paper":"/paper/2604.12456","citing_paper":"/paper/2607.28770"},"observation_digest":"sha256:4260b9c940517c55e9a7ac8562a0f3ad83835fdf419b7e650064140a12d8cbe0","observation_id":"71e856a5-5308-43db-8130-4157e0fa74b3","resolution":{"observed_at":"2026-08-03T00:31:12.284791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2604.12456/citation-record","integrity":"/paper/2604.12456/integrity","json":"/paper/2604.12456/citation-record.json","paper":"/paper/2604.12456"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":"2406.02430","doi":"10.48550/arxiv.2406.02430","metadata_source":"pith","pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","venue":"eess.AS","work_id":"6e88ee95-1133-4302-a142-cdf8f9456a8d","year":2024},"citing_paper":{"arxiv_id":"2604.12456","last_updated":"2026-04-22T07:37:41Z","snapshot_observed_at":"2026-07-06T23:00:37.144068Z","submitted_at":"2026-04-14T08:42:10Z","title":"X-VC: Zero-shot Streaming Voice Conversion in Codec Space","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T14:20:01.885544Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2604.12456"},"observation_digest":"sha256:fa2fea98af9852972b4d7555f94566c6ba2b10ac0293df7603b7e76ef8e94351","observation_id":"0babbef2-c98d-4d4c-b65d-27c612265560","resolution":{"observed_at":"2026-05-15T12:26:37.526122Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.09636","last_updated":"2023-05-16T17:41:25Z","snapshot_observed_at":"2026-07-06T15:28:16.998343Z","submitted_at":"2023-05-16T17:41:25Z","title":"SoundStorm: Efficient Parallel Audio Generation","version":1},"cited_work":{"arxiv_id":"2305.09636","doi":"10.48550/arxiv.2305.09636","metadata_source":"pith","pith_arxiv_id":"2305.09636","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AudioLM: A language modeling approach to audio generation.IEEE/ACM Trans","venue":"cs.SD","work_id":"c68926d8-7cb2-4b44-9b10-396551c6bb67","year":2023},"citing_paper":{"arxiv_id":"2604.12456","last_updated":"2026-04-22T07:37:41Z","snapshot_observed_at":"2026-07-06T23:00:37.144068Z","submitted_at":"2026-04-14T08:42:10Z","title":"X-VC: Zero-shot Streaming Voice Conversion in Codec Space","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T14:20:01.885544Z"},"links":{"cited_paper":"/paper/2305.09636","citing_paper":"/paper/2604.12456"},"observation_digest":"sha256:a694d17e90cfdf9fe1c86894f739d91918020942bc1c1ba4417643b90a9e43a4","observation_id":"4deec016-c300-41b1-b410-7b04ed4e9dde","resolution":{"observed_at":"2026-05-10T14:20:29.746702Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"e282ce3d-9aba-445a-aa66-8438a09933f7","year":2022},"citing_paper":{"arxiv_id":"2604.12456","last_updated":"2026-04-22T07:37:41Z","snapshot_observed_at":"2026-07-06T23:00:37.144068Z","submitted_at":"2026-04-14T08:42:10Z","title":"X-VC: Zero-shot Streaming Voice Conversion in Codec Space","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T14:20:01.885544Z"},"links":{"citing_paper":"/paper/2604.12456"},"observation_digest":"sha256:c452a7dd964c108d115732b3f150118e213dd8bf6f351c67a0077f898f30360a","observation_id":"33226823-7572-4aef-bfe4-d6ff4dc8e010","resolution":{"observed_at":"2026-05-18T14:52:41.856745Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2022.318811","doi":"10.1109/jstsp.2022.3188113","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"neurips.cc/paper/2020/hash/1457c0d6bfcb4967418bfb8ac142f64a-Abstract.html","venue":"IEEE Journal of Selected Topics in Signal Processing","work_id":"7d155bea-12ee-4311-9cc9-09e1315de397","year":2022},"citing_paper":{"arxiv_id":"2604.12456","last_updated":"2026-04-22T07:37:41Z","snapshot_observed_at":"2026-07-06T23:00:37.144068Z","submitted_at":"2026-04-14T08:42:10Z","title":"X-VC: Zero-shot Streaming Voice Conversion in Codec Space","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T14:20:01.885544Z"},"links":{"citing_paper":"/paper/2604.12456"},"observation_digest":"sha256:e42534a40ab6c8119f220781a26d9f3d80b0dd45210fb96cf5d4921c47da18fd","observation_id":"ec330aaf-9c00-4922-8b32-0977a574f617","resolution":{"observed_at":"2026-05-10T14:20:28.785653Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-13T20:49:45.636217+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T20:49:45.636217+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.16841","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T03:37:35.141999Z","title":"SAC: Neural speech codec with semantic-acoustic dual-stream quantization","venue":null,"work_id":"8f8d9daa-30b4-44ca-ad5a-d1a0c7f6829c","year":2025},"citing_paper":{"arxiv_id":"2604.12456","last_updated":"2026-04-22T07:37:41Z","snapshot_observed_at":"2026-07-06T23:00:37.144068Z","submitted_at":"2026-04-14T08:42:10Z","title":"X-VC: Zero-shot Streaming Voice Conversion in Codec Space","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T14:20:01.885544Z"},"links":{"citing_paper":"/paper/2604.12456"},"observation_digest":"sha256:7e6fe208a408350bd9cf2a888af85eb143f8d723c3e631ab3b95bf2af0e1d9c2","observation_id":"b82af0ba-ea76-465a-8d6b-f38365cd0c36","resolution":{"observed_at":"2026-05-10T14:20:29.755014Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"18d0b48c-bf77-419d-8ce2-977a9a73ff7e","year":2025},"citing_paper":{"arxiv_id":"2604.12456","last_updated":"2026-04-22T07:37:41Z","snapshot_observed_at":"2026-07-06T23:00:37.144068Z","submitted_at":"2026-04-14T08:42:10Z","title":"X-VC: Zero-shot Streaming Voice Conversion in Codec Space","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T14:20:01.885544Z"},"links":{"citing_paper":"/paper/2604.12456"},"observation_digest":"sha256:b8a87057b407366fdfc1c4f633bee1a26c11b3c3c06abfae74c7f16941e29756","observation_id":"3d0c6945-1297-4d81-936a-e63ccbe0fe6b","resolution":{"observed_at":"2026-05-18T14:52:41.853512Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"76caa9d9-3a74-401f-9eec-442e6ad859e7","year":null},"citing_paper":{"arxiv_id":"2604.12456","last_updated":"2026-04-22T07:37:41Z","snapshot_observed_at":"2026-07-06T23:00:37.144068Z","submitted_at":"2026-04-14T08:42:10Z","title":"X-VC: Zero-shot Streaming Voice Conversion in Codec Space","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T14:20:01.885544Z"},"links":{"citing_paper":"/paper/2604.12456"},"observation_digest":"sha256:d6cba01a61c0deefa90d368dcdc9e484680a554da69b2efc45491852f3ad86b0","observation_id":"95e272bf-a98b-4d39-b7a6-dc3b821fbe3f","resolution":{"observed_at":"2026-05-18T14:52:41.850127Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21437/interspeech.2023-1294","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InInterspeech 2023","venue":null,"work_id":"09547976-92f8-4c9d-b694-f303ff1970f6","year":2023},"citing_paper":{"arxiv_id":"2604.12456","last_updated":"2026-04-22T07:37:41Z","snapshot_observed_at":"2026-07-06T23:00:37.144068Z","submitted_at":"2026-04-14T08:42:10Z","title":"X-VC: Zero-shot Streaming Voice Conversion in Codec Space","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T14:20:01.885544Z"},"links":{"citing_paper":"/paper/2604.12456"},"observation_digest":"sha256:228a4394f66952206ff70216154ae12be0c3aecdd9815359de197350c5e97049","observation_id":"cb68ab50-c0e6-48d9-b9ad-e8b204e82482","resolution":{"observed_at":"2026-05-10T14:20:28.834510Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"edd85c60-382f-469b-8a72-abbdce1a48a5","year":2023},"citing_paper":{"arxiv_id":"2604.12456","last_updated":"2026-04-22T07:37:41Z","snapshot_observed_at":"2026-07-06T23:00:37.144068Z","submitted_at":"2026-04-14T08:42:10Z","title":"X-VC: Zero-shot Streaming Voice Conversion in Codec Space","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T14:20:01.885544Z"},"links":{"citing_paper":"/paper/2604.12456"},"observation_digest":"sha256:e7c7f9f3b3c712d94cfdb54bbdcaaf23839cb099d73eedbdd057ed7c798da8bd","observation_id":"2eb65fab-2dc6-4135-9b4f-4393081a7f0c","resolution":{"observed_at":"2026-05-18T14:52:41.826682Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"1566.2024","doi":"10.1109/slt61566.2024","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Chao, W.-H","venue":null,"work_id":"f8225990-05b1-4f2b-b5f3-7a926ca28d6e","year":2024},"citing_paper":{"arxiv_id":"2604.12456","last_updated":"2026-04-22T07:37:41Z","snapshot_observed_at":"2026-07-06T23:00:37.144068Z","submitted_at":"2026-04-14T08:42:10Z","title":"X-VC: Zero-shot Streaming Voice Conversion in Codec Space","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T14:20:01.885544Z"},"links":{"citing_paper":"/paper/2604.12456"},"observation_digest":"sha256:cdd4e78581dd887fe10fde58bf327cd8c713133158293bed10a45fda3ec255b6","observation_id":"69e76b4c-6aec-4096-8c01-f653e622352a","resolution":{"observed_at":"2026-05-10T14:20:28.812927Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"6cb45563-da98-4fcf-b196-64a3586cfe44","year":2024},"citing_paper":{"arxiv_id":"2604.12456","last_updated":"2026-04-22T07:37:41Z","snapshot_observed_at":"2026-07-06T23:00:37.144068Z","submitted_at":"2026-04-14T08:42:10Z","title":"X-VC: Zero-shot Streaming Voice Conversion in Codec Space","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T14:20:01.885544Z"},"links":{"citing_paper":"/paper/2604.12456"},"observation_digest":"sha256:c289be7316a761b9dd29cb4d92c349942cc19b150e30fb20914471c2d687de3d","observation_id":"8ebf3d9e-8495-4568-a702-88d1872b61b1","resolution":{"observed_at":"2026-05-18T14:52:41.819779Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21437/interspeech","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T00:06:37.794172Z","title":"Singing voice graph modeling for singfake detection","venue":null,"work_id":"3c3dc12b-b160-46ce-956c-7d0499a00ba2","year":2019},"citing_paper":{"arxiv_id":"2604.12456","last_updated":"2026-04-22T07:37:41Z","snapshot_observed_at":"2026-07-06T23:00:37.144068Z","submitted_at":"2026-04-14T08:42:10Z","title":"X-VC: Zero-shot Streaming Voice Conversion in Codec Space","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T14:20:01.885544Z"},"links":{"citing_paper":"/paper/2604.12456"},"observation_digest":"sha256:e15282593c610f772e8e66a419d6ab379450d01c7d52b3f2c2e9eff37e651c6d","observation_id":"ad87bc5c-1b0c-43bd-bc3b-84bbcc4e041c","resolution":{"observed_at":"2026-05-10T14:20:28.799335Z","resolver_source":"doi_truncated","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.01995","last_updated":"2025-05-24T13:50:34Z","snapshot_observed_at":"2026-07-06T19:09:50.836734Z","submitted_at":"2024-09-03T15:41:07Z","title":"vec2wav 2.0: Advancing Voice Conversion via Discrete Token Vocoders","version":4},"cited_work":{"arxiv_id":"2409.01995","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.01995","snapshot_observed_at":"2026-07-04T07:39:38.389151Z","title":"vec2wav 2.0: Advancing voice conversion via discrete token vocoders,","venue":null,"work_id":"8282d70c-2036-43af-b201-6864193a6b4b","year":2024},"citing_paper":{"arxiv_id":"2604.12456","last_updated":"2026-04-22T07:37:41Z","snapshot_observed_at":"2026-07-06T23:00:37.144068Z","submitted_at":"2026-04-14T08:42:10Z","title":"X-VC: Zero-shot Streaming Voice Conversion in Codec Space","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T14:20:01.885544Z"},"links":{"cited_paper":"/paper/2409.01995","citing_paper":"/paper/2604.12456"},"observation_digest":"sha256:a652f1b343e555987a818ed14e1bf7829b94a65b6a73f63e75007f28796c9e60","observation_id":"9df19c8e-ff23-4a7c-8f9b-be529c074448","resolution":{"observed_at":"2026-05-10T14:20:29.702976Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1109/slt61566","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T19:05:00.023305Z","title":"SVDD 2024: The inaugural singing voice deepfake detection challenge,","venue":null,"work_id":"3005aedd-ea95-45f2-a3d3-641b8bc3e0a5","year":2024},"citing_paper":{"arxiv_id":"2604.12456","last_updated":"2026-04-22T07:37:41Z","snapshot_observed_at":"2026-07-06T23:00:37.144068Z","submitted_at":"2026-04-14T08:42:10Z","title":"X-VC: Zero-shot Streaming Voice Conversion in Codec Space","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T14:20:01.885544Z"},"links":{"citing_paper":"/paper/2604.12456"},"observation_digest":"sha256:da450429b7af5c2e2cb33fb80db365b2b1e5b0b99e5118d9d58200488b87dd92","observation_id":"8f513c96-a1e2-4f66-93b2-a0abd22b38ca","resolution":{"observed_at":"2026-05-10T14:20:28.822357Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"72641e13-6d4a-4178-ad81-3c5d78113927","year":2017},"citing_paper":{"arxiv_id":"2604.12456","last_updated":"2026-04-22T07:37:41Z","snapshot_observed_at":"2026-07-06T23:00:37.144068Z","submitted_at":"2026-04-14T08:42:10Z","title":"X-VC: Zero-shot Streaming Voice Conversion in Codec Space","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T14:20:01.885544Z"},"links":{"citing_paper":"/paper/2604.12456"},"observation_digest":"sha256:ff5651d0bcd452ec2d1068cbc30ee45252bc1decf0ec6817c092f3084edc7ed1","observation_id":"43bfe640-22df-49d8-aa57-6bde3238330b","resolution":{"observed_at":"2026-05-18T14:52:41.842943Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"3fc6a0ce-a3be-4a99-a6de-f0ce2eb32ed0","year":2024},"citing_paper":{"arxiv_id":"2604.12456","last_updated":"2026-04-22T07:37:41Z","snapshot_observed_at":"2026-07-06T23:00:37.144068Z","submitted_at":"2026-04-14T08:42:10Z","title":"X-VC: Zero-shot Streaming Voice Conversion in Codec Space","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T14:20:01.885544Z"},"links":{"citing_paper":"/paper/2604.12456"},"observation_digest":"sha256:c5579d8b86d1893a2badda2c8474cc2a4f80468855400ed7809ca4185456e838","observation_id":"f2cb07fe-b93c-48bb-992c-ae735a6ddd57","resolution":{"observed_at":"2026-05-18T14:52:41.836631Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"f3adc70b-ae82-4d08-b3f5-aa1f1cee37f8","year":null},"citing_paper":{"arxiv_id":"2604.12456","last_updated":"2026-04-22T07:37:41Z","snapshot_observed_at":"2026-07-06T23:00:37.144068Z","submitted_at":"2026-04-14T08:42:10Z","title":"X-VC: Zero-shot Streaming Voice Conversion in Codec Space","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T14:20:01.885544Z"},"links":{"citing_paper":"/paper/2604.12456"},"observation_digest":"sha256:f74ed30fcf88ea993bbb4170e1a597793426ec4fe7d8697d81a0fa54f32584ef","observation_id":"57b8c6d2-3e62-4d77-9691-1ca8455f6490","resolution":{"observed_at":"2026-05-18T14:52:41.810917Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1162/tacl_a_00618","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"doi:10.1162/tacl_a_00618","venue":"Transactions of the Association for Computational Linguistics","work_id":"8b81fc77-7b10-4142-865b-4a8b867c2c2e","year":2023},"citing_paper":{"arxiv_id":"2604.12456","last_updated":"2026-04-22T07:37:41Z","snapshot_observed_at":"2026-07-06T23:00:37.144068Z","submitted_at":"2026-04-14T08:42:10Z","title":"X-VC: Zero-shot Streaming Voice Conversion in Codec Space","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T14:20:01.885544Z"},"links":{"citing_paper":"/paper/2604.12456"},"observation_digest":"sha256:6cc0c834442e501dfea28480cabc69a9bab96fb536be580e6a0802bfba8396e5","observation_id":"9e03fa50-dc37-4ca3-8c1e-8e39373d0f08","resolution":{"observed_at":"2026-05-10T14:20:28.795484Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"8485.2024","doi":"10.1109/icassp48485.2024","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"URL http://dx.doi.org/10.1109/ICASSP48485.2024.10447579","venue":null,"work_id":"c4a0500e-cb13-456d-825a-73ad45e75f95","year":2024},"citing_paper":{"arxiv_id":"2604.12456","last_updated":"2026-04-22T07:37:41Z","snapshot_observed_at":"2026-07-06T23:00:37.144068Z","submitted_at":"2026-04-14T08:42:10Z","title":"X-VC: Zero-shot Streaming Voice Conversion in Codec Space","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T14:20:01.885544Z"},"links":{"citing_paper":"/paper/2604.12456"},"observation_digest":"sha256:45a05e4ae785938563aba494d82651c28efd801cdbd2a684e18f1568a12d2a24","observation_id":"d644bcab-2587-4141-a4ae-eddbbba8784f","resolution":{"observed_at":"2026-05-10T14:20:28.808527Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-18T11:51:16.869672+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-18T11:51:16.869672+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"9357.2023","doi":"10.1109/icassp49357.2023","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"In: ICASSP 2023 - 2023 IEEE Inter- national Conference on Acoustics, Speech and Signal Processing (ICASSP), pp","venue":null,"work_id":"d4aa6117-860d-404b-ac11-39169a0ac02c","year":2023},"citing_paper":{"arxiv_id":"2604.12456","last_updated":"2026-04-22T07:37:41Z","snapshot_observed_at":"2026-07-06T23:00:37.144068Z","submitted_at":"2026-04-14T08:42:10Z","title":"X-VC: Zero-shot Streaming Voice Conversion in Codec Space","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-10T14:20:01.885544Z"},"links":{"citing_paper":"/paper/2604.12456"},"observation_digest":"sha256:068343d5e7cbd133c798367491e5d620cdfca4a52a0afebec6b1dd14c0ed47c7","observation_id":"6d8a4e03-d195-454f-acfc-132281a2e5de","resolution":{"observed_at":"2026-05-10T14:20:28.817857Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21437/interspeech.2021-319","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":null,"venue":null,"work_id":"87c573e5-42fd-4f5a-ba47-8a685acb487c","year":2021},"citing_paper":{"arxiv_id":"2604.12456","last_updated":"2026-04-22T07:37:41Z","snapshot_observed_at":"2026-07-06T23:00:37.144068Z","submitted_at":"2026-04-14T08:42:10Z","title":"X-VC: Zero-shot Streaming Voice Conversion in Codec Space","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-10T14:20:01.885544Z"},"links":{"citing_paper":"/paper/2604.12456"},"observation_digest":"sha256:7906f2572209c5102914a9f71e6d760577be6f14ca92527b9c9bdeb6f87b3258","observation_id":"e3c3fddc-52d4-43a2-8106-a3f2359d5970","resolution":{"observed_at":"2026-05-10T14:20:28.802730Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lin, Chung-Ming Chien, Jheng-Hao Lin, Hung-yi Lee, and Lin-shan Lee","venue":null,"work_id":"ebed8278-dc65-44f6-a80e-f621cadf3cae","year":null},"citing_paper":{"arxiv_id":"2604.12456","last_updated":"2026-04-22T07:37:41Z","snapshot_observed_at":"2026-07-06T23:00:37.144068Z","submitted_at":"2026-04-14T08:42:10Z","title":"X-VC: Zero-shot Streaming Voice Conversion in Codec Space","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-10T14:20:01.885544Z"},"links":{"citing_paper":"/paper/2604.12456"},"observation_digest":"sha256:a612ef3040aa2b7e0c86d54f04fe8f595fb5344f2385de60ba018dbedf512950","observation_id":"f04a160d-875a-40bc-8d46-88cafeda5f47","resolution":{"observed_at":"2026-05-18T14:52:41.823484Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"9728.2021","doi":"10.1109/icassp39728.2021","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Benign Overﬁtting in Binary Classiﬁcation of Gaussian Mix- tures","venue":null,"work_id":"be26a294-57a7-4dd7-9fc8-e42728330d49","year":2021},"citing_paper":{"arxiv_id":"2604.12456","last_updated":"2026-04-22T07:37:41Z","snapshot_observed_at":"2026-07-06T23:00:37.144068Z","submitted_at":"2026-04-14T08:42:10Z","title":"X-VC: Zero-shot Streaming Voice Conversion in Codec Space","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-10T14:20:01.885544Z"},"links":{"citing_paper":"/paper/2604.12456"},"observation_digest":"sha256:02618cf092df953caa57da356ff7186ab9e4675a8868ecbff93d2b7ac4f56119","observation_id":"284de7d8-7452-4228-b593-6374991733f7","resolution":{"observed_at":"2026-05-10T14:20:28.779855Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-21T23:23:20.57075+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T23:23:20.57075+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.09943","last_updated":"2024-11-15T04:43:44Z","snapshot_observed_at":"2026-07-06T19:50:42.251149Z","submitted_at":"2024-11-15T04:43:44Z","title":"Zero-shot Voice Conversion with Diffusion Transformers","version":1},"cited_work":{"arxiv_id":"2411.09943","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.09943","snapshot_observed_at":"2026-07-04T08:29:41.883949Z","title":"Liu, ”Zero-shot Voice Conversion with Diffusion Transformers,”","venue":null,"work_id":"a2d874f7-bf61-4f6e-8a45-e939f8b9b605","year":2024},"citing_paper":{"arxiv_id":"2604.12456","last_updated":"2026-04-22T07:37:41Z","snapshot_observed_at":"2026-07-06T23:00:37.144068Z","submitted_at":"2026-04-14T08:42:10Z","title":"X-VC: Zero-shot Streaming Voice Conversion in Codec Space","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-10T14:20:01.885544Z"},"links":{"cited_paper":"/paper/2411.09943","citing_paper":"/paper/2604.12456"},"observation_digest":"sha256:7754ce79d2fa67431d18ce744050d356804aa0de8b9c02d187c24b10281d70c9","observation_id":"c463817e-4ee0-4514-900f-962ebbd3c4e3","resolution":{"observed_at":"2026-05-10T14:20:29.712580Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.08392","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T03:37:35.390712Z","title":"Ziyang Ma, Zhisheng Zheng, Jiaxin Ye, Jinchao Li, Zhifu Gao, Shiliang Zhang, and Xie Chen","venue":null,"work_id":"dc624583-0e69-434c-a385-16cf2cca769f","year":2025},"citing_paper":{"arxiv_id":"2604.12456","last_updated":"2026-04-22T07:37:41Z","snapshot_observed_at":"2026-07-06T23:00:37.144068Z","submitted_at":"2026-04-14T08:42:10Z","title":"X-VC: Zero-shot Streaming Voice Conversion in Codec Space","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T14:20:01.885544Z"},"links":{"citing_paper":"/paper/2604.12456"},"observation_digest":"sha256:1e669228682d62e8a2e9e36aa03ef1318348e52a89452722f46e6ff901a23c96","observation_id":"ba87d31c-127a-4366-9c13-faca65846154","resolution":{"observed_at":"2026-05-10T14:20:29.814869Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1016/j","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T01:07:42.960769Z","title":"Masset, R","venue":null,"work_id":"238df2e4-a3e5-46f3-860e-3ae2b0094b97","year":2019},"citing_paper":{"arxiv_id":"2604.12456","last_updated":"2026-04-22T07:37:41Z","snapshot_observed_at":"2026-07-06T23:00:37.144068Z","submitted_at":"2026-04-14T08:42:10Z","title":"X-VC: Zero-shot Streaming Voice Conversion in Codec Space","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-10T14:20:01.885544Z"},"links":{"citing_paper":"/paper/2604.12456"},"observation_digest":"sha256:756ece98bcbcf9d27b23f86070a2dbd3039703bc98a5ea9c26c8bc599b047daf","observation_id":"7587dca1-10c4-42ec-aea7-f2653c7e0e4c","resolution":{"observed_at":"2026-05-10T14:20:28.755133Z","resolver_source":"doi_truncated","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"8485.2024","doi":"10.1109/icassp48485.2024","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"URL http://dx.doi.org/10.1109/ICASSP48485.2024.10447579","venue":null,"work_id":"c4a0500e-cb13-456d-825a-73ad45e75f95","year":2024},"citing_paper":{"arxiv_id":"2604.12456","last_updated":"2026-04-22T07:37:41Z","snapshot_observed_at":"2026-07-06T23:00:37.144068Z","submitted_at":"2026-04-14T08:42:10Z","title":"X-VC: Zero-shot Streaming Voice Conversion in Codec Space","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-10T14:20:01.885544Z"},"links":{"citing_paper":"/paper/2604.12456"},"observation_digest":"sha256:3cfe274e76df74d6028ba9d9e20b528ae87bda5ab782dc0e27e2bbf66e970134","observation_id":"13aa3780-387a-4074-a614-747bfae46cc4","resolution":{"observed_at":"2026-05-10T14:20:28.761219Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-18T11:51:16.869672+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-18T11:51:16.869672+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21437/interspeech.2023-1157","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":null,"venue":null,"work_id":"660e297b-2304-476f-9680-22e5b366fd6c","year":2023},"citing_paper":{"arxiv_id":"2604.12456","last_updated":"2026-04-22T07:37:41Z","snapshot_observed_at":"2026-07-06T23:00:37.144068Z","submitted_at":"2026-04-14T08:42:10Z","title":"X-VC: Zero-shot Streaming Voice Conversion in Codec Space","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-10T14:20:01.885544Z"},"links":{"citing_paper":"/paper/2604.12456"},"observation_digest":"sha256:f6103eb287cc16cd29a29b26103f4ae5ca4256b1b47d1100ba1275aa80af4e12","observation_id":"b862dc70-c979-4f22-8269-13823e537da4","resolution":{"observed_at":"2026-05-10T14:20:28.770397Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"77b23632-f12e-4782-bb4f-f3442dcc2b37","year":2023},"citing_paper":{"arxiv_id":"2604.12456","last_updated":"2026-04-22T07:37:41Z","snapshot_observed_at":"2026-07-06T23:00:37.144068Z","submitted_at":"2026-04-14T08:42:10Z","title":"X-VC: Zero-shot Streaming Voice Conversion in Codec Space","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-10T14:20:01.885544Z"},"links":{"citing_paper":"/paper/2604.12456"},"observation_digest":"sha256:f30f0b4f49c920132b16f673092bfb95a01b8d6489268aa9529a818c8091a726","observation_id":"024a1245-b8d4-41c1-8501-3f6a9deb058d","resolution":{"observed_at":"2026-05-18T14:52:41.830065Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1609/aaai.v32i1.11671","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Perez , author F","venue":"Proceedings of the AAAI Conference on Artificial Intelligence","work_id":"69721167-33cf-405e-bc6e-46eff7b2197f","year":2018},"citing_paper":{"arxiv_id":"2604.12456","last_updated":"2026-04-22T07:37:41Z","snapshot_observed_at":"2026-07-06T23:00:37.144068Z","submitted_at":"2026-04-14T08:42:10Z","title":"X-VC: Zero-shot Streaming Voice Conversion in Codec Space","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-10T14:20:01.885544Z"},"links":{"citing_paper":"/paper/2604.12456"},"observation_digest":"sha256:d74e955bad6bb40cece41f3ac396f9e4aed40b13e830b32f14e1fcbf8ab9150e","observation_id":"2bf89a03-098b-4396-af64-274e16eb3e4a","resolution":{"observed_at":"2026-05-10T14:20:28.773925Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T12:18:33.193763+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T12:18:33.193763+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"31270e56-116b-445c-acbd-f972aad8e5d1","year":2019},"citing_paper":{"arxiv_id":"2604.12456","last_updated":"2026-04-22T07:37:41Z","snapshot_observed_at":"2026-07-06T23:00:37.144068Z","submitted_at":"2026-04-14T08:42:10Z","title":"X-VC: Zero-shot Streaming Voice Conversion in Codec Space","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-10T14:20:01.885544Z"},"links":{"citing_paper":"/paper/2604.12456"},"observation_digest":"sha256:9456287b59ed11374dd33076947e9703bc2fbbdd78ce21ce2b52fdc8f378c49f","observation_id":"c946173c-c86f-4e5d-ae56-5f8c8373361a","resolution":{"observed_at":"2026-05-18T14:52:41.833429Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.01479","last_updated":"2024-08-18T16:36:50Z","snapshot_observed_at":"2026-08-05T11:33:26.486472Z","submitted_at":"2023-12-03T18:41:54Z","title":"OpenVoice: Versatile Instant Voice Cloning","version":6},"cited_work":{"arxiv_id":"2312.01479","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.01479","snapshot_observed_at":"2026-07-04T07:39:38.688028Z","title":"Open- voice: Versatile instant voice cloning","venue":null,"work_id":"a48b6be3-dc96-49c7-b0eb-a8ce7f9ecd40","year":2023},"citing_paper":{"arxiv_id":"2604.12456","last_updated":"2026-04-22T07:37:41Z","snapshot_observed_at":"2026-07-06T23:00:37.144068Z","submitted_at":"2026-04-14T08:42:10Z","title":"X-VC: Zero-shot Streaming Voice Conversion in Codec Space","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-10T14:20:01.885544Z"},"links":{"cited_paper":"/paper/2312.01479","citing_paper":"/paper/2604.12456"},"observation_digest":"sha256:a91a87b2d06b8456a5f6c1acea891d74c72469534c1b0e37c05176359e362665","observation_id":"751099a8-fc39-40a2-b1d5-1d066a3e25ab","resolution":{"observed_at":"2026-05-10T14:20:29.737780Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"40402e3a-eb00-48fe-85c5-2f3f119c84c4","year":2023},"citing_paper":{"arxiv_id":"2604.12456","last_updated":"2026-04-22T07:37:41Z","snapshot_observed_at":"2026-07-06T23:00:37.144068Z","submitted_at":"2026-04-14T08:42:10Z","title":"X-VC: Zero-shot Streaming Voice Conversion in Codec Space","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-10T14:20:01.885544Z"},"links":{"citing_paper":"/paper/2604.12456"},"observation_digest":"sha256:ec332e51b2bcade5fcd6efe8a5d2e52d851caf6d3bd3b3b9dedceed9e02e7ffe","observation_id":"b9893f43-dc42-4b54-aa5b-00902d23f994","resolution":{"observed_at":"2026-05-18T14:52:41.816835Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"9728.2021","doi":"10.1109/icassp39728.2021","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Benign Overﬁtting in Binary Classiﬁcation of Gaussian Mix- tures","venue":null,"work_id":"be26a294-57a7-4dd7-9fc8-e42728330d49","year":2021},"citing_paper":{"arxiv_id":"2604.12456","last_updated":"2026-04-22T07:37:41Z","snapshot_observed_at":"2026-07-06T23:00:37.144068Z","submitted_at":"2026-04-14T08:42:10Z","title":"X-VC: Zero-shot Streaming Voice Conversion in Codec Space","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-10T14:20:01.885544Z"},"links":{"citing_paper":"/paper/2604.12456"},"observation_digest":"sha256:229dbe5abce38e3b252a7c1b29998549709287734649c51e67c33c828b4eca32","observation_id":"b285de1d-0478-43fa-958f-dd18f5196e8b","resolution":{"observed_at":"2026-05-10T14:20:28.791834Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-21T23:23:20.57075+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T23:23:20.57075+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"b5935fd7-8c44-49ca-8531-1fce55331234","year":2022},"citing_paper":{"arxiv_id":"2604.12456","last_updated":"2026-04-22T07:37:41Z","snapshot_observed_at":"2026-07-06T23:00:37.144068Z","submitted_at":"2026-04-14T08:42:10Z","title":"X-VC: Zero-shot Streaming Voice Conversion in Codec Space","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-10T14:20:01.885544Z"},"links":{"citing_paper":"/paper/2604.12456"},"observation_digest":"sha256:20a4005690711ebaf16f6bb1efe87c5640684919655091b055bfd3fb029c6517","observation_id":"97edb838-e5bc-4bdb-ac2f-d0d972dfc3ba","resolution":{"observed_at":"2026-05-18T14:52:41.846333Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2020.303852","doi":"10.1109/taslp.2020.3038524","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":null,"venue":"IEEE/ACM Transactions on Audio Speech and Language Processing","work_id":"0ac5414a-15d2-4696-815d-5607ab8c0485","year":2021},"citing_paper":{"arxiv_id":"2604.12456","last_updated":"2026-04-22T07:37:41Z","snapshot_observed_at":"2026-07-06T23:00:37.144068Z","submitted_at":"2026-04-14T08:42:10Z","title":"X-VC: Zero-shot Streaming Voice Conversion in Codec Space","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-10T14:20:01.885544Z"},"links":{"citing_paper":"/paper/2604.12456"},"observation_digest":"sha256:e043c511bd0ff2ff53e3282824c4f0a359bcfb095fdda3e641913e3574175e3e","observation_id":"1864fd5f-ebfa-4fd3-bf1d-6dbaf7ff894a","resolution":{"observed_at":"2026-05-10T14:20:28.766333Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-02T20:06:32.256011Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":"2301.02111","doi":"10.48550/arxiv.2301.02111","metadata_source":"pith","pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","venue":"cs.CL","work_id":"de8fb688-dd63-4942-92f6-66d98d5b6db2","year":2023},"citing_paper":{"arxiv_id":"2604.12456","last_updated":"2026-04-22T07:37:41Z","snapshot_observed_at":"2026-07-06T23:00:37.144068Z","submitted_at":"2026-04-14T08:42:10Z","title":"X-VC: Zero-shot Streaming Voice Conversion in Codec Space","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-10T14:20:01.885544Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2604.12456"},"observation_digest":"sha256:4d690f7deeaeb9a7de70e0e44497c7335662ba5774d920da6735d097f4e7144c","observation_id":"117b39f4-c9a8-407f-bfc1-674eae695251","resolution":{"observed_at":"2026-05-13T01:31:07.171839Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21437/interspeech.2021-283","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":null,"venue":null,"work_id":"e259cf1c-53e6-491a-bf1c-f2c94c50cd21","year":2021},"citing_paper":{"arxiv_id":"2604.12456","last_updated":"2026-04-22T07:37:41Z","snapshot_observed_at":"2026-07-06T23:00:37.144068Z","submitted_at":"2026-04-14T08:42:10Z","title":"X-VC: Zero-shot Streaming Voice Conversion in Codec Space","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-10T14:20:01.885544Z"},"links":{"citing_paper":"/paper/2604.12456"},"observation_digest":"sha256:cb3b6c60aa64a6192e514fe149814bc35371afc6a06f8ad2a8a6b8531551c3d2","observation_id":"fd9455bd-42dc-40a1-adbb-bc9f5aa029b0","resolution":{"observed_at":"2026-05-10T14:20:28.837815Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"9968.2025","doi":"10.1109/icme59968.2025.11208907","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tengda Zhou, Shaoyang Men, Jingxian Liang, Baoxian Yu, Han Zhang, and Xiaomu Luo","venue":null,"work_id":"9812950f-88eb-4ca8-b5c9-7fd251f045fb","year":2025},"citing_paper":{"arxiv_id":"2604.12456","last_updated":"2026-04-22T07:37:41Z","snapshot_observed_at":"2026-07-06T23:00:37.144068Z","submitted_at":"2026-04-14T08:42:10Z","title":"X-VC: Zero-shot Streaming Voice Conversion in Codec Space","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-10T14:20:01.885544Z"},"links":{"citing_paper":"/paper/2604.12456"},"observation_digest":"sha256:eab9b8dea238006ccef6b7bf0e3c6324cb1714bae17bec0984810e9a7231af89","observation_id":"ae3157e2-c1c9-42d9-8336-9aeed1637b4d","resolution":{"observed_at":"2026-05-10T14:20:28.827791Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"fbb1c29c-8657-4099-a489-a10425923023","year":null},"citing_paper":{"arxiv_id":"2604.12456","last_updated":"2026-04-22T07:37:41Z","snapshot_observed_at":"2026-07-06T23:00:37.144068Z","submitted_at":"2026-04-14T08:42:10Z","title":"X-VC: Zero-shot Streaming Voice Conversion in Codec Space","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-10T14:20:01.885544Z"},"links":{"citing_paper":"/paper/2604.12456"},"observation_digest":"sha256:6872fdd27e9673313d96c99f91f796596470f272f996c565e5b8dfb62b57d0ed","observation_id":"3517672c-b941-49ba-a81e-3dda10ac0ba6","resolution":{"observed_at":"2026-05-18T14:52:41.839867Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.acl-long.396","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InProceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), Lun-Wei Ku, Andre Martins, and Vivek Srikumar (Eds.)","venue":null,"work_id":"42603b01-60c5-4f5c-92b9-d7153dcf3818","year":2024},"citing_paper":{"arxiv_id":"2604.12456","last_updated":"2026-04-22T07:37:41Z","snapshot_observed_at":"2026-07-06T23:00:37.144068Z","submitted_at":"2026-04-14T08:42:10Z","title":"X-VC: Zero-shot Streaming Voice Conversion in Codec Space","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-10T14:20:01.885544Z"},"links":{"citing_paper":"/paper/2604.12456"},"observation_digest":"sha256:71b222f3f732a52707013a562b5f3d54b44f0542f9168a2bc007df1f861f568f","observation_id":"ee7a07ad-430c-4e10-86ac-5b06019bb6c1","resolution":{"observed_at":"2026-05-10T14:20:28.841375Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1109/icassp48485","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":null,"venue":"ArXiv.org","work_id":"3b78ccfd-00fb-43ea-b4e7-02cd2a3d4c90","year":2024},"citing_paper":{"arxiv_id":"2604.12456","last_updated":"2026-04-22T07:37:41Z","snapshot_observed_at":"2026-07-06T23:00:37.144068Z","submitted_at":"2026-04-14T08:42:10Z","title":"X-VC: Zero-shot Streaming Voice Conversion in Codec Space","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-10T14:20:01.885544Z"},"links":{"citing_paper":"/paper/2604.12456"},"observation_digest":"sha256:4a597b1d5a4cd2ea4d73c484d502f7a0e51288257dcdd4bef530ab498864495a","observation_id":"ed2abbd0-7153-42fe-aa05-2d66cf21e67b","resolution":{"observed_at":"2026-05-10T14:20:28.831171Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2021.31299","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"ef35f822-f74c-48e0-bb83-30bc41489ffa","year":2022},"citing_paper":{"arxiv_id":"2604.12456","last_updated":"2026-04-22T07:37:41Z","snapshot_observed_at":"2026-07-06T23:00:37.144068Z","submitted_at":"2026-04-14T08:42:10Z","title":"X-VC: Zero-shot Streaming Voice Conversion in Codec Space","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-10T14:20:01.885544Z"},"links":{"citing_paper":"/paper/2604.12456"},"observation_digest":"sha256:6cf8fcf1eb0e3549477cef2ccaa48ab718d1c3293de7f8f2f8d456247a31bd63","observation_id":"eeddf9b4-7c0f-4135-b22a-36c7abb46d14","resolution":{"observed_at":"2026-05-10T14:20:29.970182Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21437/interspeech.2019-2441","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Weiss, Ye Jia, Zhifeng Chen, and Yonghui Wu","venue":null,"work_id":"82062014-09e6-4a32-9daa-dc3712dea0c5","year":2019},"citing_paper":{"arxiv_id":"2604.12456","last_updated":"2026-04-22T07:37:41Z","snapshot_observed_at":"2026-07-06T23:00:37.144068Z","submitted_at":"2026-04-14T08:42:10Z","title":"X-VC: Zero-shot Streaming Voice Conversion in Codec Space","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-10T14:20:01.885544Z"},"links":{"citing_paper":"/paper/2604.12456"},"observation_digest":"sha256:013aabce7bc9e6b411754c778eb0d3ee3dad9fcb94107ef890e813abd8f0ea5d","observation_id":"c62072cb-f198-43b4-9d2c-9d7185d8fd9b","resolution":{"observed_at":"2026-05-10T14:20:28.845093Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-13T09:49:57.294935+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T09:49:57.294935+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.09239","last_updated":"2026-06-07T10:32:48Z","snapshot_observed_at":"2026-08-03T10:44:30.007464Z","submitted_at":"2026-01-14T07:22:24Z","title":"DSA-Tokenizer: Disentangled Semantic-Acoustic Tokenization via Flow Matching-based Hierarchical Fusion","version":6},"cited_work":{"arxiv_id":"2601.09239","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2601.09239","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"b3c24771-319f-4130-889b-0eff194ebe99","year":2026},"citing_paper":{"arxiv_id":"2604.12456","last_updated":"2026-04-22T07:37:41Z","snapshot_observed_at":"2026-07-06T23:00:37.144068Z","submitted_at":"2026-04-14T08:42:10Z","title":"X-VC: Zero-shot Streaming Voice Conversion in Codec Space","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-10T14:20:01.885544Z"},"links":{"cited_paper":"/paper/2601.09239","citing_paper":"/paper/2604.12456"},"observation_digest":"sha256:e1a3b73b9ad59831ad2606784cc52485aa86c6e8cb908b01a252f5a46a9ea176","observation_id":"b89ec63c-0931-4f39-87c3-51238dc21f8b","resolution":{"observed_at":"2026-05-27T02:05:10.523257Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"576f90c2-7f3f-45ad-b151-b3f9e772a42b","year":2025},"citing_paper":{"arxiv_id":"2604.12456","last_updated":"2026-04-22T07:37:41Z","snapshot_observed_at":"2026-07-06T23:00:37.144068Z","submitted_at":"2026-04-14T08:42:10Z","title":"X-VC: Zero-shot Streaming Voice Conversion in Codec Space","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-10T14:20:01.885544Z"},"links":{"citing_paper":"/paper/2604.12456"},"observation_digest":"sha256:03e36a1b66851bd10142d139f6f6a95deb1f3e9279259ba2e239d0bc22b30113","observation_id":"e2019152-7161-4bb8-ad98-8d0fc39a8292","resolution":{"observed_at":"2026-05-18T14:52:41.814072Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.14534","last_updated":"2025-08-30T16:35:05Z","snapshot_observed_at":"2026-08-04T21:16:14.534600Z","submitted_at":"2025-07-19T08:32:07Z","title":"Conan: A Chunkwise Online Network for Zero-Shot Adaptive Voice Conversion","version":4},"cited_work":{"arxiv_id":"2507.14534","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.14534","snapshot_observed_at":"2026-07-01T20:16:12.319512Z","title":"Conan: A chunkwise online network for zero-shot adaptive voice conversion","venue":null,"work_id":"ec4092cf-4bfe-4b36-8979-093007faa456","year":2025},"citing_paper":{"arxiv_id":"2604.12456","last_updated":"2026-04-22T07:37:41Z","snapshot_observed_at":"2026-07-06T23:00:37.144068Z","submitted_at":"2026-04-14T08:42:10Z","title":"X-VC: Zero-shot Streaming Voice Conversion in Codec Space","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-10T14:20:01.885544Z"},"links":{"cited_paper":"/paper/2507.14534","citing_paper":"/paper/2604.12456"},"observation_digest":"sha256:ef41e86427eb7a80c9433ada2a80fb83328b98c2f02f1758764d825fdd1eec53","observation_id":"316d538f-1f07-4436-96e3-d160f469a179","resolution":{"observed_at":"2026-05-10T14:20:29.828049Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2604.12456","last_updated":"2026-04-22T07:37:41Z","latest_version":2,"primary_category":"eess.AS","snapshot_observed_at":"2026-07-06T23:00:37.144068Z","submitted_at":"2026-04-14T08:42:10Z","title":"X-VC: Zero-shot Streaming Voice Conversion in Codec Space"},"reference_resolution":{"displayed":47,"state_counts":{"malformed_identifier":3,"metadata_mismatch":8,"parse_uncertain":0,"unresolved":13,"verified_exact":22,"verified_fuzzy":1},"total_outbound_references":47},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 47 of 47 outbound references and 2 inbound Pith citation observations for arXiv:2604.12456."}