{"as_of":"2026-08-08T11:03:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c492b99e0b19a20d73f824d24048d54a08211471eb9001708eacd66a8b1d82b0","coverage":[{"denominator":42,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":42,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:28:41.644243Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:28:37.819963Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T11:26:01.472807Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.02414","last_updated":"2025-06-03T04:00:53Z","snapshot_observed_at":"2026-08-07T21:53:15.843632Z","submitted_at":"2025-06-03T04:00:53Z","title":"StarVC: A Unified Auto-Regressive Framework for Joint Text and Speech Generation in Voice Conversion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.02414","snapshot_observed_at":"2026-08-07T11:28:37.819963Z","title":"V oice Conversion (VC) is a technique that modifies the speaker identity of an utterance while preserving its linguistic content","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02414","last_updated":"2025-06-03T04:00:53Z","snapshot_observed_at":"2026-08-07T21:53:15.843632Z","submitted_at":"2025-06-03T04:00:53Z","title":"StarVC: A Unified Auto-Regressive Framework for Joint Text and Speech Generation in Voice Conversion","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:37.819963Z"},"links":{"cited_paper":"/paper/2506.02414","citing_paper":"/paper/2506.02414"},"observation_digest":"sha256:699540e07d1d3e7b6e64cb80d5574e16ff6046970088493c2b37e2c986ceee10","observation_id":"2df8c3c7-e932-4355-a298-55ec9b527926","resolution":{"observed_at":"2026-08-07T11:28:37.819963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02414","last_updated":"2025-06-03T04:00:53Z","snapshot_observed_at":"2026-08-07T21:53:15.843632Z","submitted_at":"2025-06-03T04:00:53Z","title":"StarVC: A Unified Auto-Regressive Framework for Joint Text and Speech Generation in Voice Conversion","version":1},"cited_work":{"arxiv_id":"2506.02414","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02414","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sang-Hoon Lee, Ha-Yeong Choi, Seung-Bin Kim, and Seong-Whan Lee","venue":null,"work_id":"3d2e1df5-1cbc-4a4a-ad94-4db36a9e922d","year":2025},"citing_paper":{"arxiv_id":"2604.11552","last_updated":"2026-04-19T12:57:45Z","snapshot_observed_at":"2026-08-02T16:35:17.072464Z","submitted_at":"2026-04-13T14:40:25Z","title":"MimicLM: Zero-Shot Voice Imitation through Autoregressive Modeling of Pseudo-Parallel Speech Corpora","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T14:57:07.894455Z"},"links":{"cited_paper":"/paper/2506.02414","citing_paper":"/paper/2604.11552"},"observation_digest":"sha256:a26b396a7f140768fffb44bf72d1df96691288afb26a84413345ecd21fe628bb","observation_id":"cbaacff1-6a1a-4a1e-872c-bb26dfe00aea","resolution":{"observed_at":"2026-05-11T11:26:01.479201Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.02414/citation-record","integrity":"/paper/2506.02414/integrity","json":"/paper/2506.02414/citation-record.json","paper":"/paper/2506.02414"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.02414","last_updated":"2025-06-03T04:00:53Z","snapshot_observed_at":"2026-08-07T21:53:15.843632Z","submitted_at":"2025-06-03T04:00:53Z","title":"StarVC: A Unified Auto-Regressive Framework for Joint Text and Speech Generation in Voice Conversion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.02414","snapshot_observed_at":"2026-08-07T11:28:37.819963Z","title":"V oice Conversion (VC) is a technique that modifies the speaker identity of an utterance while preserving its linguistic content","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02414","last_updated":"2025-06-03T04:00:53Z","snapshot_observed_at":"2026-08-07T21:53:15.843632Z","submitted_at":"2025-06-03T04:00:53Z","title":"StarVC: A Unified Auto-Regressive Framework for Joint Text and Speech Generation in Voice Conversion","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:37.819963Z"},"links":{"cited_paper":"/paper/2506.02414","citing_paper":"/paper/2506.02414"},"observation_digest":"sha256:699540e07d1d3e7b6e64cb80d5574e16ff6046970088493c2b37e2c986ceee10","observation_id":"2df8c3c7-e932-4355-a298-55ec9b527926","resolution":{"observed_at":"2026-08-07T11:28:37.819963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:44.125109Z","title":"System Architecture Our proposed StarVC framework is designed to jointly model speech conversion and text generation in an auto-regressive manner","venue":null,"work_id":"90c97f52-d9ca-42c1-b72f-4cbf42b6dec6","year":null},"citing_paper":{"arxiv_id":"2506.02414","last_updated":"2025-06-03T04:00:53Z","snapshot_observed_at":"2026-08-07T21:53:15.843632Z","submitted_at":"2025-06-03T04:00:53Z","title":"StarVC: A Unified Auto-Regressive Framework for Joint Text and Speech Generation in Voice Conversion","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:37.909035Z"},"links":{"citing_paper":"/paper/2506.02414"},"observation_digest":"sha256:9bb43fcda302a32610bf944f2d0aea9d8a701c40c32503c5dd7b9c34db2f193b","observation_id":"d0b4d78d-0dda-44f6-a87d-c6650ede0036","resolution":{"observed_at":"2026-08-07T11:28:44.222921Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:43.887025Z","title":null,"venue":null,"work_id":"9fad144d-4745-444e-b30d-61ea01da94f2","year":null},"citing_paper":{"arxiv_id":"2506.02414","last_updated":"2025-06-03T04:00:53Z","snapshot_observed_at":"2026-08-07T21:53:15.843632Z","submitted_at":"2025-06-03T04:00:53Z","title":"StarVC: A Unified Auto-Regressive Framework for Joint Text and Speech Generation in Voice Conversion","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:38.028580Z"},"links":{"citing_paper":"/paper/2506.02414"},"observation_digest":"sha256:9be476dd5cc902d833c67b3ea770bdd3c9104b1dfc8b5e96d5a0740f7185861f","observation_id":"dc1e7153-c55d-4ca3-902b-70bfe306697e","resolution":{"observed_at":"2026-08-07T11:28:44.016396Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:43.511671Z","title":null,"venue":null,"work_id":"1630ffe6-6bec-4d1f-bf7f-20ee86d20a2d","year":null},"citing_paper":{"arxiv_id":"2506.02414","last_updated":"2025-06-03T04:00:53Z","snapshot_observed_at":"2026-08-07T21:53:15.843632Z","submitted_at":"2025-06-03T04:00:53Z","title":"StarVC: A Unified Auto-Regressive Framework for Joint Text and Speech Generation in Voice Conversion","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:38.232977Z"},"links":{"citing_paper":"/paper/2506.02414"},"observation_digest":"sha256:43dd85b76595be15ea3e91903522721e1ba231567b89a82cdf16bdb6bdbbedf4","observation_id":"be2e4822-4938-407a-b34d-dcbfc2997b5b","resolution":{"observed_at":"2026-08-07T11:28:43.575685Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:38.357940Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02414","last_updated":"2025-06-03T04:00:53Z","snapshot_observed_at":"2026-08-07T21:53:15.843632Z","submitted_at":"2025-06-03T04:00:53Z","title":"StarVC: A Unified Auto-Regressive Framework for Joint Text and Speech Generation in Voice Conversion","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:38.357940Z"},"links":{"citing_paper":"/paper/2506.02414"},"observation_digest":"sha256:d1479a6372abb86f3f43b24eefc65a877231fa1c2d2827142a9fd0ff774faeda","observation_id":"97e42094-fa92-427b-9c45-7ef4b090d700","resolution":{"observed_at":"2026-08-07T11:28:38.357940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.05862","last_updated":"2019-09-11T08:19:49Z","snapshot_observed_at":"2026-08-06T05:33:37.746688Z","submitted_at":"2019-04-11T17:29:30Z","title":"wav2vec: Unsupervised Pre-training for Speech Recognition","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.05862","snapshot_observed_at":"2026-08-07T11:28:38.988059Z","title":"wav2vec: Unsupervised pre-training for speech recognition,","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2506.02414","last_updated":"2025-06-03T04:00:53Z","snapshot_observed_at":"2026-08-07T21:53:15.843632Z","submitted_at":"2025-06-03T04:00:53Z","title":"StarVC: A Unified Auto-Regressive Framework for Joint Text and Speech Generation in Voice Conversion","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:38.988059Z"},"links":{"cited_paper":"/paper/1904.05862","citing_paper":"/paper/2506.02414"},"observation_digest":"sha256:284fc746d5c9b94909617111edb9ae9bbdadd4d4188fc87b1ca1cba88195c259","observation_id":"0cd0cc7e-cfb5-4cac-8002-73ea19f1c9e0","resolution":{"observed_at":"2026-08-07T11:28:38.988059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:43.312859Z","title":"Continuous probabilis- tic transform for voice conversion,","venue":null,"work_id":"2196d1c3-5fe3-4131-849c-cc44c389b07b","year":1998},"citing_paper":{"arxiv_id":"2506.02414","last_updated":"2025-06-03T04:00:53Z","snapshot_observed_at":"2026-08-07T21:53:15.843632Z","submitted_at":"2025-06-03T04:00:53Z","title":"StarVC: A Unified Auto-Regressive Framework for Joint Text and Speech Generation in Voice Conversion","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:38.470719Z"},"links":{"citing_paper":"/paper/2506.02414"},"observation_digest":"sha256:9907b5300db3c8226c0b6833b17f7237be2660152409046f734ad5f1c337e484","observation_id":"083bfd3a-15f4-40df-877c-9ff9bc513108","resolution":{"observed_at":"2026-08-07T11:28:43.375754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08104","last_updated":"2023-11-14T12:03:46Z","snapshot_observed_at":"2026-07-06T16:47:21.000236Z","submitted_at":"2023-11-14T12:03:46Z","title":"Reimagining Speech: A Scoping Review of Deep Learning-Powered Voice Conversion","version":1},"cited_work":{"arxiv_id":"2311.08104","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.08104","snapshot_observed_at":"2026-08-07T11:28:42.213410Z","title":"Reimagining Speech: A Scoping Review of Deep Learning-Powered Voice Conversion","venue":"cs.SD","work_id":"ac5fef9c-9c1a-4cb5-8f9c-26768f6b8c77","year":2023},"citing_paper":{"arxiv_id":"2506.02414","last_updated":"2025-06-03T04:00:53Z","snapshot_observed_at":"2026-08-07T21:53:15.843632Z","submitted_at":"2025-06-03T04:00:53Z","title":"StarVC: A Unified Auto-Regressive Framework for Joint Text and Speech Generation in Voice Conversion","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:38.614095Z"},"links":{"cited_paper":"/paper/2311.08104","citing_paper":"/paper/2506.02414"},"observation_digest":"sha256:292655b723bc82da624e1cf8ee1a80813a663240b805290ac42d9d413f325d83","observation_id":"cd16316b-df7e-472d-9fc1-abb2b2823e3f","resolution":{"observed_at":"2026-08-07T11:28:42.299528Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:38.731606Z","title":"An overview of voice conversion and its challenges: From statistical modeling to deep learning,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.02414","last_updated":"2025-06-03T04:00:53Z","snapshot_observed_at":"2026-08-07T21:53:15.843632Z","submitted_at":"2025-06-03T04:00:53Z","title":"StarVC: A Unified Auto-Regressive Framework for Joint Text and Speech Generation in Voice Conversion","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:38.731606Z"},"links":{"citing_paper":"/paper/2506.02414"},"observation_digest":"sha256:b9de928de1cd5ac58140d69e6f9b1239367cdea5034b08cec7df0fcc05a6a90a","observation_id":"fcd138b0-e68e-4169-8bd6-f62d62ee0058","resolution":{"observed_at":"2026-08-07T11:28:38.731606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:38.812994Z","title":"Wavlm: Large-scale self- supervised pre-training for full stack speech processing,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.02414","last_updated":"2025-06-03T04:00:53Z","snapshot_observed_at":"2026-08-07T21:53:15.843632Z","submitted_at":"2025-06-03T04:00:53Z","title":"StarVC: A Unified Auto-Regressive Framework for Joint Text and Speech Generation in Voice Conversion","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:38.812994Z"},"links":{"citing_paper":"/paper/2506.02414"},"observation_digest":"sha256:a7a7eb8c2fed510c6650d46f49b665c8bd192b0dd718889af97ab8276c5bb8c7","observation_id":"195e3a43-85d4-472c-a547-3a17620df70f","resolution":{"observed_at":"2026-08-07T11:28:38.812994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:38.897234Z","title":"Hubert: Self-supervised speech represen- tation learning by masked prediction of hidden units,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.02414","last_updated":"2025-06-03T04:00:53Z","snapshot_observed_at":"2026-08-07T21:53:15.843632Z","submitted_at":"2025-06-03T04:00:53Z","title":"StarVC: A Unified Auto-Regressive Framework for Joint Text and Speech Generation in Voice Conversion","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:38.897234Z"},"links":{"citing_paper":"/paper/2506.02414"},"observation_digest":"sha256:79361175532b157e34122c728177c893ecdcf6ac5bc516e024212799e10ee38d","observation_id":"18398b93-4b38-4768-a86a-7eac87ab7345","resolution":{"observed_at":"2026-08-07T11:28:38.897234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.01479","last_updated":"2024-08-18T16:36:50Z","snapshot_observed_at":"2026-08-05T11:33:26.486472Z","submitted_at":"2023-12-03T18:41:54Z","title":"OpenVoice: Versatile Instant Voice Cloning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.01479","snapshot_observed_at":"2026-08-07T11:28:39.528807Z","title":"Openvoice: Versatile instant voice cloning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02414","last_updated":"2025-06-03T04:00:53Z","snapshot_observed_at":"2026-08-07T21:53:15.843632Z","submitted_at":"2025-06-03T04:00:53Z","title":"StarVC: A Unified Auto-Regressive Framework for Joint Text and Speech Generation in Voice Conversion","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:39.528807Z"},"links":{"cited_paper":"/paper/2312.01479","citing_paper":"/paper/2506.02414"},"observation_digest":"sha256:631c4c5dd7fcffee9ca7c44936694069f3734ad8229a9d37d1b07cf374b83624","observation_id":"ea4a4626-d600-476b-be27-4031ff45383f","resolution":{"observed_at":"2026-08-07T11:28:39.528807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:39.064394Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech repre- sentations,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.02414","last_updated":"2025-06-03T04:00:53Z","snapshot_observed_at":"2026-08-07T21:53:15.843632Z","submitted_at":"2025-06-03T04:00:53Z","title":"StarVC: A Unified Auto-Regressive Framework for Joint Text and Speech Generation in Voice Conversion","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:39.064394Z"},"links":{"citing_paper":"/paper/2506.02414"},"observation_digest":"sha256:6cf436d9be76c11cff9a4d5efc471761edf43f3756bc8b20f9960be1cfe940cd","observation_id":"046b8f8f-619e-4b20-9a7f-093be92c6539","resolution":{"observed_at":"2026-08-07T11:28:39.064394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:39.137014Z","title":"Neural codec language mod- els for disentangled and textless voice conversion,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02414","last_updated":"2025-06-03T04:00:53Z","snapshot_observed_at":"2026-08-07T21:53:15.843632Z","submitted_at":"2025-06-03T04:00:53Z","title":"StarVC: A Unified Auto-Regressive Framework for Joint Text and Speech Generation in Voice Conversion","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:39.137014Z"},"links":{"citing_paper":"/paper/2506.02414"},"observation_digest":"sha256:aa5b89422936ed95952e2e55e8311392ecfc066671b9b774520cad6537718da8","observation_id":"54b065c9-800b-4167-9be1-c71ec560cc6a","resolution":{"observed_at":"2026-08-07T11:28:39.137014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:43.057095Z","title":"Sef-vc: Speaker embedding free zero-shot voice conversion with cross attention,","venue":null,"work_id":"b1f67ab0-a838-4490-bdf4-eeb40628393d","year":2024},"citing_paper":{"arxiv_id":"2506.02414","last_updated":"2025-06-03T04:00:53Z","snapshot_observed_at":"2026-08-07T21:53:15.843632Z","submitted_at":"2025-06-03T04:00:53Z","title":"StarVC: A Unified Auto-Regressive Framework for Joint Text and Speech Generation in Voice Conversion","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:39.230437Z"},"links":{"citing_paper":"/paper/2506.02414"},"observation_digest":"sha256:d83e52b800e7f20b8500cf97c392f6f57a9714109ee27ffa0efc2bf66900ba85","observation_id":"9ddda902-e377-42e3-8b8b-28ce480d2a1e","resolution":{"observed_at":"2026-08-07T11:28:43.142109Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.13821","last_updated":"2022-08-04T10:25:40Z","snapshot_observed_at":"2026-08-07T17:24:03.888611Z","submitted_at":"2021-09-28T15:48:22Z","title":"Diffusion-Based Voice Conversion with Fast Maximum Likelihood Sampling Scheme","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.13821","snapshot_observed_at":"2026-08-07T11:28:39.352136Z","title":"Diffusion-based voice conversion with fast maximum likelihood sampling scheme,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.02414","last_updated":"2025-06-03T04:00:53Z","snapshot_observed_at":"2026-08-07T21:53:15.843632Z","submitted_at":"2025-06-03T04:00:53Z","title":"StarVC: A Unified Auto-Regressive Framework for Joint Text and Speech Generation in Voice Conversion","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:39.352136Z"},"links":{"cited_paper":"/paper/2109.13821","citing_paper":"/paper/2506.02414"},"observation_digest":"sha256:6d6de39050c73c733feb4a2c25ce3934cf481c786f9da6fa1fbec8a981588744","observation_id":"b8bb26c0-d798-4ad7-830a-f0d1443dacdc","resolution":{"observed_at":"2026-08-07T11:28:39.352136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04724","last_updated":"2024-12-10T05:52:28Z","snapshot_observed_at":"2026-08-07T11:14:08.982821Z","submitted_at":"2024-12-06T02:31:23Z","title":"StableVC: Style Controllable Zero-Shot Voice Conversion with Conditional Flow Matching","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04724","snapshot_observed_at":"2026-08-07T11:28:39.448947Z","title":"Sta- blevc: Style controllable zero-shot voice conversion with condi- tional flow matching,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02414","last_updated":"2025-06-03T04:00:53Z","snapshot_observed_at":"2026-08-07T21:53:15.843632Z","submitted_at":"2025-06-03T04:00:53Z","title":"StarVC: A Unified Auto-Regressive Framework for Joint Text and Speech Generation in Voice Conversion","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:39.448947Z"},"links":{"cited_paper":"/paper/2412.04724","citing_paper":"/paper/2506.02414"},"observation_digest":"sha256:17f3d34e7847496f7a9b5e7d266b82c3a0ae2929c72174ce61a5c19686443662","observation_id":"3b16057f-5c85-4021-8d28-792b3fb0e1d0","resolution":{"observed_at":"2026-08-07T11:28:39.448947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:40.063613Z","title":"Robust speech recognition via large-scale weak supervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02414","last_updated":"2025-06-03T04:00:53Z","snapshot_observed_at":"2026-08-07T21:53:15.843632Z","submitted_at":"2025-06-03T04:00:53Z","title":"StarVC: A Unified Auto-Regressive Framework for Joint Text and Speech Generation in Voice Conversion","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:40.063613Z"},"links":{"citing_paper":"/paper/2506.02414"},"observation_digest":"sha256:83c784f2ccdbbf97c02e6463aebd7c94fb20a390749102d9300ed0b96f1e9619","observation_id":"08679d1f-dc81-4a25-aba9-1d489ffcb276","resolution":{"observed_at":"2026-08-07T11:28:40.063613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:42.818475Z","title":"Lm-vc: Zero- shot voice conversion via speech generation based on language models,","venue":null,"work_id":"45c86162-f7b8-4a58-b671-a70f826ec77e","year":2023},"citing_paper":{"arxiv_id":"2506.02414","last_updated":"2025-06-03T04:00:53Z","snapshot_observed_at":"2026-08-07T21:53:15.843632Z","submitted_at":"2025-06-03T04:00:53Z","title":"StarVC: A Unified Auto-Regressive Framework for Joint Text and Speech Generation in Voice Conversion","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:39.621560Z"},"links":{"citing_paper":"/paper/2506.02414"},"observation_digest":"sha256:ca65d7845514a17d402912f63d6ab512cd65e0f2509cabf6c2c71123a7bc70ce","observation_id":"fd1cb69f-cfcf-4442-9706-a202b435bc43","resolution":{"observed_at":"2026-08-07T11:28:42.954005Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07846","last_updated":"2024-06-12T03:25:18Z","snapshot_observed_at":"2026-07-06T18:29:21.709395Z","submitted_at":"2024-06-12T03:25:18Z","title":"DualVC 3: Leveraging Language Model Generated Pseudo Context for End-to-end Low Latency Streaming Voice Conversion","version":1},"cited_work":{"arxiv_id":"2406.07846","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.07846","snapshot_observed_at":"2026-08-07T11:28:41.990312Z","title":"DualVC 3: Leveraging Language Model Generated Pseudo Context for End-to-end Low Latency Streaming Voice Conversion","venue":"eess.AS","work_id":"de97fde1-f202-428c-a562-a7597ae2a900","year":2024},"citing_paper":{"arxiv_id":"2506.02414","last_updated":"2025-06-03T04:00:53Z","snapshot_observed_at":"2026-08-07T21:53:15.843632Z","submitted_at":"2025-06-03T04:00:53Z","title":"StarVC: A Unified Auto-Regressive Framework for Joint Text and Speech Generation in Voice Conversion","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:39.747987Z"},"links":{"cited_paper":"/paper/2406.07846","citing_paper":"/paper/2506.02414"},"observation_digest":"sha256:70d7a7c2b466d7a11e221ed095dd6413794d3a1ec34aae66fc60be311f1ab4ee","observation_id":"36b70be6-0df8-4d65-bf04-5b5a7e66200c","resolution":{"observed_at":"2026-08-07T11:28:42.047432Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00037","last_updated":"2024-10-02T09:11:45Z","snapshot_observed_at":"2026-07-30T10:21:14.474746Z","submitted_at":"2024-09-17T17:55:39Z","title":"Moshi: a speech-text foundation model for real-time dialogue","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.00037","snapshot_observed_at":"2026-08-07T11:28:39.846201Z","title":"Moshi: a speech-text foundation model for real-time dialogue,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02414","last_updated":"2025-06-03T04:00:53Z","snapshot_observed_at":"2026-08-07T21:53:15.843632Z","submitted_at":"2025-06-03T04:00:53Z","title":"StarVC: A Unified Auto-Regressive Framework for Joint Text and Speech Generation in Voice Conversion","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:39.846201Z"},"links":{"cited_paper":"/paper/2410.00037","citing_paper":"/paper/2506.02414"},"observation_digest":"sha256:2168a9d2cef069c0cd9b47ec64ae606ddd49744db4455269de41dc1859c883ea","observation_id":"af841cf4-fb46-4464-a0d0-427ca241a113","resolution":{"observed_at":"2026-08-07T11:28:39.846201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16725","last_updated":"2024-11-05T02:24:18Z","snapshot_observed_at":"2026-07-06T19:07:46.545514Z","submitted_at":"2024-08-29T17:18:53Z","title":"Mini-Omni: Language Models Can Hear, Talk While Thinking in Streaming","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16725","snapshot_observed_at":"2026-08-07T11:28:39.892026Z","title":"Mini-omni: Language models can hear, talk while thinking in streaming,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02414","last_updated":"2025-06-03T04:00:53Z","snapshot_observed_at":"2026-08-07T21:53:15.843632Z","submitted_at":"2025-06-03T04:00:53Z","title":"StarVC: A Unified Auto-Regressive Framework for Joint Text and Speech Generation in Voice Conversion","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:39.892026Z"},"links":{"cited_paper":"/paper/2408.16725","citing_paper":"/paper/2506.02414"},"observation_digest":"sha256:0faf969ba804c63e31c463237f13e20308746a423a262227dc15c5edf0a9a52b","observation_id":"43b79292-ecd0-4ef7-8638-a3368fa496ff","resolution":{"observed_at":"2026-08-07T11:28:39.892026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-07-06T19:13:20.458958Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-08-07T11:28:39.960930Z","title":"Llama- omni: Seamless speech interaction with large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02414","last_updated":"2025-06-03T04:00:53Z","snapshot_observed_at":"2026-08-07T21:53:15.843632Z","submitted_at":"2025-06-03T04:00:53Z","title":"StarVC: A Unified Auto-Regressive Framework for Joint Text and Speech Generation in Voice Conversion","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:39.960930Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2506.02414"},"observation_digest":"sha256:0161cb728f340fad8281e1c5e36ed9f14e44606a94354e1cecfd80e619c24896","observation_id":"a38ced2f-e6bf-428d-9ab4-bc652ad434f4","resolution":{"observed_at":"2026-08-07T11:28:39.960930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.14411","last_updated":"2024-10-18T12:24:05Z","snapshot_observed_at":"2026-08-06T22:31:38.899089Z","submitted_at":"2024-10-18T12:24:05Z","title":"SNAC: Multi-Scale Neural Audio Codec","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.14411","snapshot_observed_at":"2026-08-07T11:28:40.523017Z","title":"Snac: Multi- scale neural audio codec,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02414","last_updated":"2025-06-03T04:00:53Z","snapshot_observed_at":"2026-08-07T21:53:15.843632Z","submitted_at":"2025-06-03T04:00:53Z","title":"StarVC: A Unified Auto-Regressive Framework for Joint Text and Speech Generation in Voice Conversion","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:40.523017Z"},"links":{"cited_paper":"/paper/2410.14411","citing_paper":"/paper/2506.02414"},"observation_digest":"sha256:3b5ef20210c84886f5c09331e1070c064952135796c498f2e86bdb4634b92238","observation_id":"f4cc7b23-095b-4950-b013-3e40c7124f70","resolution":{"observed_at":"2026-08-07T11:28:40.523017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.12838","last_updated":"2023-08-03T04:00:16Z","snapshot_observed_at":"2026-08-07T01:07:37.906062Z","submitted_at":"2023-05-22T09:01:23Z","title":"An Enhanced Res2Net with Local and Global Feature Fusion for Speaker Verification","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.12838","snapshot_observed_at":"2026-08-07T11:28:40.158378Z","title":"An enhanced res2net with local and global feature fusion for speaker verification,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02414","last_updated":"2025-06-03T04:00:53Z","snapshot_observed_at":"2026-08-07T21:53:15.843632Z","submitted_at":"2025-06-03T04:00:53Z","title":"StarVC: A Unified Auto-Regressive Framework for Joint Text and Speech Generation in Voice Conversion","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:40.158378Z"},"links":{"cited_paper":"/paper/2305.12838","citing_paper":"/paper/2506.02414"},"observation_digest":"sha256:74638bdcbbfe7097378266aabeb4bcefeb11b7ba7496d3b35f7048f7b5e3fa63","observation_id":"076302f5-652f-4c82-81b6-a0d019d2fe83","resolution":{"observed_at":"2026-08-07T11:28:40.158378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:42.682303Z","title":"Simple and controllable music gen- eration,","venue":null,"work_id":"41da548a-f771-433c-a777-84f762670251","year":2024},"citing_paper":{"arxiv_id":"2506.02414","last_updated":"2025-06-03T04:00:53Z","snapshot_observed_at":"2026-08-07T21:53:15.843632Z","submitted_at":"2025-06-03T04:00:53Z","title":"StarVC: A Unified Auto-Regressive Framework for Joint Text and Speech Generation in Voice Conversion","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:40.207492Z"},"links":{"citing_paper":"/paper/2506.02414"},"observation_digest":"sha256:93d74a22ecf64aca2529a5bc39b6eca9de460ae1a05370304c31e153c7582127","observation_id":"8966055c-0600-48f5-842f-1b7441585887","resolution":{"observed_at":"2026-08-07T11:28:42.734742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:42.619394Z","title":"A learning algorithm for contin- ually running fully recurrent neural networks,","venue":null,"work_id":"991b0e13-8d78-4b35-b1b9-81390bc09aca","year":1989},"citing_paper":{"arxiv_id":"2506.02414","last_updated":"2025-06-03T04:00:53Z","snapshot_observed_at":"2026-08-07T21:53:15.843632Z","submitted_at":"2025-06-03T04:00:53Z","title":"StarVC: A Unified Auto-Regressive Framework for Joint Text and Speech Generation in Voice Conversion","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:40.293600Z"},"links":{"citing_paper":"/paper/2506.02414"},"observation_digest":"sha256:941b70751f3e80095b67de4cdd27a8e328de3c29a6a3e1a8c1dd2fc7aa219a71","observation_id":"5a2f2a56-bbbb-481e-ae2d-1f7952068cde","resolution":{"observed_at":"2026-08-07T11:28:42.649884Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:40.350975Z","title":"Roformer: Enhanced transformer with rotary position embedding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02414","last_updated":"2025-06-03T04:00:53Z","snapshot_observed_at":"2026-08-07T21:53:15.843632Z","submitted_at":"2025-06-03T04:00:53Z","title":"StarVC: A Unified Auto-Regressive Framework for Joint Text and Speech Generation in Voice Conversion","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:40.350975Z"},"links":{"citing_paper":"/paper/2506.02414"},"observation_digest":"sha256:b395a714ab6db55cbc1e4f09585b70da0001e225862a3d4acfe06ecd6211264f","observation_id":"7ffb179f-d376-4940-a5e0-4b2a70c8daa0","resolution":{"observed_at":"2026-08-07T11:28:40.350975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.13438","last_updated":"2022-10-24T17:52:02Z","snapshot_observed_at":"2026-08-03T16:47:47.192907Z","submitted_at":"2022-10-24T17:52:02Z","title":"High Fidelity Neural Audio Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.13438","snapshot_observed_at":"2026-08-07T11:28:40.451256Z","title":"High fidelity neural audio compression,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.02414","last_updated":"2025-06-03T04:00:53Z","snapshot_observed_at":"2026-08-07T21:53:15.843632Z","submitted_at":"2025-06-03T04:00:53Z","title":"StarVC: A Unified Auto-Regressive Framework for Joint Text and Speech Generation in Voice Conversion","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:40.451256Z"},"links":{"cited_paper":"/paper/2210.13438","citing_paper":"/paper/2506.02414"},"observation_digest":"sha256:bcc652f78ce6a60cba3a261cc2b0d3623cb2f8ea3f34ba287c9968ad991eadab","observation_id":"3af7947a-e4ec-4113-bfab-1b49e1d85185","resolution":{"observed_at":"2026-08-07T11:28:40.451256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:43.661281Z","title":"GigaSpeech covers diverse domains and acoustic conditions, while LibriTTS is cleaner and more consistent","venue":null,"work_id":"7905260e-73d3-44f7-b5aa-ea3133eafa88","year":null},"citing_paper":{"arxiv_id":"2506.02414","last_updated":"2025-06-03T04:00:53Z","snapshot_observed_at":"2026-08-07T21:53:15.843632Z","submitted_at":"2025-06-03T04:00:53Z","title":"StarVC: A Unified Auto-Regressive Framework for Joint Text and Speech Generation in Voice Conversion","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:38.125123Z"},"links":{"citing_paper":"/paper/2506.02414"},"observation_digest":"sha256:3317bf55ce5e13069bc046032644b6f906454ce0292cbf8e124bfe9d72951f64","observation_id":"d21c2aa6-c7f5-4489-9a50-e5509b91f13c","resolution":{"observed_at":"2026-08-07T11:28:43.750906Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:40.567207Z","title":"High-fidelity audio compression with improved rvqgan,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02414","last_updated":"2025-06-03T04:00:53Z","snapshot_observed_at":"2026-08-07T21:53:15.843632Z","submitted_at":"2025-06-03T04:00:53Z","title":"StarVC: A Unified Auto-Regressive Framework for Joint Text and Speech Generation in Voice Conversion","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:40.567207Z"},"links":{"citing_paper":"/paper/2506.02414"},"observation_digest":"sha256:2a0f6ed49ff6d931882de9cd61e38231ea18891e0143ce60e697315d8db94d88","observation_id":"79e7c961-e095-421a-9902-fe11c8cc0f37","resolution":{"observed_at":"2026-08-07T11:28:40.567207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00233","last_updated":"2024-11-28T12:31:04Z","snapshot_observed_at":"2026-07-06T18:08:00.410061Z","submitted_at":"2024-04-30T22:51:36Z","title":"SemantiCodec: An Ultra Low Bitrate Semantic Audio Codec for General Sound","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00233","snapshot_observed_at":"2026-08-07T11:28:40.718286Z","title":"Semanticodec: An ultra low bitrate semantic audio codec for general sound,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02414","last_updated":"2025-06-03T04:00:53Z","snapshot_observed_at":"2026-08-07T21:53:15.843632Z","submitted_at":"2025-06-03T04:00:53Z","title":"StarVC: A Unified Auto-Regressive Framework for Joint Text and Speech Generation in Voice Conversion","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:40.718286Z"},"links":{"cited_paper":"/paper/2405.00233","citing_paper":"/paper/2506.02414"},"observation_digest":"sha256:858b0b451a98668bdf068d7a8c4b8cb40d44b5d8e75b02ece01c0422aa7b63db","observation_id":"1b25b703-7d5c-4ef4-82f1-5e2b0b7e8614","resolution":{"observed_at":"2026-08-07T11:28:40.718286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:42.423774Z","title":"Attention is all you need,","venue":null,"work_id":"b0bc18ae-41c0-4f99-9f36-aa510984e092","year":2017},"citing_paper":{"arxiv_id":"2506.02414","last_updated":"2025-06-03T04:00:53Z","snapshot_observed_at":"2026-08-07T21:53:15.843632Z","submitted_at":"2025-06-03T04:00:53Z","title":"StarVC: A Unified Auto-Regressive Framework for Joint Text and Speech Generation in Voice Conversion","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:40.798667Z"},"links":{"citing_paper":"/paper/2506.02414"},"observation_digest":"sha256:314fff286ec55fda5828a8f0ad219b9b779d6118e5064e7c4cdcc939673cca59","observation_id":"ea9bd571-082f-46ac-a8d4-4cb9ca20937e","resolution":{"observed_at":"2026-08-07T11:28:42.529219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-07T11:28:40.863401Z","title":"Qwen technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02414","last_updated":"2025-06-03T04:00:53Z","snapshot_observed_at":"2026-08-07T21:53:15.843632Z","submitted_at":"2025-06-03T04:00:53Z","title":"StarVC: A Unified Auto-Regressive Framework for Joint Text and Speech Generation in Voice Conversion","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:40.863401Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2506.02414"},"observation_digest":"sha256:e13c7cd5a939da0d3c26dfcf34e2b88cf674fd66923c039e282c01e2e08fdf15","observation_id":"7c0f7bc1-a43d-481f-b55b-e24c4e539021","resolution":{"observed_at":"2026-08-07T11:28:40.863401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T11:28:40.987790Z","title":"Qwen2. 5 technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02414","last_updated":"2025-06-03T04:00:53Z","snapshot_observed_at":"2026-08-07T21:53:15.843632Z","submitted_at":"2025-06-03T04:00:53Z","title":"StarVC: A Unified Auto-Regressive Framework for Joint Text and Speech Generation in Voice Conversion","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:40.987790Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2506.02414"},"observation_digest":"sha256:725ae2f5b10e8eee84d72cde4b319bbae21b7b09e896e4e47a2419651d06d771","observation_id":"bc33c64e-9538-4134-81bf-c2465e948553","resolution":{"observed_at":"2026-08-07T11:28:40.987790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06909","last_updated":"2021-06-13T04:09:16Z","snapshot_observed_at":"2026-08-07T15:49:16.814852Z","submitted_at":"2021-06-13T04:09:16Z","title":"GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.06909","snapshot_observed_at":"2026-08-07T11:28:41.066944Z","title":"Gigaspeech: An evolving, multi-domain asr corpus with 10,000 hours of transcribed audio,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.02414","last_updated":"2025-06-03T04:00:53Z","snapshot_observed_at":"2026-08-07T21:53:15.843632Z","submitted_at":"2025-06-03T04:00:53Z","title":"StarVC: A Unified Auto-Regressive Framework for Joint Text and Speech Generation in Voice Conversion","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:41.066944Z"},"links":{"cited_paper":"/paper/2106.06909","citing_paper":"/paper/2506.02414"},"observation_digest":"sha256:df5c1e43bab32ac817a9d3211e0b65da7280a6f6ae9648ed70db73e2f01d9b06","observation_id":"3d25116b-720e-4bed-b17b-d3100c804aa7","resolution":{"observed_at":"2026-08-07T11:28:41.066944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.02882","last_updated":"2019-04-05T06:05:00Z","snapshot_observed_at":"2026-08-07T13:32:24.356336Z","submitted_at":"2019-04-05T06:05:00Z","title":"LibriTTS: A Corpus Derived from LibriSpeech for Text-to-Speech","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.02882","snapshot_observed_at":"2026-08-07T11:28:41.167406Z","title":"Libritts: A corpus derived from librispeech for text- to-speech,","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2506.02414","last_updated":"2025-06-03T04:00:53Z","snapshot_observed_at":"2026-08-07T21:53:15.843632Z","submitted_at":"2025-06-03T04:00:53Z","title":"StarVC: A Unified Auto-Regressive Framework for Joint Text and Speech Generation in Voice Conversion","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:41.167406Z"},"links":{"cited_paper":"/paper/1904.02882","citing_paper":"/paper/2506.02414"},"observation_digest":"sha256:216cb06ac1f076d5a076f64f5c1cc2db6f14d13840b5b71922bf5531d7b75473","observation_id":"bc77ec91-1540-4805-b166-5340f8844ec1","resolution":{"observed_at":"2026-08-07T11:28:41.167406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:41.253071Z","title":"Lib- rispeech: an asr corpus based on public domain audio books,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.02414","last_updated":"2025-06-03T04:00:53Z","snapshot_observed_at":"2026-08-07T21:53:15.843632Z","submitted_at":"2025-06-03T04:00:53Z","title":"StarVC: A Unified Auto-Regressive Framework for Joint Text and Speech Generation in Voice Conversion","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:41.253071Z"},"links":{"citing_paper":"/paper/2506.02414"},"observation_digest":"sha256:b4bf7357e9d72c38f4b278c7b113d486afc89346beaa2993d8ebb4fdfbd5e4da","observation_id":"7a88d34e-8cf9-4b50-9f13-e91273c79b3e","resolution":{"observed_at":"2026-08-07T11:28:41.253071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05407","last_updated":"2024-07-09T07:42:51Z","snapshot_observed_at":"2026-07-06T18:42:34.958119Z","submitted_at":"2024-07-07T15:16:19Z","title":"CosyVoice: A Scalable Multilingual Zero-shot Text-to-speech Synthesizer based on Supervised Semantic Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05407","snapshot_observed_at":"2026-08-07T11:28:41.354168Z","title":"Cosyvoice: A scalable multi- lingual zero-shot text-to-speech synthesizer based on supervised semantic tokens,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02414","last_updated":"2025-06-03T04:00:53Z","snapshot_observed_at":"2026-08-07T21:53:15.843632Z","submitted_at":"2025-06-03T04:00:53Z","title":"StarVC: A Unified Auto-Regressive Framework for Joint Text and Speech Generation in Voice Conversion","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:41.354168Z"},"links":{"cited_paper":"/paper/2407.05407","citing_paper":"/paper/2506.02414"},"observation_digest":"sha256:bbfe8a5ea3acaa0b1d985b9a5db10fab08364e7d09cb682f4d3c70cf55f65199","observation_id":"be796505-843a-434d-988c-72a53d0e1f13","resolution":{"observed_at":"2026-08-07T11:28:41.354168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10117","last_updated":"2024-12-25T11:54:03Z","snapshot_observed_at":"2026-08-07T06:02:40.568271Z","submitted_at":"2024-12-13T12:59:39Z","title":"CosyVoice 2: Scalable Streaming Speech Synthesis with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10117","snapshot_observed_at":"2026-08-07T11:28:41.470407Z","title":"Cosyvoice 2: Scalable stream- ing speech synthesis with large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02414","last_updated":"2025-06-03T04:00:53Z","snapshot_observed_at":"2026-08-07T21:53:15.843632Z","submitted_at":"2025-06-03T04:00:53Z","title":"StarVC: A Unified Auto-Regressive Framework for Joint Text and Speech Generation in Voice Conversion","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:41.470407Z"},"links":{"cited_paper":"/paper/2412.10117","citing_paper":"/paper/2506.02414"},"observation_digest":"sha256:af6da900a0ac2d63102b829c0a4654000956523b7d0e0599839fa2e327f0f37b","observation_id":"8f54052a-3d2c-46cd-a514-9554e24980f9","resolution":{"observed_at":"2026-08-07T11:28:41.470407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:41.552257Z","title":"Yourtts: Towards zero-shot multi-speaker tts and zero-shot voice conversion for everyone,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.02414","last_updated":"2025-06-03T04:00:53Z","snapshot_observed_at":"2026-08-07T21:53:15.843632Z","submitted_at":"2025-06-03T04:00:53Z","title":"StarVC: A Unified Auto-Regressive Framework for Joint Text and Speech Generation in Voice Conversion","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:41.552257Z"},"links":{"citing_paper":"/paper/2506.02414"},"observation_digest":"sha256:ddd54834a15f8f35435954ffe6514786fa9144572e6cadd6781b0eebd9d85858","observation_id":"148c0d86-6b60-40c9-842f-178b7be97ab7","resolution":{"observed_at":"2026-08-07T11:28:41.552257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:41.644243Z","title":"Triaan- vc: Triple adaptive attention normalization for any-to-any voice conversion,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02414","last_updated":"2025-06-03T04:00:53Z","snapshot_observed_at":"2026-08-07T21:53:15.843632Z","submitted_at":"2025-06-03T04:00:53Z","title":"StarVC: A Unified Auto-Regressive Framework for Joint Text and Speech Generation in Voice Conversion","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:41.644243Z"},"links":{"citing_paper":"/paper/2506.02414"},"observation_digest":"sha256:213968e60e4dfef0b31d6cfa7b62bbd28fe8c20ecc28e810a2fb5974b7d42126","observation_id":"7c2b4fcd-d666-4124-ba7a-1ca69d74738e","resolution":{"observed_at":"2026-08-07T11:28:41.644243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.02414","last_updated":"2025-06-03T04:00:53Z","latest_version":1,"primary_category":"cs.MM","snapshot_observed_at":"2026-08-07T21:53:15.843632Z","submitted_at":"2025-06-03T04:00:53Z","title":"StarVC: A Unified Auto-Regressive Framework for Joint Text and Speech Generation in Voice Conversion"},"reference_resolution":{"displayed":42,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":32,"verified_exact":2,"verified_fuzzy":8},"total_outbound_references":42},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 42 of 42 outbound references and 2 inbound Pith citation observations for arXiv:2506.02414."}