{"as_of":"2026-08-07T09:19:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9498842282e10c25ef1fa285253397e38ddb807c53a65cb28298257729bb643e","coverage":[{"denominator":38,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:11:43.320594Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:11:39.929928Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T07:39:39.091187Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.19446","last_updated":"2025-06-24T09:20:25Z","snapshot_observed_at":"2026-08-06T23:04:22.364744Z","submitted_at":"2025-06-24T09:20:25Z","title":"Vo-Ve: An Explainable Voice-Vector for Speaker Identity Evaluation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.19446","snapshot_observed_at":"2026-08-06T23:11:39.929928Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.19446","last_updated":"2025-06-24T09:20:25Z","snapshot_observed_at":"2026-08-06T23:04:22.364744Z","submitted_at":"2025-06-24T09:20:25Z","title":"Vo-Ve: An Explainable Voice-Vector for Speaker Identity Evaluation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T23:11:39.929928Z"},"links":{"cited_paper":"/paper/2506.19446","citing_paper":"/paper/2506.19446"},"observation_digest":"sha256:d788cf1ffa4f7fe5ce3b3a93f52b26f9b38a5437e845e507bc66ff35573e43ef","observation_id":"5032c0b2-2a09-4683-a5f0-7fc08725c000","resolution":{"observed_at":"2026-08-06T23:11:39.929928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19446","last_updated":"2025-06-24T09:20:25Z","snapshot_observed_at":"2026-08-06T23:04:22.364744Z","submitted_at":"2025-06-24T09:20:25Z","title":"Vo-Ve: An Explainable Voice-Vector for Speaker Identity Evaluation","version":1},"cited_work":{"arxiv_id":"2506.19446","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.19446","snapshot_observed_at":"2026-07-04T07:39:39.091187Z","title":"V o-ve: An explainable voice-vector for speaker identity evaluation,","venue":null,"work_id":"6589e70c-7e52-4099-9beb-5e2a0a532895","year":2025},"citing_paper":{"arxiv_id":"2606.21305","last_updated":"2026-06-19T10:37:09Z","snapshot_observed_at":"2026-08-02T18:56:30.058323Z","submitted_at":"2026-06-19T10:37:09Z","title":"LISE : Listenable Interpretable Speaker Embeddings","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-26T13:10:03.421453Z"},"links":{"cited_paper":"/paper/2506.19446","citing_paper":"/paper/2606.21305"},"observation_digest":"sha256:351859b8896b4107c442d31baccf6bbb03f827457a51adb0ac8f8c376441877c","observation_id":"b3d5fcbf-f7e9-425b-a80a-082d472270b0","resolution":{"observed_at":"2026-07-04T07:39:39.092699Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.19446/citation-record","integrity":"/paper/2506.19446/integrity","json":"/paper/2506.19446/citation-record.json","paper":"/paper/2506.19446"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:11:48.394455Z","title":"Capturing speaker identity is crucial for tasks like speaker recognition [1]","venue":null,"work_id":"6082391f-feea-4554-8e6f-97c1010904f7","year":2025},"citing_paper":{"arxiv_id":"2506.19446","last_updated":"2025-06-24T09:20:25Z","snapshot_observed_at":"2026-08-06T23:04:22.364744Z","submitted_at":"2025-06-24T09:20:25Z","title":"Vo-Ve: An Explainable Voice-Vector for Speaker Identity Evaluation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T23:11:39.835183Z"},"links":{"citing_paper":"/paper/2506.19446"},"observation_digest":"sha256:e08544aeed0c317fadd7dad944ffc6d93c7905d25396253a7e55d537b31ddc90","observation_id":"485c22f8-e251-4b17-801c-ce7330b1e95c","resolution":{"observed_at":"2026-08-06T23:11:48.517868Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19446","last_updated":"2025-06-24T09:20:25Z","snapshot_observed_at":"2026-08-06T23:04:22.364744Z","submitted_at":"2025-06-24T09:20:25Z","title":"Vo-Ve: An Explainable Voice-Vector for Speaker Identity Evaluation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.19446","snapshot_observed_at":"2026-08-06T23:11:39.929928Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.19446","last_updated":"2025-06-24T09:20:25Z","snapshot_observed_at":"2026-08-06T23:04:22.364744Z","submitted_at":"2025-06-24T09:20:25Z","title":"Vo-Ve: An Explainable Voice-Vector for Speaker Identity Evaluation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T23:11:39.929928Z"},"links":{"cited_paper":"/paper/2506.19446","citing_paper":"/paper/2506.19446"},"observation_digest":"sha256:d788cf1ffa4f7fe5ce3b3a93f52b26f9b38a5437e845e507bc66ff35573e43ef","observation_id":"5032c0b2-2a09-4683-a5f0-7fc08725c000","resolution":{"observed_at":"2026-08-06T23:11:39.929928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:11:48.248046Z","title":"It is the sigmoid-activated output of a multi-label classification network trained on a voice attribute dataset","venue":null,"work_id":"5c4b98bb-5319-40fe-89ef-ecbe615deba9","year":null},"citing_paper":{"arxiv_id":"2506.19446","last_updated":"2025-06-24T09:20:25Z","snapshot_observed_at":"2026-08-06T23:04:22.364744Z","submitted_at":"2025-06-24T09:20:25Z","title":"Vo-Ve: An Explainable Voice-Vector for Speaker Identity Evaluation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T23:11:40.023390Z"},"links":{"citing_paper":"/paper/2506.19446"},"observation_digest":"sha256:1f81765461b9479f3a7974474fd9185a42bc2f3a54fb53a8f1c94066bbc8d335","observation_id":"cf400478-828b-493b-9b8a-6eb4c6ed5dae","resolution":{"observed_at":"2026-08-06T23:11:48.327866Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:11:48.039746Z","title":null,"venue":null,"work_id":"66c15cc7-a120-4927-8860-1fa92a5615f3","year":null},"citing_paper":{"arxiv_id":"2506.19446","last_updated":"2025-06-24T09:20:25Z","snapshot_observed_at":"2026-08-06T23:04:22.364744Z","submitted_at":"2025-06-24T09:20:25Z","title":"Vo-Ve: An Explainable Voice-Vector for Speaker Identity Evaluation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T23:11:40.161801Z"},"links":{"citing_paper":"/paper/2506.19446"},"observation_digest":"sha256:3d478b189ad487b0ffe273f1cebc34fe9be663626c90a0bbb31ca6f6bb6c766a","observation_id":"a5854b00-d644-45f1-8268-b2ebac02f036","resolution":{"observed_at":"2026-08-06T23:11:48.140825Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"0390.9996","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:11:44.115052Z","title":"In all other cases,y i is assigned a soft degree value","venue":null,"work_id":"5e83f616-2fce-4264-b134-814e2649f124","year":null},"citing_paper":{"arxiv_id":"2506.19446","last_updated":"2025-06-24T09:20:25Z","snapshot_observed_at":"2026-08-06T23:04:22.364744Z","submitted_at":"2025-06-24T09:20:25Z","title":"Vo-Ve: An Explainable Voice-Vector for Speaker Identity Evaluation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T23:11:40.270416Z"},"links":{"citing_paper":"/paper/2506.19446"},"observation_digest":"sha256:c317f938d8a22c7fe40989662b49fcffc838318831930cdea3d708dfb411836b","observation_id":"6cb08c33-f4f9-45e0-9ed9-98c0d56e0e07","resolution":{"observed_at":"2026-08-06T23:11:44.234027Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:11:47.703169Z","title":"medium.en","venue":null,"work_id":"17db17e9-f45f-4d75-be09-d4fc8ad521b7","year":null},"citing_paper":{"arxiv_id":"2506.19446","last_updated":"2025-06-24T09:20:25Z","snapshot_observed_at":"2026-08-06T23:04:22.364744Z","submitted_at":"2025-06-24T09:20:25Z","title":"Vo-Ve: An Explainable Voice-Vector for Speaker Identity Evaluation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T23:11:40.412834Z"},"links":{"citing_paper":"/paper/2506.19446"},"observation_digest":"sha256:8224402e2bc73728395b68e753a92b4a2825502ccb89b118d8ff8c99ee6d7b80","observation_id":"da65c7b0-17ff-4bd2-9275-3fb55e45d866","resolution":{"observed_at":"2026-08-06T23:11:47.843772Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:11:47.459139Z","title":"To fairly evaluate its potential, we designed a network architecture similar to that of the comparison system","venue":null,"work_id":"365dbe2a-e55c-4070-bc14-20d33f8e19b5","year":null},"citing_paper":{"arxiv_id":"2506.19446","last_updated":"2025-06-24T09:20:25Z","snapshot_observed_at":"2026-08-06T23:04:22.364744Z","submitted_at":"2025-06-24T09:20:25Z","title":"Vo-Ve: An Explainable Voice-Vector for Speaker Identity Evaluation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T23:11:40.526031Z"},"links":{"citing_paper":"/paper/2506.19446"},"observation_digest":"sha256:c6f17cbbe15526a55f05b5dfd74b8aa5198f7fec94e9809b4bb795a7a6b550a8","observation_id":"5e04afff-3473-4a71-ae5d-9db33112db5e","resolution":{"observed_at":"2026-08-06T23:11:47.567233Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:11:47.249675Z","title":null,"venue":null,"work_id":"ec9e19e6-9229-4ef9-a115-e47a29db5ccc","year":null},"citing_paper":{"arxiv_id":"2506.19446","last_updated":"2025-06-24T09:20:25Z","snapshot_observed_at":"2026-08-06T23:04:22.364744Z","submitted_at":"2025-06-24T09:20:25Z","title":"Vo-Ve: An Explainable Voice-Vector for Speaker Identity Evaluation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T23:11:40.595106Z"},"links":{"citing_paper":"/paper/2506.19446"},"observation_digest":"sha256:0a8441e91d6240ce98009d5376edb2af6b4e9166c1d1d9931619e1ec739ca6d3","observation_id":"fcde7ae5-0106-4e8e-9586-2db28808c628","resolution":{"observed_at":"2026-08-06T23:11:47.337554Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:11:47.134656Z","title":"RS- 2022-II220641, 50%], [No","venue":null,"work_id":"c333a3f9-216a-488f-9069-49a807464654","year":2022},"citing_paper":{"arxiv_id":"2506.19446","last_updated":"2025-06-24T09:20:25Z","snapshot_observed_at":"2026-08-06T23:04:22.364744Z","submitted_at":"2025-06-24T09:20:25Z","title":"Vo-Ve: An Explainable Voice-Vector for Speaker Identity Evaluation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T23:11:40.665867Z"},"links":{"citing_paper":"/paper/2506.19446"},"observation_digest":"sha256:842b6b75c215a94d8384f50d68566bcda47baf947bcf077e06acd652f14d8166","observation_id":"9c6207bd-5d2d-46af-8a73-41fef571f6d0","resolution":{"observed_at":"2026-08-06T23:11:47.219696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:11:46.983263Z","title":"The vox celeb speaker recognition challenge: A retrospective,","venue":null,"work_id":"d489a8d1-9493-49d3-aebf-4b9c3a105fc2","year":2024},"citing_paper":{"arxiv_id":"2506.19446","last_updated":"2025-06-24T09:20:25Z","snapshot_observed_at":"2026-08-06T23:04:22.364744Z","submitted_at":"2025-06-24T09:20:25Z","title":"Vo-Ve: An Explainable Voice-Vector for Speaker Identity Evaluation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T23:11:40.735020Z"},"links":{"citing_paper":"/paper/2506.19446"},"observation_digest":"sha256:ba80003ba9339890b8cff4cc4068c9f166427536abea82fcb8842a49e80bb8e3","observation_id":"84b50df6-15fc-4506-ae60-e4ec09d24fd8","resolution":{"observed_at":"2026-08-06T23:11:47.025381Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:11:46.843989Z","title":"Yourtts: Towards zero-shot multi-speaker tts and zero-shot voice conversion for everyone,","venue":null,"work_id":"d98a39f8-6f74-4e9c-b9a3-23fe4b0d83c0","year":2022},"citing_paper":{"arxiv_id":"2506.19446","last_updated":"2025-06-24T09:20:25Z","snapshot_observed_at":"2026-08-06T23:04:22.364744Z","submitted_at":"2025-06-24T09:20:25Z","title":"Vo-Ve: An Explainable Voice-Vector for Speaker Identity Evaluation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T23:11:40.796125Z"},"links":{"citing_paper":"/paper/2506.19446"},"observation_digest":"sha256:aad463e5224277248eb287d6cb46753e4dd6604f0f38d8d2d1a38a9ea5476b66","observation_id":"e8edbdf1-87c6-4a92-b894-9763989f4468","resolution":{"observed_at":"2026-08-06T23:11:46.886580Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-02T20:06:32.256011Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-06T23:11:40.868064Z","title":"Neural codec language mod- els are zero-shot text to speech synthesizers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.19446","last_updated":"2025-06-24T09:20:25Z","snapshot_observed_at":"2026-08-06T23:04:22.364744Z","submitted_at":"2025-06-24T09:20:25Z","title":"Vo-Ve: An Explainable Voice-Vector for Speaker Identity Evaluation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T23:11:40.868064Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2506.19446"},"observation_digest":"sha256:6d1b39b2df391fdffd6bfe7d73a2e388040944e704dfc20abde4f29a4bdd994a","observation_id":"8ef12dd1-6619-49f6-b981-784ba5565fb7","resolution":{"observed_at":"2026-08-06T23:11:40.868064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:11:46.712356Z","title":"V oicebox: Text-guided multilingual universal speech generation at scale,","venue":null,"work_id":"2e964804-5951-4c3b-afac-5133cb7d6c88","year":2024},"citing_paper":{"arxiv_id":"2506.19446","last_updated":"2025-06-24T09:20:25Z","snapshot_observed_at":"2026-08-06T23:04:22.364744Z","submitted_at":"2025-06-24T09:20:25Z","title":"Vo-Ve: An Explainable Voice-Vector for Speaker Identity Evaluation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T23:11:40.938787Z"},"links":{"citing_paper":"/paper/2506.19446"},"observation_digest":"sha256:da1497c16c2b4cd28fcc223f36469fd658669ad60f25471764dad4cbf45249c4","observation_id":"762f54fc-d9f1-47de-bd2d-aa7d3f20b376","resolution":{"observed_at":"2026-08-06T23:11:46.761422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.07143","last_updated":"2020-08-10T13:50:24Z","snapshot_observed_at":"2026-08-07T04:59:40.648353Z","submitted_at":"2020-05-14T17:02:15Z","title":"ECAPA-TDNN: Emphasized Channel Attention, Propagation and Aggregation in TDNN Based Speaker Verification","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.07143","snapshot_observed_at":"2026-08-06T23:11:41.039155Z","title":"Ecapa- tdnn: Emphasized channel attention, propagation and ag- gregation in tdnn based speaker verification,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2506.19446","last_updated":"2025-06-24T09:20:25Z","snapshot_observed_at":"2026-08-06T23:04:22.364744Z","submitted_at":"2025-06-24T09:20:25Z","title":"Vo-Ve: An Explainable Voice-Vector for Speaker Identity Evaluation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T23:11:41.039155Z"},"links":{"cited_paper":"/paper/2005.07143","citing_paper":"/paper/2506.19446"},"observation_digest":"sha256:6a041d02f6ff535ee5a4d3de9e1b95589ce20de2464bcf7242080db6ef821df4","observation_id":"37ef71b2-d082-485d-92b4-01090fa38714","resolution":{"observed_at":"2026-08-06T23:11:41.039155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:11:41.104677Z","title":"Wavlm: Large-scale self- supervised pre-training for full stack speech processing,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.19446","last_updated":"2025-06-24T09:20:25Z","snapshot_observed_at":"2026-08-06T23:04:22.364744Z","submitted_at":"2025-06-24T09:20:25Z","title":"Vo-Ve: An Explainable Voice-Vector for Speaker Identity Evaluation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T23:11:41.104677Z"},"links":{"citing_paper":"/paper/2506.19446"},"observation_digest":"sha256:7505d4205916a4bda918f03d07c0700001354477f253d462c5d903729c4f4c5c","observation_id":"19136b80-45e3-477f-a5e2-03945d96a9cb","resolution":{"observed_at":"2026-08-06T23:11:41.104677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:11:46.565543Z","title":"Resemblyzer,","venue":null,"work_id":"b5ba9091-4b8f-4582-abb0-ed9098370de6","year":null},"citing_paper":{"arxiv_id":"2506.19446","last_updated":"2025-06-24T09:20:25Z","snapshot_observed_at":"2026-08-06T23:04:22.364744Z","submitted_at":"2025-06-24T09:20:25Z","title":"Vo-Ve: An Explainable Voice-Vector for Speaker Identity Evaluation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T23:11:41.170641Z"},"links":{"citing_paper":"/paper/2506.19446"},"observation_digest":"sha256:dc594b23d0ee7c20a33c5426fae30ce1f7bdf8d6c0ee7f17b6064a19158a6a8f","observation_id":"89afb706-495a-4893-bb14-28d28138bcd3","resolution":{"observed_at":"2026-08-06T23:11:46.642369Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:11:46.439450Z","title":"Rw-voiceshield: Raw waveform-based adversarial attack on one-shot voice conversion,","venue":null,"work_id":"196db422-52a5-4b4c-806e-70fe09061538","year":2024},"citing_paper":{"arxiv_id":"2506.19446","last_updated":"2025-06-24T09:20:25Z","snapshot_observed_at":"2026-08-06T23:04:22.364744Z","submitted_at":"2025-06-24T09:20:25Z","title":"Vo-Ve: An Explainable Voice-Vector for Speaker Identity Evaluation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T23:11:41.231169Z"},"links":{"citing_paper":"/paper/2506.19446"},"observation_digest":"sha256:8775c9cfef04f745ce4592ef2b25fe141a812bb3eea0c7267b48967ea5a27bbe","observation_id":"2f60d1d1-855b-4c55-ac72-b04ca3a6c1bd","resolution":{"observed_at":"2026-08-06T23:11:46.506090Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:11:46.286060Z","title":"Disentangling prosody and timbre embeddings via voice conversion,","venue":null,"work_id":"4eb9498d-bc05-411c-9711-be43004c0a1c","year":2024},"citing_paper":{"arxiv_id":"2506.19446","last_updated":"2025-06-24T09:20:25Z","snapshot_observed_at":"2026-08-06T23:04:22.364744Z","submitted_at":"2025-06-24T09:20:25Z","title":"Vo-Ve: An Explainable Voice-Vector for Speaker Identity Evaluation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T23:11:41.309732Z"},"links":{"citing_paper":"/paper/2506.19446"},"observation_digest":"sha256:d1b809cddc222315de581e374fd91247ebd76ab35372b6c0716084ada2d6baa7","observation_id":"4440b17d-58a4-4ad6-8000-4a552f602c82","resolution":{"observed_at":"2026-08-06T23:11:46.342918Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:11:46.134660Z","title":"Prvae-vc2: Non-parallel voice conversion by distillation of speech represen- tations,","venue":null,"work_id":"696f33cc-c6d3-4dfd-88f9-e2acc6a33723","year":2024},"citing_paper":{"arxiv_id":"2506.19446","last_updated":"2025-06-24T09:20:25Z","snapshot_observed_at":"2026-08-06T23:04:22.364744Z","submitted_at":"2025-06-24T09:20:25Z","title":"Vo-Ve: An Explainable Voice-Vector for Speaker Identity Evaluation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T23:11:41.358326Z"},"links":{"citing_paper":"/paper/2506.19446"},"observation_digest":"sha256:2fde776b23a53ae2b0b22fa517b6a382d42be560719fb32a1087927240b4c7bb","observation_id":"52a179a6-cb4e-4482-a054-da1d27c67eea","resolution":{"observed_at":"2026-08-06T23:11:46.217001Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:11:45.971995Z","title":"Neural codec language mod- els for disentangled and textless voice conversion,","venue":null,"work_id":"a54852f2-5e77-40c9-8701-5085c462dd9c","year":2024},"citing_paper":{"arxiv_id":"2506.19446","last_updated":"2025-06-24T09:20:25Z","snapshot_observed_at":"2026-08-06T23:04:22.364744Z","submitted_at":"2025-06-24T09:20:25Z","title":"Vo-Ve: An Explainable Voice-Vector for Speaker Identity Evaluation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T23:11:41.446656Z"},"links":{"citing_paper":"/paper/2506.19446"},"observation_digest":"sha256:e8b4e373239bebf816aa657566e7bd4b8c57a389afdeede106b7395bdde4816f","observation_id":"f0e8203d-d2de-4362-a159-4069543edb41","resolution":{"observed_at":"2026-08-06T23:11:46.047706Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:11:45.871658Z","title":"Improvement speaker similarity for zero-shot any-to-any voice conversion of whispered and regular speech,","venue":null,"work_id":"a93b34f1-84b6-4875-8652-cc5dc5947ab3","year":2024},"citing_paper":{"arxiv_id":"2506.19446","last_updated":"2025-06-24T09:20:25Z","snapshot_observed_at":"2026-08-06T23:04:22.364744Z","submitted_at":"2025-06-24T09:20:25Z","title":"Vo-Ve: An Explainable Voice-Vector for Speaker Identity Evaluation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T23:11:41.552922Z"},"links":{"citing_paper":"/paper/2506.19446"},"observation_digest":"sha256:74db134777bde733ff0e797cd406e1cf6bd768f8b89c0f94903cab85e62b36d0","observation_id":"cadc6e3e-dc74-4b0a-b055-a51021ab8605","resolution":{"observed_at":"2026-08-06T23:11:45.901858Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07280","last_updated":"2024-06-11T14:07:05Z","snapshot_observed_at":"2026-07-06T18:28:55.652937Z","submitted_at":"2024-06-11T14:07:05Z","title":"Noise-Robust Voice Conversion by Conditional Denoising Training Using Latent Variables of Recording Quality and Environment","version":1},"cited_work":{"arxiv_id":"2406.07280","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.07280","snapshot_observed_at":"2026-08-06T23:11:43.728827Z","title":"Noise-Robust Voice Conversion by Conditional Denoising Training Using Latent Variables of Recording Quality and Environment","venue":"cs.SD","work_id":"6d14fe26-1d30-482c-bb91-ab9c27fd131c","year":2024},"citing_paper":{"arxiv_id":"2506.19446","last_updated":"2025-06-24T09:20:25Z","snapshot_observed_at":"2026-08-06T23:04:22.364744Z","submitted_at":"2025-06-24T09:20:25Z","title":"Vo-Ve: An Explainable Voice-Vector for Speaker Identity Evaluation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T23:11:41.642300Z"},"links":{"cited_paper":"/paper/2406.07280","citing_paper":"/paper/2506.19446"},"observation_digest":"sha256:75651735d195efa9f9114ec69a2067ab549db3bda7786abe535ad36401ef62cc","observation_id":"ac1e39c6-8530-4f04-a576-7c5e01d428e4","resolution":{"observed_at":"2026-08-06T23:11:43.809069Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:11:45.679297Z","title":"Utilizing adaptive global response normal- ization and cluster-based pseudo labels for zero-shot voice con- version,","venue":null,"work_id":"d795bc87-86a6-4602-bafc-c39bb360893a","year":2024},"citing_paper":{"arxiv_id":"2506.19446","last_updated":"2025-06-24T09:20:25Z","snapshot_observed_at":"2026-08-06T23:04:22.364744Z","submitted_at":"2025-06-24T09:20:25Z","title":"Vo-Ve: An Explainable Voice-Vector for Speaker Identity Evaluation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T23:11:41.735184Z"},"links":{"citing_paper":"/paper/2506.19446"},"observation_digest":"sha256:3d0fd43e8b95be7e3fc3986ce9eb3b436185ee6eb86adbda4faef79a7dcdfe92","observation_id":"57794480-f872-4909-95ca-07d824d94a69","resolution":{"observed_at":"2026-08-06T23:11:45.745311Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:11:45.558376Z","title":"Hear your face: Face-based voice conversion with f0 estimation,","venue":null,"work_id":"63e29b4e-c622-4432-bdea-88379b9fc3a0","year":2024},"citing_paper":{"arxiv_id":"2506.19446","last_updated":"2025-06-24T09:20:25Z","snapshot_observed_at":"2026-08-06T23:04:22.364744Z","submitted_at":"2025-06-24T09:20:25Z","title":"Vo-Ve: An Explainable Voice-Vector for Speaker Identity Evaluation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T23:11:41.911559Z"},"links":{"citing_paper":"/paper/2506.19446"},"observation_digest":"sha256:587c920cc21630c86c69b8ac22c9af1dd2047878971d6edbde72424dcfd93fe7","observation_id":"9189fd58-a25e-4193-9d87-0447877e3612","resolution":{"observed_at":"2026-08-06T23:11:45.618439Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:11:45.447661Z","title":"Xe-speech: Joint training framework of non-autoregressive cross-lingual emotional text-to-speech and voice conversion,","venue":null,"work_id":"ca8993f9-14ee-4b54-9905-4c6c242d9ac9","year":2024},"citing_paper":{"arxiv_id":"2506.19446","last_updated":"2025-06-24T09:20:25Z","snapshot_observed_at":"2026-08-06T23:04:22.364744Z","submitted_at":"2025-06-24T09:20:25Z","title":"Vo-Ve: An Explainable Voice-Vector for Speaker Identity Evaluation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T23:11:42.003263Z"},"links":{"citing_paper":"/paper/2506.19446"},"observation_digest":"sha256:0a822f1ce863ff466460b927d658c4fe65b7470c6967db97d5dd92e081cef3ba","observation_id":"ff8fa4b0-3e6a-4615-84e7-3431fe2206ee","resolution":{"observed_at":"2026-08-06T23:11:45.507465Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:11:45.254446Z","title":"Generalized end-to-end loss for speaker verification,","venue":null,"work_id":"8d434f30-ed5c-4ad5-a9dd-3d956ebaefdb","year":2018},"citing_paper":{"arxiv_id":"2506.19446","last_updated":"2025-06-24T09:20:25Z","snapshot_observed_at":"2026-08-06T23:04:22.364744Z","submitted_at":"2025-06-24T09:20:25Z","title":"Vo-Ve: An Explainable Voice-Vector for Speaker Identity Evaluation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T23:11:42.089027Z"},"links":{"citing_paper":"/paper/2506.19446"},"observation_digest":"sha256:0c85238b2c1a34cdfb03e3b6782fe5064fbe1c47775a2be75ee380933ef99c0d","observation_id":"b207531f-bfe0-47fc-aaa9-414d5ab37577","resolution":{"observed_at":"2026-08-06T23:11:45.327519Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.00990","last_updated":"2022-11-11T09:00:10Z","snapshot_observed_at":"2026-07-06T12:56:04.298366Z","submitted_at":"2022-04-03T04:55:00Z","title":"Content-Dependent Fine-Grained Speaker Embedding for Zero-Shot Speaker Adaptation in Text-to-Speech Synthesis","version":2},"cited_work":{"arxiv_id":"2204.00990","doi":null,"metadata_source":"pith","pith_arxiv_id":"2204.00990","snapshot_observed_at":"2026-08-06T23:11:43.556989Z","title":"Content-Dependent Fine-Grained Speaker Embedding for Zero-Shot Speaker Adaptation in Text-to-Speech Synthesis","venue":"cs.SD","work_id":"411f47f3-1611-4d08-97c6-77b5eadd45f7","year":2022},"citing_paper":{"arxiv_id":"2506.19446","last_updated":"2025-06-24T09:20:25Z","snapshot_observed_at":"2026-08-06T23:04:22.364744Z","submitted_at":"2025-06-24T09:20:25Z","title":"Vo-Ve: An Explainable Voice-Vector for Speaker Identity Evaluation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T23:11:42.243754Z"},"links":{"cited_paper":"/paper/2204.00990","citing_paper":"/paper/2506.19446"},"observation_digest":"sha256:ddd955e1879d87617b0eeca5d83e7c2f297f40b6a25fbd2f0c5ec6709ee20883","observation_id":"77734955-a45a-4452-b122-c527efa05d00","resolution":{"observed_at":"2026-08-06T23:11:43.619693Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:11:45.030974Z","title":"Prompttts: Control- lable text-to-speech with text descriptions,","venue":null,"work_id":"efd1cd6a-6483-4ea2-adfc-b26de744f4e2","year":2023},"citing_paper":{"arxiv_id":"2506.19446","last_updated":"2025-06-24T09:20:25Z","snapshot_observed_at":"2026-08-06T23:04:22.364744Z","submitted_at":"2025-06-24T09:20:25Z","title":"Vo-Ve: An Explainable Voice-Vector for Speaker Identity Evaluation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T23:11:42.338530Z"},"links":{"citing_paper":"/paper/2506.19446"},"observation_digest":"sha256:60b5bcb3b72f90fd7769666358be9ad11ad7a52ecca4c1292071d7f70151d50f","observation_id":"f81fb40c-955f-4df5-ac8d-e2d7922cd032","resolution":{"observed_at":"2026-08-06T23:11:45.148513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:11:44.755022Z","title":"Promptspeaker: Speaker generation based on text descriptions,","venue":null,"work_id":"168ecf82-9136-4bb3-853b-d268e6a12a3f","year":2023},"citing_paper":{"arxiv_id":"2506.19446","last_updated":"2025-06-24T09:20:25Z","snapshot_observed_at":"2026-08-06T23:04:22.364744Z","submitted_at":"2025-06-24T09:20:25Z","title":"Vo-Ve: An Explainable Voice-Vector for Speaker Identity Evaluation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T23:11:42.435402Z"},"links":{"citing_paper":"/paper/2506.19446"},"observation_digest":"sha256:54d91a07642636e6273e5b8b199dc68b53a9b257f13fde97f7215813430b41c0","observation_id":"7a9b9c98-804c-4b45-ad34-24e4e5525142","resolution":{"observed_at":"2026-08-06T23:11:44.868869Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.02285","last_updated":"2023-10-12T03:05:36Z","snapshot_observed_at":"2026-08-01T15:11:32.829718Z","submitted_at":"2023-09-05T14:45:27Z","title":"PromptTTS 2: Describing and Generating Voices with Text Prompt","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.02285","snapshot_observed_at":"2026-08-06T23:11:42.535892Z","title":"Prompttts 2: Describing and generating voices with text prompt,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.19446","last_updated":"2025-06-24T09:20:25Z","snapshot_observed_at":"2026-08-06T23:04:22.364744Z","submitted_at":"2025-06-24T09:20:25Z","title":"Vo-Ve: An Explainable Voice-Vector for Speaker Identity Evaluation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T23:11:42.535892Z"},"links":{"cited_paper":"/paper/2309.02285","citing_paper":"/paper/2506.19446"},"observation_digest":"sha256:bf6d04af7622bca977c6ff0444e6a51e9311a2509d6238a8af8c60393de2063e","observation_id":"7e391c06-70b0-455d-bc32-99a59adbf865","resolution":{"observed_at":"2026-08-06T23:11:42.535892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:11:44.529950Z","title":"Prompttts++: Controlling speaker identity in prompt-based text-to-speech using natural language descriptions,","venue":null,"work_id":"2e23cbd5-6c72-4551-9fe5-90b560113468","year":2024},"citing_paper":{"arxiv_id":"2506.19446","last_updated":"2025-06-24T09:20:25Z","snapshot_observed_at":"2026-08-06T23:04:22.364744Z","submitted_at":"2025-06-24T09:20:25Z","title":"Vo-Ve: An Explainable Voice-Vector for Speaker Identity Evaluation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T23:11:42.648416Z"},"links":{"citing_paper":"/paper/2506.19446"},"observation_digest":"sha256:4312f8d4effbde89270a19ee5a6e3951ea452d00393149c884332459c35add33","observation_id":"b43bb0dc-4675-4d6a-bba7-91ff455a110e","resolution":{"observed_at":"2026-08-06T23:11:44.633586Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07969","last_updated":"2024-06-12T07:49:21Z","snapshot_observed_at":"2026-07-06T18:29:25.765578Z","submitted_at":"2024-06-12T07:49:21Z","title":"LibriTTS-P: A Corpus with Speaking Style and Speaker Identity Prompts for Text-to-Speech and Style Captioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07969","snapshot_observed_at":"2026-08-06T23:11:42.752159Z","title":"Libritts-p: A corpus with speaking style and speaker identity prompts for text-to-speech and style captioning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19446","last_updated":"2025-06-24T09:20:25Z","snapshot_observed_at":"2026-08-06T23:04:22.364744Z","submitted_at":"2025-06-24T09:20:25Z","title":"Vo-Ve: An Explainable Voice-Vector for Speaker Identity Evaluation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T23:11:42.752159Z"},"links":{"cited_paper":"/paper/2406.07969","citing_paper":"/paper/2506.19446"},"observation_digest":"sha256:f5c4133538129bbd251986babb7457e02df28c52031c805446d1c1fe47524fd6","observation_id":"20d61d8b-d02a-4020-8f28-7efc009f9d1e","resolution":{"observed_at":"2026-08-06T23:11:42.752159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18802","last_updated":"2023-05-30T07:30:21Z","snapshot_observed_at":"2026-07-06T15:35:15.564727Z","submitted_at":"2023-05-30T07:30:21Z","title":"LibriTTS-R: A Restored Multi-Speaker Text-to-Speech Corpus","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18802","snapshot_observed_at":"2026-08-06T23:11:42.876333Z","title":"Libritts-r: A restored multi-speaker text-to-speech corpus,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.19446","last_updated":"2025-06-24T09:20:25Z","snapshot_observed_at":"2026-08-06T23:04:22.364744Z","submitted_at":"2025-06-24T09:20:25Z","title":"Vo-Ve: An Explainable Voice-Vector for Speaker Identity Evaluation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T23:11:42.876333Z"},"links":{"cited_paper":"/paper/2305.18802","citing_paper":"/paper/2506.19446"},"observation_digest":"sha256:d2662ac11fc1cbce4bc32ae1d9e6e6acc97177e5818f1b560a424b263d7bf665","observation_id":"6a283c48-535c-4950-b7b7-0d8852c115b4","resolution":{"observed_at":"2026-08-06T23:11:42.876333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.02882","last_updated":"2019-04-05T06:05:00Z","snapshot_observed_at":"2026-08-05T08:02:17.848918Z","submitted_at":"2019-04-05T06:05:00Z","title":"LibriTTS: A Corpus Derived from LibriSpeech for Text-to-Speech","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.02882","snapshot_observed_at":"2026-08-06T23:11:42.989059Z","title":"Libritts: A corpus derived from librispeech for text- to-speech,","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2506.19446","last_updated":"2025-06-24T09:20:25Z","snapshot_observed_at":"2026-08-06T23:04:22.364744Z","submitted_at":"2025-06-24T09:20:25Z","title":"Vo-Ve: An Explainable Voice-Vector for Speaker Identity Evaluation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T23:11:42.989059Z"},"links":{"cited_paper":"/paper/1904.02882","citing_paper":"/paper/2506.19446"},"observation_digest":"sha256:cd1408014acb48069f7f6a623964c5875bffee81d457761f9465290edb3108ff","observation_id":"d5ebba29-2c63-438a-80e3-3f52f9783e60","resolution":{"observed_at":"2026-08-06T23:11:42.989059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-06T23:11:43.095827Z","title":"Decoupled weight decay regularization,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.19446","last_updated":"2025-06-24T09:20:25Z","snapshot_observed_at":"2026-08-06T23:04:22.364744Z","submitted_at":"2025-06-24T09:20:25Z","title":"Vo-Ve: An Explainable Voice-Vector for Speaker Identity Evaluation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T23:11:43.095827Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2506.19446"},"observation_digest":"sha256:53085f8382c2fd96fdff78c9746a54df63fdc4a5afd239cfdc10af7d66add381","observation_id":"f7dd9378-99fa-410b-8bc8-f5db5b7c011b","resolution":{"observed_at":"2026-08-06T23:11:43.095827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:11:44.349098Z","title":"Cstr vctk corpus: English multi-speaker corpus for cstr voice cloning toolkit (ver- sion 0.92),","venue":null,"work_id":"82333bc1-e19e-4ea9-acd7-30ab45c5643d","year":2019},"citing_paper":{"arxiv_id":"2506.19446","last_updated":"2025-06-24T09:20:25Z","snapshot_observed_at":"2026-08-06T23:04:22.364744Z","submitted_at":"2025-06-24T09:20:25Z","title":"Vo-Ve: An Explainable Voice-Vector for Speaker Identity Evaluation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T23:11:43.158289Z"},"links":{"citing_paper":"/paper/2506.19446"},"observation_digest":"sha256:c8b9f888d075af0176dc3ecb6ac72f59e933eba752cbb18970945a7a9a9f899a","observation_id":"702c8416-4ebe-481d-b412-efcf77986d97","resolution":{"observed_at":"2026-08-06T23:11:44.442497Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1809.00496","last_updated":"2018-10-28T14:29:46Z","snapshot_observed_at":"2026-07-06T06:58:51.877372Z","submitted_at":"2018-09-03T08:38:34Z","title":"LRS3-TED: a large-scale dataset for visual speech recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.00496","snapshot_observed_at":"2026-08-06T23:11:43.229333Z","title":"Lrs3-ted: a large-scale dataset for visual speech recognition,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.19446","last_updated":"2025-06-24T09:20:25Z","snapshot_observed_at":"2026-08-06T23:04:22.364744Z","submitted_at":"2025-06-24T09:20:25Z","title":"Vo-Ve: An Explainable Voice-Vector for Speaker Identity Evaluation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T23:11:43.229333Z"},"links":{"cited_paper":"/paper/1809.00496","citing_paper":"/paper/2506.19446"},"observation_digest":"sha256:127a913afa6b572a46b37130f6e9fbe362e1f6bb2bb0ebcfc0afc93230e81d82","observation_id":"f938d0b1-3a39-44db-be2d-0311dbfcb046","resolution":{"observed_at":"2026-08-06T23:11:43.229333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:11:43.320594Z","title":"Robust speech recognition via large-scale weak supervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.19446","last_updated":"2025-06-24T09:20:25Z","snapshot_observed_at":"2026-08-06T23:04:22.364744Z","submitted_at":"2025-06-24T09:20:25Z","title":"Vo-Ve: An Explainable Voice-Vector for Speaker Identity Evaluation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T23:11:43.320594Z"},"links":{"citing_paper":"/paper/2506.19446"},"observation_digest":"sha256:ffbd5e5c65ec9b5e72c4967ca01c54358090530b39d544f50ee363d7b9e2d55f","observation_id":"46b6d711-48bf-4fcb-9ea6-1c41a6dfecae","resolution":{"observed_at":"2026-08-06T23:11:43.320594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.19446","last_updated":"2025-06-24T09:20:25Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-06T23:04:22.364744Z","submitted_at":"2025-06-24T09:20:25Z","title":"Vo-Ve: An Explainable Voice-Vector for Speaker Identity Evaluation"},"reference_resolution":{"displayed":38,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":13,"verified_exact":3,"verified_fuzzy":22},"total_outbound_references":38},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 38 of 38 outbound references and 2 inbound Pith citation observations for arXiv:2506.19446."}