{"as_of":"2026-08-07T20:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e26a058ba7b64de34c30deeff606d03404a848b84e2e3f191f0296e405e49c03","coverage":[{"denominator":51,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":51,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:23:53.153699Z","state":"measured"},{"denominator":53,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":53,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:23:45.554040Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-15T17:26:22.148036Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.00324","last_updated":"2025-06-30T23:41:04Z","snapshot_observed_at":"2026-08-07T14:58:54.081354Z","submitted_at":"2025-06-30T23:41:04Z","title":"Collecting, Curating, and Annotating Good Quality Speech deepfake dataset for Famous Figures: Process and Challenges","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.00324","snapshot_observed_at":"2026-08-06T21:23:45.554040Z","title":"We can broadly clas- sify these datasets into two categories, based on their speaker characteristics and intended applications","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00324","last_updated":"2025-06-30T23:41:04Z","snapshot_observed_at":"2026-08-07T14:58:54.081354Z","submitted_at":"2025-06-30T23:41:04Z","title":"Collecting, Curating, and Annotating Good Quality Speech deepfake dataset for Famous Figures: Process and Challenges","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:45.554040Z"},"links":{"cited_paper":"/paper/2507.00324","citing_paper":"/paper/2507.00324"},"observation_digest":"sha256:1549ce9739b2ecadec9a3ac39852704525069037e287eddf2072b023f2137cd0","observation_id":"f6badd89-b359-41b2-abf5-00ce9b129525","resolution":{"observed_at":"2026-08-06T21:23:45.554040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.00324","last_updated":"2025-06-30T23:41:04Z","snapshot_observed_at":"2026-08-07T14:58:54.081354Z","submitted_at":"2025-06-30T23:41:04Z","title":"Collecting, Curating, and Annotating Good Quality Speech deepfake dataset for Famous Figures: Process and Challenges","version":1},"cited_work":{"arxiv_id":"2507.00324","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.00324","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Collecting, curating, and annotating good quality speech deepfake dataset for famous figures: Process and challenges","venue":null,"work_id":"9866764e-0b44-453c-8608-d076043ecb87","year":2025},"citing_paper":{"arxiv_id":"2603.01482","last_updated":"2026-03-02T05:45:55Z","snapshot_observed_at":"2026-07-06T22:47:28.681790Z","submitted_at":"2026-03-02T05:45:55Z","title":"A SUPERB-Style Benchmark of Self-Supervised Speech Models for Audio Deepfake Detection","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-15T17:25:27.137423Z"},"links":{"cited_paper":"/paper/2507.00324","citing_paper":"/paper/2603.01482"},"observation_digest":"sha256:dcf804a2bc92ea261a7c5107eda9eb7af6f2265150c67f7995153e5383602fcb","observation_id":"aa481225-ba01-4ef9-86ae-5445907a2a84","resolution":{"observed_at":"2026-05-15T17:26:22.151421Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.00324/citation-record","integrity":"/paper/2507.00324/integrity","json":"/paper/2507.00324/citation-record.json","paper":"/paper/2507.00324"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:23:59.073986Z","title":"This high quality of synthesized speech and the ability to distribute it through so- cial media platforms are giving rise to manipulated information in the digital ecosystem","venue":null,"work_id":"ef84e0d3-159a-4e33-9320-b23aec9de42a","year":2022},"citing_paper":{"arxiv_id":"2507.00324","last_updated":"2025-06-30T23:41:04Z","snapshot_observed_at":"2026-08-07T14:58:54.081354Z","submitted_at":"2025-06-30T23:41:04Z","title":"Collecting, Curating, and Annotating Good Quality Speech deepfake dataset for Famous Figures: Process and Challenges","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:45.377493Z"},"links":{"citing_paper":"/paper/2507.00324"},"observation_digest":"sha256:5a0b05ade72ef6f1d1daedfa0a33ca3141a081aee068eafa7caa69e80156af45","observation_id":"ec41e0e6-1bdb-490c-9c9d-924a5e4a3f48","resolution":{"observed_at":"2026-08-06T21:23:59.161684Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.00324","last_updated":"2025-06-30T23:41:04Z","snapshot_observed_at":"2026-08-07T14:58:54.081354Z","submitted_at":"2025-06-30T23:41:04Z","title":"Collecting, Curating, and Annotating Good Quality Speech deepfake dataset for Famous Figures: Process and Challenges","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.00324","snapshot_observed_at":"2026-08-06T21:23:45.554040Z","title":"We can broadly clas- sify these datasets into two categories, based on their speaker characteristics and intended applications","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00324","last_updated":"2025-06-30T23:41:04Z","snapshot_observed_at":"2026-08-07T14:58:54.081354Z","submitted_at":"2025-06-30T23:41:04Z","title":"Collecting, Curating, and Annotating Good Quality Speech deepfake dataset for Famous Figures: Process and Challenges","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:45.554040Z"},"links":{"cited_paper":"/paper/2507.00324","citing_paper":"/paper/2507.00324"},"observation_digest":"sha256:1549ce9739b2ecadec9a3ac39852704525069037e287eddf2072b023f2137cd0","observation_id":"f6badd89-b359-41b2-abf5-00ce9b129525","resolution":{"observed_at":"2026-08-06T21:23:45.554040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:23:58.690707Z","title":null,"venue":null,"work_id":"8e0839a7-3e86-4245-8e03-8961774f3f94","year":2018},"citing_paper":{"arxiv_id":"2507.00324","last_updated":"2025-06-30T23:41:04Z","snapshot_observed_at":"2026-08-07T14:58:54.081354Z","submitted_at":"2025-06-30T23:41:04Z","title":"Collecting, Curating, and Annotating Good Quality Speech deepfake dataset for Famous Figures: Process and Challenges","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:45.820734Z"},"links":{"citing_paper":"/paper/2507.00324"},"observation_digest":"sha256:946a2a1f1595ca0507c33d8d623f7cf937ec8a82225fc07485e3dd0c52b18a70","observation_id":"34a76118-16bc-4390-b374-e4e12431aa93","resolution":{"observed_at":"2026-08-06T21:23:58.763526Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:23:58.060164Z","title":null,"venue":null,"work_id":"2c9abf46-2e2b-49bf-b721-c5f35b4b6f07","year":null},"citing_paper":{"arxiv_id":"2507.00324","last_updated":"2025-06-30T23:41:04Z","snapshot_observed_at":"2026-08-07T14:58:54.081354Z","submitted_at":"2025-06-30T23:41:04Z","title":"Collecting, Curating, and Annotating Good Quality Speech deepfake dataset for Famous Figures: Process and Challenges","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:46.517361Z"},"links":{"citing_paper":"/paper/2507.00324"},"observation_digest":"sha256:c11e9c26cf02fed0408e4c8f9dd5e1d94cc266ffeddec924feb527863fd82372","observation_id":"ef2e435e-1bf9-447f-b5bf-7d23e788857f","resolution":{"observed_at":"2026-08-06T21:23:58.124999Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:23:58.508637Z","title":"It uses ffmpeg to download the best audio available in the W A V format, and resample it 16 kHz","venue":null,"work_id":"17eed0bb-7eac-4dd1-8ee6-47357a01c5bb","year":null},"citing_paper":{"arxiv_id":"2507.00324","last_updated":"2025-06-30T23:41:04Z","snapshot_observed_at":"2026-08-07T14:58:54.081354Z","submitted_at":"2025-06-30T23:41:04Z","title":"Collecting, Curating, and Annotating Good Quality Speech deepfake dataset for Famous Figures: Process and Challenges","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:45.966902Z"},"links":{"citing_paper":"/paper/2507.00324"},"observation_digest":"sha256:55fa82cdf7ab06f0e4067ee9de805345a0310c3dc611766373c669b905295126","observation_id":"0cb07594-6495-4010-8f5f-3ddfbfd46961","resolution":{"observed_at":"2026-08-06T21:23:58.593590Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:23:58.354663Z","title":"This step eliminates cross-talk and background speakers","venue":null,"work_id":"86c4a6fd-067b-4155-a820-3c165a6d8fdd","year":null},"citing_paper":{"arxiv_id":"2507.00324","last_updated":"2025-06-30T23:41:04Z","snapshot_observed_at":"2026-08-07T14:58:54.081354Z","submitted_at":"2025-06-30T23:41:04Z","title":"Collecting, Curating, and Annotating Good Quality Speech deepfake dataset for Famous Figures: Process and Challenges","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:46.148015Z"},"links":{"citing_paper":"/paper/2507.00324"},"observation_digest":"sha256:fa90ba4faf20749a7d101ea9ec06dad0c5b4bd36d32e9f3cc7c444dd71abb298","observation_id":"1b89340b-2c8d-421c-b373-261544e841bf","resolution":{"observed_at":"2026-08-06T21:23:58.415398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:23:58.219143Z","title":"We also experimented with the Google speech recognition api package and other commer- cial tools; however, they generated text with less accuracy and without proper punctuation","venue":null,"work_id":"0102a034-0bc5-4e47-8fcd-4baa1aaf2684","year":null},"citing_paper":{"arxiv_id":"2507.00324","last_updated":"2025-06-30T23:41:04Z","snapshot_observed_at":"2026-08-07T14:58:54.081354Z","submitted_at":"2025-06-30T23:41:04Z","title":"Collecting, Curating, and Annotating Good Quality Speech deepfake dataset for Famous Figures: Process and Challenges","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:46.307871Z"},"links":{"citing_paper":"/paper/2507.00324"},"observation_digest":"sha256:edb92b3c869dff7cb53367970e2c9032005b2a1e0003205b0dfce196b1c1465b","observation_id":"538b5387-e11c-4005-ad38-1da8854d1d6d","resolution":{"observed_at":"2026-08-06T21:23:58.280280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:23:56.248442Z","title":"The Biden Deepfake Robocall Is Only the Beginning,","venue":null,"work_id":"c0ba0df7-55f1-4f87-9ed1-16d8b1eca2a7","year":2024},"citing_paper":{"arxiv_id":"2507.00324","last_updated":"2025-06-30T23:41:04Z","snapshot_observed_at":"2026-08-07T14:58:54.081354Z","submitted_at":"2025-06-30T23:41:04Z","title":"Collecting, Curating, and Annotating Good Quality Speech deepfake dataset for Famous Figures: Process and Challenges","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:48.600644Z"},"links":{"citing_paper":"/paper/2507.00324"},"observation_digest":"sha256:ae9372a840de45382eba94e525ec83b6f7f5fc627ebbf089c1f13bc5c21f222d","observation_id":"4c6b9b41-3a0c-48ba-b550-de8cd6d9fb70","resolution":{"observed_at":"2026-08-06T21:23:56.327407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:23:57.888719Z","title":null,"venue":null,"work_id":"066f6862-cefe-4d7d-9279-af1cf676c009","year":null},"citing_paper":{"arxiv_id":"2507.00324","last_updated":"2025-06-30T23:41:04Z","snapshot_observed_at":"2026-08-07T14:58:54.081354Z","submitted_at":"2025-06-30T23:41:04Z","title":"Collecting, Curating, and Annotating Good Quality Speech deepfake dataset for Famous Figures: Process and Challenges","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:46.655038Z"},"links":{"citing_paper":"/paper/2507.00324"},"observation_digest":"sha256:d9ec55f6ab8163307f0894556e33e2674bcfd2079e113578a7f83429611fbcc6","observation_id":"a2d27f96-3a9b-4336-98aa-fb4c88df9e0b","resolution":{"observed_at":"2026-08-06T21:23:57.977394Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:23:57.702947Z","title":"Al- though early models produced robotic-sounding speech despite extensive training data, SSL-based methods significantly im- proved quality through large-scale pre-training","venue":null,"work_id":"9b7ad0a9-dc6f-4da8-b6d7-908e76c4a387","year":null},"citing_paper":{"arxiv_id":"2507.00324","last_updated":"2025-06-30T23:41:04Z","snapshot_observed_at":"2026-08-07T14:58:54.081354Z","submitted_at":"2025-06-30T23:41:04Z","title":"Collecting, Curating, and Annotating Good Quality Speech deepfake dataset for Famous Figures: Process and Challenges","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:46.800698Z"},"links":{"citing_paper":"/paper/2507.00324"},"observation_digest":"sha256:e8013bdf863fb384c36ad7f716ee77e67e499e732f3f74f28b0dfad2177390d2","observation_id":"4e2b14f0-ca40-4164-8436-31dbb8330c30","resolution":{"observed_at":"2026-08-06T21:23:57.786761Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:23:57.536546Z","title":"We train StyleTTS2 [22] only using this approach","venue":null,"work_id":"3057551f-6c7c-48f7-a1f2-c21230d0c70d","year":null},"citing_paper":{"arxiv_id":"2507.00324","last_updated":"2025-06-30T23:41:04Z","snapshot_observed_at":"2026-08-07T14:58:54.081354Z","submitted_at":"2025-06-30T23:41:04Z","title":"Collecting, Curating, and Annotating Good Quality Speech deepfake dataset for Famous Figures: Process and Challenges","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:46.967101Z"},"links":{"citing_paper":"/paper/2507.00324"},"observation_digest":"sha256:18c50d2d18be2cc4a845c55eb789757825b7ee66f9db3ef9fda51276351eec75","observation_id":"db3e056c-b005-4bf6-be5d-33f6bd23d504","resolution":{"observed_at":"2026-08-06T21:23:57.612401Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:23:57.390940Z","title":null,"venue":null,"work_id":"7106578d-ea09-4e60-a0f5-4788b3a84c2d","year":null},"citing_paper":{"arxiv_id":"2507.00324","last_updated":"2025-06-30T23:41:04Z","snapshot_observed_at":"2026-08-07T14:58:54.081354Z","submitted_at":"2025-06-30T23:41:04Z","title":"Collecting, Curating, and Annotating Good Quality Speech deepfake dataset for Famous Figures: Process and Challenges","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:47.155081Z"},"links":{"citing_paper":"/paper/2507.00324"},"observation_digest":"sha256:a7ce2ab89061fed94334084ab42f45fcb35d1b90a02490f50afbfb9042cdbaac","observation_id":"68170591-9c61-42c8-965d-3b9d503f8dbd","resolution":{"observed_at":"2026-08-06T21:23:57.454318Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:23:57.234936Z","title":"This approach preserved linguistic coherence and improved phoneme alignment, leading to reduced noise and more ac- curate spectrogram generation","venue":null,"work_id":"998797b7-7059-446a-8d03-5b20090dc509","year":null},"citing_paper":{"arxiv_id":"2507.00324","last_updated":"2025-06-30T23:41:04Z","snapshot_observed_at":"2026-08-07T14:58:54.081354Z","submitted_at":"2025-06-30T23:41:04Z","title":"Collecting, Curating, and Annotating Good Quality Speech deepfake dataset for Famous Figures: Process and Challenges","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:47.266100Z"},"links":{"citing_paper":"/paper/2507.00324"},"observation_digest":"sha256:96eaa66eb00fe39bcbb8ddd88dcdfbaa74d44b3019ec25aadf442a5226e5c29b","observation_id":"d3b137ea-e398-49a9-8790-0dbbb28585d5","resolution":{"observed_at":"2026-08-06T21:23:57.305606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:23:57.099068Z","title":null,"venue":null,"work_id":"3a0d7e50-0059-429b-a825-138ce710b3d8","year":null},"citing_paper":{"arxiv_id":"2507.00324","last_updated":"2025-06-30T23:41:04Z","snapshot_observed_at":"2026-08-07T14:58:54.081354Z","submitted_at":"2025-06-30T23:41:04Z","title":"Collecting, Curating, and Annotating Good Quality Speech deepfake dataset for Famous Figures: Process and Challenges","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:47.416615Z"},"links":{"citing_paper":"/paper/2507.00324"},"observation_digest":"sha256:abff0454be50e085307fa61fed957457bcc34a777bab3bb72be5c754bdd29daa","observation_id":"c11b0556-b91d-47d2-b848-ecabd713c468","resolution":{"observed_at":"2026-08-06T21:23:57.171255Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:23:56.955827Z","title":"For subjective evaluation, we implemented a web-based listening test with 32 unique participants","venue":null,"work_id":"950b0069-6335-40fc-9eff-777d996393b2","year":null},"citing_paper":{"arxiv_id":"2507.00324","last_updated":"2025-06-30T23:41:04Z","snapshot_observed_at":"2026-08-07T14:58:54.081354Z","submitted_at":"2025-06-30T23:41:04Z","title":"Collecting, Curating, and Annotating Good Quality Speech deepfake dataset for Famous Figures: Process and Challenges","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:47.567771Z"},"links":{"citing_paper":"/paper/2507.00324"},"observation_digest":"sha256:b8826d3fb85f75c9f47b722466045867ea8c247938860735e8463acf2b25c1de","observation_id":"7963db6e-35d6-4ed1-8b50-8ea095bc9efe","resolution":{"observed_at":"2026-08-06T21:23:57.026356Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:23:58.888166Z","title":"Both datasets are derived from the VCTK corpus, which comprises high-quality speech recordings collected in a controlled laboratory environment","venue":null,"work_id":"e0949b05-871c-4d91-ac1c-90a0d521c946","year":null},"citing_paper":{"arxiv_id":"2507.00324","last_updated":"2025-06-30T23:41:04Z","snapshot_observed_at":"2026-08-07T14:58:54.081354Z","submitted_at":"2025-06-30T23:41:04Z","title":"Collecting, Curating, and Annotating Good Quality Speech deepfake dataset for Famous Figures: Process and Challenges","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:45.684201Z"},"links":{"citing_paper":"/paper/2507.00324"},"observation_digest":"sha256:422f12b252c93cba81a1066ebd6c827d8999302606699831ce57d3b5e87ae790","observation_id":"7c026615-d60c-4f4e-b76d-e32cb31a84dd","resolution":{"observed_at":"2026-08-06T21:23:58.981915Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.15561","last_updated":"2021-07-23T12:32:52Z","snapshot_observed_at":"2026-07-06T11:24:19.530747Z","submitted_at":"2021-06-29T16:50:51Z","title":"A Survey on Neural Speech Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.15561","snapshot_observed_at":"2026-08-06T21:23:47.667605Z","title":"A survey on neural speech synthesis,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.00324","last_updated":"2025-06-30T23:41:04Z","snapshot_observed_at":"2026-08-07T14:58:54.081354Z","submitted_at":"2025-06-30T23:41:04Z","title":"Collecting, Curating, and Annotating Good Quality Speech deepfake dataset for Famous Figures: Process and Challenges","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:47.667605Z"},"links":{"cited_paper":"/paper/2106.15561","citing_paper":"/paper/2507.00324"},"observation_digest":"sha256:9f34be99fbd2dc76dcb8cb0740635dff88f82558ba27e3307a9e42fa86725d1b","observation_id":"b33136b0-dcd8-4c67-b4de-efbb7d05da97","resolution":{"observed_at":"2026-08-06T21:23:47.667605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04558","last_updated":"2022-08-08T01:53:05Z","snapshot_observed_at":"2026-08-06T18:05:37.673476Z","submitted_at":"2020-06-08T13:05:40Z","title":"FastSpeech 2: Fast and High-Quality End-to-End Text to Speech","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.04558","snapshot_observed_at":"2026-08-06T21:23:47.831204Z","title":"Fastspeech 2: Fast and high-quality end-to-end text to speech,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2507.00324","last_updated":"2025-06-30T23:41:04Z","snapshot_observed_at":"2026-08-07T14:58:54.081354Z","submitted_at":"2025-06-30T23:41:04Z","title":"Collecting, Curating, and Annotating Good Quality Speech deepfake dataset for Famous Figures: Process and Challenges","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:47.831204Z"},"links":{"cited_paper":"/paper/2006.04558","citing_paper":"/paper/2507.00324"},"observation_digest":"sha256:3cb77ea2a066b3be1bec3666d53649171173ad9df4a598ff43a1da779e38e3f9","observation_id":"8341b7aa-fa69-4608-9424-d0d851b6f797","resolution":{"observed_at":"2026-08-06T21:23:47.831204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:23:47.947919Z","title":"Yourtts: Towards zero-shot multi-speaker tts and zero-shot voice conversion for everyone,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.00324","last_updated":"2025-06-30T23:41:04Z","snapshot_observed_at":"2026-08-07T14:58:54.081354Z","submitted_at":"2025-06-30T23:41:04Z","title":"Collecting, Curating, and Annotating Good Quality Speech deepfake dataset for Famous Figures: Process and Challenges","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:47.947919Z"},"links":{"citing_paper":"/paper/2507.00324"},"observation_digest":"sha256:b95838082762370071197f27952e1be7e8d128a58f71b8eeb19ebdcca20bb6c8","observation_id":"42a44163-1117-4c28-a7f1-e42f8587f90f","resolution":{"observed_at":"2026-08-06T21:23:47.947919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-06T21:23:48.037703Z","title":"Neural codec language models are zero-shot text to speech synthesizers, 2023,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00324","last_updated":"2025-06-30T23:41:04Z","snapshot_observed_at":"2026-08-07T14:58:54.081354Z","submitted_at":"2025-06-30T23:41:04Z","title":"Collecting, Curating, and Annotating Good Quality Speech deepfake dataset for Famous Figures: Process and Challenges","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:48.037703Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2507.00324"},"observation_digest":"sha256:d1d2d0479704361c964ea7fe30773c866d0f9ca71a72b0d2c2d90819657676e1","observation_id":"013f9f70-da0e-40f7-ad16-7ecb4c6027bb","resolution":{"observed_at":"2026-08-06T21:23:48.037703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:23:56.782772Z","title":"Zse-vits: A zero-shot expressive voice cloning method based on vits,","venue":null,"work_id":"feeaf820-624e-4467-a0f5-8d6d2f113ae4","year":2023},"citing_paper":{"arxiv_id":"2507.00324","last_updated":"2025-06-30T23:41:04Z","snapshot_observed_at":"2026-08-07T14:58:54.081354Z","submitted_at":"2025-06-30T23:41:04Z","title":"Collecting, Curating, and Annotating Good Quality Speech deepfake dataset for Famous Figures: Process and Challenges","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:48.196907Z"},"links":{"citing_paper":"/paper/2507.00324"},"observation_digest":"sha256:40808a1a877c718b17d4535c6abb2c8c4ba79272b8f9f93404c319e55e029035","observation_id":"b4c32037-b3df-447c-a59e-bf9d1295845a","resolution":{"observed_at":"2026-08-06T21:23:56.862210Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:23:56.623476Z","title":"Global Risks Report 2024","venue":null,"work_id":"afd24200-c52b-4d86-bb64-82e704934724","year":2024},"citing_paper":{"arxiv_id":"2507.00324","last_updated":"2025-06-30T23:41:04Z","snapshot_observed_at":"2026-08-07T14:58:54.081354Z","submitted_at":"2025-06-30T23:41:04Z","title":"Collecting, Curating, and Annotating Good Quality Speech deepfake dataset for Famous Figures: Process and Challenges","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:48.363816Z"},"links":{"citing_paper":"/paper/2507.00324"},"observation_digest":"sha256:cfeb28548ed0f470cb888e7475f7f28f3bf7ff564a73d41388cc9f53ea2d293c","observation_id":"f633927c-eb74-431a-9d15-b2a2f1f499a7","resolution":{"observed_at":"2026-08-06T21:23:56.696718Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:23:56.453972Z","title":"Russian War Report: Hacked news program and deep- fake video spread false Zelenskyy claims,","venue":null,"work_id":"92b29bbd-a588-471d-9563-d375ac987b7b","year":2022},"citing_paper":{"arxiv_id":"2507.00324","last_updated":"2025-06-30T23:41:04Z","snapshot_observed_at":"2026-08-07T14:58:54.081354Z","submitted_at":"2025-06-30T23:41:04Z","title":"Collecting, Curating, and Annotating Good Quality Speech deepfake dataset for Famous Figures: Process and Challenges","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:48.508515Z"},"links":{"citing_paper":"/paper/2507.00324"},"observation_digest":"sha256:9d9b72c82b726e8de943009c9a7b8da9c9cbd99e462ba469259f1aa2ca043d78","observation_id":"0646b28d-b632-4307-8403-ed1575d8c012","resolution":{"observed_at":"2026-08-06T21:23:56.520757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:23:56.075697Z","title":"Sadiq Khan says fake AI audio of him nearly led to serious disorder,","venue":null,"work_id":"3ff07cce-3562-4052-bdf9-c2913dac2658","year":2024},"citing_paper":{"arxiv_id":"2507.00324","last_updated":"2025-06-30T23:41:04Z","snapshot_observed_at":"2026-08-07T14:58:54.081354Z","submitted_at":"2025-06-30T23:41:04Z","title":"Collecting, Curating, and Annotating Good Quality Speech deepfake dataset for Famous Figures: Process and Challenges","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:48.786228Z"},"links":{"citing_paper":"/paper/2507.00324"},"observation_digest":"sha256:ac69fb4bd80b2515b0e8e3400887aca1ad64850aeab0c81fa445fbd77066887d","observation_id":"e58cadbc-45e2-4815-8c6e-4857dd46ce3a","resolution":{"observed_at":"2026-08-06T21:23:56.151468Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:23:55.886339Z","title":"Asvspoof 2019: A large-scale public database of synthe- sized, converted and replayed speech,","venue":null,"work_id":"3367e3b1-7355-4426-a142-d735958695c3","year":2019},"citing_paper":{"arxiv_id":"2507.00324","last_updated":"2025-06-30T23:41:04Z","snapshot_observed_at":"2026-08-07T14:58:54.081354Z","submitted_at":"2025-06-30T23:41:04Z","title":"Collecting, Curating, and Annotating Good Quality Speech deepfake dataset for Famous Figures: Process and Challenges","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:49.011538Z"},"links":{"citing_paper":"/paper/2507.00324"},"observation_digest":"sha256:c70d16daabf6b6064929b2492f89af703e011f08203b07ab40e8e647adafe78e","observation_id":"ec2c84af-dc38-4b29-94ad-3daabec6004d","resolution":{"observed_at":"2026-08-06T21:23:55.981769Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"document/1015516","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:23:54.184361Z","title":"ASVspoof 2021: Towards Spoofed and Deepfake Speech Detection in the Wild,","venue":null,"work_id":"633c486a-6bbe-4a4a-8c98-d53696b17cba","year":2021},"citing_paper":{"arxiv_id":"2507.00324","last_updated":"2025-06-30T23:41:04Z","snapshot_observed_at":"2026-08-07T14:58:54.081354Z","submitted_at":"2025-06-30T23:41:04Z","title":"Collecting, Curating, and Annotating Good Quality Speech deepfake dataset for Famous Figures: Process and Challenges","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:49.236797Z"},"links":{"citing_paper":"/paper/2507.00324"},"observation_digest":"sha256:df26cb989de209241e27dd69c8e922bcf43590b20d8aa832c9101b116ecd23ee","observation_id":"9881999c-8420-449f-ab10-23fe9167081d","resolution":{"observed_at":"2026-08-06T21:23:54.270034Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:23:55.722140Z","title":"Asvspoof 2021: accelerating progress in spoofed and deep- fake speech detection,","venue":null,"work_id":"327f3adc-7d94-47dd-a518-315806c0cbf9","year":2021},"citing_paper":{"arxiv_id":"2507.00324","last_updated":"2025-06-30T23:41:04Z","snapshot_observed_at":"2026-08-07T14:58:54.081354Z","submitted_at":"2025-06-30T23:41:04Z","title":"Collecting, Curating, and Annotating Good Quality Speech deepfake dataset for Famous Figures: Process and Challenges","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:49.402291Z"},"links":{"citing_paper":"/paper/2507.00324"},"observation_digest":"sha256:00a4caa89a65d99d68015cc715d0e87c4d7ea8e891d9c66a5c8c51ed67ea4de0","observation_id":"6d8b812b-97c3-4995-af76-0fcc54dedc96","resolution":{"observed_at":"2026-08-06T21:23:55.809406Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:23:55.517344Z","title":"Asvspoof 5: crowd- sourced speech data, deepfakes, and adversarial attacks at scale,","venue":null,"work_id":"54c1e501-ff4e-4648-92fa-b6c90e17cb9d","year":2024},"citing_paper":{"arxiv_id":"2507.00324","last_updated":"2025-06-30T23:41:04Z","snapshot_observed_at":"2026-08-07T14:58:54.081354Z","submitted_at":"2025-06-30T23:41:04Z","title":"Collecting, Curating, and Annotating Good Quality Speech deepfake dataset for Famous Figures: Process and Challenges","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:49.475227Z"},"links":{"citing_paper":"/paper/2507.00324"},"observation_digest":"sha256:b53bb193b661650ba507f981585acee454fd1435014539d5c5ca2045c8a788f8","observation_id":"895e6283-bfc3-4fe6-a159-f39d9181dde1","resolution":{"observed_at":"2026-08-06T21:23:55.597029Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.03411","last_updated":"2020-12-19T09:18:21Z","snapshot_observed_at":"2026-07-06T10:21:14.277598Z","submitted_at":"2020-12-07T01:53:45Z","title":"MLS: A Large-Scale Multilingual Dataset for Speech Research","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.03411","snapshot_observed_at":"2026-08-06T21:23:49.572150Z","title":"Mls: A large-scale multilingual dataset for speech research,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2507.00324","last_updated":"2025-06-30T23:41:04Z","snapshot_observed_at":"2026-08-07T14:58:54.081354Z","submitted_at":"2025-06-30T23:41:04Z","title":"Collecting, Curating, and Annotating Good Quality Speech deepfake dataset for Famous Figures: Process and Challenges","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:49.572150Z"},"links":{"cited_paper":"/paper/2012.03411","citing_paper":"/paper/2507.00324"},"observation_digest":"sha256:9a83f75a832a3308bb16b07828615153f3da1ab6b27db27b82dfb87261928c0e","observation_id":"92954748-fe91-46f9-8a87-5e3657184c02","resolution":{"observed_at":"2026-08-06T21:23:49.572150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:23:55.364718Z","title":"Is audio spoof detection robust to laundering attacks?","venue":null,"work_id":"19a7b7dc-507b-4ce3-89e5-29173a63a8da","year":2024},"citing_paper":{"arxiv_id":"2507.00324","last_updated":"2025-06-30T23:41:04Z","snapshot_observed_at":"2026-08-07T14:58:54.081354Z","submitted_at":"2025-06-30T23:41:04Z","title":"Collecting, Curating, and Annotating Good Quality Speech deepfake dataset for Famous Figures: Process and Challenges","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:49.650417Z"},"links":{"citing_paper":"/paper/2507.00324"},"observation_digest":"sha256:d29de8ccc39ab6e0e154356aff9424d57cffaa529ab402117f0fc2183c686e43","observation_id":"c35826a2-ee87-426b-bcb1-1ba8811c9704","resolution":{"observed_at":"2026-08-06T21:23:55.425051Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:23:55.230730Z","title":"Dfadd: The diffusion and flow- matching based audio deepfake dataset,","venue":null,"work_id":"e0c7c22e-c1f1-4a60-8a55-1641eb736d04","year":2024},"citing_paper":{"arxiv_id":"2507.00324","last_updated":"2025-06-30T23:41:04Z","snapshot_observed_at":"2026-08-07T14:58:54.081354Z","submitted_at":"2025-06-30T23:41:04Z","title":"Collecting, Curating, and Annotating Good Quality Speech deepfake dataset for Famous Figures: Process and Challenges","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:49.755413Z"},"links":{"citing_paper":"/paper/2507.00324"},"observation_digest":"sha256:90d68e6704b285da413bb27ce190b8a51e82bca924e471d8adbd8e4a57079b06","observation_id":"98d7743b-a51d-4fd3-90cc-2ec3146a1361","resolution":{"observed_at":"2026-08-06T21:23:55.291982Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04880","last_updated":"2024-12-25T07:30:50Z","snapshot_observed_at":"2026-07-06T18:11:26.210335Z","submitted_at":"2024-05-08T08:28:40Z","title":"The Codecfake Dataset and Countermeasures for the Universally Detection of Deepfake Audio","version":3},"cited_work":{"arxiv_id":"2405.04880","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.04880","snapshot_observed_at":"2026-08-06T21:23:53.845050Z","title":"The Codecfake Dataset and Countermeasures for the Universally Detection of Deepfake Audio","venue":"cs.SD","work_id":"3509520c-a152-415d-959c-5e612d550e2d","year":2024},"citing_paper":{"arxiv_id":"2507.00324","last_updated":"2025-06-30T23:41:04Z","snapshot_observed_at":"2026-08-07T14:58:54.081354Z","submitted_at":"2025-06-30T23:41:04Z","title":"Collecting, Curating, and Annotating Good Quality Speech deepfake dataset for Famous Figures: Process and Challenges","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:49.860090Z"},"links":{"cited_paper":"/paper/2405.04880","citing_paper":"/paper/2507.00324"},"observation_digest":"sha256:620d828a7bf26930bc5d475d832b756d82ef4be9d74218d64e04fd45b021d1ca","observation_id":"202f6993-73f5-4b3c-8b6d-764782f87ef3","resolution":{"observed_at":"2026-08-06T21:23:53.920068Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:23:55.066149Z","title":"Mlaad: The multi- language audio anti-spoofing dataset,","venue":null,"work_id":"cf6a9fe3-af58-457c-b072-c540a4faa3ec","year":2024},"citing_paper":{"arxiv_id":"2507.00324","last_updated":"2025-06-30T23:41:04Z","snapshot_observed_at":"2026-08-07T14:58:54.081354Z","submitted_at":"2025-06-30T23:41:04Z","title":"Collecting, Curating, and Annotating Good Quality Speech deepfake dataset for Famous Figures: Process and Challenges","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:50.027320Z"},"links":{"citing_paper":"/paper/2507.00324"},"observation_digest":"sha256:41c3c78b96a831e0d413e0fda5b1f5da936caac927f26f801a0ab37c5bc1704a","observation_id":"59d04091-d3ea-4307-94a5-356266d1489a","resolution":{"observed_at":"2026-08-06T21:23:55.120571Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:23:54.908119Z","title":"Does audio deepfake detection generalize?","venue":null,"work_id":"54cdb833-b3d1-4f53-815e-2a0b2f6712e1","year":2022},"citing_paper":{"arxiv_id":"2507.00324","last_updated":"2025-06-30T23:41:04Z","snapshot_observed_at":"2026-08-07T14:58:54.081354Z","submitted_at":"2025-06-30T23:41:04Z","title":"Collecting, Curating, and Annotating Good Quality Speech deepfake dataset for Famous Figures: Process and Challenges","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:50.161862Z"},"links":{"citing_paper":"/paper/2507.00324"},"observation_digest":"sha256:9d60d723dbf7a6b2dba27b62c16441ca1206adcb1dc33f0225e316a647cbb579","observation_id":"016cbdbd-4287-4066-bc7e-543d76fab3e5","resolution":{"observed_at":"2026-08-06T21:23:54.952316Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:23:54.729105Z","title":"Spoofceleb: Speech deepfake detection and sasv in the wild,","venue":null,"work_id":"db5dd55a-4d0a-433c-b7a6-b4a45f71eefb","year":2025},"citing_paper":{"arxiv_id":"2507.00324","last_updated":"2025-06-30T23:41:04Z","snapshot_observed_at":"2026-08-07T14:58:54.081354Z","submitted_at":"2025-06-30T23:41:04Z","title":"Collecting, Curating, and Annotating Good Quality Speech deepfake dataset for Famous Figures: Process and Challenges","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:50.340067Z"},"links":{"citing_paper":"/paper/2507.00324"},"observation_digest":"sha256:3288be7dca650e7da883f9a85ea2b236b1b757513d1d9892185a9b043ceb92e8","observation_id":"cd5d01b6-2b31-4925-a019-4ed5511686c0","resolution":{"observed_at":"2026-08-06T21:23:54.824184Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:23:50.513280Z","title":"V oxceleb: Large-scale speaker verification in the wild,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.00324","last_updated":"2025-06-30T23:41:04Z","snapshot_observed_at":"2026-08-07T14:58:54.081354Z","submitted_at":"2025-06-30T23:41:04Z","title":"Collecting, Curating, and Annotating Good Quality Speech deepfake dataset for Famous Figures: Process and Challenges","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:50.513280Z"},"links":{"citing_paper":"/paper/2507.00324"},"observation_digest":"sha256:05d4f99931b965f19719966c768ec9eb085a8a5a5d3c406614ef2e4cd85d2017","observation_id":"285295d0-de4a-4fb1-8bc4-32d9917fa255","resolution":{"observed_at":"2026-08-06T21:23:50.513280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:23:50.723911Z","title":"Styletts 2: Towards human-level text-to-speech through style dif- fusion and adversarial training with large speech language mod- els,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00324","last_updated":"2025-06-30T23:41:04Z","snapshot_observed_at":"2026-08-07T14:58:54.081354Z","submitted_at":"2025-06-30T23:41:04Z","title":"Collecting, Curating, and Annotating Good Quality Speech deepfake dataset for Famous Figures: Process and Challenges","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:50.723911Z"},"links":{"citing_paper":"/paper/2507.00324"},"observation_digest":"sha256:945649514242673c9d60fe816b08e9ffc7d7c0575b9a8d9e5e49296f18f1e1d8","observation_id":"3d92ef0a-b118-4ee8-92f0-503f3c09a367","resolution":{"observed_at":"2026-08-06T21:23:50.723911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04904","last_updated":"2024-06-07T12:56:11Z","snapshot_observed_at":"2026-08-06T13:29:11.244845Z","submitted_at":"2024-06-07T12:56:11Z","title":"XTTS: a Massively Multilingual Zero-Shot Text-to-Speech Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04904","snapshot_observed_at":"2026-08-06T21:23:50.893642Z","title":"Xtts: a massively multilingual zero-shot text-to-speech model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00324","last_updated":"2025-06-30T23:41:04Z","snapshot_observed_at":"2026-08-07T14:58:54.081354Z","submitted_at":"2025-06-30T23:41:04Z","title":"Collecting, Curating, and Annotating Good Quality Speech deepfake dataset for Famous Figures: Process and Challenges","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:50.893642Z"},"links":{"cited_paper":"/paper/2406.04904","citing_paper":"/paper/2507.00324"},"observation_digest":"sha256:a2cc6c86248e32367f8bafd50ddc87e40d0300c5f4c8cb4a19c722f8be4f1dcc","observation_id":"6edb5495-89ea-4980-8374-716e9984d724","resolution":{"observed_at":"2026-08-06T21:23:50.893642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06885","last_updated":"2025-05-20T15:53:10Z","snapshot_observed_at":"2026-08-01T23:52:25.071174Z","submitted_at":"2024-10-09T13:46:34Z","title":"F5-TTS: A Fairytaler that Fakes Fluent and Faithful Speech with Flow Matching","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06885","snapshot_observed_at":"2026-08-06T21:23:51.063898Z","title":"F5-tts: A fairytaler that fakes fluent and faithful speech with flow matching,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00324","last_updated":"2025-06-30T23:41:04Z","snapshot_observed_at":"2026-08-07T14:58:54.081354Z","submitted_at":"2025-06-30T23:41:04Z","title":"Collecting, Curating, and Annotating Good Quality Speech deepfake dataset for Famous Figures: Process and Challenges","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:51.063898Z"},"links":{"cited_paper":"/paper/2410.06885","citing_paper":"/paper/2507.00324"},"observation_digest":"sha256:acf72209352488894602cc5284a793e535d9ddfa0a4029681d701b0f1f6a0256","observation_id":"a5447dd1-93e1-46c0-a6c2-e656c2f2e369","resolution":{"observed_at":"2026-08-06T21:23:51.063898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:23:54.589738Z","title":"E2 tts: Embarrassingly easy fully non-autoregressive zero-shot tts,","venue":null,"work_id":"29e1d4e8-a9e2-4462-bd61-e62c793f5368","year":2024},"citing_paper":{"arxiv_id":"2507.00324","last_updated":"2025-06-30T23:41:04Z","snapshot_observed_at":"2026-08-07T14:58:54.081354Z","submitted_at":"2025-06-30T23:41:04Z","title":"Collecting, Curating, and Annotating Good Quality Speech deepfake dataset for Famous Figures: Process and Challenges","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:51.260561Z"},"links":{"citing_paper":"/paper/2507.00324"},"observation_digest":"sha256:f7a9308695d922ef1244185801fd740acbd2319b2f0e4eb69993723e88c0fcba","observation_id":"298bbffc-0c0e-4256-9e0a-b1091923898c","resolution":{"observed_at":"2026-08-06T21:23:54.634215Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01156","last_updated":"2024-11-09T05:58:10Z","snapshot_observed_at":"2026-07-06T19:43:59.326124Z","submitted_at":"2024-11-02T07:04:02Z","title":"Fish-Speech: Leveraging Large Language Models for Advanced Multilingual Text-to-Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01156","snapshot_observed_at":"2026-08-06T21:23:51.398868Z","title":"Fish-speech: Leveraging large language models for advanced multilingual text-to-speech synthesis,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00324","last_updated":"2025-06-30T23:41:04Z","snapshot_observed_at":"2026-08-07T14:58:54.081354Z","submitted_at":"2025-06-30T23:41:04Z","title":"Collecting, Curating, and Annotating Good Quality Speech deepfake dataset for Famous Figures: Process and Challenges","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:51.398868Z"},"links":{"cited_paper":"/paper/2411.01156","citing_paper":"/paper/2507.00324"},"observation_digest":"sha256:6c0b840d27233082e3724cdf5a62c9c6c75d627ca37e6dc8b4637d1532976152","observation_id":"be5a0f09-b588-4d3b-be6d-6f1fa0693359","resolution":{"observed_at":"2026-08-06T21:23:51.398868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.07556","last_updated":"2025-01-02T03:07:29Z","snapshot_observed_at":"2026-07-06T19:13:59.780393Z","submitted_at":"2024-09-11T18:24:07Z","title":"SSR-Speech: Towards Stable, Safe and Robust Zero-shot Text-based Speech Editing and Synthesis","version":2},"cited_work":{"arxiv_id":"2409.07556","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.07556","snapshot_observed_at":"2026-08-06T21:23:53.666023Z","title":"SSR-Speech: Towards Stable, Safe and Robust Zero-shot Text-based Speech Editing and Synthesis","venue":"eess.AS","work_id":"6e86b474-c712-4e8f-9d6c-3f2316f9b89d","year":2024},"citing_paper":{"arxiv_id":"2507.00324","last_updated":"2025-06-30T23:41:04Z","snapshot_observed_at":"2026-08-07T14:58:54.081354Z","submitted_at":"2025-06-30T23:41:04Z","title":"Collecting, Curating, and Annotating Good Quality Speech deepfake dataset for Famous Figures: Process and Challenges","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:51.548122Z"},"links":{"cited_paper":"/paper/2409.07556","citing_paper":"/paper/2507.00324"},"observation_digest":"sha256:81f616fc1ba0db7a5ac609bbe2327f037205d77b62db980016b296fd44cc553d","observation_id":"02eeabf4-9992-46e8-b95d-3e9fb890efc7","resolution":{"observed_at":"2026-08-06T21:23:53.712615Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00750","last_updated":"2024-10-20T14:25:49Z","snapshot_observed_at":"2026-08-01T10:20:49.367508Z","submitted_at":"2024-09-01T15:26:30Z","title":"MaskGCT: Zero-Shot Text-to-Speech with Masked Generative Codec Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00750","snapshot_observed_at":"2026-08-06T21:23:51.703103Z","title":"Maskgct: Zero-shot text-to- speech with masked generative codec transformer,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00324","last_updated":"2025-06-30T23:41:04Z","snapshot_observed_at":"2026-08-07T14:58:54.081354Z","submitted_at":"2025-06-30T23:41:04Z","title":"Collecting, Curating, and Annotating Good Quality Speech deepfake dataset for Famous Figures: Process and Challenges","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:51.703103Z"},"links":{"cited_paper":"/paper/2409.00750","citing_paper":"/paper/2507.00324"},"observation_digest":"sha256:3d48cf56e0ff092a18006ba600b909a783e4242ef4b8d1dd2f545f759b62b28d","observation_id":"824d47ee-60fe-4859-b56e-c26291a5af5e","resolution":{"observed_at":"2026-08-06T21:23:51.703103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:23:51.927221Z","title":"Cosyvoice 2: Scalable streaming speech synthesis with large language models,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00324","last_updated":"2025-06-30T23:41:04Z","snapshot_observed_at":"2026-08-07T14:58:54.081354Z","submitted_at":"2025-06-30T23:41:04Z","title":"Collecting, Curating, and Annotating Good Quality Speech deepfake dataset for Famous Figures: Process and Challenges","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:51.927221Z"},"links":{"citing_paper":"/paper/2507.00324"},"observation_digest":"sha256:7b8dbdb89c54deda0f155f3685844abbc3a5530dfd400fc450739f97fa70a173","observation_id":"9ae2daa9-6aba-4670-8a54-0512751c1724","resolution":{"observed_at":"2026-08-06T21:23:51.927221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04128","last_updated":"2025-02-22T11:32:13Z","snapshot_observed_at":"2026-08-07T17:49:42.104594Z","submitted_at":"2025-02-06T15:04:00Z","title":"Llasa: Scaling Train-Time and Inference-Time Compute for Llama-based Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04128","snapshot_observed_at":"2026-08-06T21:23:52.244690Z","title":"Llasa: Scaling train-time and inference-time compute for llama-based speech synthesis,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00324","last_updated":"2025-06-30T23:41:04Z","snapshot_observed_at":"2026-08-07T14:58:54.081354Z","submitted_at":"2025-06-30T23:41:04Z","title":"Collecting, Curating, and Annotating Good Quality Speech deepfake dataset for Famous Figures: Process and Challenges","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:52.244690Z"},"links":{"cited_paper":"/paper/2502.04128","citing_paper":"/paper/2507.00324"},"observation_digest":"sha256:874d0a2ee90f0583046cd47828aeac615b5b9405215533f83356530f01bae3b1","observation_id":"a0716cfd-1be5-4404-b1eb-a91a8fb0ecfa","resolution":{"observed_at":"2026-08-06T21:23:52.244690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1703.10135","last_updated":"2017-04-06T21:20:34Z","snapshot_observed_at":"2026-08-05T15:51:16.043022Z","submitted_at":"2017-03-29T16:55:13Z","title":"Tacotron: Towards End-to-End Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1703.10135","snapshot_observed_at":"2026-08-06T21:23:52.397089Z","title":"Tacotron: Towards end-to-end speech synthesis,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.00324","last_updated":"2025-06-30T23:41:04Z","snapshot_observed_at":"2026-08-07T14:58:54.081354Z","submitted_at":"2025-06-30T23:41:04Z","title":"Collecting, Curating, and Annotating Good Quality Speech deepfake dataset for Famous Figures: Process and Challenges","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:52.397089Z"},"links":{"cited_paper":"/paper/1703.10135","citing_paper":"/paper/2507.00324"},"observation_digest":"sha256:60b1aa90388eb9ecbdd4c41c36b91dc47c2e137c8a6966dbdcd57b94f8094542","observation_id":"09561bf6-690f-4de4-9bec-0780c6c14941","resolution":{"observed_at":"2026-08-06T21:23:52.397089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:23:54.417793Z","title":"Glow-tts: A genera- tive flow for text-to-speech via monotonic alignment search,","venue":null,"work_id":"989fdbb3-0932-43ea-a236-04ae8e4d206f","year":2020},"citing_paper":{"arxiv_id":"2507.00324","last_updated":"2025-06-30T23:41:04Z","snapshot_observed_at":"2026-08-07T14:58:54.081354Z","submitted_at":"2025-06-30T23:41:04Z","title":"Collecting, Curating, and Annotating Good Quality Speech deepfake dataset for Famous Figures: Process and Challenges","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:52.542844Z"},"links":{"citing_paper":"/paper/2507.00324"},"observation_digest":"sha256:a744d4e91e0106270ee45cf5c4b21ea85f7c211d1b1556e242d5ca4968936fc5","observation_id":"089e98bd-4114-4964-bf2b-ecf40630e816","resolution":{"observed_at":"2026-08-06T21:23:54.495771Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.02765","last_updated":"2023-05-07T09:22:04Z","snapshot_observed_at":"2026-08-06T10:45:04.364170Z","submitted_at":"2023-05-04T12:11:13Z","title":"HiFi-Codec: Group-residual Vector quantization for High Fidelity Audio Codec","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.02765","snapshot_observed_at":"2026-08-06T21:23:52.752336Z","title":"Hifi- codec: Group-residual vector quantization for high fidelity audio codec,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00324","last_updated":"2025-06-30T23:41:04Z","snapshot_observed_at":"2026-08-07T14:58:54.081354Z","submitted_at":"2025-06-30T23:41:04Z","title":"Collecting, Curating, and Annotating Good Quality Speech deepfake dataset for Famous Figures: Process and Challenges","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:52.752336Z"},"links":{"cited_paper":"/paper/2305.02765","citing_paper":"/paper/2507.00324"},"observation_digest":"sha256:7ba255143fda0abff76f168cd56ce72b437fb1ba3af6970456d7a4c1823c47f9","observation_id":"416732da-24e4-4e09-9e70-d2114e6776df","resolution":{"observed_at":"2026-08-06T21:23:52.752336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.07889","last_updated":"2021-06-15T05:35:34Z","snapshot_observed_at":"2026-07-06T11:19:21.895912Z","submitted_at":"2021-06-15T05:35:34Z","title":"UnivNet: A Neural Vocoder with Multi-Resolution Spectrogram Discriminators for High-Fidelity Waveform Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.07889","snapshot_observed_at":"2026-08-06T21:23:52.972604Z","title":"Univnet: A neural vocoder with multi-resolution spectrogram discrimi- nators for high-fidelity waveform generation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.00324","last_updated":"2025-06-30T23:41:04Z","snapshot_observed_at":"2026-08-07T14:58:54.081354Z","submitted_at":"2025-06-30T23:41:04Z","title":"Collecting, Curating, and Annotating Good Quality Speech deepfake dataset for Famous Figures: Process and Challenges","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:52.972604Z"},"links":{"cited_paper":"/paper/2106.07889","citing_paper":"/paper/2507.00324"},"observation_digest":"sha256:300b9780180b4c8f2d5eff0805cc492283a4fd5b13b09a270c89b4759e3461bb","observation_id":"c8af0324-78ea-4ecb-b44b-104148aad9b4","resolution":{"observed_at":"2026-08-06T21:23:52.972604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.11673","last_updated":"2021-04-23T16:05:20Z","snapshot_observed_at":"2026-07-06T11:03:05.623689Z","submitted_at":"2021-04-23T16:05:20Z","title":"Deep Learning Based Assessment of Synthetic Speech Naturalness","version":1},"cited_work":{"arxiv_id":"2104.11673","doi":null,"metadata_source":"pith","pith_arxiv_id":"2104.11673","snapshot_observed_at":"2026-08-06T21:23:53.400590Z","title":"Deep Learning Based Assessment of Synthetic Speech Naturalness","venue":"cs.SD","work_id":"7223da28-149e-4705-a8f2-b28ceccded27","year":2021},"citing_paper":{"arxiv_id":"2507.00324","last_updated":"2025-06-30T23:41:04Z","snapshot_observed_at":"2026-08-07T14:58:54.081354Z","submitted_at":"2025-06-30T23:41:04Z","title":"Collecting, Curating, and Annotating Good Quality Speech deepfake dataset for Famous Figures: Process and Challenges","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:53.153699Z"},"links":{"cited_paper":"/paper/2104.11673","citing_paper":"/paper/2507.00324"},"observation_digest":"sha256:cfc1e8e769108e32e6f7698f1b9f6760ea624a40670d4ae9a5edd67d0707d556","observation_id":"1dd4bc21-92bd-4520-bd50-7f7ad9e468a6","resolution":{"observed_at":"2026-08-06T21:23:53.453912Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10117","last_updated":"2024-12-25T11:54:03Z","snapshot_observed_at":"2026-08-07T06:02:40.568271Z","submitted_at":"2024-12-13T12:59:39Z","title":"CosyVoice 2: Scalable Streaming Speech Synthesis with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10117","snapshot_observed_at":"2026-08-06T21:23:52.083979Z","title":"Available: https://arxiv.org/abs/2412.10117","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00324","last_updated":"2025-06-30T23:41:04Z","snapshot_observed_at":"2026-08-07T14:58:54.081354Z","submitted_at":"2025-06-30T23:41:04Z","title":"Collecting, Curating, and Annotating Good Quality Speech deepfake dataset for Famous Figures: Process and Challenges","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:52.083979Z"},"links":{"cited_paper":"/paper/2412.10117","citing_paper":"/paper/2507.00324"},"observation_digest":"sha256:77aa3a37c717d7270dbf16860c17cc8230461c0586e39756aac42b0f9ed95497","observation_id":"94fc393c-e3fe-4e56-996a-d6340c2ed578","resolution":{"observed_at":"2026-08-06T21:23:52.083979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.00324","last_updated":"2025-06-30T23:41:04Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-07T14:58:54.081354Z","submitted_at":"2025-06-30T23:41:04Z","title":"Collecting, Curating, and Annotating Good Quality Speech deepfake dataset for Famous Figures: Process and Challenges"},"reference_resolution":{"displayed":51,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":23,"verified_exact":4,"verified_fuzzy":24},"total_outbound_references":51},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 51 of 51 outbound references and 2 inbound Pith citation observations for arXiv:2507.00324."}