{"as_of":"2026-08-21T21:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:60458df58b4d783d7d6abde0b62ca0b89b57e9c00bdb238dd27458c2e709b3b9","coverage":[{"denominator":58,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":58,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T15:51:37.449634Z","state":"measured"},{"denominator":59,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":59,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-09T19:27:59.124425Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T15:41:30.302351Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.21597","last_updated":"2026-06-03T17:37:13Z","snapshot_observed_at":"2026-08-18T03:36:37.563547Z","submitted_at":"2025-09-25T21:09:40Z","title":"AUDDT: A Unified Benchmark Toolkit for Audio and Speech Deepfake Detectors","version":2},"cited_work":{"arxiv_id":"2509.21597","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.21597","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"R., Pimentel, A., and Falk, T","venue":null,"work_id":"a303996c-90ae-4136-9b1b-ed6d79604aa3","year":null},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-08-14T05:00:21.860788Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"cited_paper":"/paper/2509.21597","citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:c75c8448272ed4f34425b5c07457b1741b28a006ae918b2eb40ecfef4a62de8a","observation_id":"443d723c-b3cb-413d-8d98-66e5d4368898","resolution":{"observed_at":"2026-06-04T02:07:39.638614Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2509.21597/citation-record","integrity":"/paper/2509.21597/integrity","json":"/paper/2509.21597/citation-record.json","paper":"/paper/2509.21597"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2308.14970","last_updated":"2023-08-29T01:50:01Z","snapshot_observed_at":"2026-08-20T12:29:57.127709Z","submitted_at":"2023-08-29T01:50:01Z","title":"Audio Deepfake Detection: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.14970","snapshot_observed_at":"2026-08-15T15:51:37.252307Z","title":"Audio deepfake detection: A survey,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.21597","last_updated":"2026-06-03T17:37:13Z","snapshot_observed_at":"2026-08-18T03:36:37.563547Z","submitted_at":"2025-09-25T21:09:40Z","title":"AUDDT: A Unified Benchmark Toolkit for Audio and Speech Deepfake Detectors","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T15:51:37.252307Z"},"links":{"cited_paper":"/paper/2308.14970","citing_paper":"/paper/2509.21597"},"observation_digest":"sha256:b6b9bb164424757b8c9425168b5e2517b3f5ca7f16b7e9d13307be14649331ee","observation_id":"3c9df119-d0da-46cd-9b1f-c3eb531b61da","resolution":{"observed_at":"2026-08-15T15:51:37.252307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:51:38.320219Z","title":"Audio deepfake detection: What has been achieved and what lies ahead,","venue":null,"work_id":"d528936d-82ac-4dd2-b4ea-41d380948f3a","year":1989},"citing_paper":{"arxiv_id":"2509.21597","last_updated":"2026-06-03T17:37:13Z","snapshot_observed_at":"2026-08-18T03:36:37.563547Z","submitted_at":"2025-09-25T21:09:40Z","title":"AUDDT: A Unified Benchmark Toolkit for Audio and Speech Deepfake Detectors","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T15:51:37.256670Z"},"links":{"citing_paper":"/paper/2509.21597"},"observation_digest":"sha256:bd23cb3e748e8887d4858819a75fed7e4685896be9c7cda4fbf25f324ca03c07","observation_id":"7803ce74-c139-4053-b630-e7c77203e743","resolution":{"observed_at":"2026-08-15T15:51:38.323615Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.02857","last_updated":"2026-05-27T00:37:53Z","snapshot_observed_at":"2026-08-19T21:31:41.789222Z","submitted_at":"2025-03-04T18:33:22Z","title":"Deepfake-Eval-2024: A Multi-Modal In-the-Wild Benchmark of Deepfakes Circulated in 2024","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.02857","snapshot_observed_at":"2026-08-15T15:51:37.260136Z","title":"Deepfake-eval- 2024: A multi-modal in-the-wild benchmark of deepfakes circulated in 2024,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.21597","last_updated":"2026-06-03T17:37:13Z","snapshot_observed_at":"2026-08-18T03:36:37.563547Z","submitted_at":"2025-09-25T21:09:40Z","title":"AUDDT: A Unified Benchmark Toolkit for Audio and Speech Deepfake Detectors","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T15:51:37.260136Z"},"links":{"cited_paper":"/paper/2503.02857","citing_paper":"/paper/2509.21597"},"observation_digest":"sha256:3c3c06dd8429e5ce656470b89e062ed8faec70441abef5a74ffc2138a087906a","observation_id":"daeacacb-2cc2-4614-975f-5f4d40dbb71f","resolution":{"observed_at":"2026-08-15T15:51:37.260136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:51:38.308837Z","title":"Spoofceleb: Speech deepfake detection and sasv in the wild,","venue":null,"work_id":"926bdc69-197e-416a-b139-a65a4971d16c","year":2025},"citing_paper":{"arxiv_id":"2509.21597","last_updated":"2026-06-03T17:37:13Z","snapshot_observed_at":"2026-08-18T03:36:37.563547Z","submitted_at":"2025-09-25T21:09:40Z","title":"AUDDT: A Unified Benchmark Toolkit for Audio and Speech Deepfake Detectors","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T15:51:37.264346Z"},"links":{"citing_paper":"/paper/2509.21597"},"observation_digest":"sha256:b4921d31b71299706698a5a6f539738e35d1c2a50737f6a42f321d1d2912546f","observation_id":"5b5dfd74-a37f-4645-b841-e6705d88297d","resolution":{"observed_at":"2026-08-15T15:51:38.313456Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:51:37.268241Z","title":"Asvspoof 2019: Spoofing countermeasures for the detection of synthesized, converted and replayed speech,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.21597","last_updated":"2026-06-03T17:37:13Z","snapshot_observed_at":"2026-08-18T03:36:37.563547Z","submitted_at":"2025-09-25T21:09:40Z","title":"AUDDT: A Unified Benchmark Toolkit for Audio and Speech Deepfake Detectors","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T15:51:37.268241Z"},"links":{"citing_paper":"/paper/2509.21597"},"observation_digest":"sha256:7547ac29a378ffaa63ed2bc11a25e0f1d08939e1ebf47b1ddbd4a3c3a0990f02","observation_id":"959177e2-5a88-4ebb-949c-8cdab8606487","resolution":{"observed_at":"2026-08-15T15:51:37.268241Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.00537","last_updated":"2021-09-01T16:17:31Z","snapshot_observed_at":"2026-08-19T16:02:42.770315Z","submitted_at":"2021-09-01T16:17:31Z","title":"ASVspoof 2021: accelerating progress in spoofed and deepfake speech detection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.00537","snapshot_observed_at":"2026-08-15T15:51:37.271752Z","title":"Asvspoof 2021: accelerating progress in spoofed and deepfake speech detection,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.21597","last_updated":"2026-06-03T17:37:13Z","snapshot_observed_at":"2026-08-18T03:36:37.563547Z","submitted_at":"2025-09-25T21:09:40Z","title":"AUDDT: A Unified Benchmark Toolkit for Audio and Speech Deepfake Detectors","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T15:51:37.271752Z"},"links":{"cited_paper":"/paper/2109.00537","citing_paper":"/paper/2509.21597"},"observation_digest":"sha256:8645e4268ad72fe4ec0d022dd0d7c5a166b8c2604568fb35c48a659266b0756f","observation_id":"689b33e3-af25-4e09-9f48-ed9f5621adc3","resolution":{"observed_at":"2026-08-15T15:51:37.271752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:51:38.297576Z","title":"Asvspoof 5: Design, collection and validation of resources for spoofing, deepfake, and adversarial attack detection using crowdsourced speech,","venue":null,"work_id":"61a8a559-a707-49db-b263-8421d013b0bc","year":2026},"citing_paper":{"arxiv_id":"2509.21597","last_updated":"2026-06-03T17:37:13Z","snapshot_observed_at":"2026-08-18T03:36:37.563547Z","submitted_at":"2025-09-25T21:09:40Z","title":"AUDDT: A Unified Benchmark Toolkit for Audio and Speech Deepfake Detectors","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T15:51:37.275797Z"},"links":{"citing_paper":"/paper/2509.21597"},"observation_digest":"sha256:07cf338bc6967776eb0b007d818c2cc7e6b91d478b7cbfe92e62208991cfa73a","observation_id":"e5394366-8729-4453-a7cf-1fec96a86e48","resolution":{"observed_at":"2026-08-15T15:51:38.301896Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:51:37.279230Z","title":"Does audio deepfake detection generalize?","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.21597","last_updated":"2026-06-03T17:37:13Z","snapshot_observed_at":"2026-08-18T03:36:37.563547Z","submitted_at":"2025-09-25T21:09:40Z","title":"AUDDT: A Unified Benchmark Toolkit for Audio and Speech Deepfake Detectors","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T15:51:37.279230Z"},"links":{"citing_paper":"/paper/2509.21597"},"observation_digest":"sha256:494273d868b06a6bba0c044f7b8a4c3206b01128d731adba69de0ab9b0dbe9b6","observation_id":"6aa475e6-1940-411b-9759-3efdb5da4073","resolution":{"observed_at":"2026-08-15T15:51:37.279230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:51:38.286479Z","title":"Mlaad: The multi- language audio anti-spoofing dataset,","venue":null,"work_id":"f6527b7b-4b1a-4f59-8ecd-175ccbaf84d9","year":2024},"citing_paper":{"arxiv_id":"2509.21597","last_updated":"2026-06-03T17:37:13Z","snapshot_observed_at":"2026-08-18T03:36:37.563547Z","submitted_at":"2025-09-25T21:09:40Z","title":"AUDDT: A Unified Benchmark Toolkit for Audio and Speech Deepfake Detectors","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T15:51:37.282571Z"},"links":{"citing_paper":"/paper/2509.21597"},"observation_digest":"sha256:e7edb6cce805882dc4ce3e1648f9ed323cb0bfde8a73a140e053ac7d4f13db61","observation_id":"2abf36bc-24b1-4814-9291-8e5ed8651151","resolution":{"observed_at":"2026-08-15T15:51:38.290535Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07237","last_updated":"2024-06-11T13:16:09Z","snapshot_observed_at":"2026-08-16T13:44:11.201849Z","submitted_at":"2024-06-11T13:16:09Z","title":"CodecFake: Enhancing Anti-Spoofing Models Against Deepfake Audios from Codec-Based Speech Synthesis Systems","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07237","snapshot_observed_at":"2026-08-15T15:51:37.285668Z","title":"Codecfake: Enhancing anti-spoofing models against deepfake audios from codec-based speech synthesis systems,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.21597","last_updated":"2026-06-03T17:37:13Z","snapshot_observed_at":"2026-08-18T03:36:37.563547Z","submitted_at":"2025-09-25T21:09:40Z","title":"AUDDT: A Unified Benchmark Toolkit for Audio and Speech Deepfake Detectors","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T15:51:37.285668Z"},"links":{"cited_paper":"/paper/2406.07237","citing_paper":"/paper/2509.21597"},"observation_digest":"sha256:13e6c531ac25d5cd835665d69b9cc0a2f190d70f134c211d9d68cd07f63c342e","observation_id":"20d4f0b2-f689-4445-9e1e-7607c4ab999f","resolution":{"observed_at":"2026-08-15T15:51:37.285668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08238","last_updated":"2026-06-05T17:32:46Z","snapshot_observed_at":"2026-08-17T22:34:27.630404Z","submitted_at":"2025-01-14T16:26:14Z","title":"CodecFake+: Codec-Based Resynthesized Data as a Proxy for Detecting CodecFake Speech","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.08238","snapshot_observed_at":"2026-08-15T15:51:37.289233Z","title":"Codecfake+: A large-scale neural audio codec-based deepfake speech dataset,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.21597","last_updated":"2026-06-03T17:37:13Z","snapshot_observed_at":"2026-08-18T03:36:37.563547Z","submitted_at":"2025-09-25T21:09:40Z","title":"AUDDT: A Unified Benchmark Toolkit for Audio and Speech Deepfake Detectors","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T15:51:37.289233Z"},"links":{"cited_paper":"/paper/2501.08238","citing_paper":"/paper/2509.21597"},"observation_digest":"sha256:ced2480917a0affda01ace0a0f9fae192864258234d765d55dd323e80898468c","observation_id":"80c37585-68ca-4b7f-9bca-babb7a807a39","resolution":{"observed_at":"2026-08-15T15:51:37.289233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:51:38.274138Z","title":"Diffssd: A diffusion-based dataset for speech forensics,","venue":null,"work_id":"b81adbaa-5eba-4687-ae06-b77a5c97cde5","year":2025},"citing_paper":{"arxiv_id":"2509.21597","last_updated":"2026-06-03T17:37:13Z","snapshot_observed_at":"2026-08-18T03:36:37.563547Z","submitted_at":"2025-09-25T21:09:40Z","title":"AUDDT: A Unified Benchmark Toolkit for Audio and Speech Deepfake Detectors","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T15:51:37.292888Z"},"links":{"citing_paper":"/paper/2509.21597"},"observation_digest":"sha256:99ef8449199a776b42bc078bc885df001cfbd3660c5ff49037eeef0a3a1115bd","observation_id":"9a40b0a1-ae04-482f-a161-188f55999bd6","resolution":{"observed_at":"2026-08-15T15:51:38.277902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:51:38.263084Z","title":"Diffuse or confuse: A diffusion deepfake speech dataset,","venue":null,"work_id":"2f200697-3032-4073-990f-8dd02590bcd1","year":2024},"citing_paper":{"arxiv_id":"2509.21597","last_updated":"2026-06-03T17:37:13Z","snapshot_observed_at":"2026-08-18T03:36:37.563547Z","submitted_at":"2025-09-25T21:09:40Z","title":"AUDDT: A Unified Benchmark Toolkit for Audio and Speech Deepfake Detectors","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T15:51:37.296218Z"},"links":{"citing_paper":"/paper/2509.21597"},"observation_digest":"sha256:ed71c4be2167b4680945075e235af22d15d6ee95e611a63ce6177421bf2f15c7","observation_id":"db553c61-84cc-4a41-9887-edd3f42a4fe6","resolution":{"observed_at":"2026-08-15T15:51:38.266654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:51:38.252403Z","title":"Habla: A dataset of latin american spanish accents for voice anti-spoofing,","venue":null,"work_id":"19f7c3e4-37c5-4658-ac37-9ebff6e0b6a6","year":2023},"citing_paper":{"arxiv_id":"2509.21597","last_updated":"2026-06-03T17:37:13Z","snapshot_observed_at":"2026-08-18T03:36:37.563547Z","submitted_at":"2025-09-25T21:09:40Z","title":"AUDDT: A Unified Benchmark Toolkit for Audio and Speech Deepfake Detectors","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T15:51:37.299457Z"},"links":{"citing_paper":"/paper/2509.21597"},"observation_digest":"sha256:2ff12831a2848aab5faef2032b0067fb521330389c3cf09dfe98f55acc39d2b4","observation_id":"c7921486-6ef8-4697-9821-463a7b2e947a","resolution":{"observed_at":"2026-08-15T15:51:38.256100Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14862","last_updated":"2025-06-01T04:46:35Z","snapshot_observed_at":"2026-08-21T10:32:21.968846Z","submitted_at":"2025-05-20T19:46:36Z","title":"Replay Attacks Against Audio Deepfake Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14862","snapshot_observed_at":"2026-08-15T15:51:37.302670Z","title":"Replay attacks against audio deepfake detection,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.21597","last_updated":"2026-06-03T17:37:13Z","snapshot_observed_at":"2026-08-18T03:36:37.563547Z","submitted_at":"2025-09-25T21:09:40Z","title":"AUDDT: A Unified Benchmark Toolkit for Audio and Speech Deepfake Detectors","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T15:51:37.302670Z"},"links":{"cited_paper":"/paper/2505.14862","citing_paper":"/paper/2509.21597"},"observation_digest":"sha256:8cd59a9af6db46494bf331ea9557d9d63948a2ea5b1c8500728d2bea8a28e609","observation_id":"ae27e744-b168-47f9-aba9-fd5ba83d3ff8","resolution":{"observed_at":"2026-08-15T15:51:37.302670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:51:38.241331Z","title":"The codecfake dataset and countermeasures for the universally detection of deepfake audio,","venue":null,"work_id":"60e428d4-237b-4fef-9663-1db4b7cc261b","year":null},"citing_paper":{"arxiv_id":"2509.21597","last_updated":"2026-06-03T17:37:13Z","snapshot_observed_at":"2026-08-18T03:36:37.563547Z","submitted_at":"2025-09-25T21:09:40Z","title":"AUDDT: A Unified Benchmark Toolkit for Audio and Speech Deepfake Detectors","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T15:51:37.306798Z"},"links":{"citing_paper":"/paper/2509.21597"},"observation_digest":"sha256:05711bd3eeb8518fda2f67c1d6f06b9c49e73e2d8e9519bedfe39d539b3be3c1","observation_id":"8cd32478-3282-47a3-a036-faf95705d651","resolution":{"observed_at":"2026-08-15T15:51:38.245059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02813","last_updated":"2021-11-04T12:26:34Z","snapshot_observed_at":"2026-08-18T06:21:12.766256Z","submitted_at":"2021-11-04T12:26:34Z","title":"WaveFake: A Data Set to Facilitate Audio Deepfake Detection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.02813","snapshot_observed_at":"2026-08-15T15:51:37.314175Z","title":"Wavefake: A data set to facilitate audio deepfake detection,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.21597","last_updated":"2026-06-03T17:37:13Z","snapshot_observed_at":"2026-08-18T03:36:37.563547Z","submitted_at":"2025-09-25T21:09:40Z","title":"AUDDT: A Unified Benchmark Toolkit for Audio and Speech Deepfake Detectors","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T15:51:37.314175Z"},"links":{"cited_paper":"/paper/2111.02813","citing_paper":"/paper/2509.21597"},"observation_digest":"sha256:b6e2e5e53218f0d5b83114ffbf2aafc0ea549b6c839520d54a6d83f0ca2fb8dd","observation_id":"190b633b-ee2d-4bdf-b3f0-30a3331aede6","resolution":{"observed_at":"2026-08-15T15:51:37.314175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:51:38.229871Z","title":"Safeear: Content privacy-preserving audio deepfake detection,","venue":null,"work_id":"3c8f0a5c-379e-4dfe-9be9-a6ffb47748e5","year":2024},"citing_paper":{"arxiv_id":"2509.21597","last_updated":"2026-06-03T17:37:13Z","snapshot_observed_at":"2026-08-18T03:36:37.563547Z","submitted_at":"2025-09-25T21:09:40Z","title":"AUDDT: A Unified Benchmark Toolkit for Audio and Speech Deepfake Detectors","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T15:51:37.317810Z"},"links":{"citing_paper":"/paper/2509.21597"},"observation_digest":"sha256:252d8fecce310441d45b3e6c80f345decc9145bcb3e603b7c992b12b083c45ed","observation_id":"0ddab8a6-2d52-4f41-9a13-0bfbe04de403","resolution":{"observed_at":"2026-08-15T15:51:38.233601Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:51:37.321547Z","title":"Ditse: High-fidelity generative speech enhancement via latent diffusion trans- formers,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.21597","last_updated":"2026-06-03T17:37:13Z","snapshot_observed_at":"2026-08-18T03:36:37.563547Z","submitted_at":"2025-09-25T21:09:40Z","title":"AUDDT: A Unified Benchmark Toolkit for Audio and Speech Deepfake Detectors","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T15:51:37.321547Z"},"links":{"citing_paper":"/paper/2509.21597"},"observation_digest":"sha256:22c77d743cc284f01a31c52777b5f07367c25018fad96431bcc78fbfbed98b73","observation_id":"7176dc27-c6ad-4d45-a56c-bc547b9f5a3f","resolution":{"observed_at":"2026-08-15T15:51:37.321547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:51:37.324962Z","title":"Generalized end-to-end loss for speaker verification,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.21597","last_updated":"2026-06-03T17:37:13Z","snapshot_observed_at":"2026-08-18T03:36:37.563547Z","submitted_at":"2025-09-25T21:09:40Z","title":"AUDDT: A Unified Benchmark Toolkit for Audio and Speech Deepfake Detectors","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T15:51:37.324962Z"},"links":{"citing_paper":"/paper/2509.21597"},"observation_digest":"sha256:49a1f8a121de2bc081131397697eff54217a6c845f436f5fe4ce0b39e4c9679b","observation_id":"d71bcd26-412b-422f-9fa1-38c10417c075","resolution":{"observed_at":"2026-08-15T15:51:37.324962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1703.10135","last_updated":"2017-04-06T21:20:34Z","snapshot_observed_at":"2026-08-17T12:01:30.659594Z","submitted_at":"2017-03-29T16:55:13Z","title":"Tacotron: Towards End-to-End Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1703.10135","snapshot_observed_at":"2026-08-15T15:51:37.328425Z","title":"Tacotron: Towards end- to-end speech synthesis,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.21597","last_updated":"2026-06-03T17:37:13Z","snapshot_observed_at":"2026-08-18T03:36:37.563547Z","submitted_at":"2025-09-25T21:09:40Z","title":"AUDDT: A Unified Benchmark Toolkit for Audio and Speech Deepfake Detectors","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T15:51:37.328425Z"},"links":{"cited_paper":"/paper/1703.10135","citing_paper":"/paper/2509.21597"},"observation_digest":"sha256:3f14540dde15e80b7695b3558025755710c3fc85e24d8114a34eaeedaf565b3a","observation_id":"2f48bc8e-52c2-44c5-be0d-f3a8162e9817","resolution":{"observed_at":"2026-08-15T15:51:37.328425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:51:38.211060Z","title":"Towards end-to-end prosody transfer for expressive speech synthesis with tacotron,","venue":null,"work_id":"3364229e-1fa0-43e4-9e24-e62939179e1e","year":2018},"citing_paper":{"arxiv_id":"2509.21597","last_updated":"2026-06-03T17:37:13Z","snapshot_observed_at":"2026-08-18T03:36:37.563547Z","submitted_at":"2025-09-25T21:09:40Z","title":"AUDDT: A Unified Benchmark Toolkit for Audio and Speech Deepfake Detectors","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T15:51:37.332018Z"},"links":{"citing_paper":"/paper/2509.21597"},"observation_digest":"sha256:811b8094eb157f4fb808eae2b2a69d7ec9577a01a1dbdf3fa3bc27a2cfe6a7fd","observation_id":"01e687d7-9627-4e0e-a149-cae8520a6312","resolution":{"observed_at":"2026-08-15T15:51:38.215024Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:51:37.335449Z","title":"Fastspeech: Fast, robust and controllable text to speech,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.21597","last_updated":"2026-06-03T17:37:13Z","snapshot_observed_at":"2026-08-18T03:36:37.563547Z","submitted_at":"2025-09-25T21:09:40Z","title":"AUDDT: A Unified Benchmark Toolkit for Audio and Speech Deepfake Detectors","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T15:51:37.335449Z"},"links":{"citing_paper":"/paper/2509.21597"},"observation_digest":"sha256:4abe8a09ed0b2a1568c1fbf85113f6c56e42a5a27dbd173a4b4d2d4ac67ed785","observation_id":"43cd36db-8f20-456f-ac34-67eab62b2160","resolution":{"observed_at":"2026-08-15T15:51:37.335449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04558","last_updated":"2022-08-08T01:53:05Z","snapshot_observed_at":"2026-08-20T03:31:53.345681Z","submitted_at":"2020-06-08T13:05:40Z","title":"FastSpeech 2: Fast and High-Quality End-to-End Text to Speech","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.04558","snapshot_observed_at":"2026-08-15T15:51:37.338770Z","title":"Fastspeech 2: Fast and high-quality end-to-end text to speech,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2509.21597","last_updated":"2026-06-03T17:37:13Z","snapshot_observed_at":"2026-08-18T03:36:37.563547Z","submitted_at":"2025-09-25T21:09:40Z","title":"AUDDT: A Unified Benchmark Toolkit for Audio and Speech Deepfake Detectors","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T15:51:37.338770Z"},"links":{"cited_paper":"/paper/2006.04558","citing_paper":"/paper/2509.21597"},"observation_digest":"sha256:21bf4ec934c1413a1b50ba10ce8094655de51b438e5573b60cf7a426e18ba000","observation_id":"80ba89bc-1bef-46a9-97a6-e5657b0b5713","resolution":{"observed_at":"2026-08-15T15:51:37.338770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:51:38.192303Z","title":"For: A dataset for synthetic speech detection,","venue":null,"work_id":"efb89feb-677f-47ae-8b6a-82d45a2a8adb","year":2019},"citing_paper":{"arxiv_id":"2509.21597","last_updated":"2026-06-03T17:37:13Z","snapshot_observed_at":"2026-08-18T03:36:37.563547Z","submitted_at":"2025-09-25T21:09:40Z","title":"AUDDT: A Unified Benchmark Toolkit for Audio and Speech Deepfake Detectors","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T15:51:37.342135Z"},"links":{"citing_paper":"/paper/2509.21597"},"observation_digest":"sha256:581bbd3df2464e4a5f7369ca59d2cd22a8dd8f468177ae0d8e76fda5685a641f","observation_id":"69604e31-cdde-4e76-86d2-65fdb18466d1","resolution":{"observed_at":"2026-08-15T15:51:38.196154Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:51:38.181373Z","title":"Yourtts: Towards zero-shot multi-speaker tts and zero- shot voice conversion for everyone,","venue":null,"work_id":"694d4332-5e5e-424a-b240-6a3c1847ff56","year":2022},"citing_paper":{"arxiv_id":"2509.21597","last_updated":"2026-06-03T17:37:13Z","snapshot_observed_at":"2026-08-18T03:36:37.563547Z","submitted_at":"2025-09-25T21:09:40Z","title":"AUDDT: A Unified Benchmark Toolkit for Audio and Speech Deepfake Detectors","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T15:51:37.345585Z"},"links":{"citing_paper":"/paper/2509.21597"},"observation_digest":"sha256:ae3dff01e4196d5ee3d8e12ba21940a85f5fd190d440b19627ee54495eed16d2","observation_id":"6977245a-bab6-4d85-b7af-d14001b7d912","resolution":{"observed_at":"2026-08-15T15:51:38.185128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:51:38.170362Z","title":"Naturalspeech: End-to-end text-to-speech synthesis with human-level quality,","venue":null,"work_id":"7b0cb271-9922-4d8c-9fe1-42fe12beba5f","year":2024},"citing_paper":{"arxiv_id":"2509.21597","last_updated":"2026-06-03T17:37:13Z","snapshot_observed_at":"2026-08-18T03:36:37.563547Z","submitted_at":"2025-09-25T21:09:40Z","title":"AUDDT: A Unified Benchmark Toolkit for Audio and Speech Deepfake Detectors","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T15:51:37.349111Z"},"links":{"citing_paper":"/paper/2509.21597"},"observation_digest":"sha256:64ab578f93fad383bdf736276c8d446ea2875bbe57d463fa81aa059783f1985b","observation_id":"25d40685-ba5c-4719-8b70-deced384f34b","resolution":{"observed_at":"2026-08-15T15:51:38.174149Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03509","last_updated":"2023-06-06T08:54:49Z","snapshot_observed_at":"2026-08-20T00:04:16.560711Z","submitted_at":"2023-06-06T08:54:49Z","title":"Mega-TTS: Zero-Shot Text-to-Speech at Scale with Intrinsic Inductive Bias","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.03509","snapshot_observed_at":"2026-08-15T15:51:37.352429Z","title":"Mega-tts: Zero-shot text-to-speech at scale with intrinsic inductive bias,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.21597","last_updated":"2026-06-03T17:37:13Z","snapshot_observed_at":"2026-08-18T03:36:37.563547Z","submitted_at":"2025-09-25T21:09:40Z","title":"AUDDT: A Unified Benchmark Toolkit for Audio and Speech Deepfake Detectors","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T15:51:37.352429Z"},"links":{"cited_paper":"/paper/2306.03509","citing_paper":"/paper/2509.21597"},"observation_digest":"sha256:7c2d9dea9ec10f406cb9a9dfd8eccc9a66b46ac72a0b0168310c5acc2925af7f","observation_id":"e0e62d68-ae4f-454e-ae2f-1f2c1f514cfd","resolution":{"observed_at":"2026-08-15T15:51:37.352429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07254","last_updated":"2024-06-11T13:34:40Z","snapshot_observed_at":"2026-08-16T13:44:10.882669Z","submitted_at":"2024-06-11T13:34:40Z","title":"SRC4VC: Smartphone-Recorded Corpus for Voice Conversion Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07254","snapshot_observed_at":"2026-08-15T15:51:37.356183Z","title":"Src4vc: Smartphone- recorded corpus for voice conversion benchmark,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.21597","last_updated":"2026-06-03T17:37:13Z","snapshot_observed_at":"2026-08-18T03:36:37.563547Z","submitted_at":"2025-09-25T21:09:40Z","title":"AUDDT: A Unified Benchmark Toolkit for Audio and Speech Deepfake Detectors","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T15:51:37.356183Z"},"links":{"cited_paper":"/paper/2406.07254","citing_paper":"/paper/2509.21597"},"observation_digest":"sha256:deec120c8c326a3ec43522e06934b3789605418b346062893d03ecf874d7aeeb","observation_id":"5e6337bc-773f-4dfa-8355-23c7b47772a9","resolution":{"observed_at":"2026-08-15T15:51:37.356183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:51:38.158906Z","title":"Timit- tts: A text-to-speech dataset for multimodal synthetic media detection,","venue":null,"work_id":"f8a271ca-5ad3-4b5d-a45f-8bbe41e06ef6","year":2023},"citing_paper":{"arxiv_id":"2509.21597","last_updated":"2026-06-03T17:37:13Z","snapshot_observed_at":"2026-08-18T03:36:37.563547Z","submitted_at":"2025-09-25T21:09:40Z","title":"AUDDT: A Unified Benchmark Toolkit for Audio and Speech Deepfake Detectors","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T15:51:37.359658Z"},"links":{"citing_paper":"/paper/2509.21597"},"observation_digest":"sha256:b840f557403361732bd581a7b6ffe77114ce29bae01f2ed6e38fc310b8bc4a0a","observation_id":"eb91aa34-5c25-4e61-b291-2d576eb2a0f1","resolution":{"observed_at":"2026-08-15T15:51:38.162599Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03100","last_updated":"2024-04-23T08:38:03Z","snapshot_observed_at":"2026-08-18T17:50:58.009731Z","submitted_at":"2024-03-05T16:35:25Z","title":"NaturalSpeech 3: Zero-Shot Speech Synthesis with Factorized Codec and Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03100","snapshot_observed_at":"2026-08-15T15:51:37.363039Z","title":"Naturalspeech 3: Zero-shot speech syn- thesis with factorized codec and diffusion models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.21597","last_updated":"2026-06-03T17:37:13Z","snapshot_observed_at":"2026-08-18T03:36:37.563547Z","submitted_at":"2025-09-25T21:09:40Z","title":"AUDDT: A Unified Benchmark Toolkit for Audio and Speech Deepfake Detectors","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T15:51:37.363039Z"},"links":{"cited_paper":"/paper/2403.03100","citing_paper":"/paper/2509.21597"},"observation_digest":"sha256:b207ace9065a9cd1f0c5615facfe33134a9c479a25507940964e8cd19acdcab5","observation_id":"f5e2585a-e1b2-4ff9-93dc-985f5b2e598b","resolution":{"observed_at":"2026-08-15T15:51:37.363039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05407","last_updated":"2024-07-09T07:42:51Z","snapshot_observed_at":"2026-08-10T17:49:50.848957Z","submitted_at":"2024-07-07T15:16:19Z","title":"CosyVoice: A Scalable Multilingual Zero-shot Text-to-speech Synthesizer based on Supervised Semantic Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05407","snapshot_observed_at":"2026-08-15T15:51:37.366532Z","title":"Cosyvoice: A scalable multilingual zero-shot text-to-speech synthesizer based on supervised semantic tokens,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.21597","last_updated":"2026-06-03T17:37:13Z","snapshot_observed_at":"2026-08-18T03:36:37.563547Z","submitted_at":"2025-09-25T21:09:40Z","title":"AUDDT: A Unified Benchmark Toolkit for Audio and Speech Deepfake Detectors","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T15:51:37.366532Z"},"links":{"cited_paper":"/paper/2407.05407","citing_paper":"/paper/2509.21597"},"observation_digest":"sha256:ac59acbdef216e066a816411331d5e0f1603c52b8d2ca3c3fcc0c30965bbd2f8","observation_id":"04b0ec63-b22c-40ef-8119-78b31c7fbdfa","resolution":{"observed_at":"2026-08-15T15:51:37.366532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:51:38.147175Z","title":"Dfadd: The diffusion and flow-matching based audio deepfake dataset,","venue":null,"work_id":"f6a01af0-706f-4352-8be6-0e5ffbdebd8f","year":2024},"citing_paper":{"arxiv_id":"2509.21597","last_updated":"2026-06-03T17:37:13Z","snapshot_observed_at":"2026-08-18T03:36:37.563547Z","submitted_at":"2025-09-25T21:09:40Z","title":"AUDDT: A Unified Benchmark Toolkit for Audio and Speech Deepfake Detectors","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T15:51:37.369880Z"},"links":{"citing_paper":"/paper/2509.21597"},"observation_digest":"sha256:6b42d6faf97bb1c75a61f92bb3fa76919d2081061785f95418e9d9284965abb6","observation_id":"1310b110-fb69-4d15-97c3-6f560284ff91","resolution":{"observed_at":"2026-08-15T15:51:38.150973Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-15T15:51:37.373108Z","title":"Neural codec language models are zero-shot text to speech synthesizers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.21597","last_updated":"2026-06-03T17:37:13Z","snapshot_observed_at":"2026-08-18T03:36:37.563547Z","submitted_at":"2025-09-25T21:09:40Z","title":"AUDDT: A Unified Benchmark Toolkit for Audio and Speech Deepfake Detectors","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T15:51:37.373108Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2509.21597"},"observation_digest":"sha256:d58b9377fcc14e7e4200348c7aba400d73af5aee5cb7de18444c00c5047e9c75","observation_id":"7021fb36-88db-41d8-98da-7a9eea181cdb","resolution":{"observed_at":"2026-08-15T15:51:37.373108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:51:37.376740Z","title":"Discrete audio tokens: More than a survey!","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.21597","last_updated":"2026-06-03T17:37:13Z","snapshot_observed_at":"2026-08-18T03:36:37.563547Z","submitted_at":"2025-09-25T21:09:40Z","title":"AUDDT: A Unified Benchmark Toolkit for Audio and Speech Deepfake Detectors","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T15:51:37.376740Z"},"links":{"citing_paper":"/paper/2509.21597"},"observation_digest":"sha256:ed1b6954506877bc2842cfe7cea4764200422587b4cec8c8eb44ad62b366bdd9","observation_id":"d1e8ed99-865a-46d0-b157-dc3c692119e8","resolution":{"observed_at":"2026-08-15T15:51:37.376740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:51:38.136871Z","title":"Ai-synthesized voice detection using neural vocoder artifacts,","venue":null,"work_id":"5d61bf55-1fb8-4a6e-9329-3fc394288343","year":2023},"citing_paper":{"arxiv_id":"2509.21597","last_updated":"2026-06-03T17:37:13Z","snapshot_observed_at":"2026-08-18T03:36:37.563547Z","submitted_at":"2025-09-25T21:09:40Z","title":"AUDDT: A Unified Benchmark Toolkit for Audio and Speech Deepfake Detectors","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T15:51:37.379881Z"},"links":{"citing_paper":"/paper/2509.21597"},"observation_digest":"sha256:3824cbf2fa491308b24448de4f9b531ce3521aa900221f7775db9e766c88f5a5","observation_id":"c2720178-eab5-43be-8c9c-a2ed7f31df33","resolution":{"observed_at":"2026-08-15T15:51:38.140583Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:51:37.382958Z","title":"Post-training for deepfake speech detection,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.21597","last_updated":"2026-06-03T17:37:13Z","snapshot_observed_at":"2026-08-18T03:36:37.563547Z","submitted_at":"2025-09-25T21:09:40Z","title":"AUDDT: A Unified Benchmark Toolkit for Audio and Speech Deepfake Detectors","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T15:51:37.382958Z"},"links":{"citing_paper":"/paper/2509.21597"},"observation_digest":"sha256:79c8dd1b2ce8fb5718dceb389ba65b0c924176b8584e711f9bd15112f5e6e327","observation_id":"e841972b-d1d4-4742-a653-641994ef2381","resolution":{"observed_at":"2026-08-15T15:51:37.382958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02438","last_updated":"2024-06-18T04:21:52Z","snapshot_observed_at":"2026-08-19T00:15:45.461817Z","submitted_at":"2024-06-04T16:00:18Z","title":"CtrSVDD: A Benchmark Dataset and Baseline Analysis for Controlled Singing Voice Deepfake Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02438","snapshot_observed_at":"2026-08-15T15:51:37.385915Z","title":"Ctrsvdd: A benchmark dataset and baseline analysis for controlled singing voice deepfake detection,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.21597","last_updated":"2026-06-03T17:37:13Z","snapshot_observed_at":"2026-08-18T03:36:37.563547Z","submitted_at":"2025-09-25T21:09:40Z","title":"AUDDT: A Unified Benchmark Toolkit for Audio and Speech Deepfake Detectors","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T15:51:37.385915Z"},"links":{"cited_paper":"/paper/2406.02438","citing_paper":"/paper/2509.21597"},"observation_digest":"sha256:58fbf59db602e885b56d29603d34629eba038ea30e2b255291977c5b966de915","observation_id":"6025f3e4-a62e-4f81-a2d5-3a49818cc163","resolution":{"observed_at":"2026-08-15T15:51:37.385915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:51:38.125099Z","title":"Deepfake cross-lingual evaluation dataset (decro),","venue":null,"work_id":"106fbaa1-aa46-47ea-b02d-e4cfbc314f9c","year":null},"citing_paper":{"arxiv_id":"2509.21597","last_updated":"2026-06-03T17:37:13Z","snapshot_observed_at":"2026-08-18T03:36:37.563547Z","submitted_at":"2025-09-25T21:09:40Z","title":"AUDDT: A Unified Benchmark Toolkit for Audio and Speech Deepfake Detectors","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T15:51:37.389412Z"},"links":{"citing_paper":"/paper/2509.21597"},"observation_digest":"sha256:fb71d628e8a140f951ff86fb545af15038d59769c02420c6d258022a5836bc2a","observation_id":"8f28a755-311c-43a2-9ced-246b0f1e4cc4","resolution":{"observed_at":"2026-08-15T15:51:38.129069Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14006","last_updated":"2024-07-19T03:36:48Z","snapshot_observed_at":"2026-08-21T00:03:00.566556Z","submitted_at":"2024-07-19T03:36:48Z","title":"MSceneSpeech: A Multi-Scene Speech Dataset For Expressive Speech Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14006","snapshot_observed_at":"2026-08-15T15:51:37.396304Z","title":"Mscenespeech: A multi-scene speech dataset for expressive speech synthesis,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.21597","last_updated":"2026-06-03T17:37:13Z","snapshot_observed_at":"2026-08-18T03:36:37.563547Z","submitted_at":"2025-09-25T21:09:40Z","title":"AUDDT: A Unified Benchmark Toolkit for Audio and Speech Deepfake Detectors","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T15:51:37.396304Z"},"links":{"cited_paper":"/paper/2407.14006","citing_paper":"/paper/2509.21597"},"observation_digest":"sha256:2bbcd4736f596c31e3fca5d2d9e81092bd695b40b7a6815d230f77677235a5ad","observation_id":"61e8c6c1-64a9-4b08-b3f5-ccf71e95c799","resolution":{"observed_at":"2026-08-15T15:51:37.396304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:51:38.114301Z","title":"An open dataset of synthetic speech,","venue":null,"work_id":"e19cc468-6d5f-4957-a299-5d126af0577a","year":2023},"citing_paper":{"arxiv_id":"2509.21597","last_updated":"2026-06-03T17:37:13Z","snapshot_observed_at":"2026-08-18T03:36:37.563547Z","submitted_at":"2025-09-25T21:09:40Z","title":"AUDDT: A Unified Benchmark Toolkit for Audio and Speech Deepfake Detectors","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T15:51:37.399755Z"},"links":{"citing_paper":"/paper/2509.21597"},"observation_digest":"sha256:28f097914f346371c83ed58ac917370e0ee84e5c59f9c9ceb51cc8ce4244760d","observation_id":"354a086e-c37b-4353-a736-343d1471398e","resolution":{"observed_at":"2026-08-15T15:51:38.118245Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:51:38.102971Z","title":"Audio recordings dataset of genuine and replayed speech at both ends of a telecommunication channel,","venue":null,"work_id":"d0020a1c-d2dc-4e43-9f8a-2300a9a7e00e","year":2021},"citing_paper":{"arxiv_id":"2509.21597","last_updated":"2026-06-03T17:37:13Z","snapshot_observed_at":"2026-08-18T03:36:37.563547Z","submitted_at":"2025-09-25T21:09:40Z","title":"AUDDT: A Unified Benchmark Toolkit for Audio and Speech Deepfake Detectors","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T15:51:37.403319Z"},"links":{"citing_paper":"/paper/2509.21597"},"observation_digest":"sha256:6f17936b190187e0282195b619734469e843278c2540fdcb2106a749a87ba779","observation_id":"3dd39851-7c36-44dd-a2ad-f86a738dedb7","resolution":{"observed_at":"2026-08-15T15:51:38.107058Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:51:37.406574Z","title":"Jvnv: A corpus of japanese emotional speech with verbal content and nonverbal expressions,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.21597","last_updated":"2026-06-03T17:37:13Z","snapshot_observed_at":"2026-08-18T03:36:37.563547Z","submitted_at":"2025-09-25T21:09:40Z","title":"AUDDT: A Unified Benchmark Toolkit for Audio and Speech Deepfake Detectors","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T15:51:37.406574Z"},"links":{"citing_paper":"/paper/2509.21597"},"observation_digest":"sha256:6eea5a7b34d029e894dfabb59a1cd7e5d0a61174f4de01bc9ca494aba954b2f7","observation_id":"2954ff89-68d4-435a-9000-0081ebccd861","resolution":{"observed_at":"2026-08-15T15:51:37.406574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:51:38.084488Z","title":"Speech enhancement and dereverberation with diffusion-based generative models,","venue":null,"work_id":"244fd25b-d46b-4827-955a-ba6be3dd3627","year":2023},"citing_paper":{"arxiv_id":"2509.21597","last_updated":"2026-06-03T17:37:13Z","snapshot_observed_at":"2026-08-18T03:36:37.563547Z","submitted_at":"2025-09-25T21:09:40Z","title":"AUDDT: A Unified Benchmark Toolkit for Audio and Speech Deepfake Detectors","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T15:51:37.409819Z"},"links":{"citing_paper":"/paper/2509.21597"},"observation_digest":"sha256:1b1ef83ba247e7fd8f207919deec0e5623e8e7145573f395aa28f9056d2c088a","observation_id":"7c865ca0-694a-4acd-b7e7-71d5530be07d","resolution":{"observed_at":"2026-08-15T15:51:38.088162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:51:38.072823Z","title":"Genhancer: High-fidelity speech enhancement via generative modeling on discrete codec tokens,","venue":null,"work_id":"11b118fb-ddb2-4f92-b7a2-ec5cca0b80dd","year":2024},"citing_paper":{"arxiv_id":"2509.21597","last_updated":"2026-06-03T17:37:13Z","snapshot_observed_at":"2026-08-18T03:36:37.563547Z","submitted_at":"2025-09-25T21:09:40Z","title":"AUDDT: A Unified Benchmark Toolkit for Audio and Speech Deepfake Detectors","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T15:51:37.413049Z"},"links":{"citing_paper":"/paper/2509.21597"},"observation_digest":"sha256:e228f40918fe8fe9fe421660080c1518b6ca9b34158e3e2d6b69618449fecefd","observation_id":"e5cf11cd-a2f9-4153-869e-b30dca7a113a","resolution":{"observed_at":"2026-08-15T15:51:38.076965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:51:38.061076Z","title":"Miipher: A robust speech restora- tion model integrating self-supervised speech and text representations,","venue":null,"work_id":"46b1ca99-f635-4d54-a1b9-52aa81ff4947","year":2023},"citing_paper":{"arxiv_id":"2509.21597","last_updated":"2026-06-03T17:37:13Z","snapshot_observed_at":"2026-08-18T03:36:37.563547Z","submitted_at":"2025-09-25T21:09:40Z","title":"AUDDT: A Unified Benchmark Toolkit for Audio and Speech Deepfake Detectors","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T15:51:37.416107Z"},"links":{"citing_paper":"/paper/2509.21597"},"observation_digest":"sha256:6989b3e2ae0152f59366c1d3431240a3b8ed0302a407f30ca1af9338df41a375","observation_id":"1a55586c-d0a7-4478-a5ef-f492be13aad4","resolution":{"observed_at":"2026-08-15T15:51:38.065384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:51:38.049509Z","title":"Hifi-gan-2: Studio-quality speech en- hancement via generative adversarial networks conditioned on acoustic features,","venue":null,"work_id":"c93d93b5-4986-488c-8bdf-f7d8af7875d3","year":2021},"citing_paper":{"arxiv_id":"2509.21597","last_updated":"2026-06-03T17:37:13Z","snapshot_observed_at":"2026-08-18T03:36:37.563547Z","submitted_at":"2025-09-25T21:09:40Z","title":"AUDDT: A Unified Benchmark Toolkit for Audio and Speech Deepfake Detectors","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T15:51:37.419401Z"},"links":{"citing_paper":"/paper/2509.21597"},"observation_digest":"sha256:086e4f1df638b615fb6de06cec129e463f1b35d58a9cfc8826d6efac0ae146e4","observation_id":"b79cc746-2c38-40b5-af86-bcc9eaf3337f","resolution":{"observed_at":"2026-08-15T15:51:38.053765Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:51:37.422757Z","title":"The lj speech dataset,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.21597","last_updated":"2026-06-03T17:37:13Z","snapshot_observed_at":"2026-08-18T03:36:37.563547Z","submitted_at":"2025-09-25T21:09:40Z","title":"AUDDT: A Unified Benchmark Toolkit for Audio and Speech Deepfake Detectors","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T15:51:37.422757Z"},"links":{"citing_paper":"/paper/2509.21597"},"observation_digest":"sha256:c235a7849f67ac02a3f5958122aa7259f213525c0b3881415f85b86dccc9c217","observation_id":"cb6ef1cb-1b67-401f-aae5-53ec15948686","resolution":{"observed_at":"2026-08-15T15:51:37.422757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:51:38.031422Z","title":"Automatic speaker verification spoofing and deepfake detection using wav2vec 2.0 and data augmentation,","venue":null,"work_id":"b88b0eb3-04fa-47ba-8545-2313c264acc4","year":2022},"citing_paper":{"arxiv_id":"2509.21597","last_updated":"2026-06-03T17:37:13Z","snapshot_observed_at":"2026-08-18T03:36:37.563547Z","submitted_at":"2025-09-25T21:09:40Z","title":"AUDDT: A Unified Benchmark Toolkit for Audio and Speech Deepfake Detectors","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T15:51:37.426100Z"},"links":{"citing_paper":"/paper/2509.21597"},"observation_digest":"sha256:93f88bfd8daff51ae04fdf8ef97b773b36c1d5ca0649ec39b511f97e69e6278f","observation_id":"2aaabab3-dfa5-4341-9f5c-253eff4f6d21","resolution":{"observed_at":"2026-08-15T15:51:38.035337Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:51:37.429384Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech representations,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.21597","last_updated":"2026-06-03T17:37:13Z","snapshot_observed_at":"2026-08-18T03:36:37.563547Z","submitted_at":"2025-09-25T21:09:40Z","title":"AUDDT: A Unified Benchmark Toolkit for Audio and Speech Deepfake Detectors","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T15:51:37.429384Z"},"links":{"citing_paper":"/paper/2509.21597"},"observation_digest":"sha256:180fb6fd4a073d3ae5adedec6f9331eb87778786cdfae19359c7ca6a65a7fa80","observation_id":"fde5178a-8192-484f-bfbb-65f028905928","resolution":{"observed_at":"2026-08-15T15:51:37.429384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:51:38.011849Z","title":"End-to-end spectro-temporal graph attention networks for speaker verification anti-spoofing and speech deepfake detection,","venue":null,"work_id":"1398138a-1faf-4a97-b3d1-9d2ef4c90e65","year":2021},"citing_paper":{"arxiv_id":"2509.21597","last_updated":"2026-06-03T17:37:13Z","snapshot_observed_at":"2026-08-18T03:36:37.563547Z","submitted_at":"2025-09-25T21:09:40Z","title":"AUDDT: A Unified Benchmark Toolkit for Audio and Speech Deepfake Detectors","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T15:51:37.436227Z"},"links":{"citing_paper":"/paper/2509.21597"},"observation_digest":"sha256:51d938bc60f74e68cf8ad6f52b9e4f13b51c26390e3f584180debe69dff71e02","observation_id":"e0b3d28a-3653-4618-82c8-d13853caf0bf","resolution":{"observed_at":"2026-08-15T15:51:38.015961Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:51:37.999174Z","title":"Speech enhancement—a review of modern meth- ods,","venue":null,"work_id":"55611683-ec06-4bc3-b6cd-8ec8d6d181be","year":2024},"citing_paper":{"arxiv_id":"2509.21597","last_updated":"2026-06-03T17:37:13Z","snapshot_observed_at":"2026-08-18T03:36:37.563547Z","submitted_at":"2025-09-25T21:09:40Z","title":"AUDDT: A Unified Benchmark Toolkit for Audio and Speech Deepfake Detectors","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T15:51:37.439491Z"},"links":{"citing_paper":"/paper/2509.21597"},"observation_digest":"sha256:0cc40329152c1014f9857c403bdc9a6ec099e4fa84a20117e86da12d0afd486a","observation_id":"17cd747c-aeb8-4357-8892-6e3bd4ff3a21","resolution":{"observed_at":"2026-08-15T15:51:38.003891Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10830","last_updated":"2025-08-14T16:54:34Z","snapshot_observed_at":"2026-08-19T23:19:54.905872Z","submitted_at":"2025-08-14T16:54:34Z","title":"Advances in Speech Separation: Techniques, Challenges, and Future Trends","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10830","snapshot_observed_at":"2026-08-15T15:51:37.442667Z","title":"Advances in speech separation: Techniques, challenges, and future trends,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.21597","last_updated":"2026-06-03T17:37:13Z","snapshot_observed_at":"2026-08-18T03:36:37.563547Z","submitted_at":"2025-09-25T21:09:40Z","title":"AUDDT: A Unified Benchmark Toolkit for Audio and Speech Deepfake Detectors","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T15:51:37.442667Z"},"links":{"cited_paper":"/paper/2508.10830","citing_paper":"/paper/2509.21597"},"observation_digest":"sha256:bc649b7e0f69cf2497087d212f146c36109e9cf2c5c6972ae950a0faa415874b","observation_id":"d7e482e8-561b-499d-adaf-844fa79f4b39","resolution":{"observed_at":"2026-08-15T15:51:37.442667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:51:37.445977Z","title":"Cstr vctk corpus: English multi-speaker corpus for cstr voice cloning toolkit (version 0.92),","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.21597","last_updated":"2026-06-03T17:37:13Z","snapshot_observed_at":"2026-08-18T03:36:37.563547Z","submitted_at":"2025-09-25T21:09:40Z","title":"AUDDT: A Unified Benchmark Toolkit for Audio and Speech Deepfake Detectors","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-15T15:51:37.445977Z"},"links":{"citing_paper":"/paper/2509.21597"},"observation_digest":"sha256:5faebe52821fc56c74531882694ab65d8dd1ad51c50bd51f4eb8c227eb931981","observation_id":"c88548e1-a921-4747-a9c7-3097766cac45","resolution":{"observed_at":"2026-08-15T15:51:37.445977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:51:37.979833Z","title":"Available: https://api.semanticscholar.org/CorpusID: 213060286 10 VOLUME ,","venue":null,"work_id":"f86af0d4-4f8d-481f-8abb-e481438b0a4b","year":null},"citing_paper":{"arxiv_id":"2509.21597","last_updated":"2026-06-03T17:37:13Z","snapshot_observed_at":"2026-08-18T03:36:37.563547Z","submitted_at":"2025-09-25T21:09:40Z","title":"AUDDT: A Unified Benchmark Toolkit for Audio and Speech Deepfake Detectors","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-15T15:51:37.449634Z"},"links":{"citing_paper":"/paper/2509.21597"},"observation_digest":"sha256:3ecfe3d6c6a4dc6dcddaca9fb2e2c956a6545906a0ae75b28a6a1c4d857e7dcb","observation_id":"7345fffa-9fe2-4ad4-b07f-1afae1aa4b15","resolution":{"observed_at":"2026-08-15T15:51:37.983918Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.11477","last_updated":"2020-10-22T06:09:10Z","snapshot_observed_at":"2026-08-14T22:05:39.651975Z","submitted_at":"2020-06-20T02:35:02Z","title":"wav2vec 2.0: A Framework for Self-Supervised Learning of Speech Representations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.11477","snapshot_observed_at":"2026-08-15T15:51:37.432808Z","title":"Available: https://arxiv.org/abs/2006.11477","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2509.21597","last_updated":"2026-06-03T17:37:13Z","snapshot_observed_at":"2026-08-18T03:36:37.563547Z","submitted_at":"2025-09-25T21:09:40Z","title":"AUDDT: A Unified Benchmark Toolkit for Audio and Speech Deepfake Detectors","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-15T15:51:37.432808Z"},"links":{"cited_paper":"/paper/2006.11477","citing_paper":"/paper/2509.21597"},"observation_digest":"sha256:35e09e124a355628e83cf2849262c563fe6ff62d3eabf3bb0f2ec1f167524722","observation_id":"cee372bc-1581-4c38-be1a-50762573c827","resolution":{"observed_at":"2026-08-15T15:51:37.432808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.5281/zenodo.7603208","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:51:37.476192Z","title":"Available: https://doi.org/10.5281/zenodo.7603208","venue":null,"work_id":"5f1b40bf-c36d-48a4-8512-4c75ab27749a","year":null},"citing_paper":{"arxiv_id":"2509.21597","last_updated":"2026-06-03T17:37:13Z","snapshot_observed_at":"2026-08-18T03:36:37.563547Z","submitted_at":"2025-09-25T21:09:40Z","title":"AUDDT: A Unified Benchmark Toolkit for Audio and Speech Deepfake Detectors","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-15T15:51:37.392955Z"},"links":{"citing_paper":"/paper/2509.21597"},"observation_digest":"sha256:8d49656d49d631addfe33ff7b10512b25c1ed386a96462d6e910bcf988f90097","observation_id":"e1b0f6f4-4e2e-4053-bfad-138d0e188ad0","resolution":{"observed_at":"2026-08-15T15:51:37.481241Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04880","last_updated":"2024-12-25T07:30:50Z","snapshot_observed_at":"2026-08-16T13:54:25.621805Z","submitted_at":"2024-05-08T08:28:40Z","title":"The Codecfake Dataset and Countermeasures for the Universally Detection of Deepfake Audio","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04880","snapshot_observed_at":"2026-08-15T15:51:37.310253Z","title":"Available: https://arxiv.org/abs/2405.04880","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.21597","last_updated":"2026-06-03T17:37:13Z","snapshot_observed_at":"2026-08-18T03:36:37.563547Z","submitted_at":"2025-09-25T21:09:40Z","title":"AUDDT: A Unified Benchmark Toolkit for Audio and Speech Deepfake Detectors","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-15T15:51:37.310253Z"},"links":{"cited_paper":"/paper/2405.04880","citing_paper":"/paper/2509.21597"},"observation_digest":"sha256:55550627c77a1ad7d8ab55b08f910672872afea2cdbdee35ee178b6d94b03882","observation_id":"d06eb128-b672-428e-91b5-472e7890b23c","resolution":{"observed_at":"2026-08-15T15:51:37.310253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.21597","last_updated":"2026-06-03T17:37:13Z","latest_version":2,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-18T03:36:37.563547Z","submitted_at":"2025-09-25T21:09:40Z","title":"AUDDT: A Unified Benchmark Toolkit for Audio and Speech Deepfake Detectors"},"reference_resolution":{"displayed":58,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":29,"verified_exact":1,"verified_fuzzy":27},"total_outbound_references":58},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 58 of 58 outbound references and 1 inbound Pith citation observation for arXiv:2509.21597."}