{"as_of":"2026-08-21T03:23:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d026bb6b656481ea1ef0f220971b4ef1c53e833a670a4f2ad9d60ab9bf73d62b","coverage":[{"denominator":71,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":71,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-24T04:34:59.205522Z","state":"measured"},{"denominator":83,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":83,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":12,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":12,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T05:15:07.510122Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-04T07:49:39.214744Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2401.09512","last_updated":"2026-05-18T13:28:38Z","snapshot_observed_at":"2026-08-16T07:24:58.122087Z","submitted_at":"2024-01-17T15:09:02Z","title":"MLAAD: The Multi-Language Audio Anti-Spoofing Dataset","version":10},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.09512","snapshot_observed_at":"2026-08-12T05:15:07.510122Z","title":"Mlaad: The multi-language audio anti-spoofing dataset,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.00571","last_updated":"2024-12-10T10:23:54Z","snapshot_observed_at":"2026-08-16T01:01:33.190459Z","submitted_at":"2024-11-30T19:53:23Z","title":"From Audio Deepfake Detection to AI-Generated Music Detection -- A Pathway and Overview","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-12T05:15:07.510122Z"},"links":{"cited_paper":"/paper/2401.09512","citing_paper":"/paper/2412.00571"},"observation_digest":"sha256:d7246a1c1e70ad97da3b02707b33c5996402726971aabd4e7751af18f0986705","observation_id":"5d3ad597-53a0-4044-90d3-f85f95048929","resolution":{"observed_at":"2026-08-12T05:15:07.510122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09512","last_updated":"2026-05-18T13:28:38Z","snapshot_observed_at":"2026-08-16T07:24:58.122087Z","submitted_at":"2024-01-17T15:09:02Z","title":"MLAAD: The Multi-Language Audio Anti-Spoofing Dataset","version":10},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.09512","snapshot_observed_at":"2026-08-11T13:57:20.907670Z","title":"u ller, N. M.; Kawa, P.; Choong, W. H.; Casanova, E.; G \\","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12619","last_updated":"2024-12-17T07:31:19Z","snapshot_observed_at":"2026-08-17T11:47:00.732991Z","submitted_at":"2024-12-17T07:31:19Z","title":"Phoneme-Level Feature Discrepancies: A Key to Detecting Sophisticated Speech Deepfakes","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-11T13:57:20.907670Z"},"links":{"cited_paper":"/paper/2401.09512","citing_paper":"/paper/2412.12619"},"observation_digest":"sha256:cc864d26d634847ac45b83626a0ea3a394ca3a2c467bb49bd222a392e66b0bf2","observation_id":"a70851d6-14f8-4366-a3e2-744145c65079","resolution":{"observed_at":"2026-08-11T13:57:20.907670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09512","last_updated":"2026-05-18T13:28:38Z","snapshot_observed_at":"2026-08-16T07:24:58.122087Z","submitted_at":"2024-01-17T15:09:02Z","title":"MLAAD: The Multi-Language Audio Anti-Spoofing Dataset","version":10},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.09512","snapshot_observed_at":"2026-08-08T23:48:28.837316Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04049","last_updated":"2025-06-01T07:23:30Z","snapshot_observed_at":"2026-08-15T15:03:53.783612Z","submitted_at":"2025-02-06T13:06:33Z","title":"Towards Explainable Spoofed Speech Attribution and Detection:a Probabilistic Approach for Characterizing Speech Synthesizer Components","version":3},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-08T23:48:28.837316Z"},"links":{"cited_paper":"/paper/2401.09512","citing_paper":"/paper/2502.04049"},"observation_digest":"sha256:48a85cb0fc3839540b50b4248924fafd4657573fd244509e2c5d231727a5de54","observation_id":"b96ba7bc-01db-44b9-b21e-dbea8a587c4b","resolution":{"observed_at":"2026-08-08T23:48:28.837316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09512","last_updated":"2026-05-18T13:28:38Z","snapshot_observed_at":"2026-08-16T07:24:58.122087Z","submitted_at":"2024-01-17T15:09:02Z","title":"MLAAD: The Multi-Language Audio Anti-Spoofing Dataset","version":10},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.09512","snapshot_observed_at":"2026-08-06T16:49:27.535796Z","title":"Mlaad: The multi-language audio anti-spoofing dataset,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12595","last_updated":"2025-07-16T19:30:51Z","snapshot_observed_at":"2026-08-20T05:50:24.120282Z","submitted_at":"2025-07-16T19:30:51Z","title":"Enhancing In-Domain and Out-Domain EmoFake Detection via Cooperative Multilingual Speech Foundation Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:27.535796Z"},"links":{"cited_paper":"/paper/2401.09512","citing_paper":"/paper/2507.12595"},"observation_digest":"sha256:838d96c81b23a8be623fb141f8da338c769950490f3b0c9f8c55671bec689e4f","observation_id":"66316a3a-d344-4529-a0f6-9e974b92de00","resolution":{"observed_at":"2026-08-06T16:49:27.535796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09512","last_updated":"2026-05-18T13:28:38Z","snapshot_observed_at":"2026-08-16T07:24:58.122087Z","submitted_at":"2024-01-17T15:09:02Z","title":"MLAAD: The Multi-Language Audio Anti-Spoofing Dataset","version":10},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.09512","snapshot_observed_at":"2026-08-06T12:49:19.818966Z","title":"u ller, Piotr Kawa, Wei Herng Choong, Edresson Casanova, Eren G \\","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21463","last_updated":"2025-07-29T03:06:31Z","snapshot_observed_at":"2026-08-10T15:09:41.229385Z","submitted_at":"2025-07-29T03:06:31Z","title":"SpeechFake: A Large-Scale Multilingual Speech Deepfake Dataset Incorporating Cutting-Edge Generation Methods","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T12:49:19.818966Z"},"links":{"cited_paper":"/paper/2401.09512","citing_paper":"/paper/2507.21463"},"observation_digest":"sha256:c990c06bd145a50879cab1cea3f54199282e492e02486d943f16fb0919769b1b","observation_id":"9d9e9765-b01b-4418-846d-1ffee2cf5a03","resolution":{"observed_at":"2026-08-06T12:49:19.818966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09512","last_updated":"2026-05-18T13:28:38Z","snapshot_observed_at":"2026-08-16T07:24:58.122087Z","submitted_at":"2024-01-17T15:09:02Z","title":"MLAAD: The Multi-Language Audio Anti-Spoofing Dataset","version":10},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.09512","snapshot_observed_at":"2026-08-05T13:55:18.739632Z","title":"MLAAD: The multi-language audio anti-spoofing dataset,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00186","last_updated":"2025-08-29T18:37:57Z","snapshot_observed_at":"2026-08-07T21:38:02.692073Z","submitted_at":"2025-08-29T18:37:57Z","title":"Generalizable Audio Spoofing Detection using Non-Semantic Representations","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T13:55:18.739632Z"},"links":{"cited_paper":"/paper/2401.09512","citing_paper":"/paper/2509.00186"},"observation_digest":"sha256:5a33925bfd019b8acf888010d80b4cd8cacc1041c7bfdc952a791fdfaf883991","observation_id":"e25cfc55-f110-4080-aefb-f4ff357bbc0a","resolution":{"observed_at":"2026-08-05T13:55:18.739632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09512","last_updated":"2026-05-18T13:28:38Z","snapshot_observed_at":"2026-08-16T07:24:58.122087Z","submitted_at":"2024-01-17T15:09:02Z","title":"MLAAD: The Multi-Language Audio Anti-Spoofing Dataset","version":10},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.09512","snapshot_observed_at":"2026-08-04T19:37:19.904207Z","title":"Mlaad: The multi-language audio anti-spoofing dataset,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09204","last_updated":"2025-09-11T07:20:18Z","snapshot_observed_at":"2026-08-18T00:30:10.077810Z","submitted_at":"2025-09-11T07:20:18Z","title":"Bona fide Cross Testing Reveals Weak Spot in Audio Deepfake Detection Systems","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:19.904207Z"},"links":{"cited_paper":"/paper/2401.09512","citing_paper":"/paper/2509.09204"},"observation_digest":"sha256:00323ac1fe6d5f6cd0feb138b15a3995cc4d76ae643995778004fd263f77ab6b","observation_id":"f76eaf6c-5b5c-4348-b130-a09db64bd8a7","resolution":{"observed_at":"2026-08-04T19:37:19.904207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09512","last_updated":"2026-05-18T13:28:38Z","snapshot_observed_at":"2026-08-16T07:24:58.122087Z","submitted_at":"2024-01-17T15:09:02Z","title":"MLAAD: The Multi-Language Audio Anti-Spoofing Dataset","version":10},"cited_work":{"arxiv_id":"2401.09512","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.09512","snapshot_observed_at":"2026-07-04T07:49:39.214744Z","title":"Mlaad: The multi- language audio anti-spoofing dataset","venue":"cs.SD","work_id":"f6b54694-3368-464e-a2a5-b15c4683dc4c","year":2024},"citing_paper":{"arxiv_id":"2604.02374","last_updated":"2026-04-27T15:09:03Z","snapshot_observed_at":"2026-08-12T19:02:16.732591Z","submitted_at":"2026-03-31T20:35:26Z","title":"Evaluating Generalization and Robustness in Russian Anti-Spoofing: The RuASD Initiative","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-08T02:27:05.776290Z"},"links":{"cited_paper":"/paper/2401.09512","citing_paper":"/paper/2604.02374"},"observation_digest":"sha256:51127fc08d96fd64dd3df17ecde7ce4f4ba58f67f6d26a790ae86ec6b2d6a877","observation_id":"e551916c-98a7-49e7-bebd-1a6e8010dfc0","resolution":{"observed_at":"2026-05-20T00:05:24.831545Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09512","last_updated":"2026-05-18T13:28:38Z","snapshot_observed_at":"2026-08-16T07:24:58.122087Z","submitted_at":"2024-01-17T15:09:02Z","title":"MLAAD: The Multi-Language Audio Anti-Spoofing Dataset","version":10},"cited_work":{"arxiv_id":"2401.09512","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.09512","snapshot_observed_at":"2026-07-04T07:49:39.214744Z","title":"Mlaad: The multi- language audio anti-spoofing dataset","venue":"cs.SD","work_id":"f6b54694-3368-464e-a2a5-b15c4683dc4c","year":2024},"citing_paper":{"arxiv_id":"2606.10758","last_updated":"2026-06-09T12:10:29Z","snapshot_observed_at":"2026-08-13T07:59:31.916418Z","submitted_at":"2026-06-09T12:10:29Z","title":"Anchoring the Unknown: Open-Set Model Attribution via Proxy-Anchor Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-27T11:48:10.283990Z"},"links":{"cited_paper":"/paper/2401.09512","citing_paper":"/paper/2606.10758"},"observation_digest":"sha256:1529e2ccd25edab7cbf4a76f6401df5d6f9361a135c2e915de9f23d44b83c0e5","observation_id":"607d1f7b-2846-492d-a5b5-bab229e87ced","resolution":{"observed_at":"2026-07-03T07:47:44.693292Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09512","last_updated":"2026-05-18T13:28:38Z","snapshot_observed_at":"2026-08-16T07:24:58.122087Z","submitted_at":"2024-01-17T15:09:02Z","title":"MLAAD: The Multi-Language Audio Anti-Spoofing Dataset","version":10},"cited_work":{"arxiv_id":"2401.09512","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.09512","snapshot_observed_at":"2026-07-04T07:49:39.214744Z","title":"Mlaad: The multi- language audio anti-spoofing dataset","venue":"cs.SD","work_id":"f6b54694-3368-464e-a2a5-b15c4683dc4c","year":2024},"citing_paper":{"arxiv_id":"2606.10911","last_updated":"2026-06-09T14:20:55Z","snapshot_observed_at":"2026-08-18T03:56:41.757976Z","submitted_at":"2026-06-09T14:20:55Z","title":"Ethical and Technical Limits of Deepfake Speech Datasets","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-27T11:40:01.282256Z"},"links":{"cited_paper":"/paper/2401.09512","citing_paper":"/paper/2606.10911"},"observation_digest":"sha256:65070fb09f662b7e4350d4c384c0ca59c3a96c7e0266fcab4d46f0fe8be5a3f8","observation_id":"282a144c-9432-45e8-9d1b-dd1f5d92d74a","resolution":{"observed_at":"2026-07-03T07:57:44.364399Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09512","last_updated":"2026-05-18T13:28:38Z","snapshot_observed_at":"2026-08-16T07:24:58.122087Z","submitted_at":"2024-01-17T15:09:02Z","title":"MLAAD: The Multi-Language Audio Anti-Spoofing Dataset","version":10},"cited_work":{"arxiv_id":"2401.09512","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.09512","snapshot_observed_at":"2026-07-04T07:49:39.214744Z","title":"Mlaad: The multi- language audio anti-spoofing dataset","venue":"cs.SD","work_id":"f6b54694-3368-464e-a2a5-b15c4683dc4c","year":2024},"citing_paper":{"arxiv_id":"2606.11666","last_updated":"2026-06-10T05:18:19Z","snapshot_observed_at":"2026-07-06T23:50:44.713490Z","submitted_at":"2026-06-10T05:18:19Z","title":"The Hidden Cost of Pairwise Verification in Synthetic Speech Source Tracing","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-27T08:36:59.271617Z"},"links":{"cited_paper":"/paper/2401.09512","citing_paper":"/paper/2606.11666"},"observation_digest":"sha256:78a69fcf0b12e85d8205fe8d75978b8e6897bb62cd1bd46bb4beaf5c99498663","observation_id":"06bf7587-1f3e-4ce2-a1cb-cc521333fb60","resolution":{"observed_at":"2026-07-03T12:58:08.620251Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09512","last_updated":"2026-05-18T13:28:38Z","snapshot_observed_at":"2026-08-16T07:24:58.122087Z","submitted_at":"2024-01-17T15:09:02Z","title":"MLAAD: The Multi-Language Audio Anti-Spoofing Dataset","version":10},"cited_work":{"arxiv_id":"2401.09512","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.09512","snapshot_observed_at":"2026-07-04T07:49:39.214744Z","title":"Mlaad: The multi- language audio anti-spoofing dataset","venue":"cs.SD","work_id":"f6b54694-3368-464e-a2a5-b15c4683dc4c","year":2024},"citing_paper":{"arxiv_id":"2606.21584","last_updated":"2026-06-19T16:39:36Z","snapshot_observed_at":"2026-08-19T15:47:24.711918Z","submitted_at":"2026-06-19T16:39:36Z","title":"When EER Hides Deployment Failure: Auditing Threshold Transfer and Unlabeled Score Calibration for Speech Deepfake Detectors","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-26T12:49:02.946331Z"},"links":{"cited_paper":"/paper/2401.09512","citing_paper":"/paper/2606.21584"},"observation_digest":"sha256:244adac2913b9f4e3b5bb122cfd494f3012bd88e77a77e8b9c8e41a46d87bbad","observation_id":"2a024c58-29c0-42b0-87f0-50a03d554917","resolution":{"observed_at":"2026-07-04T07:49:39.216139Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2401.09512/citation-record","integrity":"/paper/2401.09512/integrity","json":"/paper/2401.09512/citation-record.json","paper":"/paper/2401.09512"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Par- rotron: An End-to-End Speech-to-Speech Conversion Model and its Applications to Hearing-Impaired Speech and Speech Separation","venue":null,"work_id":"61f08f27-1e77-43af-8d47-7f56a7809760","year":2019},"citing_paper":{"arxiv_id":"2401.09512","last_updated":"2026-05-18T13:28:38Z","snapshot_observed_at":"2026-08-16T07:24:58.122087Z","submitted_at":"2024-01-17T15:09:02Z","title":"MLAAD: The Multi-Language Audio Anti-Spoofing Dataset","version":10},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-24T04:34:59.205522Z"},"links":{"citing_paper":"/paper/2401.09512"},"observation_digest":"sha256:d7b54fa744ba557cf52732e5367bea229b3604cad0aaab322185c5eeabc1780b","observation_id":"808f1224-10a5-4fd8-a8bd-a1097b748552","resolution":{"observed_at":"2026-05-24T04:36:01.365337Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Apple introduces new features for cognitive accessibility, along with live speech, personal voice, and point and speak in magnifier","venue":null,"work_id":"85d7256a-007f-4322-87f5-3d74226d16d1","year":2023},"citing_paper":{"arxiv_id":"2401.09512","last_updated":"2026-05-18T13:28:38Z","snapshot_observed_at":"2026-08-16T07:24:58.122087Z","submitted_at":"2024-01-17T15:09:02Z","title":"MLAAD: The Multi-Language Audio Anti-Spoofing Dataset","version":10},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-24T04:34:59.205522Z"},"links":{"citing_paper":"/paper/2401.09512"},"observation_digest":"sha256:702e7d0ed72678504024dffe6217089ad26f5cd5d2fefd32ccf347755bf53b8d","observation_id":"b438d230-cd1d-4b83-a1ea-1c042c7db4c6","resolution":{"observed_at":"2026-05-24T04:36:01.444015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fraudsters cloned company director’s voice in $35 million bank heist, police find","venue":null,"work_id":"849cc27a-e04e-4878-8b59-2d53ec22e55c","year":2021},"citing_paper":{"arxiv_id":"2401.09512","last_updated":"2026-05-18T13:28:38Z","snapshot_observed_at":"2026-08-16T07:24:58.122087Z","submitted_at":"2024-01-17T15:09:02Z","title":"MLAAD: The Multi-Language Audio Anti-Spoofing Dataset","version":10},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-24T04:34:59.205522Z"},"links":{"citing_paper":"/paper/2401.09512"},"observation_digest":"sha256:f935e3ea21fe502168994a5fd7063b0b398971bb188e3fbd63f185b229bff66f","observation_id":"cf44f0a7-b460-435b-a7ee-6c1630421f80","resolution":{"observed_at":"2026-05-24T04:36:01.436765Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Asvspoof 2019: A large-scale public database of synthesized, converted and replayed speech","venue":null,"work_id":"bcebcc90-80da-48cc-b52f-41d42483e76d","year":2019},"citing_paper":{"arxiv_id":"2401.09512","last_updated":"2026-05-18T13:28:38Z","snapshot_observed_at":"2026-08-16T07:24:58.122087Z","submitted_at":"2024-01-17T15:09:02Z","title":"MLAAD: The Multi-Language Audio Anti-Spoofing Dataset","version":10},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-24T04:34:59.205522Z"},"links":{"citing_paper":"/paper/2401.09512"},"observation_digest":"sha256:9a6e892951c28e6252afe0fe3fb671e28a40717bbbee40a20c993b0da7acba8d","observation_id":"cbb33c1c-fac4-48b8-8d73-7870b72ea111","resolution":{"observed_at":"2026-05-24T04:36:01.351998Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Content authenticity initiative","venue":null,"work_id":"f49270fd-68e3-49c1-839c-c6a7f4a828ac","year":2024},"citing_paper":{"arxiv_id":"2401.09512","last_updated":"2026-05-18T13:28:38Z","snapshot_observed_at":"2026-08-16T07:24:58.122087Z","submitted_at":"2024-01-17T15:09:02Z","title":"MLAAD: The Multi-Language Audio Anti-Spoofing Dataset","version":10},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-24T04:34:59.205522Z"},"links":{"citing_paper":"/paper/2401.09512"},"observation_digest":"sha256:00131a6c4eb3075cd8ab2b34be055260c9dafdd86dba88b607bb83a341dbd1ae","observation_id":"05dae2c3-69ae-4b15-81f8-a7ae626836d8","resolution":{"observed_at":"2026-05-24T04:36:01.344002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Does Audio Deepfake Detection Generalize?","venue":null,"work_id":"b6cdda96-298e-4f71-a151-059eff7924bb","year":2022},"citing_paper":{"arxiv_id":"2401.09512","last_updated":"2026-05-18T13:28:38Z","snapshot_observed_at":"2026-08-16T07:24:58.122087Z","submitted_at":"2024-01-17T15:09:02Z","title":"MLAAD: The Multi-Language Audio Anti-Spoofing Dataset","version":10},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-24T04:34:59.205522Z"},"links":{"citing_paper":"/paper/2401.09512"},"observation_digest":"sha256:0747f990323b861314882a67858cbde84475fa655c79c1dbeee986d0bd5e3bce","observation_id":"124dbd97-95f1-4605-847d-42acd8c4b935","resolution":{"observed_at":"2026-05-24T04:36:01.340090Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"news/2522048","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"”ai putin","venue":null,"work_id":"fed02f31-6546-4f96-aeba-261a2aa76336","year":2024},"citing_paper":{"arxiv_id":"2401.09512","last_updated":"2026-05-18T13:28:38Z","snapshot_observed_at":"2026-08-16T07:24:58.122087Z","submitted_at":"2024-01-17T15:09:02Z","title":"MLAAD: The Multi-Language Audio Anti-Spoofing Dataset","version":10},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-24T04:34:59.205522Z"},"links":{"citing_paper":"/paper/2401.09512"},"observation_digest":"sha256:effe853f2bf5e1cd02c0db3420d14b20fbed6e0eabb0436d0a01f6f68e4b03ca","observation_id":"876ac944-a73f-43ff-9fcd-e2fd46603cbf","resolution":{"observed_at":"2026-05-24T04:36:00.847837Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deepfake elections: How indian politicians are using ai-manipulated media to malign","venue":null,"work_id":"c22d562e-5aeb-41f9-b82a-ed9937151c2f","year":2024},"citing_paper":{"arxiv_id":"2401.09512","last_updated":"2026-05-18T13:28:38Z","snapshot_observed_at":"2026-08-16T07:24:58.122087Z","submitted_at":"2024-01-17T15:09:02Z","title":"MLAAD: The Multi-Language Audio Anti-Spoofing Dataset","version":10},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-24T04:34:59.205522Z"},"links":{"citing_paper":"/paper/2401.09512"},"observation_digest":"sha256:e308b675c294a347b281501ddfa204100e30f67f0b3e16e6d0d926adc5651a6c","observation_id":"4594d6b4-536c-486e-be61-df40f2405cd3","resolution":{"observed_at":"2026-05-24T04:36:01.405271Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Intelligence artificielle: quand un deepfake d’emmanuel macron emballe la toile","venue":null,"work_id":"0abc3ddd-f26e-4780-a441-e992d8e17336","year":2024},"citing_paper":{"arxiv_id":"2401.09512","last_updated":"2026-05-18T13:28:38Z","snapshot_observed_at":"2026-08-16T07:24:58.122087Z","submitted_at":"2024-01-17T15:09:02Z","title":"MLAAD: The Multi-Language Audio Anti-Spoofing Dataset","version":10},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-24T04:34:59.205522Z"},"links":{"citing_paper":"/paper/2401.09512"},"observation_digest":"sha256:abab17baf3fe451ab8c5ba1a0cc463f18126181e46bdefaeb3909643c4103214","observation_id":"2c584827-31dd-47de-9e83-e8cf5d52b613","resolution":{"observed_at":"2026-05-24T04:36:01.432310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The m-ailabs speech dataset","venue":null,"work_id":"5a06fca1-cdac-442b-912d-0ae2b7b8d15f","year":2019},"citing_paper":{"arxiv_id":"2401.09512","last_updated":"2026-05-18T13:28:38Z","snapshot_observed_at":"2026-08-16T07:24:58.122087Z","submitted_at":"2024-01-17T15:09:02Z","title":"MLAAD: The Multi-Language Audio Anti-Spoofing Dataset","version":10},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-24T04:34:59.205522Z"},"links":{"citing_paper":"/paper/2401.09512"},"observation_digest":"sha256:5da9c9120e8e0d196d348ffa26328d16fdd881566f9a162ccba62628d4dc45ff","observation_id":"b2a638a0-7470-40c8-aa95-7aaead941c77","resolution":{"observed_at":"2026-05-24T04:36:01.463642Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Asvspoof 2015: the first automatic speaker verification spoofing and countermeasures challenge","venue":null,"work_id":"df7b9e6d-07d0-4616-a891-ee57f27c036a","year":2015},"citing_paper":{"arxiv_id":"2401.09512","last_updated":"2026-05-18T13:28:38Z","snapshot_observed_at":"2026-08-16T07:24:58.122087Z","submitted_at":"2024-01-17T15:09:02Z","title":"MLAAD: The Multi-Language Audio Anti-Spoofing Dataset","version":10},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-24T04:34:59.205522Z"},"links":{"citing_paper":"/paper/2401.09512"},"observation_digest":"sha256:05354fb06da4d0c5149d266a1e13fc6a45003fe7085386303db66f036a17ef4d","observation_id":"96879099-b019-477b-9a40-640aafe75f66","resolution":{"observed_at":"2026-05-24T04:36:01.262637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.00537","last_updated":"2021-09-01T16:17:31Z","snapshot_observed_at":"2026-08-19T16:02:42.770315Z","submitted_at":"2021-09-01T16:17:31Z","title":"ASVspoof 2021: accelerating progress in spoofed and deepfake speech detection","version":1},"cited_work":{"arxiv_id":"2109.00537","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2109.00537","snapshot_observed_at":"2026-07-04T12:29:52.021660Z","title":"Asvspoof 2021: accelerating progress in spoofed and deepfake speech detection","venue":null,"work_id":"fda9fe31-4af5-4019-b3af-48a642c80b70","year":2021},"citing_paper":{"arxiv_id":"2401.09512","last_updated":"2026-05-18T13:28:38Z","snapshot_observed_at":"2026-08-16T07:24:58.122087Z","submitted_at":"2024-01-17T15:09:02Z","title":"MLAAD: The Multi-Language Audio Anti-Spoofing Dataset","version":10},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-24T04:34:59.205522Z"},"links":{"cited_paper":"/paper/2109.00537","citing_paper":"/paper/2401.09512"},"observation_digest":"sha256:5ece6d7beeeb350eca0bc824365aa55cdc1b7681a7d207d4ea78368d4e538335","observation_id":"a44f3bd9-cb56-4a75-8796-6acd31e6802f","resolution":{"observed_at":"2026-05-24T04:36:00.842260Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"FakeA VCeleb: A novel audio-video multimodal deepfake dataset","venue":null,"work_id":"21d91fa8-25bf-4402-a9c2-41f0fbbfe9e0","year":2021},"citing_paper":{"arxiv_id":"2401.09512","last_updated":"2026-05-18T13:28:38Z","snapshot_observed_at":"2026-08-16T07:24:58.122087Z","submitted_at":"2024-01-17T15:09:02Z","title":"MLAAD: The Multi-Language Audio Anti-Spoofing Dataset","version":10},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-24T04:34:59.205522Z"},"links":{"citing_paper":"/paper/2401.09512"},"observation_digest":"sha256:8720fe471f55b5e40a479c1a9b7ef68867b9dd4b5e746e0cc92b107cd39b1580","observation_id":"0a028c2c-f3f2-4398-9930-9b02bfd5eb48","resolution":{"observed_at":"2026-05-24T04:36:01.250445Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"For: A dataset for synthetic speech detection","venue":null,"work_id":"d7d39cdd-b5e5-4634-96a9-7d550ada5df9","year":2019},"citing_paper":{"arxiv_id":"2401.09512","last_updated":"2026-05-18T13:28:38Z","snapshot_observed_at":"2026-08-16T07:24:58.122087Z","submitted_at":"2024-01-17T15:09:02Z","title":"MLAAD: The Multi-Language Audio Anti-Spoofing Dataset","version":10},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-24T04:34:59.205522Z"},"links":{"citing_paper":"/paper/2401.09512"},"observation_digest":"sha256:4e3c6af3d4fa7a8774b1e53be76c66a8165074e10ac28521339e312d31fcea97","observation_id":"da66dd67-5b05-488f-8889-80bb71bbdb9a","resolution":{"observed_at":"2026-05-24T04:36:01.396819Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Spoofed training data for speech spoofing countermeasure can be efficiently created using neural vocoders","venue":null,"work_id":"1332edf2-c0e3-4f8c-bdc5-fbb662f05c28","year":2023},"citing_paper":{"arxiv_id":"2401.09512","last_updated":"2026-05-18T13:28:38Z","snapshot_observed_at":"2026-08-16T07:24:58.122087Z","submitted_at":"2024-01-17T15:09:02Z","title":"MLAAD: The Multi-Language Audio Anti-Spoofing Dataset","version":10},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-24T04:34:59.205522Z"},"links":{"citing_paper":"/paper/2401.09512"},"observation_digest":"sha256:b727b0f7c728e11c5a9c91476600876008d4ec088ec600e8d3f77a54f63d04a6","observation_id":"7edac77c-0ba5-4f99-a008-4fe79acea42f","resolution":{"observed_at":"2026-05-24T04:36:01.305100Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The partialspoof database and countermeasures for the detection of short fake speech segments embedded in an utterance","venue":null,"work_id":"d220ea35-315d-47a3-8440-9be7558acfd0","year":2023},"citing_paper":{"arxiv_id":"2401.09512","last_updated":"2026-05-18T13:28:38Z","snapshot_observed_at":"2026-08-16T07:24:58.122087Z","submitted_at":"2024-01-17T15:09:02Z","title":"MLAAD: The Multi-Language Audio Anti-Spoofing Dataset","version":10},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-24T04:34:59.205522Z"},"links":{"citing_paper":"/paper/2401.09512"},"observation_digest":"sha256:77d7de7eee85ebf62f22ca9304cecf39e01c097f5d8ca6f23181602add821142","observation_id":"bb6de2f1-419d-466a-8ee8-27ceb5988475","resolution":{"observed_at":"2026-05-24T04:36:01.391418Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"WaveFake: A Data Set to Facilitate Audio Deepfake Detection","venue":null,"work_id":"48abfec7-15ef-405b-bc82-14dcd9501307","year":2021},"citing_paper":{"arxiv_id":"2401.09512","last_updated":"2026-05-18T13:28:38Z","snapshot_observed_at":"2026-08-16T07:24:58.122087Z","submitted_at":"2024-01-17T15:09:02Z","title":"MLAAD: The Multi-Language Audio Anti-Spoofing Dataset","version":10},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-24T04:34:59.205522Z"},"links":{"citing_paper":"/paper/2401.09512"},"observation_digest":"sha256:b7f963ccfc58adb45f649fb56a668c60d7b5d9c24dcac0c91641e12e93e645b8","observation_id":"df4cab78-f5f5-4fa5-8fe5-492765d66d63","resolution":{"observed_at":"2026-05-24T04:36:01.320866Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Add 2022: the first audio deep synthesis detection challenge","venue":null,"work_id":"20185afd-abef-433b-a38f-6f8d78a48369","year":2022},"citing_paper":{"arxiv_id":"2401.09512","last_updated":"2026-05-18T13:28:38Z","snapshot_observed_at":"2026-08-16T07:24:58.122087Z","submitted_at":"2024-01-17T15:09:02Z","title":"MLAAD: The Multi-Language Audio Anti-Spoofing Dataset","version":10},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-24T04:34:59.205522Z"},"links":{"citing_paper":"/paper/2401.09512"},"observation_digest":"sha256:e88a98a9b095b7ff162e9be1b037067bb95de3d3b86b007e756f1436e49decac","observation_id":"734a6cbf-8b76-4b6f-a831-367676425568","resolution":{"observed_at":"2026-05-24T04:36:01.242637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13774","last_updated":"2023-05-23T07:42:52Z","snapshot_observed_at":"2026-08-20T03:00:07.655339Z","submitted_at":"2023-05-23T07:42:52Z","title":"ADD 2023: the Second Audio Deepfake Detection Challenge","version":1},"cited_work":{"arxiv_id":"2305.13774","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.13774","snapshot_observed_at":"2026-07-04T02:19:22.853731Z","title":"ADD 2023: the second audio Deepfake detection challenge","venue":null,"work_id":"808718ce-d91e-44e4-9c14-ac5308ad8428","year":2023},"citing_paper":{"arxiv_id":"2401.09512","last_updated":"2026-05-18T13:28:38Z","snapshot_observed_at":"2026-08-16T07:24:58.122087Z","submitted_at":"2024-01-17T15:09:02Z","title":"MLAAD: The Multi-Language Audio Anti-Spoofing Dataset","version":10},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-24T04:34:59.205522Z"},"links":{"cited_paper":"/paper/2305.13774","citing_paper":"/paper/2401.09512"},"observation_digest":"sha256:f88df2e90361ef78e4a14d76633acbddfc9763017a53215d01cf515141aa0d7e","observation_id":"e75da851-9130-412a-ac3d-1ef7c52da45d","resolution":{"observed_at":"2026-05-24T04:36:00.831007Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fmfcc-a: a challenging mandarin dataset for synthetic speech detection","venue":null,"work_id":"c6fa9e64-0b5a-4f54-ac63-e789aa944654","year":2021},"citing_paper":{"arxiv_id":"2401.09512","last_updated":"2026-05-18T13:28:38Z","snapshot_observed_at":"2026-08-16T07:24:58.122087Z","submitted_at":"2024-01-17T15:09:02Z","title":"MLAAD: The Multi-Language Audio Anti-Spoofing Dataset","version":10},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-24T04:34:59.205522Z"},"links":{"citing_paper":"/paper/2401.09512"},"observation_digest":"sha256:a17b5f528e3588febf33ec7a1fa5bdcabbdf9085d01bd24f81779205518b82fb","observation_id":"1e28c01f-001c-42d2-8225-59248138be8d","resolution":{"observed_at":"2026-05-24T04:36:01.258437Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Half- Truth: A Partially Fake Audio Detection Dataset","venue":null,"work_id":"6002ac3f-3268-4240-be87-c9f972f30363","year":2021},"citing_paper":{"arxiv_id":"2401.09512","last_updated":"2026-05-18T13:28:38Z","snapshot_observed_at":"2026-08-16T07:24:58.122087Z","submitted_at":"2024-01-17T15:09:02Z","title":"MLAAD: The Multi-Language Audio Anti-Spoofing Dataset","version":10},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-24T04:34:59.205522Z"},"links":{"citing_paper":"/paper/2401.09512"},"observation_digest":"sha256:f0b57785a184651394e5c407ef84cc48e2354a4b7bb5f038bba4066718ff9537","observation_id":"f047005f-a1cf-49bd-b811-9015c5807473","resolution":{"observed_at":"2026-05-24T04:36:01.238881Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12308","last_updated":"2023-07-18T04:21:40Z","snapshot_observed_at":"2026-08-19T15:04:28.249143Z","submitted_at":"2022-07-12T13:27:21Z","title":"CFAD: A Chinese Dataset for Fake Audio Detection","version":3},"cited_work":{"arxiv_id":"2207.12308","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2207.12308","snapshot_observed_at":"2026-07-03T07:57:44.365497Z","title":"Fad: A chinese dataset for fake audio detection","venue":null,"work_id":"2e691f55-f148-426b-974c-c0d852999859","year":2022},"citing_paper":{"arxiv_id":"2401.09512","last_updated":"2026-05-18T13:28:38Z","snapshot_observed_at":"2026-08-16T07:24:58.122087Z","submitted_at":"2024-01-17T15:09:02Z","title":"MLAAD: The Multi-Language Audio Anti-Spoofing Dataset","version":10},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-24T04:34:59.205522Z"},"links":{"cited_paper":"/paper/2207.12308","citing_paper":"/paper/2401.09512"},"observation_digest":"sha256:85cd791517ac409c19766b2f8a368e98324b1bb0059faecee93a07225ae36c77","observation_id":"bee55c41-7d68-4d44-9251-ee43c6e692c7","resolution":{"observed_at":"2026-05-24T04:36:00.874109Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Natural tts synthesis by conditioning wavenet on mel spectrogram predictions","venue":null,"work_id":"d1b0c5a0-5e76-4903-ab46-f102fba05aa8","year":2018},"citing_paper":{"arxiv_id":"2401.09512","last_updated":"2026-05-18T13:28:38Z","snapshot_observed_at":"2026-08-16T07:24:58.122087Z","submitted_at":"2024-01-17T15:09:02Z","title":"MLAAD: The Multi-Language Audio Anti-Spoofing Dataset","version":10},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-24T04:34:59.205522Z"},"links":{"citing_paper":"/paper/2401.09512"},"observation_digest":"sha256:af5cedcb95e303b42c08a97f712c327f955bd8436b40e2953bda69df277f2693","observation_id":"0bbc82a5-d936-446f-9c4d-0bb4789ae5da","resolution":{"observed_at":"2026-05-24T04:36:01.324820Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"SpeedySpeech: Efficient Neural Speech Syn- thesis","venue":null,"work_id":"543886a8-33d9-44b2-89b7-25a68bc93bc8","year":2020},"citing_paper":{"arxiv_id":"2401.09512","last_updated":"2026-05-18T13:28:38Z","snapshot_observed_at":"2026-08-16T07:24:58.122087Z","submitted_at":"2024-01-17T15:09:02Z","title":"MLAAD: The Multi-Language Audio Anti-Spoofing Dataset","version":10},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-24T04:34:59.205522Z"},"links":{"citing_paper":"/paper/2401.09512"},"observation_digest":"sha256:9162dc93ec7f1bf3a4a97e0bfabc55a61415689e86b1adbd771d69fa7a487156","observation_id":"39c9da88-a51f-41c6-9509-d6c0e4cf19ff","resolution":{"observed_at":"2026-05-24T04:36:01.254269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.07243","last_updated":"2023-05-23T21:41:54Z","snapshot_observed_at":"2026-08-20T12:18:44.930688Z","submitted_at":"2023-05-12T04:19:49Z","title":"Better speech synthesis through scaling","version":2},"cited_work":{"arxiv_id":"2305.07243","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.07243","snapshot_observed_at":"2026-07-04T20:10:07.252358Z","title":"Better speech synthesis through scaling","venue":null,"work_id":"a8efef68-fbc1-4c78-88e5-a8d8ad2945a4","year":2023},"citing_paper":{"arxiv_id":"2401.09512","last_updated":"2026-05-18T13:28:38Z","snapshot_observed_at":"2026-08-16T07:24:58.122087Z","submitted_at":"2024-01-17T15:09:02Z","title":"MLAAD: The Multi-Language Audio Anti-Spoofing Dataset","version":10},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-24T04:34:59.205522Z"},"links":{"cited_paper":"/paper/2305.07243","citing_paper":"/paper/2401.09512"},"observation_digest":"sha256:85da6e134ac08e94a8f375c85170fd35dcceb92b0bb0deb2e57f246e0480c152","observation_id":"fbece7d4-c200-461f-a8ae-be65655fed70","resolution":{"observed_at":"2026-05-24T04:36:00.894144Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Xtts: Open model release announcement","venue":null,"work_id":"d5e603ed-0889-4007-9ab7-655ed6ac45d3","year":2024},"citing_paper":{"arxiv_id":"2401.09512","last_updated":"2026-05-18T13:28:38Z","snapshot_observed_at":"2026-08-16T07:24:58.122087Z","submitted_at":"2024-01-17T15:09:02Z","title":"MLAAD: The Multi-Language Audio Anti-Spoofing Dataset","version":10},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-24T04:34:59.205522Z"},"links":{"citing_paper":"/paper/2401.09512"},"observation_digest":"sha256:6e4c60f84d09b315e7b02530b63526bee354e3a490ed506144772ac096099a23","observation_id":"f8b2ad1e-6fe9-40d6-a176-5329bd97e9a0","resolution":{"observed_at":"2026-05-24T04:36:01.246433Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Conditional variational autoencoder with adversarial learning for end-to-end text-to-speech","venue":null,"work_id":"e51e92b1-288d-4ee4-bea0-dd3c2b6383c7","year":2021},"citing_paper":{"arxiv_id":"2401.09512","last_updated":"2026-05-18T13:28:38Z","snapshot_observed_at":"2026-08-16T07:24:58.122087Z","submitted_at":"2024-01-17T15:09:02Z","title":"MLAAD: The Multi-Language Audio Anti-Spoofing Dataset","version":10},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-24T04:34:59.205522Z"},"links":{"citing_paper":"/paper/2401.09512"},"observation_digest":"sha256:a6949faf0253577dccaeff9c4c0dd674f40645ca10baf2edfc86a9f1cf04c819","observation_id":"bf00bf1b-b98e-4da4-a89b-aa7708579698","resolution":{"observed_at":"2026-05-24T04:36:01.269262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fastpitch: Parallel text-to-speech with pitch prediction","venue":null,"work_id":"92c14d63-d473-4878-b10d-9ad77a550f93","year":2021},"citing_paper":{"arxiv_id":"2401.09512","last_updated":"2026-05-18T13:28:38Z","snapshot_observed_at":"2026-08-16T07:24:58.122087Z","submitted_at":"2024-01-17T15:09:02Z","title":"MLAAD: The Multi-Language Audio Anti-Spoofing Dataset","version":10},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-24T04:34:59.205522Z"},"links":{"citing_paper":"/paper/2401.09512"},"observation_digest":"sha256:73a2766dcf59cf9cab21966f497d74f8bbf1d3cdd749cbec6f8d313c6edc1242","observation_id":"dbc1406e-ae90-45fa-aa89-b722b9da07b1","resolution":{"observed_at":"2026-05-24T04:36:01.317162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Effective use of variational embedding capacity in expressive end-to-end speech synthesis","venue":null,"work_id":"6accdda7-78a1-4b13-bd97-8c1073ac8031","year":2019},"citing_paper":{"arxiv_id":"2401.09512","last_updated":"2026-05-18T13:28:38Z","snapshot_observed_at":"2026-08-16T07:24:58.122087Z","submitted_at":"2024-01-17T15:09:02Z","title":"MLAAD: The Multi-Language Audio Anti-Spoofing Dataset","version":10},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-24T04:34:59.205522Z"},"links":{"citing_paper":"/paper/2401.09512"},"observation_digest":"sha256:34a5b292abc993ed0d6dd50a67cba77390ce337367450c79750c64a4890f65f2","observation_id":"eaae201b-619b-4fe0-8077-08fd0f6b7c93","resolution":{"observed_at":"2026-05-24T04:36:01.328393Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.02418","last_updated":"2023-04-30T17:46:06Z","snapshot_observed_at":"2026-08-16T22:28:42.450232Z","submitted_at":"2021-12-04T19:50:29Z","title":"YourTTS: Towards Zero-Shot Multi-Speaker TTS and Zero-Shot Voice Conversion for everyone","version":4},"cited_work":{"arxiv_id":"2112.02418","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2112.02418","snapshot_observed_at":"2026-07-04T07:39:39.535781Z","title":"YourTTS: Towards Zero-Shot Multi-Speaker TTS and Zero-Shot V oice Conversion for everyone","venue":null,"work_id":"2a022c10-c28c-45b8-bf9c-b201166223aa","year":2023},"citing_paper":{"arxiv_id":"2401.09512","last_updated":"2026-05-18T13:28:38Z","snapshot_observed_at":"2026-08-16T07:24:58.122087Z","submitted_at":"2024-01-17T15:09:02Z","title":"MLAAD: The Multi-Language Audio Anti-Spoofing Dataset","version":10},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-24T04:34:59.205522Z"},"links":{"cited_paper":"/paper/2112.02418","citing_paper":"/paper/2401.09512"},"observation_digest":"sha256:29bdcace613890ef94df80f2a91277375b506f6234a2b07317fdf2e30d24d890","observation_id":"125bd68c-e8c0-4fe7-a11f-2c1873b6e3ab","resolution":{"observed_at":"2026-05-24T04:36:00.854283Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Glow-tts: A generative flow for text-to-speech via monotonic alignment search","venue":null,"work_id":"ae8859af-dec9-49c7-9d04-ccdc8ef2229d","year":2020},"citing_paper":{"arxiv_id":"2401.09512","last_updated":"2026-05-18T13:28:38Z","snapshot_observed_at":"2026-08-16T07:24:58.122087Z","submitted_at":"2024-01-17T15:09:02Z","title":"MLAAD: The Multi-Language Audio Anti-Spoofing Dataset","version":10},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-24T04:34:59.205522Z"},"links":{"citing_paper":"/paper/2401.09512"},"observation_digest":"sha256:36203fe67ab498bb909bb4cb4677b6afd0be5ebbae35f9564107ec54189fcd32","observation_id":"c30981bb-b268-4bc8-89bf-4c0dd35f9b7d","resolution":{"observed_at":"2026-05-24T04:36:01.229014Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"OverFlow: Putting flows on top of neural transducers for better TTS","venue":null,"work_id":"04b25aab-72f6-4b1e-b410-8c6fe3de374a","year":2023},"citing_paper":{"arxiv_id":"2401.09512","last_updated":"2026-05-18T13:28:38Z","snapshot_observed_at":"2026-08-16T07:24:58.122087Z","submitted_at":"2024-01-17T15:09:02Z","title":"MLAAD: The Multi-Language Audio Anti-Spoofing Dataset","version":10},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-24T04:34:59.205522Z"},"links":{"citing_paper":"/paper/2401.09512"},"observation_digest":"sha256:e039275809f8a845e95056ed72a33799c8fdb95a23e176fbe1a59d8051dd697e","observation_id":"dd3391bc-78ac-43b9-aa45-04b0481fa3f2","resolution":{"observed_at":"2026-05-24T04:36:01.285247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"StarGANv2-VC: A Diverse, Unsupervised, Non-Parallel Framework for Natural-Sounding V oice Conversion","venue":null,"work_id":"eca83ef1-7ba7-4992-bd95-57079618fe58","year":2021},"citing_paper":{"arxiv_id":"2401.09512","last_updated":"2026-05-18T13:28:38Z","snapshot_observed_at":"2026-08-16T07:24:58.122087Z","submitted_at":"2024-01-17T15:09:02Z","title":"MLAAD: The Multi-Language Audio Anti-Spoofing Dataset","version":10},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-24T04:34:59.205522Z"},"links":{"citing_paper":"/paper/2401.09512"},"observation_digest":"sha256:54d8c1ce1fc3e5ea40fa86bc7b9b8b21c27c829af060781c2ac302416c440892","observation_id":"f320e7aa-8cc8-4c3b-aac3-75aba94e2b8a","resolution":{"observed_at":"2026-05-24T04:36:01.221083Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Freevc: Towards high-quality text-free one-shot voice conversion","venue":null,"work_id":"68ca29b1-7eb3-4ddb-b8b7-a9f5bdc54202","year":2023},"citing_paper":{"arxiv_id":"2401.09512","last_updated":"2026-05-18T13:28:38Z","snapshot_observed_at":"2026-08-16T07:24:58.122087Z","submitted_at":"2024-01-17T15:09:02Z","title":"MLAAD: The Multi-Language Audio Anti-Spoofing Dataset","version":10},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-24T04:34:59.205522Z"},"links":{"citing_paper":"/paper/2401.09512"},"observation_digest":"sha256:2a79c45afdcd5029886637a7812e46825f04dff663a54b463604d509f792cdc1","observation_id":"56af64e4-d0a4-46f5-90a5-87e87516aa9f","resolution":{"observed_at":"2026-05-24T04:36:01.273330Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21437/interspeech.2018-1456","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ESPnet: End-to-end speech processing toolkit","venue":null,"work_id":"9e751e2f-538a-401e-9530-676a7e8d6aeb","year":2018},"citing_paper":{"arxiv_id":"2401.09512","last_updated":"2026-05-18T13:28:38Z","snapshot_observed_at":"2026-08-16T07:24:58.122087Z","submitted_at":"2024-01-17T15:09:02Z","title":"MLAAD: The Multi-Language Audio Anti-Spoofing Dataset","version":10},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-24T04:34:59.205522Z"},"links":{"citing_paper":"/paper/2401.09512"},"observation_digest":"sha256:8155eac5c7e03db3801791770d605d170f80222c50d323c259b9a92a66e2543b","observation_id":"088f2db2-d047-4f62-b26f-086a53167e65","resolution":{"observed_at":"2026-05-24T04:36:00.678898Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Coqui TTS","venue":null,"work_id":"e111b768-e680-432b-8a1e-f0165847c4a3","year":2021},"citing_paper":{"arxiv_id":"2401.09512","last_updated":"2026-05-18T13:28:38Z","snapshot_observed_at":"2026-08-16T07:24:58.122087Z","submitted_at":"2024-01-17T15:09:02Z","title":"MLAAD: The Multi-Language Audio Anti-Spoofing Dataset","version":10},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-24T04:34:59.205522Z"},"links":{"citing_paper":"/paper/2401.09512"},"observation_digest":"sha256:a47f4ab0108fd6bf86587b625ea3a0aec32ba9d58464a712d8554372ce4b84d6","observation_id":"8feba14f-523d-4890-94ba-8001c402b0e3","resolution":{"observed_at":"2026-05-24T04:36:01.225032Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"SpeechBrain","venue":null,"work_id":"639c2d68-3163-4606-8de8-1e38a106a680","year":null},"citing_paper":{"arxiv_id":"2401.09512","last_updated":"2026-05-18T13:28:38Z","snapshot_observed_at":"2026-08-16T07:24:58.122087Z","submitted_at":"2024-01-17T15:09:02Z","title":"MLAAD: The Multi-Language Audio Anti-Spoofing Dataset","version":10},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-24T04:34:59.205522Z"},"links":{"citing_paper":"/paper/2401.09512"},"observation_digest":"sha256:3f9e38af44f12079ba459e6201351d15ef6d28a3dbb83e84bd632dcffcd84eaa","observation_id":"f62a56db-64e8-4e89-93b1-f5e653391eb3","resolution":{"observed_at":"2026-05-24T04:36:01.281659Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Transformers: State-of-the-Art Natural Language Processing","venue":null,"work_id":"478872c2-d086-4dce-9bc4-d115445e4dff","year":2020},"citing_paper":{"arxiv_id":"2401.09512","last_updated":"2026-05-18T13:28:38Z","snapshot_observed_at":"2026-08-16T07:24:58.122087Z","submitted_at":"2024-01-17T15:09:02Z","title":"MLAAD: The Multi-Language Audio Anti-Spoofing Dataset","version":10},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-24T04:34:59.205522Z"},"links":{"citing_paper":"/paper/2401.09512"},"observation_digest":"sha256:67347ca39712437bab8d3913cdd47f0fc914a68d0e460648e1d673501ab36553","observation_id":"7cc98168-cfc5-4ffa-bcf2-f8a15d2fbb96","resolution":{"observed_at":"2026-05-24T04:36:01.212812Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The lj speech dataset","venue":null,"work_id":"683f3649-5212-4df9-8763-0ffbaef63df9","year":2017},"citing_paper":{"arxiv_id":"2401.09512","last_updated":"2026-05-18T13:28:38Z","snapshot_observed_at":"2026-08-16T07:24:58.122087Z","submitted_at":"2024-01-17T15:09:02Z","title":"MLAAD: The Multi-Language Audio Anti-Spoofing Dataset","version":10},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-24T04:34:59.205522Z"},"links":{"citing_paper":"/paper/2401.09512"},"observation_digest":"sha256:cb156a9529bf7bf5ed293aef6400e5fb07276299ad9561ddaa82efb58901e3d3","observation_id":"91083d5d-6957-4100-aa54-0ae8c47fca49","resolution":{"observed_at":"2026-05-24T04:36:01.313220Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The blizzard challenge 2013","venue":null,"work_id":"a74b9823-7e61-474a-b08a-27747c10d982","year":2013},"citing_paper":{"arxiv_id":"2401.09512","last_updated":"2026-05-18T13:28:38Z","snapshot_observed_at":"2026-08-16T07:24:58.122087Z","submitted_at":"2024-01-17T15:09:02Z","title":"MLAAD: The Multi-Language Audio Anti-Spoofing Dataset","version":10},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-24T04:34:59.205522Z"},"links":{"citing_paper":"/paper/2401.09512"},"observation_digest":"sha256:67f1a0e711c3f40c7f89698cbfcee737a06b587099400a1c5e0be8e57c0a0743","observation_id":"65b8a90b-e07b-4949-a068-3d50499c48a1","resolution":{"observed_at":"2026-05-24T04:36:01.308683Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"CSS10: A Collection of Single Speaker Speech Datasets for 10 Languages","venue":null,"work_id":"86287f02-505d-4d9b-a0c8-853f0200e48c","year":2019},"citing_paper":{"arxiv_id":"2401.09512","last_updated":"2026-05-18T13:28:38Z","snapshot_observed_at":"2026-08-16T07:24:58.122087Z","submitted_at":"2024-01-17T15:09:02Z","title":"MLAAD: The Multi-Language Audio Anti-Spoofing Dataset","version":10},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-24T04:34:59.205522Z"},"links":{"citing_paper":"/paper/2401.09512"},"observation_digest":"sha256:c324154a98354f2bd858447f19076cc2c3236f45a37f01d51bc847676e640ad1","observation_id":"c4a0207f-eb34-4792-89a7-d814591b67f0","resolution":{"observed_at":"2026-05-24T04:36:01.208673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Common voice: A massively-multilingual speech corpus","venue":null,"work_id":"f855b6b7-4c2a-48a9-94e3-a73050ad28a4","year":2020},"citing_paper":{"arxiv_id":"2401.09512","last_updated":"2026-05-18T13:28:38Z","snapshot_observed_at":"2026-08-16T07:24:58.122087Z","submitted_at":"2024-01-17T15:09:02Z","title":"MLAAD: The Multi-Language Audio Anti-Spoofing Dataset","version":10},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-24T04:34:59.205522Z"},"links":{"citing_paper":"/paper/2401.09512"},"observation_digest":"sha256:5a0f841f182e8faf8a520824e3211c30d817a0c2d5107d9fed0379816f32dec2","observation_id":"4aef2621-42d3-4438-922b-61d49c88e414","resolution":{"observed_at":"2026-05-24T04:36:01.216369Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Thorsten-voice dataset 2022.10","venue":null,"work_id":"bfdf637b-8a12-480d-bc31-c738e393e879","year":2022},"citing_paper":{"arxiv_id":"2401.09512","last_updated":"2026-05-18T13:28:38Z","snapshot_observed_at":"2026-08-16T07:24:58.122087Z","submitted_at":"2024-01-17T15:09:02Z","title":"MLAAD: The Multi-Language Audio Anti-Spoofing Dataset","version":10},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-24T04:34:59.205522Z"},"links":{"citing_paper":"/paper/2401.09512"},"observation_digest":"sha256:c85c101cae54e9128622614eab64f79f35f2b07774927354b1dc6b71e26870b9","observation_id":"e89228ad-4698-4db7-9d96-6d6c333d2587","resolution":{"observed_at":"2026-05-24T04:36:01.232999Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.5281/zenodo.7265581","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Available: https://doi.org/10.5281/zenodo.7265581","venue":"Zenodo (CERN European Organization for Nuclear Research)","work_id":"44677e74-6dd9-4b44-8108-2bdb356e0fa2","year":null},"citing_paper":{"arxiv_id":"2401.09512","last_updated":"2026-05-18T13:28:38Z","snapshot_observed_at":"2026-08-16T07:24:58.122087Z","submitted_at":"2024-01-17T15:09:02Z","title":"MLAAD: The Multi-Language Audio Anti-Spoofing Dataset","version":10},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-24T04:34:59.205522Z"},"links":{"citing_paper":"/paper/2401.09512"},"observation_digest":"sha256:a677649d2c3bcfbf3c47a4219991ba9a18e48d9355e660b64be93ae02ea92bbc","observation_id":"952fa394-f99e-4945-922e-a4da31cf48e3","resolution":{"observed_at":"2026-05-24T04:36:00.683400Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Github - dioco-group/jenny-tts-dataset: A high-quality, varied ˜30hr voice dataset suitable for training a tts model","venue":null,"work_id":"e39cc635-4978-43ae-a50e-92a843f3b728","year":2024},"citing_paper":{"arxiv_id":"2401.09512","last_updated":"2026-05-18T13:28:38Z","snapshot_observed_at":"2026-08-16T07:24:58.122087Z","submitted_at":"2024-01-17T15:09:02Z","title":"MLAAD: The Multi-Language Audio Anti-Spoofing Dataset","version":10},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-24T04:34:59.205522Z"},"links":{"citing_paper":"/paper/2401.09512"},"observation_digest":"sha256:ed26d552968babe711a3b436c5e9dc7453ddebe49970af3107603baa9689f67e","observation_id":"b165b99f-c259-4e64-b943-dc0be9d2f43a","resolution":{"observed_at":"2026-05-24T04:36:01.293597Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"End-to-end anti-spoofing with rawnet2","venue":null,"work_id":"152557f5-4e92-4c56-a6a6-0684b807ba46","year":2021},"citing_paper":{"arxiv_id":"2401.09512","last_updated":"2026-05-18T13:28:38Z","snapshot_observed_at":"2026-08-16T07:24:58.122087Z","submitted_at":"2024-01-17T15:09:02Z","title":"MLAAD: The Multi-Language Audio Anti-Spoofing Dataset","version":10},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-24T04:34:59.205522Z"},"links":{"citing_paper":"/paper/2401.09512"},"observation_digest":"sha256:577658f735a12228f95587c68c834285bda40fa87f44b3dcf2d7dd87ff1ed714","observation_id":"908440f2-94d1-421c-8627-953441e50a69","resolution":{"observed_at":"2026-05-24T04:36:01.332805Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.12710","last_updated":"2021-08-23T17:06:53Z","snapshot_observed_at":"2026-08-20T20:04:00.871491Z","submitted_at":"2021-07-27T10:11:41Z","title":"End-to-End Spectro-Temporal Graph Attention Networks for Speaker Verification Anti-Spoofing and Speech Deepfake Detection","version":2},"cited_work":{"arxiv_id":"2107.12710","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2107.12710","snapshot_observed_at":"2026-07-01T12:45:44.604031Z","title":"End-to-end spectro-temporal graph attention networks for speaker ver- ification anti-spoofing and speech deepfake detection","venue":null,"work_id":"f458dbe8-3343-4267-8685-09cd6109bdea","year":2021},"citing_paper":{"arxiv_id":"2401.09512","last_updated":"2026-05-18T13:28:38Z","snapshot_observed_at":"2026-08-16T07:24:58.122087Z","submitted_at":"2024-01-17T15:09:02Z","title":"MLAAD: The Multi-Language Audio Anti-Spoofing Dataset","version":10},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-24T04:34:59.205522Z"},"links":{"cited_paper":"/paper/2107.12710","citing_paper":"/paper/2401.09512"},"observation_digest":"sha256:d9b7874ee8d95698cab1710bfdbdabb2d8908875c3c2e1139de606d64da3916a","observation_id":"003e6d05-7ce2-48a7-be3f-e58cb7362464","resolution":{"observed_at":"2026-05-24T04:36:00.836441Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Aasist: Audio anti-spoofing using integrated spectro-temporal graph attention networks","venue":null,"work_id":"fd585d08-ea3d-46b2-84eb-53e74cd67ef7","year":2022},"citing_paper":{"arxiv_id":"2401.09512","last_updated":"2026-05-18T13:28:38Z","snapshot_observed_at":"2026-08-16T07:24:58.122087Z","submitted_at":"2024-01-17T15:09:02Z","title":"MLAAD: The Multi-Language Audio Anti-Spoofing Dataset","version":10},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-24T04:34:59.205522Z"},"links":{"citing_paper":"/paper/2401.09512"},"observation_digest":"sha256:7104a18228ff48eb63746ebce11d0392d1390b5a56a0772f5f428a1bbe91fa06","observation_id":"8d101a1f-a42b-477a-8979-ba5488cb4030","resolution":{"observed_at":"2026-05-24T04:36:01.336251Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.12212","last_updated":"2021-10-06T14:07:22Z","snapshot_observed_at":"2026-08-16T18:07:29.755037Z","submitted_at":"2021-07-26T13:36:14Z","title":"Raw Differentiable Architecture Search for Speech Deepfake and Spoofing Detection","version":2},"cited_work":{"arxiv_id":"2107.12212","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2107.12212","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Raw differentiable architecture search for speech deepfake and spoofing detection","venue":null,"work_id":"f6fbfa52-0792-4d66-90bf-d57d8fc937c0","year":2021},"citing_paper":{"arxiv_id":"2401.09512","last_updated":"2026-05-18T13:28:38Z","snapshot_observed_at":"2026-08-16T07:24:58.122087Z","submitted_at":"2024-01-17T15:09:02Z","title":"MLAAD: The Multi-Language Audio Anti-Spoofing Dataset","version":10},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-24T04:34:59.205522Z"},"links":{"cited_paper":"/paper/2107.12212","citing_paper":"/paper/2401.09512"},"observation_digest":"sha256:5161b612765be863476fd148e648f83504884399abf23808ba981fe47f67e1d7","observation_id":"01a941be-295e-4c94-8135-e3d9d40784a8","resolution":{"observed_at":"2026-05-24T04:36:00.869438Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A comparison of features for synthetic speech detection","venue":null,"work_id":"a080592a-00b3-4f87-a391-8ffbb428183e","year":2015},"citing_paper":{"arxiv_id":"2401.09512","last_updated":"2026-05-18T13:28:38Z","snapshot_observed_at":"2026-08-16T07:24:58.122087Z","submitted_at":"2024-01-17T15:09:02Z","title":"MLAAD: The Multi-Language Audio Anti-Spoofing Dataset","version":10},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-24T04:34:59.205522Z"},"links":{"citing_paper":"/paper/2401.09512"},"observation_digest":"sha256:7e374649cea4414e931f67808c2415765fd26b3a25b87b5ff7536b02e165539d","observation_id":"e19941af-a19f-45d8-8b6e-d11b01546982","resolution":{"observed_at":"2026-05-24T04:36:01.355920Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A Comparative Study on Recent Neural Spoofing Countermeasures for Synthetic Speech Detection","venue":null,"work_id":"16178319-df28-4a9a-ae88-5ebadf7c2adf","year":2021},"citing_paper":{"arxiv_id":"2401.09512","last_updated":"2026-05-18T13:28:38Z","snapshot_observed_at":"2026-08-16T07:24:58.122087Z","submitted_at":"2024-01-17T15:09:02Z","title":"MLAAD: The Multi-Language Audio Anti-Spoofing Dataset","version":10},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-24T04:34:59.205522Z"},"links":{"citing_paper":"/paper/2401.09512"},"observation_digest":"sha256:205bca493ef299c91ab2d3ba749b0a76fe23f1f06e4fd4e47ea9bd4bcaf28d0a","observation_id":"f434da85-68bc-4937-ab16-af4adc32bf8c","resolution":{"observed_at":"2026-05-24T04:36:01.386695Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mesonet: a compact facial video forgery detection network","venue":null,"work_id":"d06dc7d3-b1b4-4816-81bb-3737d71d54b6","year":2018},"citing_paper":{"arxiv_id":"2401.09512","last_updated":"2026-05-18T13:28:38Z","snapshot_observed_at":"2026-08-16T07:24:58.122087Z","submitted_at":"2024-01-17T15:09:02Z","title":"MLAAD: The Multi-Language Audio Anti-Spoofing Dataset","version":10},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-24T04:34:59.205522Z"},"links":{"citing_paper":"/paper/2401.09512"},"observation_digest":"sha256:b9c8c2fac69e5fa8c2256f7fa1a168fddd35615ed1f864d6bd57fde116b5c819","observation_id":"91180a9f-8384-4910-a5d2-2c74d7f15630","resolution":{"observed_at":"2026-05-24T04:36:01.289194Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Specrnet: Towards faster and more ac- cessible audio deepfake detection","venue":null,"work_id":"d7771e2b-4feb-424f-a03f-e9ffeca0e8d0","year":2022},"citing_paper":{"arxiv_id":"2401.09512","last_updated":"2026-05-18T13:28:38Z","snapshot_observed_at":"2026-08-16T07:24:58.122087Z","submitted_at":"2024-01-17T15:09:02Z","title":"MLAAD: The Multi-Language Audio Anti-Spoofing Dataset","version":10},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-24T04:34:59.205522Z"},"links":{"citing_paper":"/paper/2401.09512"},"observation_digest":"sha256:b54bf1f80a06088516e5115b65416efa71395d97a18dac403f0bc1c85a172440","observation_id":"3e0fb543-0652-4e72-9261-d3ffa21525a3","resolution":{"observed_at":"2026-05-24T04:36:01.448660Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fake speech detection using residual network with transformer encoder","venue":null,"work_id":"c6a401ef-aee5-4017-93e3-c98b3f033b26","year":2021},"citing_paper":{"arxiv_id":"2401.09512","last_updated":"2026-05-18T13:28:38Z","snapshot_observed_at":"2026-08-16T07:24:58.122087Z","submitted_at":"2024-01-17T15:09:02Z","title":"MLAAD: The Multi-Language Audio Anti-Spoofing Dataset","version":10},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-24T04:34:59.205522Z"},"links":{"citing_paper":"/paper/2401.09512"},"observation_digest":"sha256:f57dbe5234cbb30350c9fc377564f044284802c13b39e87d7766275527372219","observation_id":"60d218e1-d25c-4aba-bc66-426d20574b6d","resolution":{"observed_at":"2026-05-24T04:36:01.297200Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.12233","last_updated":"2022-02-28T11:50:57Z","snapshot_observed_at":"2026-08-16T17:18:51.871221Z","submitted_at":"2022-02-24T17:55:00Z","title":"Automatic speaker verification spoofing and deepfake detection using wav2vec 2.0 and data augmentation","version":2},"cited_work":{"arxiv_id":"2202.12233","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2202.12233","snapshot_observed_at":"2026-07-03T03:47:35.550760Z","title":"Automatic speaker verification spoofing and deepfake detection using wav2vec 2.0 and data augmentation","venue":null,"work_id":"4453706c-8f12-4bd1-ad86-c9af276c509e","year":2022},"citing_paper":{"arxiv_id":"2401.09512","last_updated":"2026-05-18T13:28:38Z","snapshot_observed_at":"2026-08-16T07:24:58.122087Z","submitted_at":"2024-01-17T15:09:02Z","title":"MLAAD: The Multi-Language Audio Anti-Spoofing Dataset","version":10},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-24T04:34:59.205522Z"},"links":{"cited_paper":"/paper/2202.12233","citing_paper":"/paper/2401.09512"},"observation_digest":"sha256:af16d0514db8c1826f29e63af50637ad1844c495bca7f67418bb5d14998e070c","observation_id":"809b3c36-137a-456d-ac08-d8e9e2dcac40","resolution":{"observed_at":"2026-05-24T04:36:00.864687Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The vicomtech audio deepfake detection system based on wav2vec2 for the 2022 add challenge","venue":null,"work_id":"c749565f-4591-41ab-88de-8777d51aa87f","year":2022},"citing_paper":{"arxiv_id":"2401.09512","last_updated":"2026-05-18T13:28:38Z","snapshot_observed_at":"2026-08-16T07:24:58.122087Z","submitted_at":"2024-01-17T15:09:02Z","title":"MLAAD: The Multi-Language Audio Anti-Spoofing Dataset","version":10},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-24T04:34:59.205522Z"},"links":{"citing_paper":"/paper/2401.09512"},"observation_digest":"sha256:38c0b8360dde9f500077007edb16ab06465f3b56ef5eb7a88618c6d8913c415c","observation_id":"62cc9a17-1e1d-4a8b-868b-d302098802f2","resolution":{"observed_at":"2026-05-24T04:36:01.301332Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Improved DeepFake Detection Using Whisper Features","venue":null,"work_id":"7027a770-9833-4856-8bdc-c17742cc82df","year":2023},"citing_paper":{"arxiv_id":"2401.09512","last_updated":"2026-05-18T13:28:38Z","snapshot_observed_at":"2026-08-16T07:24:58.122087Z","submitted_at":"2024-01-17T15:09:02Z","title":"MLAAD: The Multi-Language Audio Anti-Spoofing Dataset","version":10},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-24T04:34:59.205522Z"},"links":{"citing_paper":"/paper/2401.09512"},"observation_digest":"sha256:436c39f70210ad97c981157f22722e1bfacf3a6b4da4f6289da549d4329b3292","observation_id":"a39b0edf-1ca7-49e6-a60c-5fa8c0c94e5f","resolution":{"observed_at":"2026-05-24T04:36:01.277420Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Complex-valued neural networks for voice anti-spoofing","venue":null,"work_id":"75cba306-d46a-40d5-873e-eac7a01f8ac3","year":2023},"citing_paper":{"arxiv_id":"2401.09512","last_updated":"2026-05-18T13:28:38Z","snapshot_observed_at":"2026-08-16T07:24:58.122087Z","submitted_at":"2024-01-17T15:09:02Z","title":"MLAAD: The Multi-Language Audio Anti-Spoofing Dataset","version":10},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-24T04:34:59.205522Z"},"links":{"citing_paper":"/paper/2401.09512"},"observation_digest":"sha256:d58a08af1f241ddd66c255280b66b589ceaa70b40165f75304bb396272c87138","observation_id":"a7162198-a7a4-40da-9b90-f657223c90ec","resolution":{"observed_at":"2026-05-24T04:36:01.379484Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15308","last_updated":"2024-07-29T06:24:07Z","snapshot_observed_at":"2026-08-16T14:40:19.410223Z","submitted_at":"2023-11-26T14:17:51Z","title":"AV-Deepfake1M: A Large-Scale LLM-Driven Audio-Visual Deepfake Dataset","version":2},"cited_work":{"arxiv_id":"2311.15308","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.15308","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Av-deepfake1m: A large-scale llm-driven audio-visual deepfake dataset","venue":null,"work_id":"b7634f93-27dc-4d33-950b-75eb0d883418","year":2023},"citing_paper":{"arxiv_id":"2401.09512","last_updated":"2026-05-18T13:28:38Z","snapshot_observed_at":"2026-08-16T07:24:58.122087Z","submitted_at":"2024-01-17T15:09:02Z","title":"MLAAD: The Multi-Language Audio Anti-Spoofing Dataset","version":10},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-24T04:34:59.205522Z"},"links":{"cited_paper":"/paper/2311.15308","citing_paper":"/paper/2401.09512"},"observation_digest":"sha256:f799ca3594e62079f668f7b485eeb3d1c6ed7073b4231fb75c5f814a33c9ee54","observation_id":"7a8e2b82-3e3f-4017-9bcc-f0f6ddf4772b","resolution":{"observed_at":"2026-05-24T04:36:00.879524Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"nmt · pypi","venue":null,"work_id":"3371bb53-63a9-4354-a735-3c0e7972bdee","year":2024},"citing_paper":{"arxiv_id":"2401.09512","last_updated":"2026-05-18T13:28:38Z","snapshot_observed_at":"2026-08-16T07:24:58.122087Z","submitted_at":"2024-01-17T15:09:02Z","title":"MLAAD: The Multi-Language Audio Anti-Spoofing Dataset","version":10},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-24T04:34:59.205522Z"},"links":{"citing_paper":"/paper/2401.09512"},"observation_digest":"sha256:f5ea827806470d4f351a75034bc62a4bf204479872d0c6d2501aeb1421e1a098","observation_id":"e3eda89a-ac07-4bb2-bb50-a753cfc2b385","resolution":{"observed_at":"2026-05-24T04:36:01.467976Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Signal estimation from modified short-time fourier transform","venue":null,"work_id":"540669ce-bcd3-4e35-a75a-321d94a98eb8","year":1984},"citing_paper":{"arxiv_id":"2401.09512","last_updated":"2026-05-18T13:28:38Z","snapshot_observed_at":"2026-08-16T07:24:58.122087Z","submitted_at":"2024-01-17T15:09:02Z","title":"MLAAD: The Multi-Language Audio Anti-Spoofing Dataset","version":10},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-24T04:34:59.205522Z"},"links":{"citing_paper":"/paper/2401.09512"},"observation_digest":"sha256:de8a22c33fd241845c5c96e81791df29745f389d2d9ab30d78c17bd792eb59a5","observation_id":"17ac8818-e7e4-41e5-873e-8850664dc161","resolution":{"observed_at":"2026-05-24T04:36:01.471654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13516","last_updated":"2023-05-22T22:09:41Z","snapshot_observed_at":"2026-08-19T02:48:06.947821Z","submitted_at":"2023-05-22T22:09:41Z","title":"Scaling Speech Technology to 1,000+ Languages","version":1},"cited_work":{"arxiv_id":"2305.13516","doi":"10.48550/arxiv.2305.13516","metadata_source":"arxiv_reference","pith_arxiv_id":"2305.13516","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling speech technology to 1,000+ languages","venue":"arXiv (Cornell University)","work_id":"d85c5ee3-0310-48b2-b8c8-a24601ce26c1","year":2023},"citing_paper":{"arxiv_id":"2401.09512","last_updated":"2026-05-18T13:28:38Z","snapshot_observed_at":"2026-08-16T07:24:58.122087Z","submitted_at":"2024-01-17T15:09:02Z","title":"MLAAD: The Multi-Language Audio Anti-Spoofing Dataset","version":10},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-24T04:34:59.205522Z"},"links":{"cited_paper":"/paper/2305.13516","citing_paper":"/paper/2401.09512"},"observation_digest":"sha256:9d183ec84ded53ef859c5f51122591b79f7feba08922a2ef61e944be9a71df34","observation_id":"e3d61ba3-faed-4c9c-a3ef-41e280caaed2","resolution":{"observed_at":"2026-05-24T04:36:00.889425Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sam: Accenture non-binary voice","venue":null,"work_id":"086499f6-c17a-4bb9-aabc-b45745821119","year":2023},"citing_paper":{"arxiv_id":"2401.09512","last_updated":"2026-05-18T13:28:38Z","snapshot_observed_at":"2026-08-16T07:24:58.122087Z","submitted_at":"2024-01-17T15:09:02Z","title":"MLAAD: The Multi-Language Audio Anti-Spoofing Dataset","version":10},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-24T04:34:59.205522Z"},"links":{"citing_paper":"/paper/2401.09512"},"observation_digest":"sha256:83b05bbbc859977a2f464312cfdbb4603dbc467eba09a5410028ad78df97b61a","observation_id":"90df24ff-00f8-4043-ac03-6c94bbf65ebd","resolution":{"observed_at":"2026-05-24T04:36:01.474893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Automatic speaker verification spoofing and deepfake detection using wav2vec 2.0 and data augmentation","venue":null,"work_id":"93b4d258-8c95-4901-8611-3c06670326a1","year":2022},"citing_paper":{"arxiv_id":"2401.09512","last_updated":"2026-05-18T13:28:38Z","snapshot_observed_at":"2026-08-16T07:24:58.122087Z","submitted_at":"2024-01-17T15:09:02Z","title":"MLAAD: The Multi-Language Audio Anti-Spoofing Dataset","version":10},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-24T04:34:59.205522Z"},"links":{"citing_paper":"/paper/2401.09512"},"observation_digest":"sha256:2404991557b82126bfca37c4ce27be1b2626a5ff0f891e2582b469cc91d7a3b8","observation_id":"fd2a5bba-acec-4ddc-a96d-6252c3af590a","resolution":{"observed_at":"2026-05-24T04:36:01.427686Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A study on data augmentation of reverberant speech for robust speech recognition","venue":null,"work_id":"b9e94546-03c1-4820-aec7-97d31539ecc4","year":2017},"citing_paper":{"arxiv_id":"2401.09512","last_updated":"2026-05-18T13:28:38Z","snapshot_observed_at":"2026-08-16T07:24:58.122087Z","submitted_at":"2024-01-17T15:09:02Z","title":"MLAAD: The Multi-Language Audio Anti-Spoofing Dataset","version":10},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-24T04:34:59.205522Z"},"links":{"citing_paper":"/paper/2401.09512"},"observation_digest":"sha256:d1a6c1492b7d622fd71fe66c71ddef33210eb01886fb0220ffd4bd96be7379f9","observation_id":"e318fcfe-0062-47e8-864a-84e44adb46e6","resolution":{"observed_at":"2026-05-24T04:36:01.454310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"3373.28063","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T14:25:02.439749Z","title":"ESC: Dataset for Environmental Sound Classification","venue":null,"work_id":"f0670cd6-59a8-48d2-94ce-45595e02c599","year":2015},"citing_paper":{"arxiv_id":"2401.09512","last_updated":"2026-05-18T13:28:38Z","snapshot_observed_at":"2026-08-16T07:24:58.122087Z","submitted_at":"2024-01-17T15:09:02Z","title":"MLAAD: The Multi-Language Audio Anti-Spoofing Dataset","version":10},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-24T04:34:59.205522Z"},"links":{"citing_paper":"/paper/2401.09512"},"observation_digest":"sha256:0130d4b11d49ae660f9643cd5ea0bb239226810d80bde0cd3d2bd41f8ca0d132","observation_id":"956fcf37-fdfa-40ba-a178-90e0f7c0eb84","resolution":{"observed_at":"2026-05-24T04:36:00.824662Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Free music archive - instrumental","venue":null,"work_id":"15637f32-2012-4cd8-b49c-af65b132bcae","year":2023},"citing_paper":{"arxiv_id":"2401.09512","last_updated":"2026-05-18T13:28:38Z","snapshot_observed_at":"2026-08-16T07:24:58.122087Z","submitted_at":"2024-01-17T15:09:02Z","title":"MLAAD: The Multi-Language Audio Anti-Spoofing Dataset","version":10},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-24T04:34:59.205522Z"},"links":{"citing_paper":"/paper/2401.09512"},"observation_digest":"sha256:e2eff0069ffcda050bc26718cf71c34cf38dc95bd314872aab0ab4a6c7f655ad","observation_id":"4300f20a-3534-4979-a9d2-c83b92c67b10","resolution":{"observed_at":"2026-05-24T04:36:01.459331Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1510.08484","last_updated":"2015-10-28T20:59:04Z","snapshot_observed_at":"2026-08-18T07:31:38.105834Z","submitted_at":"2015-10-28T20:59:04Z","title":"MUSAN: A Music, Speech, and Noise Corpus","version":1},"cited_work":{"arxiv_id":"1510.08484","doi":null,"metadata_source":"pith","pith_arxiv_id":"1510.08484","snapshot_observed_at":"2026-07-10T12:57:07.598373Z","title":"MUSAN: A Music, Speech, and Noise Corpus","venue":"cs.SD","work_id":"7c604702-578b-4f91-9cc6-f8aa7dbe6d26","year":2015},"citing_paper":{"arxiv_id":"2401.09512","last_updated":"2026-05-18T13:28:38Z","snapshot_observed_at":"2026-08-16T07:24:58.122087Z","submitted_at":"2024-01-17T15:09:02Z","title":"MLAAD: The Multi-Language Audio Anti-Spoofing Dataset","version":10},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-24T04:34:59.205522Z"},"links":{"cited_paper":"/paper/1510.08484","citing_paper":"/paper/2401.09512"},"observation_digest":"sha256:d979e571d6b2814366eaf9a5ff850e8a199bef1ec71e8462957dcb5dde74a7f6","observation_id":"83fb749a-5154-4c42-89d9-b5cce88982f2","resolution":{"observed_at":"2026-05-24T04:36:00.884639Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.12914","last_updated":"2021-09-28T09:06:33Z","snapshot_observed_at":"2026-08-16T18:15:08.735723Z","submitted_at":"2021-06-23T08:28:59Z","title":"Speech is Silver, Silence is Golden: What do ASVspoof-trained Models Really Learn?","version":4},"cited_work":{"arxiv_id":"2106.12914","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2106.12914","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Speech is silver, silence is golden: What do ASVspoof-trained models really learn?","venue":null,"work_id":"e113186f-49e4-4a5b-a25c-63c2cf1a386b","year":2021},"citing_paper":{"arxiv_id":"2401.09512","last_updated":"2026-05-18T13:28:38Z","snapshot_observed_at":"2026-08-16T07:24:58.122087Z","submitted_at":"2024-01-17T15:09:02Z","title":"MLAAD: The Multi-Language Audio Anti-Spoofing Dataset","version":10},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-24T04:34:59.205522Z"},"links":{"cited_paper":"/paper/2106.12914","citing_paper":"/paper/2401.09512"},"observation_digest":"sha256:fe98929b78ad216c84069308c13ed09be69d85b0f5d553a0f8ba47bd3881ff35","observation_id":"b5146934-6c6f-4c46-971e-98b7caa7daa7","resolution":{"observed_at":"2026-05-24T04:36:00.859108Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"openai/whisper-large · hugging face","venue":null,"work_id":"abc2188d-94aa-4bc4-a6d9-307038f9a9ad","year":2024},"citing_paper":{"arxiv_id":"2401.09512","last_updated":"2026-05-18T13:28:38Z","snapshot_observed_at":"2026-08-16T07:24:58.122087Z","submitted_at":"2024-01-17T15:09:02Z","title":"MLAAD: The Multi-Language Audio Anti-Spoofing Dataset","version":10},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-24T04:34:59.205522Z"},"links":{"citing_paper":"/paper/2401.09512"},"observation_digest":"sha256:e8da7504c1cbb6fae19b75705a0ff68e2317148785eed1810ad7cb4bd0746d7e","observation_id":"c3064aa4-5103-44c6-9861-8142d5fdd547","resolution":{"observed_at":"2026-05-24T04:36:01.421257Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Binary codes capable of correcting deletions, insertions, and reversals","venue":null,"work_id":"ae0d60fc-4431-438c-ac3a-25c1d1a40395","year":1966},"citing_paper":{"arxiv_id":"2401.09512","last_updated":"2026-05-18T13:28:38Z","snapshot_observed_at":"2026-08-16T07:24:58.122087Z","submitted_at":"2024-01-17T15:09:02Z","title":"MLAAD: The Multi-Language Audio Anti-Spoofing Dataset","version":10},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-24T04:34:59.205522Z"},"links":{"citing_paper":"/paper/2401.09512"},"observation_digest":"sha256:dd2b12430c72a14f891a3f422e42636cab48f0e3345ec468cd078a738c372ca5","observation_id":"227833c9-197f-45f1-b662-c8dd14e1b99c","resolution":{"observed_at":"2026-05-24T04:36:01.410534Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2401.09512","last_updated":"2026-05-18T13:28:38Z","latest_version":10,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-16T07:24:58.122087Z","submitted_at":"2024-01-17T15:09:02Z","title":"MLAAD: The Multi-Language Audio Anti-Spoofing Dataset"},"reference_resolution":{"displayed":71,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":0,"verified_exact":15,"verified_fuzzy":54},"total_outbound_references":71},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 71 of 71 outbound references and 12 inbound Pith citation observations for arXiv:2401.09512."}