{"as_of":"2026-08-04T15:36:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9424ea5ab507123810ff1458a87aedd984ebc1c970bc3f8309a5a42f18645c8b","coverage":[{"denominator":60,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":60,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-09T19:27:59.124425Z","state":"measured"},{"denominator":61,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":61,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T01:12:30.668116Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-07-31T23:37:37.390633Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.00251","snapshot_observed_at":"2026-08-02T01:12:30.668116Z","title":"Alethia: A foun- dational encoder for voice deepfakes,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14753","last_updated":"2026-07-16T09:38:45Z","snapshot_observed_at":"2026-08-02T01:12:29.525481Z","submitted_at":"2026-07-16T09:38:45Z","title":"Large Audio Language Models for Spoofing-Aware Speaker Verification","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T01:12:30.668116Z"},"links":{"cited_paper":"/paper/2605.00251","citing_paper":"/paper/2607.14753"},"observation_digest":"sha256:576d8cb1814e2e56e641740e3cc93e00c7ea9ffefb8aef8aeca1f23062b121c8","observation_id":"31613142-6035-4ac0-af9c-3f340d2897df","resolution":{"observed_at":"2026-08-02T01:12:30.668116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2605.00251/citation-record","integrity":"/paper/2605.00251/integrity","json":"/paper/2605.00251/citation-record.json","paper":"/paper/2605.00251"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.09985","last_updated":"2025-06-11T17:57:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-11T17:57:09Z","title":"V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning","version":1},"cited_work":{"arxiv_id":"2506.09985","doi":"10.48550/arxiv.2506.09985","metadata_source":"pith","pith_arxiv_id":"2506.09985","snapshot_observed_at":"2026-07-11T02:27:49.493432Z","title":"V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning","venue":"cs.AI","work_id":"a9c28401-f16a-4933-89f0-788e2f94e52b","year":2025},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-07-31T23:37:37.390633Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"cited_paper":"/paper/2506.09985","citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:0b898d2cea204993fc1da492dc5bc6c3831816f19721d3520b3265e5d2d550e1","observation_id":"641850ff-482e-422d-952e-a48fbe8847fa","resolution":{"observed_at":"2026-05-11T15:41:33.204364Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-03T19:08:37.559938+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T19:08:37.559938+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Transferring audio deepfake detection capabil- ity across languages","venue":null,"work_id":"336ca3c7-2fd0-48c3-b188-2d806443e183","year":2023},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-07-31T23:37:37.390633Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:2c675ed3df565bd60784218fed034e88cf48b73414a31abea38fdc532ba62308","observation_id":"9d1c0c32-53fb-4c50-9523-59b0afd95d6c","resolution":{"observed_at":"2026-05-25T21:26:15.440406Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11337","last_updated":"2024-02-17T17:08:16Z","snapshot_observed_at":"2026-07-06T17:31:37.574049Z","submitted_at":"2024-02-17T17:08:16Z","title":"Learning by Reconstruction Produces Uninformative Features For Perception","version":1},"cited_work":{"arxiv_id":"2402.11337","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.11337","snapshot_observed_at":"2026-06-28T19:12:34.907582Z","title":"Learning by reconstruction produces uninformative features for perception","venue":null,"work_id":"d4867e4d-548c-404c-8a82-645e2813010f","year":2024},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-07-31T23:37:37.390633Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"cited_paper":"/paper/2402.11337","citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:e1e09005a78086377b85ab775b2de9801ccfea93318cae10e0da3eed90ab92d0","observation_id":"7bbd27c9-76fe-4fe9-b43c-b64d3365c9ba","resolution":{"observed_at":"2026-05-11T15:41:33.295146Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"9f0fd219-dec6-4f5a-af8e-b99c6efe3a3b","year":2025},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-07-31T23:37:37.390633Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:0d228ede6734cd40765adefb92d192fa71512ebb3175291b751586721dcc249b","observation_id":"48e383b4-6414-4ccd-9d0e-b2937a6c30c6","resolution":{"observed_at":"2026-05-25T21:26:15.437118Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.02857","last_updated":"2026-05-27T00:37:53Z","snapshot_observed_at":"2026-07-06T20:46:41.601428Z","submitted_at":"2025-03-04T18:33:22Z","title":"Deepfake-Eval-2024: A Multi-Modal In-the-Wild Benchmark of Deepfakes Circulated in 2024","version":5},"cited_work":{"arxiv_id":"2503.02857","doi":"10.1007/s44267-025-00100-2","metadata_source":"pith","pith_arxiv_id":"2503.02857","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Deepfake-Eval-2024: A Multi-Modal In-the-Wild Benchmark of Deepfakes Circulated in 2024","venue":"cs.CV","work_id":"d1bf3332-d565-448c-8175-e624da877d13","year":2025},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-07-31T23:37:37.390633Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"cited_paper":"/paper/2503.02857","citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:a34af3382adc86b8b569c7eeba236b8a4f227f10c90141e0b6ff85c5f8b1f2ec","observation_id":"620aedc2-c342-4ea4-9c12-2a2fd41977c0","resolution":{"observed_at":"2026-05-28T02:04:08.212974Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"CoLLD: Contrastive layer-to-layer distil- lation for compressing multilingual pre-trained speech encoders","venue":null,"work_id":"e40d81c3-2faa-4feb-981d-56d4f7e4f676","year":2024},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-07-31T23:37:37.390633Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:4f90a62ade209bee206c48d8a3b5fbd7a624c19840fcc0147b355da4f262c88f","observation_id":"a0a9749f-0886-48cb-9feb-c36f9e79e3d5","resolution":{"observed_at":"2026-05-25T21:26:15.443193Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-02T22:59:21.722084Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"cited_work":{"arxiv_id":"2506.18843","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.18843","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Usad: Universal speech and audio representation via distillation.arXiv preprint arXiv:2506.18843","venue":null,"work_id":"7b36bf96-cc69-440d-93c0-c978e50e271f","year":null},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-07-31T23:37:37.390633Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"cited_paper":"/paper/2506.18843","citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:4591676f82f30be5f63feaa275b11cfd4b733e916be21bb35a0a18b4f7623f19","observation_id":"b3c39e7d-ebbd-417a-bfa5-7ab57dcca0a4","resolution":{"observed_at":"2026-05-11T15:41:33.721376Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Demir¨ors, M., Ozbayoglu, A","venue":null,"work_id":"03b8c757-cb32-4f47-9354-07acca324267","year":2026},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-07-31T23:37:37.390633Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:de763ff27172f36978f9539bdd79ef8d994f9379f8154438a6ca8dcda6d48fe4","observation_id":"959fdc7d-61b5-4113-81c0-59a1e5dfdb88","resolution":{"observed_at":"2026-05-25T21:26:15.427302Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Trident of poseidon: A generalized approach for detecting deepfake voices","venue":null,"work_id":"9b65de53-4fb3-435f-ae9c-7e06e2d2fe03","year":2024},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-07-31T23:37:37.390633Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:f5b9d0fa498bc78f81cf0ba1c7b8da65caaae0eb7eb0c67d135a104e6bb50053","observation_id":"ec839b8c-84cd-4a80-8dd8-28bb7f05535e","resolution":{"observed_at":"2026-05-25T21:26:15.422498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"T., Manrique, R., and Nunes, B","venue":null,"work_id":"cca3d4b3-ca2e-4f80-8106-71be63e115dc","year":2023},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-07-31T23:37:37.390633Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:0e61021657b7fee32ff57881fe50aa2b373f3df1672e21cabf085f6c560981f8","observation_id":"cd5b9cba-767b-4ba0-b146-8cd0edf47473","resolution":{"observed_at":"2026-05-25T21:26:15.424855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05674","last_updated":"2025-05-22T06:13:29Z","snapshot_observed_at":"2026-07-06T20:33:24.850279Z","submitted_at":"2025-02-08T19:49:09Z","title":"ShiftySpeech: A Large-Scale Synthetic Speech Dataset with Distribution Shifts","version":4},"cited_work":{"arxiv_id":"2502.05674","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.05674","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"L., Garc´ıa-Perera, L","venue":null,"work_id":"2ff9b0ca-10b4-4564-a421-a9026d28996a","year":null},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-07-31T23:37:37.390633Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"cited_paper":"/paper/2502.05674","citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:143cc017dadf57dde1d1c7a03a3b940a05f30feaa3d582a4a089bbcef0b994f6","observation_id":"265e0227-7795-4c2a-a43c-233ec782d76d","resolution":{"observed_at":"2026-05-11T15:41:31.105348Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.21090","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T21:37:25.495539Z","title":"Post-training for deepfake speech de- tection.arXiv preprint arXiv:2506.21090","venue":null,"work_id":"f6d62c6a-5d65-47ef-8b15-44fa1a619d08","year":2025},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-07-31T23:37:37.390633Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:ae4fa55a6efc3aaeb81924a9dcae39b8a696ef4f3946cd94d93375fa3065d03a","observation_id":"7640aea8-f2a2-4703-9bdc-21922a0b421c","resolution":{"observed_at":"2026-05-11T15:41:35.515762Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.03365","last_updated":"2019-07-02T04:42:17Z","snapshot_observed_at":"2026-07-06T07:44:19.552249Z","submitted_at":"2019-04-06T05:42:18Z","title":"ReMASC: Realistic Replay Attack Corpus for Voice Controlled Systems","version":2},"cited_work":{"arxiv_id":"1904.03365","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1904.03365","snapshot_observed_at":"2026-07-04T23:45:46.948480Z","title":"ReMASC: Realistic replay attack corpus for voice controlled systems.arXiv preprint arXiv:1904.03365","venue":null,"work_id":"60b48f9d-652e-412f-aa31-4ae94021b601","year":1904},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-07-31T23:37:37.390633Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"cited_paper":"/paper/1904.03365","citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:e2e1b97633a315d8a28d255847c93a356cfc6ecb57e9cfb672660fee40850b3b","observation_id":"7933d3d9-79f2-4a52-ab0a-670c1d26897c","resolution":{"observed_at":"2026-07-04T23:45:46.948480Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"R., Pimentel, A., Avila, A","venue":null,"work_id":"88151186-bcd7-4e06-b911-bc7e5179ae3c","year":2023},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-07-31T23:37:37.390633Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:49ed1326a489291726dce6f48d78f1da2905ad41af3b93d0d867ad41eebd556e","observation_id":"bfa253f2-f954-4410-b27e-8284d9e9d1f1","resolution":{"observed_at":"2026-05-25T21:26:15.434718Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08654","last_updated":"2024-03-13T16:08:59Z","snapshot_observed_at":"2026-07-06T17:44:04.908253Z","submitted_at":"2024-03-13T16:08:59Z","title":"An Efficient End-to-End Approach to Noise Invariant Speech Features via Multi-Task Learning","version":1},"cited_work":{"arxiv_id":"2403.08654","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.08654","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"R., Pimentel, A., Avila, A","venue":null,"work_id":"194d8ed5-30ad-444d-abb3-534df7e77114","year":null},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-07-31T23:37:37.390633Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"cited_paper":"/paper/2403.08654","citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:53147f744010b8c3ee2ca2e01e9c6eef91408982a1a1c7fe2325dda46d3c0bee","observation_id":"ffd426c4-a3c5-4a1e-b09c-22283fe12c2b","resolution":{"observed_at":"2026-05-11T15:41:30.569243Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.04161","last_updated":"2025-09-04T12:35:10Z","snapshot_observed_at":"2026-08-04T05:30:24.632942Z","submitted_at":"2025-09-04T12:35:10Z","title":"Wav2DF-TSL: Two-stage Learning with Efficient Pre-training and Hierarchical Experts Fusion for Robust Audio Deepfake Detection","version":1},"cited_work":{"arxiv_id":"2509.04161","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.04161","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Wav2df-tsl: Two-stage learning with efficient pre-training and hierarchical experts fu- sion for robust audio deepfake detection.arXiv preprint arXiv:2509.04161","venue":null,"work_id":"04b6ab03-a7bc-4da9-aca3-a64f27de4cfc","year":null},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-07-31T23:37:37.390633Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"cited_paper":"/paper/2509.04161","citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:d8b3debf8172209b5aff265d181b5bb415bf97879978674f0fb8f963a27cd028","observation_id":"e60da123-abcf-460e-a92e-e8dbb05497e8","resolution":{"observed_at":"2026-05-11T15:41:32.948686Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14396","last_updated":"2025-07-07T03:39:01Z","snapshot_observed_at":"2026-07-06T21:43:31.210133Z","submitted_at":"2025-06-17T10:51:34Z","title":"Manipulated Regions Localization For Partially Deepfake Audio: A Survey","version":2},"cited_work":{"arxiv_id":"2506.14396","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.14396","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Manipulated re- gions localization for partially deepfake audio: A survey","venue":null,"work_id":"2ab79b19-ec58-462d-84c4-ce48ff23715e","year":null},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-07-31T23:37:37.390633Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"cited_paper":"/paper/2506.14396","citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:a32ca98685b4b58066b26c18bf6f1f0628452e55cca57e1d083afe67a1a19a86","observation_id":"22f2ad38-e67a-41a7-a0b6-3621a7587aca","resolution":{"observed_at":"2026-05-11T15:41:34.085537Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21463","last_updated":"2025-07-29T03:06:31Z","snapshot_observed_at":"2026-07-06T22:04:20.800847Z","submitted_at":"2025-07-29T03:06:31Z","title":"SpeechFake: A Large-Scale Multilingual Speech Deepfake Dataset Incorporating Cutting-Edge Generation Methods","version":1},"cited_work":{"arxiv_id":"2507.21463","doi":"10.48550/arxiv.2507.21463","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.21463","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Huzaifah, M., Lin, G., Liu, T., Sailor, H","venue":null,"work_id":"e10143f5-361c-43b2-85da-e76ca786ecd0","year":null},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-07-31T23:37:37.390633Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"cited_paper":"/paper/2507.21463","citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:5726563e34fc6dc58c2ab05f310af3382f9adb94df92c8ab78cba7d6b961de60","observation_id":"bf7a20ec-4abf-4975-8772-f9a17653c7c5","resolution":{"observed_at":"2026-05-11T15:41:35.077427Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.20067","last_updated":"2025-02-27T13:16:41Z","snapshot_observed_at":"2026-07-06T20:43:40.848236Z","submitted_at":"2025-02-27T13:16:41Z","title":"UniCodec: Unified Audio Codec with Single Domain-Adaptive Codebook","version":1},"cited_work":{"arxiv_id":"2502.20067","doi":"10.48550/arxiv.2502.20067","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.20067","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"UniCodec: Unified audio codec with single domain-adaptive codebook.arXiv preprint arXiv:2502.20067","venue":null,"work_id":"41222bdc-a942-4ca8-9628-d042985b8e0d","year":2025},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-07-31T23:37:37.390633Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"cited_paper":"/paper/2502.20067","citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:1f72a44a5b93cc76df4271e69a505783a29c8a410d4bb299a9ee653e1abf1f34","observation_id":"7aec9a64-e12e-4b43-b87a-772f5749caa8","resolution":{"observed_at":"2026-05-11T15:41:32.535227Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"S., et al","venue":null,"work_id":"6678012c-682c-4635-a557-d372517bb17d","year":2025},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-07-31T23:37:37.390633Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:aaf635d5961b70b0d5d89974a9ad5f5d2721e3ea435c0a68cd62803c21d57c68","observation_id":"004b232c-6971-43c3-8c4b-3c74bd0f50e9","resolution":{"observed_at":"2026-05-25T21:26:15.414891Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08016","last_updated":"2024-07-10T19:49:10Z","snapshot_observed_at":"2026-07-06T18:44:28.967181Z","submitted_at":"2024-07-10T19:49:10Z","title":"Source Tracing of Audio Deepfake Systems","version":1},"cited_work":{"arxiv_id":"2407.08016","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.08016","snapshot_observed_at":"2026-07-03T07:47:44.708019Z","title":"Source tracing of audio deepfake systems","venue":null,"work_id":"ab9795f8-fca2-420e-9096-d96bec567ca0","year":2024},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-07-31T23:37:37.390633Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"cited_paper":"/paper/2407.08016","citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:e405a2490e2a417e373290c99739a4adb26387b13b786d992774abc2fb83dcf4","observation_id":"95430da1-9ed2-4b28-8b7d-cc3f1eab6971","resolution":{"observed_at":"2026-05-11T15:41:33.959367Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19014","last_updated":"2025-06-26T17:21:45Z","snapshot_observed_at":"2026-08-01T18:01:54.371336Z","submitted_at":"2025-06-23T18:10:06Z","title":"IndieFake Dataset: A Benchmark Dataset for Audio Deepfake Detection","version":2},"cited_work":{"arxiv_id":"2506.19014","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.19014","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"IndieFake dataset: A benchmark dataset for audio deepfake detection.arXiv preprint arXiv:2506.19014","venue":null,"work_id":"afca12d7-47ba-4015-9df9-3c928ea57dfc","year":null},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-07-31T23:37:37.390633Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"cited_paper":"/paper/2506.19014","citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:70c977232defe31a7591701a74a923037f4a0efdd2c56638c1ad3d7ff96ae798","observation_id":"db490d85-3db8-45f7-a3c5-e367e0dc8cf0","resolution":{"observed_at":"2026-05-11T15:41:32.825794Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A survey on speech deepfake detection.ACM Computing Surveys, 57 (7):1–38, 2025a","venue":null,"work_id":"20b49222-dbc7-41c4-8826-a3120b09143b","year":2024},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-07-31T23:37:37.390633Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:03109e7f20456749f0ec2dcdd2e47d951602e898c89966b9c9e283b321878371","observation_id":"c21f4f4c-7721-4560-a33d-f6a9edee7702","resolution":{"observed_at":"2026-05-25T21:26:15.420026Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.17577","last_updated":"2026-07-05T21:12:59Z","snapshot_observed_at":"2026-07-09T23:17:37.168278Z","submitted_at":"2025-03-21T23:21:17Z","title":"Measuring the Robustness of Audio Deepfake Detection under Real-World Corruption","version":2},"cited_work":{"arxiv_id":"2503.17577","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.17577","snapshot_observed_at":"2026-07-07T02:18:24.167264Z","title":"Measuring the ro- bustness of audio deepfake detectors","venue":null,"work_id":"759209bd-fd61-4e75-9eb1-4d1797354c04","year":2025},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-07-31T23:37:37.390633Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"cited_paper":"/paper/2503.17577","citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:bf75d276fd36229e014106fdfd821c9cb948e2228445b558cf35115cbaf4fe40","observation_id":"45bb5d01-2935-453b-8288-39b70abcc2d3","resolution":{"observed_at":"2026-07-07T02:18:24.167264Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":"2210.02747","doi":"10.1038/s41467-024-47656-z","metadata_source":"pith","pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Flow Matching for Generative Modeling","venue":"cs.LG","work_id":"6edb71c4-5d64-40af-a394-9757ea051a36","year":2022},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-07-31T23:37:37.390633Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:3f3c9e2629a194f8f57952440471ebfe95794961ac2cbaa53dbc197d04b9dc92","observation_id":"303860d8-5039-4cbd-a4bf-4b284ebb126e","resolution":{"observed_at":"2026-05-11T15:41:34.564428Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-06-01T22:57:59.860918+00:00","source":"crossref_status_cache"},{"observed_at":"2026-06-01T22:57:59.860918+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.16338","last_updated":"2024-03-25T18:18:40Z","snapshot_observed_at":"2026-07-06T16:38:09.978805Z","submitted_at":"2023-10-25T03:40:50Z","title":"Generative Pre-training for Speech with Flow Matching","version":2},"cited_work":{"arxiv_id":"2310.16338","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.16338","snapshot_observed_at":"2026-07-08T00:04:22.558026Z","title":"H., Le, M., Vyas, A., Shi, B., Tjandra, A., and Hsu, W.-N","venue":"eess.AS","work_id":"5f38b5bc-2b5a-4b19-9cea-17751b76c46b","year":2023},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-07-31T23:37:37.390633Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"cited_paper":"/paper/2310.16338","citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:935fb9956512a294e96a8cfacd7fda2208ba81da20b988ef06968e3dceb75125","observation_id":"54d60b93-9d0e-4c9f-bbf3-47f739e9f73c","resolution":{"observed_at":"2026-05-11T15:41:33.447165Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A., and Chng, E","venue":null,"work_id":"3eb13da9-8155-4508-a36f-df0dbfe7446f","year":2025},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-07-31T23:37:37.390633Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:f8cb71031a02f33f452f0f64d944e83e1594fe8063e8a1bb20aa82b5ad52462e","observation_id":"73407916-7033-4ba0-a8ac-9eefc9445da5","resolution":{"observed_at":"2026-05-25T21:26:15.412803Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23962","last_updated":"2025-05-29T19:32:57Z","snapshot_observed_at":"2026-07-06T21:33:17.306281Z","submitted_at":"2025-05-29T19:32:57Z","title":"Can Emotion Fool Anti-spoofing?","version":1},"cited_work":{"arxiv_id":"2505.23962","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23962","snapshot_observed_at":"2026-06-29T13:33:28.656699Z","title":"R., Naini, A","venue":null,"work_id":"09c82968-b442-4ea1-832e-62e8d16e25bc","year":2025},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-07-31T23:37:37.390633Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"cited_paper":"/paper/2505.23962","citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:0d4a7cea547b383773545c7d337e4685687c66d51531c43d35cc2ec601418573","observation_id":"3ab933b8-abae-4b07-bd9f-47b793255611","resolution":{"observed_at":"2026-05-11T15:41:30.964905Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.10274","doi":"10.48550/arxiv.2506.10274","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Discrete audio tokens: More than a survey!","venue":null,"work_id":"c89ef171-a1ea-49a1-8800-b9d5ef2dc175","year":2025},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-07-31T23:37:37.390633Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:2ad51bcfe36e545e9b407aa70f468a0edd835c261e7a429c3bf26055ae24ced2","observation_id":"14e2efef-894b-4138-b102-c69a60f8db54","resolution":{"observed_at":"2026-05-11T15:41:31.016439Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14862","last_updated":"2025-06-01T04:46:35Z","snapshot_observed_at":"2026-08-04T12:16:17.536370Z","submitted_at":"2025-05-20T19:46:36Z","title":"Replay Attacks Against Audio Deepfake Detection","version":2},"cited_work":{"arxiv_id":"2505.14862","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14862","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"T., Pizzi, K., Wagner, A., and Sperl, P","venue":null,"work_id":"4ba25e4a-3fa2-4c98-901e-aee8f05dac9a","year":null},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-07-31T23:37:37.390633Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"cited_paper":"/paper/2505.14862","citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:0ca5cb0dc05666d75162cfc3969f75d15218436684cf8acfd23ceb9f509308aa","observation_id":"a032c811-d589-4306-a92b-c6326b7389ac","resolution":{"observed_at":"2026-05-11T15:41:34.689109Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.12914","last_updated":"2021-09-28T09:06:33Z","snapshot_observed_at":"2026-07-06T11:22:29.069903Z","submitted_at":"2021-06-23T08:28:59Z","title":"Speech is Silver, Silence is Golden: What do ASVspoof-trained Models Really Learn?","version":4},"cited_work":{"arxiv_id":"2106.12914","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2106.12914","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Speech is silver, silence is golden: What do ASVspoof-trained models really learn?","venue":null,"work_id":"e113186f-49e4-4a5b-a25c-63c2cf1a386b","year":2021},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-07-31T23:37:37.390633Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"cited_paper":"/paper/2106.12914","citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:417c022cf139167caa9564b315006dba41bfeb47495bb1389c809c1edfe49f22","observation_id":"d350a536-2e4e-4c06-976a-453ad440e1ac","resolution":{"observed_at":"2026-05-11T15:41:30.779331Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"H., Vest- man, V ., Todisco, M., Delgado, H., Sahidullah, M., Yam- agishi, J., and Lee, K","venue":null,"work_id":"e6609da1-38fb-45fc-97b9-5ba94282b54b","year":2019},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-07-31T23:37:37.390633Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:37ef5239bb9acd92e29e2988f25c46c85a619af7c98965ce5d88757db0192a60","observation_id":"da469195-752a-499e-ae69-431c1a6f9e30","resolution":{"observed_at":"2026-05-25T21:26:15.417453Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"4863765e-f97a-4c23-8761-4c1dd9f2c1b6","year":2026},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-07-31T23:37:37.390633Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:b3074f5c9a47a6bea1fc6016fc893c362e614530b03f302d3c228bd2cc3939b7","observation_id":"e04cab96-3f1c-47ae-86d1-43213eebbbf4","resolution":{"observed_at":"2026-05-25T21:26:15.432278Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21437/interspeech","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T00:06:37.794172Z","title":"Singing voice graph modeling for singfake detection","venue":null,"work_id":"3c3dc12b-b160-46ce-956c-7d0499a00ba2","year":2019},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-07-31T23:37:37.390633Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:744329836788b1eb38a9f557273489ff76939286160a2688bec34869953be112","observation_id":"abfa597c-d941-4c84-855a-86aa33d20697","resolution":{"observed_at":"2026-05-09T19:30:37.083915Z","resolver_source":"doi","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07254","last_updated":"2024-06-11T13:34:40Z","snapshot_observed_at":"2026-08-03T17:44:26.774885Z","submitted_at":"2024-06-11T13:34:40Z","title":"SRC4VC: Smartphone-Recorded Corpus for Voice Conversion Benchmark","version":1},"cited_work":{"arxiv_id":"2406.07254","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.07254","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"SRC4VC: Smartphone-recorded corpus for voice conversion bench- mark.arXiv preprint arXiv:2406.07254","venue":null,"work_id":"56a50f24-311f-4b29-b7f6-185e12523175","year":null},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-07-31T23:37:37.390633Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"cited_paper":"/paper/2406.07254","citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:1f6025973efa0fa9c3b3612cdf06042947586add67594e49ebf6be1eb3d7477a","observation_id":"73cbbff2-7736-4303-bc6e-4260e8bc823b","resolution":{"observed_at":"2026-05-11T15:41:31.478174Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.00354","last_updated":"2017-10-28T05:28:01Z","snapshot_observed_at":"2026-07-06T06:07:14.578359Z","submitted_at":"2017-10-28T05:28:01Z","title":"JSUT corpus: free large-scale Japanese speech corpus for end-to-end speech synthesis","version":1},"cited_work":{"arxiv_id":"1711.00354","doi":null,"metadata_source":"pith","pith_arxiv_id":"1711.00354","snapshot_observed_at":"2026-07-04T20:30:08.172073Z","title":"JSUT corpus: free large-scale Japanese speech corpus for end-to-end speech synthesis","venue":"cs.CL","work_id":"84194a92-6891-4d35-85e6-56cbc1068f0d","year":2017},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-07-31T23:37:37.390633Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"cited_paper":"/paper/1711.00354","citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:2fd4eb864eee83459918fc9f1ea13785fc89aebe8726fe5b5e707b5fbd4be986","observation_id":"03a1d533-cd23-418f-bf37-2266a05e30a1","resolution":{"observed_at":"2026-05-11T15:41:34.878535Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rawboost: A raw data boosting and augmentation method applied to automatic speaker verification anti-spoofing","venue":null,"work_id":"3d4568dc-4187-4ace-9f3d-7fb01979f28f","year":2022},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-07-31T23:37:37.390633Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:88c56b7f489be9025db74bf8a90856bf687ae60bf1817d2779bf0c5cbb123fca","observation_id":"30c8161e-e91a-4a12-a01a-09b12f8d5b39","resolution":{"observed_at":"2026-05-25T21:26:15.429930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"JMD: Japanese multi-dialect corpus for speech synthesis","venue":null,"work_id":"06318c0a-8d49-4ca3-bd04-24c8ff48d9e5","year":2026},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-07-31T23:37:37.390633Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:cc39daf2f8ad5b5a47004475e771d96b73053b2c0cdfad26c8e07a5ca1bb654a","observation_id":"6e8d119b-6a94-4ae4-b973-2d391c135383","resolution":{"observed_at":"2026-05-25T21:26:15.380956Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.01793","last_updated":"2020-10-05T05:46:10Z","snapshot_observed_at":"2026-07-06T10:01:26.447380Z","submitted_at":"2020-10-05T05:46:10Z","title":"JSSS: free Japanese speech corpus for summarization and simplification","version":1},"cited_work":{"arxiv_id":"2010.01793","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2010.01793","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Takamichi, S., Komachi, M., Tanji, N., and Saruwatari, H","venue":null,"work_id":"a26e67ee-255c-49f2-9a1c-963bd417bf1f","year":2026},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-07-31T23:37:37.390633Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"cited_paper":"/paper/2010.01793","citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:e780935673db7f9b9656758ab13c641ce1e32360a6f40b9ad1d5320bb8b7cbe9","observation_id":"c15dff90-1d12-423e-baa2-7835ea0f993e","resolution":{"observed_at":"2026-05-11T15:41:31.707924Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08739","last_updated":"2024-08-16T13:37:20Z","snapshot_observed_at":"2026-07-06T19:01:32.237848Z","submitted_at":"2024-08-16T13:37:20Z","title":"ASVspoof 5: Crowdsourced Speech Data, Deepfakes, and Adversarial Attacks at Scale","version":1},"cited_work":{"arxiv_id":"2408.08739","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2408.08739","snapshot_observed_at":"2026-07-04T07:49:38.746872Z","title":"ASVspoof 5: Crowdsourced speech data at scale","venue":null,"work_id":"00f9ada8-7f80-449e-95d3-b9f58bfad87a","year":2024},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-07-31T23:37:37.390633Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"cited_paper":"/paper/2408.08739","citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:374f715a6a6e53f7e263c261f9a77e0bb3d8fe4a77c7b5630b0ad624c114b4ef","observation_id":"aa430382-204a-426d-b3c3-a247a26503d3","resolution":{"observed_at":"2026-05-11T15:41:35.345209Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07237","last_updated":"2024-06-11T13:16:09Z","snapshot_observed_at":"2026-07-06T18:28:51.180903Z","submitted_at":"2024-06-11T13:16:09Z","title":"CodecFake: Enhancing Anti-Spoofing Models Against Deepfake Audios from Codec-Based Speech Synthesis Systems","version":1},"cited_work":{"arxiv_id":"2406.07237","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.07237","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Codecfake: Enhanc- ing anti-spoofing models against deepfake audios from codec-based speech synthesis systems.arXiv preprint arXiv:2406.07237","venue":null,"work_id":"57111da5-121e-4c05-b2ea-8c27e3cb15f1","year":null},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-07-31T23:37:37.390633Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"cited_paper":"/paper/2406.07237","citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:dc89d38603be53f31db7d09d433baf38b10c9b42fc90c5f8d6692a005edf3587","observation_id":"756857e7-d796-44cd-9e2a-c0ca260e2418","resolution":{"observed_at":"2026-05-11T15:41:34.406645Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06514","last_updated":"2025-01-11T11:15:58Z","snapshot_observed_at":"2026-07-06T20:19:40.856839Z","submitted_at":"2025-01-11T11:15:58Z","title":"Neural Codec Source Tracing: Toward Comprehensive Attribution in Open-Set Condition","version":1},"cited_work":{"arxiv_id":"2501.06514","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.06514","snapshot_observed_at":"2026-07-03T03:47:35.575637Z","title":"Neural codec source tracing: Toward comprehensive attribution in open-set condition","venue":null,"work_id":"a6761591-576f-42a0-8a32-6a6810469740","year":2025},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-07-31T23:37:37.390633Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"cited_paper":"/paper/2501.06514","citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:8258f7f244f33fa98dceaedff26f1c4c2486f5dd97b798257f9ae03af819e265","observation_id":"0c4fa906-d077-4b9b-9385-a08bd0821cd7","resolution":{"observed_at":"2026-05-11T15:41:32.564889Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.00537","last_updated":"2021-09-01T16:17:31Z","snapshot_observed_at":"2026-07-06T11:43:28.084184Z","submitted_at":"2021-09-01T16:17:31Z","title":"ASVspoof 2021: accelerating progress in spoofed and deepfake speech detection","version":1},"cited_work":{"arxiv_id":"2109.00537","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2109.00537","snapshot_observed_at":"2026-07-04T12:29:52.021660Z","title":"Asvspoof 2021: accelerating progress in spoofed and deepfake speech detection","venue":null,"work_id":"fda9fe31-4af5-4019-b3af-48a642c80b70","year":2021},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-07-31T23:37:37.390633Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"cited_paper":"/paper/2109.00537","citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:47bb417076833c79b5fc8c6283138b92ba289fbe40d37cf38a29a14ad2b78fec","observation_id":"d1459f72-da4a-4128-91d9-16cff074ccbf","resolution":{"observed_at":"2026-05-11T15:41:31.868407Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14006","last_updated":"2024-07-19T03:36:48Z","snapshot_observed_at":"2026-07-06T18:48:49.546589Z","submitted_at":"2024-07-19T03:36:48Z","title":"MSceneSpeech: A Multi-Scene Speech Dataset For Expressive Speech Synthesis","version":1},"cited_work":{"arxiv_id":"2407.14006","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.14006","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mscenespeech: A multi-scene speech dataset for expressive speech synthesis.arXiv preprint arXiv:2407.14006","venue":null,"work_id":"a17daa92-ccaf-4eb6-9045-b4b718462ebf","year":null},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-07-31T23:37:37.390633Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"cited_paper":"/paper/2407.14006","citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:0d2da88fb0cc9e670a2989c350b3319352dd760bbdce060be446ee2a58851b6f","observation_id":"de63e1e9-9ecb-4c86-80fa-fdce143c610e","resolution":{"observed_at":"2026-05-11T15:41:35.279155Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.01051","last_updated":"2021-10-15T22:04:39Z","snapshot_observed_at":"2026-07-06T11:05:55.984799Z","submitted_at":"2021-05-03T17:51:09Z","title":"SUPERB: Speech processing Universal PERformance Benchmark","version":4},"cited_work":{"arxiv_id":"2105.01051","doi":null,"metadata_source":"pith","pith_arxiv_id":"2105.01051","snapshot_observed_at":"2026-07-07T14:53:55.761527Z","title":"arXiv preprint arXiv:2105.01051 , year=","venue":"cs.CL","work_id":"7509ab27-75f2-4438-96ee-f6612ef7e1ce","year":2021},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-07-31T23:37:37.390633Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"cited_paper":"/paper/2105.01051","citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:2349907355fa00444e2e03efccfb7f83b793e79e313085d7f5de10f716983d7a","observation_id":"1d174128-92b1-4b5d-90be-656fa86a94bc","resolution":{"observed_at":"2026-05-11T15:41:33.505238Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.25955","last_updated":"2026-06-22T12:55:18Z","snapshot_observed_at":"2026-08-04T07:27:03.980917Z","submitted_at":"2025-10-29T20:53:12Z","title":"SPEAR: A Unified SSL Framework for Learning Speech and Audio Representations","version":4},"cited_work":{"arxiv_id":"2510.25955","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.25955","snapshot_observed_at":"2026-07-04T17:09:58.602413Z","title":"SPEAR: A unified ssl framework for learning speech and audio representations.arXiv preprint arXiv:2510.25955","venue":"eess.AS","work_id":"6b5f07c2-d4aa-4e2b-8435-70737f1335eb","year":2025},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-07-31T23:37:37.390633Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"cited_paper":"/paper/2510.25955","citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:c7ac4fd3a1534e8d73b57c041e7695aef7ae5a27b51f0040384df7706facc130","observation_id":"9df8832f-7b6d-434f-8990-93f145edc78a","resolution":{"observed_at":"2026-06-23T04:13:40.777736Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.03617","last_updated":"2023-12-16T02:17:19Z","snapshot_observed_at":"2026-07-06T10:57:34.353038Z","submitted_at":"2021-04-08T08:57:13Z","title":"Half-Truth: A Partially Fake Audio Detection Dataset","version":2},"cited_work":{"arxiv_id":"2104.03617","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2104.03617","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Half-truth: A partially fake audio detection dataset.arXiv preprint arXiv:2104.03617","venue":null,"work_id":"efc40a1b-edd5-4f05-b661-68702384f76b","year":null},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-07-31T23:37:37.390633Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"cited_paper":"/paper/2104.03617","citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:09cc060dd31400cf4cb45801e1d516f3afee47045bcf3cd80a86e317b9bd9619","observation_id":"57bc7879-8a94-460a-82e6-a68a2874a80b","resolution":{"observed_at":"2026-05-11T15:41:32.138168Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Singfake: Singing voice deepfake detection","venue":null,"work_id":"35cc0df9-c0c1-4a07-b317-71d916ae77ff","year":2024},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-07-31T23:37:37.390633Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:97f4fb7d39087783984c1af8ac36b73836b5159d60420f0d820efd08eb206ea3","observation_id":"9b8e9469-d344-4d12-b3e9-869e0c2e5a80","resolution":{"observed_at":"2026-05-25T21:26:15.378444Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Audio deepfake detection: What has been achieved and what lies ahead.Sensors (Basel, Switzerland), 25(7):1989","venue":null,"work_id":"ad5b8e05-f318-487b-92bb-a0fd5eeb1b7f","year":1989},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-07-31T23:37:37.390633Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:783ebd82111073a0eaf91d85ee577ffdf05986d52f84146cde70b36e7f2b322b","observation_id":"18842dae-1a5e-48ea-8bba-30bff6ddf03d","resolution":{"observed_at":"2026-05-25T21:26:15.384022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"SVDD 2024: The inaugural singing voice deepfake detection challenge","venue":null,"work_id":"63db02ba-5aeb-4e2c-b9c5-83660d826db8","year":2024},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-07-31T23:37:37.390633Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:45b51bf112f40921f58617ee3efbb6436a320eef63865a440a4cf101e71fcb28","observation_id":"dd743721-520f-4299-b43f-758fd58a2cf5","resolution":{"observed_at":"2026-05-25T21:26:15.387024Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.21597","last_updated":"2026-06-03T17:37:13Z","snapshot_observed_at":"2026-08-04T15:01:24.045051Z","submitted_at":"2025-09-25T21:09:40Z","title":"AUDDT: A Unified Benchmark Toolkit for Audio and Speech Deepfake Detectors","version":2},"cited_work":{"arxiv_id":"2509.21597","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.21597","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"R., Pimentel, A., and Falk, T","venue":null,"work_id":"a303996c-90ae-4136-9b1b-ed6d79604aa3","year":null},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-07-31T23:37:37.390633Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"cited_paper":"/paper/2509.21597","citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:0d0d2e9363bb06a0c0b63c166b7f00a2495515321b893a59366894ecdf321e4a","observation_id":"443d723c-b3cb-413d-8d98-66e5d4368898","resolution":{"observed_at":"2026-06-04T02:07:39.638614Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"560bb64e-46f5-45f4-b9d1-bee50a621551","year":2020},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-07-31T23:37:37.390633Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:c8b656c3d114248d609cb770accff2988d05af04d76d21a874453dd22170c715","observation_id":"5ccc53a1-bc74-456c-80b1-75dfd457111a","resolution":{"observed_at":"2026-05-25T21:26:15.392964Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"all-step","venue":null,"work_id":"4ea085de-a8a8-4d03-b133-a6a2b985049f","year":2020},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-07-31T23:37:37.390633Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:fa61ae65182638f17e2a6cd3ac3899c6a4bd1d67dd4b1b87f74d6f8688e5cca4","observation_id":"ed41190a-b2a8-414b-859c-6980c7572207","resolution":{"observed_at":"2026-05-25T21:26:15.375713Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Other Tasks PFSL.For dataset configuration and model inference, we adapt the framework provided by Luong et al","venue":null,"work_id":"e433e567-653b-460f-b556-df37f983ec61","year":2025},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-07-31T23:37:37.390633Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:55fba5d8c61f8447949c1077c10bcce3a3ea7628007d6fd041e2afd1f9903e7a","observation_id":"961a8366-95c9-4244-9868-3a701b2f7757","resolution":{"observed_at":"2026-05-25T21:26:15.390327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A VDD.For this task, we adapt code from the FakeA VCeleb repository2","venue":null,"work_id":"787c6438-2128-43b0-9dc5-e63ce1412bfa","year":2021},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-07-31T23:37:37.390633Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:b88ecb9ce4d1fc169f56a8454d0ead09b6f98879511ecae3b36e0afa1f404d86","observation_id":"9c7f63d8-7453-4836-b9d6-95cc554222ad","resolution":{"observed_at":"2026-05-25T21:26:15.401907Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"bba7e8e5-1351-4346-982d-92bf3fe8bc20","year":2021},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-07-31T23:37:37.390633Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:11606501e09228283f3c3347199a369ab0be3d0c3b1ee4673fb0e1151734c646","observation_id":"c2034fe2-0aa4-4feb-b8a1-db9d751822a6","resolution":{"observed_at":"2026-05-25T21:26:15.404444Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"preprocessed","venue":null,"work_id":"a880afab-90a1-4823-ae5f-436039b771f7","year":2021},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-07-31T23:37:37.390633Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:a946ec271cf5bb47f7d61a535fd8fef1e649a9bc3a4404e3dfffa074fe49f8b2","observation_id":"cf07b65d-a843-4998-aab0-4a0d012b14e0","resolution":{"observed_at":"2026-05-25T21:26:15.407306Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"d33a45c7-054a-43cb-8998-f58cf3bb1a27","year":2024},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-07-31T23:37:37.390633Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:5346cafea2817c459d9dd6e2366756e9665976415052e42dc6d6c635366dc3a2","observation_id":"6704ddd1-53eb-40f8-86b6-04feb069d2e6","resolution":{"observed_at":"2026-05-25T21:26:15.396178Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"d0260adb-4a08-4f51-956e-f4c6d61b885c","year":2019},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-07-31T23:37:37.390633Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:7ac2e20411378275e205fc3ce20c0c722114a825c7b581e70b9ebc8878b3e0ae","observation_id":"3e3e94e6-e8af-4352-84c8-5cb0397b6f33","resolution":{"observed_at":"2026-05-25T21:26:15.398943Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Other Experimental Results G.1","venue":null,"work_id":"74218b9a-fbd1-410d-8a71-d5594ea5fe66","year":1934},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-07-31T23:37:37.390633Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:c4d6e2c2f54ab6af7813a82240acb95bede8c9ee70b5403922a93808effbcb5a","observation_id":"88836099-047e-4aee-b12a-d881db205f19","resolution":{"observed_at":"2026-05-25T21:26:15.410512Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-07-31T23:37:37.390633Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes"},"reference_resolution":{"displayed":60,"state_counts":{"malformed_identifier":2,"metadata_mismatch":6,"parse_uncertain":0,"unresolved":6,"verified_exact":27,"verified_fuzzy":19},"total_outbound_references":60},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 60 of 60 outbound references and 1 inbound Pith citation observation for arXiv:2605.00251."}