{"as_of":"2026-08-09T14:24:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a3e03b8ea1c7439d76243c1ec9bef0ef1145963bf092a004a97d0099bd63a5fe","coverage":[{"denominator":162,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T11:50:21.172908Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.05507/citation-record","integrity":"/paper/2608.05507/integrity","json":"/paper/2608.05507/citation-record.json","paper":"/paper/2608.05507"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:20.827537Z","title":"Busso and R","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T14:10:38.251150Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:20.827537Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:e59149cab7ab38c5ffbae284f8618775c9252bb018b7ec0169ef08326deb3d27","observation_id":"afdcb53f-4466-4d38-bc83-faf75effdfb7","resolution":{"observed_at":"2026-08-08T11:50:20.827537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:20.831613Z","title":"Artificial Intelligence Review , volume=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T14:10:38.251150Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:20.831613Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:df391cb9fb434500e40c49fb5e8e057baaa90d3e5f3b7b3f8861b77175b77e7b","observation_id":"1ab19ad2-ce5a-40ee-8093-fa743c552777","resolution":{"observed_at":"2026-08-08T11:50:20.831613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.10781","last_updated":"2025-09-13T01:58:34Z","snapshot_observed_at":"2026-08-08T10:19:51.918113Z","submitted_at":"2025-09-13T01:58:34Z","title":"Emoanti: audio anti-deepfake with refined emotion-guided representations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.10781","snapshot_observed_at":"2026-08-08T11:50:20.835476Z","title":"arXiv preprint arXiv:2509.10781 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T14:10:38.251150Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:20.835476Z"},"links":{"cited_paper":"/paper/2509.10781","citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:41f03c1ec7eba58f04451e03288f1cda2b83d22d353a9f37bb0cb89c310168b7","observation_id":"1930ed66-d594-43e3-9065-54099f5db9e9","resolution":{"observed_at":"2026-08-08T11:50:20.835476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:20.839466Z","title":"Applied intelligence , volume=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T14:10:38.251150Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:20.839466Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:c611cf11aa296fb6ac201792b05f095dd314a86646ab49b131502f4c0ab0c40c","observation_id":"55c5f096-0c8f-4a07-a8a2-d3215b0b5e6c","resolution":{"observed_at":"2026-08-08T11:50:20.839466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:20.843369Z","title":"The 2024 ACM Conference on Fairness, Accountability, and Transparency , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T14:10:38.251150Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:20.843369Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:7df270dd7e64a7a2615ee3cf2e88cccd257562c588cb41b04f75fbc490c1ce4c","observation_id":"019f9663-167f-41d7-a68a-57425e03528a","resolution":{"observed_at":"2026-08-08T11:50:20.843369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:20.847029Z","title":"End-to-End anti-spoofing with RawNet2 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T14:10:38.251150Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:20.847029Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:8e3f26c650a1f4213ffec1b99aee453dfac381e0b829691b11fbc3713f7a0bf8","observation_id":"b4a5decc-5f55-4ab1-b4e4-93166d801464","resolution":{"observed_at":"2026-08-08T11:50:20.847029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:20.850778Z","title":"AASIST: Audio Anti-Spoofing Using Integrated Spectro-Temporal Graph Attention Networks , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T14:10:38.251150Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:20.850778Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:7ac4e6cabbe4deb89d329dc76d3edb7254e921905ed57c675225c9555ac040be","observation_id":"c26db90c-c2ab-436b-b362-eef34dd21a37","resolution":{"observed_at":"2026-08-08T11:50:20.850778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:23.740664Z","title":"ASVspoof 2019: A large-scale public database of synthesized, converted and replayed speech , journal =","venue":null,"work_id":"2cdc66fe-a4b7-4a55-b09b-c32c88ea4641","year":2019},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T14:10:38.251150Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:20.854040Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:4916a5b4f89934d53959edf9a53d53b4fa4a409cd6e1dc466065ad31de1a311c","observation_id":"bf934a49-aa58-4cdd-8b47-163843f32368","resolution":{"observed_at":"2026-08-08T11:50:23.744601Z","resolver_source":"arxiv_id_nonexistent","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:20.857602Z","title":"ASVspoof 2021: Towards Spoofed and Deepfake Speech Detection in the Wild , year=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T14:10:38.251150Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:20.857602Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:26a06efe32e5922a3a1c24763fd0e4f1a47b90fb4052ebe48c5516fd53b591c4","observation_id":"1a08421d-12ca-49fe-9f9e-ff1fd95cf0da","resolution":{"observed_at":"2026-08-08T11:50:20.857602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:20.861212Z","title":"StyleTTS 2: Towards Human-Level Text-to-Speech through Style Diffusion and Adversarial Training with Large Speech Language Models , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T14:10:38.251150Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:20.861212Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:2c06d7646ae914ef83a25eb4bd5c9aa6f665c7753e2f294ed52041a2d3d7c0ba","observation_id":"f88db42b-ca2d-4698-86a0-5bea2864037d","resolution":{"observed_at":"2026-08-08T11:50:20.861212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:20.864623Z","title":"Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T14:10:38.251150Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:20.864623Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:e96a535a511db9708263572b51fe3420a3bfc4806cdb64f0ea83ea34e182a012","observation_id":"c8a34661-f0ed-4251-bf0f-89106415c726","resolution":{"observed_at":"2026-08-08T11:50:20.864623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05407","last_updated":"2024-07-09T07:42:51Z","snapshot_observed_at":"2026-07-06T18:42:34.958119Z","submitted_at":"2024-07-07T15:16:19Z","title":"CosyVoice: A Scalable Multilingual Zero-shot Text-to-speech Synthesizer based on Supervised Semantic Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05407","snapshot_observed_at":"2026-08-08T11:50:20.868085Z","title":"arXiv preprint arXiv:2407.05407 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T14:10:38.251150Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:20.868085Z"},"links":{"cited_paper":"/paper/2407.05407","citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:e8ddfa7a7f4c1877b8633ee53f57aa11bd763251c864ed5f8aaed8306383927a","observation_id":"818c7cc0-5fc2-4b41-b4cd-5e36e02a454a","resolution":{"observed_at":"2026-08-08T11:50:20.868085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08739","last_updated":"2024-08-16T13:37:20Z","snapshot_observed_at":"2026-07-06T19:01:32.237848Z","submitted_at":"2024-08-16T13:37:20Z","title":"ASVspoof 5: Crowdsourced Speech Data, Deepfakes, and Adversarial Attacks at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.08739","snapshot_observed_at":"2026-08-08T11:50:20.872203Z","title":"arXiv preprint arXiv:2408.08739 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T14:10:38.251150Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:20.872203Z"},"links":{"cited_paper":"/paper/2408.08739","citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:d328d549d13f21ae41d8ba426d2ae75233a163bcdef1f35e4b595d56954161fd","observation_id":"28fc5487-e371-4abb-b98a-270c3c419d70","resolution":{"observed_at":"2026-08-08T11:50:20.872203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:20.875846Z","title":"China National Conference on Chinese Computational Linguistics , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T14:10:38.251150Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:20.875846Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:0145d8046ae463e2ddfaa6dfd6b359b76126b0200a36aa68a63b69cd5c5f7955","observation_id":"e3911ac0-7246-4796-9b28-7b2526882d18","resolution":{"observed_at":"2026-08-08T11:50:20.875846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:20.879440Z","title":"ADD 2022: the first Audio Deep Synthesis Detection Challenge , year=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T14:10:38.251150Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:20.879440Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:44b799f7d5c3ccd44092c99553609c3ffc9cc6d71f9b5145d5002199eb1eadbe","observation_id":"ed4954ef-7de1-4164-b221-c7f1dca24e96","resolution":{"observed_at":"2026-08-08T11:50:20.879440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13774","last_updated":"2023-05-23T07:42:52Z","snapshot_observed_at":"2026-07-06T15:31:13.189124Z","submitted_at":"2023-05-23T07:42:52Z","title":"ADD 2023: the Second Audio Deepfake Detection Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13774","snapshot_observed_at":"2026-08-08T11:50:20.882735Z","title":"arXiv preprint arXiv:2305.13774 , year=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T14:10:38.251150Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:20.882735Z"},"links":{"cited_paper":"/paper/2305.13774","citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:16faa7194f2aaac685cd6d9dbd5ff517c07682777b3ac5fe9f033070ae4fe7f4","observation_id":"7a35fe27-8980-450b-92ec-36386e8d5d08","resolution":{"observed_at":"2026-08-08T11:50:20.882735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:20.886464Z","title":"Training , volume=","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T14:10:38.251150Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:20.886464Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:0e26baf1e235952226d96601532e3f26bd7bd1d3a22cde0c49fcc0269dc74203","observation_id":"e8b1f6db-92b2-4192-8b3c-bffe53248ee4","resolution":{"observed_at":"2026-08-08T11:50:20.886464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:20.889694Z","title":"Seen and Unseen Emotional Style Transfer for Voice Conversion with A New Emotional Speech Dataset , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T14:10:38.251150Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:20.889694Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:7cc5ef93fa09cfa0214af07bc8f8dfd4167a93a79bbf770cc54987bbb1ccdcff","observation_id":"0200fc8b-28fa-4f79-b869-016feba7dd4e","resolution":{"observed_at":"2026-08-08T11:50:20.889694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:20.893083Z","title":"The Twelfth International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T14:10:38.251150Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:20.893083Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:4f17056cc5ba10cae480d11edbf0c2c627bc589ae8b36d54cd844c3959dc1b25","observation_id":"87ce8e59-4660-4656-9475-30e791b278af","resolution":{"observed_at":"2026-08-08T11:50:20.893083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:20.896403Z","title":"ICASSP 2023-2023 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP) , pages=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T14:10:38.251150Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:20.896403Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:d93e0417773748795b80cb1e96a0808391e50a102d169dd2ceae364c35c9782c","observation_id":"d3c68ad9-6464-45d3-b46a-e07eba8c02b6","resolution":{"observed_at":"2026-08-08T11:50:20.896403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:20.899689Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T14:10:38.251150Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:20.899689Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:13ff800a3f7d7230c7fb01423845ff618ae38541b73548cef6e0173f2b196a26","observation_id":"9a01ef94-a10f-4f14-8c5e-e9d6f9bcdf10","resolution":{"observed_at":"2026-08-08T11:50:20.899689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:20.903129Z","title":"Development , volume=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T14:10:38.251150Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:20.903129Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:8a243e4b5a6713a583fe6f99eba34bd6ffa15c0d870fa35a7fe11bec58036f52","observation_id":"9e710910-821c-4118-94de-7370fcd3710f","resolution":{"observed_at":"2026-08-08T11:50:20.903129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:20.907876Z","title":"Interspeech 2022 , year=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T14:10:38.251150Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:20.907876Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:07f1d464f887743d6c789eb02a8ca42861e945e1572b53ab557883ef660f641a","observation_id":"d23698f6-20cb-42b1-a354-45750f63d41b","resolution":{"observed_at":"2026-08-08T11:50:20.907876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.09637","last_updated":"2020-09-21T06:38:19Z","snapshot_observed_at":"2026-08-04T06:54:37.531209Z","submitted_at":"2020-09-21T06:38:19Z","title":"Light Convolutional Neural Network with Feature Genuinization for Detection of Synthetic Speech Attacks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.09637","snapshot_observed_at":"2026-08-08T11:50:20.911251Z","title":"arXiv preprint arXiv:2009.09637 , year=","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T14:10:38.251150Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:20.911251Z"},"links":{"cited_paper":"/paper/2009.09637","citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:890f1e1abcbadae97a2c0677026fea66ad7b7c76cb5da69fe13afb03ed402ab2","observation_id":"2389d46c-b44e-4b3e-8517-d02227bd7774","resolution":{"observed_at":"2026-08-08T11:50:20.911251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.01120","last_updated":"2019-04-01T21:47:00Z","snapshot_observed_at":"2026-08-01T16:03:46.824467Z","submitted_at":"2019-04-01T21:47:00Z","title":"ASSERT: Anti-Spoofing with Squeeze-Excitation and Residual neTworks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.01120","snapshot_observed_at":"2026-08-08T11:50:20.914922Z","title":"arXiv preprint arXiv:1904.01120 , year=","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T14:10:38.251150Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:20.914922Z"},"links":{"cited_paper":"/paper/1904.01120","citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:1c460c776bcb55f5458aa5204f93a72ecc11e16c5fddb3a208786f5846ae01a4","observation_id":"ea63185b-1253-42a7-8f56-bad1552d7a81","resolution":{"observed_at":"2026-08-08T11:50:20.914922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:20.918662Z","title":"2023 18th International Joint Symposium on Artificial Intelligence and Natural Language Processing (iSAI-NLP) , pages=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T14:10:38.251150Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:20.918662Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:faa9eab82c5fa059211b7fd98c2de4edfaaf88b273605013c35aa635fc3f3b62","observation_id":"c654db24-786a-4d88-bce8-243b1b2c95fb","resolution":{"observed_at":"2026-08-08T11:50:20.918662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.09791","last_updated":"2025-09-11T18:51:58Z","snapshot_observed_at":"2026-08-08T06:22:12.517525Z","submitted_at":"2025-09-11T18:51:58Z","title":"The MSP-Podcast Corpus","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.09791","snapshot_observed_at":"2026-08-08T11:50:20.922023Z","title":"arXiv preprint arXiv:2509.09791 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T14:10:38.251150Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:20.922023Z"},"links":{"cited_paper":"/paper/2509.09791","citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:5cb4a0e32f87dbb308dc29fb9ee7993ea53e95d440e0416eacb26e8f3052f9a4","observation_id":"7f716022-9104-4dd8-ac8f-6df4a970c680","resolution":{"observed_at":"2026-08-08T11:50:20.922023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:20.925940Z","title":"EMOQ-TTS: Emotion Intensity Quantization for Fine-Grained Controllable Emotional Text-to-Speech , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T14:10:38.251150Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:20.925940Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:2e65bdb3bb5b81651acebedddc145f5ed48e63a0797403dd35bfa997c09a59f2","observation_id":"b0307f1a-3948-4817-8717-17b5f9225218","resolution":{"observed_at":"2026-08-08T11:50:20.925940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:20.929217Z","title":"Emodiff: Intensity Controllable Emotional Text-to-Speech with Soft-Label Guidance , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T14:10:38.251150Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:20.929217Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:a68c0c3d7f86a5657e2856eb1ad4e576f0404449cd3317b4893cdd1d1255b2a2","observation_id":"ea28811f-56b9-4a8b-aa57-19e71db09060","resolution":{"observed_at":"2026-08-08T11:50:20.929217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:20.932415Z","title":"ED-TTS: Multi-Scale Emotion Modeling Using Cross-Domain Emotion Diarization for Emotional Speech Synthesis , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T14:10:38.251150Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:20.932415Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:eb10d87065190c62d6046d6121dc6b9c8ed055c64fa9372ad77ef549420b3b61","observation_id":"3a8b974c-1034-4827-81c7-f15f416586cf","resolution":{"observed_at":"2026-08-08T11:50:20.932415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:20.935904Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T14:10:38.251150Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:20.935904Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:a2e9f72bf6487a49fc5ddd46cb0809651f246bc3e13ca32a8cf601cb383833d3","observation_id":"82738aa9-2b7e-4661-97ac-f3a1e0d30429","resolution":{"observed_at":"2026-08-08T11:50:20.935904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:20.939248Z","title":"Advances in Neural Information Processing Systems , editor=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T14:10:38.251150Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:20.939248Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:c5656b7bf36186601d0d14f75149cad67eecf8f3fc55c71bcb082826e538d100","observation_id":"58fdbb6c-6582-4756-bf96-c053cbb258fd","resolution":{"observed_at":"2026-08-08T11:50:20.939248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:20.942739Z","title":"Thirty-seventh Conference on Neural Information Processing Systems , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T14:10:38.251150Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:20.942739Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:cd78815e2454f81c9993b8706e66468f5a298725d875feca956a0d2528d4300b","observation_id":"7e4b8981-a30e-4f24-9824-85ef9f719a7e","resolution":{"observed_at":"2026-08-08T11:50:20.942739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:20.945962Z","title":"Laugh Now Cry Later: Controlling Time-Varying Emotional States of Flow-Matching-Based Zero-Shot Text-To-Speech , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T14:10:38.251150Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:20.945962Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:28ba7ada54a03766303b4c827a17359727477115a18911da03a9d3cbb11f922f","observation_id":"a35aacef-30fd-46ee-ae1c-892cb3ba56dd","resolution":{"observed_at":"2026-08-08T11:50:20.945962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:20.949422Z","title":"ICASSP 2024-2024 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP) , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T14:10:38.251150Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:20.949422Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:0d8f367e96dbd670044845bd4b2cd5399483ab6adc4a9d90cd3c531fbf3c425c","observation_id":"c7b76fa3-b136-44fc-a9b4-9a9a21afd413","resolution":{"observed_at":"2026-08-08T11:50:20.949422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:20.952770Z","title":"Proceedings of the 32nd ACM International Conference on Multimedia , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T14:10:38.251150Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:20.952770Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:3dcc63ee8fdfb83e89037af20ad312787f93f76286c9cdc9b5015ab588819cf5","observation_id":"ade48486-2678-4209-bedd-7f83c578c669","resolution":{"observed_at":"2026-08-08T11:50:20.952770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.12233","last_updated":"2022-02-28T11:50:57Z","snapshot_observed_at":"2026-07-06T12:41:22.635071Z","submitted_at":"2022-02-24T17:55:00Z","title":"Automatic speaker verification spoofing and deepfake detection using wav2vec 2.0 and data augmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.12233","snapshot_observed_at":"2026-08-08T11:50:20.956033Z","title":"arXiv preprint arXiv:2202.12233 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T14:10:38.251150Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:20.956033Z"},"links":{"cited_paper":"/paper/2202.12233","citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:4d6844f19a66ebfc317b1920b9dd32c9ab26f030ec5fe277988173f026e65b09","observation_id":"1f313600-25aa-4c35-a086-c65aceaa60b2","resolution":{"observed_at":"2026-08-08T11:50:20.956033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09296","last_updated":"2021-12-16T18:29:22Z","snapshot_observed_at":"2026-07-06T12:09:37.468149Z","submitted_at":"2021-11-17T18:49:42Z","title":"XLS-R: Self-supervised Cross-lingual Speech Representation Learning at Scale","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09296","snapshot_observed_at":"2026-08-08T11:50:20.959680Z","title":"arXiv preprint arXiv:2111.09296 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T14:10:38.251150Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:20.959680Z"},"links":{"cited_paper":"/paper/2111.09296","citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:eddf0476bf762d5c06b3e4e5aee9f1634047d2e2beb8c35811287d3d6a8d470e","observation_id":"d2c4190e-0f77-431f-9e6a-f25ddb3fb6be","resolution":{"observed_at":"2026-08-08T11:50:20.959680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:20.963557Z","title":"IEEE Journal of Selected Topics in Signal Processing , volume=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T14:10:38.251150Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:20.963557Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:60a48c6d5089ed98b055c51f30934ccc217ca0e0ac2d4b69b2b65bf8b4e4509b","observation_id":"2e7cd1c7-3c25-46ba-947e-9c88c05f1deb","resolution":{"observed_at":"2026-08-08T11:50:20.963557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:20.966883Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T14:10:38.251150Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:20.966883Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:33d561859c4705947185f529e5c0553965faf1cfe991496b364d4484a45f39e2","observation_id":"02176627-a37f-439d-8343-a71422ec40a7","resolution":{"observed_at":"2026-08-08T11:50:20.966883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:20.970139Z","title":"IEEE/ACM transactions on audio, speech, and language processing , volume=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T14:10:38.251150Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:20.970139Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:ab30d03e65aa70ee0da84df13b3ff44a162b627993ebc448a46a723edaee3939","observation_id":"4fea9f74-b5c5-4739-a850-315dff836400","resolution":{"observed_at":"2026-08-08T11:50:20.970139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14726","last_updated":"2025-02-20T16:52:55Z","snapshot_observed_at":"2026-08-07T18:01:26.635694Z","submitted_at":"2025-02-20T16:52:55Z","title":"Pitch Imperfect: Detecting Audio Deepfakes Through Acoustic Prosodic Analysis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14726","snapshot_observed_at":"2026-08-08T11:50:20.973529Z","title":"arXiv preprint arXiv:2502.14726 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T14:10:38.251150Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:20.973529Z"},"links":{"cited_paper":"/paper/2502.14726","citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:2e4eda4fc7c77a2dc4c843878e19167b5e4fa61d10bcdac15a0addb2fab5f8ec","observation_id":"e2c06744-c406-4c70-82d6-e12bb10bd05d","resolution":{"observed_at":"2026-08-08T11:50:20.973529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:20.977007Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T14:10:38.251150Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:20.977007Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:2773ef3e7f37a8e4432916a671e17c9ab0e73cdd5c335f96fc51bfbcb468e005","observation_id":"d01dc710-0239-4350-92f6-8b6a4f2a223b","resolution":{"observed_at":"2026-08-08T11:50:20.977007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:20.980204Z","title":", author=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T14:10:38.251150Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:20.980204Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:d91ecb0af7c63c8ade11ea399310baed06a092c12036f9d72b22c873a9979b8c","observation_id":"6b2e64dd-1431-4866-9b75-9db8688c542e","resolution":{"observed_at":"2026-08-08T11:50:20.980204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:20.983482Z","title":"EURASIP Journal on Audio, Speech, and Music Processing , volume=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T14:10:38.251150Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:20.983482Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:d92ccea1a59e4444c849f32bfbaaec3953ed8df6941d306b0996a6175a3316f2","observation_id":"1da9739a-fb15-460e-bfb4-6ce5bc3626f4","resolution":{"observed_at":"2026-08-08T11:50:20.983482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.19197","last_updated":"2025-04-27T11:22:21Z","snapshot_observed_at":"2026-08-07T15:58:51.482040Z","submitted_at":"2025-04-27T11:22:21Z","title":"Generative Adversarial Network based Voice Conversion: Techniques, Challenges, and Recent Advancements","version":1},"cited_work":{"arxiv_id":"2504.19197","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.19197","snapshot_observed_at":"2026-08-08T11:50:23.464466Z","title":"Generative Adversarial Network based Voice Conversion: Techniques, Challenges, and Recent Advancements","venue":"cs.SD","work_id":"97363b82-c0a0-4d8e-af8e-3cd0c6ba253f","year":2025},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T14:10:38.251150Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:20.986817Z"},"links":{"cited_paper":"/paper/2504.19197","citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:73b89fc0c8550c93657f8129e2496dfe6267ecf5d2f9ef1e121eda62bba8e59f","observation_id":"b77b17f6-5d37-4c6e-aec1-b460840ffd0d","resolution":{"observed_at":"2026-08-08T11:50:23.468649Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:20.990676Z","title":"Frontiers in signal processing , volume=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T14:10:38.251150Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:20.990676Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:a1dad58feb009456c79e0ffad6209d57125cdf4b01bf69eaa3c0447ad0bb4828","observation_id":"2c2cb1bb-e909-4de2-ae84-3a8c5e7cb277","resolution":{"observed_at":"2026-08-08T11:50:20.990676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:20.993945Z","title":"IEICE TRANSACTIONS on Information and Systems , volume=","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T14:10:38.251150Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:20.993945Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:ad3b87a8b810a3c7bee21c1160d9d7235e90ca2714c28551ee68586dfd4167df","observation_id":"1227421f-4ffa-484d-b0f3-e7bdb663b156","resolution":{"observed_at":"2026-08-08T11:50:20.993945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:20.997227Z","title":"IEEE/ACM Transactions on Audio, Speech, and Language Processing , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T14:10:38.251150Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:20.997227Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:d3c54d9744b30bf746e61e0360de006298bb011e6547915a1f20a6088f16db0b","observation_id":"e2c789b3-8842-454a-b68b-35b689de0a0f","resolution":{"observed_at":"2026-08-08T11:50:20.997227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:21.000532Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T14:10:38.251150Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:21.000532Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:ce95e5c2cc7b80bd73d00a9474acc3a37114fc9061b64a4ea18cbfc623e134c6","observation_id":"ee6cb616-aebc-4b3c-b1f8-d5c71a430fe0","resolution":{"observed_at":"2026-08-08T11:50:21.000532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.07402","last_updated":"2022-12-13T14:12:02Z","snapshot_observed_at":"2026-08-05T21:50:11.152608Z","submitted_at":"2021-11-14T18:16:42Z","title":"Textless Speech Emotion Conversion using Discrete and Decomposed Representations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.07402","snapshot_observed_at":"2026-08-08T11:50:21.003985Z","title":"arXiv preprint arXiv:2111.07402 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T14:10:38.251150Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:21.003985Z"},"links":{"cited_paper":"/paper/2111.07402","citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:8947225a30ae48a433fceaf69bd8f98cb3512e89d3a8481d72a8347a47efc8a5","observation_id":"20f2c225-b11c-43a8-babd-4ee563595883","resolution":{"observed_at":"2026-08-08T11:50:21.003985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:21.007684Z","title":"IEEE/ACM Transactions on Audio, Speech, and Language Processing , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T14:10:38.251150Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:21.007684Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:a8914b90450a30a5e58ac783b9881ad72401414b293748ce6f4f0b60392b1b2c","observation_id":"39c3c457-4d4a-436f-a5e4-d709c9878641","resolution":{"observed_at":"2026-08-08T11:50:21.007684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:21.011412Z","title":"XLSR-Mamba: A Dual-Column Bidirectional State Space Model for Spoofing Attack Detection , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T14:10:38.251150Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:21.011412Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:12a1a412e4fc7edc83c13d261f2a353d5180d02508a13000a0fa48371394d003","observation_id":"dc272b26-3def-4d78-900a-ede1c3006f45","resolution":{"observed_at":"2026-08-08T11:50:21.011412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:21.014796Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T14:10:38.251150Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:21.014796Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:7d66a701be41704617c6770b6d9ca95921089ff668665fd69df9b0d0e849fadd","observation_id":"db7777d0-cbbd-4479-9410-af00f3c8bc8b","resolution":{"observed_at":"2026-08-08T11:50:21.014796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:21.018368Z","title":"Proceedings of the 15th Biannual Conference of the Italian SIGCHI Chapter , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T14:10:38.251150Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:21.018368Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:01ac217aedaad9889b64696b5775d8e92769ec4d4e7588b5c9650e0e466d5523","observation_id":"e4c4185c-e4c5-40ae-bb9a-e47dd383ea4b","resolution":{"observed_at":"2026-08-08T11:50:21.018368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:21.021912Z","title":"Better Be Computer or I'm Dumb","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T14:10:38.251150Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:21.021912Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:08b0d8aca7330c33674bed39256ee7e232ab9227395d3ec3d1e8e4477b745c03","observation_id":"933159c5-26ee-42e8-8216-6e5711ffc863","resolution":{"observed_at":"2026-08-08T11:50:21.021912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:21.025934Z","title":"ICASSP 2022-2022 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP) , pages=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T14:10:38.251150Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:21.025934Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:ca2e7e178ad48765e4c4889c53055a584a4ae4595baf0cc7ec7664b32c0c4cba","observation_id":"cc5022a4-3a9f-4425-905f-cd14ce7b8905","resolution":{"observed_at":"2026-08-08T11:50:21.025934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:21.029353Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T14:10:38.251150Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:21.029353Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:97c55aa9ff13b82f444ac101753e798d8ce9a0d6859a32d9987db4874e50d6c7","observation_id":"c84efbff-5a9d-4898-b740-698915415949","resolution":{"observed_at":"2026-08-08T11:50:21.029353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:21.032707Z","title":"ICASSP 2025-2025 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP) , pages=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T14:10:38.251150Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:21.032707Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:020f4dd6dc91982cb9be6dcfe922972fa2ebfddb9250974175fa3f609f40f443","observation_id":"ca4d43e5-c0e6-42fa-819d-fe41b83375d3","resolution":{"observed_at":"2026-08-08T11:50:21.032707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:21.036159Z","title":"Machine learning , volume=","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T14:10:38.251150Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:21.036159Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:2819c8ec3e0964ff947176e3daf444ae99578e85182f1ff4f3da41470c2081a8","observation_id":"49f0a89d-9841-48d1-85a2-08efdc5ad558","resolution":{"observed_at":"2026-08-08T11:50:21.036159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:21.039601Z","title":"Proceedings of the IEEE/CVF conference on computer vision and pattern recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T14:10:38.251150Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:21.039601Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:32c1fdf825553682ba88a4fa5ceb98a82e0fa469f7e23a0d4cf5bd39627b9ae2","observation_id":"81de6bbb-4793-4952-8fc1-81654ac65f22","resolution":{"observed_at":"2026-08-08T11:50:21.039601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:21.043246Z","title":", author=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T14:10:38.251150Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:21.043246Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:a0e0805946894a19f3ebbeb84fd239ab6e345434adf7463723b443b907fe6995","observation_id":"7e2a0e17-847f-4f6c-b983-80776e1b1a14","resolution":{"observed_at":"2026-08-08T11:50:21.043246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:21.047014Z","title":"National Science Review , volume=","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T14:10:38.251150Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:21.047014Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:a9976e0c64cb2e7629a0f4eb0142fa2a71f8360e074e5e98389838191601bab1","observation_id":"6a513489-d8aa-4a62-b4e3-8951d7451e57","resolution":{"observed_at":"2026-08-08T11:50:21.047014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.08470","last_updated":"2026-04-28T12:49:51Z","snapshot_observed_at":"2026-07-31T07:42:25.034469Z","submitted_at":"2025-09-10T10:18:56Z","title":"Joint Learning using Mixture-of-Expert-Based Representation for Speech Enhancement and Robust Emotion Recognition","version":2},"cited_work":{"arxiv_id":"2509.08470","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.08470","snapshot_observed_at":"2026-08-08T11:50:23.439128Z","title":"Joint Learning using Mixture-of-Expert-Based Representation for Speech Enhancement and Robust Emotion Recognition","venue":"eess.AS","work_id":"51d61c7d-fa55-446f-9ab4-1d2492441c12","year":2025},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T14:10:38.251150Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:21.050441Z"},"links":{"cited_paper":"/paper/2509.08470","citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:bfa878f87bc3ea643cc55774bdafbe1b049f657b4f84f25530f14d2084cdaf41","observation_id":"7ae02a56-13cd-4060-b69f-8422066dd73c","resolution":{"observed_at":"2026-08-08T11:50:23.442986Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:21.054029Z","title":"ICASSP 2022-2022 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP) , pages=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T14:10:38.251150Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:21.054029Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:7cfed5c6bb32f5764597e8b1e7c565be4d9366c461d7614b4233ca68c785900f","observation_id":"e2505c97-f69b-4ee7-9973-2bab71d4adec","resolution":{"observed_at":"2026-08-08T11:50:21.054029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.3555","last_updated":"2014-12-11T06:46:53Z","snapshot_observed_at":"2026-08-03T11:40:51.182181Z","submitted_at":"2014-12-11T06:46:53Z","title":"Empirical Evaluation of Gated Recurrent Neural Networks on Sequence Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.3555","snapshot_observed_at":"2026-08-08T11:50:21.057378Z","title":"arXiv preprint arXiv:1412.3555 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T14:10:38.251150Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:21.057378Z"},"links":{"cited_paper":"/paper/1412.3555","citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:b3f5fc7252e414a8050c1216d1b8997e39d8a935f7cc0408266d1c36ed6ecb24","observation_id":"16dee11b-68fe-4210-9820-dd89a9ce6aea","resolution":{"observed_at":"2026-08-08T11:50:21.057378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:21.060759Z","title":"2021 IEEE Automatic Speech Recognition and Understanding Workshop (ASRU) , pages=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T14:10:38.251150Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:21.060759Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:7abfa311dcc3d608c3e84819806966ff19ffc25889ce85f95f100065a4a4a9d3","observation_id":"dc0b567b-d012-4b43-a87c-6dd78c911155","resolution":{"observed_at":"2026-08-08T11:50:21.060759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:21.064017Z","title":"ICASSP 2023-2023 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP) , pages=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T14:10:38.251150Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:21.064017Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:afbabe0a42cf43e2fd058540d028bccad45a29f8d742f5614c6a33da8074056a","observation_id":"e0027e1b-e32c-4449-81ca-b5ad6fd64d4d","resolution":{"observed_at":"2026-08-08T11:50:21.064017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:21.067212Z","title":"Proceedings of the 31st ACM International Conference on Multimedia , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T14:10:38.251150Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:21.067212Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:e87564a029e544ccb1b6e978751890be4ba8b1ed56fe9220122f38a12fc1c174","observation_id":"0a3cac74-4902-4a2e-a732-eefab1a784bd","resolution":{"observed_at":"2026-08-08T11:50:21.067212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:21.070396Z","title":"IEEE Transactions on Information Forensics and Security , volume=","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T14:10:38.251150Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:21.070396Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:3c4e3077e761679a8f11462741966c0c2d5d2f2e4858ff6d709b9c999b68b1e3","observation_id":"5de3e80a-8fdc-4edf-9520-b28e52cf96b3","resolution":{"observed_at":"2026-08-08T11:50:21.070396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:21.074073Z","title":"arXiv preprint arXiv:2509.21676 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T14:10:38.251150Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:21.074073Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:0b9aed36bd1ce8ba08f544e29c1e92f156503c8e3f42ea57324c02343283e766","observation_id":"76361c58-ab90-4a79-b5c4-cfb56a354bc0","resolution":{"observed_at":"2026-08-08T11:50:21.074073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:21.077413Z","title":"IEEE Transactions on Affective Computing , volume=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T14:10:38.251150Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:21.077413Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:161f65bfca11c15a6fd455005d0db9a1dbecd2af28c95b6e85c74d89952880a9","observation_id":"f807bfde-35f1-4d09-a200-1f4069d18e35","resolution":{"observed_at":"2026-08-08T11:50:21.077413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:21.080569Z","title":"ICASSP 2024-2024 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP) , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T14:10:38.251150Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:21.080569Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:f21e81d7b31f54e2add98661a091983590874eae670113e831b832bb993d7770","observation_id":"44db2902-c483-4562-88c7-d331f7cef6b0","resolution":{"observed_at":"2026-08-08T11:50:21.080569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04693","last_updated":"2023-11-08T14:02:53Z","snapshot_observed_at":"2026-08-04T07:43:21.606101Z","submitted_at":"2023-11-08T14:02:53Z","title":"Diff-HierVC: Diffusion-based Hierarchical Voice Conversion with Robust Pitch Generation and Masked Prior for Zero-shot Speaker Adaptation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.04693","snapshot_observed_at":"2026-08-08T11:50:21.083895Z","title":"arXiv preprint arXiv:2311.04693 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T14:10:38.251150Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:21.083895Z"},"links":{"cited_paper":"/paper/2311.04693","citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:26ae77d69226bc15d09573c12db9a7dfee48ce0b1dadfbbdaf683fbc33426d21","observation_id":"72929826-c271-4bac-8edd-9ec6e3cd5228","resolution":{"observed_at":"2026-08-08T11:50:21.083895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:21.087492Z","title":"2024 IEEE Spoken Language Technology Workshop (SLT) , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T14:10:38.251150Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:21.087492Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:c8320cd5bc092f472ae1f246febf4dc891d944d8da383682062e8b73ff25e9fa","observation_id":"ba79faa9-3c2e-41ac-8c00-667ad145961e","resolution":{"observed_at":"2026-08-08T11:50:21.087492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:21.090834Z","title":"ICASSP 2021-2021 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP) , pages=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T14:10:38.251150Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:21.090834Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:8e74d257cb1648f785deef0d4fc3f67c5507cd41008b7286b7f368c8d5ba0e4b","observation_id":"b2ce0d57-f22c-4409-a0ec-d080dd878a35","resolution":{"observed_at":"2026-08-08T11:50:21.090834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:21.094029Z","title":"Language, Cognition and Neuroscience , volume=","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T14:10:38.251150Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:21.094029Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:4602cc7f782e1c563bc24514babacec88ef2e68e46737d7a4255a2b0ef65c2d8","observation_id":"f36e7878-8a7f-4e36-a351-a1a85883d06d","resolution":{"observed_at":"2026-08-08T11:50:21.094029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:21.097212Z","title":"Studies in second language acquisition , volume=","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T14:10:38.251150Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:21.097212Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:ce19297f02284569ca4685f8b18c0ed11f8b070fff78a68026e6d1089ffd3505","observation_id":"2a6321b1-99c5-447c-870f-75f69c387f81","resolution":{"observed_at":"2026-08-08T11:50:21.097212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:21.100898Z","title":"and Li, Haizhou , journal=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T14:10:38.251150Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:21.100898Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:068a8074d4465fb3b631b2560e78d28cfecabd8eb69769cc64c40d279b5e1ab8","observation_id":"a0c87b74-1e1d-48ca-8f71-fa617158e13b","resolution":{"observed_at":"2026-08-08T11:50:21.100898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:21.104204Z","title":"Librispeech: An ASR corpus based on public domain audio books , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T14:10:38.251150Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:21.104204Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:3f743005b94f5a848676caa618cc5b90f8869d969e277de43d6a90a0b1ee1604","observation_id":"73da0aa7-013d-4754-af58-b234018319a4","resolution":{"observed_at":"2026-08-08T11:50:21.104204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:21.107493Z","title":"International Conference on Pattern Recognition , pages=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T14:10:38.251150Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:21.107493Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:5d240ec6bac7c83ff5824e9e3554775a2b62afbe19f1d523b759ac560f5b9c9a","observation_id":"06b115c3-1103-4309-97cf-00dc96bdafb0","resolution":{"observed_at":"2026-08-08T11:50:21.107493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:21.110585Z","title":"ICASSP 2022-2022 IEEE international conference on acoustics, speech and signal processing (ICASSP) , pages=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T14:10:38.251150Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:21.110585Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:5cbde04f0cfe79eb4eb5136f986c00d86ec7ba0daf0331bfc0e159dacf390ec6","observation_id":"4f06e403-81fe-453b-a244-ec3ad0559a37","resolution":{"observed_at":"2026-08-08T11:50:21.110585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:21.113860Z","title":"2020 Asia-Pacific Signal and Information Processing Association Annual Summit and Conference (APSIPA ASC) , pages=","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T14:10:38.251150Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:21.113860Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:070652e8bbd8d5e5736ed7f65adbab72e083b65262af1ed2410c74940650d8c6","observation_id":"d89e11c8-dec4-4fb7-90c0-a14c29cfa1c9","resolution":{"observed_at":"2026-08-08T11:50:21.113860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:21.117276Z","title":"METTS: Multilingual Emotional Text-to-Speech by Cross-Speaker and Cross-Lingual Emotion Transfer , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T14:10:38.251150Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:21.117276Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:2aa3b9613cb0bb28f2cc6fba53f5cd0db9d258803a0e0838a30faefdffcd4b76","observation_id":"0093ee55-cb08-44f2-84b0-989406ec074c","resolution":{"observed_at":"2026-08-08T11:50:21.117276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.00186","last_updated":"2025-08-29T18:37:57Z","snapshot_observed_at":"2026-08-07T21:38:02.692073Z","submitted_at":"2025-08-29T18:37:57Z","title":"Generalizable Audio Spoofing Detection using Non-Semantic Representations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.00186","snapshot_observed_at":"2026-08-08T11:50:21.120714Z","title":"arXiv preprint arXiv:2509.00186 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T14:10:38.251150Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:21.120714Z"},"links":{"cited_paper":"/paper/2509.00186","citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:e6c06c1aefe5a8e6b1d8096289221d74673cce9b4803737e16958209bc73e2d8","observation_id":"d3aa8b9d-dd17-4099-b745-ff8498d19f03","resolution":{"observed_at":"2026-08-08T11:50:21.120714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:21.124312Z","title":"IEEE Transactions on Affective Computing , volume=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T14:10:38.251150Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:21.124312Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:787cb0d9e892935709127df9d07728cc7617d8ca20398e1d75d95e327835e46c","observation_id":"de3d97ca-3d60-43da-afcb-a4c14f2dcade","resolution":{"observed_at":"2026-08-08T11:50:21.124312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:21.127824Z","title":"2024 International Joint Conference on Neural Networks (IJCNN) , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T14:10:38.251150Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:21.127824Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:7d5f28059bd9983a6aaf6d4ab475dd8aed389e61b6405585c52b8003d9fa20f0","observation_id":"7dec294c-8945-4ec9-9d5d-7d705447b78b","resolution":{"observed_at":"2026-08-08T11:50:21.127824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.06422","last_updated":"2020-04-19T13:23:20Z","snapshot_observed_at":"2026-07-06T09:12:13.006707Z","submitted_at":"2020-04-14T11:16:10Z","title":"An explainability study of the constant Q cepstral coefficient spoofing countermeasure for automatic speaker verification","version":3},"cited_work":{"arxiv_id":"2004.06422","doi":null,"metadata_source":"pith","pith_arxiv_id":"2004.06422","snapshot_observed_at":"2026-08-08T11:50:23.186525Z","title":"An explainability study of the constant Q cepstral coefficient spoofing countermeasure for automatic speaker verification","venue":"eess.AS","work_id":"a96e40e2-0a36-46fa-8103-24dc42cb646c","year":2020},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T14:10:38.251150Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:21.131272Z"},"links":{"cited_paper":"/paper/2004.06422","citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:b47379862cc18296e8cd41258e8b2051b441986bc6e9928b2994a2b33dd25338","observation_id":"d613ccc7-39bb-413c-9efa-702eee1fbc48","resolution":{"observed_at":"2026-08-08T11:50:23.191094Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:21.134870Z","title":"EURASIP Journal on Information Security , volume=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T14:10:38.251150Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:21.134870Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:bd3f05c77720b048617fb8d9ef9f15103c790068a3406b15a0e187b8df0fdb4b","observation_id":"71897323-4303-459a-9943-418dd541a561","resolution":{"observed_at":"2026-08-08T11:50:21.134870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:21.138353Z","title":"IEEE/ACM Transactions on Audio, Speech, and Language Processing , volume=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T14:10:38.251150Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:21.138353Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:58a263ff6e8e26645306c2de3f5e5d5a477eee67895ae7106f5bcb1d188222f0","observation_id":"252754f3-e96b-4bcc-8f07-8538e7a122ec","resolution":{"observed_at":"2026-08-08T11:50:21.138353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.12914","last_updated":"2021-09-28T09:06:33Z","snapshot_observed_at":"2026-07-06T11:22:29.069903Z","submitted_at":"2021-06-23T08:28:59Z","title":"Speech is Silver, Silence is Golden: What do ASVspoof-trained Models Really Learn?","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.12914","snapshot_observed_at":"2026-08-08T11:50:21.141690Z","title":"arXiv preprint arXiv:2106.12914 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T14:10:38.251150Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:21.141690Z"},"links":{"cited_paper":"/paper/2106.12914","citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:f0473a80b88a2b1c7a6289bac7979867e0cf0a6b2c31f7968ff957e104a35fdd","observation_id":"7631c976-57bd-4421-9c04-22fa68bd1068","resolution":{"observed_at":"2026-08-08T11:50:21.141690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:21.145361Z","title":"Feature Genuinization based Residual Squeeze-and-Excitation for Audio Anti-Spoofing in Sound AI , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T14:10:38.251150Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:21.145361Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:6d082472d0cd21267605c7fd65d6e8a7ea78857b404aa7c73e0679e135eb3791","observation_id":"48fc5548-461b-4853-8d7c-c4fb96f38b51","resolution":{"observed_at":"2026-08-08T11:50:21.145361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:21.148828Z","title":"PloS one , volume=","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T14:10:38.251150Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:21.148828Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:76236d97cd650c03c049479b055c0b87591f656439084e3f18c2a78379460001","observation_id":"7c295709-7373-4fa2-b5d3-e36e48552381","resolution":{"observed_at":"2026-08-08T11:50:21.148828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:21.152290Z","title":"International Conference on Machine Learning , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T14:10:38.251150Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:21.152290Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:e900027e40530f3cb35df62bde17eb8219c2e0c67340b9bf8ee0f13623a1fe83","observation_id":"6f504cc9-acf2-4c89-b7e6-f5f7f103c7b9","resolution":{"observed_at":"2026-08-08T11:50:21.152290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04904","last_updated":"2024-06-07T12:56:11Z","snapshot_observed_at":"2026-08-06T13:29:11.244845Z","submitted_at":"2024-06-07T12:56:11Z","title":"XTTS: a Massively Multilingual Zero-Shot Text-to-Speech Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04904","snapshot_observed_at":"2026-08-08T11:50:21.155761Z","title":"arXiv preprint arXiv:2406.04904 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T14:10:38.251150Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:21.155761Z"},"links":{"cited_paper":"/paper/2406.04904","citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:87ce415e709bd6f7ea0803f7c724f37b81e6af2bc2020eb87ea97081a50b60db","observation_id":"93d279d8-29c1-4fd5-afc8-1017556a9f8e","resolution":{"observed_at":"2026-08-08T11:50:21.155761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:21.159501Z","title":"ICASSP 2021-2021 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP) , pages=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T14:10:38.251150Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:21.159501Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:3a9ed9285947a463514aecdce0a78b1aff2ca3cadd7fe89c4c60641362e6823a","observation_id":"2bdfa3ae-4109-4c4e-8f7a-a6a0911ac7f5","resolution":{"observed_at":"2026-08-08T11:50:21.159501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.10394","last_updated":"2021-07-23T01:08:09Z","snapshot_observed_at":"2026-07-06T11:31:23.057674Z","submitted_at":"2021-07-21T23:44:17Z","title":"StarGANv2-VC: A Diverse, Unsupervised, Non-parallel Framework for Natural-Sounding Voice Conversion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.10394","snapshot_observed_at":"2026-08-08T11:50:21.162778Z","title":"arXiv preprint arXiv:2107.10394 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T14:10:38.251150Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:21.162778Z"},"links":{"cited_paper":"/paper/2107.10394","citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:7e5df4860e9c3cc5c1541226b89fc551dac50e8ac72ea48bcf78047c7fb22710","observation_id":"2984661d-20a6-422c-b1f0-fd2cc2e27884","resolution":{"observed_at":"2026-08-08T11:50:21.162778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.13821","last_updated":"2022-08-04T10:25:40Z","snapshot_observed_at":"2026-08-07T17:24:03.888611Z","submitted_at":"2021-09-28T15:48:22Z","title":"Diffusion-Based Voice Conversion with Fast Maximum Likelihood Sampling Scheme","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.13821","snapshot_observed_at":"2026-08-08T11:50:21.166263Z","title":"arXiv preprint arXiv:2109.13821 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T14:10:38.251150Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:21.166263Z"},"links":{"cited_paper":"/paper/2109.13821","citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:777356e5318f14e87786446bef6478e26c1d0f41bd9a265fbc7de0ffa25052bb","observation_id":"07650bfa-c611-42d6-88ef-957cae3bd642","resolution":{"observed_at":"2026-08-08T11:50:21.166263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:21.169709Z","title":", author=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T14:10:38.251150Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:21.169709Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:ec89dc2c010aa264a0f4f87832b75c3427f4895d93b18c34be98f2874c1e9c4e","observation_id":"39d2a617-78dc-4f9e-8bed-58ab947bd55b","resolution":{"observed_at":"2026-08-08T11:50:21.169709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:21.172908Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T14:10:38.251150Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:21.172908Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:44f6249ffc9c4d8db162b1963d889fe8783db7948ae8ef2aec84717e6a8c16b6","observation_id":"7a701a40-187a-4f17-9826-4d7d4ffdc233","resolution":{"observed_at":"2026-08-08T11:50:21.172908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-09T14:10:38.251150Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":96,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":162},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 100 of 162 outbound references and 0 inbound Pith citation observations for arXiv:2608.05507."}