{"as_of":"2026-08-09T21:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3ec3b3b7f3b4dd15ed575fa6bd20c7fdbb2be844c56c72327d458f5b89a5803a","coverage":[{"denominator":34,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T16:49:30.258365Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T16:49:26.014563Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-10T00:34:47.280797Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.12595","last_updated":"2025-07-16T19:30:51Z","snapshot_observed_at":"2026-08-08T15:13:20.897014Z","submitted_at":"2025-07-16T19:30:51Z","title":"Enhancing In-Domain and Out-Domain EmoFake Detection via Cooperative Multilingual Speech Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.12595","snapshot_observed_at":"2026-08-06T16:49:26.014563Z","title":"However, despite these advancements, an under- explored yet critical dimension remains: scenarios where the emotional state of speech is artificially modified i.e","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.12595","last_updated":"2025-07-16T19:30:51Z","snapshot_observed_at":"2026-08-08T15:13:20.897014Z","submitted_at":"2025-07-16T19:30:51Z","title":"Enhancing In-Domain and Out-Domain EmoFake Detection via Cooperative Multilingual Speech Foundation Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:26.014563Z"},"links":{"cited_paper":"/paper/2507.12595","citing_paper":"/paper/2507.12595"},"observation_digest":"sha256:1afe971f04a301e06ad5cf81fba96dbec1c2ec06b95bdd9126f579451785b98c","observation_id":"838739be-3923-4839-af3a-dd0078da5c28","resolution":{"observed_at":"2026-08-06T16:49:26.014563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12595","last_updated":"2025-07-16T19:30:51Z","snapshot_observed_at":"2026-08-08T15:13:20.897014Z","submitted_at":"2025-07-16T19:30:51Z","title":"Enhancing In-Domain and Out-Domain EmoFake Detection via Cooperative Multilingual Speech Foundation Models","version":1},"cited_work":{"arxiv_id":"2507.12595","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.12595","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2507.12595 , year=","venue":null,"work_id":"23f78076-9965-4a79-b4ef-d2fcf4a655c4","year":null},"citing_paper":{"arxiv_id":"2604.19949","last_updated":"2026-04-21T19:54:54Z","snapshot_observed_at":"2026-07-06T23:06:31.110859Z","submitted_at":"2026-04-21T19:54:54Z","title":"Indic-CodecFake meets SATYAM: Towards Detecting Neural Audio Codec Synthesized Speech Deepfakes in Indic Languages","version":1},"reference_index":152,"source":"arxiv_source","source_observed_at":"2026-05-10T00:34:30.978387Z"},"links":{"cited_paper":"/paper/2507.12595","citing_paper":"/paper/2604.19949"},"observation_digest":"sha256:318d00d7f042dd203e3b9175dde32ff53072da443d9e2ed807b740f0d1d1aec0","observation_id":"629898af-23f9-425e-a216-d06744fe9853","resolution":{"observed_at":"2026-05-10T00:34:47.282346Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.12595/citation-record","integrity":"/paper/2507.12595/integrity","json":"/paper/2507.12595/citation-record.json","paper":"/paper/2507.12595"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:37.729951Z","title":null,"venue":null,"work_id":"a5949b76-efc4-47f5-84f4-93b5a2733a6f","year":2017},"citing_paper":{"arxiv_id":"2507.12595","last_updated":"2025-07-16T19:30:51Z","snapshot_observed_at":"2026-08-08T15:13:20.897014Z","submitted_at":"2025-07-16T19:30:51Z","title":"Enhancing In-Domain and Out-Domain EmoFake Detection via Cooperative Multilingual Speech Foundation Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:25.889331Z"},"links":{"citing_paper":"/paper/2507.12595"},"observation_digest":"sha256:9f56679d1c1355ca8eac077fc8193fceee26f65810ee9b49c66ae1ad7b49ae8a","observation_id":"fbc77585-a1fe-47c1-b85c-87d774e6a193","resolution":{"observed_at":"2026-08-06T16:49:37.870541Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:37.457921Z","title":"Speech Foundation Models (SFMs): For monolingual SFMs, we consider WavLM1 [17], Unispeech-SAT2 [18], Wav2vec23 [19], and HuBERT 4 [20]","venue":null,"work_id":"5e8b2551-2359-4b01-a94d-da8a81201e28","year":null},"citing_paper":{"arxiv_id":"2507.12595","last_updated":"2025-07-16T19:30:51Z","snapshot_observed_at":"2026-08-08T15:13:20.897014Z","submitted_at":"2025-07-16T19:30:51Z","title":"Enhancing In-Domain and Out-Domain EmoFake Detection via Cooperative Multilingual Speech Foundation Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:26.094403Z"},"links":{"citing_paper":"/paper/2507.12595"},"observation_digest":"sha256:d77eaaf70f791498845c335a81039e712fb9db0c3e7cb97da4a0f2cb4b1982fa","observation_id":"c6afa01a-ab22-473e-b564-6bced7e1a1c4","resolution":{"observed_at":"2026-08-06T16:49:37.590706Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:37.176845Z","title":"We use Fully Connected Network (FCN) and CNN as downstream networks with individual FMs","venue":null,"work_id":"4d58925b-19fa-49fd-9d21-e345f8764ca6","year":null},"citing_paper":{"arxiv_id":"2507.12595","last_updated":"2025-07-16T19:30:51Z","snapshot_observed_at":"2026-08-08T15:13:20.897014Z","submitted_at":"2025-07-16T19:30:51Z","title":"Enhancing In-Domain and Out-Domain EmoFake Detection via Cooperative Multilingual Speech Foundation Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:26.203494Z"},"links":{"citing_paper":"/paper/2507.12595"},"observation_digest":"sha256:dbc2534c66bd6629f3e69d2548feb6f2de3027de96de93621b66d918a266c7b5","observation_id":"4b421cee-1121-465c-ba68-e3780698981b","resolution":{"observed_at":"2026-08-06T16:49:37.302061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:36.646960Z","title":"Benchmark Dataset We use the only dataset available for EFD by Zhao et al","venue":null,"work_id":"69c6e590-5679-4928-adfc-3266f83b3ef4","year":null},"citing_paper":{"arxiv_id":"2507.12595","last_updated":"2025-07-16T19:30:51Z","snapshot_observed_at":"2026-08-08T15:13:20.897014Z","submitted_at":"2025-07-16T19:30:51Z","title":"Enhancing In-Domain and Out-Domain EmoFake Detection via Cooperative Multilingual Speech Foundation Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:26.466138Z"},"links":{"citing_paper":"/paper/2507.12595"},"observation_digest":"sha256:0e1a18770a9cea8a15b6be23c5208dfb943a3b35f12c3e33281aea21b9684ad5","observation_id":"ab3c6371-0fd2-4e86-b964-08bcc5943917","resolution":{"observed_at":"2026-08-06T16:49:36.792819Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:36.932778Z","title":"The projected features are then fused using Tucker Decomposi- tion, where a core tensor T ∈ Rdf ×df ×df models the high- order interactions between features","venue":null,"work_id":"e4af3f29-1408-4211-aacd-31ad44b1e9c1","year":null},"citing_paper":{"arxiv_id":"2507.12595","last_updated":"2025-07-16T19:30:51Z","snapshot_observed_at":"2026-08-08T15:13:20.897014Z","submitted_at":"2025-07-16T19:30:51Z","title":"Enhancing In-Domain and Out-Domain EmoFake Detection via Cooperative Multilingual Speech Foundation Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:26.362848Z"},"links":{"citing_paper":"/paper/2507.12595"},"observation_digest":"sha256:072813c03183a6b46b379c42879cef635f41c3099e5077c32e792c67c2b6205d","observation_id":"f4bbbe07-ed8e-4892-8c2f-4283e552552b","resolution":{"observed_at":"2026-08-06T16:49:37.062031Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13774","last_updated":"2023-05-23T07:42:52Z","snapshot_observed_at":"2026-07-06T15:31:13.189124Z","submitted_at":"2023-05-23T07:42:52Z","title":"ADD 2023: the Second Audio Deepfake Detection Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13774","snapshot_observed_at":"2026-08-06T16:49:27.397372Z","title":"Add 2023: the second audio deepfake detection challenge,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12595","last_updated":"2025-07-16T19:30:51Z","snapshot_observed_at":"2026-08-08T15:13:20.897014Z","submitted_at":"2025-07-16T19:30:51Z","title":"Enhancing In-Domain and Out-Domain EmoFake Detection via Cooperative Multilingual Speech Foundation Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:27.397372Z"},"links":{"cited_paper":"/paper/2305.13774","citing_paper":"/paper/2507.12595"},"observation_digest":"sha256:087f98f930a6e146aa9639d850bca35b9d97f3a142329c09d83a6e19d3ee675f","observation_id":"1f3bb06b-db1f-447d-adb1-9834f0f44d1f","resolution":{"observed_at":"2026-08-06T16:49:27.397372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12595","last_updated":"2025-07-16T19:30:51Z","snapshot_observed_at":"2026-08-08T15:13:20.897014Z","submitted_at":"2025-07-16T19:30:51Z","title":"Enhancing In-Domain and Out-Domain EmoFake Detection via Cooperative Multilingual Speech Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.12595","snapshot_observed_at":"2026-08-06T16:49:26.014563Z","title":"However, despite these advancements, an under- explored yet critical dimension remains: scenarios where the emotional state of speech is artificially modified i.e","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.12595","last_updated":"2025-07-16T19:30:51Z","snapshot_observed_at":"2026-08-08T15:13:20.897014Z","submitted_at":"2025-07-16T19:30:51Z","title":"Enhancing In-Domain and Out-Domain EmoFake Detection via Cooperative Multilingual Speech Foundation Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:26.014563Z"},"links":{"cited_paper":"/paper/2507.12595","citing_paper":"/paper/2507.12595"},"observation_digest":"sha256:1afe971f04a301e06ad5cf81fba96dbec1c2ec06b95bdd9126f579451785b98c","observation_id":"838739be-3923-4839-af3a-dd0078da5c28","resolution":{"observed_at":"2026-08-06T16:49:26.014563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:36.368076Z","title":"Our comprehen- sive analysis confirms their superiority in both in-domain and cross-lingual settings","venue":null,"work_id":"f3854696-758f-4dae-a917-87a1ff48e157","year":null},"citing_paper":{"arxiv_id":"2507.12595","last_updated":"2025-07-16T19:30:51Z","snapshot_observed_at":"2026-08-08T15:13:20.897014Z","submitted_at":"2025-07-16T19:30:51Z","title":"Enhancing In-Domain and Out-Domain EmoFake Detection via Cooperative Multilingual Speech Foundation Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:26.580472Z"},"links":{"citing_paper":"/paper/2507.12595"},"observation_digest":"sha256:305f46dcc2699deed779dcd7469b3053ba14f87cbf8aef8ab40cc31a6adf64ed","observation_id":"76b2a696-fe67-4852-a007-feb5df332f39","resolution":{"observed_at":"2026-08-06T16:49:36.542799Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:36.042470Z","title":"ASVspoof 2015: the first automatic speaker verification spoofing and countermeasures chal- lenge,","venue":null,"work_id":"c3b2804d-1205-41c2-b032-973b54b2e28b","year":2015},"citing_paper":{"arxiv_id":"2507.12595","last_updated":"2025-07-16T19:30:51Z","snapshot_observed_at":"2026-08-08T15:13:20.897014Z","submitted_at":"2025-07-16T19:30:51Z","title":"Enhancing In-Domain and Out-Domain EmoFake Detection via Cooperative Multilingual Speech Foundation Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:26.728871Z"},"links":{"citing_paper":"/paper/2507.12595"},"observation_digest":"sha256:ea499fc2dbdc5f54c6321c57241cc9e7e0390aa5b418ef4961145f8b5d57349c","observation_id":"e1fffa2e-cbb1-49a2-b498-23fdfc41ebce","resolution":{"observed_at":"2026-08-06T16:49:36.198859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:35.671001Z","title":"The ASVspoof 2017 Challenge: Assessing the Limits of Replay Spoofing Attack Detection,","venue":null,"work_id":"00a60220-6f3c-4c65-adbf-4a08ef809c97","year":2017},"citing_paper":{"arxiv_id":"2507.12595","last_updated":"2025-07-16T19:30:51Z","snapshot_observed_at":"2026-08-08T15:13:20.897014Z","submitted_at":"2025-07-16T19:30:51Z","title":"Enhancing In-Domain and Out-Domain EmoFake Detection via Cooperative Multilingual Speech Foundation Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:26.848500Z"},"links":{"citing_paper":"/paper/2507.12595"},"observation_digest":"sha256:67d7ba471b52c23204f127aff697f0571e8be726766b4f2dfa821fc9e91e0608","observation_id":"2f882a3c-4ea7-4048-9c4a-462dd9fb6a8e","resolution":{"observed_at":"2026-08-06T16:49:35.831072Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:35.348625Z","title":"ASVspoof 2019: Fu- ture Horizons in Spoofed and Fake Audio Detection,","venue":null,"work_id":"a5d6600d-ddd9-495b-9867-79ed9e9e474f","year":2019},"citing_paper":{"arxiv_id":"2507.12595","last_updated":"2025-07-16T19:30:51Z","snapshot_observed_at":"2026-08-08T15:13:20.897014Z","submitted_at":"2025-07-16T19:30:51Z","title":"Enhancing In-Domain and Out-Domain EmoFake Detection via Cooperative Multilingual Speech Foundation Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:26.967618Z"},"links":{"citing_paper":"/paper/2507.12595"},"observation_digest":"sha256:33404b013006963785b1a273dce5b2ed34677846e0a301d6eb226698e38f848c","observation_id":"53172660-5363-45da-b2f6-4598abf9d420","resolution":{"observed_at":"2026-08-06T16:49:35.480805Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:35.023054Z","title":"ASVspoof 2021: ac- celerating progress in spoofed and deepfake speech detection,","venue":null,"work_id":"5bcf449b-5c97-4b3a-b50e-fbd838fadded","year":2021},"citing_paper":{"arxiv_id":"2507.12595","last_updated":"2025-07-16T19:30:51Z","snapshot_observed_at":"2026-08-08T15:13:20.897014Z","submitted_at":"2025-07-16T19:30:51Z","title":"Enhancing In-Domain and Out-Domain EmoFake Detection via Cooperative Multilingual Speech Foundation Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:27.097856Z"},"links":{"citing_paper":"/paper/2507.12595"},"observation_digest":"sha256:30151222ab8d2a6a79544e280967eb996c9050437632b5a88149818058524766","observation_id":"4d010a09-e6a8-4e5c-8de9-ff4edd2db105","resolution":{"observed_at":"2026-08-06T16:49:35.200538Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:34.744350Z","title":"Add 2022: the first audio deep synthesis detection challenge,","venue":null,"work_id":"05272093-7179-4493-8282-bdb2616b0561","year":2022},"citing_paper":{"arxiv_id":"2507.12595","last_updated":"2025-07-16T19:30:51Z","snapshot_observed_at":"2026-08-08T15:13:20.897014Z","submitted_at":"2025-07-16T19:30:51Z","title":"Enhancing In-Domain and Out-Domain EmoFake Detection via Cooperative Multilingual Speech Foundation Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:27.267171Z"},"links":{"citing_paper":"/paper/2507.12595"},"observation_digest":"sha256:38096876dcc60c7e09b115f48759865ccd9f070c5c8e0e4b77af3ad997789b3d","observation_id":"8548c05f-232e-4091-a30a-012582ab1980","resolution":{"observed_at":"2026-08-06T16:49:34.893476Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09512","last_updated":"2026-05-18T13:28:38Z","snapshot_observed_at":"2026-07-06T17:17:03.447619Z","submitted_at":"2024-01-17T15:09:02Z","title":"MLAAD: The Multi-Language Audio Anti-Spoofing Dataset","version":10},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.09512","snapshot_observed_at":"2026-08-06T16:49:27.535796Z","title":"Mlaad: The multi-language audio anti-spoofing dataset,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12595","last_updated":"2025-07-16T19:30:51Z","snapshot_observed_at":"2026-08-08T15:13:20.897014Z","submitted_at":"2025-07-16T19:30:51Z","title":"Enhancing In-Domain and Out-Domain EmoFake Detection via Cooperative Multilingual Speech Foundation Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:27.535796Z"},"links":{"cited_paper":"/paper/2401.09512","citing_paper":"/paper/2507.12595"},"observation_digest":"sha256:19677586606909f3ca692c99a6dcf29fded2b4180906f7c25a27a64e66c92fa8","observation_id":"66316a3a-d344-4529-a0f6-9e974b92de00","resolution":{"observed_at":"2026-08-06T16:49:27.535796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:34.540506Z","title":"Singfake: Singing voice deepfake detection,","venue":null,"work_id":"217aa866-f347-4ef3-9bf1-498ddbc3a078","year":2024},"citing_paper":{"arxiv_id":"2507.12595","last_updated":"2025-07-16T19:30:51Z","snapshot_observed_at":"2026-08-08T15:13:20.897014Z","submitted_at":"2025-07-16T19:30:51Z","title":"Enhancing In-Domain and Out-Domain EmoFake Detection via Cooperative Multilingual Speech Foundation Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:27.655664Z"},"links":{"citing_paper":"/paper/2507.12595"},"observation_digest":"sha256:fffb74e74ff8ad4e80f6cd0961a5b4cb3c98e6a3cab2d70fa39ebf5ef0548546","observation_id":"eadbfb0d-e27c-4bf1-a4e6-29ccd3c45bac","resolution":{"observed_at":"2026-08-06T16:49:34.631536Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:34.281286Z","title":"Scenefake: An initial dataset and benchmarks for scene fake audio detection,","venue":null,"work_id":"2f4fe554-9f60-47d9-8aa7-041f524195f9","year":2024},"citing_paper":{"arxiv_id":"2507.12595","last_updated":"2025-07-16T19:30:51Z","snapshot_observed_at":"2026-08-08T15:13:20.897014Z","submitted_at":"2025-07-16T19:30:51Z","title":"Enhancing In-Domain and Out-Domain EmoFake Detection via Cooperative Multilingual Speech Foundation Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:27.756654Z"},"links":{"citing_paper":"/paper/2507.12595"},"observation_digest":"sha256:fc866e76d8049a2f0d1ce5aed5697752dfd60928920bde3934b8db90fccd7796","observation_id":"4822b577-e0bf-4caf-a6c1-a31d2bfe7d32","resolution":{"observed_at":"2026-08-06T16:49:34.428750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:34.021484Z","title":"Emofake: An initial dataset for emotion fake audio detection,","venue":null,"work_id":"da6c5b17-24d4-45c8-91be-9f46201da5b4","year":2024},"citing_paper":{"arxiv_id":"2507.12595","last_updated":"2025-07-16T19:30:51Z","snapshot_observed_at":"2026-08-08T15:13:20.897014Z","submitted_at":"2025-07-16T19:30:51Z","title":"Enhancing In-Domain and Out-Domain EmoFake Detection via Cooperative Multilingual Speech Foundation Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:27.896955Z"},"links":{"citing_paper":"/paper/2507.12595"},"observation_digest":"sha256:21983d67d071a40edd030502ebc5f070cdd46f2513f3511ba7e1793b435ebcc1","observation_id":"d7689fa9-ed8b-4ef2-bf0c-31dd2530f029","resolution":{"observed_at":"2026-08-06T16:49:34.153219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:33.762807Z","title":"Im- proved deepfake detection using whisper features,","venue":null,"work_id":"71f0b4db-dd8e-4509-add4-f81cb37e7ad1","year":2023},"citing_paper":{"arxiv_id":"2507.12595","last_updated":"2025-07-16T19:30:51Z","snapshot_observed_at":"2026-08-08T15:13:20.897014Z","submitted_at":"2025-07-16T19:30:51Z","title":"Enhancing In-Domain and Out-Domain EmoFake Detection via Cooperative Multilingual Speech Foundation Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:28.055676Z"},"links":{"citing_paper":"/paper/2507.12595"},"observation_digest":"sha256:aa13062bbe6f41156f566c5730a5c70a30658baeec070ead9246e3aea936d887","observation_id":"b5a831cd-7e32-40a1-8fd3-a867dd034679","resolution":{"observed_at":"2026-08-06T16:49:33.906117Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:33.539893Z","title":"Detection of deepfake environmental audio,","venue":null,"work_id":"22bf4cd0-76d0-4d39-9be5-bbdc9f497b09","year":2024},"citing_paper":{"arxiv_id":"2507.12595","last_updated":"2025-07-16T19:30:51Z","snapshot_observed_at":"2026-08-08T15:13:20.897014Z","submitted_at":"2025-07-16T19:30:51Z","title":"Enhancing In-Domain and Out-Domain EmoFake Detection via Cooperative Multilingual Speech Foundation Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:28.214441Z"},"links":{"citing_paper":"/paper/2507.12595"},"observation_digest":"sha256:4bb8a9bbd9ef176fb01a767f1b5ddd6f5b3058a57a871a9dca13be72d14e88bd","observation_id":"ae5fd083-1d83-417c-b53f-85e2eed824d9","resolution":{"observed_at":"2026-08-06T16:49:33.636322Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:33.319659Z","title":"Exploring wavlm back-ends for speech spoofing and deepfake detection,","venue":null,"work_id":"685adb77-02ef-4cc4-b956-9dd6649929b3","year":2024},"citing_paper":{"arxiv_id":"2507.12595","last_updated":"2025-07-16T19:30:51Z","snapshot_observed_at":"2026-08-08T15:13:20.897014Z","submitted_at":"2025-07-16T19:30:51Z","title":"Enhancing In-Domain and Out-Domain EmoFake Detection via Cooperative Multilingual Speech Foundation Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:28.334736Z"},"links":{"citing_paper":"/paper/2507.12595"},"observation_digest":"sha256:b5cb5c164d661c32d2a503277691f6b863a1c009f08d8cbaf6a7e8a1c9701444","observation_id":"dd028d11-dce9-48d8-b051-ed2a0c04ffb4","resolution":{"observed_at":"2026-08-06T16:49:33.406192Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:33.114044Z","title":"Investi- gation of ensemble features of self-supervised pretrained models for automatic speech recognition,","venue":null,"work_id":"37b0d43a-349d-42b6-b32d-b3a08a2c5caf","year":2022},"citing_paper":{"arxiv_id":"2507.12595","last_updated":"2025-07-16T19:30:51Z","snapshot_observed_at":"2026-08-08T15:13:20.897014Z","submitted_at":"2025-07-16T19:30:51Z","title":"Enhancing In-Domain and Out-Domain EmoFake Detection via Cooperative Multilingual Speech Foundation Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:28.459922Z"},"links":{"citing_paper":"/paper/2507.12595"},"observation_digest":"sha256:1d36e0dbfe7e8ae2d8447413faad6edde87e09548f19eb3a81e74fe4823bbecd","observation_id":"4c1a7829-1fc2-4c9c-a498-e1803d486d42","resolution":{"observed_at":"2026-08-06T16:49:33.244477Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:32.922176Z","title":"Investigation of ensemble of self-supervised models for speech emotion recognition,","venue":null,"work_id":"6c4cfcc8-8779-487a-856d-83e5d2bd1552","year":2023},"citing_paper":{"arxiv_id":"2507.12595","last_updated":"2025-07-16T19:30:51Z","snapshot_observed_at":"2026-08-08T15:13:20.897014Z","submitted_at":"2025-07-16T19:30:51Z","title":"Enhancing In-Domain and Out-Domain EmoFake Detection via Cooperative Multilingual Speech Foundation Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:28.589315Z"},"links":{"citing_paper":"/paper/2507.12595"},"observation_digest":"sha256:b6ebe434f0fd65efb0429de2d81c4fee8e0fcb6d71cd88c32bea50fa848e055a","observation_id":"66170b6b-a1da-442c-ba5b-d78e9a4c033f","resolution":{"observed_at":"2026-08-06T16:49:32.968592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:32.702062Z","title":"Heterogeneity over homogeneity: Investigating multilingual speech pre-trained models for detecting audio deepfake,","venue":null,"work_id":"51e4f8ce-4b14-447d-a80a-221c2099a4aa","year":2024},"citing_paper":{"arxiv_id":"2507.12595","last_updated":"2025-07-16T19:30:51Z","snapshot_observed_at":"2026-08-08T15:13:20.897014Z","submitted_at":"2025-07-16T19:30:51Z","title":"Enhancing In-Domain and Out-Domain EmoFake Detection via Cooperative Multilingual Speech Foundation Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:28.717358Z"},"links":{"citing_paper":"/paper/2507.12595"},"observation_digest":"sha256:6de77be0909c4a69f7eba003e58b1b933816aa461c15852c5abbae9a29b1b4f4","observation_id":"83c91593-4ab3-4cfa-a532-fbe584180d6a","resolution":{"observed_at":"2026-08-06T16:49:32.859480Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:32.409821Z","title":"Wavlm: Large-scale self-supervised pre-training for full stack speech processing,","venue":null,"work_id":"aa7087ed-14c8-4317-83dd-38978cd3938f","year":2022},"citing_paper":{"arxiv_id":"2507.12595","last_updated":"2025-07-16T19:30:51Z","snapshot_observed_at":"2026-08-08T15:13:20.897014Z","submitted_at":"2025-07-16T19:30:51Z","title":"Enhancing In-Domain and Out-Domain EmoFake Detection via Cooperative Multilingual Speech Foundation Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:28.862554Z"},"links":{"citing_paper":"/paper/2507.12595"},"observation_digest":"sha256:d3d58a00d7632d02462ecb704ee312fe6e759694ae843af08d82805dfd2a86e9","observation_id":"ce4baea6-bcc6-43a0-8d59-e25da3c9d3de","resolution":{"observed_at":"2026-08-06T16:49:32.560832Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:31.979633Z","title":"Unispeech-sat: Universal speech repre- sentation learning with speaker aware pre-training,","venue":null,"work_id":"4c560590-b5ad-4eec-994d-9ab0c29ba1b8","year":2022},"citing_paper":{"arxiv_id":"2507.12595","last_updated":"2025-07-16T19:30:51Z","snapshot_observed_at":"2026-08-08T15:13:20.897014Z","submitted_at":"2025-07-16T19:30:51Z","title":"Enhancing In-Domain and Out-Domain EmoFake Detection via Cooperative Multilingual Speech Foundation Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:28.986105Z"},"links":{"citing_paper":"/paper/2507.12595"},"observation_digest":"sha256:7c11c461cd8d692a8182e7105b0ea4fda11ef0bba0ffce906cfc0de1ea5a82ee","observation_id":"36ba3077-b2ea-4445-8f2a-233d81d0766d","resolution":{"observed_at":"2026-08-06T16:49:32.168224Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:31.678284Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech representations,","venue":null,"work_id":"f593dfbb-9648-4c6e-8fd7-d39cfe48b764","year":2020},"citing_paper":{"arxiv_id":"2507.12595","last_updated":"2025-07-16T19:30:51Z","snapshot_observed_at":"2026-08-08T15:13:20.897014Z","submitted_at":"2025-07-16T19:30:51Z","title":"Enhancing In-Domain and Out-Domain EmoFake Detection via Cooperative Multilingual Speech Foundation Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:29.189544Z"},"links":{"citing_paper":"/paper/2507.12595"},"observation_digest":"sha256:2da88065e80437a46096dcca220a5398acc7200bf35768c29c8d4e7d01d2672b","observation_id":"562ed369-5747-4e20-87d4-ac1b77ba64f0","resolution":{"observed_at":"2026-08-06T16:49:31.723379Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:31.559228Z","title":"Hubert: Self-supervised speech representation learning by masked prediction of hidden units,","venue":null,"work_id":"3e7838e4-f6d0-49ab-992a-ea120a0719dc","year":2021},"citing_paper":{"arxiv_id":"2507.12595","last_updated":"2025-07-16T19:30:51Z","snapshot_observed_at":"2026-08-08T15:13:20.897014Z","submitted_at":"2025-07-16T19:30:51Z","title":"Enhancing In-Domain and Out-Domain EmoFake Detection via Cooperative Multilingual Speech Foundation Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:29.294173Z"},"links":{"citing_paper":"/paper/2507.12595"},"observation_digest":"sha256:40a4c682ad0955e53845de3bc12295cafab279f315e6e08e9b1100885b8f1890","observation_id":"0ea59450-ff9b-4d66-8433-ba7ee0ee6e93","resolution":{"observed_at":"2026-08-06T16:49:31.606210Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:31.361419Z","title":"Xls-r: Self-supervised cross-lingual speech representation learning at scale,","venue":null,"work_id":"7c4f005c-5668-406f-94fa-1720b0c8cda1","year":2022},"citing_paper":{"arxiv_id":"2507.12595","last_updated":"2025-07-16T19:30:51Z","snapshot_observed_at":"2026-08-08T15:13:20.897014Z","submitted_at":"2025-07-16T19:30:51Z","title":"Enhancing In-Domain and Out-Domain EmoFake Detection via Cooperative Multilingual Speech Foundation Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:29.417119Z"},"links":{"citing_paper":"/paper/2507.12595"},"observation_digest":"sha256:3f24f9648f0414eb56be4150464a8d95534c9653137da7d8ffccd66cf5cffedc","observation_id":"3c295996-d049-4d4e-a4bc-c5a57ab2a60d","resolution":{"observed_at":"2026-08-06T16:49:31.457878Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:29.545716Z","title":"Robust speech recognition via large-scale weak supervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12595","last_updated":"2025-07-16T19:30:51Z","snapshot_observed_at":"2026-08-08T15:13:20.897014Z","submitted_at":"2025-07-16T19:30:51Z","title":"Enhancing In-Domain and Out-Domain EmoFake Detection via Cooperative Multilingual Speech Foundation Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:29.545716Z"},"links":{"citing_paper":"/paper/2507.12595"},"observation_digest":"sha256:baedad557cedf41ef83c340e3b09371930fbc0bb25f49bd8030e596f003ac65c","observation_id":"45a42136-71e2-499a-a8ea-d9423a94dd5e","resolution":{"observed_at":"2026-08-06T16:49:29.545716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:31.024859Z","title":"Scaling speech technology to 1,000+ languages,","venue":null,"work_id":"d5c7499e-649d-4d81-92f4-6ec219c9f5ce","year":2024},"citing_paper":{"arxiv_id":"2507.12595","last_updated":"2025-07-16T19:30:51Z","snapshot_observed_at":"2026-08-08T15:13:20.897014Z","submitted_at":"2025-07-16T19:30:51Z","title":"Enhancing In-Domain and Out-Domain EmoFake Detection via Cooperative Multilingual Speech Foundation Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:29.729728Z"},"links":{"citing_paper":"/paper/2507.12595"},"observation_digest":"sha256:fb517907efd128a2fb9c66065a31feacdde256d3fd321d709c98998280282cac","observation_id":"ce83244b-cd4a-4fe5-898d-f3d462781914","resolution":{"observed_at":"2026-08-06T16:49:31.178127Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:30.769515Z","title":"X-vectors: Robust dnn embeddings for speaker recognition,","venue":null,"work_id":"9e0c1dc4-54ed-4930-a811-13ed780c74b8","year":2018},"citing_paper":{"arxiv_id":"2507.12595","last_updated":"2025-07-16T19:30:51Z","snapshot_observed_at":"2026-08-08T15:13:20.897014Z","submitted_at":"2025-07-16T19:30:51Z","title":"Enhancing In-Domain and Out-Domain EmoFake Detection via Cooperative Multilingual Speech Foundation Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:29.841758Z"},"links":{"citing_paper":"/paper/2507.12595"},"observation_digest":"sha256:5cf4311c4a6629b54485124cfd3a647069d31be4480f6d580e37633d965d875e","observation_id":"72f10ea0-7940-41d3-8853-067124a60b30","resolution":{"observed_at":"2026-08-06T16:49:30.905187Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:30.434532Z","title":"X- vectors meet emotions: A study on dependencies between emotion and speaker recognition,","venue":null,"work_id":"5f55c45e-1b0f-4a85-8ed1-45137c00ed56","year":2020},"citing_paper":{"arxiv_id":"2507.12595","last_updated":"2025-07-16T19:30:51Z","snapshot_observed_at":"2026-08-08T15:13:20.897014Z","submitted_at":"2025-07-16T19:30:51Z","title":"Enhancing In-Domain and Out-Domain EmoFake Detection via Cooperative Multilingual Speech Foundation Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:29.925644Z"},"links":{"citing_paper":"/paper/2507.12595"},"observation_digest":"sha256:67f53675b99008df276d8e4315a36e90097732bab9679ebcde53bfd4e86aea7c","observation_id":"115fbe28-5486-4ddd-bc13-8db3b3627d03","resolution":{"observed_at":"2026-08-06T16:49:30.529996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00107","last_updated":"2024-12-27T12:28:34Z","snapshot_observed_at":"2026-08-06T16:16:34.606158Z","submitted_at":"2023-05-31T18:27:43Z","title":"MERT: Acoustic Music Understanding Model with Large-Scale Self-supervised Training","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.00107","snapshot_observed_at":"2026-08-06T16:49:30.038796Z","title":"Mert: Acoustic music understanding model with large-scale self-supervised training,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12595","last_updated":"2025-07-16T19:30:51Z","snapshot_observed_at":"2026-08-08T15:13:20.897014Z","submitted_at":"2025-07-16T19:30:51Z","title":"Enhancing In-Domain and Out-Domain EmoFake Detection via Cooperative Multilingual Speech Foundation Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:30.038796Z"},"links":{"cited_paper":"/paper/2306.00107","citing_paper":"/paper/2507.12595"},"observation_digest":"sha256:a47561cb22c678d1cbdb16b1e3f227d6c90e2b0a3315ac2ecf34177229bcca49","observation_id":"8bb2fca9-b7d9-4b04-8130-381de20ba017","resolution":{"observed_at":"2026-08-06T16:49:30.038796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.02508","last_updated":"2022-12-05T16:04:26Z","snapshot_observed_at":"2026-08-04T02:25:10.395165Z","submitted_at":"2022-12-05T16:04:26Z","title":"MAP-Music2Vec: A Simple and Effective Baseline for Self-Supervised Music Audio Representation Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.02508","snapshot_observed_at":"2026-08-06T16:49:30.258365Z","title":"Map- music2vec: A simple and effective baseline for self-supervised music audio representation learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.12595","last_updated":"2025-07-16T19:30:51Z","snapshot_observed_at":"2026-08-08T15:13:20.897014Z","submitted_at":"2025-07-16T19:30:51Z","title":"Enhancing In-Domain and Out-Domain EmoFake Detection via Cooperative Multilingual Speech Foundation Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:30.258365Z"},"links":{"cited_paper":"/paper/2212.02508","citing_paper":"/paper/2507.12595"},"observation_digest":"sha256:5f8bf1da49e7e7004bb636008911285df451702e6a99cf47f38b76c075f5ef85","observation_id":"4ae0d372-7c74-45ee-999e-cd7dff9e041a","resolution":{"observed_at":"2026-08-06T16:49:30.258365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.12595","last_updated":"2025-07-16T19:30:51Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-08T15:13:20.897014Z","submitted_at":"2025-07-16T19:30:51Z","title":"Enhancing In-Domain and Out-Domain EmoFake Detection via Cooperative Multilingual Speech Foundation Models"},"reference_resolution":{"displayed":34,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":7,"verified_exact":0,"verified_fuzzy":26},"total_outbound_references":34},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 34 of 34 outbound references and 2 inbound Pith citation observations for arXiv:2507.12595."}