{"as_of":"2026-08-11T12:19:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e1332409e9ebad7fc16cdc38a61886e901f3c33555c883f2f4861563c7986551","coverage":[{"denominator":28,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":28,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-29T05:19:26.613301Z","state":"measured"},{"denominator":30,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":30,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T01:12:30.652884Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2606.10791","last_updated":"2026-06-26T07:49:38Z","snapshot_observed_at":"2026-08-09T08:36:08.533336Z","submitted_at":"2026-06-09T12:42:14Z","title":"Overview of ESDD2: Environment-Aware Speech and Sound Deepfake Detection Challenge","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.10791","snapshot_observed_at":"2026-07-11T12:34:20.057072Z","title":"Overview of esdd2: Environment-aware speech and sound deepfake detection challenge,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.04848","last_updated":"2026-07-06T09:19:03Z","snapshot_observed_at":"2026-08-07T07:26:18.976803Z","submitted_at":"2026-07-06T09:19:03Z","title":"SynSFX: Multi-Model Sound Effects Synthesis Dataset for Deepfake Detection and Evaluation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-11T12:34:20.057072Z"},"links":{"cited_paper":"/paper/2606.10791","citing_paper":"/paper/2607.04848"},"observation_digest":"sha256:768b2f98d79a7ef296cf42433eb799aa30b45064ef663ece163f7022624c0277","observation_id":"5bf1ba35-306a-4e43-8ba6-63af0b17ca99","resolution":{"observed_at":"2026-07-11T12:34:20.057072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.10791","last_updated":"2026-06-26T07:49:38Z","snapshot_observed_at":"2026-08-09T08:36:08.533336Z","submitted_at":"2026-06-09T12:42:14Z","title":"Overview of ESDD2: Environment-Aware Speech and Sound Deepfake Detection Challenge","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.10791","snapshot_observed_at":"2026-08-02T01:12:30.652884Z","title":"Overview of esdd2: Environment-aware speech and sound deepfake detection challenge,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14753","last_updated":"2026-07-16T09:38:45Z","snapshot_observed_at":"2026-08-08T00:38:13.414993Z","submitted_at":"2026-07-16T09:38:45Z","title":"Large Audio Language Models for Spoofing-Aware Speaker Verification","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T01:12:30.652884Z"},"links":{"cited_paper":"/paper/2606.10791","citing_paper":"/paper/2607.14753"},"observation_digest":"sha256:1713614c58b8296de23d307beff100a16214905f322cc0e3ef5caf0cf10ae572","observation_id":"d1286339-70b2-46c1-99ef-d8ef0b441fa1","resolution":{"observed_at":"2026-08-02T01:12:30.652884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2606.10791/citation-record","integrity":"/paper/2606.10791/integrity","json":"/paper/2606.10791/citation-record.json","paper":"/paper/2606.10791"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:19:26.613301Z","title":"Compspoof: A dataset and joint learning framework for component- level audio anti-spoofing countermeasures,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.10791","last_updated":"2026-06-26T07:49:38Z","snapshot_observed_at":"2026-08-09T08:36:08.533336Z","submitted_at":"2026-06-09T12:42:14Z","title":"Overview of ESDD2: Environment-Aware Speech and Sound Deepfake Detection Challenge","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-29T05:19:26.613301Z"},"links":{"citing_paper":"/paper/2606.10791"},"observation_digest":"sha256:323781178d1c0884ae2a8cd60e0e21f57b09f305a06e84dfa96207e9fd1a4ade","observation_id":"232f632b-1db2-4788-92c3-4c5dec6ffe09","resolution":{"observed_at":"2026-06-29T05:19:26.613301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:19:26.613301Z","title":"Environmental sound deepfake detection challenge: An overview,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.10791","last_updated":"2026-06-26T07:49:38Z","snapshot_observed_at":"2026-08-09T08:36:08.533336Z","submitted_at":"2026-06-09T12:42:14Z","title":"Overview of ESDD2: Environment-Aware Speech and Sound Deepfake Detection Challenge","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-29T05:19:26.613301Z"},"links":{"citing_paper":"/paper/2606.10791"},"observation_digest":"sha256:8e47bd6ba196cf2211686e56f415420139daa2687668078bc8f6253c2ca8d02d","observation_id":"19d3c7f0-05cf-44db-bb8c-db9954dd9bc4","resolution":{"observed_at":"2026-06-29T05:19:26.613301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2508.04529","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T17:13:45.455667Z","title":"Esdd 2026: Environmental sound deepfake detection challenge evalu- ation plan","venue":null,"work_id":"8997fd5f-979f-49a5-b0f6-e8b0eb732c61","year":2026},"citing_paper":{"arxiv_id":"2606.10791","last_updated":"2026-06-26T07:49:38Z","snapshot_observed_at":"2026-08-09T08:36:08.533336Z","submitted_at":"2026-06-09T12:42:14Z","title":"Overview of ESDD2: Environment-Aware Speech and Sound Deepfake Detection Challenge","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-29T05:19:26.613301Z"},"links":{"citing_paper":"/paper/2606.10791"},"observation_digest":"sha256:3f430d4f77db36e442b318850a968e9b98600c03f5fb2a1a491797ca84467c1a","observation_id":"2bf0a484-d791-4479-8812-b50d30a90bc8","resolution":{"observed_at":"2026-06-29T17:13:45.457367Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.04865","last_updated":"2026-06-17T11:18:27Z","snapshot_observed_at":"2026-08-09T08:36:28.000231Z","submitted_at":"2026-03-05T06:40:57Z","title":"The First Environmental Sound Deepfake Detection Challenge: Benchmarking Robustness, Evaluation, and Insights","version":4},"cited_work":{"arxiv_id":"2603.04865","doi":null,"metadata_source":"pith","pith_arxiv_id":"2603.04865","snapshot_observed_at":"2026-06-29T17:13:45.458715Z","title":"The First Environmental Sound Deepfake Detection Challenge: Benchmarking Robustness, Evaluation, and Insights","venue":"cs.SD","work_id":"93de66f6-e6c2-43b6-b65a-6e6be4575ce0","year":2026},"citing_paper":{"arxiv_id":"2606.10791","last_updated":"2026-06-26T07:49:38Z","snapshot_observed_at":"2026-08-09T08:36:08.533336Z","submitted_at":"2026-06-09T12:42:14Z","title":"Overview of ESDD2: Environment-Aware Speech and Sound Deepfake Detection Challenge","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-29T05:19:26.613301Z"},"links":{"cited_paper":"/paper/2603.04865","citing_paper":"/paper/2606.10791"},"observation_digest":"sha256:827ee44649d56f1a181a8210ab53b7e9269659bf1081afd71590aa82d0c0b3fc","observation_id":"b57569d5-309e-4f9d-8d95-3de276efdd9f","resolution":{"observed_at":"2026-06-29T17:13:45.460141Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:19:26.613301Z","title":"Audiocaps: Generating captions for audios in the wild,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.10791","last_updated":"2026-06-26T07:49:38Z","snapshot_observed_at":"2026-08-09T08:36:08.533336Z","submitted_at":"2026-06-09T12:42:14Z","title":"Overview of ESDD2: Environment-Aware Speech and Sound Deepfake Detection Challenge","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-29T05:19:26.613301Z"},"links":{"citing_paper":"/paper/2606.10791"},"observation_digest":"sha256:c2e19fdf21c6252916646e418c4974b79892f5f08446025dd6f8a5e382140943","observation_id":"9ab58271-24bf-4981-9bf9-8086b5837f7c","resolution":{"observed_at":"2026-06-29T05:19:26.613301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:19:26.613301Z","title":"Vggsound: A large-scale audio-visual dataset,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.10791","last_updated":"2026-06-26T07:49:38Z","snapshot_observed_at":"2026-08-09T08:36:08.533336Z","submitted_at":"2026-06-09T12:42:14Z","title":"Overview of ESDD2: Environment-Aware Speech and Sound Deepfake Detection Challenge","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-29T05:19:26.613301Z"},"links":{"citing_paper":"/paper/2606.10791"},"observation_digest":"sha256:d7d0f0abbea02898fc1056a0acf221d9c4ab5a87d51e554565859f0048096906","observation_id":"042c6abe-6b0e-4fd5-8bf6-590efff56f36","resolution":{"observed_at":"2026-06-29T05:19:26.613301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:19:26.613301Z","title":"Common voice: A massively-multilingual speech corpus,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.10791","last_updated":"2026-06-26T07:49:38Z","snapshot_observed_at":"2026-08-09T08:36:08.533336Z","submitted_at":"2026-06-09T12:42:14Z","title":"Overview of ESDD2: Environment-Aware Speech and Sound Deepfake Detection Challenge","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-29T05:19:26.613301Z"},"links":{"citing_paper":"/paper/2606.10791"},"observation_digest":"sha256:639af653cb931fdc4f19fa50a7660d00492eddbc4dcbc75e5170b3b42cd2fd9f","observation_id":"07539c61-dfc3-428f-9337-3b6ef6df7c10","resolution":{"observed_at":"2026-06-29T05:19:26.613301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:19:26.613301Z","title":"Libritts: A corpus derived from librispeech for text-to-speech,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.10791","last_updated":"2026-06-26T07:49:38Z","snapshot_observed_at":"2026-08-09T08:36:08.533336Z","submitted_at":"2026-06-09T12:42:14Z","title":"Overview of ESDD2: Environment-Aware Speech and Sound Deepfake Detection Challenge","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-29T05:19:26.613301Z"},"links":{"citing_paper":"/paper/2606.10791"},"observation_digest":"sha256:1316605a6a21df364af9f168ae1b68288dc7ebdbf2a40ca26654830cbbccb60a","observation_id":"56ae0c1a-0697-4f19-a148-40ae387b432a","resolution":{"observed_at":"2026-06-29T05:19:26.613301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:19:26.613301Z","title":"Enhancing Speaking Styles in Conversational Text-to- Speech Synthesis with Graph-Based Multi-Modal Context Modeling,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.10791","last_updated":"2026-06-26T07:49:38Z","snapshot_observed_at":"2026-08-09T08:36:08.533336Z","submitted_at":"2026-06-09T12:42:14Z","title":"Overview of ESDD2: Environment-Aware Speech and Sound Deepfake Detection Challenge","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-29T05:19:26.613301Z"},"links":{"citing_paper":"/paper/2606.10791"},"observation_digest":"sha256:80b730788c55063c75519946c75b65e1681c8ded1a60f2b8d03e99391dac1d21","observation_id":"f5336ba8-0f17-41cb-990e-8f9ceda0d07d","resolution":{"observed_at":"2026-06-29T05:19:26.613301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:19:26.613301Z","title":"TAU urban acoustic scenes 2019 open set, development dataset,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.10791","last_updated":"2026-06-26T07:49:38Z","snapshot_observed_at":"2026-08-09T08:36:08.533336Z","submitted_at":"2026-06-09T12:42:14Z","title":"Overview of ESDD2: Environment-Aware Speech and Sound Deepfake Detection Challenge","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-29T05:19:26.613301Z"},"links":{"citing_paper":"/paper/2606.10791"},"observation_digest":"sha256:0f0f0aca210c0d3c11b2346d522e2d370a190a21bfa9be4f04e4084ef2e527f7","observation_id":"3ff9eef4-abe3-4784-a5eb-70cfeb577d1c","resolution":{"observed_at":"2026-06-29T05:19:26.613301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:19:26.613301Z","title":"Tut database for acoustic scene classification and sound event detection,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2606.10791","last_updated":"2026-06-26T07:49:38Z","snapshot_observed_at":"2026-08-09T08:36:08.533336Z","submitted_at":"2026-06-09T12:42:14Z","title":"Overview of ESDD2: Environment-Aware Speech and Sound Deepfake Detection Challenge","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-29T05:19:26.613301Z"},"links":{"citing_paper":"/paper/2606.10791"},"observation_digest":"sha256:b1323d4ec06f04ee42bba6d61779acaa3b5b7ab170780294a3abbdc004f82923","observation_id":"f996d014-f2a6-4539-9b04-341c18729f27","resolution":{"observed_at":"2026-06-29T05:19:26.613301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:19:26.613301Z","title":"Tut sound events 2017, development dataset,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.10791","last_updated":"2026-06-26T07:49:38Z","snapshot_observed_at":"2026-08-09T08:36:08.533336Z","submitted_at":"2026-06-09T12:42:14Z","title":"Overview of ESDD2: Environment-Aware Speech and Sound Deepfake Detection Challenge","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-29T05:19:26.613301Z"},"links":{"citing_paper":"/paper/2606.10791"},"observation_digest":"sha256:34095b0ec72b17c9974a8b19a82349f42ac10682542ef181eb6c0bdd170da5f7","observation_id":"48cdeae3-1491-4c41-84fa-7d32dcf00ba7","resolution":{"observed_at":"2026-06-29T05:19:26.613301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:19:26.613301Z","title":"Tut sound events 2017, evaluation dataset,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.10791","last_updated":"2026-06-26T07:49:38Z","snapshot_observed_at":"2026-08-09T08:36:08.533336Z","submitted_at":"2026-06-09T12:42:14Z","title":"Overview of ESDD2: Environment-Aware Speech and Sound Deepfake Detection Challenge","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-29T05:19:26.613301Z"},"links":{"citing_paper":"/paper/2606.10791"},"observation_digest":"sha256:613f22530bafc6ad2c153714d4dac24b3c58875ad47b66e6857c75272e3d30e2","observation_id":"253bd668-0da4-4fef-a7b1-ac8188142c26","resolution":{"observed_at":"2026-06-29T05:19:26.613301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:19:26.613301Z","title":"A dataset and taxonomy for urban sound research,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2606.10791","last_updated":"2026-06-26T07:49:38Z","snapshot_observed_at":"2026-08-09T08:36:08.533336Z","submitted_at":"2026-06-09T12:42:14Z","title":"Overview of ESDD2: Environment-Aware Speech and Sound Deepfake Detection Challenge","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-29T05:19:26.613301Z"},"links":{"citing_paper":"/paper/2606.10791"},"observation_digest":"sha256:de9ed9e86d70dbde91a2d0070ea22fdacaaf026585c4584ab91601b5a7e0f1bc","observation_id":"c5f8cd24-7d0f-48fc-aa2e-a672c9eff077","resolution":{"observed_at":"2026-06-29T05:19:26.613301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:19:26.613301Z","title":"Envsdd: Benchmarking environ- mental sound deepfake detection,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.10791","last_updated":"2026-06-26T07:49:38Z","snapshot_observed_at":"2026-08-09T08:36:08.533336Z","submitted_at":"2026-06-09T12:42:14Z","title":"Overview of ESDD2: Environment-Aware Speech and Sound Deepfake Detection Challenge","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-29T05:19:26.613301Z"},"links":{"citing_paper":"/paper/2606.10791"},"observation_digest":"sha256:c285f4eadbcfc0c371f4a9f68d0430c7c92abbc3f324c196bec828e26e22fbb9","observation_id":"9fee1ee3-771f-4ddf-9651-48ab1da8805c","resolution":{"observed_at":"2026-06-29T05:19:26.613301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:19:26.613301Z","title":"VCapA V: A Video-Caption Based Audio-Visual Deepfake Detection Dataset,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.10791","last_updated":"2026-06-26T07:49:38Z","snapshot_observed_at":"2026-08-09T08:36:08.533336Z","submitted_at":"2026-06-09T12:42:14Z","title":"Overview of ESDD2: Environment-Aware Speech and Sound Deepfake Detection Challenge","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-29T05:19:26.613301Z"},"links":{"citing_paper":"/paper/2606.10791"},"observation_digest":"sha256:1f58c8a7c015818e06c0e49ddae7bf62268d748a2e22d6bf88611bd8890994cc","observation_id":"5c1e80e0-bc0a-40bb-9e6a-9f96660dfd06","resolution":{"observed_at":"2026-06-29T05:19:26.613301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:19:26.613301Z","title":"Asvspoof 5: crowdsourced speech data, deepfakes, and adversarial attacks at scale,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10791","last_updated":"2026-06-26T07:49:38Z","snapshot_observed_at":"2026-08-09T08:36:08.533336Z","submitted_at":"2026-06-09T12:42:14Z","title":"Overview of ESDD2: Environment-Aware Speech and Sound Deepfake Detection Challenge","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-29T05:19:26.613301Z"},"links":{"citing_paper":"/paper/2606.10791"},"observation_digest":"sha256:399c67db0b29b6b110e1ae33f75bd8a76f8e6884d16107936e9a31d23025d688","observation_id":"dcaa45db-68c8-48af-a0a2-6b1e3ebf5e71","resolution":{"observed_at":"2026-06-29T05:19:26.613301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:19:26.613301Z","title":"Mlaad: The multi-language audio anti-spoofing dataset,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10791","last_updated":"2026-06-26T07:49:38Z","snapshot_observed_at":"2026-08-09T08:36:08.533336Z","submitted_at":"2026-06-09T12:42:14Z","title":"Overview of ESDD2: Environment-Aware Speech and Sound Deepfake Detection Challenge","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-29T05:19:26.613301Z"},"links":{"citing_paper":"/paper/2606.10791"},"observation_digest":"sha256:48e5c61e7f0b228b528e02d1219a0238e203697dc1bea5ee3150233310337602","observation_id":"c9b0f8ee-ca98-4520-9edc-d0aa8b844723","resolution":{"observed_at":"2026-06-29T05:19:26.613301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.03420","last_updated":"2026-05-05T06:51:41Z","snapshot_observed_at":"2026-08-02T14:37:25.615088Z","submitted_at":"2026-05-05T06:51:41Z","title":"Deepfake Audio Detection Using Self-supervised Fusion Representations","version":1},"cited_work":{"arxiv_id":"2605.03420","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.03420","snapshot_observed_at":"2026-07-03T07:47:45.160739Z","title":"Deepfake Audio Detection Using Self-supervised Fusion Representations","venue":"cs.SD","work_id":"089df46f-5779-4072-b479-5414e1b24587","year":2026},"citing_paper":{"arxiv_id":"2606.10791","last_updated":"2026-06-26T07:49:38Z","snapshot_observed_at":"2026-08-09T08:36:08.533336Z","submitted_at":"2026-06-09T12:42:14Z","title":"Overview of ESDD2: Environment-Aware Speech and Sound Deepfake Detection Challenge","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-29T05:19:26.613301Z"},"links":{"cited_paper":"/paper/2605.03420","citing_paper":"/paper/2606.10791"},"observation_digest":"sha256:0449feb1c3fc9f9e76a2bbd26a58fc09a7d7bbb6dc94a55c50476ce302111d55","observation_id":"45700f7c-301d-4e92-8be6-0916ff1e4497","resolution":{"observed_at":"2026-06-29T17:13:45.451160Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:19:26.613301Z","title":"Xls-r: Self-supervised cross-lingual speech representation learning at scale,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.10791","last_updated":"2026-06-26T07:49:38Z","snapshot_observed_at":"2026-08-09T08:36:08.533336Z","submitted_at":"2026-06-09T12:42:14Z","title":"Overview of ESDD2: Environment-Aware Speech and Sound Deepfake Detection Challenge","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-29T05:19:26.613301Z"},"links":{"citing_paper":"/paper/2606.10791"},"observation_digest":"sha256:5a54410b39af96bd6b7fa7a60f2b3b3a15a8851db1d4594674d123950ec49ee7","observation_id":"34989123-f903-4c8c-a4a0-320f63b578d3","resolution":{"observed_at":"2026-06-29T05:19:26.613301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:19:26.613301Z","title":"Eat: self-supervised pre-training with efficient audio transformer,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10791","last_updated":"2026-06-26T07:49:38Z","snapshot_observed_at":"2026-08-09T08:36:08.533336Z","submitted_at":"2026-06-09T12:42:14Z","title":"Overview of ESDD2: Environment-Aware Speech and Sound Deepfake Detection Challenge","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-29T05:19:26.613301Z"},"links":{"citing_paper":"/paper/2606.10791"},"observation_digest":"sha256:de556dda93ed8fa574a1afa83f6fd8de3e79d2e793a82ae14d93fa65867af9fd","observation_id":"4bc75510-8d98-4fe5-b805-e10e7612c8d3","resolution":{"observed_at":"2026-06-29T05:19:26.613301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:19:26.613301Z","title":"Sslam: Enhancing self-supervised models with audio mixtures for polyphonic soundscapes,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.10791","last_updated":"2026-06-26T07:49:38Z","snapshot_observed_at":"2026-08-09T08:36:08.533336Z","submitted_at":"2026-06-09T12:42:14Z","title":"Overview of ESDD2: Environment-Aware Speech and Sound Deepfake Detection Challenge","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-29T05:19:26.613301Z"},"links":{"citing_paper":"/paper/2606.10791"},"observation_digest":"sha256:9a41bb4c85043778b6bb5c2b5d819f4f76e4dd417aac6797195d015256f191ef","observation_id":"215b379f-5aa8-4fe5-8d6f-64555c8b5c2a","resolution":{"observed_at":"2026-06-29T05:19:26.613301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:19:26.613301Z","title":"Scaling up masked audio encoder learning for general audio classification,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10791","last_updated":"2026-06-26T07:49:38Z","snapshot_observed_at":"2026-08-09T08:36:08.533336Z","submitted_at":"2026-06-09T12:42:14Z","title":"Overview of ESDD2: Environment-Aware Speech and Sound Deepfake Detection Challenge","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-29T05:19:26.613301Z"},"links":{"citing_paper":"/paper/2606.10791"},"observation_digest":"sha256:7fec8a31cbbcb14cca944c6891cdbdeeaa4845c010492ac40114c11f0d841dd3","observation_id":"7c2df84a-9a4a-41aa-97e5-802c8f3a8665","resolution":{"observed_at":"2026-06-29T05:19:26.613301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.06164","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T07:47:45.163465Z","title":"Do compact ssl backbones matter for audio deepfake detection? a controlled study with raptor","venue":null,"work_id":"9fdd874a-cc32-4074-bad4-72351d028981","year":2026},"citing_paper":{"arxiv_id":"2606.10791","last_updated":"2026-06-26T07:49:38Z","snapshot_observed_at":"2026-08-09T08:36:08.533336Z","submitted_at":"2026-06-09T12:42:14Z","title":"Overview of ESDD2: Environment-Aware Speech and Sound Deepfake Detection Challenge","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-29T05:19:26.613301Z"},"links":{"citing_paper":"/paper/2606.10791"},"observation_digest":"sha256:3213342c8992ccac09f01f0335e553f81443665fefec1cb76fb28bb215f41dac","observation_id":"403b2a7d-c133-40e2-b9c2-cde0f0be6a0d","resolution":{"observed_at":"2026-06-29T17:13:45.454386Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:19:26.613301Z","title":"Xlsr-mamba: A dual-column bidirectional state space model for spoofing attack detection,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.10791","last_updated":"2026-06-26T07:49:38Z","snapshot_observed_at":"2026-08-09T08:36:08.533336Z","submitted_at":"2026-06-09T12:42:14Z","title":"Overview of ESDD2: Environment-Aware Speech and Sound Deepfake Detection Challenge","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-29T05:19:26.613301Z"},"links":{"citing_paper":"/paper/2606.10791"},"observation_digest":"sha256:82344b5d8cdb27de56429d2efd5ddbe54bc22e51b4cf8d177ac33bc57022c752","observation_id":"ad31a4fe-884f-4eaf-9ea1-359698f3885f","resolution":{"observed_at":"2026-06-29T05:19:26.613301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:19:26.613301Z","title":"Audio deepfake detection with self-supervised xls-r and sls classifier,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10791","last_updated":"2026-06-26T07:49:38Z","snapshot_observed_at":"2026-08-09T08:36:08.533336Z","submitted_at":"2026-06-09T12:42:14Z","title":"Overview of ESDD2: Environment-Aware Speech and Sound Deepfake Detection Challenge","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-29T05:19:26.613301Z"},"links":{"citing_paper":"/paper/2606.10791"},"observation_digest":"sha256:cc23f3def90290aae10fe551a0812face6d3363e41ed09ab42123d3e8c097ab8","observation_id":"e5c67944-6bc0-4057-b0a0-b6c4dd7392ce","resolution":{"observed_at":"2026-06-29T05:19:26.613301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:19:26.613301Z","title":"Temporal-channel modeling in multi-head self-attention for synthetic speech detection,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10791","last_updated":"2026-06-26T07:49:38Z","snapshot_observed_at":"2026-08-09T08:36:08.533336Z","submitted_at":"2026-06-09T12:42:14Z","title":"Overview of ESDD2: Environment-Aware Speech and Sound Deepfake Detection Challenge","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-29T05:19:26.613301Z"},"links":{"citing_paper":"/paper/2606.10791"},"observation_digest":"sha256:1800465abe896a2ee93d8414191172d186c9b6cbd67e48d59f75da6c6187e914","observation_id":"7a9f7525-0672-4550-9bcf-38d0ea49b8b0","resolution":{"observed_at":"2026-06-29T05:19:26.613301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:19:26.613301Z","title":"Rawboost: A raw data boosting and augmentation method applied to automatic speaker verification anti-spoofing,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.10791","last_updated":"2026-06-26T07:49:38Z","snapshot_observed_at":"2026-08-09T08:36:08.533336Z","submitted_at":"2026-06-09T12:42:14Z","title":"Overview of ESDD2: Environment-Aware Speech and Sound Deepfake Detection Challenge","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-29T05:19:26.613301Z"},"links":{"citing_paper":"/paper/2606.10791"},"observation_digest":"sha256:df440bf269547b66b8fd589a12f0da0167c9fc5278b9e5ce36f81fee1151e450","observation_id":"d4b91ff5-e510-412a-b532-4bdf4fd1ddfd","resolution":{"observed_at":"2026-06-29T05:19:26.613301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.10791","last_updated":"2026-06-26T07:49:38Z","latest_version":2,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-09T08:36:08.533336Z","submitted_at":"2026-06-09T12:42:14Z","title":"Overview of ESDD2: Environment-Aware Speech and Sound Deepfake Detection Challenge"},"reference_resolution":{"displayed":28,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":24,"verified_exact":4,"verified_fuzzy":0},"total_outbound_references":28},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 28 of 28 outbound references and 2 inbound Pith citation observations for arXiv:2606.10791."}