{"as_of":"2026-08-08T20:04:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6774435ed3252ca842def5d475b9c6853af69649838923d2e84bfccf60d0f9c0","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T10:28:23.687225Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.28351/citation-record","integrity":"/paper/2607.28351/integrity","json":"/paper/2607.28351/citation-record.json","paper":"/paper/2607.28351"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2503.02857","last_updated":"2026-05-27T00:37:53Z","snapshot_observed_at":"2026-08-07T17:29:40.662418Z","submitted_at":"2025-03-04T18:33:22Z","title":"Deepfake-Eval-2024: A Multi-Modal In-the-Wild Benchmark of Deepfakes Circulated in 2024","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.02857","snapshot_observed_at":"2026-07-31T10:28:21.466792Z","title":"Harder or different? understanding generalization of audio deepfake detection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28351","last_updated":"2026-07-30T15:21:38Z","snapshot_observed_at":"2026-08-06T13:13:23.062215Z","submitted_at":"2026-07-30T15:21:38Z","title":"Teffic-Audio: Tell Fact from Fiction","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-31T10:28:21.466792Z"},"links":{"cited_paper":"/paper/2503.02857","citing_paper":"/paper/2607.28351"},"observation_digest":"sha256:41f108fb03fd842d3c97d2e9457c41e1b82147799bdd128596ecfcdc8d667ce3","observation_id":"1e544df8-f8d4-48d9-84d8-45e25a441cc6","resolution":{"observed_at":"2026-07-31T10:28:21.466792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T10:28:21.768535Z","title":"Does audio deepfake detection generalize?arXiv preprint arXiv:2203.16263,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28351","last_updated":"2026-07-30T15:21:38Z","snapshot_observed_at":"2026-08-06T13:13:23.062215Z","submitted_at":"2026-07-30T15:21:38Z","title":"Teffic-Audio: Tell Fact from Fiction","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-31T10:28:21.768535Z"},"links":{"citing_paper":"/paper/2607.28351"},"observation_digest":"sha256:4d3ca14efe5b6aee38d01c9b9a653864526987a1200c7237d87402f82aaa8d8d","observation_id":"be4d2081-8dab-48cd-bd07-7774e5a06a7d","resolution":{"observed_at":"2026-07-31T10:28:21.768535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T10:28:21.828061Z","title":"Asvspoof 5: crowdsourced speech data, deepfakes, and adversarial attacks at scale","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28351","last_updated":"2026-07-30T15:21:38Z","snapshot_observed_at":"2026-08-06T13:13:23.062215Z","submitted_at":"2026-07-30T15:21:38Z","title":"Teffic-Audio: Tell Fact from Fiction","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-31T10:28:21.828061Z"},"links":{"citing_paper":"/paper/2607.28351"},"observation_digest":"sha256:7abda97f3974dc4bd8e2f01800c29797470b00ef6735058815e52871e248cc8b","observation_id":"9b781278-fb42-44c0-9271-5f29fc3fd377","resolution":{"observed_at":"2026-07-31T10:28:21.828061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T10:28:21.938096Z","title":"Light convolutional neural network with feature genuinization for detection of synthetic speech attacks","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.28351","last_updated":"2026-07-30T15:21:38Z","snapshot_observed_at":"2026-08-06T13:13:23.062215Z","submitted_at":"2026-07-30T15:21:38Z","title":"Teffic-Audio: Tell Fact from Fiction","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-31T10:28:21.938096Z"},"links":{"citing_paper":"/paper/2607.28351"},"observation_digest":"sha256:fea60695dcd5c4441939d7c337b20e21d53cb2adb2521aefe8a4143068149aa3","observation_id":"90bbc901-57b5-4094-af2c-1cfb1db88011","resolution":{"observed_at":"2026-07-31T10:28:21.938096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T10:28:21.950262Z","title":"Replay and synthetic speech detection with res2net architecture","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.28351","last_updated":"2026-07-30T15:21:38Z","snapshot_observed_at":"2026-08-06T13:13:23.062215Z","submitted_at":"2026-07-30T15:21:38Z","title":"Teffic-Audio: Tell Fact from Fiction","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-31T10:28:21.950262Z"},"links":{"citing_paper":"/paper/2607.28351"},"observation_digest":"sha256:f2dbfcfa22b5df4e9e2cc8509d8377267b24945b922323d25fcdb487a74a5a0f","observation_id":"f1cad2b4-db5c-4e32-8bfc-3748387ebee5","resolution":{"observed_at":"2026-07-31T10:28:21.950262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T10:28:22.014498Z","title":"End-to-end anti-spoofing with rawnet2","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.28351","last_updated":"2026-07-30T15:21:38Z","snapshot_observed_at":"2026-08-06T13:13:23.062215Z","submitted_at":"2026-07-30T15:21:38Z","title":"Teffic-Audio: Tell Fact from Fiction","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-31T10:28:22.014498Z"},"links":{"citing_paper":"/paper/2607.28351"},"observation_digest":"sha256:1b93d0364159e88ab0f51adce87e59ac5f3cd5ae057a426ce6717e8181ad2bb2","observation_id":"beff54a8-2b33-4293-a96b-632ff7b317bf","resolution":{"observed_at":"2026-07-31T10:28:22.014498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09296","last_updated":"2021-12-16T18:29:22Z","snapshot_observed_at":"2026-07-06T12:09:37.468149Z","submitted_at":"2021-11-17T18:49:42Z","title":"XLS-R: Self-supervised Cross-lingual Speech Representation Learning at Scale","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09296","snapshot_observed_at":"2026-07-31T10:28:22.087327Z","title":"Xls-r: Self-supervised cross-lingual speech representation learning at scale.arXiv preprint arXiv:2111.09296,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28351","last_updated":"2026-07-30T15:21:38Z","snapshot_observed_at":"2026-08-06T13:13:23.062215Z","submitted_at":"2026-07-30T15:21:38Z","title":"Teffic-Audio: Tell Fact from Fiction","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-31T10:28:22.087327Z"},"links":{"cited_paper":"/paper/2111.09296","citing_paper":"/paper/2607.28351"},"observation_digest":"sha256:08033b10a45c2afbd2e98c0b56277ed83dc50f58f24c5a6c224c996325124372","observation_id":"46196a50-20d5-4b09-b76d-b2dd78425e91","resolution":{"observed_at":"2026-07-31T10:28:22.087327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T10:28:22.148358Z","title":"Mixture of experts fusion for fake audio detection using frozen wav2vec 2.0","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28351","last_updated":"2026-07-30T15:21:38Z","snapshot_observed_at":"2026-08-06T13:13:23.062215Z","submitted_at":"2026-07-30T15:21:38Z","title":"Teffic-Audio: Tell Fact from Fiction","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-31T10:28:22.148358Z"},"links":{"citing_paper":"/paper/2607.28351"},"observation_digest":"sha256:0c3821fba6255aa2fa6c4a4b4f83cdcdfc5bf5f7c7448ef597266e3d91d67be6","observation_id":"4f3beb0b-6a81-41c0-8837-d1af39921367","resolution":{"observed_at":"2026-07-31T10:28:22.148358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17376","last_updated":"2024-06-25T08:50:43Z","snapshot_observed_at":"2026-07-06T18:36:38.636181Z","submitted_at":"2024-06-25T08:50:43Z","title":"Temporal-Channel Modeling in Multi-head Self-Attention for Synthetic Speech Detection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17376","snapshot_observed_at":"2026-07-31T10:28:22.248260Z","title":"Temporal-channel modeling in multi-head self-attention for synthetic speech detection.arXiv preprint arXiv:2406.17376,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28351","last_updated":"2026-07-30T15:21:38Z","snapshot_observed_at":"2026-08-06T13:13:23.062215Z","submitted_at":"2026-07-30T15:21:38Z","title":"Teffic-Audio: Tell Fact from Fiction","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-31T10:28:22.248260Z"},"links":{"cited_paper":"/paper/2406.17376","citing_paper":"/paper/2607.28351"},"observation_digest":"sha256:689aa733b5eec0d6011214feb6fc377d7b83ab13e4110c5e010f805107eff691","observation_id":"f1d57647-b9c5-4509-8c87-b1b51aeceaf3","resolution":{"observed_at":"2026-07-31T10:28:22.248260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T10:28:22.307614Z","title":"Frame-level temporal difference learning for partial deepfake speech detection.IEEE Signal Processing Letters, 2025b","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28351","last_updated":"2026-07-30T15:21:38Z","snapshot_observed_at":"2026-08-06T13:13:23.062215Z","submitted_at":"2026-07-30T15:21:38Z","title":"Teffic-Audio: Tell Fact from Fiction","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-31T10:28:22.307614Z"},"links":{"citing_paper":"/paper/2607.28351"},"observation_digest":"sha256:e54cdc25102c2d7299d8e2ceabfd5e3376476c2c228910e2355e78a5fe10a03d","observation_id":"5534c589-bbc2-4ebb-a20c-2669033a82ce","resolution":{"observed_at":"2026-07-31T10:28:22.307614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T10:28:22.380736Z","title":"Leveraging mixture of experts for improved speech deepfake detection","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28351","last_updated":"2026-07-30T15:21:38Z","snapshot_observed_at":"2026-08-06T13:13:23.062215Z","submitted_at":"2026-07-30T15:21:38Z","title":"Teffic-Audio: Tell Fact from Fiction","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-31T10:28:22.380736Z"},"links":{"citing_paper":"/paper/2607.28351"},"observation_digest":"sha256:da3d3a520cf3c7e2161c58e86640f7f0f97b24f0bb69026ab86d6acad9cdb68c","observation_id":"8fff0a9b-4906-4970-93c3-2845da5e2e9b","resolution":{"observed_at":"2026-07-31T10:28:22.380736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.09175","last_updated":"2025-09-11T06:18:29Z","snapshot_observed_at":"2026-08-06T15:48:58.256012Z","submitted_at":"2025-09-11T06:18:29Z","title":"MoLEx: Mixture of LoRA Experts in Speech Self-Supervised Models for Audio Deepfake Detection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.09175","snapshot_observed_at":"2026-07-31T10:28:22.453820Z","title":"Molex: Mixture of lora experts in speech self-supervised models for audio deepfake detection.arXiv preprint arXiv:2509.09175,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28351","last_updated":"2026-07-30T15:21:38Z","snapshot_observed_at":"2026-08-06T13:13:23.062215Z","submitted_at":"2026-07-30T15:21:38Z","title":"Teffic-Audio: Tell Fact from Fiction","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-31T10:28:22.453820Z"},"links":{"cited_paper":"/paper/2509.09175","citing_paper":"/paper/2607.28351"},"observation_digest":"sha256:a7ad347d90662677bced6663d2cec8299e8a06bb7d1e7ba1a199ac6e77237394","observation_id":"36d40298-5761-4e16-a2be-ed767dca83ea","resolution":{"observed_at":"2026-07-31T10:28:22.453820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T10:28:22.514287Z","title":"Rawboost: A raw data boosting and augmentation method applied to automatic speaker verification anti-spoofing","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.28351","last_updated":"2026-07-30T15:21:38Z","snapshot_observed_at":"2026-08-06T13:13:23.062215Z","submitted_at":"2026-07-30T15:21:38Z","title":"Teffic-Audio: Tell Fact from Fiction","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-31T10:28:22.514287Z"},"links":{"citing_paper":"/paper/2607.28351"},"observation_digest":"sha256:1e3d7e1da5288ffc7f7cbaf937592c4864643ea8d1c93a06821d937f3af4e865","observation_id":"c2c2693f-96fe-4dbd-8842-eca570cb1d9a","resolution":{"observed_at":"2026-07-31T10:28:22.514287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T10:28:22.579124Z","title":"A data-centric approach to generalizable speech deepfake detection","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28351","last_updated":"2026-07-30T15:21:38Z","snapshot_observed_at":"2026-08-06T13:13:23.062215Z","submitted_at":"2026-07-30T15:21:38Z","title":"Teffic-Audio: Tell Fact from Fiction","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-31T10:28:22.579124Z"},"links":{"citing_paper":"/paper/2607.28351"},"observation_digest":"sha256:d51aa62e5577432851e83e9b641c1ffd2349d122ff86bee5d74fc784803cd2a0","observation_id":"bc8c7fe9-3ce2-443e-ba98-cde4596bb4e3","resolution":{"observed_at":"2026-07-31T10:28:22.579124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T10:28:22.645887Z","title":"Generalizable audio deepfake detection via latent space refinement and augmentation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28351","last_updated":"2026-07-30T15:21:38Z","snapshot_observed_at":"2026-08-06T13:13:23.062215Z","submitted_at":"2026-07-30T15:21:38Z","title":"Teffic-Audio: Tell Fact from Fiction","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-31T10:28:22.645887Z"},"links":{"citing_paper":"/paper/2607.28351"},"observation_digest":"sha256:89ce55ef89acc83ad0194fa76417eece23964d2aa216d369f054cb3c93ecf1b9","observation_id":"effa4449-a4cd-4e14-8eb8-58e02651b4f0","resolution":{"observed_at":"2026-07-31T10:28:22.645887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T10:28:22.682452Z","title":"Generalizable speech deepfake detection via meta-learned lora","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28351","last_updated":"2026-07-30T15:21:38Z","snapshot_observed_at":"2026-08-06T13:13:23.062215Z","submitted_at":"2026-07-30T15:21:38Z","title":"Teffic-Audio: Tell Fact from Fiction","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-31T10:28:22.682452Z"},"links":{"citing_paper":"/paper/2607.28351"},"observation_digest":"sha256:79dfa0d66ae856d34197c5d113a6b808fdb26e11d4ac50d77ed15e73ad9375b7","observation_id":"d3e5bb99-7b3a-436e-aa05-2b31de3e1279","resolution":{"observed_at":"2026-07-31T10:28:22.682452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T10:28:22.779079Z","title":"Conformer: Convolution-augmented transformer for speech recognition","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.28351","last_updated":"2026-07-30T15:21:38Z","snapshot_observed_at":"2026-08-06T13:13:23.062215Z","submitted_at":"2026-07-30T15:21:38Z","title":"Teffic-Audio: Tell Fact from Fiction","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-31T10:28:22.779079Z"},"links":{"citing_paper":"/paper/2607.28351"},"observation_digest":"sha256:2abeb343aecffc02d0c86e65f5a6dfbe2aa6720497dd7d75a5d150c73351c762","observation_id":"6ac7f324-7ed4-4b95-aa6f-491c413728eb","resolution":{"observed_at":"2026-07-31T10:28:22.779079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.10963","last_updated":"2019-02-25T01:44:06Z","snapshot_observed_at":"2026-08-02T00:52:09.236237Z","submitted_at":"2018-03-29T08:45:55Z","title":"Attentive Statistics Pooling for Deep Speaker Embedding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.10963","snapshot_observed_at":"2026-07-31T10:28:22.841215Z","title":"Attentive statistics pooling for deep speaker embedding.arXiv preprint arXiv:1803.10963,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28351","last_updated":"2026-07-30T15:21:38Z","snapshot_observed_at":"2026-08-06T13:13:23.062215Z","submitted_at":"2026-07-30T15:21:38Z","title":"Teffic-Audio: Tell Fact from Fiction","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-31T10:28:22.841215Z"},"links":{"cited_paper":"/paper/1803.10963","citing_paper":"/paper/2607.28351"},"observation_digest":"sha256:16e0d5a76e64446a9a3dee4ba6952bb75e5d44283c2d36ef27411b694653aa88","observation_id":"c3de67fd-f113-4190-8cdc-5c70c93268ed","resolution":{"observed_at":"2026-07-31T10:28:22.841215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T10:28:22.984927Z","title":"Replay attacks against audio deepfake detection","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28351","last_updated":"2026-07-30T15:21:38Z","snapshot_observed_at":"2026-08-06T13:13:23.062215Z","submitted_at":"2026-07-30T15:21:38Z","title":"Teffic-Audio: Tell Fact from Fiction","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-31T10:28:22.984927Z"},"links":{"citing_paper":"/paper/2607.28351"},"observation_digest":"sha256:bd785adb4ef9cef0e69fdb7f5e1651c27cd07d8f7c1bf979ee6c93226a4b68c7","observation_id":"22eb84af-bf57-43a6-ba69-36d91ada68c9","resolution":{"observed_at":"2026-07-31T10:28:22.984927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11567","last_updated":"2021-04-22T07:51:51Z","snapshot_observed_at":"2026-08-06T10:12:55.155871Z","submitted_at":"2020-10-22T09:54:22Z","title":"AISHELL-3: A Multi-speaker Mandarin TTS Corpus and the Baselines","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11567","snapshot_observed_at":"2026-07-31T10:28:23.043310Z","title":"Aishell-3: A multi-speaker mandarin tts corpus and the baselines","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2607.28351","last_updated":"2026-07-30T15:21:38Z","snapshot_observed_at":"2026-08-06T13:13:23.062215Z","submitted_at":"2026-07-30T15:21:38Z","title":"Teffic-Audio: Tell Fact from Fiction","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-31T10:28:23.043310Z"},"links":{"cited_paper":"/paper/2010.11567","citing_paper":"/paper/2607.28351"},"observation_digest":"sha256:b9ed9a25de7d380bcf9ee5951db58d3661616688ce0fe1de0d01a6c5def3dc96","observation_id":"7f9b7f3b-fe35-4c58-8aef-be0e603c8e3f","resolution":{"observed_at":"2026-07-31T10:28:23.043310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06909","last_updated":"2021-06-13T04:09:16Z","snapshot_observed_at":"2026-08-07T15:49:16.814852Z","submitted_at":"2021-06-13T04:09:16Z","title":"GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.06909","snapshot_observed_at":"2026-07-31T10:28:23.121360Z","title":"Gigaspeech: An evolving, multi-domain asr corpus with 10,000 hours of transcribed audio.arXiv preprint arXiv:2106.06909,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28351","last_updated":"2026-07-30T15:21:38Z","snapshot_observed_at":"2026-08-06T13:13:23.062215Z","submitted_at":"2026-07-30T15:21:38Z","title":"Teffic-Audio: Tell Fact from Fiction","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-31T10:28:23.121360Z"},"links":{"cited_paper":"/paper/2106.06909","citing_paper":"/paper/2607.28351"},"observation_digest":"sha256:d902e398b50f28eea87e0271305aab67ac3fbff3d87863c29575c2606d5a82b0","observation_id":"4ec5937e-80d3-493e-a287-688527d91673","resolution":{"observed_at":"2026-07-31T10:28:23.121360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T10:28:23.186106Z","title":"Cn-celeb: a challenging chinese speaker recognition dataset","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.28351","last_updated":"2026-07-30T15:21:38Z","snapshot_observed_at":"2026-08-06T13:13:23.062215Z","submitted_at":"2026-07-30T15:21:38Z","title":"Teffic-Audio: Tell Fact from Fiction","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-31T10:28:23.186106Z"},"links":{"citing_paper":"/paper/2607.28351"},"observation_digest":"sha256:bff7d94ecaf16630c532b304a8c04fb892382c96bb5364e0cfc1e73587e139df","observation_id":"7c8be08c-477e-4554-b9ec-6660e6d78e02","resolution":{"observed_at":"2026-07-31T10:28:23.186106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.09204","last_updated":"2025-09-11T07:20:18Z","snapshot_observed_at":"2026-08-06T12:09:57.872911Z","submitted_at":"2025-09-11T07:20:18Z","title":"Bona fide Cross Testing Reveals Weak Spot in Audio Deepfake Detection Systems","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.09204","snapshot_observed_at":"2026-07-31T10:28:23.243141Z","title":"Bona fide cross testing reveals weak spot in audio deepfake detection systems.arXiv preprint arXiv:2509.09204,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28351","last_updated":"2026-07-30T15:21:38Z","snapshot_observed_at":"2026-08-06T13:13:23.062215Z","submitted_at":"2026-07-30T15:21:38Z","title":"Teffic-Audio: Tell Fact from Fiction","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-31T10:28:23.243141Z"},"links":{"cited_paper":"/paper/2509.09204","citing_paper":"/paper/2607.28351"},"observation_digest":"sha256:d49ea7f8cf969f8aa01060504b27db63578e2e3526261637bed7f3e1dc6d8564","observation_id":"bc341901-0631-4f9d-9ce5-1309c2066c54","resolution":{"observed_at":"2026-07-31T10:28:23.243141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T10:28:23.349214Z","title":"Unimax: Fairer and more effective language sampling for large-scale multilingual pretraining","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28351","last_updated":"2026-07-30T15:21:38Z","snapshot_observed_at":"2026-08-06T13:13:23.062215Z","submitted_at":"2026-07-30T15:21:38Z","title":"Teffic-Audio: Tell Fact from Fiction","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-31T10:28:23.349214Z"},"links":{"citing_paper":"/paper/2607.28351"},"observation_digest":"sha256:f3cceb440d457927a4feaad15e0253f248604177811027f5d7393ad3e937125a","observation_id":"44e6ca35-da5a-45cf-8abb-0765a465e3f1","resolution":{"observed_at":"2026-07-31T10:28:23.349214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.13438","last_updated":"2022-10-24T17:52:02Z","snapshot_observed_at":"2026-08-03T16:47:47.192907Z","submitted_at":"2022-10-24T17:52:02Z","title":"High Fidelity Neural Audio Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.13438","snapshot_observed_at":"2026-07-31T10:28:23.427413Z","title":"High fidelity neural audio compression.arXiv preprint arXiv:2210.13438,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28351","last_updated":"2026-07-30T15:21:38Z","snapshot_observed_at":"2026-08-06T13:13:23.062215Z","submitted_at":"2026-07-30T15:21:38Z","title":"Teffic-Audio: Tell Fact from Fiction","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-31T10:28:23.427413Z"},"links":{"cited_paper":"/paper/2210.13438","citing_paper":"/paper/2607.28351"},"observation_digest":"sha256:2be556fd8311de845253c56a58870baba1171f7b8161980112064acc8a866791","observation_id":"fa394a0c-ae31-4537-a500-88ae04bc13c4","resolution":{"observed_at":"2026-07-31T10:28:23.427413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13930","last_updated":"2025-05-20T04:52:59Z","snapshot_observed_at":"2026-08-07T15:42:21.778161Z","submitted_at":"2025-05-20T04:52:59Z","title":"BiCrossMamba-ST: Speech Deepfake Detection with Bidirectional Mamba Spectro-Temporal Cross-Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.13930","snapshot_observed_at":"2026-07-31T10:28:23.484198Z","title":"Bicrossmamba-st: speech deepfake detection with bidirectional mamba spectro-temporal cross-attention.arXiv preprint arXiv:2505.13930,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28351","last_updated":"2026-07-30T15:21:38Z","snapshot_observed_at":"2026-08-06T13:13:23.062215Z","submitted_at":"2026-07-30T15:21:38Z","title":"Teffic-Audio: Tell Fact from Fiction","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-31T10:28:23.484198Z"},"links":{"cited_paper":"/paper/2505.13930","citing_paper":"/paper/2607.28351"},"observation_digest":"sha256:9854470256fa03fcc1fb9cf2d5acf9684804c8b8c3921eb8376749a51b9d5cee","observation_id":"6f429dc8-6d58-4039-a3d3-efdb02aeaadd","resolution":{"observed_at":"2026-07-31T10:28:23.484198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.12233","last_updated":"2022-02-28T11:50:57Z","snapshot_observed_at":"2026-07-06T12:41:22.635071Z","submitted_at":"2022-02-24T17:55:00Z","title":"Automatic speaker verification spoofing and deepfake detection using wav2vec 2.0 and data augmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.12233","snapshot_observed_at":"2026-07-31T10:28:23.550257Z","title":"Automatic speaker verification spoofing and deepfake detection using wav2vec 2.0 and data augmentation.arXiv preprint arXiv:2202.12233, 2022b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28351","last_updated":"2026-07-30T15:21:38Z","snapshot_observed_at":"2026-08-06T13:13:23.062215Z","submitted_at":"2026-07-30T15:21:38Z","title":"Teffic-Audio: Tell Fact from Fiction","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-31T10:28:23.550257Z"},"links":{"cited_paper":"/paper/2202.12233","citing_paper":"/paper/2607.28351"},"observation_digest":"sha256:339e95afe2a578967f59c57e5b1fb91f3ee4144e98dc5cf6c2ca2f6f88bfd211","observation_id":"4fee6289-b8b6-45a4-8510-182ba23d758e","resolution":{"observed_at":"2026-07-31T10:28:23.550257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T10:28:23.600331Z","title":"Exploring generalization to unseen audio data for spoofing: Insights from ssl models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28351","last_updated":"2026-07-30T15:21:38Z","snapshot_observed_at":"2026-08-06T13:13:23.062215Z","submitted_at":"2026-07-30T15:21:38Z","title":"Teffic-Audio: Tell Fact from Fiction","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-31T10:28:23.600331Z"},"links":{"citing_paper":"/paper/2607.28351"},"observation_digest":"sha256:8cefc39f759f05c5edc7b8a1390f3e6e8ca8e779fdc9ccd266a9badb890e514e","observation_id":"766e22e8-d789-4721-a28c-2178484feb27","resolution":{"observed_at":"2026-07-31T10:28:23.600331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.12710","last_updated":"2021-08-23T17:06:53Z","snapshot_observed_at":"2026-07-06T11:32:54.446325Z","submitted_at":"2021-07-27T10:11:41Z","title":"End-to-End Spectro-Temporal Graph Attention Networks for Speaker Verification Anti-Spoofing and Speech Deepfake Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.12710","snapshot_observed_at":"2026-07-31T10:28:23.629281Z","title":"End-to-end spectro-temporal graph attention networks for speaker verification anti-spoofing and speech deepfake detection","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28351","last_updated":"2026-07-30T15:21:38Z","snapshot_observed_at":"2026-08-06T13:13:23.062215Z","submitted_at":"2026-07-30T15:21:38Z","title":"Teffic-Audio: Tell Fact from Fiction","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-31T10:28:23.629281Z"},"links":{"cited_paper":"/paper/2107.12710","citing_paper":"/paper/2607.28351"},"observation_digest":"sha256:a09faf1a82687a167f280b0a715d1fa5d1c22b11f43dca63d09d0a5c73085751","observation_id":"71c8f231-7d39-4b63-b2d0-808f3d44cdf5","resolution":{"observed_at":"2026-07-31T10:28:23.629281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T10:28:23.687225Z","title":"Teffic-Audio achieves the best pooled ACC and pooled F1-score among the listed systems","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28351","last_updated":"2026-07-30T15:21:38Z","snapshot_observed_at":"2026-08-06T13:13:23.062215Z","submitted_at":"2026-07-30T15:21:38Z","title":"Teffic-Audio: Tell Fact from Fiction","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-31T10:28:23.687225Z"},"links":{"citing_paper":"/paper/2607.28351"},"observation_digest":"sha256:d5353671347e5dde860696759da32fa72cce44adcc2c3d42c9a1d542f7ef2222","observation_id":"d5bc1f3c-694a-492c-84ca-1463981cd374","resolution":{"observed_at":"2026-07-31T10:28:23.687225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21437/interspeech.2015-462","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Xin Wang, Junichi Yamagishi, Massimiliano Todisco, Hector Delgado, Andreas Nautsch, Nicholas Evans, Md Sahidullah, Ville Vestman, Tomi Kinnunen, Kong Aik Lee, et al","venue":null,"work_id":"7729240d-1c7b-4466-af30-dd10247dc683","year":2015},"citing_paper":{"arxiv_id":"2607.28351","last_updated":"2026-07-30T15:21:38Z","snapshot_observed_at":"2026-08-06T13:13:23.062215Z","submitted_at":"2026-07-30T15:21:38Z","title":"Teffic-Audio: Tell Fact from Fiction","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-07-31T10:28:21.313618Z"},"links":{"citing_paper":"/paper/2607.28351"},"observation_digest":"sha256:cb55b084b13bdd8290c7887aa80da15a1d11141d2e48c9702e0b5762483e6337","observation_id":"451308d7-d185-4135-b813-98bc3758b2d8","resolution":{"observed_at":"2026-07-31T10:30:53.086958Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T15:38:06.345634+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T15:38:06.345634+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T15:38:06.345634+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1510.08484","last_updated":"2015-10-28T20:59:04Z","snapshot_observed_at":"2026-07-06T04:34:36.474437Z","submitted_at":"2015-10-28T20:59:04Z","title":"MUSAN: A Music, Speech, and Noise Corpus","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1510.08484","snapshot_observed_at":"2026-07-31T10:28:23.379685Z","title":"Musan: A music, speech, and noise corpus.arXiv preprint arXiv:1510.08484,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28351","last_updated":"2026-07-30T15:21:38Z","snapshot_observed_at":"2026-08-06T13:13:23.062215Z","submitted_at":"2026-07-30T15:21:38Z","title":"Teffic-Audio: Tell Fact from Fiction","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-07-31T10:28:23.379685Z"},"links":{"cited_paper":"/paper/1510.08484","citing_paper":"/paper/2607.28351"},"observation_digest":"sha256:da130384d6e8b3ff55af8fa6e2d0aa27c32f5b0021eb1e86061b036659984c1a","observation_id":"e6d0476a-cba0-459e-a90b-cda0262fe0cc","resolution":{"observed_at":"2026-07-31T10:28:23.379685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05187","last_updated":"2023-12-08T17:18:42Z","snapshot_observed_at":"2026-08-06T14:36:57.042438Z","submitted_at":"2023-12-08T17:18:42Z","title":"Seamless: Multilingual Expressive and Streaming Speech Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.05187","snapshot_observed_at":"2026-07-31T10:28:22.922154Z","title":"Seamless: Multilingual expressive and streaming speech translation.arXiv preprint arXiv:2312.05187,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28351","last_updated":"2026-07-30T15:21:38Z","snapshot_observed_at":"2026-08-06T13:13:23.062215Z","submitted_at":"2026-07-30T15:21:38Z","title":"Teffic-Audio: Tell Fact from Fiction","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-07-31T10:28:22.922154Z"},"links":{"cited_paper":"/paper/2312.05187","citing_paper":"/paper/2607.28351"},"observation_digest":"sha256:a1537f5283528c591a07dcb071ac2d2ce585726e381c1279da35212bc57f55cc","observation_id":"5a0d7f71-e7bf-4804-8b48-f7515130997f","resolution":{"observed_at":"2026-07-31T10:28:22.922154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T10:28:21.347004Z","title":"Nicolas M Müller, Piotr Kawa, Wei Herng Choong, Edresson Casanova, Eren Gölge, Thorsten Müller, Piotr Syga, Philip Sperl, and Konstantin Böttinger","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.28351","last_updated":"2026-07-30T15:21:38Z","snapshot_observed_at":"2026-08-06T13:13:23.062215Z","submitted_at":"2026-07-30T15:21:38Z","title":"Teffic-Audio: Tell Fact from Fiction","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-07-31T10:28:21.347004Z"},"links":{"citing_paper":"/paper/2607.28351"},"observation_digest":"sha256:a0cbca7f0b33bf0ed7b1933e5cf320c1fc501fca3601cddd0037d804f06b5d68","observation_id":"ded5af8c-1732-4ca8-8cb0-66d77a949d2f","resolution":{"observed_at":"2026-07-31T10:28:21.347004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T10:28:21.646660Z","title":"Add 2022: the first audio deep synthesis detection challenge","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.28351","last_updated":"2026-07-30T15:21:38Z","snapshot_observed_at":"2026-08-06T13:13:23.062215Z","submitted_at":"2026-07-30T15:21:38Z","title":"Teffic-Audio: Tell Fact from Fiction","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-07-31T10:28:21.646660Z"},"links":{"citing_paper":"/paper/2607.28351"},"observation_digest":"sha256:f99c14910bb95009f7d6c044c4078113a883713ec32496a1ea1de0638982db85","observation_id":"ce701d1d-71e4-4d8f-b9b1-07f63e086622","resolution":{"observed_at":"2026-07-31T10:28:21.646660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13774","last_updated":"2023-05-23T07:42:52Z","snapshot_observed_at":"2026-07-06T15:31:13.189124Z","submitted_at":"2023-05-23T07:42:52Z","title":"ADD 2023: the Second Audio Deepfake Detection Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13774","snapshot_observed_at":"2026-07-31T10:28:21.703461Z","title":"Add 2023: the second audio deepfake detection challenge.arXiv preprint arXiv:2305.13774,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28351","last_updated":"2026-07-30T15:21:38Z","snapshot_observed_at":"2026-08-06T13:13:23.062215Z","submitted_at":"2026-07-30T15:21:38Z","title":"Teffic-Audio: Tell Fact from Fiction","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-07-31T10:28:21.703461Z"},"links":{"cited_paper":"/paper/2305.13774","citing_paper":"/paper/2607.28351"},"observation_digest":"sha256:2632a09be286dd9bee7241266802261bda34f5244b984ad7141bdefa43bf4af8","observation_id":"d3440183-9ab5-4ed7-b769-426786d55791","resolution":{"observed_at":"2026-07-31T10:28:21.703461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02813","last_updated":"2021-11-04T12:26:34Z","snapshot_observed_at":"2026-07-06T12:05:25.336577Z","submitted_at":"2021-11-04T12:26:34Z","title":"WaveFake: A Data Set to Facilitate Audio Deepfake Detection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.02813","snapshot_observed_at":"2026-07-31T10:28:21.405092Z","title":"Wavefake: A data set to facilitate audio deepfake detection.arXiv preprint arXiv:2111.02813,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28351","last_updated":"2026-07-30T15:21:38Z","snapshot_observed_at":"2026-08-06T13:13:23.062215Z","submitted_at":"2026-07-30T15:21:38Z","title":"Teffic-Audio: Tell Fact from Fiction","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-07-31T10:28:21.405092Z"},"links":{"cited_paper":"/paper/2111.02813","citing_paper":"/paper/2607.28351"},"observation_digest":"sha256:358e4dff276a5929b154a54cb5d5f62c2719b9ab53572e0344ca13b442f2e15d","observation_id":"8fb26762-abed-4bbb-bac9-e041a32783e0","resolution":{"observed_at":"2026-07-31T10:28:21.405092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10117","last_updated":"2024-12-25T11:54:03Z","snapshot_observed_at":"2026-08-07T06:02:40.568271Z","submitted_at":"2024-12-13T12:59:39Z","title":"CosyVoice 2: Scalable Streaming Speech Synthesis with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10117","snapshot_observed_at":"2026-07-31T10:28:21.169578Z","title":"Cosyvoice 2: Scalable streaming speech synthesis with large language models.arXiv preprint arXiv:2412.10117, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28351","last_updated":"2026-07-30T15:21:38Z","snapshot_observed_at":"2026-08-06T13:13:23.062215Z","submitted_at":"2026-07-30T15:21:38Z","title":"Teffic-Audio: Tell Fact from Fiction","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-07-31T10:28:21.169578Z"},"links":{"cited_paper":"/paper/2412.10117","citing_paper":"/paper/2607.28351"},"observation_digest":"sha256:bf9622cf0fcd64b078d2744a3e12008ee82c441840da1ee8f42d620d5f7a39cc","observation_id":"a78a6a21-751e-4731-9c43-3e2455d87a4d","resolution":{"observed_at":"2026-07-31T10:28:21.169578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T10:28:21.236552Z","title":"Asvspoof 2015: the first automatic speaker verification spoofing and countermeasures challenge","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.28351","last_updated":"2026-07-30T15:21:38Z","snapshot_observed_at":"2026-08-06T13:13:23.062215Z","submitted_at":"2026-07-30T15:21:38Z","title":"Teffic-Audio: Tell Fact from Fiction","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-07-31T10:28:21.236552Z"},"links":{"citing_paper":"/paper/2607.28351"},"observation_digest":"sha256:d2199c72c7751f891dc38348ea546305bd8a8ecf3f23038dba0a6fcc42aeb60c","observation_id":"90b35423-3b9f-490f-b76b-fb8665440fa8","resolution":{"observed_at":"2026-07-31T10:28:21.236552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T10:28:21.538373Z","title":"Asvspoof 2021: accelerating progress in spoofed and deepfake speech detection","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.28351","last_updated":"2026-07-30T15:21:38Z","snapshot_observed_at":"2026-08-06T13:13:23.062215Z","submitted_at":"2026-07-30T15:21:38Z","title":"Teffic-Audio: Tell Fact from Fiction","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-07-31T10:28:21.538373Z"},"links":{"citing_paper":"/paper/2607.28351"},"observation_digest":"sha256:66afe94d3de64e8eb43b59db41dbf7c59b4607d11828848ed0a4049c06bfcfcb","observation_id":"87fd1936-1f7a-4549-8ffd-58a26f68ae90","resolution":{"observed_at":"2026-07-31T10:28:21.538373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.28351","last_updated":"2026-07-30T15:21:38Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-06T13:13:23.062215Z","submitted_at":"2026-07-30T15:21:38Z","title":"Teffic-Audio: Tell Fact from Fiction"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":39,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 0 inbound Pith citation observations for arXiv:2607.28351."}