{"as_of":"2026-08-08T09:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9415ddb120c8f9d51192b44b67b3303da4526f0628278be1eb173208d387cd99","coverage":[{"denominator":28,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":28,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T21:50:10.595745Z","state":"measured"},{"denominator":28,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":28,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.16369/citation-record","integrity":"/paper/2607.16369/integrity","json":"/paper/2607.16369/citation-record.json","paper":"/paper/2607.16369"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.03926","last_updated":"2023-03-07T14:31:55Z","snapshot_observed_at":"2026-08-06T04:55:08.186019Z","submitted_at":"2023-03-07T14:31:55Z","title":"Speak Foreign Languages with Your Own Voice: Cross-Lingual Neural Codec Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03926","snapshot_observed_at":"2026-08-01T21:50:08.442744Z","title":"Speak foreign languages with your own voice: Cross-lingual neural codec language modeling,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16369","last_updated":"2026-07-17T14:00:32Z","snapshot_observed_at":"2026-08-06T19:20:45.030716Z","submitted_at":"2026-07-17T14:00:32Z","title":"Component-Level Ensemble Fusion for Speech and Environmental Sound Deepfake Detection","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T21:50:08.442744Z"},"links":{"cited_paper":"/paper/2303.03926","citing_paper":"/paper/2607.16369"},"observation_digest":"sha256:da3bdd39a4b470c7b21e34e865436257c1d8814429a9c09c32c4c781ac42319a","observation_id":"487ed536-8ec9-4116-a1b7-b26693617478","resolution":{"observed_at":"2026-08-01T21:50:08.442744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:50:08.527062Z","title":"Esdd2: Environment-aware speech and sound deepfake detection challenge evaluation plan,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.16369","last_updated":"2026-07-17T14:00:32Z","snapshot_observed_at":"2026-08-06T19:20:45.030716Z","submitted_at":"2026-07-17T14:00:32Z","title":"Component-Level Ensemble Fusion for Speech and Environmental Sound Deepfake Detection","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T21:50:08.527062Z"},"links":{"citing_paper":"/paper/2607.16369"},"observation_digest":"sha256:4fb6d79b48cbd2808c679eb5af750c99f1c8515752fabcc68e0c3d215591d76e","observation_id":"bad70afb-50ed-47ed-af2a-58a02092ae6b","resolution":{"observed_at":"2026-08-01T21:50:08.527062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:50:08.617801Z","title":"Compspoof: A dataset and joint learning framework for component- level audio anti-spoofing countermeasures,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.16369","last_updated":"2026-07-17T14:00:32Z","snapshot_observed_at":"2026-08-06T19:20:45.030716Z","submitted_at":"2026-07-17T14:00:32Z","title":"Component-Level Ensemble Fusion for Speech and Environmental Sound Deepfake Detection","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T21:50:08.617801Z"},"links":{"citing_paper":"/paper/2607.16369"},"observation_digest":"sha256:9f32265961aadc3a6b7d484251f68e35b97a8106a62621f3a6134ea37be9b49d","observation_id":"b3c436c7-fa36-4353-9895-f2c29d5ec2c5","resolution":{"observed_at":"2026-08-01T21:50:08.617801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:50:08.678153Z","title":"Esdd2-compspoof-v2: A compos- ite spoofing dataset for speech anti-spoofing,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16369","last_updated":"2026-07-17T14:00:32Z","snapshot_observed_at":"2026-08-06T19:20:45.030716Z","submitted_at":"2026-07-17T14:00:32Z","title":"Component-Level Ensemble Fusion for Speech and Environmental Sound Deepfake Detection","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T21:50:08.678153Z"},"links":{"citing_paper":"/paper/2607.16369"},"observation_digest":"sha256:df91903bfbfd79cc301a4162d8b470788ab3879e078104fcda5e30517ed59d09","observation_id":"0aff3c87-83fa-47d1-9fb0-6666bbb7709f","resolution":{"observed_at":"2026-08-01T21:50:08.678153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:50:08.772672Z","title":"Asvspoof 2019: Spoofing countermeasures for the detection of synthesized, converted and replayed speech,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.16369","last_updated":"2026-07-17T14:00:32Z","snapshot_observed_at":"2026-08-06T19:20:45.030716Z","submitted_at":"2026-07-17T14:00:32Z","title":"Component-Level Ensemble Fusion for Speech and Environmental Sound Deepfake Detection","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T21:50:08.772672Z"},"links":{"citing_paper":"/paper/2607.16369"},"observation_digest":"sha256:0c6627e133bcd6c4f4de6983665d2dca75b1d2c450b84ba94832c13f3107878c","observation_id":"4935244a-c2a2-4dfb-b16e-03d91b2e0c9a","resolution":{"observed_at":"2026-08-01T21:50:08.772672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:50:08.861578Z","title":"Asvspoof 2021: accelerating progress in spoofed and deepfake speech detection,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.16369","last_updated":"2026-07-17T14:00:32Z","snapshot_observed_at":"2026-08-06T19:20:45.030716Z","submitted_at":"2026-07-17T14:00:32Z","title":"Component-Level Ensemble Fusion for Speech and Environmental Sound Deepfake Detection","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T21:50:08.861578Z"},"links":{"citing_paper":"/paper/2607.16369"},"observation_digest":"sha256:8560974bf07421b2178b03c1b27e15c7a4852b216883dbb3d468255b94bce06b","observation_id":"8cbaa82c-352c-4c73-b659-4970c74494ed","resolution":{"observed_at":"2026-08-01T21:50:08.861578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:50:08.951080Z","title":"ASVspoof 5: crowdsourced speech data, deepfakes, and adversarial attacks at scale,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16369","last_updated":"2026-07-17T14:00:32Z","snapshot_observed_at":"2026-08-06T19:20:45.030716Z","submitted_at":"2026-07-17T14:00:32Z","title":"Component-Level Ensemble Fusion for Speech and Environmental Sound Deepfake Detection","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T21:50:08.951080Z"},"links":{"citing_paper":"/paper/2607.16369"},"observation_digest":"sha256:3cd7fa6eeaf6e20acf26bf4837372c6021c43ac020badcf981738f6c2df59f1d","observation_id":"568f3c70-98ef-492a-a6d6-4eef0189b940","resolution":{"observed_at":"2026-08-01T21:50:08.951080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:50:09.038204Z","title":"Towards end- to-end synthetic speech detection,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.16369","last_updated":"2026-07-17T14:00:32Z","snapshot_observed_at":"2026-08-06T19:20:45.030716Z","submitted_at":"2026-07-17T14:00:32Z","title":"Component-Level Ensemble Fusion for Speech and Environmental Sound Deepfake Detection","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T21:50:09.038204Z"},"links":{"citing_paper":"/paper/2607.16369"},"observation_digest":"sha256:987ed214f02c0c1f019e613d180faa4a4e13c244d16f76decc4e5ad8163e2783","observation_id":"02661d5b-ae33-4204-a2c4-0b40ae623dd2","resolution":{"observed_at":"2026-08-01T21:50:09.038204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:50:09.103326Z","title":"End-to-end anti-spoofing with rawnet2,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.16369","last_updated":"2026-07-17T14:00:32Z","snapshot_observed_at":"2026-08-06T19:20:45.030716Z","submitted_at":"2026-07-17T14:00:32Z","title":"Component-Level Ensemble Fusion for Speech and Environmental Sound Deepfake Detection","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T21:50:09.103326Z"},"links":{"citing_paper":"/paper/2607.16369"},"observation_digest":"sha256:3439da9b282674a3c09902ef68891232ad29bc4af89e52cdcb24508f849f208f","observation_id":"47682521-2c76-49fd-9d8a-98f4ddaa23af","resolution":{"observed_at":"2026-08-01T21:50:09.103326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:50:09.193229Z","title":"Does audio deepfake detection generalize?,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.16369","last_updated":"2026-07-17T14:00:32Z","snapshot_observed_at":"2026-08-06T19:20:45.030716Z","submitted_at":"2026-07-17T14:00:32Z","title":"Component-Level Ensemble Fusion for Speech and Environmental Sound Deepfake Detection","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T21:50:09.193229Z"},"links":{"citing_paper":"/paper/2607.16369"},"observation_digest":"sha256:30a2c3f1f20f30920e0f58c7fba0f041a02c99a6cc2d3c7a408eed1e67b4f365","observation_id":"d73820a9-44ce-439b-a063-ce4d1cf2d4af","resolution":{"observed_at":"2026-08-01T21:50:09.193229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:50:09.284925Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech representations,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.16369","last_updated":"2026-07-17T14:00:32Z","snapshot_observed_at":"2026-08-06T19:20:45.030716Z","submitted_at":"2026-07-17T14:00:32Z","title":"Component-Level Ensemble Fusion for Speech and Environmental Sound Deepfake Detection","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T21:50:09.284925Z"},"links":{"citing_paper":"/paper/2607.16369"},"observation_digest":"sha256:00170800543ce4862eae58a85b43723925573131774adab792bd1918733f5bfd","observation_id":"92d11b2f-e594-431c-8d0c-d72a58f5e7cb","resolution":{"observed_at":"2026-08-01T21:50:09.284925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:50:09.379834Z","title":"Hubert: Self- supervised speech representation learning by masked prediction of hidden units,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.16369","last_updated":"2026-07-17T14:00:32Z","snapshot_observed_at":"2026-08-06T19:20:45.030716Z","submitted_at":"2026-07-17T14:00:32Z","title":"Component-Level Ensemble Fusion for Speech and Environmental Sound Deepfake Detection","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T21:50:09.379834Z"},"links":{"citing_paper":"/paper/2607.16369"},"observation_digest":"sha256:5d1771a45d8dd147f44d5c5b7fc142241c00e1bf8f44d3dc039c1b8524025045","observation_id":"0f223557-e1d9-4406-a15a-2327549c8fe1","resolution":{"observed_at":"2026-08-01T21:50:09.379834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:50:09.470552Z","title":"XLS-R: Self-supervised Cross-lingual Speech Representation Learning at Scale,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.16369","last_updated":"2026-07-17T14:00:32Z","snapshot_observed_at":"2026-08-06T19:20:45.030716Z","submitted_at":"2026-07-17T14:00:32Z","title":"Component-Level Ensemble Fusion for Speech and Environmental Sound Deepfake Detection","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T21:50:09.470552Z"},"links":{"citing_paper":"/paper/2607.16369"},"observation_digest":"sha256:a47357e7025cd61603680861de610f81c30acd9441d3a1f4b7d12fc0d8982e36","observation_id":"eac88cbc-3d57-4b8f-a35a-d5e5035d938e","resolution":{"observed_at":"2026-08-01T21:50:09.470552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:50:09.576625Z","title":"Automatic speaker verification spoof- ing and deepfake detection using wav2vec 2.0 and data augmentation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.16369","last_updated":"2026-07-17T14:00:32Z","snapshot_observed_at":"2026-08-06T19:20:45.030716Z","submitted_at":"2026-07-17T14:00:32Z","title":"Component-Level Ensemble Fusion for Speech and Environmental Sound Deepfake Detection","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T21:50:09.576625Z"},"links":{"citing_paper":"/paper/2607.16369"},"observation_digest":"sha256:1a0514bb21b2cd9c47006f193ddfdd1374fd9eb75c74b7dde498404b5acb8345","observation_id":"712f3198-ba83-41b6-9c1a-719c2e405483","resolution":{"observed_at":"2026-08-01T21:50:09.576625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:50:09.661246Z","title":"Xlsr-mamba: A dual-column bidirectional state space model for spoofing attack detection,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16369","last_updated":"2026-07-17T14:00:32Z","snapshot_observed_at":"2026-08-06T19:20:45.030716Z","submitted_at":"2026-07-17T14:00:32Z","title":"Component-Level Ensemble Fusion for Speech and Environmental Sound Deepfake Detection","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T21:50:09.661246Z"},"links":{"citing_paper":"/paper/2607.16369"},"observation_digest":"sha256:e61ac9b9e92f13499cbf6ff6c9be0afc27ef8a17dda94b34e5065c2391186d00","observation_id":"66a6ecf3-26b0-44bb-8843-28039d2128f8","resolution":{"observed_at":"2026-08-01T21:50:09.661246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:50:09.755238Z","title":"Audio deepfake detection with self-supervised xls-r and sls classifier,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16369","last_updated":"2026-07-17T14:00:32Z","snapshot_observed_at":"2026-08-06T19:20:45.030716Z","submitted_at":"2026-07-17T14:00:32Z","title":"Component-Level Ensemble Fusion for Speech and Environmental Sound Deepfake Detection","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T21:50:09.755238Z"},"links":{"citing_paper":"/paper/2607.16369"},"observation_digest":"sha256:ddde25ccf144ac8ccc235c4fe2ccfa2cdce9901a53c3ac275483bd55463233c7","observation_id":"bde7d441-5779-4fab-81a3-cd8960ef6ff0","resolution":{"observed_at":"2026-08-01T21:50:09.755238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:50:09.822734Z","title":"Temporal-channel modeling in multi-head self-attention for synthetic speech detection,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16369","last_updated":"2026-07-17T14:00:32Z","snapshot_observed_at":"2026-08-06T19:20:45.030716Z","submitted_at":"2026-07-17T14:00:32Z","title":"Component-Level Ensemble Fusion for Speech and Environmental Sound Deepfake Detection","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T21:50:09.822734Z"},"links":{"citing_paper":"/paper/2607.16369"},"observation_digest":"sha256:7946f99fa758493b569c879e8bcdde691d49f19df5a4c87cfdbf485812f45bb6","observation_id":"4185632b-26bc-41d4-9b16-00126d402778","resolution":{"observed_at":"2026-08-01T21:50:09.822734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:50:09.909457Z","title":"Scenefake: An initial dataset and benchmarks for scene fake audio detection,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16369","last_updated":"2026-07-17T14:00:32Z","snapshot_observed_at":"2026-08-06T19:20:45.030716Z","submitted_at":"2026-07-17T14:00:32Z","title":"Component-Level Ensemble Fusion for Speech and Environmental Sound Deepfake Detection","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T21:50:09.909457Z"},"links":{"citing_paper":"/paper/2607.16369"},"observation_digest":"sha256:24098c01ca11600e5913e825d697263a16fad6292acfff1210f79ff8f4d7e7f8","observation_id":"99eed178-2665-4e48-8b41-81a80db76a7a","resolution":{"observed_at":"2026-08-01T21:50:09.909457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:50:09.973741Z","title":"Envfake: An initial environmental-fake audio dataset for scene-consistency detec- tion,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16369","last_updated":"2026-07-17T14:00:32Z","snapshot_observed_at":"2026-08-06T19:20:45.030716Z","submitted_at":"2026-07-17T14:00:32Z","title":"Component-Level Ensemble Fusion for Speech and Environmental Sound Deepfake Detection","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T21:50:09.973741Z"},"links":{"citing_paper":"/paper/2607.16369"},"observation_digest":"sha256:c657f57d9045067c7fd5e330e0760886e05c9a08a915da9121e9ea6ed1d849f7","observation_id":"169c12a5-6426-4f0b-bed0-dc6bb2016f0f","resolution":{"observed_at":"2026-08-01T21:50:09.973741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:50:10.034929Z","title":"Detection of deepfake environmental audio,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16369","last_updated":"2026-07-17T14:00:32Z","snapshot_observed_at":"2026-08-06T19:20:45.030716Z","submitted_at":"2026-07-17T14:00:32Z","title":"Component-Level Ensemble Fusion for Speech and Environmental Sound Deepfake Detection","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T21:50:10.034929Z"},"links":{"citing_paper":"/paper/2607.16369"},"observation_digest":"sha256:20b54694c827bcdb46c324f9580a2d59a471d433a65c0b6b1951ac8ace0ed3a9","observation_id":"2c017e1e-1efe-444f-9bae-6a22cedcae5a","resolution":{"observed_at":"2026-08-01T21:50:10.034929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:50:10.099628Z","title":"Fakesound: Deepfake general audio detection,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16369","last_updated":"2026-07-17T14:00:32Z","snapshot_observed_at":"2026-08-06T19:20:45.030716Z","submitted_at":"2026-07-17T14:00:32Z","title":"Component-Level Ensemble Fusion for Speech and Environmental Sound Deepfake Detection","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T21:50:10.099628Z"},"links":{"citing_paper":"/paper/2607.16369"},"observation_digest":"sha256:498dbffd84f4892dc5db9a061fb0e9066f469e9bc305a5609ea454b7ebfb85e2","observation_id":"ef1a24a4-5fc6-488d-bdea-5780b82badd3","resolution":{"observed_at":"2026-08-01T21:50:10.099628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:50:10.152336Z","title":"Audiocaps: Generating captions for audios in the wild,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.16369","last_updated":"2026-07-17T14:00:32Z","snapshot_observed_at":"2026-08-06T19:20:45.030716Z","submitted_at":"2026-07-17T14:00:32Z","title":"Component-Level Ensemble Fusion for Speech and Environmental Sound Deepfake Detection","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T21:50:10.152336Z"},"links":{"citing_paper":"/paper/2607.16369"},"observation_digest":"sha256:4d2012ea0dde7134bd13e14f519956c8061baeecbbbe5eefe038fa5e6839f7bf","observation_id":"594f6339-d016-4a8b-9800-bc75b6c0c40a","resolution":{"observed_at":"2026-08-01T21:50:10.152336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:50:10.227519Z","title":"Envsdd: Benchmarking envi- ronmental sound deepfake detection,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16369","last_updated":"2026-07-17T14:00:32Z","snapshot_observed_at":"2026-08-06T19:20:45.030716Z","submitted_at":"2026-07-17T14:00:32Z","title":"Component-Level Ensemble Fusion for Speech and Environmental Sound Deepfake Detection","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T21:50:10.227519Z"},"links":{"citing_paper":"/paper/2607.16369"},"observation_digest":"sha256:b1e3df594fb34fcfa2afe052fac0b555632ae3bf6f9d7be617754efbce57cbf5","observation_id":"e2ca0e45-ef25-49ed-9fd5-fedf4e263baf","resolution":{"observed_at":"2026-08-01T21:50:10.227519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:50:10.305054Z","title":"Does audio deepfake detection rely on artifacts?,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16369","last_updated":"2026-07-17T14:00:32Z","snapshot_observed_at":"2026-08-06T19:20:45.030716Z","submitted_at":"2026-07-17T14:00:32Z","title":"Component-Level Ensemble Fusion for Speech and Environmental Sound Deepfake Detection","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T21:50:10.305054Z"},"links":{"citing_paper":"/paper/2607.16369"},"observation_digest":"sha256:d493f1aa283b4f29c6dea4744c93041fe38d01fb029655351775fcbe45dfe07c","observation_id":"930da6ba-77c3-4cf0-a520-00c07923907d","resolution":{"observed_at":"2026-08-01T21:50:10.305054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:50:10.370933Z","title":"Audio deepfake detection under post-processing attack,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16369","last_updated":"2026-07-17T14:00:32Z","snapshot_observed_at":"2026-08-06T19:20:45.030716Z","submitted_at":"2026-07-17T14:00:32Z","title":"Component-Level Ensemble Fusion for Speech and Environmental Sound Deepfake Detection","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T21:50:10.370933Z"},"links":{"citing_paper":"/paper/2607.16369"},"observation_digest":"sha256:8978a138ea79550a9aeea5c7b392a247aeb4bc031dc01a44410e00376904d38b","observation_id":"c2266bcd-6fa3-4143-bd0b-39e7c8938af8","resolution":{"observed_at":"2026-08-01T21:50:10.370933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:50:10.422630Z","title":"Do compact ssl backbones matter for audio deepfake detection? a controlled study with raptor,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.16369","last_updated":"2026-07-17T14:00:32Z","snapshot_observed_at":"2026-08-06T19:20:45.030716Z","submitted_at":"2026-07-17T14:00:32Z","title":"Component-Level Ensemble Fusion for Speech and Environmental Sound Deepfake Detection","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T21:50:10.422630Z"},"links":{"citing_paper":"/paper/2607.16369"},"observation_digest":"sha256:14955be48471c79b884ec80af4b3f4f8165decaa66f5fd1de752b1068f12fe2c","observation_id":"8ecec13e-a28f-420a-82d7-2f3d3d497a16","resolution":{"observed_at":"2026-08-01T21:50:10.422630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:50:10.503091Z","title":"Rawboost: A raw data boosting and augmentation method applied to automatic speaker verification anti-spoofing,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.16369","last_updated":"2026-07-17T14:00:32Z","snapshot_observed_at":"2026-08-06T19:20:45.030716Z","submitted_at":"2026-07-17T14:00:32Z","title":"Component-Level Ensemble Fusion for Speech and Environmental Sound Deepfake Detection","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T21:50:10.503091Z"},"links":{"citing_paper":"/paper/2607.16369"},"observation_digest":"sha256:2ab6a88fc8bf705b5a9c847deb146cad90985c1cd80fa9909942bb47c982c226","observation_id":"cd0414f1-b199-455e-a042-008979f2bdc2","resolution":{"observed_at":"2026-08-01T21:50:10.503091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:50:10.595745Z","title":"Decoupled weight decay regulariza- tion,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.16369","last_updated":"2026-07-17T14:00:32Z","snapshot_observed_at":"2026-08-06T19:20:45.030716Z","submitted_at":"2026-07-17T14:00:32Z","title":"Component-Level Ensemble Fusion for Speech and Environmental Sound Deepfake Detection","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T21:50:10.595745Z"},"links":{"citing_paper":"/paper/2607.16369"},"observation_digest":"sha256:f4d8b821164281f0cd63ab6f9925c21982430246773a39acae3e08e7e57d6f89","observation_id":"c79fadc9-faea-4b82-95db-f2d93668d679","resolution":{"observed_at":"2026-08-01T21:50:10.595745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.16369","last_updated":"2026-07-17T14:00:32Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-06T19:20:45.030716Z","submitted_at":"2026-07-17T14:00:32Z","title":"Component-Level Ensemble Fusion for Speech and Environmental Sound Deepfake Detection"},"reference_resolution":{"displayed":28,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":28,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":28},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 28 of 28 outbound references and 0 inbound Pith citation observations for arXiv:2607.16369."}