{"as_of":"2026-08-08T06:58:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e5055ebb835894d571692e5ada4c16be33bae52e479bf4e6e0a200a1cce95d14","coverage":[{"denominator":53,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":53,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:43:08.435473Z","state":"measured"},{"denominator":57,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":57,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T20:43:29.213147Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T20:17:21.993904Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.07294","last_updated":"2025-08-16T22:33:43Z","snapshot_observed_at":"2026-08-07T05:34:41.391218Z","submitted_at":"2025-06-08T21:36:10Z","title":"Towards Generalized Source Tracing for Codec-Based Deepfake Speech","version":3},"cited_work":{"arxiv_id":"2506.07294","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07294","snapshot_observed_at":"2026-07-02T20:17:21.993904Z","title":"Towards generalized source tracing for codec-based deepfake speech","venue":null,"work_id":"878e5e1f-7b24-4875-80a7-9f755f6cc060","year":2025},"citing_paper":{"arxiv_id":"2604.04841","last_updated":"2026-04-06T16:42:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-06T16:42:59Z","title":"Joint Fullband-Subband Modeling for High-Resolution SingFake Detection","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-10T19:45:22.309413Z"},"links":{"cited_paper":"/paper/2506.07294","citing_paper":"/paper/2604.04841"},"observation_digest":"sha256:564f3b5419720753b2908967e1386075f3808c976828b93a386dba9989544edb","observation_id":"c46848cf-9b97-42bb-acb2-ea4e4f12d0ed","resolution":{"observed_at":"2026-05-10T22:30:53.579055Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07294","last_updated":"2025-08-16T22:33:43Z","snapshot_observed_at":"2026-08-07T05:34:41.391218Z","submitted_at":"2025-06-08T21:36:10Z","title":"Towards Generalized Source Tracing for Codec-Based Deepfake Speech","version":3},"cited_work":{"arxiv_id":"2506.07294","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07294","snapshot_observed_at":"2026-07-02T20:17:21.993904Z","title":"Towards generalized source tracing for codec-based deepfake speech","venue":null,"work_id":"878e5e1f-7b24-4875-80a7-9f755f6cc060","year":2025},"citing_paper":{"arxiv_id":"2604.17642","last_updated":"2026-04-19T22:26:28Z","snapshot_observed_at":"2026-08-02T05:49:46.405306Z","submitted_at":"2026-04-19T22:26:28Z","title":"HCFD: A Benchmark for Audio Deepfake Detection in Healthcare","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-05-10T04:52:52.682483Z"},"links":{"cited_paper":"/paper/2506.07294","citing_paper":"/paper/2604.17642"},"observation_digest":"sha256:a133ad35d90179d5c3dc4d984482bd28b51fa52fcf065d75dde3864f9d792cc3","observation_id":"d84ad319-759b-4bb8-a176-388a2154fbee","resolution":{"observed_at":"2026-05-10T11:10:09.897684Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07294","last_updated":"2025-08-16T22:33:43Z","snapshot_observed_at":"2026-08-07T05:34:41.391218Z","submitted_at":"2025-06-08T21:36:10Z","title":"Towards Generalized Source Tracing for Codec-Based Deepfake Speech","version":3},"cited_work":{"arxiv_id":"2506.07294","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07294","snapshot_observed_at":"2026-07-02T20:17:21.993904Z","title":"Towards generalized source tracing for codec-based deepfake speech","venue":null,"work_id":"878e5e1f-7b24-4875-80a7-9f755f6cc060","year":2025},"citing_paper":{"arxiv_id":"2604.19949","last_updated":"2026-04-21T19:54:54Z","snapshot_observed_at":"2026-07-06T23:06:31.110859Z","submitted_at":"2026-04-21T19:54:54Z","title":"Indic-CodecFake meets SATYAM: Towards Detecting Neural Audio Codec Synthesized Speech Deepfakes in Indic Languages","version":1},"reference_index":155,"source":"arxiv_source","source_observed_at":"2026-05-10T00:34:30.978387Z"},"links":{"cited_paper":"/paper/2506.07294","citing_paper":"/paper/2604.19949"},"observation_digest":"sha256:570f758bc185114479663899099c6e23751455987f87591db0430cbe0535c720","observation_id":"2ef949e0-3495-4086-8ecf-75e350ebccb0","resolution":{"observed_at":"2026-05-10T00:34:47.302626Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07294","last_updated":"2025-08-16T22:33:43Z","snapshot_observed_at":"2026-08-07T05:34:41.391218Z","submitted_at":"2025-06-08T21:36:10Z","title":"Towards Generalized Source Tracing for Codec-Based Deepfake Speech","version":3},"cited_work":{"arxiv_id":"2506.07294","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07294","snapshot_observed_at":"2026-07-02T20:17:21.993904Z","title":"Towards generalized source tracing for codec-based deepfake speech","venue":null,"work_id":"878e5e1f-7b24-4875-80a7-9f755f6cc060","year":2025},"citing_paper":{"arxiv_id":"2606.07494","last_updated":"2026-06-05T17:48:46Z","snapshot_observed_at":"2026-08-03T05:11:42.143646Z","submitted_at":"2026-06-05T17:48:46Z","title":"Mitigating Proxy-to-Wild Domain Gap in Deepfake Speech","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-27T20:43:29.213147Z"},"links":{"cited_paper":"/paper/2506.07294","citing_paper":"/paper/2606.07494"},"observation_digest":"sha256:c7d56903e9375a3d7436c0754dfe7ad3cb1ff8986911291ac0b672d472987eac","observation_id":"6c5e34d4-e5c4-454f-8891-e5e62686c251","resolution":{"observed_at":"2026-07-02T20:17:21.995549Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.07294/citation-record","integrity":"/paper/2506.07294/integrity","json":"/paper/2506.07294/citation-record.json","paper":"/paper/2506.07294"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:09.262574Z","title":"A survey on speech deepfake detection,","venue":null,"work_id":"1056b453-6e30-4c15-8212-95ebd237cb3f","year":2025},"citing_paper":{"arxiv_id":"2506.07294","last_updated":"2025-08-16T22:33:43Z","snapshot_observed_at":"2026-08-07T05:34:41.391218Z","submitted_at":"2025-06-08T21:36:10Z","title":"Towards Generalized Source Tracing for Codec-Based Deepfake Speech","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:08.246632Z"},"links":{"citing_paper":"/paper/2506.07294"},"observation_digest":"sha256:fcf8f1a6f07bdd128ef738f2369d4c1f22638c1398b6a8ec96e551cbd633ba97","observation_id":"b70fa2f3-39ab-452f-aa48-fa5e69eaf8b9","resolution":{"observed_at":"2026-08-07T05:43:09.266477Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.12804","last_updated":"2023-06-25T09:22:09Z","snapshot_observed_at":"2026-08-05T05:43:41.342356Z","submitted_at":"2023-05-22T08:01:59Z","title":"The defender's perspective on automatic speaker verification: An overview","version":2},"cited_work":{"arxiv_id":"2305.12804","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.12804","snapshot_observed_at":"2026-08-07T05:43:08.840604Z","title":"The defender's perspective on automatic speaker verification: An overview","venue":"cs.SD","work_id":"84347011-5dbb-4186-87c5-b2a63448f489","year":2023},"citing_paper":{"arxiv_id":"2506.07294","last_updated":"2025-08-16T22:33:43Z","snapshot_observed_at":"2026-08-07T05:34:41.391218Z","submitted_at":"2025-06-08T21:36:10Z","title":"Towards Generalized Source Tracing for Codec-Based Deepfake Speech","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:08.251081Z"},"links":{"cited_paper":"/paper/2305.12804","citing_paper":"/paper/2506.07294"},"observation_digest":"sha256:29c3454bc16c1a8e75cdad26df05fbb5787f9ccdf3fb0b5a4b85d0db6a0bba4f","observation_id":"4442a0c9-f670-45b9-90ca-30af813fccf4","resolution":{"observed_at":"2026-08-07T05:43:08.845713Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:09.251124Z","title":"Asvspoof 2015: the first automatic speaker verification spoofing and countermea- sures challenge,","venue":null,"work_id":"ea509763-834f-47a8-8063-ac62bfb1467f","year":2015},"citing_paper":{"arxiv_id":"2506.07294","last_updated":"2025-08-16T22:33:43Z","snapshot_observed_at":"2026-08-07T05:34:41.391218Z","submitted_at":"2025-06-08T21:36:10Z","title":"Towards Generalized Source Tracing for Codec-Based Deepfake Speech","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:08.255484Z"},"links":{"citing_paper":"/paper/2506.07294"},"observation_digest":"sha256:0b6c5e5f4c20f739a36540c439adfd4b1f661090f0a4668dfc1d5195f34684bd","observation_id":"d44097a4-aaf2-45b7-9ac8-2c44c973c403","resolution":{"observed_at":"2026-08-07T05:43:09.254854Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:09.239581Z","title":"The asvspoof 2017 challenge: Assessing the limits of replay spoofing attack detection,","venue":null,"work_id":"3615ed60-bb06-4585-b9a8-c3a5ff3809ec","year":2017},"citing_paper":{"arxiv_id":"2506.07294","last_updated":"2025-08-16T22:33:43Z","snapshot_observed_at":"2026-08-07T05:34:41.391218Z","submitted_at":"2025-06-08T21:36:10Z","title":"Towards Generalized Source Tracing for Codec-Based Deepfake Speech","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:08.259679Z"},"links":{"citing_paper":"/paper/2506.07294"},"observation_digest":"sha256:b0f19150e853341c13cab6e92cdc0c1408e5bbcc74bddaa911dfc49f6b2213bc","observation_id":"3b68e8cc-b6b9-4421-b584-5f04a21b9801","resolution":{"observed_at":"2026-08-07T05:43:09.243316Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:09.227748Z","title":"ASVspoof 2019: future horizons in spoofed and fake audio detection,","venue":null,"work_id":"c6ad5fb0-f608-47d2-a5a2-be0287743b85","year":2019},"citing_paper":{"arxiv_id":"2506.07294","last_updated":"2025-08-16T22:33:43Z","snapshot_observed_at":"2026-08-07T05:34:41.391218Z","submitted_at":"2025-06-08T21:36:10Z","title":"Towards Generalized Source Tracing for Codec-Based Deepfake Speech","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:08.263729Z"},"links":{"citing_paper":"/paper/2506.07294"},"observation_digest":"sha256:898389f516a63f7529db0c6cfa0b00df91fa204756cfe95382bcf7ed2b42ef26","observation_id":"7870c927-ce78-4248-b220-ecb3fe254572","resolution":{"observed_at":"2026-08-07T05:43:09.231664Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:09.215563Z","title":"Asvspoof 2021: Towards spoofed and deepfake speech detection in the wild,","venue":null,"work_id":"71fadbb3-095e-4a15-aa87-ad8a8b7f955b","year":2021},"citing_paper":{"arxiv_id":"2506.07294","last_updated":"2025-08-16T22:33:43Z","snapshot_observed_at":"2026-08-07T05:34:41.391218Z","submitted_at":"2025-06-08T21:36:10Z","title":"Towards Generalized Source Tracing for Codec-Based Deepfake Speech","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:08.267627Z"},"links":{"citing_paper":"/paper/2506.07294"},"observation_digest":"sha256:4511b6d40a2e8da221c188d99ed4a0f6f53b5bb4e457541307703810b1c1743d","observation_id":"dc6f8a13-4066-445a-b83e-71657bc39747","resolution":{"observed_at":"2026-08-07T05:43:09.219660Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:09.203201Z","title":"ASVspoof 5: Crowdsourced speech data, deepfakes, and adversarial attacks at scale,","venue":null,"work_id":"10004d2d-fa66-44a2-9f5d-fdc3688be468","year":2024},"citing_paper":{"arxiv_id":"2506.07294","last_updated":"2025-08-16T22:33:43Z","snapshot_observed_at":"2026-08-07T05:34:41.391218Z","submitted_at":"2025-06-08T21:36:10Z","title":"Towards Generalized Source Tracing for Codec-Based Deepfake Speech","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:08.271694Z"},"links":{"citing_paper":"/paper/2506.07294"},"observation_digest":"sha256:7517b9bce129bc812c60f96812ce18d43f81cd491503fd1d92803a305a1ca28d","observation_id":"010a4448-844b-481b-91bd-0fa8ca865f27","resolution":{"observed_at":"2026-08-07T05:43:09.207517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:09.191587Z","title":"Add 2022: the first audio deep synthesis detection challenge,","venue":null,"work_id":"50a646eb-a329-473f-870f-78aa5c4a5ac8","year":2022},"citing_paper":{"arxiv_id":"2506.07294","last_updated":"2025-08-16T22:33:43Z","snapshot_observed_at":"2026-08-07T05:34:41.391218Z","submitted_at":"2025-06-08T21:36:10Z","title":"Towards Generalized Source Tracing for Codec-Based Deepfake Speech","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:08.275287Z"},"links":{"citing_paper":"/paper/2506.07294"},"observation_digest":"sha256:bce014520d5ff5e008d9789d676abdb068a685c30cb002d3947b57b965d283d0","observation_id":"e75dad71-3b95-4321-b713-b7ab566dbfb7","resolution":{"observed_at":"2026-08-07T05:43:09.195357Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04967","last_updated":"2024-12-11T07:40:26Z","snapshot_observed_at":"2026-07-06T18:58:48.131448Z","submitted_at":"2024-08-09T09:32:37Z","title":"ADD 2023: Towards Audio Deepfake Detection and Analysis in the Wild","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04967","snapshot_observed_at":"2026-08-07T05:43:08.278930Z","title":"Add 2023: Towards audio deep- fake detection and analysis in the wild,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07294","last_updated":"2025-08-16T22:33:43Z","snapshot_observed_at":"2026-08-07T05:34:41.391218Z","submitted_at":"2025-06-08T21:36:10Z","title":"Towards Generalized Source Tracing for Codec-Based Deepfake Speech","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:08.278930Z"},"links":{"cited_paper":"/paper/2408.04967","citing_paper":"/paper/2506.07294"},"observation_digest":"sha256:f9d3e1d09cd5e99421d3fa7dbe21a3ac3be5945e47038c74e5026a392b1419f9","observation_id":"bf986a06-3279-4f71-91e9-7f8b03fe8179","resolution":{"observed_at":"2026-08-07T05:43:08.278930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:09.178755Z","title":"Synthetic speech detection through short- term and long-term prediction traces,","venue":null,"work_id":"c4d0a815-2338-4c19-82a5-1e82079a07ed","year":2021},"citing_paper":{"arxiv_id":"2506.07294","last_updated":"2025-08-16T22:33:43Z","snapshot_observed_at":"2026-08-07T05:34:41.391218Z","submitted_at":"2025-06-08T21:36:10Z","title":"Towards Generalized Source Tracing for Codec-Based Deepfake Speech","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:08.282824Z"},"links":{"citing_paper":"/paper/2506.07294"},"observation_digest":"sha256:2e3d4e5ff2372f5594ed18fcc2356c85fbda334dac356ef7ff9799a0ec1e5ece","observation_id":"64b1b69c-be79-40fa-8088-214ace2df742","resolution":{"observed_at":"2026-08-07T05:43:09.182932Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:09.165504Z","title":"An initial investigation for detecting vocoder fingerprints of fake audio,","venue":null,"work_id":"b67352c4-cb32-493a-bf1d-9914cf601d37","year":2022},"citing_paper":{"arxiv_id":"2506.07294","last_updated":"2025-08-16T22:33:43Z","snapshot_observed_at":"2026-08-07T05:34:41.391218Z","submitted_at":"2025-06-08T21:36:10Z","title":"Towards Generalized Source Tracing for Codec-Based Deepfake Speech","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:08.286491Z"},"links":{"citing_paper":"/paper/2506.07294"},"observation_digest":"sha256:bf26b2d49b12aca7dbba2624609e5bfb54fb24dddda5e5a98c33d01efe293f60","observation_id":"f2de419a-f426-415b-a1de-50d600d7f48d","resolution":{"observed_at":"2026-08-07T05:43:09.169787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:09.152283Z","title":"Distinguishing neural speech synthesis models through fingerprints in speech waveforms,","venue":null,"work_id":"4fb9ae8b-2547-4c52-83e6-9250c4e5ca25","year":2023},"citing_paper":{"arxiv_id":"2506.07294","last_updated":"2025-08-16T22:33:43Z","snapshot_observed_at":"2026-08-07T05:34:41.391218Z","submitted_at":"2025-06-08T21:36:10Z","title":"Towards Generalized Source Tracing for Codec-Based Deepfake Speech","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:08.289892Z"},"links":{"citing_paper":"/paper/2506.07294"},"observation_digest":"sha256:d56b4ee11baca5bc04da7107a650e53b19e2cd4b921f3287de7ea90b6ce0a044","observation_id":"e4cd77e6-dac1-41b3-bcbb-3f0b57228c38","resolution":{"observed_at":"2026-08-07T05:43:09.156547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:09.138733Z","title":"Source tracing: detecting voice spoofing,","venue":null,"work_id":"af236534-f55d-4274-9b85-5ba88a8e7326","year":2022},"citing_paper":{"arxiv_id":"2506.07294","last_updated":"2025-08-16T22:33:43Z","snapshot_observed_at":"2026-08-07T05:34:41.391218Z","submitted_at":"2025-06-08T21:36:10Z","title":"Towards Generalized Source Tracing for Codec-Based Deepfake Speech","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:08.293297Z"},"links":{"citing_paper":"/paper/2506.07294"},"observation_digest":"sha256:5f814159ca549d7b2c0ac3f6260773c4555f2bfca91e1b0db1de6eb246120fb9","observation_id":"beeeb5a1-a9ee-41eb-a4b7-74699813b65a","resolution":{"observed_at":"2026-08-07T05:43:09.143229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:09.125722Z","title":"Source tracing of audio deepfake systems,","venue":null,"work_id":"2906ea13-f741-4ede-98ef-ca49dc00ec67","year":2024},"citing_paper":{"arxiv_id":"2506.07294","last_updated":"2025-08-16T22:33:43Z","snapshot_observed_at":"2026-08-07T05:34:41.391218Z","submitted_at":"2025-06-08T21:36:10Z","title":"Towards Generalized Source Tracing for Codec-Based Deepfake Speech","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:08.296674Z"},"links":{"citing_paper":"/paper/2506.07294"},"observation_digest":"sha256:a5716097d3c3873d13fc2d91fb9a028b6937d097bfe7d8e8882586f6458aad9b","observation_id":"53967e6c-d49e-48a1-9cf4-1280eab1bcfb","resolution":{"observed_at":"2026-08-07T05:43:09.129954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08528","last_updated":"2026-04-07T06:11:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-11T13:40:53Z","title":"On The Landscape of Spoken Language Models: A Comprehensive Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.08528","snapshot_observed_at":"2026-08-07T05:43:08.300073Z","title":"On the landscape of spoken lan- guage models: A comprehensive survey,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07294","last_updated":"2025-08-16T22:33:43Z","snapshot_observed_at":"2026-08-07T05:34:41.391218Z","submitted_at":"2025-06-08T21:36:10Z","title":"Towards Generalized Source Tracing for Codec-Based Deepfake Speech","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:08.300073Z"},"links":{"cited_paper":"/paper/2504.08528","citing_paper":"/paper/2506.07294"},"observation_digest":"sha256:5025bb91b31eb20c55304d5a3b6a3a2a63c05537a97420fe203cdae59f7a2e1e","observation_id":"8ce57144-6318-4e00-a20b-637add111ef0","resolution":{"observed_at":"2026-08-07T05:43:08.300073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06514","last_updated":"2025-01-11T11:15:58Z","snapshot_observed_at":"2026-07-06T20:19:40.856839Z","submitted_at":"2025-01-11T11:15:58Z","title":"Neural Codec Source Tracing: Toward Comprehensive Attribution in Open-Set Condition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.06514","snapshot_observed_at":"2026-08-07T05:43:08.303886Z","title":"Neural codec source tracing: Toward comprehensive attribution in open-set condition,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07294","last_updated":"2025-08-16T22:33:43Z","snapshot_observed_at":"2026-08-07T05:34:41.391218Z","submitted_at":"2025-06-08T21:36:10Z","title":"Towards Generalized Source Tracing for Codec-Based Deepfake Speech","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:08.303886Z"},"links":{"cited_paper":"/paper/2501.06514","citing_paper":"/paper/2506.07294"},"observation_digest":"sha256:cdfa80087288dea29add5b4130e1c7dd1a32a1bc67f294805518b1087cb7e748","observation_id":"0727059a-1c03-40c6-a988-acd0c8cf2630","resolution":{"observed_at":"2026-08-07T05:43:08.303886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04049","last_updated":"2025-06-01T07:23:30Z","snapshot_observed_at":"2026-07-06T20:32:09.545287Z","submitted_at":"2025-02-06T13:06:33Z","title":"Towards Explainable Spoofed Speech Attribution and Detection:a Probabilistic Approach for Characterizing Speech Synthesizer Components","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04049","snapshot_observed_at":"2026-08-07T05:43:08.307680Z","title":"Towards explainable spoofed speech attribution and detection: a probabilistic approach for character- izing speech synthesizer components,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07294","last_updated":"2025-08-16T22:33:43Z","snapshot_observed_at":"2026-08-07T05:34:41.391218Z","submitted_at":"2025-06-08T21:36:10Z","title":"Towards Generalized Source Tracing for Codec-Based Deepfake Speech","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:08.307680Z"},"links":{"cited_paper":"/paper/2502.04049","citing_paper":"/paper/2506.07294"},"observation_digest":"sha256:dc52a9e34cc3d073fe7caf34bc071a0603ba0947a2625fd89586a2ba250fa145","observation_id":"3c87a779-ac6a-4eb2-8856-36d00987105e","resolution":{"observed_at":"2026-08-07T05:43:08.307680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14188","last_updated":"2025-05-20T10:42:48Z","snapshot_observed_at":"2026-08-07T15:36:32.298738Z","submitted_at":"2025-05-20T10:42:48Z","title":"Source Verification for Speech Deepfakes","version":1},"cited_work":{"arxiv_id":"2505.14188","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.14188","snapshot_observed_at":"2026-08-07T05:43:08.769109Z","title":"Source Verification for Speech Deepfakes","venue":"cs.SD","work_id":"17fa8dee-89c0-4382-bc1a-c191d2067641","year":2025},"citing_paper":{"arxiv_id":"2506.07294","last_updated":"2025-08-16T22:33:43Z","snapshot_observed_at":"2026-08-07T05:34:41.391218Z","submitted_at":"2025-06-08T21:36:10Z","title":"Towards Generalized Source Tracing for Codec-Based Deepfake Speech","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:08.311552Z"},"links":{"cited_paper":"/paper/2505.14188","citing_paper":"/paper/2506.07294"},"observation_digest":"sha256:91be8c0500277bbaa357bd60ae05ae5a1d4a1fc120012544c23641b5733db0c7","observation_id":"5b017e66-e8cc-4767-a728-b7080f146839","resolution":{"observed_at":"2026-08-07T05:43:08.773379Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14601","last_updated":"2025-05-20T16:51:52Z","snapshot_observed_at":"2026-08-07T15:29:23.590965Z","submitted_at":"2025-05-20T16:51:52Z","title":"Listen, Analyze, and Adapt to Learn New Attacks: An Exemplar-Free Class Incremental Learning Method for Audio Deepfake Source Tracing","version":1},"cited_work":{"arxiv_id":"2505.14601","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.14601","snapshot_observed_at":"2026-08-07T05:43:08.750764Z","title":"Listen, Analyze, and Adapt to Learn New Attacks: An Exemplar-Free Class Incremental Learning Method for Audio Deepfake Source Tracing","venue":"eess.AS","work_id":"8868c4e0-d936-4297-95b1-f6ff85ecd3df","year":2025},"citing_paper":{"arxiv_id":"2506.07294","last_updated":"2025-08-16T22:33:43Z","snapshot_observed_at":"2026-08-07T05:34:41.391218Z","submitted_at":"2025-06-08T21:36:10Z","title":"Towards Generalized Source Tracing for Codec-Based Deepfake Speech","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:08.315601Z"},"links":{"cited_paper":"/paper/2505.14601","citing_paper":"/paper/2506.07294"},"observation_digest":"sha256:c0dcba84d517a7db6abac37994316aa7f4b942d57014ce5b1027472193a9b844","observation_id":"7dbbc8f3-08ba-4008-95f3-e47dfeaa5a94","resolution":{"observed_at":"2026-08-07T05:43:08.755086Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.12627","last_updated":"2025-06-14T21:00:39Z","snapshot_observed_at":"2026-08-07T00:42:36.771247Z","submitted_at":"2025-06-14T21:00:39Z","title":"Towards Neural Audio Codec Source Parsing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.12627","snapshot_observed_at":"2026-08-07T05:43:08.319149Z","title":"Towards neural audio codec source parsing,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07294","last_updated":"2025-08-16T22:33:43Z","snapshot_observed_at":"2026-08-07T05:34:41.391218Z","submitted_at":"2025-06-08T21:36:10Z","title":"Towards Generalized Source Tracing for Codec-Based Deepfake Speech","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:08.319149Z"},"links":{"cited_paper":"/paper/2506.12627","citing_paper":"/paper/2506.07294"},"observation_digest":"sha256:d385f5ba297611b8aeafe65fe78e29fcee5813ba2d8283195c4f645ba4c66189","observation_id":"01c6ea52-d3e0-43d5-b24e-3140faa90254","resolution":{"observed_at":"2026-08-07T05:43:08.319149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:09.112271Z","title":"CodecFake: En- hancing anti-spoofing models against deepfake audios from codec-based speech synthesis systems,","venue":null,"work_id":"9eb93730-234e-494d-924e-e26f9220a8e3","year":2024},"citing_paper":{"arxiv_id":"2506.07294","last_updated":"2025-08-16T22:33:43Z","snapshot_observed_at":"2026-08-07T05:34:41.391218Z","submitted_at":"2025-06-08T21:36:10Z","title":"Towards Generalized Source Tracing for Codec-Based Deepfake Speech","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:08.322722Z"},"links":{"citing_paper":"/paper/2506.07294"},"observation_digest":"sha256:271414e2bb6ec08f695db257f8d3e11e9ead88a6205111f0e12cf9585b73a628","observation_id":"8b734f88-ea9f-4c4d-bf73-58ad1cdfe11e","resolution":{"observed_at":"2026-08-07T05:43:09.116718Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08238","last_updated":"2026-06-05T17:32:46Z","snapshot_observed_at":"2026-07-06T20:21:00.314703Z","submitted_at":"2025-01-14T16:26:14Z","title":"CodecFake+: Codec-Based Resynthesized Data as a Proxy for Detecting CodecFake Speech","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.08238","snapshot_observed_at":"2026-08-07T05:43:08.326154Z","title":"Codec- Fake+: A large-scale neural audio codec-based deepfake speech dataset,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07294","last_updated":"2025-08-16T22:33:43Z","snapshot_observed_at":"2026-08-07T05:34:41.391218Z","submitted_at":"2025-06-08T21:36:10Z","title":"Towards Generalized Source Tracing for Codec-Based Deepfake Speech","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:08.326154Z"},"links":{"cited_paper":"/paper/2501.08238","citing_paper":"/paper/2506.07294"},"observation_digest":"sha256:51087a29bda3f9c842ba9d3b1a474df16ad237a1deb29c9f5ea6674aeee089d5","observation_id":"e1dcd91c-70e6-4704-ad9d-b2be91fa50df","resolution":{"observed_at":"2026-08-07T05:43:08.326154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12994","last_updated":"2025-08-03T07:58:47Z","snapshot_observed_at":"2026-08-07T15:43:17.200568Z","submitted_at":"2025-05-19T11:31:32Z","title":"Codec-Based Deepfake Source Tracing via Neural Audio Codec Taxonomy","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.12994","snapshot_observed_at":"2026-08-07T05:43:08.329952Z","title":"Codec-based deepfake source trac- ing via neural audio codec taxonomy,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07294","last_updated":"2025-08-16T22:33:43Z","snapshot_observed_at":"2026-08-07T05:34:41.391218Z","submitted_at":"2025-06-08T21:36:10Z","title":"Towards Generalized Source Tracing for Codec-Based Deepfake Speech","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:08.329952Z"},"links":{"cited_paper":"/paper/2505.12994","citing_paper":"/paper/2506.07294"},"observation_digest":"sha256:bfeec85ec5a8c41dd834805762dddc83a5c6a33f83922316b004edc4e8353d94","observation_id":"7cf198e4-2b76-4cc2-b767-8be3f187f132","resolution":{"observed_at":"2026-08-07T05:43:08.329952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:08.333557Z","title":"Recent advances in discrete speech tokens: A review,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07294","last_updated":"2025-08-16T22:33:43Z","snapshot_observed_at":"2026-08-07T05:34:41.391218Z","submitted_at":"2025-06-08T21:36:10Z","title":"Towards Generalized Source Tracing for Codec-Based Deepfake Speech","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:08.333557Z"},"links":{"citing_paper":"/paper/2506.07294"},"observation_digest":"sha256:9e884baad42363b4e1a527197d06a31348ce69119feb2451fff93c364265d29b","observation_id":"3295d263-0949-40aa-9f53-e77d63a7440c","resolution":{"observed_at":"2026-08-07T05:43:08.333557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13236","last_updated":"2024-02-20T18:50:25Z","snapshot_observed_at":"2026-08-06T03:13:16.529776Z","submitted_at":"2024-02-20T18:50:25Z","title":"Towards audio language modeling -- an overview","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13236","snapshot_observed_at":"2026-08-07T05:43:08.337092Z","title":"Towards au- dio language modeling-an overview,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07294","last_updated":"2025-08-16T22:33:43Z","snapshot_observed_at":"2026-08-07T05:34:41.391218Z","submitted_at":"2025-06-08T21:36:10Z","title":"Towards Generalized Source Tracing for Codec-Based Deepfake Speech","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:08.337092Z"},"links":{"cited_paper":"/paper/2402.13236","citing_paper":"/paper/2506.07294"},"observation_digest":"sha256:f3ab77e9e60f318245736af1604c412145d20c771e82f5ff5decdba1fb0db74c","observation_id":"ec034de6-3d8c-4ca7-9e9f-86ae48eb45fe","resolution":{"observed_at":"2026-08-07T05:43:08.337092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:09.099718Z","title":"Codec-SUPERB: An in-depth analysis of sound codec models,","venue":null,"work_id":"36522be5-29f9-45b5-a973-7e024a545643","year":2024},"citing_paper":{"arxiv_id":"2506.07294","last_updated":"2025-08-16T22:33:43Z","snapshot_observed_at":"2026-08-07T05:34:41.391218Z","submitted_at":"2025-06-08T21:36:10Z","title":"Towards Generalized Source Tracing for Codec-Based Deepfake Speech","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:08.341066Z"},"links":{"citing_paper":"/paper/2506.07294"},"observation_digest":"sha256:64d87eeb4c64cbd79277c3039979b581ad5a1517332a9df9a75bd59d922b12d3","observation_id":"a7c8ae83-66dd-421f-a4f0-900b8cc7c6dd","resolution":{"observed_at":"2026-08-07T05:43:09.103909Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:09.086765Z","title":"Codec-SUPERB@ SLT 2024: A lightweight benchmark for neural audio codec models,","venue":null,"work_id":"5089f170-6f1d-459d-8b7d-f7747eb96385","year":2024},"citing_paper":{"arxiv_id":"2506.07294","last_updated":"2025-08-16T22:33:43Z","snapshot_observed_at":"2026-08-07T05:34:41.391218Z","submitted_at":"2025-06-08T21:36:10Z","title":"Towards Generalized Source Tracing for Codec-Based Deepfake Speech","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:08.344782Z"},"links":{"citing_paper":"/paper/2506.07294"},"observation_digest":"sha256:038caaafa4c919f99b74f3ba44ed2d38e5a4428268ef1ec53ccdc01530a47b21","observation_id":"4dbcd270-4756-4e58-bea0-794956337341","resolution":{"observed_at":"2026-08-07T05:43:09.090800Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:09.072569Z","title":"Improved deepfake detection using whisper features,","venue":null,"work_id":"09a006d2-af75-459c-bf8f-ff7552890f4e","year":2023},"citing_paper":{"arxiv_id":"2506.07294","last_updated":"2025-08-16T22:33:43Z","snapshot_observed_at":"2026-08-07T05:34:41.391218Z","submitted_at":"2025-06-08T21:36:10Z","title":"Towards Generalized Source Tracing for Codec-Based Deepfake Speech","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:08.348154Z"},"links":{"citing_paper":"/paper/2506.07294"},"observation_digest":"sha256:75a3eb8d734a2d24b97d68128a6ace33ff594d11267b1c7841229e4d5231bb61","observation_id":"e4d9d556-fbe5-4c06-a335-29299c034dde","resolution":{"observed_at":"2026-08-07T05:43:09.076873Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:09.058918Z","title":"Aasist: Audio anti- spoofing using integrated spectro-temporal graph atten- tion networks,","venue":null,"work_id":"f2f71733-af19-4b44-9680-95f605385c48","year":2022},"citing_paper":{"arxiv_id":"2506.07294","last_updated":"2025-08-16T22:33:43Z","snapshot_observed_at":"2026-08-07T05:34:41.391218Z","submitted_at":"2025-06-08T21:36:10Z","title":"Towards Generalized Source Tracing for Codec-Based Deepfake Speech","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:08.351607Z"},"links":{"citing_paper":"/paper/2506.07294"},"observation_digest":"sha256:434a15723a05845d77bd09b673fb2484a6fee2411eac128b560b5a7e2a5dfe13","observation_id":"0d805bfb-bbf5-4314-b558-7213e38544a9","resolution":{"observed_at":"2026-08-07T05:43:09.063454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:09.045232Z","title":"Robust speech recog- nition via large-scale weak supervision,","venue":null,"work_id":"acff604e-d54e-441e-ac28-18c439551489","year":2022},"citing_paper":{"arxiv_id":"2506.07294","last_updated":"2025-08-16T22:33:43Z","snapshot_observed_at":"2026-08-07T05:34:41.391218Z","submitted_at":"2025-06-08T21:36:10Z","title":"Towards Generalized Source Tracing for Codec-Based Deepfake Speech","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:08.355100Z"},"links":{"citing_paper":"/paper/2506.07294"},"observation_digest":"sha256:39a6faed2d75f4d9e74e6f7df69b7c55d6426d5aca2bd0ad39b57c67cb1bec57","observation_id":"f0e96551-cc21-4b17-ba76-0d2dbd94879d","resolution":{"observed_at":"2026-08-07T05:43:09.049766Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09296","last_updated":"2021-12-16T18:29:22Z","snapshot_observed_at":"2026-07-06T12:09:37.468149Z","submitted_at":"2021-11-17T18:49:42Z","title":"XLS-R: Self-supervised Cross-lingual Speech Representation Learning at Scale","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09296","snapshot_observed_at":"2026-08-07T05:43:08.358475Z","title":"Xls-r: Self- supervised cross-lingual speech representation learning at scale,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.07294","last_updated":"2025-08-16T22:33:43Z","snapshot_observed_at":"2026-08-07T05:34:41.391218Z","submitted_at":"2025-06-08T21:36:10Z","title":"Towards Generalized Source Tracing for Codec-Based Deepfake Speech","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:08.358475Z"},"links":{"cited_paper":"/paper/2111.09296","citing_paper":"/paper/2506.07294"},"observation_digest":"sha256:d625a3eb49df4ffcf75740f9520813d813d1e9a2d8b7aa74516c7488da761b58","observation_id":"df060ada-c158-40dd-a58e-c297ca8c74c8","resolution":{"observed_at":"2026-08-07T05:43:08.358475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:09.029898Z","title":"Masked au- toencoders that listen,","venue":null,"work_id":"3fce46b6-344f-4ebe-81c6-c9b7e5966fb5","year":2022},"citing_paper":{"arxiv_id":"2506.07294","last_updated":"2025-08-16T22:33:43Z","snapshot_observed_at":"2026-08-07T05:34:41.391218Z","submitted_at":"2025-06-08T21:36:10Z","title":"Towards Generalized Source Tracing for Codec-Based Deepfake Speech","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:08.362016Z"},"links":{"citing_paper":"/paper/2506.07294"},"observation_digest":"sha256:ad1cc66735eda4ecd6a561726d6500c269c501f4230ea4e35b470f11e847a20c","observation_id":"f79dbe60-53e3-409b-941d-90a117dd682c","resolution":{"observed_at":"2026-08-07T05:43:09.034182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.06377","last_updated":"2021-12-19T19:23:25Z","snapshot_observed_at":"2026-07-31T02:35:46.853381Z","submitted_at":"2021-11-11T18:46:40Z","title":"Masked Autoencoders Are Scalable Vision Learners","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.06377","snapshot_observed_at":"2026-08-07T05:43:08.365509Z","title":"Mae: Masked autoencoders are scalable vision learners,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.07294","last_updated":"2025-08-16T22:33:43Z","snapshot_observed_at":"2026-08-07T05:34:41.391218Z","submitted_at":"2025-06-08T21:36:10Z","title":"Towards Generalized Source Tracing for Codec-Based Deepfake Speech","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:08.365509Z"},"links":{"cited_paper":"/paper/2111.06377","citing_paper":"/paper/2506.07294"},"observation_digest":"sha256:846b2cc401baca03ee0bb5c16c3b6f0e3b91b58ffcff4fff0a85923b765834a7","observation_id":"e38ae026-609f-4b0b-9c6c-eb370c4fb728","resolution":{"observed_at":"2026-08-07T05:43:08.365509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:09.017587Z","title":"Adversarial sample detection for speaker verification by neural vocoders,","venue":null,"work_id":"6aa186d9-712a-4f77-9917-14d2d2a4c00c","year":2022},"citing_paper":{"arxiv_id":"2506.07294","last_updated":"2025-08-16T22:33:43Z","snapshot_observed_at":"2026-08-07T05:34:41.391218Z","submitted_at":"2025-06-08T21:36:10Z","title":"Towards Generalized Source Tracing for Codec-Based Deepfake Speech","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:08.369117Z"},"links":{"citing_paper":"/paper/2506.07294"},"observation_digest":"sha256:6e00583fd1a8dfd7abdb4d5ae9a5502bcde3a6c5299e33284d46452149d4a68f","observation_id":"7fb84deb-286f-4c73-ac51-4aa352836271","resolution":{"observed_at":"2026-08-07T05:43:09.021547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:09.005153Z","title":"Neural codec-based adversarial sample detection for speaker verification,","venue":null,"work_id":"b49b1f15-2f81-4fa8-ba65-0c1b79a2f213","year":2024},"citing_paper":{"arxiv_id":"2506.07294","last_updated":"2025-08-16T22:33:43Z","snapshot_observed_at":"2026-08-07T05:34:41.391218Z","submitted_at":"2025-06-08T21:36:10Z","title":"Towards Generalized Source Tracing for Codec-Based Deepfake Speech","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:08.372529Z"},"links":{"citing_paper":"/paper/2506.07294"},"observation_digest":"sha256:e6534b396c913f94fc03d9b2320d261d1a6eaf47c05ae81041793a787cc781ba","observation_id":"7032dbe1-409f-48c5-b812-276dfb3eb784","resolution":{"observed_at":"2026-08-07T05:43:09.009305Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02233","last_updated":"2026-07-16T01:44:59Z","snapshot_observed_at":"2026-07-19T23:18:13.438957Z","submitted_at":"2024-06-04T11:55:11Z","title":"Towards Out-of-Distribution Detection in Vocoder Recognition via Latent Feature Reconstruction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02233","snapshot_observed_at":"2026-08-07T05:43:08.375819Z","title":"To- wards out-of-distribution detection in vocoder recogni- tion via latent feature reconstruction,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07294","last_updated":"2025-08-16T22:33:43Z","snapshot_observed_at":"2026-08-07T05:34:41.391218Z","submitted_at":"2025-06-08T21:36:10Z","title":"Towards Generalized Source Tracing for Codec-Based Deepfake Speech","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:08.375819Z"},"links":{"cited_paper":"/paper/2406.02233","citing_paper":"/paper/2506.07294"},"observation_digest":"sha256:f4738de572eb6221b9548b29bac473c4069146063fb45faa16b6e424773c31d2","observation_id":"3c53ff36-aee7-49f2-bc8e-6a4d42413030","resolution":{"observed_at":"2026-08-07T05:43:08.375819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:08.992945Z","title":"Push-pull: Characterizing the adversarial robustness for audio-visual active speaker detection,","venue":null,"work_id":"8ce19d0a-cdd7-4272-bfc1-db9b3f2bda1a","year":2022},"citing_paper":{"arxiv_id":"2506.07294","last_updated":"2025-08-16T22:33:43Z","snapshot_observed_at":"2026-08-07T05:34:41.391218Z","submitted_at":"2025-06-08T21:36:10Z","title":"Towards Generalized Source Tracing for Codec-Based Deepfake Speech","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:08.379433Z"},"links":{"citing_paper":"/paper/2506.07294"},"observation_digest":"sha256:3523316a818c8efa7c30ff7e4a350dd0accc8416d86b44db6a91c9d44a11080d","observation_id":"68d116e0-f247-4547-b34e-37a13c11a76d","resolution":{"observed_at":"2026-08-07T05:43:08.996846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:08.979748Z","title":"Multimodal transformer distillation for audio- visual synchronization,","venue":null,"work_id":"1ab5f8b0-a6c8-412e-95c4-f308f8cb67e0","year":2024},"citing_paper":{"arxiv_id":"2506.07294","last_updated":"2025-08-16T22:33:43Z","snapshot_observed_at":"2026-08-07T05:34:41.391218Z","submitted_at":"2025-06-08T21:36:10Z","title":"Towards Generalized Source Tracing for Codec-Based Deepfake Speech","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:08.382884Z"},"links":{"citing_paper":"/paper/2506.07294"},"observation_digest":"sha256:6ac42e27137184ab2de238764a215d7b0d80e0505689f36ccb1e9bfc97987cf7","observation_id":"6715ea09-403e-4ea5-b2f0-823370371867","resolution":{"observed_at":"2026-08-07T05:43:08.984382Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.02000","last_updated":"2025-08-04T02:41:09Z","snapshot_observed_at":"2026-08-06T05:19:05.673484Z","submitted_at":"2025-08-04T02:41:09Z","title":"Localizing Audio-Visual Deepfakes via Hierarchical Boundary Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.02000","snapshot_observed_at":"2026-08-07T05:43:08.386247Z","title":"Localizing audio- visual deepfakes via hierarchical boundary modeling,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07294","last_updated":"2025-08-16T22:33:43Z","snapshot_observed_at":"2026-08-07T05:34:41.391218Z","submitted_at":"2025-06-08T21:36:10Z","title":"Towards Generalized Source Tracing for Codec-Based Deepfake Speech","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:08.386247Z"},"links":{"cited_paper":"/paper/2508.02000","citing_paper":"/paper/2506.07294"},"observation_digest":"sha256:0988aff272ff06ad7f8635aab24a306547dd70d8eb87c62c6617904bea663bea","observation_id":"2186c5ec-4dde-4ced-9e64-6293e8ade4f3","resolution":{"observed_at":"2026-08-07T05:43:08.386247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:08.390007Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.07294","last_updated":"2025-08-16T22:33:43Z","snapshot_observed_at":"2026-08-07T05:34:41.391218Z","submitted_at":"2025-06-08T21:36:10Z","title":"Towards Generalized Source Tracing for Codec-Based Deepfake Speech","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:08.390007Z"},"links":{"citing_paper":"/paper/2506.07294"},"observation_digest":"sha256:dbc75e64bcdedd927946b36f7030288ef692e36fd478da5c6f4cfa40a5e9cd82","observation_id":"60209873-ca57-4f66-89c5-b20cd3272744","resolution":{"observed_at":"2026-08-07T05:43:08.390007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1805.06334","last_updated":"2018-05-17T16:12:16Z","snapshot_observed_at":"2026-08-04T09:18:49.772826Z","submitted_at":"2018-05-16T13:59:20Z","title":"Auxiliary Tasks in Multi-task Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1805.06334","snapshot_observed_at":"2026-08-07T05:43:08.393663Z","title":"Auxiliary tasks in multi-task learning,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.07294","last_updated":"2025-08-16T22:33:43Z","snapshot_observed_at":"2026-08-07T05:34:41.391218Z","submitted_at":"2025-06-08T21:36:10Z","title":"Towards Generalized Source Tracing for Codec-Based Deepfake Speech","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:08.393663Z"},"links":{"cited_paper":"/paper/1805.06334","citing_paper":"/paper/2506.07294"},"observation_digest":"sha256:a85dbe1de52a8ecb92bd14d95d395cfd6408d2b45fdad9a482d448c1204137ea","observation_id":"cf58cf55-fc8f-490c-bb8a-4647cc838370","resolution":{"observed_at":"2026-08-07T05:43:08.393663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:08.958083Z","title":"Automatic speaker verification spoofing and deepfake detection using wav2vec 2.0 and data augmentation,","venue":null,"work_id":"3e9883c5-8ce0-489e-88c5-aa298d245567","year":2022},"citing_paper":{"arxiv_id":"2506.07294","last_updated":"2025-08-16T22:33:43Z","snapshot_observed_at":"2026-08-07T05:34:41.391218Z","submitted_at":"2025-06-08T21:36:10Z","title":"Towards Generalized Source Tracing for Codec-Based Deepfake Speech","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:08.397389Z"},"links":{"citing_paper":"/paper/2506.07294"},"observation_digest":"sha256:e8fa92abdaa27f675270ec30a2beb030ccd8d3597cdf5ae307029ddb52fb8177","observation_id":"82bd2cc0-33b8-4efe-8326-f34e79f39275","resolution":{"observed_at":"2026-08-07T05:43:08.962015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:08.946119Z","title":"Rawboost: A raw data boosting and augmentation method applied to automatic speaker verification anti- spoofing,","venue":null,"work_id":"99970a5a-ccff-4dc1-b2f7-00fa5ef429b6","year":2022},"citing_paper":{"arxiv_id":"2506.07294","last_updated":"2025-08-16T22:33:43Z","snapshot_observed_at":"2026-08-07T05:34:41.391218Z","submitted_at":"2025-06-08T21:36:10Z","title":"Towards Generalized Source Tracing for Codec-Based Deepfake Speech","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:08.400983Z"},"links":{"citing_paper":"/paper/2506.07294"},"observation_digest":"sha256:7b6d8515edd750af01f509b14ae4eec1c4e6676504b622690029c13637b70c23","observation_id":"a51bbc2d-3de4-4c10-b1a0-d7c801d8e6a7","resolution":{"observed_at":"2026-08-07T05:43:08.950120Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:08.933763Z","title":"Cstr vctk corpus: English multi-speaker corpus for cstr voice cloning toolkit (version 0.92),","venue":null,"work_id":"d5cc5f5c-815f-4da8-ab52-4490b50f80a3","year":2019},"citing_paper":{"arxiv_id":"2506.07294","last_updated":"2025-08-16T22:33:43Z","snapshot_observed_at":"2026-08-07T05:34:41.391218Z","submitted_at":"2025-06-08T21:36:10Z","title":"Towards Generalized Source Tracing for Codec-Based Deepfake Speech","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:08.404377Z"},"links":{"citing_paper":"/paper/2506.07294"},"observation_digest":"sha256:c9d24804e510df75526c6058e48bad0b29ae3d6b2d00d073fbba4f4b759af8be","observation_id":"141b3f3b-2a0d-4f31-adf9-de7f78de781a","resolution":{"observed_at":"2026-08-07T05:43:08.937727Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:08.921515Z","title":"UniAudio: Towards universal audio gen- eration with large language models,","venue":null,"work_id":"67877da4-c99d-47ba-bb1d-d451fa9564b0","year":2024},"citing_paper":{"arxiv_id":"2506.07294","last_updated":"2025-08-16T22:33:43Z","snapshot_observed_at":"2026-08-07T05:34:41.391218Z","submitted_at":"2025-06-08T21:36:10Z","title":"Towards Generalized Source Tracing for Codec-Based Deepfake Speech","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:08.407794Z"},"links":{"citing_paper":"/paper/2506.07294"},"observation_digest":"sha256:5068f7c162d6be83434849348a2b46a69d9b0f8e7021020f7d71f319d4987936","observation_id":"3ff5c0c3-9239-48c1-8d17-6271eb9408ce","resolution":{"observed_at":"2026-08-07T05:43:08.925532Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:08.907545Z","title":"MaskGCT: Zero-shot text-to-speech with masked generative codec transformer,","venue":null,"work_id":"2f065615-cf01-4b4d-8df7-b918d73c67a5","year":2025},"citing_paper":{"arxiv_id":"2506.07294","last_updated":"2025-08-16T22:33:43Z","snapshot_observed_at":"2026-08-07T05:34:41.391218Z","submitted_at":"2025-06-08T21:36:10Z","title":"Towards Generalized Source Tracing for Codec-Based Deepfake Speech","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:08.411320Z"},"links":{"citing_paper":"/paper/2506.07294"},"observation_digest":"sha256:7ece2245632fb684f9b26f81781775e36b1517a6d20885aee338d4c419409044","observation_id":"fc5aa0c1-469c-4fe7-a310-c6f496955678","resolution":{"observed_at":"2026-08-07T05:43:08.912122Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:08.894982Z","title":"The impact of silence on speech anti- spoofing,","venue":null,"work_id":"87cffa7d-74ab-40a3-acaa-77a038666579","year":2023},"citing_paper":{"arxiv_id":"2506.07294","last_updated":"2025-08-16T22:33:43Z","snapshot_observed_at":"2026-08-07T05:34:41.391218Z","submitted_at":"2025-06-08T21:36:10Z","title":"Towards Generalized Source Tracing for Codec-Based Deepfake Speech","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:08.414684Z"},"links":{"citing_paper":"/paper/2506.07294"},"observation_digest":"sha256:a1fd7d396ee45bf8c3351af23ea88b1059eda2d344f30e8ccd745f499e622a9b","observation_id":"37a90e27-11ea-4b3b-ac8c-8437fd99395d","resolution":{"observed_at":"2026-08-07T05:43:08.899004Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:08.881915Z","title":"The effect of silence and dual-band fusion in anti-spoofing system,","venue":null,"work_id":"6bd05308-179f-45a0-a9c5-b1658498ed79","year":2021},"citing_paper":{"arxiv_id":"2506.07294","last_updated":"2025-08-16T22:33:43Z","snapshot_observed_at":"2026-08-07T05:34:41.391218Z","submitted_at":"2025-06-08T21:36:10Z","title":"Towards Generalized Source Tracing for Codec-Based Deepfake Speech","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:08.417974Z"},"links":{"citing_paper":"/paper/2506.07294"},"observation_digest":"sha256:c08933dcb8d85a3d32d63f9f076588247a886b161acfe28457dda6a0d53de7aa","observation_id":"c0ec5f1c-3f38-4e0b-ae21-f2804ee347f6","resolution":{"observed_at":"2026-08-07T05:43:08.885959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03247","last_updated":"2024-06-09T05:42:04Z","snapshot_observed_at":"2026-08-04T07:50:23.136776Z","submitted_at":"2024-06-05T13:22:09Z","title":"Genuine-Focused Learning using Mask AutoEncoder for Generalized Fake Audio Detection","version":2},"cited_work":{"arxiv_id":"2406.03247","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.03247","snapshot_observed_at":"2026-08-07T05:43:08.496391Z","title":"Genuine-Focused Learning using Mask AutoEncoder for Generalized Fake Audio Detection","venue":"cs.SD","work_id":"5e756252-37b1-4bf9-9c0c-1d4d24ad2b36","year":2024},"citing_paper":{"arxiv_id":"2506.07294","last_updated":"2025-08-16T22:33:43Z","snapshot_observed_at":"2026-08-07T05:34:41.391218Z","submitted_at":"2025-06-08T21:36:10Z","title":"Towards Generalized Source Tracing for Codec-Based Deepfake Speech","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:08.421235Z"},"links":{"cited_paper":"/paper/2406.03247","citing_paper":"/paper/2506.07294"},"observation_digest":"sha256:4312a04562939f6d8532087cd9e0fa6bfdcca84b70bdfd3b466d4134313f1720","observation_id":"b3b05fd7-f063-44df-88cd-45e035271d17","resolution":{"observed_at":"2026-08-07T05:43:08.502776Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:08.868116Z","title":"Dynamic-superb: Towards a dynamic, collabo- rative, and comprehensive instruction-tuning benchmark for speech,","venue":null,"work_id":"2e1cddac-c6fb-48ec-85c3-73b59555b041","year":2024},"citing_paper":{"arxiv_id":"2506.07294","last_updated":"2025-08-16T22:33:43Z","snapshot_observed_at":"2026-08-07T05:34:41.391218Z","submitted_at":"2025-06-08T21:36:10Z","title":"Towards Generalized Source Tracing for Codec-Based Deepfake Speech","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:08.424690Z"},"links":{"citing_paper":"/paper/2506.07294"},"observation_digest":"sha256:712799840108ade0ca224ba195842fea6189a6eff8c327f929c394d063cc1894","observation_id":"919f7080-8ddc-4fbd-ae7a-0cffcd68794a","resolution":{"observed_at":"2026-08-07T05:43:08.872285Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:08.855123Z","title":"Dynamic-SUPERB phase-2: A collaboratively expanding benchmark for measuring the capabilities of spoken language models with 180 tasks,","venue":null,"work_id":"120fcd0e-2cc9-415c-8dd2-8413c0b40eff","year":2025},"citing_paper":{"arxiv_id":"2506.07294","last_updated":"2025-08-16T22:33:43Z","snapshot_observed_at":"2026-08-07T05:34:41.391218Z","submitted_at":"2025-06-08T21:36:10Z","title":"Towards Generalized Source Tracing for Codec-Based Deepfake Speech","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:08.428428Z"},"links":{"citing_paper":"/paper/2506.07294"},"observation_digest":"sha256:ea1cf03b450ec9d1d245b7e067d174f7bc7d4575f2253020194ee9b2191f0419","observation_id":"5d5190e6-bdda-4dfd-96b3-c4044af2305b","resolution":{"observed_at":"2026-08-07T05:43:08.859409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15957","last_updated":"2026-04-26T17:05:53Z","snapshot_observed_at":"2026-07-06T21:28:06.120576Z","submitted_at":"2025-05-21T19:17:29Z","title":"Towards Holistic Evaluation of Large Audio-Language Models: A Comprehensive Survey","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15957","snapshot_observed_at":"2026-08-07T05:43:08.431748Z","title":"Towards holistic evaluation of large audio-language models: A compre- hensive survey,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07294","last_updated":"2025-08-16T22:33:43Z","snapshot_observed_at":"2026-08-07T05:34:41.391218Z","submitted_at":"2025-06-08T21:36:10Z","title":"Towards Generalized Source Tracing for Codec-Based Deepfake Speech","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:08.431748Z"},"links":{"cited_paper":"/paper/2505.15957","citing_paper":"/paper/2506.07294"},"observation_digest":"sha256:36b84305a2d4c6c81e066170cba805a15c8a931f8ceaf051c4085f51887e2279","observation_id":"4d4e21e9-a9eb-4f1c-b736-8aa2ffa2ec25","resolution":{"observed_at":"2026-08-07T05:43:08.431748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09940","last_updated":"2025-02-14T06:34:08Z","snapshot_observed_at":"2026-08-07T19:57:13.037270Z","submitted_at":"2025-02-14T06:34:08Z","title":"A Preliminary Exploration with GPT-4o Voice Mode","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09940","snapshot_observed_at":"2026-08-07T05:43:08.435473Z","title":"A preliminary exploration with gpt-4o voice mode,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07294","last_updated":"2025-08-16T22:33:43Z","snapshot_observed_at":"2026-08-07T05:34:41.391218Z","submitted_at":"2025-06-08T21:36:10Z","title":"Towards Generalized Source Tracing for Codec-Based Deepfake Speech","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:08.435473Z"},"links":{"cited_paper":"/paper/2502.09940","citing_paper":"/paper/2506.07294"},"observation_digest":"sha256:d3eb98e42e4a49436a235628e6d65e894f9e168dabc37bf0ab755b4305b88ded","observation_id":"bab67a9a-cbc5-4ae2-a27f-821dd93357a5","resolution":{"observed_at":"2026-08-07T05:43:08.435473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.07294","last_updated":"2025-08-16T22:33:43Z","latest_version":3,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-07T05:34:41.391218Z","submitted_at":"2025-06-08T21:36:10Z","title":"Towards Generalized Source Tracing for Codec-Based Deepfake Speech"},"reference_resolution":{"displayed":53,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":17,"verified_exact":4,"verified_fuzzy":32},"total_outbound_references":53},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 53 of 53 outbound references and 4 inbound Pith citation observations for arXiv:2506.07294."}