{"as_of":"2026-08-08T21:58:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8928bdf17d4eccb96c008df9c63104ea87365c33b5326cf3673bdb1c9a09b909","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:52:46.527011Z","state":"measured"},{"denominator":34,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":34,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:52:43.353115Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T12:29:52.013717Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.21568","last_updated":"2025-05-30T12:11:04Z","snapshot_observed_at":"2026-08-07T13:45:07.360193Z","submitted_at":"2025-05-27T05:59:34Z","title":"VoiceMark: Zero-Shot Voice Cloning-Resistant Watermarking Approach Leveraging Speaker-Specific Latents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.21568","snapshot_observed_at":"2026-08-07T13:52:43.353115Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21568","last_updated":"2025-05-30T12:11:04Z","snapshot_observed_at":"2026-08-07T13:45:07.360193Z","submitted_at":"2025-05-27T05:59:34Z","title":"VoiceMark: Zero-Shot Voice Cloning-Resistant Watermarking Approach Leveraging Speaker-Specific Latents","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:43.353115Z"},"links":{"cited_paper":"/paper/2505.21568","citing_paper":"/paper/2505.21568"},"observation_digest":"sha256:a0216c782500f348216cf864c627898ef9969210aa6aa67478b01ea53603e4a8","observation_id":"ea8d6b6c-5020-4ef9-b1f5-c9b285b97071","resolution":{"observed_at":"2026-08-07T13:52:43.353115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21568","last_updated":"2025-05-30T12:11:04Z","snapshot_observed_at":"2026-08-07T13:45:07.360193Z","submitted_at":"2025-05-27T05:59:34Z","title":"VoiceMark: Zero-Shot Voice Cloning-Resistant Watermarking Approach Leveraging Speaker-Specific Latents","version":2},"cited_work":{"arxiv_id":"2505.21568","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21568","snapshot_observed_at":"2026-07-04T12:29:52.013717Z","title":"V oiceMark: Zero-shot voice cloning-resistant watermarking approach leveraging speaker-specific latents,","venue":null,"work_id":"b0cf2ed6-410a-46a6-ad43-4e797f08b13d","year":2025},"citing_paper":{"arxiv_id":"2606.23335","last_updated":"2026-06-22T13:42:31Z","snapshot_observed_at":"2026-08-02T14:38:10.010771Z","submitted_at":"2026-06-22T13:42:31Z","title":"The Watermark Shortcut: How Provenance Marking Sabotages Audio Deepfake Detection","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-26T06:45:08.471913Z"},"links":{"cited_paper":"/paper/2505.21568","citing_paper":"/paper/2606.23335"},"observation_digest":"sha256:cb1898b677ad5779e94c394149394a3c68c33289c51c38e7e13a2c4411326677","observation_id":"25ff0174-6c54-417b-a1ee-d4274bf0c2a7","resolution":{"observed_at":"2026-07-04T12:29:52.015200Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21568","last_updated":"2025-05-30T12:11:04Z","snapshot_observed_at":"2026-08-07T13:45:07.360193Z","submitted_at":"2025-05-27T05:59:34Z","title":"VoiceMark: Zero-Shot Voice Cloning-Resistant Watermarking Approach Leveraging Speaker-Specific Latents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.21568","snapshot_observed_at":"2026-08-01T08:25:27.668664Z","title":"V oiceMark: Zero- shot voice cloning-resistant watermarking approach leveraging speaker- specific latents,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21132","last_updated":"2026-07-23T10:12:36Z","snapshot_observed_at":"2026-08-06T20:43:47.837332Z","submitted_at":"2026-07-23T10:12:36Z","title":"Investigating Codec-Internal Latent Audio Watermarking for Neural Codec Robustness","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T08:25:27.668664Z"},"links":{"cited_paper":"/paper/2505.21568","citing_paper":"/paper/2607.21132"},"observation_digest":"sha256:5d03b353c4a6e13310c31be90413cbd61fd46b5d8e327ac5f65e4dfbbb634762","observation_id":"6f14e012-b715-4550-9e8b-8e76118ffb03","resolution":{"observed_at":"2026-08-01T08:25:27.668664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.21568/citation-record","integrity":"/paper/2505.21568/integrity","json":"/paper/2505.21568/citation-record.json","paper":"/paper/2505.21568"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.21568","last_updated":"2025-05-30T12:11:04Z","snapshot_observed_at":"2026-08-07T13:45:07.360193Z","submitted_at":"2025-05-27T05:59:34Z","title":"VoiceMark: Zero-Shot Voice Cloning-Resistant Watermarking Approach Leveraging Speaker-Specific Latents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.21568","snapshot_observed_at":"2026-08-07T13:52:43.353115Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21568","last_updated":"2025-05-30T12:11:04Z","snapshot_observed_at":"2026-08-07T13:45:07.360193Z","submitted_at":"2025-05-27T05:59:34Z","title":"VoiceMark: Zero-Shot Voice Cloning-Resistant Watermarking Approach Leveraging Speaker-Specific Latents","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:43.353115Z"},"links":{"cited_paper":"/paper/2505.21568","citing_paper":"/paper/2505.21568"},"observation_digest":"sha256:a0216c782500f348216cf864c627898ef9969210aa6aa67478b01ea53603e4a8","observation_id":"ea8d6b6c-5020-4ef9-b1f5-c9b285b97071","resolution":{"observed_at":"2026-08-07T13:52:43.353115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:49.835704Z","title":"The RVQ model disentangles speaker-specific la- tents and reconstructs watermarked audio","venue":null,"work_id":"826e9e5c-08ca-465c-a0d0-3ccdefc930dd","year":null},"citing_paper":{"arxiv_id":"2505.21568","last_updated":"2025-05-30T12:11:04Z","snapshot_observed_at":"2026-08-07T13:45:07.360193Z","submitted_at":"2025-05-27T05:59:34Z","title":"VoiceMark: Zero-Shot Voice Cloning-Resistant Watermarking Approach Leveraging Speaker-Specific Latents","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:43.478910Z"},"links":{"citing_paper":"/paper/2505.21568"},"observation_digest":"sha256:814e0892d1f72fd687794151d76c38ac275668f4e92628f3ed2f9309983b7da0","observation_id":"0e7008c2-abaf-45ae-8b13-5e44351b3257","resolution":{"observed_at":"2026-08-07T13:52:49.916550Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:49.731802Z","title":"Implementation Details For the RVQ model, we use the pretrained SpeechTokenizer *","venue":null,"work_id":"d433a6f5-edc6-4896-b0f7-8b9d28193958","year":null},"citing_paper":{"arxiv_id":"2505.21568","last_updated":"2025-05-30T12:11:04Z","snapshot_observed_at":"2026-08-07T13:45:07.360193Z","submitted_at":"2025-05-27T05:59:34Z","title":"VoiceMark: Zero-Shot Voice Cloning-Resistant Watermarking Approach Leveraging Speaker-Specific Latents","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:43.611674Z"},"links":{"citing_paper":"/paper/2505.21568"},"observation_digest":"sha256:7ea1d394e3124118dfe9a5c3f4c74d84e994f37fcb9abd61607cb3aaa983e45b","observation_id":"7c24cade-15fa-4c13-87c6-cd4e09f82949","resolution":{"observed_at":"2026-08-07T13:52:49.783309Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:49.328516Z","title":"Additionally, we incorporate VC-simulated augmenta- tions and V AD-based loss to further enhance the robustness of V oiceMark","venue":null,"work_id":"1f86c8ba-f12d-4cbd-9420-5bb2a436eaee","year":null},"citing_paper":{"arxiv_id":"2505.21568","last_updated":"2025-05-30T12:11:04Z","snapshot_observed_at":"2026-08-07T13:45:07.360193Z","submitted_at":"2025-05-27T05:59:34Z","title":"VoiceMark: Zero-Shot Voice Cloning-Resistant Watermarking Approach Leveraging Speaker-Specific Latents","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:43.831228Z"},"links":{"citing_paper":"/paper/2505.21568"},"observation_digest":"sha256:1748c7e29e5d0e679800a317675496e240d293fb54fa5f953a3fe3e4d8f65ae6","observation_id":"ab851a6b-e778-4f76-8afd-7f0d2b9de3ca","resolution":{"observed_at":"2026-08-07T13:52:49.448395Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:49.175544Z","title":null,"venue":null,"work_id":"e37c4e0b-d1cc-41e5-9922-1da4d1977df2","year":null},"citing_paper":{"arxiv_id":"2505.21568","last_updated":"2025-05-30T12:11:04Z","snapshot_observed_at":"2026-08-07T13:45:07.360193Z","submitted_at":"2025-05-27T05:59:34Z","title":"VoiceMark: Zero-Shot Voice Cloning-Resistant Watermarking Approach Leveraging Speaker-Specific Latents","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:43.994445Z"},"links":{"citing_paper":"/paper/2505.21568"},"observation_digest":"sha256:b1dd29732e864bebfa13371ace4b205f0f9aff64247fc14661d28b41d98ed78c","observation_id":"a051ce5e-b760-4763-bb4b-cbbb5527256d","resolution":{"observed_at":"2026-08-07T13:52:49.231357Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:48.731099Z","title":"Gruhl, A","venue":null,"work_id":"52d02316-b59e-4388-bc1c-e32cbc539a36","year":1996},"citing_paper":{"arxiv_id":"2505.21568","last_updated":"2025-05-30T12:11:04Z","snapshot_observed_at":"2026-08-07T13:45:07.360193Z","submitted_at":"2025-05-27T05:59:34Z","title":"VoiceMark: Zero-Shot Voice Cloning-Resistant Watermarking Approach Leveraging Speaker-Specific Latents","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:44.680201Z"},"links":{"citing_paper":"/paper/2505.21568"},"observation_digest":"sha256:c15e7e2d3f909b4724a7663cc6f6659cbbb5b2a2a000ec2b4a333aee6b47389a","observation_id":"560a1257-afe8-4ed8-8c14-f2c1930dff7f","resolution":{"observed_at":"2026-08-07T13:52:48.861485Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:48.957144Z","title":"De- tecting voice cloning attacks via timbre watermarking,","venue":null,"work_id":"c6470c37-0ca4-473e-a85a-0502932be921","year":2024},"citing_paper":{"arxiv_id":"2505.21568","last_updated":"2025-05-30T12:11:04Z","snapshot_observed_at":"2026-08-07T13:45:07.360193Z","submitted_at":"2025-05-27T05:59:34Z","title":"VoiceMark: Zero-Shot Voice Cloning-Resistant Watermarking Approach Leveraging Speaker-Specific Latents","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:44.132018Z"},"links":{"citing_paper":"/paper/2505.21568"},"observation_digest":"sha256:5f225d4f6b3f2fcefe606711494c56a687086bb4a12149df0ebe0793adcf9ca0","observation_id":"a5a68e83-f819-4cbc-be9d-869bdade2d28","resolution":{"observed_at":"2026-08-07T13:52:49.052030Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05407","last_updated":"2024-07-09T07:42:51Z","snapshot_observed_at":"2026-07-06T18:42:34.958119Z","submitted_at":"2024-07-07T15:16:19Z","title":"CosyVoice: A Scalable Multilingual Zero-shot Text-to-speech Synthesizer based on Supervised Semantic Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05407","snapshot_observed_at":"2026-08-07T13:52:44.234690Z","title":"Cosyvoice: A scalable multi- lingual zero-shot text-to-speech synthesizer based on supervised semantic tokens,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21568","last_updated":"2025-05-30T12:11:04Z","snapshot_observed_at":"2026-08-07T13:45:07.360193Z","submitted_at":"2025-05-27T05:59:34Z","title":"VoiceMark: Zero-Shot Voice Cloning-Resistant Watermarking Approach Leveraging Speaker-Specific Latents","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:44.234690Z"},"links":{"cited_paper":"/paper/2407.05407","citing_paper":"/paper/2505.21568"},"observation_digest":"sha256:71077937fa12d9dc7d7fa6b5f14bf257cd29edbc9f7a20a106ecc5b614a5300a","observation_id":"14a77150-a91c-43f9-b55a-f36d57b18d1f","resolution":{"observed_at":"2026-08-07T13:52:44.234690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06885","last_updated":"2025-05-20T15:53:10Z","snapshot_observed_at":"2026-08-01T23:52:25.071174Z","submitted_at":"2024-10-09T13:46:34Z","title":"F5-TTS: A Fairytaler that Fakes Fluent and Faithful Speech with Flow Matching","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06885","snapshot_observed_at":"2026-08-07T13:52:44.357485Z","title":"F5-tts: A fairytaler that fakes fluent and faithful speech with flow matching,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21568","last_updated":"2025-05-30T12:11:04Z","snapshot_observed_at":"2026-08-07T13:45:07.360193Z","submitted_at":"2025-05-27T05:59:34Z","title":"VoiceMark: Zero-Shot Voice Cloning-Resistant Watermarking Approach Leveraging Speaker-Specific Latents","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:44.357485Z"},"links":{"cited_paper":"/paper/2410.06885","citing_paper":"/paper/2505.21568"},"observation_digest":"sha256:06f2ea14ffa6b5468a4f25981beadb49c2d8cf604fadf2a62b40247802fbb9ff","observation_id":"0a21cbe0-c959-4c9d-a419-20ec1b584fe1","resolution":{"observed_at":"2026-08-07T13:52:44.357485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:44.467258Z","title":"Maskgct: Zero-shot text- to-speech with masked generative codec transformer,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21568","last_updated":"2025-05-30T12:11:04Z","snapshot_observed_at":"2026-08-07T13:45:07.360193Z","submitted_at":"2025-05-27T05:59:34Z","title":"VoiceMark: Zero-Shot Voice Cloning-Resistant Watermarking Approach Leveraging Speaker-Specific Latents","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:44.467258Z"},"links":{"citing_paper":"/paper/2505.21568"},"observation_digest":"sha256:0941f6729ae2c41310dc0d894ebdce350bfb078acae0fce2d227d0faf8984948","observation_id":"cf0e8148-8995-4008-a43f-61aa484e8827","resolution":{"observed_at":"2026-08-07T13:52:44.467258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1147/sj.353.0313","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:46.716860Z","title":"Techniques for data hiding,","venue":null,"work_id":"2d1e3293-c815-4c3e-9221-6858a7528ff6","year":1996},"citing_paper":{"arxiv_id":"2505.21568","last_updated":"2025-05-30T12:11:04Z","snapshot_observed_at":"2026-08-07T13:45:07.360193Z","submitted_at":"2025-05-27T05:59:34Z","title":"VoiceMark: Zero-Shot Voice Cloning-Resistant Watermarking Approach Leveraging Speaker-Specific Latents","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:44.552649Z"},"links":{"citing_paper":"/paper/2505.21568"},"observation_digest":"sha256:207212a03d75029955760488f0ba225f2911d91960c56b784ccfe4288c83dba2","observation_id":"649eecf1-d788-43d8-bec7-b248dfbb6a4d","resolution":{"observed_at":"2026-08-07T13:52:46.793038Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:45.160070Z","title":"Natural tts synthesis by conditioning wavenet on mel spectrogram pre- dictions,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.21568","last_updated":"2025-05-30T12:11:04Z","snapshot_observed_at":"2026-08-07T13:45:07.360193Z","submitted_at":"2025-05-27T05:59:34Z","title":"VoiceMark: Zero-Shot Voice Cloning-Resistant Watermarking Approach Leveraging Speaker-Specific Latents","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:45.160070Z"},"links":{"citing_paper":"/paper/2505.21568"},"observation_digest":"sha256:82c4b07536b39771e9764dd3087fe20d77e25ff450c7cc8056d21f4da1b25a26","observation_id":"62a4c0e3-aa0a-4d7c-b30e-95062793a035","resolution":{"observed_at":"2026-08-07T13:52:45.160070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12770","last_updated":"2024-01-07T07:05:37Z","snapshot_observed_at":"2026-07-06T16:09:59.750388Z","submitted_at":"2023-08-24T13:17:35Z","title":"WavMark: Watermarking for Audio Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12770","snapshot_observed_at":"2026-08-07T13:52:44.744029Z","title":"Wav- mark: Watermarking for audio generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21568","last_updated":"2025-05-30T12:11:04Z","snapshot_observed_at":"2026-08-07T13:45:07.360193Z","submitted_at":"2025-05-27T05:59:34Z","title":"VoiceMark: Zero-Shot Voice Cloning-Resistant Watermarking Approach Leveraging Speaker-Specific Latents","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:44.744029Z"},"links":{"cited_paper":"/paper/2308.12770","citing_paper":"/paper/2505.21568"},"observation_digest":"sha256:c12a5c1ec56c0638bbd0dd64d838c12ff38150c8b06ebc6089385e40976d6bd6","observation_id":"2d766219-fc65-47e1-af2d-db940381b093","resolution":{"observed_at":"2026-08-07T13:52:44.744029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:48.517294Z","title":"Proactive detection of voice cloning with localized watermarking,","venue":null,"work_id":"d51032ca-5325-4007-a9f9-f1936f477825","year":2024},"citing_paper":{"arxiv_id":"2505.21568","last_updated":"2025-05-30T12:11:04Z","snapshot_observed_at":"2026-08-07T13:45:07.360193Z","submitted_at":"2025-05-27T05:59:34Z","title":"VoiceMark: Zero-Shot Voice Cloning-Resistant Watermarking Approach Leveraging Speaker-Specific Latents","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:44.824023Z"},"links":{"citing_paper":"/paper/2505.21568"},"observation_digest":"sha256:c764d265d07a65d90709a829073f01b633e4cba532ea58701fbb492983dec28d","observation_id":"679ef444-a4ce-4a87-87c4-17c4928f9f78","resolution":{"observed_at":"2026-08-07T13:52:48.630720Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:48.379093Z","title":"Proactive audio authentication using speaker identity watermarking,","venue":null,"work_id":"c8fb7ed5-ee71-4bfd-b1b9-1203990048c8","year":2024},"citing_paper":{"arxiv_id":"2505.21568","last_updated":"2025-05-30T12:11:04Z","snapshot_observed_at":"2026-08-07T13:45:07.360193Z","submitted_at":"2025-05-27T05:59:34Z","title":"VoiceMark: Zero-Shot Voice Cloning-Resistant Watermarking Approach Leveraging Speaker-Specific Latents","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:44.923082Z"},"links":{"citing_paper":"/paper/2505.21568"},"observation_digest":"sha256:38556897f5ba7aaf8eb9116d5faa213f732ffe78aa22cdcc3ded100f2c52b55e","observation_id":"46b1198a-d9e1-4d0b-a99b-3ce91b446d1d","resolution":{"observed_at":"2026-08-07T13:52:48.445724Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:49.524387Z","title":"The model is trained for 30 epochs using Adam [21] optimizer with a learning rate of5e −5","venue":null,"work_id":"b5eb4730-7f10-4383-9c48-d3680e0cbda3","year":2024},"citing_paper":{"arxiv_id":"2505.21568","last_updated":"2025-05-30T12:11:04Z","snapshot_observed_at":"2026-08-07T13:45:07.360193Z","submitted_at":"2025-05-27T05:59:34Z","title":"VoiceMark: Zero-Shot Voice Cloning-Resistant Watermarking Approach Leveraging Speaker-Specific Latents","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:43.727333Z"},"links":{"citing_paper":"/paper/2505.21568"},"observation_digest":"sha256:57521e5b3756b4c9bd8b03b0d16c0dd0f60ea0b614a8cc2c31831afc2b65dd34","observation_id":"0078746f-1c65-45b0-893f-30698b2d6876","resolution":{"observed_at":"2026-08-07T13:52:49.598054Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:48.179363Z","title":"Conditional variational autoencoder with adversarial learning for end-to-end text-to-speech,","venue":null,"work_id":"255dc3fe-760c-45db-8d84-eded42c5d238","year":2021},"citing_paper":{"arxiv_id":"2505.21568","last_updated":"2025-05-30T12:11:04Z","snapshot_observed_at":"2026-08-07T13:45:07.360193Z","submitted_at":"2025-05-27T05:59:34Z","title":"VoiceMark: Zero-Shot Voice Cloning-Resistant Watermarking Approach Leveraging Speaker-Specific Latents","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:44.983653Z"},"links":{"citing_paper":"/paper/2505.21568"},"observation_digest":"sha256:a098563fb37631e8986ae3fa65fc95d84c721fe2f52c89804d4d1808c7dd1c9c","observation_id":"b931714d-b772-45de-8ccb-e266c0c7ce43","resolution":{"observed_at":"2026-08-07T13:52:48.273468Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:47.982748Z","title":"Fastspeech 2: Fast and high-quality end-to-end text to speech,","venue":null,"work_id":"34f0eebf-bc49-4866-bce7-5482909db7d9","year":null},"citing_paper":{"arxiv_id":"2505.21568","last_updated":"2025-05-30T12:11:04Z","snapshot_observed_at":"2026-08-07T13:45:07.360193Z","submitted_at":"2025-05-27T05:59:34Z","title":"VoiceMark: Zero-Shot Voice Cloning-Resistant Watermarking Approach Leveraging Speaker-Specific Latents","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:45.086864Z"},"links":{"citing_paper":"/paper/2505.21568"},"observation_digest":"sha256:f91b62a03951ef46ed1a67553ad0030067f0c20bc99a6f4027dec9b9c7a270d5","observation_id":"976f6a41-62af-483b-981c-12e41c5378b2","resolution":{"observed_at":"2026-08-07T13:52:48.050691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:47.795043Z","title":"Paddlespeech: An easy-to-use all-in-one speech toolkit,","venue":null,"work_id":"29b7aa35-6c75-4dfa-b2b1-c344fa70e29c","year":2022},"citing_paper":{"arxiv_id":"2505.21568","last_updated":"2025-05-30T12:11:04Z","snapshot_observed_at":"2026-08-07T13:45:07.360193Z","submitted_at":"2025-05-27T05:59:34Z","title":"VoiceMark: Zero-Shot Voice Cloning-Resistant Watermarking Approach Leveraging Speaker-Specific Latents","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:45.288567Z"},"links":{"citing_paper":"/paper/2505.21568"},"observation_digest":"sha256:9677f94d189c76b667d973035a573445cb8ac8bf5aae31909bf463ea31f6f739","observation_id":"3af694f5-0558-46a4-9409-bb198c8254e4","resolution":{"observed_at":"2026-08-07T13:52:47.880357Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:47.598299Z","title":"V oice cloning app,","venue":null,"work_id":"d089930a-336f-43d6-acc0-8de0e2a9c2ba","year":2023},"citing_paper":{"arxiv_id":"2505.21568","last_updated":"2025-05-30T12:11:04Z","snapshot_observed_at":"2026-08-07T13:45:07.360193Z","submitted_at":"2025-05-27T05:59:34Z","title":"VoiceMark: Zero-Shot Voice Cloning-Resistant Watermarking Approach Leveraging Speaker-Specific Latents","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:45.480745Z"},"links":{"citing_paper":"/paper/2505.21568"},"observation_digest":"sha256:29176674a5c742945d854b17c02e378feb46f3401e4f8e59b97818a61a9ac08a","observation_id":"9c6a3a09-5827-421e-93d8-7158dcba402c","resolution":{"observed_at":"2026-08-07T13:52:47.694277Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.13438","last_updated":"2022-10-24T17:52:02Z","snapshot_observed_at":"2026-08-03T16:47:47.192907Z","submitted_at":"2022-10-24T17:52:02Z","title":"High Fidelity Neural Audio Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.13438","snapshot_observed_at":"2026-08-07T13:52:45.548593Z","title":"High fidelity neural audio compression,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.21568","last_updated":"2025-05-30T12:11:04Z","snapshot_observed_at":"2026-08-07T13:45:07.360193Z","submitted_at":"2025-05-27T05:59:34Z","title":"VoiceMark: Zero-Shot Voice Cloning-Resistant Watermarking Approach Leveraging Speaker-Specific Latents","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:45.548593Z"},"links":{"cited_paper":"/paper/2210.13438","citing_paper":"/paper/2505.21568"},"observation_digest":"sha256:90657505912996b314115bdfec1b867a825aadae47d4b513afe2574d88a31338","observation_id":"a749c905-0668-4cb1-baab-5bb29dd0c58a","resolution":{"observed_at":"2026-08-07T13:52:45.548593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:47.459206Z","title":"Naturalspeech 3: Zero-shot speech syn- thesis with factorized codec and diffusion models,","venue":null,"work_id":"78caa7cc-6903-4567-9c90-56257dee7be2","year":null},"citing_paper":{"arxiv_id":"2505.21568","last_updated":"2025-05-30T12:11:04Z","snapshot_observed_at":"2026-08-07T13:45:07.360193Z","submitted_at":"2025-05-27T05:59:34Z","title":"VoiceMark: Zero-Shot Voice Cloning-Resistant Watermarking Approach Leveraging Speaker-Specific Latents","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:45.625200Z"},"links":{"citing_paper":"/paper/2505.21568"},"observation_digest":"sha256:aae954c7d7358f9fb13d531b1168731e8e29e5df36374d462a11aceab346f746","observation_id":"002776d9-c8c4-49d0-91e6-90e661347c88","resolution":{"observed_at":"2026-08-07T13:52:47.510021Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16692","last_updated":"2024-01-23T01:56:57Z","snapshot_observed_at":"2026-08-07T03:22:13.424379Z","submitted_at":"2023-08-31T12:53:09Z","title":"SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.16692","snapshot_observed_at":"2026-08-07T13:52:45.708799Z","title":"Speechtok- enizer: Unified speech tokenizer for speech large language mod- els,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21568","last_updated":"2025-05-30T12:11:04Z","snapshot_observed_at":"2026-08-07T13:45:07.360193Z","submitted_at":"2025-05-27T05:59:34Z","title":"VoiceMark: Zero-Shot Voice Cloning-Resistant Watermarking Approach Leveraging Speaker-Specific Latents","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:45.708799Z"},"links":{"cited_paper":"/paper/2308.16692","citing_paper":"/paper/2505.21568"},"observation_digest":"sha256:cc829a80dd6b762e3892a15797fff123cd096a5bc7c670dd056c4ab8ccaead0d","observation_id":"9b249c78-daf0-46a8-8de0-3b860e34aaf8","resolution":{"observed_at":"2026-08-07T13:52:45.708799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:45.803244Z","title":"Hubert: Self-supervised speech represen- tation learning by masked prediction of hidden units,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.21568","last_updated":"2025-05-30T12:11:04Z","snapshot_observed_at":"2026-08-07T13:45:07.360193Z","submitted_at":"2025-05-27T05:59:34Z","title":"VoiceMark: Zero-Shot Voice Cloning-Resistant Watermarking Approach Leveraging Speaker-Specific Latents","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:45.803244Z"},"links":{"citing_paper":"/paper/2505.21568"},"observation_digest":"sha256:9d74d017ce8accbaeab9c903442020b15dd06cfec81f511487cddb615be6fe51","observation_id":"bbd3d8e2-cbf4-4d6a-a3ec-91ec5318cc8d","resolution":{"observed_at":"2026-08-07T13:52:45.803244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:45.924595Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.21568","last_updated":"2025-05-30T12:11:04Z","snapshot_observed_at":"2026-08-07T13:45:07.360193Z","submitted_at":"2025-05-27T05:59:34Z","title":"VoiceMark: Zero-Shot Voice Cloning-Resistant Watermarking Approach Leveraging Speaker-Specific Latents","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:45.924595Z"},"links":{"citing_paper":"/paper/2505.21568"},"observation_digest":"sha256:5be184329d68b4c583fa7a23321d78c244f92f222498bce7f9fcc2245d432789","observation_id":"700e9ca6-7118-4184-809e-16431506b768","resolution":{"observed_at":"2026-08-07T13:52:45.924595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:47.262599Z","title":null,"venue":null,"work_id":"8e83d1ec-8ff4-40ac-9da0-711d880e9ff1","year":1978},"citing_paper":{"arxiv_id":"2505.21568","last_updated":"2025-05-30T12:11:04Z","snapshot_observed_at":"2026-08-07T13:45:07.360193Z","submitted_at":"2025-05-27T05:59:34Z","title":"VoiceMark: Zero-Shot Voice Cloning-Resistant Watermarking Approach Leveraging Speaker-Specific Latents","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:46.003323Z"},"links":{"citing_paper":"/paper/2505.21568"},"observation_digest":"sha256:f69186ce248079ca70dabb9c9aef4801ffd5ad5b85e8d46689fc477c93de23af","observation_id":"67507c36-7537-48e0-8f02-75cd0581a9cf","resolution":{"observed_at":"2026-08-07T13:52:47.346618Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-07T13:52:46.120612Z","title":"Adam: A method for stochastic optimization,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.21568","last_updated":"2025-05-30T12:11:04Z","snapshot_observed_at":"2026-08-07T13:45:07.360193Z","submitted_at":"2025-05-27T05:59:34Z","title":"VoiceMark: Zero-Shot Voice Cloning-Resistant Watermarking Approach Leveraging Speaker-Specific Latents","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:46.120612Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2505.21568"},"observation_digest":"sha256:b3f1f09ae57269d90e1ba7ddad220d466cdeb231bffe689fe715b5ee5e339aae","observation_id":"da792311-bb83-416b-a441-ed529c7d588f","resolution":{"observed_at":"2026-08-07T13:52:46.120612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:47.102524Z","title":"English multi-speaker corpus for cstr voice cloning toolkit,","venue":null,"work_id":"87fa6c11-531f-4a26-9088-5aba7dffb2b4","year":2012},"citing_paper":{"arxiv_id":"2505.21568","last_updated":"2025-05-30T12:11:04Z","snapshot_observed_at":"2026-08-07T13:45:07.360193Z","submitted_at":"2025-05-27T05:59:34Z","title":"VoiceMark: Zero-Shot Voice Cloning-Resistant Watermarking Approach Leveraging Speaker-Specific Latents","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:46.191460Z"},"links":{"citing_paper":"/paper/2505.21568"},"observation_digest":"sha256:5591238eaba7dbece919a592e57ff341787a3edfbc949a0319a96f2c091c1464","observation_id":"596e068b-2eae-4c61-8935-c327a1f48739","resolution":{"observed_at":"2026-08-07T13:52:47.154984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:46.316770Z","title":"Lib- rispeech: an asr corpus based on public domain audio books,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.21568","last_updated":"2025-05-30T12:11:04Z","snapshot_observed_at":"2026-08-07T13:45:07.360193Z","submitted_at":"2025-05-27T05:59:34Z","title":"VoiceMark: Zero-Shot Voice Cloning-Resistant Watermarking Approach Leveraging Speaker-Specific Latents","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:46.316770Z"},"links":{"citing_paper":"/paper/2505.21568"},"observation_digest":"sha256:bd1ff1787940ad765468d5011cd0cdf07542ae34fac0cdac423ffffe680c85f8","observation_id":"721db919-dc4f-4f5c-b955-c534076d8de0","resolution":{"observed_at":"2026-08-07T13:52:46.316770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:46.436359Z","title":"Perceptual evaluation of speech quality (pesq)-a new method for speech quality assessment of telephone networks and codecs,","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2505.21568","last_updated":"2025-05-30T12:11:04Z","snapshot_observed_at":"2026-08-07T13:45:07.360193Z","submitted_at":"2025-05-27T05:59:34Z","title":"VoiceMark: Zero-Shot Voice Cloning-Resistant Watermarking Approach Leveraging Speaker-Specific Latents","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:46.436359Z"},"links":{"citing_paper":"/paper/2505.21568"},"observation_digest":"sha256:8e5ba59c14cbbb51aeb9591ca7928b2279c54c14f6fe09b5a927494874453d5e","observation_id":"f46d6f39-d03b-47cc-8008-0261a0161b4b","resolution":{"observed_at":"2026-08-07T13:52:46.436359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:46.946001Z","title":"A short- time objective intelligibility measure for time-frequency weighted noisy speech,","venue":null,"work_id":"bd6574d8-346a-4486-b826-68434434cf8d","year":2010},"citing_paper":{"arxiv_id":"2505.21568","last_updated":"2025-05-30T12:11:04Z","snapshot_observed_at":"2026-08-07T13:45:07.360193Z","submitted_at":"2025-05-27T05:59:34Z","title":"VoiceMark: Zero-Shot Voice Cloning-Resistant Watermarking Approach Leveraging Speaker-Specific Latents","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:46.527011Z"},"links":{"citing_paper":"/paper/2505.21568"},"observation_digest":"sha256:30eda5d659e0dc5e9241eddaaf701db9e41e3c102180577399db08513554ff60","observation_id":"9258956e-4e59-4fcd-99ad-f12a4b3213c1","resolution":{"observed_at":"2026-08-07T13:52:47.016246Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.21568","last_updated":"2025-05-30T12:11:04Z","latest_version":2,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-07T13:45:07.360193Z","submitted_at":"2025-05-27T05:59:34Z","title":"VoiceMark: Zero-Shot Voice Cloning-Resistant Watermarking Approach Leveraging Speaker-Specific Latents"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":15,"verified_exact":1,"verified_fuzzy":14},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 3 inbound Pith citation observations for arXiv:2505.21568."}