{"as_of":"2026-08-12T12:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:860be94dfe57a41e6ca6c219cbf9ffe290c41da0168b5d550563dda9b9abf43b","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T19:47:30.104529Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.16870/citation-record","integrity":"/paper/2607.16870/integrity","json":"/paper/2607.16870/citation-record.json","paper":"/paper/2607.16870"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:47:24.390762Z","title":"The secret revealer: Generative model-inversion attacks against deep neural networks,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.16870","last_updated":"2026-07-18T16:21:22Z","snapshot_observed_at":"2026-08-08T06:18:07.745845Z","submitted_at":"2026-07-18T16:21:22Z","title":"Do Speech Tokens Leak Voiceprints? Speaker Inversion Attacks Against End-to-End Speech Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T19:47:24.390762Z"},"links":{"citing_paper":"/paper/2607.16870"},"observation_digest":"sha256:2b5e34d03005972025220d1771d725d01885903d70b2eb27798ef1aa9ca550f1","observation_id":"b41ccd79-4a83-44e5-a495-b1b86223666b","resolution":{"observed_at":"2026-08-01T19:47:24.390762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:47:24.491640Z","title":"SpeechGPT: Empowering large language models with intrinsic cross- modal conversational abilities,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16870","last_updated":"2026-07-18T16:21:22Z","snapshot_observed_at":"2026-08-08T06:18:07.745845Z","submitted_at":"2026-07-18T16:21:22Z","title":"Do Speech Tokens Leak Voiceprints? Speaker Inversion Attacks Against End-to-End Speech Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T19:47:24.491640Z"},"links":{"citing_paper":"/paper/2607.16870"},"observation_digest":"sha256:40ca0a2be73754abe72aedb155ba17b4bcc4b44d18361db427976aa09225850f","observation_id":"25f13f89-60bd-4684-adfc-2734eeee36e3","resolution":{"observed_at":"2026-08-01T19:47:24.491640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:47:24.553795Z","title":"Spoken question answering and speech continuation using spectrogram-powered LLM,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16870","last_updated":"2026-07-18T16:21:22Z","snapshot_observed_at":"2026-08-08T06:18:07.745845Z","submitted_at":"2026-07-18T16:21:22Z","title":"Do Speech Tokens Leak Voiceprints? Speaker Inversion Attacks Against End-to-End Speech Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T19:47:24.553795Z"},"links":{"citing_paper":"/paper/2607.16870"},"observation_digest":"sha256:579e2e35c6ba1b6566ec9ad906d2e3a9d48d703f536f0ad768c40a731afba975","observation_id":"a5579030-ac7e-4164-b092-e5d31aab4ef5","resolution":{"observed_at":"2026-08-01T19:47:24.553795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:47:24.628423Z","title":"PSLM: Parallel generation of text and speech with LLMs for low-latency spoken dialogue systems,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16870","last_updated":"2026-07-18T16:21:22Z","snapshot_observed_at":"2026-08-08T06:18:07.745845Z","submitted_at":"2026-07-18T16:21:22Z","title":"Do Speech Tokens Leak Voiceprints? Speaker Inversion Attacks Against End-to-End Speech Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T19:47:24.628423Z"},"links":{"citing_paper":"/paper/2607.16870"},"observation_digest":"sha256:cc087b39d1a58f60fbb4c2f866f171e674fa47de7e61071d92e2ee6899e5ccf5","observation_id":"08e535a6-26b3-43b6-b805-683ca1c7f895","resolution":{"observed_at":"2026-08-01T19:47:24.628423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00037","last_updated":"2024-10-02T09:11:45Z","snapshot_observed_at":"2026-07-30T10:21:14.474746Z","submitted_at":"2024-09-17T17:55:39Z","title":"Moshi: a speech-text foundation model for real-time dialogue","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.00037","snapshot_observed_at":"2026-08-01T19:47:24.701159Z","title":"Moshi: A speech-text foundation model for real-time dialogue,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16870","last_updated":"2026-07-18T16:21:22Z","snapshot_observed_at":"2026-08-08T06:18:07.745845Z","submitted_at":"2026-07-18T16:21:22Z","title":"Do Speech Tokens Leak Voiceprints? Speaker Inversion Attacks Against End-to-End Speech Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T19:47:24.701159Z"},"links":{"cited_paper":"/paper/2410.00037","citing_paper":"/paper/2607.16870"},"observation_digest":"sha256:5595564fd7a9e924963612d543f45626dbc5ace953e0df481df591f40327934e","observation_id":"b398e019-1841-4b03-8f55-3d819d4977fc","resolution":{"observed_at":"2026-08-01T19:47:24.701159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:47:24.778375Z","title":"Higgs TTS 3: Conversational speech for voice AI from Boson AI,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.16870","last_updated":"2026-07-18T16:21:22Z","snapshot_observed_at":"2026-08-08T06:18:07.745845Z","submitted_at":"2026-07-18T16:21:22Z","title":"Do Speech Tokens Leak Voiceprints? Speaker Inversion Attacks Against End-to-End Speech Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T19:47:24.778375Z"},"links":{"citing_paper":"/paper/2607.16870"},"observation_digest":"sha256:ed77c26574f74f9b1462c75acd4441f4dc442cf3f114911c90862fa3a4f66a2a","observation_id":"13531619-6790-4625-8624-fb6d76310337","resolution":{"observed_at":"2026-08-01T19:47:24.778375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.00688","last_updated":"2026-04-21T12:14:57Z","snapshot_observed_at":"2026-07-06T22:51:26.754746Z","submitted_at":"2026-04-01T09:45:51Z","title":"OmniVoice: Towards Omnilingual Zero-Shot Text-to-Speech with Diffusion Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.00688","snapshot_observed_at":"2026-08-01T19:47:24.839553Z","title":"OmniV oice: Towards omnilingual zero-shot text-to-speech with diffusion language models,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.16870","last_updated":"2026-07-18T16:21:22Z","snapshot_observed_at":"2026-08-08T06:18:07.745845Z","submitted_at":"2026-07-18T16:21:22Z","title":"Do Speech Tokens Leak Voiceprints? Speaker Inversion Attacks Against End-to-End Speech Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T19:47:24.839553Z"},"links":{"cited_paper":"/paper/2604.00688","citing_paper":"/paper/2607.16870"},"observation_digest":"sha256:f312082387f0b38a2e14cd284862a5a98cfc9c2dc9cc59339992853499fb570c","observation_id":"bfd9be4d-22fd-44fa-a6e3-d4ba67094e22","resolution":{"observed_at":"2026-08-01T19:47:24.839553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.18425","last_updated":"2025-04-25T15:31:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-25T15:31:46Z","title":"Kimi-Audio Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.18425","snapshot_observed_at":"2026-08-01T19:47:24.929258Z","title":"Kimi-Audio technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16870","last_updated":"2026-07-18T16:21:22Z","snapshot_observed_at":"2026-08-08T06:18:07.745845Z","submitted_at":"2026-07-18T16:21:22Z","title":"Do Speech Tokens Leak Voiceprints? Speaker Inversion Attacks Against End-to-End Speech Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T19:47:24.929258Z"},"links":{"cited_paper":"/paper/2504.18425","citing_paper":"/paper/2607.16870"},"observation_digest":"sha256:bfc191d0d245a51eeafe96290265526b6d84c69765fbcb9937364edb46dbd16d","observation_id":"657f12c3-9cdb-437d-a131-940e6b9c519e","resolution":{"observed_at":"2026-08-01T19:47:24.929258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.17765","last_updated":"2025-09-22T13:26:24Z","snapshot_observed_at":"2026-08-11T00:14:34.061687Z","submitted_at":"2025-09-22T13:26:24Z","title":"Qwen3-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.17765","snapshot_observed_at":"2026-08-01T19:47:25.092934Z","title":"Qwen3-Omni technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16870","last_updated":"2026-07-18T16:21:22Z","snapshot_observed_at":"2026-08-08T06:18:07.745845Z","submitted_at":"2026-07-18T16:21:22Z","title":"Do Speech Tokens Leak Voiceprints? Speaker Inversion Attacks Against End-to-End Speech Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T19:47:25.092934Z"},"links":{"cited_paper":"/paper/2509.17765","citing_paper":"/paper/2607.16870"},"observation_digest":"sha256:bf0e0f46dc792d1c44ce888da3dfd011e73e24028929317b75f3bf70d27b0ae5","observation_id":"02662e63-3c0c-4ba8-9f46-e0378173033c","resolution":{"observed_at":"2026-08-01T19:47:25.092934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:47:25.330783Z","title":"Speaker verification using adapted gaussian mixture models,","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2607.16870","last_updated":"2026-07-18T16:21:22Z","snapshot_observed_at":"2026-08-08T06:18:07.745845Z","submitted_at":"2026-07-18T16:21:22Z","title":"Do Speech Tokens Leak Voiceprints? Speaker Inversion Attacks Against End-to-End Speech Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T19:47:25.330783Z"},"links":{"citing_paper":"/paper/2607.16870"},"observation_digest":"sha256:bdc2822073ecac1bed83537266b42330b0148b8bced9e47191ca32c8ac67c4ae","observation_id":"2f59a965-2629-4dcb-b7be-ad8185eeaeba","resolution":{"observed_at":"2026-08-01T19:47:25.330783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:47:25.526470Z","title":"Joint factor analysis versus eigenchannels in speaker recognition,","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2607.16870","last_updated":"2026-07-18T16:21:22Z","snapshot_observed_at":"2026-08-08T06:18:07.745845Z","submitted_at":"2026-07-18T16:21:22Z","title":"Do Speech Tokens Leak Voiceprints? Speaker Inversion Attacks Against End-to-End Speech Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T19:47:25.526470Z"},"links":{"citing_paper":"/paper/2607.16870"},"observation_digest":"sha256:9a01c38a27a7604de0ede2e257f38680fd79711ecb17d17f7b4677e24e5ad8f0","observation_id":"b9ce85e1-15b4-4f02-a9ea-c789dcf2d52e","resolution":{"observed_at":"2026-08-01T19:47:25.526470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:47:25.700973Z","title":"Front- end factor analysis for speaker verification,","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2607.16870","last_updated":"2026-07-18T16:21:22Z","snapshot_observed_at":"2026-08-08T06:18:07.745845Z","submitted_at":"2026-07-18T16:21:22Z","title":"Do Speech Tokens Leak Voiceprints? Speaker Inversion Attacks Against End-to-End Speech Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T19:47:25.700973Z"},"links":{"citing_paper":"/paper/2607.16870"},"observation_digest":"sha256:a27512a271c9903cd8eee35b0bca633d1161f59e7fe2bb01a7800ede23d10aad","observation_id":"b07f127a-4e88-4d7f-b6d2-243feea5dac9","resolution":{"observed_at":"2026-08-01T19:47:25.700973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:47:25.875069Z","title":"Deep neural networks for small footprint text-dependent speaker verification,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2607.16870","last_updated":"2026-07-18T16:21:22Z","snapshot_observed_at":"2026-08-08T06:18:07.745845Z","submitted_at":"2026-07-18T16:21:22Z","title":"Do Speech Tokens Leak Voiceprints? Speaker Inversion Attacks Against End-to-End Speech Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T19:47:25.875069Z"},"links":{"citing_paper":"/paper/2607.16870"},"observation_digest":"sha256:d5eaeeab1c1c6ced332bdde7f0e86453a817e329111e28ab963990781b1e10d0","observation_id":"023a8b05-ae8d-404a-8c4e-a59b7f86925a","resolution":{"observed_at":"2026-08-01T19:47:25.875069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:47:25.988124Z","title":"End-to-end text-dependent speaker verification,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.16870","last_updated":"2026-07-18T16:21:22Z","snapshot_observed_at":"2026-08-08T06:18:07.745845Z","submitted_at":"2026-07-18T16:21:22Z","title":"Do Speech Tokens Leak Voiceprints? Speaker Inversion Attacks Against End-to-End Speech Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T19:47:25.988124Z"},"links":{"citing_paper":"/paper/2607.16870"},"observation_digest":"sha256:08fec56d448cac731b532b6513118d3bb8aa0a6e8c072c46fdb61b2c6ad88a9c","observation_id":"bf4ef308-20af-4ee3-9a74-021fe5783dc3","resolution":{"observed_at":"2026-08-01T19:47:25.988124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:47:26.167636Z","title":"Generalized end- to-end loss for speaker verification,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.16870","last_updated":"2026-07-18T16:21:22Z","snapshot_observed_at":"2026-08-08T06:18:07.745845Z","submitted_at":"2026-07-18T16:21:22Z","title":"Do Speech Tokens Leak Voiceprints? Speaker Inversion Attacks Against End-to-End Speech Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T19:47:26.167636Z"},"links":{"citing_paper":"/paper/2607.16870"},"observation_digest":"sha256:dafa19be10794d7f0ae1cc425fac54234b4a63da651ef9f0370565136f0188eb","observation_id":"06986d7c-604b-4589-82bb-53ab907588eb","resolution":{"observed_at":"2026-08-01T19:47:26.167636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:47:26.321678Z","title":"X-vectors: Robust DNN embeddings for speaker recognition,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.16870","last_updated":"2026-07-18T16:21:22Z","snapshot_observed_at":"2026-08-08T06:18:07.745845Z","submitted_at":"2026-07-18T16:21:22Z","title":"Do Speech Tokens Leak Voiceprints? Speaker Inversion Attacks Against End-to-End Speech Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T19:47:26.321678Z"},"links":{"citing_paper":"/paper/2607.16870"},"observation_digest":"sha256:bb5667e1b41d91f06d313f516bdd400437c74229cfad6cf05174c964170f2da0","observation_id":"ae4c98e0-78f5-4f48-9ec5-100ff276566f","resolution":{"observed_at":"2026-08-01T19:47:26.321678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:47:26.493248Z","title":"V oxCeleb2: Deep speaker recognition,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.16870","last_updated":"2026-07-18T16:21:22Z","snapshot_observed_at":"2026-08-08T06:18:07.745845Z","submitted_at":"2026-07-18T16:21:22Z","title":"Do Speech Tokens Leak Voiceprints? Speaker Inversion Attacks Against End-to-End Speech Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T19:47:26.493248Z"},"links":{"citing_paper":"/paper/2607.16870"},"observation_digest":"sha256:08c20a9c00b46c83f2c35282c58704752735d3479b649e0a1340b9e3c5d63d45","observation_id":"92b0f91e-e2f8-4a9d-a1dd-73a6ebe60a56","resolution":{"observed_at":"2026-08-01T19:47:26.493248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:47:26.667982Z","title":"Pushing the limits of self-supervised speaker verification using regularized distillation framework,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16870","last_updated":"2026-07-18T16:21:22Z","snapshot_observed_at":"2026-08-08T06:18:07.745845Z","submitted_at":"2026-07-18T16:21:22Z","title":"Do Speech Tokens Leak Voiceprints? Speaker Inversion Attacks Against End-to-End Speech Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T19:47:26.667982Z"},"links":{"citing_paper":"/paper/2607.16870"},"observation_digest":"sha256:5e35389bb5f536b914768acd6eca2671945b6d5db000932a8b58a6724f692824","observation_id":"782a5783-d868-49e9-b65c-26ac06f3da0a","resolution":{"observed_at":"2026-08-01T19:47:26.667982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:47:26.806015Z","title":"Self-distillation prototypes network: Learning robust speaker representations without supervision,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16870","last_updated":"2026-07-18T16:21:22Z","snapshot_observed_at":"2026-08-08T06:18:07.745845Z","submitted_at":"2026-07-18T16:21:22Z","title":"Do Speech Tokens Leak Voiceprints? Speaker Inversion Attacks Against End-to-End Speech Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T19:47:26.806015Z"},"links":{"citing_paper":"/paper/2607.16870"},"observation_digest":"sha256:f4d8330adbde75c90e6e6db4bdf248d137a5df41700bbd7d2d8dee92ee0c7f05","observation_id":"43107838-82ed-4985-9da5-9d12c2885b81","resolution":{"observed_at":"2026-08-01T19:47:26.806015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:47:26.890577Z","title":"ECAPA-TDNN: Emphasized channel attention, propagation and aggregation in TDNN based speaker verification,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.16870","last_updated":"2026-07-18T16:21:22Z","snapshot_observed_at":"2026-08-08T06:18:07.745845Z","submitted_at":"2026-07-18T16:21:22Z","title":"Do Speech Tokens Leak Voiceprints? Speaker Inversion Attacks Against End-to-End Speech Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T19:47:26.890577Z"},"links":{"citing_paper":"/paper/2607.16870"},"observation_digest":"sha256:0dc881437cd8d61c3c38d990fe8a081413ff358e61e98294cc24f74889185865","observation_id":"619ed206-5b0e-484a-8faa-ac6356778bde","resolution":{"observed_at":"2026-08-01T19:47:26.890577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:47:26.994800Z","title":"CAM++: A fast and efficient network for speaker verification using context- aware masking,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16870","last_updated":"2026-07-18T16:21:22Z","snapshot_observed_at":"2026-08-08T06:18:07.745845Z","submitted_at":"2026-07-18T16:21:22Z","title":"Do Speech Tokens Leak Voiceprints? Speaker Inversion Attacks Against End-to-End Speech Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T19:47:26.994800Z"},"links":{"citing_paper":"/paper/2607.16870"},"observation_digest":"sha256:a3b17514aee44cae716704d3a87a509ec7f537871bf9be2e21022b449200d593","observation_id":"335f5300-8540-412b-b2b6-ce7c22a8aee0","resolution":{"observed_at":"2026-08-01T19:47:26.994800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:47:27.129739Z","title":"An enhanced Res2Net with local and global feature fusion for speaker verifi- cation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16870","last_updated":"2026-07-18T16:21:22Z","snapshot_observed_at":"2026-08-08T06:18:07.745845Z","submitted_at":"2026-07-18T16:21:22Z","title":"Do Speech Tokens Leak Voiceprints? Speaker Inversion Attacks Against End-to-End Speech Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T19:47:27.129739Z"},"links":{"citing_paper":"/paper/2607.16870"},"observation_digest":"sha256:fa7dbd86178b8f393e0bac4b7cc9e2f220d0ad1bdc101f089d897eecc254a83d","observation_id":"cf96013c-2dd7-4657-8a4f-a48b5505175c","resolution":{"observed_at":"2026-08-01T19:47:27.129739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:47:27.335806Z","title":"Model inversion attacks that exploit confidence information and basic countermeasures,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.16870","last_updated":"2026-07-18T16:21:22Z","snapshot_observed_at":"2026-08-08T06:18:07.745845Z","submitted_at":"2026-07-18T16:21:22Z","title":"Do Speech Tokens Leak Voiceprints? Speaker Inversion Attacks Against End-to-End Speech Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T19:47:27.335806Z"},"links":{"citing_paper":"/paper/2607.16870"},"observation_digest":"sha256:20039cdd338123454776bdaf86b78b1e2978042c5033967dbe3f3ec9140dbd77","observation_id":"faf2f83c-520f-4d71-90d8-50a20ebe0675","resolution":{"observed_at":"2026-08-01T19:47:27.335806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:47:27.424163Z","title":"FGMIA: Feature- guided model inversion attacks against face recognition models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16870","last_updated":"2026-07-18T16:21:22Z","snapshot_observed_at":"2026-08-08T06:18:07.745845Z","submitted_at":"2026-07-18T16:21:22Z","title":"Do Speech Tokens Leak Voiceprints? Speaker Inversion Attacks Against End-to-End Speech Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T19:47:27.424163Z"},"links":{"citing_paper":"/paper/2607.16870"},"observation_digest":"sha256:15c624db1dc791ad62f755ea706faba21bd33b18ab48f115696665cafa1c57a3","observation_id":"77690235-ea4c-4a09-84ec-b9f109fc4728","resolution":{"observed_at":"2026-08-01T19:47:27.424163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11424","last_updated":"2024-11-21T12:22:10Z","snapshot_observed_at":"2026-08-09T02:11:07.331897Z","submitted_at":"2024-07-16T06:38:49Z","title":"Model Inversion Attacks Through Target-Specific Conditional Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.11424","snapshot_observed_at":"2026-08-01T19:47:27.549176Z","title":"Model inversion attacks through target-specific conditional diffusion models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16870","last_updated":"2026-07-18T16:21:22Z","snapshot_observed_at":"2026-08-08T06:18:07.745845Z","submitted_at":"2026-07-18T16:21:22Z","title":"Do Speech Tokens Leak Voiceprints? Speaker Inversion Attacks Against End-to-End Speech Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T19:47:27.549176Z"},"links":{"cited_paper":"/paper/2407.11424","citing_paper":"/paper/2607.16870"},"observation_digest":"sha256:fb942c7b8ae355cbd9d9f00da7492247df2f72527debe91e3f14c39bd7aa42df","observation_id":"15486223-7b4f-4186-a719-0841cd93425b","resolution":{"observed_at":"2026-08-01T19:47:27.549176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:47:27.730257Z","title":"Text embeddings reveal (almost) as much as text,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16870","last_updated":"2026-07-18T16:21:22Z","snapshot_observed_at":"2026-08-08T06:18:07.745845Z","submitted_at":"2026-07-18T16:21:22Z","title":"Do Speech Tokens Leak Voiceprints? Speaker Inversion Attacks Against End-to-End Speech Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T19:47:27.730257Z"},"links":{"citing_paper":"/paper/2607.16870"},"observation_digest":"sha256:d81ba1aa6aaf9d15d8d5c9e1a442786ade2ed3d887094ed94e0e2dce1482b993","observation_id":"1063ac30-3287-466d-83ea-15c8e10df02e","resolution":{"observed_at":"2026-08-01T19:47:27.730257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:47:27.951493Z","title":"Text embedding inversion security for multilingual language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16870","last_updated":"2026-07-18T16:21:22Z","snapshot_observed_at":"2026-08-08T06:18:07.745845Z","submitted_at":"2026-07-18T16:21:22Z","title":"Do Speech Tokens Leak Voiceprints? Speaker Inversion Attacks Against End-to-End Speech Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T19:47:27.951493Z"},"links":{"citing_paper":"/paper/2607.16870"},"observation_digest":"sha256:91735cc6bbb6f3d40afb1caea20c408b5872ad11cddae3e6279e5c6281d63f56","observation_id":"00345a64-b265-44a7-b9cf-a00b1ce6ef74","resolution":{"observed_at":"2026-08-01T19:47:27.951493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:47:28.093709Z","title":"Introducing model inversion attacks on automatic speaker recognition,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.16870","last_updated":"2026-07-18T16:21:22Z","snapshot_observed_at":"2026-08-08T06:18:07.745845Z","submitted_at":"2026-07-18T16:21:22Z","title":"Do Speech Tokens Leak Voiceprints? Speaker Inversion Attacks Against End-to-End Speech Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T19:47:28.093709Z"},"links":{"citing_paper":"/paper/2607.16870"},"observation_digest":"sha256:21d90692ddbce28d165aabb02d298ac6db152a8df3fcd170696e6abbaf37bbdc","observation_id":"a18cd1e9-9536-467e-90cc-e2e323f25591","resolution":{"observed_at":"2026-08-01T19:47:28.093709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:47:28.297263Z","title":"Inference attacks for x-vector speaker anonymization,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16870","last_updated":"2026-07-18T16:21:22Z","snapshot_observed_at":"2026-08-08T06:18:07.745845Z","submitted_at":"2026-07-18T16:21:22Z","title":"Do Speech Tokens Leak Voiceprints? Speaker Inversion Attacks Against End-to-End Speech Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-01T19:47:28.297263Z"},"links":{"citing_paper":"/paper/2607.16870"},"observation_digest":"sha256:8a1d69c44c2471cf6fa6c0ee2b8038c9bf9aec5bc73438447e9a725e8c56ae09","observation_id":"58b1bb36-ee6b-4c0c-a2cf-3a0bf3c05f9b","resolution":{"observed_at":"2026-08-01T19:47:28.297263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:47:28.438714Z","title":"V oxGuard: Evaluating user and attribute privacy in speech via membership inference attacks,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.16870","last_updated":"2026-07-18T16:21:22Z","snapshot_observed_at":"2026-08-08T06:18:07.745845Z","submitted_at":"2026-07-18T16:21:22Z","title":"Do Speech Tokens Leak Voiceprints? Speaker Inversion Attacks Against End-to-End Speech Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T19:47:28.438714Z"},"links":{"citing_paper":"/paper/2607.16870"},"observation_digest":"sha256:a425d9e251dbb299eb331a1d7024b2cbc517ba4adca9ced362980f0e15529084","observation_id":"6124d17a-d751-4de8-a900-b963ee74aec7","resolution":{"observed_at":"2026-08-01T19:47:28.438714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:47:28.657035Z","title":"Scores know Bob’s voice: Speaker impersonation attack,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.16870","last_updated":"2026-07-18T16:21:22Z","snapshot_observed_at":"2026-08-08T06:18:07.745845Z","submitted_at":"2026-07-18T16:21:22Z","title":"Do Speech Tokens Leak Voiceprints? Speaker Inversion Attacks Against End-to-End Speech Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-01T19:47:28.657035Z"},"links":{"citing_paper":"/paper/2607.16870"},"observation_digest":"sha256:10839930db39861838a9c3278bdab4fa6c74686ebbf5284830b17e8f9c405bb8","observation_id":"7ba8d875-a5e9-4212-9f11-2d9d0e0e3262","resolution":{"observed_at":"2026-08-01T19:47:28.657035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:47:28.831537Z","title":"HearSay benchmark: Do audio LLMs leak what they hear?","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.16870","last_updated":"2026-07-18T16:21:22Z","snapshot_observed_at":"2026-08-08T06:18:07.745845Z","submitted_at":"2026-07-18T16:21:22Z","title":"Do Speech Tokens Leak Voiceprints? Speaker Inversion Attacks Against End-to-End Speech Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-01T19:47:28.831537Z"},"links":{"citing_paper":"/paper/2607.16870"},"observation_digest":"sha256:66b48859d76b9bb90330aab0f73a4bb3bf26c63658c7484aebac5157431f6e16","observation_id":"7f20e806-1730-4687-9f73-a0bc9a1dce0d","resolution":{"observed_at":"2026-08-01T19:47:28.831537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:47:29.024367Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.16870","last_updated":"2026-07-18T16:21:22Z","snapshot_observed_at":"2026-08-08T06:18:07.745845Z","submitted_at":"2026-07-18T16:21:22Z","title":"Do Speech Tokens Leak Voiceprints? Speaker Inversion Attacks Against End-to-End Speech Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-01T19:47:29.024367Z"},"links":{"citing_paper":"/paper/2607.16870"},"observation_digest":"sha256:10800cedd285273c97825e8610f8527dfd0fa75bc4f488c645e130d519de34c6","observation_id":"143bdb3a-fe9a-4b5f-8f00-5f3c85157300","resolution":{"observed_at":"2026-08-01T19:47:29.024367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:47:29.199656Z","title":"BERT: Pre-training of deep bidirectional transformers for language understanding,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.16870","last_updated":"2026-07-18T16:21:22Z","snapshot_observed_at":"2026-08-08T06:18:07.745845Z","submitted_at":"2026-07-18T16:21:22Z","title":"Do Speech Tokens Leak Voiceprints? Speaker Inversion Attacks Against End-to-End Speech Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-01T19:47:29.199656Z"},"links":{"citing_paper":"/paper/2607.16870"},"observation_digest":"sha256:43d6d39d63d2e30eedbb972abc228a37f7899abb3989e5b7fb8a14e9d53c01ce","observation_id":"da2a316b-2924-4b18-a935-4f5e41fae4c0","resolution":{"observed_at":"2026-08-01T19:47:29.199656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1607.06450","last_updated":"2016-07-21T19:57:52Z","snapshot_observed_at":"2026-08-12T08:59:05.030983Z","submitted_at":"2016-07-21T19:57:52Z","title":"Layer Normalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.06450","snapshot_observed_at":"2026-08-01T19:47:29.394242Z","title":"Layer normalization,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.16870","last_updated":"2026-07-18T16:21:22Z","snapshot_observed_at":"2026-08-08T06:18:07.745845Z","submitted_at":"2026-07-18T16:21:22Z","title":"Do Speech Tokens Leak Voiceprints? Speaker Inversion Attacks Against End-to-End Speech Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-01T19:47:29.394242Z"},"links":{"cited_paper":"/paper/1607.06450","citing_paper":"/paper/2607.16870"},"observation_digest":"sha256:b0a2a94c420948e5e13eadd8840c11cf4e3114217c1f3e226249852686cb9f46","observation_id":"78f18058-1c52-4792-ba3b-5f115970af09","resolution":{"observed_at":"2026-08-01T19:47:29.394242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.08415","last_updated":"2023-06-06T01:53:32Z","snapshot_observed_at":"2026-07-06T05:01:27.910364Z","submitted_at":"2016-06-27T19:20:40Z","title":"Gaussian Error Linear Units (GELUs)","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.08415","snapshot_observed_at":"2026-08-01T19:47:29.574585Z","title":"Gaussian error linear units (GELUs),","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.16870","last_updated":"2026-07-18T16:21:22Z","snapshot_observed_at":"2026-08-08T06:18:07.745845Z","submitted_at":"2026-07-18T16:21:22Z","title":"Do Speech Tokens Leak Voiceprints? Speaker Inversion Attacks Against End-to-End Speech Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-01T19:47:29.574585Z"},"links":{"cited_paper":"/paper/1606.08415","citing_paper":"/paper/2607.16870"},"observation_digest":"sha256:e637ba5728cc91de82a768b024be9c50f53fe6985f8e696cb59973abe7802b8e","observation_id":"acaed446-cec7-49f2-a2be-c0a305b8616f","resolution":{"observed_at":"2026-08-01T19:47:29.574585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:47:29.739265Z","title":"VICReg: Variance-invariance- covariance regularization for self-supervised learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.16870","last_updated":"2026-07-18T16:21:22Z","snapshot_observed_at":"2026-08-08T06:18:07.745845Z","submitted_at":"2026-07-18T16:21:22Z","title":"Do Speech Tokens Leak Voiceprints? Speaker Inversion Attacks Against End-to-End Speech Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-01T19:47:29.739265Z"},"links":{"citing_paper":"/paper/2607.16870"},"observation_digest":"sha256:e3cb1ffbd6676ea1b7dea2531ae92ba3b3502f2f08068b21ddd3618ec0061486","observation_id":"bb9b4594-bc14-4507-8af0-3f75795c0905","resolution":{"observed_at":"2026-08-01T19:47:29.739265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:47:29.881362Z","title":"Emerging properties in self-supervised vision transformers,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.16870","last_updated":"2026-07-18T16:21:22Z","snapshot_observed_at":"2026-08-08T06:18:07.745845Z","submitted_at":"2026-07-18T16:21:22Z","title":"Do Speech Tokens Leak Voiceprints? Speaker Inversion Attacks Against End-to-End Speech Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-01T19:47:29.881362Z"},"links":{"citing_paper":"/paper/2607.16870"},"observation_digest":"sha256:a46c4ac4a4c21c8679043b5b371dd07beeb88dd7867fcb293023a371a2e72aa7","observation_id":"9584add1-68cf-4f55-a963-a925199d8bef","resolution":{"observed_at":"2026-08-01T19:47:29.881362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:47:29.994945Z","title":"ArcFace: Additive angular margin loss for deep face recognition,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.16870","last_updated":"2026-07-18T16:21:22Z","snapshot_observed_at":"2026-08-08T06:18:07.745845Z","submitted_at":"2026-07-18T16:21:22Z","title":"Do Speech Tokens Leak Voiceprints? Speaker Inversion Attacks Against End-to-End Speech Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-01T19:47:29.994945Z"},"links":{"citing_paper":"/paper/2607.16870"},"observation_digest":"sha256:ec7b307c2069452e32c6c33db530fac6b3f49992c6868ee5d66c79530c00e8f2","observation_id":"07481413-0a10-42a4-9d15-77950c76f611","resolution":{"observed_at":"2026-08-01T19:47:29.994945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:47:30.104529Z","title":"V oxCeleb: A large- scale speaker identification dataset,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.16870","last_updated":"2026-07-18T16:21:22Z","snapshot_observed_at":"2026-08-08T06:18:07.745845Z","submitted_at":"2026-07-18T16:21:22Z","title":"Do Speech Tokens Leak Voiceprints? Speaker Inversion Attacks Against End-to-End Speech Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-01T19:47:30.104529Z"},"links":{"citing_paper":"/paper/2607.16870"},"observation_digest":"sha256:f1fbc795237fc2a6491e55c7a4d517c13bb38fef59bdcf888befcc324ac46e44","observation_id":"655d3997-f351-43e8-8ec4-7c45a91eebd2","resolution":{"observed_at":"2026-08-01T19:47:30.104529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.16870","last_updated":"2026-07-18T16:21:22Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-08T06:18:07.745845Z","submitted_at":"2026-07-18T16:21:22Z","title":"Do Speech Tokens Leak Voiceprints? Speaker Inversion Attacks Against End-to-End Speech Language Models"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":40,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 0 inbound Pith citation observations for arXiv:2607.16870."}