{"as_of":"2026-08-08T03:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b6aa495e3ef16fab6dfae647bc6fc9a97d00f5508bac2ee1963c1b7778dd70d5","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:46:58.425343Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:46:57.924566Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T11:46:58.564632Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.02083","last_updated":"2025-06-02T10:59:31Z","snapshot_observed_at":"2026-08-07T11:36:44.614536Z","submitted_at":"2025-06-02T10:59:31Z","title":"LASPA: Language Agnostic Speaker Disentanglement with Prefix-Tuned Cross-Attention","version":1},"cited_work":{"arxiv_id":"2506.02083","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.02083","snapshot_observed_at":"2026-08-07T11:46:58.564632Z","title":"LASPA: Language Agnostic Speaker Disentanglement with Prefix-Tuned Cross-Attention","venue":"cs.SD","work_id":"7b2200cd-e9ae-411e-a57e-5425b264f26f","year":2025},"citing_paper":{"arxiv_id":"2506.02083","last_updated":"2025-06-02T10:59:31Z","snapshot_observed_at":"2026-08-07T11:36:44.614536Z","submitted_at":"2025-06-02T10:59:31Z","title":"LASPA: Language Agnostic Speaker Disentanglement with Prefix-Tuned Cross-Attention","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T11:46:57.924566Z"},"links":{"cited_paper":"/paper/2506.02083","citing_paper":"/paper/2506.02083"},"observation_digest":"sha256:b137d0938caf93fe96751e083a35cac3933a52f21c86478995877fb72869636c","observation_id":"2afacb45-7a08-4a8d-922f-dd29cd4d1530","resolution":{"observed_at":"2026-08-07T11:46:58.576700Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.02083/citation-record","integrity":"/paper/2506.02083/integrity","json":"/paper/2506.02083/citation-record.json","paper":"/paper/2506.02083"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:47:49.666560Z","title":null,"venue":null,"work_id":"2f5ade34-6da7-4d35-bb4f-dea983404edf","year":null},"citing_paper":{"arxiv_id":"2506.02083","last_updated":"2025-06-02T10:59:31Z","snapshot_observed_at":"2026-08-07T11:36:44.614536Z","submitted_at":"2025-06-02T10:59:31Z","title":"LASPA: Language Agnostic Speaker Disentanglement with Prefix-Tuned Cross-Attention","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:45:39.076967Z"},"links":{"citing_paper":"/paper/2506.02083"},"observation_digest":"sha256:b332644807563c8c2047ad26b0d6e6d201932a6e848efcc934c6bda865327fff","observation_id":"ac1e2573-d214-4ad8-b818-69eae080edef","resolution":{"observed_at":"2026-08-07T11:47:49.715184Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:47:00.818958Z","title":null,"venue":null,"work_id":"505442cf-784a-4cde-9e5e-a64d0c868b3a","year":null},"citing_paper":{"arxiv_id":"2506.02083","last_updated":"2025-06-02T10:59:31Z","snapshot_observed_at":"2026-08-07T11:36:44.614536Z","submitted_at":"2025-06-02T10:59:31Z","title":"LASPA: Language Agnostic Speaker Disentanglement with Prefix-Tuned Cross-Attention","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:46:21.639442Z"},"links":{"citing_paper":"/paper/2506.02083"},"observation_digest":"sha256:d52feebc49c93f3033b69d96a3fa3d2d468e033d73994944c5dd8851bec601e7","observation_id":"f5f46384-81f8-4a60-af1c-344afba683aa","resolution":{"observed_at":"2026-08-07T11:47:49.594121Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:47:00.721883Z","title":null,"venue":null,"work_id":"e06ed9ee-5a58-4809-a3c2-c1c84f1be679","year":null},"citing_paper":{"arxiv_id":"2506.02083","last_updated":"2025-06-02T10:59:31Z","snapshot_observed_at":"2026-08-07T11:36:44.614536Z","submitted_at":"2025-06-02T10:59:31Z","title":"LASPA: Language Agnostic Speaker Disentanglement with Prefix-Tuned Cross-Attention","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T11:46:56.236855Z"},"links":{"citing_paper":"/paper/2506.02083"},"observation_digest":"sha256:c6c6b27dc3aed69e3ddb29a3fbb5ae5d6056d27e0de68c910e36a73858408edf","observation_id":"732cf235-0905-4434-aba9-3ed0b7e22737","resolution":{"observed_at":"2026-08-07T11:47:00.762187Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:47:00.652965Z","title":null,"venue":null,"work_id":"8c28b73e-4138-4a2c-94e0-91a61c6e06c9","year":null},"citing_paper":{"arxiv_id":"2506.02083","last_updated":"2025-06-02T10:59:31Z","snapshot_observed_at":"2026-08-07T11:36:44.614536Z","submitted_at":"2025-06-02T10:59:31Z","title":"LASPA: Language Agnostic Speaker Disentanglement with Prefix-Tuned Cross-Attention","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T11:46:57.907739Z"},"links":{"citing_paper":"/paper/2506.02083"},"observation_digest":"sha256:3f728496b35f99f027c6f03cc4fcef351657072edfd42f470c7800448d7af8fd","observation_id":"236b00ef-41c6-4746-8b95-ee5f45578a76","resolution":{"observed_at":"2026-08-07T11:47:00.684159Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02083","last_updated":"2025-06-02T10:59:31Z","snapshot_observed_at":"2026-08-07T11:36:44.614536Z","submitted_at":"2025-06-02T10:59:31Z","title":"LASPA: Language Agnostic Speaker Disentanglement with Prefix-Tuned Cross-Attention","version":1},"cited_work":{"arxiv_id":"2506.02083","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.02083","snapshot_observed_at":"2026-08-07T11:46:58.564632Z","title":"LASPA: Language Agnostic Speaker Disentanglement with Prefix-Tuned Cross-Attention","venue":"cs.SD","work_id":"7b2200cd-e9ae-411e-a57e-5425b264f26f","year":2025},"citing_paper":{"arxiv_id":"2506.02083","last_updated":"2025-06-02T10:59:31Z","snapshot_observed_at":"2026-08-07T11:36:44.614536Z","submitted_at":"2025-06-02T10:59:31Z","title":"LASPA: Language Agnostic Speaker Disentanglement with Prefix-Tuned Cross-Attention","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T11:46:57.924566Z"},"links":{"cited_paper":"/paper/2506.02083","citing_paper":"/paper/2506.02083"},"observation_digest":"sha256:b137d0938caf93fe96751e083a35cac3933a52f21c86478995877fb72869636c","observation_id":"2afacb45-7a08-4a8d-922f-dd29cd4d1530","resolution":{"observed_at":"2026-08-07T11:46:58.576700Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:47:00.584735Z","title":null,"venue":null,"work_id":"47e67307-cd73-4320-9e7c-13ea717224ca","year":2021},"citing_paper":{"arxiv_id":"2506.02083","last_updated":"2025-06-02T10:59:31Z","snapshot_observed_at":"2026-08-07T11:36:44.614536Z","submitted_at":"2025-06-02T10:59:31Z","title":"LASPA: Language Agnostic Speaker Disentanglement with Prefix-Tuned Cross-Attention","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T11:46:57.941233Z"},"links":{"citing_paper":"/paper/2506.02083"},"observation_digest":"sha256:ecfb37cc7c46ec0fead1c42c628311a8680c545aa3990bcb9574880df3d76549","observation_id":"8008f6c2-d4e6-4de6-837c-8ce48634c601","resolution":{"observed_at":"2026-08-07T11:47:00.616248Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:47:00.485429Z","title":"In the Speaker Encoder, the mel- spectrogram passes through a feature extraction module and a fully connected layer","venue":null,"work_id":"fd038234-faaf-439b-9f2a-836567049179","year":null},"citing_paper":{"arxiv_id":"2506.02083","last_updated":"2025-06-02T10:59:31Z","snapshot_observed_at":"2026-08-07T11:36:44.614536Z","submitted_at":"2025-06-02T10:59:31Z","title":"LASPA: Language Agnostic Speaker Disentanglement with Prefix-Tuned Cross-Attention","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:46:57.953209Z"},"links":{"citing_paper":"/paper/2506.02083"},"observation_digest":"sha256:7ba00f6b58cb306688f4d34ec9e0813eb618a820ad1073d43607f099781462a3","observation_id":"a1a5d299-8470-4a84-8edd-64f4d92811b5","resolution":{"observed_at":"2026-08-07T11:47:00.537412Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:47:00.396477Z","title":"Baselines We use ResNet-(S [17] and L [18]), ECAPA [19] and ReD- imNet [20] as speaker encoder architectures which are trained from scratch","venue":null,"work_id":"1c40311a-cc5a-4ad0-86c7-e259dac3f775","year":2021},"citing_paper":{"arxiv_id":"2506.02083","last_updated":"2025-06-02T10:59:31Z","snapshot_observed_at":"2026-08-07T11:36:44.614536Z","submitted_at":"2025-06-02T10:59:31Z","title":"LASPA: Language Agnostic Speaker Disentanglement with Prefix-Tuned Cross-Attention","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T11:46:57.984692Z"},"links":{"citing_paper":"/paper/2506.02083"},"observation_digest":"sha256:439871df2cf9184c7c486f062f620240f20bdabd8ac74425540c3cc6398b0016","observation_id":"e8496916-bbb5-4b17-b6e7-9f2db0832a3d","resolution":{"observed_at":"2026-08-07T11:47:00.436884Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:47:00.326119Z","title":"Our method effectively separates speaker iden- tity from linguistic information, addressing key challenges in multi-lingual speaker recognition","venue":null,"work_id":"9cffba0e-b036-4d84-bbe8-6c540dbf8f65","year":null},"citing_paper":{"arxiv_id":"2506.02083","last_updated":"2025-06-02T10:59:31Z","snapshot_observed_at":"2026-08-07T11:36:44.614536Z","submitted_at":"2025-06-02T10:59:31Z","title":"LASPA: Language Agnostic Speaker Disentanglement with Prefix-Tuned Cross-Attention","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:46:58.032877Z"},"links":{"citing_paper":"/paper/2506.02083"},"observation_digest":"sha256:57ca2306cd04f982295763431c1f06e6c7b23e8dca8c2515df4b310789e41bae","observation_id":"26edf240-2ee5-44db-868b-c8fcbb7d4f54","resolution":{"observed_at":"2026-08-07T11:47:00.357259Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:47:00.247132Z","title":"Disentangled representation learning for multilingual speaker recognition,","venue":null,"work_id":"65f8cd19-edf2-4432-a883-aece07105468","year":2023},"citing_paper":{"arxiv_id":"2506.02083","last_updated":"2025-06-02T10:59:31Z","snapshot_observed_at":"2026-08-07T11:36:44.614536Z","submitted_at":"2025-06-02T10:59:31Z","title":"LASPA: Language Agnostic Speaker Disentanglement with Prefix-Tuned Cross-Attention","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:46:58.055712Z"},"links":{"citing_paper":"/paper/2506.02083"},"observation_digest":"sha256:e9e2a88b38dce5a6978060b43d29e522e88691883a1616ecdba57e3e5361f9a2","observation_id":"fa79f171-b74a-4a7e-a517-9ed3d37e073a","resolution":{"observed_at":"2026-08-07T11:47:00.279486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.04972","last_updated":"2020-04-10T10:01:53Z","snapshot_observed_at":"2026-07-06T09:11:28.904636Z","submitted_at":"2020-04-10T10:01:53Z","title":"Generating Multilingual Voices Using Speaker Space Translation Based on Bilingual Speaker Data","version":1},"cited_work":{"arxiv_id":"2004.04972","doi":null,"metadata_source":"pith","pith_arxiv_id":"2004.04972","snapshot_observed_at":"2026-08-07T11:46:58.528335Z","title":"Generating Multilingual Voices Using Speaker Space Translation Based on Bilingual Speaker Data","venue":"cs.CL","work_id":"a33d671c-6e83-4d78-9632-8f59dfcc51fa","year":2020},"citing_paper":{"arxiv_id":"2506.02083","last_updated":"2025-06-02T10:59:31Z","snapshot_observed_at":"2026-08-07T11:36:44.614536Z","submitted_at":"2025-06-02T10:59:31Z","title":"LASPA: Language Agnostic Speaker Disentanglement with Prefix-Tuned Cross-Attention","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T11:46:58.093636Z"},"links":{"cited_paper":"/paper/2004.04972","citing_paper":"/paper/2506.02083"},"observation_digest":"sha256:f1a781484305af19a1856907777481695b18742b767a3ebd409d1db3f7775526","observation_id":"ce778a9c-06e3-4987-a233-c14487f1983b","resolution":{"observed_at":"2026-08-07T11:46:58.539004Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:47:00.165908Z","title":"Unsupervised domain adaptation by backpropagation,","venue":null,"work_id":"9fc8ea51-97ec-479c-9236-3d57a8d3bb2d","year":2015},"citing_paper":{"arxiv_id":"2506.02083","last_updated":"2025-06-02T10:59:31Z","snapshot_observed_at":"2026-08-07T11:36:44.614536Z","submitted_at":"2025-06-02T10:59:31Z","title":"LASPA: Language Agnostic Speaker Disentanglement with Prefix-Tuned Cross-Attention","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T11:46:58.123901Z"},"links":{"citing_paper":"/paper/2506.02083"},"observation_digest":"sha256:0fd07e07b3638016beaba68d8d7be6024d196e95023eba52757cad3c93664b52","observation_id":"c582d41d-ec1c-4339-aa23-51b92893f038","resolution":{"observed_at":"2026-08-07T11:47:00.199073Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:47:00.094202Z","title":"Disentan- gled speaker representation learning via mutual information min- imization,","venue":null,"work_id":"fd1fa918-1d07-43cd-95ee-bf79b25830b7","year":2022},"citing_paper":{"arxiv_id":"2506.02083","last_updated":"2025-06-02T10:59:31Z","snapshot_observed_at":"2026-08-07T11:36:44.614536Z","submitted_at":"2025-06-02T10:59:31Z","title":"LASPA: Language Agnostic Speaker Disentanglement with Prefix-Tuned Cross-Attention","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:46:58.139191Z"},"links":{"citing_paper":"/paper/2506.02083"},"observation_digest":"sha256:ff758cc105ea1a44aff763cb9d337e7258d6cd9e7e2f991500a965cfd61339de","observation_id":"bf22719f-98b9-4669-9316-ac1833987afd","resolution":{"observed_at":"2026-08-07T11:47:00.128814Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:47:00.018568Z","title":"Disentangled speaker embedding for ro- bust speaker verification,","venue":null,"work_id":"aa043cea-6640-43df-b7f0-94b16591c3d0","year":2022},"citing_paper":{"arxiv_id":"2506.02083","last_updated":"2025-06-02T10:59:31Z","snapshot_observed_at":"2026-08-07T11:36:44.614536Z","submitted_at":"2025-06-02T10:59:31Z","title":"LASPA: Language Agnostic Speaker Disentanglement with Prefix-Tuned Cross-Attention","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T11:46:58.151133Z"},"links":{"citing_paper":"/paper/2506.02083"},"observation_digest":"sha256:e1f484fff1c40f138517ce7971b7bd7df0e6323850a46d792b4ac03ce705dd15","observation_id":"d322e69f-4671-4639-b726-615f35c48cf1","resolution":{"observed_at":"2026-08-07T11:47:00.047242Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:46:59.946435Z","title":"Deep Representation Decomposition for Rate-Invariant Speaker Verifi- cation,","venue":null,"work_id":"bf56c9f5-83f5-4716-bc09-f4dce036d9ac","year":2022},"citing_paper":{"arxiv_id":"2506.02083","last_updated":"2025-06-02T10:59:31Z","snapshot_observed_at":"2026-08-07T11:36:44.614536Z","submitted_at":"2025-06-02T10:59:31Z","title":"LASPA: Language Agnostic Speaker Disentanglement with Prefix-Tuned Cross-Attention","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T11:46:58.159330Z"},"links":{"citing_paper":"/paper/2506.02083"},"observation_digest":"sha256:91f1f00da4a02b69f4f361a49447732cc0f14a328dd8a98da64624d51932d4bf","observation_id":"70dc3df1-058b-4783-b40c-00c2cd640b14","resolution":{"observed_at":"2026-08-07T11:46:59.979323Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:46:59.863890Z","title":"Augmenta- tion adversarial training for self-supervised speaker representation learning,","venue":null,"work_id":"641f6dfe-c2de-4999-9b20-9849c20abc7b","year":2022},"citing_paper":{"arxiv_id":"2506.02083","last_updated":"2025-06-02T10:59:31Z","snapshot_observed_at":"2026-08-07T11:36:44.614536Z","submitted_at":"2025-06-02T10:59:31Z","title":"LASPA: Language Agnostic Speaker Disentanglement with Prefix-Tuned Cross-Attention","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T11:46:58.167760Z"},"links":{"citing_paper":"/paper/2506.02083"},"observation_digest":"sha256:e809d6bbd1620ee776ba296614e87b604776439ae0d2152ab069df8441603c65","observation_id":"9a8f13bb-ce2e-4491-9883-f530a12fb39e","resolution":{"observed_at":"2026-08-07T11:46:59.896272Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:46:59.773574Z","title":"Towards principled methods for training generative adversarial networks,","venue":null,"work_id":"4491bc61-e199-4c22-a18e-d3f5e6beb462","year":2017},"citing_paper":{"arxiv_id":"2506.02083","last_updated":"2025-06-02T10:59:31Z","snapshot_observed_at":"2026-08-07T11:36:44.614536Z","submitted_at":"2025-06-02T10:59:31Z","title":"LASPA: Language Agnostic Speaker Disentanglement with Prefix-Tuned Cross-Attention","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T11:46:58.175323Z"},"links":{"citing_paper":"/paper/2506.02083"},"observation_digest":"sha256:f0efa0af89a8ef14762fb55aee41a9f1480413c3b5cfef3187b3e03d52aa5b50","observation_id":"5fa4314c-5421-476d-9195-005a3013a6e8","resolution":{"observed_at":"2026-08-07T11:46:59.814989Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:46:59.687826Z","title":"Disentan- gled speaker and nuisance attribute embedding for robust speaker verification,","venue":null,"work_id":"615aed2b-104f-4ac8-862f-8345b99cab6a","year":2020},"citing_paper":{"arxiv_id":"2506.02083","last_updated":"2025-06-02T10:59:31Z","snapshot_observed_at":"2026-08-07T11:36:44.614536Z","submitted_at":"2025-06-02T10:59:31Z","title":"LASPA: Language Agnostic Speaker Disentanglement with Prefix-Tuned Cross-Attention","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T11:46:58.184281Z"},"links":{"citing_paper":"/paper/2506.02083"},"observation_digest":"sha256:0753a650d85b6fa51cff66918bc0b45cec8c581360f87243ed8763b72b3166ba","observation_id":"461d16fb-11c4-43e8-8f22-03af368ac085","resolution":{"observed_at":"2026-08-07T11:46:59.716952Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:46:59.611876Z","title":"Disentangled represen- tation with dual-stage feature learning for face anti-spoofing,","venue":null,"work_id":"701cce17-c719-46aa-bd93-7580290f5f44","year":2022},"citing_paper":{"arxiv_id":"2506.02083","last_updated":"2025-06-02T10:59:31Z","snapshot_observed_at":"2026-08-07T11:36:44.614536Z","submitted_at":"2025-06-02T10:59:31Z","title":"LASPA: Language Agnostic Speaker Disentanglement with Prefix-Tuned Cross-Attention","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T11:46:58.195092Z"},"links":{"citing_paper":"/paper/2506.02083"},"observation_digest":"sha256:d1df43a0dcfb658735a98ec343d4c5c8d254f3179939a47c2529acf3e2112fe3","observation_id":"92a1aafa-534d-468d-9439-995ddf7d97f5","resolution":{"observed_at":"2026-08-07T11:46:59.648211Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:46:58.207915Z","title":"Arcface: Additive angular margin loss for deep face recognition,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.02083","last_updated":"2025-06-02T10:59:31Z","snapshot_observed_at":"2026-08-07T11:36:44.614536Z","submitted_at":"2025-06-02T10:59:31Z","title":"LASPA: Language Agnostic Speaker Disentanglement with Prefix-Tuned Cross-Attention","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T11:46:58.207915Z"},"links":{"citing_paper":"/paper/2506.02083"},"observation_digest":"sha256:1a2de792f9149c40bca0bc87e6db483dac351289e04fdb708315ebb6364bdf65","observation_id":"a5b0cf12-89e3-4ab6-83b9-06489e025ed7","resolution":{"observed_at":"2026-08-07T11:46:58.207915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:46:59.526733Z","title":"Disentangling style factors from speaker representations,","venue":null,"work_id":"94f4245c-3227-41b0-b6af-83cf4bc5d64c","year":2019},"citing_paper":{"arxiv_id":"2506.02083","last_updated":"2025-06-02T10:59:31Z","snapshot_observed_at":"2026-08-07T11:36:44.614536Z","submitted_at":"2025-06-02T10:59:31Z","title":"LASPA: Language Agnostic Speaker Disentanglement with Prefix-Tuned Cross-Attention","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T11:46:58.218609Z"},"links":{"citing_paper":"/paper/2506.02083"},"observation_digest":"sha256:b494e196bbddc7662aaf86e77904cca995aef0b4da12154270fca87270e6a8a8","observation_id":"525c2395-2d1f-406f-8e69-34f22348d5ce","resolution":{"observed_at":"2026-08-07T11:46:59.556610Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:46:59.455090Z","title":"X- vectors meet emotions: A study on dependencies between emo- tion and speaker recognition,","venue":null,"work_id":"eafc83e3-c50b-46e9-b207-80469c13ed7c","year":2020},"citing_paper":{"arxiv_id":"2506.02083","last_updated":"2025-06-02T10:59:31Z","snapshot_observed_at":"2026-08-07T11:36:44.614536Z","submitted_at":"2025-06-02T10:59:31Z","title":"LASPA: Language Agnostic Speaker Disentanglement with Prefix-Tuned Cross-Attention","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T11:46:58.232292Z"},"links":{"citing_paper":"/paper/2506.02083"},"observation_digest":"sha256:59e56b7251f000bc1ee37dca64fbef0543f7cd147939400ab6a8e74051b796e0","observation_id":"b320bc10-27d5-46c7-9b9d-e91271fd3d23","resolution":{"observed_at":"2026-08-07T11:46:59.486372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:46:59.383563Z","title":"Accent and speaker disentanglement in many- to-many voice conversion,","venue":null,"work_id":"6f5501a3-1d8f-4b03-857f-29de81a0d27e","year":2021},"citing_paper":{"arxiv_id":"2506.02083","last_updated":"2025-06-02T10:59:31Z","snapshot_observed_at":"2026-08-07T11:36:44.614536Z","submitted_at":"2025-06-02T10:59:31Z","title":"LASPA: Language Agnostic Speaker Disentanglement with Prefix-Tuned Cross-Attention","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T11:46:58.247351Z"},"links":{"citing_paper":"/paper/2506.02083"},"observation_digest":"sha256:048e587ffa8e518f522267f18afb4a5598418d63545c3de2d52210f7fb9aaf19","observation_id":"856e8b1e-a4fb-4016-94b1-c3588c8dbdec","resolution":{"observed_at":"2026-08-07T11:46:59.416145Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:46:58.262439Z","title":"Probing the information encoded in x-vectors,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.02083","last_updated":"2025-06-02T10:59:31Z","snapshot_observed_at":"2026-08-07T11:36:44.614536Z","submitted_at":"2025-06-02T10:59:31Z","title":"LASPA: Language Agnostic Speaker Disentanglement with Prefix-Tuned Cross-Attention","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T11:46:58.262439Z"},"links":{"citing_paper":"/paper/2506.02083"},"observation_digest":"sha256:7e8076c55e2f4286ac27c0aced3f6b7bbce2d88b3640f9efb40e44487d142979","observation_id":"10430e4d-0b91-441d-bd10-2a9a2bcb0470","resolution":{"observed_at":"2026-08-07T11:46:58.262439Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:46:59.297121Z","title":"Speaker recognition: a tutorial,","venue":null,"work_id":"122e61ed-bc0d-4e27-b591-785fd23ecb59","year":1997},"citing_paper":{"arxiv_id":"2506.02083","last_updated":"2025-06-02T10:59:31Z","snapshot_observed_at":"2026-08-07T11:36:44.614536Z","submitted_at":"2025-06-02T10:59:31Z","title":"LASPA: Language Agnostic Speaker Disentanglement with Prefix-Tuned Cross-Attention","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T11:46:58.275967Z"},"links":{"citing_paper":"/paper/2506.02083"},"observation_digest":"sha256:566dbcf244687b0f5b359f02cc446fd146ce94af968b8bc2147d8a6cbb131606","observation_id":"36909bdf-57f1-40cc-935b-a87be247f363","resolution":{"observed_at":"2026-08-07T11:46:59.336773Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:46:59.224942Z","title":"In defence of metric learning for speaker recognition,","venue":null,"work_id":"32efedf6-e189-47c2-aa61-20a688af0580","year":2020},"citing_paper":{"arxiv_id":"2506.02083","last_updated":"2025-06-02T10:59:31Z","snapshot_observed_at":"2026-08-07T11:36:44.614536Z","submitted_at":"2025-06-02T10:59:31Z","title":"LASPA: Language Agnostic Speaker Disentanglement with Prefix-Tuned Cross-Attention","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T11:46:58.285275Z"},"links":{"citing_paper":"/paper/2506.02083"},"observation_digest":"sha256:2fd00d34491a850250ba2e6bf671b6ac2ab95e92dcd2c0787689205c8c17054a","observation_id":"110f03ea-f035-4f46-b535-96e2b6b58604","resolution":{"observed_at":"2026-08-07T11:46:59.259483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:46:59.152995Z","title":"The ins and outs of speaker recognition: lessons from voxsrc 2020,","venue":null,"work_id":"6dbf1b79-5808-49ef-a6ca-7eb64d636382","year":2020},"citing_paper":{"arxiv_id":"2506.02083","last_updated":"2025-06-02T10:59:31Z","snapshot_observed_at":"2026-08-07T11:36:44.614536Z","submitted_at":"2025-06-02T10:59:31Z","title":"LASPA: Language Agnostic Speaker Disentanglement with Prefix-Tuned Cross-Attention","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T11:46:58.295996Z"},"links":{"citing_paper":"/paper/2506.02083"},"observation_digest":"sha256:3338e7b631d25d0c9b898fc0b12bfa7f826f4c050a241f9a3370313c4113eba3","observation_id":"55857be1-fd83-45e5-975d-0b44a7c602e0","resolution":{"observed_at":"2026-08-07T11:46:59.179084Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:46:58.312074Z","title":"ECAPA- TDNN: Emphasized Channel Attention, Propagation and Ag- gregation in TDNN Based Speaker Verification,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.02083","last_updated":"2025-06-02T10:59:31Z","snapshot_observed_at":"2026-08-07T11:36:44.614536Z","submitted_at":"2025-06-02T10:59:31Z","title":"LASPA: Language Agnostic Speaker Disentanglement with Prefix-Tuned Cross-Attention","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T11:46:58.312074Z"},"links":{"citing_paper":"/paper/2506.02083"},"observation_digest":"sha256:f6a4eff3b5f2989d803a446b6a6b578d55053b42255afb4d8f0190082a1454f1","observation_id":"6d14fadb-ed87-414f-aecf-626469198702","resolution":{"observed_at":"2026-08-07T11:46:58.312074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:46:59.071232Z","title":"Reshape dimensions network for speaker recognition,","venue":null,"work_id":"c92e1e62-ebe3-4c17-8041-1afbefe3457e","year":2024},"citing_paper":{"arxiv_id":"2506.02083","last_updated":"2025-06-02T10:59:31Z","snapshot_observed_at":"2026-08-07T11:36:44.614536Z","submitted_at":"2025-06-02T10:59:31Z","title":"LASPA: Language Agnostic Speaker Disentanglement with Prefix-Tuned Cross-Attention","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T11:46:58.322198Z"},"links":{"citing_paper":"/paper/2506.02083"},"observation_digest":"sha256:92589914642509dc4beadc4b6ce5df8b0b35472b8cde68a7a5dcb8928d23b041","observation_id":"b728c4d3-84bd-4ed7-87a2-e2ac4c6c8387","resolution":{"observed_at":"2026-08-07T11:46:59.111561Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:46:59.007252Z","title":"Prefix-tuning: Optimizing continuous prompts for generation,","venue":null,"work_id":"ce6c77a1-fe11-4aa0-b94b-8b74f8ade005","year":2021},"citing_paper":{"arxiv_id":"2506.02083","last_updated":"2025-06-02T10:59:31Z","snapshot_observed_at":"2026-08-07T11:36:44.614536Z","submitted_at":"2025-06-02T10:59:31Z","title":"LASPA: Language Agnostic Speaker Disentanglement with Prefix-Tuned Cross-Attention","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T11:46:58.330142Z"},"links":{"citing_paper":"/paper/2506.02083"},"observation_digest":"sha256:3e25eb9fcd322ea7abfb545f5358560955af03d0289e2b81df8c94c88ef98da3","observation_id":"1b33b641-e8fd-4012-b5d6-a834c6994a3e","resolution":{"observed_at":"2026-08-07T11:46:59.030729Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:46:58.948453Z","title":"Cross-modal fusion and attention mechanism for weakly supervised video anomaly detection,","venue":null,"work_id":"517707f8-459f-4baf-9d2b-5c12788d9d83","year":2024},"citing_paper":{"arxiv_id":"2506.02083","last_updated":"2025-06-02T10:59:31Z","snapshot_observed_at":"2026-08-07T11:36:44.614536Z","submitted_at":"2025-06-02T10:59:31Z","title":"LASPA: Language Agnostic Speaker Disentanglement with Prefix-Tuned Cross-Attention","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T11:46:58.338582Z"},"links":{"citing_paper":"/paper/2506.02083"},"observation_digest":"sha256:a5e607d99e2df5fadc57dd3fdf4d025587b7b611fec391b31814d5846402a518","observation_id":"4ca91b79-2996-4cd0-929c-b0c4989311c9","resolution":{"observed_at":"2026-08-07T11:46:58.967977Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:46:58.347429Z","title":"Atten- tion is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.02083","last_updated":"2025-06-02T10:59:31Z","snapshot_observed_at":"2026-08-07T11:36:44.614536Z","submitted_at":"2025-06-02T10:59:31Z","title":"LASPA: Language Agnostic Speaker Disentanglement with Prefix-Tuned Cross-Attention","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T11:46:58.347429Z"},"links":{"citing_paper":"/paper/2506.02083"},"observation_digest":"sha256:a567f9f1c8f9eb7072e2c6ec23044fcb3add8e4de91abb6adbcc59e0c640ffc1","observation_id":"3f117dd7-245c-493a-8c9e-3bc52c0c44f2","resolution":{"observed_at":"2026-08-07T11:46:58.347429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:46:58.357515Z","title":"Long Short-Term Memory,","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2506.02083","last_updated":"2025-06-02T10:59:31Z","snapshot_observed_at":"2026-08-07T11:36:44.614536Z","submitted_at":"2025-06-02T10:59:31Z","title":"LASPA: Language Agnostic Speaker Disentanglement with Prefix-Tuned Cross-Attention","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T11:46:58.357515Z"},"links":{"citing_paper":"/paper/2506.02083"},"observation_digest":"sha256:9354012cce4adc3b96789219eaa92ab747de508781cc835022e4b56f4c984bee","observation_id":"89b9b333-6554-468a-abd3-e8bf54197b94","resolution":{"observed_at":"2026-08-07T11:46:58.357515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:46:58.849184Z","title":"Multilayer perceptron and neural networks,","venue":null,"work_id":"add54640-6d8d-4fdd-a0d9-7de9cea3cd83","year":2009},"citing_paper":{"arxiv_id":"2506.02083","last_updated":"2025-06-02T10:59:31Z","snapshot_observed_at":"2026-08-07T11:36:44.614536Z","submitted_at":"2025-06-02T10:59:31Z","title":"LASPA: Language Agnostic Speaker Disentanglement with Prefix-Tuned Cross-Attention","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T11:46:58.367554Z"},"links":{"citing_paper":"/paper/2506.02083"},"observation_digest":"sha256:ca749651261ec6d324b912c456eaec6ef5d1fe5e8d4f1d5b0ee076a5a9d0543b","observation_id":"6398f9ba-ea38-4a7c-a20e-a9cd4a47bc01","resolution":{"observed_at":"2026-08-07T11:46:58.899240Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:46:58.752097Z","title":"V oxceleb2: Deep speaker recognition,","venue":null,"work_id":"2dc851d8-521b-4525-bbb0-f40bc5e8c90d","year":2018},"citing_paper":{"arxiv_id":"2506.02083","last_updated":"2025-06-02T10:59:31Z","snapshot_observed_at":"2026-08-07T11:36:44.614536Z","submitted_at":"2025-06-02T10:59:31Z","title":"LASPA: Language Agnostic Speaker Disentanglement with Prefix-Tuned Cross-Attention","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T11:46:58.375195Z"},"links":{"citing_paper":"/paper/2506.02083"},"observation_digest":"sha256:e96f01678d8622fda4899b57ffb05867400dd11eb6da2eaab2e18f2cbd7e1181","observation_id":"c7117d09-0ad9-43b7-afe0-16a2042d6914","resolution":{"observed_at":"2026-08-07T11:46:58.784189Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:46:58.671068Z","title":"V oxlingua107: A dataset for spoken lan- guage recognition,","venue":null,"work_id":"a0e2fc06-7dc4-48ff-b5b5-450eb6007387","year":2021},"citing_paper":{"arxiv_id":"2506.02083","last_updated":"2025-06-02T10:59:31Z","snapshot_observed_at":"2026-08-07T11:36:44.614536Z","submitted_at":"2025-06-02T10:59:31Z","title":"LASPA: Language Agnostic Speaker Disentanglement with Prefix-Tuned Cross-Attention","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T11:46:58.383447Z"},"links":{"citing_paper":"/paper/2506.02083"},"observation_digest":"sha256:dc977882ba2d55be201fe2c45b59614802b9e4f90ba5f6017fff834a72af4a1f","observation_id":"47d2e677-b30d-46d2-8053-3f473e637802","resolution":{"observed_at":"2026-08-07T11:46:58.703998Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:46:58.647331Z","title":"V oxceleb: A large- scale speaker identification dataset,","venue":null,"work_id":"52824f27-cfd9-413d-a6ab-32ed56762af3","year":2017},"citing_paper":{"arxiv_id":"2506.02083","last_updated":"2025-06-02T10:59:31Z","snapshot_observed_at":"2026-08-07T11:36:44.614536Z","submitted_at":"2025-06-02T10:59:31Z","title":"LASPA: Language Agnostic Speaker Disentanglement with Prefix-Tuned Cross-Attention","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T11:46:58.393583Z"},"links":{"citing_paper":"/paper/2506.02083"},"observation_digest":"sha256:0c5accc51baa70dc3d01146190cca4df90bfe6eb155cbcf7be1bbe1be1d7080e","observation_id":"a22cc39b-3e9c-4459-b384-91da14d12a96","resolution":{"observed_at":"2026-08-07T11:46:58.656967Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:46:58.625538Z","title":"Nisp: A multi-lingual multi-accent dataset for speaker profiling,","venue":null,"work_id":"58103778-c4f4-4d67-a9b9-b0a9d1b55a2b","year":2021},"citing_paper":{"arxiv_id":"2506.02083","last_updated":"2025-06-02T10:59:31Z","snapshot_observed_at":"2026-08-07T11:36:44.614536Z","submitted_at":"2025-06-02T10:59:31Z","title":"LASPA: Language Agnostic Speaker Disentanglement with Prefix-Tuned Cross-Attention","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T11:46:58.402322Z"},"links":{"citing_paper":"/paper/2506.02083"},"observation_digest":"sha256:268fdebe94e88ab3052919280ba7cb01c79668ab992c30e7192e8ad14e47f3d7","observation_id":"a558e9e6-88b1-4aba-a37a-7bd7962ad157","resolution":{"observed_at":"2026-08-07T11:46:58.634497Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:46:58.606561Z","title":"The displace challenge 2023 - diarization of speaker and language in conversational environments,","venue":null,"work_id":"73f4d8cd-348b-42cf-9c12-9db26fb5078d","year":2023},"citing_paper":{"arxiv_id":"2506.02083","last_updated":"2025-06-02T10:59:31Z","snapshot_observed_at":"2026-08-07T11:36:44.614536Z","submitted_at":"2025-06-02T10:59:31Z","title":"LASPA: Language Agnostic Speaker Disentanglement with Prefix-Tuned Cross-Attention","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T11:46:58.413507Z"},"links":{"citing_paper":"/paper/2506.02083"},"observation_digest":"sha256:64cb12ff5a74dcfa15a079a7d872c3e0add619a64c271e6f85186a686ae60de2","observation_id":"ad7f446e-dab5-4cdf-ba32-3b97fd8be7ba","resolution":{"observed_at":"2026-08-07T11:46:58.614241Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:46:58.589147Z","title":"Ensemble of incremental system enhancements for robust speaker diariza- tion in code-switched real-life audios,","venue":null,"work_id":"7644fee9-99c7-4905-bdb1-15f44c3f20bd","year":2023},"citing_paper":{"arxiv_id":"2506.02083","last_updated":"2025-06-02T10:59:31Z","snapshot_observed_at":"2026-08-07T11:36:44.614536Z","submitted_at":"2025-06-02T10:59:31Z","title":"LASPA: Language Agnostic Speaker Disentanglement with Prefix-Tuned Cross-Attention","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T11:46:58.425343Z"},"links":{"citing_paper":"/paper/2506.02083"},"observation_digest":"sha256:102aa5ef4886245cbda9c5c14fe3f73dab370f56b95d0290086399f51f4d98cf","observation_id":"27463162-58b9-477e-bdba-eae1a7c353fc","resolution":{"observed_at":"2026-08-07T11:46:58.594835Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.02083","last_updated":"2025-06-02T10:59:31Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-07T11:36:44.614536Z","submitted_at":"2025-06-02T10:59:31Z","title":"LASPA: Language Agnostic Speaker Disentanglement with Prefix-Tuned Cross-Attention"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":2,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":8,"verified_exact":2,"verified_fuzzy":28},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 1 inbound Pith citation observation for arXiv:2506.02083."}