{"as_of":"2026-08-22T07:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:57a8fa8cc25a03407c1075688566df6d0908cb00bb5cffadb0ef475169dca08a","coverage":[{"denominator":56,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":56,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T20:43:27.389104Z","state":"measured"},{"denominator":56,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":56,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.12288/citation-record","integrity":"/paper/2505.12288/integrity","json":"/paper/2505.12288/citation-record.json","paper":"/paper/2505.12288"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:43:30.868461Z","title":"Some experiments on the recognition of speech, with one and with two ears,","venue":null,"work_id":"9f910760-11f3-43c5-9b02-51cfd0ceeb07","year":1953},"citing_paper":{"arxiv_id":"2505.12288","last_updated":"2026-07-12T11:39:40Z","snapshot_observed_at":"2026-08-15T22:08:19.121467Z","submitted_at":"2025-05-18T08:01:12Z","title":"Unified Architecture and Unsupervised Speech Disentanglement for Speaker Embedding-Free Enrollment in Personalized Speech Enhancement","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:26.409479Z"},"links":{"citing_paper":"/paper/2505.12288"},"observation_digest":"sha256:12092808de7c967bbd07b360483e95b2803d1d92b7b296ae5a1562956372306e","observation_id":"d1d9940e-f54b-4839-b75e-f16361745cbb","resolution":{"observed_at":"2026-08-15T20:43:30.872899Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:43:30.854361Z","title":"The cocktail party problem,","venue":null,"work_id":"142d98f4-cbd1-43c7-8c5d-2497e53523d4","year":1902},"citing_paper":{"arxiv_id":"2505.12288","last_updated":"2026-07-12T11:39:40Z","snapshot_observed_at":"2026-08-15T22:08:19.121467Z","submitted_at":"2025-05-18T08:01:12Z","title":"Unified Architecture and Unsupervised Speech Disentanglement for Speaker Embedding-Free Enrollment in Personalized Speech Enhancement","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:26.418615Z"},"links":{"citing_paper":"/paper/2505.12288"},"observation_digest":"sha256:1682dafab65588fd6ca6110e812963b41e99f4a9f3cf9d4c77328f38448e5815","observation_id":"518523af-87b2-4a3e-b02b-c512a0482e0a","resolution":{"observed_at":"2026-08-15T20:43:30.858988Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:43:30.839148Z","title":"SEGAN: Speech enhancement generative adversarial network,","venue":null,"work_id":"83614f0f-429a-4f13-99ae-2e9e65a7bebf","year":2017},"citing_paper":{"arxiv_id":"2505.12288","last_updated":"2026-07-12T11:39:40Z","snapshot_observed_at":"2026-08-15T22:08:19.121467Z","submitted_at":"2025-05-18T08:01:12Z","title":"Unified Architecture and Unsupervised Speech Disentanglement for Speaker Embedding-Free Enrollment in Personalized Speech Enhancement","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:26.431647Z"},"links":{"citing_paper":"/paper/2505.12288"},"observation_digest":"sha256:a6a3487015a44c599642570992b8318324c648f209b6c9b1b157543ee6077227","observation_id":"86e66518-3e0e-48ec-8ad5-d7293d16f4d8","resolution":{"observed_at":"2026-08-15T20:43:30.845266Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:43:30.670306Z","title":"MetricGAN: Generative adversarial networks based black-box metric scores optimization for speech enhancement,","venue":null,"work_id":"4f57d568-5750-45e3-b44d-b18a5f46f7be","year":2019},"citing_paper":{"arxiv_id":"2505.12288","last_updated":"2026-07-12T11:39:40Z","snapshot_observed_at":"2026-08-15T22:08:19.121467Z","submitted_at":"2025-05-18T08:01:12Z","title":"Unified Architecture and Unsupervised Speech Disentanglement for Speaker Embedding-Free Enrollment in Personalized Speech Enhancement","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:26.436509Z"},"links":{"citing_paper":"/paper/2505.12288"},"observation_digest":"sha256:383b3dcb60a103e9317631744a482429e1d677c0bc87cb901f0ca88ed11ae6f0","observation_id":"5d47193f-e870-43f9-9b9b-0918badd53b4","resolution":{"observed_at":"2026-08-15T20:43:30.762498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:43:30.656083Z","title":"MP-SENet: A speech enhancement model with parallel denoising of magnitude,","venue":null,"work_id":"8354163a-9fb5-4f80-b067-2081e7bd7d45","year":2020},"citing_paper":{"arxiv_id":"2505.12288","last_updated":"2026-07-12T11:39:40Z","snapshot_observed_at":"2026-08-15T22:08:19.121467Z","submitted_at":"2025-05-18T08:01:12Z","title":"Unified Architecture and Unsupervised Speech Disentanglement for Speaker Embedding-Free Enrollment in Personalized Speech Enhancement","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:26.441421Z"},"links":{"citing_paper":"/paper/2505.12288"},"observation_digest":"sha256:fb9446b3b48d944ae5f14470a1c28359fb724b6b7ba6c0ae426f22c5017dce21","observation_id":"2c8b37db-5aa8-4f79-88d7-46081905d844","resolution":{"observed_at":"2026-08-15T20:43:30.661608Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:43:30.640313Z","title":"Real-time speech enhance- ment in the waveform domain,","venue":null,"work_id":"5b715ae5-8c25-4691-9d98-35a5977c7d1e","year":2020},"citing_paper":{"arxiv_id":"2505.12288","last_updated":"2026-07-12T11:39:40Z","snapshot_observed_at":"2026-08-15T22:08:19.121467Z","submitted_at":"2025-05-18T08:01:12Z","title":"Unified Architecture and Unsupervised Speech Disentanglement for Speaker Embedding-Free Enrollment in Personalized Speech Enhancement","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:26.445849Z"},"links":{"citing_paper":"/paper/2505.12288"},"observation_digest":"sha256:b945a4576f37b6f24cdd58b942cf983f116c4b164f37aa882ff1628e0ab9dcd2","observation_id":"186896ed-13ac-441c-be69-b134f96b5bdf","resolution":{"observed_at":"2026-08-15T20:43:30.645424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:43:30.624947Z","title":"Dual-branch attention-in-attention transformer for single-channel speech enhance- ment,","venue":null,"work_id":"8ccb5620-a7fd-4295-b33c-eb13f276c4b1","year":2022},"citing_paper":{"arxiv_id":"2505.12288","last_updated":"2026-07-12T11:39:40Z","snapshot_observed_at":"2026-08-15T22:08:19.121467Z","submitted_at":"2025-05-18T08:01:12Z","title":"Unified Architecture and Unsupervised Speech Disentanglement for Speaker Embedding-Free Enrollment in Personalized Speech Enhancement","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:26.450203Z"},"links":{"citing_paper":"/paper/2505.12288"},"observation_digest":"sha256:cbdc623f11fe8d543baee802c6919c5c7950411c6acd2d2e8726a2bbb2c81948","observation_id":"49dc7a1d-0e75-49ea-ba1a-8df7f0a7fd0b","resolution":{"observed_at":"2026-08-15T20:43:30.630932Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:43:30.504360Z","title":"DPT-FSNet: Dual-path transformer- based full-band and sub-band fusion network for speech enhancement,","venue":null,"work_id":"9c73f837-4182-4044-8536-194bdac2b85a","year":2022},"citing_paper":{"arxiv_id":"2505.12288","last_updated":"2026-07-12T11:39:40Z","snapshot_observed_at":"2026-08-15T22:08:19.121467Z","submitted_at":"2025-05-18T08:01:12Z","title":"Unified Architecture and Unsupervised Speech Disentanglement for Speaker Embedding-Free Enrollment in Personalized Speech Enhancement","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:26.454742Z"},"links":{"citing_paper":"/paper/2505.12288"},"observation_digest":"sha256:0baf1b7032bfa259befd403ff2707c4ccf9a981f42e1676f1c7187f0a79ad35a","observation_id":"9ae25c25-9c17-4320-82b4-ced28b578804","resolution":{"observed_at":"2026-08-15T20:43:30.590390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:43:30.419015Z","title":"PhaseN: A phase-and- harmonics-aware speech enhancement network,","venue":null,"work_id":"98cf1eae-5647-40a2-b385-9ff8255889ef","year":2020},"citing_paper":{"arxiv_id":"2505.12288","last_updated":"2026-07-12T11:39:40Z","snapshot_observed_at":"2026-08-15T22:08:19.121467Z","submitted_at":"2025-05-18T08:01:12Z","title":"Unified Architecture and Unsupervised Speech Disentanglement for Speaker Embedding-Free Enrollment in Personalized Speech Enhancement","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:26.459660Z"},"links":{"citing_paper":"/paper/2505.12288"},"observation_digest":"sha256:3abde2be5741d11f4fd8981807b700a67e5300de948547cd5ec5e3b5f02c8935","observation_id":"43116a11-3f31-4689-8dba-0b31d6e8cb84","resolution":{"observed_at":"2026-08-15T20:43:30.424359Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:43:30.405077Z","title":"Neural target speech extraction: An overview,","venue":null,"work_id":"c3c2bca2-1029-4d76-a7fa-4cc4a9856ed8","year":2023},"citing_paper":{"arxiv_id":"2505.12288","last_updated":"2026-07-12T11:39:40Z","snapshot_observed_at":"2026-08-15T22:08:19.121467Z","submitted_at":"2025-05-18T08:01:12Z","title":"Unified Architecture and Unsupervised Speech Disentanglement for Speaker Embedding-Free Enrollment in Personalized Speech Enhancement","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:26.463982Z"},"links":{"citing_paper":"/paper/2505.12288"},"observation_digest":"sha256:21bdf67f753a328aa838c30f18c15854cdbb61af89c9c7d35fff2cdefee6d4da","observation_id":"96262c9e-9847-4bcd-8b80-2df7dfe673da","resolution":{"observed_at":"2026-08-15T20:43:30.409767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:43:30.391172Z","title":"An overview of deep learning-based audio-visual speech enhancement and separation,","venue":null,"work_id":"a941d8f9-3dd1-45c3-8148-6829e5bf8c1b","year":2021},"citing_paper":{"arxiv_id":"2505.12288","last_updated":"2026-07-12T11:39:40Z","snapshot_observed_at":"2026-08-15T22:08:19.121467Z","submitted_at":"2025-05-18T08:01:12Z","title":"Unified Architecture and Unsupervised Speech Disentanglement for Speaker Embedding-Free Enrollment in Personalized Speech Enhancement","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:26.467790Z"},"links":{"citing_paper":"/paper/2505.12288"},"observation_digest":"sha256:43717ee51bf517dbfc76bebbdfcfa0166d9b2017c95964863fa1b913a6845084","observation_id":"35a2d776-6b0b-492a-8a9a-2242c24f6e94","resolution":{"observed_at":"2026-08-15T20:43:30.395852Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:43:30.205555Z","title":"DPCCN: Densely-connected pyramid complex convolutional network for robust speech separation and extraction,","venue":null,"work_id":"eb1733d6-2d93-4863-89b5-35751e581127","year":2022},"citing_paper":{"arxiv_id":"2505.12288","last_updated":"2026-07-12T11:39:40Z","snapshot_observed_at":"2026-08-15T22:08:19.121467Z","submitted_at":"2025-05-18T08:01:12Z","title":"Unified Architecture and Unsupervised Speech Disentanglement for Speaker Embedding-Free Enrollment in Personalized Speech Enhancement","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:26.485030Z"},"links":{"citing_paper":"/paper/2505.12288"},"observation_digest":"sha256:5e5f016e352a8d94f573f5be18076b73ed75beaff9a1577833697537fe2dc14f","observation_id":"34941dbc-8c23-4b8b-82e5-a0c72803f6d2","resolution":{"observed_at":"2026-08-15T20:43:30.307022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:43:30.191044Z","title":"High fidelity speech enhancement with band-split rnn,","venue":null,"work_id":"370f2c64-ebcf-403b-bff3-475b3dbcf0b1","year":2023},"citing_paper":{"arxiv_id":"2505.12288","last_updated":"2026-07-12T11:39:40Z","snapshot_observed_at":"2026-08-15T22:08:19.121467Z","submitted_at":"2025-05-18T08:01:12Z","title":"Unified Architecture and Unsupervised Speech Disentanglement for Speaker Embedding-Free Enrollment in Personalized Speech Enhancement","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:26.516955Z"},"links":{"citing_paper":"/paper/2505.12288"},"observation_digest":"sha256:17dad1f884cbc1cca982500d0dacdd2062732b5e6e0ff8d9d12675312e9c834d","observation_id":"44657de0-f148-4a62-8342-b94cfd8656d4","resolution":{"observed_at":"2026-08-15T20:43:30.195276Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:43:30.176426Z","title":"X-SEPFORMER: End-to-end speaker extraction network with explicit optimization on speaker con- fusion,","venue":null,"work_id":"cd6923a9-a39f-4432-a9d5-28fb88147ae5","year":2023},"citing_paper":{"arxiv_id":"2505.12288","last_updated":"2026-07-12T11:39:40Z","snapshot_observed_at":"2026-08-15T22:08:19.121467Z","submitted_at":"2025-05-18T08:01:12Z","title":"Unified Architecture and Unsupervised Speech Disentanglement for Speaker Embedding-Free Enrollment in Personalized Speech Enhancement","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:26.556456Z"},"links":{"citing_paper":"/paper/2505.12288"},"observation_digest":"sha256:d2cfea4a39ab07364dbb7ec2e46493a16d1c74b3a60edbe3dd1cb486240afa10","observation_id":"783562d5-d792-4b11-8587-4396f2d533a2","resolution":{"observed_at":"2026-08-15T20:43:30.181621Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:43:29.982815Z","title":"Deep- FilterNet: Perceptually motivated real-time speech enhancement,","venue":null,"work_id":"9e2c4b56-2474-489a-889c-27bc9e72aea2","year":2023},"citing_paper":{"arxiv_id":"2505.12288","last_updated":"2026-07-12T11:39:40Z","snapshot_observed_at":"2026-08-15T22:08:19.121467Z","submitted_at":"2025-05-18T08:01:12Z","title":"Unified Architecture and Unsupervised Speech Disentanglement for Speaker Embedding-Free Enrollment in Personalized Speech Enhancement","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:26.609730Z"},"links":{"citing_paper":"/paper/2505.12288"},"observation_digest":"sha256:3b21a88255f25da34c1f796e7f21305002fe6244e6f353189a33cc4b0e4e594c","observation_id":"582c7007-c470-40ce-973c-2f61a9472c39","resolution":{"observed_at":"2026-08-15T20:43:30.090577Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:43:29.968729Z","title":"SEF-Net: Speaker embedding free target speaker extraction network,","venue":null,"work_id":"2ff007b5-fd97-41c6-9a34-27bf302f017b","year":2023},"citing_paper":{"arxiv_id":"2505.12288","last_updated":"2026-07-12T11:39:40Z","snapshot_observed_at":"2026-08-15T22:08:19.121467Z","submitted_at":"2025-05-18T08:01:12Z","title":"Unified Architecture and Unsupervised Speech Disentanglement for Speaker Embedding-Free Enrollment in Personalized Speech Enhancement","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:26.685814Z"},"links":{"citing_paper":"/paper/2505.12288"},"observation_digest":"sha256:1eec54c8e9ae4a7acc09806c41d03404fe424a72319dfc40597ddc4f87227d9e","observation_id":"8e4fe6b2-62b9-4682-abe1-b917441f110e","resolution":{"observed_at":"2026-08-15T20:43:29.973132Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:43:29.953625Z","title":"Target speaker extraction by directly exploiting contextual information in the time-frequency domain,","venue":null,"work_id":"85eb4670-5af5-45e4-a6fa-8e252cfd72e0","year":2024},"citing_paper":{"arxiv_id":"2505.12288","last_updated":"2026-07-12T11:39:40Z","snapshot_observed_at":"2026-08-15T22:08:19.121467Z","submitted_at":"2025-05-18T08:01:12Z","title":"Unified Architecture and Unsupervised Speech Disentanglement for Speaker Embedding-Free Enrollment in Personalized Speech Enhancement","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:26.694460Z"},"links":{"citing_paper":"/paper/2505.12288"},"observation_digest":"sha256:c83e3668c0bd00a82262c228410385e2f542c2a20942a0a8ace23d10ffbd1690","observation_id":"0a69d6e0-e924-449f-81d6-54b49e15f982","resolution":{"observed_at":"2026-08-15T20:43:29.958137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:43:29.805953Z","title":"Personalized speech enhancement without a separate speaker embedding model,","venue":null,"work_id":"b60c91b6-63bf-465e-90dc-17c70826ee02","year":2024},"citing_paper":{"arxiv_id":"2505.12288","last_updated":"2026-07-12T11:39:40Z","snapshot_observed_at":"2026-08-15T22:08:19.121467Z","submitted_at":"2025-05-18T08:01:12Z","title":"Unified Architecture and Unsupervised Speech Disentanglement for Speaker Embedding-Free Enrollment in Personalized Speech Enhancement","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:26.703019Z"},"links":{"citing_paper":"/paper/2505.12288"},"observation_digest":"sha256:4d3558184cb6350e70ba02c5a932ee19471b92c20e722f939dbd73bc84240503","observation_id":"a195858b-e966-444a-ba99-be555f8e452a","resolution":{"observed_at":"2026-08-15T20:43:29.872659Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:43:29.791825Z","title":"Urgent Challenge: Universality, robustness, and generalizability for speech enhancement,","venue":null,"work_id":"e05b7c5b-3311-4474-aecb-242a01f8209f","year":2024},"citing_paper":{"arxiv_id":"2505.12288","last_updated":"2026-07-12T11:39:40Z","snapshot_observed_at":"2026-08-15T22:08:19.121467Z","submitted_at":"2025-05-18T08:01:12Z","title":"Unified Architecture and Unsupervised Speech Disentanglement for Speaker Embedding-Free Enrollment in Personalized Speech Enhancement","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:26.717931Z"},"links":{"citing_paper":"/paper/2505.12288"},"observation_digest":"sha256:5f29f37d795d5162a79a30fe413be22148b9ce06a2fcd62ba593b47d09d1f747","observation_id":"eb765355-3171-43a7-a71b-4ddda00d29c8","resolution":{"observed_at":"2026-08-15T20:43:29.796834Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:43:26.722847Z","title":"AnyEnhance: A unified generative model with prompt-guidance and self-critic for voice enhancement,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.12288","last_updated":"2026-07-12T11:39:40Z","snapshot_observed_at":"2026-08-15T22:08:19.121467Z","submitted_at":"2025-05-18T08:01:12Z","title":"Unified Architecture and Unsupervised Speech Disentanglement for Speaker Embedding-Free Enrollment in Personalized Speech Enhancement","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:26.722847Z"},"links":{"citing_paper":"/paper/2505.12288"},"observation_digest":"sha256:6f768f2de91029c8a55e582a4f839f6f40785c9e78e964cf045337885e7ed190","observation_id":"a6d54836-3e7b-44a2-a825-5c7cfb9c9e45","resolution":{"observed_at":"2026-08-15T20:43:26.722847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:43:29.776164Z","title":"Uniaudio: Towards universal audio generation with large language models,","venue":null,"work_id":"d2eedbd2-860d-4f8f-9ef0-744fcc9db2ab","year":2024},"citing_paper":{"arxiv_id":"2505.12288","last_updated":"2026-07-12T11:39:40Z","snapshot_observed_at":"2026-08-15T22:08:19.121467Z","submitted_at":"2025-05-18T08:01:12Z","title":"Unified Architecture and Unsupervised Speech Disentanglement for Speaker Embedding-Free Enrollment in Personalized Speech Enhancement","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:26.727724Z"},"links":{"citing_paper":"/paper/2505.12288"},"observation_digest":"sha256:f30aedacdd1e093d25f0b3c0ff02cf1392fc19d4c7c091a365c2e4882c926742","observation_id":"88aafe99-5fb9-4687-b792-aa87dec94063","resolution":{"observed_at":"2026-08-15T20:43:29.781062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-18T17:13:14.270187Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.03128","snapshot_observed_at":"2026-08-15T20:43:26.732480Z","title":"Metis: A foundation speech generation model with masked generative pre- training,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.12288","last_updated":"2026-07-12T11:39:40Z","snapshot_observed_at":"2026-08-15T22:08:19.121467Z","submitted_at":"2025-05-18T08:01:12Z","title":"Unified Architecture and Unsupervised Speech Disentanglement for Speaker Embedding-Free Enrollment in Personalized Speech Enhancement","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:26.732480Z"},"links":{"cited_paper":"/paper/2502.03128","citing_paper":"/paper/2505.12288"},"observation_digest":"sha256:5dbeaf71c665f2da52451b2739b65d201b36261af732e8b9cd32f1e7183c4c70","observation_id":"fa2b64c3-2432-42f2-ab9d-66c7c002d53a","resolution":{"observed_at":"2026-08-15T20:43:26.732480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:43:29.629601Z","title":"Target confusion in end-to-end speaker extraction: Analysis and approaches,","venue":null,"work_id":"c09e1fe2-4102-4946-a9a3-785f04437339","year":2022},"citing_paper":{"arxiv_id":"2505.12288","last_updated":"2026-07-12T11:39:40Z","snapshot_observed_at":"2026-08-15T22:08:19.121467Z","submitted_at":"2025-05-18T08:01:12Z","title":"Unified Architecture and Unsupervised Speech Disentanglement for Speaker Embedding-Free Enrollment in Personalized Speech Enhancement","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:26.814496Z"},"links":{"citing_paper":"/paper/2505.12288"},"observation_digest":"sha256:364e8e6232fc33518e94d6d01a26476c72e38dd195948333fc02446752b5c006","observation_id":"854cc2d4-aa87-4ae8-94ef-5b2e7c0e9a24","resolution":{"observed_at":"2026-08-15T20:43:29.686727Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:43:29.614225Z","title":"Self-supervised disentangled representation learning for robust target speech extraction,","venue":null,"work_id":"79cbdd85-7bb3-4c5e-937e-cd1cf7474a16","year":2024},"citing_paper":{"arxiv_id":"2505.12288","last_updated":"2026-07-12T11:39:40Z","snapshot_observed_at":"2026-08-15T22:08:19.121467Z","submitted_at":"2025-05-18T08:01:12Z","title":"Unified Architecture and Unsupervised Speech Disentanglement for Speaker Embedding-Free Enrollment in Personalized Speech Enhancement","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:26.885119Z"},"links":{"citing_paper":"/paper/2505.12288"},"observation_digest":"sha256:e2d2b31c9f4c4e7700aeab494ad3bbc631f9acef748cac8f6963a067650cc35d","observation_id":"ae850b7f-55c3-4971-9d0a-2510bf5e1dd2","resolution":{"observed_at":"2026-08-15T20:43:29.618947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:43:29.598726Z","title":"Centroid estimation with transformer-based speaker embedder for robust target speaker extraction,","venue":null,"work_id":"8d45b46f-f5e6-4d4d-8c98-ccbc42ced051","year":2024},"citing_paper":{"arxiv_id":"2505.12288","last_updated":"2026-07-12T11:39:40Z","snapshot_observed_at":"2026-08-15T22:08:19.121467Z","submitted_at":"2025-05-18T08:01:12Z","title":"Unified Architecture and Unsupervised Speech Disentanglement for Speaker Embedding-Free Enrollment in Personalized Speech Enhancement","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:26.899153Z"},"links":{"citing_paper":"/paper/2505.12288"},"observation_digest":"sha256:e540b9f8fed642d3ddcc09680f649e09d2e22a2488ae22df79cd1c352059ceae","observation_id":"8c9aaa58-5b33-42fe-a6b1-66f0434fbff5","resolution":{"observed_at":"2026-08-15T20:43:29.604380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:43:29.447292Z","title":"SEF-PNet: Speaker encoder- free personalized speech enhancement with local and global contexts aggregation,","venue":null,"work_id":"30dbf583-a949-42cc-861a-14a7105a1eb1","year":2025},"citing_paper":{"arxiv_id":"2505.12288","last_updated":"2026-07-12T11:39:40Z","snapshot_observed_at":"2026-08-15T22:08:19.121467Z","submitted_at":"2025-05-18T08:01:12Z","title":"Unified Architecture and Unsupervised Speech Disentanglement for Speaker Embedding-Free Enrollment in Personalized Speech Enhancement","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:26.915412Z"},"links":{"citing_paper":"/paper/2505.12288"},"observation_digest":"sha256:3b049cb84bd6b084d3a2a580f9b1fbf5dfda19bec6a66062b2c406318314888f","observation_id":"a8916cf1-3c90-4ae5-aa7c-29573c7f5031","resolution":{"observed_at":"2026-08-15T20:43:29.522920Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:43:29.432392Z","title":"ECAPA-TDNN: Emphasized channel attention, propagation and aggregation in tdnn based speaker verification,","venue":null,"work_id":"2f5ddad9-3fd8-4c31-8635-b759e95277b1","year":2020},"citing_paper":{"arxiv_id":"2505.12288","last_updated":"2026-07-12T11:39:40Z","snapshot_observed_at":"2026-08-15T22:08:19.121467Z","submitted_at":"2025-05-18T08:01:12Z","title":"Unified Architecture and Unsupervised Speech Disentanglement for Speaker Embedding-Free Enrollment in Personalized Speech Enhancement","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:26.920169Z"},"links":{"citing_paper":"/paper/2505.12288"},"observation_digest":"sha256:2538c273332ce2d38af2730aaeb8f15d98f4b23452b206c0ce8a6da96e4bfe0d","observation_id":"a9e113f9-266c-4b51-833b-21f1dcdcf520","resolution":{"observed_at":"2026-08-15T20:43:29.437800Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:43:29.415513Z","title":"Deep residual learning for image recognition,","venue":null,"work_id":"03259035-8405-4ba2-b66d-4e3fa52bb75c","year":2016},"citing_paper":{"arxiv_id":"2505.12288","last_updated":"2026-07-12T11:39:40Z","snapshot_observed_at":"2026-08-15T22:08:19.121467Z","submitted_at":"2025-05-18T08:01:12Z","title":"Unified Architecture and Unsupervised Speech Disentanglement for Speaker Embedding-Free Enrollment in Personalized Speech Enhancement","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:26.925543Z"},"links":{"citing_paper":"/paper/2505.12288"},"observation_digest":"sha256:39b4737567280d262974989f5754f330900e6c85016d404a5699dbf5a76ee562","observation_id":"f44d7fce-8080-43c4-8f53-9dac83ead6fa","resolution":{"observed_at":"2026-08-15T20:43:29.421470Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:43:29.294819Z","title":"Improving speaker dis- crimination of target speech extraction with time-domain speakerbeam,","venue":null,"work_id":"d1150fea-1318-4fc3-8652-9ccd57646434","year":2020},"citing_paper":{"arxiv_id":"2505.12288","last_updated":"2026-07-12T11:39:40Z","snapshot_observed_at":"2026-08-15T22:08:19.121467Z","submitted_at":"2025-05-18T08:01:12Z","title":"Unified Architecture and Unsupervised Speech Disentanglement for Speaker Embedding-Free Enrollment in Personalized Speech Enhancement","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:26.929976Z"},"links":{"citing_paper":"/paper/2505.12288"},"observation_digest":"sha256:4c87827410c3b2460571aace85de06f81b77fbb36136b14bb6b72ce097b8e225","observation_id":"c3bbb6d7-968f-4c03-b5b1-1f0ce177f231","resolution":{"observed_at":"2026-08-15T20:43:29.377760Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:43:29.234358Z","title":"SpEx: Multi-scale time domain speaker extraction network,","venue":null,"work_id":"f68b8628-9fc2-446e-b992-e611cddfce74","year":2020},"citing_paper":{"arxiv_id":"2505.12288","last_updated":"2026-07-12T11:39:40Z","snapshot_observed_at":"2026-08-15T22:08:19.121467Z","submitted_at":"2025-05-18T08:01:12Z","title":"Unified Architecture and Unsupervised Speech Disentanglement for Speaker Embedding-Free Enrollment in Personalized Speech Enhancement","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:26.933697Z"},"links":{"citing_paper":"/paper/2505.12288"},"observation_digest":"sha256:ce58d1bb32526b4507840615195de2cea52b2b4dc71411b8feeb324a1005e66b","observation_id":"9598fde2-242e-4c21-bc93-650e64f1e903","resolution":{"observed_at":"2026-08-15T20:43:29.240277Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:43:29.219591Z","title":"SpEx+: A complete time domain speaker extraction network,","venue":null,"work_id":"e1efd113-9ec1-4e7a-bf19-f61547aec1f4","year":2020},"citing_paper":{"arxiv_id":"2505.12288","last_updated":"2026-07-12T11:39:40Z","snapshot_observed_at":"2026-08-15T22:08:19.121467Z","submitted_at":"2025-05-18T08:01:12Z","title":"Unified Architecture and Unsupervised Speech Disentanglement for Speaker Embedding-Free Enrollment in Personalized Speech Enhancement","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:26.938581Z"},"links":{"citing_paper":"/paper/2505.12288"},"observation_digest":"sha256:7d476ce2aa284b1cbf4f6fd4d6fe5948b6dcee8f60bbfd3fa8c34273855f06b4","observation_id":"c5f35dc2-73ca-4432-bf71-7ec76a2ab480","resolution":{"observed_at":"2026-08-15T20:43:29.223821Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:43:29.030509Z","title":"MC-SpEx: Towards effective speaker extraction with multi- scale interfusion and conditional speaker modulation,","venue":null,"work_id":"d25c7e12-1670-465e-bae1-5aebfdc82165","year":2023},"citing_paper":{"arxiv_id":"2505.12288","last_updated":"2026-07-12T11:39:40Z","snapshot_observed_at":"2026-08-15T22:08:19.121467Z","submitted_at":"2025-05-18T08:01:12Z","title":"Unified Architecture and Unsupervised Speech Disentanglement for Speaker Embedding-Free Enrollment in Personalized Speech Enhancement","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:26.943157Z"},"links":{"citing_paper":"/paper/2505.12288"},"observation_digest":"sha256:c44ff8c609cf9e6dd655be4365cdd9fc3873ec2bdc3c39d00eb75644336b4a0f","observation_id":"03d06d95-7265-4c8f-9aef-f062c9880fda","resolution":{"observed_at":"2026-08-15T20:43:29.134465Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:43:28.995502Z","title":"Contrastive self-supervised speaker embedding with sequential disentanglement,","venue":null,"work_id":"a23cb9f3-6e1b-4b17-9cc7-2352cfa18b5d","year":2024},"citing_paper":{"arxiv_id":"2505.12288","last_updated":"2026-07-12T11:39:40Z","snapshot_observed_at":"2026-08-15T22:08:19.121467Z","submitted_at":"2025-05-18T08:01:12Z","title":"Unified Architecture and Unsupervised Speech Disentanglement for Speaker Embedding-Free Enrollment in Personalized Speech Enhancement","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:26.948282Z"},"links":{"citing_paper":"/paper/2505.12288"},"observation_digest":"sha256:3dfdf6443019b5ad0bc610a7d2486438c08e704298199dc60376289884842f10","observation_id":"fce929e7-a9ff-4a19-97cf-3e6708a3d987","resolution":{"observed_at":"2026-08-15T20:43:29.001281Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:43:28.871549Z","title":"Noise- disentanglement metric learning for robust speaker verification,","venue":null,"work_id":"8a7e4976-adc0-4497-83b9-bb6658791b12","year":2023},"citing_paper":{"arxiv_id":"2505.12288","last_updated":"2026-07-12T11:39:40Z","snapshot_observed_at":"2026-08-15T22:08:19.121467Z","submitted_at":"2025-05-18T08:01:12Z","title":"Unified Architecture and Unsupervised Speech Disentanglement for Speaker Embedding-Free Enrollment in Personalized Speech Enhancement","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:26.952489Z"},"links":{"citing_paper":"/paper/2505.12288"},"observation_digest":"sha256:f8f72661430bd70f9fec77b4d1782811319c3ee32d8d90363d4c4083db07873f","observation_id":"1f949b2c-b123-45e5-84e2-4cc274956200","resolution":{"observed_at":"2026-08-15T20:43:28.985179Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:43:28.813974Z","title":"Disentangled speaker embedding for robust speaker verification,","venue":null,"work_id":"a7358321-4bf0-421a-a3b7-d25542ec0503","year":2022},"citing_paper":{"arxiv_id":"2505.12288","last_updated":"2026-07-12T11:39:40Z","snapshot_observed_at":"2026-08-15T22:08:19.121467Z","submitted_at":"2025-05-18T08:01:12Z","title":"Unified Architecture and Unsupervised Speech Disentanglement for Speaker Embedding-Free Enrollment in Personalized Speech Enhancement","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:26.975212Z"},"links":{"citing_paper":"/paper/2505.12288"},"observation_digest":"sha256:20a65aaab966dbf6cb7ebdbfe7ad2de191565e585f47a32313d4e1708402f825","observation_id":"723af5d9-18a4-49e2-b102-9d39dcdb4cee","resolution":{"observed_at":"2026-08-15T20:43:28.818766Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:43:28.798954Z","title":"Disentangling voice and content with self-supervision for speaker recognition,","venue":null,"work_id":"9a657fdd-69da-4279-85e2-094998adbeb3","year":2023},"citing_paper":{"arxiv_id":"2505.12288","last_updated":"2026-07-12T11:39:40Z","snapshot_observed_at":"2026-08-15T22:08:19.121467Z","submitted_at":"2025-05-18T08:01:12Z","title":"Unified Architecture and Unsupervised Speech Disentanglement for Speaker Embedding-Free Enrollment in Personalized Speech Enhancement","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:27.061880Z"},"links":{"citing_paper":"/paper/2505.12288"},"observation_digest":"sha256:05f9d861eab90898b8e22dccef4d85b4502b8156cc35fc4790d4098a09ae7dac","observation_id":"0e5ef2f1-7724-47ec-bcad-5781bfb48aba","resolution":{"observed_at":"2026-08-15T20:43:28.803819Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:43:28.758693Z","title":"Time-domain target-speaker speech separation with waveform-based speaker embedding,","venue":null,"work_id":"dc9e5003-b0db-46f3-b883-36eb1537b9e5","year":2020},"citing_paper":{"arxiv_id":"2505.12288","last_updated":"2026-07-12T11:39:40Z","snapshot_observed_at":"2026-08-15T22:08:19.121467Z","submitted_at":"2025-05-18T08:01:12Z","title":"Unified Architecture and Unsupervised Speech Disentanglement for Speaker Embedding-Free Enrollment in Personalized Speech Enhancement","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:27.112791Z"},"links":{"citing_paper":"/paper/2505.12288"},"observation_digest":"sha256:17a7e90b6116d6e18a7c5f3b9fe362a84b6cd400784154723096c7b1f58e1f38","observation_id":"15e40320-674d-4ac9-b689-2a1a5e74d4c6","resolution":{"observed_at":"2026-08-15T20:43:28.789913Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.03065","last_updated":"2022-09-16T10:27:27Z","snapshot_observed_at":"2026-08-16T16:54:50.395014Z","submitted_at":"2022-06-07T07:32:32Z","title":"Universal Speech Enhancement with Score-based Diffusion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.03065","snapshot_observed_at":"2026-08-15T20:43:27.126788Z","title":"Univer- sal speech enhancement with score-based diffusion,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.12288","last_updated":"2026-07-12T11:39:40Z","snapshot_observed_at":"2026-08-15T22:08:19.121467Z","submitted_at":"2025-05-18T08:01:12Z","title":"Unified Architecture and Unsupervised Speech Disentanglement for Speaker Embedding-Free Enrollment in Personalized Speech Enhancement","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:27.126788Z"},"links":{"cited_paper":"/paper/2206.03065","citing_paper":"/paper/2505.12288"},"observation_digest":"sha256:add471ff8ce17fced3b8e2da48bd4d6467fed6c56ba5b246afe27b0268705cff","observation_id":"1887585c-5bad-47a9-aa64-dd0acef41036","resolution":{"observed_at":"2026-08-15T20:43:27.126788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:43:28.634338Z","title":"Conditional diffusion probabilistic model for speech enhancement,","venue":null,"work_id":"1e1ffd66-3949-4c0a-b535-4a11387f89f1","year":2022},"citing_paper":{"arxiv_id":"2505.12288","last_updated":"2026-07-12T11:39:40Z","snapshot_observed_at":"2026-08-15T22:08:19.121467Z","submitted_at":"2025-05-18T08:01:12Z","title":"Unified Architecture and Unsupervised Speech Disentanglement for Speaker Embedding-Free Enrollment in Personalized Speech Enhancement","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:27.134066Z"},"links":{"citing_paper":"/paper/2505.12288"},"observation_digest":"sha256:88922c61d7c72de780c2cf765dc3cd4bb132529fc5b774f2aebb2adc8705e3f5","observation_id":"ea97cac7-ea84-4318-ade7-285a9ac73fae","resolution":{"observed_at":"2026-08-15T20:43:28.670606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:43:28.619777Z","title":"V oiceFixer: A unified framework for high-fidelity speech restoration,","venue":null,"work_id":"0cec9f79-0f62-41c6-9347-51fd1ae170ed","year":2022},"citing_paper":{"arxiv_id":"2505.12288","last_updated":"2026-07-12T11:39:40Z","snapshot_observed_at":"2026-08-15T22:08:19.121467Z","submitted_at":"2025-05-18T08:01:12Z","title":"Unified Architecture and Unsupervised Speech Disentanglement for Speaker Embedding-Free Enrollment in Personalized Speech Enhancement","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:27.139136Z"},"links":{"citing_paper":"/paper/2505.12288"},"observation_digest":"sha256:299b48b60bb82cf0ad35aa8febb9c5559cb59a347332d1a9641ae8cc04f3d8f5","observation_id":"a1f7b319-537d-4ce4-bef8-3832ddef194e","resolution":{"observed_at":"2026-08-15T20:43:28.624829Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:43:28.604633Z","title":"Toward uni- versal speech enhancement for diverse input conditions,","venue":null,"work_id":"dfb0d769-c30c-403e-907e-64c7a243484f","year":2023},"citing_paper":{"arxiv_id":"2505.12288","last_updated":"2026-07-12T11:39:40Z","snapshot_observed_at":"2026-08-15T22:08:19.121467Z","submitted_at":"2025-05-18T08:01:12Z","title":"Unified Architecture and Unsupervised Speech Disentanglement for Speaker Embedding-Free Enrollment in Personalized Speech Enhancement","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:27.143713Z"},"links":{"citing_paper":"/paper/2505.12288"},"observation_digest":"sha256:eaea9281a8a7ab538c28725e0cb3bce9617f6d17d44915816793e70e126457d4","observation_id":"579b063b-90cc-45a7-88ae-f285abf51124","resolution":{"observed_at":"2026-08-15T20:43:28.609788Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:43:28.589428Z","title":"Improving design of input condition invariant speech enhancement,","venue":null,"work_id":"130697a4-17d9-40f4-804c-c4dbee1c93c9","year":2024},"citing_paper":{"arxiv_id":"2505.12288","last_updated":"2026-07-12T11:39:40Z","snapshot_observed_at":"2026-08-15T22:08:19.121467Z","submitted_at":"2025-05-18T08:01:12Z","title":"Unified Architecture and Unsupervised Speech Disentanglement for Speaker Embedding-Free Enrollment in Personalized Speech Enhancement","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:27.148213Z"},"links":{"citing_paper":"/paper/2505.12288"},"observation_digest":"sha256:3ccc2ab2d827cd97142e92790483a4b3d9ada5c0bef8972c9048830bdc52d57f","observation_id":"0dfe0907-938c-40b0-abe0-586fed7c85fd","resolution":{"observed_at":"2026-08-15T20:43:28.594211Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:43:28.381295Z","title":"Multi-stage speaker extraction with utterance and frame-level reference signals,","venue":null,"work_id":"61a31eaa-3cde-4c35-9ada-35dd5da4369c","year":2021},"citing_paper":{"arxiv_id":"2505.12288","last_updated":"2026-07-12T11:39:40Z","snapshot_observed_at":"2026-08-15T22:08:19.121467Z","submitted_at":"2025-05-18T08:01:12Z","title":"Unified Architecture and Unsupervised Speech Disentanglement for Speaker Embedding-Free Enrollment in Personalized Speech Enhancement","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:27.153080Z"},"links":{"citing_paper":"/paper/2505.12288"},"observation_digest":"sha256:194b70ed71305d24f0bec0b3dd0beb15100dcc569473fde2ef85503d35c4a2bb","observation_id":"617c6ae1-d378-4593-96cf-e630d12f1d3a","resolution":{"observed_at":"2026-08-15T20:43:28.519033Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06311","last_updated":"2021-03-24T21:07:51Z","snapshot_observed_at":"2026-08-11T05:36:08.774339Z","submitted_at":"2019-12-13T03:38:14Z","title":"Short-duration Speaker Verification (SdSV) Challenge 2021: the Challenge Evaluation Plan","version":3},"cited_work":{"arxiv_id":"1912.06311","doi":null,"metadata_source":"pith","pith_arxiv_id":"1912.06311","snapshot_observed_at":"2026-08-15T20:43:27.443213Z","title":"Short-duration Speaker Verification (SdSV) Challenge 2021: the Challenge Evaluation Plan","venue":"eess.AS","work_id":"878dd8f4-3e9b-4bb1-823a-a62a4f0e18c2","year":2019},"citing_paper":{"arxiv_id":"2505.12288","last_updated":"2026-07-12T11:39:40Z","snapshot_observed_at":"2026-08-15T22:08:19.121467Z","submitted_at":"2025-05-18T08:01:12Z","title":"Unified Architecture and Unsupervised Speech Disentanglement for Speaker Embedding-Free Enrollment in Personalized Speech Enhancement","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:27.157484Z"},"links":{"cited_paper":"/paper/1912.06311","citing_paper":"/paper/2505.12288"},"observation_digest":"sha256:664599f207075ce96cf4cdf6c09830f68ee72853a4c82faf7950740d80b1d41d","observation_id":"1c1e8085-06a8-4820-b72b-6dfb0e1ffc3a","resolution":{"observed_at":"2026-08-15T20:43:27.499365Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:43:28.367541Z","title":"Discriminative neural embed- ding learning for short-duration text-independent speaker verification,","venue":null,"work_id":"63a2f991-c84b-4b1d-8cd1-29f77015f7f8","year":2019},"citing_paper":{"arxiv_id":"2505.12288","last_updated":"2026-07-12T11:39:40Z","snapshot_observed_at":"2026-08-15T22:08:19.121467Z","submitted_at":"2025-05-18T08:01:12Z","title":"Unified Architecture and Unsupervised Speech Disentanglement for Speaker Embedding-Free Enrollment in Personalized Speech Enhancement","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:27.234082Z"},"links":{"citing_paper":"/paper/2505.12288"},"observation_digest":"sha256:cffb475e7906bf2ee6396188d0e7ae14cd5d6b8f8dbf8e005e361a4aa5ce371e","observation_id":"31a6eadf-1a8a-475d-acde-7bd2a8c27356","resolution":{"observed_at":"2026-08-15T20:43:28.372304Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:43:28.351724Z","title":"ERes2NetV2: Boosting short-duration speaker verification performance with computational efficiency,","venue":null,"work_id":"6be122a1-5556-46fe-9dbc-1ecea2b5c6b2","year":2024},"citing_paper":{"arxiv_id":"2505.12288","last_updated":"2026-07-12T11:39:40Z","snapshot_observed_at":"2026-08-15T22:08:19.121467Z","submitted_at":"2025-05-18T08:01:12Z","title":"Unified Architecture and Unsupervised Speech Disentanglement for Speaker Embedding-Free Enrollment in Personalized Speech Enhancement","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:27.310802Z"},"links":{"citing_paper":"/paper/2505.12288"},"observation_digest":"sha256:6cb842064159ddfa2ce5edd2faa8d3c08e82ff3e404aa9299917053b2333d1ea","observation_id":"981c31f7-95df-4a96-9f0c-d513979200f4","resolution":{"observed_at":"2026-08-15T20:43:28.356979Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:43:28.338085Z","title":"Augmenting short enrollment speech via synthesis for target speaker ex- traction,","venue":null,"work_id":"35aae892-0058-4ab7-a14d-91e7c692678b","year":2025},"citing_paper":{"arxiv_id":"2505.12288","last_updated":"2026-07-12T11:39:40Z","snapshot_observed_at":"2026-08-15T22:08:19.121467Z","submitted_at":"2025-05-18T08:01:12Z","title":"Unified Architecture and Unsupervised Speech Disentanglement for Speaker Embedding-Free Enrollment in Personalized Speech Enhancement","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:27.322594Z"},"links":{"citing_paper":"/paper/2505.12288"},"observation_digest":"sha256:995df6af4a73d043a98ab25ae67ed1c9e1f01504c4ed3bbe4261eca51bf8a0bf","observation_id":"d3c7b274-6911-4316-a786-d6cf905f04b9","resolution":{"observed_at":"2026-08-15T20:43:28.342528Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:43:28.303327Z","title":"Target speaker extraction with ultra-short reference speech by ve-ve framework,","venue":null,"work_id":"d2e6feb2-3430-44da-8f39-b9c387ead0f9","year":2023},"citing_paper":{"arxiv_id":"2505.12288","last_updated":"2026-07-12T11:39:40Z","snapshot_observed_at":"2026-08-15T22:08:19.121467Z","submitted_at":"2025-05-18T08:01:12Z","title":"Unified Architecture and Unsupervised Speech Disentanglement for Speaker Embedding-Free Enrollment in Personalized Speech Enhancement","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:27.340189Z"},"links":{"citing_paper":"/paper/2505.12288"},"observation_digest":"sha256:73f0be31bcea07b0deaa25839524824cae797c54dcb0d07d0ac07545062e8b7c","observation_id":"7e0b163c-2cb0-4126-aea6-75e56087c694","resolution":{"observed_at":"2026-08-15T20:43:28.317899Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:43:28.192897Z","title":"Sdr–half-baked or well done?","venue":null,"work_id":"21c37a71-f8db-4d2a-9458-295a06660fc3","year":2019},"citing_paper":{"arxiv_id":"2505.12288","last_updated":"2026-07-12T11:39:40Z","snapshot_observed_at":"2026-08-15T22:08:19.121467Z","submitted_at":"2025-05-18T08:01:12Z","title":"Unified Architecture and Unsupervised Speech Disentanglement for Speaker Embedding-Free Enrollment in Personalized Speech Enhancement","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:27.354172Z"},"links":{"citing_paper":"/paper/2505.12288"},"observation_digest":"sha256:34fc3beb29f5b0b2b15d7cd895c31896765145b719242bef95b118e6cc4ef695","observation_id":"3a783352-970d-4bd9-8a78-b461c9acd15b","resolution":{"observed_at":"2026-08-15T20:43:28.263686Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.11262","last_updated":"2020-05-22T16:26:54Z","snapshot_observed_at":"2026-08-15T22:07:29.787968Z","submitted_at":"2020-05-22T16:26:54Z","title":"LibriMix: An Open-Source Dataset for Generalizable Speech Separation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.11262","snapshot_observed_at":"2026-08-15T20:43:27.359520Z","title":"LibriMix: An open-source dataset for generalizable speech separation,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2505.12288","last_updated":"2026-07-12T11:39:40Z","snapshot_observed_at":"2026-08-15T22:08:19.121467Z","submitted_at":"2025-05-18T08:01:12Z","title":"Unified Architecture and Unsupervised Speech Disentanglement for Speaker Embedding-Free Enrollment in Personalized Speech Enhancement","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:27.359520Z"},"links":{"cited_paper":"/paper/2005.11262","citing_paper":"/paper/2505.12288"},"observation_digest":"sha256:77c802d0a1c9b3f6505d8305cff5608972b9eee43b286427995eeb1ad257d04b","observation_id":"6771830a-7bab-4547-bc47-dae05fc4360c","resolution":{"observed_at":"2026-08-15T20:43:27.359520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:43:28.150030Z","title":"Investi- gating rnn-based speech enhancement methods for noise-robust text-to- speech,","venue":null,"work_id":"80b69862-abca-434d-b177-dd6b3b6a1763","year":2016},"citing_paper":{"arxiv_id":"2505.12288","last_updated":"2026-07-12T11:39:40Z","snapshot_observed_at":"2026-08-15T22:08:19.121467Z","submitted_at":"2025-05-18T08:01:12Z","title":"Unified Architecture and Unsupervised Speech Disentanglement for Speaker Embedding-Free Enrollment in Personalized Speech Enhancement","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:27.364775Z"},"links":{"citing_paper":"/paper/2505.12288"},"observation_digest":"sha256:282d5067dd5307bb231a0cc2db7d64bd649270e871cc67305c04266e8328b03c","observation_id":"686563ab-2c2f-482e-befd-1d16781b28b1","resolution":{"observed_at":"2026-08-15T20:43:28.155754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:43:28.132959Z","title":"On the importance of power compression and phase estimation in monaural speech dereverberation,","venue":null,"work_id":"8174f4e5-7b13-42b7-bd78-9b8c01d531ca","year":2021},"citing_paper":{"arxiv_id":"2505.12288","last_updated":"2026-07-12T11:39:40Z","snapshot_observed_at":"2026-08-15T22:08:19.121467Z","submitted_at":"2025-05-18T08:01:12Z","title":"Unified Architecture and Unsupervised Speech Disentanglement for Speaker Embedding-Free Enrollment in Personalized Speech Enhancement","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:27.369494Z"},"links":{"citing_paper":"/paper/2505.12288"},"observation_digest":"sha256:342d5b1dc827896e6f3eedde0f1df9d5f18860b062288fb605bdcbba8e4b0baf","observation_id":"8c9a7d18-db6e-4a69-9ba2-013a51381679","resolution":{"observed_at":"2026-08-15T20:43:28.138571Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:43:27.961727Z","title":"Adam: A method for stochastic optimization,","venue":null,"work_id":"3b91c2f6-3c42-40c5-9ffa-81e7f200b3db","year":2015},"citing_paper":{"arxiv_id":"2505.12288","last_updated":"2026-07-12T11:39:40Z","snapshot_observed_at":"2026-08-15T22:08:19.121467Z","submitted_at":"2025-05-18T08:01:12Z","title":"Unified Architecture and Unsupervised Speech Disentanglement for Speaker Embedding-Free Enrollment in Personalized Speech Enhancement","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:27.373885Z"},"links":{"citing_paper":"/paper/2505.12288"},"observation_digest":"sha256:a59a94204a89a85addcf2fade502f0e48448a0dde1ea1c2797031ff0461aa397","observation_id":"7b4d8cba-98ab-4b46-9a89-42c30e378ef5","resolution":{"observed_at":"2026-08-15T20:43:28.074763Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:43:27.946793Z","title":"Why gradient clipping accelerates training: A theoretical justification for adaptivity,","venue":null,"work_id":"8f323dae-d091-4f44-bfe7-c3bc393febe7","year":2020},"citing_paper":{"arxiv_id":"2505.12288","last_updated":"2026-07-12T11:39:40Z","snapshot_observed_at":"2026-08-15T22:08:19.121467Z","submitted_at":"2025-05-18T08:01:12Z","title":"Unified Architecture and Unsupervised Speech Disentanglement for Speaker Embedding-Free Enrollment in Personalized Speech Enhancement","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:27.379561Z"},"links":{"citing_paper":"/paper/2505.12288"},"observation_digest":"sha256:e1022d2451999f55bc234c1963f5dac9ef61c038d0c16b407be52711f7ff2c51","observation_id":"021d1725-4bd0-46e8-b739-fcc431225301","resolution":{"observed_at":"2026-08-15T20:43:27.952517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:43:27.928126Z","title":"Pesq (perceptual evaluation of speech quality) wrapper for python users,","venue":null,"work_id":"347ee1ed-0672-46c3-be4f-fbb445f188ba","year":2022},"citing_paper":{"arxiv_id":"2505.12288","last_updated":"2026-07-12T11:39:40Z","snapshot_observed_at":"2026-08-15T22:08:19.121467Z","submitted_at":"2025-05-18T08:01:12Z","title":"Unified Architecture and Unsupervised Speech Disentanglement for Speaker Embedding-Free Enrollment in Personalized Speech Enhancement","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:27.384198Z"},"links":{"citing_paper":"/paper/2505.12288"},"observation_digest":"sha256:245657919654b300a6e0d9ffd2d71bbc96d43b5c59fbf96081d832e3e739c90b","observation_id":"cd9e27b8-ad75-4f37-949e-5f108dd77453","resolution":{"observed_at":"2026-08-15T20:43:27.935027Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:43:27.777898Z","title":"A short- time objective intelligibility measure for time-frequency weighted noisy speech,","venue":null,"work_id":"f770185f-351c-4870-929e-931715207b58","year":2010},"citing_paper":{"arxiv_id":"2505.12288","last_updated":"2026-07-12T11:39:40Z","snapshot_observed_at":"2026-08-15T22:08:19.121467Z","submitted_at":"2025-05-18T08:01:12Z","title":"Unified Architecture and Unsupervised Speech Disentanglement for Speaker Embedding-Free Enrollment in Personalized Speech Enhancement","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:27.389104Z"},"links":{"citing_paper":"/paper/2505.12288"},"observation_digest":"sha256:d96225766410bc4ffbf021cd72a982bb2bda239c04f24d1e1abe42cb94e036b7","observation_id":"8048fb43-aacc-4ba0-af17-eb6dbdacd029","resolution":{"observed_at":"2026-08-15T20:43:27.841070Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.12288","last_updated":"2026-07-12T11:39:40Z","latest_version":2,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-15T22:08:19.121467Z","submitted_at":"2025-05-18T08:01:12Z","title":"Unified Architecture and Unsupervised Speech Disentanglement for Speaker Embedding-Free Enrollment in Personalized Speech Enhancement"},"reference_resolution":{"displayed":56,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":4,"verified_exact":1,"verified_fuzzy":51},"total_outbound_references":56},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 56 of 56 outbound references and 0 inbound Pith citation observations for arXiv:2505.12288."}