{"as_of":"2026-08-06T03:29:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f3fbebd0d818f97990f69455e6be6f5d946d71812dd391c884a16a112a75824f","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T23:55:33.743598Z","state":"measured"},{"denominator":39,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":39,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.15198/citation-record","integrity":"/paper/2607.15198/integrity","json":"/paper/2607.15198/citation-record.json","paper":"/paper/2607.15198"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:55:29.502928Z","title":"V oiceFilter: Targeted voice separation by speaker-conditioned spectrogram masking,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.15198","last_updated":"2026-07-16T16:57:05Z","snapshot_observed_at":"2026-08-05T18:12:12.518096Z","submitted_at":"2026-07-16T16:57:05Z","title":"SLT 2026 REAL-TSE Challenge: Real-world Target Speaker Extraction from Conversational Recordings","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T23:55:29.502928Z"},"links":{"citing_paper":"/paper/2607.15198"},"observation_digest":"sha256:1c130e333a562a7191c7f3b5a1bf93cce487eddaaac5461a1225c5fc3d049252","observation_id":"e7d322e0-9319-497d-81ee-a9962f84c3b6","resolution":{"observed_at":"2026-08-01T23:55:29.502928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:55:29.612146Z","title":"SpEx: Multi-scale time domain speaker extraction network,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.15198","last_updated":"2026-07-16T16:57:05Z","snapshot_observed_at":"2026-08-05T18:12:12.518096Z","submitted_at":"2026-07-16T16:57:05Z","title":"SLT 2026 REAL-TSE Challenge: Real-world Target Speaker Extraction from Conversational Recordings","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T23:55:29.612146Z"},"links":{"citing_paper":"/paper/2607.15198"},"observation_digest":"sha256:d7aab947faf40e308809dae751ffa1257f86cf331ba0122afd67658a85cc2316","observation_id":"6c3cebdd-84e3-4c6b-9d4b-a57ff60b207e","resolution":{"observed_at":"2026-08-01T23:55:29.612146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:55:29.779647Z","title":"Neural target speech extraction: An overview,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.15198","last_updated":"2026-07-16T16:57:05Z","snapshot_observed_at":"2026-08-05T18:12:12.518096Z","submitted_at":"2026-07-16T16:57:05Z","title":"SLT 2026 REAL-TSE Challenge: Real-world Target Speaker Extraction from Conversational Recordings","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T23:55:29.779647Z"},"links":{"citing_paper":"/paper/2607.15198"},"observation_digest":"sha256:121c724ffeb49745cf272cfadb8741d0e99f9d5fb3f469b5b1f0849740f3d9dc","observation_id":"85fc6d9a-561e-4aa5-a523-d304745df503","resolution":{"observed_at":"2026-08-01T23:55:29.779647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.11262","last_updated":"2020-05-22T16:26:54Z","snapshot_observed_at":"2026-08-04T10:15:33.124350Z","submitted_at":"2020-05-22T16:26:54Z","title":"LibriMix: An Open-Source Dataset for Generalizable Speech Separation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.11262","snapshot_observed_at":"2026-08-01T23:55:29.954391Z","title":"LibriMix: An open-source dataset for generalizable speech separation,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2607.15198","last_updated":"2026-07-16T16:57:05Z","snapshot_observed_at":"2026-08-05T18:12:12.518096Z","submitted_at":"2026-07-16T16:57:05Z","title":"SLT 2026 REAL-TSE Challenge: Real-world Target Speaker Extraction from Conversational Recordings","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T23:55:29.954391Z"},"links":{"cited_paper":"/paper/2005.11262","citing_paper":"/paper/2607.15198"},"observation_digest":"sha256:babe7c99fe6c2315eb5be22432880c7db3507737c68361e0322ef7e76a13def9","observation_id":"069e1799-3731-4254-ac16-51700c65bbc3","resolution":{"observed_at":"2026-08-01T23:55:29.954391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:55:30.129251Z","title":"Deep clustering: Discriminative embeddings for segmentation and separation,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.15198","last_updated":"2026-07-16T16:57:05Z","snapshot_observed_at":"2026-08-05T18:12:12.518096Z","submitted_at":"2026-07-16T16:57:05Z","title":"SLT 2026 REAL-TSE Challenge: Real-world Target Speaker Extraction from Conversational Recordings","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T23:55:30.129251Z"},"links":{"citing_paper":"/paper/2607.15198"},"observation_digest":"sha256:c6107d5de61162371d56929e6b679da3eb16681079869d9bca0dd165356932fc","observation_id":"d4dbae8e-c24d-479f-8f21-e6a2e6dc16fe","resolution":{"observed_at":"2026-08-01T23:55:30.129251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:55:30.341452Z","title":"The Fifth ’CHiME’ Speech Separation and Recognition Challenge: Dataset, Task and Baselines,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.15198","last_updated":"2026-07-16T16:57:05Z","snapshot_observed_at":"2026-08-05T18:12:12.518096Z","submitted_at":"2026-07-16T16:57:05Z","title":"SLT 2026 REAL-TSE Challenge: Real-world Target Speaker Extraction from Conversational Recordings","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T23:55:30.341452Z"},"links":{"citing_paper":"/paper/2607.15198"},"observation_digest":"sha256:f3032d6c9f8ad9f44c5a3380fd3156f0ffc23308c045a115b5c4ee8333a7c336","observation_id":"e780a627-4a1c-4fc0-935a-9c112ac0dc33","resolution":{"observed_at":"2026-08-01T23:55:30.341452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:55:30.475244Z","title":"CHiME-6 Challenge: Tackling Multispeaker Speech Recognition for Unsegmented Recordings,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.15198","last_updated":"2026-07-16T16:57:05Z","snapshot_observed_at":"2026-08-05T18:12:12.518096Z","submitted_at":"2026-07-16T16:57:05Z","title":"SLT 2026 REAL-TSE Challenge: Real-world Target Speaker Extraction from Conversational Recordings","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T23:55:30.475244Z"},"links":{"citing_paper":"/paper/2607.15198"},"observation_digest":"sha256:b564cd55c084da3224a2989ebc2954fcbb195c57e43ee03b625c0f284d1ebd30","observation_id":"1bb94c4c-e378-4eaf-9c7a-37dbb1e1ac89","resolution":{"observed_at":"2026-08-01T23:55:30.475244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:55:30.604031Z","title":"Descriptor: Enhancing conversations for the hearing impaired in the 9th computational hearing in multisource environments challenge (CHiME9 ECHI),","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15198","last_updated":"2026-07-16T16:57:05Z","snapshot_observed_at":"2026-08-05T18:12:12.518096Z","submitted_at":"2026-07-16T16:57:05Z","title":"SLT 2026 REAL-TSE Challenge: Real-world Target Speaker Extraction from Conversational Recordings","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T23:55:30.604031Z"},"links":{"citing_paper":"/paper/2607.15198"},"observation_digest":"sha256:e3988a2db6a7a7d71a0ef644d757603d7c9892c38206dc5abaab0a37d8ec6d37","observation_id":"59576c93-bbd0-4d1e-9dad-72bec9de4d80","resolution":{"observed_at":"2026-08-01T23:55:30.604031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:55:30.724559Z","title":"M2MeT: The ICASSP 2022 multi- channel multi-party meeting transcription challenge,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.15198","last_updated":"2026-07-16T16:57:05Z","snapshot_observed_at":"2026-08-05T18:12:12.518096Z","submitted_at":"2026-07-16T16:57:05Z","title":"SLT 2026 REAL-TSE Challenge: Real-world Target Speaker Extraction from Conversational Recordings","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T23:55:30.724559Z"},"links":{"citing_paper":"/paper/2607.15198"},"observation_digest":"sha256:a5f766a2d023759de88015b3bbecf22870b2018a4692f0ecfd2f69d12e3ce862","observation_id":"1653f923-83f4-4bfb-9b6e-048b3eed7de3","resolution":{"observed_at":"2026-08-01T23:55:30.724559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:55:30.845696Z","title":"AISHELL-4: An open source dataset for speech enhancement, separation, recognition and speaker diarization in conference scenario,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.15198","last_updated":"2026-07-16T16:57:05Z","snapshot_observed_at":"2026-08-05T18:12:12.518096Z","submitted_at":"2026-07-16T16:57:05Z","title":"SLT 2026 REAL-TSE Challenge: Real-world Target Speaker Extraction from Conversational Recordings","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T23:55:30.845696Z"},"links":{"citing_paper":"/paper/2607.15198"},"observation_digest":"sha256:8cc9001861ce0e16622c34377d89cbb356b8bfd06f67ffb3e83c77b6accf5a63","observation_id":"aad57061-785f-4178-8b66-a4eb540f76ca","resolution":{"observed_at":"2026-08-01T23:55:30.845696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:55:31.011467Z","title":"REAL-T: Real Conversational Mixtures for Target Speaker Extraction,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15198","last_updated":"2026-07-16T16:57:05Z","snapshot_observed_at":"2026-08-05T18:12:12.518096Z","submitted_at":"2026-07-16T16:57:05Z","title":"SLT 2026 REAL-TSE Challenge: Real-world Target Speaker Extraction from Conversational Recordings","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T23:55:31.011467Z"},"links":{"citing_paper":"/paper/2607.15198"},"observation_digest":"sha256:e623bc837a379dc3d50f1eb0424a55c5ae2a046444fd4f548dbaa59be9e5740a","observation_id":"14798e87-7106-4347-8b4b-b058d496fc40","resolution":{"observed_at":"2026-08-01T23:55:31.011467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:55:31.128677Z","title":"WeSep: A Scalable and Flexible Toolkit Towards Generalizable Target Speaker Extraction,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15198","last_updated":"2026-07-16T16:57:05Z","snapshot_observed_at":"2026-08-05T18:12:12.518096Z","submitted_at":"2026-07-16T16:57:05Z","title":"SLT 2026 REAL-TSE Challenge: Real-world Target Speaker Extraction from Conversational Recordings","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T23:55:31.128677Z"},"links":{"citing_paper":"/paper/2607.15198"},"observation_digest":"sha256:23090399ac36a5c6196a26cc9e71238e133209b276684c6530990b6220b7e5a9","observation_id":"5838dfee-e73c-4258-8624-3ffd9d262e23","resolution":{"observed_at":"2026-08-01T23:55:31.128677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:55:31.226364Z","title":"Zipformer: A faster and better encoder for automatic speech recognition,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15198","last_updated":"2026-07-16T16:57:05Z","snapshot_observed_at":"2026-08-05T18:12:12.518096Z","submitted_at":"2026-07-16T16:57:05Z","title":"SLT 2026 REAL-TSE Challenge: Real-world Target Speaker Extraction from Conversational Recordings","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T23:55:31.226364Z"},"links":{"citing_paper":"/paper/2607.15198"},"observation_digest":"sha256:2ee8930b0cb22f9aecf39cd2b1dd2f1990481d98405ab2a16d05179785be57e4","observation_id":"26759e63-6c94-4f0f-bf33-bed2262ca686","resolution":{"observed_at":"2026-08-01T23:55:31.226364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:55:31.344791Z","title":"Wespeaker: A research and production oriented speaker embedding learning toolkit,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.15198","last_updated":"2026-07-16T16:57:05Z","snapshot_observed_at":"2026-08-05T18:12:12.518096Z","submitted_at":"2026-07-16T16:57:05Z","title":"SLT 2026 REAL-TSE Challenge: Real-world Target Speaker Extraction from Conversational Recordings","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T23:55:31.344791Z"},"links":{"citing_paper":"/paper/2607.15198"},"observation_digest":"sha256:2fcbb853d8a791064278978ac63e4b3f3e6956f9c258fbc263e54bdc62576253","observation_id":"90d1402b-a338-48c0-b415-2c28127159ea","resolution":{"observed_at":"2026-08-01T23:55:31.344791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:55:31.412772Z","title":"DNSMOS P.835: A non- intrusive perceptual objective speech quality metric to evaluate noise suppressors,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.15198","last_updated":"2026-07-16T16:57:05Z","snapshot_observed_at":"2026-08-05T18:12:12.518096Z","submitted_at":"2026-07-16T16:57:05Z","title":"SLT 2026 REAL-TSE Challenge: Real-world Target Speaker Extraction from Conversational Recordings","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T23:55:31.412772Z"},"links":{"citing_paper":"/paper/2607.15198"},"observation_digest":"sha256:da568d6218f1dd472c7b14ab78e0a15d538b1fb692be9c31e1ff8e182daf9535","observation_id":"148d4467-1d52-4b80-8500-4b4303b6155f","resolution":{"observed_at":"2026-08-01T23:55:31.412772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:55:31.473472Z","title":"DNSMOS: A non-intrusive perceptual objective speech quality metric to evaluate noise suppressors,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.15198","last_updated":"2026-07-16T16:57:05Z","snapshot_observed_at":"2026-08-05T18:12:12.518096Z","submitted_at":"2026-07-16T16:57:05Z","title":"SLT 2026 REAL-TSE Challenge: Real-world Target Speaker Extraction from Conversational Recordings","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T23:55:31.473472Z"},"links":{"citing_paper":"/paper/2607.15198"},"observation_digest":"sha256:d5a6bd2743fa7faceebe52436d5391b4a6a71653d63f42e08d5b8ecd002b41e1","observation_id":"07c6eb75-3d97-4018-865b-0455f7c057f2","resolution":{"observed_at":"2026-08-01T23:55:31.473472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:55:31.568792Z","title":"Fireredasr2s: A state-of-the-art industrial-grade all-in-one automatic speech recognition system,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15198","last_updated":"2026-07-16T16:57:05Z","snapshot_observed_at":"2026-08-05T18:12:12.518096Z","submitted_at":"2026-07-16T16:57:05Z","title":"SLT 2026 REAL-TSE Challenge: Real-world Target Speaker Extraction from Conversational Recordings","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T23:55:31.568792Z"},"links":{"citing_paper":"/paper/2607.15198"},"observation_digest":"sha256:85b520c6a338f5203ce1c7dddf161c6099684f0bed3d05f24ad418c64862d182","observation_id":"edf25c10-fafb-4aae-80b6-0d6b31659444","resolution":{"observed_at":"2026-08-01T23:55:31.568792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:55:31.629281Z","title":"Image method for efficiently simulating small-room acoustics,","venue":null,"work_id":null,"year":1979},"citing_paper":{"arxiv_id":"2607.15198","last_updated":"2026-07-16T16:57:05Z","snapshot_observed_at":"2026-08-05T18:12:12.518096Z","submitted_at":"2026-07-16T16:57:05Z","title":"SLT 2026 REAL-TSE Challenge: Real-world Target Speaker Extraction from Conversational Recordings","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T23:55:31.629281Z"},"links":{"citing_paper":"/paper/2607.15198"},"observation_digest":"sha256:9b209c7be6c6e9f0e1cbbc511df1817619eb4a157905704c08ed699bd6540824","observation_id":"190e11fb-b69e-4c25-be4e-a398e20bf34a","resolution":{"observed_at":"2026-08-01T23:55:31.629281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:55:31.721756Z","title":"The AMI meeting corpus: A pre-announcement,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2607.15198","last_updated":"2026-07-16T16:57:05Z","snapshot_observed_at":"2026-08-05T18:12:12.518096Z","submitted_at":"2026-07-16T16:57:05Z","title":"SLT 2026 REAL-TSE Challenge: Real-world Target Speaker Extraction from Conversational Recordings","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T23:55:31.721756Z"},"links":{"citing_paper":"/paper/2607.15198"},"observation_digest":"sha256:59fb3c8f8467b197aad2f7e2e2918840e0958c31db87dcdd7b7e77bafc586cd1","observation_id":"ec0b618d-79ec-40eb-99c0-33c7bd5904a4","resolution":{"observed_at":"2026-08-01T23:55:31.721756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:55:31.817101Z","title":"DiPCo – Dinner Party Corpus,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.15198","last_updated":"2026-07-16T16:57:05Z","snapshot_observed_at":"2026-08-05T18:12:12.518096Z","submitted_at":"2026-07-16T16:57:05Z","title":"SLT 2026 REAL-TSE Challenge: Real-world Target Speaker Extraction from Conversational Recordings","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T23:55:31.817101Z"},"links":{"citing_paper":"/paper/2607.15198"},"observation_digest":"sha256:ba75a02ef4d3ea53e15c00e030300fc91741f29aeae77a271dcb9f100bdc8188","observation_id":"a5a7209c-cb4b-41d5-ba19-becaf98a87ab","resolution":{"observed_at":"2026-08-01T23:55:31.817101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:55:31.913671Z","title":"Music source separation with band-split RNN,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.15198","last_updated":"2026-07-16T16:57:05Z","snapshot_observed_at":"2026-08-05T18:12:12.518096Z","submitted_at":"2026-07-16T16:57:05Z","title":"SLT 2026 REAL-TSE Challenge: Real-world Target Speaker Extraction from Conversational Recordings","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T23:55:31.913671Z"},"links":{"citing_paper":"/paper/2607.15198"},"observation_digest":"sha256:23bebdda29fce66b8a9745111a052230559946873f471661d377a9a20ae4f39b","observation_id":"6065f502-0b4a-4f35-801c-99b2eb9ef931","resolution":{"observed_at":"2026-08-01T23:55:31.913671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:55:32.004568Z","title":"Multi-level speaker representation for target speaker extraction,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15198","last_updated":"2026-07-16T16:57:05Z","snapshot_observed_at":"2026-08-05T18:12:12.518096Z","submitted_at":"2026-07-16T16:57:05Z","title":"SLT 2026 REAL-TSE Challenge: Real-world Target Speaker Extraction from Conversational Recordings","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T23:55:32.004568Z"},"links":{"citing_paper":"/paper/2607.15198"},"observation_digest":"sha256:5df780665bd7fc7c6c484ea56389016fd1b2a61067025587f8876260169c6800","observation_id":"17af6bba-510c-4b10-b23d-70938d9a3a12","resolution":{"observed_at":"2026-08-01T23:55:32.004568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:55:32.096524Z","title":"ECAPA-TDNN: Emphasized Channel Attention, Propagation and Aggregation in TDNN Based Speaker Verification,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.15198","last_updated":"2026-07-16T16:57:05Z","snapshot_observed_at":"2026-08-05T18:12:12.518096Z","submitted_at":"2026-07-16T16:57:05Z","title":"SLT 2026 REAL-TSE Challenge: Real-world Target Speaker Extraction from Conversational Recordings","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T23:55:32.096524Z"},"links":{"citing_paper":"/paper/2607.15198"},"observation_digest":"sha256:6c1a56f3ef00c8777ab18d9cc4039b2185840f7f08d7f7711939b727364f4712","observation_id":"cc0bd727-ffd1-48f2-8897-587d3aef4348","resolution":{"observed_at":"2026-08-01T23:55:32.096524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:55:32.190697Z","title":"Librispeech: an asr corpus based on public domain audio books,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.15198","last_updated":"2026-07-16T16:57:05Z","snapshot_observed_at":"2026-08-05T18:12:12.518096Z","submitted_at":"2026-07-16T16:57:05Z","title":"SLT 2026 REAL-TSE Challenge: Real-world Target Speaker Extraction from Conversational Recordings","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T23:55:32.190697Z"},"links":{"citing_paper":"/paper/2607.15198"},"observation_digest":"sha256:ac0405e4704f57eea56fd8adb410952354349de393be7bf1013172da7cb9dc9f","observation_id":"4092e76c-37dd-40df-b88a-455124d3285a","resolution":{"observed_at":"2026-08-01T23:55:32.190697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:55:32.252100Z","title":"V oxceleb: A large-scale speaker identification dataset,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.15198","last_updated":"2026-07-16T16:57:05Z","snapshot_observed_at":"2026-08-05T18:12:12.518096Z","submitted_at":"2026-07-16T16:57:05Z","title":"SLT 2026 REAL-TSE Challenge: Real-world Target Speaker Extraction from Conversational Recordings","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T23:55:32.252100Z"},"links":{"citing_paper":"/paper/2607.15198"},"observation_digest":"sha256:8f6cff86eeeeae58cb0bdf5902f1c593de6e2818dd94d2d4a2893925ff4f640d","observation_id":"20688441-8a8b-44e2-a978-56e198c428c2","resolution":{"observed_at":"2026-08-01T23:55:32.252100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:55:32.349907Z","title":"CN-Celeb: A challenging chinese speaker recognition dataset,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.15198","last_updated":"2026-07-16T16:57:05Z","snapshot_observed_at":"2026-08-05T18:12:12.518096Z","submitted_at":"2026-07-16T16:57:05Z","title":"SLT 2026 REAL-TSE Challenge: Real-world Target Speaker Extraction from Conversational Recordings","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T23:55:32.349907Z"},"links":{"citing_paper":"/paper/2607.15198"},"observation_digest":"sha256:c1c4117a90017546f13009f07cc2ea7cde16b75c6bed5c88d7fa246c51c12423","observation_id":"8591ae37-2507-4c98-a3c5-dc4093e07511","resolution":{"observed_at":"2026-08-01T23:55:32.349907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:55:32.418267Z","title":"Aishell-1: An open-source mandarin speech corpus and a speech recognition baseline,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.15198","last_updated":"2026-07-16T16:57:05Z","snapshot_observed_at":"2026-08-05T18:12:12.518096Z","submitted_at":"2026-07-16T16:57:05Z","title":"SLT 2026 REAL-TSE Challenge: Real-world Target Speaker Extraction from Conversational Recordings","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T23:55:32.418267Z"},"links":{"citing_paper":"/paper/2607.15198"},"observation_digest":"sha256:43f5ef0a44a747484e8fd68a73d59ee6b547a281cc5eba8529e2f2cb81a07ea6","observation_id":"281449cd-fde4-4c6a-8744-1b4cf4fe03dc","resolution":{"observed_at":"2026-08-01T23:55:32.418267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:55:32.537436Z","title":"CSTR VCTK Corpus: English multi-speaker corpus for CSTR voice cloning toolkit,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.15198","last_updated":"2026-07-16T16:57:05Z","snapshot_observed_at":"2026-08-05T18:12:12.518096Z","submitted_at":"2026-07-16T16:57:05Z","title":"SLT 2026 REAL-TSE Challenge: Real-world Target Speaker Extraction from Conversational Recordings","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T23:55:32.537436Z"},"links":{"citing_paper":"/paper/2607.15198"},"observation_digest":"sha256:8bf69bc230d7ff78ccf2f83f73344001c932f866238d8f1cbf1dda9266aba465","observation_id":"5e3370d0-0cf2-4a3f-998d-beebee452ebd","resolution":{"observed_at":"2026-08-01T23:55:32.537436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:55:32.603764Z","title":"EARS: An Anechoic Fullband Speech Dataset Benchmarked for Speech Enhancement and Dereverberation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15198","last_updated":"2026-07-16T16:57:05Z","snapshot_observed_at":"2026-08-05T18:12:12.518096Z","submitted_at":"2026-07-16T16:57:05Z","title":"SLT 2026 REAL-TSE Challenge: Real-world Target Speaker Extraction from Conversational Recordings","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-01T23:55:32.603764Z"},"links":{"citing_paper":"/paper/2607.15198"},"observation_digest":"sha256:4c8504408c9e4a5cdd87924e9ed7cbaeb1a0425eec5f262c2a82cbe959c81363","observation_id":"e7f828df-2080-4458-898d-42c3b89ca208","resolution":{"observed_at":"2026-08-01T23:55:32.603764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:55:32.715991Z","title":"WHAM!: Extending Speech Separation to Noisy Environments,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.15198","last_updated":"2026-07-16T16:57:05Z","snapshot_observed_at":"2026-08-05T18:12:12.518096Z","submitted_at":"2026-07-16T16:57:05Z","title":"SLT 2026 REAL-TSE Challenge: Real-world Target Speaker Extraction from Conversational Recordings","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T23:55:32.715991Z"},"links":{"citing_paper":"/paper/2607.15198"},"observation_digest":"sha256:d400686395576324ed05929344aead854ee3b42d55924869eafc771510940d80","observation_id":"f5e1aac2-5398-4665-9b9b-a0a8b640fd17","resolution":{"observed_at":"2026-08-01T23:55:32.715991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1510.08484","last_updated":"2015-10-28T20:59:04Z","snapshot_observed_at":"2026-07-06T04:34:36.474437Z","submitted_at":"2015-10-28T20:59:04Z","title":"MUSAN: A Music, Speech, and Noise Corpus","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1510.08484","snapshot_observed_at":"2026-08-01T23:55:32.787563Z","title":"Musan: A music, speech, and noise corpus,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.15198","last_updated":"2026-07-16T16:57:05Z","snapshot_observed_at":"2026-08-05T18:12:12.518096Z","submitted_at":"2026-07-16T16:57:05Z","title":"SLT 2026 REAL-TSE Challenge: Real-world Target Speaker Extraction from Conversational Recordings","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-01T23:55:32.787563Z"},"links":{"cited_paper":"/paper/1510.08484","citing_paper":"/paper/2607.15198"},"observation_digest":"sha256:1f7448b5b1dadba8d1e4ec6b8a2574778fd46513541175f8c7ebca68dc537310","observation_id":"32ad0a4e-59ca-4768-873c-410ea463340a","resolution":{"observed_at":"2026-08-01T23:55:32.787563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:55:32.883765Z","title":"DEMAND: A collection of multi- channel recordings of acoustic noise in diverse environments,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2607.15198","last_updated":"2026-07-16T16:57:05Z","snapshot_observed_at":"2026-08-05T18:12:12.518096Z","submitted_at":"2026-07-16T16:57:05Z","title":"SLT 2026 REAL-TSE Challenge: Real-world Target Speaker Extraction from Conversational Recordings","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-01T23:55:32.883765Z"},"links":{"citing_paper":"/paper/2607.15198"},"observation_digest":"sha256:612cb112cd33685fa339c94b8bb7835892f3970a1cdd25a558ac86d99a0e5f50","observation_id":"2dfe1e0c-70d1-4cb5-8c87-40db1153e645","resolution":{"observed_at":"2026-08-01T23:55:32.883765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:55:32.981307Z","title":"The INTERSPEECH 2020 Deep Noise Suppression Challenge: Datasets, Subjective Testing Framework, and Challenge Results,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.15198","last_updated":"2026-07-16T16:57:05Z","snapshot_observed_at":"2026-08-05T18:12:12.518096Z","submitted_at":"2026-07-16T16:57:05Z","title":"SLT 2026 REAL-TSE Challenge: Real-world Target Speaker Extraction from Conversational Recordings","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-01T23:55:32.981307Z"},"links":{"citing_paper":"/paper/2607.15198"},"observation_digest":"sha256:369cfdd58e86ac0d64312be66541360759a24364e7e12b3289e98f0bb1b648b9","observation_id":"b44bb0f2-0330-4562-b049-f13ae9308a81","resolution":{"observed_at":"2026-08-01T23:55:32.981307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:55:33.111260Z","title":"Building and evaluation of a real room impulse response dataset,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.15198","last_updated":"2026-07-16T16:57:05Z","snapshot_observed_at":"2026-08-05T18:12:12.518096Z","submitted_at":"2026-07-16T16:57:05Z","title":"SLT 2026 REAL-TSE Challenge: Real-world Target Speaker Extraction from Conversational Recordings","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-01T23:55:33.111260Z"},"links":{"citing_paper":"/paper/2607.15198"},"observation_digest":"sha256:5ce86e29801ee75d23ce502a1ac0bc39bf50bacaed160bd9ccb8285f842742b5","observation_id":"f32a0238-ee59-47b1-b91a-5f6708b50b08","resolution":{"observed_at":"2026-08-01T23:55:33.111260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:55:33.229214Z","title":"Fast random approximation of multi-channel room impulse response,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15198","last_updated":"2026-07-16T16:57:05Z","snapshot_observed_at":"2026-08-05T18:12:12.518096Z","submitted_at":"2026-07-16T16:57:05Z","title":"SLT 2026 REAL-TSE Challenge: Real-world Target Speaker Extraction from Conversational Recordings","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-01T23:55:33.229214Z"},"links":{"citing_paper":"/paper/2607.15198"},"observation_digest":"sha256:3cd3a0eec72d84da8975c1ee4fdd702ad387d6ffc31421d69cfcba12c3353d00","observation_id":"5935f448-6ff7-48da-adca-efe214816240","resolution":{"observed_at":"2026-08-01T23:55:33.229214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:55:33.345978Z","title":"TF- GridNet: Integrating full-and sub-band modeling for speech separation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.15198","last_updated":"2026-07-16T16:57:05Z","snapshot_observed_at":"2026-08-05T18:12:12.518096Z","submitted_at":"2026-07-16T16:57:05Z","title":"SLT 2026 REAL-TSE Challenge: Real-world Target Speaker Extraction from Conversational Recordings","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-01T23:55:33.345978Z"},"links":{"citing_paper":"/paper/2607.15198"},"observation_digest":"sha256:0cddd85b970fc3130f4ee265a2d8cabb2e9f0d27639779bdf53c8eac8059fe4a","observation_id":"4af715b9-c5e6-480a-8b56-5b562d383461","resolution":{"observed_at":"2026-08-01T23:55:33.345978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:55:33.397361Z","title":"Notes on the history of correlation,","venue":null,"work_id":null,"year":1920},"citing_paper":{"arxiv_id":"2607.15198","last_updated":"2026-07-16T16:57:05Z","snapshot_observed_at":"2026-08-05T18:12:12.518096Z","submitted_at":"2026-07-16T16:57:05Z","title":"SLT 2026 REAL-TSE Challenge: Real-world Target Speaker Extraction from Conversational Recordings","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-01T23:55:33.397361Z"},"links":{"citing_paper":"/paper/2607.15198"},"observation_digest":"sha256:9a2c871b6cc7c39c590ee26cb2ff9f76959d505bca1eacc466b0395d4cb6ed73","observation_id":"1498298a-a1cc-4c8c-93c0-18a4058c2f64","resolution":{"observed_at":"2026-08-01T23:55:33.397361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:55:33.490785Z","title":"The proof and measurement of association between two things","venue":null,"work_id":null,"year":1961},"citing_paper":{"arxiv_id":"2607.15198","last_updated":"2026-07-16T16:57:05Z","snapshot_observed_at":"2026-08-05T18:12:12.518096Z","submitted_at":"2026-07-16T16:57:05Z","title":"SLT 2026 REAL-TSE Challenge: Real-world Target Speaker Extraction from Conversational Recordings","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-01T23:55:33.490785Z"},"links":{"citing_paper":"/paper/2607.15198"},"observation_digest":"sha256:6be2eb47c2f95196c6c6d076e2ea6e555574c5138b98865b8ca23c75bb3a0d82","observation_id":"ea63e4ae-e748-4146-87bc-5000313d07cc","resolution":{"observed_at":"2026-08-01T23:55:33.490785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:55:33.743598Z","title":"DNSMOS Pro: A reduced-size DNN for probabilistic MOS of speech","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15198","last_updated":"2026-07-16T16:57:05Z","snapshot_observed_at":"2026-08-05T18:12:12.518096Z","submitted_at":"2026-07-16T16:57:05Z","title":"SLT 2026 REAL-TSE Challenge: Real-world Target Speaker Extraction from Conversational Recordings","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-01T23:55:33.743598Z"},"links":{"citing_paper":"/paper/2607.15198"},"observation_digest":"sha256:726d3be2e43ff76d5a3ef21eed137ed26a046128e45d0dfd2051d870744e37be","observation_id":"c87d1c48-f2df-4a31-91c3-770a881bd309","resolution":{"observed_at":"2026-08-01T23:55:33.743598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.15198","last_updated":"2026-07-16T16:57:05Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-05T18:12:12.518096Z","submitted_at":"2026-07-16T16:57:05Z","title":"SLT 2026 REAL-TSE Challenge: Real-world Target Speaker Extraction from Conversational Recordings"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":39,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 0 inbound Pith citation observations for arXiv:2607.15198."}