{"as_of":"2026-08-08T11:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2a7bebd77e92b782a88c8c89afe87e79083c82697207cadf62fb15bfd922a0e6","coverage":[{"denominator":80,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":80,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:22:07.475291Z","state":"measured"},{"denominator":83,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":83,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T14:20:49.132229Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-07T14:14:48.835560Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19314","snapshot_observed_at":"2026-08-03T14:20:49.132229Z","title":"Solospeech: Enhanc- ing intelligibility and quality in target speech extraction through a cascaded generative pipeline,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.20978","last_updated":"2026-06-06T11:42:51Z","snapshot_observed_at":"2026-08-06T20:32:00.349975Z","submitted_at":"2025-12-24T06:13:02Z","title":"GenTSE: Enhancing Target Speaker Extraction via a Coarse-to-Fine Generative Language Model","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T14:20:49.132229Z"},"links":{"cited_paper":"/paper/2505.19314","citing_paper":"/paper/2512.20978"},"observation_digest":"sha256:a891d7eefd5ac6c09d37da3de2ffcd2687b8eb2507e5f287ce5dc97ab65493f0","observation_id":"cc329c18-7386-4acd-8846-95a8f1672c13","resolution":{"observed_at":"2026-08-03T14:20:49.132229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-07T14:14:48.835560Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19314","snapshot_observed_at":"2026-08-02T22:51:20.849476Z","title":"SoloSpeech: Enhancing Intelligi- bility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.15519","last_updated":"2026-06-08T11:40:00Z","snapshot_observed_at":"2026-08-04T03:59:57.330735Z","submitted_at":"2026-02-17T11:47:56Z","title":"Enroll-on-Wakeup: A First Comparative Study of Target Speech Extraction for Seamless Interaction in Real Noisy Human-Machine Dialogue Scenarios","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T22:51:20.849476Z"},"links":{"cited_paper":"/paper/2505.19314","citing_paper":"/paper/2602.15519"},"observation_digest":"sha256:7b3c6b4f399981162f871d03e9b0e3dc9a19a6d24809afe148022ddd8ee5a8cb","observation_id":"0293e581-3ff6-4913-8d5f-4960ebfa64ed","resolution":{"observed_at":"2026-08-02T22:51:20.849476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-07T14:14:48.835560Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19314","snapshot_observed_at":"2026-07-13T17:09:15.281290Z","title":"Solospeech: Enhancing intelligibility and quality in target speech extraction through a cascaded generative pipeline,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.27205","last_updated":"2026-06-21T01:18:38Z","snapshot_observed_at":"2026-08-07T10:01:19.312395Z","submitted_at":"2026-03-28T09:14:41Z","title":"Beyond Acoustic Prefixes: Persistent Grounding in Serialized Acoustic Memory for LLM-Based Multi-Talker Speech Recognition","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-13T17:09:15.281290Z"},"links":{"cited_paper":"/paper/2505.19314","citing_paper":"/paper/2603.27205"},"observation_digest":"sha256:4eb0dc9b2bbc0bf1fbf299db4b461883ec60047a8d4eec693393a0651772ba75","observation_id":"29ebe771-cc57-4139-8478-42c13570334e","resolution":{"observed_at":"2026-07-13T17:09:15.281290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.19314/citation-record","integrity":"/paper/2505.19314/integrity","json":"/paper/2505.19314/citation-record.json","paper":"/paper/2505.19314"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:16.236290Z","title":"The cocktail-party problem revisited: early pro- cessing and selection of multi-talker speech,","venue":null,"work_id":"34b0a595-7d18-48b5-bc25-f3f9428b687b","year":2015},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-07T14:14:48.835560Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.154451Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:b20ae56670cdf1ccb92a09bb0d438f78468f8e154c507805789379bf4d8f58c6","observation_id":"d86250cd-c963-4ac1-9256-ddbe38fad0ee","resolution":{"observed_at":"2026-08-07T14:22:16.316621Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:16.119104Z","title":"Neural target speech extraction: An overview,","venue":null,"work_id":"890ec36b-4e41-49e8-8c74-c89bab85e147","year":2023},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-07T14:14:48.835560Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.158760Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:f556f1f0311eee86e1261a6121105d5bf6d53b4a37b701964718b883e716ae87","observation_id":"d24a1ce8-4e6c-4d93-9999-a8c2e4cf756a","resolution":{"observed_at":"2026-08-07T14:22:16.167867Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:15.985401Z","title":"Neural spatial filter: Target speaker speech separation assisted with directional information,","venue":null,"work_id":"0c6477f8-41eb-41f2-9961-2c1bfbe981ad","year":2019},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-07T14:14:48.835560Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.163056Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:a79e053141bd67f9a64cc03cc356f9fdef61cc67e0b90435e117aa1c7b0a4b56","observation_id":"a5f4c12f-df00-4fbe-9813-b06d63e71704","resolution":{"observed_at":"2026-08-07T14:22:16.021303Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:15.537800Z","title":"Far-field location guided target speech extraction using end-to-end speech recognition objectives,","venue":null,"work_id":"b592ad31-d477-4df5-83bb-d88f1850c3ae","year":2020},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-07T14:14:48.835560Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.168216Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:7f3e2f5c8de738fa5fa5f6ff29c65ff0d8bd953243351cfe0f9fedddc311bc5a","observation_id":"8b003eec-47d2-42bc-b634-cecfc738d80d","resolution":{"observed_at":"2026-08-07T14:22:15.913298Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:15.350971Z","title":"Looking to listen at the cocktail party: a speaker-independent audio-visual model for speech separation,","venue":null,"work_id":"4484a070-8fd4-4164-b9d1-97be6a7addda","year":2018},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-07T14:14:48.835560Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.171996Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:bd23e8508a10b76f7c0a07a4644dc6d108698ed256eb395a29ceb41fde3672f7","observation_id":"1eedf57c-0046-4639-a424-985e93779fbf","resolution":{"observed_at":"2026-08-07T14:22:15.435237Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:15.201990Z","title":"Conceptbeam: Concept driven target speech extraction,","venue":null,"work_id":"a3f274ad-abb1-4ff3-b85c-8329a0b49ffe","year":2022},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-07T14:14:48.835560Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.176146Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:65d4250a0e1a85ca8131b53d3a44681fe230638b43d66527cf952701f0d01fb2","observation_id":"27460b18-8024-4c28-a89d-4479dbe0a0ef","resolution":{"observed_at":"2026-08-07T14:22:15.283829Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:15.071396Z","title":"V oicefilter: Targeted voice separation by speaker-conditioned spectrogram masking,","venue":null,"work_id":"b71f9bb9-2f60-45cb-b605-34a2025de488","year":2019},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-07T14:14:48.835560Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.180844Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:35ec893f45924a640c01d5ac58a49368cb167f76c5f004ab0f43d777bab77cc2","observation_id":"693bb2b9-cf52-4e47-8d02-945d341d136c","resolution":{"observed_at":"2026-08-07T14:22:15.164815Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:14.923821Z","title":"Speakerbeam: Speaker aware neural network for target speaker extraction in speech mixtures,","venue":null,"work_id":"5baab1ca-31a9-4af0-bfa7-d0c0e58583df","year":2019},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-07T14:14:48.835560Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.184966Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:29ba477f2827b65858cf396adc700d3b47d5087f7fb866709f2cad368417f28a","observation_id":"930acadf-25cf-4460-b1bf-70371d4bf6ca","resolution":{"observed_at":"2026-08-07T14:22:15.002077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:14.820490Z","title":"Wesep: A scalable and flexible toolkit towards generalizable target speaker extraction,","venue":null,"work_id":"5442465c-c7b2-49bb-95f4-42553bef56b9","year":2024},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-07T14:14:48.835560Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.188682Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:fb5f2f5a5c8c29490440f1c5309ac721a9838027a30690976f764c5941d51378","observation_id":"33604da3-1634-4163-ac55-ae8543afb007","resolution":{"observed_at":"2026-08-07T14:22:14.875258Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:14.706947Z","title":"Target confusion in end-to-end speaker extraction: Analysis and approaches,","venue":null,"work_id":"a50fcfa1-101e-4dd9-a17e-1573b7a2ef56","year":2022},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-07T14:14:48.835560Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.192850Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:997cca539bd782c5fe1abdafb8cb58f504d9018a2e46782f28e61b2fd2c675c4","observation_id":"460ed315-7fe9-41ff-b469-ddcbc96234dd","resolution":{"observed_at":"2026-08-07T14:22:14.758242Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:14.592313Z","title":"Dpccn: Densely-connected pyramid complex convolutional network for robust speech separation 11 and extraction,","venue":null,"work_id":"c934db80-b9f2-46a6-9ea1-e81da7e7888b","year":2022},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-07T14:14:48.835560Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.196434Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:8f1ff4c14dc53444994f7a1345ed1486ff9bab4a5f9377e67e4825e7fd482048","observation_id":"f22eb8bc-4f60-4f6c-803d-194c16e497aa","resolution":{"observed_at":"2026-08-07T14:22:14.633307Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:14.436335Z","title":"Improving target sound extraction with timestamp information,","venue":null,"work_id":"fffa703e-2e4c-441b-a823-a70f8f281647","year":2022},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-07T14:14:48.835560Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.200583Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:e32c0a4619a1b29959e85de7c55fa5d6fc23cab6763640fb07ff24eb62fe4952","observation_id":"a5f74896-a48a-44e2-a4d5-4a405cdc5bdc","resolution":{"observed_at":"2026-08-07T14:22:14.516695Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15799","last_updated":"2024-09-24T06:47:12Z","snapshot_observed_at":"2026-08-04T16:20:42.322464Z","submitted_at":"2024-09-24T06:47:12Z","title":"WeSep: A Scalable and Flexible Toolkit Towards Generalizable Target Speaker Extraction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.15799","snapshot_observed_at":"2026-08-07T14:22:07.204106Z","title":"Wesep: A scalable and flexible toolkit towards generalizable target speaker extraction,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-07T14:14:48.835560Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.204106Z"},"links":{"cited_paper":"/paper/2409.15799","citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:22e7d22ba13c488d3a046d04a59bee0c907ae4078333c9b7e8b1c6b157f34b9b","observation_id":"610f6f0c-164e-427f-ad8d-55bce01922a0","resolution":{"observed_at":"2026-08-07T14:22:07.204106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:14.292649Z","title":"Spex: Multi-scale time domain speaker extraction network,","venue":null,"work_id":"5b66cdee-e28c-43bb-ae16-0bcab6a3d549","year":2020},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-07T14:14:48.835560Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.208667Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:520d1f623d9cbb087593585b9290b2bd76c6bf8aa34fadea66e85007ca7e178d","observation_id":"611ca561-de03-4463-8427-7df5c5ba0e9c","resolution":{"observed_at":"2026-08-07T14:22:14.357625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:14.188268Z","title":"Spex+: A complete time domain speaker extraction network,","venue":null,"work_id":"c25cf6b4-8464-42df-87d6-1c171ded2d1d","year":2020},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-07T14:14:48.835560Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.212662Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:ec033b13f86f799bddc60b4e29dfbbd122e346343f1d05d29162511c6cb0f6e2","observation_id":"3858436a-b8b9-43ec-9a1f-78e582e3d462","resolution":{"observed_at":"2026-08-07T14:22:14.233683Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:14.061292Z","title":"X-SEPFORMER: end-to- end speaker extraction network with explicit optimization on speaker confusion,","venue":null,"work_id":"642b63ca-9710-4f1d-b5b0-33cfa12b1daf","year":2023},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-07T14:14:48.835560Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.216422Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:9e521c294743b37bf19115fcb69a039da206774c14117913a217e852afe080cf","observation_id":"85db493b-472e-4c86-895d-e4730dc4985c","resolution":{"observed_at":"2026-08-07T14:22:14.115190Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:13.918559Z","title":"X-tf-gridnet: A time-frequency domain target speaker extraction network with adaptive speaker embedding fusion,","venue":null,"work_id":"1e275b45-8d05-4933-967d-a259e0cf38d0","year":2024},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-07T14:14:48.835560Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.221377Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:55405422c5efe378f9c9c9aa9cde4265b85aced15f262c8622a22f0973eb9882","observation_id":"8da9cead-1b4d-4c0c-877a-787dddb08cab","resolution":{"observed_at":"2026-08-07T14:22:13.979985Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02615","last_updated":"2025-05-20T03:22:39Z","snapshot_observed_at":"2026-07-06T19:10:16.874343Z","submitted_at":"2024-09-04T11:12:30Z","title":"USEF-TSE: Universal Speaker Embedding Free Target Speaker Extraction","version":3},"cited_work":{"arxiv_id":"2409.02615","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.02615","snapshot_observed_at":"2026-08-07T14:22:07.830197Z","title":"USEF-TSE: Universal Speaker Embedding Free Target Speaker Extraction","venue":"eess.AS","work_id":"e7fbf494-185d-4cf8-aad4-054f5c917469","year":2024},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-07T14:14:48.835560Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.225317Z"},"links":{"cited_paper":"/paper/2409.02615","citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:0ece1a82d1eaa1b602a725eb15b3c228e398327862d9086afbb30a3777cdaabd","observation_id":"1de9266a-258a-4493-b63b-e2782b33b22b","resolution":{"observed_at":"2026-08-07T14:22:07.834953Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:13.758775Z","title":"Target speech extraction with conditional diffusion model,","venue":null,"work_id":"03a9cd00-36ca-4679-adbf-d6fb2317f340","year":2023},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-07T14:14:48.835560Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.230095Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:01425997e1f4ffbebb9cd53b2eae0b6eaa215dc09f02a44e2a5e4385545042ec","observation_id":"ed61ae57-6b30-475d-b20a-a71d244102f2","resolution":{"observed_at":"2026-08-07T14:22:13.866038Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07461","last_updated":"2024-06-11T17:08:21Z","snapshot_observed_at":"2026-07-06T18:29:04.294349Z","submitted_at":"2024-06-11T17:08:21Z","title":"Noise-robust Speech Separation with Fast Generative Correction","version":1},"cited_work":{"arxiv_id":"2406.07461","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.07461","snapshot_observed_at":"2026-08-07T14:22:07.813009Z","title":"Noise-robust Speech Separation with Fast Generative Correction","venue":"eess.AS","work_id":"47f625ef-3a30-4cd2-be1d-8c2a2a0ed8e6","year":2024},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-07T14:14:48.835560Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.234297Z"},"links":{"cited_paper":"/paper/2406.07461","citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:1544d27fded3c59b51bb72f03208d08fd6d6a6f43b59f6c6cda7246601a55335","observation_id":"3f2ee616-3578-4865-9a29-f62fd92bdbb1","resolution":{"observed_at":"2026-08-07T14:22:07.817493Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:13.612459Z","title":"Speech enhancement and dereverberation with diffusion-based generative models,","venue":null,"work_id":"b534234a-1712-4f03-adac-8c52721f69df","year":2023},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-07T14:14:48.835560Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.239647Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:8a56078897607b7dcd20f9e8d6556dd6ada5c67a47b6eb2aca4973b84fc9300a","observation_id":"9f531854-3c29-43d1-bf74-867007a691f8","resolution":{"observed_at":"2026-08-07T14:22:13.683036Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:07.243716Z","title":"Diffusion-based generative speech source separation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-07T14:14:48.835560Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.243716Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:f9f2fa611abe37f2a6dbccddbc47cda6b1387a836ff9f1cc81bede6f3755c418","observation_id":"1c4af11a-89ad-4505-9ea5-a24441951168","resolution":{"observed_at":"2026-08-07T14:22:07.243716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:13.420084Z","title":"Generative pre-training for speech with flow matching,","venue":null,"work_id":"f98530d5-35f2-4275-a8f4-673ff4dca94f","year":2024},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-07T14:14:48.835560Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.248153Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:a67a94675eb920f22ce0dac6acbe3dd3591a5c9d3f365fc6bb25bff6943aea33","observation_id":"63742595-d3a9-4838-bd75-3a4f27419613","resolution":{"observed_at":"2026-08-07T14:22:13.475291Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-07-06T20:31:32.157039Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.03128","snapshot_observed_at":"2026-08-07T14:22:07.252044Z","title":"Metis: A foundation speech generation model with masked generative pre-training,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-07T14:14:48.835560Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.252044Z"},"links":{"cited_paper":"/paper/2502.03128","citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:a66b8e266b5eb81a350e5115ef5582d03100a295248cb3431d097d50bdce5acd","observation_id":"ffb056b2-5e5a-4357-a714-17287e0219e7","resolution":{"observed_at":"2026-08-07T14:22:07.252044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.08425","last_updated":"2025-01-02T03:34:22Z","snapshot_observed_at":"2026-08-01T21:00:39.966928Z","submitted_at":"2024-09-12T23:12:25Z","title":"SoloAudio: Target Sound Extraction with Language-oriented Audio Diffusion Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.08425","snapshot_observed_at":"2026-08-07T14:22:07.256774Z","title":"Soloau- dio: Target sound extraction with language-oriented audio diffusion transformer,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-07T14:14:48.835560Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.256774Z"},"links":{"cited_paper":"/paper/2409.08425","citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:0773a4e863fd5676b85195beb00a93515866075eaf83ac7ebf68d37f6c9df146","observation_id":"af0f0304-7d6e-4afa-91ce-5577d88b2cbd","resolution":{"observed_at":"2026-08-07T14:22:07.256774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.10752","last_updated":"2023-06-24T05:28:19Z","snapshot_observed_at":"2026-07-06T14:44:38.168186Z","submitted_at":"2023-01-25T18:21:51Z","title":"Separate And Diffuse: Using a Pretrained Diffusion Model for Improving Source Separation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.10752","snapshot_observed_at":"2026-08-07T14:22:07.261084Z","title":"Separate and diffuse: Using a pretrained diffusion model for improving source separation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-07T14:14:48.835560Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.261084Z"},"links":{"cited_paper":"/paper/2301.10752","citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:0b5bab75551962cdaf458e30eea5d32ddd960460fc521e1336d10310811bf2d1","observation_id":"bf62dc7e-f961-46a4-be01-5f8568be862f","resolution":{"observed_at":"2026-08-07T14:22:07.261084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:07.265276Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-07T14:14:48.835560Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.265276Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:fa1d0deae6d7701a562f227f60909a562000de12ee1eac2ee3662eaf79a4c14f","observation_id":"eadbdd15-2a50-446f-88e2-1527b08990b5","resolution":{"observed_at":"2026-08-07T14:22:07.265276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2409.09785","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:07.774576Z","title":"Large language model based generative error correction: A challenge and baselines for speech recognition, speaker tagging, and emotion recognition,","venue":null,"work_id":"7278e4c5-90bf-4ec3-be8f-3da9c9780af6","year":2024},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-07T14:14:48.835560Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.269521Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:0aeefe2de3e784cd9facd12c27a387afb4a76b7540246017a5c95d4284a1336b","observation_id":"17e636f9-cabc-4df8-b41f-2cbca8dbe101","resolution":{"observed_at":"2026-08-07T14:22:07.780630Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.03273","last_updated":"2025-05-26T07:01:19Z","snapshot_observed_at":"2026-08-07T15:49:40.354756Z","submitted_at":"2025-05-06T08:04:37Z","title":"SepALM: Audio Language Models Are Error Correctors for Robust Speech Separation","version":2},"cited_work":{"arxiv_id":"2505.03273","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.03273","snapshot_observed_at":"2026-08-07T14:22:07.706463Z","title":"SepALM: Audio Language Models Are Error Correctors for Robust Speech Separation","venue":"cs.SD","work_id":"24b25144-5ac2-424e-a761-a74b3443cf28","year":2025},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-07T14:14:48.835560Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.274041Z"},"links":{"cited_paper":"/paper/2505.03273","citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:459097f6f9911b531c62ddc2171d0700ef1624a4be4994d1a43b5f13e11983f4","observation_id":"58f778a2-4cd6-4848-b207-4291a63e5542","resolution":{"observed_at":"2026-08-07T14:22:07.710817Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.11262","last_updated":"2020-05-22T16:26:54Z","snapshot_observed_at":"2026-08-04T10:15:33.124350Z","submitted_at":"2020-05-22T16:26:54Z","title":"LibriMix: An Open-Source Dataset for Generalizable Speech Separation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.11262","snapshot_observed_at":"2026-08-07T14:22:07.278378Z","title":"Librimix: An open-source dataset for generalizable speech separation,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-07T14:14:48.835560Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.278378Z"},"links":{"cited_paper":"/paper/2005.11262","citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:e7a91de718c1b65a9c23f0adac00fdf352bc953125ab22a45a6d79bcb9bc8505","observation_id":"ff992483-89bd-4c28-8710-1079063a1ac4","resolution":{"observed_at":"2026-08-07T14:22:07.278378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:13.173449Z","title":"Target speech extraction with conditional diffusion model,","venue":null,"work_id":"f9883dfa-f55b-450b-8cc8-08fc58b193a0","year":2023},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-07T14:14:48.835560Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.282398Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:eb1d5d9144386703121ebaaeeea1bb759aedc6bcd6cbcd36a581cc808b61f938","observation_id":"335f9c72-14f9-4d0b-9d3d-7ba3e47b1cba","resolution":{"observed_at":"2026-08-07T14:22:13.348423Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:12.945017Z","title":"Dpm-tse: A diffusion probabilistic model for target sound extraction,","venue":null,"work_id":"dbacc139-3a27-4c7d-a0e1-5fbfdd0adbaf","year":2024},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-07T14:14:48.835560Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.286482Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:e7fdcd681a460b157fcf0f3e4d8e2f742ccc872749274bbfe2023e1e3a55178f","observation_id":"e99c4cc7-f709-4a9a-a5f6-b9cb4bf63e49","resolution":{"observed_at":"2026-08-07T14:22:13.098187Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:12.601174Z","title":"Diffusion- based generative speech source separation,","venue":null,"work_id":"d0338579-ee12-4837-9544-e7b0d552e2cc","year":2023},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-07T14:14:48.835560Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.290826Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:1c4eae08dac569e71bb8d4d3a59750b110b059242dd7e340fda16a2ec2904c74","observation_id":"73ea1afc-061b-4f60-a9f9-019697bca4fb","resolution":{"observed_at":"2026-08-07T14:22:12.750074Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16117","last_updated":"2024-09-25T01:21:31Z","snapshot_observed_at":"2026-08-04T16:09:50.939418Z","submitted_at":"2024-09-24T14:24:47Z","title":"Generative Speech Foundation Model Pretraining for High-Quality Speech Extraction and Restoration","version":2},"cited_work":{"arxiv_id":"2409.16117","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.16117","snapshot_observed_at":"2026-08-07T14:22:07.679347Z","title":"Generative Speech Foundation Model Pretraining for High-Quality Speech Extraction and Restoration","venue":"eess.AS","work_id":"d7ed71fd-2bcd-4e72-9c65-062869783632","year":2024},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-07T14:14:48.835560Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.295184Z"},"links":{"cited_paper":"/paper/2409.16117","citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:45acb025b04ba88211bcaeb5be04c97269b34c7f3365afd0057024db7c15a375","observation_id":"246e030c-ca12-4386-8f20-fdd375bd3a4e","resolution":{"observed_at":"2026-08-07T14:22:07.683925Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:12.276356Z","title":"Generation- based target speech extraction with speech discretization and vocoder,","venue":null,"work_id":"67ea9df2-63ae-47b2-a58b-f4d79521ad5f","year":2024},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-07T14:14:48.835560Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.299420Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:8c109cf453c6fb58286961f38033547b70a9a1e46b90bbf785e71aa7451e4f20","observation_id":"aa515a27-f2d8-4c0c-99c9-7d5b713dd5b7","resolution":{"observed_at":"2026-08-07T14:22:12.458042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.14477","last_updated":"2025-05-21T17:26:11Z","snapshot_observed_at":"2026-07-06T20:25:36.218904Z","submitted_at":"2025-01-24T13:19:56Z","title":"Enhancing Intelligibility for Generative Target Speech Extraction via Joint Optimization with Target Speaker ASR","version":2},"cited_work":{"arxiv_id":"2501.14477","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.14477","snapshot_observed_at":"2026-08-07T14:22:07.662926Z","title":"Enhancing Intelligibility for Generative Target Speech Extraction via Joint Optimization with Target Speaker ASR","venue":"eess.AS","work_id":"a5c811a8-63a5-4457-9bd3-49f05fafdaa5","year":2025},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-07T14:14:48.835560Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.303374Z"},"links":{"cited_paper":"/paper/2501.14477","citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:c0c0941245a2cd8edf4c3255724f5a28726e709aba3b3b825440cc03ace56c0f","observation_id":"25dbd4bf-1922-457e-abd1-dd3165775919","resolution":{"observed_at":"2026-08-07T14:22:07.667941Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:07.307054Z","title":"Diffusion-based signal refiner for speech separation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-07T14:14:48.835560Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.307054Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:0c1754ac91203f30afaef09daeb33f80b0daae2b9fc3ad797bcfe200037be0fc","observation_id":"72098b94-b6c8-4c80-a0a5-18864715c414","resolution":{"observed_at":"2026-08-07T14:22:07.307054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:11.871358Z","title":"Storm: A diffusion-based stochastic regeneration model for speech enhancement and dereverberation,","venue":null,"work_id":"72f73e86-eda9-45c5-8eb9-24bc0f0bbe17","year":2023},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-07T14:14:48.835560Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.311336Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:8ef2849eace81452720755425af713bf130e231bb7911941d02f0784d676343c","observation_id":"4842be6c-412c-46b7-83ea-3ef0264395a8","resolution":{"observed_at":"2026-08-07T14:22:12.042351Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:11.605956Z","title":"Ddtse: Discriminative diffusion model for target speech extraction,","venue":null,"work_id":"4e08f872-663a-42c5-b660-fab571a388b6","year":2024},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-07T14:14:48.835560Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.315289Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:805aaa4f7b4ab40b1fabe4564f37e596d150736a9e854a772508c35daa4136e0","observation_id":"22f71e89-d785-415d-b410-649fa43d864b","resolution":{"observed_at":"2026-08-07T14:22:11.826875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:11.076059Z","title":"Speaker-aware neural network based beamformer for speaker extraction in speech mixtures,","venue":null,"work_id":"e44693a0-d3d8-4437-9c2f-28c080e96bc8","year":2017},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-07T14:14:48.835560Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.319275Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:13f846fa8293f27d608b78673f26a6cf9b39f354320c940bca4699e82519a3a2","observation_id":"4c8713c5-9933-4c50-ba86-8f2066bbe735","resolution":{"observed_at":"2026-08-07T14:22:11.286750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:10.568651Z","title":"X- vectors: Robust DNN embeddings for speaker recognition,","venue":null,"work_id":"c3894832-df40-4aeb-af8c-956a7c844ff6","year":2018},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-07T14:14:48.835560Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.323186Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:1a86a75b9a7d24e8958e5e832891449f2ab2c7e055a35f3abb3dfb39fc2da4d4","observation_id":"52a51c3a-7be6-4adb-80a6-4269e55219eb","resolution":{"observed_at":"2026-08-07T14:22:10.825851Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:10.265384Z","title":"Probing self-supervised learning models with target speech extraction,","venue":null,"work_id":"30e7e4a9-1482-45ef-9e87-babdf30c1fd6","year":2024},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-07T14:14:48.835560Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.326526Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:f114eeed294f54acf2117ddafe465bd487b97a86cabb7145658551526f48060b","observation_id":"4f347263-8123-49eb-a228-bd5c259de03c","resolution":{"observed_at":"2026-08-07T14:22:10.383416Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:10.102664Z","title":"Target speech extraction with pre-trained self-supervised learning models,","venue":null,"work_id":"11217e14-b517-4e4e-93fb-e83c0ffe0141","year":2024},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-07T14:14:48.835560Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.329756Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:0bc159fa6f0d528405a09fd324f44745614a6915840302f6c9017228766f2fb7","observation_id":"70347c62-4802-4526-b4b1-884eaeda3a8c","resolution":{"observed_at":"2026-08-07T14:22:10.184130Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:09.974088Z","title":"Smma-net: An audio clue-based target speaker extraction network with spectrogram matching and mutual attention,","venue":null,"work_id":"c40afde8-c81f-4afa-b6d2-a0bc1213cf8e","year":2024},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-07T14:14:48.835560Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.333165Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:0bdcf609fe789a6e20ee29118198c744ba3c79c790f2c185869737806f71e4b6","observation_id":"a6131e0a-85aa-4405-8e71-6099872bfdb6","resolution":{"observed_at":"2026-08-07T14:22:10.039313Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:09.827515Z","title":"Target speaker extraction by directly exploiting contextual information in the time-frequency domain,","venue":null,"work_id":"92dd19d2-1c13-4249-93dd-6843c14a3f51","year":2024},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-07T14:14:48.835560Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.336782Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:1735f60e2746ac02a0c29600323e573c3ec0210118af19ce13f899c5b37e990f","observation_id":"dc6868b9-d78f-42f0-848f-bb5f43732e07","resolution":{"observed_at":"2026-08-07T14:22:09.902393Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:09.660811Z","title":"Target speaker extraction with ultra-short reference speech by VE-VE framework,","venue":null,"work_id":"74539907-5420-422b-b050-4faab5652689","year":2023},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-07T14:14:48.835560Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.340177Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:32522ccd0847839c86cdde1a5ec86c2de94509c6a6c6f94ded8fe8043bb54037","observation_id":"f0f6c734-18fe-4623-9839-4327c25098b4","resolution":{"observed_at":"2026-08-07T14:22:09.751317Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:09.493544Z","title":"Sef-net: Speaker embedding free target speaker extraction network,","venue":null,"work_id":"d90229cb-f803-41d4-a681-f77a1b99eff9","year":2023},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-07T14:14:48.835560Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.344503Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:c5c731b48c5d259a7db767dd919b8b292f3389ef35ff6e8bd88e06ca511fc9de","observation_id":"cfcbd0d9-aa6b-4853-b2a3-7dd89ec2c885","resolution":{"observed_at":"2026-08-07T14:22:09.585458Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:09.407464Z","title":"Common diffusion noise schedules and sample steps are flawed,","venue":null,"work_id":"52a6f97c-14a0-46e5-a33b-2b2bc39dbc21","year":2024},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-07T14:14:48.835560Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.347592Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:ed3436985eb7abf9d68b56765b4a569483303f950bfbac58f0623f1dd853e15d","observation_id":"6dc8bc8b-9d24-4d81-9c76-b40ddc55d071","resolution":{"observed_at":"2026-08-07T14:22:09.460733Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:09.310891Z","title":"Progressive distillation for fast sampling of diffusion models,","venue":null,"work_id":"9584b3de-5904-438e-926b-7a9bda0305d8","year":2022},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-07T14:14:48.835560Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.350993Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:0587f240a96c1ec5d91330b8838757593d46ac6558105c21192903fd62a5d654","observation_id":"23f2da4c-8b3e-435f-ad39-abb56ef48d70","resolution":{"observed_at":"2026-08-07T14:22:09.360479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:09.116192Z","title":"High- fidelity audio compression with improved RVQGAN,","venue":null,"work_id":"b54b236e-485c-4050-85f7-fcc837f52187","year":2023},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-07T14:14:48.835560Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.354792Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:fd14befc5a7c27f6bb497c2d3edbfd4234efe0d0323c4a862d37ea435430b575","observation_id":"f157c4e6-1f2e-4093-a974-7438ab5c6e9d","resolution":{"observed_at":"2026-08-07T14:22:09.211137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14358","last_updated":"2024-07-31T16:22:42Z","snapshot_observed_at":"2026-08-06T16:30:00.821754Z","submitted_at":"2024-07-19T14:40:23Z","title":"Stable Audio Open","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14358","snapshot_observed_at":"2026-08-07T14:22:07.358306Z","title":"Stable audio open,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-07T14:14:48.835560Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.358306Z"},"links":{"cited_paper":"/paper/2407.14358","citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:e8ce5088a6f4dcf2c5294233322c1c1094afac86720777cd86e4cd37ed52a3ae","observation_id":"010a6aa9-89f3-47cb-9fbb-8b2e41a8ab8f","resolution":{"observed_at":"2026-08-07T14:22:07.358306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10819","last_updated":"2025-06-19T04:44:02Z","snapshot_observed_at":"2026-07-06T19:16:28.014017Z","submitted_at":"2024-09-17T01:27:28Z","title":"EzAudio: Enhancing Text-to-Audio Generation with Efficient Diffusion Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.10819","snapshot_observed_at":"2026-08-07T14:22:07.362796Z","title":"Ezaudio: Enhancing text-to-audio generation with efficient diffusion transformer,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-07T14:14:48.835560Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.362796Z"},"links":{"cited_paper":"/paper/2409.10819","citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:13c7d13cdf59a0f28f9665a814f0fda6db943c5c3865681c3fcc2def9bd0f6b5","observation_id":"96e4134f-1562-4fc0-96fe-b16912434989","resolution":{"observed_at":"2026-08-07T14:22:07.362796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:08.958426Z","title":"Tf- gridnet: Integrating full- and sub-band modeling for speech separation,","venue":null,"work_id":"ba2b616f-8e97-43ce-ac8f-da7126d1f613","year":2023},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-07T14:14:48.835560Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.366834Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:92e2af8a2177bdbbfbb268437582d6fd26ea65a9442148f137925f0e58727a04","observation_id":"15bc5cc7-3c30-4004-a002-2d6a7760ec0b","resolution":{"observed_at":"2026-08-07T14:22:09.018402Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02063","last_updated":"2024-09-10T14:02:58Z","snapshot_observed_at":"2026-07-06T17:54:39.685251Z","submitted_at":"2024-04-02T16:04:31Z","title":"SPMamba: State-space model is all you need in speech separation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02063","snapshot_observed_at":"2026-08-07T14:22:07.370792Z","title":"Spmamba: State-space model is all you need in speech separation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-07T14:14:48.835560Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.370792Z"},"links":{"cited_paper":"/paper/2404.02063","citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:290d3e04f006647206967c8cbd5503d7afc5e8c06f8a6218dc0c6814290f5342","observation_id":"e6a27d0f-83b0-47a4-b831-3b0e46ed4003","resolution":{"observed_at":"2026-08-07T14:22:07.370792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:08.798705Z","title":"Complex ratio masking for monaural speech separation,","venue":null,"work_id":"ca11d8b1-84a3-443d-9bab-043f804b05d3","year":2016},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-07T14:14:48.835560Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.374906Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:53847d3d1f4f8f93e04b00b5d86df476014a362fd0c80637475586f10915e7eb","observation_id":"11054119-9270-47de-9613-91804548ef4b","resolution":{"observed_at":"2026-08-07T14:22:08.871580Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:07.379255Z","title":"auraloss: Audio focused loss functions in pytorch,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-07T14:14:48.835560Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.379255Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:ade8c5fd8298d683592e81bd877b6cd9116a2f517653f651175e1bc881f4ad1e","observation_id":"aadc30e0-17e9-4e6e-ba89-151dfc7f0c01","resolution":{"observed_at":"2026-08-07T14:22:07.379255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:08.570576Z","title":"High fidelity neural audio compression,","venue":null,"work_id":"5d08e12e-9fb3-40d7-bf08-68379ee21b2a","year":2023},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-07T14:14:48.835560Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.383128Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:ff67068323014826da861af7a319d99a258095994b8d190ccc2ceee53557e37f","observation_id":"54a7bc8f-5781-4c69-b7e1-ad5fe4ce80f4","resolution":{"observed_at":"2026-08-07T14:22:08.674926Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:08.350463Z","title":"Scalable diffusion models with transformers,","venue":null,"work_id":"8fd66ec4-96d8-4f88-b9ea-4b0ced4df7d2","year":2023},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-07T14:14:48.835560Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.387236Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:8c3bc7e5426517790a1469f38fea05112adfc7a3cb546d6beadf91667655b76f","observation_id":"de2e9680-5b1a-41a2-9c2f-441ef16b5157","resolution":{"observed_at":"2026-08-07T14:22:08.454405Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:08.228100Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale,","venue":null,"work_id":"8828561f-045d-4edb-b676-88c9633cd30a","year":2021},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-07T14:14:48.835560Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.390920Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:f010083bd89fbcff1145f83b08dd626680df3e070c603e7c8d612d90194e1f48","observation_id":"31cfd854-1be9-4e3c-804e-60f026a25267","resolution":{"observed_at":"2026-08-07T14:22:08.264101Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:07.395030Z","title":"Sigmoid-weighted linear units for neural network function approximation in reinforcement learning,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-07T14:14:48.835560Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.395030Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:ef09a8a3126b8d6c69698e08c9c11016f068483e0776557064997d22cc562b53","observation_id":"a0bfd558-bae4-425f-91e7-49c5aed8eebf","resolution":{"observed_at":"2026-08-07T14:22:07.395030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:08.074184Z","title":"Roformer: Enhanced transformer with rotary position embedding,","venue":null,"work_id":"f9cb18ff-2292-415e-ac73-df467e05467a","year":2024},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-07T14:14:48.835560Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.399020Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:a48ef67b84ae49c18c53633d5391d2de6a920624b194fb3ccc4a5550e55301c9","observation_id":"2f748628-177d-4a38-b1bd-f2f82efc59c0","resolution":{"observed_at":"2026-08-07T14:22:08.143124Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:08.036627Z","title":"Single- channel multi-speaker separation using deep clustering,","venue":null,"work_id":"7b7534b4-1a3f-43a7-996f-01313a5672a7","year":2016},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-07T14:14:48.835560Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.402914Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:da8af2c38e8c9558a94a258dc435b45f52e868bcbcd4ccbba9284b063cb70fae","observation_id":"0edd31f9-8f3b-4bb4-9518-44c1cbd8072d","resolution":{"observed_at":"2026-08-07T14:22:08.040444Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:08.024873Z","title":"Conv-tasnet: Surpassing ideal time-frequency magnitude masking for speech separation,","venue":null,"work_id":"d801100b-7d27-42ce-a89e-4a860bddd2ba","year":2019},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-07T14:14:48.835560Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.406508Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:c8d5cb74d3a84a1eb7c3c26f87a4be75723dac33f996dddff262c7d55a8245c1","observation_id":"75bdcf37-727d-4132-8a8d-0786387e5952","resolution":{"observed_at":"2026-08-07T14:22:08.028706Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:08.012838Z","title":"Wham!: Extending speech separation to noisy environments,","venue":null,"work_id":"91552f88-a99b-4178-8c82-d2bb06d36e8e","year":2019},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-07T14:14:48.835560Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.410086Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:430e30a5802756c7fa08439fc4b1dbaf5234b80512ed79aa9e5ba81283d3c1eb","observation_id":"4918245f-567b-4278-be56-986fac214ce5","resolution":{"observed_at":"2026-08-07T14:22:08.017035Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:08.001558Z","title":"Librispeech: An ASR corpus based on public domain audio books,","venue":null,"work_id":"88b45c7a-a362-47d4-995a-72e74766842d","year":2015},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-07T14:14:48.835560Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.413724Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:01dd32d7ec903daa9202e23c72830473dee62de7817340d93e26d736c8ed02f3","observation_id":"79627c97-0cab-4265-9437-c08bde14e8bb","resolution":{"observed_at":"2026-08-07T14:22:08.005422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:07.987914Z","title":"Improving speaker discrimination of target speech extraction with time-domain speakerbeam,","venue":null,"work_id":"665864a4-e3e5-4a63-9f9f-34f16a620648","year":2020},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-07T14:14:48.835560Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.417535Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:b670189ba45e8d4eeb23e0a27306f6db33bc54196b7de0976e8b0c1603a3fb2b","observation_id":"73d7aa18-fb73-4828-97c6-8dd42e67a898","resolution":{"observed_at":"2026-08-07T14:22:07.993118Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1510.08484","last_updated":"2015-10-28T20:59:04Z","snapshot_observed_at":"2026-07-06T04:34:36.474437Z","submitted_at":"2015-10-28T20:59:04Z","title":"MUSAN: A Music, Speech, and Noise Corpus","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1510.08484","snapshot_observed_at":"2026-08-07T14:22:07.421318Z","title":"MUSAN: A music, speech, and noise corpus,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-07T14:14:48.835560Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.421318Z"},"links":{"cited_paper":"/paper/1510.08484","citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:c37fb3ba3b99d2b4dc38556531c9a263dbb3dbf91e1185d3701efb32b15cc677","observation_id":"7deb9100-49d1-4a44-81eb-7d1dac4d1144","resolution":{"observed_at":"2026-08-07T14:22:07.421318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:07.975318Z","title":"Multichannel audio database in various acoustic environments,","venue":null,"work_id":"e7f95162-a3e6-4fd6-b4f8-38c7181878e9","year":2014},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-07T14:14:48.835560Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.425128Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:e5185ce3646758876a51ceb66aa082fcea9db011fc95d3414f1d423e0e7cf877","observation_id":"d5dd377b-9cfe-4767-b06e-9e8dc831bfbf","resolution":{"observed_at":"2026-08-07T14:22:07.979644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:07.961050Z","title":"The fifth ’chime’ speech separation and recognition challenge: Dataset, task and baselines,","venue":null,"work_id":"6c1e098c-f012-4f74-b436-2c7194c2f698","year":2018},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-07T14:14:48.835560Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.429542Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:eeae45cd0fbb2f35ac340028b7365ec46ba32a85d8b47f33c6531bd1dd43e8bd","observation_id":"6be34bc1-4554-44a6-bbce-60ee64db0d1c","resolution":{"observed_at":"2026-08-07T14:22:07.966005Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01481","last_updated":"2025-03-06T04:11:26Z","snapshot_observed_at":"2026-07-06T19:25:56.114976Z","submitted_at":"2024-10-02T12:33:59Z","title":"SonicSim: A customizable simulation platform for speech processing in moving sound source scenarios","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01481","snapshot_observed_at":"2026-08-07T14:22:07.433411Z","title":"Sonicsim: A customizable simulation platform for speech processing in moving sound source scenarios,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-07T14:14:48.835560Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.433411Z"},"links":{"cited_paper":"/paper/2410.01481","citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:fd7e1bb488a15bfc11afc5e361911eace368a766aa5010ad7a84100d64be1d33","observation_id":"b89ca30e-01c2-46bf-b953-d0904c8f36e3","resolution":{"observed_at":"2026-08-07T14:22:07.433411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:07.943194Z","title":"Perceptual evaluation of speech quality (pesq)-a new method for speech quality assessment of telephone networks and codecs,","venue":null,"work_id":"fcbc2c7c-c25d-452a-973f-feb6611e31ff","year":2001},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-07T14:14:48.835560Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.437013Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:74a4be2a0a9abfaa3d0998e8551bcb30187d2aee80f1a26cc50d22fff2bad1e0","observation_id":"35abf0fb-854c-4bf8-ae44-0209e167cd0d","resolution":{"observed_at":"2026-08-07T14:22:07.951031Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:07.924483Z","title":"An algorithm for predicting the intelligibility of speech masked by modulated noise maskers,","venue":null,"work_id":"0d5d72c4-f881-4cdf-b852-376a1b54cc3a","year":2009},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-07T14:14:48.835560Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.440926Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:8f90a2515ca7f53acea74f6310b89fa3149d5cb0df85586a5f819da5a778173a","observation_id":"e24fe973-e9ee-44e8-88a7-9561bd4b5938","resolution":{"observed_at":"2026-08-07T14:22:07.931359Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:07.902732Z","title":"Dnsmos P.835: A non- intrusive perceptual objective speech quality metric to evaluate noise suppressors,","venue":null,"work_id":"74e93a66-d80e-4a4c-9b89-b5f1f5e6c97d","year":2022},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-07T14:14:48.835560Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.445060Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:05314666357b2906433c61a9cc9fe27dfc587f65b2bb094043ac2206d8223682","observation_id":"9ca04559-6a14-4eb9-95b6-5a04d202f30a","resolution":{"observed_at":"2026-08-07T14:22:07.911881Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:07.883872Z","title":"Robust speech recognition via large-scale weak supervision,","venue":null,"work_id":"7c7c84a2-bd76-45af-b154-a60f47351155","year":2023},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-07T14:14:48.835560Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.453503Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:c20ee2702176923dae2cd6aa8cbbc535e9ea6153ecb7cf5ac267942e2e8b208d","observation_id":"a04353fe-156d-442a-ba94-d5b2718ed1be","resolution":{"observed_at":"2026-08-07T14:22:07.888087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:07.457443Z","title":"Wavlm: Large-scale self-supervised pre- training for full stack speech processing,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-07T14:14:48.835560Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.457443Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:ee0741cdaab87827ff95e1adee168ce863112954f404b0a4ebf7cfc564040f3a","observation_id":"7f382b3e-dce3-42ac-8325-5ba18d26efb8","resolution":{"observed_at":"2026-08-07T14:22:07.457443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16126","last_updated":"2024-08-28T20:26:34Z","snapshot_observed_at":"2026-07-06T19:07:20.444206Z","submitted_at":"2024-08-28T20:26:34Z","title":"Improving Generalization of Speech Separation in Real-World Scenarios: Strategies in Simulation, Optimization, and Evaluation","version":1},"cited_work":{"arxiv_id":"2408.16126","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.16126","snapshot_observed_at":"2026-08-07T14:22:07.526652Z","title":"Improving Generalization of Speech Separation in Real-World Scenarios: Strategies in Simulation, Optimization, and Evaluation","venue":"cs.SD","work_id":"408f827a-8617-4f08-b3bd-d37c512a778e","year":2024},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-07T14:14:48.835560Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.460985Z"},"links":{"cited_paper":"/paper/2408.16126","citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:36877a8454e283749ebcfa27420f669bd728b0bca0a0b61a704723402c908e4e","observation_id":"e5c1acbc-6245-400f-8509-f8751ee5b120","resolution":{"observed_at":"2026-08-07T14:22:07.533270Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-07T14:22:07.466008Z","title":"Classifier-free diffusion guidance,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-07T14:14:48.835560Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.466008Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:daaa1b9a79c1eb17a187a940dc81699c49a724b1884244fc67567a2126ecc715","observation_id":"31812576-3bd2-4f26-836a-81dda307c00c","resolution":{"observed_at":"2026-08-07T14:22:07.466008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:07.865629Z","title":"Photorealistic text-to-image diffusion models with deep language understanding,","venue":null,"work_id":"4755ad06-888f-4844-8245-620e6b8c5ae3","year":null},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-07T14:14:48.835560Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.470504Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:4523c4be7cf7bb2046ae33e4dcaa3355d8fa57c88e9eeaed617c2b96a89b1519","observation_id":"2da558ad-64b7-47c4-b910-1665ea66ae00","resolution":{"observed_at":"2026-08-07T14:22:07.869297Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:07.852499Z","title":"Available: https://openreview.net/forum?id=08Yk-n5l2Al","venue":null,"work_id":"15ed2535-8b10-4ebd-820a-3a448a62a776","year":null},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-07T14:14:48.835560Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.475291Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:3d0e75fc5206e65b3d24aeeb934603dc15e13d7c430483614788828bc1f27139","observation_id":"6f599b9a-c3e8-4b82-9d3d-e8ebea2852e9","resolution":{"observed_at":"2026-08-07T14:22:07.857925Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:07.449434Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-07T14:14:48.835560Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.449434Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:5d8b77deb366749987c9f3d945e4b5f2a02c4531c47ee5632072300bb942dd27","observation_id":"f9ec7a85-4eca-4bf2-b7a6-cc964b864693","resolution":{"observed_at":"2026-08-07T14:22:07.449434Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","latest_version":3,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-07T14:14:48.835560Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline"},"reference_resolution":{"displayed":80,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":17,"verified_exact":7,"verified_fuzzy":55},"total_outbound_references":80},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 80 of 80 outbound references and 3 inbound Pith citation observations for arXiv:2505.19314."}