{"as_of":"2026-08-08T12:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ec089a72f9d193fcd53d8401195034f0dba6a2dc179394240f92869d4a4bf151","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:11:24.534728Z","state":"measured"},{"denominator":52,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":52,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":7,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:11:24.362189Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T13:08:08.743449Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.19398","last_updated":"2025-06-24T08:01:33Z","snapshot_observed_at":"2026-08-07T06:16:42.699266Z","submitted_at":"2025-06-24T08:01:33Z","title":"ClearerVoice-Studio: Bridging Advanced Speech Processing Research and Practical Deployment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.19398","snapshot_observed_at":"2026-08-06T23:11:24.362189Z","title":"2https://github.com/resemble-ai/resemble-enhance arXiv:2506.19398v1 [cs.SD] 24 Jun 2025 2.1","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.19398","last_updated":"2025-06-24T08:01:33Z","snapshot_observed_at":"2026-08-07T06:16:42.699266Z","submitted_at":"2025-06-24T08:01:33Z","title":"ClearerVoice-Studio: Bridging Advanced Speech Processing Research and Practical Deployment","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T23:11:24.362189Z"},"links":{"cited_paper":"/paper/2506.19398","citing_paper":"/paper/2506.19398"},"observation_digest":"sha256:bb007aa4970f73650a2ca284fa3f38f2a7d0aab6da2a225c254162ff170204d0","observation_id":"714fd3b6-e2d1-45c8-b151-2d020951eb2c","resolution":{"observed_at":"2026-08-06T23:11:24.362189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19398","last_updated":"2025-06-24T08:01:33Z","snapshot_observed_at":"2026-08-07T06:16:42.699266Z","submitted_at":"2025-06-24T08:01:33Z","title":"ClearerVoice-Studio: Bridging Advanced Speech Processing Research and Practical Deployment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.19398","snapshot_observed_at":"2026-08-02T19:39:50.604200Z","title":"Clearervoice-studio: Bridging advanced speech processing research and practical deployment,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.01530","last_updated":"2026-06-29T12:25:41Z","snapshot_observed_at":"2026-08-08T04:36:38.509410Z","submitted_at":"2026-03-02T07:00:48Z","title":"CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T19:39:50.604200Z"},"links":{"cited_paper":"/paper/2506.19398","citing_paper":"/paper/2603.01530"},"observation_digest":"sha256:715298005b3a4f9b228e822d255830e7fd74963d2175f78c815b6875fde450f4","observation_id":"02546d07-92d4-4255-a078-45e13b8b6517","resolution":{"observed_at":"2026-08-02T19:39:50.604200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19398","last_updated":"2025-06-24T08:01:33Z","snapshot_observed_at":"2026-08-07T06:16:42.699266Z","submitted_at":"2025-06-24T08:01:33Z","title":"ClearerVoice-Studio: Bridging Advanced Speech Processing Research and Practical Deployment","version":1},"cited_work":{"arxiv_id":"2506.19398","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.19398","snapshot_observed_at":"2026-07-03T13:08:08.743449Z","title":"arXiv preprint arXiv:2506.19398 , year=","venue":null,"work_id":"90e42749-71ac-4c88-a9b3-267735668d70","year":2025},"citing_paper":{"arxiv_id":"2604.10367","last_updated":"2026-04-11T22:34:21Z","snapshot_observed_at":"2026-08-04T17:39:32.698422Z","submitted_at":"2026-04-11T22:34:21Z","title":"Beyond Monologue: Interactive Talking-Listening Avatar Generation with Conversational Audio Context-Aware Kernels","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-10T15:16:53.603971Z"},"links":{"cited_paper":"/paper/2506.19398","citing_paper":"/paper/2604.10367"},"observation_digest":"sha256:f429f3e51af72ba19c6a0cf20603149d0efd4857a430bd9aef42e992641881af","observation_id":"54563704-4c79-430a-bd33-33beede6abb6","resolution":{"observed_at":"2026-05-11T10:56:01.909103Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19398","last_updated":"2025-06-24T08:01:33Z","snapshot_observed_at":"2026-08-07T06:16:42.699266Z","submitted_at":"2025-06-24T08:01:33Z","title":"ClearerVoice-Studio: Bridging Advanced Speech Processing Research and Practical Deployment","version":1},"cited_work":{"arxiv_id":"2506.19398","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.19398","snapshot_observed_at":"2026-07-03T13:08:08.743449Z","title":"arXiv preprint arXiv:2506.19398 , year=","venue":null,"work_id":"90e42749-71ac-4c88-a9b3-267735668d70","year":2025},"citing_paper":{"arxiv_id":"2604.15923","last_updated":"2026-04-17T10:28:21Z","snapshot_observed_at":"2026-07-06T23:03:21.422544Z","submitted_at":"2026-04-17T10:28:21Z","title":"Hierarchical Codec Diffusion for Video-to-Speech Generation","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-10T08:12:01.260833Z"},"links":{"cited_paper":"/paper/2506.19398","citing_paper":"/paper/2604.15923"},"observation_digest":"sha256:bd97da66f94228f2c6fa793fb1ed6788187bfbe9ce1c3f5e8d0d0a89efe9c69a","observation_id":"deafe58a-e056-440e-8781-a9f84efcd48a","resolution":{"observed_at":"2026-05-10T08:12:26.283645Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19398","last_updated":"2025-06-24T08:01:33Z","snapshot_observed_at":"2026-08-07T06:16:42.699266Z","submitted_at":"2025-06-24T08:01:33Z","title":"ClearerVoice-Studio: Bridging Advanced Speech Processing Research and Practical Deployment","version":1},"cited_work":{"arxiv_id":"2506.19398","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.19398","snapshot_observed_at":"2026-07-03T13:08:08.743449Z","title":"arXiv preprint arXiv:2506.19398 , year=","venue":null,"work_id":"90e42749-71ac-4c88-a9b3-267735668d70","year":2025},"citing_paper":{"arxiv_id":"2605.17225","last_updated":"2026-05-17T02:13:58Z","snapshot_observed_at":"2026-08-07T09:09:04.903896Z","submitted_at":"2026-05-17T02:13:58Z","title":"Can Large Audio Language Models Ignore Multilingual Distractors? An Evaluation of Their Selective Auditory Attention Capabilities","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-05-19T23:17:08.124240Z"},"links":{"cited_paper":"/paper/2506.19398","citing_paper":"/paper/2605.17225"},"observation_digest":"sha256:03e63f72f0aa80c5b48cbc650687b56ed84bbcc3a9f003e1c2a230630f7cfc14","observation_id":"c8e55c73-53a0-4cd6-8931-5862900542ea","resolution":{"observed_at":"2026-05-19T23:17:57.459132Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19398","last_updated":"2025-06-24T08:01:33Z","snapshot_observed_at":"2026-08-07T06:16:42.699266Z","submitted_at":"2025-06-24T08:01:33Z","title":"ClearerVoice-Studio: Bridging Advanced Speech Processing Research and Practical Deployment","version":1},"cited_work":{"arxiv_id":"2506.19398","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.19398","snapshot_observed_at":"2026-07-03T13:08:08.743449Z","title":"arXiv preprint arXiv:2506.19398 , year=","venue":null,"work_id":"90e42749-71ac-4c88-a9b3-267735668d70","year":2025},"citing_paper":{"arxiv_id":"2606.11828","last_updated":"2026-06-10T09:06:37Z","snapshot_observed_at":"2026-08-02T14:52:50.946409Z","submitted_at":"2026-06-10T09:06:37Z","title":"Feature-Aligned Speech Watermarking for Robustness to Reconstruction Distortions","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-27T08:27:00.881610Z"},"links":{"cited_paper":"/paper/2506.19398","citing_paper":"/paper/2606.11828"},"observation_digest":"sha256:1a486aba77657f80446f63471572453b5509a065e3494d1cb71f505861735fa5","observation_id":"6c4486fa-1b94-4290-bd04-2b0d6369226b","resolution":{"observed_at":"2026-07-03T13:08:08.745045Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19398","last_updated":"2025-06-24T08:01:33Z","snapshot_observed_at":"2026-08-07T06:16:42.699266Z","submitted_at":"2025-06-24T08:01:33Z","title":"ClearerVoice-Studio: Bridging Advanced Speech Processing Research and Practical Deployment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.19398","snapshot_observed_at":"2026-07-14T06:37:05.257817Z","title":"Clearervoice-studio: Bridging advanced speech processing research and practical deployment,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11157","last_updated":"2026-07-13T06:51:12Z","snapshot_observed_at":"2026-07-30T05:02:25.925930Z","submitted_at":"2026-07-13T06:51:12Z","title":"Where Speech Enhancement Hurts Recognition: An Inference Time Polar Projection Diagnosis","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-14T06:37:05.257817Z"},"links":{"cited_paper":"/paper/2506.19398","citing_paper":"/paper/2607.11157"},"observation_digest":"sha256:644db6b1394c978d79f48346e78a94e2622535a9098362c2babaad28c33bff21","observation_id":"f08e5579-001a-4a99-96e0-c7ceb8cf0d7d","resolution":{"observed_at":"2026-07-14T06:37:05.257817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.19398/citation-record","integrity":"/paper/2506.19398/integrity","json":"/paper/2506.19398/citation-record.json","paper":"/paper/2506.19398"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:11:25.123122Z","title":"While crucial for these applications, ac- curately processing speech is challenged by the often degraded quality of real-world audio","venue":null,"work_id":"60689c21-4aa9-4486-b566-6f20ed5e822a","year":null},"citing_paper":{"arxiv_id":"2506.19398","last_updated":"2025-06-24T08:01:33Z","snapshot_observed_at":"2026-08-07T06:16:42.699266Z","submitted_at":"2025-06-24T08:01:33Z","title":"ClearerVoice-Studio: Bridging Advanced Speech Processing Research and Practical Deployment","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T23:11:24.356498Z"},"links":{"citing_paper":"/paper/2506.19398"},"observation_digest":"sha256:6de7c634a7663c3e24d513f3887fadc14706807a543cf980afe9fcd19f67750f","observation_id":"69262a98-01cc-4375-8be0-ce2617879210","resolution":{"observed_at":"2026-08-06T23:11:25.131306Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19398","last_updated":"2025-06-24T08:01:33Z","snapshot_observed_at":"2026-08-07T06:16:42.699266Z","submitted_at":"2025-06-24T08:01:33Z","title":"ClearerVoice-Studio: Bridging Advanced Speech Processing Research and Practical Deployment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.19398","snapshot_observed_at":"2026-08-06T23:11:24.362189Z","title":"2https://github.com/resemble-ai/resemble-enhance arXiv:2506.19398v1 [cs.SD] 24 Jun 2025 2.1","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.19398","last_updated":"2025-06-24T08:01:33Z","snapshot_observed_at":"2026-08-07T06:16:42.699266Z","submitted_at":"2025-06-24T08:01:33Z","title":"ClearerVoice-Studio: Bridging Advanced Speech Processing Research and Practical Deployment","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T23:11:24.362189Z"},"links":{"cited_paper":"/paper/2506.19398","citing_paper":"/paper/2506.19398"},"observation_digest":"sha256:bb007aa4970f73650a2ca284fa3f38f2a7d0aab6da2a225c254162ff170204d0","observation_id":"714fd3b6-e2d1-45c8-b151-2d020951eb2c","resolution":{"observed_at":"2026-08-06T23:11:24.362189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:11:25.106698Z","title":"Training strategies 3.1.1","venue":null,"work_id":"42324e90-4ffc-44a2-a233-5a2807b6931e","year":2020},"citing_paper":{"arxiv_id":"2506.19398","last_updated":"2025-06-24T08:01:33Z","snapshot_observed_at":"2026-08-07T06:16:42.699266Z","submitted_at":"2025-06-24T08:01:33Z","title":"ClearerVoice-Studio: Bridging Advanced Speech Processing Research and Practical Deployment","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T23:11:24.366582Z"},"links":{"citing_paper":"/paper/2506.19398"},"observation_digest":"sha256:0942162f6bd9f79712125ed891b028b621eba8572bbca3e1d32a5ebff4a35e5e","observation_id":"ffbe1fee-e561-42d0-b535-2900b9f5f465","resolution":{"observed_at":"2026-08-06T23:11:25.112661Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:11:25.088894Z","title":"Beyond the presented evaluations, ClearerV oice- Studio is available for live demos on HuggingFace and Mod- elScope, enabling users to experiment with real-world record- ings","venue":null,"work_id":"90d4e00f-b083-42a0-b7e3-8babee99371a","year":null},"citing_paper":{"arxiv_id":"2506.19398","last_updated":"2025-06-24T08:01:33Z","snapshot_observed_at":"2026-08-07T06:16:42.699266Z","submitted_at":"2025-06-24T08:01:33Z","title":"ClearerVoice-Studio: Bridging Advanced Speech Processing Research and Practical Deployment","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T23:11:24.371021Z"},"links":{"citing_paper":"/paper/2506.19398"},"observation_digest":"sha256:6d44cce39c8d7c707bd384d0391fd7bc3ff73408dc5e328d973f1a6a93192e91","observation_id":"72b8ed4b-36ef-4577-8a86-85b840ff6436","resolution":{"observed_at":"2026-08-06T23:11:25.095263Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:11:25.072741Z","title":"Deep learning for audio signal processing,","venue":null,"work_id":"c87a9eb8-2459-415c-86e4-36d83457f9c5","year":2019},"citing_paper":{"arxiv_id":"2506.19398","last_updated":"2025-06-24T08:01:33Z","snapshot_observed_at":"2026-08-07T06:16:42.699266Z","submitted_at":"2025-06-24T08:01:33Z","title":"ClearerVoice-Studio: Bridging Advanced Speech Processing Research and Practical Deployment","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T23:11:24.376338Z"},"links":{"citing_paper":"/paper/2506.19398"},"observation_digest":"sha256:6f6c33c5881fde83b6a27f097cd1f0839f24b0c80572f781875eebc8080fa1a5","observation_id":"641f26e5-0e0d-4eb6-aae4-80b3166b30ec","resolution":{"observed_at":"2026-08-06T23:11:25.078020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12609","last_updated":"2025-04-27T05:17:15Z","snapshot_observed_at":"2026-07-06T18:17:12.404441Z","submitted_at":"2024-05-21T09:04:48Z","title":"Mamba in Speech: Towards an Alternative to Self-Attention","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12609","snapshot_observed_at":"2026-08-06T23:11:24.380674Z","title":"Mamba in Speech: Towards an alternative to self-attention,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.19398","last_updated":"2025-06-24T08:01:33Z","snapshot_observed_at":"2026-08-07T06:16:42.699266Z","submitted_at":"2025-06-24T08:01:33Z","title":"ClearerVoice-Studio: Bridging Advanced Speech Processing Research and Practical Deployment","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T23:11:24.380674Z"},"links":{"cited_paper":"/paper/2405.12609","citing_paper":"/paper/2506.19398"},"observation_digest":"sha256:2f0e978d6705cf8a2d099a04d49ff88b802a4b18cd5c791b5205ef09dbbb7e54","observation_id":"84304d9c-cd5d-423d-9c93-b1b942667db1","resolution":{"observed_at":"2026-08-06T23:11:24.380674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:11:25.057124Z","title":"DeepMMSE: A deep learning approach to mmse-based noise power spectral density estimation,","venue":null,"work_id":"52d758ac-c1bc-4542-8f0b-02adccf7ed75","year":2020},"citing_paper":{"arxiv_id":"2506.19398","last_updated":"2025-06-24T08:01:33Z","snapshot_observed_at":"2026-08-07T06:16:42.699266Z","submitted_at":"2025-06-24T08:01:33Z","title":"ClearerVoice-Studio: Bridging Advanced Speech Processing Research and Practical Deployment","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T23:11:24.385499Z"},"links":{"citing_paper":"/paper/2506.19398"},"observation_digest":"sha256:d8c2bffd4bd56e84e8f9d7d93835717345e8ed10b50735d8296868c0ffd0deb7","observation_id":"6082d4d3-b631-4c69-ad1b-0d83a76af01a","resolution":{"observed_at":"2026-08-06T23:11:25.063117Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:11:25.040674Z","title":"SpeechBrain: A general-purpose speech toolkit,","venue":null,"work_id":"4adb950e-6dd1-4ecc-9d99-8b9f6aca90a5","year":null},"citing_paper":{"arxiv_id":"2506.19398","last_updated":"2025-06-24T08:01:33Z","snapshot_observed_at":"2026-08-07T06:16:42.699266Z","submitted_at":"2025-06-24T08:01:33Z","title":"ClearerVoice-Studio: Bridging Advanced Speech Processing Research and Practical Deployment","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T23:11:24.389448Z"},"links":{"citing_paper":"/paper/2506.19398"},"observation_digest":"sha256:02b123f8fd6a711171ee30acfdb5f42133554ad14a1ec31bd47eaeb59c81d553","observation_id":"2a35cea7-d23a-4042-93f2-bdc8a40e17dd","resolution":{"observed_at":"2026-08-06T23:11:25.047106Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:11:24.974013Z","title":"AudioSR: Versatile audio super-resolution at scale,","venue":null,"work_id":"305fbd4b-1a7f-4fa4-b6db-c4be037c92b9","year":2024},"citing_paper":{"arxiv_id":"2506.19398","last_updated":"2025-06-24T08:01:33Z","snapshot_observed_at":"2026-08-07T06:16:42.699266Z","submitted_at":"2025-06-24T08:01:33Z","title":"ClearerVoice-Studio: Bridging Advanced Speech Processing Research and Practical Deployment","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T23:11:24.416110Z"},"links":{"citing_paper":"/paper/2506.19398"},"observation_digest":"sha256:e58d0ec1501c05eb93729563f87050e78c463195f492441a0f7ab4d10b8313eb","observation_id":"651b4301-b4e2-413f-8fbd-95a5ae5587c8","resolution":{"observed_at":"2026-08-06T23:11:24.978245Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:11:25.028705Z","title":"ESPnet: End-to-end speech processing toolkit,","venue":null,"work_id":"81364d82-09c5-40c5-8fac-ff08f7996ee8","year":2018},"citing_paper":{"arxiv_id":"2506.19398","last_updated":"2025-06-24T08:01:33Z","snapshot_observed_at":"2026-08-07T06:16:42.699266Z","submitted_at":"2025-06-24T08:01:33Z","title":"ClearerVoice-Studio: Bridging Advanced Speech Processing Research and Practical Deployment","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T23:11:24.399073Z"},"links":{"citing_paper":"/paper/2506.19398"},"observation_digest":"sha256:033230f043b8180974db4d7ce07f4f27986c1daa4a1e525b000de7380ced1cc7","observation_id":"0a8da161-6948-4863-9ea9-090d76f982a9","resolution":{"observed_at":"2026-08-06T23:11:25.032797Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:11:25.015670Z","title":"Summary on the multimodal information-based speech processing 2023 challenge,","venue":null,"work_id":"9d3e2405-c3cf-4456-bb72-6351e7dd7977","year":2023},"citing_paper":{"arxiv_id":"2506.19398","last_updated":"2025-06-24T08:01:33Z","snapshot_observed_at":"2026-08-07T06:16:42.699266Z","submitted_at":"2025-06-24T08:01:33Z","title":"ClearerVoice-Studio: Bridging Advanced Speech Processing Research and Practical Deployment","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T23:11:24.403507Z"},"links":{"citing_paper":"/paper/2506.19398"},"observation_digest":"sha256:a3c05ad7c509615a6bbe05da2d9f4af3ed66deb98dc82beb2d69cf3332f4dab6","observation_id":"d4baf6c7-b9da-4399-9bab-d6526be4a8df","resolution":{"observed_at":"2026-08-06T23:11:25.020116Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:11:25.001604Z","title":"As- teroid: the PyTorch-based audio source separation toolkit for re- searchers,","venue":null,"work_id":"7e1d6945-3c42-42b0-8e63-0f61c43787fa","year":2020},"citing_paper":{"arxiv_id":"2506.19398","last_updated":"2025-06-24T08:01:33Z","snapshot_observed_at":"2026-08-07T06:16:42.699266Z","submitted_at":"2025-06-24T08:01:33Z","title":"ClearerVoice-Studio: Bridging Advanced Speech Processing Research and Practical Deployment","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T23:11:24.407313Z"},"links":{"citing_paper":"/paper/2506.19398"},"observation_digest":"sha256:5034eb1e9b3f85ce00186c3c23beffcb1f517b124ed9690274b7deec432eccf8","observation_id":"51bb2732-9407-4c47-a76c-6aebd1a7ea79","resolution":{"observed_at":"2026-08-06T23:11:25.007293Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:11:24.988248Z","title":"DeepFilterNet: Perceptually motivated real-time speech en- hancement,","venue":null,"work_id":"149967a9-3302-429e-8c7b-9c45bfd82128","year":2023},"citing_paper":{"arxiv_id":"2506.19398","last_updated":"2025-06-24T08:01:33Z","snapshot_observed_at":"2026-08-07T06:16:42.699266Z","submitted_at":"2025-06-24T08:01:33Z","title":"ClearerVoice-Studio: Bridging Advanced Speech Processing Research and Practical Deployment","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T23:11:24.411596Z"},"links":{"citing_paper":"/paper/2506.19398"},"observation_digest":"sha256:59bf41ab505b4fa02c31e6b673be36ebaa0a0dc4488db78fe4fbd9b10fef242d","observation_id":"95a7cd92-8c58-4079-bed2-62ae14bd37ca","resolution":{"observed_at":"2026-08-06T23:11:24.993239Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:11:24.911063Z","title":"Hifi-SR: A unified generative transformer-convolutional adversarial net- work for high-fidelity speech super-resolution,","venue":null,"work_id":"6ef89422-c1ea-4bc6-bb7f-e9c508dd8511","year":2025},"citing_paper":{"arxiv_id":"2506.19398","last_updated":"2025-06-24T08:01:33Z","snapshot_observed_at":"2026-08-07T06:16:42.699266Z","submitted_at":"2025-06-24T08:01:33Z","title":"ClearerVoice-Studio: Bridging Advanced Speech Processing Research and Practical Deployment","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T23:11:24.435224Z"},"links":{"citing_paper":"/paper/2506.19398"},"observation_digest":"sha256:33bc3f5fa84432a1e62947af7aa0562e70773a56acc2ad50baac3cabd241c2c3","observation_id":"cc184939-26b3-4313-8d7f-57dec752ac13","resolution":{"observed_at":"2026-08-06T23:11:24.915062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:11:24.960323Z","title":"FlowA VSE: Ef- ficient audio-visual speech enhancement with conditional flow matching,","venue":null,"work_id":"6b28c9b5-bf26-4c63-a5b7-ac359eecb0c2","year":2024},"citing_paper":{"arxiv_id":"2506.19398","last_updated":"2025-06-24T08:01:33Z","snapshot_observed_at":"2026-08-07T06:16:42.699266Z","submitted_at":"2025-06-24T08:01:33Z","title":"ClearerVoice-Studio: Bridging Advanced Speech Processing Research and Practical Deployment","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T23:11:24.420128Z"},"links":{"citing_paper":"/paper/2506.19398"},"observation_digest":"sha256:9d600f522229fc78e7bb41e5353f8f28d7659903c1602fa302fe677b4b04118b","observation_id":"b444fbaa-fe93-4bfe-8501-0343628453ef","resolution":{"observed_at":"2026-08-06T23:11:24.964648Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:11:24.945842Z","title":"FRCRN: Boosting feature representation using frequency recurrence for monaural speech enhancement,","venue":null,"work_id":"b948c306-0b65-4027-ade0-11449d2e7126","year":2022},"citing_paper":{"arxiv_id":"2506.19398","last_updated":"2025-06-24T08:01:33Z","snapshot_observed_at":"2026-08-07T06:16:42.699266Z","submitted_at":"2025-06-24T08:01:33Z","title":"ClearerVoice-Studio: Bridging Advanced Speech Processing Research and Practical Deployment","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T23:11:24.424200Z"},"links":{"citing_paper":"/paper/2506.19398"},"observation_digest":"sha256:67e68312ecee2e4a2e21cac97da4442135133940637438d3b02a5cbd0a42dadd","observation_id":"60e16eda-03ee-4f93-af38-77890af77535","resolution":{"observed_at":"2026-08-06T23:11:24.950815Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:11:24.933459Z","title":"MossFormer2: Combin- ing transformer and rnn-free recurrent network for enhanced time- domain monaural speech separation,","venue":null,"work_id":"d0497fc7-274e-4071-99aa-2adb5421d7ef","year":2024},"citing_paper":{"arxiv_id":"2506.19398","last_updated":"2025-06-24T08:01:33Z","snapshot_observed_at":"2026-08-07T06:16:42.699266Z","submitted_at":"2025-06-24T08:01:33Z","title":"ClearerVoice-Studio: Bridging Advanced Speech Processing Research and Practical Deployment","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T23:11:24.427496Z"},"links":{"citing_paper":"/paper/2506.19398"},"observation_digest":"sha256:87cdc3b88129a05207e8bdf830ebb4e35a2af2b4decce7d90feabe11af8b45ef","observation_id":"f9a92ae9-a8d1-46e3-9c7c-c7226a044498","resolution":{"observed_at":"2026-08-06T23:11:24.937368Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:11:24.922861Z","title":"MossFormer: Pushing the performance limit of monaural speech separation using gated single-head trans- former with convolution-augmented joint self-attentions,","venue":null,"work_id":"43c271e9-ce90-44dd-b39e-523fc7b6e977","year":2023},"citing_paper":{"arxiv_id":"2506.19398","last_updated":"2025-06-24T08:01:33Z","snapshot_observed_at":"2026-08-07T06:16:42.699266Z","submitted_at":"2025-06-24T08:01:33Z","title":"ClearerVoice-Studio: Bridging Advanced Speech Processing Research and Practical Deployment","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T23:11:24.431574Z"},"links":{"citing_paper":"/paper/2506.19398"},"observation_digest":"sha256:aeedd16b60d3f58924b389864a565c7c966556c6be73555bcb52322c32ef096e","observation_id":"3f76367b-dfd3-42af-8818-5c8d59f4bbf4","resolution":{"observed_at":"2026-08-06T23:11:24.926695Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.14303","last_updated":"2023-07-26T17:07:27Z","snapshot_observed_at":"2026-07-06T15:58:51.597795Z","submitted_at":"2023-07-26T17:07:27Z","title":"NeuroHeed: Neuro-Steered Speaker Extraction using EEG Signals","version":1},"cited_work":{"arxiv_id":"2307.14303","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.14303","snapshot_observed_at":"2026-08-06T23:11:24.579686Z","title":"NeuroHeed: Neuro-Steered Speaker Extraction using EEG Signals","venue":"eess.AS","work_id":"3583e0dd-0e8f-4426-8da6-3133e1241e7a","year":2023},"citing_paper":{"arxiv_id":"2506.19398","last_updated":"2025-06-24T08:01:33Z","snapshot_observed_at":"2026-08-07T06:16:42.699266Z","submitted_at":"2025-06-24T08:01:33Z","title":"ClearerVoice-Studio: Bridging Advanced Speech Processing Research and Practical Deployment","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T23:11:24.452262Z"},"links":{"cited_paper":"/paper/2307.14303","citing_paper":"/paper/2506.19398"},"observation_digest":"sha256:18a91cfa675bd67c53b10efe7736e518f01b06352535e8e71e4ddb96d2c6a99a","observation_id":"5658879f-5b6d-49b8-a6d9-67f991f513c3","resolution":{"observed_at":"2026-08-06T23:11:24.586002Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:11:24.898812Z","title":"HiFi-GAN: Generative adversarial networks for efficient and high fidelity speech synthesis,","venue":null,"work_id":"59263000-ecd7-48ae-bf83-444186dcd8ae","year":2020},"citing_paper":{"arxiv_id":"2506.19398","last_updated":"2025-06-24T08:01:33Z","snapshot_observed_at":"2026-08-07T06:16:42.699266Z","submitted_at":"2025-06-24T08:01:33Z","title":"ClearerVoice-Studio: Bridging Advanced Speech Processing Research and Practical Deployment","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T23:11:24.438524Z"},"links":{"citing_paper":"/paper/2506.19398"},"observation_digest":"sha256:87006e852747091f76592d89206b9d41057078ceca5025681dcabcec6a7d62a4","observation_id":"de92d52c-4bf6-4860-8822-ba96854e3fe5","resolution":{"observed_at":"2026-08-06T23:11:24.902975Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:11:24.886217Z","title":"Scenario-aware audio-visual TF- Gridnet for target speech extraction,","venue":null,"work_id":"693d7dcb-ac28-4f38-9f48-7bbcd5ea6554","year":2023},"citing_paper":{"arxiv_id":"2506.19398","last_updated":"2025-06-24T08:01:33Z","snapshot_observed_at":"2026-08-07T06:16:42.699266Z","submitted_at":"2025-06-24T08:01:33Z","title":"ClearerVoice-Studio: Bridging Advanced Speech Processing Research and Practical Deployment","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T23:11:24.441735Z"},"links":{"citing_paper":"/paper/2506.19398"},"observation_digest":"sha256:5c49501a4586f53911f9cedb50aec899d0854af1f7b123ec9ca9e6045ab0d3b1","observation_id":"aabc8ee1-2c97-4e64-aa86-a8da807dc826","resolution":{"observed_at":"2026-08-06T23:11:24.891068Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:11:24.874443Z","title":"Speaker extraction with co-speech gestures cue,","venue":null,"work_id":"5fc6b554-c883-46fc-8250-7f83c0c6cc7e","year":2022},"citing_paper":{"arxiv_id":"2506.19398","last_updated":"2025-06-24T08:01:33Z","snapshot_observed_at":"2026-08-07T06:16:42.699266Z","submitted_at":"2025-06-24T08:01:33Z","title":"ClearerVoice-Studio: Bridging Advanced Speech Processing Research and Practical Deployment","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T23:11:24.445326Z"},"links":{"citing_paper":"/paper/2506.19398"},"observation_digest":"sha256:0f616a4cfd04a830802001e7a8193960ecc49b08ddb684da4405a4dd6c852599","observation_id":"d8c239ae-1c8d-4c32-859d-5764628568ce","resolution":{"observed_at":"2026-08-06T23:11:24.878761Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:11:24.860671Z","title":"SpEx+: A complete time domain speaker extraction network,","venue":null,"work_id":"feb464de-72ff-4400-b7f5-4e6d3b2f3437","year":2020},"citing_paper":{"arxiv_id":"2506.19398","last_updated":"2025-06-24T08:01:33Z","snapshot_observed_at":"2026-08-07T06:16:42.699266Z","submitted_at":"2025-06-24T08:01:33Z","title":"ClearerVoice-Studio: Bridging Advanced Speech Processing Research and Practical Deployment","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T23:11:24.448614Z"},"links":{"citing_paper":"/paper/2506.19398"},"observation_digest":"sha256:fb8b7a935cda22faa1a40c9df164e0a40a213933f1ec6acdffc6ca61891e489f","observation_id":"bac71848-182d-4296-86e5-a0f824999631","resolution":{"observed_at":"2026-08-06T23:11:24.866309Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:11:24.795905Z","title":"DCCRN+: Channel-wise subband dccrn with snr estimation for speech enhancement,","venue":null,"work_id":"ff627a8d-18ff-4cea-8c28-30ab6c98c194","year":2021},"citing_paper":{"arxiv_id":"2506.19398","last_updated":"2025-06-24T08:01:33Z","snapshot_observed_at":"2026-08-07T06:16:42.699266Z","submitted_at":"2025-06-24T08:01:33Z","title":"ClearerVoice-Studio: Bridging Advanced Speech Processing Research and Practical Deployment","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T23:11:24.472350Z"},"links":{"citing_paper":"/paper/2506.19398"},"observation_digest":"sha256:f20586be876525d1e12d42482357a790f471623caef15db7400093e807f00b89","observation_id":"ec631b81-503b-41f1-8a50-b5ab29dfa231","resolution":{"observed_at":"2026-08-06T23:11:24.800145Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:11:24.847713Z","title":"The interspeech 2020 deep noise suppression challenge: Datasets, subjective testing framework, and challenge results,","venue":null,"work_id":"b09ecdbd-7ea3-4b61-9ff1-dd821172a17d","year":2020},"citing_paper":{"arxiv_id":"2506.19398","last_updated":"2025-06-24T08:01:33Z","snapshot_observed_at":"2026-08-07T06:16:42.699266Z","submitted_at":"2025-06-24T08:01:33Z","title":"ClearerVoice-Studio: Bridging Advanced Speech Processing Research and Practical Deployment","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T23:11:24.456214Z"},"links":{"citing_paper":"/paper/2506.19398"},"observation_digest":"sha256:54b743c8c233e739607a0fff6839e5ca96cd3a3cbb2c529a91baffeb505f3e3c","observation_id":"56a28c20-a421-4a64-9fef-8351e699a4d6","resolution":{"observed_at":"2026-08-06T23:11:24.852653Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:11:24.835103Z","title":"CSTR VCTK Corpus: English multi-speaker corpus for cstr voice cloning toolkit (version 0.92),","venue":null,"work_id":"4d17a02f-8a48-457d-9f7a-67d60a5efac6","year":2019},"citing_paper":{"arxiv_id":"2506.19398","last_updated":"2025-06-24T08:01:33Z","snapshot_observed_at":"2026-08-07T06:16:42.699266Z","submitted_at":"2025-06-24T08:01:33Z","title":"ClearerVoice-Studio: Bridging Advanced Speech Processing Research and Practical Deployment","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T23:11:24.459983Z"},"links":{"citing_paper":"/paper/2506.19398"},"observation_digest":"sha256:f3ab0b1242246911f386678856b03c90d22f8718c4a285d26993c54d7e5317f8","observation_id":"3f12de00-69f9-4ec6-9155-361df8278134","resolution":{"observed_at":"2026-08-06T23:11:24.840151Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:11:24.821629Z","title":"Audio set: An ontology and human-labeled dataset for audio events,","venue":null,"work_id":"43c04227-af7a-49b8-a5fc-7894429c9665","year":2017},"citing_paper":{"arxiv_id":"2506.19398","last_updated":"2025-06-24T08:01:33Z","snapshot_observed_at":"2026-08-07T06:16:42.699266Z","submitted_at":"2025-06-24T08:01:33Z","title":"ClearerVoice-Studio: Bridging Advanced Speech Processing Research and Practical Deployment","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T23:11:24.463692Z"},"links":{"citing_paper":"/paper/2506.19398"},"observation_digest":"sha256:d018b59973321c3cdfea4bc8477863a7044253c2e75472260faf10b97157c323","observation_id":"659d3a06-5962-4ebf-b2e5-03c71bfa0038","resolution":{"observed_at":"2026-08-06T23:11:24.825770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:11:24.807337Z","title":"DEMAND: a collection of multi-channel recordings of acoustic noise in diverse environments,","venue":null,"work_id":"228bddfc-2c86-4e0e-9297-d1536dc6d933","year":2013},"citing_paper":{"arxiv_id":"2506.19398","last_updated":"2025-06-24T08:01:33Z","snapshot_observed_at":"2026-08-07T06:16:42.699266Z","submitted_at":"2025-06-24T08:01:33Z","title":"ClearerVoice-Studio: Bridging Advanced Speech Processing Research and Practical Deployment","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T23:11:24.468069Z"},"links":{"citing_paper":"/paper/2506.19398"},"observation_digest":"sha256:e696bc216ef2d396be684a0bdbf229c1dedce6188440f1b025ace23adb41c5e1","observation_id":"95fdaf25-0bc1-40ec-a534-9a7e5ab7d920","resolution":{"observed_at":"2026-08-06T23:11:24.812415Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:11:24.739162Z","title":"Phase- sensitive and recognition-boosted speech separation using deep recurrent neural networks,","venue":null,"work_id":"0be3a479-8ef8-4533-acf8-cda3f15b569e","year":2015},"citing_paper":{"arxiv_id":"2506.19398","last_updated":"2025-06-24T08:01:33Z","snapshot_observed_at":"2026-08-07T06:16:42.699266Z","submitted_at":"2025-06-24T08:01:33Z","title":"ClearerVoice-Studio: Bridging Advanced Speech Processing Research and Practical Deployment","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T23:11:24.492570Z"},"links":{"citing_paper":"/paper/2506.19398"},"observation_digest":"sha256:3d88f969959715375ca256a652f1ee08e1b84e52f8fce47b1cb9163aed7e756d","observation_id":"84ac29bb-be00-47d6-9960-e826474b4b6e","resolution":{"observed_at":"2026-08-06T23:11:24.743338Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:11:24.784642Z","title":"A mask free neural network for monaural speech enhancement,","venue":null,"work_id":"b005e4df-a28c-4a89-8ccf-7c6c71e6f538","year":2023},"citing_paper":{"arxiv_id":"2506.19398","last_updated":"2025-06-24T08:01:33Z","snapshot_observed_at":"2026-08-07T06:16:42.699266Z","submitted_at":"2025-06-24T08:01:33Z","title":"ClearerVoice-Studio: Bridging Advanced Speech Processing Research and Practical Deployment","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T23:11:24.476740Z"},"links":{"citing_paper":"/paper/2506.19398"},"observation_digest":"sha256:c62d15b65eee617f37c0e3fdaf70b197350e9848af5f3e876fdd8839f10cd1e1","observation_id":"ae34a824-1169-40b3-8f35-5e3e3c074c7b","resolution":{"observed_at":"2026-08-06T23:11:24.788296Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:11:24.773348Z","title":"TridentSE: Guiding speech enhancement with 32 global tokens,","venue":null,"work_id":"81cd0ba8-1b77-4ac3-a0f9-43f241857c97","year":2023},"citing_paper":{"arxiv_id":"2506.19398","last_updated":"2025-06-24T08:01:33Z","snapshot_observed_at":"2026-08-07T06:16:42.699266Z","submitted_at":"2025-06-24T08:01:33Z","title":"ClearerVoice-Studio: Bridging Advanced Speech Processing Research and Practical Deployment","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T23:11:24.480847Z"},"links":{"citing_paper":"/paper/2506.19398"},"observation_digest":"sha256:b95946f4c0a4d6d9b590e701ca8c96893afb4e69ed6d0b27775ef44c84eac796","observation_id":"33a9f56d-411a-468a-9246-0760cb623b87","resolution":{"observed_at":"2026-08-06T23:11:24.777289Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:11:24.761464Z","title":"LibriTTS: A corpus derived from librispeech for text- to-speech,","venue":null,"work_id":"86ed0230-5882-4f9d-bd22-f30dad516567","year":2019},"citing_paper":{"arxiv_id":"2506.19398","last_updated":"2025-06-24T08:01:33Z","snapshot_observed_at":"2026-08-07T06:16:42.699266Z","submitted_at":"2025-06-24T08:01:33Z","title":"ClearerVoice-Studio: Bridging Advanced Speech Processing Research and Practical Deployment","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T23:11:24.484737Z"},"links":{"citing_paper":"/paper/2506.19398"},"observation_digest":"sha256:80d0a97c3a7dc83b1c9acc187acaf8bcabee0784c80775f7c6c3bc7028d64901","observation_id":"5ab46bd6-5543-4693-94c5-762f92a30bea","resolution":{"observed_at":"2026-08-06T23:11:24.766236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:11:24.750539Z","title":"Explor- ing strategies for training deep neural networks,","venue":null,"work_id":"0c3e9fae-f8ff-42be-a01a-2c9ba2dba6af","year":2009},"citing_paper":{"arxiv_id":"2506.19398","last_updated":"2025-06-24T08:01:33Z","snapshot_observed_at":"2026-08-07T06:16:42.699266Z","submitted_at":"2025-06-24T08:01:33Z","title":"ClearerVoice-Studio: Bridging Advanced Speech Processing Research and Practical Deployment","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T23:11:24.488634Z"},"links":{"citing_paper":"/paper/2506.19398"},"observation_digest":"sha256:6e39ff9dadba4e0977950368fcae06495a3e970a3c71ec229008da62fc204082","observation_id":"37ab05c7-7c56-42e3-8b87-94489e6e4ff0","resolution":{"observed_at":"2026-08-06T23:11:24.754403Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:11:24.678827Z","title":"An efficient encoder-decoder archi- tecture with top-down attention for speech separation,","venue":null,"work_id":"ba8231c0-74b3-415c-b6b4-46f093b0d76e","year":2023},"citing_paper":{"arxiv_id":"2506.19398","last_updated":"2025-06-24T08:01:33Z","snapshot_observed_at":"2026-08-07T06:16:42.699266Z","submitted_at":"2025-06-24T08:01:33Z","title":"ClearerVoice-Studio: Bridging Advanced Speech Processing Research and Practical Deployment","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T23:11:24.511237Z"},"links":{"citing_paper":"/paper/2506.19398"},"observation_digest":"sha256:830e0e7e45e772bde5bd74038ec10fbbea2543414756b5c4bb6ddf2f2c3bdcff","observation_id":"1a55352d-409e-441e-8e99-b07c8b85bb82","resolution":{"observed_at":"2026-08-06T23:11:24.683161Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:11:24.726700Z","title":"CMGAN: Conformer-based metric gan for speech enhancement,","venue":null,"work_id":"1892c809-6557-415b-a772-7c1014cece51","year":2022},"citing_paper":{"arxiv_id":"2506.19398","last_updated":"2025-06-24T08:01:33Z","snapshot_observed_at":"2026-08-07T06:16:42.699266Z","submitted_at":"2025-06-24T08:01:33Z","title":"ClearerVoice-Studio: Bridging Advanced Speech Processing Research and Practical Deployment","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T23:11:24.496146Z"},"links":{"citing_paper":"/paper/2506.19398"},"observation_digest":"sha256:03698b328cecea41719e03d5f60078efc15579f7a90174023938bd45fa74c59f","observation_id":"a3042b7b-1c2e-4e49-9fcb-38ad66742e36","resolution":{"observed_at":"2026-08-06T23:11:24.730747Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:11:24.714584Z","title":"Permutation invari- ant training of deep models for speaker-independent multi-talker speech separation,","venue":null,"work_id":"e6f84767-a78b-4950-95ea-964cceae7f61","year":2017},"citing_paper":{"arxiv_id":"2506.19398","last_updated":"2025-06-24T08:01:33Z","snapshot_observed_at":"2026-08-07T06:16:42.699266Z","submitted_at":"2025-06-24T08:01:33Z","title":"ClearerVoice-Studio: Bridging Advanced Speech Processing Research and Practical Deployment","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T23:11:24.499581Z"},"links":{"citing_paper":"/paper/2506.19398"},"observation_digest":"sha256:879b23f0e5f2cddb7b3dd777ca49b8606703559daba46dc0ff1e6a61bd756a5e","observation_id":"d3c53e10-c4f2-4b40-953d-c1a1122527eb","resolution":{"observed_at":"2026-08-06T23:11:24.719254Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:11:24.703012Z","title":"Dual-Path RNN: Efficient long sequence modeling for time-domain single-channel speech sepa- ration,","venue":null,"work_id":"6b97ffbc-8a76-4d91-999a-5e21e9850e42","year":2020},"citing_paper":{"arxiv_id":"2506.19398","last_updated":"2025-06-24T08:01:33Z","snapshot_observed_at":"2026-08-07T06:16:42.699266Z","submitted_at":"2025-06-24T08:01:33Z","title":"ClearerVoice-Studio: Bridging Advanced Speech Processing Research and Practical Deployment","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T23:11:24.503833Z"},"links":{"citing_paper":"/paper/2506.19398"},"observation_digest":"sha256:ac914f99982855b69294f95bb09c8c7bdf375770c56a7d10addcb8480d70eb99","observation_id":"9f24950c-a1cd-4283-9cd1-8ab001d8e2c4","resolution":{"observed_at":"2026-08-06T23:11:24.706871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:11:24.690895Z","title":"Attention is all you need in speech separation,","venue":null,"work_id":"de64630a-1571-4fc8-afe8-349e2e9eaea2","year":2021},"citing_paper":{"arxiv_id":"2506.19398","last_updated":"2025-06-24T08:01:33Z","snapshot_observed_at":"2026-08-07T06:16:42.699266Z","submitted_at":"2025-06-24T08:01:33Z","title":"ClearerVoice-Studio: Bridging Advanced Speech Processing Research and Practical Deployment","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T23:11:24.507563Z"},"links":{"citing_paper":"/paper/2506.19398"},"observation_digest":"sha256:b3e166b84d2f0e3a031102b80a1c7660876abd2b68486de6b47fbbbce5921ee3","observation_id":"d376de3c-6851-490f-a8d7-be8a5d857958","resolution":{"observed_at":"2026-08-06T23:11:24.695833Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:11:24.636698Z","title":"Selective listening by synchronizing speech with lips,","venue":null,"work_id":"a8ebcdc7-35af-4bb4-9d5e-ca40e55bea00","year":2022},"citing_paper":{"arxiv_id":"2506.19398","last_updated":"2025-06-24T08:01:33Z","snapshot_observed_at":"2026-08-07T06:16:42.699266Z","submitted_at":"2025-06-24T08:01:33Z","title":"ClearerVoice-Studio: Bridging Advanced Speech Processing Research and Practical Deployment","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T23:11:24.530987Z"},"links":{"citing_paper":"/paper/2506.19398"},"observation_digest":"sha256:246bc51be0b217e525a565e4b41bdfcec18cb2618c9b5dc75abca0f1124b2097","observation_id":"22a3c68e-0b4a-41ee-a4f2-14383c8ead30","resolution":{"observed_at":"2026-08-06T23:11:24.640308Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:11:24.515143Z","title":"TF-GridNet: Making time-frequency domain models great again for monaural speaker separation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.19398","last_updated":"2025-06-24T08:01:33Z","snapshot_observed_at":"2026-08-07T06:16:42.699266Z","submitted_at":"2025-06-24T08:01:33Z","title":"ClearerVoice-Studio: Bridging Advanced Speech Processing Research and Practical Deployment","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T23:11:24.515143Z"},"links":{"citing_paper":"/paper/2506.19398"},"observation_digest":"sha256:a84f6115ee923582fa5abae03d315f16050e5efe2ae7128509beb97432ce734f","observation_id":"07b9b447-c93c-4a44-9e37-c8d9f9885845","resolution":{"observed_at":"2026-08-06T23:11:24.515143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02063","last_updated":"2024-09-10T14:02:58Z","snapshot_observed_at":"2026-07-06T17:54:39.685251Z","submitted_at":"2024-04-02T16:04:31Z","title":"SPMamba: State-space model is all you need in speech separation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02063","snapshot_observed_at":"2026-08-06T23:11:24.519069Z","title":"SPMamba: State-space model is all you need in speech separation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19398","last_updated":"2025-06-24T08:01:33Z","snapshot_observed_at":"2026-08-07T06:16:42.699266Z","submitted_at":"2025-06-24T08:01:33Z","title":"ClearerVoice-Studio: Bridging Advanced Speech Processing Research and Practical Deployment","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T23:11:24.519069Z"},"links":{"cited_paper":"/paper/2404.02063","citing_paper":"/paper/2506.19398"},"observation_digest":"sha256:9214d07b1cd86ecf48366595dc93b22b5dfdaf43d2882a500fa22919b269271d","observation_id":"100526fc-2a2d-40f2-a4e1-ed08c42b5971","resolution":{"observed_at":"2026-08-06T23:11:24.519069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:11:24.659672Z","title":"Time domain audio visual speech separation,","venue":null,"work_id":"7ce5fd55-999f-43d3-8269-2bf91854552d","year":2019},"citing_paper":{"arxiv_id":"2506.19398","last_updated":"2025-06-24T08:01:33Z","snapshot_observed_at":"2026-08-07T06:16:42.699266Z","submitted_at":"2025-06-24T08:01:33Z","title":"ClearerVoice-Studio: Bridging Advanced Speech Processing Research and Practical Deployment","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T23:11:24.523257Z"},"links":{"citing_paper":"/paper/2506.19398"},"observation_digest":"sha256:97fce223acc65fd5e40eba2cfd8820bdd179675a6b36d70cd1c6a15d46b5c1ea","observation_id":"a9606353-6c7f-47a4-a8e3-39ca7e2241b3","resolution":{"observed_at":"2026-08-06T23:11:24.663849Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:11:24.647924Z","title":"MuSE: Multi-modal target speaker extraction with visual cues,","venue":null,"work_id":"a0145d32-e04a-400e-a735-05c9068fec79","year":2021},"citing_paper":{"arxiv_id":"2506.19398","last_updated":"2025-06-24T08:01:33Z","snapshot_observed_at":"2026-08-07T06:16:42.699266Z","submitted_at":"2025-06-24T08:01:33Z","title":"ClearerVoice-Studio: Bridging Advanced Speech Processing Research and Practical Deployment","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T23:11:24.526741Z"},"links":{"citing_paper":"/paper/2506.19398"},"observation_digest":"sha256:08a248f93e4d645aea236ed3728441b1d0106d64caaa887df7dc4893d5d3ba2e","observation_id":"f5854460-642f-4afb-9029-0d21a5d977fe","resolution":{"observed_at":"2026-08-06T23:11:24.651853Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:11:24.625683Z","title":"USEV: Universal speaker extraction with visual cue,","venue":null,"work_id":"dd94821b-f0e3-4684-95de-5eaaaa89484d","year":2022},"citing_paper":{"arxiv_id":"2506.19398","last_updated":"2025-06-24T08:01:33Z","snapshot_observed_at":"2026-08-07T06:16:42.699266Z","submitted_at":"2025-06-24T08:01:33Z","title":"ClearerVoice-Studio: Bridging Advanced Speech Processing Research and Practical Deployment","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T23:11:24.534728Z"},"links":{"citing_paper":"/paper/2506.19398"},"observation_digest":"sha256:12bcb09b0de85f9d892a7760112bb16787e0621185f5cc5c0a864c6a15544108","observation_id":"ea871c47-8135-4ac8-a3a6-cdb06e9d4e2a","resolution":{"observed_at":"2026-08-06T23:11:24.629442Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.04624","last_updated":"2021-06-08T18:22:56Z","snapshot_observed_at":"2026-08-04T07:20:14.379561Z","submitted_at":"2021-06-08T18:22:56Z","title":"SpeechBrain: A General-Purpose Speech Toolkit","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.04624","snapshot_observed_at":"2026-08-06T23:11:24.394051Z","title":"Available: https://arxiv.org/abs/2106.04624","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.19398","last_updated":"2025-06-24T08:01:33Z","snapshot_observed_at":"2026-08-07T06:16:42.699266Z","submitted_at":"2025-06-24T08:01:33Z","title":"ClearerVoice-Studio: Bridging Advanced Speech Processing Research and Practical Deployment","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-06T23:11:24.394051Z"},"links":{"cited_paper":"/paper/2106.04624","citing_paper":"/paper/2506.19398"},"observation_digest":"sha256:3422e87a55f8f81c0bffa008ff7b13496860d9591e9d54248735fc6144556484","observation_id":"3ae2ef09-51e3-4364-9d36-43eabf7fb5d6","resolution":{"observed_at":"2026-08-06T23:11:24.394051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.19398","last_updated":"2025-06-24T08:01:33Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-07T06:16:42.699266Z","submitted_at":"2025-06-24T08:01:33Z","title":"ClearerVoice-Studio: Bridging Advanced Speech Processing Research and Practical Deployment"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":5,"verified_exact":1,"verified_fuzzy":38},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 7 inbound Pith citation observations for arXiv:2506.19398."}