{"as_of":"2026-08-09T08:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3b739a628c3d9f4ea47b5e9ae74af83ac064bed66a487bcf03cab89df30eca40","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-14T06:37:05.257817Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.11157/citation-record","integrity":"/paper/2607.11157/integrity","json":"/paper/2607.11157/citation-record.json","paper":"/paper/2607.11157"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T06:37:05.257817Z","title":"Complex ratio masking for monaural speech separation,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.11157","last_updated":"2026-07-13T06:51:12Z","snapshot_observed_at":"2026-07-30T05:02:25.925930Z","submitted_at":"2026-07-13T06:51:12Z","title":"Where Speech Enhancement Hurts Recognition: An Inference Time Polar Projection Diagnosis","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-14T06:37:05.257817Z"},"links":{"citing_paper":"/paper/2607.11157"},"observation_digest":"sha256:8fe2730654c4a7a91a301db6ecdff90b81163ef15567413c5f1cf222e2741f94","observation_id":"fee4f39f-570a-4f93-9e52-ff4167086f75","resolution":{"observed_at":"2026-07-14T06:37:05.257817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T06:37:05.257817Z","title":"Complex spectral mapping for single-and multi-channel speech enhancement and robust asr,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.11157","last_updated":"2026-07-13T06:51:12Z","snapshot_observed_at":"2026-07-30T05:02:25.925930Z","submitted_at":"2026-07-13T06:51:12Z","title":"Where Speech Enhancement Hurts Recognition: An Inference Time Polar Projection Diagnosis","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-14T06:37:05.257817Z"},"links":{"citing_paper":"/paper/2607.11157"},"observation_digest":"sha256:82713309c8beee60cd405cb029b6aba3a4072b22e9dbedf1e693c3d0aa735fce","observation_id":"1e050417-72a2-4ce9-9955-db20544a5304","resolution":{"observed_at":"2026-07-14T06:37:05.257817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1804.10204","last_updated":"2018-04-26T13:14:22Z","snapshot_observed_at":"2026-08-03T13:44:07.152019Z","submitted_at":"2018-04-26T13:14:22Z","title":"End-to-End Speech Separation with Unfolded Iterative Phase Reconstruction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.10204","snapshot_observed_at":"2026-07-14T06:37:05.257817Z","title":"End-to-end speech separation with unfolded iterative phase reconstruction,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.11157","last_updated":"2026-07-13T06:51:12Z","snapshot_observed_at":"2026-07-30T05:02:25.925930Z","submitted_at":"2026-07-13T06:51:12Z","title":"Where Speech Enhancement Hurts Recognition: An Inference Time Polar Projection Diagnosis","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-14T06:37:05.257817Z"},"links":{"cited_paper":"/paper/1804.10204","citing_paper":"/paper/2607.11157"},"observation_digest":"sha256:58417a34776798d024d817a9aa889be153d6eec5be941c77f009c7ae115c7b64","observation_id":"ce539046-9d18-4b38-b3d4-868473d07f2f","resolution":{"observed_at":"2026-07-14T06:37:05.257817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T06:37:05.257817Z","title":"A wavenet for speech denoising,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.11157","last_updated":"2026-07-13T06:51:12Z","snapshot_observed_at":"2026-07-30T05:02:25.925930Z","submitted_at":"2026-07-13T06:51:12Z","title":"Where Speech Enhancement Hurts Recognition: An Inference Time Polar Projection Diagnosis","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-14T06:37:05.257817Z"},"links":{"citing_paper":"/paper/2607.11157"},"observation_digest":"sha256:cd6b234390efbdbf1e41c90b9919cd50dfc4991ba328ac2a30c2fb45ab241005","observation_id":"4f6b1165-1fc8-4d90-bc0b-33ae5880dfee","resolution":{"observed_at":"2026-07-14T06:37:05.257817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T06:37:05.257817Z","title":"Conv-tasnet: Surpassing ideal time– frequency magnitude masking for speech separation,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.11157","last_updated":"2026-07-13T06:51:12Z","snapshot_observed_at":"2026-07-30T05:02:25.925930Z","submitted_at":"2026-07-13T06:51:12Z","title":"Where Speech Enhancement Hurts Recognition: An Inference Time Polar Projection Diagnosis","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-14T06:37:05.257817Z"},"links":{"citing_paper":"/paper/2607.11157"},"observation_digest":"sha256:32dccf9d5ad3de517f105320f50315610d40a2c3548e564ce7c8e6eecaddc937","observation_id":"89e63ab4-fce0-4d36-bdf7-f95d49ec8cab","resolution":{"observed_at":"2026-07-14T06:37:05.257817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.03538","last_updated":"2021-06-04T09:15:25Z","snapshot_observed_at":"2026-08-07T02:34:36.889171Z","submitted_at":"2021-04-08T06:46:35Z","title":"MetricGAN+: An Improved Version of MetricGAN for Speech Enhancement","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.03538","snapshot_observed_at":"2026-07-14T06:37:05.257817Z","title":"Metricgan+: An improved version of metricgan for speech enhancement,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.11157","last_updated":"2026-07-13T06:51:12Z","snapshot_observed_at":"2026-07-30T05:02:25.925930Z","submitted_at":"2026-07-13T06:51:12Z","title":"Where Speech Enhancement Hurts Recognition: An Inference Time Polar Projection Diagnosis","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-14T06:37:05.257817Z"},"links":{"cited_paper":"/paper/2104.03538","citing_paper":"/paper/2607.11157"},"observation_digest":"sha256:981fcd87e51df8ba57bee029e14cc53ac129a63e00680067354d991a68cf6ec4","observation_id":"b724993e-7241-4afc-b92e-64f6851079d7","resolution":{"observed_at":"2026-07-14T06:37:05.257817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T06:37:05.257817Z","title":"Usefulness of phase spectrum in human speech perception","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2607.11157","last_updated":"2026-07-13T06:51:12Z","snapshot_observed_at":"2026-07-30T05:02:25.925930Z","submitted_at":"2026-07-13T06:51:12Z","title":"Where Speech Enhancement Hurts Recognition: An Inference Time Polar Projection Diagnosis","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-14T06:37:05.257817Z"},"links":{"citing_paper":"/paper/2607.11157"},"observation_digest":"sha256:e1c233642ec97f53fcd7ea8ec2374f53fab5c95d33d76cb5fc0c75c92292e360","observation_id":"3d0b05d1-1478-4794-a12b-02b9671a99c5","resolution":{"observed_at":"2026-07-14T06:37:05.257817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T06:37:05.257817Z","title":"Phase processing for single-channel speech enhancement: History and recent advances,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.11157","last_updated":"2026-07-13T06:51:12Z","snapshot_observed_at":"2026-07-30T05:02:25.925930Z","submitted_at":"2026-07-13T06:51:12Z","title":"Where Speech Enhancement Hurts Recognition: An Inference Time Polar Projection Diagnosis","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-14T06:37:05.257817Z"},"links":{"citing_paper":"/paper/2607.11157"},"observation_digest":"sha256:c9c331836780b1d6607f1a009a3e70639f5030d3fd641ed1471ac25523d65f24","observation_id":"3274d87d-dde8-4ec6-9ff9-ef35e2084639","resolution":{"observed_at":"2026-07-14T06:37:05.257817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.06685","last_updated":"2022-03-30T11:18:52Z","snapshot_observed_at":"2026-08-05T09:57:09.718956Z","submitted_at":"2022-01-18T01:12:01Z","title":"How Bad Are Artifacts?: Analyzing the Impact of Speech Enhancement Errors on ASR","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.06685","snapshot_observed_at":"2026-07-14T06:37:05.257817Z","title":"How bad are artifacts?: Analyzing the impact of speech enhancement errors on asr,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.11157","last_updated":"2026-07-13T06:51:12Z","snapshot_observed_at":"2026-07-30T05:02:25.925930Z","submitted_at":"2026-07-13T06:51:12Z","title":"Where Speech Enhancement Hurts Recognition: An Inference Time Polar Projection Diagnosis","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-14T06:37:05.257817Z"},"links":{"cited_paper":"/paper/2201.06685","citing_paper":"/paper/2607.11157"},"observation_digest":"sha256:514b24f11c61f52c41bd1432eb61f2376b27cc70284c4b8ec6ebee4c54344ec1","observation_id":"1f2c280a-96ae-4ff2-bd2d-32c6dd07f1c5","resolution":{"observed_at":"2026-07-14T06:37:05.257817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T06:37:05.257817Z","title":"When de-noising hurts: A systematic study of speech enhancement effects on modern medical asr systems,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11157","last_updated":"2026-07-13T06:51:12Z","snapshot_observed_at":"2026-07-30T05:02:25.925930Z","submitted_at":"2026-07-13T06:51:12Z","title":"Where Speech Enhancement Hurts Recognition: An Inference Time Polar Projection Diagnosis","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-14T06:37:05.257817Z"},"links":{"citing_paper":"/paper/2607.11157"},"observation_digest":"sha256:e241006b199df00606886044017a859e7abe6920025882e18b11fcf0cf5af7ba","observation_id":"896726a5-0c87-4945-8f0d-dc82ffa68044","resolution":{"observed_at":"2026-07-14T06:37:05.257817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T06:37:05.257817Z","title":"When denoising hinders: Revisiting zero-shot asr with sam-audio and whisper,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.11157","last_updated":"2026-07-13T06:51:12Z","snapshot_observed_at":"2026-07-30T05:02:25.925930Z","submitted_at":"2026-07-13T06:51:12Z","title":"Where Speech Enhancement Hurts Recognition: An Inference Time Polar Projection Diagnosis","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-14T06:37:05.257817Z"},"links":{"citing_paper":"/paper/2607.11157"},"observation_digest":"sha256:333c46ec34ac7a4101729a3f51aca781cf67bb2a0b59cd2ef14275eea0f2cbb8","observation_id":"efbf3436-54ef-47ae-ad2e-d734a06f5a84","resolution":{"observed_at":"2026-07-14T06:37:05.257817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T06:37:05.257817Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech representations,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.11157","last_updated":"2026-07-13T06:51:12Z","snapshot_observed_at":"2026-07-30T05:02:25.925930Z","submitted_at":"2026-07-13T06:51:12Z","title":"Where Speech Enhancement Hurts Recognition: An Inference Time Polar Projection Diagnosis","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-14T06:37:05.257817Z"},"links":{"citing_paper":"/paper/2607.11157"},"observation_digest":"sha256:cce8be2b234fafdd81ca94432b2c23037cd548757a1e00c17353bf7723ccc09d","observation_id":"9ae39dd5-cde3-460d-8eae-23b406590bb2","resolution":{"observed_at":"2026-07-14T06:37:05.257817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T06:37:05.257817Z","title":"Robust speech recognition via large-scale weak supervi- sion,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.11157","last_updated":"2026-07-13T06:51:12Z","snapshot_observed_at":"2026-07-30T05:02:25.925930Z","submitted_at":"2026-07-13T06:51:12Z","title":"Where Speech Enhancement Hurts Recognition: An Inference Time Polar Projection Diagnosis","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-14T06:37:05.257817Z"},"links":{"citing_paper":"/paper/2607.11157"},"observation_digest":"sha256:c6c751eef5afc2c75f75a93c0e2ccf87ea1e1812c981436005f36773a16864b9","observation_id":"919e6e04-3b98-412c-bf38-20f0d88f618e","resolution":{"observed_at":"2026-07-14T06:37:05.257817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T06:37:05.257817Z","title":"How does end-to-end speech recognition training impact speech enhancement artifacts?","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.11157","last_updated":"2026-07-13T06:51:12Z","snapshot_observed_at":"2026-07-30T05:02:25.925930Z","submitted_at":"2026-07-13T06:51:12Z","title":"Where Speech Enhancement Hurts Recognition: An Inference Time Polar Projection Diagnosis","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-14T06:37:05.257817Z"},"links":{"citing_paper":"/paper/2607.11157"},"observation_digest":"sha256:28c2e1b749434bfa86925c49dd275ae77e3df8eda83b1b9a96061150d19862e8","observation_id":"bc263471-ad0c-4b2f-90b2-5d22f2a55471","resolution":{"observed_at":"2026-07-14T06:37:05.257817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T06:37:05.257817Z","title":"Rethinking processing distortions: Disentangling the impact of speech enhancement errors on speech recognition performance,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.11157","last_updated":"2026-07-13T06:51:12Z","snapshot_observed_at":"2026-07-30T05:02:25.925930Z","submitted_at":"2026-07-13T06:51:12Z","title":"Where Speech Enhancement Hurts Recognition: An Inference Time Polar Projection Diagnosis","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-14T06:37:05.257817Z"},"links":{"citing_paper":"/paper/2607.11157"},"observation_digest":"sha256:7194869aa9abd92352543190a2e48b5b19ac51b93120462886b8a334515616e0","observation_id":"5a07b512-299c-4188-a370-dde5772db5a0","resolution":{"observed_at":"2026-07-14T06:37:05.257817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T06:37:05.257817Z","title":"Effect of noise suppression losses on speech distortion and asr performance,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.11157","last_updated":"2026-07-13T06:51:12Z","snapshot_observed_at":"2026-07-30T05:02:25.925930Z","submitted_at":"2026-07-13T06:51:12Z","title":"Where Speech Enhancement Hurts Recognition: An Inference Time Polar Projection Diagnosis","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-14T06:37:05.257817Z"},"links":{"citing_paper":"/paper/2607.11157"},"observation_digest":"sha256:7051ce520929e0b41ef01db6358f95cdfd62c370f12777fc36823626742675a4","observation_id":"0007795b-5451-40ff-a2b4-2ecb9179144b","resolution":{"observed_at":"2026-07-14T06:37:05.257817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T06:37:05.257817Z","title":"On the compensation between magnitude and phase in speech separation,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.11157","last_updated":"2026-07-13T06:51:12Z","snapshot_observed_at":"2026-07-30T05:02:25.925930Z","submitted_at":"2026-07-13T06:51:12Z","title":"Where Speech Enhancement Hurts Recognition: An Inference Time Polar Projection Diagnosis","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-14T06:37:05.257817Z"},"links":{"citing_paper":"/paper/2607.11157"},"observation_digest":"sha256:4707a9884d6f0c7d9df0fb17c1b5fc4714b0bd804f9a38cd383e83a7a933a435","observation_id":"f7026300-2391-4ab2-adf1-6ad38a89b9bb","resolution":{"observed_at":"2026-07-14T06:37:05.257817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T06:37:05.257817Z","title":"Joint noise adaptive training for robust automatic speech recognition,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2607.11157","last_updated":"2026-07-13T06:51:12Z","snapshot_observed_at":"2026-07-30T05:02:25.925930Z","submitted_at":"2026-07-13T06:51:12Z","title":"Where Speech Enhancement Hurts Recognition: An Inference Time Polar Projection Diagnosis","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-14T06:37:05.257817Z"},"links":{"citing_paper":"/paper/2607.11157"},"observation_digest":"sha256:b293f223263a5066187e3464430c8b7bec410d40890c75fec2a1aaa0182700d5","observation_id":"b78aa9ad-aed2-4b6b-b5c9-daeb3a1c4ade","resolution":{"observed_at":"2026-07-14T06:37:05.257817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T06:37:05.257817Z","title":"Learning to enhance or not: Neural network-based switching of en- hanced and observed signals for overlapping speech recognition,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.11157","last_updated":"2026-07-13T06:51:12Z","snapshot_observed_at":"2026-07-30T05:02:25.925930Z","submitted_at":"2026-07-13T06:51:12Z","title":"Where Speech Enhancement Hurts Recognition: An Inference Time Polar Projection Diagnosis","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-14T06:37:05.257817Z"},"links":{"citing_paper":"/paper/2607.11157"},"observation_digest":"sha256:3e35d738555b30a70677b120b2f21efc5784b2cab0570ab1c8d741f4c3cac1d5","observation_id":"ab712a4e-f8d1-494c-9fa8-0136fd22a5f0","resolution":{"observed_at":"2026-07-14T06:37:05.257817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T06:37:05.257817Z","title":"Frcrn: Boosting feature representation using frequency recurrence for monaural speech enhancement,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.11157","last_updated":"2026-07-13T06:51:12Z","snapshot_observed_at":"2026-07-30T05:02:25.925930Z","submitted_at":"2026-07-13T06:51:12Z","title":"Where Speech Enhancement Hurts Recognition: An Inference Time Polar Projection Diagnosis","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-14T06:37:05.257817Z"},"links":{"citing_paper":"/paper/2607.11157"},"observation_digest":"sha256:231aaecfacf03a2065b1902495cd450a085830bf153b53e74cf13b098fae5566","observation_id":"28f4f22e-823d-40ef-96e4-8904af87bb9e","resolution":{"observed_at":"2026-07-14T06:37:05.257817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T06:37:05.257817Z","title":"Phase- sensitive and recognition-boosted speech separation using deep recurrent neural networks,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.11157","last_updated":"2026-07-13T06:51:12Z","snapshot_observed_at":"2026-07-30T05:02:25.925930Z","submitted_at":"2026-07-13T06:51:12Z","title":"Where Speech Enhancement Hurts Recognition: An Inference Time Polar Projection Diagnosis","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-14T06:37:05.257817Z"},"links":{"citing_paper":"/paper/2607.11157"},"observation_digest":"sha256:640f8f01ede854c47c1937e3215fdde0af783dd0deb12fac546cf3190adbc7a2","observation_id":"5d3b4b3b-380b-4f22-bebe-86577c6e27cd","resolution":{"observed_at":"2026-07-14T06:37:05.257817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T06:37:05.257817Z","title":"Task- aware warping factors in mask-based speech enhancement,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.11157","last_updated":"2026-07-13T06:51:12Z","snapshot_observed_at":"2026-07-30T05:02:25.925930Z","submitted_at":"2026-07-13T06:51:12Z","title":"Where Speech Enhancement Hurts Recognition: An Inference Time Polar Projection Diagnosis","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-14T06:37:05.257817Z"},"links":{"citing_paper":"/paper/2607.11157"},"observation_digest":"sha256:39465ec5bbec124b0f06e583e7f30033c4ff4d8549893151c7f16e3b3d287280","observation_id":"0635132a-f31d-48d5-a5ea-cd5b993b66a7","resolution":{"observed_at":"2026-07-14T06:37:05.257817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.12092","last_updated":"2022-04-26T06:10:48Z","snapshot_observed_at":"2026-07-06T13:03:48.062988Z","submitted_at":"2022-04-26T06:10:48Z","title":"Mask scalar prediction for improving robust automatic speech recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.12092","snapshot_observed_at":"2026-07-14T06:37:05.257817Z","title":"Mask scalar prediction for improving robust automatic speech recog- nition,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.11157","last_updated":"2026-07-13T06:51:12Z","snapshot_observed_at":"2026-07-30T05:02:25.925930Z","submitted_at":"2026-07-13T06:51:12Z","title":"Where Speech Enhancement Hurts Recognition: An Inference Time Polar Projection Diagnosis","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-14T06:37:05.257817Z"},"links":{"cited_paper":"/paper/2204.12092","citing_paper":"/paper/2607.11157"},"observation_digest":"sha256:bbd70ede67904e1a88ae5f2115f330ebb69ea5d7fb5e5e46c1beead2a22c930b","observation_id":"bf6edaaf-f2f7-4201-a330-a804957ed57e","resolution":{"observed_at":"2026-07-14T06:37:05.257817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T06:37:05.257817Z","title":"The third ‘chime’speech separation and recognition challenge: Dataset, task and baselines,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.11157","last_updated":"2026-07-13T06:51:12Z","snapshot_observed_at":"2026-07-30T05:02:25.925930Z","submitted_at":"2026-07-13T06:51:12Z","title":"Where Speech Enhancement Hurts Recognition: An Inference Time Polar Projection Diagnosis","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-14T06:37:05.257817Z"},"links":{"citing_paper":"/paper/2607.11157"},"observation_digest":"sha256:93915eac005089c3c55574dd879fcecdf3eca2312ec46268221b66f53d955e6e","observation_id":"dc73a535-f9b3-4617-b03d-66f1d5b45031","resolution":{"observed_at":"2026-07-14T06:37:05.257817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T06:37:05.257817Z","title":"Impact of residual noise and artifacts in speech enhancement errors on intelligibility of human and machine","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.11157","last_updated":"2026-07-13T06:51:12Z","snapshot_observed_at":"2026-07-30T05:02:25.925930Z","submitted_at":"2026-07-13T06:51:12Z","title":"Where Speech Enhancement Hurts Recognition: An Inference Time Polar Projection Diagnosis","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-14T06:37:05.257817Z"},"links":{"citing_paper":"/paper/2607.11157"},"observation_digest":"sha256:8134e56f72cb1ec4a15d6c092ba8b54248b89463c1064d0d9dc290861616bcdf","observation_id":"ba526077-3157-473b-b326-99e81ff97360","resolution":{"observed_at":"2026-07-14T06:37:05.257817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.12107","last_updated":"2026-05-12T13:21:37Z","snapshot_observed_at":"2026-07-06T23:23:48.960874Z","submitted_at":"2026-05-12T13:21:37Z","title":"Too Good to Be True: A Study on Modern Automatic Speech Recognition for the Evaluation of Speech Enhancement","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.12107","snapshot_observed_at":"2026-07-14T06:37:05.257817Z","title":"Too good to be true: A study on modern automatic speech recognition for the evaluation of speech enhancement,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.11157","last_updated":"2026-07-13T06:51:12Z","snapshot_observed_at":"2026-07-30T05:02:25.925930Z","submitted_at":"2026-07-13T06:51:12Z","title":"Where Speech Enhancement Hurts Recognition: An Inference Time Polar Projection Diagnosis","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-14T06:37:05.257817Z"},"links":{"cited_paper":"/paper/2605.12107","citing_paper":"/paper/2607.11157"},"observation_digest":"sha256:08c0d0f18cc224c2350f42ef434d1445bd651bd43310b9c35410fa0005fc9468","observation_id":"a54843ca-78ee-460d-851b-25deeacd7547","resolution":{"observed_at":"2026-07-14T06:37:05.257817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T06:37:05.257817Z","title":"A joint training framework for robust auto- matic speech recognition,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.11157","last_updated":"2026-07-13T06:51:12Z","snapshot_observed_at":"2026-07-30T05:02:25.925930Z","submitted_at":"2026-07-13T06:51:12Z","title":"Where Speech Enhancement Hurts Recognition: An Inference Time Polar Projection Diagnosis","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-14T06:37:05.257817Z"},"links":{"citing_paper":"/paper/2607.11157"},"observation_digest":"sha256:83b37dd7f8339e2ac68583048e8a79a1078a957e41354aacc14a1a0e79002322","observation_id":"d40e4bd4-ea8c-4192-9136-88c38519960c","resolution":{"observed_at":"2026-07-14T06:37:05.257817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.00764","last_updated":"2022-03-28T05:28:41Z","snapshot_observed_at":"2026-08-04T02:27:39.631289Z","submitted_at":"2021-11-01T08:26:12Z","title":"SNRi Target Training for Joint Speech Enhancement and Recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.00764","snapshot_observed_at":"2026-07-14T06:37:05.257817Z","title":"Snri target training for joint speech enhancement and recognition,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.11157","last_updated":"2026-07-13T06:51:12Z","snapshot_observed_at":"2026-07-30T05:02:25.925930Z","submitted_at":"2026-07-13T06:51:12Z","title":"Where Speech Enhancement Hurts Recognition: An Inference Time Polar Projection Diagnosis","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-14T06:37:05.257817Z"},"links":{"cited_paper":"/paper/2111.00764","citing_paper":"/paper/2607.11157"},"observation_digest":"sha256:b096aefa69c2164e6d50360c55d95104f16e64d498dc9addd792e4410ee0610f","observation_id":"4672954e-500a-4628-9fc7-080f2590e15f","resolution":{"observed_at":"2026-07-14T06:37:05.257817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T06:37:05.257817Z","title":"Dual application of speech enhancement for automatic speech recognition,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.11157","last_updated":"2026-07-13T06:51:12Z","snapshot_observed_at":"2026-07-30T05:02:25.925930Z","submitted_at":"2026-07-13T06:51:12Z","title":"Where Speech Enhancement Hurts Recognition: An Inference Time Polar Projection Diagnosis","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-14T06:37:05.257817Z"},"links":{"citing_paper":"/paper/2607.11157"},"observation_digest":"sha256:0abec4e6b42e59c58c68edfc9a38c7e8903e8928e237892daa9b328cd3e4d1d0","observation_id":"aef08702-3916-4912-b9c3-bba509a3792b","resolution":{"observed_at":"2026-07-14T06:37:05.257817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T06:37:05.257817Z","title":"Interactive feature fusion for end-to-end noise-robust speech recognition,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.11157","last_updated":"2026-07-13T06:51:12Z","snapshot_observed_at":"2026-07-30T05:02:25.925930Z","submitted_at":"2026-07-13T06:51:12Z","title":"Where Speech Enhancement Hurts Recognition: An Inference Time Polar Projection Diagnosis","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-14T06:37:05.257817Z"},"links":{"citing_paper":"/paper/2607.11157"},"observation_digest":"sha256:a8a73692205c994c627b65350b3bc06f99f6a63c40a6a653d4aee96224f963b2","observation_id":"14bd39c6-d696-46cf-ab8d-61929a64cc53","resolution":{"observed_at":"2026-07-14T06:37:05.257817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T06:37:05.257817Z","title":"Enhanced spectral features for distortion- independent acoustic modeling","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.11157","last_updated":"2026-07-13T06:51:12Z","snapshot_observed_at":"2026-07-30T05:02:25.925930Z","submitted_at":"2026-07-13T06:51:12Z","title":"Where Speech Enhancement Hurts Recognition: An Inference Time Polar Projection Diagnosis","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-14T06:37:05.257817Z"},"links":{"citing_paper":"/paper/2607.11157"},"observation_digest":"sha256:14001777dbf1a890dad53837e0ef3d4ba366a47465bff6e0518dd6fab3f50625","observation_id":"bd3ff6d9-8c7d-4b93-b03e-1b6f860c9f05","resolution":{"observed_at":"2026-07-14T06:37:05.257817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.00949","last_updated":"2021-06-02T05:31:45Z","snapshot_observed_at":"2026-07-06T11:15:03.599852Z","submitted_at":"2021-06-02T05:31:45Z","title":"Should We Always Separate?: Switching Between Enhanced and Observed Signals for Overlapping Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.00949","snapshot_observed_at":"2026-07-14T06:37:05.257817Z","title":"Should we always separate?: Switching between enhanced and ob- served signals for overlapping speech recognition,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.11157","last_updated":"2026-07-13T06:51:12Z","snapshot_observed_at":"2026-07-30T05:02:25.925930Z","submitted_at":"2026-07-13T06:51:12Z","title":"Where Speech Enhancement Hurts Recognition: An Inference Time Polar Projection Diagnosis","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-14T06:37:05.257817Z"},"links":{"cited_paper":"/paper/2106.00949","citing_paper":"/paper/2607.11157"},"observation_digest":"sha256:3ce67d5e53aa06c299b7f4ca9d1685b8666ab6292d7962d3d88e4532d39275a6","observation_id":"eddb54d1-45ab-4f20-b7f2-21ff67181eb8","resolution":{"observed_at":"2026-07-14T06:37:05.257817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.20967","last_updated":"2026-06-06T10:41:57Z","snapshot_observed_at":"2026-08-09T03:23:13.450394Z","submitted_at":"2026-02-24T14:46:54Z","title":"Training-Free Intelligibility-Guided Observation Addition for Noisy ASR","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.20967","snapshot_observed_at":"2026-07-14T06:37:05.257817Z","title":"Training-free intelligibility-guided observation addition for noisy asr,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.11157","last_updated":"2026-07-13T06:51:12Z","snapshot_observed_at":"2026-07-30T05:02:25.925930Z","submitted_at":"2026-07-13T06:51:12Z","title":"Where Speech Enhancement Hurts Recognition: An Inference Time Polar Projection Diagnosis","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-14T06:37:05.257817Z"},"links":{"cited_paper":"/paper/2602.20967","citing_paper":"/paper/2607.11157"},"observation_digest":"sha256:9f7206fb32d269cc910b8a59d909912284f49a08e9d25f8b4ea575a5fa3f24f0","observation_id":"fa4a145b-acb4-40fc-97cf-0708e335db85","resolution":{"observed_at":"2026-07-14T06:37:05.257817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T06:37:05.257817Z","title":"Mossformer2: Combining transformer and rnn-free recurrent network for enhanced time-domain monaural speech separation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.11157","last_updated":"2026-07-13T06:51:12Z","snapshot_observed_at":"2026-07-30T05:02:25.925930Z","submitted_at":"2026-07-13T06:51:12Z","title":"Where Speech Enhancement Hurts Recognition: An Inference Time Polar Projection Diagnosis","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-14T06:37:05.257817Z"},"links":{"citing_paper":"/paper/2607.11157"},"observation_digest":"sha256:d1c401c6118b0d94000dbe12196d787ec454c47b49fb088f76d1733f664c6aaa","observation_id":"2aacbd13-7531-434e-8ba4-5c1aaae247fa","resolution":{"observed_at":"2026-07-14T06:37:05.257817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T06:37:05.257817Z","title":"Meanflowse: One-step generative speech enhancement via conditional mean flow,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.11157","last_updated":"2026-07-13T06:51:12Z","snapshot_observed_at":"2026-07-30T05:02:25.925930Z","submitted_at":"2026-07-13T06:51:12Z","title":"Where Speech Enhancement Hurts Recognition: An Inference Time Polar Projection Diagnosis","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-14T06:37:05.257817Z"},"links":{"citing_paper":"/paper/2607.11157"},"observation_digest":"sha256:2647ce9eaac282623e0acd7b1684511317194461f196a2b8a27326f05f8decb0","observation_id":"007e5e11-d608-4189-b504-ab73f671d6b6","resolution":{"observed_at":"2026-07-14T06:37:05.257817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19476","last_updated":"2025-05-27T09:33:56Z","snapshot_observed_at":"2026-08-08T22:43:33.430909Z","submitted_at":"2025-05-26T03:55:00Z","title":"FlowSE: Efficient and High-Quality Speech Enhancement via Flow Matching","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19476","snapshot_observed_at":"2026-07-14T06:37:05.257817Z","title":"Flowse: Efficient and high-quality speech enhancement via flow matching,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11157","last_updated":"2026-07-13T06:51:12Z","snapshot_observed_at":"2026-07-30T05:02:25.925930Z","submitted_at":"2026-07-13T06:51:12Z","title":"Where Speech Enhancement Hurts Recognition: An Inference Time Polar Projection Diagnosis","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-14T06:37:05.257817Z"},"links":{"cited_paper":"/paper/2505.19476","citing_paper":"/paper/2607.11157"},"observation_digest":"sha256:e8ee2aa53f5ae921554cb46bf37c295e910d4f8c6e148554bc559236772fcaa2","observation_id":"e11eb73e-e443-4743-8752-51a8c564cf2f","resolution":{"observed_at":"2026-07-14T06:37:05.257817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T06:37:05.257817Z","title":"Investigating rnn-based speech enhancement methods for noise-robust text-to-speech,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.11157","last_updated":"2026-07-13T06:51:12Z","snapshot_observed_at":"2026-07-30T05:02:25.925930Z","submitted_at":"2026-07-13T06:51:12Z","title":"Where Speech Enhancement Hurts Recognition: An Inference Time Polar Projection Diagnosis","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-14T06:37:05.257817Z"},"links":{"citing_paper":"/paper/2607.11157"},"observation_digest":"sha256:368f3d5d2756e3d7f99264f7165bcd4b8e59c05d87649127738d5c56ba5de59b","observation_id":"62d6213e-4b2e-42cc-b5ca-3152fb8077ab","resolution":{"observed_at":"2026-07-14T06:37:05.257817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T06:37:05.257817Z","title":"The diverse environments multi- channel acoustic noise database (demand): A database of multichannel environmental noise recordings,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2607.11157","last_updated":"2026-07-13T06:51:12Z","snapshot_observed_at":"2026-07-30T05:02:25.925930Z","submitted_at":"2026-07-13T06:51:12Z","title":"Where Speech Enhancement Hurts Recognition: An Inference Time Polar Projection Diagnosis","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-14T06:37:05.257817Z"},"links":{"citing_paper":"/paper/2607.11157"},"observation_digest":"sha256:f0eb94df6ef348a56818d126f1eafd22ffff0be5b85986030c210e60c48ecbf1","observation_id":"34058963-da3c-4b5a-ae3e-0d1a9593b5f6","resolution":{"observed_at":"2026-07-14T06:37:05.257817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19398","last_updated":"2025-06-24T08:01:33Z","snapshot_observed_at":"2026-08-07T06:16:42.699266Z","submitted_at":"2025-06-24T08:01:33Z","title":"ClearerVoice-Studio: Bridging Advanced Speech Processing Research and Practical Deployment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.19398","snapshot_observed_at":"2026-07-14T06:37:05.257817Z","title":"Clearervoice-studio: Bridging advanced speech processing research and practical deployment,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11157","last_updated":"2026-07-13T06:51:12Z","snapshot_observed_at":"2026-07-30T05:02:25.925930Z","submitted_at":"2026-07-13T06:51:12Z","title":"Where Speech Enhancement Hurts Recognition: An Inference Time Polar Projection Diagnosis","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-14T06:37:05.257817Z"},"links":{"cited_paper":"/paper/2506.19398","citing_paper":"/paper/2607.11157"},"observation_digest":"sha256:644db6b1394c978d79f48346e78a94e2622535a9098362c2babaad28c33bff21","observation_id":"f08e5579-001a-4a99-96e0-c7ceb8cf0d7d","resolution":{"observed_at":"2026-07-14T06:37:05.257817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T06:37:05.257817Z","title":"Performance measurement in blind audio source separation,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2607.11157","last_updated":"2026-07-13T06:51:12Z","snapshot_observed_at":"2026-07-30T05:02:25.925930Z","submitted_at":"2026-07-13T06:51:12Z","title":"Where Speech Enhancement Hurts Recognition: An Inference Time Polar Projection Diagnosis","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-14T06:37:05.257817Z"},"links":{"citing_paper":"/paper/2607.11157"},"observation_digest":"sha256:ed0b0ec177da80c635f3dc3630f4d96891a85009ab023e031b0bab4d721628fb","observation_id":"cba80beb-f680-4229-afd5-45fa45bdf405","resolution":{"observed_at":"2026-07-14T06:37:05.257817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T06:37:05.257817Z","title":"Per- ceptual evaluation of speech quality (pesq)-a new method for speech quality assessment of telephone networks and codecs,","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2607.11157","last_updated":"2026-07-13T06:51:12Z","snapshot_observed_at":"2026-07-30T05:02:25.925930Z","submitted_at":"2026-07-13T06:51:12Z","title":"Where Speech Enhancement Hurts Recognition: An Inference Time Polar Projection Diagnosis","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-14T06:37:05.257817Z"},"links":{"citing_paper":"/paper/2607.11157"},"observation_digest":"sha256:fa3c33b3857aea4a276d021a65e78a57d5235ac13e1267521c5057ff5a0312d0","observation_id":"8142e370-bbea-4cd8-9aab-6c5f53a6c024","resolution":{"observed_at":"2026-07-14T06:37:05.257817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T06:37:05.257817Z","title":"An algorithm for intelligibility prediction of time–frequency weighted noisy speech,","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2607.11157","last_updated":"2026-07-13T06:51:12Z","snapshot_observed_at":"2026-07-30T05:02:25.925930Z","submitted_at":"2026-07-13T06:51:12Z","title":"Where Speech Enhancement Hurts Recognition: An Inference Time Polar Projection Diagnosis","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-14T06:37:05.257817Z"},"links":{"citing_paper":"/paper/2607.11157"},"observation_digest":"sha256:beb385bc9a8ac597e503bec82b8a51ab98450d91c0bfe754bb3bfa358afe2a4c","observation_id":"abf8100a-1ef9-4c50-916c-c375fd98624d","resolution":{"observed_at":"2026-07-14T06:37:05.257817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T06:37:05.257817Z","title":"Bridging the gap: Integrating pre-trained speech enhancement and recognition models for robust speech recognition,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.11157","last_updated":"2026-07-13T06:51:12Z","snapshot_observed_at":"2026-07-30T05:02:25.925930Z","submitted_at":"2026-07-13T06:51:12Z","title":"Where Speech Enhancement Hurts Recognition: An Inference Time Polar Projection Diagnosis","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-14T06:37:05.257817Z"},"links":{"citing_paper":"/paper/2607.11157"},"observation_digest":"sha256:a966588b1caa2f9476246c080612b7a5e73fbfe92c2613122b9ec0d84ac526d0","observation_id":"7383ac42-1ec3-4643-85cf-2d5c1ced5b65","resolution":{"observed_at":"2026-07-14T06:37:05.257817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.11157","last_updated":"2026-07-13T06:51:12Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-07-30T05:02:25.925930Z","submitted_at":"2026-07-13T06:51:12Z","title":"Where Speech Enhancement Hurts Recognition: An Inference Time Polar Projection Diagnosis"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":43,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 0 inbound Pith citation observations for arXiv:2607.11157."}