{"as_of":"2026-08-19T20:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c6132cf89ff6244ccf54f0975e10e987ec2b93c4fee89b234e9f89eef8147feb","coverage":[{"denominator":72,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":72,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T15:52:24.351100Z","state":"measured"},{"denominator":72,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":72,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2509.21003/citation-record","integrity":"/paper/2509.21003/integrity","json":"/paper/2509.21003/citation-record.json","paper":"/paper/2509.21003"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2203.13086","last_updated":"2023-12-10T13:52:10Z","snapshot_observed_at":"2026-08-16T17:12:04.691282Z","submitted_at":"2022-03-24T14:25:51Z","title":"HiFi++: a Unified Framework for Bandwidth Extension and Speech Enhancement","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.13086","snapshot_observed_at":"2026-08-15T15:52:24.064391Z","title":"Hifi++: a unified framework for bandwidth extension and speech enhancement","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.064391Z"},"links":{"cited_paper":"/paper/2203.13086","citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:5d55846db9705258ee12822c202447464266bdc8258e1b3fac00cc0b0e82b00c","observation_id":"722bff73-3f4a-4c7d-ad15-da88a87587ec","resolution":{"observed_at":"2026-08-15T15:52:24.064391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:24.069401Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.069401Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:404a60233c0c5149d844bede02127af1db3a5e2d4af1d4efebc3196054972c5f","observation_id":"4ff26baf-55a5-4bcb-9996-e2eff2c228b0","resolution":{"observed_at":"2026-08-15T15:52:24.069401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:26.064292Z","title":"FINALLY : fast and universal speech enhancement with studio-like quality","venue":null,"work_id":"3af9e2a4-f478-4ba5-87d0-947bc76422d4","year":2024},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.073116Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:410a9d1d03821504fb6da6d3038358bacb99e3fd1b2a4bcb35db78922d281edb","observation_id":"12b76472-26ae-4fcc-808d-5927103070c3","resolution":{"observed_at":"2026-08-15T15:52:26.069557Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:24.077044Z","title":"CMGAN: Conformer-based Metric GAN for Speech Enhancement","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.077044Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:4a5fa3e875abd55134bcfd7d49ba1ff2bf3aeb8485f1da01975f295ac3e160f3","observation_id":"28fe2e2d-1110-4f90-b4f5-a6d36d74cc5d","resolution":{"observed_at":"2026-08-15T15:52:24.077044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:24.081167Z","title":"An investigation of incorporating mamba for speech enhancement","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.081167Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:778e14c3e5a132f45f15859bc25c441722173014bf6e49e71863ea44bcebbbb7","observation_id":"f06e1bc5-ee90-464d-856b-314009fd65c1","resolution":{"observed_at":"2026-08-15T15:52:24.081167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:26.048888Z","title":"Wav LM : L arge-scale self-supervised pre-training for full stack speech processing","venue":null,"work_id":"f968ba41-da00-451f-b09c-2f170fb5c144","year":2022},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.085232Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:a6fd979c2176e14e980ac327384a321162d16897ac0c549ce936e5caa69d9e47","observation_id":"f3c85346-984a-4633-a78f-d70e3e22258b","resolution":{"observed_at":"2026-08-15T15:52:26.053415Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:26.035210Z","title":"Phase-aware speech enhancement with deep complex u-net","venue":null,"work_id":"bf1e2d19-ead3-48d6-a43b-69eac6d0d41a","year":2018},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.089552Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:7dac16d96df1d36e76a309d207f7bcc0bf778b1007e1e40352a6ffaff1d25afe","observation_id":"ce7e07a5-fd8d-4910-8dda-141473f20f27","resolution":{"observed_at":"2026-08-15T15:52:26.039699Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.13254","last_updated":"2021-04-28T14:37:48Z","snapshot_observed_at":"2026-08-18T09:58:32.203962Z","submitted_at":"2019-11-27T13:50:45Z","title":"Music Source Separation in the Waveform Domain","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.13254","snapshot_observed_at":"2026-08-15T15:52:24.097351Z","title":"Music source separation in the waveform domain","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.097351Z"},"links":{"cited_paper":"/paper/1911.13254","citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:26a7653320dccdb5769fec2053cdb70830bb92128ce07780068dbbfddda6081d","observation_id":"f5079de6-8033-46a0-b0a3-2de738c5a85a","resolution":{"observed_at":"2026-08-15T15:52:24.097351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:26.022133Z","title":"High fidelity neural audio compression","venue":null,"work_id":"fff42c23-709e-4a01-ad2f-e97347fa020e","year":2023},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.103201Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:2e1c99e8826c969542859195f5f4c6b3ece6723894338e578f21f72b55cfb1d9","observation_id":"cec2f676-3d67-450c-a938-88ab78b0d24a","resolution":{"observed_at":"2026-08-15T15:52:26.026308Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:26.008970Z","title":"Speech enhancement using a minimum-mean square error short-time spectral amplitude estimator","venue":null,"work_id":"b0ec864c-085b-4142-9bf1-4168b364c228","year":1984},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.107999Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:50fe59af5f5ed21340908389889cb12dd9b389160c61104f393a439ccee6385b","observation_id":"ac3af8cf-7761-41e8-8e0f-97026986cf21","resolution":{"observed_at":"2026-08-15T15:52:26.013375Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"1992.22595","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:25.543815Z","title":"Fukada, K","venue":null,"work_id":"df5378a9-6f5d-470d-8b10-de5ca97271a4","year":1992},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.112131Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:2886ac30963d323b182876b317578c8a40b05b87e58d683c7e17068d7877ac21","observation_id":"ff94df62-d4ee-46a1-8ea8-92592592a974","resolution":{"observed_at":"2026-08-15T15:52:25.549465Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:24.116004Z","title":"Mamba: Linear-time sequence modeling with selective state spaces","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.116004Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:31ed870c49446b798323219bcdb460dfa2ea00d2d2df7fd284c499e0ee30bbf0","observation_id":"9199065b-0c8c-4b51-9f65-8f6c3cec3c23","resolution":{"observed_at":"2026-08-15T15:52:24.116004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:25.987253Z","title":"Siamese masked autoencoders","venue":null,"work_id":"666a411e-b397-429f-8e46-9a2704be030d","year":2023},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.119911Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:4dc13484877e9419247ab1ec794ac846ba5842f3594d5d4419646cb12f2dc0ee","observation_id":"2ea3e9cf-dc04-4e7f-8564-07a03bc6ecb0","resolution":{"observed_at":"2026-08-15T15:52:25.991088Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2015.24166","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:25.476244Z","title":"Woods, Ivo Merks, and Tao Zhang","venue":null,"work_id":"04974cd2-40c8-4a26-ab82-e4e7a916db32","year":2015},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.123738Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:57a3d5108f810678fa59232ca99fb6142e681d4c05640be1abada733b1fb0b4c","observation_id":"21d54377-fc90-448a-a0f0-d82abaa864a4","resolution":{"observed_at":"2026-08-15T15:52:25.482416Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:24.127625Z","title":"Nu-wave 2: A general neural audio upsampling model for various sampling rates","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.127625Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:111a067616993e38892e74c24452bc2fb157655f37f7f76b59eee50f1056aaf4","observation_id":"8b177e32-0986-4b0d-9e73-7728825ebb5d","resolution":{"observed_at":"2026-08-15T15:52:24.127625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:25.974438Z","title":"Masked autoencoders are scalable vision learners","venue":null,"work_id":"92cdf597-98c2-4285-ba17-645ec5a40527","year":2022},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.131726Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:6f3b062a36c5bc6cde279c3a4a7e5e5360b485eeb5bdfe6718687fd3a5273073","observation_id":"9fb50caa-896d-4f5e-874a-c25cf45aa390","resolution":{"observed_at":"2026-08-15T15:52:25.978656Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:24.135855Z","title":"Denoising diffusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.135855Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:a599a293584db6e938dde9eb11c1be7c62e5ce89cb1155173fb6fd340b4ba5aa","observation_id":"998ad533-58da-4391-88e8-743862b414ee","resolution":{"observed_at":"2026-08-15T15:52:24.135855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:24.139702Z","title":"DCCRN: Deep Complex Convolution Recurrent Network for Phase-Aware Speech Enhancement","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.139702Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:aa180ca808b148b44e55bdd042b7042d6de780b79818a02001aa73074d5c149f","observation_id":"716289df-68d6-4532-8cc8-0deb38f73c64","resolution":{"observed_at":"2026-08-15T15:52:24.139702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2009.52012","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:25.403701Z","title":"A binaural room impulse response database for the evaluation of dereverberation algorithms","venue":null,"work_id":"a00a5ee7-dfe5-483d-8557-254a98f12af8","year":2009},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.143082Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:a8d2cfe56a7b872ed638ffb9500844dca360e9b8628792aa9bcacd43e0c77718","observation_id":"ad2083f0-eb7c-4bbb-95df-03799a5081d0","resolution":{"observed_at":"2026-08-15T15:52:25.412666Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:25.953386Z","title":"Naturalspeech 3: Zero-shot speech synthesis with factorized codec and diffusion models","venue":null,"work_id":"4443de51-ed6f-4060-83ce-d7a56f94ef64","year":2024},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.146547Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:8faf5a060f9e7cb01fe49cd3a90618b7466be212fd607c293c18569b3cc954b8","observation_id":"2849cac0-8e53-4638-a482-8554c3c9d75e","resolution":{"observed_at":"2026-08-15T15:52:25.957265Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:24.150172Z","title":"Istftnet: Fast and lightweight mel-spectrogram vocoder incorporating inverse short-time fourier transform","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.150172Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:070d159a93bc8e4998230fba94a8bddd6ec9cade64e274cb2f12d9f25a3f9ef6","observation_id":"9543eb44-9c13-48a6-80bb-21ece9644aa3","resolution":{"observed_at":"2026-08-15T15:52:24.150172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:24.153665Z","title":"Audio super-resolution with robust speech representation learning of masked autoencoder","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.153665Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:5452ff71648d8b6fc7d6ae1f1df6b9a2f6aea5daa365a4eb106d81a2ec0f0616","observation_id":"5e523f2e-bd4e-4c65-a96e-0d38bf85838f","resolution":{"observed_at":"2026-08-15T15:52:24.153665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:25.940802Z","title":"Miipher: A robust speech restoration model integrating self-supervised speech and text representations","venue":null,"work_id":"70a7568d-b261-4a67-a6da-07df841c6b8a","year":2023},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.157259Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:bd6ba17565071807622ef3c5bf082b988dc6ab8cdc7f63cb5d076352ae221f88","observation_id":"94ce9f12-6aea-4630-ade6-89ddb136b386","resolution":{"observed_at":"2026-08-15T15:52:25.944807Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:25.928232Z","title":"Hifi-GAN : Generative adversarial networks for efficient and high fidelity speech synthesis","venue":null,"work_id":"be479d92-f07e-4a90-bd45-f41e3932603e","year":2020},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.160946Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:c700680b8f31719cb9df99404099d77962468c6927ff8ae92556b55aea7b8268","observation_id":"d2d4da27-a862-4ba1-bdce-23373c753fae","resolution":{"observed_at":"2026-08-15T15:52:25.932328Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.09761","last_updated":"2021-03-30T19:48:38Z","snapshot_observed_at":"2026-07-06T09:57:19.117228Z","submitted_at":"2020-09-21T11:20:38Z","title":"DiffWave: A Versatile Diffusion Model for Audio Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.09761","snapshot_observed_at":"2026-08-15T15:52:24.164463Z","title":"Diffwave: A versatile diffusion model for audio synthesis","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.164463Z"},"links":{"cited_paper":"/paper/2009.09761","citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:b7f8b2f6e3bd3d78b0e7104b55d7aa4a91d7a4ac4720d505dbcc220980fe23f2","observation_id":"c0130c57-6d2c-44fd-b9b9-afc6b2a817f2","resolution":{"observed_at":"2026-08-15T15:52:24.164463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:25.915786Z","title":"Mel GAN : Generative adversarial networks for conditional waveform synthesis","venue":null,"work_id":"f878ad4e-dff4-47a6-b8af-5a7f535d95d1","year":2019},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.168258Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:f1d419a2e395e6cfe42a1cebd685d6bac5705e7ceba6c457448d2d0acd0414ad","observation_id":"279a4b4e-b87d-428e-b53f-33da0aa0d518","resolution":{"observed_at":"2026-08-15T15:52:25.919934Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.14748","last_updated":"2023-05-30T13:05:55Z","snapshot_observed_at":"2026-08-16T15:52:00.816531Z","submitted_at":"2023-02-28T16:45:42Z","title":"Reducing the Prior Mismatch of Stochastic Differential Equations for Diffusion-based Speech Enhancement","version":2},"cited_work":{"arxiv_id":"2302.14748","doi":null,"metadata_source":"pith","pith_arxiv_id":"2302.14748","snapshot_observed_at":"2026-08-15T15:52:25.266457Z","title":"Reducing the Prior Mismatch of Stochastic Differential Equations for Diffusion-based Speech Enhancement","venue":"eess.AS","work_id":"9b93d9d1-2dcf-4c97-81e8-0a20195556a3","year":2023},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.171779Z"},"links":{"cited_paper":"/paper/2302.14748","citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:ebec8b12c266997432adb9dc30af2d5e02faff9b9326adadfea43651102d5ac7","observation_id":"8bee52d2-34fc-41c0-af86-f4b4a730d2e7","resolution":{"observed_at":"2026-08-15T15:52:25.270686Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:24.175698Z","title":"Nu-wave: A diffusion probabilistic model for neural audio upsampling","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.175698Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:b1bdebc2239e8407862033595f07a1a2882895f109714c5f8d8f9cc2323d4a2a","observation_id":"feff9b80-e8d7-4eb3-ab24-8b3b414d8be1","resolution":{"observed_at":"2026-08-15T15:52:24.175698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:25.903495Z","title":"Storm: A diffusion-based stochastic regeneration model for speech enhancement and dereverberation","venue":null,"work_id":"df71c5f5-2e7a-4caa-8b18-0d5affa908d8","year":2023},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.179509Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:afa54b73b8fe032e626ed4d77d67eb58472f67d8be09c9de68adbfae51ade6cf","observation_id":"da10d043-296f-4804-9544-248f10741892","resolution":{"observed_at":"2026-08-15T15:52:25.907799Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21437/interspeech.2024-1584","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:24.463259Z","title":"MaskSR: Masked Language Model for Full-band Speech Restoration","venue":null,"work_id":"df9a1579-926c-4ff8-9438-e8f26b15366a","year":2024},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.183168Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:5a46d4f6921a5538bb1f3dcc1c5f5c247a542cfaac85118759f0d4ae244518f1","observation_id":"08b758f6-8b65-4b1e-8b94-521ac97ebb19","resolution":{"observed_at":"2026-08-15T15:52:24.466990Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21437/interspeech.2022-11017","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:24.451437Z","title":"Neural vocoder is all you need for speech super-resolution","venue":null,"work_id":"42558c09-bf2c-4efe-8567-43c70ee196a3","year":2022},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.186923Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:6b3c0102755ae6ab719f758295287659378752827763609fd97f1848276a8bb4","observation_id":"5249730c-98da-4afc-b2db-e844417d3915","resolution":{"observed_at":"2026-08-15T15:52:24.455483Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:24.190696Z","title":"Voicefixer: A unified framework for high-fidelity speech restoration","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.190696Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:5eef2a54e7c8f331e0d8045c22e66b74ad6b11e8bd18c3d53a950a747005d36b","observation_id":"4ef50da4-e2f4-42a5-aa96-2838749eae24","resolution":{"observed_at":"2026-08-15T15:52:24.190696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:25.891492Z","title":"Decoupled Weight Decay Regularization","venue":null,"work_id":"9a184042-8c04-4668-a7df-40ccc409c194","year":2019},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.194835Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:521f1fe1e4ba799bec6d99833e2bc0f1f633b00c0cd8aaeb2f175119951bb33a","observation_id":"bd17b453-3646-4849-b92c-1b591c431cd2","resolution":{"observed_at":"2026-08-15T15:52:25.895367Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:25.878796Z","title":"MP-SENet: A Speech Enhancement Model with Parallel Denoising of Magnitude and Phase Spectra","venue":null,"work_id":"c202d261-f3a9-45aa-afa8-0f02f72e88bc","year":2023},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.199767Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:cb812ca694fa010824431886506c8cb8d450a97833142134be8341a3b22f8263","observation_id":"59e62475-cb9f-4106-8846-ea6fe91e9775","resolution":{"observed_at":"2026-08-15T15:52:25.883033Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:24.204761Z","title":"Towards high-quality and efficient speech bandwidth extension with parallel amplitude and phase prediction","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.204761Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:3684c9c499e1046aee3567df247d467897dd2760b129c2c1c1d3272f124ece85","observation_id":"57457866-5719-4041-bcfc-8d58481740c5","resolution":{"observed_at":"2026-08-15T15:52:24.204761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:25.866421Z","title":"Understanding and improving transformer from a multi-particle dynamic system point of view","venue":null,"work_id":"0b462f85-07c0-479f-a993-7028a8a265f3","year":2020},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.209028Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:4b0164c123189e5c10bcefcd2342b537b6eb2f57371ebb0e9fcddbbb44da6442","observation_id":"3c6e36ce-253d-43bd-8cea-742829b5c31f","resolution":{"observed_at":"2026-08-15T15:52:25.870228Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2019.89372","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:25.194688Z","title":null,"venue":null,"work_id":"5f737441-cdf1-4a30-abee-9387e980d1e4","year":2019},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.213031Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:001c95f8d65410eba0df164b64518667ad7ce5ecde528530b4915fd158291a69","observation_id":"d6ddec0c-013c-40a8-8960-36ad159cc3b0","resolution":{"observed_at":"2026-08-15T15:52:25.200515Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:25.855469Z","title":"Least squares generative adversarial networks","venue":null,"work_id":"bf700dae-2fe8-4cf1-92d7-f3969e374354","year":2017},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.216953Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:d000097145522a6aa8551612da0b31b7c451865026a2eac4c0c9c0146cae5d24","observation_id":"812b17fa-0ad8-4ef5-8de0-e2b638ebed1d","resolution":{"observed_at":"2026-08-15T15:52:25.859221Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.08612","last_updated":"2018-05-30T06:52:06Z","snapshot_observed_at":"2026-08-18T23:33:12.915054Z","submitted_at":"2017-06-26T21:42:27Z","title":"VoxCeleb: a large-scale speaker identification dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.08612","snapshot_observed_at":"2026-08-15T15:52:24.221637Z","title":"VoxCeleb : a large-scale speaker identification dataset","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.221637Z"},"links":{"cited_paper":"/paper/1706.08612","citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:39dab9568ec97ba267ba908d7bb02bfb35c745b79b0b495a26a24401c45ca25b","observation_id":"36b9502b-ba93-495d-b727-bbef41646e15","resolution":{"observed_at":"2026-08-15T15:52:24.221637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:25.842614Z","title":"Acoustical sound database in real environments for sound scene understanding and hands-free speech recognition","venue":null,"work_id":"c8476eee-5b0b-4170-ab03-c39874fe211f","year":2000},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.226451Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:0066a018fef7c7ae5f419073e26f00885d632b090fa7911bfc1a3e68f8b3e973","observation_id":"9a40b620-d7af-4c5b-a6e2-9746b1cf3d1e","resolution":{"observed_at":"2026-08-15T15:52:25.847371Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-08-16T05:39:41.727705Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-15T15:52:24.231010Z","title":"WaveNet : A generative model for raw audio","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.231010Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:72993995e8734ef84d7893a0e31bbc56d58404451e447e5d631bca3818f31ada","observation_id":"7185565a-62d7-4343-b659-6811f728c56d","resolution":{"observed_at":"2026-08-15T15:52:24.231010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:24.235299Z","title":"SEGAN : Speech enhancement generative adversarial network","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.235299Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:5da47a248586625c1c1bbb9b2cbed29aa24019005f54a711524bd3af0369b150","observation_id":"cb79c9df-6b45-4763-9d60-901e436bde4a","resolution":{"observed_at":"2026-08-15T15:52:24.235299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:24.239258Z","title":"Sampling frequency independent dialogue separation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.239258Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:1ac9b47fce240756f43877a2259820ca1aa568835c213c17a47b0632c2472b13","observation_id":"c1b0cc78-7659-40cd-8100-f7ce1f68f828","resolution":{"observed_at":"2026-08-15T15:52:24.239258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21437/interspeech.2020-3038","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:24.424903Z","title":null,"venue":null,"work_id":"b9de5429-8b13-4b24-8696-979c5914f39b","year":2020},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.243272Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:a869daf12da9817295ad60f99499596cdbf99e9de9c688550d0723fd16a441a6","observation_id":"d0478b96-e4c0-4add-b822-e2b4a0fa53a0","resolution":{"observed_at":"2026-08-15T15:52:24.429829Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:25.829381Z","title":"Dnsmos p","venue":null,"work_id":"458a0582-c804-4093-b7f8-d319b27f6266","year":2022},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.247006Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:f1412e4ba2d6aef92626c1f78b6118f9b7c35e540656f1dcfc702a76b9228da0","observation_id":"e781e7cd-a9b3-4b21-850e-73a877a3b212","resolution":{"observed_at":"2026-08-15T15:52:25.834045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:24.250925Z","title":"Speech enhancement and dereverberation with diffusion-based generative models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.250925Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:7138a93747635796e7383323d85330df71e517ad9521fc68e761b84c7e3061f1","observation_id":"97abd07c-23d9-443a-95fa-d22d0c26a774","resolution":{"observed_at":"2026-08-15T15:52:24.250925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:24.254732Z","title":"Rix, J.G","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.254732Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:45ef48e72af66a52a5ebf08e4048ee96d0f0ea0e055fe50b3a969a9047e3d61d","observation_id":"3d4bfadc-1bfb-4858-8ea4-b20b71eaa3f0","resolution":{"observed_at":"2026-08-15T15:52:24.254732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.02508","last_updated":"2018-11-06T17:20:05Z","snapshot_observed_at":"2026-08-14T18:03:15.569348Z","submitted_at":"2018-11-06T17:20:05Z","title":"SDR - half-baked or well done?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.02508","snapshot_observed_at":"2026-08-15T15:52:24.258584Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.258584Z"},"links":{"cited_paper":"/paper/1811.02508","citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:08e96623264c82a09b0b02cb288b0bac2fedaef8ad2487dfa3741156e0ada6ba","observation_id":"41dd7175-598a-4569-87cd-1b6335d9619f","resolution":{"observed_at":"2026-08-15T15:52:24.258584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.02152","last_updated":"2022-06-29T13:42:05Z","snapshot_observed_at":"2026-08-18T07:24:35.277244Z","submitted_at":"2022-04-05T12:23:51Z","title":"UTMOS: UTokyo-SaruLab System for VoiceMOS Challenge 2022","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.02152","snapshot_observed_at":"2026-08-15T15:52:24.262602Z","title":"UTMOS : Utokyo-sarulab system for voicemos challenge 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.262602Z"},"links":{"cited_paper":"/paper/2204.02152","citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:63f501a06ae187549faa52918c7aaba78dbb623f42987b400148adb2820d4482","observation_id":"23e9446b-a5d3-41e0-92e9-bc07ad1ed059","resolution":{"observed_at":"2026-08-15T15:52:24.262602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21437/interspeech.2024-1508","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:24.410170Z","title":"SpeechBERTScore: Reference-Aware Automatic Evaluation of Speech Generation Leveraging NLP Evaluation Metrics","venue":null,"work_id":"18b55840-bd0f-44e2-8d92-e0c9ce7b5caf","year":2024},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.266432Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:9b29cb000b2df32c3a8e5256f523fa20c8c869083e0dd271cd14662fa65ccbc5","observation_id":"a9d32f5b-a80f-423f-83d9-ed67b7750775","resolution":{"observed_at":"2026-08-15T15:52:24.416284Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"1483.2024","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:24.881614Z","title":"Germain, Zexu Pan, and Jonathan Le Roux","venue":null,"work_id":"3b332832-0087-4dc3-b21b-286fcc466564","year":2024},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.270059Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:e56a4f9703e09a14e4ddca39114ce98d0d5881a9cbf752b0186a1329c0afb523","observation_id":"cf7ffad8-aa94-417d-ade1-0937a0db4d2a","resolution":{"observed_at":"2026-08-15T15:52:24.888101Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:24.273778Z","title":"Universal score-based speech enhancement with high content preservation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.273778Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:a36fa257aa7a4150b8507449420074f2f966e60712e4bea200df868979d588bd","observation_id":"cc7e48ce-8201-4cbe-8f4e-da55c57f11f0","resolution":{"observed_at":"2026-08-15T15:52:24.273778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.03065","last_updated":"2022-09-16T10:27:27Z","snapshot_observed_at":"2026-08-16T16:54:50.395014Z","submitted_at":"2022-06-07T07:32:32Z","title":"Universal Speech Enhancement with Score-based Diffusion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.03065","snapshot_observed_at":"2026-08-15T15:52:24.277223Z","title":"Universal speech enhancement with score-based diffusion","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.277223Z"},"links":{"cited_paper":"/paper/2206.03065","citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:bc413c11a5487642d6174a9209cbd55e907a6f383cb82f47dcc791ae4acd72d8","observation_id":"1e516b92-a0e1-4936-9a3f-4a507253294a","resolution":{"observed_at":"2026-08-15T15:52:24.277223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:24.280951Z","title":"TF-CorrNet : Leveraging spatial correlation for continuous speech separation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.280951Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:756afd06b3b91623342d77ac94d33eb1afad768fb5d9c4449c67f60420f971d2","observation_id":"7ba965f3-a0cc-412d-baff-8769279d88ae","resolution":{"observed_at":"2026-08-15T15:52:24.280951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1806.03185","last_updated":"2018-06-08T14:29:08Z","snapshot_observed_at":"2026-08-14T19:05:59.076260Z","submitted_at":"2018-06-08T14:29:08Z","title":"Wave-U-Net: A Multi-Scale Neural Network for End-to-End Audio Source Separation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.03185","snapshot_observed_at":"2026-08-15T15:52:24.284675Z","title":"Wave-u-net: A multi-scale neural network for end-to-end audio source separation","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.284675Z"},"links":{"cited_paper":"/paper/1806.03185","citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:04b806c78035f05aa1257a806d9b7cbdd548058a860fb4a23d7a9d2127e6d839","observation_id":"4c51322f-bb06-44e5-a772-2ff02dcfc409","resolution":{"observed_at":"2026-08-15T15:52:24.284675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:24.288666Z","title":"Roformer: Enhanced transformer with rotary position embedding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.288666Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:e951b54304b6d413cf6dc1c31787831e1ef2fa859cd4ec202194d418fd10a371","observation_id":"ae75efaf-9828-49d6-9f15-1a9fd995b10a","resolution":{"observed_at":"2026-08-15T15:52:24.288666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:25.817566Z","title":"HiFi-GAN : High-fidelity denoising and dereverberation based on speech deep features in adversarial networks","venue":null,"work_id":"5f88aedb-4f39-4012-aac4-57cffaaafb47","year":2020},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.293848Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:f011475886259642445a1524116b5b45fa63e9d484b9c7c4b9e04f7b13e9abe5","observation_id":"5ae4aab7-3567-4818-97c5-1fe1ca6ff42d","resolution":{"observed_at":"2026-08-15T15:52:25.821764Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:25.803847Z","title":"HiFi-GAN-2 : Studio-quality speech enhancement via generative adversarial networks conditioned on acoustic features","venue":null,"work_id":"45c04f52-1805-4c67-8151-fd4a919c79c2","year":2021},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.297653Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:ab81d1c1ca7a14872990ca5d218ecc0ca739c3e6e6b14330142773eef68692d1","observation_id":"d29af622-c388-4d41-9984-2944039aea88","resolution":{"observed_at":"2026-08-15T15:52:25.808820Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:24.301098Z","title":"The diverse environments multi-channel acoustic noise database (demand): A database of multichannel environmental noise recordings","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.301098Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:52902c1aade57eacea5cae847261da213b9cc15b6be5f80e6609678e79dfb836","observation_id":"5b100efb-f0fa-4f83-95ec-e6ea0a7b663f","resolution":{"observed_at":"2026-08-15T15:52:24.301098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:25.791106Z","title":"MLP -mixer: An all- MLP architecture for vision","venue":null,"work_id":"20cfd7e3-bb4b-41dc-82b0-2c3edfd1237a","year":2021},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.304998Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:24d79dc7d2fb4739153b2c1d4956af3dc80c19589e60c626197092c5b5f09c4d","observation_id":"f7796bad-0a21-46ef-8598-dfb70950e765","resolution":{"observed_at":"2026-08-15T15:52:25.795001Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:25.778644Z","title":"Noisy speech database for training speech enhancement algorithms and tts models","venue":null,"work_id":"bd29c4fd-7bbd-45bd-9659-249086ae3087","year":2017},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.308600Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:357fbbab43b587b7ad98c00c2d6fc1a07fc862b40e44ce711230efb89d673184","observation_id":"679364b5-2252-4887-8de0-912d6a901c0b","resolution":{"observed_at":"2026-08-15T15:52:25.782747Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:24.312017Z","title":"Li, Madian Khabsa, Han Fang, and Hao Ma","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.312017Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:7cce98e45bfb0de11f513276bb42b18debd502b6edf9e36186779b13b78400aa","observation_id":"598139cb-862b-4f8c-a555-6c66271cc12a","resolution":{"observed_at":"2026-08-15T15:52:24.312017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:24.315692Z","title":"Deep learning based target cancellation for speech dereverberation","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.315692Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:ac6fa94a9315e211e3ea63869b23bb9af103ea0a154eaf0bfed5e6878503ca84","observation_id":"d782d6ff-9143-40e1-9118-0b4443934b93","resolution":{"observed_at":"2026-08-15T15:52:24.315692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:24.319973Z","title":"TF-GridNet: Integrating Full- and Sub-Band Modeling for Speech Separation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.319973Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:e63075af971d1fe6d7b2fbe5cb6dbda6d477d029b4c204989603698f475c0c7e","observation_id":"0593af82-c16d-4545-91b0-485fe27df438","resolution":{"observed_at":"2026-08-15T15:52:24.319973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:24.323938Z","title":"Speech enhancement with score-based generative models in the complex STFT domain","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.323938Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:f450953ce2a109f002989047f08b116e07a49e4bf6b7486d6a9be5092818e3a0","observation_id":"61d5e02d-8272-417c-8041-590ee5ef7bd2","resolution":{"observed_at":"2026-08-15T15:52:24.323938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:24.327790Z","title":"Cstr vctk corpus: English multi-speaker corpus for cstr voice cloning toolkit (version 0.92)","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.327790Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:65b1d2fa0aa6a628b56633b021839d42afc752afdf40e6987a552e2fe5d6f17e","observation_id":"8709e9c6-028f-4f9e-b02a-4bf069869d84","resolution":{"observed_at":"2026-08-15T15:52:24.327790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.06467","last_updated":"2022-02-14T11:59:32Z","snapshot_observed_at":"2026-08-16T17:49:46.313013Z","submitted_at":"2021-10-13T03:03:49Z","title":"Dual-branch Attention-In-Attention Transformer for single-channel speech enhancement","version":5},"cited_work":{"arxiv_id":"2110.06467","doi":null,"metadata_source":"pith","pith_arxiv_id":"2110.06467","snapshot_observed_at":"2026-08-15T15:52:24.567124Z","title":"Dual-branch Attention-In-Attention Transformer for single-channel speech enhancement","venue":"cs.SD","work_id":"2c413a77-f07b-4077-bdbd-de55d36a345a","year":2021},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.331193Z"},"links":{"cited_paper":"/paper/2110.06467","citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:2f15a30154cdb8b5cfb9fd58bf443663e9c70b5cdb18b630b31a25238831e773","observation_id":"30014cd1-a7c4-425a-9a0f-72aee611f456","resolution":{"observed_at":"2026-08-15T15:52:24.573066Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:24.334583Z","title":"Toward Universal Speech Enhancement For Diverse Input Conditions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.334583Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:6498cd4463b108487a2142605303f4196f18457dbfdc0ea67749f9fcf5493ded","observation_id":"5e13155e-e186-49ea-9f4e-f88605e8918a","resolution":{"observed_at":"2026-08-15T15:52:24.334583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:24.338328Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.338328Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:a549785a28aef60bcec75f2467ad5fe9045c7e4573dca50428e1a7691aae765c","observation_id":"fd238da2-4c31-4b6c-9884-b482691dbb69","resolution":{"observed_at":"2026-08-15T15:52:24.338328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:24.342712Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.342712Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:abd7955651ca8cb7833a1a44614a1bc246088bdb6d1eaec3927d8673fd7ceb6c","observation_id":"7e5d9f6a-1359-43f7-922d-23199e1b8b1b","resolution":{"observed_at":"2026-08-15T15:52:24.342712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:24.346958Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.346958Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:ec85552e7a44d0bca8d9efa1fd7d752929e9ce37c0cad0559b7fafe9326c4ea9","observation_id":"133a79d6-9029-4bc5-9cf8-0a348e1caa6c","resolution":{"observed_at":"2026-08-15T15:52:24.346958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:24.351100Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.351100Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:b6b4e4e195c63566629587a071c11faad9889fb40ab6511220a8f5a41d67c361","observation_id":"4e823c6b-5b27-4863-a7ff-29e626ad7f49","resolution":{"observed_at":"2026-08-15T15:52:24.351100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","latest_version":4,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration"},"reference_resolution":{"displayed":72,"state_counts":{"malformed_identifier":0,"metadata_mismatch":4,"parse_uncertain":0,"unresolved":39,"verified_exact":7,"verified_fuzzy":22},"total_outbound_references":72},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 72 of 72 outbound references and 0 inbound Pith citation observations for arXiv:2509.21003."}