{"as_of":"2026-08-10T06:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9926561872a3284721f649034063fc0f8361fef3d7af848b085d55eff9a72ec1","coverage":[{"denominator":48,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":48,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T10:37:03.781195Z","state":"measured"},{"denominator":52,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":52,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T14:20:49.180965Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-19T13:12:18.207183Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.02942","last_updated":"2025-02-05T07:14:39Z","snapshot_observed_at":"2026-08-09T10:28:59.080733Z","submitted_at":"2025-02-05T07:14:39Z","title":"GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling","version":1},"cited_work":{"arxiv_id":"2502.02942","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.02942","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"GenSE: Generative speech enhancement via language models using hierarchical modeling","venue":null,"work_id":"a11cdfee-3f54-48ba-828c-7ab4fb9aab7d","year":2025},"citing_paper":{"arxiv_id":"2505.24437","last_updated":"2026-05-07T16:01:45Z","snapshot_observed_at":"2026-08-01T04:07:46.006657Z","submitted_at":"2025-05-30T10:20:04Z","title":"SwitchCodec: A High-Fidelity Nerual Audio Codec With Sparse Quantization","version":4},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-19T13:10:14.839742Z"},"links":{"cited_paper":"/paper/2502.02942","citing_paper":"/paper/2505.24437"},"observation_digest":"sha256:d0ace38eb14f13d55a32d3cccbc3727957c32bd2e9500d9f585281a6fa890e15","observation_id":"0934fbbf-1b5d-4e48-a3c9-4affd5419835","resolution":{"observed_at":"2026-05-19T13:12:18.210108Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02942","last_updated":"2025-02-05T07:14:39Z","snapshot_observed_at":"2026-08-09T10:28:59.080733Z","submitted_at":"2025-02-05T07:14:39Z","title":"GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.02942","snapshot_observed_at":"2026-08-03T14:20:49.180965Z","title":"Gense: Generative speech enhancement via language models using hier- archical modeling,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.20978","last_updated":"2026-06-06T11:42:51Z","snapshot_observed_at":"2026-08-09T23:24:19.443679Z","submitted_at":"2025-12-24T06:13:02Z","title":"GenTSE: Enhancing Target Speaker Extraction via a Coarse-to-Fine Generative Language Model","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T14:20:49.180965Z"},"links":{"cited_paper":"/paper/2502.02942","citing_paper":"/paper/2512.20978"},"observation_digest":"sha256:d87e339d514db7c2c27788c72bf8f138ca847a25ec0b77d7152aae986e7fc336","observation_id":"9fd7e768-dd26-4c45-b1b6-e75b77c43489","resolution":{"observed_at":"2026-08-03T14:20:49.180965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02942","last_updated":"2025-02-05T07:14:39Z","snapshot_observed_at":"2026-08-09T10:28:59.080733Z","submitted_at":"2025-02-05T07:14:39Z","title":"GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling","version":1},"cited_work":{"arxiv_id":"2502.02942","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.02942","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"GenSE: Generative speech enhancement via language models using hierarchical modeling","venue":null,"work_id":"a11cdfee-3f54-48ba-828c-7ab4fb9aab7d","year":2025},"citing_paper":{"arxiv_id":"2604.14606","last_updated":"2026-07-20T08:55:18Z","snapshot_observed_at":"2026-08-09T08:22:48.731691Z","submitted_at":"2026-04-16T04:25:03Z","title":"UniPASE: A Generative Model for Universal Speech Enhancement with High Fidelity and Low Hallucinations","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-10T10:18:16.972414Z"},"links":{"cited_paper":"/paper/2502.02942","citing_paper":"/paper/2604.14606"},"observation_digest":"sha256:f1693ea15185ddb3c76bdca217018d221bec5b70b410f363f6fa4516d7ad8dfa","observation_id":"32b38a54-4b1a-46c1-afd9-a606c2a2009d","resolution":{"observed_at":"2026-05-10T10:19:19.986900Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02942","last_updated":"2025-02-05T07:14:39Z","snapshot_observed_at":"2026-08-09T10:28:59.080733Z","submitted_at":"2025-02-05T07:14:39Z","title":"GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.02942","snapshot_observed_at":"2026-08-02T16:16:37.017642Z","title":"GenSE: Generative speech enhancement via language models using hierarchical modeling,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.14606","last_updated":"2026-07-20T08:55:18Z","snapshot_observed_at":"2026-08-09T08:22:48.731691Z","submitted_at":"2026-04-16T04:25:03Z","title":"UniPASE: A Generative Model for Universal Speech Enhancement with High Fidelity and Low Hallucinations","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T16:16:37.017642Z"},"links":{"cited_paper":"/paper/2502.02942","citing_paper":"/paper/2604.14606"},"observation_digest":"sha256:299caca13a6b38f60596eb307d789e498c4406ae03b2ada92a9d7aa4168b16e2","observation_id":"0edcb4b6-3f4a-40e9-b27e-001503530b53","resolution":{"observed_at":"2026-08-02T16:16:37.017642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2502.02942/citation-record","integrity":"/paper/2502.02942/integrity","json":"/paper/2502.02942/citation-record.json","paper":"/paper/2502.02942"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.10533","last_updated":"2024-09-24T01:14:07Z","snapshot_observed_at":"2026-07-06T17:31:04.675896Z","submitted_at":"2024-02-16T09:38:16Z","title":"APCodec: A Neural Audio Codec with Parallel Amplitude and Phase Spectrum Encoding and Decoding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10533","snapshot_observed_at":"2026-08-09T10:37:03.556157Z","title":"Apcodec: A neural audio codec with parallel amplitude and phase spectrum encoding and decoding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02942","last_updated":"2025-02-05T07:14:39Z","snapshot_observed_at":"2026-08-09T10:28:59.080733Z","submitted_at":"2025-02-05T07:14:39Z","title":"GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-09T10:37:03.556157Z"},"links":{"cited_paper":"/paper/2402.10533","citing_paper":"/paper/2502.02942"},"observation_digest":"sha256:aabb7ebd720e950ffbb1358b2d6209282e47a47ef052a85ce8a99d20d58510de","observation_id":"06c49604-3c9a-4dd1-8f00-73114a9b30ea","resolution":{"observed_at":"2026-08-09T10:37:03.556157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:37:04.284434Z","title":null,"venue":null,"work_id":"caee46df-214e-42f3-b95b-37a30e2aceb4","year":2025},"citing_paper":{"arxiv_id":"2502.02942","last_updated":"2025-02-05T07:14:39Z","snapshot_observed_at":"2026-08-09T10:28:59.080733Z","submitted_at":"2025-02-05T07:14:39Z","title":"GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-09T10:37:03.771761Z"},"links":{"citing_paper":"/paper/2502.02942"},"observation_digest":"sha256:3789fff53854fe7303e4be2492781854e6b0d42a7127c5c8c18f42e88bd33416","observation_id":"5f9c9a7a-a4bb-4285-bb43-bec73dc56985","resolution":{"observed_at":"2026-08-09T10:37:04.289191Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.13979","last_updated":"2020-12-15T23:19:19Z","snapshot_observed_at":"2026-08-09T01:00:21.805016Z","submitted_at":"2020-06-24T18:25:05Z","title":"Unsupervised Cross-lingual Representation Learning for Speech Recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.13979","snapshot_observed_at":"2026-08-09T10:37:03.570902Z","title":"Unsupervised cross-lingual representation learning for speech recognition","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2502.02942","last_updated":"2025-02-05T07:14:39Z","snapshot_observed_at":"2026-08-09T10:28:59.080733Z","submitted_at":"2025-02-05T07:14:39Z","title":"GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-09T10:37:03.570902Z"},"links":{"cited_paper":"/paper/2006.13979","citing_paper":"/paper/2502.02942"},"observation_digest":"sha256:8df42b75f6b0da106ad1a71e0d5dea2e4e98c6b0902d761c9c371502e347eda5","observation_id":"31249799-37a2-4892-b4d0-c234593b4b53","resolution":{"observed_at":"2026-08-09T10:37:03.570902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.13438","last_updated":"2022-10-24T17:52:02Z","snapshot_observed_at":"2026-08-09T07:12:13.721596Z","submitted_at":"2022-10-24T17:52:02Z","title":"High Fidelity Neural Audio Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.13438","snapshot_observed_at":"2026-08-09T10:37:03.575758Z","title":"High fidelity neural audio compression","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02942","last_updated":"2025-02-05T07:14:39Z","snapshot_observed_at":"2026-08-09T10:28:59.080733Z","submitted_at":"2025-02-05T07:14:39Z","title":"GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-09T10:37:03.575758Z"},"links":{"cited_paper":"/paper/2210.13438","citing_paper":"/paper/2502.02942"},"observation_digest":"sha256:683ee3f114125e2d986297be6aa2ca5d41242d993153b4f65599dcb4751109b6","observation_id":"fbe90fbe-7b1b-4277-9412-1d6f0bcfd610","resolution":{"observed_at":"2026-08-09T10:37:03.575758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02982","last_updated":"2023-06-13T15:15:17Z","snapshot_observed_at":"2026-07-06T15:38:43.389873Z","submitted_at":"2023-06-05T15:53:15Z","title":"PolyVoice: Language Models for Speech to Speech Translation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02982","snapshot_observed_at":"2026-08-09T10:37:03.580194Z","title":"Polyvoice: Language models for speech to speech transla- tion","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02942","last_updated":"2025-02-05T07:14:39Z","snapshot_observed_at":"2026-08-09T10:28:59.080733Z","submitted_at":"2025-02-05T07:14:39Z","title":"GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-09T10:37:03.580194Z"},"links":{"cited_paper":"/paper/2306.02982","citing_paper":"/paper/2502.02942"},"observation_digest":"sha256:68d45d24075ef4777c890a9c590d5c656b6b73f051f341f8ee476804287d2975","observation_id":"92ae16bd-9663-40d1-8f3b-627c34399576","resolution":{"observed_at":"2026-08-09T10:37:03.580194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:37:04.253296Z","title":null,"venue":null,"work_id":"454e6948-d831-4bca-a311-9979d1037f4f","year":2025},"citing_paper":{"arxiv_id":"2502.02942","last_updated":"2025-02-05T07:14:39Z","snapshot_observed_at":"2026-08-09T10:28:59.080733Z","submitted_at":"2025-02-05T07:14:39Z","title":"GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-09T10:37:03.781195Z"},"links":{"citing_paper":"/paper/2502.02942"},"observation_digest":"sha256:5d0ab44520bf89d374e47655dd037fd502cc7386197b1d9a8a0171e59a0b9756","observation_id":"e841061e-bef3-4a40-b3aa-58a2eca8e5f3","resolution":{"observed_at":"2026-08-09T10:37:04.257698Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:37:04.542674Z","title":"Variational autoencoder for speech enhancement with a noise-aware encoder","venue":null,"work_id":"76ada0b8-cb54-4191-8bae-e337472f409c","year":2021},"citing_paper":{"arxiv_id":"2502.02942","last_updated":"2025-02-05T07:14:39Z","snapshot_observed_at":"2026-08-09T10:28:59.080733Z","submitted_at":"2025-02-05T07:14:39Z","title":"GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-09T10:37:03.590284Z"},"links":{"citing_paper":"/paper/2502.02942"},"observation_digest":"sha256:ffbfe6f23b052c9aceb0968171f417c458cfdc5654608de6519295279ddece4a","observation_id":"48a5a75d-e41e-476f-9180-c9c63600d22c","resolution":{"observed_at":"2026-08-09T10:37:04.547934Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:37:04.513271Z","title":"Fullsubnet: A full-band and sub-band fusion model for real-time single-channel speech enhancement","venue":null,"work_id":"dc08de33-baab-4d28-9348-f161280f2a79","year":2021},"citing_paper":{"arxiv_id":"2502.02942","last_updated":"2025-02-05T07:14:39Z","snapshot_observed_at":"2026-08-09T10:28:59.080733Z","submitted_at":"2025-02-05T07:14:39Z","title":"GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-09T10:37:03.605648Z"},"links":{"citing_paper":"/paper/2502.02942"},"observation_digest":"sha256:0a7242ff218674e203ef96c7e80b2d8524dfcea8787171b553854eb38781b06b","observation_id":"12139086-bc1d-4c2b-a568-7ebed5a690f8","resolution":{"observed_at":"2026-08-09T10:37:04.517963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:37:04.498075Z","title":"Hubert: Self-supervised speech representation learning by masked prediction of hidden units","venue":null,"work_id":"ff61af0e-1b16-41f8-8cf6-f007e51da71a","year":2025},"citing_paper":{"arxiv_id":"2502.02942","last_updated":"2025-02-05T07:14:39Z","snapshot_observed_at":"2026-08-09T10:28:59.080733Z","submitted_at":"2025-02-05T07:14:39Z","title":"GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-09T10:37:03.610815Z"},"links":{"citing_paper":"/paper/2502.02942"},"observation_digest":"sha256:824a0928201f705e2d3e1f85937f5196329f72e1340956a3e41c4d7369629b84","observation_id":"f2468bc9-e5a0-4d90-89f6-93ce67188133","resolution":{"observed_at":"2026-08-09T10:37:04.502747Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.11377","last_updated":"2022-12-21T21:36:52Z","snapshot_observed_at":"2026-07-06T14:33:43.621116Z","submitted_at":"2022-12-21T21:36:52Z","title":"ReVISE: Self-Supervised Speech Resynthesis with Visual Input for Universal and Generalized Speech Enhancement","version":1},"cited_work":{"arxiv_id":"2212.11377","doi":null,"metadata_source":"pith","pith_arxiv_id":"2212.11377","snapshot_observed_at":"2026-08-09T10:37:04.139609Z","title":"ReVISE: Self-Supervised Speech Resynthesis with Visual Input for Universal and Generalized Speech Enhancement","venue":"eess.AS","work_id":"10b7cba0-4e2c-4955-a2c4-f8b9521096b2","year":2022},"citing_paper":{"arxiv_id":"2502.02942","last_updated":"2025-02-05T07:14:39Z","snapshot_observed_at":"2026-08-09T10:28:59.080733Z","submitted_at":"2025-02-05T07:14:39Z","title":"GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-09T10:37:03.615473Z"},"links":{"cited_paper":"/paper/2212.11377","citing_paper":"/paper/2502.02942"},"observation_digest":"sha256:b08136cb00967a3c15c8a27ec21ac06f49400aca0d0575efad172afadd0e23c1","observation_id":"9e98d6b6-d2a6-4112-9438-43f1561609be","resolution":{"observed_at":"2026-08-09T10:37:04.145349Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12208","last_updated":"2025-06-04T05:50:15Z","snapshot_observed_at":"2026-07-06T17:32:15.447061Z","submitted_at":"2024-02-19T15:12:12Z","title":"Language-Codec: Bridging Discrete Codec Representations and Speech Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12208","snapshot_observed_at":"2026-08-09T10:37:03.620875Z","title":"Language-codec: Reducing the gaps between discrete codec representation and speech language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02942","last_updated":"2025-02-05T07:14:39Z","snapshot_observed_at":"2026-08-09T10:28:59.080733Z","submitted_at":"2025-02-05T07:14:39Z","title":"GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-09T10:37:03.620875Z"},"links":{"cited_paper":"/paper/2402.12208","citing_paper":"/paper/2502.02942"},"observation_digest":"sha256:8d0e13195041dfa8592a7b788e91106ee4d6c7bf1f5fee74d1bec4ddae28ec06","observation_id":"d5073d6b-362b-4ea3-9cd6-5d5a8f4957a7","resolution":{"observed_at":"2026-08-09T10:37:03.620875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:37:04.483950Z","title":"Libri- light: A benchmark for asr with limited or no supervision","venue":null,"work_id":"5c55df62-2617-44f2-b40e-7af34e6929a0","year":2020},"citing_paper":{"arxiv_id":"2502.02942","last_updated":"2025-02-05T07:14:39Z","snapshot_observed_at":"2026-08-09T10:28:59.080733Z","submitted_at":"2025-02-05T07:14:39Z","title":"GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-09T10:37:03.630522Z"},"links":{"citing_paper":"/paper/2502.02942"},"observation_digest":"sha256:9b342d29bfca22bd779969d345ef8271e0e74404a34fc994c7abbebde3015382","observation_id":"69673469-7183-4116-9255-789da0f976fc","resolution":{"observed_at":"2026-08-09T10:37:04.488624Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:37:04.469159Z","title":"A study on data augmentation of reverberant speech for robust speech recognition","venue":null,"work_id":"f2636566-48d8-4a5e-80ec-fe96ac3512cc","year":2017},"citing_paper":{"arxiv_id":"2502.02942","last_updated":"2025-02-05T07:14:39Z","snapshot_observed_at":"2026-08-09T10:28:59.080733Z","submitted_at":"2025-02-05T07:14:39Z","title":"GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-09T10:37:03.634723Z"},"links":{"citing_paper":"/paper/2502.02942"},"observation_digest":"sha256:034ea18f96ab75074fa5163430c6f4f8afccd367dfb5f4b8a69e36df6ca090ba","observation_id":"22716251-6203-4a62-82f4-731b6ca1ba61","resolution":{"observed_at":"2026-08-09T10:37:04.473837Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:37:04.454387Z","title":"Lan- guage models as controlled natural language semantic parsers for knowledge graph question an- swering","venue":null,"work_id":"01adf50b-4b82-489c-a2fb-1a02f3c13b73","year":2023},"citing_paper":{"arxiv_id":"2502.02942","last_updated":"2025-02-05T07:14:39Z","snapshot_observed_at":"2026-08-09T10:28:59.080733Z","submitted_at":"2025-02-05T07:14:39Z","title":"GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-09T10:37:03.643592Z"},"links":{"citing_paper":"/paper/2502.02942"},"observation_digest":"sha256:2195d6f07c4f116c422a9b5056098e8e70b06bfaeaeefd9d04540c064600bada","observation_id":"949cdf6a-c968-43eb-a060-482e25189ce8","resolution":{"observed_at":"2026-08-09T10:37:04.459166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07422","last_updated":"2024-06-11T16:22:57Z","snapshot_observed_at":"2026-08-09T13:16:57.379517Z","submitted_at":"2024-06-11T16:22:57Z","title":"Single-Codec: Single-Codebook Speech Codec towards High-Performance Speech Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07422","snapshot_observed_at":"2026-08-09T10:37:03.648039Z","title":"Single-codec: Single-codebook speech codec towards high-performance speech generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02942","last_updated":"2025-02-05T07:14:39Z","snapshot_observed_at":"2026-08-09T10:28:59.080733Z","submitted_at":"2025-02-05T07:14:39Z","title":"GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-09T10:37:03.648039Z"},"links":{"cited_paper":"/paper/2406.07422","citing_paper":"/paper/2502.02942"},"observation_digest":"sha256:3aea27bb5c273e87b9e797c285ec3f4b9331e534cce992b0d2f5c261227eaffe","observation_id":"12f57c02-ea07-424d-9f4b-e8d8571dd0f1","resolution":{"observed_at":"2026-08-09T10:37:03.648039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.04001","last_updated":"2020-04-08T14:17:31Z","snapshot_observed_at":"2026-07-06T09:10:57.234689Z","submitted_at":"2020-04-08T14:17:31Z","title":"Noise Tokens: Learning Neural Noise Templates for Environment-Aware Speech Enhancement","version":1},"cited_work":{"arxiv_id":"2004.04001","doi":null,"metadata_source":"pith","pith_arxiv_id":"2004.04001","snapshot_observed_at":"2026-08-09T10:37:04.053521Z","title":"Noise Tokens: Learning Neural Noise Templates for Environment-Aware Speech Enhancement","venue":"eess.AS","work_id":"2963dc55-a42d-456c-a898-353cc3e655fa","year":2020},"citing_paper":{"arxiv_id":"2502.02942","last_updated":"2025-02-05T07:14:39Z","snapshot_observed_at":"2026-08-09T10:28:59.080733Z","submitted_at":"2025-02-05T07:14:39Z","title":"GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-09T10:37:03.652516Z"},"links":{"cited_paper":"/paper/2004.04001","citing_paper":"/paper/2502.02942"},"observation_digest":"sha256:661e0dee2b95df98fc219e8e26dbb0a8f2b75421a5ed8644886d99cfe6026505","observation_id":"873e4451-21d3-4a4d-a091-16da579da7c4","resolution":{"observed_at":"2026-08-09T10:37:04.059313Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.13731","last_updated":"2021-10-05T15:52:27Z","snapshot_observed_at":"2026-07-06T11:52:12.204724Z","submitted_at":"2021-09-28T13:51:16Z","title":"VoiceFixer: Toward General Speech Restoration with Neural Vocoder","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.13731","snapshot_observed_at":"2026-08-09T10:37:03.661876Z","title":"V oicefixer: Toward general speech restoration with neural vocoder","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02942","last_updated":"2025-02-05T07:14:39Z","snapshot_observed_at":"2026-08-09T10:28:59.080733Z","submitted_at":"2025-02-05T07:14:39Z","title":"GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-09T10:37:03.661876Z"},"links":{"cited_paper":"/paper/2109.13731","citing_paper":"/paper/2502.02942"},"observation_digest":"sha256:0c9071b802cb1f4253312928aa50768f0a04c116903f33d957e5c324366109d0","observation_id":"76e3ce1d-53e6-45d8-9dea-2b7133e179f0","resolution":{"observed_at":"2026-08-09T10:37:03.661876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00233","last_updated":"2024-11-28T12:31:04Z","snapshot_observed_at":"2026-07-06T18:08:00.410061Z","submitted_at":"2024-04-30T22:51:36Z","title":"SemantiCodec: An Ultra Low Bitrate Semantic Audio Codec for General Sound","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00233","snapshot_observed_at":"2026-08-09T10:37:03.666522Z","title":"Se- manticodec: An ultra low bitrate semantic audio codec for general sound","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.02942","last_updated":"2025-02-05T07:14:39Z","snapshot_observed_at":"2026-08-09T10:28:59.080733Z","submitted_at":"2025-02-05T07:14:39Z","title":"GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-09T10:37:03.666522Z"},"links":{"cited_paper":"/paper/2405.00233","citing_paper":"/paper/2502.02942"},"observation_digest":"sha256:56c7a713d36f72416777f785109882c3697379411a66e348e611c0c30703e947","observation_id":"b44fc7fe-1069-487b-b416-2d2cd9e14006","resolution":{"observed_at":"2026-08-09T10:37:03.666522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:37:04.439700Z","title":"Speaker independence of neural vocoders and their effect on parametric resynthesis speech enhancement","venue":null,"work_id":"7b078302-3559-4004-a960-4d53e21023c4","year":2020},"citing_paper":{"arxiv_id":"2502.02942","last_updated":"2025-02-05T07:14:39Z","snapshot_observed_at":"2026-08-09T10:28:59.080733Z","submitted_at":"2025-02-05T07:14:39Z","title":"GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-09T10:37:03.671130Z"},"links":{"citing_paper":"/paper/2502.02942"},"observation_digest":"sha256:37c25db01edab23209a2e4bb9f46e6b59767fbe3ad4332af199d7a98a42a9b4c","observation_id":"21fbec8c-b87a-481f-b3a2-7836e1134c6f","resolution":{"observed_at":"2026-08-09T10:37:04.444577Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15505","last_updated":"2023-10-12T07:55:05Z","snapshot_observed_at":"2026-07-06T16:24:17.829828Z","submitted_at":"2023-09-27T09:13:40Z","title":"Finite Scalar Quantization: VQ-VAE Made Simple","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15505","snapshot_observed_at":"2026-08-09T10:37:03.675402Z","title":"Finite scalar quantiza- tion: Vq-vae made simple","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02942","last_updated":"2025-02-05T07:14:39Z","snapshot_observed_at":"2026-08-09T10:28:59.080733Z","submitted_at":"2025-02-05T07:14:39Z","title":"GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-09T10:37:03.675402Z"},"links":{"cited_paper":"/paper/2309.15505","citing_paper":"/paper/2502.02942"},"observation_digest":"sha256:6aef7a2a595b349bb31f81b57a2425b9c8c66e8ab5ed8779ddce90f1e58304df","observation_id":"17a3139c-8abc-47f6-aac1-38c28d6113b0","resolution":{"observed_at":"2026-08-09T10:37:03.675402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:37:04.424836Z","title":"Dnsmos p","venue":null,"work_id":"650784e7-22c9-4831-aa14-0e27a7ea6a6d","year":2022},"citing_paper":{"arxiv_id":"2502.02942","last_updated":"2025-02-05T07:14:39Z","snapshot_observed_at":"2026-08-09T10:28:59.080733Z","submitted_at":"2025-02-05T07:14:39Z","title":"GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-09T10:37:03.684725Z"},"links":{"citing_paper":"/paper/2502.02942"},"observation_digest":"sha256:0547ce9a886e48558e491741dcf3f0135d91e32602884c56e3136619b8bbd52f","observation_id":"6acf754b-dbc7-405d-9b67-22473d9c8e3c","resolution":{"observed_at":"2026-08-09T10:37:04.429747Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:37:04.409519Z","title":"Fewer-token neural speech codec with time-invariant codes","venue":null,"work_id":"93ecc652-4a70-4d97-a633-489f28486262","year":2024},"citing_paper":{"arxiv_id":"2502.02942","last_updated":"2025-02-05T07:14:39Z","snapshot_observed_at":"2026-08-09T10:28:59.080733Z","submitted_at":"2025-02-05T07:14:39Z","title":"GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-09T10:37:03.688823Z"},"links":{"citing_paper":"/paper/2502.02942"},"observation_digest":"sha256:aa90a0c3d2a63c578023b29f818cb1cf595581d24176be417ce786d1a19fb8ba","observation_id":"55d42621-87a4-4fd1-9fda-f5cc23ccb46d","resolution":{"observed_at":"2026-08-09T10:37:04.414676Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.02152","last_updated":"2022-06-29T13:42:05Z","snapshot_observed_at":"2026-08-04T06:18:23.412967Z","submitted_at":"2022-04-05T12:23:51Z","title":"UTMOS: UTokyo-SaruLab System for VoiceMOS Challenge 2022","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.02152","snapshot_observed_at":"2026-08-09T10:37:03.693127Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02942","last_updated":"2025-02-05T07:14:39Z","snapshot_observed_at":"2026-08-09T10:28:59.080733Z","submitted_at":"2025-02-05T07:14:39Z","title":"GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-09T10:37:03.693127Z"},"links":{"cited_paper":"/paper/2204.02152","citing_paper":"/paper/2502.02942"},"observation_digest":"sha256:43fff00f4c865a484ab09668a98d1f9840779ef05cd938801a44c6447aad5e13","observation_id":"fe002d0a-cc8c-41e1-a026-f26f74bb9db9","resolution":{"observed_at":"2026-08-09T10:37:03.693127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12194","last_updated":"2024-06-18T01:49:00Z","snapshot_observed_at":"2026-08-04T01:54:48.891011Z","submitted_at":"2024-06-18T01:49:00Z","title":"Universal Score-based Speech Enhancement with High Content Preservation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12194","snapshot_observed_at":"2026-08-09T10:37:03.697677Z","title":"Universal score-based speech enhancement with high content preservation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02942","last_updated":"2025-02-05T07:14:39Z","snapshot_observed_at":"2026-08-09T10:28:59.080733Z","submitted_at":"2025-02-05T07:14:39Z","title":"GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-09T10:37:03.697677Z"},"links":{"cited_paper":"/paper/2406.12194","citing_paper":"/paper/2502.02942"},"observation_digest":"sha256:e4cc6ef222010fe6f54f7e96558ddcc23c8b27844cb71944a5b37a4305bc63ad","observation_id":"c76a641e-ac99-424b-84f4-67a3546f93d4","resolution":{"observed_at":"2026-08-09T10:37:03.697677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00814","last_updated":"2024-05-29T14:21:47Z","snapshot_observed_at":"2026-08-08T02:04:12.090464Z","submitted_at":"2023-06-01T15:40:32Z","title":"Vocos: Closing the gap between time-domain and Fourier-based neural vocoders for high-quality audio synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.00814","snapshot_observed_at":"2026-08-09T10:37:03.701969Z","title":"V ocos: Closing the gap between time-domain and fourier-based neural vocoders for high-quality audio synthesis","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.02942","last_updated":"2025-02-05T07:14:39Z","snapshot_observed_at":"2026-08-09T10:28:59.080733Z","submitted_at":"2025-02-05T07:14:39Z","title":"GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-09T10:37:03.701969Z"},"links":{"cited_paper":"/paper/2306.00814","citing_paper":"/paper/2502.02942"},"observation_digest":"sha256:66abe4cf8147a3e5454c9226ba66bdf9b6911e59478f0f093c6b83b6c0e26eda","observation_id":"acc77a20-f55a-4746-86b1-74de8fce3ff3","resolution":{"observed_at":"2026-08-09T10:37:03.701969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:37:04.394157Z","title":"The voice bank corpus: Design, collection and data analysis of a large regional accent speech database","venue":null,"work_id":"1bf95d51-cda4-481e-9127-1a78058aad1f","year":2013},"citing_paper":{"arxiv_id":"2502.02942","last_updated":"2025-02-05T07:14:39Z","snapshot_observed_at":"2026-08-09T10:28:59.080733Z","submitted_at":"2025-02-05T07:14:39Z","title":"GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-09T10:37:03.706795Z"},"links":{"citing_paper":"/paper/2502.02942"},"observation_digest":"sha256:f9bcb457bd8c328c703c642d71c97cc2de051cdaa7af1d47c0edf56cadc1de68","observation_id":"b30ab931-29a9-4a06-b78d-1c13f78ceb4b","resolution":{"observed_at":"2026-08-09T10:37:04.399196Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.01160","last_updated":"2019-07-02T04:27:55Z","snapshot_observed_at":"2026-07-06T08:04:17.909965Z","submitted_at":"2019-07-02T04:27:55Z","title":"WHAM!: Extending Speech Separation to Noisy Environments","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.01160","snapshot_observed_at":"2026-08-09T10:37:03.716408Z","title":"Wham!: Extending speech separation to noisy environments","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2502.02942","last_updated":"2025-02-05T07:14:39Z","snapshot_observed_at":"2026-08-09T10:28:59.080733Z","submitted_at":"2025-02-05T07:14:39Z","title":"GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-09T10:37:03.716408Z"},"links":{"cited_paper":"/paper/1907.01160","citing_paper":"/paper/2502.02942"},"observation_digest":"sha256:4ba06504e1c4926c029dca8ac8e0829ca4eca64b32e9c8de2b85259ef43d1673","observation_id":"464655a4-19bf-40e4-abcb-5fcbbed33fcb","resolution":{"observed_at":"2026-08-09T10:37:03.716408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:37:04.378499Z","title":"Audiodec: An open-source streaming high-fidelity neural audio codec","venue":null,"work_id":"bc585c55-ebdd-4c7e-9e68-19cf27bf6bc7","year":2023},"citing_paper":{"arxiv_id":"2502.02942","last_updated":"2025-02-05T07:14:39Z","snapshot_observed_at":"2026-08-09T10:28:59.080733Z","submitted_at":"2025-02-05T07:14:39Z","title":"GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-09T10:37:03.722180Z"},"links":{"citing_paper":"/paper/2502.02942"},"observation_digest":"sha256:8429052b78ba6a77845960b558635305c2da22c0d0386769f44f2ff245dbae55","observation_id":"afa3289d-9183-4eda-a8c8-8ba17ff32094","resolution":{"observed_at":"2026-08-09T10:37:04.383185Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.02765","last_updated":"2023-05-07T09:22:04Z","snapshot_observed_at":"2026-08-06T10:45:04.364170Z","submitted_at":"2023-05-04T12:11:13Z","title":"HiFi-Codec: Group-residual Vector quantization for High Fidelity Audio Codec","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.02765","snapshot_observed_at":"2026-08-09T10:37:03.726917Z","title":"Hifi-codec: Group-residual vector quantization for high fidelity audio codec","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02942","last_updated":"2025-02-05T07:14:39Z","snapshot_observed_at":"2026-08-09T10:28:59.080733Z","submitted_at":"2025-02-05T07:14:39Z","title":"GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-09T10:37:03.726917Z"},"links":{"cited_paper":"/paper/2305.02765","citing_paper":"/paper/2502.02942"},"observation_digest":"sha256:b69931db966b87d8a688fabafff38bfb0bb9dd0bbdf8dbcda910313d7859b24b","observation_id":"1322981d-a653-44ed-a58f-ded95262096f","resolution":{"observed_at":"2026-08-09T10:37:03.726917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.02882","last_updated":"2019-04-05T06:05:00Z","snapshot_observed_at":"2026-08-07T13:32:24.356336Z","submitted_at":"2019-04-05T06:05:00Z","title":"LibriTTS: A Corpus Derived from LibriSpeech for Text-to-Speech","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.02882","snapshot_observed_at":"2026-08-09T10:37:03.731933Z","title":"Libritts: A corpus derived from librispeech for text-to-speech","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2502.02942","last_updated":"2025-02-05T07:14:39Z","snapshot_observed_at":"2026-08-09T10:28:59.080733Z","submitted_at":"2025-02-05T07:14:39Z","title":"GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-09T10:37:03.731933Z"},"links":{"cited_paper":"/paper/1904.02882","citing_paper":"/paper/2502.02942"},"observation_digest":"sha256:afa5538246f0851cc86dacecc148f6fe1a7e70aad87dbc3cd9fc6da6608955a8","observation_id":"d9203ab6-3161-42cd-8002-275405161514","resolution":{"observed_at":"2026-08-09T10:37:03.731933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10642","last_updated":"2024-09-23T22:57:44Z","snapshot_observed_at":"2026-07-06T17:31:08.762955Z","submitted_at":"2024-02-16T12:43:01Z","title":"Speaking in Wavelet Domain: A Simple and Efficient Approach to Speed up Speech Diffusion Model","version":2},"cited_work":{"arxiv_id":"2402.10642","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.10642","snapshot_observed_at":"2026-08-09T10:37:03.837653Z","title":"Speaking in Wavelet Domain: A Simple and Efficient Approach to Speed up Speech Diffusion Model","venue":"eess.AS","work_id":"4452768d-0cbe-48a4-89c3-f3ff7e01ae4d","year":2024},"citing_paper":{"arxiv_id":"2502.02942","last_updated":"2025-02-05T07:14:39Z","snapshot_observed_at":"2026-08-09T10:28:59.080733Z","submitted_at":"2025-02-05T07:14:39Z","title":"GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-09T10:37:03.736696Z"},"links":{"cited_paper":"/paper/2402.10642","citing_paper":"/paper/2502.02942"},"observation_digest":"sha256:7016d057ad30a8fa481cfb9c7bae067e1d23b7098942a10f455e2e23661c5f46","observation_id":"d0c6c1ff-b73b-4952-93c3-ec6c44925d76","resolution":{"observed_at":"2026-08-09T10:37:03.844720Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16692","last_updated":"2024-01-23T01:56:57Z","snapshot_observed_at":"2026-08-07T03:22:13.424379Z","submitted_at":"2023-08-31T12:53:09Z","title":"SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.16692","snapshot_observed_at":"2026-08-09T10:37:03.741448Z","title":"Speechtokenizer: Unified speech tokenizer for speech large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02942","last_updated":"2025-02-05T07:14:39Z","snapshot_observed_at":"2026-08-09T10:28:59.080733Z","submitted_at":"2025-02-05T07:14:39Z","title":"GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-09T10:37:03.741448Z"},"links":{"cited_paper":"/paper/2308.16692","citing_paper":"/paper/2502.02942"},"observation_digest":"sha256:a90b3b50dd2f99699c28266a04e86e053d7e0277bbd815f0885332e10acc978d","observation_id":"5cc50158-7a0e-45a4-ac35-9bf2cd84f3ad","resolution":{"observed_at":"2026-08-09T10:37:03.741448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:37:04.363425Z","title":"We discuss several common questions for the design of GenSE","venue":null,"work_id":"c9f95d15-092c-405f-bb35-6d6d167b1738","year":2022},"citing_paper":{"arxiv_id":"2502.02942","last_updated":"2025-02-05T07:14:39Z","snapshot_observed_at":"2026-08-09T10:28:59.080733Z","submitted_at":"2025-02-05T07:14:39Z","title":"GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-09T10:37:03.746318Z"},"links":{"citing_paper":"/paper/2502.02942"},"observation_digest":"sha256:a62543fe700a54131687cdacc3b60cb15c2bb25b21e870177b92d3d62aaaa459","observation_id":"7ef73369-47ff-47a4-8da5-f840c90aaa53","resolution":{"observed_at":"2026-08-09T10:37:04.368095Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:37:04.348634Z","title":"On the other hand, we chose XLSR as the semantic extractor due to the key advantage of its multilin- gual speech representation capabilities","venue":null,"work_id":"48fbb978-c8a1-4de9-81e5-600c6fdb0e09","year":2025},"citing_paper":{"arxiv_id":"2502.02942","last_updated":"2025-02-05T07:14:39Z","snapshot_observed_at":"2026-08-09T10:28:59.080733Z","submitted_at":"2025-02-05T07:14:39Z","title":"GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-09T10:37:03.751285Z"},"links":{"citing_paper":"/paper/2502.02942"},"observation_digest":"sha256:2c1de1e3908f926fd27eec8a9feed0dc703e9cf234878495be893d936b671f86","observation_id":"abf7d858-0d37-46c7-ad03-e6066347135e","resolution":{"observed_at":"2026-08-09T10:37:04.353500Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:37:04.331744Z","title":"To address this limitation, we also conducted an ABX test to assess the perceptual quality of the enhanced speech compared to clean speech, as shown in Figure","venue":null,"work_id":"f35fe41c-41d1-4eb2-b58d-100e971faa46","year":2022},"citing_paper":{"arxiv_id":"2502.02942","last_updated":"2025-02-05T07:14:39Z","snapshot_observed_at":"2026-08-09T10:28:59.080733Z","submitted_at":"2025-02-05T07:14:39Z","title":"GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-09T10:37:03.756648Z"},"links":{"citing_paper":"/paper/2502.02942"},"observation_digest":"sha256:e696644bbdbb62d8851fc6621fac7232472c5c0befb6c201cc11e6e06228ab23","observation_id":"c74d7a16-07f5-49f5-bded-6d167a258413","resolution":{"observed_at":"2026-08-09T10:37:04.337453Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:37:04.315800Z","title":"No Preference","venue":null,"work_id":"4baf0aeb-9292-49a4-82f7-a89627b5c810","year":2025},"citing_paper":{"arxiv_id":"2502.02942","last_updated":"2025-02-05T07:14:39Z","snapshot_observed_at":"2026-08-09T10:28:59.080733Z","submitted_at":"2025-02-05T07:14:39Z","title":"GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-09T10:37:03.761784Z"},"links":{"citing_paper":"/paper/2502.02942"},"observation_digest":"sha256:190096961b9706ccf9557f46344cd5df3bd98f746a77965fdc40eda4958f22d8","observation_id":"3d73fd3b-356c-4181-a7f4-f86cd57c86b2","resolution":{"observed_at":"2026-08-09T10:37:04.320599Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:37:04.269213Z","title":"We also observe that finite scalar quantization (FSQ) (Mentzer et al., 2023a) demonstrates lower reconstruction quality","venue":null,"work_id":"0adb66ec-1b61-4576-ac55-94e31e476f93","year":2024},"citing_paper":{"arxiv_id":"2502.02942","last_updated":"2025-02-05T07:14:39Z","snapshot_observed_at":"2026-08-09T10:28:59.080733Z","submitted_at":"2025-02-05T07:14:39Z","title":"GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-09T10:37:03.776701Z"},"links":{"citing_paper":"/paper/2502.02942"},"observation_digest":"sha256:747083ee7c6b8fb6aad667ead46b792bc47e7c7a4a05216988fb3bfff709967e","observation_id":"36e4c198-c62a-4e1c-a0e0-5a05278cb404","resolution":{"observed_at":"2026-08-09T10:37:04.273771Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:37:04.299756Z","title":"We employ the AdamW optimizer with a learning rate of 1e-4 to optimize the codec model","venue":null,"work_id":"5e5608be-25d9-4e59-b3d2-acbab4a24995","year":2025},"citing_paper":{"arxiv_id":"2502.02942","last_updated":"2025-02-05T07:14:39Z","snapshot_observed_at":"2026-08-09T10:28:59.080733Z","submitted_at":"2025-02-05T07:14:39Z","title":"GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling","version":1},"reference_index":128,"source":"pdf_text","source_observed_at":"2026-08-09T10:37:03.767028Z"},"links":{"citing_paper":"/paper/2502.02942"},"observation_digest":"sha256:73f94ac113f5c0eaf917a393f0ff1b9c740c056accce4ffc5cd183db632d1506","observation_id":"12ea5c2a-2b9b-40a2-965f-1b5b29361e4c","resolution":{"observed_at":"2026-08-09T10:37:04.305095Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-09T10:37:03.711308Z","title":"Neural codec language models are zero-shot text to speech synthesizers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02942","last_updated":"2025-02-05T07:14:39Z","snapshot_observed_at":"2026-08-09T10:28:59.080733Z","submitted_at":"2025-02-05T07:14:39Z","title":"GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling","version":1},"reference_index":2013,"source":"pdf_text","source_observed_at":"2026-08-09T10:37:03.711308Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2502.02942"},"observation_digest":"sha256:71e6cc7503c439be784d5b1450908eb568fdaa9bf0bdb882daee59b1d2bee51e","observation_id":"e5545a6d-5a73-46d4-8d01-d56cb98ebb8f","resolution":{"observed_at":"2026-08-09T10:37:03.711308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.01902","last_updated":"2021-04-05T01:19:31Z","snapshot_observed_at":"2026-08-08T13:15:55.788700Z","submitted_at":"2021-01-06T07:46:25Z","title":"Interspeech 2021 Deep Noise Suppression Challenge","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.01902","snapshot_observed_at":"2026-08-09T10:37:03.680242Z","title":"Interspeech 2021 deep noise suppression challenge","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.02942","last_updated":"2025-02-05T07:14:39Z","snapshot_observed_at":"2026-08-09T10:28:59.080733Z","submitted_at":"2025-02-05T07:14:39Z","title":"GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-09T10:37:03.680242Z"},"links":{"cited_paper":"/paper/2101.01902","citing_paper":"/paper/2502.02942"},"observation_digest":"sha256:3eb7018f48d021895e6a8965f834bb1794428f17756a48d11e2e4f66f9d73324","observation_id":"a752c229-8f33-415f-8e9c-fcfa022b4eb1","resolution":{"observed_at":"2026-08-09T10:37:03.680242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:37:04.557753Z","title":"Funcodec: A fundamental, reproducible and integrable open-source toolkit for neural speech codec","venue":null,"work_id":"fb94d63b-d93d-48a4-81b8-660b1f9c6aa1","year":2024},"citing_paper":{"arxiv_id":"2502.02942","last_updated":"2025-02-05T07:14:39Z","snapshot_observed_at":"2026-08-09T10:28:59.080733Z","submitted_at":"2025-02-05T07:14:39Z","title":"GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-09T10:37:03.585622Z"},"links":{"citing_paper":"/paper/2502.02942"},"observation_digest":"sha256:c1f2d005eb877316fc2e7dcbc348c1b1e63e6ac34ef64778a2f0bd07ea81d1a5","observation_id":"df688006-3bb2-455e-8e55-212d5ed86908","resolution":{"observed_at":"2026-08-09T10:37:04.562354Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11362","last_updated":"2020-10-22T01:00:23Z","snapshot_observed_at":"2026-08-06T08:52:24.459809Z","submitted_at":"2020-10-22T01:00:23Z","title":"NU-GAN: High resolution neural upsampling with GAN","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11362","snapshot_observed_at":"2026-08-09T10:37:03.638921Z","title":"Nu-gan: High resolution neural upsampling with gan","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2502.02942","last_updated":"2025-02-05T07:14:39Z","snapshot_observed_at":"2026-08-09T10:28:59.080733Z","submitted_at":"2025-02-05T07:14:39Z","title":"GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-09T10:37:03.638921Z"},"links":{"cited_paper":"/paper/2010.11362","citing_paper":"/paper/2502.02942"},"observation_digest":"sha256:172bb35d0796e2ba5544fdce61d05d025e3d1e4850e296ba880b45440e17cf03","observation_id":"dc161ac4-b595-45a0-b79e-f979fe65ab21","resolution":{"observed_at":"2026-08-09T10:37:03.638921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16321","last_updated":"2024-02-26T06:01:38Z","snapshot_observed_at":"2026-07-06T17:35:18.965223Z","submitted_at":"2024-02-26T06:01:38Z","title":"Self-Supervised Speech Quality Estimation and Enhancement Using Only Clean Speech","version":1},"cited_work":{"arxiv_id":"2402.16321","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.16321","snapshot_observed_at":"2026-08-09T10:37:04.162043Z","title":"Self-Supervised Speech Quality Estimation and Enhancement Using Only Clean Speech","venue":"cs.SD","work_id":"1cbb0ce2-3a1a-4c8d-956f-472111099fee","year":2024},"citing_paper":{"arxiv_id":"2502.02942","last_updated":"2025-02-05T07:14:39Z","snapshot_observed_at":"2026-08-09T10:28:59.080733Z","submitted_at":"2025-02-05T07:14:39Z","title":"GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-09T10:37:03.599883Z"},"links":{"cited_paper":"/paper/2402.16321","citing_paper":"/paper/2502.02942"},"observation_digest":"sha256:20b4936a3c43c1bf1e2ac25e5915c9130d5a89d0d8ac61a8bbddf1684bd75e19","observation_id":"6c4c018e-0e23-4898-976b-24d6cfb1cec1","resolution":{"observed_at":"2026-08-09T10:37:04.166692Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01156","last_updated":"2024-11-09T05:58:10Z","snapshot_observed_at":"2026-08-10T00:08:15.031162Z","submitted_at":"2024-11-02T07:04:02Z","title":"Fish-Speech: Leveraging Large Language Models for Advanced Multilingual Text-to-Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01156","snapshot_observed_at":"2026-08-09T10:37:03.657296Z","title":"Fish-speech: Leveraging large language models for advanced multilingual text-to-speech synthe- sis","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.02942","last_updated":"2025-02-05T07:14:39Z","snapshot_observed_at":"2026-08-09T10:28:59.080733Z","submitted_at":"2025-02-05T07:14:39Z","title":"GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-09T10:37:03.657296Z"},"links":{"cited_paper":"/paper/2411.01156","citing_paper":"/paper/2502.02942"},"observation_digest":"sha256:190a3724f66c1aa995535b44b1f4b021db4f49457d7071a2b9c7e88f63778d59","observation_id":"9c711ee6-7141-46e4-a003-909bbdfd5f41","resolution":{"observed_at":"2026-08-09T10:37:03.657296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:37:04.527646Z","title":"Metricgan: Generative adversarial net- works based black-box metric scores optimization for speech enhancement","venue":null,"work_id":"cddfe503-a7d1-45ee-b44a-8502916d6a5b","year":null},"citing_paper":{"arxiv_id":"2502.02942","last_updated":"2025-02-05T07:14:39Z","snapshot_observed_at":"2026-08-09T10:28:59.080733Z","submitted_at":"2025-02-05T07:14:39Z","title":"GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-09T10:37:03.595122Z"},"links":{"citing_paper":"/paper/2502.02942"},"observation_digest":"sha256:6b58b1a4d45d5845473350d4c981428ef31bbd90eab9ae685c145820c28a86ef","observation_id":"32685557-cfe0-42df-8a48-0100d4aa5dea","resolution":{"observed_at":"2026-08-09T10:37:04.532634Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.09636","last_updated":"2023-05-16T17:41:25Z","snapshot_observed_at":"2026-08-06T19:45:49.830925Z","submitted_at":"2023-05-16T17:41:25Z","title":"SoundStorm: Efficient Parallel Audio Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.09636","snapshot_observed_at":"2026-08-09T10:37:03.566091Z","title":"Audiolm: a language modeling approach to audio generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02942","last_updated":"2025-02-05T07:14:39Z","snapshot_observed_at":"2026-08-09T10:28:59.080733Z","submitted_at":"2025-02-05T07:14:39Z","title":"GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-09T10:37:03.566091Z"},"links":{"cited_paper":"/paper/2305.09636","citing_paper":"/paper/2502.02942"},"observation_digest":"sha256:8eabf2e819c5a68a8448c31c4c8c6b0c3f37796bd7288775833c34ac668ee1c4","observation_id":"48941f34-dddc-46bc-9f8d-d1e66e99fbc8","resolution":{"observed_at":"2026-08-09T10:37:03.566091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03100","last_updated":"2024-04-23T08:38:03Z","snapshot_observed_at":"2026-08-07T23:22:31.422843Z","submitted_at":"2024-03-05T16:35:25Z","title":"NaturalSpeech 3: Zero-Shot Speech Synthesis with Factorized Codec and Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03100","snapshot_observed_at":"2026-08-09T10:37:03.625975Z","title":"Naturalspeech 3: Zero-shot speech synthesis with factor- ized codec and diffusion models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02942","last_updated":"2025-02-05T07:14:39Z","snapshot_observed_at":"2026-08-09T10:28:59.080733Z","submitted_at":"2025-02-05T07:14:39Z","title":"GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-09T10:37:03.625975Z"},"links":{"cited_paper":"/paper/2403.03100","citing_paper":"/paper/2502.02942"},"observation_digest":"sha256:e64936d7cdd739c82929727b53e371b99ecc1d2a543f82b323824394d1c63a60","observation_id":"72b5b59b-50fd-4783-9f12-2e1ab27da007","resolution":{"observed_at":"2026-08-09T10:37:03.625975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:37:04.572166Z","title":"Unsupervised speech en- hancement using dynamical variational autoencoders.IEEE/ACM Transactions on Audio, Speech, and Language Processing, 30:2993–3007,","venue":null,"work_id":"59aa9923-a833-4231-b434-7033e2566f61","year":2025},"citing_paper":{"arxiv_id":"2502.02942","last_updated":"2025-02-05T07:14:39Z","snapshot_observed_at":"2026-08-09T10:28:59.080733Z","submitted_at":"2025-02-05T07:14:39Z","title":"GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-09T10:37:03.561414Z"},"links":{"citing_paper":"/paper/2502.02942"},"observation_digest":"sha256:19c2fa9705d808c0ca0c045bb987f7904d62ee7d033c5cb740b20c3427a193db","observation_id":"31880e8c-2126-42e5-8443-ce43a3992637","resolution":{"observed_at":"2026-08-09T10:37:04.577005Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2502.02942","last_updated":"2025-02-05T07:14:39Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-09T10:28:59.080733Z","submitted_at":"2025-02-05T07:14:39Z","title":"GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling"},"reference_resolution":{"displayed":48,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":24,"verified_exact":4,"verified_fuzzy":20},"total_outbound_references":48},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 48 of 48 outbound references and 4 inbound Pith citation observations for arXiv:2502.02942."}