Pith. sign in

Paper Citation Record · LEDGER

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling

As of 23 August 2026, this Paper Citation Record lists 48 of 48 outbound references and 5 inbound Pith citation observations for arXiv:2502.02942.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2502.02942 v1

Coverage vector

measured 48 of 48 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-09T10:37:03.781195Z

measured 53 of 53 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-23T06:30:58.430688+00:00

measured 5 of 5 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-15T18:04:57.555362Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-05-19T13:12:18.207183Z

Reference resolution

48 of 48 outbound references displayed

  • verified exact4
  • verified fuzzy20
  • unresolved24
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 06c49604-3c9a-4dd1-8f00-73114a9b30ea · outbound

This paper cites APCodec: A Neural Audio Codec with Parallel Amplitude and Phase Spectrum Encoding and Decoding.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling APCodec: A Neural Audio Codec with Parallel Amplitude and Phase Spectrum Encoding and Decoding

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-09T10:37:03.556157Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T10:37:03.556157Z digest=sha256:c3603c325571d0b82d14b1bbb76f0a045a50f42aec9a551094009594755a5fca

Observation 5f9c9a7a-a4bb-4285-bb43-bec73dc56985 · outbound

This paper cites an unresolved cited work.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling Unresolved cited work

Reference 2

Resolution
unresolved
raw_fallback, observed 2026-08-09T10:37:04.289191Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-09T10:37:03.771761Z digest=sha256:74dc74f27ee29f1442b22af0104880f9dddee44a8d329331114731622087d186

Observation 31249799-37a2-4892-b4d0-c234593b4b53 · outbound

This paper cites Unsupervised Cross-lingual Representation Learning for Speech Recognition.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling Unsupervised Cross-lingual Representation Learning for Speech Recognition

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-09T10:37:03.570902Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T10:37:03.570902Z digest=sha256:9bef1edc27c0be80be9e5a9d7ee6c189d989aff8dfc7aa1be7e5001e66c391d7

Observation fbe90fbe-7b1b-4277-9412-1d6f0bcfd610 · outbound

This paper cites High Fidelity Neural Audio Compression.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling High Fidelity Neural Audio Compression

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-09T10:37:03.575758Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T10:37:03.575758Z digest=sha256:c11a3e8412c5ebbba4d9614bdffe62ef55364952e25f2bd4fd35ef2384874883

Observation 92ae16bd-9663-40d1-8f3b-627c34399576 · outbound

This paper cites PolyVoice: Language Models for Speech to Speech Translation.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling PolyVoice: Language Models for Speech to Speech Translation

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-09T10:37:03.580194Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T10:37:03.580194Z digest=sha256:f77c3c582ea90d31dac5a9a65a6f88ab165ad381f3177e62d10b5b80a7e71869

Observation e841061e-bef3-4a40-b3aa-58a2eca8e5f3 · outbound

This paper cites an unresolved cited work.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling Unresolved cited work

Reference 7

Resolution
unresolved
raw_fallback, observed 2026-08-09T10:37:04.257698Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-09T10:37:03.781195Z digest=sha256:73a1868f40a9e5fb7753b9ff1e8b37fce7857b89b3a6301eed44d4c24c7f2f53

Observation 48a5a75d-e41e-476f-9180-c9c63600d22c · outbound

This paper cites Variational autoencoder for speech enhancement with a noise-aware encoder.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling Variational autoencoder for speech enhancement with a noise-aware encoder

Reference 8

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T10:37:04.547934Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-09T10:37:03.590284Z digest=sha256:dc614d2e3d8cf5c1696885d4ce963775b8f5c95b22500fa07ff1299040affbce

Observation 12139086-bc1d-4c2b-a568-7ebed5a690f8 · outbound

This paper cites Fullsubnet: A full-band and sub-band fusion model for real-time single-channel speech enhancement.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling Fullsubnet: A full-band and sub-band fusion model for real-time single-channel speech enhancement

Reference 11

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T10:37:04.517963Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-09T10:37:03.605648Z digest=sha256:dba7a98196d829f69402e68ba11263edd658a3357c9a6c6c1626caa2735a8e7e

Observation f2468bc9-e5a0-4d90-89f6-93ce67188133 · outbound

This paper cites Hubert: Self-supervised speech representation learning by masked prediction of hidden units.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling Hubert: Self-supervised speech representation learning by masked prediction of hidden units

Reference 12

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T10:37:04.502747Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-09T10:37:03.610815Z digest=sha256:016415d4184866e2931814eaf6d3f641be11c65842f31d7687ceca3e64cfe54e

Observation 9e98d6b6-d2a6-4112-9438-43f1561609be · outbound

This paper cites ReVISE: Self-Supervised Speech Resynthesis with Visual Input for Universal and Generalized Speech Enhancement.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling ReVISE: Self-Supervised Speech Resynthesis with Visual Input for Universal and Generalized Speech Enhancement

Reference 13

Resolution
verified exact
local_arxiv, observed 2026-08-09T10:37:04.145349Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-09T10:37:03.615473Z digest=sha256:dc2dcf3d7695c22cf39f6281ba907cb891f487390a1a369fd8f8b99c9636f47f

Observation d5073d6b-362b-4ea3-9cd6-5d5a8f4957a7 · outbound

This paper cites Language-Codec: Bridging Discrete Codec Representations and Speech Language Models.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling Language-Codec: Bridging Discrete Codec Representations and Speech Language Models

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-09T10:37:03.620875Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T10:37:03.620875Z digest=sha256:969a9e4eef7c4c3cece8ee432e216c330d6c12a462813d09f7e5901d8cfe0d94

Observation 69673469-7183-4116-9255-789da0f976fc · outbound

This paper cites Libri- light: A benchmark for asr with limited or no supervision.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling Libri- light: A benchmark for asr with limited or no supervision

Reference 16

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T10:37:04.488624Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-09T10:37:03.630522Z digest=sha256:8adca4f97a336582754300fe7392bc104413bf1ebff5764d42017609c906db0b

Observation 22716251-6203-4a62-82f4-731b6ca1ba61 · outbound

This paper cites A study on data augmentation of reverberant speech for robust speech recognition.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling A study on data augmentation of reverberant speech for robust speech recognition

Reference 17

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T10:37:04.473837Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-09T10:37:03.634723Z digest=sha256:1a2ad4f13284a3edc492eb0bf45846bffe89db32c8a7348700e511361a5097a5

Observation 949cdf6a-c968-43eb-a060-482e25189ce8 · outbound

This paper cites Lan- guage models as controlled natural language semantic parsers for knowledge graph question an- swering.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling Lan- guage models as controlled natural language semantic parsers for knowledge graph question an- swering

Reference 19

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T10:37:04.459166Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-09T10:37:03.643592Z digest=sha256:26d4895fe5f45a8711eefac9292323b9ac2f41f7e533516c8d0b5be5405baf31

Observation 12f57c02-ea07-424d-9f4b-e8d8571dd0f1 · outbound

This paper cites Single-Codec: Single-Codebook Speech Codec towards High-Performance Speech Generation.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling Single-Codec: Single-Codebook Speech Codec towards High-Performance Speech Generation

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-09T10:37:03.648039Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T10:37:03.648039Z digest=sha256:432fb45688d3f8e99640c7f62703fd47209c7efddd4dbadd5adfda80cc5e2dcc

Observation 873e4451-21d3-4a4d-a091-16da579da7c4 · outbound

This paper cites Noise Tokens: Learning Neural Noise Templates for Environment-Aware Speech Enhancement.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling Noise Tokens: Learning Neural Noise Templates for Environment-Aware Speech Enhancement

Reference 21

Resolution
verified exact
local_arxiv, observed 2026-08-09T10:37:04.059313Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-09T10:37:03.652516Z digest=sha256:8fc740a38b4f0bc7e14656cfcbe83d7e6d369ca546b7a1f8b749dcfadb687ece

Observation 76e3ce1d-53e6-45d8-9dea-2b7133e179f0 · outbound

This paper cites VoiceFixer: Toward General Speech Restoration with Neural Vocoder.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling VoiceFixer: Toward General Speech Restoration with Neural Vocoder

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-09T10:37:03.661876Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T10:37:03.661876Z digest=sha256:f42b8bc5073a04667c16ee8ec9b53961b88abf07332e6b44934df78b181bee59

Observation b44fc7fe-1069-487b-b416-2d2cd9e14006 · outbound

This paper cites SemantiCodec: An Ultra Low Bitrate Semantic Audio Codec for General Sound.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling SemantiCodec: An Ultra Low Bitrate Semantic Audio Codec for General Sound

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-09T10:37:03.666522Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T10:37:03.666522Z digest=sha256:125ff928e9ff56276fc3815a3fbff0869970a73ebcef931cc209416887431b5d

Observation 21fbec8c-b87a-481f-b3a2-7836e1134c6f · outbound

This paper cites Speaker independence of neural vocoders and their effect on parametric resynthesis speech enhancement.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling Speaker independence of neural vocoders and their effect on parametric resynthesis speech enhancement

Reference 25

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T10:37:04.444577Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-09T10:37:03.671130Z digest=sha256:ff5f1e02914bfaebfa85067e80e18c7161cbed8c22486dea320d68e03efd80bd

Observation 17a3139c-8abc-47f6-aac1-38c28d6113b0 · outbound

This paper cites Finite Scalar Quantization: VQ-VAE Made Simple.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling Finite Scalar Quantization: VQ-VAE Made Simple

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-09T10:37:03.675402Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T10:37:03.675402Z digest=sha256:510609907d9ea7d8a0f2bd3a73f7f3374641a8ef3ae8025e656750e18a103ecc

Observation 6acf754b-dbc7-405d-9b67-22473d9c8e3c · outbound

This paper cites Dnsmos p.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling Dnsmos p

Reference 28

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T10:37:04.429747Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-09T10:37:03.684725Z digest=sha256:65993af7194ff1dcaa4139c150280b32655e17897e3b5c966682db82fdb74f27

Observation 55d42621-87a4-4fd1-9fda-f5cc23ccb46d · outbound

This paper cites Fewer-token neural speech codec with time-invariant codes.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling Fewer-token neural speech codec with time-invariant codes

Reference 29

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T10:37:04.414676Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-09T10:37:03.688823Z digest=sha256:1f4875cedd5f7ec954ade80b6cb17cb7586a8614665d4e2cd07b95c4d9e6d35c

Observation fe002d0a-cc8c-41e1-a026-f26f74bb9db9 · outbound

This paper cites UTMOS: UTokyo-SaruLab System for VoiceMOS Challenge 2022.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling UTMOS: UTokyo-SaruLab System for VoiceMOS Challenge 2022

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-09T10:37:03.693127Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T10:37:03.693127Z digest=sha256:0518b6a1b28b87d22ffd6bd3758a288d258ef8cd77b4430689ccab395467494a

Observation c76a641e-ac99-424b-84f4-67a3546f93d4 · outbound

This paper cites Universal Score-based Speech Enhancement with High Content Preservation.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling Universal Score-based Speech Enhancement with High Content Preservation

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-09T10:37:03.697677Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T10:37:03.697677Z digest=sha256:74bee5b089b0e36e2f016f55acd972410a53a81ef9615121c8f1b8b92d53bb0b

Observation acc77a20-f55a-4746-86b1-74de8fce3ff3 · outbound

This paper cites Vocos: Closing the gap between time-domain and Fourier-based neural vocoders for high-quality audio synthesis.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling Vocos: Closing the gap between time-domain and Fourier-based neural vocoders for high-quality audio synthesis

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-09T10:37:03.701969Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T10:37:03.701969Z digest=sha256:e94d89a575cdc86bdda275966e218c44e2f84c07535654ca041aedab0d7bfb9e

Observation b30ab931-29a9-4a06-b78d-1c13f78ceb4b · outbound

This paper cites The voice bank corpus: Design, collection and data analysis of a large regional accent speech database.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling The voice bank corpus: Design, collection and data analysis of a large regional accent speech database

Reference 33

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T10:37:04.399196Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-09T10:37:03.706795Z digest=sha256:35e35d134d807f1e1a48f9bc4c9fe8474ea124ea0276b49c6c5dc64778757d28

Observation 464655a4-19bf-40e4-abcb-5fcbbed33fcb · outbound

This paper cites WHAM!: Extending Speech Separation to Noisy Environments.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling WHAM!: Extending Speech Separation to Noisy Environments

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-09T10:37:03.716408Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T10:37:03.716408Z digest=sha256:0d221e03d4742d4aac46a25f5112438d706e729be13144f16728bd1a571880c5

Observation afa3289d-9183-4eda-a8c8-8ba17ff32094 · outbound

This paper cites Audiodec: An open-source streaming high-fidelity neural audio codec.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling Audiodec: An open-source streaming high-fidelity neural audio codec

Reference 36

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T10:37:04.383185Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-09T10:37:03.722180Z digest=sha256:d4d34fd8588205cd1629962888590d2dce42328923e8de4cc9071bcece368080

Observation 1322981d-a653-44ed-a58f-ded95262096f · outbound

This paper cites HiFi-Codec: Group-residual Vector quantization for High Fidelity Audio Codec.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling HiFi-Codec: Group-residual Vector quantization for High Fidelity Audio Codec

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-09T10:37:03.726917Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T10:37:03.726917Z digest=sha256:f397851ab1f0b470aa1720e578b20fa9129ae02f572cad40705a226a7f19564c

Observation d9203ab6-3161-42cd-8002-275405161514 · outbound

This paper cites LibriTTS: A Corpus Derived from LibriSpeech for Text-to-Speech.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling LibriTTS: A Corpus Derived from LibriSpeech for Text-to-Speech

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-09T10:37:03.731933Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T10:37:03.731933Z digest=sha256:4680827feb5c9d6d98588b0ef6e4908e6805bbdf14216e3342b0c2255f8ed212

Observation d0c6c1ff-b73b-4952-93c3-ec6c44925d76 · outbound

This paper cites Speaking in Wavelet Domain: A Simple and Efficient Approach to Speed up Speech Diffusion Model.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling Speaking in Wavelet Domain: A Simple and Efficient Approach to Speed up Speech Diffusion Model

Reference 39

Resolution
verified exact
local_arxiv, observed 2026-08-09T10:37:03.844720Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-09T10:37:03.736696Z digest=sha256:2485b920556cfe6632826708aa272bcb9d4c98385b1d42008661bf6997051b5a

Observation 5cc50158-7a0e-45a4-ac35-9bf2cd84f3ad · outbound

This paper cites SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-09T10:37:03.741448Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T10:37:03.741448Z digest=sha256:e1465bc11cce8ffe54d330f1898b56ec465b483c328e77a8c5231f870bf17986

Observation 7ef73369-47ff-47a4-8da5-f840c90aaa53 · outbound

This paper cites We discuss several common questions for the design of GenSE.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling We discuss several common questions for the design of GenSE

Reference 41

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T10:37:04.368095Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-09T10:37:03.746318Z digest=sha256:d1243375069efb6cb7a58edaa130ef1de51cbc766f9d8dd78126db1949f3645a

Observation abf7d858-0d37-46c7-ad03-e6066347135e · outbound

This paper cites On the other hand, we chose XLSR as the semantic extractor due to the key advantage of its multilin- gual speech representation capabilities.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling On the other hand, we chose XLSR as the semantic extractor due to the key advantage of its multilin- gual speech representation capabilities

Reference 42

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T10:37:04.353500Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-09T10:37:03.751285Z digest=sha256:2b0206308dc0e829da90ad5e1f1e1d48d75f6e71ae74c808771264a323b94d44

Observation c74d7a16-07f5-49f5-bded-6d167a258413 · outbound

This paper cites To address this limitation, we also conducted an ABX test to assess the perceptual quality of the enhanced speech compared to clean speech, as shown in Figure.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling To address this limitation, we also conducted an ABX test to assess the perceptual quality of the enhanced speech compared to clean speech, as shown in Figure

Reference 43

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T10:37:04.337453Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-09T10:37:03.756648Z digest=sha256:8b7959d7046aafe9778fe5e91f56d5820236b32a896e7760bd1cfe3d0a890654

Observation 3d73fd3b-356c-4181-a7f4-f86cd57c86b2 · outbound

This paper cites No Preference.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling No Preference

Reference 44

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T10:37:04.320599Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-09T10:37:03.761784Z digest=sha256:c70a5527787cda65029cdeb6225c17cb6844740d8e53d765c9897d27420d72ea

Observation 36e4c198-c62a-4e1c-a0e0-5a05278cb404 · outbound

This paper cites We also observe that finite scalar quantization (FSQ) (Mentzer et al., 2023a) demonstrates lower reconstruction quality.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling We also observe that finite scalar quantization (FSQ) (Mentzer et al., 2023a) demonstrates lower reconstruction quality

Reference 47

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T10:37:04.273771Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-09T10:37:03.776701Z digest=sha256:a70c89999b3c7a31ec5e93aa552be2693940fd633c569acca16a4ddb44d287c7

Observation 12ea5c2a-2b9b-40a2-965f-1b5b29361e4c · outbound

This paper cites We employ the AdamW optimizer with a learning rate of 1e-4 to optimize the codec model.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling We employ the AdamW optimizer with a learning rate of 1e-4 to optimize the codec model

Reference 128

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T10:37:04.305095Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-09T10:37:03.767028Z digest=sha256:f234af63ceabcd4aeb1170905ad9222f0a73465dda783a8cea62d9729f800785

Observation e5545a6d-5a73-46d4-8d01-d56cb98ebb8f · outbound

This paper cites Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers

Reference 2013

Resolution
unresolved
no resolver link, observed 2026-08-09T10:37:03.711308Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T10:37:03.711308Z digest=sha256:4223228743f0fedc44418eb49b1c1caa69fa97286f221e7a1aca35dc5ca6681e

Observation a752c229-8f33-415f-8e9c-fcfa022b4eb1 · outbound

This paper cites Interspeech 2021 Deep Noise Suppression Challenge.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling Interspeech 2021 Deep Noise Suppression Challenge

Reference 2015

Resolution
unresolved
no resolver link, observed 2026-08-09T10:37:03.680242Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T10:37:03.680242Z digest=sha256:ef661f64f22cdb81b54cbb8c9cdc438e0694908e603ee9693b21723636fa20d2

Observation df688006-3bb2-455e-8e55-212d5ed86908 · outbound

This paper cites Funcodec: A fundamental, reproducible and integrable open-source toolkit for neural speech codec.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling Funcodec: A fundamental, reproducible and integrable open-source toolkit for neural speech codec

Reference 2016

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T10:37:04.562354Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-09T10:37:03.585622Z digest=sha256:3323d11cbfcca2b1cc7a2336eb2fb5d481769da2af997562d927e79886c1258d

Observation dc161ac4-b595-45a0-b79e-f979fe65ab21 · outbound

This paper cites NU-GAN: High resolution neural upsampling with GAN.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling NU-GAN: High resolution neural upsampling with GAN

Reference 2017

Resolution
unresolved
no resolver link, observed 2026-08-09T10:37:03.638921Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T10:37:03.638921Z digest=sha256:94c0f1b09ae3dd3c48c50ad67ed3996901bffacd5ef1e2d2f8f97f9ae8483c9e

Observation 6c4c018e-0e23-4898-976b-24d6cfb1cec1 · outbound

This paper cites Self-Supervised Speech Quality Estimation and Enhancement Using Only Clean Speech.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling Self-Supervised Speech Quality Estimation and Enhancement Using Only Clean Speech

Reference 2019

Resolution
verified exact
local_arxiv, observed 2026-08-09T10:37:04.166692Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-09T10:37:03.599883Z digest=sha256:a01b73e774a3699e47fbb2e09e7f1ec8deac93763c51bc37f38f6904ff9cb9c6

Observation 9c711ee6-7141-46e4-a003-909bbdfd5f41 · outbound

This paper cites Fish-Speech: Leveraging Large Language Models for Advanced Multilingual Text-to-Speech Synthesis.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling Fish-Speech: Leveraging Large Language Models for Advanced Multilingual Text-to-Speech Synthesis

Reference 2020

Resolution
unresolved
no resolver link, observed 2026-08-09T10:37:03.657296Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T10:37:03.657296Z digest=sha256:6548f8cc57e031b320dde50568a566345f7e899e397362ce8dec98a4a7f336ef

Observation 32685557-cfe0-42df-8a48-0100d4aa5dea · outbound

This paper cites Metricgan: Generative adversarial net- works based black-box metric scores optimization for speech enhancement.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling Metricgan: Generative adversarial net- works based black-box metric scores optimization for speech enhancement

Reference 2021

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T10:37:04.532634Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-09T10:37:03.595122Z digest=sha256:272e704bfe9f4cfb25cd8a3c7c6b321418b5956f054ca15a86e888f8bf370259

Observation 48941f34-dddc-46bc-9f8d-d1e66e99fbc8 · outbound

This paper cites SoundStorm: Efficient Parallel Audio Generation.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling SoundStorm: Efficient Parallel Audio Generation

Reference 2022

Resolution
unresolved
no resolver link, observed 2026-08-09T10:37:03.566091Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T10:37:03.566091Z digest=sha256:7f146143840d695d2675d08954dd8edf8dfcebe86966b59a6c4f582f6b749fdc

Observation 72b5b59b-50fd-4783-9f12-2e1ab27da007 · outbound

This paper cites NaturalSpeech 3: Zero-Shot Speech Synthesis with Factorized Codec and Diffusion Models.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling NaturalSpeech 3: Zero-Shot Speech Synthesis with Factorized Codec and Diffusion Models

Reference 2023

Resolution
unresolved
no resolver link, observed 2026-08-09T10:37:03.625975Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T10:37:03.625975Z digest=sha256:57bd5a99edb5e834d20115d52f7b7e48a9923264dc11b83ca519aa929b5ea792

Observation 31880e8c-2126-42e5-8443-ce43a3992637 · outbound

This paper cites Unsupervised speech en- hancement using dynamical variational autoencoders.IEEE/ACM Transactions on Audio, Speech, and Language Processing, 30:2993–3007,.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling Unsupervised speech en- hancement using dynamical variational autoencoders.IEEE/ACM Transactions on Audio, Speech, and Language Processing, 30:2993–3007,

Reference 2024

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T10:37:04.577005Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-09T10:37:03.561414Z digest=sha256:3b3130637010ecaa36645e5167e486070d4abc3c652c6edf7b0e08f6032022b6

Pith citing papers

Observation 0934fbbf-1b5d-4e48-a3c9-4affd5419835 · inbound

SwitchCodec: A High-Fidelity Nerual Audio Codec With Sparse Quantization cites this paper.

SwitchCodec: A High-Fidelity Nerual Audio Codec With Sparse Quantization GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling

Reference 37

Resolution
verified exact
arxiv_id, observed 2026-05-19T13:12:18.210108Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-05-19T13:10:14.839742Z digest=sha256:e960bc51c4831945d91971d344925fe2ae6988677c662e4ff6176c4a4f898279

Observation f00852ae-a811-43fc-8049-a209cc68b5ad · inbound

From Continuous to Discrete: Cross-Domain Collaborative General Speech Enhancement via Hierarchical Language Models cites this paper.

From Continuous to Discrete: Cross-Domain Collaborative General Speech Enhancement via Hierarchical Language Models GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-15T18:04:57.555362Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T18:04:57.555362Z digest=sha256:32596cf97865526c9571613f0cc6d5b2850aa9285c9f50b6e51d7169ff251006

Observation 9fd7e768-dd26-4c45-b1b6-e75b77c43489 · inbound

GenTSE: Enhancing Target Speaker Extraction via a Coarse-to-Fine Generative Language Model cites this paper.

GenTSE: Enhancing Target Speaker Extraction via a Coarse-to-Fine Generative Language Model GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-03T14:20:49.180965Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T14:20:49.180965Z digest=sha256:7ca941bd82a1dcc9a7897f17514872c74aa05294430b4d9ed1d1cdc16ef07b48

Observation 32b38a54-4b1a-46c1-afd9-a606c2a2009d · inbound

UniPASE: A Generative Model for Universal Speech Enhancement with High Fidelity and Low Hallucinations cites this paper.

UniPASE: A Generative Model for Universal Speech Enhancement with High Fidelity and Low Hallucinations GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling

Reference 29

Resolution
verified exact
arxiv_id, observed 2026-05-10T10:19:19.986900Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-05-10T10:18:16.972414Z digest=sha256:99d85158303e8133f79ecb8800a6c1bc02b06b727965c05704257542a1fb374e

Observation 0edcb4b6-3f4a-40e9-b27e-001503530b53 · inbound

UniPASE: A Generative Model for Universal Speech Enhancement with High Fidelity and Low Hallucinations cites this paper.

UniPASE: A Generative Model for Universal Speech Enhancement with High Fidelity and Low Hallucinations GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-02T16:16:37.017642Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T16:16:37.017642Z digest=sha256:d32b6b797f128996e5e8ca82b17c5b28fb817cad3a743c6f0a173f4e52934365