Pith. sign in

Paper Citation Record · LEDGER

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling

As of 10 August 2026, this Paper Citation Record lists 48 of 48 outbound references and 4 inbound Pith citation observations for arXiv:2502.02942.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2502.02942 v1

Coverage vector

measured 48 of 48 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-09T10:37:03.781195Z

measured 52 of 52 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-09T06:31:02.800959+00:00

measured 4 of 4 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-03T14:20:49.180965Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-05-19T13:12:18.207183Z

Reference resolution

48 of 48 outbound references displayed

  • verified exact4
  • verified fuzzy20
  • unresolved24
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 06c49604-3c9a-4dd1-8f00-73114a9b30ea · outbound

This paper cites APCodec: A Neural Audio Codec with Parallel Amplitude and Phase Spectrum Encoding and Decoding.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling APCodec: A Neural Audio Codec with Parallel Amplitude and Phase Spectrum Encoding and Decoding

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-09T10:37:03.556157Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T10:37:03.556157Z digest=sha256:aabb7ebd720e950ffbb1358b2d6209282e47a47ef052a85ce8a99d20d58510de

Observation 5f9c9a7a-a4bb-4285-bb43-bec73dc56985 · outbound

This paper cites an unresolved cited work.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling Unresolved cited work

Reference 2

Resolution
unresolved
raw_fallback, observed 2026-08-09T10:37:04.289191Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-09T10:37:03.771761Z digest=sha256:3789fff53854fe7303e4be2492781854e6b0d42a7127c5c8c18f42e88bd33416

Observation 31249799-37a2-4892-b4d0-c234593b4b53 · outbound

This paper cites Unsupervised Cross-lingual Representation Learning for Speech Recognition.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling Unsupervised Cross-lingual Representation Learning for Speech Recognition

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-09T10:37:03.570902Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T10:37:03.570902Z digest=sha256:8df42b75f6b0da106ad1a71e0d5dea2e4e98c6b0902d761c9c371502e347eda5

Observation fbe90fbe-7b1b-4277-9412-1d6f0bcfd610 · outbound

This paper cites High Fidelity Neural Audio Compression.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling High Fidelity Neural Audio Compression

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-09T10:37:03.575758Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T10:37:03.575758Z digest=sha256:683ee3f114125e2d986297be6aa2ca5d41242d993153b4f65599dcb4751109b6

Observation 92ae16bd-9663-40d1-8f3b-627c34399576 · outbound

This paper cites PolyVoice: Language Models for Speech to Speech Translation.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling PolyVoice: Language Models for Speech to Speech Translation

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-09T10:37:03.580194Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T10:37:03.580194Z digest=sha256:68d45d24075ef4777c890a9c590d5c656b6b73f051f341f8ee476804287d2975

Observation e841061e-bef3-4a40-b3aa-58a2eca8e5f3 · outbound

This paper cites an unresolved cited work.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling Unresolved cited work

Reference 7

Resolution
unresolved
raw_fallback, observed 2026-08-09T10:37:04.257698Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-09T10:37:03.781195Z digest=sha256:5d0ab44520bf89d374e47655dd037fd502cc7386197b1d9a8a0171e59a0b9756

Observation 48a5a75d-e41e-476f-9180-c9c63600d22c · outbound

This paper cites Variational autoencoder for speech enhancement with a noise-aware encoder.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling Variational autoencoder for speech enhancement with a noise-aware encoder

Reference 8

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T10:37:04.547934Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-09T10:37:03.590284Z digest=sha256:ffbfe6f23b052c9aceb0968171f417c458cfdc5654608de6519295279ddece4a

Observation 12139086-bc1d-4c2b-a568-7ebed5a690f8 · outbound

This paper cites Fullsubnet: A full-band and sub-band fusion model for real-time single-channel speech enhancement.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling Fullsubnet: A full-band and sub-band fusion model for real-time single-channel speech enhancement

Reference 11

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T10:37:04.517963Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-09T10:37:03.605648Z digest=sha256:0a7242ff218674e203ef96c7e80b2d8524dfcea8787171b553854eb38781b06b

Observation f2468bc9-e5a0-4d90-89f6-93ce67188133 · outbound

This paper cites Hubert: Self-supervised speech representation learning by masked prediction of hidden units.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling Hubert: Self-supervised speech representation learning by masked prediction of hidden units

Reference 12

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T10:37:04.502747Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-09T10:37:03.610815Z digest=sha256:824a0928201f705e2d3e1f85937f5196329f72e1340956a3e41c4d7369629b84

Observation 9e98d6b6-d2a6-4112-9438-43f1561609be · outbound

This paper cites ReVISE: Self-Supervised Speech Resynthesis with Visual Input for Universal and Generalized Speech Enhancement.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling ReVISE: Self-Supervised Speech Resynthesis with Visual Input for Universal and Generalized Speech Enhancement

Reference 13

Resolution
verified exact
local_arxiv, observed 2026-08-09T10:37:04.145349Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-09T10:37:03.615473Z digest=sha256:b08136cb00967a3c15c8a27ec21ac06f49400aca0d0575efad172afadd0e23c1

Observation d5073d6b-362b-4ea3-9cd6-5d5a8f4957a7 · outbound

This paper cites Language-Codec: Bridging Discrete Codec Representations and Speech Language Models.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling Language-Codec: Bridging Discrete Codec Representations and Speech Language Models

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-09T10:37:03.620875Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T10:37:03.620875Z digest=sha256:8d0e13195041dfa8592a7b788e91106ee4d6c7bf1f5fee74d1bec4ddae28ec06

Observation 69673469-7183-4116-9255-789da0f976fc · outbound

This paper cites Libri- light: A benchmark for asr with limited or no supervision.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling Libri- light: A benchmark for asr with limited or no supervision

Reference 16

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T10:37:04.488624Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-09T10:37:03.630522Z digest=sha256:9b342d29bfca22bd779969d345ef8271e0e74404a34fc994c7abbebde3015382

Observation 22716251-6203-4a62-82f4-731b6ca1ba61 · outbound

This paper cites A study on data augmentation of reverberant speech for robust speech recognition.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling A study on data augmentation of reverberant speech for robust speech recognition

Reference 17

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T10:37:04.473837Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-09T10:37:03.634723Z digest=sha256:034ea18f96ab75074fa5163430c6f4f8afccd367dfb5f4b8a69e36df6ca090ba

Observation 949cdf6a-c968-43eb-a060-482e25189ce8 · outbound

This paper cites Lan- guage models as controlled natural language semantic parsers for knowledge graph question an- swering.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling Lan- guage models as controlled natural language semantic parsers for knowledge graph question an- swering

Reference 19

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T10:37:04.459166Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-09T10:37:03.643592Z digest=sha256:2195d6f07c4f116c422a9b5056098e8e70b06bfaeaeefd9d04540c064600bada

Observation 12f57c02-ea07-424d-9f4b-e8d8571dd0f1 · outbound

This paper cites Single-Codec: Single-Codebook Speech Codec towards High-Performance Speech Generation.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling Single-Codec: Single-Codebook Speech Codec towards High-Performance Speech Generation

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-09T10:37:03.648039Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T10:37:03.648039Z digest=sha256:3aea27bb5c273e87b9e797c285ec3f4b9331e534cce992b0d2f5c261227eaffe

Observation 873e4451-21d3-4a4d-a091-16da579da7c4 · outbound

This paper cites Noise Tokens: Learning Neural Noise Templates for Environment-Aware Speech Enhancement.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling Noise Tokens: Learning Neural Noise Templates for Environment-Aware Speech Enhancement

Reference 21

Resolution
verified exact
local_arxiv, observed 2026-08-09T10:37:04.059313Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-09T10:37:03.652516Z digest=sha256:661e0dee2b95df98fc219e8e26dbb0a8f2b75421a5ed8644886d99cfe6026505

Observation 76e3ce1d-53e6-45d8-9dea-2b7133e179f0 · outbound

This paper cites VoiceFixer: Toward General Speech Restoration with Neural Vocoder.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling VoiceFixer: Toward General Speech Restoration with Neural Vocoder

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-09T10:37:03.661876Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T10:37:03.661876Z digest=sha256:0c9071b802cb1f4253312928aa50768f0a04c116903f33d957e5c324366109d0

Observation b44fc7fe-1069-487b-b416-2d2cd9e14006 · outbound

This paper cites SemantiCodec: An Ultra Low Bitrate Semantic Audio Codec for General Sound.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling SemantiCodec: An Ultra Low Bitrate Semantic Audio Codec for General Sound

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-09T10:37:03.666522Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T10:37:03.666522Z digest=sha256:56c7a713d36f72416777f785109882c3697379411a66e348e611c0c30703e947

Observation 21fbec8c-b87a-481f-b3a2-7836e1134c6f · outbound

This paper cites Speaker independence of neural vocoders and their effect on parametric resynthesis speech enhancement.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling Speaker independence of neural vocoders and their effect on parametric resynthesis speech enhancement

Reference 25

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T10:37:04.444577Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-09T10:37:03.671130Z digest=sha256:37c25db01edab23209a2e4bb9f46e6b59767fbe3ad4332af199d7a98a42a9b4c

Observation 17a3139c-8abc-47f6-aac1-38c28d6113b0 · outbound

This paper cites Finite Scalar Quantization: VQ-VAE Made Simple.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling Finite Scalar Quantization: VQ-VAE Made Simple

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-09T10:37:03.675402Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T10:37:03.675402Z digest=sha256:6aef7a2a595b349bb31f81b57a2425b9c8c66e8ab5ed8779ddce90f1e58304df

Observation 6acf754b-dbc7-405d-9b67-22473d9c8e3c · outbound

This paper cites Dnsmos p.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling Dnsmos p

Reference 28

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T10:37:04.429747Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-09T10:37:03.684725Z digest=sha256:0547ce9a886e48558e491741dcf3f0135d91e32602884c56e3136619b8bbd52f

Observation 55d42621-87a4-4fd1-9fda-f5cc23ccb46d · outbound

This paper cites Fewer-token neural speech codec with time-invariant codes.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling Fewer-token neural speech codec with time-invariant codes

Reference 29

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T10:37:04.414676Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-09T10:37:03.688823Z digest=sha256:aa90a0c3d2a63c578023b29f818cb1cf595581d24176be417ce786d1a19fb8ba

Observation fe002d0a-cc8c-41e1-a026-f26f74bb9db9 · outbound

This paper cites UTMOS: UTokyo-SaruLab System for VoiceMOS Challenge 2022.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling UTMOS: UTokyo-SaruLab System for VoiceMOS Challenge 2022

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-09T10:37:03.693127Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T10:37:03.693127Z digest=sha256:43fff00f4c865a484ab09668a98d1f9840779ef05cd938801a44c6447aad5e13

Observation c76a641e-ac99-424b-84f4-67a3546f93d4 · outbound

This paper cites Universal Score-based Speech Enhancement with High Content Preservation.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling Universal Score-based Speech Enhancement with High Content Preservation

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-09T10:37:03.697677Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T10:37:03.697677Z digest=sha256:e4cc6ef222010fe6f54f7e96558ddcc23c8b27844cb71944a5b37a4305bc63ad

Observation acc77a20-f55a-4746-86b1-74de8fce3ff3 · outbound

This paper cites Vocos: Closing the gap between time-domain and Fourier-based neural vocoders for high-quality audio synthesis.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling Vocos: Closing the gap between time-domain and Fourier-based neural vocoders for high-quality audio synthesis

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-09T10:37:03.701969Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T10:37:03.701969Z digest=sha256:66abe4cf8147a3e5454c9226ba66bdf9b6911e59478f0f093c6b83b6c0e26eda

Observation b30ab931-29a9-4a06-b78d-1c13f78ceb4b · outbound

This paper cites The voice bank corpus: Design, collection and data analysis of a large regional accent speech database.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling The voice bank corpus: Design, collection and data analysis of a large regional accent speech database

Reference 33

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T10:37:04.399196Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-09T10:37:03.706795Z digest=sha256:f9bcb457bd8c328c703c642d71c97cc2de051cdaa7af1d47c0edf56cadc1de68

Observation 464655a4-19bf-40e4-abcb-5fcbbed33fcb · outbound

This paper cites WHAM!: Extending Speech Separation to Noisy Environments.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling WHAM!: Extending Speech Separation to Noisy Environments

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-09T10:37:03.716408Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T10:37:03.716408Z digest=sha256:4ba06504e1c4926c029dca8ac8e0829ca4eca64b32e9c8de2b85259ef43d1673

Observation afa3289d-9183-4eda-a8c8-8ba17ff32094 · outbound

This paper cites Audiodec: An open-source streaming high-fidelity neural audio codec.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling Audiodec: An open-source streaming high-fidelity neural audio codec

Reference 36

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T10:37:04.383185Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-09T10:37:03.722180Z digest=sha256:8429052b78ba6a77845960b558635305c2da22c0d0386769f44f2ff245dbae55

Observation 1322981d-a653-44ed-a58f-ded95262096f · outbound

This paper cites HiFi-Codec: Group-residual Vector quantization for High Fidelity Audio Codec.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling HiFi-Codec: Group-residual Vector quantization for High Fidelity Audio Codec

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-09T10:37:03.726917Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T10:37:03.726917Z digest=sha256:b69931db966b87d8a688fabafff38bfb0bb9dd0bbdf8dbcda910313d7859b24b

Observation d9203ab6-3161-42cd-8002-275405161514 · outbound

This paper cites LibriTTS: A Corpus Derived from LibriSpeech for Text-to-Speech.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling LibriTTS: A Corpus Derived from LibriSpeech for Text-to-Speech

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-09T10:37:03.731933Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T10:37:03.731933Z digest=sha256:afa5538246f0851cc86dacecc148f6fe1a7e70aad87dbc3cd9fc6da6608955a8

Observation d0c6c1ff-b73b-4952-93c3-ec6c44925d76 · outbound

This paper cites Speaking in Wavelet Domain: A Simple and Efficient Approach to Speed up Speech Diffusion Model.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling Speaking in Wavelet Domain: A Simple and Efficient Approach to Speed up Speech Diffusion Model

Reference 39

Resolution
verified exact
local_arxiv, observed 2026-08-09T10:37:03.844720Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-09T10:37:03.736696Z digest=sha256:7016d057ad30a8fa481cfb9c7bae067e1d23b7098942a10f455e2e23661c5f46

Observation 5cc50158-7a0e-45a4-ac35-9bf2cd84f3ad · outbound

This paper cites SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-09T10:37:03.741448Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T10:37:03.741448Z digest=sha256:a90b3b50dd2f99699c28266a04e86e053d7e0277bbd815f0885332e10acc978d

Observation 7ef73369-47ff-47a4-8da5-f840c90aaa53 · outbound

This paper cites We discuss several common questions for the design of GenSE.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling We discuss several common questions for the design of GenSE

Reference 41

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T10:37:04.368095Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-09T10:37:03.746318Z digest=sha256:a62543fe700a54131687cdacc3b60cb15c2bb25b21e870177b92d3d62aaaa459

Observation abf7d858-0d37-46c7-ad03-e6066347135e · outbound

This paper cites On the other hand, we chose XLSR as the semantic extractor due to the key advantage of its multilin- gual speech representation capabilities.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling On the other hand, we chose XLSR as the semantic extractor due to the key advantage of its multilin- gual speech representation capabilities

Reference 42

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T10:37:04.353500Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-09T10:37:03.751285Z digest=sha256:2c1de1e3908f926fd27eec8a9feed0dc703e9cf234878495be893d936b671f86

Observation c74d7a16-07f5-49f5-bded-6d167a258413 · outbound

This paper cites To address this limitation, we also conducted an ABX test to assess the perceptual quality of the enhanced speech compared to clean speech, as shown in Figure.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling To address this limitation, we also conducted an ABX test to assess the perceptual quality of the enhanced speech compared to clean speech, as shown in Figure

Reference 43

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T10:37:04.337453Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-09T10:37:03.756648Z digest=sha256:e696644bbdbb62d8851fc6621fac7232472c5c0befb6c201cc11e6e06228ab23

Observation 3d73fd3b-356c-4181-a7f4-f86cd57c86b2 · outbound

This paper cites No Preference.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling No Preference

Reference 44

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T10:37:04.320599Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-09T10:37:03.761784Z digest=sha256:190096961b9706ccf9557f46344cd5df3bd98f746a77965fdc40eda4958f22d8

Observation 36e4c198-c62a-4e1c-a0e0-5a05278cb404 · outbound

This paper cites We also observe that finite scalar quantization (FSQ) (Mentzer et al., 2023a) demonstrates lower reconstruction quality.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling We also observe that finite scalar quantization (FSQ) (Mentzer et al., 2023a) demonstrates lower reconstruction quality

Reference 47

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T10:37:04.273771Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-09T10:37:03.776701Z digest=sha256:747083ee7c6b8fb6aad667ead46b792bc47e7c7a4a05216988fb3bfff709967e

Observation 12ea5c2a-2b9b-40a2-965f-1b5b29361e4c · outbound

This paper cites We employ the AdamW optimizer with a learning rate of 1e-4 to optimize the codec model.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling We employ the AdamW optimizer with a learning rate of 1e-4 to optimize the codec model

Reference 128

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T10:37:04.305095Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-09T10:37:03.767028Z digest=sha256:73f94ac113f5c0eaf917a393f0ff1b9c740c056accce4ffc5cd183db632d1506

Observation e5545a6d-5a73-46d4-8d01-d56cb98ebb8f · outbound

This paper cites Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers

Reference 2013

Resolution
unresolved
no resolver link, observed 2026-08-09T10:37:03.711308Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T10:37:03.711308Z digest=sha256:71e6cc7503c439be784d5b1450908eb568fdaa9bf0bdb882daee59b1d2bee51e

Observation a752c229-8f33-415f-8e9c-fcfa022b4eb1 · outbound

This paper cites Interspeech 2021 Deep Noise Suppression Challenge.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling Interspeech 2021 Deep Noise Suppression Challenge

Reference 2015

Resolution
unresolved
no resolver link, observed 2026-08-09T10:37:03.680242Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T10:37:03.680242Z digest=sha256:3eb7018f48d021895e6a8965f834bb1794428f17756a48d11e2e4f66f9d73324

Observation df688006-3bb2-455e-8e55-212d5ed86908 · outbound

This paper cites Funcodec: A fundamental, reproducible and integrable open-source toolkit for neural speech codec.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling Funcodec: A fundamental, reproducible and integrable open-source toolkit for neural speech codec

Reference 2016

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T10:37:04.562354Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-09T10:37:03.585622Z digest=sha256:c1f2d005eb877316fc2e7dcbc348c1b1e63e6ac34ef64778a2f0bd07ea81d1a5

Observation dc161ac4-b595-45a0-b79e-f979fe65ab21 · outbound

This paper cites NU-GAN: High resolution neural upsampling with GAN.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling NU-GAN: High resolution neural upsampling with GAN

Reference 2017

Resolution
unresolved
no resolver link, observed 2026-08-09T10:37:03.638921Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T10:37:03.638921Z digest=sha256:172bb35d0796e2ba5544fdce61d05d025e3d1e4850e296ba880b45440e17cf03

Observation 6c4c018e-0e23-4898-976b-24d6cfb1cec1 · outbound

This paper cites Self-Supervised Speech Quality Estimation and Enhancement Using Only Clean Speech.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling Self-Supervised Speech Quality Estimation and Enhancement Using Only Clean Speech

Reference 2019

Resolution
verified exact
local_arxiv, observed 2026-08-09T10:37:04.166692Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-09T10:37:03.599883Z digest=sha256:20b4936a3c43c1bf1e2ac25e5915c9130d5a89d0d8ac61a8bbddf1684bd75e19

Observation 9c711ee6-7141-46e4-a003-909bbdfd5f41 · outbound

This paper cites Fish-Speech: Leveraging Large Language Models for Advanced Multilingual Text-to-Speech Synthesis.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling Fish-Speech: Leveraging Large Language Models for Advanced Multilingual Text-to-Speech Synthesis

Reference 2020

Resolution
unresolved
no resolver link, observed 2026-08-09T10:37:03.657296Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T10:37:03.657296Z digest=sha256:190a3724f66c1aa995535b44b1f4b021db4f49457d7071a2b9c7e88f63778d59

Observation 32685557-cfe0-42df-8a48-0100d4aa5dea · outbound

This paper cites Metricgan: Generative adversarial net- works based black-box metric scores optimization for speech enhancement.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling Metricgan: Generative adversarial net- works based black-box metric scores optimization for speech enhancement

Reference 2021

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T10:37:04.532634Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-09T10:37:03.595122Z digest=sha256:6b58b1a4d45d5845473350d4c981428ef31bbd90eab9ae685c145820c28a86ef

Observation 48941f34-dddc-46bc-9f8d-d1e66e99fbc8 · outbound

This paper cites SoundStorm: Efficient Parallel Audio Generation.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling SoundStorm: Efficient Parallel Audio Generation

Reference 2022

Resolution
unresolved
no resolver link, observed 2026-08-09T10:37:03.566091Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T10:37:03.566091Z digest=sha256:8eabf2e819c5a68a8448c31c4c8c6b0c3f37796bd7288775833c34ac668ee1c4

Observation 72b5b59b-50fd-4783-9f12-2e1ab27da007 · outbound

This paper cites NaturalSpeech 3: Zero-Shot Speech Synthesis with Factorized Codec and Diffusion Models.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling NaturalSpeech 3: Zero-Shot Speech Synthesis with Factorized Codec and Diffusion Models

Reference 2023

Resolution
unresolved
no resolver link, observed 2026-08-09T10:37:03.625975Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T10:37:03.625975Z digest=sha256:e64936d7cdd739c82929727b53e371b99ecc1d2a543f82b323824394d1c63a60

Observation 31880e8c-2126-42e5-8443-ce43a3992637 · outbound

This paper cites Unsupervised speech en- hancement using dynamical variational autoencoders.IEEE/ACM Transactions on Audio, Speech, and Language Processing, 30:2993–3007,.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling Unsupervised speech en- hancement using dynamical variational autoencoders.IEEE/ACM Transactions on Audio, Speech, and Language Processing, 30:2993–3007,

Reference 2024

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T10:37:04.577005Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-09T10:37:03.561414Z digest=sha256:19c2fa9705d808c0ca0c045bb987f7904d62ee7d033c5cb740b20c3427a193db

Pith citing papers

Observation 0934fbbf-1b5d-4e48-a3c9-4affd5419835 · inbound

SwitchCodec: A High-Fidelity Nerual Audio Codec With Sparse Quantization cites this paper.

SwitchCodec: A High-Fidelity Nerual Audio Codec With Sparse Quantization GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling

Reference 37

Resolution
verified exact
arxiv_id, observed 2026-05-19T13:12:18.210108Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-05-19T13:10:14.839742Z digest=sha256:d0ace38eb14f13d55a32d3cccbc3727957c32bd2e9500d9f585281a6fa890e15

Observation 9fd7e768-dd26-4c45-b1b6-e75b77c43489 · inbound

GenTSE: Enhancing Target Speaker Extraction via a Coarse-to-Fine Generative Language Model cites this paper.

GenTSE: Enhancing Target Speaker Extraction via a Coarse-to-Fine Generative Language Model GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-03T14:20:49.180965Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T14:20:49.180965Z digest=sha256:d87e339d514db7c2c27788c72bf8f138ca847a25ec0b77d7152aae986e7fc336

Observation 32b38a54-4b1a-46c1-afd9-a606c2a2009d · inbound

UniPASE: A Generative Model for Universal Speech Enhancement with High Fidelity and Low Hallucinations cites this paper.

UniPASE: A Generative Model for Universal Speech Enhancement with High Fidelity and Low Hallucinations GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling

Reference 29

Resolution
verified exact
arxiv_id, observed 2026-05-10T10:19:19.986900Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-05-10T10:18:16.972414Z digest=sha256:f1693ea15185ddb3c76bdca217018d221bec5b70b410f363f6fa4516d7ad8dfa

Observation 0edcb4b6-3f4a-40e9-b27e-001503530b53 · inbound

UniPASE: A Generative Model for Universal Speech Enhancement with High Fidelity and Low Hallucinations cites this paper.

UniPASE: A Generative Model for Universal Speech Enhancement with High Fidelity and Low Hallucinations GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-02T16:16:37.017642Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T16:16:37.017642Z digest=sha256:299caca13a6b38f60596eb307d789e498c4406ae03b2ada92a9d7aa4168b16e2