Pith. sign in

Paper Citation Record · LEDGER

MELD: Mel-Spectrogram-Based Speech Language Modeling with Discrete Latent Variables

As of 5 August 2026, this Paper Citation Record lists 11 of 11 outbound references and 2 inbound Pith citation observations for arXiv:2605.29859.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2605.29859 v1

Coverage vector

measured 11 of 11 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-06-29T05:34:55.822901Z

measured 13 of 13 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-05T06:32:48.257954+00:00

measured 2 of 2 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-07-03T23:55:11.698728Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: pith, observed 2026-07-03T23:59:06.127454Z

Reference resolution

11 of 11 outbound references displayed

  • verified exact8
  • verified fuzzy0
  • unresolved3
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 148c29f7-02c0-4a98-8653-1cb760f799ce · outbound

This paper cites On The Landscape of Spoken Language Models: A Comprehensive Survey.

MELD: Mel-Spectrogram-Based Speech Language Modeling with Discrete Latent Variables On The Landscape of Spoken Language Models: A Comprehensive Survey

Reference 1

Resolution
verified exact
local_arxiv, observed 2026-06-29T05:43:08.707279Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-06-29T05:34:55.822901Z digest=sha256:064eb4ccca96fda9535bdf8ed97e51c10d46cabe342350e51e91913ad649bc9f

Observation 00c8baf2-b53a-46d2-be24-2f63e2669dd0 · outbound

This paper cites dMel: Speech Tokenization made Simple.

MELD: Mel-Spectrogram-Based Speech Language Modeling with Discrete Latent Variables dMel: Speech Tokenization made Simple

Reference 2

Resolution
verified exact
arxiv_id, observed 2026-06-29T05:43:08.702843Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-06-29T05:34:55.822901Z digest=sha256:8be367a3d0e8f623e87115ce05a7877f1894714253b20f7c83f9cb688e4c4fbb

Observation e3030e54-10c4-45dd-9755-9e24c05f2cd1 · outbound

This paper cites VALL-E 2: Neural Codec Language Models are Human Parity Zero-Shot Text to Speech Synthesizers.

MELD: Mel-Spectrogram-Based Speech Language Modeling with Discrete Latent Variables VALL-E 2: Neural Codec Language Models are Human Parity Zero-Shot Text to Speech Synthesizers

Reference 3

Resolution
verified exact
arxiv_id, observed 2026-06-29T05:43:08.711740Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-06-29T05:34:55.822901Z digest=sha256:69a5cd299e11f3e19aac9d1ca111c285946c6e0a351a61f283625aa9b5b67b89

Observation b1e07ea0-3c3a-4a97-b250-231697e60be3 · outbound

This paper cites Moshi: a speech-text foundation model for real-time dialogue.

MELD: Mel-Spectrogram-Based Speech Language Modeling with Discrete Latent Variables Moshi: a speech-text foundation model for real-time dialogue

Reference 4

Resolution
verified exact
local_arxiv, observed 2026-06-29T05:43:08.697724Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-06-29T05:34:55.822901Z digest=sha256:8fc2caa28d144ed6bcae0ce8efb6f69b95c4a89059b2d486c15d5e9881a2902b

Observation 0d600b63-8d33-4d4f-829b-c7393ee12ba6 · outbound

This paper cites Multimodal Latent Language Modeling with Next-Token Diffusion.

MELD: Mel-Spectrogram-Based Speech Language Modeling with Discrete Latent Variables Multimodal Latent Language Modeling with Next-Token Diffusion

Reference 5

Resolution
verified exact
arxiv_id, observed 2026-06-29T05:43:08.720503Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-06-29T05:34:55.822901Z digest=sha256:5e265cd49eb361c58e29d555a6d6ee8eb96e7eee4744b00cbb77b92a0f37a580

Observation b1ce039b-1703-4f53-9ba7-8c7997e8f23a · outbound

This paper cites Continuous speech synthesis using per-token latent diffusion.arXiv preprint arXiv:2410.16048,.

MELD: Mel-Spectrogram-Based Speech Language Modeling with Discrete Latent Variables Continuous speech synthesis using per-token latent diffusion.arXiv preprint arXiv:2410.16048,

Reference 6

Resolution
verified exact
arxiv_id, observed 2026-06-29T05:43:08.690897Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-06-29T05:34:55.822901Z digest=sha256:344ee4dcf68a9a2594d18dc02e6a89b1768e7b436d7a34716dbb696a20f275ca

Observation e4863365-06c9-43c6-a734-a6bf1a9282b5 · outbound

This paper cites Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers.

MELD: Mel-Spectrogram-Based Speech Language Modeling with Discrete Latent Variables Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers

Reference 7

Resolution
verified exact
local_arxiv, observed 2026-06-29T05:43:08.690882Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-06-29T05:34:55.822901Z digest=sha256:3f68d9a05013410498de9ea99ae92f1763b1be16982df55ef4caece1f6d6e5e3

Observation 51960991-28ba-47a1-a9de-170f3e11b8f8 · outbound

This paper cites V oxcpm: Tokenizer-free tts for context-aware speech generation and true-to-life voice cloning.

MELD: Mel-Spectrogram-Based Speech Language Modeling with Discrete Latent Variables V oxcpm: Tokenizer-free tts for context-aware speech generation and true-to-life voice cloning

Reference 8

Resolution
verified exact
arxiv_id, observed 2026-06-29T05:43:08.688017Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-06-29T05:34:55.822901Z digest=sha256:3c321aa92ac9744f448f8c25f1ead5caaed8793df5e9bac830229db3e305cab2

Observation 6f5910bd-702b-4ba7-99fc-bc579802dd45 · outbound

This paper cites We also experiment with longer training steps, and we do not see notable improvements.

MELD: Mel-Spectrogram-Based Speech Language Modeling with Discrete Latent Variables We also experiment with longer training steps, and we do not see notable improvements

Reference 9

Resolution
unresolved
no resolver link, observed 2026-06-29T05:34:55.822901Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-29T05:34:55.822901Z digest=sha256:d8e33a271401c9db3f7ff0cd8ec3a932adeee657c7f50e8a1cd62624d8c24195

Observation c52ada6f-d857-453a-80f9-2b8352bbbfb5 · outbound

This paper cites continuous.

MELD: Mel-Spectrogram-Based Speech Language Modeling with Discrete Latent Variables continuous

Reference 10

Resolution
unresolved
no resolver link, observed 2026-06-29T05:34:55.822901Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-29T05:34:55.822901Z digest=sha256:f51cf3c10418f5c410f95ea712a47c47dd8c0194a9b5995c7b0e20ffe50a4d50

Observation 76e36608-8163-4944-9d5e-41409e48c074 · outbound

This paper cites abnormal.

MELD: Mel-Spectrogram-Based Speech Language Modeling with Discrete Latent Variables abnormal

Reference 11

Resolution
unresolved
no resolver link, observed 2026-06-29T05:34:55.822901Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-29T05:34:55.822901Z digest=sha256:ed38a4028e4c000eae15c8525fadffe5230c257f43fd9105354cab813ea181f3

Pith citing papers

Observation 3d1f99b6-b0d9-42fe-87a0-ca67d8eb2b31 · inbound

LLM can Read Spectrogram: Encoder-free Speech-Language Modeling cites this paper.

LLM can Read Spectrogram: Encoder-free Speech-Language Modeling MELD: Mel-Spectrogram-Based Speech Language Modeling with Discrete Latent Variables

Reference 28

Resolution
verified exact
local_arxiv, observed 2026-07-03T03:47:35.725012Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-06-27T14:40:40.673091Z digest=sha256:1a10b20b8e6973d1765e2d7b5e3dc86b828940e892252d731cac7c44b1f1aa95

Observation 2f1c0eac-61fb-4a84-a34d-5fead643ddc3 · inbound

LLM can Read Spectrogram: Encoder-free Speech-Language Modeling cites this paper.

LLM can Read Spectrogram: Encoder-free Speech-Language Modeling MELD: Mel-Spectrogram-Based Speech Language Modeling with Discrete Latent Variables

Reference 30

Resolution
verified exact
local_arxiv, observed 2026-07-03T23:59:06.129686Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-07-03T23:55:11.698728Z digest=sha256:eebd87bf2d8ab2caa5ac3d227a89bf1bc1a8c56ffe30741f0d9be3e88af6246c