Pith. sign in

Paper Citation Record · LEDGER

Continuous Speech Tokens Makes LLMs Robust Multi-Modality Learners

As of 21 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 4 inbound Pith citation observations for arXiv:2412.04917.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2412.04917 v1

Coverage vector

measured 35 of 35 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-11T21:12:24.123186Z

measured 39 of 39 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-20T06:33:59.587034+00:00

measured 4 of 4 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-07T12:03:30.685319Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-05-22T20:45:08.132130Z

Reference resolution

35 of 35 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved35
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 57e20474-ba2e-4d9a-90ac-ef77d669ecd1 · outbound

This paper cites EMOVA: Empowering Language Models to See, Hear and Speak with Vivid Emotions.

Continuous Speech Tokens Makes LLMs Robust Multi-Modality Learners EMOVA: Empowering Language Models to See, Hear and Speak with Vivid Emotions

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-11T21:12:23.961929Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T21:12:23.961929Z digest=sha256:1a9e15828b3de3ba4bec20c7f1c3d1a255c5f87f3c2d0bdb2ac250b810ef2d20

Observation b603eacb-3b43-4ded-94de-e74e081eb72b · outbound

This paper cites Ichigo: Mixed-Modal Early-Fusion Realtime Voice Assistant.

Continuous Speech Tokens Makes LLMs Robust Multi-Modality Learners Ichigo: Mixed-Modal Early-Fusion Realtime Voice Assistant

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-11T21:12:23.979142Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T21:12:23.979142Z digest=sha256:f3377c70ecebdcd835ef4023a91858250772cf0f3e7a67c50031a8fc67bc2bed

Observation 8127f057-5242-4aba-a1d2-86ff74d7fb31 · outbound

This paper cites Moshi: a speech-text foundation model for real-time dialogue.

Continuous Speech Tokens Makes LLMs Robust Multi-Modality Learners Moshi: a speech-text foundation model for real-time dialogue

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-11T21:12:23.984579Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T21:12:23.984579Z digest=sha256:b937bb38d08ad427b6779baed5f16209a0b051d65ef76dbff0e61623dc83eaeb

Observation 3021b48b-e7f1-4a94-9036-9dd1c853f500 · outbound

This paper cites E2 TTS: Embarrassingly Easy Fully Non-Autoregressive Zero-Shot TTS.

Continuous Speech Tokens Makes LLMs Robust Multi-Modality Learners E2 TTS: Embarrassingly Easy Fully Non-Autoregressive Zero-Shot TTS

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-11T21:12:23.988934Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T21:12:23.988934Z digest=sha256:d33d1f74aec7ad2d0515ee239f2ef9ccb0ca37964ab42b7af7024efe303bdc1a

Observation 5c56b5a3-535f-4f59-9386-a4c401157592 · outbound

This paper cites Fluid: Scaling Autoregressive Text-to-image Generative Models with Continuous Tokens.

Continuous Speech Tokens Makes LLMs Robust Multi-Modality Learners Fluid: Scaling Autoregressive Text-to-image Generative Models with Continuous Tokens

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-11T21:12:23.993685Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T21:12:23.993685Z digest=sha256:b27a8bddd960e16d7ee77cfd72160c3182a2cb063cd1bdb6699c89175dc7f14c

Observation 5267b4e2-7a21-48c7-9c16-7b84feba1748 · outbound

This paper cites LLaMA-Omni: Seamless Speech Interaction with Large Language Models.

Continuous Speech Tokens Makes LLMs Robust Multi-Modality Learners LLaMA-Omni: Seamless Speech Interaction with Large Language Models

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-11T21:12:23.997188Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T21:12:23.997188Z digest=sha256:8df89f3bcff97f684fb57a3f87e7042ad3eb514b2945b7114f07c6e320bb39f3

Observation 946cfcaf-f1c7-4e7f-af8e-a168e8f7037a · outbound

This paper cites VITA: Towards Open-Source Interactive Omni Multimodal LLM.

Continuous Speech Tokens Makes LLMs Robust Multi-Modality Learners VITA: Towards Open-Source Interactive Omni Multimodal LLM

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-11T21:12:24.001335Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T21:12:24.001335Z digest=sha256:8d6f310c02138a4272a10e21f6f8e31268006391e31669418c7d0c88bb1192c5

Observation e74ffe0d-4a08-45b2-8b09-ca0d96878287 · outbound

This paper cites VALL-E R: Robust and Efficient Zero-Shot Text-to-Speech Synthesis via Monotonic Alignment.

Continuous Speech Tokens Makes LLMs Robust Multi-Modality Learners VALL-E R: Robust and Efficient Zero-Shot Text-to-Speech Synthesis via Monotonic Alignment

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-11T21:12:24.005405Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T21:12:24.005405Z digest=sha256:ac6475ef9e5389d1fa63d2f029bee44246e5c4d9ce87f3291cb940b703d64938

Observation b50dc08f-184c-43ab-8d88-a206a844f672 · outbound

This paper cites GPT-4o System Card.

Continuous Speech Tokens Makes LLMs Robust Multi-Modality Learners GPT-4o System Card

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-11T21:12:24.009654Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T21:12:24.009654Z digest=sha256:b5f92fb85d1743c48527165bde8593396943f86fe7678c793a3d15baef8e30bd

Observation a03dbb64-8ad8-47ff-8b52-f7946be435e7 · outbound

This paper cites WavChat: A Survey of Spoken Dialogue Models.

Continuous Speech Tokens Makes LLMs Robust Multi-Modality Learners WavChat: A Survey of Spoken Dialogue Models

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-11T21:12:24.013748Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T21:12:24.013748Z digest=sha256:d08fcdff2f88a608d23f905e6a7997440834f0cb65ae6ee6e5b8bb70e9f2f4e6

Observation 7829fab8-35e1-49b8-b2aa-881cca0d32f5 · outbound

This paper cites NaturalSpeech 3: Zero-Shot Speech Synthesis with Factorized Codec and Diffusion Models.

Continuous Speech Tokens Makes LLMs Robust Multi-Modality Learners NaturalSpeech 3: Zero-Shot Speech Synthesis with Factorized Codec and Diffusion Models

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-11T21:12:24.017408Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T21:12:24.017408Z digest=sha256:50cf0e207c32a9ae81845d91efacbec50c60c30e6a87787c7d72c348cede9ffe

Observation 979a1fc0-da93-48da-afcc-623cc445ad85 · outbound

This paper cites Making Flow-Matching-Based Zero-Shot Text-to-Speech Laugh as You Like.

Continuous Speech Tokens Makes LLMs Robust Multi-Modality Learners Making Flow-Matching-Based Zero-Shot Text-to-Speech Laugh as You Like

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-11T21:12:24.020995Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T21:12:24.020995Z digest=sha256:4433c4ab5ab3017e4eacecc85024112b668f54f60b2a300a55b4c2e95d956deb

Observation c1f51dc1-1cfa-4c52-870c-2446676844fe · outbound

This paper cites Investigating Neural Audio Codecs for Speech Language Model-Based Speech Generation.

Continuous Speech Tokens Makes LLMs Robust Multi-Modality Learners Investigating Neural Audio Codecs for Speech Language Model-Based Speech Generation

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-11T21:12:24.032430Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T21:12:24.032430Z digest=sha256:38d3c8021b1a03a847fbfa2aa4fb225b488c50a8cefa08b9f347508ef1a735af

Observation b1aff6de-b716-4a8b-b614-80ac8f879a81 · outbound

This paper cites MoBoAligner: a Neural Alignment Model for Non-autoregressive TTS with Monotonic Boundary Search.

Continuous Speech Tokens Makes LLMs Robust Multi-Modality Learners MoBoAligner: a Neural Alignment Model for Non-autoregressive TTS with Monotonic Boundary Search

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-11T21:12:24.036707Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T21:12:24.036707Z digest=sha256:3592dc6e304f9b0526df753b08afc8e5da93e8c5ce05e1c0f953d5d4c0a03a2d

Observation f7867242-133a-4905-b1b3-63cb5db9de4e · outbound

This paper cites Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow.

Continuous Speech Tokens Makes LLMs Robust Multi-Modality Learners Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-11T21:12:24.045362Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T21:12:24.045362Z digest=sha256:573120671bab7dcbb10c0635ffed22790ec4ac9ae1ec2db04dcd98e5d0e05cee

Observation 74d342f8-f9e7-43bc-902d-c2e766602add · outbound

This paper cites DelightfulTTS 2: End-to-End Speech Synthesis with Adversarial Vector-Quantized Auto-Encoders.

Continuous Speech Tokens Makes LLMs Robust Multi-Modality Learners DelightfulTTS 2: End-to-End Speech Synthesis with Adversarial Vector-Quantized Auto-Encoders

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-11T21:12:24.049483Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T21:12:24.049483Z digest=sha256:876bd97c23ee9df34f01d73a82010637b47fe1b8c1822ece352a749238f18bab

Observation 3caa5dde-4d75-4246-a896-2f262d2f30f0 · outbound

This paper cites Autoregressive Speech Synthesis without Vector Quantization.

Continuous Speech Tokens Makes LLMs Robust Multi-Modality Learners Autoregressive Speech Synthesis without Vector Quantization

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-11T21:12:24.053891Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T21:12:24.053891Z digest=sha256:294a059c5e4d2c17a74e2eb0762686b0bf08fb81ef7a46b03a3aedd36666c82e

Observation d201cb1d-f8ce-4341-9bf9-a7d36e2a74ea · outbound

This paper cites Spoken Question Answering and Speech Continuation Using Spectrogram-Powered LLM.

Continuous Speech Tokens Makes LLMs Robust Multi-Modality Learners Spoken Question Answering and Speech Continuation Using Spectrogram-Powered LLM

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-11T21:12:24.057607Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T21:12:24.057607Z digest=sha256:dac2cced468407c3e054f3e6e082ef33f58717fb95c4189eee0fe1357c3976a1

Observation 69168993-6dbb-403d-8c7b-dc73dccc4d96 · outbound

This paper cites Mo\^usai: Text-to-Music Generation with Long-Context Latent Diffusion.

Continuous Speech Tokens Makes LLMs Robust Multi-Modality Learners Mo\^usai: Text-to-Music Generation with Long-Context Latent Diffusion

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-11T21:12:24.061438Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T21:12:24.061438Z digest=sha256:abd28dcea9de06ae1b4b35313f4e48d959e674f2356872f14cc03c93fbf6c480

Observation f07153a0-ea82-4e04-9ff0-c196a1530593 · outbound

This paper cites Bespoke Solvers for Generative Flow Models.

Continuous Speech Tokens Makes LLMs Robust Multi-Modality Learners Bespoke Solvers for Generative Flow Models

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-11T21:12:24.065947Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T21:12:24.065947Z digest=sha256:f30ac27b11cf71e9fb7f7a43b0002be79cfc1bcce36d843dede6d166b7c4a7b3

Observation a15dfbd5-666e-4a52-a256-a949d4b516ca · outbound

This paper cites NaturalSpeech 2: Latent Diffusion Models are Natural and Zero-Shot Speech and Singing Synthesizers.

Continuous Speech Tokens Makes LLMs Robust Multi-Modality Learners NaturalSpeech 2: Latent Diffusion Models are Natural and Zero-Shot Speech and Singing Synthesizers

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-11T21:12:24.072590Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T21:12:24.072590Z digest=sha256:f6d7ec43d631837825e642de3e5a2ac0e50a8e5eb0c674518eb79269c827a55a

Observation d06573db-0160-4c6a-98c2-0bab659855e6 · outbound

This paper cites Improving and generalizing flow-based generative models with minibatch optimal transport.

Continuous Speech Tokens Makes LLMs Robust Multi-Modality Learners Improving and generalizing flow-based generative models with minibatch optimal transport

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-11T21:12:24.077413Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T21:12:24.077413Z digest=sha256:5b2116f225d37a30afb7d0a4ca150b7333c3ce4bbc97ae80d4e5fe23a6d909b0

Observation 4e440572-9239-4a3b-b3b3-366bc5f11d2b · outbound

This paper cites Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers.

Continuous Speech Tokens Makes LLMs Robust Multi-Modality Learners Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-11T21:12:24.083513Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T21:12:24.083513Z digest=sha256:19669f2f5816dd96eb77305aa368b032d239ed8ec27098608eb3435e5bbf7749

Observation 72795f17-3505-4ec4-b58a-f73569adbbd4 · outbound

This paper cites Freeze-Omni: A Smart and Low Latency Speech-to-speech Dialogue Model with Frozen LLM.

Continuous Speech Tokens Makes LLMs Robust Multi-Modality Learners Freeze-Omni: A Smart and Low Latency Speech-to-speech Dialogue Model with Frozen LLM

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-11T21:12:24.088388Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T21:12:24.088388Z digest=sha256:fec16082a30c46b9d8421fbcd7be41032e8874409c67b5a2dc072e8c993339cd

Observation 44456515-7b16-4442-ad1d-e431217f467f · outbound

This paper cites Janus: Decoupling Visual Encoding for Unified Multimodal Understanding and Generation.

Continuous Speech Tokens Makes LLMs Robust Multi-Modality Learners Janus: Decoupling Visual Encoding for Unified Multimodal Understanding and Generation

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-11T21:12:24.099012Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T21:12:24.099012Z digest=sha256:485d9e3f171dcfe51570971bb897168cd7016eec35f0d44d5d95f983fe104796

Observation 3ced33df-bf4e-4c94-92db-cee7a6a5191c · outbound

This paper cites Mini-Omni: Language Models Can Hear, Talk While Thinking in Streaming.

Continuous Speech Tokens Makes LLMs Robust Multi-Modality Learners Mini-Omni: Language Models Can Hear, Talk While Thinking in Streaming

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-11T21:12:24.102735Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T21:12:24.102735Z digest=sha256:493e11803cc27d9735f487b949aead6a7401db7b38f678c2721712c27ef9fce3

Observation 33d97c09-3a17-4b48-a6a0-28313112caba · outbound

This paper cites Qwen2 Technical Report.

Continuous Speech Tokens Makes LLMs Robust Multi-Modality Learners Qwen2 Technical Report

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-11T21:12:24.106734Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T21:12:24.106734Z digest=sha256:72bb19b10fc8bb2c1fd8c9be72370aeda4986062882954a5387d1368e7227394

Observation 0ad4dfac-b493-4042-948b-b91b33bbdc11 · outbound

This paper cites LibriTTS: A Corpus Derived from LibriSpeech for Text-to-Speech.

Continuous Speech Tokens Makes LLMs Robust Multi-Modality Learners LibriTTS: A Corpus Derived from LibriSpeech for Text-to-Speech

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-11T21:12:24.111466Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T21:12:24.111466Z digest=sha256:4c5633529c99317b5b9eb5e3bb060421b6b2c40986fa09c7b8c0ed6bf815bbd0

Observation 24fb27b1-dca9-4f65-8ef2-34f80ba7ec56 · outbound

This paper cites Boosting Diffusion Model for Spectrogram Up-sampling in Text-to-speech: An Empirical Study.

Continuous Speech Tokens Makes LLMs Robust Multi-Modality Learners Boosting Diffusion Model for Spectrogram Up-sampling in Text-to-speech: An Empirical Study

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-11T21:12:24.117270Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T21:12:24.117270Z digest=sha256:8ebb5886db06960a8b0fb267f2be5370d047688fbb302043da3d5897e5a91531

Observation 57606263-1fd7-4937-bb54-c3495b0086f1 · outbound

This paper cites OmniFlatten: An End-to-end GPT Model for Seamless Voice Conversation.

Continuous Speech Tokens Makes LLMs Robust Multi-Modality Learners OmniFlatten: An End-to-end GPT Model for Seamless Voice Conversation

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-11T21:12:24.123186Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T21:12:24.123186Z digest=sha256:1f0f5386535e573e44d83343c1951fe095c71182a47112292b8d2204a4357160

Observation 21dc1169-1c22-44d0-b05a-abea892a15de · outbound

This paper cites PromptTTS 2: Describing and Generating Voices with Text Prompt.

Continuous Speech Tokens Makes LLMs Robust Multi-Modality Learners PromptTTS 2: Describing and Generating Voices with Text Prompt

Reference 2019

Resolution
unresolved
no resolver link, observed 2026-08-11T21:12:24.028223Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T21:12:24.028223Z digest=sha256:0d6f5dfb53d03abdb7e8a506034c450b4ee9c187ce0edefa6e5e51b9fe01a26b

Observation 11b02b08-2e59-4e24-bd95-2b7283f4dcf8 · outbound

This paper cites VALL-E 2: Neural Codec Language Models are Human Parity Zero-Shot Text to Speech Synthesizers.

Continuous Speech Tokens Makes LLMs Robust Multi-Modality Learners VALL-E 2: Neural Codec Language Models are Human Parity Zero-Shot Text to Speech Synthesizers

Reference 2021

Resolution
unresolved
no resolver link, observed 2026-08-11T21:12:23.969675Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T21:12:23.969675Z digest=sha256:8f92bd70c59751789ae3f42ab6d4e2467bfa741adf913e0ab928b7e370ea3779

Observation bab0be1d-6279-4510-8f4c-9b040b3495a8 · outbound

This paper cites MarDini: Masked Autoregressive Diffusion for Video Generation at Scale.

Continuous Speech Tokens Makes LLMs Robust Multi-Modality Learners MarDini: Masked Autoregressive Diffusion for Video Generation at Scale

Reference 2022

Resolution
unresolved
no resolver link, observed 2026-08-11T21:12:24.041379Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T21:12:24.041379Z digest=sha256:c6bf085279725770fa43a1eea3f0a83c09055811ea2c32d35c915d5b3f75bdc7

Observation 0ec7112d-9787-477e-8730-7f7185ce16b4 · outbound

This paper cites Understanding DDPM Latent Codes Through Optimal Transport.

Continuous Speech Tokens Makes LLMs Robust Multi-Modality Learners Understanding DDPM Latent Codes Through Optimal Transport

Reference 2023

Resolution
unresolved
no resolver link, observed 2026-08-11T21:12:24.024563Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T21:12:24.024563Z digest=sha256:36274c9cd4d5750d8b89835c3276315f6164671df5948df18bae5d19936f3ce0

Observation cce992c9-8d14-4e91-b54e-8938282f5b6a · outbound

This paper cites Recent Advances in Speech Language Models: A Survey.

Continuous Speech Tokens Makes LLMs Robust Multi-Modality Learners Recent Advances in Speech Language Models: A Survey

Reference 2024

Resolution
unresolved
no resolver link, observed 2026-08-11T21:12:23.974565Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T21:12:23.974565Z digest=sha256:2c34ca68d2a0c0724ab5a8d963a3ab604bff2b44c62a9840165f447af518fd35

Pith citing papers

Observation 4f425dfd-1a03-4aa3-8f97-c1519f08c345 · inbound

On The Landscape of Spoken Language Models: A Comprehensive Survey cites this paper.

On The Landscape of Spoken Language Models: A Comprehensive Survey Continuous Speech Tokens Makes LLMs Robust Multi-Modality Learners

Reference 48

Resolution
verified exact
arxiv_id, observed 2026-05-22T20:45:08.135585Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-05-22T20:44:57.476464Z digest=sha256:0ad3e4cb15d9aa4890123a7a6bfd8712c4554d695f4cd871840af5dbb4c101c3

Observation a83a50da-cb83-4dd3-a6cc-78708deb9984 · inbound

IMPACT: Iterative Mask-based Parallel Decoding for Text-to-Audio Generation with Diffusion Modeling cites this paper.

IMPACT: Iterative Mask-based Parallel Decoding for Text-to-Audio Generation with Diffusion Modeling Continuous Speech Tokens Makes LLMs Robust Multi-Modality Learners

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-07T12:03:30.685319Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T12:03:30.685319Z digest=sha256:5675eea26632ab6396f21dc3492ec5c713207d11ac424b3b9fc1773aec25a24c

Observation 57703305-fd3c-4bd1-8837-dd90a5334c5e · inbound

Next Tokens Denoising for Speech Synthesis cites this paper.

Next Tokens Denoising for Speech Synthesis Continuous Speech Tokens Makes LLMs Robust Multi-Modality Learners

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-06T11:22:27.693175Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T11:22:27.693175Z digest=sha256:1255628a1d8ee467ae83a2a4459044939bb85bcb0cccebcdc5a578e9924e61d8

Observation ebd68a4c-3872-4398-9419-19b1b8df4f0f · inbound

Fast Text-to-Audio Generation with One-Step Sampling via Energy-Scoring and Auxiliary Contextual Representation Distillation cites this paper.

Fast Text-to-Audio Generation with One-Step Sampling via Energy-Scoring and Auxiliary Contextual Representation Distillation Continuous Speech Tokens Makes LLMs Robust Multi-Modality Learners

Reference 32

Resolution
verified exact
arxiv_id, observed 2026-05-11T15:46:42.075264Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-05-09T19:17:09.247932Z digest=sha256:52d9d48f26cffc3c9e66d10219cad1e18078e72b0774fcc687bb44848c1074ea