Pith. sign in

Paper Citation Record · LEDGER

SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models

As of 6 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 33 inbound Pith citation observations for arXiv:2308.16692.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2308.16692 v2

Coverage vector

measured 0 of 0 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links

measured 33 of 33 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-05T06:32:48.257954+00:00

measured 33 of 33 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-05T23:10:56.208858Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: pith, observed 2026-07-07T14:53:55.714650Z

Reference resolution

0 of 0 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved0
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

No outbound reference observations are available for this paper version.

Pith citing papers

Observation 21e2559e-71e2-448e-bb54-2fb2d8744e75 · inbound

F5-TTS: A Fairytaler that Fakes Fluent and Faithful Speech with Flow Matching cites this paper.

F5-TTS: A Fairytaler that Fakes Fluent and Faithful Speech with Flow Matching SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models

Reference 154

Resolution
verified exact
arxiv_id, observed 2026-05-16T06:06:41.567125Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=arxiv_source observed=2026-05-16T06:06:41.348728Z digest=sha256:2369b4d52b7d155da0c04d478524f474bfc863e7e2d912126dd051e58bf894c3

Observation 2e2cc775-94ec-4211-bae6-f0d509600162 · inbound

Step-Audio 2 Technical Report cites this paper.

Step-Audio 2 Technical Report SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models

Reference 84

Resolution
malformed identifier
arxiv_id, observed 2026-05-16T05:59:51.122199Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-16T05:59:50.900436Z digest=sha256:4793225bc3886d57d54aa95dc4f81fbed4fc258ddf5431ef10ecfeaf96d99ea8

Observation cdd5867a-8a93-41d2-8127-0046701c044a · inbound

NanoCodec: Towards High-Quality Ultra Fast Speech LLM Inference cites this paper.

NanoCodec: Towards High-Quality Ultra Fast Speech LLM Inference SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-05T23:10:56.208858Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T23:10:56.208858Z digest=sha256:d166e3ed8f5866bb050f89d35be6b41f2a92e3d0774d6c1f1d46c284db5998b9

Observation 684daa38-e47c-4732-a064-d44c3ff5fe60 · inbound

LLaSO: A Foundational Framework for Reproducible Research in Large Language and Speech Model cites this paper.

LLaSO: A Foundational Framework for Reproducible Research in Large Language and Speech Model SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models

Reference 93

Resolution
unresolved
no resolver link, observed 2026-08-05T17:56:56.866060Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T17:56:56.866060Z digest=sha256:256aeb4b8bffb5c41c54beb16176809443bde19d98c92549ab8ad873c0126cd4

Observation e89c1e01-398a-4a9b-9a5f-14c3a259b39d · inbound

Speech Discrete Tokens or Continuous Features? A Comparative Analysis for Spoken Language Understanding in SpeechLLMs cites this paper.

Speech Discrete Tokens or Continuous Features? A Comparative Analysis for Spoken Language Understanding in SpeechLLMs SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models

Reference 55

Resolution
unresolved
no resolver link, observed 2026-08-05T16:46:49.276513Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T16:46:49.276513Z digest=sha256:32377be841b5d3406c6f7a501c526cff2df65444e8205952e202dcda25941f29

Observation 93203482-b7d1-49f0-8ed7-7fd2812cbe20 · inbound

CodecBench: A Comprehensive Benchmark for Acoustic and Semantic Evaluation cites this paper.

CodecBench: A Comprehensive Benchmark for Acoustic and Semantic Evaluation SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-05T15:00:14.164561Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T15:00:14.164561Z digest=sha256:acc45bc59d59978b1b3cce1b2ffea1c80e82fa05c742a017eb49a47469de87f1

Observation a03d558c-6c2f-4275-ae38-8bca8cd10ad5 · inbound

Entropy-based Coarse and Compressed Semantic Speech Representation Learning cites this paper.

Entropy-based Coarse and Compressed Semantic Speech Representation Learning SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-05T13:36:07.188114Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T13:36:07.188114Z digest=sha256:a47a488c11e346fb204b618c1b3a6405198aa3e633ba8b86f4b3ab19440550c6

Observation b986fc34-f565-4f28-9bb0-aabbcd94cffc · inbound

FireRedTTS-2: Towards Long Conversational Speech Generation for Podcast and Chatbot cites this paper.

FireRedTTS-2: Towards Long Conversational Speech Generation for Podcast and Chatbot SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-05T12:00:45.385843Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:00:45.385843Z digest=sha256:bad00b82fbc13fc53878b1e798a9711f1bfa3009938ecb937ddfc579ce4d0ec7

Observation 6177a395-c42e-4f7b-b2fb-c50277146890 · inbound

AudioCodecBench: A Comprehensive Benchmark for Audio Codec Evaluation cites this paper.

AudioCodecBench: A Comprehensive Benchmark for Audio Codec Evaluation SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models

Reference 51

Resolution
unresolved
no resolver link, observed 2026-08-05T11:41:03.627960Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T11:41:03.627960Z digest=sha256:aeaf054dba895dfebcc25c9a5163c942bc475ce40d25fdbcf6978522e42c43fd

Observation 9d390e1d-3709-4354-a1b9-ec425eae07b5 · inbound

DeCodec: Rethinking Audio Codecs as Universal Disentangled Representation Learners cites this paper.

DeCodec: Rethinking Audio Codecs as Universal Disentangled Representation Learners SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-04T19:37:52.109011Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T19:37:52.109011Z digest=sha256:f19b947d5b70d2fa77681c6dcb5bd751a7e6427f1f9b309ef6f2b747328d6376

Observation ecdb9f2c-8b5f-49f5-bbe0-5e3761476c3c · inbound

StableToken: A Noise-Robust Semantic Speech Tokenizer for Resilient SpeechLLMs cites this paper.

StableToken: A Noise-Robust Semantic Speech Tokenizer for Resilient SpeechLLMs SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models

Reference 91

Resolution
verified exact
arxiv_id, observed 2026-05-18T13:01:24.368802Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=arxiv_source observed=2026-05-18T12:57:04.450462Z digest=sha256:7ae1cc70409de7029c1df5fd490244fd747dc939624013e9efd3e5533496d050

Observation 2bb80f16-9c37-465a-99cd-ffcb0690091c · inbound

TokenChain: A Discrete Speech Chain via Semantic Token Modeling cites this paper.

TokenChain: A Discrete Speech Chain via Semantic Token Modeling SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models

Reference 15

Resolution
verified exact
arxiv_id, observed 2026-05-18T09:16:09.512778Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-18T09:14:58.542628Z digest=sha256:4ad4f17f6b7c19d849e2ffb409476be70033528b9b512a37d511c6e262f9b1a5

Observation f011e8c3-3f3c-4f07-ba68-6169a9ff7206 · inbound

Two-Dimensional Quantization for Geometry-Aware Audio Coding cites this paper.

Two-Dimensional Quantization for Geometry-Aware Audio Coding SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models

Reference 82

Resolution
verified exact
arxiv_id, observed 2026-05-21T18:20:29.255424Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=arxiv_source observed=2026-05-21T18:16:51.486807Z digest=sha256:7189698e3b3049dfff788ea067ecbf1c34330397a817a36099bf88d66291d892

Observation d8ad6aef-1f0e-4aa5-884c-4211e7627d5a · inbound

The Equalizer: Introducing Shape-Gain Decomposition in Neural Audio Codecs cites this paper.

The Equalizer: Introducing Shape-Gain Decomposition in Neural Audio Codecs SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-02T22:52:23.470401Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T22:52:23.470401Z digest=sha256:250ecef7921a67f544a8a5427fcc7f9319b6e204b14b83708a1df04ab266b42a

Observation e4018985-962f-4df1-b8a7-6b4f0df66bfe · inbound

PolySLGen: Online Multimodal Speaking-Listening Reaction Generation in Polyadic Interaction cites this paper.

PolySLGen: Online Multimodal Speaking-Listening Reaction Generation in Polyadic Interaction SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models

Reference 93

Resolution
verified exact
arxiv_id, observed 2026-05-11T00:30:54.807546Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-10T18:28:26.910105Z digest=sha256:5d5bc3d9d6c2c3bd79ed57ac55fb69175196658805db7eade40c331927f45756

Observation 975d0b7c-3b6e-4e31-82c1-c4cbdca5aa29 · inbound

PairAlign: A Framework for Sequence Tokenization via Self-Alignment with Applications to Audio Tokenization cites this paper.

PairAlign: A Framework for Sequence Tokenization via Self-Alignment with Applications to Audio Tokenization SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models

Reference 61

Resolution
verified exact
arxiv_id, observed 2026-05-11T19:16:08.551547Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-08T12:25:52.847432Z digest=sha256:a5bf230a489b827be58945a21f3e7f742fdfccfdcb1f5b525d303a9d44ca5733

Observation 3564f7f5-83ee-4660-b759-e14212cc3e07 · inbound

PairAlign: A Framework for Sequence Tokenization via Self-Alignment with Applications to Audio Tokenization cites this paper.

PairAlign: A Framework for Sequence Tokenization via Self-Alignment with Applications to Audio Tokenization SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models

Reference 61

Resolution
verified exact
arxiv_id, observed 2026-06-30T23:15:07.805858Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-06-30T23:14:32.494076Z digest=sha256:f60536e32fd9bf8b13679a53590bc3ed86b09e587f472e19603cf1bded948721

Observation 60910e39-7b60-4175-b555-72b61816971e · inbound

Codec-Robust Attacks on Audio LLMs cites this paper.

Codec-Robust Attacks on Audio LLMs SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models

Reference 56

Resolution
verified exact
arxiv_id, observed 2026-05-21T06:44:00.768635Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-21T06:43:52.735211Z digest=sha256:3d8582fbe721c71843657ee771c972c54d70b87c14bae0660446b7bff7079686

Observation c8bbad41-00b6-47b5-964b-2cba9831453e · inbound

Codec-Robust Attacks on Audio LLMs cites this paper.

Codec-Robust Attacks on Audio LLMs SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models

Reference 56

Resolution
verified exact
arxiv_id, observed 2026-05-25T05:45:23.760085Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-25T05:44:46.831360Z digest=sha256:f6224eb00648449409d54b86b2095626121dbfc381060479904baa58d9228c64

Observation c02b7ec1-3b85-4b62-a36a-ec76c0345d7d · inbound

MOSS-Audio Technical Report cites this paper.

MOSS-Audio Technical Report SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models

Reference 61

Resolution
verified exact
arxiv_id, observed 2026-07-02T00:56:25.032216Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-06-28T13:05:29.813707Z digest=sha256:ce6417efb9afce7a40d824e9929b31c89d17d373d42d332ab097a7899cdb4888

Observation eff99e53-30ad-4c4e-878f-8128b51cdd53 · inbound

SARA: A Dual-Stream VAE for High-Fidelity Speech Generation via Integrating Semantic and Acoustic Representations cites this paper.

SARA: A Dual-Stream VAE for High-Fidelity Speech Generation via Integrating Semantic and Acoustic Representations SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models

Reference 11

Resolution
verified exact
arxiv_id, observed 2026-07-03T12:58:08.349544Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-06-27T08:38:51.371500Z digest=sha256:df54b7db41bf8d020138c6317cb75cbe885dd1ee6bef260e996989edbcb1a1d2

Observation 42b92062-9349-4acb-b6c3-969097fda026 · inbound

Which Speech Representation Better Matches Text-Native Reasoning? A Study of Speech-Text Alignment on Frame Rate and Representation cites this paper.

Which Speech Representation Better Matches Text-Native Reasoning? A Study of Speech-Text Alignment on Frame Rate and Representation SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models

Reference 25

Resolution
verified exact
arxiv_id, observed 2026-07-03T13:18:12.788140Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-06-27T08:18:23.182355Z digest=sha256:fe176ff449489b0a1d9eba0d4dabb20c20b72e0601bd009affce6b975b8d8386

Observation b17b94d4-8972-4347-89f2-5dd1c4b9e824 · inbound

Self-Guidance: Enhancing Neural Codecs via Decoder Manifold Alignment cites this paper.

Self-Guidance: Enhancing Neural Codecs via Decoder Manifold Alignment SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models

Reference 86

Resolution
metadata mismatch
arxiv_id, observed 2026-07-03T16:08:37.515597Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=arxiv_source observed=2026-06-27T06:05:26.735340Z digest=sha256:e7895ba36971ade9ed907df9114b28d52911322c04abca138163ce9a7628eafd

Observation 01ed80dd-013b-4107-b3ea-114674aa9bb4 · inbound

Phonemes to the Rescue: Multilingual Tokenization Based on International Phonetic Alphabet cites this paper.

Phonemes to the Rescue: Multilingual Tokenization Based on International Phonetic Alphabet SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models

Reference 69

Resolution
verified exact
arxiv_id, observed 2026-07-04T04:39:34.594685Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=arxiv_source observed=2026-06-26T16:53:25.556222Z digest=sha256:177684c51ce676bc8642bd45d811a3f4791dcb018b80f382bb37421d411ce429

Observation 6a9700a0-a430-4ac4-9502-98329c5e74fd · inbound

wav2tok 2.0: Scalable Audio Tokenization Maintaining Explicit Pairwise Token Alignment for Efficient Audio Retrieval cites this paper.

wav2tok 2.0: Scalable Audio Tokenization Maintaining Explicit Pairwise Token Alignment for Efficient Audio Retrieval SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models

Reference 29

Resolution
verified exact
arxiv_id, observed 2026-07-04T14:39:58.366769Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-06-26T02:49:35.819155Z digest=sha256:007f2da808d44579591dab426f9b064266275e4e453d46565afe876d14b02116

Observation 28b4c19e-f21e-4c70-9bc7-ab4db1393272 · inbound

FlexiSLM: A Dynamic and Controllable Frame Rate Spoken Language Model cites this paper.

FlexiSLM: A Dynamic and Controllable Frame Rate Spoken Language Model SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models

Reference 193

Resolution
metadata mismatch
arxiv_id, observed 2026-07-01T11:45:47.146929Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=arxiv_source observed=2026-07-01T03:50:26.873406Z digest=sha256:a83218096fa2f547ebb7c120b30258c7482a7a630f9d53efe353f0d956eff39d

Observation e6451e05-4307-47ec-9477-f9e7730f820b · inbound

SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models cites this paper.

SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models

Reference 19

Resolution
verified exact
local_arxiv, observed 2026-07-07T14:53:55.721428Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-07-07T14:53:07.512543Z digest=sha256:b8a81168615700fef531101bc971ed9e2c47a3be9176ad376b9d9ef4231d7ae6

Observation 706dcea2-3cce-4293-8aa2-6facee4b7f77 · inbound

AuEmoChat: Authentic Emotion Understanding and Rendering for Conversational Speech Synthesis cites this paper.

AuEmoChat: Authentic Emotion Understanding and Rendering for Conversational Speech Synthesis SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models

Reference 50

Resolution
unresolved
no resolver link, observed 2026-08-01T22:28:21.964747Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T22:28:21.964747Z digest=sha256:a1854d0d11531e5f90c445e52b1e7c90105a52fafa2be7302942fb5c4a6528b7

Observation 704dae48-2532-4840-ace5-216e89f6dfbc · inbound

AuEmoChat: Authentic Emotion Understanding and Rendering for Conversational Speech Synthesis cites this paper.

AuEmoChat: Authentic Emotion Understanding and Rendering for Conversational Speech Synthesis SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models

Reference 56

Resolution
unresolved
no resolver link, observed 2026-08-03T01:58:26.210946Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T01:58:26.210946Z digest=sha256:4cded9ee8056db91954fabeb668f9c953b78ca2701fa0da4a1585d37e948794d

Observation dac67f1b-7032-41fc-801a-e19e4c436218 · inbound

HARP: Harmonic-Aware Residual Partitioning for Neural Audio Codecs cites this paper.

HARP: Harmonic-Aware Residual Partitioning for Neural Audio Codecs SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-01T20:22:47.787655Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T20:22:47.787655Z digest=sha256:d00ef75f45d7c567786d0d26f42269cd9a4192746a64ea7765207591dd531cc3

Observation 5ae0cf21-b0fb-4649-bef0-5810607e3b1c · inbound

Investigating Codec-Internal Latent Audio Watermarking for Neural Codec Robustness cites this paper.

Investigating Codec-Internal Latent Audio Watermarking for Neural Codec Robustness SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-01T08:25:27.411588Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T08:25:27.411588Z digest=sha256:8240bb7b873cf7a9c63ae8ee226dbb4de0e35cc90f192171acad7322724b72b9

Observation a54b8c01-8f04-4c63-8591-12d3120f4b7f · inbound

OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation cites this paper.

OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models

Reference 4

Resolution
unresolved
no resolver link, observed 2026-07-30T10:34:57.884102Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-30T10:34:57.884102Z digest=sha256:b40491ad095b71c2f9363fb94ea2ffac33424087c6336f0f0df3a257993aa53f

Observation 184be546-ffba-4adf-86ec-b83c1e6b6403 · inbound

OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation cites this paper.

OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-03T01:50:57.207168Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T01:50:57.207168Z digest=sha256:9243bee7a9ddc2d983d1228bca91bad7d41cd4f092a4870435c014ae4774c130