Pith. sign in

Paper Citation Record · LEDGER

OpusLM: A Family of Open Unified Speech Language Models

As of 7 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 4 inbound Pith citation observations for arXiv:2506.17611.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2506.17611 v1

Coverage vector

measured 57 of 57 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-06T23:35:37.514349Z

measured 61 of 61 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-07T06:34:17.273281+00:00

measured 4 of 4 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-06T23:35:35.805367Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-07-04T10:19:47.988040Z

Reference resolution

57 of 57 outbound references displayed

  • verified exact1
  • verified fuzzy30
  • unresolved25
  • parse uncertain0
  • malformed identifier1
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 3b8c5a0a-2ad1-4961-b14a-b848c46c297e · outbound

This paper cites This prosperity quickly spread to the speech domain and invoked the popular- ity of speech language models (SpeechLMs) [4–6].

OpusLM: A Family of Open Unified Speech Language Models This prosperity quickly spread to the speech domain and invoked the popular- ity of speech language models (SpeechLMs) [4–6]

Reference 1

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:35:43.204876Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T23:35:35.768809Z digest=sha256:24756cc3bfa7def70267eed32a98df7f637596a698b1e64c51b50a32f3bf63b4

Observation 9f94f05f-bee1-4862-8945-76bf43178963 · outbound

This paper cites OpusLM: A Family of Open Unified Speech Language Models.

OpusLM: A Family of Open Unified Speech Language Models OpusLM: A Family of Open Unified Speech Language Models

Reference 2

Resolution
malformed identifier
no resolver link, observed 2026-08-06T23:35:35.805367Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:35:35.805367Z digest=sha256:daa60cba515485460e0afd5b4585616971f0aaba948c001830e989e777b71133

Observation 2111fd18-8b77-4f2a-bc85-96c22520c478 · outbound

This paper cites Experimental Setup Data:Our speech data is a mixture of YODAS [41], Emilia [42], and OWSM v3.2 suite [22].

OpusLM: A Family of Open Unified Speech Language Models Experimental Setup Data:Our speech data is a mixture of YODAS [41], Emilia [42], and OWSM v3.2 suite [22]

Reference 3

Resolution
verified exact
raw_fallback, observed 2026-08-06T23:35:39.596126Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T23:35:35.845196Z digest=sha256:4b5e957c48d66c13778b579e5bc7f5d3930eb8855e2cd0ae2448c9773993f621

Observation 0c65bce9-1a68-4cfd-9bf3-0ba1d36a8361 · outbound

This paper cites The code, data, checkpoints, and training logs are released to support open speech language model research in the community.

OpusLM: A Family of Open Unified Speech Language Models The code, data, checkpoints, and training logs are released to support open speech language model research in the community

Reference 4

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:35:43.044755Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T23:35:35.891220Z digest=sha256:0c79d44bd25c721aab65f977ec701144ac57570883b47c9671e35034e4f38635

Observation 5673b951-608c-4260-8a48-770788453204 · outbound

This paper cites 18Note the out-domain corpus in [25] is of sufficiently high quality, so we believe this degradation is more from domain mismatch.

OpusLM: A Family of Open Unified Speech Language Models 18Note the out-domain corpus in [25] is of sufficiently high quality, so we believe this degradation is more from domain mismatch

Reference 5

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:35:42.894750Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T23:35:35.928366Z digest=sha256:df27d767b4255bf82aa88fe84968795cd4be64768c7854a56727a931a9c7944f

Observation 3ff11d81-8665-4a31-9c7a-1f0999cb9d6d · outbound

This paper cites GPT-4 Technical Report.

OpusLM: A Family of Open Unified Speech Language Models GPT-4 Technical Report

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-06T23:35:35.964871Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:35:35.964871Z digest=sha256:ae99735ac13642729aff3591fad1b82a0591752447d2d48fad650d61c359fa52

Observation da065035-e9bc-4f03-8750-778e2e82fe75 · outbound

This paper cites The Llama 3 Herd of Models.

OpusLM: A Family of Open Unified Speech Language Models The Llama 3 Herd of Models

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-06T23:35:35.991787Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:35:35.991787Z digest=sha256:568ea3692c171ce68b4bac9983a0b7ac5be3b6d53dab78bb4620a3b16b1b5f04

Observation ff696368-a817-4e6b-9932-d2321378b2c5 · outbound

This paper cites A Survey of Large Language Models.

OpusLM: A Family of Open Unified Speech Language Models A Survey of Large Language Models

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-06T23:35:35.998119Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:35:35.998119Z digest=sha256:b6202b1e916476e5068f204726a74a15919768fabd3f407ec71fef5c7e35e9c0

Observation bb72e72e-eb31-46a0-8cd5-6748b6f876b0 · outbound

This paper cites Recent Advances in Speech Language Models: A Survey.

OpusLM: A Family of Open Unified Speech Language Models Recent Advances in Speech Language Models: A Survey

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-06T23:35:36.004978Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:35:36.004978Z digest=sha256:445e42d7a16b28efa93b30d4f919ec4246416c9d1ee8acc39739564be23c344e

Observation 73bd60e5-4c44-43e7-b345-b972a9be184a · outbound

This paper cites A survey on speech large language models,.

OpusLM: A Family of Open Unified Speech Language Models A survey on speech large language models,

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-06T23:35:36.046876Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:35:36.046876Z digest=sha256:36fdaa9eda16e77389e070e9cc9c674f70ef693e444ee24436e49c9c02400ec4

Observation b65c5f37-2a5f-4cad-b67c-2cbb5e689769 · outbound

This paper cites WavChat: A Survey of Spoken Dialogue Models.

OpusLM: A Family of Open Unified Speech Language Models WavChat: A Survey of Spoken Dialogue Models

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-06T23:35:36.084747Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:35:36.084747Z digest=sha256:b17642338183c781c60b6dc15eb858fb349ec25b33943a85210fbdccc05f57e4

Observation 8ef6a9b0-5cb3-4c18-af6d-6e8ef37cb0ea · outbound

This paper cites Qwen2-Audio Technical Report.

OpusLM: A Family of Open Unified Speech Language Models Qwen2-Audio Technical Report

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-06T23:35:36.144749Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:35:36.144749Z digest=sha256:a3a823304b61b0bf1b09ad82d75032506f44920e9ec6cb72fdfad66d1b2c9446

Observation 1116a37e-1c1a-4135-8dc9-802542cac382 · outbound

This paper cites V oxtlm: Unified decoder-only models for consoli- dating speech recognition, synthesis and speech, text continuation tasks,.

OpusLM: A Family of Open Unified Speech Language Models V oxtlm: Unified decoder-only models for consoli- dating speech recognition, synthesis and speech, text continuation tasks,

Reference 13

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:35:42.712790Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T23:35:36.184826Z digest=sha256:8514d1001ed4cef08101d9d6a4380dffefb7f33e2940dada96e6d4c2fd8db271

Observation bb2df365-0857-4293-8b3a-fe758f918271 · outbound

This paper cites Uniaudio: Towards universal audio generation with large language models,.

OpusLM: A Family of Open Unified Speech Language Models Uniaudio: Towards universal audio generation with large language models,

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:35:42.598157Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T23:35:36.226145Z digest=sha256:8e1d4e3d7d9063ee9c17caf0ed863d67364d83bf818c552f5361611ec34763b4

Observation 91e9715e-1895-40cf-980a-feaa593d1713 · outbound

This paper cites SpeechX: Neural codec language model as a ver- satile speech transformer,.

OpusLM: A Family of Open Unified Speech Language Models SpeechX: Neural codec language model as a ver- satile speech transformer,

Reference 15

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:35:42.497580Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T23:35:36.284828Z digest=sha256:d19030e05ff5106c85b02d769f9eadacb4d2fef234240e0106abbc17087b43ea

Observation e58d9ddf-40d0-4d10-893d-ff661ecaf7eb · outbound

This paper cites Speak Foreign Languages with Your Own Voice: Cross-Lingual Neural Codec Language Modeling.

OpusLM: A Family of Open Unified Speech Language Models Speak Foreign Languages with Your Own Voice: Cross-Lingual Neural Codec Language Modeling

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-06T23:35:36.334752Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:35:36.334752Z digest=sha256:91239745af5df8c6e1d4e25093c1e06d380e294bebd229bfc93a0fabd177a574

Observation 8be3e27d-70a3-4345-aa55-5203dfe1087e · outbound

This paper cites Moshi: a speech-text foundation model for real-time dialogue.

OpusLM: A Family of Open Unified Speech Language Models Moshi: a speech-text foundation model for real-time dialogue

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-06T23:35:36.384751Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:35:36.384751Z digest=sha256:3c38a1a5ae1ceaf9faeb5359efea23ae34e5e4b0412f6097f51363858c75bdc7

Observation 4671bcde-ba59-4488-adc5-c0b8b2c4d638 · outbound

This paper cites VITA-1.5: Towards GPT-4o Level Real-Time Vision and Speech Interaction.

OpusLM: A Family of Open Unified Speech Language Models VITA-1.5: Towards GPT-4o Level Real-Time Vision and Speech Interaction

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-06T23:35:36.434750Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:35:36.434750Z digest=sha256:163a80367a48f6bbbb0047b92b37acc33b8b7af31c989b648774d492c74ee68c

Observation 6c5dedfc-9ad4-4aea-a19b-e1f21db0a1b9 · outbound

This paper cites Mini-Omni2: Towards Open-source GPT-4o with Vision, Speech and Duplex Capabilities.

OpusLM: A Family of Open Unified Speech Language Models Mini-Omni2: Towards Open-source GPT-4o with Vision, Speech and Duplex Capabilities

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-06T23:35:36.459737Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:35:36.459737Z digest=sha256:9bbd0e03a198523638ec3f2821b0f885ef42a9c0df59125276ffbe5a25c1e832

Observation 4ea713a3-5306-4c83-8481-dcaf28e86912 · outbound

This paper cites GLM-4-V oice: Towards intelligent and human- like end-to-end spoken chatbot,.

OpusLM: A Family of Open Unified Speech Language Models GLM-4-V oice: Towards intelligent and human- like end-to-end spoken chatbot,

Reference 20

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:35:42.447416Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T23:35:36.484883Z digest=sha256:bb70c00d44a1388fcf1e9b8ec1e754d961d808af417bfa81ded575f70a6ec1bd

Observation c52f4991-75aa-4ad9-bc57-22d18667c366 · outbound

This paper cites Ocean-omni: To understand the world with omni- modality,.

OpusLM: A Family of Open Unified Speech Language Models Ocean-omni: To understand the world with omni- modality,

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-06T23:35:36.524956Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:35:36.524956Z digest=sha256:fdcf7a14199f24d75519ab9f3c9460a1e27e9f59594c9e62c7fb98f001e19f27

Observation a8d48137-7d0c-489f-86b0-9e6e0c7883a8 · outbound

This paper cites V oiceTextBlender: Augmenting Large Language Models with Speech Capabilities via Single-Stage Joint Speech- Text Supervised Fine-Tuning,.

OpusLM: A Family of Open Unified Speech Language Models V oiceTextBlender: Augmenting Large Language Models with Speech Capabilities via Single-Stage Joint Speech- Text Supervised Fine-Tuning,

Reference 22

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:35:42.325354Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T23:35:36.551512Z digest=sha256:1ae0aabcccc71934e61dc7ac12341fb4262a1108e26d7dfd4e6ed97659a900a3

Observation 1302e537-cbc1-4284-b308-3a2af68d494c · outbound

This paper cites Role of intelligence tests in speech/language,.

OpusLM: A Family of Open Unified Speech Language Models Role of intelligence tests in speech/language,

Reference 23

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:35:42.026476Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T23:35:36.568157Z digest=sha256:12af2e92d2880c5cd8153b42a93baf8b6c8c4c590f7c62755e434eee323f3773

Observation 8f3ab886-beea-43fa-973c-b2a58273f08a · outbound

This paper cites GPT-4o System Card.

OpusLM: A Family of Open Unified Speech Language Models GPT-4o System Card

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-06T23:35:36.580526Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:35:36.580526Z digest=sha256:40f921ddb98911da21c3d1de13c413ae46d9943d465eefb71a839eeaa77ee2f3

Observation 4f1d3656-06bc-49ae-8278-a3baecccb410 · outbound

This paper cites Gemini: A Family of Highly Capable Multimodal Models.

OpusLM: A Family of Open Unified Speech Language Models Gemini: A Family of Highly Capable Multimodal Models

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-06T23:35:36.595070Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:35:36.595070Z digest=sha256:9289a7e324220883af13251f4545d148d7a0fe63fb9147702b865d387a1ac418

Observation 26861933-ce1a-4d5e-9135-504cbd478843 · outbound

This paper cites Owsm v3.1: Better and faster open whisper-style speech models based on e-branchformer,.

OpusLM: A Family of Open Unified Speech Language Models Owsm v3.1: Better and faster open whisper-style speech models based on e-branchformer,

Reference 26

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:35:41.664808Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T23:35:36.640226Z digest=sha256:a619c55ba988b8327b01aee2013e89bc9f689a08730f694f0d528b6afdd8f30e

Observation fde3f299-ccb8-4ab8-b995-f13370bbca2c · outbound

This paper cites On the effects of heterogeneous data sources on speech-to-text foundation models,.

OpusLM: A Family of Open Unified Speech Language Models On the effects of heterogeneous data sources on speech-to-text foundation models,

Reference 27

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:35:41.531325Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T23:35:36.659701Z digest=sha256:c34cd130118c1ea3394d3021db12152f0f89b1236c14fe9d5506d6a95cc4cfe5

Observation 7d548fb4-ed25-440b-a023-a30419e2dd8a · outbound

This paper cites 2 OLMo 2 Furious.

OpusLM: A Family of Open Unified Speech Language Models 2 OLMo 2 Furious

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-06T23:35:36.704077Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:35:36.704077Z digest=sha256:9884126654ba1e743caf6d8bd09edd7d45ea45239233f50b5462543946daeb6a

Observation cc165af1-575a-49b4-8216-c7e6b40122ee · outbound

This paper cites Parler-tts,.

OpusLM: A Family of Open Unified Speech Language Models Parler-tts,

Reference 29

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:35:41.394807Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T23:35:36.735394Z digest=sha256:001d7e5d94627d9389a56703aef40a5a87beae4694154c4e56bcf61d51399c36

Observation 09dcac45-0ef7-426b-a577-a7b8666813e9 · outbound

This paper cites ESPnet-SpeechLM: An open speech language model toolkit,.

OpusLM: A Family of Open Unified Speech Language Models ESPnet-SpeechLM: An open speech language model toolkit,

Reference 30

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:35:41.315783Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T23:35:36.766750Z digest=sha256:9b4d1414691f229bfff94c20657ae11ae27914ae3f45ccdf2bc0d3bc9e1dfc28

Observation b92efcad-d929-43fa-b14b-628ecd758c33 · outbound

This paper cites Librispeech: an ASR corpus based on public domain audio books,.

OpusLM: A Family of Open Unified Speech Language Models Librispeech: an ASR corpus based on public domain audio books,

Reference 31

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:35:41.183085Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T23:35:36.795731Z digest=sha256:a7deb0f6ac48d1a2467c39d39bc034d7b30cd261becee5762fbbc11415a84909

Observation 5d1a4c94-3f59-4a24-883d-c38a21e028bd · outbound

This paper cites Measuring Massive Multitask Language Understanding.

OpusLM: A Family of Open Unified Speech Language Models Measuring Massive Multitask Language Understanding

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-06T23:35:36.816221Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:35:36.816221Z digest=sha256:aeb4efad98024ff88afa31ae55f95ffac23ce4f48ef5f5e0205f8ad91576943c

Observation 5e0c97e7-7dd4-4d1e-add7-3e9cf29eccd5 · outbound

This paper cites SALMONN: Towards generic hearing abilities for large language models,.

OpusLM: A Family of Open Unified Speech Language Models SALMONN: Towards generic hearing abilities for large language models,

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-06T23:35:36.834754Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:35:36.834754Z digest=sha256:d4c640ec9756c3a4020af5daf54227adab0860db88e15696eadf8e9dc874319b

Observation 9c573230-f601-4b7c-ac62-6424680a70b1 · outbound

This paper cites Speak, read and prompt: High-fidelity text- to-speech with minimal supervision,.

OpusLM: A Family of Open Unified Speech Language Models Speak, read and prompt: High-fidelity text- to-speech with minimal supervision,

Reference 34

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:35:41.025369Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T23:35:36.880206Z digest=sha256:1ac25563b0208a7bd5993eafc88f81fe27945e07bd145dd0c9486b3198060d23

Observation 1ee27a7c-4577-4596-9748-7656a98eb793 · outbound

This paper cites Audiolm: a language modeling approach to au- dio generation,.

OpusLM: A Family of Open Unified Speech Language Models Audiolm: a language modeling approach to au- dio generation,

Reference 35

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:35:40.926122Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T23:35:36.905232Z digest=sha256:8c1e060bf5627e05a8552249dd2af27e1770a58b66dfc6f8e7a2539a6968189e

Observation 8b28a046-c13e-47e0-83bb-8465db3a9f11 · outbound

This paper cites Soundstream: An end-to-end neural audio codec,.

OpusLM: A Family of Open Unified Speech Language Models Soundstream: An end-to-end neural audio codec,

Reference 36

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:35:40.834738Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T23:35:36.954999Z digest=sha256:96194895da1f77b7f83afbdf0ee9f541b9f654eb6034ddc07345a046ba4da41b

Observation ec395036-1136-4f94-aa1d-8f93c6921728 · outbound

This paper cites Robust speech recognition via large-scale weak supervision,.

OpusLM: A Family of Open Unified Speech Language Models Robust speech recognition via large-scale weak supervision,

Reference 37

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:35:40.709792Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T23:35:36.993493Z digest=sha256:3c386831267cd578f1b8de99ef7cbf08f22060d22f5c901f7b6df46f943cce19

Observation e48e996f-b2a4-4258-9e71-c0d01fd405a6 · outbound

This paper cites Chattts: A generative speech model for daily dialogue.

OpusLM: A Family of Open Unified Speech Language Models Chattts: A generative speech model for daily dialogue

Reference 38

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:35:40.625504Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T23:35:37.024923Z digest=sha256:1d186a40e4e9361321adaf38515e505d6bc7ac75bf66be6c0c7420cb7ed2d4fb

Observation 52c982af-42cf-4abd-b1fe-a57526a91a20 · outbound

This paper cites CosyVoice: A Scalable Multilingual Zero-shot Text-to-speech Synthesizer based on Supervised Semantic Tokens.

OpusLM: A Family of Open Unified Speech Language Models CosyVoice: A Scalable Multilingual Zero-shot Text-to-speech Synthesizer based on Supervised Semantic Tokens

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-06T23:35:37.056647Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:35:37.056647Z digest=sha256:777800cb35ac81225d62e79850a9ef13040aee8c018a61b8b0b8f6a320b5cb45

Observation 9e742353-f459-4b9c-ac78-b736f50fc1cf · outbound

This paper cites Gemma: Open Models Based on Gemini Research and Technology.

OpusLM: A Family of Open Unified Speech Language Models Gemma: Open Models Based on Gemini Research and Technology

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-06T23:35:37.094892Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:35:37.094892Z digest=sha256:5a88fa4054c4a8f488a9efe07471c00e40150427c2293e7cc000d21a64fbc1a8

Observation db665f08-39dd-412a-adc2-67c86da45994 · outbound

This paper cites SmolLM2: When Smol Goes Big -- Data-Centric Training of a Small Language Model.

OpusLM: A Family of Open Unified Speech Language Models SmolLM2: When Smol Goes Big -- Data-Centric Training of a Small Language Model

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-06T23:35:37.134608Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:35:37.134608Z digest=sha256:573b0b0ad1cc82365e41225fb87d447fe6cdbb40f23583d3866f9bf7b093ad83

Observation 85ea1877-d18b-41a0-930e-5a3f1e7bed1f · outbound

This paper cites Llama 2: Open Foundation and Fine-Tuned Chat Models.

OpusLM: A Family of Open Unified Speech Language Models Llama 2: Open Foundation and Fine-Tuned Chat Models

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-06T23:35:37.174496Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:35:37.174496Z digest=sha256:b906e6607b46e8d0a5df1418de6d83e2c06218e4c68fde08a6a65c3b31cda3f0

Observation ca0fb67c-5e01-41e9-8158-5e48fa6eec11 · outbound

This paper cites Spirit LM: Interleaved Spoken and Written Language Model.

OpusLM: A Family of Open Unified Speech Language Models Spirit LM: Interleaved Spoken and Written Language Model

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-06T23:35:37.204906Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:35:37.204906Z digest=sha256:f81734eca436576bedf75bf4cbfe3dea121ff68740aabd119782dfa996a70886

Observation 187d76d5-0bd2-4fa4-8b85-ed7273abebba · outbound

This paper cites Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers.

OpusLM: A Family of Open Unified Speech Language Models Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-06T23:35:37.245740Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:35:37.245740Z digest=sha256:04178ffa3743dbe1e9b12b268f681f57884e7ee1332af66988d7f7ffa8eb9693

Observation 4bac999b-59ee-4a72-a9a4-2d16557f4151 · outbound

This paper cites Simple and controllable music generation,.

OpusLM: A Family of Open Unified Speech Language Models Simple and controllable music generation,

Reference 45

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:35:40.490526Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T23:35:37.300784Z digest=sha256:ee49536b072bd6d8e14f51ccc3cc78e948e99568bef59111b74449c26be98001

Observation 9a757072-8620-42d5-a437-5f474632bdf8 · outbound

This paper cites Yodas: Youtube-oriented dataset for audio and speech,.

OpusLM: A Family of Open Unified Speech Language Models Yodas: Youtube-oriented dataset for audio and speech,

Reference 46

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:35:40.367605Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T23:35:37.372656Z digest=sha256:2a9d981f50b8b142bcaa287a77393df07137e1dccd80a5725572cb463925c897

Observation ca97a751-3b71-4ba0-8951-a4cf453e6657 · outbound

This paper cites Emilia: An extensive, multilingual, and diverse speech dataset for large-scale speech generation,.

OpusLM: A Family of Open Unified Speech Language Models Emilia: An extensive, multilingual, and diverse speech dataset for large-scale speech generation,

Reference 47

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:35:40.184279Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T23:35:37.405956Z digest=sha256:725026c66d2631fc36e1c2bb8a3bc5ec6e5ae5b160df20a5b66b66a3a77c590a

Observation 65ddbee9-59c0-436a-aab1-22171199b815 · outbound

This paper cites Zero: Memory optimizations toward train- ing trillion parameter models,.

OpusLM: A Family of Open Unified Speech Language Models Zero: Memory optimizations toward train- ing trillion parameter models,

Reference 48

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:35:40.045832Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T23:35:37.442538Z digest=sha256:be89fc12030e2e1ef40001d51906950661905de7dc3f18f895758d50aa388d1e

Observation d9b3c04b-0266-4fb1-95c4-a650d1126fec · outbound

This paper cites PaLM: Scaling language modeling with pathways,.

OpusLM: A Family of Open Unified Speech Language Models PaLM: Scaling language modeling with pathways,

Reference 49

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:35:39.974737Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T23:35:37.458194Z digest=sha256:c3d5708c6b54842dfaafcb164eb23e3b43fa0ef7a61fde7cfc72676707621be1

Observation dd4aadb3-8619-433c-bae1-7017716076b2 · outbound

This paper cites FLEURS: Few-Shot Learning Evaluation of Universal Representations of Speech,.

OpusLM: A Family of Open Unified Speech Language Models FLEURS: Few-Shot Learning Evaluation of Universal Representations of Speech,

Reference 50

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:35:39.856931Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T23:35:37.461483Z digest=sha256:92a4931344c600ff248aed63089aca978708a6d0e6b4a94d795f7643cc275726

Observation 3fc516ab-3b33-4181-8635-6bca30a8bc91 · outbound

This paper cites Espnet-spk: full pipeline speaker embedding toolkit with reproducible recipes, self-supervised front-ends, and off-the-shelf models,.

OpusLM: A Family of Open Unified Speech Language Models Espnet-spk: full pipeline speaker embedding toolkit with reproducible recipes, self-supervised front-ends, and off-the-shelf models,

Reference 51

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:35:39.810512Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T23:35:37.465720Z digest=sha256:221e361af45db09493ab2126534e3f725f523ad36279c965cb7ab727f2f82ec4

Observation 08caaae5-b12d-4ccb-b00d-ae804b134964 · outbound

This paper cites Utmos: Utokyo-sarulab system for voicemos challenge 2022,.

OpusLM: A Family of Open Unified Speech Language Models Utmos: Utokyo-sarulab system for voicemos challenge 2022,

Reference 52

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:35:39.766985Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T23:35:37.468734Z digest=sha256:80340d82410f91b2ea9afc75a1de5dc62826c2f538dae27e07a388e93a47ebc5

Observation 65ee1f7f-35da-48d7-a95e-209464a251ed · outbound

This paper cites VERSA: A Versatile Evaluation Toolkit for Speech, Audio, and Music.

OpusLM: A Family of Open Unified Speech Language Models VERSA: A Versatile Evaluation Toolkit for Speech, Audio, and Music

Reference 53

Resolution
unresolved
no resolver link, observed 2026-08-06T23:35:37.473556Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:35:37.473556Z digest=sha256:87a02c81e35661d271edc61bf81155ed8a1bf82f0f2bf9c6736d533da9c9949f

Observation a9101987-efe9-471d-ac91-c6d6b31b1f83 · outbound

This paper cites Libritts: A corpus derived from librispeech for text-to-speech,.

OpusLM: A Family of Open Unified Speech Language Models Libritts: A corpus derived from librispeech for text-to-speech,

Reference 54

Resolution
unresolved
no resolver link, observed 2026-08-06T23:35:37.496340Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:35:37.496340Z digest=sha256:0d4449303d5b5252a0a8f7826aa61e47a34169c88ace93d42c4e0862b04035fc

Observation daa7046c-f4db-4b86-b692-c43c444eba75 · outbound

This paper cites CSTR VCTK Corpus: English Multi-speaker Corpus for CSTR V oice Cloning Toolkit,.

OpusLM: A Family of Open Unified Speech Language Models CSTR VCTK Corpus: English Multi-speaker Corpus for CSTR V oice Cloning Toolkit,

Reference 55

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:35:39.691760Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T23:35:37.500919Z digest=sha256:ec18c2430c0457263b0bdd2cc94f9a0aeed295786540839765e697a32d68069c

Observation 7a57c7ba-333d-4465-bc03-0569157b14cd · outbound

This paper cites GigaSpeech: An Evolving, Multi-Domain ASR Corpus with 10,000 Hours of Transcribed Audio,.

OpusLM: A Family of Open Unified Speech Language Models GigaSpeech: An Evolving, Multi-Domain ASR Corpus with 10,000 Hours of Transcribed Audio,

Reference 56

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:35:39.673426Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T23:35:37.509743Z digest=sha256:9c70bf6f5b9c0c9780eca1a08a84ee1ccea2588f1016270f21aad57b4f5ebd79

Observation 6c9ed181-5e46-4ca3-851f-922926ed02af · outbound

This paper cites Libriheavy: a 50,000 hours asr corpus with punc- tuation casing and context,.

OpusLM: A Family of Open Unified Speech Language Models Libriheavy: a 50,000 hours asr corpus with punc- tuation casing and context,

Reference 57

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:35:39.661422Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T23:35:37.514349Z digest=sha256:0e045180354c8cda6671bdf819654c5c292c18dd46737cd8d921027cd2531be9

Pith citing papers

Observation 9f94f05f-bee1-4862-8945-76bf43178963 · inbound

OpusLM: A Family of Open Unified Speech Language Models cites this paper.

OpusLM: A Family of Open Unified Speech Language Models OpusLM: A Family of Open Unified Speech Language Models

Reference 2

Resolution
malformed identifier
no resolver link, observed 2026-08-06T23:35:35.805367Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:35:35.805367Z digest=sha256:daa60cba515485460e0afd5b4585616971f0aaba948c001830e989e777b71133

Observation f7ac93b2-b13d-4169-bc04-40c1e4174723 · inbound

UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models cites this paper.

UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models OpusLM: A Family of Open Unified Speech Language Models

Reference 53

Resolution
unresolved
no resolver link, observed 2026-08-04T11:29:35.787283Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T11:29:35.787283Z digest=sha256:55850580233e6bb1f808a8f388471f01b9e0e173b2089a6d9ce8029655d31bdc

Observation 2ac87cda-fac0-4a2f-84c8-27f14ebcf149 · inbound

Bagpiper-TTS: Natural Language Guided Universal Speech Synthesis cites this paper.

Bagpiper-TTS: Natural Language Guided Universal Speech Synthesis OpusLM: A Family of Open Unified Speech Language Models

Reference 14

Resolution
verified exact
arxiv_id, observed 2026-07-04T10:19:47.989537Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-06-26T08:54:18.325054Z digest=sha256:c7031ea248392f965b28e0e20c4ba47baef4722a2e2920550997bc581789a4ce

Observation 4e7d6f72-051e-4415-8efb-3bb12206aa9f · inbound

An Efficient vLLM-Based Inference Pipeline for Unified Audio Understanding and Generation cites this paper.

An Efficient vLLM-Based Inference Pipeline for Unified Audio Understanding and Generation OpusLM: A Family of Open Unified Speech Language Models

Reference 11

Resolution
verified exact
arxiv_id, observed 2026-07-03T05:07:38.317151Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-07-03T05:04:23.295592Z digest=sha256:f3193203c0e46e58bc7aa03d0d39ec478a77014d7ecdede955577ebd1f3a14e7