Pith. sign in

Paper Citation Record · LEDGER

S2SBench: A Benchmark for Quantifying Intelligence Degradation in Speech-to-Speech Large Language Models

As of 8 August 2026, this Paper Citation Record lists 13 of 13 outbound references and 1 inbound Pith citation observation for arXiv:2505.14438.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2505.14438 v1

Coverage vector

measured 13 of 13 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-07T15:38:38.037256Z

measured 14 of 14 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-08T06:32:00.761636+00:00

measured 1 of 1 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-01T07:12:17.845741Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

13 of 13 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved13
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 3213cf7d-783c-4901-a0b7-31d4ee3c087c · outbound

This paper cites Moshi: a speech-text foundation model for real-time dialogue.

S2SBench: A Benchmark for Quantifying Intelligence Degradation in Speech-to-Speech Large Language Models Moshi: a speech-text foundation model for real-time dialogue

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-07T15:38:36.810867Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:38:36.810867Z digest=sha256:6bf163bd957c81079ef1675282a600a751215b3c340ced4da2a6397d6b368eba

Observation 507fb53f-1c52-4fb5-81b3-7edc9f0ec53b · outbound

This paper cites LLaMA-Omni: Seamless Speech Interaction with Large Language Models.

S2SBench: A Benchmark for Quantifying Intelligence Degradation in Speech-to-Speech Large Language Models LLaMA-Omni: Seamless Speech Interaction with Large Language Models

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-07T15:38:36.938679Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:38:36.938679Z digest=sha256:7148e46752ebde6283db95eb18b007de81772de835f64231354cb4a491130fb7

Observation 93c89ea9-8d31-4ec7-a4ef-826470f1eab9 · outbound

This paper cites CMMLU: Measuring massive multitask language understanding in Chinese.

S2SBench: A Benchmark for Quantifying Intelligence Degradation in Speech-to-Speech Large Language Models CMMLU: Measuring massive multitask language understanding in Chinese

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-07T15:38:37.106067Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:38:37.106067Z digest=sha256:32602a05b6078a451d78bc92200b699c851601a3dac1f8725ed4b6bf3408125d

Observation 3fe741c6-d071-41b1-9000-f47f5998c79a · outbound

This paper cites Baichuan-Audio: A Unified Framework for End-to-End Speech Interaction.

S2SBench: A Benchmark for Quantifying Intelligence Degradation in Speech-to-Speech Large Language Models Baichuan-Audio: A Unified Framework for End-to-End Speech Interaction

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-07T15:38:37.251024Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:38:37.251024Z digest=sha256:0f656d0c66b5e7150fb72682156a8bcb474c7ef0a123c0f905e805d8aff685bf

Observation c357c432-2126-4bdf-96cc-8bd74c059147 · outbound

This paper cites arXiv preprint arXiv:2410.08565, 3(7).

S2SBench: A Benchmark for Quantifying Intelligence Degradation in Speech-to-Speech Large Language Models arXiv preprint arXiv:2410.08565, 3(7)

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-07T15:38:37.377467Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:38:37.377467Z digest=sha256:c22c3c9aeaff76d0ecf4364d302992a590ddfc1dc93385624b8f080ec9537c87

Observation 2d67f1ad-f1b1-4df9-9161-fdfc34304504 · outbound

This paper cites Video-LLaVA: Learning United Visual Representation by Alignment Before Projection.

S2SBench: A Benchmark for Quantifying Intelligence Degradation in Speech-to-Speech Large Language Models Video-LLaVA: Learning United Visual Representation by Alignment Before Projection

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-07T15:38:37.460005Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:38:37.460005Z digest=sha256:08c532f65465d2f37b0d4e7ccaaa9a96bdef211ebc26e20ebbe242345254edff

Observation 3a11c5e6-f77b-451c-aef3-26e810aafb47 · outbound

This paper cites Qwen2.5 Technical Report.

S2SBench: A Benchmark for Quantifying Intelligence Degradation in Speech-to-Speech Large Language Models Qwen2.5 Technical Report

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-07T15:38:37.597535Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:38:37.597535Z digest=sha256:351225b26aa08d72fef3122b53dad963c35c11e94e98cac2bdd73812ecc1467f

Observation 1847bc0e-6b6c-46ae-b58f-46a59b596cdb · outbound

This paper cites MiniCPM-V: A GPT-4V Level MLLM on Your Phone.

S2SBench: A Benchmark for Quantifying Intelligence Degradation in Speech-to-Speech Large Language Models MiniCPM-V: A GPT-4V Level MLLM on Your Phone

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-07T15:38:37.759717Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:38:37.759717Z digest=sha256:f47cee6ca5f19ffc3c139878fdc550b0efcc08e31d337928858474391725533b

Observation c030018a-e74c-41e5-9bd8-e5fe1bfa002f · outbound

This paper cites SALMONN-omni: A Codec-free LLM for Full-duplex Speech Understanding and Generation.

S2SBench: A Benchmark for Quantifying Intelligence Degradation in Speech-to-Speech Large Language Models SALMONN-omni: A Codec-free LLM for Full-duplex Speech Understanding and Generation

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-07T15:38:37.904851Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:38:37.904851Z digest=sha256:61d77c227c22ecc3beda343ed73b585f9241766549666a395219bdbdeb4ea34f

Observation 72888da8-50f9-4add-9bb4-6f751b1f8573 · outbound

This paper cites GLM-4-Voice: Towards Intelligent and Human-Like End-to-End Spoken Chatbot.

S2SBench: A Benchmark for Quantifying Intelligence Degradation in Speech-to-Speech Large Language Models GLM-4-Voice: Towards Intelligent and Human-Like End-to-End Spoken Chatbot

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-07T15:38:38.037256Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:38:38.037256Z digest=sha256:395ad6f26bbf7fe5d326771e2a2329ac90e46130d7b6d879421555f7e8b21af1

Observation 2565e616-6a06-46cb-a16f-6710b9e6830b · outbound

This paper cites GPT-4 Technical Report.

S2SBench: A Benchmark for Quantifying Intelligence Degradation in Speech-to-Speech Large Language Models GPT-4 Technical Report

Reference 2023

Resolution
unresolved
no resolver link, observed 2026-08-07T15:38:36.517629Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:38:36.517629Z digest=sha256:92428893615dbdda9a2919a3666d296ba8f33691b0698fecdaa3ee68a3ae89eb

Observation 692ab65b-9305-455a-ad14-67ae6b376ef5 · outbound

This paper cites Qwen2-Audio Technical Report.

S2SBench: A Benchmark for Quantifying Intelligence Degradation in Speech-to-Speech Large Language Models Qwen2-Audio Technical Report

Reference 2024

Resolution
unresolved
no resolver link, observed 2026-08-07T15:38:36.638097Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:38:36.638097Z digest=sha256:c11ba245e1ef7fbf20ff187cf355b7cee80f9edb04305bd779c10547916afd78

Observation 679aa329-f2a4-4154-838a-1f7a5350dc2f · outbound

This paper cites VITA-1.5: Towards GPT-4o Level Real-Time Vision and Speech Interaction.

S2SBench: A Benchmark for Quantifying Intelligence Degradation in Speech-to-Speech Large Language Models VITA-1.5: Towards GPT-4o Level Real-Time Vision and Speech Interaction

Reference 2025

Resolution
unresolved
no resolver link, observed 2026-08-07T15:38:37.006815Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:38:37.006815Z digest=sha256:755b0ee1cbd440c48ee1e3d123e6cc55c8a38db1c4289bb22f8c85f4d4088aae

Pith citing papers

Observation 6d26307d-677b-447f-b4c8-743580ef4d4f · inbound

X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment cites this paper.

X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment S2SBench: A Benchmark for Quantifying Intelligence Degradation in Speech-to-Speech Large Language Models

Reference 205

Resolution
unresolved
no resolver link, observed 2026-08-01T07:12:17.845741Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-01T07:12:17.845741Z digest=sha256:8af5472c23280d489398ea99ff95dab9eb8fdbf9120e1baf6921bf37bdc66c9b