Pith. sign in

Paper Citation Record · LEDGER

SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models

As of 21 August 2026, this Paper Citation Record lists 55 of 55 outbound references and 0 inbound Pith citation observations for arXiv:2607.05365.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2607.05365 v1

Coverage vector

measured 55 of 55 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-07-07T14:53:07.512543Z

measured 55 of 55 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-20T06:33:59.587034+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

55 of 55 outbound references displayed

  • verified exact21
  • verified fuzzy30
  • unresolved0
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch4

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation dc7450df-764d-4b75-a05a-f4c73542b24b · outbound

This paper cites Large language models: a survey of their development, capabilities, and applications.

SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models Large language models: a survey of their development, capabilities, and applications

Reference 1

Resolution
verified fuzzy
raw_fallback, observed 2026-07-07T14:53:55.903780Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-07-07T14:53:07.512543Z digest=sha256:234c6765b8532e2766750b8b97157e09f6e5fcd62f12a68e97d710aaca189e2f

Observation c0214adf-85b2-4627-8455-f5efab4214b6 · outbound

This paper cites On The Landscape of Spoken Language Models: A Comprehensive Survey.

SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models On The Landscape of Spoken Language Models: A Comprehensive Survey

Reference 2

Resolution
verified exact
local_arxiv, observed 2026-07-07T14:53:55.732536Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-07-07T14:53:07.512543Z digest=sha256:7b32fd38848c96f78a3e8d914f57ccc4648864782ebe27bb226e3da22179882d

Observation 427e98d8-9ab9-4078-a8d8-bb828dbff0cf · outbound

This paper cites A full-duplex speech dialogue scheme based on large language model,.

SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models A full-duplex speech dialogue scheme based on large language model,

Reference 3

Resolution
verified fuzzy
raw_fallback, observed 2026-07-07T14:53:55.912115Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-07-07T14:53:07.512543Z digest=sha256:e523c9cab65e7595c81a9b630927377a2ea3c1191c169154ff1f948d8f9bd8d2

Observation 3c52f983-cf20-40c2-8b83-86ae60aaa1d8 · outbound

This paper cites Human conversational behavior,.

SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models Human conversational behavior,

Reference 4

Resolution
verified fuzzy
raw_fallback, observed 2026-07-07T14:53:55.936847Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-07-07T14:53:07.512543Z digest=sha256:f60828bd9f11b925de1b9ff2cb1dfbba8b61e5f530b860366dd33426f1c10b42

Observation f059b1cd-71b6-457b-98ae-4e4e97b2114f · outbound

This paper cites 6 conversation analytic approaches to the relevance and uses of relationship categories in interaction,.

SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models 6 conversation analytic approaches to the relevance and uses of relationship categories in interaction,

Reference 5

Resolution
verified fuzzy
raw_fallback, observed 2026-07-07T14:53:55.910160Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-07-07T14:53:07.512543Z digest=sha256:dc38da5cc2f27239b7760b1d460ec5dfd39b7386eb6ba830df46f53f72f6abea

Observation 433d7776-909d-433f-87ed-3cbac7bbcdd1 · outbound

This paper cites τ-voice: Benchmarking full-duplex voice agents on real-world domains.

SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models τ-voice: Benchmarking full-duplex voice agents on real-world domains

Reference 6

Resolution
verified exact
arxiv_id, observed 2026-07-07T14:53:55.778510Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-07-07T14:53:07.512543Z digest=sha256:e5e29eb85b7475c470f9c89130301c2d42741a3f30c6a9c6d36275dc0ec0fe47

Observation 6e032512-eb4d-4e5c-b6e0-4afe4a7c4b3c · outbound

This paper cites Wildspeech-bench: Benchmarking end-to-end speechllms in the wild.

SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models Wildspeech-bench: Benchmarking end-to-end speechllms in the wild

Reference 7

Resolution
verified exact
arxiv_id, observed 2026-07-07T14:53:55.751211Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-07-07T14:53:07.512543Z digest=sha256:71d41eb24e4a81e3cc377866f5c4512e03c25fc656738c3a494e6e33a5bcb097

Observation 53d58aa6-b453-4969-a737-34720ed263dd · outbound

This paper cites Full-duplex-bench v1. 5: Evaluating overlap handling for full-duplex speech models,.

SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models Full-duplex-bench v1. 5: Evaluating overlap handling for full-duplex speech models,

Reference 8

Resolution
verified fuzzy
raw_fallback, observed 2026-07-07T14:53:55.908186Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-07-07T14:53:07.512543Z digest=sha256:e51f9eec3b432de4c411de717079dbc94196459676bff290574cc0054701c870

Observation 773c2f82-c687-45cb-bfac-10ecfa0f2a43 · outbound

This paper cites Seamless Interaction: Dyadic Audiovisual Motion Modeling and Large-Scale Dataset.

SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models Seamless Interaction: Dyadic Audiovisual Motion Modeling and Large-Scale Dataset

Reference 9

Resolution
verified exact
local_arxiv, observed 2026-07-07T14:53:55.735818Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-07-07T14:53:07.512543Z digest=sha256:93fa7579ca7da40f3c2c6b0ac7bc41079f265c1070fa651aa2150aeddac5e03e

Observation 958289ae-5a6d-414d-a0a9-a99bbd810356 · outbound

This paper cites TRACE: Temporal Relationship-Aware Conversational Entrainment Detection in Dyadic Speech.

SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models TRACE: Temporal Relationship-Aware Conversational Entrainment Detection in Dyadic Speech

Reference 10

Resolution
verified exact
local_arxiv, observed 2026-07-07T14:53:55.784312Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-07-07T14:53:07.512543Z digest=sha256:c4958e357d88250e2197973f550c198002ba90f5029a97f129a2059f7273e2ed

Observation 20d93fba-99d0-44ec-882d-0df67967d16a · outbound

This paper cites The embedded deformation problem for monomial ideals.

SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models The embedded deformation problem for monomial ideals

Reference 11

Resolution
metadata mismatch
local_arxiv, observed 2026-07-07T14:53:55.775591Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-07-07T14:53:07.512543Z digest=sha256:733edbc0e6f63474c5c85571b662e57541043c522e9ee0b2b4b937edae65ff18

Observation 6145d9e5-6b24-4931-af5b-6192f990cacd · outbound

This paper cites TurnNat: Automatic Evaluation of Turn-Taking Naturalness in Dyadic Spoken Dialogue.

SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models TurnNat: Automatic Evaluation of Turn-Taking Naturalness in Dyadic Spoken Dialogue

Reference 12

Resolution
verified exact
local_arxiv, observed 2026-07-07T14:53:55.744939Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-07-07T14:53:07.512543Z digest=sha256:7a6b8dfdf4932211b997fc0a498821e0186e8f8a911ab62ca2117b92d74ba734

Observation 246f4cc5-1e1a-46d1-9a95-d50bd62fcb29 · outbound

This paper cites Vox-Profile: A Speech Foundation Model Benchmark for Characterizing Diverse Speaker and Speech Traits.

SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models Vox-Profile: A Speech Foundation Model Benchmark for Characterizing Diverse Speaker and Speech Traits

Reference 13

Resolution
verified exact
local_arxiv, observed 2026-07-07T14:53:55.757166Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-07-07T14:53:07.512543Z digest=sha256:c083c6b466c514fa71b2266c013abf30dfaf29194aa589196830cccc5015608f

Observation 14813de2-cbdc-4dbe-bd0d-51dbad3be517 · outbound

This paper cites V oxlect: A speech foundation model benchmark for modeling dialects and regional languages around the globe,.

SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models V oxlect: A speech foundation model benchmark for modeling dialects and regional languages around the globe,

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-07-07T14:53:55.925345Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-07-07T14:53:07.512543Z digest=sha256:b271324dcf414f8e8e35368f8b5ef340d9fe34bc098d2db9d1f1dcaa8f7d032d

Observation bacf8d78-19bc-4613-8e4d-05e873f6dd5f · outbound

This paper cites Reference-based prosody and rhythm evaluation for spoken dialogue systems,.

SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models Reference-based prosody and rhythm evaluation for spoken dialogue systems,

Reference 15

Resolution
verified fuzzy
raw_fallback, observed 2026-07-07T14:53:55.935018Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-07-07T14:53:07.512543Z digest=sha256:f263520087cbacf84c01224dd7f5ffe771f0c5b2569c3c97cd764cbcdc19a699

Observation 2a3ba648-7f3d-461d-8de8-5a2e3c0b2b57 · outbound

This paper cites Gpt-4 technical report,.

SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models Gpt-4 technical report,

Reference 16

Resolution
verified fuzzy
raw_fallback, observed 2026-07-07T14:53:55.917785Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-07-07T14:53:07.512543Z digest=sha256:fcde613a7544757a2a9e74688b8f9e8469178ad449912287d7bd209e5fb6ca6c

Observation 37c4a746-c714-4e72-b644-0e91bdc7d1e9 · outbound

This paper cites Qwen3-Omni Technical Report.

SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models Qwen3-Omni Technical Report

Reference 17

Resolution
verified exact
local_arxiv, observed 2026-07-07T14:53:55.781561Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-07-07T14:53:07.512543Z digest=sha256:363a6513f016d2b539576f0cdd942294c8ec278d424544a8a04b2afa30341b78

Observation 1f68a723-5ecc-486a-8b52-c87389211192 · outbound

This paper cites Gemini: A Family of Highly Capable Multimodal Models.

SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models Gemini: A Family of Highly Capable Multimodal Models

Reference 18

Resolution
verified exact
local_arxiv, observed 2026-07-07T14:53:55.765795Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-07-07T14:53:07.512543Z digest=sha256:42fa403b212dfde82a27909346115a262b5ef0e61d8fe0efc3491cb2201127b1

Observation e6451e05-4307-47ec-9477-f9e7730f820b · outbound

This paper cites SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models.

SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models

Reference 19

Resolution
verified exact
local_arxiv, observed 2026-07-07T14:53:55.721428Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-07-07T14:53:07.512543Z digest=sha256:51ca19713d67aae7c64e9395a9902aa3c850b71ff112ab70ceeab989e2fd8220

Observation 68ee057e-8f93-4c68-8492-a4431557e16e · outbound

This paper cites Whisper-AT: Noise-Robust Automatic Speech Recognizers are Also Strong General Audio Event Taggers.

SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models Whisper-AT: Noise-Robust Automatic Speech Recognizers are Also Strong General Audio Event Taggers

Reference 20

Resolution
verified exact
local_arxiv, observed 2026-07-07T14:53:55.739204Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-07-07T14:53:07.512543Z digest=sha256:3890b4f587bf6b0b1455ab1565df8882a9d41c4838f3d763a9c2cdafcff3a18c

Observation 1b25f448-0516-4ce6-9eb5-5b22cf2f06ad · outbound

This paper cites Qwen3-ASR Technical Report.

SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models Qwen3-ASR Technical Report

Reference 21

Resolution
verified exact
local_arxiv, observed 2026-07-07T14:53:55.768753Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-07-07T14:53:07.512543Z digest=sha256:a92c6aeb4515e1d3a624c759f7bdb364b5c8e49a3942d4c036539c01eee10431

Observation e4a0d144-2bc2-425e-a32b-fcc7328db780 · outbound

This paper cites Hubert: Self-supervised speech representation learning by masked prediction of hidden units.

SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models Hubert: Self-supervised speech representation learning by masked prediction of hidden units

Reference 22

Resolution
verified fuzzy
raw_fallback, observed 2026-07-07T14:53:55.931192Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-07-07T14:53:07.512543Z digest=sha256:2d403ede54fa66ab6ac9e7348e3ae461022b07e8f4f574a4a772ac0bdbbac415

Observation ebc32acf-4467-4bf3-9e49-bd6764b6407b · outbound

This paper cites wav2vec 2.0: A Framework for Self-Supervised Learning of Speech Representations.

SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models wav2vec 2.0: A Framework for Self-Supervised Learning of Speech Representations

Reference 23

Resolution
metadata mismatch
local_arxiv, observed 2026-07-07T14:53:55.742174Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-07-07T14:53:07.512543Z digest=sha256:9055658ed9a45a59b1a5b4cfa2e818f354c192f5b277e9ee0e738776f5ba7dc0

Observation 6523c40a-596a-4e69-acc8-8482fa6de632 · outbound

This paper cites Wavlm: Large-scale self-supervised pre- training for full stack speech processing.

SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models Wavlm: Large-scale self-supervised pre- training for full stack speech processing

Reference 24

Resolution
verified fuzzy
raw_fallback, observed 2026-07-07T14:53:55.919746Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-07-07T14:53:07.512543Z digest=sha256:66cef17668904a403d6921aaae9e305f4f09ca789c21e1e2b6cbcf321863c4c4

Observation 6e4c7289-d80d-4a0b-906f-af201dded00d · outbound

This paper cites WavLLM: Towards Robust and Adaptive Speech Large Language Model.

SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models WavLLM: Towards Robust and Adaptive Speech Large Language Model

Reference 25

Resolution
metadata mismatch
local_arxiv, observed 2026-07-07T14:53:55.789976Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-07-07T14:53:07.512543Z digest=sha256:e8efdd1098e75e0e8baad2f1ee8b005922e3371a00ed338024ec16df0a98582f

Observation 5cee6b7c-d768-438a-b8c4-e136211ac1bd · outbound

This paper cites Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models.

SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models

Reference 26

Resolution
verified exact
local_arxiv, observed 2026-07-07T14:53:55.725759Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-07-07T14:53:07.512543Z digest=sha256:3fed19e550b96ff4b691282e65989cc551d7f3023ca2c6ecb9e9da1726a9a815

Observation 2af54508-abda-4e58-9ccc-cea4c3721ea5 · outbound

This paper cites gpt-audio-1.5,.

SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models gpt-audio-1.5,

Reference 27

Resolution
verified fuzzy
raw_fallback, observed 2026-07-07T14:53:55.953866Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-07-07T14:53:07.512543Z digest=sha256:fd8f249ce82886812da185e5535f8aa0741157b2a24246dab35669c9c3ccb899

Observation f8cfa9fe-64d6-45b9-b037-949d80bc8d77 · outbound

This paper cites Qwen2.5-Omni Technical Report.

SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models Qwen2.5-Omni Technical Report

Reference 28

Resolution
verified exact
local_arxiv, observed 2026-07-07T14:53:55.787189Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-07-07T14:53:07.512543Z digest=sha256:ca24f53923f1d7a9e648ae15b83002914e4275488ddd0f2917025726850e210a

Observation 6875b2f9-7546-44c0-b64c-2ce42d4095d1 · outbound

This paper cites gpt-realtime-2,.

SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models gpt-realtime-2,

Reference 29

Resolution
verified fuzzy
raw_fallback, observed 2026-07-07T14:53:55.923464Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-07-07T14:53:07.512543Z digest=sha256:8a424868259c046c36282d9f5ce35cfea450c2dfa157e5d223292da158c1b623

Observation 45f5a163-01fb-4a37-9d1c-a3b040895e44 · outbound

This paper cites Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities.

SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities

Reference 30

Resolution
verified exact
local_arxiv, observed 2026-07-07T14:53:55.747819Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-07-07T14:53:07.512543Z digest=sha256:4d71e48f7a2575af8d090468b7e81e2eba3d5f1d2abae4fbdbbfa1ac9f877460

Observation 2ef3b95b-e22e-4b52-b992-09178b36372c · outbound

This paper cites gemini-3.1-flash-live-preview,.

SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models gemini-3.1-flash-live-preview,

Reference 31

Resolution
verified fuzzy
raw_fallback, observed 2026-07-07T14:53:55.906037Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-07-07T14:53:07.512543Z digest=sha256:a4288b0c0d2c40c38c566ba200f850f4f1a5938cdd5f8b7708ec2c6516a95ccb

Observation 672dc707-08c5-4bf4-879a-e306953c57e0 · outbound

This paper cites Available: https://ai.google.dev/gemini-api/docs/models/ gemini-3.1-flash-live-preview.

SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models Available: https://ai.google.dev/gemini-api/docs/models/ gemini-3.1-flash-live-preview

Reference 32

Resolution
verified fuzzy
raw_fallback, observed 2026-07-07T14:53:55.946630Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-07-07T14:53:07.512543Z digest=sha256:e4473f0021946e0068ae8a8e03e2da78d7bd5560c712c786eba271f773ad3c89

Observation 833cd489-af27-4686-a29a-c5550f69ea82 · outbound

This paper cites Mini-Omni: Language Models Can Hear, Talk While Thinking in Streaming.

SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models Mini-Omni: Language Models Can Hear, Talk While Thinking in Streaming

Reference 33

Resolution
verified exact
local_arxiv, observed 2026-07-07T14:53:55.792681Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-07-07T14:53:07.512543Z digest=sha256:396f59dbd6df10666e010a03a4b3077cb2112ee330972516ba48df45c49f1070

Observation 3f0d91e3-f456-4abc-988f-0eb5097149a9 · outbound

This paper cites Couper-Kuhlen and M.

SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models Couper-Kuhlen and M

Reference 34

Resolution
verified fuzzy
raw_fallback, observed 2026-07-07T14:53:55.952210Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-07-07T14:53:07.512543Z digest=sha256:10e32a8d577f8e74c9a1f8c64f37c8d4d34c0113445ecc030180784d7fb47f1f

Observation 7de617d4-6af4-465b-9871-cb130e888db0 · outbound

This paper cites Phonetics and prosody in conversation,.

SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models Phonetics and prosody in conversation,

Reference 35

Resolution
verified fuzzy
raw_fallback, observed 2026-07-07T14:53:55.914007Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-07-07T14:53:07.512543Z digest=sha256:6d6d5e4b7a47c0cfb709de3367b562bb717db1b99a5bdc3155c08d23ffb4a7aa

Observation 3ef9f11a-b666-45b0-8a15-289f9e09dd15 · outbound

This paper cites Classifying conversational entrainment of speech behavior: An expanded framework and review,.

SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models Classifying conversational entrainment of speech behavior: An expanded framework and review,

Reference 36

Resolution
verified fuzzy
raw_fallback, observed 2026-07-07T14:53:55.933124Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-07-07T14:53:07.512543Z digest=sha256:fffd815788a4c592d571ae30fc053bebddafb3cd137e527442a872ebedb2a6da

Observation 6c539f27-3f84-48e2-b3b9-902682b1394e · outbound

This paper cites A cross-linguistic analysis of the temporal dynamics of turn-taking cues using machine learning as a descriptive tool,.

SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models A cross-linguistic analysis of the temporal dynamics of turn-taking cues using machine learning as a descriptive tool,

Reference 37

Resolution
verified fuzzy
raw_fallback, observed 2026-07-07T14:53:55.942604Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-07-07T14:53:07.512543Z digest=sha256:923946504adeba14d8676ed73e9d22b9b357f2b5da6be3a8f5d70e31a3e34e0e

Observation b178f409-8385-43b5-bf6b-4cb8bd75f504 · outbound

This paper cites Real-time changes to social dynamics in human-robot turn-taking,.

SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models Real-time changes to social dynamics in human-robot turn-taking,

Reference 38

Resolution
verified fuzzy
raw_fallback, observed 2026-07-07T14:53:55.938750Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-07-07T14:53:07.512543Z digest=sha256:c53e9389f043017c2772dbfd77880b45cbe00b0c685f0440785025ac757f1b04

Observation 2a5d849a-7bfb-46ab-a75d-972749ffa3a9 · outbound

This paper cites Talking Turns: Benchmarking Audio Foundation Models on Turn-Taking Dynamics.

SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models Talking Turns: Benchmarking Audio Foundation Models on Turn-Taking Dynamics

Reference 39

Resolution
verified exact
local_arxiv, observed 2026-07-07T14:53:55.795345Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-07-07T14:53:07.512543Z digest=sha256:2777a3b3f3ce683eb7387c4fb0af0c400d931389317b502ff28d8a58ed1388ea

Observation 58a2debd-d7d6-4ee8-a37d-569b059d42b7 · outbound

This paper cites UTMOS: UTokyo-SaruLab System for VoiceMOS Challenge 2022.

SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models UTMOS: UTokyo-SaruLab System for VoiceMOS Challenge 2022

Reference 40

Resolution
verified exact
local_arxiv, observed 2026-07-07T14:53:55.729253Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-07-07T14:53:07.512543Z digest=sha256:963ccb9600b374b67fd3aed79172986d92b8a7513b1b572198b4b58e99534c6c

Observation 7963645b-9cd7-4068-b5d1-df5bcd427f8c · outbound

This paper cites SUPERB: Speech processing Universal PERformance Benchmark.

SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models SUPERB: Speech processing Universal PERformance Benchmark

Reference 41

Resolution
metadata mismatch
local_arxiv, observed 2026-07-07T14:53:55.763035Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-07-07T14:53:07.512543Z digest=sha256:58ca9547a3cb2b8b1a87326c9a8803a287fffe2ab67d59679951013106942df6

Observation 72874aac-fc2e-4d92-a913-36525bedd6ec · outbound

This paper cites Wildbench: Benchmarking llms with chal- lenging tasks from real users in the wild,.

SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models Wildbench: Benchmarking llms with chal- lenging tasks from real users in the wild,

Reference 42

Resolution
verified fuzzy
raw_fallback, observed 2026-07-07T14:53:55.899239Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-07-07T14:53:07.512543Z digest=sha256:fc938a52204999bd31a1125cd1a7776e67dce52a05c7d3bac5f94106af65addc

Observation df14cba5-6600-43aa-8d0a-03da7266391e · outbound

This paper cites Mt-bench-101: A fine-grained benchmark for evaluat- ing large language models in multi-turn dialogues,.

SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models Mt-bench-101: A fine-grained benchmark for evaluat- ing large language models in multi-turn dialogues,

Reference 43

Resolution
verified fuzzy
raw_fallback, observed 2026-07-07T14:53:55.944519Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-07-07T14:53:07.512543Z digest=sha256:16deb66d5c7193a0870c6fd6b5bb4335dd02aca347ca42def6c7a76c6a1446fc

Observation 3fd36e6a-1423-48c6-be2f-d35fc0a42f88 · outbound

This paper cites Air-bench: Benchmarking large audio-language models via generative comprehension.

SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models Air-bench: Benchmarking large audio-language models via generative comprehension

Reference 44

Resolution
verified fuzzy
raw_fallback, observed 2026-07-07T14:53:55.897127Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-07-07T14:53:07.512543Z digest=sha256:f4301981ef9cea4a64b4a2a866b49b0ccfb0d0d31a46611fe24d81f59f4a2ffd

Observation eb11fc14-eb85-4ad7-9e72-e1cd047fd8f4 · outbound

This paper cites GlobeAudio: A Multilingual Multicultural Benchmark for Naturalistic Evaluation of Large Audio-Language Models.

SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models GlobeAudio: A Multilingual Multicultural Benchmark for Naturalistic Evaluation of Large Audio-Language Models

Reference 45

Resolution
verified exact
local_arxiv, observed 2026-07-07T14:53:55.798196Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-07-07T14:53:07.512543Z digest=sha256:e6ffeb18794da4b7f0e7bb8d02f5786949e3eb2cbfb29805460a1a4aafb4b332

Observation 95d45456-7a28-49fb-8a71-4bc749c5846a · outbound

This paper cites A systematic survey and critical review on evaluating large language models: Challenges, limitations, and recommendations,.

SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models A systematic survey and critical review on evaluating large language models: Challenges, limitations, and recommendations,

Reference 46

Resolution
verified fuzzy
raw_fallback, observed 2026-07-07T14:53:55.948517Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-07-07T14:53:07.512543Z digest=sha256:82778794e8a4f767251ed4d70275079affdde8876f2c4bb32fb7ef82ec0cafbe

Observation 19bc96f1-8ff8-4314-8945-1e6bd1df7318 · outbound

This paper cites Flexi: Benchmarking full-duplex human-llm speech interaction.

SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models Flexi: Benchmarking full-duplex human-llm speech interaction

Reference 47

Resolution
verified exact
arxiv_id, observed 2026-07-07T14:53:55.772890Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-07-07T14:53:07.512543Z digest=sha256:8e19274e7461fdf441a9cedc9f6503347b2a0b4cebc679c201b7af82110c94bc

Observation 22847e6f-472d-47e5-ba87-f613595d12f8 · outbound

This paper cites Speech to Speech AI Model & Provider Leaderboard,.

SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models Speech to Speech AI Model & Provider Leaderboard,

Reference 48

Resolution
verified fuzzy
raw_fallback, observed 2026-07-07T14:53:55.901621Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-07-07T14:53:07.512543Z digest=sha256:c49533227e433e4d03d0f3fc772ea5ad47642689f1940666c5a4d323bbd39059

Observation c171b547-75ff-440c-9627-1f245b46f0ea · outbound

This paper cites Speech Arena Leaderboard,.

SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models Speech Arena Leaderboard,

Reference 49

Resolution
verified fuzzy
raw_fallback, observed 2026-07-07T14:53:55.950560Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-07-07T14:53:07.512543Z digest=sha256:f74eccf78de45c235179cf4c017d4bb5b4e7490acb4becc89f4be1f5369f87e4

Observation 4896ad97-aefb-460b-95fc-6f5c3b7af505 · outbound

This paper cites Methodology — V oice Arena TTS Leaderboard,.

SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models Methodology — V oice Arena TTS Leaderboard,

Reference 50

Resolution
verified fuzzy
raw_fallback, observed 2026-07-07T14:53:55.927225Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-07-07T14:53:07.512543Z digest=sha256:e12b9a70fe79fbd0dff775e542f123657b015f383310ae34726d8e09e93ea144

Observation a5bc260d-d5cf-4da2-bf96-6f608301c6a2 · outbound

This paper cites Robust speech recognition via large-scale weak supervi- sion.

SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models Robust speech recognition via large-scale weak supervi- sion

Reference 51

Resolution
verified fuzzy
raw_fallback, observed 2026-07-07T14:53:55.921760Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-07-07T14:53:07.512543Z digest=sha256:8d7776b5d40871b272330b7148fc7c710be3e17b7009c75164564bdddf2743c2

Observation e4d3f6f8-6931-484c-9920-270b1c54a3b3 · outbound

This paper cites Silero vad: pre-trained enterprise-grade voice activity detec- tor (vad), number detector and language classifier.

SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models Silero vad: pre-trained enterprise-grade voice activity detec- tor (vad), number detector and language classifier

Reference 52

Resolution
verified fuzzy
raw_fallback, observed 2026-07-07T14:53:55.929150Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-07-07T14:53:07.512543Z digest=sha256:c8e34421a0dc01d98da41ff94dc65d3b07e50435fd2ec734f9a77a912e43ee30

Observation 7c7bcfee-af00-4e22-89d1-41686b8569ba · outbound

This paper cites Scaling speech technology to 1,000+ languages,.

SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models Scaling speech technology to 1,000+ languages,

Reference 53

Resolution
verified fuzzy
raw_fallback, observed 2026-07-07T14:53:55.915901Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-07-07T14:53:07.512543Z digest=sha256:47047225014615422a805f457042d84b75b31a665cd1333a8f4f9c5a2b438d18

Observation 190783a9-186b-4d73-866f-6a86eab5e424 · outbound

This paper cites Fleurs: Few-shot learning evaluation of universal representations of speech.

SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models Fleurs: Few-shot learning evaluation of universal representations of speech

Reference 54

Resolution
verified fuzzy
raw_fallback, observed 2026-07-07T14:53:55.940618Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-07-07T14:53:07.512543Z digest=sha256:7f29b41d34f34567acbede748b2bb5f1907e15a146d081637d9874f26fa73278

Observation e4a23d02-3103-45fa-b218-a91b57672ee8 · outbound

This paper cites Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks.

SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks

Reference 55

Resolution
verified exact
local_arxiv, observed 2026-07-07T14:53:55.760237Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-07-07T14:53:07.512543Z digest=sha256:d35b0690b5cda4aa1be3ada6f6cbb2289669b8894fc7b6fdd63f6ff4e77ff243

Pith citing papers

No inbound Pith citation observations are available.