Pith. sign in

CMT-LLM: Contextual Multi-Talker ASR Utilizing Large Language Models

1 Pith paper cite this work. Polarity classification is still indexing.

1 Pith paper citing it
abstract

In real-world applications, automatic speech recognition (ASR) systems must handle overlapping speech from multiple speakers and recognize rare words like technical terms. Traditional methods address multi-talker ASR and contextual biasing separately, limiting performance in complex scenarios. We propose a unified framework that combines multi-talker overlapping speech recognition and contextual biasing into a single task. Our ASR method integrates pretrained speech encoders and large language models (LLMs), using optimized finetuning strategies. We also introduce a two-stage filtering algorithm to efficiently identify relevant rare words from large biasing lists and incorporate them into the LLM's prompt input, enhancing rare word recognition. Experiments show that our approach outperforms traditional contextual biasing methods, achieving a WER of 7.9% on LibriMix and 32.9% on AMI SDM when the biasing size is 1,000, demonstrating its effectiveness in complex speech scenarios.

fields

eess.AS 1

years

2025 1

verdicts

CONDITIONAL 1

representative citing papers

citing papers explorer

Showing 1 of 1 citing paper.

  • CMT-LLM: Contextual Multi-Talker ASR Utilizing Large Language Models eess.AS · 2025-05-31 · conditional · none · ref 2 · internal anchor

    An LLM-based ASR system that jointly performs overlapping-speech recognition and rare-word biasing, with a CTC-stage filter that trims large biasing lists, beats the tested baselines on LibriMix and AMI.