PARCO cuts named-entity errors by large margins (NE-CER 1.57% on AISHELL-1, NE-WER 8.34% on DATA2 at zero distractors) by combining phoneme-enriched entity encoding, a contrastive disambiguation loss, and hierarchical entity filtering.
Multi-modal video summarization based on two-stage fusion of audio, visual, and recognized text information,
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
citation-role summary
background 1
citation-polarity summary
fields
cs.CL 1years
2025 1verdicts
CONDITIONAL 1roles
background 1polarities
background 1representative citing papers
citing papers explorer
-
PARCO: Phoneme-Augmented Robust Contextual ASR via Contrastive Entity Disambiguation
PARCO cuts named-entity errors by large margins (NE-CER 1.57% on AISHELL-1, NE-WER 8.34% on DATA2 at zero distractors) by combining phoneme-enriched entity encoding, a contrastive disambiguation loss, and hierarchical entity filtering.