
【导语在 ASR 模型面临多人同时讲话场景难题时小米开源了 CocktailASR - 1 模型。它采用目标说话人语音识别技术在多场景测试中表现出色还具备负样本拒识和思维链推理等特性意义重大。】创新思路从根本改变 ASR 任务输入人类听觉能轻松从嘈杂人群中剥离人声但 ASR 模型在多人同时讲话场景难题待解。小米的 CocktailASR - 1 没有做“更好的降噪”而是从根本上改变任务的输入采用目标说话人语音识别先给模型参考音频定位目标说话人再让其只转录该人的语音过滤其他人说话内容、混响和背景噪音。端到端架构单模型搞定多场景CocktailASR - 1 是端到端 LLM 架构即 D2V2 音频编码器 - Adapter - LLM 解码所有权重放在一个 checkpoint 里。输入格式是参考音频和目标音频拼接中间插一秒静音分隔为 16kHz 单声道。它无需针对不同场景切换模型单人或多人场景都能应对。测试领先精度远超同赛道竞品基准测试结果显示CocktailASR - 1 表现优异。在多说话人模拟测试中LibriMix 2mix 的 WER 只有 4.11%LibriSpeechMix 2mix 更是低至 2.90%在 LibriMix 3mix 测试中Qwen3 - ASR、Gemini、StepAudio 全军覆没而 CocktailASR - 1 为 12.29%。在真实会议录制测试中AMI SDM 的 WER 是 21.81%AliMeeting Far 是 20.63%大幅领先已有方案。单人场景下在 LibriSpeech 等数据集上也全面领先。附加特性负样本拒识与思维链推理该模型具备负样本拒识能力当参考音频对应的人不参与当前对话时输出空文本。在 LibriSpeech 负样本上拒识率达 79.59%Aishell 上是 75.35%小米自有的中文测试集上是 68.54%而 Qwen3 - ASR 和 StepAudio 无此能力。同时它还具备思维链推理功能可在输出答案前展示推理过程对调试和可解释性有意义且对精度影响不大。编辑观点小米 CocktailASR - 1 模型在技术上创新突破多场景测试表现亮眼且有实用特性从“所有声音”到“一个声音”的转向为行业发展提供新思路。