
课堂录音的痛点为什么传统 ASR 救不了场做过课堂笔记的人都有过这种体验回听录音时老师的声音和周围一切混在一起——前排同学的窃窃私语、后排翻书的沙沙声、走廊里偶尔传来的动静甚至空调运转的低频噪音。传统 ASR 模型不管这些它会把所有能识别的语音一股脑转写出来结果就是一份充斥着嗯这个那个以及大量无关对话的文字稿真正需要的内容反而被淹没了。更麻烦的是课堂特有的动态性。老师从讲台走到学生中间麦克风距离变化导致音量忽大忽小学生集体回答问题时多个声音重叠课间休息回来设备没关又录了一段无关内容。这些场景对 ASR 的挑战不是听不清而是听太杂——模型缺乏区分谁在说的能力只能被动接收所有声源。目标说话人技术从全量收声到指哪打哪小米最近开源的 CocktailASR-1 换了个思路。它没有走先做降噪、再做识别的老路而是把任务定义改成目标说话人语音识别先给模型一段参考音频让它记住这个声音的特征然后在后续录音中只转录这个人的语音其他人的声音、背景噪音、混响统统过滤掉。这个思路很符合人的听觉习惯。想象一下在嘈杂餐厅里你能轻易从周围几桌的谈话中锁定朋友的声音靠的不是把环境变安静而是大脑对特定声纹的持续关注。CocktailASR-1 做的就是这个事只不过对象换成了课堂场景中的教师声音。参考音频从哪来实际用起来获取参考音频的方式很灵活。课前单独录一段教师自我介绍是最直接的十几秒就够关键是包含稳定的声纹特征。更省事的做法是直接用课程开头的片段——大多数老师开场会有固定的自我介绍或课程概述截取这部分作为参考音频省去了额外录制环节。对于连续多节课的场景参考音频甚至可以复用。只要教师没有明显感冒或设备更换同一参考音频支撑一整天的课程转写通常没问题。如果中间有较长时间间隔或者换教室导致录音设备变化补录一段新的参考音频就能保持效果。端到端架构一个模型包圆不用拆东墙补西墙CocktailASR-1 的架构设计比较简洁D2V2 音频编码器负责把音频转成特征Adapter 做适配最后接 LLM 解码。所有权重放在一个 checkpoint 里输入时把参考音频和目标音频拼接中间插一秒静音分隔16kHz 单声道即可。这种端到端设计的好处是不用为不同场景换模型。传统方案里单人讲话用一个模型多人场景换另一个噪音大了再换降噪模块实际部署起来很繁琐。CocktailASR-1 把参考音频作为条件输入单人讲课、多人讨论、甚至教师走动导致声学环境变化同一个模型都能处理。教师从讲台走到教室后排距离麦克风远了、混响变了模型依然能靠声纹特征锁定目标不会因为音量降低就漏掉内容。相比降噪识别的串联方案端到端架构的鲁棒性体现在错误不会逐级放大。传统流程里降噪环节把教师声音误当成噪音削掉后面识别再好也救不回来或者降噪不足残留噪音干扰识别。目标说话人技术直接把只关注谁作为输入条件绕开了这个困境。负样本拒识集体回答时不再乱转写课堂里有个特殊场景教师提问后学生集体回答。这时候传统 ASR 会忠实转写所有声音输出一片混乱的文本。CocktailASR-1 的负样本拒识能力在这里就很有用——当参考音频对应的人教师没有说话时模型输出空文本而不是把周围学生的七嘴八舌硬转成文字。测试数据上看这项能力的准确率相当可观LibriSpeech 负样本拒识率 79.59%Aishell 上 75.35%小米自有的中文测试集上 68.54%。作为对比Qwen3-ASR 和 StepAudio 目前不具备这个能力。实际课堂中这意味着学生讨论环节不会混入转写结果最终文稿的纯净度大幅提升。当然68%-79% 的拒识率也意味着有优化空间。如果课程设计里需要记录学生发言目前的方案还需要配合其他手段比如单独给学生准备参考音频或者事后人工标注。但对于只保留教师讲解这个核心需求现有能力已经能过滤掉大部分干扰。思维链推理让转写过程可解释CocktailASR-1 另一个有意思的特性是思维链推理。模型在输出最终转写结果前会先展示一段推理过程比如判断当前片段是否属于目标说话人这段音频是有效语音还是背景噪音。对课堂场景来说这相当于给转写结果加了层审计日志。如果某段内容转写异常——比如突然漏掉几句话或者出现了明显不属于教师的词汇——可以回溯推理过程看是模型判断目标说话人不在场还是把其他声音误识别了。这种可解释性在调试和优化工作流时很有价值不用对着黑盒猜测。从实际测试看开启思维链对最终精度的影响很小几乎可以忽略。所以如果系统资源允许建议保持开启尤其是转写质量需要人工复核的场景。中文课堂适配自研测试集的意义前面提到小米在自有中文测试集上做了测试这个细节值得展开。中文课堂场景和英文语料差异不小普通话的声调变化、课堂里常见的方言口音、中文特有的语速和停顿习惯都需要模型在训练阶段有足够覆盖。CocktailASR-1 在中文测试集上的表现WER 及拒识率说明其训练数据里包含了相当比例的中文语料不是简单把英文模型搬过来。对于国内在线教育、高校课堂录制等场景这意味着开箱即用的可能性更高不需要像某些海外模型那样先做大量本地化适配。实际部署时如果教师有较重口音或习惯使用特定术语可以在参考音频里多覆盖一些这类样本或者课后用少量数据做轻量级微调进一步提升准确率。一个可落地的课堂转写工作流把以上特性串起来可以设计这样一个流程课前准备录制或截取 10-20 秒教师参考音频存为课程档案。同一学期同一教师可复用。录制阶段正常开启课堂录音无需特殊设备普通领夹麦或手机录音即可。教师走动、学生讨论都不影响模型只关注目标声纹。转写阶段输入参考音频目标音频CocktailASR-1 自动过滤非目标语音。开启思维链保留推理日志备查。后处理对输出文本做段落和标点优化结合时间戳生成可检索的课程文稿。学生集体回答的片段自然留白不会混入噪音转写。这个流程的核心优势是低侵入性教师不需要改变授课习惯不用佩戴特殊设备学生讨论也不会被压制。技术层面把复杂度留给了模型使用层面保持简单。局限与权衡任何技术都有边界。CocktailASR-1 目前的表现依赖参考音频的质量如果录制时环境过于嘈杂或者教师声音被严重遮挡参考声纹的纯净度会受影响。另外极端多人同时讲话且声纹特征接近的场景比如双胞胎学生同时发言模型区分能力会下降不过这类情况在常规课堂中较少见。另一个现实考量是计算资源。端到端大模型相比传统轻量 ASR推理延迟和硬件要求更高。对于实时字幕这类强时效场景需要评估部署成本课后离线转写的场景则完全适用。写在最后课堂录音的价值在于把一次性的听觉信息转化为可检索、可复习的文字资产。传统 ASR 做到了能转但距离好用还有距离。CocktailASR-1 代表的方向——用目标说话人技术精准锁定信息源——让课堂转写从全量收录走向按需提取实际解决的是信息过载而非信息不足的问题。对于每天面对大量课程资料的学生或者需要管理海量教学内容的在线教育从业者这种只转录该转录的能力可能比追求绝对最低的词错率更有实用价值。毕竟一份干净的、属于教师的讲解文稿远比一份混杂了所有背景噪音的完整记录更有复习意义。