ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

每小时0.54美元:微软流式转录第一,是非流式的5倍

每小时0.54美元:微软流式转录第一,是非流式的5倍 2.50%的词错误率0.13秒的延迟微软的新模型拿下了流式转录榜单第一的位置。但更值得看的数字是它的定价每小时0.54美元。同一家公司几乎同名的非流式版本每小时0.10美元。流式的价格是它的5倍多。这多出来的钱买到了什么又没买到什么值得说清楚。一句话说清它是边听边说不是听完再写10月1日微软AI一次发了三款语音模型MAI-Transcribe-2-Streaming、MAI-Voice-2.1以及它的高速版MAI-Voice-2.1-Flash。三款都在Microsoft Foundry上以公共预览的形式提供Foundry之外还能在MAI Playground、OpenRouter、Vercel这些渠道试到。前一个是语音转文字后两个是文字转语音。真正的新东西是第一个它是微软的第一个流式转录模型。转录这件事分两种做法。非流式是把一段录好的音频丢进去等模型把整段处理完一次性把文字交出来。流式是音频一边送进去文字一边出来没说完的句子先给一版不完整的稿子之后不断改说到某个位置再定稿。微软上一个转录模型MAI-Transcribe-2走的是前一条路。这次的区别不在准确率在时间。流式模型支持60种语言并且能自动、连续地判断语言。这一点比听上去重要真实场景里一段会议既可能中英混杂也可能中途换人换语种要求用户开场前先指定语言等于把问题推给了使用者。2.5%和0.13秒是两个不同时刻的数字先把这两个数字的来处说清楚它们经常被当成同一件事。2.50%是最终词错误率0.13秒是最终延迟。换成日常说法在一句话结束、这段文字被确定为最终结果之后它的错词率是2.50%而模型从话音结束到交出这个最终结果用了0.13秒。拆开看这套流程。音频不是一整块进来的是被切成小块持续送进模型的。每进来一块模型先给一版临时文字这版文字在100多毫秒内就会出现微软自己的实时评测里文字最快在语音出现后约320毫秒显示出来。随着上下文越攒越多这些临时文字会被反复修改直到句子结束模型提交一个它认为稳定的版本。关键就在这里2.50%算的是最后那一版0.13秒算的是最后一版出现得有多快。你在屏幕上看到的那一版临时文字不在这个指标里。这不是微软一家的问题是所有流式转录模型共用的度量方式。最终结果的指标天生好看中间稿的指标难看得多。行业公开的排行榜也很少把中间改了几次、改错了多少单独摆出来。榜单的对比对象倒是清楚。Artificial Analysis在9月28日发布的流式语音转文字排行里排在微软后面的是Grok Voice Transcribe 2.0 Streaming的2.73%再后面是ElevenLabs Scribe v2 Realtime的3.59%。前两名之间只差0.23个百分点。这个差距的意思是领先是真的但没有代差。选型的时候把榜单第一当成一个加分项而不是一个必须换的理由会更理性。每小时0.54美元是非流式的5倍再看价格。MAI-Transcribe-2-Streaming目前的优惠价是每小时音频0.54美元折合约每1000分钟9美元。而微软的非流式模型MAI-Transcribe-2在Azure Speech公共预览阶段的价格是每小时0.10美元。同一家公司、同一个任务只因为多了实时这两个字价格差了5倍多。有人可能立刻想到因为流式的更准。这个推论在这里不成立。非流式那个模型对外给出的成绩是60种语言平均词错误率5.2%看着比2.50%差不少但这两个数字来自不同的评测集、不同的语言构成放在一起比较没有意义。两个模型之间真正的差别是交付方式不是准确率的档位。真正撑起价差的是算力占用方式。非流式可以攒批一百段录音一起送进来服务器塞满算力跑一轮就行机器不用为某一路音频空等。流式做不到每一路音频都要保持一个活着的会话说话人下一秒说不说、还要说多久服务端都不知道但算力得占着。按音频时长计价实际是在为这段占用时间付费。还有一层容易忽略0.54美元属于年末前的引入价。正式价格没有公布做预算的时候按这个数字算等于把优惠当成了常态。放到场景里0.13秒能换来什么延迟这个数字只有在具体场景里才有意义。放到客服智能体里看。用户说我上个月买的那台……“句子还没结束流式模型已经识别出他在讲一台具体商品。系统可以提前去查订单等用户说完能不能退”答案已经准备好了。非流式做不到这一点它必须等这句话说完才开始处理。放到实时字幕里看。字幕要贴着声音走观众才能跟着看。0.13秒的最终延迟意味着字幕不会明显落后于口型在直播、会议、课堂这类场景里这是可用与不可用的区别。反过来看会议记录。录音转文字是典型的整段放在一起处理的任务说话人不需要中途看到文字也不需要系统提前反应。这类任务用非流式成本只有流式的五分之一左右。省下来的钱不是抠出来的是任务本身不需要实时。这里有个容易忽视的物理限制人说话本来就带停顿句子中间的空隙常常有好几百毫秒。所谓实时本质是让模型在信息还不完整的时候先下判断然后不断修正自己而不是让模型瞬间看完整句话。这也解释了为什么中间稿的准确率天然低于最终稿。最容易看错的几件事说法一2.5%的词错误率意思是一百个字错2.5个字。这个说法在定义上没错词错误率确实是错词数除以总词数数值越低越好。但它解释不了一件事这个2.50%是最终结果的成绩。实时字幕里先出现的那版文字会被改写观众实际看到的中间状态并不能保证同样的错误率。更准确的理解是把2.50%当成这套系统的下限而不是你眼睛看到的平均状态。说法二既然是榜单第一现在就该把项目切过去。这个判断有现实支撑2.50%的最终错误率和0.13秒的最终延迟确实是目前公开成绩里最好的。但它解释不了部署条件模型处在公共预览阶段官方文档明确写着没有服务等级协议也不建议用于生产负载。更准确的理解是它的位置是目前能买到的最好的实时转录不是所有转录任务都该换成它。真要上生产得先准备好一条降级路径。说法三同一家公司的模型贵的那个一定更强。这符合一般直觉型号更新、价格更高通常对应更强的能力。但它解释不了价差结构流式贵贵在状态保持和并发占用不在于模型本身高一个档。同一代的非流式版本便宜是因为它可以把算力攒起来用。更准确的理解是这5倍价差买的是不攒批是交付方式的溢价。真要选型先回答四个问题如果你想知道手上这类活该不该用流式转录可以按下面四条过一遍。任一条答不上来就先别急着迁移。一是结果需要在对方说话的过程中被使用吗。比如提前触发工具调用、实时翻译、边听边生成待办。需要流式才有意义只是事后归档非流式更划算。二是按小时计费的成本能不能覆盖业务价值。0.54美元一小时的音频折算成每分钟不到一分钱量小的时候无感量上去之后是一条实打实的成本线而且它还是优惠价。三是出错时有没有人复核、有没有回退方案。公共预览无服务等级协议这不是危言耸听是官方文档的原话。降级方案是必须项不是可选项。四是你能接受中间稿被改写吗。实时字幕在屏幕上跳动是设计的一部分不是故障。下游系统如果按每来一段文字就写库的方式设计会被改写搞乱需要先想清楚覆盖与幂等逻辑。这四条不是门槛是边界。过了这四条流式的价值很清楚过不了非流式或者直接用成熟的云服务往往更稳。接下来值得盯的不是榜单发布当天的名次会被很快刷新真正的变量在后面几个地方。价格什么时候从引入价转成正式价转完涨多少。中间稿的准确率指标会不会被公开如果公开那才是能真实对比实时体验的时刻。并发和限流怎么设定实时服务最怕的不是单次慢而是高峰期排队。语音合成那两个模型同样值得留意边界。从几秒参考音频里复刻音色这个功能需要用审批过的访问权限系统也要求只能合成获得本人同意的声音。这条限制放在今天的环境里成立且必要它同时提醒使用者音色复制不是随手可用的默认能力。回到最开始那个数字。2.50%和0.13秒都是好成绩但真正决定你要不要用的是每小时0.54美元能不能换回对应的价值以及在一个没有服务承诺的预览期里你敢不敢把它放在关键链路上。如果你的会议记录从明天起快10秒但准确率掉一点点你换不换如果觉得今天这篇有启发,点个在看,顺手转发给需要的朋友;想第一时间收到推送,可以星标我⭐。关注我,每天陪你聪明看世界 —— 看懂热搜,玩懂AI。
返回列表