
sherpa-onnx v1.10.45 发布FireRedAsr 语音识别模型上线一套 API 打通 10 种语言【免费下载链接】sherpa-onnxSpeech-to-text, text-to-speech, speaker diarization, speech enhancement, source separation, and VAD using next-gen Kaldi with onnxruntime without Internet connection. Support embedded systems, Android, iOS, HarmonyOS, Raspberry Pi, RISC-V, RK NPU, Axera NPU, Ascend NPU, x86_64 servers, websocket server/client, support 12 programming languages项目地址: https://gitcode.com/GitHub_Trending/sh/sherpa-onnxsherpa-onnx 在 v1.10.45 中把 FireRedAsr 语音识别模型正式纳入了模型库。这是该版本最大的变化从模型导出到 C、Python 接口首发再到 C API、Java、Kotlin、C#、Swift、Dart、Go、JavaScriptNode.js 与 WebAssembly、Pascal 等十种语言的绑定一次配齐本地离线识别又多了一个可选模型。此外还修了 Go 绑定的一处隐患和 RTF 指标的一个笔误。30 秒速览本次更新要点新增模型FireRedASR 完成 ONNX 导出并接入 sherpa-onnx接口首发C、Python API 同步落地绑定铺开C、C#、Swift、Dart、Go、Pascal、JavaScriptNode.js 与 WebAssembly 两种形态等语言接口全部跟上稳定性修复Go 绑定创建实例的失败场景现在会正确报错指标修正RTF 实时因子计算中的笔误已修复。核心更新详解FireRedAsr 语音识别模型支持它是什么为什么值得看一眼FireRedASR 是一款基于注意力机制的 AED 模型。AED 指 Attention-based End-to-End也就是端到端语音识别音频进去、文字直接出来中间由模型内部完成声学 解码不像老式方案那样要逐级串联声学模型、语言模型再拼出结果。链路更短推理也更省心。sherpa-onnx 本身是一个基于 ONNX Runtime 的本地推理框架支持语音识别、语音合成、说话人分离等功能全程不需要联网。FireRedASR 的模型文件以 ONNX 格式分发跟着项目现有的离线识别流程走即可——升级到 v1.10.45 的发行包下载对应模型就能跑起来。支持的语言、平台与接口范围这一版真正花功夫的地方在于覆盖面。各语言都提供了可直接参考的示例语言 / 平台仓库内示例Ccxx-api-examples/fire-red-asr-cxx-api.ccPythonpython-api-examples/offline-fire-red-asr-decode-files.pyC APIc-api-examples/fire-red-asr-c-api.cJava / Kotlinjava-api-examples/NonStreamingDecodeFileFireRedAsr.javaC#.NETdotnet-examples/offline-decode-files/Swiftswift-api-examples/fire-red-asr.swiftDart / Flutterdart-api-examples/non-streaming-asr/bin/fire-red-asr.dartGogo-api-examples/non-streaming-decode-files/JavaScriptnodejs-examples/test-offline-fire-red-asr.js、nodejs-addon-examples/test_asr_non_streaming_fire_red_asr.jsPascalpascal-api-examples/non-streaming-asr/fire_red_asr.pas对桌面端用户Flutter 的跨平台 App 可以直接体验本地推理的完整流程界面上给出的 RTF 数值直观反映了推理耗时与音频时长的比值其他变化与修复谁需要关心Go 用户之前创建 Go 实例时存在一个隐患底层 C 结构体初始化失败Go 侧却仍然返回创建成功。程序拿到一个不可用的对象继续往下走轻则结果异常重则直接崩溃。现在失败会如实向上传递属于典型的稳定性修复用了 Go 绑定的项目建议升级。看性能指标的用户RTF 是语音识别领域衡量实时能力的核心指标推理耗时除以音频时长数值小于 1 说明比实时还快。此前 RTF 计算里有个笔误可能让统计值失真。做性能监控、对比不同模型速度的人升级后拿到的数字才可信。能不能直接用分场景建议新用户从 Python 示例入手最省事跑通一条音频后再挑语言各接口怎么写可翻 CHANGELOG.md 对应条目和示例目录。存量用户不强制升级但建议尽快切换——两处修复都关乎正确性如果升级前统计过 RTF升级后建议重新校准基线。Web 与桌面端WebAssembly 和 Node.js 两套 JavaScript 接口都已适配 FireRedASR可以在浏览器或 Node 服务里做本地转写不依赖远程 API。嵌入式与离线场景sherpa-onnx 支持树莓派、RK/Ascend NPU、Android、iOS、HarmonyOS 等平台FireRedASR 同样走这条离线路线适合对数据不出本机有要求的部署。写在最后v1.10.45 的定位很清楚给 sherpa-onnx 的离线识别模型库补进 FireRedASR并用十种语言的绑定把接入成本压到最低同时顺手修掉两处影响可信度的小毛病。接下来更值得关注的是 FireRedASR 在这套多语言框架里的表现细节与后续模型扩展对想换一个新模型试一试的开发者来说现在正是低成本验证的时机。【免费下载链接】sherpa-onnxSpeech-to-text, text-to-speech, speaker diarization, speech enhancement, source separation, and VAD using next-gen Kaldi with onnxruntime without Internet connection. Support embedded systems, Android, iOS, HarmonyOS, Raspberry Pi, RISC-V, RK NPU, Axera NPU, Ascend NPU, x86_64 servers, websocket server/client, support 12 programming languages项目地址: https://gitcode.com/GitHub_Trending/sh/sherpa-onnx创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考