ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

FireRedAsr 语音识别模型部署指南:Sherpa-onnx v1.10.45 给各平台带来了什么

FireRedAsr 语音识别模型部署指南:Sherpa-onnx v1.10.45 给各平台带来了什么 FireRedAsr 语音识别模型部署指南Sherpa-onnx v1.10.45 给各平台带来了什么【免费下载链接】sherpa-onnxSpeech-to-text, text-to-speech, speaker diarization, speech enhancement, source separation, and VAD using next-gen Kaldi with onnxruntime without Internet connection. Support embedded systems, Android, iOS, HarmonyOS, Raspberry Pi, RISC-V, RK NPU, Axera NPU, Ascend NPU, x86_64 servers, websocket server/client, support 12 programming languages项目地址: https://gitcode.com/GitHub_Trending/sh/sherpa-onnxSherpa-onnx v1.10.45 正式带上了 FireRedAsr 语音识别模型模型已导出为 ONNX 格式并配齐了从 C 到 Pascal 的 10 种语言绑定。如果你的产品要在浏览器、手机或服务端做离线语音转写这个版本直接扩大了可选模型范围另外两处修复Go 绑定的内存隐患、RTF 计算拼写错误则关系到已经在用这套框架的用户。FireRedAsr 是什么一次识别一整个音频的端到端模型FireRedAsr 是基于注意力机制的 AEDAttention-based Encoder-Decoder端到端模型。用半句白话说编码器先把整段音频压成特征序列解码器再靠注意力机制回头看这些特征、逐词吐出文本。端到端意味着它不需要像传统方案那样把声学模型和语言模型分开组装一个模型直接给出结果识别准确率和推理速度都有不错的表现。对使用者来说最关键的一点是官方已完成 ONNX 导出模型包里包含编码器和解码器两个 ONNX 文件提供 int8 量化版用体积换速度和词表文件官方示例基于中英双语zh_en模型做文件识别。也就是说拿到模型包、配上对应语言的绑定就可以开始推理无需再走训练或转格式流程。按应用运行位置选 FireRedAsr 绑定Sherpa-onnx 的核心推理用 C 实现各语言绑定都建立在这套核心之上分层跨平台架构。所以选绑定的标准很简单你的应用跑在哪里就用哪个封装不必关心底层差异。应用运行位置绑定仓库内参考示例浏览器WebAssemblyJavaScript (WebAssembly)wasm/服务端 / 后端Node.js (node-addon)、Python、Cnodejs-addon-examples/、python-api-examples/、cxx-api-examples/Android Kotlin / Javaandroid/iOS Swiftios-swift/、swift-api-examples/桌面 / 嵌入式C API、C#c-api-examples/、dotnet-examples/Pascal 项目Pascalpascal-api-examples/跨平台 UIDart (Flutter)dart-api-examples/、flutter/发布日志中还包含 Kotlin、Java、Go 三个 FireRedAsr 接口需要时可以一并参考。v1.10.45 修了什么对已有用户意味着什么Go 绑定的假成功问题。此前在特定情况下创建 Go 实例会返回成功但底层 C 结构体的初始化实际失败了——调用照常返回隐患却留了下来后续访问内存时可能出错。修复后初始化失败会在创建那一刻就暴露出来。对你来说用 Go 绑定跑服务时不会再出现创建一切正常、运行中却崩溃或行为诡异的排查难题如果你没用到 Go 绑定这条与你无关。RTF 计算的拼写错误。RTF实时因子 识别耗时 ÷ 音频时长小于 1 表示比实时更快是衡量识别系统快慢的核心指标。之前的拼写错误导致这个指标算不准影响性能监控与优化决策。现在结果可信了如果你的系统里盯着 RTF 看性能升级后读到的数字才作数。快速上手 FireRedAsr 的路径先从 Python 绑定开始体验跑一遍python-api-examples/下的 FireRedAsr 文件识别示例确认模型和你的数据匹配。生产环境再按上表选绑定服务端用 Node.js 或 C移动端正经应用 Android/iOS 官方示例工程桌面集成走 C API。每个语言目录下的示例都附带了模型获取与运行脚本照着执行即可不需要自己拼配置。要不要立刻升级到 v1.10.45建议马上升级服务在用 Go 绑定——初始化隐患属于稳定性问题越早修越好想评估离线中英混合语音识别——FireRedAsr 是这一版新增的可选模型不升级就没有正在用 RTF 指标做性能监控——升级后数据才准确。可以先观望只用 Whisper、Paraformer 等既有模型且服务稳定——本版本的新能力不触碰你现有的推理管线等后续版本也无妨实时麦克风流式场景为主——FireRedAsr 属于离线非流式识别模型实时链路是否适用建议先用自己的数据小规模测一轮再决定。 一句话收个尾v1.10.45 提供了 FireRedAsr 的 ONNX 模型与 C、Python、Android、iOS、JavaScriptWebAssembly/Node.js、C#、Swift、Dart、C API、Pascal 共 10 项语言绑定并修复了 Go 绑定的初始化问题和 RTF 计算拼写错误——该版本的全部改动就是这三件事。【免费下载链接】sherpa-onnxSpeech-to-text, text-to-speech, speaker diarization, speech enhancement, source separation, and VAD using next-gen Kaldi with onnxruntime without Internet connection. Support embedded systems, Android, iOS, HarmonyOS, Raspberry Pi, RISC-V, RK NPU, Axera NPU, Ascend NPU, x86_64 servers, websocket server/client, support 12 programming languages项目地址: https://gitcode.com/GitHub_Trending/sh/sherpa-onnx创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表