ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

FunASR 本地语音转写教程:无 GPU 也能跑出 17 倍实时速度

FunASR 本地语音转写教程:无 GPU 也能跑出 17 倍实时速度 FunASR 本地语音转写教程无 GPU 也能跑出 17 倍实时速度【免费下载链接】FunASROpen-source speech recognition toolkit for training, inference, streaming ASR, VAD, punctuation, speaker diarization pipelines, and OpenAI-compatible/MCP serving.项目地址: https://gitcode.com/GitHub_Trending/fun/FunASR会议录音不想传给云端FunASR 是达摩院开源的语音识别工具包能在你自己电脑上离线完成语音转文字断网可用CPU 机器上 SenseVoice 模型转写速度约 17 倍实时1 分钟音频约 3.5 秒跑完。按本文走完你的电脑上就有一条 16kHz 音频 → 带标点的中文文本的最短链路。 先跑起来三步大约 5 分钟全程只用 pip不需要 clone 仓库。第一步安装依赖。注意顺序先 torch 后 funasr。python -m pip install -U torch torchaudio python -m pip install -U funasr做完应该看到两个包安装成功python -c import funasr不报任何错误。第二步转一条本地音频。CLI 装完即用默认走 SenseVoice 模型首次运行会自动下载模型。funasr meeting.wav --language zh做完应该看到终端逐行打印出识别文本形如欢迎大家来体验达摩院推出的语音识别模型。第三步换个模型验证链路。funasr meeting.wav --model paraformer -f json做完应该看到带segments时间戳的 JSON 输出说明 VAD 切句和标点流程都通了。 它是什么先说定位Whisper 是单模型FunASR 是工具包——识别ASR、端点检测VAD、标点PUNC、说话人分离SV/SD、情感与音频事件SenseVoice以及 WebSocket 实时流式服务和 OpenAI 兼容 APIfunasr-server。能做的离线文件转写16kHz 单声道为主容器格式wav/mp3/mp4/m4a/flac/ogg直接解码实时流式识别--mode online按 600ms 分块送音频出部分结果--mode 2pass先流式后离线纠错说话人分离 时间戳、热词偏置、逆文本规范化ITN数字日期还原成自然读法服务端部署OpenAI 兼容 API/v1/audio/transcriptions、WebSocket 服务、llama.cpp/GGUF 单文件二进制无 Python不做的事不替你清洗录音、不做翻译Whisper 系模型除外、不训练你的私有数据训练框架有但本文不展开。离线识别服务内部是一条流水线环境与选型环境要求Python 3.83.13PyTorch ≥ 1.11Linux/Windows/macOS 都支持无 GPU 也能跑模型默认从 ModelScope 下载海外可用--hub hf切 Hugging Face。模型语言参数量实测速度适合场景SenseVoice-Small中/英/日/韩/粤234MCPU 17x 实时GPU 170x中文 CER 7.81%无 GPU、多语言、要情感标签Paraformer-Large中/英220MCPU 15xGPU 120xCER 10.18%中文生产、要字级时间戳和热词Fun-ASR-Nano中/英/日方言800MGPU vLLM 340x 实时CER 8.20%有显卡、专名/难例多的会议Fun-ASR-MLT-Nano31 种语言800M需 GPU多语言混合音频怎么选没有独显直接 SenseVoice一条命令就能用主力是普通话且要时间戳、热词用 Paraformer有 NVIDIA 显卡且追求准确率上 Fun-ASR-Nano。完整对照见 docs/model_selection.md。️ 进阶玩法批量转写。用途一次处理整个目录的会议录音。funasr *.wav -f srt --output-dir ./subs预期效果目录里每个音频对应一份按句切分的 SRT 字幕文件可直接当视频字幕用。热词纠错。用途公司名、人名、产品词总被识别错。funasr meeting.wav --model paraformer --hotwords FunASR,达摩院预期效果这些词的识别准确率明显高于不带热词的基线。服务部署侧也可以把热词 权重每行一条写进 hotwords.txt 由服务端加载。字幕与说话人分离。用途长会议要分清谁在什么时候说话。funasr meeting.wav --spk --timestamps -f json预期效果JSON 里每段文本带毫秒级起止时间和说话人编号VAD CAM 组合。浏览器界面。不想敲命令的话起一个 HTML5 客户端就能点鼠标转写支持麦克风录音和文件上传python h5Server.py --host 0.0.0.0 --port 1337预期效果浏览器打开 1337 端口的页面选音频、点连接结果直接显示在页面上手机也能访问。⚠️ 避坑手册现象原因解法pip install funasr后 import 报错torch/torchaudio 版本或安装渠道与 funasr 不匹配先装 torch torchaudio再从同一渠道装 funasr仍报错就新建干净的虚拟环境重装模型下载很慢或中断默认走 ModelScope海外网络绕路海外用--hub hf或 HF 上的 FunAudioLLM 仓库下载中断清掉该模型的部分缓存重下funasr-server能启动但浏览器请求失败CORS 默认关闭跨域被拦用--cors-origin显式加上页面的完整来源协议主机端口不要用通配符WebSocket 实时出字为空或延迟高客户端音频格式与服务端预期不符采样率、通道、PCM 编码先拿一段 16kHz 单声道短 WAV 验证链路再查分块参数--chunk_size中文识别 CER 比预期高音频是 8kHz 电话采样或噪音大统一转成 16kHz 再喂模型必要时给热词文件偏置专有名词更细的排障清单在 docs/troubleshooting.md。收尾最适合两个场景会议录音/客服录音的本地合规转写以及给视频批量产字幕。下一步看 docs/model_selection.md 定模型或 docs/troubleshooting.md 排你卡住的那一步。【免费下载链接】FunASROpen-source speech recognition toolkit for training, inference, streaming ASR, VAD, punctuation, speaker diarization pipelines, and OpenAI-compatible/MCP serving.项目地址: https://gitcode.com/GitHub_Trending/fun/FunASR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表