
FunASR 完全指南从会议转写到实时字幕一套免费开源语音识别工具搞定【免费下载链接】FunASROpen-source speech recognition toolkit for training, inference, streaming ASR, VAD, punctuation, speaker diarization pipelines, and OpenAI-compatible/MCP serving.项目地址: https://gitcode.com/GitHub_Trending/fun/FunASR一场两小时的会议纪要、几百段客服录音、需要实时字幕的直播——这些场景背后都是同一个需求把语音准确、快速地变成文字。FunASR 是阿里巴巴达摩院开源的端到端语音识别ASR工具包一条AutoModel调用就能串联起 VAD 语音端点检测、ASR 识别、标点恢复和说话人分离并且支持离线转写、流式实时识别、OpenAI 兼容 API 部署甚至纯 CPU 的边缘设备。与单个模型不同FunASR 提供的是一个可按需组合的模型工具箱有 GPU 就用旗舰 Fun-ASR-Nano 追极致精度纯 CPU 就用 SenseVoice-Small 跑 17 倍实时需要低延迟就用 Paraformer 流式模型。为什么说 FunASR 值得放进你的技术栈选语音识别方案时大家最常纠结三件事准确率够不够、跑得快不快、部署省不省钱。FunASR 给出的答卷是数据来自项目自带的 184 条长音频、共 192 分钟基准测试模型中文 CER ↓GPU 速度CPU 速度Fun-ASR-NanovLLM 加速8.20%340 倍实时—SenseVoice-Small7.81%170 倍实时17 倍实时Paraformer-Large10.18%120 倍实时15 倍实时更直观的一句话FunASR 的模型跑在 CPU 上比 Whisper 跑在 GPU 上还要快。同时它自带说话人分离、情感与音频事件标签SenseVoice 提供、流式 WebSocket 服务而这些都是Whisper 额外组件要自己拼出来的。工具包源码为 MIT 协议模型权重按各自模型卡许可使用整体免费自托管。按场景看FunASR 能帮你解决哪些问题长音频一次转写成结构化文本丢进去一整段会议录音返回的不是干巴巴的一行字而是带时间戳、说话人编号和标点的句子列表——AutoModel会自动协调 ASR、VAD、说话人模型完成整条流水线。多人会议与客服录音的说话人区分通过spk_modelcam参数即可开启说话人分离配合 FSMN-VAD 切分语音段谁在什么时候说了什么直接落进结果里无需再引入额外的分离工具。实时字幕与呼叫中心流式转写Paraformer 流式模型按 600ms 小块逐段输入、逐段输出配合项目内置的 WebSocket 运行时服务详见 运行时文档可以支撑直播字幕、通话质检这类长连接场景。私有化部署一套语音识别 APIfunasr-server一条命令就能起一个 OpenAI 兼容的/v1/audio/transcriptions端点LangChain、Dify、n8n 等现有客户端几乎零改动接入音频不出内网。示例代码在 examples/openai_api/。让 AI 智能体听懂语音仓库自带 MCP Serverexamples/mcp_server/把本地语音识别能力直接暴露给 Claude、Cursor 这类 Agent实现对 Agent 说话的交互入口。两个关键设计帮你看懂它是怎么做到的流水线编排一次调用背后的装配线FunASR 的核心思想是把语音理解拆成可插拔的工序VAD 负责哪里有声音ASR 负责说了什么CT-Transformer 负责加标点CAM 负责谁说的。你只需在AutoModel里声明用哪些工序框架负责调度、批处理和结果合并。这就是为什么它既能一行代码做最简转写也能一行代码做带说话人的生产级转写。上下文增强解码旗舰模型如何提升准确率最新的 Fun-ASR-Nano 采用编码器 LLM 解码器结构并引入三路上下文注入音频上下文Audio Context、CTC 预测上下文CTC Predicting Context和基于 RAG 的用户热词User Hotword。简单说模型在解码每个词时既参考前面已识别的语音与文本也能检索你提供的业务热词库因此对专有名词、人名、方言场景的识别明显更稳。FunASR 最快上手安装 第一段识别一键安装步骤pip install torch torchaudio pip install funasr要求 Python ≥ 3.8Linux / Windows / Mac 均支持从源码安装则为git clone https://gitcode.com/GitHub_Trending/fun/FunASR cd FunASR pip install -e .详细环境说明见 安装文档。最短识别示例有 GPU 的场景三行代码出结果from funasr import AutoModel model AutoModel(modelFunAudioLLM/Fun-ASR-Nano-2512, devicecuda) result model.generate(inputmeeting.wav) print(result[0][text])纯 CPU 或想同时要情感和说话人标签换成 SenseVoice 流水线model AutoModel(modeliic/SenseVoiceSmall, vad_modelfsmn-vad, spk_modelcam, devicecpu) result model.generate(inputmeeting.wav)不想写 Python 也没关系装完就有 CLI 可用funasr audio.wav # 最简转写 funasr audio.wav --spk --timestamps -f json # 说话人 时间戳JSON 输出 funasr audio.wav --output-format srt # 直接生成字幕不同场景的典型用法你想做的事推荐路径GPU 上追求最高精度中/英/日 方言Fun-ASR-Nano吞吐敏感时配 vLLMAutoModelVLLMCPU 环境 / 多语言 情感事件标签SenseVoice-Small中文生产环境 时间戳 热词Paraformer-zhhotword参数直接传热词长音频 匿名说话人标签一步到位MOSS-Transcribe-Diarize直播 / 呼叫中心实时字幕Paraformer 流式模型 WebSocket 服务批量处理录音存档参考 examples/batch_asr_improved.py字幕生成examples/subtitle/generate_subtitle.py选不定模型时的完整对照表在 模型选择指南从 Whisper 或云端 ASR 迁移过来的评估方法见 迁移指南。无 GPU、无 Python单二进制跑在边缘设备上通过 llama.cpp 的 GGUF 路线SenseVoice / Paraformer / Fun-ASR-Nano 都能编译成单个自包含二进制内置 FSMN-VADLinux / macOS / Windows含 Vulkan、CUDA 包都有预编译版本中文错误率比 whisper.cpp 低约 3 倍。相关实现见 runtime/llama.cpp/。版本演进与近期亮点Fun-ASR-NanoV2 架构LLM 式 ASR支持中英日与中文方言/口音配合 vLLM 达到 340 倍实时MOSS-Transcribe-Diarize一次离线请求同时返回转写、时间戳和匿名说话人标签支持 Docker / Kubernetes / vLLM 工作流FunASR 1.4.x完善 Model Zoo 发现机制提升实时服务稳定性部署生态OpenAI 兼容 API、MCP Server、Gradio 演示、Kubernetes 模板、llama.cpp 边缘包一应俱全延伸资源继续深入 FunASR模型源码funasr/models/Paraformer、SenseVoice、FSMN-VAD 等全部模型实现训练与推理流水线funasr/auto/auto_model.py工具包与 CLI 入口funasr/cli.py、docs/cli.md故障排查docs/troubleshooting.md使用场景合集docs/use_case_showcase.md社区集成项目docs/community_projects.md从一段会议录音到一整套私有语音识别服务FunASR 提供的不是又一个模型而是一条从研究、推理到生产部署的完整通路。先用 Colab 或上面的三行代码试出感觉再按 部署矩阵 选择适合你的落地路径就是最快的开始方式。【免费下载链接】FunASROpen-source speech recognition toolkit for training, inference, streaming ASR, VAD, punctuation, speaker diarization pipelines, and OpenAI-compatible/MCP serving.项目地址: https://gitcode.com/GitHub_Trending/fun/FunASR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考