ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

Qwen3-ASR 全面解析:52 种语言开源语音识别模型如何叫板 GPT-4o?

Qwen3-ASR 全面解析:52 种语言开源语音识别模型如何叫板 GPT-4o? Qwen3-ASR 全面解析:52 种语言开源语音识别模型如何叫板 GPT-4o?【免费下载链接】Qwen3-ASRQwen3-ASR is an open-source series of ASR models developed by the Qwen team at Alibaba Cloud, supporting stable multilingual speech/music/song recognition, language detection and timestamp prediction.项目地址: https://gitcode.com/gh_mirrors/qw/Qwen3-ASRQwen3-ASR 是阿里 Qwen 团队开源的语音识别ASR模型家族支持 30 种语言 22 种中文方言共 52 种的语言自动识别与语音转写还能识别唱歌和带背景音乐的歌曲。它由 1.7B 和 0.6B 两个 ASR 模型、一个非自回归强制对齐模型组成官方数据显示 1.7B 版本在多项开源基准上达到开源 ASR 模型 SOTA效果可与 GPT-4o-Transcribe 等顶级商用闭源 API 正面抗衡——而且完全免费、可私有化部署。️为什么 Qwen3-ASR 值得关注相比 Whisper 等老牌开源方案Qwen3-ASR 把一站式做到了极致能力说明覆盖范围语言识别 语音转写无需预先指定语言自动检测30 种语言中文方言转写四川话、粤语、闽南语等22 种方言英文口音多国/地区口音英语16 种口音唱歌/歌曲识别人声演唱、带 BGM 整首歌语音 歌声流式/离线统一单模型同时支持实时与离线转写—时间戳预测字级/词级时间戳需对齐器11 种语言更关键的是工程体验官方开源了完整的qwen-asrPython 推理框架内置 transformers 和 vLLM 双后端0.6B 小模型在 128 并发下吞吐量可达2000 倍实时非常适合生产环境。5 分钟快速上手 Qwen3-ASR 安装指南第一步一键安装 Python 包推荐在干净的 Python 3.12 环境中操作避免依赖冲突conda create -n qwen3-asr python3.12 -y conda activate qwen3-asr # 最小安装transformers 后端 pip install -U qwen-asr # 启用 vLLM 后端更快推理 流式支持 pip install -U qwen-asr[vllm]第二步加载模型做首次转写import torch from qwen_asr import Qwen3ASRModel model Qwen3ASRModel.from_pretrained( Qwen/Qwen3-ASR-1.7B, dtypetorch.bfloat16, device_mapcuda:0, max_new_tokens256, ) results model.transcribe( audioasr_en.wav, # 支持本地路径 / URL / base64 / numpy 数组 languageNone, # None 自动识别语言 ) print(results[0].language) # English print(results[0].text)模型权重会在首次加载时自动下载离线环境可提前用 ModelScope 或 Hugging Face CLI 手动拉取。完整示例见 example_qwen3_asr_transformers.pyvLLM 后端示例见 example_qwen3_asr_vllm.py。 需要开发或魔改源码可克隆仓库后以 editable 模式安装git clone https://gitcode.com/gh_mirrors/qw/Qwen3-ASR cd Qwen3-ASR pip install -e .双后端推理transformers 与 vLLM 怎么选维度transformers 后端vLLM 后端安装pip install qwen-asrpip install qwen-asr[vllm]初始化Qwen3ASRModel.from_pretrained(...)Qwen3ASRModel.LLM(...)速度常规更快支持大批量流式识别❌✅时间戳✅需加载对齐器✅两者共用同一套transcribe()接口切换后端几乎零成本。若追求极限吞吐推荐 vLLM并可通过 qwen_asr/cli/serve.py 提供的qwen-asr-serve命令直接启动 OpenAI 兼容的推理服务qwen-asr-serve Qwen/Qwen3-ASR-1.7B --gpu-memory-utilization 0.8 --port 8000之后用标准 OpenAI Chat Completions 协议发请求即可现有调用代码基本无需改动。流式识别 时间戳一句话生成逐字字幕实时流式转写Qwen3-ASR 是单模型同时支持流式与离线的 ASR流式推理按 2 秒一块增量喂入音频边说边出字适合会议记录、直播字幕等低延迟场景。官方提供了 Flask 版麦克风流式 Demo一条命令即可体验qwen-asr-demo-streaming --asr-model-path Qwen/Qwen3-ASR-1.7B --port 8000浏览器打开http://your-ip:8000即可对着麦克风实时转写。对应代码在 demo_streaming.pyPython 侧流式示例见 example_qwen3_asr_vllm_streaming.py。字级时间戳预测想要哪个字在第几毫秒出现加载官方强制对齐器 Qwen3-ForcedAligner-0.6B 即可支持 11 种语言、最长 5 分钟音频输出字级中文/日韩或词级拉丁语系时间戳from qwen_asr import Qwen3ForcedAligner aligner Qwen3ForcedAligner.from_pretrained( Qwen/Qwen3-ForcedAligner-0.6B, dtypetorch.bfloat16, device_mapcuda:0, ) results aligner.align(audioasr_zh.wav, text甚至出现交易几乎停滞的情况。, languageChinese) print(results[0][0].text, results[0][0].start_time, results[0][0].end_time)在Qwen3ASRModel中传入forced_aligner参数 return_time_stampsTrue一次调用即可同时拿到识别文本和时间戳。实测成绩Qwen3-ASR 如何叫板 GPT-4o官方评测WER 越低越好中最具代表性的一组对比基准测试GPT-4o-TranscribeWhisper-large-v3Qwen3-ASR-1.7BLibrispeech clean | other (EN)1.39| 3.751.51 | 3.971.63 |3.38AISHELL-2-test (ZH)4.245.062.71KeSpeech 中文方言26.8728.795.10WenetSpeech-Chuan 四川话34.81 | 53.9814.35 | 26.8011.99| 21.63唱歌 M4Singer16.7713.585.98带BGM歌曲 EntireSongs-zh34.86N/A13.91几个关键结论方言是杀手锏中文方言上 1.7B 的 WER 比 GPT-4o 低一半以上KeSpeech 5.10 vs 26.87这是闭源 API 普遍做不到的唱歌识别领先带背景音乐整首歌转写1.7B 全面压制 GPT-4o 与 Gemini-2.5-Pro复杂场景抗噪强内部极端噪声、绕口令基准上1.7B 的 WER16.17 / 2.44同样大幅领先 GPT-4o36.11 / 20.87语言识别准确率平均 97.9%优于 Whisper 的 94.1%。强制对齐器方面Qwen3-ForcedAligner 平均绝对误差 42.9ms比 NFA 快约 3 倍在 5 分钟长音频上优势更夸张52.9ms vs WhisperX 的 2708ms。完整评测表见 README.md 的 Evaluation 章节。微调与部署从 Demo 到生产用自己的数据微调官方提供开箱即用的 SFT 脚本 qwen3_asr_sft.py训练数据只需 JSONL每行一个audio路径 text转写文本支持单卡和多卡 torchrun、断点续训python qwen3_asr_sft.py \ --model_path Qwen/Qwen3-ASR-1.7B \ --train_file ./train.jsonl \ --output_dir ./qwen3-asr-finetuning-out \ --batch_size 32 --lr 2e-5 --epochs 1详细的数据格式说明包括language Englishasr_text...语言前缀的写法见 finetuning/README.md。本地 Web Demo 与 Docker 部署不想写代码两条命令启动可视化界面# 普通 Gradio Demo支持时间戳可视化 qwen-asr-demo --asr-checkpoint Qwen/Qwen3-ASR-1.7B --backend vllm --port 8000生产环境推荐官方 Docker 镜像qwenllm/qwen3-asr装好 GPU 驱动后直接运行容器即可Dockerfile 参考 Dockerfile-qwen3-asr-cu128。总结适合哪些人你的场景推荐方案中文/方言/多语种会议转写Qwen3-ASR-1.7B 离线推理直播字幕、语音助手等实时场景1.7B vLLM 流式推理低成本批量转写0.6B精度换速度2000x 吞吐字幕制作、逐字对齐ASR ForcedAligner-0.6B 组合专有领域医疗/法律等官方 SFT 脚本微调Qwen3-ASR 用开源 SOTA 完整工程工具链证明了私有化部署的语音识别已经不必再向 GPT-4o 妥协。核心代码结构也值得了解——推理封装在 qwen_asr/inference/transformers 后端模型实现在 qwen_asr/core/transformers_backend/技术细节可参阅仓库内的 Qwen3_ASR.pdf 技术报告。【免费下载链接】Qwen3-ASRQwen3-ASR is an open-source series of ASR models developed by the Qwen team at Alibaba Cloud, supporting stable multilingual speech/music/song recognition, language detection and timestamp prediction.项目地址: https://gitcode.com/gh_mirrors/qw/Qwen3-ASR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表