ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

faster-whisper 安装使用完全指南:如何把 Whisper 语音识别提速 4 倍

faster-whisper 安装使用完全指南:如何把 Whisper 语音识别提速 4 倍 faster-whisper 安装使用完全指南如何把 Whisper 语音识别提速 4 倍【免费下载链接】faster-whisperFaster Whisper transcription with CTranslate2项目地址: https://gitcode.com/GitHub_Trending/fa/faster-whisperfaster-whisper 是基于 CTranslate2 推理引擎重写的 OpenAI Whisper 语音转文字工具官方测试显示它比原版快最高 4 倍内存占用更低识别精度不变。如果你正被转写一条 30 分钟录音要等半天的问题拖慢工作这篇文章会带你从零跑通它。一行命令安装 faster-whisper环境要求与首次运行先确认两件事Python 3.9 及以上这是硬性要求有 NVIDIA 显卡更好没有也没关系CPU 完全可用只是慢一些和 openai-whisper 不同faster-whisper不需要你单独安装 FFmpeg。音频解码由 PyAV 库完成FFmpeg 相关组件已随包内置省掉了一类最常见的安装报错。pip install faster-whisper装好后第一次运行只需要几行代码from faster_whisper import WhisperModel model WhisperModel(large-v3, devicecuda, compute_typefloat16) segments, info model.transcribe(audio.mp3, beam_size5) print(识别到的语言:, info.language) for seg in segments: print(f[{seg.start:.2f}s - {seg.end:.2f}s] {seg.text})一个新手容易踩的坑transcribe()返回的segments是生成器调用瞬间并不会开始转写只有你真正遍历它时计算才会启动。想拿到完整结果写segments list(segments)即可。模型权重在首次加载时按model_size自动下载你不需要手动准备任何文件。faster-whisper 能做什么除转写之外的四个核心能力自动语言检测不指定语言时模型会自己判断并通过info.language_probability给出置信度支持近百种语言。词级时间戳每个词都带起止时间做字幕、剪辑卡点时非常有用。静音过滤VAD内置 Silero VAD 声源检测模型自动跳过纯静音片段长音频省时间更明显。相关实现在 faster_whisper/vad.py检测权重在 faster_whisper/assets/silero_vad_v6.onnx。批量推理BatchedInferencePipeline可以并发处理多条音频GPU 利用率更高官方基准里 13 分钟音频从 59 秒压到 16 秒。实战词级时间戳 静音过滤的组合用法最常用的进阶写法把时间戳和 VAD 一起打开segments, _ model.transcribe( audio.mp3, word_timestampsTrue, # 输出每个词的时间 vad_filterTrue, # 自动跳过静音段 vad_parametersdict(min_silence_duration_ms500), # 静音超过 500ms 才切掉 ) for seg in segments: for w in seg.words: print(f{w.start:.2f}s - {w.end:.2f}s {w.word})多文件批量处理时换成批量管线即可from faster_whisper import WhisperModel, BatchedInferencePipeline model WhisperModel(turbo, devicecuda, compute_typefloat16) pipeline BatchedInferencePipeline(modelmodel) segments, info pipeline.transcribe(audio.mp3, batch_size16)更多可配置项温度、beam、上下文提示等都集中在 faster_whisper/transcribe.py 的WhisperModel类里遇到识别不准的问题先翻这个文件。调优指南模型大小与计算类型怎么选模型大小精度换速度的档位模型定位适合场景tiny/base最快实时场景、快速草稿small/medium均衡日常会议、普通内容large-v3精度最高专业交付、低容忍度场景distil-large-v3蒸馏版接近 large 精度、更快英文为主的长音频turbo面向批量推理优化大批量转写计算类型按硬件对号入座硬件compute_type说明NVIDIA GPU显存充足float16速度最快首选NVIDIA GPU显存紧张int8_float16显存近乎减半精度损失很小CPUint8速度、内存平衡点CPU追求极限精度float32慢一般不推荐其他关键参数beam_size默认 5。调大更稳但更慢调小更快但易出错。batch_size仅在BatchedInferencePipeline中生效显存够就调大。CPU 线程数用OMP_NUM_THREADS环境变量控制例如OMP_NUM_THREADS4 python3 my_script.py避免框架偷跑满线程拖慢整体。initial_prompt给一句带专业术语的文本作为上下文能显著改善特定领域识别。官方基准数据13 分钟音频large-v2RTX 3070 Ti方案耗时显存openai/whisper (fp16)2m23s4708MBfaster-whisper (fp16)1m03s4525MBfaster-whisper (int8)59s2926MBfaster-whisper (int8, batch_size8)16s4500MB想自己复现可以直接跑 benchmark/speed_benchmark.pyGPU 环境还可以参考 docker/ 下的 Dockerfile 与 docker/infer.py 做端到端演示。常见问题3 个高频报错与解法1. 启动报 cuDNN / CUDA 缺失或版本不符新版ctranslate2只支持 CUDA 12 cuDNN 9。如果你的环境是旧版本CUDA 11 cuDNN 8pip install ctranslate23.24.0CUDA 12 cuDNN 8pip install ctranslate24.4.0Linux 上也可以用pip install nvidia-cublas-cu12 nvidia-cudnn-cu129.*补库并配置LD_LIBRARY_PATHDocker 用户直接用官方 CUDA 基础镜像更省事。2. 显存不足OOM按顺序尝试换成int8_float16→ 换更小的模型 → 调小batch_size。这三步基本能解决绝大多数 OOM。3. CPU 上速度慢确认OMP_NUM_THREADS设置合理并且优先用int8而不是float32音频长时开启vad_filter能直接砍掉无效计算。典型应用场景会议纪要自动化录音转文字后交给 LLM 总结多说话人场景可结合社区的分角色工具链。视频字幕生产词级时间戳直接对接 SRT 导出做双语字幕也很顺手。播客/课程索引长音频全文转录建立可搜索的文字副本方便按关键词定位片段。语音备忘归档手机语音条批量转写入库配合initial_prompt提升专业术语准确率。下一步从一条命令开始现在就可以动手了先装pip install faster-whisper用tiny模型 CPU 跑一段短音频把流程走通确认硬件后再切到large-v3和float16对比同一份音频的效果与耗时。如果本地代码不完整可以从 https://link.gitcode.com/i/06cbdc50617364f4ddd365931aec85a8 克隆仓库里面 tests/ 目录下就有现成的测试音频和用例可以直接对照运行。【免费下载链接】faster-whisperFaster Whisper transcription with CTranslate2项目地址: https://gitcode.com/GitHub_Trending/fa/faster-whisper创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表