ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

faster-whisper快速安装配置实战指南:13分钟音频1分钟转完

faster-whisper快速安装配置实战指南:13分钟音频1分钟转完 faster-whisper快速安装配置实战指南13分钟音频1分钟转完【免费下载链接】faster-whisperFaster Whisper transcription with CTranslate2项目地址: https://gitcode.com/GitHub_Trending/fa/faster-whisper你手里有一批 MP3 或会议录音要带时间戳转成文字而原版 whisper 跑得太慢。faster-whisper 把 13 分钟音频压到 1 分钟以内转完显存直降 38%本文带你一次装好。faster-whisper 是什么到底快多少faster-whisper 用 CTranslate2一个专门给 Transformer 模型加速的推理引擎重写了 OpenAI Whisper语音转文字模型精度不变速度最高提升 4 倍内存占用更低。大模型实测数据large-v2 模型转写 13 分钟音频GPU方案耗时显存openai/whisperfp162m23s4708MBfaster-whisperfp161m03s4525MBfaster-whisperint859s2926MB两个影响安装体验的事实不用单独装 FFmpeg音频解码由 PyAV 库自带完成少踩一类环境坑首次运行会自动从 Hugging Face Hub 下载转换好的模型large-v3 超过 3GB先留好磁盘动手前5 项自检表条件最低要求推荐配置说明Python 版本3.93.10–3.12当前 1.2.1 版要求 3.9磁盘空间1GB10GB 以上large-v3 转换模型超 3GBGPU 显存NVIDIA4GBlarge int8 约 2926MB8GB 以上large fp16 约 4525MB开批量推理batch 8需 6GB 以上CUDA cuDNNCUDA 11 cuDNN 8CUDA 12 cuDNN 9新版 ctranslate2 只支持 CUDA 12 cuDNN 9老环境要锁版本见坑点表CPU无 GPU4 核8 核默认 4 线程cpu_threads 可调高三条安装路线一条命令 / GPU / 源码路线 ACPU 快速版适合先验证环境的人一条命令 10 分钟内搞定。pip install faster-whisper路线 BGPU 版推荐3 条命令Linux。NVIDIA 的 cuBLAS/cuDNN 库矩阵计算和卷积加速库得让 Python 找得到用 pip 装完再导出路径pip install nvidia-cublas-cu12 nvidia-cudnn-cu129.* export LD_LIBRARY_PATHpython3 -c import os; import nvidia.cublas.lib; import nvidia.cudnn.lib; print(os.path.dirname(nvidia.cublas.lib.__file__) : os.path.dirname(nvidia.cudnn.lib.__file__)) pip install faster-whisper⚠️ cuDNN 版本必须锁 9.*版本对不上是 GPU 起不来的头号原因。路线 C源码版适合要用最新特性或改代码的人。git clone https://gitcode.com/GitHub_Trending/fa/faster-whisper pip install ./faster-whisper第一次跑通10 行代码验证是否装好准备一段小音频任意 mp3/wav放在当前目录tiny 是最小模型39M 参数下载不到 200MB专门用来验证环境from faster_whisper import WhisperModel model WhisperModel(tiny, devicecpu, compute_typeint8) segments, info model.transcribe(audio.mp3) print(flanguage: {info.language}, prob: {info.language_probability:.2f}) for segment in segments: print(f[{segment.start:.2f}s - {segment.end:.2f}s] {segment.text})预期输出文字随你的音频变化格式固定language: zh, prob: 0.97 [0.00s - 3.52s] 大家好这是一个语音识别测试 [3.52s - 7.88s] 转录速度非常快能打印出语言和各段时间戳文本就算通过。⚠️ 记住 segments 是个生成器转写只在 for 循环开始时才真正执行——不迭代它就会看起来没反应。高频参数速查8 个参数覆盖 90% 场景参数作用建议值device计算设备cpu / cuda / autocudacompute_type精度与量化方式GPU 用 float16 或 int8_float16CPU 用 int8beam_size解码时并行候选数越大越准越慢默认 5追求实时可降到 1language直接指定语言跳过自动检测已知语言就写死如 zhvad_filter用 Silero VAD 滤掉无声段长音频提速明显长音频开 Truevad_parametersVAD 细节如 min_silence_duration_ms默认 2000ms停顿被切太碎就调到 500word_timestamps输出每个词的开始/结束时间做字幕就开 Trueinitial_prompt给模型一段提示文本改善专有名词识别填入领域术语调优实战GPU 和 CPU 各 3 招GPU 线large-v2 实测把 float16 换成 int8_float16显存 4525MB 降到 2926MB1m03s 降到 59s。显存不够时这是第一优先开关。换 BatchedInferencePipeline 批量推理13 分钟音频从 1m03s 降到 17s约 6 倍代价是 batch_size8 时显存涨到 6090MB。多卡device_index[0,1] 配 num_workers多线程并发转不同文件。CPU 线small 模型实测int8 量化2m37s 降到 1m42s内存 2257MB 降到 1477MB。线程数拉到物理核数启动脚本时带上环境变量OMP_NUM_THREADS8 python3 transcribe.py内存够的话开 batch_size8 批量推理1m42s 降到 51s内存升到 3608MB。 跟别人比速度前先对齐 beam_size这里默认 5原版 whisper 默认 1和 CPU 线程数否则数字没可比性。坑点自诊5 个最常见的报错怎么处理现象大概率原因处置transcribe() 返回了却没任何输出segments 是生成器没被迭代包一层 list(segments) 或进 for 循环GPU 报找不到 cuDNN / cuBLASNVIDIA 库没装或 LD_LIBRARY_PATH 没导出按路线 B 操作先 export 再启动 Pythonctranslate2 加载失败CUDA 11 / cuDNN 8 环境新版只支持 CUDA 12 cuDNN 9装 ctranslate23.24.0CUDA11cuDNN8或 4.4.0CUDA12cuDNN8长音频同一段话反复输出模型陷入失败循环condition_on_previous_textFalse首次运行卡很久正在自动下载模型large-v3 约 3GB耐心等待或用 download_root 提前放置模型延伸方向批量推理、模型转换、生态集成批量场景直接用 BatchedInferencePipeline接口与 WhisperModel.transcribe 完全一致细节见faster_whisper/transcribe.py。自己有微调过的 Whisper 模型pip install faster-whisper[conversion]后用ct2-transformers-converter --model openai/whisper-large-v3 --output_dir whisper-large-v3-ct2 --quantization float16转换再把目录传给 WhisperModel。说话人分离、实时流式转写、字幕生成等需求WhisperX、whisper_streaming 等社区项目已基于 faster-whisper 封装好见 README 的社区集成清单。一条 pip 命令换 13 分钟音频 1 分钟转完。下一步把 tiny 换成 large-v3长音频记得开 vad_filter。【免费下载链接】faster-whisperFaster Whisper transcription with CTranslate2项目地址: https://gitcode.com/GitHub_Trending/fa/faster-whisper创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表