ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

faster-whisper 安装配置与上手指南:三步跑通第一条语音转录

faster-whisper 安装配置与上手指南:三步跑通第一条语音转录 faster-whisper 安装配置与上手指南三步跑通第一条语音转录【免费下载链接】faster-whisperFaster Whisper transcription with CTranslate2项目地址: https://gitcode.com/GitHub_Trending/fa/faster-whisperfaster-whisper 是 OpenAI Whisper 语音识别模型的 CTranslate2 重写版识别准确率不变的前提下转录速度最高快 4 倍内存占用更低。如果你用原始 whisper 跑十几分钟的音频要等很久或者显存/内存吃紧这个包就是为此准备的。本文带你从零装好它并跑通第一条转录全程约 10 分钟。开工前的环境自检表照着打勾即可全绿再往下走✅ Python 3.9 或更高版本包声明为3.93.8 装不上✅ pip 可正常使用✅ GPU 路径NVIDIA 显卡 CUDA 12 cuDNN 9CPU 路径可跳过本项✅ 磁盘留够 1~2GB首次运行会下载模型large-v3 级别的权重体积不小✅ 内存预期GPU 上 large-v2 用 fp16 约占 4.5GB 显存切 int8 可压到约 2.9GBCPU 上 small 模型 int8 约占 1.5GB 内存一个小好消息不需要单独装 FFmpeg。音频解码由依赖里的 PyAV 完成它把 FFmpeg 的库打包进了 pip 包里。最短安装路径两条命令先建一个干净的虚拟环境避免污染全局依赖然后用一条命令装包。装完无需任何手工配置首次转录时模型权重会从 Hugging Face Hub 自动拉取并缓存。python3 -m venv fw-env source fw-env/bin/activate # Windows 下为 fw-env\Scripts\activate pip install faster-whisper当前稳定版为 1.2.1底层依赖ctranslate24.0,5装包时会自动按版本区间解析不用手动指定。首次运行验证5 行代码确认装好了挑一段音频仓库里就有现成的tests/data/jfk.flac加载最小的 tiny 模型跑一遍。选 tiny 是因为它只有 39M 参数几秒就能下完、CPU 也能跑专门用来验证链路是否打通from faster_whisper import WhisperModel model WhisperModel(tiny, devicecpu, compute_typeint8) segments, info model.transcribe(jfk.flac) print(info.language, info.language_probability) for s in segments: print(f[{s.start:.2f}s - {s.end:.2f}s] {s.text})预期先打印一行en 0.99左右随后逐行输出形如[0.00s - 2.18s] And so my fellow Americans ...的时间戳文本。能打出时间戳安装即成功。⚠️ 有个容易卡住的细节transcribe返回的segments是生成器你不迭代它转录就不会真正开始。想拿到完整结果用list(segments)或for循环把它消费掉。进阶配置参数按需取值日常场景下device加compute_type两个参数就够常用取值如下运行环境compute_type 取值适用场景GPUCUDA 12float16追求精度显存够large-v2 约 4.5GBGPUCUDA 12int8_float16显存紧张内存省近四成CPUint8内存受限的主力选择small 模型约 1.5GBCPUdefaultfp32内存充足且想留精度余量其他几个按需调的旋钮线程数CPU 模式默认 4 线程用cpu_threads参数或直接OMP_NUM_THREADS8 python3 my_script.py调核心越多越划算。beam_size本库默认 5原始 whisper 默认 1对比速度前必须对齐这个值。VAD 静音过滤vad_filterTrue开启后默认只剔除 2 秒以上的纯静音改vad_parametersdict(min_silence_duration_ms500)可调得更激进。批量转录多段音频用BatchedInferencePipeline(model, batch_size8)它是WhisperModel.transcribe的替代入口长音频下提速明显README 实测 13 分钟音频从 1 分 03 秒压到 17 秒。自定义模型自己微调过的 Whisper 权重需要先用ct2-transformers-converter转成 CTranslate2 格式依赖transformers[torch]4.23转换后把本地目录直接传给WhisperModel(whisper-large-v3-ct2)即可。高频问题 QA问题一加载 large 模型就报显存不足OOM现象devicecudafloat16跑 large-v2/v3 直接 OOM。原因fp16 下 large 级模型常驻约 4.5GB 显存8GB 卡还要留给激活值。解决compute_type换int8_float16约 2.9GB或者退到 small 模型 batch_size调小。问题二GPU 报 cuBLAS/cuDNN 加载失败现象启动 CUDA 设备时找不到 NVIDIA 库。原因本机 CUDA/cuDNN 版本与 ctranslate2 不匹配——最新版只支持 CUDA 12 cuDNN 9。解决对照降级CUDA 11 cuDNN 8 用pip install --force-reinstall ctranslate23.24.0CUDA 12 cuDNN 8 用ctranslate24.4.0也可以装官方镜像nvidia/cuda:12.3.2-cudnn9-runtime-ubuntu22.04省掉手工装库。问题三transcribe 调用后程序「卡住」不动现象调了model.transcribe却迟迟不输出。原因返回值是生成器转录在首次迭代时才触发。解决segments list(segments)或放进for循环逐段打印。问题四想给长音频提速现象单个transcribe跑长音频偏慢。原因单段推理没有利用批处理。解决改用BatchedInferencePipeline并设batch_size8~16注意它默认自带 VAD 过滤CPU 场景记得同时调高cpu_threads。收尾装好、跑通 tiny、按场景选好compute_typefaster-whisper 的主力用法就到手了。想继续深挖全部转录参数在faster_whisper/transcribe.py的WhisperModel类定义里VAD 各参数默认值见faster_whisper/vad.py。【免费下载链接】faster-whisperFaster Whisper transcription with CTranslate2项目地址: https://gitcode.com/GitHub_Trending/fa/faster-whisper创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表