ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

faster-whisper:把 13 分钟音频转写压到 17 秒

faster-whisper:把 13 分钟音频转写压到 17 秒 faster-whisper把 13 分钟音频转写压到 17 秒【免费下载链接】faster-whisperFaster Whisper transcription with CTranslate2项目地址: https://gitcode.com/GitHub_Trending/fa/faster-whisper你有一段 40 分钟会议录音晚饭前要拿到逐字稿。faster-whisper 是用 CTranslate2 重写的 OpenAI Whisper 语音转写引擎同等精度下最高快 4 倍、更省内存。它适合想在 CPU 或 N 卡上做离线语音转写的你。60 秒跑通from faster_whisper import WhisperModel model WhisperModel(large-v3, devicecuda, compute_typefloat16) segments, info model.transcribe(audio.mp3, beam_size5, vad_filterTrue) print(f检测语言 {info.language}概率 {info.language_probability:.2f}) for seg in segments: print(f[{seg.start:.2f}s - {seg.end:.2f}s] {seg.text})跑完你应该看到两类输出检测语言 zh概率 0.99 [0.00s - 3.52s] 大家好我们开始今天的会议。到这里一份带时间戳的逐字稿就已经到手。为什么它比原版快 ⚡原版 openai/whisper 处理 13 分钟音频要 2 分 23 秒faster-whisper 把推理引擎换成了 CTranslate2≈ 把通用引擎换成更省力的专用推理引擎降到 1 分 03 秒。音频解码也换成了自带解码器的库等于把解码能力打包进安装包里系统里不用额外装任何东西。faster-whisper 显存占用下表是同一份 13 分钟音频、large-v2 模型在 GPU 上的仓库基准数据实现方式精度耗时显存openai/whisperfp162m23s4708MBfaster-whisperfp161m03s4525MBfaster-whisperbatch_size8fp1617s6090MBfaster-whisperint859s2926MB代价批量那一行显存从 4525MB 涨到 6090MBint8 换来省显存的同时精度有轻微取舍新版推理引擎还锁定了 CUDA 12 cuDNN 9 的组合。装环境三条命令 两个坑 pip install nvidia-cublas-cu12 nvidia-cudnn-cu129.*—— 有 N 卡先装这两个 GPU 运行库无卡则跳过这步直接走 CPU。pip install av—— 音频解码组件官方预编译 wheel 装完就能读 mp3 / wav / m4a。pip install faster-whisper—— 本体一行带齐 ctranslate2、tokenizers、onnxruntime。如果 import 时提示推理引擎版本冲突说明环境里残留旧版用pip install --force-reinstall ctranslate24.4.0锁定版本即可。如果 GPU 加载报 cuDNN 找不到或 CUDA 版本错误说明库路径没进环境变量或版本对不上Linux 上先给 Python 启动前把 nvidia 库目录加进环境变量CUDA 11 的老环境则退回 3.24.0 旧版。调参从能跑到跑好beam_size默认 5控制束搜索解码的候选路径数。音频短、要快可以降到 12正式出稿保持默认 5。vad_filter默认 True内置的 Silero VAD 会先把没声音的段落剪掉再送模型≈ 把静默剪掉模型不用白算。录音长、说话占比低时把最短静音时长从默认 2 秒收紧到 0.5 秒能少算不少空段。word_timestamps默认 False。做字幕、要每个词的起止时刻时改成 True每句的 words 里就带单独时间戳。compute_type在加载模型时传有卡用 float16无卡用 int8显存紧张再上 int8_float16 混合量化。faster-whisper 批量转写音频很长或一次处理多段时该从单条切到批量from faster_whisper import WhisperModel, BatchedInferencePipeline model WhisperModel(turbo, devicecuda, compute_typefloat16) pipeline BatchedInferencePipeline(modelmodel) segments, _ pipeline.transcribe(audio.mp3, batch_size16)把片段攒成批一次喂给模型比逐句解码快一个量级仓库基准里 13 分钟 large-v2 fp16 就是这么从 1 分 03 秒压到 17 秒的且批量模式默认开启 VAD。常见卡点速查segments调用后马上打印什么都没有 → 它是生成器解码只在你遍历它时发生 → 先用segments list(segments)跑完。音频解码库安装时触发本地源码编译失败 → pip 拉到了源码包而不是 wheel →pip install av换官方预编译包重装Windows 上别硬编译。GPU 加载报 cuDNN not found → cuBLAS / cuDNN 9 没装或不在搜索路径 →pip install nvidia-cublas-cu12 nvidia-cudnn-cu129.*并把库目录加入环境变量。老环境里启动报 CUDA 版本不匹配 → 新版推理引擎只认 CUDA 12 cuDNN 9 →pip install --force-reinstall ctranslate23.24.0降级。CPU 转写又慢又占内存 → 用的是默认浮点精度 → 构造模型时传compute_typeint8small 模型内存能从 2257MB 降到 1477MB。下一步看哪想查 hotwords、clip_timestamps 等全部解码开关时看 transcribe.py 的 transcribe 参数表。需要微调 VAD 静音切分行为时看 vad.py 里 VadOptions 的默认值和含义。想复现上文表格里的数字时直接跑 benchmark/speed_benchmark.py。【免费下载链接】faster-whisperFaster Whisper transcription with CTranslate2项目地址: https://gitcode.com/GitHub_Trending/fa/faster-whisper创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表