faster-whisper 等语音转文字的python包,支持gpu和cpu模式 一、先解决 faster-whisper 安装失败问题1. 分开执行命令不要一次性管道过滤方便看完整报错打开 CMD依次执行C:/Python/Python312/python.exe -m pip install --user faster-whisper如果网络超时/下载失败换国内清华镜像源加速安装C:/Python/Python312/python.exe -m pip install --user faster-whisper -i https://pypi.tuna.tsinghua.edu.cn/simple2. 安装前置依赖必装否则运行报错、识别差① 安装 ffmpeg音频解码必备Windows 最简单方式用 winget自带winget install ffmpeg② 匹配 CUDA 的 PyTorchGPU加速无GPU可跳过C:/Python/Python312/python.exe -m pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu121二、安装成功后large-v3 指定中文 language“zh” 完整代码faster-whisper 标准写法比原生openai-whisper更快、显存更低fromfaster_whisperimportWhisperModel# 加载 large-v3 模型device自动识别cuda/gpu无显卡填 cpumodelWhisperModel(model_size_or_pathlarge-v3,deviceauto,compute_typedefault)# 转录音频强制中文segments,infomodel.transcribe(audio你的音频文件.mp3,languagezh,# 强制中文识别解决中文不准tasktranscribe,vad_filterTrue# 人声降噪杂音大幅降低识别错误)# 遍历输出带时间戳字幕forseginsegments:print(f[{seg.start:.2f}-{seg.end:.2f}]{seg.text})三、如果坚持用原版 openai-whisper 代码对比参考importwhisper modelwhisper.load_model(large-v3)resultmodel.transcribe(音频.mp3,languagezh,verboseFalse)print(result[text])四、中文识别不准额外优化方案开启 vad_filterTruefaster-whisper独有过滤静音、背景噪音提升中文准确率音频预处理尽量使用 16kHz、单声道 wav 格式录音降噪后再转录模型必须large-v3small/base 中文方言、口语识别很差短分段音频不要超过30分钟过长会出现上下文错乱五、安装常见报错处理提示权限不足保留命令里的--user参数就是安装到当前用户目录不需要管理员权限内存/显存不足无法加载 large-v3临时替换model_size_or_pathmedium精度下降但硬件要求低No module named faster_whisper确认你运行代码用的解释器是C:/Python/Python312/python.exe不要用系统其他Python版本下载模型缓慢第一次运行会自动在线下载 large-v3 权重可手动下载模型放到本地通过本地路径加载modelWhisperModel(rC:\model\large-v3)结论不需要GPU也能跑纯CPU完全可用只是速度巨慢1. CPU 运行完整可行faster-whisper / openai-whisper 都支持代码不用改仅手动指定devicecpufromfaster_whisperimportWhisperModel# 强制CPU运行无显卡电脑专用modelWhisperModel(large-v3,devicecpu,# 关键指定CPUcompute_typeint8# CPU专用量化降低内存占用、提速)segments,_model.transcribe(audio.mp3,languagezh,vad_filterTrue)forsinsegments:print(f{s.start}~{s.end}{s.text})2. CPU 跑 large-v3 的痛点很关键速度极慢GPU1660/306010分钟音频 ≈ 1分钟转完普通CPUi5/i7笔记本10分钟音频2060分钟内存占用极高large-v3 量化int8也要占用6~8GB内存电脑内存8G会卡顿、程序崩溃。长时间转录电脑风扇狂转、发热严重3. 无GPU电脑两套折中方案方案A换小模型牺牲精度换速度推荐低配电脑不用large-v3改用medium/small内存、耗时减半modelWhisperModel(medium,devicecpu,compute_typeint8)缺点方言、嘈杂录音、专业词汇识别准确率下降。方案B仅用large-v3处理重要短音频只拿几分钟以内的音频用large-v3长音频先用medium快速粗转。4. compute_type 参数区分 CPU/GPUCPU 固定用compute_typeint8唯一流畅的量化格式NVIDIA GPUcompute_typefloat16速度最快AMD显卡/无显卡只能走CPU int85. 补充安装不需要GPU安装faster-whisper、ffmpeg、torch 全程和显卡无关PyTorch 就算没有CUDA显卡也会自动安装CPU版本不影响安装流程。6. 如果你安装失败和GPU无关安装报错基本只有3类网络差下载包超时 → 加-i 清华源缺少VC运行库Windows→ 安装微软VC Redist磁盘空间不足large-v3模型文件6G左右预留空间纯CPU、中文准、速度快 3套方案按推荐优先级排序方案1faster-whisper distil-large-v3最推荐平衡速度中文精度核心优势完全不需要GPUCPU int8量化深度优化distil-large-v3 是 large-v3 蒸馏轻量化版本中文准确率接近原版large-v3速度快23倍内存直接减半自带VAD静音过滤、自动标点、多方言兼容你已经在装这个库不用换全新依赖上手成本最低。安装你之前的命令加清华源保证成功C:/Python/Python312/python.exe -m pip install --user faster-whisper -i https://pypi.tuna.tsinghua.edu.cn/simple先装ffmpeg音频解码必装Windows管理员CMDwinget install ffmpeg纯CPU最优代码distil-large-v3 int8量化强制中文fromfaster_whisperimportWhisperModel# CPU专用最优配置modelWhisperModel(model_size_or_pathdistil-large-v3,# 轻量化大模型中文强、速度快devicecpu,compute_typeint8,# CPU必须int8内存减半、提速30%cpu_threads6,# 根据你的CPU核心数调整4核填46核填68核填8num_workers1)# 转录参数优化大幅提升中文识别、降噪提速segments,infomodel.transcribe(audiotest.mp3,languagezh,# 强制中文解决乱码、识别跑偏vad_filterTrue,# 过滤空白杂音减少无效计算、提升准确率beam_size4,# 平衡速度与准确度别开到5以上word_timestampsFalse,temperature0.0)# 输出带时间戳字幕forseginsegments:print(f[{seg.start:.2f}~{seg.end:.2f}]{seg.text})速度内存参考普通笔记本i5-12400纯CPUlarge-v3 int810分钟音频 ≈ 4060分钟内存7GBdistil-large-v3 int810分钟音频 ≈ 1218分钟内存3.5GB左右中文识别差距极小日常会议、采访、短视频完全够用。低配电脑内存不足折中内存6G换成medium模型model_size_or_pathmedium10分钟音频58分钟跑完普通话清晰录音效果很好嘈杂环境略差。方案2阿里FunASR SenseVoice-Small纯CPU天花板中文原生优化比Whisper更快核心优势专门针对中文优化CPU速度碾压Whisper达摩院自研原生普通话、粤语、四川话、带口音中文优化自动加标点、数字转换int8量化后仅几百MB4核笔记本CPU可2倍实时速度10分钟音频5分钟转完内置VAD降噪嘈杂录音识别远好于同尺寸Whisper完全离线不需要GPUWindows完美兼容。安装命令C:/Python/Python312/python.exe -m pip install --user funasr modelscope -i https://pypi.tuna.tsinghua.edu.cn/simple最简CPU中文转写代码fromfunasrimportAutoModel# 轻量中文专用模型纯CPUmodelAutoModel(modelspeech_paraformer_asr_nat-zh-cn-16k-common-vocab8404-pytorch,devicecpu)resmodel.generate(inputtest.mp3)print(res[0][text])缺点不支持多语言翻译只适合纯中文场景没有细分字幕时间戳需额外配置。方案3Moonshine极致轻量化老旧低配电脑专用适合内存4G、老笔记本tiny/base模型秒加载但嘈杂录音、专业词汇识别弱只适合清晰单人录音不作为主力。三套方案对比纯CPU场景方案中文准确率10分钟音频耗时(i5)内存占用适合场景faster-whisper distil-large-v3★★★★★1218分钟3.5G通用首选会议、采访、视频字幕、多口音FunASR SenseVoice★★★★☆46分钟0.8G纯中文大批量快速转写、嘈杂录音faster-whisper medium★★★☆58分钟2G内存不足低配电脑清晰录音原版large-v3★★★★★4060分钟7G不推荐纯CPU太慢纯CPU提速关键设置必看永远不要用compute_typefloat32CPU必须int8cpu_threads设置成你CPU物理核心数不要超过音频提前转成16kHz 单声道wav大幅减少解码耗时开启vad_filterTrue静音片段直接跳过提速提升识别不要开启word时间戳关闭多余功能节省算力。你现在的最优操作步骤先安装faster-whisperffmpeg直接使用distil-large-v3模型不要原生large-v3复制上面完整CPU代码运行强制languagezh内存不够就降级为medium模型。

本月热点