ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

faster-whisper-GUI 完整教程:免费离线语音转文字,支持说话人识别与字幕导出

faster-whisper-GUI 完整教程:免费离线语音转文字,支持说话人识别与字幕导出 faster-whisper-GUI 完整教程免费离线语音转文字支持说话人识别与字幕导出【免费下载链接】faster-whisper-GUIfaster_whisper GUI with PySide6项目地址: https://gitcode.com/gh_mirrors/fa/faster-whisper-GUIfaster-whisper-GUI 是一款基于 faster-whisper 引擎的离线语音转文字工具。把音频或视频文件丢进去它输出带时间戳的文字稿还能做说话人识别、导出七种字幕格式。全部计算在本地完成不收费敏感录音不用离开你的机器。功能点解决什么问题所在章节模型与设备选择决定转写跑多快、认得多准参数设置转写核心四参数压低错字率和重复乱码参数设置批量转写一个文件夹的录音一次跑完跑任务WhisperX 说话人识别分清这句话是谁说的跑任务表格纠错与七种格式导出改完错字输出 SRT、LRC 等成品拿结果Demucs 人声分离嘈杂录音先把人声拆出来再转进阶玩法跑起来从克隆代码到看到界面整个流程只需要几行命令。克隆仓库装好依赖直接启动主程序即可git clone https://gitcode.com/gh_mirrors/fa/faster-whisper-GUI cd faster-whisper-GUI pip install -r requirements.txt python FasterWhisperGUI.py启动后是一个 Fluent 风格的桌面窗口界面语言和主题色都能在设置里换。别急着转写先打开左侧的模型参数页把引擎配好——这一步直接决定后面所有转写的速度和准确率。参数设置先定模型再调转写选项按硬件选模型档位与设备模型档位是最影响结果的选项按下表选就行选项默认建议什么时候改模型大小日常用 small 或 medium追求专业级精度再上 medium 或 large-v3计算设备有 NVIDIA 显卡选 cuda否则选 cpu换机器后核对设备匹配计算精度float16 快int8 省内存float32 最稳float16 出现异常就退回 float32CPU 线程数默认 4多核机器可按核心数翻倍转写明显提速模型支持从 Hugging Face 自动下载也可以直接指向本地模型目录加载。加载过程界面有明确的进度状态看到模型已加载再开始下一步。最值得调的四个转写参数转写参数页的选项很多真正左右结果的是下面四个参数建议取值作用language选 Auto 或直接指定 zh / en直接指定可省掉前 30 秒的语言检测temperature正式内容压到 0.2~0.3值越低输出越老实自由采访可放到 0.5 左右vad_filter开启Silero VAD 自动跳过静音段省时且减少无意义输出word_timestamps做字幕就开生成单词级时间戳是卡拉 OK 歌词导出的前提跑任务从单文件到批量与说话人分离单文件转写在执行转写页选择转写文件把文件加入列表后点开始下方区域会按[起始 -- 结束] 文本的形式实时回显带时间戳的结果处理状态在列表里随时可见。批量转写整个文件夹丢进去文件列表支持一次添加几十个文件排队执行还能用过滤规则排除非音频文件中途想剔除某个文件单点删除就行。几小时的录音批量跑放那里让它自己转完即可。WhisperX 说话人识别怎么开多人场景下最有价值的是 WhisperX它在转写之外做时间戳对齐和说话人识别两步后处理。在WhisperX页勾选 Speaker Diarize结果里每段话就会带上说话人标记words 列还能看到单词级时间戳。右下角的 min speaker / max speaker 可以限定说话人数量区间。识别结果太碎或把一个人拆成两个时收紧这个区间重跑一遍通常就能收敛。拿结果表格纠错与七种导出格式转写完成后结果以表格呈现开始时间、结束时间、文本开启对齐后还有 words 列。哪行不对就选中直接改时间戳和文字都能在线编辑改完再导出。格式适用场景SRT通用字幕格式几乎所有播放器都认VTT网页与在线视频平台使用ASS需要样式化排版字体、定位的高级字幕LRC音乐歌词配合单词时间戳可做逐字滚动卡拉 OKSMI老版本 Windows Media Player 的字幕格式TXT纯文本存档方便二次编辑JSON结构化数据适合程序化二次处理如果转写时打开了 word_timestamps导出的 LRC 丢进支持歌词插件的播放器就是逐字高亮的卡拉 OK 效果拿来当听力训练素材很顺手。进阶玩法Demucs 人声分离录音背景嘈杂、人声被音乐盖住时别直接转。先切到 Demucs 页把人声从混合音轨里分离出来——可选 vocals、鼓点、贝斯等单轨也有 All Stems 全部分离选项——再拿分离后的纯人声去转写。这个先分离、再转写的顺序对访谈和现场录音能明显提升识别率。分离逻辑在 de_mucs.py 模块里内置的 whisperx 后处理代码放在 whisperx/ 目录想深挖都可以直接读。常见问题首次下载模型太慢怎么办大模型首次加载完全看网络。稳妥做法是提前把模型放进本地缓存目录然后在界面走使用本地文件加载彻底绕开下载环节。纯 CPU 能用吗能。medium 及以下的模型在 8 核 CPU 上跑得动只是比 GPU 慢。按自己的硬件选档位别硬上大模型。转出来一堆重复乱码怎么办大概率是温度或 VAD 没调对。把 temperature 回落到 0.2~0.3同时打开 vad_filter 过滤静音段输出一般立刻恢复正常。日韩粤等语言断词奇怪无空格语言在工程里配了专门的标点与分词处理逻辑详见 参数说明.md。按对应语言直接选就行不要用英文的规则去套。faster-whisper-GUI 把 faster-whisper 的全部进阶参数装进了图形界面新手照着默认值点开始就能跑通老手每个旋钮都能拧。 挑一段手边的录音按配模型 → 调参数 → 跑转写 → 导出结果走一遍十几分钟后就能拿到第一份带时间戳的文字稿 【免费下载链接】faster-whisper-GUIfaster_whisper GUI with PySide6项目地址: https://gitcode.com/gh_mirrors/fa/faster-whisper-GUI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表