ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

Buzz 如何把本地音频转成文字:免费离线 Whisper 转写与 SRT 字幕导出指南

Buzz 如何把本地音频转成文字:免费离线 Whisper 转写与 SRT 字幕导出指南 Buzz 如何把本地音频转成文字免费离线 Whisper 转写与 SRT 字幕导出指南【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzzBuzz 是一款免费开源的本地语音转文字工具基于 OpenAI Whisper 模型把音频或视频整段转写、翻译成带时间轴的文字稿全程离线跑在你自己的电脑上——文件不上传也没有按分钟、按字符的计费。第一次接触离线转录的人读完这篇能装好它、导出第一份 SRT 字幕还会顺带学会实时录音转写。 四个转写后端先按你的硬件挑一个装好 Buzz 之前先搞清楚它靠什么干活。Buzz 内置了多套 Whisper 推理后端转写时选哪个直接决定速度和资源占用后端特点适合场景Whisper默认OpenAI 原始实现准确但慢、吃内存不折腾直接上手Whisper.cppC 实现支持 Vulkan GPU 加速核显也能跑有显卡想提速或笔记本做实时转写Faster Whisper优化版速度快得多吃显存N 卡显存 6GB 以上Hugging FaceTransformers 实现能加载 Parakeet、Qwen3-ASR 等第三方模型1.4.5 起想试新模型、针对特定语言优化另外还能接 OpenAI Whisper API 在远程跑不占本机资源。没有 N 卡的话Whisper.cpp 是最稳的选择连网不便也不怕模型可以先在别的机器上下载好再拷过去离线机器照样用。 四大系统安装方法各有一条最短路径这一节的目标只有一个让你尽快看到 Buzz 的界面。macOS下载.dmg拖进应用程序即可。注意新版已转向 Apple Silicon最后一个支持 Intel Mac 的版本是 1.4.5。Windows下载官方安装程序按提示装。安装包未签名系统会弹警告——选More info → Run anyway就能继续。Linux终端跑sudo snap install buzz或flatpak install flathub io.github.chidiwilliams.Buzz。Python 包pip install buzz-captions装好后执行python -m buzz适合装服务器上跑自动化。需要 Python 3.12 和 ffmpeg。装完第一次打开去 偏好设置Help → Preferences快捷键 Ctrl/Cmd ,的模型页面下载你要用的模型档位从 Tiny 到 Large 都有本地已下载的和可下载的列得很清楚。详见官方安装文档。▶️ 第一次转写从导入文件到 Completed装好之后跑通第一个任务只要四步。打开File → Import Media File或直接按CtrlO选中一个音频或视频文件贴 YouTube 链接它也能拉下来处理。批量导入几十个文件也是同一个流程排队跑就行。选任务类型Transcribe转写或Translate翻译手动指定语言再选模型档位。语言强烈建议手动指定官方文档也提醒自动检测偶尔会翻车。点Run回主界面看状态列从排队到Completed即完成。双击那一行转录详情页打开后面的编辑、校对、导出都从这里进。一个容易忽略的细节如果转写老是拼错人名、术语打开导入表单里的Advanced...把容易错的词写进Initial prompt准确率会明显改善。✂️ 把转写稿整理成能用的 SRT 字幕这一章解决最实际的痛点Whisper 切出来的句子长短不齐有的占半屏有的只有几个字直接导出没法用。关键动作在导入时就做勾上Word-Level Timings词级时间轴。之后再点转录页工具栏的Resize进调整对话框——设定单条字幕的最大长度可以按标点智能断句只要原音频还在本机它还会分析音频里的静音间隙把过短的碎片合并掉。字幕停留时间太短可以给每条片段统一往后延若干秒。调好之后点工具栏的导出菜单TXT、SRT、VTT 都能选做字幕就导 SRT 丢进剪辑软件当笔记就导 TXT。转录页本身是个好用的校对台每段带起止时间点哪段就跳到哪段音频边播边改按CtrlF开搜索播放速度支持 0.5x 到 2x 调节长音频校对不用硬听原速。️ 实时录音转写麦克风一接文字跟着走会议、授课、采访现场要的是「即说即所得」。在实时录音界面选好任务、语言、模型和麦克风点Record说的话就变文字滚出来。三个实用细节默认 Whisper 模型做实时转写很吃资源官方建议换 Whisper.cpp 后端走 GPU 加速并选小一档的模型保实时性。Queue 面板是观察窗口实时模式用「Append and correct」时如果队列越堆越长把Transcription step调大一点负载立刻下来步长越短延迟越低但压力越大这是官方给出的取舍。Presentation window开始录音后会出现这个选项能把实时字幕投到大屏上讲者、主持人的场景直接可用。对现场记录的人最有用讲座讲师、活动主持、需要当场出纪要的采访者。 外语内容变中文两条翻译路线Whisper 自带翻译任务类型选Translate to English转录结果直接变英文纯本地、不花钱。局限是只到英文为止。AI 翻译到任意语言走 OpenAI 兼容 APIOpenAI、Ollama 等本地模型都支持。在偏好设置里配好 Base URL 和 Key再在转录页点工具栏的Translate按钮把目标语言写进提示词即可。官方文档给的参考用 ChatGPT 或 Claude 级别模型翻 1 小时音频成本大约 1 美元。外语播客转中文字幕、跨语言会议纪要走第二条路就行。⚙️ 进阶用法监控文件夹、CLI 与插件系统三个「装一次、省很多事」的玩法文件夹监控自动转录指定一个文件夹新音频丢进去 Buzz 自动开转。团队协作很合适——同事往共享目录扔录音文字稿自己出来。命令行接口Buzz 提供 CLI支持直接指定输出 SRT/VTT、Initial prompt 等参数适合写脚本做自动化细节在官方 CLI 文档里。插件系统1.4.5 版本起提供Help → Plugins里可开关、拖拽排序、按 URL 添加社区插件贴一个 .zip 链接即可。内置有 AI 摘要生成、Enhanced Language Detection、转录导出 Word.docx、Resize Transcript按静音间隙重新分组字幕、Skip Already Transcribed文件已转过就跳过适合监控文件夹时避免重复跑。写法可以参考buzz/plugins/目录下的源码。️ 四个常见症状怎么处理转得太慢→ 先换小一档的模型有 N 卡就上 GPU 加速1.4.6 起可在 Help → About Buzz 里单独装 CUDA 加速别并行塞太多任务抢资源。转出来错得多→ 先治录音本身导入时打开Extract speech把人声单独提取出来仍不理想就换大一号的模型重跑人名术语老错写进 Initial prompt。实时转写越来越卡→ 盯 Queue 面板涨得快就把 Transcription step 调大实时性要求不高的话直接换更小模型。Windows 装的时候弹警告→ 不是坏了是安装包未签名按提示 More info → Run anyway 继续即可。✅ 现在就可以开始免费、离线、开源音频从头到尾留在本机也不产生任何按量费用。下一步就一件事按前面四种方式之一装好 Buzz把一个音频文件拖进去勾上 Word-Level Timings 点 Run等 Completed 出现后双击打开详情页导出你的第一份 SRT。【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表