ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

Buzz 离线语音转文字完整指南:10 分钟把声音文件变成能用的文稿

Buzz 离线语音转文字完整指南:10 分钟把声音文件变成能用的文稿 Buzz 离线语音转文字完整指南10 分钟把声音文件变成能用的文稿【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz想象你在做田野调查一天访谈下来电脑里堆满了录音文件。没有网没有云端服务可传文字稿却要当晚交出来。Buzz 离线语音转文字就是为这种时刻准备的它把 OpenAI 的 Whisper 语音识别模型跑在你自己的电脑上把音频、视频变成可搜索、可编辑、可导出的文字。不上传、不联网、不限时长纯 CPU 就能跑有显卡还能再快一截。能力速览一张表看懂 Buzz 能干什么在动手之前先给你一张地图。Buzz 本质上是一个转录引擎给了你图形界面和命令行两个入口界面负责单个文件、实时录音命令行负责批量任务。能力能做什么适合谁文件转录导入音频/视频MP3、WAV、MP4、MOV…本地转成文字所有人起步功能实时录音转录说话的同时生成文字可开演示窗口投屏会议、演讲、直播字幕翻译一键转成英文或经 AI 翻译成任意语言外语内容整理者批量与自动化命令行批量加任务、文件夹监控自动转录有几十上百个文件的人转录加工双击改错、调时间戳、Resize 重组字幕行、导出 TXT/SRT/VTT/JSON做字幕、做文档的人说话人识别区分录音里谁说了什么可改名、可合并访谈、会议记录插件系统AI 摘要、降噪、导出 Word 等可扩展能力想定制流程的人语言覆盖上Whisper 模型自带约 99 种语言中英文到拉脱维亚语都有。下面走一遍最短路径。最短路径第一次转出文字只需 4 步第 1 步装好它。每个平台都有一条命令系统一条命令Windowswinget install ChidiWilliams.BuzzmacOSbrew install --cask buzzLinuxflatpak install flathub io.github.chidiwilliams.Buzz或sudo snap install buzz注意Windows 安装包未做代码签名安装时会弹安全警告。点更多信息 → 仍要运行即可这是正常现象。如果你是开发者想跑源码克隆仓库https://gitcode.com/GitHub_Trending/buz/buzz后按 README 装依赖即可。第 2 步导入文件只关心三个参数。菜单文件 → 导入媒体文件Ctrl/Cmd O或工具栏图标。弹窗里三个关键下拉框参数怎么选TaskTranscribe转成同语言文字Translate to English直接翻成英文Language知道什么语言就手动选自动检测偶尔翻车手动指定准确率更高Model新手无脑选small后面长录音转太慢一节细讲第 3 步点 Run。任务进队列主界面显示实时进度。文件越大、模型越大越久正常。第 4 步状态变 Completed 后双击任务行。进入转录查看器逐段带时间戳的文字可以直接搜索、播放、改错工具栏点导出就能拿到 TXT、SRT、VTT、JSON。第一份文字稿到手。到这里你掌握了 Buzz 的 80%。剩下 20% 按你的实际问题对号入座。长录音转得太慢等不起转录质量的分水岭在模型速度也是。Whisper 模型从小到大是tiny→base→small→medium→large每升一档更准也更慢更吃内存你的情况推荐低配电脑、看大意、实时录音tiny/base秒级出结果日常转录多数人small速度和准确率的甜点区口音重、术语多的专业录音medium/large建议有显卡内存吃紧想跑大模型Whisper.cpp 的量化版如q_5微小精度损失换速度后端whisper type也有讲究没有 N 卡或 Mac 用户选 Whisper.cppC 实现纯 CPU 也能跑实时转录N 卡显存 ≥ 6GB 选 Faster Whisper比原版快一个量级还想试多语种定制模型Meta MMS 等用 HuggingFace 后端。模型在偏好设置Ctrl/Cmd ,→ Models页管理左边已下载右边待下载勾选点 Download 即可还能粘贴自定义模型的.bin下载地址提前把常用模型拉好。两个加速细节N 卡用户在偏好里确认 CUDA 选项已启用large的转录时间能从小时级降到分钟级如果显卡老、反而拖后腿设环境变量BUZZ_FORCE_CPUtrue强制纯 CPU。国内下载模型慢就设HF_ENDPOINThttps://hf-mirror.com走镜像。开会、演讲要现场出字主界面切到 Live Recording 标签页选麦克风、语言、模型点红色 Record说话的同时文字一行行出来。注意实时转录吃性能官方明确建议用Whisper.cpp 后端 tiny或base小模型默认 Whisper 模型跟不上语速。三个让现场更好用的开关Append and correct 模式偏好设置里的录制模式会回头修正前面刚生成的句子更准但更吃硬件演示窗口Presentation Window录音开始后出现新选项把实时字幕投到外接屏做演讲字幕、直播辅助很顺手实时转录导出到文本文件打开后文字边生成边写入.txt直接接 OBS 做直播字幕。想转的不是话筒而是电脑里放出来的声音网课、会议软件装一个虚拟声卡把系统输出改道Windows 用 VB-CABLE把系统输出设成 CABLE InputBuzz 里麦克风选 CABLE OutputmacOS 用 BlackHole 建多输出设备Linux 用pavucontrol重定向。官方文档 docs/docs/usage/2_live_recording.md 有逐步图解。外语音频要的是我能懂的语言翻译有两条路一条离线、一条任意语言Translate to English任务类型直接选它任何语言的音频离线转出英文稿这是 Whisper 自带能力零配置任意目标语言偏好设置里填一个 OpenAI 兼容的 API 地址和密钥在转录查看器点Translate给 AI 一句指令例如你是专业译者把英文翻成西班牙语只翻译、不加注释。本地跑 Ollama、LM Studio 的兼容模型也能接上等于搭一条全离线翻译管线。提示约 1 小时音频用云端模型翻译成本在 1 美元量级想完全免费把翻译模型也跑在本地。字幕断句不自然一行长到离谱这是转录后最常见的返工。解法是两件事配合转录时就勾选Word-Level Timings词级时间戳——事后无法补这一步决定后面能不能用 Resize查看器工具栏点Resize设字幕最大长度、按标点分割、按静音间隙合并一键把碎词重组成规整的字幕行。顺手记下几个快捷键校对效率翻倍Ctrl/Cmd P播放/暂停Ctrl/Cmd ←/→微调当前段开始时间Ctrl/Cmd Shift ←/→调整结束时间。双击文本单元格直接改字改完自动保存。一个文件夹几十个音频不想一个个点图形界面之外还有命令行入口。buzz add一次丢多个文件参数按需求加buzz add --task transcribe --model-type whispercpp --model-size small --srt --vtt 访谈1.mp3 访谈2.wav这条命令用 Whisper.cpp 的 small 模型转录两个文件并直接输出 SRT 和 VTT 字幕。常用参数--language zh指定语言--prompt 专有名词提示减少错字--task translate做翻译。配合系统定时任务夜里跑一个文件夹早上起来直接收稿详细参数见 docs/docs/cli.md。再往上还有两层自动化文件夹监控偏好设置里开一个目录新文件落进去自动转录Skip Already Transcribed 插件重导文件夹时跳过已转过的不重复烧算力。另外访谈录音里分不清谁说的谁查看器里点Identify speakersBuzz 会把不同说话人的句子标上标签你能试听 10 秒原声、把标签改成真人姓名保存时还能勾选把同一人的连续句子合并成段。只记一张表你的情况怎么选如果你是…就这样配老笔记本 / 没有显卡Whisper.cpp 后端 small量化版q_5再省内存N 卡且显存 ≥ 6GBFaster Whisper medium/large开 CUDA要实时录音出字Whisper.cpp tiny/base别用默认后端要中文以外语言的翻译本地 Ollama / LM Studio 接上全离线文件多、要重复跑命令行buzz add 文件夹监控 跳过已转插件涉密、完全不能联网在别的机器下好模型拷到本机模型目录离线可用回到开头现在就把那段录音变成稿子回到开头那个山村访谈的场景——其实不需要走到山里你手头现在就有一段转不动的录音客户电话、外语课、采访现场。打开 Buzz导入它手动选好语言模型选small点 Run。等状态变成 Completed双击导出。你拥有的不再是一段再也听不全的录音而是能搜索、能编辑、能导出的文字资产。觉得顺手去项目仓库点个 Star遇到的问题和想法也欢迎反馈给社区。Buzz 的文件夹监控、更多语言模型、AI 摘要等能力还在持续迭代这套本地转录工作流值得成为你工具箱里的常驻成员。【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表