
Buzz 离线音频转录完整指南本地 Whisper 识别三分钟导出字幕文件【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzzBuzz 是一款基于 OpenAI Whisper 模型的本地离线音频转录工具。音频和视频文件在你自己的电脑上完成识别与翻译不需要上传不按时长收费。这篇指南从安装讲到字幕导出帮你把一套可重复的本地转录流程搭起来。Buzz 本地转录功能一览表功能点解决的问题适用场景音视频文件转录把长录音、课程视频转成文字访谈整理、课程笔记YouTube 链接导入省去手动下载音频的步骤给视频补字幕麦克风实时转录说话的同时出文字会议纪要、直播字幕SRT / VTT 字幕导出生成可直接用于剪辑的字幕文件视频剪辑、平台发布说话人识别多人对话自动区分发言者播客、访谈录音文件夹监控新文件落盘后自动转录批量素材、固定工作流首次上手Buzz 安装与第一个转录结果安装 Buzz 桌面版Windows双击安装包按向导走。软件未签名安装时会有安全提示点更多信息再选仍要运行即可。macOS安装对应的 .dmg 文件。LinuxFlatpak 或 Snap 一条命令即可装上。开发者路线pip install buzz-captions需要 Python 3.12 环境和 ffmpeg。安装包均从官方发布渠道下载渠道说明见 README.md。导入素材并配置转录参数导入文件有三种方式点工具栏上的按钮、从 File 菜单选 Import Media File、按CtrlOmacOS 为CmdO。也可以直接把文件拖进窗口或粘贴 YouTube 链接。导入后在面板里设置四项选项建议TaskTranscribe 输出原语言Translate to English 输出英文Language已知语言就手动指定比自动检测更稳ModelTiny 到 Large 可选未下载的模型可先在设置里下载Export As默认 TXT需要字幕就勾上 SRT 和 VTT官方建议能确定语言就不要依赖自动检测见 文件导入文档。运行任务并拿到转录结果点Run任务进入队列多个文件会排队并发处理。状态变成 Completed 后双击列表行打开转录查看器逐句文本带时间戳可以直接查看、复制、搜索和导出。场景能力地图Buzz 离线识别能覆盖哪些用法文件本地转录MP3、WAV、FLAC、MP4 等常见格式都能直接导入。产出是逐句、带时间戳的文本。查看器里可以播放原音频、调节 0.5 倍到 2.0 倍速、按CtrlF搜索关键词定位到对应句子。跨语言翻译把 Task 设为Translate to English非英语音频直接输出英文文本。另外 Buzz 支持 AI 翻译到任意语言在 Preferences 里配置 OpenAI 兼容的 API也可以指向本机运行的 Ollama、LM Studio翻译完全不出局域网。生成 SRT / VTT 字幕转录时勾选Word-Level Timings词级时间戳再用 Resize 工具把词按最大长度和标点组合成字幕行最后导出 SRT 或 VTT即可导入剪辑软件。具体操作见 编辑与字幕整形文档。麦克风实时语音转录在 Live Recording 界面选好任务、语言、模型和麦克风点Record文字随说话实时上屏。官方提示实时场景用 Whisper.cpp 后端加小模型对硬件更友好。录音开始后还可以打开 Presentation Window把实时文字投到投影或大屏上。多人对话说话人识别在转录查看器里点Identify speakersBuzz 自动给每位说话人的句子打标签。可以试听任一句子的 10 秒片段来核对把标签改成本人真名还能勾选合并同一说话人的连续句子。注意Intel 芯片的 macOS 不支持该功能。进阶功能详解字幕整形、提示词与时间戳微调字幕整形用 Resize 控制字幕行宽解决什么问题长录音的字幕行太长或切得太碎。在哪里操作转录查看器工具栏的Resize按钮。能做什么设定字幕最大长度超限自动拆行按标点把长句切开按时间间隔把过碎的片段合并给每个片段统一延长结束时间让字幕在屏幕上多停留几秒若原始音频还在本机会分析静音段来校准断点让切分更准。初始提示词与语音提取录音里如果有人名、地名、专业术语容易认错把它们填进Advanced...里的Initial prompt识别率会明显提升。背景嘈杂的音频勾选Extract speechBuzz 会先把人声提取到独立音轨再做转录减少干扰。转录查看器搜索、调速与时间戳微调CtrlFCmdF打开搜索Enter 跳到下一处匹配CtrlP播放/暂停CtrlShiftP重播当前句Ctrl← / Ctrl→以 0.5 秒步进移动片段的起点或终点修正错位的字幕时间戳勾选 Follow Audio 后文本会跟随播放进度自动滚动。快捷键全表见 转录查看器文档。效率增强文件夹监控、插件与命令行文件夹监控在 Preferences 里配置监控目录后新音频文件放进该目录就会自动开始转录不需要人工干预。批量素材和定期更新的录音流适合用这一招。插件系统Help → Plugins管理插件开关、拖拽排序、点齿轮图标配置参数。内置六个AI Summary转录完成后自动生成摘要Enhanced Language Detection用本地 Whisper 模型预检语言未知语言场景更好用Export to DOCX结果直接导出 Word 文档可选带时间戳Resize Transcript转录后自动按字幕规格重组词级片段DeepFilterNet Noise Reduction转录前先用降噪模型清理背景音Skip Already Transcribed检测到已有结果就跳过避免重复跑模型。插件机制说明见 插件文档。命令行批量任务CLI 适合写进定时脚本完整参数见 CLI 文档。三条常用示例# 用 Whisper.cpp small 模型转录指定中文 buzz add --task transcribe --language zh --model-type whispercpp --model-size small audio.mp3 # 批量翻译成英文需已配置 OpenAI API buzz add --task translate --model-type openaiapi *.mp3 # 一次导出 SRT 和 VTT并隐藏主窗口 buzz add --task transcribe --srt --vtt --hide-gui video.mp4调优与选型建议按硬件和用途配置本地转录按硬件选后端硬件推荐后端说明Nvidia 显卡显存 ≥ 6GBFaster Whisper支持 CUDA 加速速度最快Mac 或 Intel/AMD 核显Whisper.cpp支持 Vulkan可跑集成显卡和纯 CPUMac 首选纯 CPU 老机器Whisper.cppCPU搭配 tiny / base 小模型保速度注意 CPU 需要支持 AVX2 指令很老的机器无法运行。按用途选模型Tiny / Base实时转录、快速摸底速度快但误差多一些Small / Medium日常使用的甜点区间Large-V2稳定性口碑好Large-V3精度最高偶有幻听造词的情况Turbo速度与精度的折中档。显存不够时在模型设置里选量化版本如 q_5可显著降低占用。实时转录如果发现队列越积越长把 Transcription step 调大即可。避坑速查离线转录高频疑问问答QBuzz 必须联网吗A转录全程离线。首次使用需要联网下载模型之后断网可继续用。纯离线环境可以在联网电脑上下载好模型打开 Help → Preferences → Models 点 Show file location把模型文件夹拷到离线机的相同位置。只有选择 OpenAI API 后端时才需要网络。Q支持多少种语言A99 种以上Whisper 覆盖的语言列表中、英、日、德、法等主流语言都包含识别和翻译都覆盖。HuggingFace 后端还能接入 MMS 等覆盖上千种语言的模型。Q处理速度怎么样A取决于音频时长、模型大小和硬件。带 GPU 的机器通常能达到实时甚至更快纯 CPU 建议换小一号的模型。Q能转多长的音频A没有硬性长度限制几秒的语音到几小时的录音都能处理。Q去哪里拿最新版本A稳定版跟随官方发布页更新。想要最新开发版Linux 执行sudo snap install buzz --edge其他平台从项目 CI 构建页面下载最新构建产物示例如下Q点 Record 报错 PaErrorCode-9999A这是麦克风权限问题。检查系统设置里 Buzz 是否被允许访问麦克风Windows 在 Settings → Privacy → Microphone 中确认。收尾下载安装包丢进第一段录音等状态变成 Completed再把结果导出成 SRT整条本地离线转录流程就跑通了。参数拿不准时对照上面的选型表改一次即可更多细节查 FAQ。【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考