ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

Buzz 本地语音转录工具:3 步把音频变成可编辑的字幕

Buzz 本地语音转录工具:3 步把音频变成可编辑的字幕 Buzz 本地语音转录工具3 步把音频变成可编辑的字幕【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzzBuzz 是一款运行在你个人电脑上的离线语音识别应用基于 OpenAI 的 Whisper 模型可以把 MP3、WAV 等音频文件、视频文件甚至 YouTube 链接转成文字并支持翻译成英文。它适合需要处理会议录音、访谈资料、视频字幕又不想把原始音频交给第三方服务的用户。全文按选它 → 装它 → 用它跑完一次任务 → 调常用设置的顺序展开读完即可独立完成一次完整的离线转录。先判断这 3 种情况适合用 Buzz音频内容敏感希望处理过程发生在本地机器上而不是上传给在线服务。Buzz 的所有 Whisper 类模型都在本机运行只有第一次下载模型时需要联网模型缓存目录可在 偏好设置 → 模型 中查看也能整体复制到断网机器上使用。需要批量或自动化处理Buzz 支持文件夹监视watch folder新放入的音频会自动排队转录。需要字幕或时间戳导出格式包含 TXT、SRT、VTT并且可以对转录结果做编辑和时长调整。如果你的场景是把麦克风里的话实时转成文字展示Buzz 的实时录音功能也能覆盖见后文。安装 Buzz 并首次启动Windows从 SourceForge 的 buzz-captions 项目页下载安装包。安装程序未签名系统会弹出警告选择更多信息→仍要运行即可。安装包已内置 GPU 支持需要 CUDA 12 环境旧版本 CUDA 的机器会退回 CPU 运行。macOS下载.dmg文件将应用拖入应用程序文件夹。Apple Silicon 与 Intel 芯片均有对应版本。Linux两种包管理方式任选其一# Flatpak flatpak install flathub io.github.chidiwilliams.Buzz # Snap sudo apt-get install libportaudio2 libcanberra-gtk-module libcanberra-gtk3-module sudo snap install buzz sudo snap connect buzz:password-manager-service通过 Python 安装pip install buzz-captions python -m buzz建议配合 Python 3.12 环境并提前装好 ffmpeg。NVIDIA 显卡用户需要按 docs/docs/installation.md 中的说明为 torch 安装 CUDA 版本。第一次完整任务从导入文件到导出字幕主界面是一张任务表每一行是一个转录任务能看到状态、进度和所用模型。第一次操作的完整流程点击工具栏的图标或菜单文件 → 导入媒体文件快捷键Ctrl/Cmd O选择音频或视频文件。在任务行里选择三个参数任务Transcribe原语言转写或 Translate to English翻译成英文语言官方文档建议手动指定语言自动检测基于开头几秒音频可能出现意外结果模型类型Whisper / Whisper.cpp / Faster Whisper 等与大小tiny 到 large。点击Run开始转录状态变为 Completed 后双击该行打开转录查看器。在查看器顶部工具栏点击Export选择 SRT、VTT 或 TXT 导出。查看器里可以同时搜索文本Ctrl/Cmd F、播放音频并跟随滚动Ctrl/Cmd G跳到当前位置、按 0.5 秒步进微调片段起止时间。实时录音会议场景的另一种入口不想先录文件再转在录音面板选择任务、语言、麦克风和模型后点击RecordBuzz 会边录边转并支持追加重写Append and correct模式对已出句尾做纠错。实时模式下建议选 Whisper.cpp 和较小的模型降低延迟与占用NVIDIA 显卡用户可改用 Faster Whisper。录音开始后会出现Presentation window演示窗口适合在会议或演讲现场把实时文字投到大屏。字幕长度调整让 SRT 更像成品导出字幕前Buzz 提供一个 Resize调整大小入口用于把过长的字幕行重组为适合屏幕上显示的长度开启 Word-Level Timings 生成的转录可以按静音间隙合并、按标点拆分并设置单条字幕最大长度未开字级时间戳的转录只能按最大长度重新切分还可以给每条字幕统一延长显示秒数避免闪得太快。常用设置模型、命名规则与插件偏好设置Ctrl/Cmd ,里高频使用的几项模型管理下载、删除模型Whisper.cpp 支持自定义.bin模型和 q5 等量化版本可显著降低显存与内存占用。模型缓存位置Linux~/.cache/Buzz、macOS~/Library/Caches/Buzz、Windows%USERPROFILE%\AppData\Local\Buzz可在此页一键打开。默认导出文件名支持模板变量如{{ input_file_name }} ({{ task }}d on {{ date_time }})批量导出时命名更可控。初始提示Initial prompt在导入面板的 Advanced 里填写把容易拼错的人名、术语放进去可以减少错字。插件1.4.5 起Help → Plugins 管理内置 AI 摘要、DOCX 导出、降噪DeepFilterNet、跳过已转录文件等可以逐个开关并调整执行顺序。三个典型用法示例示例一会议录音自动出文字稿。开启文件夹监视把录音丢进指定文件夹Buzz 自动排队转录并导出配合跳过已转录插件重复导入同一文件夹也不会重跑模型。示例二为视频生成字幕。导入 MP4任务选 Transcribe 并指定语言开启 Word-Level Timings转完后用 Resize 设置字幕最大长度再导出 SRT 直接交给剪辑软件。示例三完全离线环境使用。在联网机器上提前下载所需模型将整个模型目录复制到离线机器相同位置例如 Linux 主目录下的.cache/Buzz/models即可。仓库里还提供了一个 scripts/download-models.py 脚本可用来批量准备离线模型缓存。开始前的检查清单转录太慢换更小的模型或改用 Whisper.cpp有 6GB 以上显存的 NVIDIA 显卡可试 Faster Whisper。模型怎么选小模型快但错得多大模型准但吃硬件FAQ 中对比了 Large、Large-V2、Large-V3 与 Turbo 的特性差异最稳妥的方式是拿自己的语言各试一遍。麦克风报错如 PaErrorCode-9999检查系统隐私设置里 Buzz 是否有权访问麦克风。应用启动崩溃多半是模型下载不完整到 偏好设置 → 模型 删除后重新下载。老机器注意Buzz 需要 CPU 支持 AVX2 指令集。延伸资料安装细节与依赖说明docs/docs/installation.md文件导入选项表docs/docs/usage/1_file_import.md实时录音与系统声音录制虚拟声卡配置docs/docs/usage/2_live_recording.md命令行用法脚本化、批量导出 SRT/VTTdocs/docs/cli.md插件开发参考buzz/plugins/【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表