ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

Buzz本地语音转文字:五个环节完成离线转录

Buzz本地语音转文字:五个环节完成离线转录 Buzz本地语音转文字五个环节完成离线转录【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz一段30分钟的会议录音躺在收件箱里手动听写加校对、导出往往要花上两个小时。Buzz是一款基于OpenAI Whisper、完全在本地运行的离线音频转录工具音频不经过任何云端服务本地语音转文字从这里开始。跑起来安装 Buzz 并完成首次本地语音转文字安装方式中 PyPI 路径通用性最强普通用户也可以直接取现成安装包macOS 下载 .dmg、Windows 使用安装程序、Linux 用 Flatpak 或 Snap都是一条命令或一次双击的事。PyPI 方式需要 Python 3.12 环境并保证系统已装好 ffmpegpip install buzz-captions python -m buzz首次启动后先确认三件事下载模型按 Ctrl/Cmd , 打开偏好设置在 Models 页面下载所需尺寸tiny / base / small / medium / large。尺寸越大准确率越高内存与耗时要求也越高。固定任务语言官方文档建议明确指定语言而不是依赖自动检测避免识别出预期之外的结果。确定导出格式默认导出 TXT做字幕的话直接选 SRT 或 VTT。跟一个任务走30 分钟录音的本地语音转文字全流程把meeting-0906.mp3拖进 Buzz看一次完整流程如何走下来加任务—— 菜单 File → Import Media File快捷键 Ctrl/Cmd O或工具栏的 按钮。表单里把 Task 设为 TranscribeLanguage 选中文模型选 smallExport As 改 SRT。录音里有大量专有名词或易错词时可点 Advanced 按钮填入 initial prompt减少同音字误写。选模型—— 30 分钟的录音用 small 或 medium 是速度和准确率的折中有显卡的话选 faster-whisper 或 Whisper.cpp 后端更快。等转写—— 点 Run 后任务进入队列状态从 In progress 变为 Completed。可以同时排入多个文件按顺序逐个执行。看结果—— 双击任务行打开转录查看器。每一句是一行带起止时间顶部工具栏提供搜索、播放、倍速控制任意一句都可以双击编辑文字。导出—— 点查看器里的导出按钮选格式保存。字幕句长不满意时点 resize按间隔合并或按标点重新切分。转录查看器每句带时间戳、文字可直接编辑顶部工具栏支持搜索、播放与导出效率对照用数据说话两组数字实际耗时因硬件与音频内容而异这里按常见配置估算场景手动用 Buzz30 分钟会议录音逐字听写加校对约 120 分钟small 模型转写数分钟 约 10 分钟校对合计 30 分钟内10 集播客、约 10 小时音频需要数天配置文件夹监控后放一夜早上拿到全部字幕文件第二组对应偏好设置里的文件夹监控把播客文件放进被监控目录Buzz 按到达顺序逐个建任务不需要人守在电脑旁。任务表里排队中、进行中、已完成一目了然这是这套免费字幕生成流程能批处理的关键主界面任务表模型、任务类型与状态一览进阶自动化与定制有四处可以直接定制每处都能点开对应路径文件夹监控指定输入与输出目录可勾选处理后删除源文件新文件放入即自动转录实现见 folder_watch_preferences_widget.py。插件系统plugins/ 自带 6 个插件——AI 摘要接 OpenAI 兼容 API 生成要点、DeepFilterNet 降噪、增强语言检测、导出 DOCX、跳过已转录、转录重排照着 plugins/base.py 的接口可以写自己的。导出命名模板偏好设置里用{{input_file_name}}、{{task}}、{{date_time}}等变量定义默认导出文件名完整变量表见 docs/docs/preferences.md。性能档位显存紧张时选 Whisper.cpp 后端的量化版本如 q5模型或设置环境变量BUZZ_REDUCE_GPU_MEMORYtrue启用 8 位量化线程数、强制 CPU 等参数同样走环境变量。技术要点速览多引擎后端buzz/transcriber/ 中内置 Whisper 原版、Faster-Whisper、Whisper.cpp、Hugging Face 模型与 OpenAI API 五种实现可自由切换。硬件加速支持 NVIDIA CUDA、Apple Silicon 原生运行Whisper.cpp 后端还可用 Vulkan 让核显参与加速。多语言转写与翻译覆盖约 100 种语言可指定或自动检测界面本身在 buzz/locale/ 下提供 15 种语言包。常见问题Q几小时的长音频会把内存吃满吗Buzz 按分片处理内存占用随文件长度基本保持稳定。超长文件建议选 Whisper.cpp 后端或量化模型并可配合BUZZ_REDUCE_GPU_MEMORYtrue进一步压缩显存。Q会议或直播时能出实时字幕吗可以。Buzz 带独立的 Presentation Window 实时转录窗口开启直播文本导出后句子生成即写入 txt 文件OBS 或其他大屏应用可直接读取。Q字幕句长或时间戳不准怎么调勾选 Word-Level Timings 生成词级时间戳再用 resize 按间隔或标点重新合并切分也可以启用转录重排插件自动调整见 docs/docs/cli.md 中对应的 CLI 参数。Resize 对话框按间隔或标点重新切分字幕边界想动手的话git clone https://gitcode.com/GitHub_Trending/buz/buzz拿到源码或按开头步骤从 PyPI 安装使用细节在 docs/ 目录里按功能分章。【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表