ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

本地离线音频转录:Buzz 帮你把两小时会议录音变成带时间戳的文稿

本地离线音频转录:Buzz 帮你把两小时会议录音变成带时间戳的文稿 本地离线音频转录Buzz 帮你把两小时会议录音变成带时间戳的文稿【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz每次开完会对着两小时录音逐句敲笔记Buzz 是一款完全在本地运行的离线音频转录工具基于 OpenAI Whisper 模型录音不用上传任何服务器文字直接落在你自己电脑上。五分钟跑起来第一步安装。推荐直接装官方安装包支持 Windows、macOS、LinuxLinux 用户也可以snap install buzz。想用 Python 环境就跑pip install buzz-captions然后python -m buzz启动。第二步第一次转录。打开程序点左上角导入一个 MP3 或 MP4 文件任务选 Transcribe语言选中文模型先用默认的 tiny 试跑。第三步拿到结果。等状态变成 Completed双击这一行打开转录结果点导出按钮一个带时间戳的 TXT 或 SRT 文件就生成在源文件旁边了。主界面展示任务队列和转录进度能力拆解 文件批量转文字解决一堆录音挨个手动转的麻烦。支持 MP3、MP4、WAV、M4A、FLAC 等格式一次可以导入多个文件排队处理。也可以在导入时填一个 URL直接转录在线音频。核心逻辑在 buzz/transcriber/file_transcriber.py 里任务在后台线程执行界面不卡死。 麦克风实时转录解决开会时来不及做记录的问题。选好麦克风点 RecordBuzz 边录边转新句子实时出现在面板里。它还提供演示窗口把实时字幕投到大屏上做演讲或直播现场字幕都行。默认用 Whisper.cpp 后端做实时处理小模型配核显也能跑。 转录同时翻译解决外语资料看不懂的问题。任务选 Translate to EnglishBuzz 会在本地把外语直接转成英文文本。另外可以接任意兼容 OpenAI 格式的翻译接口包括本地跑的 Ollama把转录结果翻成中文或其他语言约 1 美元可翻译 1 小时音频。✂️ 字幕分段与说话人区分解决转录文本没法直接当字幕用的问题。转录时勾选 Word-Level Timings 生成词级时间戳之后在 Resize 工具里按最大长度合并、按标点拆分buzz/plugins/ 下还有内置的说话人识别能力把多人对话按人分开。四种 Whisper 后端可选这是最常见的纠结点后端适用场景特点Whisper.cpp无独显的电脑、MacC 实现吃 CPU 和各类 GPU实时转录首选Faster Whisper6GB 显存以上的 NVIDIA 显卡比原版快一个数量级显存占用更低Whisper原版内存充足的机器准确但慢吃内存HuggingFace用特定语言定制模型支持社区模型和量化版本实战工作流场景一会议录音批量转纪要适用人群经常开会、一次要处理好几段录音的职场人。把一周的会议录音放进一个文件夹全部导入 Buzz。任务选 Transcribe语言明确选中文自动检测偶尔会跑偏手动选更稳。模型选 Whisper.cpp 的 base导出格式勾 SRT 和 TXT。点 Run队列会自动依次处理中途可以插队或取消单个任务。推荐配置base 模型 默认 8 线程10 分钟录音大约 1 分钟左右转完。产出物每段录音对应一个.txt全文和.srt字幕文件文件名可以用{{ input_file_name }}_{{ date_time }}这类模板自定义配置入口在 buzz/settings/settings.py。场景二讲座/播客做双语字幕适用人群视频创作者、课程制作者。导入 MP4 视频Buzz 会直接处理其中的音轨不用先抽音频。开启 Word-Level Timings用 medium 模型转一遍语言选英文。双击结果打开转录视图点 Resize按 42 字符左右的最大长度重新分段勾选按标点切分。如果需要中文在工具栏点 Translate接入你配置的翻译 API 生成译文。导出 VTT 或 SRT 上传到视频平台。推荐配置medium 模型 词级时间戳 分段最大长度 42–50 字符。产出物一段每行不超过 50 字符、时间轴对齐的原语字幕加一份对照译文。转录结果支持逐句编辑和时间戳查看场景三现场活动实时字幕适用人群主持演讲、做直播或需要现场记录的人。切到录音转录面板选麦克风语言选中文模型用 tiny 或 base。点 RecordBuzz 实时输出句子开启 Presentation Window 可以单独投屏。在首选项里打开实时转录导出每句话同步写进本地 txt 文件方便 OBS 这类软件直接读取。录完点停止得到完整文稿。推荐配置Whisper.cpp tiny 模型 Append and correct 模式延迟和准确度的平衡最好。实时转录的实现在 buzz/transcriber/recording_transcriber.py。效果调优模型大小直接决定速度先测再选。在 16 线程的笔记本上实测tiny 转 10 分钟音频约 20 秒base 约 40 秒medium 约 2 分钟large 要 10 分钟以上。中文日常使用 base 到 medium 的准确率差距不大没必要硬上 large。调线程数别默认全开。通过环境变量BUZZ_WHISPERCPP_N_THREADS设置 Whisper.cpp 线程数。官方数据16 线程的机器设为 8转录快约 15%——线程太多合并结果反而更慢。显存不够就开量化。首选项里打开 Reduce GPU RAMBuzz 会用 8bit 量化版本压缩显存占用large 模型这样能塞进 6GB 显存的卡里。模型页面管理各尺寸模型的下载排错速查现象原因解法录音时报 PaErrorCode-9999系统屏蔽了麦克风权限Windows 检查 设置→隐私→麦克风 是否允许 Buzz启动即崩溃模型下载不完整首选项→模型 里删掉重下GPU 没生效CUDA 版本过旧Windows 安装包自带 CUDA 12旧卡会自动回落 CPU转录明显偏慢模型太大换更小的模型或改用 Whisper.cpp 后端老 CPU 跑不起来不支持 AVX2 指令集换硬件或改用云端 OpenAI API 后端各系统安装差异Windows安装包未签名安装时选更多信息→仍要运行。macOS从 SourceForge 下.dmgIntel 和 Apple Silicon 都有。LinuxFlatpak 或 Snap 均可Snap 需先装libportaudio2等音频依赖。进阶与集成CLI 批量自动化。不想开界面的话buzz add一条命令搞定buzz add --model-type whispercpp --model-size small \ --language zh --srt --txt \ /path/to/recordings/*.mp3支持--hide-gui后台静默跑配合 crontab 就能做无人值守的录音转文字流水线。完整参数见 docs/docs/cli.md。插件扩展。Buzz 1.4.5 起内置插件系统打开 Help → Plugins 即可开关。常用的有AI Summary转录完自动出摘要、DeepFilterNet转录前降噪嘈杂环境准确率明显提升、Skip Already Transcribed重导文件夹时跳过已转过的文件。想自己写插件直接照着 buzz/plugins/ 里现成插件的结构抄就行。离线部署的话可以用 scripts/download-models.py 提前在联网机器上备好模型整个拷到内网机器使用。Resize 工具按标点与长度重新分段字幕选它的理由Buzz 把 Whisper 跑在你自己的硬盘里数据不出本地断网也能用一分钱不花。GUI、CLI、插件三层都给你留了口从随手转一段录音到搭全自动字幕流水线都不用换工具。项目地址就在 gitcode.com/GitHub_Trending/buz/buzzclone 下来试试遇到坑欢迎提 issue。【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表