ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

Buzz:本地离线 AI 音频转录,3 步把 12 小时录音变成可搜索文字和字幕

Buzz:本地离线 AI 音频转录,3 步把 12 小时录音变成可搜索文字和字幕 Buzz本地离线 AI 音频转录3 步把 12 小时录音变成可搜索文字和字幕【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz研究生手里 12 小时访谈录音传在线转写十几分钟就弹付费墙把原文件交出去还得跟导师解释。Buzz 做的是本地离线 AI 音频转录录音不出本机几分钟就能拿到带时间戳的转录文件。在线转写为什么不顺手很多人对语音转文字的第一反应是找个在线服务问题有三个文件要上传到别人服务器会议录音、访谈素材这类涉密内容不敢传按时长或订阅收费录音一多成本算不清断网就停摆。Buzz 就卡在这个缝隙里它把 OpenAI 开源的 Whisper 语音识别模型整个搬到你电脑上跑音频从头到尾在本机处理一个字节都不外传项目开源免费不限时长模型下载完成后断网也能用。代价是速度取决于你的硬件——有 NVIDIA 显卡可以开 CUDA 加速一种利用显卡算力跑计算的方式Apple Silicon 也有深度优化纯 CPU 只是快慢之别。对录音多、不能泄密、不想按月付费的场景它是最省心的位置。第一次转录任务从导入到拿结果装好后第一次跑通只要几个动作。先把文件丢进去点工具栏的按钮或直接把文件拖进窗口MP3、WAV、FLAC、MP4 这类主流音视频格式都认懒得下载视频的话直接粘贴一个视频链接它会先把音频拉下来再进流程这一步从 1.2.0 版本开始支持。导入后主界面里每个文件占一行任务语言、模型、输出格式都在这行上改不改就走默认值。然后按运行任务进队列多个文件会排队并发处理进度条随时能看。第一次跑批量建议用小的模型单文件几分钟就完事别误以为程序卡死了。最后拿结果处理完直接打开转录视图句子按时间轴排好点任意一句播放就跳到对应时间点还能直接导出 SRT 字幕、VTT 或纯文本。到这里一条能用的转录流水线就算搭好了后面所有的调参都只是为了更准和更快。真正影响体验的四个参数选错了会怎样任务类型转录还是翻译。选错方向产出直接报废转录输出与原音频相同的语言翻译则是把非英语音频直接转成英文文本。中文访谈要中文稿选转录法语采访要出英文稿才选翻译。语言自动检测还是手动指定。全靠自动检测遇到口音重、中英混杂的录音可能猜错语种。事先知道是什么语言就手动选准确率会明显更稳。官方语言表共 100 项除英语外覆盖 99 种语言中日法德这些小语种都有。模型大小tiny 到 large 五档。这是速度和精度的主开关。选小了专有名词和专业术语会出岔子选大了纯 CPU 环境慢到影响节奏。在设置的模型管理页能看到哪些已下载、哪些可以一键补上。我习惯先用 small 摸底重要的内容再换 large 重跑一遍。输出格式TXT、SRT、VTT 可勾多个。漏勾就得重导一遍干脆把要用的格式一次勾齐TXT 留文稿、SRT/VTT 留给视频字幕。拉开差距的三个功能字幕整形、实时转录、说话人识别字幕整形救一屏放不下的字幕。转录完的字幕往往行长度不受控——太长观众读不完太短跳行频繁。Buzz 的 Resize 工具就是干这个的设一个目标字数它按标点和语义重新断句把每条字幕裁齐。合并选项还有三个开关按时间间隔合并过碎的字幕、按标点拆开长句、按最大长度强制分块给不同平台配字幕改几个数字就行。注意两套选项各有一个前提设目标字数再整形只在转录时未启用词级时间戳时可用合并、拆分三个开关则要求转录时启用了词级时间戳没勾就得重跑。实时转录边说话边出字。Buzz 可以直接吃麦克风输入说话的同时屏幕上就蹦出文字还能投到一个专门的演示窗口放大展示。直播加实时字幕、会议边开边出纪要、课堂同步出笔记都是同一套配置不用为边录边转再找第二个工具。说话人识别多人对话分清谁说了什么。多人录音最大的坑是通篇他说她说。开启说话人识别后不同发言者会被自动打上标签结果里每句话归属谁一目了然。我用它整理过一段访谈素材省掉了来回听录音猜说话人的功夫。入口都不难找整形和说话人识别在转录视图的工具按钮里实时转录就在主界面的录音按钮上。两条值得搭起来的批量工作流单条转录跑通后真正的效率来自组合。一条是放着不管流建一个专用音频文件夹在设置里打开文件夹监控之后录音一丢进这个文件夹 Buzz 就自动开始转录再配合跳过已转录插件处理过的文件自动略过重复丢文件也不用担心。定期更新的播客、成批的课程录音都是它的主场。另一条是视频上字幕流导入视频 → 转录 → 按目标长度整形 → 导出 SRT想要文稿就顺手勾上 TXT录音嘈杂就转录前勾上提取语音选项先过滤背景干扰结果想变 Word 文档还有导出 DOCX 插件。嫌点鼠标麻烦的话整套流程也能从命令行跑buzz add支持任务、模型、语言、输出格式等参数方便挂进定时任务buzz add --task transcribe --language zh \ --model-type whispercpp --model-size small \ --srt --txt interview.mp3想深挖可以看CLI 命令参考和插件源码。我踩过的坑都是以为二字一开始以为模型越大越好后来发现纯 CPU 环境上 large 慢到坐不住日常 small/medium 是甜点区只有真正重要的内容才值得上大模型。一开始以为自动语言检测不会翻车后来发现口音重、中英混读的录音会被猜错语种手动指定反而稳得多。一开始以为字幕想怎么合并都行后来发现合并依赖词级时间戳转录时没勾这个选项整形的合并功能就用不上只能重跑。还有一个要诚实说的局限录音环境本身太吵时准确率会明显掉Buzz 救不回麦克风没录清的声音所以嘈杂场景先别急着调参数先把音源处理干净。常见疑问速答必须联网吗不用全部处理在本机完成只有调用 OpenAI 在线 API 时才需要网络。支持多少种语言除英语外 99 种识别和翻译都覆盖中文、英语、日语、法语、德语都在内。多长的音频能转官方未标注上限几秒到几小时的录音都可以处理。速度如何取决于音频时长、模型大小和硬件带 GPU 的机器通常能到实时甚至更快。链接能导入吗可以1.2.0 起支持直接粘贴 URL 拉取音频。新版本去哪拿官方仓库会持续发布开发版保持更新即可。结语开头那 12 小时访谈录音我现在是直接丢进 Buzz剩下的时间去做别的事回来文字和字幕都在想搜索直接搜。如果你手里也有一堆懒得听的音频挑一个最小的文件跑通第一次转录再决定要不要把它当日常工具。【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表