
微信里发条语音,1-3 秒后 AI 助手回你一行简体字——这是给自部署助手接上 Groq 免费语音识别后最直观的变化。1-3 秒—— 微信语音出简体字8 小时/天—— 免费档音频额度,个人用不完零内存—— 转写全在云端,本地 0 占用为什么折腾这个?我的助手 Hermes 跑在一台 2G 内存的小服务器上,打字交互没问题,但人总有懒得打字的时候,语音才是自然输入。第一版用本地faster-whisper,实测两个问题很现实:「收到」被识别成「抽到」,口语词错得更多;转写一条语音占 400-500MB 内存,2G 的机器转完基本没余量干别的。换成云端 Groq Whisper 后,中文错字基本消失,内存零占用,免费档约 8 小时音频/天个人用不完。整条路走完踩了两个坑——访问限制、默认出繁体——各有各的解法。下面六步照抄即可,所有命令都是我实测过的。1. 选型:先本地,再云端本地 faster-whisper 一句话总结:能用,但不好用。对比项本地faster-whisper云端 Groq Whisper中文识别base模型一般,「收到」识别成「抽到」,助手根本接不住话明显更准,base模型那些错字基本消失内存占用转写一条占 400-500MB,2G 的机器转完基本没余量干别的零占用,识别在云端完成免费额度无,消耗本地资源约 8 小时音频/天,个人用量用不完2. 上手:六步走完2.1 注册打开 Groq 控制台 注册,进 API Keys 页面 Create API Key,复制保存。 key 只显示一次,丢了只能重新生成。注意:Groq 需要魔法访问。2.2 写 .envkey 放进 Hermes 根目录的.env(本机是/root/.hermes/.env),加一行:# .env GROQ_API_KEY你的key 这个文件权限要收紧,别让别的用户读到:chmod 600 /root/.hermes/.env2.3 配sttconfig.yaml里加:# config.yaml stt: provider: groq language: zh模型默认就是whisper-large-v3-turbo,端点https://api.groq.com/openai/v1,一般不用改。想换模型,在.env里设STT_GROQ_MODEL和GROQ_BASE_URL即可,详见 Groq API 文档。2.4 访问限制(坑 1:无法直连)⚠️坑 1:访问限制现象:部分网络环境下无法直接访问 Groq(HTTP 403)。原因:Groq 服务有区域限制。解决:需要魔法访问,自行解决。2.5opencc补丁(坑 2:默认出繁体)⚠️坑 2:默认出繁体现象:中文识别出来了,但全是繁体字。原因:whisper-large-v3-turbo中文默认输出繁体,没有现成的「简体优先」参数。解法:转写结果过一遍 opencc,t2s(繁转简)。改 Hermes 的转写文件/usr/local/lib/hermes-agent/tools/transcription_tools.py,在_transcribe_groq函数里找到这行:# transcription_tools.py 定位 transcript_text str(transcription).strip()在它后面插入:# transcription_tools.py 插入 try: from opencc import OpenCC transcript_text OpenCC(t2s).convert(transcript_text) except Exception: pass装依赖(这步最容易漏):pip install opencc-python-reimplementedopencc库不装,上面那段try会静默失败,繁体照旧——表现就是「明明打了补丁还是繁体」。我 2026-08 装到的版本文件里已经内置了这段转换,如果你的版本没有,照上面手动加。改文件前先备份,可随时回滚:cp /usr/local/lib/hermes-agent/tools/transcription_tools.py{,.bak-groq}改完重启 Hermes 让补丁生效(本机网关是systemd服务:sudo systemctl restart hermes-gateway;其他部署方式重启对应进程即可)。2.6 验证 ✅微信发一条语音,1-3 秒应该回一行简体字。两条判断:出字慢或报错 → 确认能正常访问 Groq(需要魔法),curl一下https://api.groq.com看通不通出字了但是繁体 →opencc依赖没装或补丁没生效,重启后再试3. 效果✅1-3 秒出简体字—— 微信发语音,直接进对话流程✅零内存负担—— 识别全在云端,服务器不占资源✅免费额度充足—— 约 8 小时/天,个人用不完4. 总结小服务器跑 AI 助手,资源是硬约束。本地方案「能用」和「好用」之间,差着一条内存线;云端方案把这条线抹掉了。两个坑——访问限制、繁体输出——前者需要魔法,后者打段opencc补丁,都容易解决。如果你也在小机器上折腾语音入口,照着上面六步走,这条路可以照抄。卡在哪一步,欢迎留言交流。