ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

VisionClaw低延迟语音助手内幕:Gemini Live WebSocket如何做到实时语音交互

VisionClaw低延迟语音助手内幕:Gemini Live WebSocket如何做到实时语音交互 VisionClaw低延迟语音助手内幕Gemini Live WebSocket如何做到实时语音交互【免费下载链接】VisionClawReal-time AI assistant for Meta Ray-Ban smart glasses -- voice vision agentic actions via Gemini Live and OpenClaw项目地址: https://gitcode.com/gh_mirrors/vi/VisionClawVisionClaw 是一个开源的实时语音助手专为 Meta Ray-Ban 智能眼镜打造。它基于Gemini Live APIWebSocket构建低延迟语音交互管线你的声音以 16kHz PCM 流式推上云端AI 的回应以 24kHz 原生语音流式返回——无需先转文字再合成因此对话体验接近真人。本文将带你拆解这套实时语音助手背后的工作原理。它能做什么一副眼镜上的实时语音助手戴上眼镜点一下 AI 按钮开口说我在看什么—— AI 透过眼镜摄像头看见你的画面并描述场景把牛奶加进我的购物清单—— 通过 OpenClaw 网关操作你已连接的 App给 John 发消息说我晚点到—— 经 OpenClaw 路由到 WhatsApp/Telegram/iMessage搜一下附近的咖啡店—— 联网搜索后把结果念给你听整个过程中眼镜摄像头以约 1 帧/秒推送 JPEG 画面提供视觉上下文而音频则是双向实时流动的——这才是低延迟语音交互的核心。一张图看懂整体架构项目根目录的 README.md 中给出了完整的架构示意数据流可以概括为三方协作角色职责眼镜 / 手机摄像头产生视频帧 麦克风音频iOS / Android 客户端本项目 App编码、节流、双向收发 WebSocket 数据Gemini Live API一条 WebSocket 承载语音理解、语音生成、视觉分析与工具调用为什么是 WebSocket低延迟的三个关键设计很多语音助手是录音 → 上传 → STT 转文字 → LLM 生成 → TTS 合成的串行长链路每一环都在叠加延迟。VisionClaw 采用的 Gemini Live 走的是全双工 WebSocket 长连接带来三点本质不同1. 原生音频到音频不走 STT-first 路线麦克风采集的 PCM 数据16kHz、单声道、100ms 一块直接送入 WebSocket返回的是 24kHz PCM 语音流直接进播放器。语音从不落地成文字省掉了两次最耗时的转换环节也保留了语气和停顿等副语言信息。2. 全双工流式收发边说边听同一条 WebSocket 上上行音频、下行音频、工具调用互相独立、并发流动。AI 说话时麦克风会被主动门控iOS 用.voiceChat音频会话做回声消除Android 使用VOICE_COMMUNICATION音源启用系统级 AEC避免自己听到自己的反馈。3. 视觉帧与语音共用同一条通道视频流被节流到约 1fps、压缩为 50% 质量的 JPEG 后随 WebSocket 上行。对视觉理解来说每秒一帧就足够维持场景上下文既满足看得懂你在看什么又不挤占语音的带宽和延迟预算。眼镜端 DAT SDK 的 24fps 视频流、手机端的 30fps 采集都在这一步被刻意降帧。一次对话在管线里走了多远以把鸡蛋加进购物清单为例README.md 的 Tool Calling 章节描述了完整时序用户说出指令Gemini先开口确认好的这就加上工具调用前的口头回执让用户感知不到等待Gemini 下发execute(task: ...)工具调用客户端ToolCallRouter以 HTTP POST 转发到 OpenClaw 网关OpenClaw 调用其 56 技能搜索、消息、智能家居、备忘录等执行结果以toolResponse文本回填给 GeminiGemini 把结果念出来可以看到WebSocket 在这里承担的不只是语音传输而是整个会话的状态总线语音、视觉、工具调用三种消息类型在同一条连接上有序流动。动手体验没有眼镜也能跑通全链路没有 Meta Ray-Ban 也能完整体验这套实时语音助手App 内置Phone 模式用 iPhone / 手机后置摄像头代替眼镜点 Start on iPhone 再点 AI 按钮即可开始 Gemini Live 会话。若使用真眼镜需先在 Meta AI App 中开启 Developer Mode设置 → App Info → 连点版本号 5 次解锁配置要点详见 gateway/README.md复制 Secrets.swift.example 为Secrets.swift填入 Gemini API Key可选接入 OpenClaw 网关解锁动手执行能力或在设置页运行时修改眼镜模式还依赖 LiveKit 云账号免费额度即可打通语音呼叫链路核心源码导航想深挖 Gemini Live WebSocket 客户端的实现建议从这些模块入手GeminiConfig.swift —— API Key、模型与系统提示词配置StreamSessionViewModel.swift —— 眼镜/手机双模视频采集、帧率节流与重连策略OpenClawBridge.swift —— 工具调用通往 OpenClaw 网关的 HTTP 桥NudgeScheduler.swift —— AI 主动发起的语音提醒调度gateway/ —— 自托管网关源码房间票据、任务执行、仪表盘小结VisionClaw 的答案其实并不神秘用一条 Gemini Live WebSocket 同时承载语音双向流、视觉帧流和工具调用流配合 16kHz/24kHz 的原生 PCM 音频与系统级回声消除把传统录音-转写-生成-合成的串行长链路压缩成一条全双工管道。这正是智能眼镜上说出口就听到的低延迟体验的全部秘密。【免费下载链接】VisionClawReal-time AI assistant for Meta Ray-Ban smart glasses -- voice vision agentic actions via Gemini Live and OpenClaw项目地址: https://gitcode.com/gh_mirrors/vi/VisionClaw创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表