ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

终极开源实时语音运行时qwen-audio-agent:让AI语音助手一直在聊、一直在干活的完整解析

终极开源实时语音运行时qwen-audio-agent:让AI语音助手一直在聊、一直在干活的完整解析 终极开源实时语音运行时qwen-audio-agent让AI语音助手一直在聊、一直在干活的完整解析【免费下载链接】qwen-audio-agentA realtime voice runtime that keeps Agents talking, working, and present. Real-time Voice Runtime for AI Agents项目地址: https://gitcode.com/gh_mirrors/qw/qwen-audio-agentqwen-audio-agent 是一个开源的实时语音运行时Realtime Voice Runtime专为 AI 语音助手打造它让 Agent 与你全双工对话的同时还能把工具调用、文件处理和长任务交给后台执行——对话不中断、结果自然回流真正做到“一直在聊、一直在干活、一直在场”。为什么需要这个实时语音运行时传统语音助手的痛点很直观说一句、等一句。助手去查资料、调工具、跑任务时整场对话就“卡住”了。qwen-audio-agent 的设计哲学是Agent Presence始终在场️全双工实时语音——随时打断、自然多轮像真人聊天一样连续⚡对话与任务并行——后台干活时前台继续聊可随时追问进度或取消结果自动回流——任务完成后结果自然回到当前对话支持继续追问和修改长期记忆——当前用户跨会话的个性化记忆官方一句话概括能直接回答的问题立即回答需要工具或持续处理时交给后台 Agent而用户面对的始终是同一个助理。三层架构AI语音助手如何边聊边干活理解这套实时语音运行时只需记住三层职责层级组件职责第 1 层前台 Agent实时语音听、说、路由负责自然语音答复与打断处理第 2 层Gateway 编排运行时管理任务生命周期、权限、会话让工作与对话并行第 3 层后台 Agent可选持久执行用自己的模型、工具、MCP 与 Skills 持续干活关键机制是非阻塞循环当请求需要后台执行时前台发起任务委派spawn_thinking编排运行时立即返回受理回执对话继续进行任务完成后结果在安全的插入窗口自然回流到同一场对话。更底层的原理见下方架构图——用户与实时模型之间维持连续语音而更深入的搜索、推理和智能体能力由 Agent Runtime 委派处理完整设计解读可阅读 docs/architecture/overview.zh.md 和 docs/architecture/deep-dive.zh.md。最快安装步骤三步开始第一次对话安装非常轻量只需 Node.js 22.22.2或 24.15.0和 npm 10第 1 步 · 一键安装npm install -g qwen-audio-agent第 2 步 · 创建配置并填入 API Keyqwenaudio config在生成的config.env中填入百炼DashScopeAPI Key。新手建议先只用「仅前台模式」验证语音对话不配置后台也不影响聊天DASHSCOPE_API_KEYyour-key QWEN_AUDIO_REALTIME_MODELqwen-audio-3.0-realtime-plus AGENT_PROTOCOLnone第 3 步 · 启动 Gateway连接客户端qwenaudio # 终端 1启动 Gateway qwenaudio webui # 终端 2打开浏览器界面或 qwenaudio tui 使用终端客户端打开麦克风说一句“你好”能看到转写并听到回答就说明运行成功了。详细步骤见 docs/getting-started/quickstart.zh.md 与 docs/getting-started/install.zh.md。桌面悬浮球让语音助手常驻桌面的完整体验不想敲命令下载桌面版macOS / Windows / Linux即可。它内置 Gateway无需单独启动服务语音悬浮球 对话面板——常驻桌面可切换外观、导入桌宠皮肤自动休眠——闲置后自动隐藏但保持连接与上下文说“可以退下了”也能唤醒退出️语音唤醒——启用唤醒词“你好千问”本地检测、不上传音频手机远程接入——手机或另一台电脑可通过连接码接入同一 Gateway桌面版源码位于 desktop/行为说明见 docs/desktop/overview.zh.md。可自由组合的语音前台与后台 Agent这套运行时把「说话的大脑」和「干活的手」解耦按需组合语音前台负责实时交流Qwen Audio 3.0 Realtime、GPT-Live / OpenAI Realtime、Google Gemini Live、Qwen3.5-Omni Realtime、豆包 Seeduplex、StepAudio 3以及本地部署的 Hugging Face Speech-to-Speech、MiniCPM-o 4.5 等。接入新服务只需实现 Realtime Provider 接口无需改动核心逻辑。后台 Agent负责执行任务一键接入 Qwen Code、OpenCode、OpenClaw、Qoder、Kimi Code、Codex、Claude Code、DeepSeek Harness 等十余个 Agent并复用其模型配置、工具、MCP、Skills 和认证。各方案对比与配置方法见 docs/backends/overview.zh.md 和 docs/voice-frontends/ 下的各前台指南。场景扩展从桌面办公到智能座舱“前台对话 后台任务”的设计远不止桌面办公。项目内置了多个可直接参考的示例智能座舱——车控、导航、音乐、天气与生活服务的语音 Agent完整示例见 examples/smart-cockpit/语音客服——零售与航空场景的语音客服见 examples/customer-service/️X-Omni 视觉对话——画面观察与解说见 examples/x-omni/AI Passport——硬件卡片上的千问语音豆见 examples/ai-passport/数字人——见 examples/digital-human/智能座舱示例展示了同一套实时语音运行时如何驱动车控、导航、音乐等技能卡片文档与源码导航按需深入想做什么去哪里看快速上手docs/getting-started/quickstart.zh.md理解架构docs/architecture/overview.zh.md配置语音前台docs/configuration/frontend.zh.md接入后台 Agentdocs/backends/overview.zh.md桌面版玩法docs/desktop/overview.zh.md远程接入与运维docs/operations/remote-access.zh.md服务端核心实现server/src/voice 语音会话、task 任务管理、backend 后台接入项目采用 Apache License 2.0 开源贡献指南见 CONTRIBUTING.md安全与隐私说明见 SECURITY.md 和 PRIVACY.md。一句话总结如果你想要一个不冷场、不等待、边聊边办事的 AI 语音助手qwen-audio-agent 就是目前开源世界里最完整的实时语音运行时答案。【免费下载链接】qwen-audio-agentA realtime voice runtime that keeps Agents talking, working, and present. Real-time Voice Runtime for AI Agents项目地址: https://gitcode.com/gh_mirrors/qw/qwen-audio-agent创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表