)
Dograh终极指南20个让语音Agent更聪明的调优技巧提示词模型音频【免费下载链接】dograhOpen source voice AI platform. Self-hosted alternative to Vapi and Retell. On Prem, BYOK across Speech to Speech or LLM/STT/TTS, with a visual workflow builder, MCP native and telephony support.项目地址: https://gitcode.com/GitHub_Trending/do/dograhDograh 是一个开源的语音 AI 平台Vapi、Retell 的自托管替代方案支持 BYOK、可视化工作流构建器、电话集成与 MCP 原生能力。本文将通过 20 个可落地的语音 Agent 调优技巧帮你从提示词工程、模型配置、音频体验三个维度快速打造更聪明、更自然的 Dograh 语音 Agent新手也能直接照做。一、提示词调优让 Agent 听懂人话提示词是语音 Agent 的大脑。以下 7 个技巧直接决定对话质量。技巧 1在 Global Node 里写全局人设角色设定、语气规则、合规红线这类整通电话都要遵守的指令应该只写一次——放进Global Node的 Global Prompt 中。开启 Add Global Prompt 的节点会在运行时自动拼接这段内容避免在每个节点里重复人设。参考文档docs/voice-agent/global.mdx技巧 2用明确顺序写 Agent Node 提示词模糊的提示词会产生不稳定的行为。如果你的 Agent 应该先确认身份再谈付款就在提示词里明确写出这个顺序。节点提示词只写本步骤该做什么全局规则留给 Global Node。技巧 3让边Edge条件具体化节点之间的连线靠自然语言条件路由。条件越模糊路由越混乱❌ 模糊避免✅ 具体推荐债务人回复了债务人确认了身份并准备讨论账户通话结束债务人选定了一种具体还款方式并报出金额如果 Agent 总走错分支把条件写得更具体即可。详见 docs/voice-agent/agent.mdx。技巧 4用模板变量实现个性化开场在 Greeting Text 和 Prompt 中支持{{字段名}}模板变量来自 API 触发、外呼任务表或 Pre-Call Data Fetch。例如开场白直接说Hi {{user.name}}比任何通用问候都像真人。⚠️ 如果请求参数里缺少某个变量Agent 会把原始占位符念出来。发布前务必用完整参数测试一次。详见 docs/voice-agent/template-variables.mdx。技巧 5开启变量抽取把对话变成结构化数据在节点设置中开启Enable Variable Extraction配置抽取提示词和变量列表名称 类型 说明。通话结束后这些信息会存入gathered_context可以通过 Webhook 推送到 CRM也可在运行记录中查看。技巧 6用 QA 节点自动评分每一通电话QA Node 在通话结束后用 LLM 审查转录文本输出 1–10 分质量分、情绪、标签如用户沮丧Agent 打转等。把默认 System Prompt 换成你自己的合规检查指令就能批量发现 Bad Case——不用人工听录音。详见 docs/voice-agent/qa.mdx技巧 7把知识库当外挂大脑而不是堆进提示词产品手册、FAQ、政策文档上传到Knowledge Base按节点挂载Agent 会按需检索作答。小文件菜单、价目表用Full Document模式大文档政策、合同用Chunked Search模式需配置 Embedding 模型。详见 docs/voice-agent/knowledge-base.mdx二、模型调优选对 LLM、STT 与 TTS模型选择直接影响延迟、音色和理解力。技巧 8三种模型配置模式按场景选择Dograh 的Models页面分三个区Speech to Speech实时语音到语音模型直接处理对话延迟最低适合实时交互强的场景Dograh用一个 Service Key 使用 Dograh 托管的 LLM/语音/转录模型零配置起步BYOK自带各厂商密钥LLM、Voice、Transcriber、Embedding 分别配置成本控制最灵活。详见 docs/configurations/inference-providers.mdx技巧 9给每个 Agent 单独设模型覆盖不同 Agent 需要不同模型时在Agent 设置 → Model Overrides中只覆盖某一项比如只换 Voice保留组织的 LLM 配置实现精细调优。技巧 10LLM 选不准从下拉框开始再手动添加平台内置 OpenAI、Google、AWS Bedrock、Groq、OpenRouter、MiniMax 等多家模型本地部署的 Ollama、vLLM 等 OpenAI 兼容端点也支持。找不到心仪模型时用 Add manually 手动填入模型名即可。详见 docs/configurations/llm.mdx技巧 11STT 选支持你语言、能加关键词的转录引擎Deepgram、OpenAI、Azure、AssemblyAI 等转录引擎语言支持各异。用户总被听错检查转录引擎的语言设置并为专有名词配置 keyterms——这是最被低估的听懂用户技巧。详见 docs/configurations/transcriber.mdx技巧 12TTS 音色不满意手动添加 Voice IDElevenLabs、OpenAI、Cartesia、MiniMax 等语音引擎各有音色库。下拉框里没有你想要的声音用 Add Voice ID manually 直接粘贴音色 ID并调整语速——稍快的语速能显著减少通话冷场感。详见 docs/configurations/voice.mdx三、音频调优让声音更自然、更省钱技巧 13混合预录音频 AI 生成Hybrid Voice Agent为关键对话环节录制真人音频开场白、重要声明动态问答仍由克隆音色 TTS 生成。好处省 TTS 费用、延迟更低、情绪更真实。在提示词编辑器里输入即可插入已上传的录音。详见 docs/voice-agent/pre-recorded-audio.mdx技巧 14先用语音克隆让录音和 AI 声音同一张脸在支持克隆的 TTS 服务商如 Cartesia、ElevenLabs上传 10 秒样音生成克隆音色再把 Voice ID 填入 Dograh。这样预录音频与动态生成的语音音色一致切换毫无违和感。技巧 15逐节点开关Allow Interruption打断控制是每个节点独立的开场白、法律声明、关键指令→ 关闭打断让 Agent 说完再听用户问答、异议处理、开放讨论→ 开启打断体验更像真人对话。背后由 Silero VAD 实时检测用户开口并触发抢话。详见 docs/configurations/interruption.mdx。技巧 16开场延迟微调Delayed Start外呼场景下对方接起电话需要一点反应时间。开启Delayed Start0.1–10 秒让 Agent 稍候再开口避免抢话尴尬。详见 docs/voice-agent/start-call.mdx四、数据驱动的迭代调优技巧 17用 Traces 看穿 Agent 的大脑每次通话结束后在Traces标签页能看到发给 LLM 的完整提示词Global 节点拼接、完整对话历史、可用工具、工具调用与返回、STT 转录。Agent 答非所问时90% 的原因都能在这里找到。详见 docs/configurations/tracing.mdx技巧 18追踪送出去的提示词而不只是看到的Traces 中的 LLM 条目同时展示 Prompt 与 Conversation History——每次 LLM 调用都会携带完整历史。调优时对比你以为的提示词和实际发出的提示词常能发现重复拼接、缺失全局提示词等问题。技巧 19测试时手动注入上下文变量在Settings Context Variables里填入模拟数据如customer_name工作流编辑器里的 Web/电话测试拨号就会带上这些值设置directionoutbound还能模拟外呼——不用真实电话也能完整调试。技巧 20建立QA 评分 → 定位 Bad Case → 改提示词 → 回归测试的闭环把 20 个技巧串起来就是这套循环用QA 节点批量打分找低分通话 → 用Traces定位具体哪一步提示词或模型出了问题 → 修改 Global/节点提示词或更换模型 → 用测试上下文变量回归验证。坚持一周Agent 的合格率会肉眼可见地提升。 调优速查清单维度关键动作对应文档提示词Global Node 写人设、Edge 条件具体化global.mdx、agent.mdx提示词变量抽取 QA 自动评分qa.mdx模型S2S / BYOK / 单 Agent 覆盖inference-providers.mdx音频预录音频 语音克隆 打断开关pre-recorded-audio.mdx、interruption.mdx迭代Traces 闭环调优tracing.mdx更多完整说明可查阅官方文档入口docs/README.md。现在就打开你的 Dograh 工作流从技巧 1 开始逐个执行吧【免费下载链接】dograhOpen source voice AI platform. Self-hosted alternative to Vapi and Retell. On Prem, BYOK across Speech to Speech or LLM/STT/TTS, with a visual workflow builder, MCP native and telephony support.项目地址: https://gitcode.com/GitHub_Trending/do/dograh创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考