ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

基于 Composio MCP 的 ElevenLabs TTS 自动化:文本合成、语音库查询、额度检查与流式交付实战指南

基于 Composio MCP 的 ElevenLabs TTS 自动化:文本合成、语音库查询、额度检查与流式交付实战指南 AI 技能AI 插件人工智能工作流自动化【免费下载链接】awesome-claude-skillsA curated list of awesome Claude Skills, resources, and tools for customizing Claude AI workflows项目地址https://gitcode.com/GitHub_Trending/aw/awesome-claude-skills点击查看免费下载本篇技术指南以 awesome-claude-skills 仓库中的 ElevenLabs Automation Skill 为核心系统讲解如何通过 Composio MCPRube 网关把 ElevenLabs 文本转语音TTS能力接入 Claude 工作流。读完本文你将掌握 7 个真实工具槽Tool Slug的调用方法、全部输入参数与输出格式细节、6 大核心工作流编排以及批量合成前必须避开的 6 类已知陷阱可直接落地文本 → 语音文件 / 低延迟音频流的自动化生产链路。一、Skill 是什么ElevenLabs 语音能力如何进入 Agent 工作流Claude Skills 是可复用的指令包每个 Skill 是一个目录内含带 YAML frontmattername、description的SKILL.md指令文件可选附带脚本与参考资源详见仓库 README.md 的 What Are Claude Skills? 一节。Skill 本身不是 MCP Server、也不是工具它定义的是做什么、按什么顺序、带什么护栏的工作流而连接外部系统认证、传输、工具发现是 MCP 的职责。ElevenLabs Automation 正是这一分层架构的典型应用MCP 层通过 Composio 提供的 Rube MCP 网关https://rube.app/mcp建立连接为 Agent 暴露经过 Schema 化的真实工具工具层ElevenLabs 的ELEVENLABS_TEXT_TO_SPEECH、ELEVENLABS_GET_VOICES等真实工具槽Skill 层本 Skill 文件composio-skills/elevenlabs-automation/SKILL.md把这些工具编排成可复用的 TTS 工作流并内置了参数指引与陷阱清单。Skill 的 frontmatter 声明了它的能力边界与依赖requires: mcp: [rube]Agent 在会话开始时只加载 name/description约 100 tokens当判定任务相关时才加载完整指令体——这也是仓库能同时托管数百个 Skill 而不撑爆上下文的原因。二、Setup三步接入 ElevenLabs按照 Skill 文档的 Setup 部分接入过程极简添加 Composio MCP Server在客户端Claude Code / Claude.ai 等的 MCP 配置中加入端点https://rube.app/mcp连接 ElevenLabs 账号按提示完成授权采用API Key 认证方式即你的 ElevenLabs API Key开始使用工作流随后即可通过下方各工作流调用 ElevenLabs 能力。关于 Rube MCP 的通用运行前置仓库中的 Composio Automation Skill 补充了三点关键约束同样适用于本 Skill连接建立后应确认RUBE_MANAGE_CONNECTIONS返回的状态为ACTIVE再执行任何工作流调用任何工具前先用RUBE_SEARCH_TOOLS获取当前最新的工具 Schema——工具槽与参数会随上游 API 演进不应硬编码批量场景可经由RUBE_MULTI_EXECUTE_TOOL带memory参数即使为空也需传{}与RUBE_REMOTE_WORKBENCHrun_composio_tool()批量编排执行。三、核心工作流详解六大场景3.1 文本转语音ELEVENLABS_TEXT_TO_SPEECH这是本 Skill 的主干能力将文本转换为可下载的音频文件。Tool: ELEVENLABS_TEXT_TO_SPEECH Inputs: - voice_id: string (required) -- 从 ELEVENLABS_GET_VOICES 获取 - text: string (required) -- 长度上限约 10,000 字符多数模型、30,000Flash/Turbo v2、40,000v2.5 - model_id: string (default eleven_monolingual_v1) -- 例如 eleven_multilingual_v2 - output_format: string (default mp3_44100_128) -- 见下方格式清单 - optimize_streaming_latency: integer (0-4) -- 注意不与 eleven_v3 模型兼容 - seed: integer (optional) -- 用于可复现性但官方不保证结果一致 - pronunciation_dictionary_locators: array (optional) -- 最多 3 个发音词典输出格式output_format完整取值编码类型可用取值说明MP3mp3_22050_32、mp3_44100_32、mp3_44100_64、mp3_44100_96、mp3_44100_128、mp3_44100_192其中mp3_44100_192需 Creator 套餐PCMpcm_16000、pcm_22050、pcm_24000、pcm_44100需 Pro 套餐uLawulaw_8000面向 Twilio 电话场景关键行为该工具返回的是一个文件对象下载链接位于data.file.s3url——这是一个presigned URL约 1 小时后过期签名参数X-Amz-Expires3600。因此拿到结果后应立即下载音频不能把该链接当作持久存储地址。3.2 浏览可用声音库ELEVENLABS_GET_VOICES合成前先选声音。该工具无需任何输入参数Tool: ELEVENLABS_GET_VOICES Inputs: (none)返回一个数组位于data.voices[]每个声音对象包含voice_id后续合成与查询的唯一标识name声音名称labels属性标签含gender性别、accent口音、use_case适用场景等维度settings该声音的默认设置。3.3 查看单个声音详情ELEVENLABS_GET_VOICE在正式合成前对候选声音做元数据核验Tool: ELEVENLABS_GET_VOICE Inputs: - voice_id: string (required) -- 例如 21m00Tcm4TlvDq8ikWAM - with_settings: boolean (default false) -- 是否附带详细声音设置需要提醒的是不要依赖预览列表做选择。由于声音库可能很大客户端预览往往被截断应以data.voices[]完整载荷为准详见已知陷阱章节。3.4 检查订阅额度ELEVENLABS_GET_USER_SUBSCRIPTION_INFO批量合成前务必先查额度。该工具无输入参数返回当前套餐的限额信息与剩余积分creditsTool: ELEVENLABS_GET_USER_SUBSCRIPTION_INFO Inputs: (none)结合陷阱表若请求返回 HTTP 401 quota_exceeded或 HTTP 402 payment_required即表示额度不足或套餐档位受限。在跑批量任务前用此工具做前置校验可避免任务中途大面积失败。3.5 列出可用 TTS 模型ELEVENLABS_GET_MODELSElevenLabs 的模型列表中并非所有模型都支持 TTS。正确姿势是拉取全部模型后按can_do_text_to_speech: true过滤Tool: ELEVENLABS_GET_MODELS Inputs: (none)这一步与 3.1 的model_id参数形成闭环先用GET_MODELS确认兼容模型再回填TEXT_TO_SPEECH避免因选了不支持 TTS 的模型而失败。3.6 低延迟流式与历史音频取回两个补充工具覆盖实时与回溯两个场景Tool: ELEVENLABS_TEXT_TO_SPEECH_STREAM - 核心输入与 TEXT_TO_SPEECH 相同但返回音频流适合低延迟播放场景 Tool: ELEVENLABS_GET_AUDIO_FROM_HISTORY_ITEM - history_item_id: string (required) -- 取自某次历史生成的 ID配合optimize_streaming_latency取值 0-4可进一步压低首包延迟但再次强调该参数不被eleven_v3模型支持选择eleven_v3时必须省略它。四、从源码结构看调用闭环Rube MCP 的标准编排仓库中的 composio-automation/SKILL.md 与 composio-search-automation/SKILL.md 同属 README.md 所列 App Automation via Composio78 个 SaaS 应用预置 Skill体系。从这些 Skill 的共性结构可以推断出本 Skill 背后一致的 Rube 调用闭环发现DiscoverRUBE_SEARCH_TOOLS传入use_case如 ElevenLabs text to speech返回可用工具槽、输入 Schema、推荐执行计划与已知陷阱建连ConnectRUBE_MANAGE_CONNECTIONS指定toolkits: [elevenlabs]确认状态 ACTIVE执行ExecuteRUBE_MULTI_EXECUTE_TOOL携带tool_slug如ELEVENLABS_TEXT_TO_SPEECH与符合 Schema 的arguments并附带memory与session_id批量Bulk大批量合成可走RUBE_REMOTE_WORKBENCHrun_composio_tool()。因此本文所述的 7 个ELEVENLABS_*工具槽本质是 Rube 网关对 ElevenLabs REST API 的 Schema 化封装——工具返回结构如data.voices[]、data.file.s3url直接映射上游响应体。五、已知陷阱与规避Production Checklist以下完整继承自 Skill 文档的 Pitfalls 表并结合上文展开是批量生产时必须逐条对照的清单陷阱细节与应对文本长度上限多数模型单次请求上限约 10,000-20,000 字符Flash/Turbo v2 为 30,000v2.5 为 40,000。超限返回 HTTP 400。应对把长文本按约 5,000 字符分块逐块生成后再拼接音频。输出是 presigned URLELEVENLABS_TEXT_TO_SPEECH返回data.file.s3url约 1 小时过期X-Amz-Expires3600。应对拿到链接立即下载勿长期持有或二次分发。额度与积分错误HTTP 401quota_exceeded或 HTTP 402payment_required表示额度不足/套餐受限。应对批量任务前先用ELEVENLABS_GET_USER_SUBSCRIPTION_INFO校验。声音权限缺失HTTP 401missing_permissions表示 API Key 缺少voices_read作用域。应对检查并补齐 Key 权限。模型兼容性并非所有模型支持 TTS且optimize_streaming_latency不支持eleven_v3。应对用ELEVENLABS_GET_MODELS过滤can_do_text_to_speech: true选eleven_v3时省略延迟优化参数。声音列表截断ELEVENLABS_GET_VOICES返回大列表时客户端预览可能被截断。应对一律从完整data.voices[]载荷中选取voice_id。六、工具速查表工具槽说明ELEVENLABS_TEXT_TO_SPEECH文本转语音返回可下载音频文件presigned URL约 1 小时有效ELEVENLABS_GET_VOICES列出全部可用声音及属性ELEVENLABS_GET_VOICE获取指定声音的详细信息ELEVENLABS_GET_USER_SUBSCRIPTION_INFO查询订阅套餐与剩余额度ELEVENLABS_GET_MODELS列出可用 TTS 模型及能力过滤can_do_text_to_speechELEVENLABS_TEXT_TO_SPEECH_STREAM低延迟流式音频输出ELEVENLABS_GET_AUDIO_FROM_HISTORY_ITEM从生成历史中重新下载音频七、如何把该 Skill 安装进你的 Claude 环境根据仓库 README.md 的 Getting Started 部分将 Skill 目录放入 Claude Code 的 skills 目录即可生效mkdir -p ~/.config/claude-code/skills/ cp -r composio-skills/elevenlabs-automation ~/.config/claude-code/skills/然后验证元数据frontmatter 必须含 name 与 descriptionhead ~/.config/claude-code/skills/elevenlabs-automation/SKILL.md最后启动claudeSkill 会在任务相关时自动加载。若使用 Claude.ai则通过聊天界面中的 Skill 图标从市场添加或上传自定义 Skill。之后确保 Rube MCPhttps://rube.app/mcp已连接、ElevenLabs 账号已完成 API Key 认证即可按第三、四节的流程开始自动化语音合成。小结ElevenLabs Automation Skill 的价值在于把选音色 → 定模型 → 合成/流式 → 校验额度 → 回溯历史这条 TTS 链路压缩为 Schema 化的 7 个工具调用。配合 Rube MCP 的发现-建连-执行闭环以及本文整理的参数表、格式表与陷阱清单你可以在 Claude 中稳定地批量产出多语种语音内容——只需记得先查额度、再分块、及时下载。赞分享AI 技能AI 插件人工智能工作流自动化【免费下载链接】awesome-claude-skillsA curated list of awesome Claude Skills, resources, and tools for customizing Claude AI workflows项目地址https://gitcode.com/GitHub_Trending/aw/awesome-claude-skills点击查看免费下载相关推荐基于 Rube MCP 的 IP2WHOIS 自动化实战指南在 Codex 中通过 Composio 驱动域名 WHOIS 查询基于 Rube MCP 的 IP2WHOIS 自动化实战指南在 Codex 中通过 Composio 驱动域名 WHOIS 查询 本指南以开源仓库 awesoAI 技能AI 插件工作流自动化人工智能awesome-codex-skills 实战基于 Rube MCP 与 Composio 自动化 Synthflow AI 语音工作流awesome codex skills 实战基于 Rube MCP 与 Composio 自动化 Synthflow AI 语音工作流 SynthflowAI 技能AI 插件工作流自动化人工智能GroqCloud 自动化技能实战基于 Composio MCP 编排高性能 AI 推理、语音翻译与 TTS 工作流GroqCloud 自动化技能实战基于 Composio MCP 编排高性能 AI 推理、语音翻译与 TTS 工作流 本指南以 awesome codex sAI 技能AI 插件工作流自动化人工智能创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表