ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

从推理到构建:腾讯云ES如何让企业Agent从「能用」走向「好用」

从推理到构建:腾讯云ES如何让企业Agent从「能用」走向「好用」 导读当 16% 的企业已把 Agentic AI 推进生产环境、而真正拥有 AI-Ready 数据的企业只有 4% 时热度与落地之间的这道缺口并不是大模型能力的缺口而是上下文供给的缺口。在 腾讯云 x Elastic AI 搜索技术大会上腾讯云 ES 专家产品经理任翔发表《从推理服务到 RAG 和 Agent 构建》主题演讲系统梳理了从模型推理能力构建到 RAG 与 Agent 落地的完整链路——一条推理管道、四条构建路径为企业 Agent 从「能用」走向「好用」给出一套可操作的参考答案。Agent≠大模型对话界面随着AI时代的快速演进大模型能力已经非常强大但就企业应用而言并不是大模型越聪明Agent 就越强这么简单。实际上当我们真正深入Agent剖析一个企业 Agent 应用的典型管道就会发现大模型只是一个负责思考决策的大脑它需要外部知识的供给而这正需要推理服务的加工处理在这里推理服务扮演了一个非常重要的「感知系统」的角色——负责把企业数据加工处理成大脑能消费的认知输入。就认知系统而言它通常包含三条链路知识链路检索、Rerank、上下文组装、推理链路意图识别、规划、决策与行动链路工具调用、结果执行。如果我们仔细分析推理过程的一系列链路实际存在明显的「质量漏斗效应」文档解析 95% × 切片完整性 90% × Embedding 80% × 召回率 95% × Rerank 90%最终送达大模型的上下文质量只剩约 58%。链路各环节是相互加强也相互拖累的关系——每一个环节都必须做到最优整条链路的效果才能最好。这对每个推理服务的质量与性能都提出了极高要求。Agent 认知系统管道与「质量漏斗效应」推理服务的构建对企业而言挑战重重企业构建推理服务无外乎两条路自行部署开源模型或选用第三方模型服务。无论哪条路企业真正付出的代价都不仅仅在「模型」这一项上。路径 A · 自行部署要算清几笔账GPU 月租、冗余灾备、监控测试、运维人力「能跑」不等于「能用」并发、延迟、稳定性都要重新打磨7×24 生产运维、扩缩容与 SLA 保障是持续性挑战新模型层出不穷升级链路牵一发动全身准确性、稳定性、数据安全每一项都要自己验证。路径 B · 第三方模型同样不轻松市面上成百上千的模型自说自话、榜单口径不一发现成本高自建评测至少 1-2 周起步新模型发布难以反复重测单个模型好不等于整体好Embedding 与 Rerank 的配对效果就是典型今天选好的「最优方案」也会随着行业的技术发展在明天变成落后于时代。两条路都可以跑通但真正的代价在工程化与选型——企业显然不希望把相当多的精力放在众多模型的试错选择上这正是推理服务要协助的部分。自建与第三方两条路径的真实成本腾讯云ES提供的灵活推理选择基于以上痛点腾讯云大数据团队构建了一套完整的推理服务体系以 Ray Serve 为生产级推理服务引擎向下对接 vLLM、SGLang、TensorRT-LLM 等推理框架与 GPU 异构算力池向上通过 Inference API 统一网关提供鉴权、限流与计量能力。在这一架构之上腾讯云 ES 提供三种灵活组合的供给方式方式一 · 开箱即用的原子服务。注册即可调用、按量付费覆盖 Agent 构建全链路由腾讯优图实验室打造的文档解析引擎支持 20 类文档格式突破图文混排版面分析、复杂表格识别等瓶颈递归字符分块与优图语义切块双策略的 Chunk 分块开源 bge/qwen 与自研 KaLM、Conan 双供给的文本 EmbeddingKinfra-VL 将文本、图片、视频统一到同一向量空间的多模态 Embedding微信团队研发、已在视频号/公众号等 10 余条产品线验证的 WeClip-v2 图文混搜模型以及 Rerank、Post-Rerank 精排、意图识别、多轮改写、查询改写和混元/DeepSeek 大模型服务。所有原子服务统一注册、统一鉴权、统一计量、统一监控像积木一样自由组合——「精选」二字直接省去了企业自己甄别模型的负担。开箱即用的精选原子服务方式二 · 企业自部署推理服务。模型自主权留在企业手里工程化交给平台主流开源模型一键部署、分钟级上线按 QPS/GPU 利用率弹性伸缩延迟、吞吐、显存、成功率全维度监控版本管理、灰度发布、一键回滚VPC 隔离、权限管控、审计日志保障企业级安全。对于有独占资源、自微调模型或数据合规要求的企业这是兼顾自主权与免运维的选项。企业自部署推理服务方式三 · 对接第三方推理服务。外部模型 API 统一接入纳入同一操作体系。三种方式并不互斥企业的不同模型可以各取所需、组合使用。而这一切的关键收口是 Inference API 统一网关上层应用面向 Inference API 编程不感知底层是原子服务、自部署模型还是三方 API路由、鉴权在网关层一次做完向量写入与向量查询走同一网关入库与检索使用同一模型口径避免维度与版本漂移。「模型应用」由此从架构决策简化为统一配置。Inference API一个网关串起三类推理方式Agent构建的四条路径从探索到生产的方案选择推理服务底座就绪之后Agent 怎么建坦率地说很多企业在向量技术选型与构建方式之间徘徊一站式可视化平台门槛低但担心不灵活纯代码开发灵活但担心投入大——很多企业就卡在这里迟迟没有动手。腾讯云 ES 给出的参考答案是按「需求复杂度 × 定制深度」划分的四条路径它们共享同一套推理服务底座四条构建路径全景按「需求复杂度 × 定制深度」选择路径 1 · Agent Builder 数据探查与原型验证。这是 ES 企业版默认提供的在 Kibana 中开箱即用的能力。过去我们用 Discover、Dashboard、DevTools 探查数据现在用自然语言直接探查跨索引检索汇总、自然语言直出可执行 ES|QL、关联日志/指标/Trace 定位根因甚至不止于回答——检测到 payment OOM 可以直接自动开单并通知 on-call。通过 MCP/A2AAgent Builder 还能对接到 WorkBuddy、Claude Desktop、Cursor 等外部工作台随时随地互动。想验证某个业务问法能否返回想要的结果直接对话再通过 Tools、Skills、Workflow 增强业务理解——原型验证的成本被压到对话级几个小时、最多半天即可验证 ES 技术栈是否满足需求。路径 2 · 轻量应用Agent Builder 或一站式 RAG。业务 QPS 不高、延迟不敏感的轻量场景调试好的 Agent Builder 可经 A2A/MCP 或 Converse 方式直接对接客户自有 Agent 或业务端天级别即可完成搭建——黑客松中已涌现出企业知识问答、技术客服、市场情报、游戏社区机器人、HR 分析助手、IoT 观测助手等丰富实践。若是纯 RAG 场景ES 控制台提供一站式 RAG 构建体验文档拖拽上传、在线测试、效果评估、代码生成、一键发布、服务监控。入库解析、切片、向量化、索引、检索意图理解、查询改写、多路召回、Rerank、生成LLM、引用溯源三段全链路可视化。路径 3 · 复杂应用TCDataAgent 或 ADP ES。业务流程复杂、需要可视化编排与独立集群保障的场景有两套方案腾讯自研的 TCDataAgent 面向 DataAI 场景通过多智能体协同完成从连接数据源、语义建模、对话取数到洞察输出的全流程ES 作为其存储与检索底座。ADP腾讯云智能体开发平台 ES 的组合则适合有复杂业务流程的中大型场景ADP 负责流程编排与应用框架ES 负责向量存储与检索两者通过 MCP Server 连接或独享知识库配置打通企业数据在 ES 集群中独立管理、可靠性有保障。路径 4 · 深度定制自主开发灵活构建。检索是核心竞争力、团队希望完全掌控代码的技术驱动型团队可以直接基于 SDK 与原子服务自主开发。好消息是CodeBuddy、Cursor、Codex 等 Vibe Coding 工具让开发成本大幅下降客户只需描述业务需求、评审生成代码框架选型LangGraph、Agents SDK、CrewAI、LlamaIndex交给 AIES 向量与混合检索、预置原子服务通过 API/MCP 即取即用评测集回归、调用链追踪、Token 成本与延迟监控、灰度与安全合规构成面向生产的工程化闭环。一句话AI 帮你写代码ES 帮你扛底座不受限于任何平台边界。企业Agent典型案例剖析案例一 · 某报业客户的舆情分析智能体TCDataAgent。该客户舆情栏目需对含投诉内容的数据做检索分类与统计分析传统工作流中运营人员要在检索系统做关键词分类、导出到 BI 工具统计、再粘贴进文档手动撰写报告跨三个工具、全程人工串联一份报告耗时 1 天。接入 TCDataAgent 后Planner 拆解任务、RAG Agent 向量召回与重排、SQL Agent 自动生成统计、Report Agent 汇总洞察并附引用溯源——5 分钟输出完整舆情报告100 倍提速每条结论可审计、可溯源。100 倍不是模型变快了而是把检索、统计、成稿三个割裂的工种合进了同一条链路。案例二 · 某游戏公司的 AI NPC自主开发路径。面对职业搭配、副本打法、装备词条等庞大玩法体系带来的客服压力该客户通过 Vibe Coding 生成 Agent、对接 ES 与原子服务打造 7×24 小时在线的公会引导员 AI NPC集攻略问答、情感陪伴、语音交互、工单服务于一体。知识进了向量库就从「攻略帖」变成了可复用的企业资产——NPC 只是它的第一个出口客服、社区、新版本宣发都能复用同一份知识。未来展望Agent应用需要高质量的上下文供给我们从一份 Gartner 最新的调研数据可以看到行业的真实现状16% 的企业已把 Agent 推进生产环境但真正拥有 AI-Ready 数据的只有 4%。热度与落地之间的这道缺口不是大模型能力的缺口而是上下文供给的缺口。由此我们应关注未来的三个转变从「怎么问」到「给什么」——上下文质量正取代 Prompt 技巧成为胜负手原子服务就是上下文工程的工业化封装从「堆模型」到「建体系」——全链路可观测与 Agent 评测运营将从配套项升级为一等能力从「存数据」到「让数据行动」——数据正从静态的记录系统变为驱动业务执行的行动系统。过去两年企业比较的的是谁接入的模型更强而接下来两年企业真正应该比较的是谁能把自己的上下文组织得更有质量。未来展望三个转变结语16% 与 4% 之间的落差表明Agent 竞争的主战场不仅仅在模型层更在高质量的上下文层。腾讯云 ES 团队在此方向上给出了构建思路以推理管道重构上下文生产方式以四条构建路径覆盖从可视化编排到自主开发的多样化方案。模型会不断更替而「让高质量上下文成为可复用、可组合、可工程化的基础能力」将是企业 AI 架构中沉淀周期最长的资产。Agent 从「能用」走向「好用」本质上是一次上下文供给的工业化——这正是腾讯云 ES 与行业共同推进的方向。
返回列表