ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

程序员必看!大模型智能体“聪明“起来的四大核心能力,一篇搞定,建议收藏!!

程序员必看!大模型智能体“聪明“起来的四大核心能力,一篇搞定,建议收藏!! 前言大模型智能体想要真正“聪明”起来离不开四大核心能力感知、规划、记忆和工具使用。有了它们模型才能突破传统大语言模型只会“纸上谈兵”的局限真正学会和外部世界互动。不过最早的大语言模型并没有这些“外挂”。它们只是靠着海量文本训练出来的“语言高手”擅长写作、对话和理解文字但一旦遇到需要调用外部工具、分步骤解决复杂问题或者记住用户长期对话内容时就显得力不从心。为了弥补这些短板研究人员开始探索各种方法怎样让模型学会熟练地使用工具怎样让它能像人类一样进行推理和规划又怎样给它装上“记忆”记住更长的对话历史这些正是大模型智能体走向更强大、更实用的关键方向。1 工具学习大语言模型虽然能聊天、写文章但要真正帮我们解决问题光靠说是不够的还得学会用工具。比如你问它请告诉我上海今天的天气。如果它具备工具使用能力就不会凭空编答案而是会调用一个天气查询API返回最新的天气情况。研究人员把这种能力称为工具学习Tool Learning。核心目标是让模型不仅会说话还会动手去操作外部工具从而满足各种现实需求。工具学习是怎么训练出来的以ToolLLaMA为例研究者们设计了一个三步走的流程来教模型收集工具API研究人员从 RapidAPI 这样的平台上抓取了大量真实世界的工具和接口说明比如输入参数、调用方法和示例返回值。经过筛选最后留下了3451 个高质量工具覆盖 49 大类和 500 多个细分领域。生成指令光有工具还不够还要让模型知道用户可能会如何提问。于是研究人员用 ChatGPT 自动生成了各种与工具相关的任务指令比如单一工具调用、多工具组合调用等最后得到了近20 万条“问题—工具”配对数据。标注解决路径每条任务指令对应的“调用步骤”也要明确。研究人员用 ChatGPT 的函数调用功能来生成这些路径并引入一种类似深度优先搜索的方法让模型能够探索多种可能的调用方式。最终得到了12.6 万条高质量的指令-解决路径数据。工具学习中的挑战虽然看起来很完善但现实中仍有不少问题数据错误很多训练数据集都是用 GPT-4 自动生成的但其中约有17% 的调用轨迹是错误的比如调用了不存在的工具、参数写错了等。这些错误会误导模型降低性能。关键词元问题研究发现模型在工具调用时一旦第一个关键词比如工具名的开头预测错误后面就很容易一路错下去但如果人工纠正第一个词后续往往就能正确生成。性能瓶颈即使用大规模数据集训练像ToolLLaMA-2-7B的效果也只达到 GPT-4 的80% 左右。新方法TL-Training为了解决这些问题研究人员提出了一种叫TL-Training的改进训练方法它包含三大策略过滤错误数据自动识别并屏蔽错误的调用轨迹避免它们对模型产生负面影响。重点学习关键词对工具名称和关键参数等“关键词元”赋予更高的权重让模型在预测时更重视这些词。强化学习优化引入奖励机制不同类型的错误给出不同的扣分例如调用了不存在的工具-2工具名称对了但参数写错-0.5 ~ -1.5正确调用1然后用强化学习PPO 算法不断调整模型使它越来越“靠谱”。实验结果显示只用 1217 条训练数据TL-Training 就能让CodeLLaMA-2-7B的工具使用能力接近GPT-4o。这说明靠更聪明的训练方法而不是一味依赖大规模数据也能让模型更好地学会用工具。2 推理规划对一个智能体来说光能聊天还不够它必须具备推理和规划能力。只有这样AI 才能理解环境和任务制定合理的行动步骤并一步步执行最终达成目标。不过研究发现单纯把模型做大并不能显著提升它的推理能力。比如在常识推理、逻辑推理、数学题解答上大模型还是容易犯错。那该怎么办呢研究人员借鉴人类的解题习惯提出了两种特别有效的方法思维链提示Chain-of-Thought, CoT和由少至多提示Least-to-Most Prompting。1 思维链提示方法一思维链提示一步一步想人类在解题时通常会把解题过程写下来先分析条件再列式子最后得出答案。相比之下大模型以前的做法往往是直接蹦出答案没有任何中间推理步骤。结果往往准确率不高还缺乏解释性。为了解决这个问题Google Brain 的研究人员提出了思维链提示CoT在给模型问题时不只提供最终答案还提供“中间的解题思路”引导模型先输出推理步骤再得出结果。这样模型就像学生一样边思考边写草稿最后得到更靠谱的答案。更有意思的是后来研究人员发现只需要在问题前面加上一句“让我们一步一步思考”哪怕没有示例模型也会自动生成中间步骤。这就是所谓的零样本思维链Zero-shot CoT。方法二由少至多提示化整为零面对一个复杂的问题人类常常会先拆解把大问题分成小问题逐个解决最后拼出答案。大模型同样可以这样做。这种方法被称为由少至多提示Least-to-Most Prompting先让模型把复杂任务拆成多个简单子任务然后逐一求解最后合并结果完成整体推理。通过这种方式模型在处理复杂任务时的成功率大大提高。自动化的思维链构建虽然思维链方法很有效但最初的研究大多依赖人工写的推理过程。问题在于不同人写的示例质量差异很大准确率差别甚至能达到28%后来研究人员发现示例的多样性比单纯的相似度更重要也就是说要让模型学得好给它看的推理示例不能千篇一律而要覆盖不同风格和角度。基于这一发现上海交通大学和 AWS 的研究团队提出了Auto-CoT 方法通过自动收集多样化的问题并为它们生成推理链来构建更有效的训练示例。Auto-CoT 包括以下两个主要阶段1问题聚类将给定数据集中的问题划分为几个簇Cluster2范例采样从每个簇中选择一个代表性问题并基于简单的启发式方法使用 Zero-shot CoT生成问题的推理链。在链式思维的研究中Auto-CoT算法提供了一种自动化生成推理示例的方法。它的核心思路是通过聚类来保证示例的多样性从而避免因为样本过于相似而带来的推理偏差。具体来说Auto-CoT 会先利用Sentence-BERT把问题集合转化为向量表示然后使用K-means 聚类将问题分成若干簇。在每个簇中问题会根据与簇中心的距离排序越接近中心的问题越优先被选为候选。在生成推理链时Auto-CoT 会对每个候选问题构造提示让模型按照“让我们一步一步思考”的方式作答并得到解释和答案。如果生成的推理步骤不超过 5 步、问题本身长度不超过 60 个词元那么该示例就会被保留下来作为该簇的代表性范例。这样得到的推理链示例既简洁又具有代表性。在此基础上研究者还提出了几种改进方法Complex-CoT优先选择那些推理过程最复杂的问题作为示例帮助模型更好地处理复杂任务。Self-Polish从问题本身入手把原本复杂、模糊甚至质量较低的问题改写成更清晰、更高质量的形式从而提升模型理解和生成推理链的能力。总体而言这些方法的共同目标都是提升 CoT 的有效性既要保证示例的多样性又要提升示例的质量。2 由少至多提示在面对复杂问题时人类通常会把大问题拆解成若干个小问题然后逐一解决最后再把答案拼接起来得到完整的结果。这种思维方式被称为任务分解Task Decomposition。研究人员受到这一启发提出了一种叫做由少至多提示的方法。它的核心思想是利用大语言模型的规划能力把一个复杂问题拆分成一系列更容易处理的子问题并一步步解决它们。整个流程大致分为两个阶段问题分解阶段模型先学习如何把原始问题拆分成子问题并形成一个子问题列表。逐步解决阶段模型会按照子问题的顺序逐一作答每解决一个子问题就把结果作为“中间答案”保存下来帮助它继续解下一个问题直到得出最终答案。这种方式就像解谜游戏先把大谜题分解成小块再逐一拼接最终得到完整的图景。AgentTuning为了让大语言模型在更多场景下具备动手能力研究人员提出了一种叫做AgentTuning的方法。它的目标是让模型在保持通用推理能力的同时更好地完成各种智能体任务比如操作系统指令、网页交互、数据库查询等。AgentTuning 的核心有两部分一个轻量级的数据集 AgentInstruct它收集了1,866 条高质量的交互数据这些数据不仅有“答案”还包含模型的完整推理过程Chain-of-Thought覆盖了六类任务虚拟环境操作AlfWorld、网络购物WebShop、网页浏览Mind2Web、知识图谱、操作系统和数据库。一种混合调优策略通过结合不同类型的指令调优方式提升模型的泛化性。数据构建方式很有意思对于已经有训练数据的任务如 AlfWorld、WebShop研究人员直接利用原始数据再加上交互和过滤。对于缺乏数据的任务如操作系统、数据库则要“自造数据”数据库任务以 BIRD 数据集为基础利用 GPT-4 生成推理过程并通过执行 SQL 语句来比对答案筛选出正确轨迹。操作系统任务直接让 GPT-4 设计任务和解决方案再由 GPT-4 自己去“操作终端”并生成交互轨迹最后通过比对结果来确认哪些数据是有效的。交互过程是这样进行的给模型一个任务说明和一个示例然后让它进入真实的“对话式操作”模型先“思考”生成 Thought再采取行动。环境会反馈新的信息或状态。模型再基于反馈继续操作直到完成任务或者失败。如果模型总是卡在重复输出或者输出的格式不符合要求就会通过自动指标比如 BLEU 分数来纠正或丢弃这些轨迹。最终只有高质量的数据会被保留下来。在实验中研究人员用 AgentTuning 对Llama 2进行了微调得到一个叫AgentLM的开源模型。测试结果显示AgentLM 在未知的智能体任务上表现良好在一些标准基准测试MMLU、GSM8K、HumanEval、MT-Bench上仍然保持很强的综合能力特别是AgentLM-70B它在智能体任务上的表现已经接近GPT-3.5-turbo。简而言之AgentTuning 就像是给大模型加上了一门“实操训练课”不仅能解题还能在更接近真实世界的环境里完成任务。最后为什么要学AI大模型当下⼈⼯智能市场迎来了爆发期并逐渐进⼊以⼈⼯通⽤智能AGI为主导的新时代。企业纷纷官宣“ AI ”战略为新兴技术⼈才创造丰富的就业机会⼈才缺⼝将达 400 万DeepSeek问世以来生成式AI和大模型技术爆发式增长让很多岗位重新成了炙手可热的新星岗位薪资远超很多后端岗位在程序员中稳居前列。与此同时AI与各行各业深度融合飞速发展成为炙手可热的新风口企业非常需要了解AI、懂AI、会用AI的员工纷纷开出高薪招聘AI大模型相关岗位。最近很多程序员朋友都已经学习或者准备学习 AI 大模型后台也经常会有小伙伴咨询学习路线和学习资料我特别拜托北京清华大学学士和美国加州理工学院博士学位的鲁为民老师给大家这里给大家准备了一份涵盖了AI大模型入门学习思维导图、精品AI大模型学习书籍手册、视频教程、实战学习等录播视频全系列的学习资料这些学习资料不仅深入浅出而且非常实用让大家系统而高效地掌握AI大模型的各个知识点。这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】AI大模型系统学习路线在面对AI大模型开发领域的复杂与深入精准学习显得尤为重要。一份系统的技术路线图不仅能够帮助开发者清晰地了解从入门到精通所需掌握的知识点还能提供一条高效、有序的学习路径。但知道是一回事做又是另一回事初学者最常遇到的问题主要是理论知识缺乏、资源和工具的限制、模型理解和调试的复杂性在这基础上找到高质量的学习资源不浪费时间、不走弯路又是重中之重。AI大模型入门到实战的视频教程项目包看视频学习是一种高效、直观、灵活且富有吸引力的学习方式可以更直观地展示过程能有效提升学习兴趣和理解力是现在获取知识的重要途径光学理论是没用的要学会跟着一起敲要动手实操才能将自己的所学运用到实际当中去这时候可以搞点实战案例来学习。海量AI大模型必读的经典书籍PDF阅读AI大模型经典书籍可以帮助读者提高技术水平开拓视野掌握核心技术提高解决问题的能力同时也可以借鉴他人的经验。对于想要深入学习AI大模型开发的读者来说阅读经典书籍是非常有必要的。600AI大模型报告实时更新这套包含640份报告的合集涵盖了AI大模型的理论研究、技术实现、行业应用等多个方面。无论您是科研人员、工程师还是对AI大模型感兴趣的爱好者这套报告合集都将为您提供宝贵的信息和启示。AI大模型面试真题答案解析我们学习AI大模型必然是想找到高薪的工作下面这些面试题都是总结当前最新、最热、最高频的面试题并且每道题都有详细的答案面试前刷完这套面试题资料小小offer不在话下这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】
返回列表