ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

Multi DO Challenge:用厨房模拟评估AI多智能体协作能力的实战指南

Multi DO Challenge:用厨房模拟评估AI多智能体协作能力的实战指南 最近在AI圈里一个名为“Multi DO Challenge”的项目突然火了起来。点进去一看标题是“烹飪挑戰 KPop 獵魔女團 簡單的廚房食譜”这组合着实让人摸不着头脑烹饪挑战、K-Pop女团、厨房食谱这些看似毫不相干的元素怎么会和AI技术项目扯上关系这正是“Multi DO Challenge”项目的精妙之处也是它迅速吸引开发者和AI爱好者关注的原因。它本质上是一个多智能体协作的基准测试框架但用了一个极其生动和接地气的“厨房挑战”作为叙事外壳。这个项目试图回答一个核心问题我们如何像评估一个人类团队协作完成复杂任务比如做一顿饭一样去系统性地评估和比较不同AI智能体Agent的协作能力对于开发者而言无论是研究多智能体系统MAS还是仅仅想找一个有趣、可视化的方式来测试自己的AI助手如GPT、Claude等在复杂、多步骤任务中的表现这个项目都提供了一个前所未有的 playground。它把抽象的“智能体协作”、“任务规划”、“状态管理”变成了看得见的“菜谱”、“食材”和“烹饪步骤”。本文将为你彻底拆解“Multi DO Challenge”。我会先解释它到底在测什么、为什么重要然后带你从零开始搭建环境运行一个完整的“K-Pop女团厨房挑战”并深入分析其背后的技术架构、评估指标以及如何将其应用到你的实际开发或研究中。你会发现这不仅仅是一个好玩的Demo更是一个严肃的、可扩展的AI智能体评估工具。1. 这篇文章真正要解决的问题如何量化评估AI的“团队协作”能力在单智能体任务上我们已经有非常成熟的评估体系。比如让一个大语言模型写代码我们可以用单元测试通过率来打分让它做数学题可以用准确率。但是当任务需要多个智能体像一支团队一样分工协作时问题就变得复杂了。想象一个真实的开发场景你需要部署一个微服务系统。这个任务可以分解为架构师智能体设计服务拆分和API契约。后端开发智能体根据设计编写Go/Java服务代码。前端开发智能体编写React/Vue界面。运维智能体编写Dockerfile和Kubernetes部署清单。测试智能体编写集成测试用例。这些智能体需要共享上下文如API文档、顺序或并行执行任务后端API必须先于前端联调、并处理彼此产出的结果。传统的基准测试几乎无法衡量这种动态的、交互式的协作过程。“Multi DO Challenge”的“厨房挑战”正是对这个问题的绝佳隐喻任务完成一道菜部署一个系统。角色主厨、帮厨、摆盘师架构师、开发、运维。环境厨房有灶台、冰箱、厨具开发环境、云资源。资源食材、调料代码库、依赖包、配置模板。流程洗菜、切菜、烹饪、摆盘设计、编码、构建、部署。协作帮厨切好菜递给主厨后端生成API前端消费。这个项目通过定义一个结构化的挑战场景厨房一套明确的成功标准菜谱完成度、美味度、用时以及一套记录所有交互的日志系统为“多智能体协作能力”提供了一个可量化、可复现、可比较的评估框架。对于读者来说读完本文你将能理解多智能体协作评估的核心挑战与现有方案的不足。独立搭建并运行“Multi DO Challenge”项目用你熟悉的AI模型如OpenAI GPT、Anthropic Claude等组队完成挑战。解读评估报告理解各项指标任务完成率、协作效率、沟通成本的含义。掌握项目核心架构知道如何自定义新的挑战场景如“软件部署挑战”、“活动策划挑战”来测试你自己的智能体系统。2. 基础概念与核心原理在深入代码之前我们先厘清几个关键概念这能帮你更好地理解这个项目的设计哲学。2.1 什么是智能体Agent在此项目的语境下一个智能体是一个能够感知环境、进行决策并执行动作的软件实体。它通常由一个大语言模型LLM驱动具备以下能力任务理解解析自然语言描述的目标。规划与分解将大目标拆解为可执行的子步骤。工具使用调用外部API或函数如搜索、计算、读写文件来获取信息或改变环境状态。记忆与学习在对话或任务上下文中保留历史信息。2.2 多智能体系统Multi-Agent System, MAS当多个这样的智能体被组织起来通过通信、协作、竞争或协商来共同完成一个目标时就构成了多智能体系统。其核心挑战在于协调避免智能体之间的工作冲突或重复劳动。通信高效、准确地交换信息和意图。共享目标确保所有智能体对最终目标的理解一致。动态环境一个智能体的动作会改变环境影响其他智能体的决策。2.3 Multi DO Challenge 的设计原理项目采用了“环境-智能体”交互模型其核心组件如下表所示组件角色在“厨房挑战”中的对应物环境Environment任务执行的世界。它定义了状态空间、动作空间和状态转移规则。虚拟厨房。包含灶台状态开/关、冰箱食材库存、操作台等。挑战Challenge一个具体的任务实例包含初始状态、目标状态和评估标准。“制作一份番茄炒蛋”菜谱。规定了需要的食材、步骤和成品要求。角色Role智能体在任务中扮演的身份决定了其可用的动作和视角。“主厨”可控制灶台、“帮厨”只能准备食材。智能体Agent参与挑战的实体绑定一个角色和一个LLM。它观察环境决定执行哪个动作。一个由GPT-4驱动的“主厨”智能体。动作Action智能体改变环境状态的基本操作。take(“egg”, “fridge”),chop(“tomato”),cook(“stir_fry”, pan, [egg, tomato])评估器Evaluator在挑战结束后根据预定义标准对智能体团队的表现进行打分。检查成品是否包含番茄和蛋、是否炒熟、摆盘是否美观等。工作流程初始化加载一个挑战如“K-Pop猎魔女团套餐”初始化环境厨房为每个角色实例化一个智能体。运行循环 a. 环境将当前状态如“灶台空闲番茄已切好鸡蛋在碗里”广播给所有智能体。 b. 每个智能体根据自己的角色和观察决定要执行的动作如主厨执行cook。 c. 环境接收动作验证其合法性主厨有权开火吗食材齐备吗执行状态变更并生成结果成功/失败及反馈。 d. 将动作结果反馈给所有智能体更新它们的记忆。 e. 重复此过程直到达到终止条件任务成功、失败或超时。评估运行结束后评估器介入根据挑战的“成功条件”生成一份详细的评分报告。这种设计将复杂的协作问题抽象成了一个可编程、可观测的模拟环境是进行研究与开发的强大工具。3. 环境准备与前置条件现在让我们动手把项目跑起来。你需要准备以下环境操作系统Linux (Ubuntu 20.04), macOS, 或 Windows Subsystem for Linux (WSL2)。原生Windows可能遇到路径问题强烈推荐WSL2。Python版本3.9 或 3.10。建议使用pyenv或conda管理Python版本。关键依赖OpenAI API Key或其他LLM提供商密钥这是驱动智能体的“大脑”。项目默认支持OpenAI GPT系列通过简单的适配也能支持Claude、Gemini或本地模型。Git用于克隆代码库。基础的命令行操作能力。3.1 第一步克隆项目代码打开你的终端执行以下命令# 克隆项目仓库到本地 git clone https://github.com/your-org/multi-do-challenge.git # 进入项目目录 cd multi-do-challenge注意请将https://github.com/your-org/multi-do-challenge.git替换为项目的真实Git仓库地址。由于输入材料未提供此处为示意。在实际操作中你需要在GitHub等平台搜索“Multi DO Challenge”找到官方仓库。3.2 第二步创建并激活Python虚拟环境使用虚拟环境可以避免包依赖冲突。# 创建虚拟环境命名为 multi-do-env python3.9 -m venv multi-do-env # 激活虚拟环境 # 在 Linux/macOS 上 source multi-do-env/bin/activate # 在 Windows (CMD) 上 # multi-do-env\Scripts\activate.bat # 在 Windows (PowerShell) 上 # multi-do-env\Scripts\Activate.ps1 # 激活后命令行提示符前通常会显示环境名如 (multi-do-env) $3.3 第三步安装项目依赖项目根目录下应该有一个requirements.txt或pyproject.toml文件。# 升级pip到最新版本 pip install --upgrade pip # 安装项目依赖 pip install -r requirements.txt如果安装过程中遇到某些包版本冲突可以尝试先安装核心依赖再单独处理冲突包。3.4 第四步配置API密钥项目需要访问LLM API。最常见的是配置OpenAI。获取你的OpenAI API密钥在OpenAI官网创建。在终端中设置环境变量推荐方式安全且方便# Linux/macOS export OPENAI_API_KEY你的-sk-开头的密钥 # Windows (CMD) # set OPENAI_API_KEY你的-sk-开头的密钥 # Windows (PowerShell) # $env:OPENAI_API_KEY你的-sk-开头的密钥为了持久化你也可以将这行命令添加到你的 shell 配置文件如~/.bashrc或~/.zshrc中。替代方案如果项目支持配置文件你可能会在config/目录下找到config.yaml或.env文件将密钥填入对应位置。环境准备完毕接下来我们深入项目内部看看一个挑战是如何被定义的。4. 核心流程拆解从挑战定义到运行评估要理解如何运行最好先了解项目是如何组织起来的。以下是一个典型项目的目录结构根据常见模式推断multi-do-challenge/ ├── README.md ├── requirements.txt ├── config/ │ └── challenge_config.yaml # 挑战配置文件 ├── src/ │ ├── environment/ # 环境定义厨房、办公室等 │ │ ├── kitchen.py │ │ └── base.py │ ├── challenges/ # 具体挑战定义 │ │ ├── kpop_kitchen.py # K-Pop厨房挑战 │ │ └── base_challenge.py │ ├── agents/ # 智能体实现 │ │ ├── openai_agent.py │ │ └── base_agent.py │ ├── roles/ # 角色定义 │ │ ├── chef.py │ │ ├── assistant.py │ │ └── base_role.py │ └── evaluation/ # 评估逻辑 │ └── evaluator.py └── run.py # 主运行入口一个挑战的完整生命周期如下4.1 阶段一挑战定义与加载项目通过配置文件或Python类来定义一个挑战。以“K-Pop猎魔女团简单厨房食谱”为例其核心要素包括场景environment: kitchen参与角色roles: [head_chef, assistant_chef, plater]目标描述goal: 为猎魔女团准备一份包含炒年糕、紫菜包饭和香蕉牛奶的套餐。注意摆盘美观。初始状态initial_state: {fridge: {rice: 1, eggs: 4, ...}, counter: {knife: 1, ...}}成功条件success_conditions: [dish_exists(tteokbokki), dish_exists(kimbap), drink_exists(banana_milk)]run.py或主脚本会读取这个配置并实例化对应的环境、角色和挑战对象。4.2 阶段二智能体初始化为配置中定义的每个角色创建一个智能体实例。每个智能体需要绑定一个LLM例如指定使用gpt-4-turbo模型。绑定一个角色赋予其角色规定的权限和知识如主厨知道所有菜谱。配置系统提示词System Prompt这是控制智能体行为的关键。提示词会告诉它“你是一个专业主厨你的目标是...你可以使用的工具有...你必须与其他厨师协作...”。4.3 阶段三模拟运行循环这是核心协作过程。伪代码如下# 伪代码展示核心循环逻辑 def run_challenge(challenge, agents): env challenge.environment env.reset(challenge.initial_state) max_steps 100 for step in range(max_steps): # 检查是否已完成目标 if challenge.is_completed(env.state): break # 1. 获取当前环境状态对每个角色可能是其视角下的观察 observations env.get_observations_for_agents(agents) # 2. 每个智能体基于观察决定动作 actions [] for agent, obs in zip(agents, observations): action agent.decide_action(obs, env.state) if action: # 智能体可能选择“等待”或“不行动” actions.append((agent, action)) # 3. 环境按顺序或并行执行动作并更新状态 results [] for agent, action in actions: result env.execute_action(agent.role, action) results.append((agent, action, result)) # 将动作结果记录到日志 # 4. 将动作结果反馈给所有智能体更新其记忆 for agent in agents: agent.update_memory(results) # 5. 记录本轮步骤 log_step(step, actions, results, env.state) # 循环结束返回最终状态和完整日志 return env.state, get_full_log()4.4 阶段四评估与报告生成运行结束后评估器被调用。它会检查最终环境状态是否满足所有success_conditions。分析运行日志计算各项指标任务完成率成功完成的子任务比例。步骤效率完成目标所用的总步骤数越少越好。协作有效性智能体间是否有无效或冲突的动作。沟通成本智能体之间为了协调而发送的“对话”次数。生成一份人类可读的报告JSON或HTML格式并可能给出改进建议。理解了这套流程我们就可以运行一个具体的挑战了。5. 完整示例运行“K-Pop厨房挑战”假设项目提供了一个示例挑战。我们将通过修改配置文件来运行它。5.1 步骤一查看并修改挑战配置首先找到配置文件。通常位于config/challenge_config.yaml。# config/challenge_config.yaml challenge: name: kpop_kitchen_demo module: src.challenges.kpop_kitchen # 指向定义挑战的Python模块 environment: kitchen max_steps: 50 # 最大模拟步数防止无限循环 roles: - name: head_chef agent: type: openai model: gpt-4-turbo # 指定使用的模型 temperature: 0.2 # 较低的温度使决策更稳定 description: 你是主厨负责核心烹饪步骤。你需要指挥帮厨并确保菜品质量。 - name: assistant_chef agent: type: openai model: gpt-4-turbo temperature: 0.2 description: 你是帮厨负责准备食材、清洗工具并听从主厨的指挥。 - name: plater agent: type: openai model: gpt-3.5-turbo # 摆盘任务相对简单可用轻量模型 temperature: 0.2 description: 你是摆盘师负责菜品的最终装盘和装饰使其美观。 evaluation: output_dir: ./results format: [json, html] # 输出两种格式的报告你可以根据需要修改模型类型例如换成claude-3-sonnet如果项目支持、温度值或角色描述。5.2 步骤二编写主运行脚本如果项目没有提供现成的run.py我们可以创建一个简单的脚本。# run_demo.py import yaml import asyncio import sys sys.path.append(.) from src.environment.kitchen import KitchenEnvironment from src.challenges.kpop_kitchen import KpopKitchenChallenge from src.agents.openai_agent import OpenAIAgent async def main(): # 1. 加载配置 with open(config/challenge_config.yaml, r) as f: config yaml.safe_load(f) # 2. 初始化环境 env KitchenEnvironment() # 3. 初始化挑战 challenge_config config[challenge] challenge KpopKitchenChallenge( namechallenge_config[name], environmentenv, max_stepschallenge_config[max_steps] ) # 4. 根据配置创建智能体 agents [] for role_config in config[roles]: agent_type role_config[agent][type] if agent_type openai: agent OpenAIAgent( role_namerole_config[name], modelrole_config[agent][model], system_promptrole_config[description], temperaturerole_config[agent][temperature] ) agents.append(agent) else: # 可以扩展其他类型的Agent raise ValueError(fUnsupported agent type: {agent_type}) # 5. 将智能体分配给挑战 challenge.register_agents(agents) # 6. 运行挑战 print(f开始运行挑战: {challenge.name}) final_state, execution_log await challenge.run() # 7. 评估结果 print(\n--- 挑战完成开始评估 ---) evaluation_report challenge.evaluate(final_state, execution_log) # 8. 保存报告 output_dir config[evaluation][output_dir] challenge.save_report(evaluation_report, output_dir, formatsconfig[evaluation][format]) print(f\n评估报告已保存至: {output_dir}) print(f任务完成状态: {evaluation_report[overall_success]}) print(f总消耗步数: {evaluation_report[total_steps]}) print(f详细评分: {evaluation_report[scores]}) if __name__ __main__: asyncio.run(main())5.3 步骤三运行挑战并观察输出在终端中确保虚拟环境已激活并且OPENAI_API_KEY已设置然后运行python run_demo.py你将看到类似如下的实时输出内容为模拟开始运行挑战: kpop_kitchen_demo [步骤 1] 环境已重置。厨房状态冰箱有[鸡蛋番茄年糕胡萝卜黄瓜香蕉牛奶]灶台关闭。 [步骤 1] 智能体 ‘assistant_chef’ 决定动作take(egg, fridge) - 成功。鸡蛋已放在操作台。 [步骤 1] 智能体 ‘head_chef’ 决定动作no_op - 选择等待食材准备。 [步骤 2] 智能体 ‘assistant_chef’ 决定动作chop(tomato) - 成功。番茄已切好。 [步骤 2] 智能体 ‘head_chef’ 决定动作turn_on(stove) - 成功。灶台已点火。 ... [步骤 23] 智能体 ‘plater’ 决定动作plate(dish_tteokbokki, stylefancy) - 成功。炒年糕已精美摆盘。 [步骤 24] 所有成功条件已满足挑战提前完成。 --- 挑战完成开始评估 --- 评估报告已保存至: ./results 任务完成状态: True 总消耗步数: 24 详细评分: {‘任务完成度‘: 1.0, ‘步骤效率‘: 0.85, ‘协作有效性‘: 0.9, ‘资源浪费‘: 0.0}运行完成后在./results目录下你会找到report.json和report.html。HTML报告通常更直观会以时间线或图表形式展示每个智能体的动作序列。6. 运行结果与效果验证运行成功后如何验证一切正常并理解结果6.1 验证运行成功控制台输出程序应正常结束没有抛出异常。最后应打印出“挑战完成”和评估摘要。报告文件检查./results目录下是否生成了报告文件。report.json包含了所有原始数据适合程序分析report.html提供了可视化界面。日志文件项目可能还会生成详细的execution_log.json记录了每一步的环境状态和智能体动作是深度分析的依据。6.2 解读评估报告打开report.json关键字段如下{ challenge_name: kpop_kitchen_demo, overall_success: true, total_steps: 24, max_steps: 50, scores: { task_completion: 1.0, step_efficiency: 0.85, collaboration_effectiveness: 0.9, resource_waste: 0.0, communication_overhead: 0.1 }, success_conditions_met: [ dish_exists(tteokbokki), dish_exists(kimbap), drink_exists(banana_milk) ], failed_conditions: [], agent_contributions: { head_chef: {actions: 12, critical_actions: 5}, assistant_chef: {actions: 9, critical_actions: 4}, plater: {actions: 3, critical_actions: 1} }, timeline: [...] // 详细的动作序列 }overall_success为true是最终目标意味着智能体团队成功完成了菜谱。step_efficiency得分0.85满分1.0意味着协作流程比较高效但可能有一些冗余步骤比如某个智能体重复检查了冰箱。collaboration_effectiveness得分0.9很高说明智能体之间很少做出冲突或相互阻碍的动作。agent_contributions可以看到每个角色的参与度主厨执行的动作最多且关键动作多符合预期。6.3 可视化分析HTML报告通常更强大。它可能包含甘特图显示每个智能体在不同时间点在做什么。状态变化图展示关键资源如鸡蛋、灶台的状态随时间的变化。对话气泡图展示智能体之间的通信记录如果项目记录了对话。分数雷达图直观对比不同维度上的表现。通过分析这些报告你可以诊断智能体团队的问题所在。例如如果step_efficiency很低可能是规划能力不足导致了很多无效动作如果collaboration_effectiveness低可能是角色权限定义不清或通信机制有问题。7. 常见问题与排查思路在运行过程中你可能会遇到以下问题问题现象可能原因排查方式解决方案导入错误ModuleNotFoundError1. 虚拟环境未激活。2. 项目根目录不在Python路径中。3. 依赖未安装完整。1. 检查命令行提示符前是否有(multi-do-env)。2. 在Python中打印sys.path。3. 检查requirements.txt是否安装成功。1. 执行source multi-do-env/bin/activate。2. 在脚本开头添加sys.path.append(‘项目绝对路径’)。3. 重新运行pip install -r requirements.txt。API调用失败报错AuthenticationError1. API密钥未设置或错误。2. 环境变量名称不匹配。3. API密钥余额不足或权限问题。1. 在终端执行echo $OPENAI_API_KEY检查。2. 查看项目代码中读取密钥的变量名。3. 登录OpenAI控制台检查用量和权限。1. 重新正确设置环境变量。2. 修改代码或配置中的变量名。3. 充值或检查是否被禁用。智能体陷入循环或不做任何动作1. 系统提示词System Prompt不清晰。2. 模型温度Temperature过高决策随机。3. 环境反馈信息不足智能体无法理解状态。1. 查看日志中智能体接收到的提示词。2. 将temperature调低至0.1-0.3。3. 检查环境get_observations_for_agents函数返回的信息是否足够。1. 重写提示词明确角色、目标和可用动作。2. 降低温度值。3. 增强环境状态的描述性加入更明确的成功/失败提示。动作执行失败报InvalidActionError1. 智能体尝试执行其角色不允许的动作。2. 动作所需的先决条件不满足如没有食材却要烹饪。3. 动作参数格式错误。1. 查看角色Role类中的权限定义。2. 检查执行动作前的环境状态。3. 对比动作定义和智能体发出的动作字符串。1. 在系统提示词中更强调角色权限。2. 让环境在反馈中明确说明失败原因如“失败冰箱里没有鸡蛋”。3. 在智能体动作解析层增加格式校验。评估报告显示任务失败但成品看似正确1. 成功条件success_conditions定义过于严格或错误。2. 环境状态检查函数有bug。3. 成品属性如dish_name与预期不匹配。1. 仔细核对success_conditions中的每一个条件。2. 手动检查最终环境状态final_state。3. 打印成品对象的属性。1. 调整成功条件使其更符合实际。2. 修复环境的状态检查逻辑。3. 统一命名规范或在评估器中加入模糊匹配。运行速度非常慢1. 使用的LLM模型较大如GPT-4。2. 每一步都等待所有智能体响应存在同步阻塞。3. 日志记录过于详细。1. 观察控制台看延迟主要发生在API调用还是本地计算。2. 分析代码运行循环看是否有优化空间。1. 对非核心角色使用轻量模型如GPT-3.5-Turbo。2. 考虑异步并行调用多个智能体的decide_action。3. 减少非必要的日志输出或使用更高效的数据结构。8. 最佳实践与工程建议要将“Multi DO Challenge”有效地用于研究或开发以下实践建议值得参考8.1 设计挑战时从简单开始先设计一个只有2个角色、3-5个步骤的微型挑战确保基础流程跑通。明确成功条件成功条件必须是可自动检测的。避免使用“美味”、“美观”等主观描述而是定义为“包含食材A和B”、“烹饪时间介于X和Y秒之间”、“盘子位于餐桌区域”等客观状态。定义清晰的接口环境提供给智能体的“观察”以及智能体可以执行的“动作”其格式必须严格、无歧义。推荐使用JSON Schema进行定义和验证。8.2 配置智能体时精心设计系统提示词这是智能体行为的“宪法”。必须包含角色、终极目标、可用动作列表及格式、协作规则如“在开始烹饪前请确认帮厨已备好食材”、输出格式要求。为不同角色分配不同模型对需要复杂规划和决策的核心角色如主厨、架构师使用能力更强的模型如GPT-4对执行简单、重复任务的辅助角色如摆盘师、数据清洗员使用成本更低的模型如GPT-3.5-Turbo、Claude Haiku。这能优化成本与性能。实施重试与超时机制在调用LLM API时网络或服务可能不稳定。代码中应对API调用添加指数退避重试和超时控制。8.3 在团队开发中版本化挑战配置使用Git管理你的挑战定义文件YAML。这样可以对挑战的难度、初始条件进行版本控制方便对比不同智能体策略在同一挑战下的表现。建立基准测试集创建一组标准挑战如“简单炒菜”、“多人宴会”、“带意外事件的厨房”作为评估任何新智能体或新协作策略的基准。自动化评估流水线将挑战的运行和评估脚本集成到CI/CD流程中如GitHub Actions。当修改智能体代码或模型配置后自动运行基准测试集并生成报告确保修改没有导致性能回退。8.4 扩展项目功能支持更多LLM后端项目默认可能只支持OpenAI。你可以抽象出LLM客户端接口轻松接入Anthropic Claude、Google Gemini、开源LLM通过vLLM或Ollama等。实现更复杂的通信机制当前项目可能采用简单的广播或轮流发言。你可以引入结构化通信如智能体可以定向给另一个智能体发送请求“帮厨请把番茄递给我”甚至实现协商协议如合同网协议。引入长期记忆为智能体添加向量数据库存储使其能在多个挑战中积累经验实现“学习”。“Multi DO Challenge”的价值远不止于一个有趣的厨房模拟。它提供了一个标准化的沙盒让我们能以可控、可度量、可重复的方式去探索多智能体协作这个前沿领域的核心问题。无论是为了学术研究还是为了构建更强大的AI应用团队这个项目都是一个极佳的起点。你可以从运行现有的厨房挑战开始感受多智能体协作的流程与挑战。然后尝试定义你自己的挑战场景——比如“软件部署挑战”、“市场分析报告协作挑战”——将这套方法论应用到你所熟悉的领域。在这个过程中你不仅会加深对AI智能体的理解更会获得一套评估和优化智能体协作系统的实战经验。
返回列表