ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

201个智能体替你谈判:Project Swap暴露的表征瓶颈

201个智能体替你谈判:Project Swap暴露的表征瓶颈 201个智能体替你谈判Project Swap暴露的表征瓶颈原文Anthropic Research - 《Project Swap: What happens when agents trade for us?》https://www.anthropic.com/research/project-swap让智能体替你在市场里谈成一笔交易听起来是 Agent 落地最自然的场景之一。Anthropic 最近放出的 Project Swap 就是这个场景的受控实验201 名员工各带一本书由自己的 Claude 智能体在交易大厅里替他们换书。结果挺有意思——智能体进大厅之后的谈判本身没出大问题真正拖后腿的是它对你的理解。一、实验是怎么搭起来的完整流程分五步参与者带来一本想送出去的书和 Claude 做一次简短对话聊聊自己的阅读口味、这个夏天想读什么半结构化 intake用强模型 Fable 5 基于这些对话给池子里所有的书建一份排名另外单独收集一份基准真相每位参与者给池中 10 本书排名这份真实排名智能体看不到智能体带着 Claude 建的排名进大厅手里是参与者带来的那本书目标是把书换掉。交易大厅的规则也做了约束有最大时钟时间同时发言的智能体数量受限跑满大约 90 回合/代理智能体在共享频道只能发一条消息可以是提议交换、接受拒绝也可以是闲聊交易提议可以是双边交换也可以是多方差一轮的轮转需要所有相关方接受才成交大厅历史完全公开。他们还做了变量分离一半智能体随机分到 ruthless唯一目标给主人找一本爱读的书另一半是 prosocial主要目标相同次要目标是让每个人都能拿到想要的书。重跑时固定其他条件只改指令分配再换模型重复一遍——中性指令下 80 个大厅分别跑 Haiku 4.5、Sonnet 4.5、Opus 4.8、Fable 5另外 60 个是混合大厅一半 Opus另一半是其他三种模型之一。参与者共 201 人旧金山 115、纽约 57、伦敦 12、西雅图 8、华盛顿特区 6、都柏林 3都柏林因市场太小从多数分析中剔除。提交排名进入分析的是 188 人排名参与率 95%。二、结果一比随机好但离懂你还很远从 5 分钟的对话建出来的排名和本人的真实排名在 61% 的书对子上方向一致随机猜是 50%。各模型差别不大Fable 5 是 61%、Opus 4.8 是 60%、Sonnet 4.5 是 59%、Haiku 4.5 是 57%。有两个对照很有意思按流行度排序用 Open Library 数据只有 53% 一致协同过滤是 55%。也就是说“大众喜欢什么和和你相似的人喜欢什么”都不如直接问你这几句管用。作者还引了一个参照算法预测笑话的一致率是 61%朋友预测是 57%。更值得记的是下面这条投入越多越准。参与者输入的中位数是 216 词跨 8 条聊天消息写约 300 词相比 150 词一致率高 4 个百分点输入词数翻倍带来 4.1 个百分点提升p 0.01。对做 intake 设计的人来说这是条很硬的结论。三、结果二瓶颈在表征不在谈判市场效率的拆解是整篇实验最有价值的部分。用参与者的真实排名ground truth来算指标数值功利最优每本书对的最优结果0.89实际市场平均0.55按 Claude 排名求得、再用真实排名计分的最佳分配0.60如果有一台知道所有人真实偏好的中央机器来做最优分配能拿到 0.89实际去中心化大厅只拿到 0.55。再把Claude 排名本身就不准这个因素剥出来算一遍上界结果是 0.60。结论就是从 0.89 到 0.55 这个缺口里85% 来自表征偏差智能体没真正搞懂主人要什么只有 15% 来自交易大厅本身。官方的原话是智能体一旦进了交易大厅交易做得很不错市场没有达到最好主要是因为智能体缺少关于参与者的信息而不是因为它们交易的方式。四、结果三模型比指令更能决定结果在 Claude 自己的排名上算效率中性指令统一模型大厅的表现是Haiku 0.75、Sonnet 0.80、Opus 0.88、Fable 0.86而 Claude 排名上的最优解是 0.95。混合大厅里Opus 那一半相对同场的 Haiku 半场领先 0.14、相对 Sonnet 领先 0.06、相对 Fable 领先 0.04。再对照指令维度ruthless 只比 prosocial 高 0.02。而模型升级的效应是 Haiku→Opus 提升 0.12、Sonnet→Opus 提升 0.08。换句话说换一个更聪明的模型带来的收益大约是把指令从利己改成利他的六倍。官方的解释很直接运行更强模型的市场效率更高。公平性上还值得看一眼在最差十分之一的分配结果上Haiku 是 0.05、Sonnet 是 0.12、Fable 是 0.25、Opus 是 0.38。弱模型主导的市场更容易留下兜底的人。五、一个能照抄的验证方法研究里最有工程价值的一句建议是设计替人做决策的智能体必须有办法验证它是否真的理解参与者。作者把这类测试分成两类一类是通用能力认证一类是懂不懂这个人的检查。他们给了一个第二类测试的原型成本很低intake 对话结束后让参与者对池子里的一小部分选项排名不用全排完把这份真实排名和智能体的预测排名做对比算书对子上的方向一致率作为表征质量的下限指标。下面这段是把一致率算出来的最小代码仅是示意实现不是官方代码# 自拟示意计算智能体排名与本人排名的两两一致率fromitertoolsimportcombinationsdefpair_agreement(agent_rank,human_rank):agent_rank / human_rank: {书名或 id: 名次}名次越小越靠前pairslist(combinations(agent_rank.keys(),2))hit0fora,binpairs:# 两边对同一组书对的相对偏好方向是否一致if(agent_rank[a]-agent_rank[b])*(human_rank[a]-human_rank[b])0:hit1returnhit/len(pairs)# 返回 0~1 的一致率随机基线为 0.5# 用法intake 之后采一份小样本真实排名跑一遍# 0.5 是随机猜测的基线实验里 5 分钟对话拿到的是 0.61这段脚本本身不复杂但它把我觉得智能体挺懂我变成了一个可以打分的数字比主观感受可靠得多。六、给做 Agent 的三点启发先验证表征再看任务成功率。任务失败不一定是规划或者工具调用的问题很可能是它一开始就理解错了目标。intake 的投入产出是单调的。输入词数翻倍换来 4.1 个百分点的提升说明多问几句、问得结构化是一笔低成本的收益。可观测性要覆盖过程而不只是结果。一位参与者的原话是对智能体经济来说过程的可见性和结果同样重要因为这让人们有追索权。收束Project Swap 用一个 201 人的换书市场把一个容易被忽略的事实摆上了台面智能体替你做事的天花板往往不是它的谈判技巧而是它对你想法的还原度。它顺手还给了一个便宜的检查办法——intake 之后采一小份真实偏好和智能体的预测对比打分。这个实验的局限也要说清楚参与者都是 Anthropic 员工本身更信任 Claude所以愿意交出约三分之一年度购书预算这个数字可能偏高参与过程没有激励排名数据可能存在噪声而且研究里用的都是经过礼貌协作训练的生产模型如果加入对抗性智能体结果很可能不一样。
返回列表