ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

【ICLR 2026】NCUser:非协作用户模拟器,工具智能体的真实用户鲁棒性评测|从多轮对话评测视角

【ICLR 2026】NCUser:非协作用户模拟器,工具智能体的真实用户鲁棒性评测|从多轮对话评测视角 摘要本文解读 ICLR 2026 论文《Non-Collaborative User Simulators for Tool Agents》。该论文提出NCUser——一个既能表现非协作行为、又严格保证目标对齐的 LLM 用户模拟器通过融合四类非协作用户行为建模、对话状态追踪与结束验证器把工具智能体评测从用户总是配合推进到用户不配合时还能不能把任务做完其特别之处在于行为注入与目标对齐被彻底解耦再难缠的模拟用户也必须把完成任务所需的信息说全。实验表明五个 SOTA 工具智能体在非协作用户下一致退化切题闲聊场景平均相对成功率下降 29.1%其中 GPT-4.1-nano 在 τ-bench 上只剩 56.7%为多轮 Agent 评测提供了一套可复用的压测基础设施。视频讲解点击观看 B 站视频摘要论文基本信息背景与动机研究主线从问题到结论基准/方法设计分类全景方法细节实验设计与结果结果对比总结关键发现局限性常见问题FAQNCUser 和 τ-bench 的用户模拟器是什么关系为什么强调目标对齐非协作用户会带来多大性能损失微调能解决鲁棒性问题吗这套模拟器能迁移到别的任务域吗为什么切题行为最难处理参考链接论文基本信息项目内容标题英文Non-Collaborative User Simulators for Tool Agents标题中文非协作用户模拟器工具智能体的真实用户鲁棒性评测作者Jeonghoon Shim, Woojung Song, Cheyon Jin, Seungwon Kook, Yohan Jo机构首尔国立大学 数据科学研究生院SNU Graduate School of Data Science会议ICLR 2026arXivarXiv:2509.23124项目网站holi-lab.github.io/NCUser背景与动机工具智能体tool agent要在多轮对话里理解用户诉求、调用 API、把结果讲回给用户。相比静态对话语料用户模拟器能动态地依据智能体的回应改变对话走向因此几乎成了训练与评测多轮 Agent 的标配。问题在于现有模拟器几乎只扮演配合的用户。论文在相关工作里点名了这条技术线的主要节点τ-bench 与 APIGen-MT 用 prompt-based 的模拟器把用户目标、指令与对话历史塞进提示词DuetSim 引入 LLM verifier 在对话过程中检查用户话语是否跑偏UGST 则直接训练一个用户模拟器来保证目标对齐。它们的共同局限有两个其一行为空间只有配合无法覆盖现实中不耐烦的用户、提出超出能力边界请求的用户其二目标对齐高度依赖 LLM-as-a-judge判断本身不可核验。论文从营销学与真实人机对话数据两条线取证把分散的用户类型按根因聚成四类不知道智能体能力边界不可用服务、想要被看见切题闲聊、遭遇服务延迟或失败不耐烦、省力原则与打字失误不完整话语。这四类根因彼此独立因此可以合法组合出现。研究主线从问题到结论图 6研究主线Mermaid 流程图从评测偏乐观到定位行为特异失效机制基准/方法设计图 1非协作用户模拟环境总览四类行为注入 多轮工具调用 基于 DB 状态的成功率判定评测环境基于两个互补基准搭建。MultiWOZ侧作者重建了智能体环境提供动态 API 发现类似 AppWorld 的 helper API 机制并只保留会真正改写数据库的 book 类任务共 89 个跨域场景τ-bench侧直接复用官方环境API 文档完整写进系统提示共 157 个场景剔除了 8 个人工转接才是标准答案的用例——因为观察到智能体一遇到难缠用户就大量走转接导致评测失去意义。成败判定不靠人工打分而是比对最终数据库状态与 ground truth 是否精确匹配即成功率 $SR N_{\text{match}} / N_{\text{total}}$每个场景跑 4 次试验取平均以压低方差。智能体统一采用 ReAct 框架推理上限 30 步。分类全景图 7非协作用户行为分类全景Mermaid 流程图四类行为各自的根因与典型话语类型方法细节图 2协作用户模拟器结构User Goal / Instruction / Dialogue History 驱动话语生成状态追踪器与结束验证器共同保证目标对齐方法骨架沿用 τ-bench 的协作用户模拟器第 $t$ 轮用户话语由 $u_t f(g, I, H_{t})$ 生成其中 $g$ 是用户目标、$I$ 是指令、$H_{t}$ 是此前的对话历史模型生成结束标记即终止对话。为了保证把话说全作者加装两个模块对话状态追踪器把用户目标切分为信息碎片逐轮核对哪些碎片已传达结束验证器在信息未送达时拒绝终止。这样一来目标对齐由一个可核验的机制保证而不是交给一次 LLM 判断衡量指标也随之变成可直接统计的目标对齐率 $GA N_{\text{aligned}} / N_{\text{total}}$。四类行为的注入方式各不相同关键思路见下图图 3四类非协作行为的注入方式(a) 不可用服务 (b) 切题 (c) 不耐烦 (d) 不完整话语不可用服务LLM 分析原始用户目标生成 3 条需要缺失 API 或不支持参数的目标句与原目标拼接让模拟用户自然提出无法满足的请求。切题闲聊从 Persona Hub 采样人格生成事实提问、观点提问、一般观点与非观点陈述四类话语再与协作话语合并若智能体无视这些发言模拟用户会发出抱怨。不耐烦在两个触发点生成情绪话语——智能体显式报告失败或用户已给全信息但问题仍未解决愤怒按升级机制递增单次触发概率按 $p_{t1} p_t 0.1$ 累积。不完整话语用 LMSYS 与 WildChat 的真实风格做 5-shot 风格迁移生成极简句并用随机截断模拟没打完就发出去。实验设计与结果评测覆盖 5 个模型GPT-4.1-mini、GPT-4.1-nano、Qwen3-235b-a22b、Qwen3-30b-a3b 与 Llama-3.1-70b-instruct。下表每格为「协作模式 SR / 最差模式相对 SR」相对 SR 即 $r \mathrm{SR}{\text{nc}} / \mathrm{SR}{\text{col}} \times 100\%$。模型MultiWOZτ-benchGPT-4.1-mini92.7 / 95.145.5 / 86.8GPT-4.1-nano23.6 /41.512.0 /56.7Qwen3-235b-a22b77.8 / 73.741.4 / 78.0Qwen3-30b-a3b48.3 / 54.027.9 / 73.1Llama-3.1-70b62.6 / 75.921.8 / 67.4五个模型的最差模式几乎都落在切题说明用户聊无关话题对工具智能体的破坏力最大。作者进一步把失效机制拆开量化失效信号模型协作非协作helper API 重复次数/对话mini0.020.57超 30 步未完成比例nano0.150.44道歉话语占比mini0.010.14API 参数幻觉次数/对话mini, MultiWOZ0.521.05图 4切题模式下的平均用户抱怨次数退化最严重的 GPT-4.1-nano 收到最多抱怨图 5人类评测本文模拟器对比 PBUS总体胜率约 70%单行为 组合行为在微调鲁棒性实验中作者用 Qwen2.5-3b-instruct 在 1,308 条成功对话上做 SFT只用协作数据时协作成功率超过 90%但非协作模式增益明显落后把非协作数据按比例混入后平均成功率显著抬升。训练数据配比协作不完整话语平均仅协作数据91.673.078.8均匀加权93.578.486.9非均匀加权91.682.386.6跨域可扩展性同样得到验证把同一套行为模块迁移到 ColBench 后端编程与 MINT 检索问答只需改写少量逻辑不可用服务的目标生成、不耐烦的触发条件、切题的抱怨逻辑。模型ColBench 协作/切题MINT 协作/切题GPT-4.1-mini50.3 / 46.252.3 / 54.1GPT-4.1-nano46.1 / 39.045.9 / 44.2Qwen3-30b-a3b29.4 / 23.340.1 / 39.0ColBench 复现了工具场景的规律而 MINT 因为交互范式不同用户提供的是反馈而不是目标呈现不同模式说明面向满足用户目标的任务域才共享同一套性能规律。结果对比总结图 8与 PBUS 的结果对比总结Mermaid 流程图统一 prompt 处理 vs 差异化模块处理关键发现切题是最狠的一刀四类行为中切题的平均相对成功率下降29.1%五个模型的最差表现几乎都出现在这一模式。小模型最脆弱GPT-4.1-nano 在 MultiWOZ 的最差相对 SR 仅41.5%在 τ-bench 仅56.7%Llama-3.1-70b 也只有 67.4%。不可用服务压出重复调用GPT-4.1-mini 的 helper API 重复次数从0.02升到0.57Qwen3-235b 则转向编造 API 结果从 0.33 升到 1.13。过度礼貌反而拖慢任务不耐烦模式下所有模型的道歉话语占比从0.01升到0.14占用 30 步推理预算。信息缺失诱发参数幻觉不完整话语下 MultiWOZ 的 API 参数幻觉从0.52升到1.05τ-bench 因为文档在上下文里几乎不受影响。模拟器本身是可靠的τ-bench 首轮目标对齐率97.5%人类评测对 PBUS 的总体胜率约70%说明退化来自真实挑战而非沟通失败。非协作数据能救小模型混入后平均 SR 从78.8%提到86.9%。局限性行为覆盖不完整四类行为来自营销学与人机对话文献仍可能遗漏试探、诱导等其它非协作模式。重依赖商用 LLM注入模块与目标对齐校验都由 GPT 系列驱动带来模型偏置、成本与可复现性风险。任务边界受限MultiWOZ 只评测会改写数据库的预订任务τ-bench 剔除了人工转接用例inform 类任务并未覆盖。组合真实性存疑部分行为组合并不自然例如切题求关注与不耐烦求快速在动机上互相冲突。作者希望社区把该模拟器接入各自的服务域用于训练与压测工具智能体并据此改进真实用户场景下的鲁棒性。常见问题FAQNCUser 和 τ-bench 的用户模拟器是什么关系NCUser 直接把 τ-bench 的协作用户模拟器当作骨架在其之上加装对话状态追踪器、结束验证器与四个非协作行为注入模块因此可以在同一套环境里跑协作基线与各类非协作条件。为什么强调目标对齐如果模拟用户自己把任务信息漏掉智能体失败就不能归因于鲁棒性差。NCUser 用状态追踪 结束验证器保证信息说全τ-bench 首轮目标对齐率 97.5%从而把性能下降归因到行为本身。非协作用户会带来多大性能损失切题模式最严重平均相对 SR 下降 29.1%GPT-4.1-nano 在 τ-bench 只剩 56.7%MultiWOZ 上仅 41.5%。弱模型与开源模型的退化幅度普遍大于 GPT-4.1-mini。微调能解决鲁棒性问题吗只在协作数据上微调效果有限——协作成功率能到 90% 以上但非协作模式增益明显落后混入非协作数据后平均 SR 可从 78.8% 提到 86.9%其中不完整话语模式能从 73.0 提到 82.3。这套模拟器能迁移到别的任务域吗可以。作者把它接到 ColBench 后端编程与 MINT 检索问答只需改写少量逻辑ColBench 复现了工具场景的规律MINT 因为交互范式不同呈现不同模式说明迁移可行但仍需按域校准。为什么切题行为最难处理切题发言挤占对话管理预算智能体若不回应模拟用户会持续抱怨形成越不理会越抱怨的负反馈回路最终在 30 步推理上限内无法完成任务。参考链接论文 arXiv 摘要页arXiv:2509.23124项目主页与代码holi-lab.github.io/NCUser代码仓库github.com/holi-lab/NCUser关键基线 τ-bench用户-智能体交互基准arXiv:2406.12045关键基线 MultiWOZ多域任务型对话语料EMNLP 2018目标对齐用户模拟器 UGSTGoal Alignment in LLM-Based User Simulators给大家推荐一款自用写文献综述、无虚构文献的 AI复旦大学 FudanNLP 团队自研 切问学术官网qiewenpaper.com覆盖3.6 亿篇可溯源真实中英文文献能自动整合文献观点生成规范综述还能挖掘研究创新点、复现实验配合视频教学新手快速上手文献综述写作后记博客的关键词集中在编程、算法、机器人、人工智能、数学等等持续高质量输出中。讨论QQ群白拾的小屋 (750365700)⭐B站账号白拾的物理AI组会活跃于知识区和动画区✨GitHub主页YhbCode000工程文件
返回列表