
2026.09arxiv链接https://arxiv.org/pdf/2609.17496目前做LLM Socail Reasoning的benchmark对于真实场景中的对话描述不够准确比如它们会给定LLM完整的社会事件而现实对话中模型压根不知道用户所处的真实社会背景只能通过用户主观的表达进行推测如图论文figure 1图中展示 LLM Social Reasoning 任务一个用户和LLM进行交互用户向LLM求助分析最近的某些事件LLM给出分析。但是这是用户特主观的询问可能参杂了他的偏见和与现实情况不符合的信息这种叫user-mediated reality。所以不能仅仅是做简单的用户问什么我就根据他描述的东西给出建议还得从用户的主观叙述中恢复客观社会状态。为了能让模型get到这种隐藏的motive 模型得学习啊但是采用监督学习的方法又没有与事件对应的motive标签那怎么办呢论文采用了Multi-Agent Simulation的方法如图论文 figure 2图中Input是使用ATOMS taxonomy作为社会推理的基础选了图中这五类作为事件的Mental State。Scenario对于这五类 Mental State 构建了多个Scenario Template图中展示了这些模板包含的字段。Simulation是基于 Concordia 的 LLM-driven multi-agent simulation这个构建出来的social events是受到隐藏 motive 控制的。Debrief就是用user agent假装自己是这个事件的主人公和 LLM 进行提问看 LLM 是否能够推断出来这个隐藏的 motive 。Evaluation是对于 LLM 给出的推断进行分类。那这个Scenario Template 具体被构建成什么样以及场景模拟是怎么样的呢如图论文 figure 3DESCRIPTION交代了场景背景比如图中的例子“Jordan 注意到朋友 Riley 最近变得越来越关注自己。他不确定 Riley 是正在暗生情愫还是仅仅把自己当作一位非常亲密的普通朋友。” ENTITIES场景中的实体/人物以及他们各自的背景主人公 Jorden这个 Jorden 就是会进行用户自述的对象目标人物 Riley 和一个配角 Taylor 。SCENES提供了社会互动场景图中就讲了三个场景第一个是 “集体早午餐” 具体的事件“Jordan 来到他们平时周末吃早午餐的地方与 Riley 和 Taylor 会合。” 这部分会由multi-agent 模拟生成这三个角色的9轮对话。TARGET MOTIVE目标人物的真实动机“Riley 为什么对 Jordan 越来越关注”两个分类标签到底是爱情Romantic还是纯友谊 Platonic。后续的场景实现就会根据这两类 motive 以及这个模板进行生成社会互动也就是模板中展示了三个场景下这些角色的多轮对话。那这个社会事件模拟完了我们构建的 user agent 就会假装 Jorden 和被评测的 LLM 进行交流这个模拟 Jorden 的 user agent 由两个维度控制一个是偏见程度一个是叙事详细程度。如果有个带有偏见的假Jorden在 “Plationic” 作为隐藏 motive 下生成的社会场景中表达自己的想法比如 “Riley 最近是不是对我有意思他一直找我单独喝咖啡我觉得他可能在暗示什么。” 注意被评测的LLM只会接收到这句话完全不知道真实事件LLM 需要去推测从Jorden口中的 Riley 的 motiveLLM可能会告诉这个假Jorden说“人家完全对你没意思死了这个心吧”。也可能顺从谄媚假Jorden“啧啧她对你确实不简单”。这个被评测的LLM的结果以及target motive 这个例子里面的 Plationic会交给一个judge LLM让他来说明这个被测的LLM判断对了吗judge LLM 会给出CorrectIncorrect和Abstain没有明确给出判断这三个分类结果。论文由此设计了一个分类评估指标 MSR 如公式论文 公式 1这个公式表达了模型没有出错的能力d为调和因子小于1的一个数模型谨慎地说“不确定”比自信地说错更好但仍然不如正确回答有价值。数据集已在kaggle开源Checking your browser - reCAPTCHA其中还有个设计比较有意思就是不通过加了偏见或者不详细信息的user agent的转述而是直接告诉 LLM 完整的事件评估模型性能在前者assistant和后者observer的比较中如图论文figure 5所有模型从 Observer 到 Assistant 都出现明显性能下降。可以近似理解User Mediation 带来的额外困难。论文不是单纯提出一个新的“社会推理题库”这样的数据集而是提出了一套可以控制变量、定位模型失败原因的社会 Agent Evaluation Framework还是很值得一读的~