ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

Evaluating the Ability of Large Language Models to Reason about Cardinal Directions, Revisited

Evaluating the Ability of Large Language Models to Reason about Cardinal Directions, Revisited 文章主要内容总结本文聚焦于评估大型语言模型(LLMs)对基本方向(cardinal directions, CDs)的推理能力,是对作者此前在COSIT-24会议上发表工作的扩展。研究使用一个包含5760个问题的基准数据集(由6个模板生成),测试了28个LLM(包括最新的大型推理模型LRMs)的表现。研究背景:空间推理是人类在物理世界中行动的基础,而LLMs不具备实体性,其对现实世界场景的空间推理能力有待验证。基本方向推理在导航、地理理解、气候分析等领域至关重要,因此成为研究焦点。实验设计:通过模板自动生成问题,变量包括移动方式(如步行、骑行)、人称(第一/二/三人称单复数)、方向类型(基本方向如南北、中间方向如东北)等。采用零样本提示,要求模型仅输出方向答案。主要结果:所有模型准确率均高于随机猜测(0.125),但无模型能完全可靠推理;最佳模型为o1(准确率0.92),远高于早期模型(如GPT-3.5 Turbo的0.60)。大型推理模型(LRMs)表现优于传统LLMs,且推理token使用量与难度相关(中间方向需更多token)。模型表现受人称、移动方式、模板类型影响(如线性物体模板T4准确率最低),存在性别偏向和方向混淆(中间方向更易出错)。关键发现:部分模型(如GPT-4.5)可能因训练数据包含基准集而表现异常;LRMs推理token使用量与答案正确性存在关联(部分模型
返回列表