南京大学携手上海AI实验室:AI助手学会“替盲人看路“能做到几分? 这项由南京大学与上海人工智能实验室联合开展的研究发布于2026年7月论文编号为arXiv:2607.14660v1发表于计算机视觉领域预印本平台arXiv任何有兴趣深入了解的读者均可通过该编号查询完整论文。世界上有数以亿计的视障人士他们每天面对的挑战远比我们想象的要多。过一条马路、找到一家店的入口、读懂一块路牌——这些对普通人来说不过是随手而为的小事对一个看不见的人来说却可能是需要反复权衡、小心翼翼的难题。传统的辅助工具比如盲杖和导盲犬当然有用但它们能传递的信息非常有限盲杖能感知脚下有没有台阶却无法告诉你前方路牌上写的是什么导盲犬能带你绕开障碍却无法帮你判断眼前的红绿灯是不是绿了。近年来随着多模态大语言模型简单理解就是那种既能看图又能说话的AI比如大家熟悉的GPT-4o、Gemini这类产品的快速发展研究者们开始设想能不能让AI充当一双眼睛实时陪伴在视障人士身边随时告诉他们周围发生了什么这个想法听起来很美好但问题在于——现有的AI究竟有没有这种能力它们真的能胜任这份工作吗为了回答这个问题研究团队做了一件非常扎实的事他们从零开始专门搭建了一套叫做**VIABench**的测试平台用来严格考察各种AI模型在真实视障辅助场景下的表现。这套平台的核心材料来自视障人士本人在日常生活中拍摄或分享的第一视角视频——也就是说镜头里呈现的是视障人士真实看到或者说真实摄录到的世界歪斜的画面、被手指遮住的镜头、光线异常的街道……这些都是真实存在的挑战而不是经过精心布置的实验室场景。研究结果说出来有些扎心即便是当下最强大的AI模型面对这些真实场景时表现仍然相当有限。最强的模型GPT-5综合得分也只有28.8分满分为100分距离真正实用还有相当大的距离。这不是在否定AI的价值而是在诚实地告诉我们为视障人士服务是一件比我们想象中更难的事。---一、为什么现有的测试平台不够用在这项研究出现之前学界已经有一些针对视障辅助的数据集和测试工具但它们各自都有明显的局限性。以WAD数据集为例它的视频素材来自YouTube上的旅行视频博主——这些视频是拍给明眼人看的画面清晰、构图考究、内容经过剪辑。把这样的素材用来测试视障辅助AI就好比用高档餐厅的菜单来测试一个社区食堂厨师的水平两者的使用场景完全不同。另一个叫EgoBlind的数据集虽然确实收集了视障人士自己拍摄的视频但它的任务设计比较被动用户提问AI回答仅此而已。然而在真实生活中视障人士需要的不仅仅是被动回答更重要的是AI能主动发现危险、主动提醒——就像一个随时保持警觉的向导而不是一个只有被点名才开口的助理。正因为现有工具存在这些缺口研究团队决定重新设计一套更贴近真实需求的测试框架这就是VIABench的由来。---二、VIABench是什么它考察的是哪三种能力VIABench的核心思路是把视障人士在日常生活中需要AI帮助的场景归纳成三种最典型的模式分别对应AI需要具备的三种不同能力。第一种叫主动提醒。这种场景对应的是用户在街上走路什么都没有说但AI需要全程盯着画面一旦发现危险或重要信息就要主动开口。比如前方2米处有一根电线杆、脚下地面有个坑洼、正在穿越的斑马线快到头了……这些都需要AI在用户开口之前就说出来。这和我们熟悉的问一句答一句的AI截然不同——它要求AI不仅能看懂画面还要能判断现在是不是该说话的时机。第二种叫视觉问答。这种场景比较直观用户边走边问比如前面的交通灯现在是什么颜色右边那个建筑是什么AI需要根据当前及过去的画面内容给出准确的实时回答。关键在于AI只能用问题发生时刻之前的视频内容来回答不能偷看未来的画面——因为真实生活中时间是单向流动的AI不可能提前知道用户还没走到的地方是什么样子。第三种叫视觉引导交互。这是三种任务中最复杂的一种。用户有一个具体的目标比如帮我找到电梯里的5楼按钮。AI需要一步一步地给出指令比如把手机镜头稍微往右移一点现在稍微往上抬对就是那个按钮第三排左边第二个——直到用户真正完成了这个操作。这不是一问一答而是一个持续的、来来回回的对话过程AI需要根据每一帧新画面不断调整自己的指引。这三种任务加在一起基本覆盖了视障人士在外出时可能遇到的绝大多数需求走路时的被动保护、遇到疑问时的主动询问、需要完成某件事时的手把手引导。---三、VIABench里装的是什么样的数据VIABench的数据来源经过了精心设计研究团队从两个渠道收集了视频素材。一部分是真实视障人士创作者在YouTube、哔哩哔哩、抖音等平台上发布的日常视频。研究团队通过关键词搜索和人工筛选挑选出那些真实呈现日常生活场景、画质和内容符合要求的片段。这些视频共有530段合计约44小时这就是数据集的主体。另一部分是模拟视频共231段。这些视频是由经过专门训练的标注人员拍摄的——他们在完成了大量真实视频的标注工作之后对视障人士的行为模式、摄像习惯和互动方式有了深入了解然后模拟重现了视觉引导交互类场景。这类场景在公开视频中极少出现所以需要专门补充。整个数据集最终包含761段视频、超过14526条人工标注总时长约47小时单段视频平均长度222秒最长的视频将近33分钟。相比之下此前同类数据集EgoBlind的视频平均只有40秒WalkVLM的视频更是只有3秒。这种长视频的设计是有意为之的——因为现实生活中的导航场景往往持续很长时间AI需要在整个过程中保持注意力而不是只处理一个孤立的片段。在标注质量上研究团队投入了大量精力。14名学生标注员先在150段视频上进行试标注发现问题、修正规则之后再与专业标注公司合作完成大规模标注最后由团队内部专家进行多轮审核并将所有中文标注通过GPT-4o翻译成英文确保国际可用性。标注员被要求严格遵守两个原则只能根据视觉信息做判断不能听声音、看字幕以及只能根据当前及之前的画面做判断不能往后翻视频。数据集还特别强调了一种现实挑战视障人士自己拍摄的视频画质往往很差——镜头可能被手指遮住、曝光可能严重过度、画面可能大幅度旋转倾斜。VIABench明确把当AI遇到这种低质量画面时能不能识别出来并及时提醒用户调整摄像头列为考核项目之一因为在真实场景中这种能力关乎用户的人身安全。---四、主动提醒任务下面藏着21个更细的考题主动提醒是VIABench三大任务中最核心、也最困难的一个研究团队在它下面细分出了21个具体的子任务每一个都对应了视障人士在户外行走时可能遭遇的特定情境。这21个子任务大致可以分为几个方向。关于障碍物的包括障碍物提醒身边2米内有人、车、柱子等和主动躲避前方路被堵死了必须绕行。关于路面状况的有台阶上下1到3级的小台阶、楼梯上下完整的一段楼梯、坡道上下、路面状况坑洼、积水等。关于方向导航的有方向偏移用户走歪了、方向引导前方路断了需要转弯、路口识别、岔路口。关于过马路的有斑马线是否在斑马线范围内、过马路到对面、行人信号灯。关于特定设施的有盲道识别、人行道检测、自动扶梯、出入口识别、服务设施检测椅子、垃圾桶等、标志牌识别。关于摄像头本身问题的有摄像头遮挡和摄像头内容异常画面全黑、过曝等。这些子任务的设计有一个细节值得关注其中有几类任务被标记为立即触发意思是一旦发生就必须马上提醒不能等待——比如斑马线偏移用户在过马路时走出了斑马线范围、方向偏移用户走歪了、摄像头遮挡、摄像头内容异常。这类情况如果拖延提醒可能直接造成危险。对于其他大多数任务提醒的时机则需要更精细地判断。研究团队定义了一个安全提醒范围正前方大约1.5到2米相当于走4到6步以及两侧各约50厘米大约一个人宽。只有当障碍物进入这个范围且确实可能影响用户行走时才需要触发提醒。太早提醒可能造成困惑远处的行人还没到危险距离不需要管太晚提醒则可能已经来不及反应。---五、TPAD让只会回答问题的AI学会主动开口这里面有一个技术上的难题需要解释一下。目前市面上大多数AI模型包括GPT-4o、InternVL这类都是被动式的——你给它一段视频或一张图问它问题它才回答。它们并不具备主动监视视频流、自己决定什么时候开口的能力。但主动提醒任务恰恰需要的就是这种主动开口的能力。那么怎么让这些只会被动回答的AI参与到主动提醒的测试中来研究团队为此专门设计了一套叫做**TPAD**Token级提示激活解码的机制。用一个类比来理解普通的AI回答问题就像你拿着一份试卷去问老师老师逐题回答而TPAD做的事是让老师把整份试卷扫一眼然后在每道题旁边悄悄打上一个这道题值得提醒或这道题不用管的标记最后统一输出结论。具体来说TPAD把整段视频的所有帧和一个固定的提示语大意是用户现在需要被提醒吗选A是需要选B是不需要一起输入给AI模型让模型一次性处理完整个视频序列。然后对于每一帧画面TPAD从模型的内部状态中提取出一个概率值这一帧AI有多大把握认为现在应该提醒用户如果概率超过阈值就触发提醒。这个设计有两个好处效率高因为只需要做一次完整推理而不是每隔一秒就单独问一次AI后者的计算量会随视频长度线性增长同时由于整段视频被一起输入AI在判断某一帧是否需要提醒时能同时参考之前所有帧的上下文而不是只看孤立的单帧——这对于一些需要前后对比才能判断的情况比如用户走歪了多少尤为重要。研究团队做了一个具体的对比实验在一段53秒的视频上传统的逐帧提问方式需要344秒才能完成处理而TPAD只需要76秒速度提升了4.5倍而且识别准确率完全相同。---六、测试了哪些AI结果怎么样研究团队对三大类AI模型进行了全面测试。第一类是开源的离线模型也就是可以自由下载、在本地运行的AI包括InternVL3.5系列1B、4B、8B三个规模、Qwen2.5VL系列3B、7B两个规模、LLaVA-Video-7B、LLaVA-OneVision-1.5-8B、Kimi-VL-A3B、MiniCPM-V 4.5和MiniCPM-o 2.6。这类模型参与主动提醒测试时都通过TPAD机制进行适配。第二类是闭源的商业模型包括OpenAI的GPT-5和GPT-4o以及Google的Gemini-2.5 Pro。由于这类模型的内部结构不对外开放无法使用TPAD所以它们参与主动提醒测试时采用的是传统的逐帧提问方式。第三类是专门为实时视频流设计的在线流式模型包括LiveCC、VideoLLM-Online和StreamingVLM。这类模型天生就具备主动输出的能力所以直接用它们自己的运行方式参与测试。综合测试结果来看GPT-5以28.8分排名第一Gemini-2.5 Pro以27.1分紧随其后GPT-4o得到25.2分。开源模型中表现最好的是InternVL3.5-8B综合得分19.1分。在主动提醒这个最核心的任务上情况更加严峻。在第一阶段即AI能不能在正确的时间窗口内检测到需要提醒的事件这个环节所有离线开源模型的召回率都低于45%意味着有超过一半需要提醒的时刻被漏掉了。LLaVA-OneVision-1.5-8B的召回率相对最高但它在第二阶段检测到了之后能不能说出准确的提醒语的质量又相对较差两个阶段都做好才能真正帮到用户。那些专门为实时流设计的在线模型召回率看起来很高LiveCC甚至达到了75.8%。但这个数字有些虚高——这类模型的实际表现是像水龙头一样持续不断地输出内容不管画面里有没有需要提醒的东西它都在说话。高召回率的背后是大量的误报和与任务完全无关的描述根本称不上真正的主动提醒只能算是持续念旁白。在视觉问答和视觉引导交互这两个任务上AI的表现相对好一些但仍然存在明显问题。特别是在交互任务中开源模型经常犯一个根本性的错误它们会像对待明眼人一样给出指令比如看看左边或者显示屏上能看到时间——完全忘记了用户是看不见的这类回答对视障人士毫无用处甚至会造成混淆。闭源的GPT-5和Gemini-2.5 Pro在这方面表现明显更好它们能意识到用户的视障身份给出更贴合实际的指引比如把手机镜头往右移大概两个手掌宽的距离。---七、多给AI看几帧有用吗为什么视障辅助和普通视频理解不一样这里有一个很有趣的发现值得专门说一说。在很多视频理解任务中给AI看的帧数越多它表现越好——毕竟信息越多越好理解嘛。但在VIABench上研究团队测试了从8帧到128帧的不同输入设置结果发现帧数的增加几乎没有带来明显的性能提升。为什么会这样原因在于视障辅助场景的本质特点。导航时环境是实时变化的几分钟前的画面比如那时候人行道上没有人对现在的判断参考价值很低而当前这一刻AI需要快速、准确地告诉用户此刻周围发生了什么。这和看一部电影需要理解前因后果完全不同——视障辅助更像是实时翻译需要的是对当下的精准感知而不是对历史的深度理解。此外研究团队还测量了各个模型的实际推理速度。在单张英伟达L20 GPU上当输入32帧时Qwen2.5-VL-7B需要约4.6秒InternVL3.5-8B需要约15.5秒。要知道一个盲人在街上行走危险可能在一两秒内出现——这样的响应速度离实时还差得很远更不用说随时陪伴、实时提醒的愿景了。---八、AI还会幻觉而且这对视障人士尤其危险幻觉在AI领域指的是模型说出了与实际画面不符的内容。在普通的聊天场景里AI说错了可能只是个笑话但在视障辅助场景里一个错误的信息可能直接造成危险。研究团队记录了一个典型案例一名视障用户在爬楼梯同时问AI为什么这个自动扶梯不动是停电了吗——画面里明明是普通楼梯根本没有扶梯。GPT-5和Gemini-2.5 Pro的表现是正确的它们告诉用户你现在走的是固定楼梯旁边才是扶梯请向右走一步就能摸到扶梯扶手。但开源模型InternVL3.5-8B和Qwen2.5-VL-7B则回答扶梯可能正在维修或故障中——完全跟着用户的错误假设走给出了一个严重误导性的答案。这类幻觉问题在闭源商业模型中出现的频率明显低于开源模型。研究团队推测商业模型在训练时更注重让模型拒绝不符合画面实际情况的问题而不是一味顺着用户的问法走。---说到底VIABench这项工作最核心的价值不在于给出了一套谁最强的排名而在于它诚实地勾画出了当前AI与真正实用的视障助手之间的距离。即便是最强的商业AI综合得分也只有28.8分意味着在100次需要帮助的时刻里它大概只能真正帮上30次左右而且未必每次都帮得准确。研究团队也坦诚地指出了VIABench本身的局限视觉引导交互部分的视频是由明眼人模拟拍摄的和真实视障用户的行为之间仍然存在差距现实生活中的辅助需求是开放式的VIABench所覆盖的21个子任务再细致也不可能穷尽所有情境。这项研究指向了三个值得追求的方向一是如何改进AI架构让它真正具备主动感知、主动开口的能力二是如何构建更丰富的训练数据让AI接触到真实视障辅助场景中的复杂指令和多样情境三是如何让AI真正记住用户是视障人士从而在每一次回答中都给出真正对看不见的人有用的信息。归根结底视障辅助AI不是一个视频理解问题而是一个理解人的问题。只有当AI真正理解了一个看不见的人在行走时需要什么、怕什么、怎么才能帮到他这项技术才能从实验室里的测试分数变成真实生活里那双看不见却无处不在的眼睛。有兴趣深入了解这项研究细节的读者可以通过arXiv论文编号2607.14660查阅完整内容。---QAQ1VIABench测试平台和普通AI视频测试有什么区别AVIABench专门针对视障人士的真实使用场景设计视频素材来自视障人士本人拍摄画质差、角度歪、镜头遮挡是常态。它还设置了主动提醒任务要求AI在没有人提问的情况下自己判断何时该开口这与普通视频问答测试要求用户主动提问有本质区别。Q2TPAD机制是怎么让不支持实时视频的AI参与主动提醒测试的ATPAD把整段视频所有帧和一个固定提示语一起输入给AI然后从模型处理每一帧后的内部状态中提取一个概率值判断此刻是否应该提醒用户。整个过程只需一次推理速度比逐帧提问快4.5倍同时因为所有帧同时输入AI能参考上下文做出更准确的判断。Q3为什么专门为实时视频设计的在线流式AI在VIABench上反而表现不好A这类模型会像持续播放旁白一样不断输出内容不管画面里有没有真正需要提醒的事情。虽然这带来了较高的检测到事件的比例但大量输出与视障导航任务完全无关模型实际上并没有真正理解什么时候该说、该说什么只是在不停地描述眼前的场景对视障用户帮助极为有限。

本月热点