
给VLA加触觉后就越加越差了。——回答触觉进入模型后的四个问题目录01 触觉是有用问题是模型未必知道该怎么用第一件事是机器人需不需要触觉但第二件事是只要把触觉加进模型模型就会变强吗02 触觉不是“另一台相机”它和视觉连工作节奏都不一样03 第一个问题什么时候应该听触觉的04 第二个问题模型一定要重新学一门“触觉语言”吗05 第三个问题谁真的需要触觉06 最后一个问题触觉究竟应该有多大的话语权07 从“多模态融合”到“感知分工”08 那么为什么给机器人加上触觉反而可能更差和还在躬身入局的朋友聊聊行业具身智能很“吵”。翻开任何一个议程排在最前面的必然是世界模型、VLA 、灵巧手、数据采集。同时质疑泡沫的声音越来越大几乎每个热门方向都被业内人喷过一遍。所有人都在同一条没铺完的路上跑摸索期的特征就是没有权威。既然谁都没法证明自己对公开质疑就成了这套系统唯一的纠错机制。再加上钱到位的速度快过技术兑现的速度中间那段真空只能靠话语吹填。牛皮一膨胀反噬就来了。一边拿钱一边骂。在这个行业里不是什么新鲜事是常态。吵归吵还能被骂说明至少都还在牌桌上。但「触觉」不在。一年前“触觉”还称为是最后一块拼图如今几乎退成了一个零部件位了。你甚至很难在最近的行业论坛议题里找到单独属于它的一节。它不再拥有自己的名字。但两年前触觉被寄予的期望可不是这样的。不过好在话题度虽然在退但钱可一分没少投进去。触觉在2024-2025年经历了一轮密集的融资造势。原因是触觉开始进入的不只是机器人的手而是机器人的「模型」。这源于堪称业内最害人的一句话共识模态越多模型越强。所以此前触觉基座模型、视触融合VLA、灵巧手触觉赋能的赛道热度空前所有人都在扎堆给机器人“加装触觉”。传感器配齐、信号打通、token 接入一套流程走完看似完成了技术升级但真机跑起来的结果是更烂了。粗暴给模型堆叠触觉模态不仅没有增效反而会污染原有感知体系。这种无效升级不如不加。最典型的就是今年六月以李飞飞为代表的三十四个作者联名发布的一篇名为 T-Rex 的工作。他们在 π0.5 这个行业基座上将触觉 token 简单拼接进原有模型的 Transformer 输入。然后平均任务成功率从 17% 反干到了 6%。而在同一套机器人硬件、同一组评测任务与评估标准下换一种接法就提高到了65%。本质上现在的问题不是如何让机器人「拥有」触觉认知。而是如何让模型真正「用好」触觉01 触觉是有用问题是模型未必知道该怎么用先把最容易混淆的两件事拆开。第一件事是机器人需不需要触觉答案几乎没有悬念。越是精细的操作越需要。视觉擅长告诉机器人“东西在哪里”、“大概是什么”、“下一步往哪走”。但真正接触以后很多决定成败的信息反而会从画面里消失。插头是不是轻微卡住了夹爪是不是快滑了擦拭时压力够不够瓶盖到底拧紧没有。这些状态在 RGB 图像里可能几乎没有变化可对机器人来说动作结果已经完全不同。于是过去两年里把触觉、力觉接进 VLA逐渐成了一条很自然的路线。一些工作已经证明在接触密集型任务里如果机器人能获得力、形变、滑移等反馈确实可能做得更稳。但第二件事是只要把触觉加进模型模型就会变强吗这里的答案就没那么“简单”了。今天的 VLA 并不是一块等待添加新传感器的空白海绵。它已经在大量视觉、语言和机器人数据上学会了一套相对稳定的表示方式。模型知道什么样的图像意味着“杯子在左边”什么样的语言意味着“把它拿起来”也逐渐建立了某种“看到什么就怎么动”的对应关系。触觉却完全不是同一种数据有的传感器输出形变图有的输出 marker 位移有的是六维力和力矩还有的是密集的 taxel 数值。更关键的是这些信号在主流 VLA 的大规模预训练阶段几乎没有出现过。于是一个看起来很基础的问题出现了模型真的会因为多看到一种数据就自然知道怎么使用它吗CVPR 2026 的 AT-VLA 是这个方向里一个很有代表性的研究。在拉拉链、盖章、擦花瓶和拧瓶盖等真实机器人任务上做了一组非常直接的实验。完全不用触觉时原始 VLA 的平均成功率是 22%。但是如果把 6D 力信号持续输入模型成功率反而降到 13%换成二维 marker 位移只剩 5%直接把视觉触觉图像作为 token 输入时甚至只有 2%。也就是说在这组实验里三种不同形式的触觉直接加进去以后都比不加「更差」。▲图1 | 这四类任务的共同难点并不是“看不见目标”而是进入最后的接触阶段后画面变化可能很小物理状态却在快速变化。当然这并不能推出“给 VLA 加触觉普遍有害”。不同模型、传感器和任务的结果都可能不同。但这个实验把一个过去很容易被忽略的问题摊到了桌面上“触觉有信息”与“模型会使用这些信息”从来不是一回事。而要理解为什么会出现这种差距还得先看清视觉和触觉本身到底有什么不同。02 触觉不是“另一台相机”它和视觉连工作节奏都不一样视觉和触觉都叫“感知”很容易让人下意识地把它们当成两种并列的信息源。但放到机器人身上它们承担的工作其实非常不同。视觉是一种很“提前”的感知。机械臂还没碰到杯子时相机已经能判断杯子在哪里、把手朝哪边、周围有没有障碍物。它看到的是一个相对完整的场景主要处理的是目标、位置、语义和全局关系。触觉几乎相反。它通常是局部的只来自手指、夹爪或某个接触面附近很多时候只有真正碰上以后才开始有意义。在大量自由空间运动阶段它甚至什么都不需要说。两者需要的反应速度也不一样。理解一句指令、识别一个物体、判断下一步往哪走并不需要每几毫秒重新算一遍。但如果一个插头已经顶在插孔边缘或者手里夹着的物体突然开始滑动机器人如果再等几百毫秒重新“思考一次”可能已经晚了。所以如果把两类信息的角色说得简单一点视觉更多是在回答“我现在要做什么目标在哪里”触觉经常是在回答“刚才这一下对不对现在要不要立刻修一点”一旦把这层差异说清楚最近一批工作里那些看起来各不相同的设计就开始连成一条线了。它们并不是单纯在发明更多“触觉模型”而是在依次回答四个问题“什么时候应该听触觉的触觉应该以什么形式进入模型模型里的谁需要听以及触觉究竟应该有多大的话语权03 第一个问题什么时候应该听触觉的如果触觉真正有价值的时刻主要发生在接触之后那么最直接的想法就是没碰到的时候先别让它一直‘说话’。这也是近来一类代表性方法的核心。模型仍然依靠原来的视觉和语言去理解任务、找到目标、靠近物体只有检测到接触真正发生以后触觉通道才被打开开始影响后续动作。这看起来似乎只是多了一个“开关”但它改变的其实是触觉在整个系统里的身份到了真正需要它的时候它才介入。更进一步既然视觉和触觉需要的反应速度不同那它们也未必要走完全相同的计算路径。一种典型的做法是把视觉语言理解和触觉反应拆成快慢两条流慢流继续负责看场景、理解任务快流则不断读取最新的触觉反馈在接触过程中快速修正动作。在前面提到的代表性研究 AT-VLA 里这条触觉反应路径可以在约0.04 秒内完成一次闭环更新。▲图2 | 这张框架图对应全文的第一个问题什么时候应该听触觉上方的 Slow Stream 继续处理视觉、语言和机器人状态负责较低频的场景理解与动作意图下方的 Fast Stream 持续编码触觉只有当 Tactile Gate 判断它真正有用时才把触觉送进 Action Expert。这里的关键并不是“多接一根传感器”而是把两类感知按职责和频率拆开视觉负责把手送到正确的位置触觉负责接触发生后的快速纠偏。这和人手的工作方式其实很接近。拧瓶盖时我们不会每感觉到一次轻微滑动就重新思考“这是一只瓶子我的目标是打开它”。高层目标根本没有变真正需要快速变化的只是手指应该再用多少力、往哪个方向多拧一点。同样是 6D 力信号直接持续注入模型时平均成功率只有 13%而当触觉只在合适阶段介入并配合更快的反应路径后平均成功率提高到了 50%。所以第一层答案已经很清楚触觉什么时候进来可能比“有没有触觉”本身更重要。但这只解决了“时间”上的问题。即便我们知道什么时候需要触觉模型仍然要面对第二个麻烦一种在预训练阶段从没见过的新模态到底应该以什么形式进来04 第二个问题模型一定要重新学一门“触觉语言”吗今天的大多数 VLA几乎都生长在视觉和语言的预训练世界里。这意味着当我们增加触觉时常见做法往往是再加一个触觉编码器把新特征和原来的视觉、语言 token 放在一起。从架构上看这很“正统”。但从数据上看它有一个现实问题视觉语言模型见过海量图片和文本触觉编码器却只能依赖规模小得多、而且高度依赖具体传感器的机器人数据来学习。于是另一类研究开始反过来想既然 VLA 已经很会看图为什么一定要逼它重新学一套触觉表示TAP-VLA 是这种思路里很直观的一篇代表性工作。它没有额外增加一套复杂的触觉输入接口而是先从 GelSight 里提取接触面的剪切方向再把这些受力变化画成箭头直接叠到普通 RGB 图像上。对模型来说它还是在“看图”。只不过这张图现在多了一些明确的提示哪一侧正在受力、力往哪里变化、左右手指的剪切是否对称。▲图3 | 这张图对应第二个问题触觉应该以什么形式进入模型左侧并没有把原始触觉图像直接塞进 VLA而是先根据触觉表面的 marker 位移估计剪切方向再把这些方向画成箭头叠加到正常 RGB 画面中。这样一来模型输入仍然是它最熟悉的“图像”但画面里被显式补上了原本看不见的接触信息。这个设计想解决的并不是触觉本身够不够丰富而是如何尽量复用已有视觉预训练能力避免用少量下游数据重新学一门陌生的“触觉语言”。这个方法可能听起来有一点“笨”。但它恰好避开了“用少量数据重新学习一种新模态”的难题。在四类真实机器人任务中这种做法一共完成了 120 次测试里的 94 次整体成功率约为 78%而纯视觉微调、直接输入原始触觉图像、额外训练触觉编码器等几种方案总体成功率都没有超过 50%。这里真正值得讨论的并不是“‘画箭头’比加 encoder 更聪明”。而是一个更一般的问题对于预训练大模型来说一种信息“以什么形式”进入模型可能和这项信息“本身有多重要”一样关键。可即使我们把触觉“翻译”成模型容易理解的形式问题仍然没有结束。因为还有第三层是不是模型里的所有部分都需要知道这些触觉信息呢05 第三个问题谁真的需要触觉这个问题到了 World Action Model 上会变得尤其明显。世界动作模型不只是输出动作它还试图预测“接下来世界会变成什么样”。那么一个自然的想法是既然接触任务需要触觉不如把未来触觉也一起预测让模型同时想象“接下来会看到什么”和“接下来会摸到什么”。逻辑上没有问题。但近期 Tactile-WAM 的研究发现当局部、稀疏、事件驱动的触觉 token 无约束地进入一个以视觉动态为核心的世界模型后反而可能干扰原本的视觉预测。研究把这种现象称为Tactile Pollution触觉污染。问题并不是触觉没有价值而是“动作需要触觉”和“整个视觉世界模型都需要触觉”根本不是同一回事。于是解决办法反而不是让两种模态融合得更彻底而是开始主动限制信息流。负责预测未来画面的部分不读取触觉尽量保护原本的视觉动态负责生成机器人动作的部分仍然可以使用触觉因为它确实需要知道有没有滑、有没有卡、接触方向发生了什么变化。换句话说触觉可以告诉手该怎么改但没必要让它重新解释整个世界。▲图4 | 这张图对应第三个问题模型里的谁真正需要看到触觉左侧模型仍然联合预测未来视频、未来触觉和动作但右侧的 TAAM 并没有让所有 token 无限制互相访问。Video Query 被阻止读取 Tactile Key而 Action Query 仍然可以在接触变化时利用触觉信息。背后的逻辑是局部接触信号确实应该影响“手接下来怎么动”却未必需要改写整个视觉世界的预测。这里体现的不是更彻底的多模态融合而是一种更克制的信息路由。在最新版实验里这种视觉路径隔离让模型的视觉轨迹更接近原始 RGB-only 模型完整方法则把 ManiFeel 上的平均成功率从 15.6% 提高到 32.7%并在五类真实机器人任务上取得 49.2% 的成功率。这里比具体数字更值得注意的是设计思想的变化。在很多通用多模态模型里让所有 token 充分交流通常被视为一种能力。到了机器人控制里这件事却不再那么理所当然。因为信息越多不一定意味着每个模块都应该知道得越多。而当研究者开始主动限制“谁能看见触觉”之后下一个问题自然就出现了即使动作模块需要触觉触觉就一定应该拥有和视觉相同的决策权吗06 最后一个问题触觉究竟应该有多大的话语权这是最近另一类思路更进一步的地方它们开始把触觉从“动作生成的一部分”改成“动作执行的调节器”。ViTaR 是这里一个很有代表性的例子。它直接冻结原本的 VLA。视觉、语言和机器人状态继续照常生成一个基础动作触觉不去推翻这个动作也不重新规划整个轨迹而只负责判断当前这个动作在眼下的接触状态里要不要小幅修一下比如 VLA 说“继续往下压”。触觉可以回答“方向大体没错但现在太用力了少一点。”或者“再往左挪一点。”▲图5 | 这张图对应第四个问题触觉究竟应该拥有多大的决策权左侧被冻结的 VLA 仍然根据语言、RGB 和机器人状态生成 Reference Action触觉特征与一组有限的 Residual Options 随后进入 Effect-Guided Modeling判断哪一种微调更适合当前接触状态再由 Residual Action Modulation 选择并缩放这次修正。换句话说触觉不再重新决定“机器人要做什么”而是负责判断“原来的动作还要不要往左一点、轻一点、稳一点”。它从共同决策者变成了执行阶段的调节器。这样一来触觉的身份又发生了一次变化。它不再是和视觉平起平坐的“决策者”更像一个执行阶段的监督员。高层方向没问题就别乱改只有接触状态明显不对时再有限度地介入。在七类接触任务上这类方法的平均成功率达到 61.3%相比冻结的基础 VLA 高出 30.6 个百分点并且在真实机器人实验中也保持了明显优势。这类方法当然有自己的边界。如果基础 VLA 连高层动作方向都搞错了小幅 residual correction 不可能把一个完全错误的决策救回来。但也正因为如此它把一个很重要的问题说得更清楚了一个模态重不重要不看它有没有同等的决策权而看它能不能在关键环节补上别人补不了的信息。07 从“多模态融合”到“感知分工”走到这里前面看起来分散的几种方法其实已经可以放回到同一条逻辑线上了。简单总结一下它们分别在回答“触觉进入机器人基础模型之后”的四个问题第一个问题是什么时候听。不是从任务开始到结束一直听而可能只在接触真正发生以后触觉才开始有价值。第二个问题是以什么形式进来。如果一种模态在预训练中几乎不存在那么直接新增 token 未必是唯一办法。先把它转成模型熟悉的表示有时反而更容易利用原本的预训练能力。第三个问题是谁应该听。动作控制需要局部接触信息并不代表负责全局视觉预测和语义理解的所有模块都需要共享这份信息。第四个问题则是听到什么程度。触觉可以参与完整决策也可以只做局部修正。它是否应该拥有和视觉一样的“话语权”本身就是一个需要设计的问题。▲图6 | 这张总览图把全文讨论的“角色变化”压缩在了一起。A 展示了更直接的做法把触觉编码后一起送进 VLAB 则保留冻结的视觉语言动作模型只让触觉参与后续的 Residual Action 修正。右侧 C 展示了不同接触密集型任务D 则给出这种受限纠偏思路在仿真和真实机器人上的整体结果。它想表达的并不是“触觉应该更弱”而是触觉越重要越需要被放到真正擅长的位置不去抢视觉和语言的全局决策工作而是在接触发生后对执行进行更精确的物理校正。把这四件事放在一起一个更大的变化就浮了出来机器人多模态学习正在从“把更多信息放进同一个模型”转向“给不同信息安排不同的角色”。这和过去常见的“多模态融合”直觉其实不太一样。我们很容易把多模态理解成一个加法题视觉 语言 触觉 力觉 声音但信息越来越多机器人自然越来越聪明吗真实的物理系统可能更像一个分工问题。视觉和语言拥有海量预训练数据适合处理目标、语义和全局空间关系触觉的数据少得多却离真实物理交互最近。它最擅长的也许不是告诉机器人“这是什么”而是在真正接触之后告诉它刚才那一下到底对不对。所以多模态机器人未必应该追求完全对称。08 那么为什么给机器人加上触觉反而可能更差当下的触觉赛道充斥着大量伪创新。很多团队看似完成了视触融合的技术迭代配齐了传感器、做完了数据集、打通了模型输入却始终跳不出“加触觉就降级”的怪圈。本质上都是在做没有用的工程堆砌毕竟上面催进度下面要交付。但这样会搞坏这个行业的名声。因为这并不是「触觉没用」导致的结果。恰恰相反机器人越走向精细操作越离不开触觉。真正的问题是“触觉有用”和“触觉 token 越多越好”从来不是一回事。今天的大多数 VLA都生长在一个视觉和语言占绝对主导的预训练世界里。而触觉是局部的、稀疏的、传感器高度异构的还经常要求远高于大模型推理频率的实时响应。如果只是把它当成“第三种输入”塞进去模型不仅要在很少的数据里重新学一套表示还可能让这套新表示反过来干扰原本已经训练好的能力。所以触觉进入 VLA 之后真正困难的问题已经不再只是“怎么融合”。而是更细也更像机器人本身的问题什么时候应该听手指手指应该怎么说谁来听以及当眼睛和手指意见不同时到底谁说了算这些问题现在都还没有标准答案。现有研究覆盖的任务仍然有限不同工作使用的 GelSight、Xense、力传感器等硬件也很难直接比较。和视觉相比触觉数据的规模依然小得多。如果未来真的出现足够大、足够多样的触觉预训练数据今天这种“新模态会干扰预训练能力”的问题也可能再次被改写。和还在躬身入局的朋友聊聊行业历史上每一次硬件 软件交叉的新兴技术浪潮都经历过同款质疑。泡沫不是赛道的原罪分不清 “技术瓶颈” 和 “商业骗局”才是最大的陷阱。2011 到 2013 年整个光伏行业被定性为产能过剩、全靠补贴。当时骂它的话比今天骂具身智能的难听得多。后来一堆公司倒了但工艺留下来了。今天中国光伏在全球是什么地位不用多说。不是所有新兴方向都能熬过质疑。2021 年火爆的元宇宙便是一例宏大预言铺天盖地却缺少刚性需求与落地闭环热潮转瞬消散。说英雄谁是英雄还得由结果评说。现在做研究的人怎么办站在质疑外面跟着骂站在叙事里面帮着吹。这两个位置都不产出真东西。判断标准很简单假设三年后你这个问题被彻底证伪了积累的下来东西还剩什么对近三年触觉研究变化感兴趣的读者朋友可以阅读这篇文章《“foundation model” 热潮终于轮到触觉了》Ref1. AT-VLA: Adaptive Tactile Injection for Enhanced Feedback Reaction in Vision-Language-Action Models, CVPR 20262. TAP-VLA: Tactile Annotation Prompting for Vision Language Action Models3. Tactile-WAM: Touch-Aware World Action Model with Tactile Asymmetric Attention4. ViTaR: Visuo-Tactile Residual Adaptation for Foundation VLA Manipulation5. ForceVLA: Enhancing VLA Models with a Force-aware MoE for Contact-rich Manipulation, NeurIPS 2025.6. Tactile-VLA: Unlocking Vision-Language-Action Models Physical Knowledge for Tactile Generalization7. VLA-Touch: Enhancing Vision-Language-Action Models with Dual-Level Tactile Feedback, IEEE RA-L, 2025.