ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

2020年GPT - 3震动NLP界,如今具身智能ICL崛起,可可矩阵创业押注!

2020年GPT - 3震动NLP界,如今具身智能ICL崛起,可可矩阵创业押注! 2020年GPT - 3震动NLP界如今具身智能领域ICL崛起可可矩阵创业押注2020年GPT - 3凭借“看几个示例就会新任务”的能力震动了NLP界。六年后的今天同样的故事正在具身智能领域上演主角就是In - Context LearningICL。8月中旬Skild AI发布机器人基础模型S1。只需给机器人看一遍任务演示视频它就能在不微调、不做额外post - training的情况下尝试完成此前未训练过的新任务。任务时长可达10分钟包含几十个操作步骤。Skild对比了在训练数据见过的任务和未见过的任务上ICL视频Prompt和传统的语言Prompt VLA的效果。测试结果显示当训练数据只有1000小时时语言Prompt效果更好随着数据规模增加ICL开始反超。对于未见任务加入视频context后模型表现相比只用语言指令提升约7倍。S1发布的一周之前Generalist AI发布GEN - 1.5同样将One - Shot Learning作为核心能力。机器人只需看一个示范就能在数秒内学习新任务无需梯度更新或微调还支持人类示范到机器人执行、组合泛化和Sim - to - Real迁移。这两项进展都在尝试让机器人学会利用更长的多模态Context。ICL这条路径已在LLM领域得到验证并成为至关重要的一环。2020年OpenAI在GPT - 3的论文Language Models are Few‑Shot Learners中提出ICL将其定义为一种能力不给模型做任何参数更新没有微调、反向传播训练仅在输入prompt中提供若干任务示例demonstrations/examples模型在单次前向推理过程中就能识别并执行该新任务。过去三年上下文从4K扩展到1M使模型能一口气处理一整本书、一个代码库背后的主要引擎就是ICL。与LLM不同具身模型面对的是视觉观测、语言指令与动作序列交织的复合上下文且真实任务是非马尔可夫的——“接下来做什么”取决于“几分钟前做过什么”。简单来说具身模型面对的上下文是每秒几十帧视觉观测外加本体状态与动作序列信息量高出几个数量级。直到今年7月16日才有李飞飞、Jim Fan、Yuke Zhu等合著的机器人长上下文策略模型与训练方案RoboTTT第一次系统地把“上下文scaling”这条路线搬到机器人视觉运动策略上。8月Generalist和Skild发布成果。虽然两家公司仅以成果发布形式展示模型效果技术细节未完整公开但在具身领域关于ICL的讨论度随即骤升。这条路能否在具身领域真正跑通取决于一系列远未解决的技术问题。我们也因此产生了更具体的好奇如果具身智能真的要沿着Long Context和ICL继续发展机器人究竟要怎样理解如此复杂的上下文示范、语言、历史动作甚至人的纠正又该怎样进入模型于是我们找到了可可矩阵COCO Matrix一家致力于把In - Context Learning做成具身智能底层范式的国内创业公司。该公司成立于2026年4月。创始人兼CEO高宇翔表示今年1月深入讨论创业相关事宜时他和co - founder就一致认为是时候着手押注ICL了。高宇翔今年30岁西安交大少年班出身约翰斯·霍普金斯大学JHU博士辍学在读期间做人机交互研究。他说GPT - 3展现出上下文学习能力时还在JHU读博的他就开始琢磨这种“不给参数更新、只看示例就会新任务”的能力能否应用到机器人身上。此后五年他辍学、回国创业、加入工业界、再次创业。这期间高宇翔在傅利叶带队打通了全尺寸人形机器人从遥操作、数据采集到模型部署的完整链路并在2025年5至8月用一百多万成本在全尺寸双足人形上训练出具备一定泛化能力的世界模型。今年4月可可矩阵正式成立开始将当年在学校里接触的问题转化为创业方向。与Generalist、Skild不同可可矩阵的思路是把后训练的ICL前置到预训练阶段。围绕具身ICL的技术进展、落地难题与行业争议等我与高宇翔在上海进行了一场深度对谈以下是对话实录在不影响本意的前提下略有删改。为什么具身智能需要换一条Scaling路线量子位过去很长一段时间具身智能都沿着大模型的路线Scale数据。大家为何相信堆更多数据就能提升机器人能力高宇翔最初整个行业心态比较乐观。早期像ACT、Diffusion Policy这些方案跑通后基本解决了behavior cloning、模仿学习的很多核心问题。当时大家自然地延续大语言模型的成功逻辑认为只要持续扩充数据积累到一定阈值模型就能涌现出通用能力最终实现全方位的任务适配。在当时的行业环境里这个思路没问题所以整个行业都全力规模化扩充数据。量子位后来问题出在哪里高宇翔针对单一任务现在采集两百条左右的数据就能把任务拟合得很好一个新任务从演示到模型适配大概十八个小时就能完成。但继续增加数据后模型并未出现大家期待的通用泛化能力。同时具身数据本身也很难Scale。遥操作数据质量不统一物品和场景多样性有限单纯依靠这类数据很难提供足够丰富的感知覆盖。量子位除了这个还有哪些问题高宇翔早期很多VLA沿用了LLM、VLM的预训练体系但面向物理世界时原有视觉表征很难同时覆盖机器人需要的不同层级信息因此不少方案需要不断拼接不同的视觉模块。这套路线在很多场景下依然有效但过去一年多大家逐渐发现继续沿着原有VLA范式叠数据、叠模块后续能力提升会越来越困难。具身智能Scaling路线的新尝试量子位如果数据覆盖走不通行业现在开始Scale什么高宇翔能明显感觉到大家开始关注机器人的学习能力和适应能力。过去更关注模型在训练阶段见过多少数据、学会多少任务。现在大家开始思考机器人到了一个全新的环境和任务中能否利用当前的Context快速学习。今年已经出现了一些明显的信号。像RoboTTT这类工作在尝试解决更长历史信息的编码、压缩和利用让机器人能够持续参考更长时间的视觉和动作Context。Generalist AI、Skild AI最近展示的One - Shot能力更进一步。给机器人看一次任务示范它就可以基于这段Context快速适配新任务无需为每个任务重新做完整的微调或训练。所以现在具身智能的Scaling维度正在扩展。除了继续Scale模型、数据和任务覆盖之外机器人在部署之后能否继续学习能否从示范、历史经验和交互过程中快速获得新能力也开始成为一个新的Scaling方向。LLM验证过的Scaling逻辑怎么到了具身领域这么难量子位同样是ICL具身领域的难度似乎比语言模型领域高很多复杂在哪里高宇翔机器人面对的是物理世界其输入和任务结构比纯语言复杂得多。这种复杂性主要集中在两大维度一是模型本身的输入输出与技术架构问题二是数据体系的先天短板问题。可进一步拆成三个核心技术难点。首先是视觉理解机器人在不同任务、不同动作阶段需要的信息层级不同。它既要理解“这是什么”这样的高层语义也要获得位置、深度、轮廓等和动作直接相关的精细空间信息。这也是早期很多VLA需要同时拼接DINO、CLIP这类不同视觉模型的原因。单一视觉编码器很难完整覆盖机器人需要的信息。第二是多模态语言对机器人来说远远不够。视觉可能承担大部分信息但触觉、听觉、本体感知同样会影响动作。问题在于这些模态的数据量差异非常大目前视觉和语言还能依靠海量数据做预训练对齐触觉、声音和本体状态的数据规模远远没有达到这个程度。第三个问题就是Long Context和Memory机器人执行的是连续任务它需要知道之前发生过什么还要判断过去哪些信息和现在有关。这个过程涉及历史信息的压缩、筛选、提取和长期保留。实际上这些支撑机器人长时记忆的基础技术也就是最近半年左右才开始出现比较明显的进展。从固定窗口到流式记忆量子位上个月底Skild - AI的S1模型支持最长10分钟级别的长任务示范。对比Generalist GEN - 1.5的one - shot ICL示范视频仅3 - 12秒放在30s窗口内完成现学现用。虽然Skild给出的是示范demo但这个时长还是很惊人。高宇翔不能单纯看时长更重要的是信息密度。如果一段10分钟的视频里都是重复动作没有新的任务信息那它对模型来说并不是高质量Context。我们现在测试效果比较好的是人类第一视角或者第三视角的一整段完整任务演示。人做一遍新任务机器人看完后在当前场景里按照这个任务再完成一次这种One - Shot Adaptation的信息密度就很高因为里面包含了完整的新任务逻辑、动作和场景信息。相反如果10分钟只是很多重复动作或者是几个简单小任务拼起来它的学习价值反而有限。量子位所以Long Context的重点不是把固定窗口从一分钟硬拉到十分钟高宇翔对。真实机器人任务里很多有效Context可能只有两三分钟。单纯让机器人每次都重新看完整的十分钟历史没有太大必要。更重要的是新的Context不断进入后模型能够持续筛选和压缩历史信息。有些最后保留下来的有效信息可能来自十分钟前也可能来自一小时前。我们理解的Long Context更接近一种流式机制。最终希望做到机器人可以持续工作、持续利用过去经验而不会因为固定Context Window耗尽一到下午就把早上学到的东西全部忘掉。量子位但模型本身的显存和Context容量毕竟有限这种长期Memory具体怎么解决高宇翔目前主要从两个方向着手这些方案还在内部测试。一个是先提升模型自己的理解能力。模型如果真的理解当前任务就会更清楚历史里哪些信息重要、哪些信息可以丢掉。所以Memory并不只是压缩问题也和模型理解能力有关。另一个是对长时序产生的大量KV Cache做压缩既要保证实时性也要控制显存消耗。这方面大语言模型和视频生成已经有不少可以借鉴的技术路线比如Linear Attention、Sparse Attention还有基于Routing的关键信息筛选。我觉得Long Context最后解决的不是“能塞进去多少东西”而是在有限的模型容量下能否一直保留和调用真正有用的历史经验。目前ICL还缺什么样的数据量子位既然ICL能降低对海量数据的依赖为什么数据仍然是一个问题高宇翔ICL降低的主要是对“海量任务全覆盖数据”的依赖但基础数据的数量和多样性依然很重要。在UMI这类本体中心数据逐渐普及之前行业很难获得以机器人自身动作、本体视角为核心的高质量数据。随着这类数据越来越多模型才开始具备比较扎实的基础操作能力。ICL并不意味着不再需要数据。它更像是让机器人不必为每一个新任务都重新采集大量专项数据但前提是模型已经建立起足够好的基础能力。量子位那现在最缺的是哪一类数据高宇翔现在比较明显的缺口是人机教学、实时纠偏和协同作业这类数据。如果希望机器人能够接受人的实时指导做错之后被及时纠正甚至和人一起完成任务模型就需要见过大量类似的交互过程。但目前行业对这类数据还没有形成成熟的定义和采集体系。比如人类手把手教机器人时哪些信息需要记录纠错发生在哪个时间点人的动作、语言和机器人的反馈应该怎么对齐这些都还缺少统一标准。所以我们后续也会重点去定义这类人机教学交互数据包括应该采什么、怎么采以及怎么把它用于ICL训练。“强理解轻生成”量子位可可矩阵现在在ICL这一块整体进展如何高宇翔整体进度比我原本预期快一些。量子位你原本的预计是高宇翔一开始我们判断光是把模型的理解能力这一块打磨出来可能就需要两三个月。但核心团队到齐之后不到一个月我们已经拿到了足以验证技术方案可行性的核心证据。现在这部分技术路线基本已经跑通下一阶段主要是在Scale数据继续扩量、精炼数据把模型能力往上推。我们现在最核心的判断是“机器人后面的动作生成能不能做好很大程度取决于前面到底有没有把物理世界理解清楚”。量子位在“理解”这一块你们做了什么不同的尝试可以具体说说吗高宇翔我们现在做的是一套“条件表征”也可以理解成条件隐空间。传统视觉表征通常是一帧图像对应一个固定Embedding。无论机器人现在想做什么看到这张图后提取出来的信息基本是固定的。但机器人执行任务并非如此。同一张画面在不同任务、不同动作阶段里需要的信息完全不同。比如抓一个杯子刚开始我更关心它是不是杯子这是语义信息真正伸手抓的时候我更关心它的位置、深度、轮廓和空间关系。所以我们认为一个适合机器人的视觉表征不应该只由“我看到了什么”决定还应该由“我现在想做什么”共同决定。我们的模型会根据任务条件和动作意图动态提取不同层级的信息。现在这套统一模型已经在八、九类视觉任务上做了验证包括深度、分割、人体姿态等。部分任务的能力已经能够接近上一代专门为单任务训练的模型后面主要继续通过数据把它往当前SOTA推。量子位是什么让你们认定“理解做好以后动作生成反而可以变轻”高宇翔因为现在很多机器人模型的问题是前面的表征里混进了太多和动作无关的信息。比如桌面到底是木纹还是大理石这对我要不要抓这个杯子基本没有帮助但传统视觉Embedding里这些纹理、材质信息都会一起被编码进去。那后面的Action Head就得非常大自己从一堆混合信息里把真正和动作有关的东西筛出来。我们的思路是在前面的条件表征阶段就尽量把动作相关信息提炼出来。我们做过一个比较极端的实验。在同样的训练设置和算力下把动作头压到大约60M参数效果依然可以超过一个动作头达到1.1B左右的对照方案。所以现在更相信“强理解、轻生成”这个方向。如果前面的视觉理解足够准确后面的动作解码其实没有必要设计得特别重。量子位什么叫“动作相关信息”行业里对这有统一定义吗高宇翔目前还没有特别统一、让我觉得足够完善的定义。现在行业里比较常见的一条路线是Latent Action Model。很多人类视频、生成视频本身没有机器人动作标注所以大家会训练一个隐变量去表示帧与帧之间发生了什么变化把它当成一种“替代动作”。常见做法有两类。一种是只要从第一帧能够推到第二帧就认为中间的变化包含动作信息另一种是通过光流把像素在空间里的变化作为动作表征。但这些方案都有问题。比如光流很稠密但很难区分到底是相机在动还是机器人、人物本身在动。人体关键点相对更稳定不太受相机运动影响但它的信息又比较稀疏。所以我们没有先人为规定一个非常严格的“动作表示”应该是什么。现在会把人类手部关键点、全身关键点、光流等多种和动作相关的预测任务放进同一个条件表征模型里训练让不同信息彼此补充。后面如果发现新的预测任务能够帮助动作生成也可以继续加入训练。我们更希望模型能力的提升来自数据和训练任务本身而不是不断在结构上做复杂修改。成功率之外怎么衡量机器人的学习能力量子位现在可可基础模型的One - Shot能力大概达到什么水平高宇翔目前比较明确的是简单任务。比如常规抓取类任务在临时改变目标、做One - Shot Adaptation之后完成率可以稳定在80%以上。我们现在不仅仅是单独看One - Shot成功率还要看它和专项Post - training后的能力差距有多大。理想状态下机器人只看一次示范、在Context里完成快速适配之后效果应该尽可能接近针对这个任务专门训练出来的模型。复杂任务目前还没有完整评测因为对应模型还在继续训练。量子位主攻One - Shot的同时为什么还去做Self - Correction高宇翔因为人类学习新任务也不是看一遍之后每次都能第一次成功。但失败以后你会知道哪里出了问题下次会针对性调整。我们希望机器人也有这种能力。第一次执行失败之后模型会重新利用这段失败轨迹判断哪里需要修正再进行下一次尝试。所以Self - Correction其实也是In - Context Learning的一种形态。Context不只来自别人给出的示范也可以来自机器人自己刚刚经历过的失败。我们的目标是即使第一次没有完成任务机器人也能通过后续几次自主尝试和纠正最终完成任务。量子位假如机器人可以不断试错那以后“成功率”是不是不够用了高宇翔对所以我们之后可能会更关注另外一个指标——第一次成功平均耗时。如果机器人能够持续尝试、持续Self - Correction那么单纯问“一次任务成功率是多少”意义会越来越有限。更有价值的问题是它看完一次示范之后要花多久才能第一次把这个任务学会。这个时间其实对应的就是机器人的教学成本和学习效率。对于抓取这种简单任务我们希望它看一次就能第一次成功。但像叠衣服甚至把衣服叠成大象、天鹅这种人类自己可能也需要几个小时学习。那我们希望机器人的学习周期至少可以逐渐接近正常人的培训周期。如果这套能力成立一个地方、一台机器人学会的新技能后面也可以被其他机器人继续复用。所以以后衡量机器人智能可能不只是看它已经会多少任务还要看它学会一个新任务到底需要多久。为什么要自己创业量子位你本科就从自驾转向了机器人大概是十年前。高宇翔对我本科在西安交大少年班最开始做自动驾驶大概2016年前后开始转向机器人。那个时候我就觉得机器人这个问题比自动驾驶更复杂它同时涉及硬件、算法和数据而且要解决的场景更多样。后来从JHU博士生辍学我来到工业界尤其是人形机器人、数据和模型落地这一侧。量子位我看你是从机器人公司傅利叶出来创业的。高宇翔对。我2024年加入了傅利叶。这几年我较早参与打通了全尺寸人形机器人的遥操作、数据采集到模型部署这一整套流程也参与了一些大规模VLA训练。那段经历让我第一次比较直观地看到VLA数据Scaling的边界。后来我们又在内部做了基于世界模型的全尺寸人形机器人Policy也验证了世界模型确实可以驱动全尺寸人形机器人并且在一些特性上表现出和传统VLA不同的优势。这几个判断叠在一起后我开始觉得可能到了需要重新考虑模型范式的时候。我的目标是让ICL远不止于一个“feature”。我们要真正颠覆模型训练范式。量子位既然已经在傅利叶内部验证过一些方向为什么还是决定出来创业高宇翔因为这个方向本质上是一个范式创新的问题。如果继续在原来的组织里做我很难拿到足够集中的资源也很难围绕这个方向重新搭一支足够强的模型团队。还有一个现实原因就是我的联创不可能直接加入原来的团队。但我们真正确定要做这个方向之后我觉得最合适的合作对象只有她。她长期在学术侧研究机器人泛化、学习能力和ICL我这边刚好有比较完整的工业界经验包括本体、数据、模型训练、场景和上下游资源。两边的能力正好互补所以最后就决定一起出来做。量子位你们现在怎么分工高宇翔联创主要负责整体技术路线和核心研发方向我会更多负责上下游硬件、场景、数据、算力这些问题。这也是我过去两年在人形机器人行业里积累比较多的部分。我踩过很多数据Scale、遥操作数据、第一视角数据、模型部署相关的坑所以现在更清楚什么样的数据适合什么样的模型也知道不同数据来源分别应该在训练里发挥什么作用。我们不会把团队做得特别大。模型研发真正核心的团队本身就不需要很多人。我们更看重团队的智力密度。量子位最后聊一下公司名字吧你们的名字和市面上大多数具身公司的名字风格不太一样。高宇翔COEXIST、COWORK、COLLABORATE、COEVOLVE这就是我们公司名字的由来。
返回列表