ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

让AI看视频时不再健忘:LatentStream如何把记忆真正“内化“进大脑

让AI看视频时不再健忘:LatentStream如何把记忆真正“内化“进大脑 你有没有遇到过这种情况跟一个人聊了很久的事情对方却记不住上下文你每次提问都要重新把背景交代一遍。这种感觉挺累的对吧现在的AI在看视频时也在经历类似的困境。想象一台监控摄像头接了一个AI模型让它实时理解画面里发生的事情。视频一直在播画面一帧接一帧涌进来AI不可能把每一帧都完整存下来内存会爆掉。所以现有的做法是把看过的画面压缩存进一个记忆仓库等用户提问了再从仓库里翻出相关的几张画面重新塞给AI去理解。这套思路听起来挺合理问题出在哪呢**这个仓库里存的东西,始终是外部的、临时的视觉材料,AI每次回答问题都要重新翻找、重新读取,它从来没有真正把这些历史信息记在脑子里过。**这就好比你每次要用一个知识点都得翻书查阅而不是把它真正理解并记在脑子里。翻书当然能用但如果不把知识内化成自己的理解你永远无法把新旧信息串联起来做深层推理只能停留在查到什么就说什么的层面。如果AI一直靠查资料而不是记脑子里它就永远无法形成连贯、逐步深化的理解每次提问都是从零开始检索,信息用完就扔,下一轮又要重新翻。这就是南京理工大学、蚂蚁集团、新加坡国立大学等机构联合提出的LatentStream要解决的核心矛盾。他们给这套系统起了个很直白的名字从存储再检索转变为检索并内化。视频记忆的三层仓库不是所有历史都值得同等对待先说说AI怎么管理这些不断涌入的视频画面。*流式视频理解*指AI模型需要连续处理正在播放的视频画面并能随时回答用户提出的问题而不是等视频播完再统一分析。LatentStream的第一步叫做*查询无关的分层流式记忆*在用户提问之前系统就已经按时间远近把视频画面分成短期、中期、长期三层记忆库进行组织和压缩。这个设计的道理其实很朴素。刚发生的事情细节要保留得清楚一点因为大概率会被问到发生得越久远信息就该越粗略因为大部分细节已经不重要了。这跟人脑记忆的规律几乎一模一样你能清楚记得十分钟前吃了什么但一个月前某天下午三点发生的事除非特别重要早就模糊成一个大概印象了。问题是多久算旧这个界限该怎么划如果用一个固定的时间阈值比如超过30秒就归为中期记忆那在信息变化剧烈的片段比如一场激烈的球赛和信息平缓的片段比如一个人静坐看书里这个阈值的效果完全不一样。LatentStream用了一个叫*Jenks自然断点法*的统计工具来解决这个问题这是一种能根据数据本身的分布特征自动找出分组断点的统计方法而不是人为设定一个固定的阈值。具体来说系统会给每个视觉片段计算一个时间重要性分数衡量这段画面和相邻画面比起来有多大变化。变化大说明有新事件发生值得保留细节变化小说明画面基本没变可以压缩甚至丢弃。Jenks方法会根据这些分数本身的分布自动找出两个断点把画面分成丢弃、压缩、完整保留三类。到了中期记忆过渡到长期记忆时系统又用类似的方法把空间上相似的画面块合并起来进一步压缩体积。这套机制的好处在哪如果不这样做用固定规则去裁剪历史遇到运动激烈的视频段就会把有用信息切掉太多遇到平静的视频段又会存下大量冗余。实验数据显示仅这一步分层记忆管理就能把OVO-Bench基准的得分从54.0%拉到58.1%VideoMME从63.3%拉到65.1%。这只是第一步效果已经相当可观了。让记忆令牌自己去翻历史越翻越准有了分层的历史仓库接下来的问题是用户提问之后怎么把相关的历史信息真正吸收进AI的思考过程里而不是简单地当作参考资料贴在旁边这里LatentStream引入了一个核心概念叫*潜在记忆令牌*Latent Memory Tokens简称LMT这是一组可以被优化、能主动去检索历史信息、并不断更新自己内容的特殊向量它们存在于模型的内部表示空间也就是潜在空间里而不是普通的文字或图像。这组令牌被分成三组分别对应短期、中期、长期三层记忆每一组能看到的历史范围逐渐扩大。短期组只能看最近的记忆中期组能看短期加中期长期组能看到全部三层。这个设计巧妙之处在于它模拟了人回忆事情时的自然过程。你回想一件事的时候往往不是一次性把所有相关记忆都调出来而是先想起最近发生的线索再顺着这个线索往前追溯范围越扩大想起的细节也越多。就好比警察破案先看监控里最近的画面找线索发现线索后再去查更早的录像一步步扩大排查范围,而不是一开始就把过去一整年的录像全倒出来看,那样反而会被无关信息淹没,找不到重点。这三组令牌不是一次性检索完就结束的而是要经过多轮检索—更新的循环。每一轮每组令牌都会从自己对应的记忆范围里挑出和自己最相关的几段历史证据用余弦相似度衡量把这些证据注入进来跟令牌本身一起参与到模型的一次前向计算里然后再根据结果决定这次检索的证据要不要保留下来继续用于下一轮。这里有一个细节值得单独说一下新检索到的证据不是无条件被接受的只有当它能让整体的信心指标下一节会讲真正提升时才会被并入长期保留的证据池否则就被丢弃。这个择优保留的机制其实很关键。如果不设这个门槛检索到的证据不管好坏全部塞进去模型很容易被无关信息带偏就像开会时如果谁的发言都要记进会议纪要纪要最后会变得又长又乱真正重要的决定反而被淹没。设置门槛之后只有真正有价值的信息才会留下来记忆内容始终保持精炼。用AI自己的信心当老师不需要标注答案前面说的检索和更新循环靠什么信号来判断这一轮做得好不好这是LatentStream最有意思的部分。答案是不需要人工标注正确答案而是让模型自己的预测置信度当反馈信号。*预测熵*衡量模型对下一步输出结果的不确定程度熵越低说明模型对答案越有把握熵越高说明模型犹豫不决好几个答案的概率都差不多。具体做法是对短期、中期、长期这三组令牌分别计算它们在当前状态下的预测熵。因为三组令牌看到的历史范围是逐层扩大的直觉上看到的历史信息越全面模型应该越有把握做出判断也就是熵应该逐层降低短期组的熵最高长期组的熵最低。这就构成了一个叫*层级递进奖励*的优化目标它由两部分组成一部分是绝对信心鼓励每一组令牌本身的熵都尽量低另一部分是层级递进专门奖励熵值确实按短期到长期的顺序递减的情况如果某一组的熵反而比该更自信的那一组还高就会被扣分。这套机制解决了什么问题光靠绝对信心这一项是不够的因为它只会让每一组独立地朝着自信的方向走却没有约束这几组之间该有的逻辑关系检索到更多历史信息、看到更全面的证据理应带来更强的把握如果这个递进关系没被鼓励模型很可能出现看得越多反而越糊涂的反常状态这在实验里也确实被验证了只用绝对信心优化OVO-Bench是62.5%VideoMME是65.5%加上层级递进的约束之后分别提升到64.2%和66.6%。这就好比考试复习如果一个学生只追求每一科都要自信他可能会在简单题上刷高信心难题上随便应付。真正好的学习状态应该是随着复习资料看得越多、理解越深对整道题的把握应该越强而不是复习了半天反而更糊涂。层级递进奖励做的正是这件事它逼着模型的信心随着信息量的增加而真正增长而不只是虚假地在每个孤立环节里显得自信。有了这个奖励信号系统用一种叫*REINFORCE的策略梯度方法*来更新令牌和检索到的证据表示这是一种通过对参数加入随机扰动、观察扰动前后奖励的变化、再据此调整参数方向的优化技术整个过程不需要修改AI模型本身的任何参数只优化这些额外插入的记忆令牌。优化完成之后检索用的临时证据会被移除最终回答只依据压缩后的分层记忆、用户提问、以及这些已经吸收了历史信息的记忆令牌来生成。历史信息不再是外挂的参考资料,而是被真正消化进了模型思考的内部状态里。数字说话省内存、还更准这套设计到底效果如何论文在多个基准上做了详尽验证。在流式视频理解的OVO-Bench上基于Qwen2.5-VL-7B模型LatentStream把整体得分从基线的54.0%提升到64.2%涨了10.2个百分点。细拆开看实时视觉感知这一项从63.3%涨到68.5%而回溯追踪需要回忆更早发生的事件这一项涨幅特别惊人从44.7%直接跳到60.0%涨了超过15个百分点。这恰恰印证了前面说的逻辑越需要调用长期历史记忆的任务这套检索并内化的机制带来的提升就越明显。在StreamingBench上LatentStream拿到76.9%超过了所有对比过的免训练方法。而在三个离线长视频理解基准VideoMME、MLVU、LongVideoBench上尽管这套系统本来是给流式场景设计的也依然拿下了66.6%、74.0%、62.1%的成绩比基线分别提升3.3、6.1、1.4个百分点说明这套记忆内化机制的价值不局限于实时这一个场景。效率方面也有意外的收获。原本你可能会担心加了这么多轮检索和优化计算成本肯定飙升。但实测下来LatentStream把峰值显存从30.80GB降到21.97GB每个输出token的解码时间从6.45毫秒降到3.16毫秒速度提升了一半以上。原因在于压缩后的分层记忆大幅减少了需要在生成阶段反复处理的视觉上下文长度。当然代价是首字延迟从7.63秒增加到8.41秒因为多轮记忆演化本身需要额外的推理时间这是一个合理的权衡多花不到一秒钟去想清楚换来后续每一步回答都更快、更省资源。论文里还做了一组对比实验很能说明问题。如果只是简单地把检索到的视觉证据拼接进上下文不经过令牌内化这一步OVO-Bench只能到59.7%如果只加入未经优化的初始记忆令牌反而降到56.5%比基线还差只有经过完整演化优化的记忆令牌才能达到64.2%。这说明性能提升不是因为多塞了点信息这么简单而是那个内化并演化的过程本身在起作用。写在后面读完这篇论文最触动我的一点是它其实在质疑一个我们过去几年都默认合理的假设给AI装个检索模块让它按需去查资料这就够了。但检索这件事本质上是外部知识库按需调用的模式跟人真正学会一个东西是不一样的。你能查到一个知识点和你把这个知识点内化成自己的理解、能在后续推理里灵活调用它是两种完全不同的认知状态。LatentStream把这个区分第一次明确地做进了流式视频理解这个具体任务里而且拿出了具体的数字来证明这个区分是有意义的比如那15个百分点的回溯追踪能力提升。还有一点让我意外这套系统完全没有修改底层大模型的任何参数靠的全是在推理阶段对几个额外插入的记忆令牌做优化。这意味着同样的思路理论上可以套用到任何现成的视频语言模型上不需要重新训练一遍。这种轻量插件式的改进思路如果推广开来可能会比训一个更大的模型更实用。论文里没细说的一个问题是这套机制在面对更长、更复杂的多轮对话场景不是单次提问而是连续追问时会怎样演化记忆令牌能不能在多轮交互里持续积累而不饱和或遗忘这个问题留给了后续研究。如果AI真的能做到把看过的东西记在心里而不是存在硬盘里再翻,那它离真正理解这个世界,又近了一步吗QAQ1LatentStream是什么ALatentStream是一个面向流式视频理解的框架它把AI处理视频历史信息的方式从存储再检索转变为检索并内化让历史证据被真正吸收进一个紧凑的潜在记忆状态持续指导后续推理而不是简单地作为外部参考资料贴在旁边。Q2LatentStream需要重新训练AI模型吗A不需要。LatentStream在推理阶段工作只优化额外插入的潜在记忆令牌底层视频语言模型的参数完全保持冻结因此可以直接套用在现成的Qwen2.5-VL等模型上。Q3LatentStream相比之前的方法效果提升有多少A在OVO-Bench上整体得分从54.0%提升到64.2%其中依赖长期回忆的回溯追踪任务提升超过15个百分点同时显存占用从30.80GB降到21.97GB解码速度提升超过一半。
返回列表