书链收录网
  • 如何加入
  • 查询是否收录
  • 文章资讯
  • 人气排行榜人气排行榜
  • 点入排行榜点入排行榜
  • 自助发软文
  • 自助广告位
  • 会员登录会员登录
  • LatentStream如何把记忆真正内化进大脑-让AI看视频时不再健忘 (latently)
  • 文章编号:6675 / 分类:互联网资讯 / 发布时间:2026-09-26T11:30:01 / 浏览:次
  • 你有没有遇到过这种情况:跟一个人聊了很久的事情,对方却记不住上下文,你每次提问都要重新把背景交代一遍。这种感觉挺累的,对吧?

    现在的AI在看视频时,也在经历类似的困境。

    想象一台监控摄像头,接了一个AI模型,让它实时理解画面里发生的事情。视频一直在播,画面一帧接一帧涌进来,AI不可能把每一帧都完整存下来,内存会爆掉。所以现有的做法是:把看过的画面压缩存进一个"记忆仓库",等用户提问了,再从仓库里翻出相关的几张画面,重新塞给AI去理解。

    这套思路听起来挺合理,问题出在哪呢?

    **这个仓库里存的东西,始终是外部的、临时的视觉材料,AI每次回答问题都要重新翻找、重新读取,它从来没有真正把这些历史信息"记在脑子里"过。**

    这就好比你每次要用一个知识点,都得翻书查阅,而不是把它真正理解并记在脑子里。翻书当然能用,但如果不把知识内化成自己的理解,你永远无法把新旧信息串联起来做深层推理,只能停留在"查到什么就说什么"的层面。如果AI一直靠"查资料"而不是"记脑子里",它就永远无法形成连贯、逐步深化的理解,每次提问都是从零开始检索,信息用完就扔,下一轮又要重新翻。

    这就是南京理工大学、蚂蚁集团、新加坡国立大学等机构联合提出的LatentStream要解决的核心矛盾。他们给这套系统起了个很直白的名字,从"存储再检索"转变为"检索并内化"。

    视频记忆的三层仓库:不是所有历史都值得同等对待

    先说说AI怎么管理这些不断涌入的视频画面。

    *流式视频理解*:指AI模型需要连续处理正在播放的视频画面,并能随时回答用户提出的问题,而不是等视频播完再统一分析。

    LatentStream的第一步,叫做*查询无关的分层流式记忆*:在用户提问之前,系统就已经按时间远近,把视频画面分成短期、中期、长期三层记忆库进行组织和压缩。

    这个设计的道理其实很朴素。刚发生的事情,细节要保留得清楚一点,因为大概率会被问到;发生得越久远,信息就该越粗略,因为大部分细节已经不重要了。这跟人脑记忆的规律几乎一模一样,你能清楚记得十分钟前吃了什么,但一个月前某天下午三点发生的事,除非特别重要,早就模糊成一个大概印象了。

    问题是,"多久算旧"这个界限该怎么划?如果用一个固定的时间阈值,比如"超过30秒就归为中期记忆",那在信息变化剧烈的片段(比如一场激烈的球赛)和信息平缓的片段(比如一个人静坐看书)里,这个阈值的效果完全不一样。

    LatentStream用了一个叫*Jenks自然断点法*的统计工具来解决这个问题:这是一种能根据数据本身的分布特征,自动找出"分组断点"的统计方法,而不是人为设定一个固定的阈值。

    具体来说,系统会给每个视觉片段计算一个"时间重要性分数",衡量这段画面和相邻画面比起来有多大变化。变化大,说明有新事件发生,值得保留细节;变化小,说明画面基本没变,可以压缩甚至丢弃。Jenks方法会根据这些分数本身的分布,自动找出两个断点,把画面分成"丢弃、压缩、完整保留"三类。到了中期记忆过渡到长期记忆时,系统又用类似的方法,把空间上相似的画面块合并起来,进一步压缩体积。

    这套机制的好处在哪?如果不这样做,用固定规则去裁剪历史,遇到运动激烈的视频段就会把有用信息切掉太多,遇到平静的视频段又会存下大量冗余。实验数据显示,仅这一步分层记忆管理,就能把OVO-Bench基准的得分从54.0%拉到58.1%,VideoMME从63.3%拉到65.1%。这只是第一步,效果已经相当可观了。

    让"记忆令牌"自己去翻历史,越翻越准

    有了分层的历史仓库,接下来的问题是:用户提问之后,怎么把相关的历史信息真正"吸收"进AI的思考过程里,而不是简单地当作参考资料贴在旁边?

    LatentStream如何把记忆真正内化进大脑让AI看视

    这里LatentStream引入了一个核心概念,叫*潜在记忆令牌*(Latent Memory Tokens,简称LMT):这是一组可以被优化、能主动去检索历史信息、并不断更新自己内容的特殊向量,它们存在于模型的内部表示空间(也就是"潜在空间")里,而不是普通的文字或图像。

    这组令牌被分成三组,分别对应短期、中期、长期三层记忆,每一组能"看到"的历史范围逐渐扩大。短期组只能看最近的记忆,中期组能看短期加中期,长期组能看到全部三层。

    这个设计巧妙之处在于,它模拟了人回忆事情时的自然过程。你回想一件事的时候,往往不是一次性把所有相关记忆都调出来,而是先想起最近发生的线索,再顺着这个线索往前追溯,范围越扩大,想起的细节也越多。就好比警察破案,先看监控里最近的画面找线索,发现线索后再去查更早的录像,一步步扩大排查范围,而不是一开始就把过去一整年的录像全倒出来看,那样反而会被无关信息淹没,找不到重点。

    这三组令牌不是一次性检索完就结束的,而是要经过多轮"检索—更新"的循环。每一轮,每组令牌都会从自己对应的记忆范围里,挑出和自己最相关的几段历史证据(用余弦相似度衡量),把这些证据"注入"进来,跟令牌本身一起参与到模型的一次前向计算里,然后再根据结果决定这次检索的证据要不要保留下来,继续用于下一轮。

    这里有一个细节值得单独说一下:新检索到的证据不是无条件被接受的,只有当它能让整体的"信心"指标(下一节会讲)真正提升时,才会被并入长期保留的证据池,否则就被丢弃。

    这个"择优保留"的机制其实很关键。如果不设这个门槛,检索到的证据不管好坏全部塞进去,模型很容易被无关信息带偏,就像开会时如果谁的发言都要记进会议纪要,纪要最后会变得又长又乱,真正重要的决定反而被淹没。设置门槛之后,只有真正有价值的信息才会留下来,记忆内容始终保持精炼。

    用"AI自己的信心"当老师,不需要标注答案

    前面说的检索和更新循环,靠什么信号来判断"这一轮做得好不好"?这是LatentStream最有意思的部分。

    答案是:不需要人工标注正确答案,而是让模型自己的预测置信度当反馈信号。

    *预测熵*:衡量模型对下一步输出结果的不确定程度,熵越低,说明模型对答案越有把握;熵越高,说明模型犹豫不决,好几个答案的概率都差不多。

    具体做法是,对短期、中期、长期这三组令牌,分别计算它们在当前状态下的预测熵。因为三组令牌看到的历史范围是逐层扩大的,直觉上,看到的历史信息越全面,模型应该越有把握做出判断,也就是熵应该逐层降低:短期组的熵最高,长期组的熵最低。

    这就构成了一个叫*层级递进奖励*的优化目标,它由两部分组成,一部分是"绝对信心",鼓励每一组令牌本身的熵都尽量低;另一部分是"层级递进",专门奖励熵值确实按短期到长期的顺序递减的情况,如果某一组的熵反而比该更自信的那一组还高,就会被扣分。

    这套机制解决了什么问题?光靠"绝对信心"这一项是不够的,因为它只会让每一组独立地朝着自信的方向走,却没有约束这几组之间该有的逻辑关系,检索到更多历史信息、看到更全面的证据,理应带来更强的把握,如果这个递进关系没被鼓励,模型很可能出现"看得越多反而越糊涂"的反常状态,这在实验里也确实被验证了:只用绝对信心优化,OVO-Bench是62.5%,VideoMME是65.5%;加上层级递进的约束之后,分别提升到64.2%和66.6%。

    这就好比考试复习,如果一个学生只追求"每一科都要自信",他可能会在简单题上刷高信心,难题上随便应付。真正好的学习状态应该是,随着复习资料看得越多、理解越深,对整道题的把握应该越强,而不是复习了半天反而更糊涂。层级递进奖励做的正是这件事,它逼着模型的信心随着信息量的增加而真正增长,而不只是虚假地在每个孤立环节里显得自信。

    有了这个奖励信号,系统用一种叫*REINforCE的策略梯度方法*来更新令牌和检索到的证据表示:这是一种通过对参数加入随机扰动、观察扰动前后奖励的变化、再据此调整参数方向的优化技术,整个过程不需要修改AI模型本身的任何参数,只优化这些额外插入的记忆令牌。

    优化完成之后,检索用的临时证据会被移除,最终回答只依据压缩后的分层记忆、用户提问、以及这些已经吸收了历史信息的记忆令牌来生成。历史信息不再是外挂的参考资料,而是被真正"消化"进了模型思考的内部状态里。

    数字说话:省内存、还更准

    这套设计到底效果如何?论文在多个基准上做了详尽验证。

    在流式视频理解的OVO-Bench上,基于Qwen2.5-VL-7B模型,LatentStream把整体得分从基线的54.0%提升到64.2%,涨了10.2个百分点。细拆开看,实时视觉感知这一项从63.3%涨到68.5%,而"回溯追踪"(需要回忆更早发生的事件)这一项,涨幅特别惊人,从44.7%直接跳到60.0%,涨了超过15个百分点。这恰恰印证了前面说的逻辑:越需要调用长期历史记忆的任务,这套"检索并内化"的机制带来的提升就越明显。

    在StreamingBench上,LatentStream拿到76.9%,超过了所有对比过的免训练方法。而在三个离线长视频理解基准VideoMME、MLVU、LongVideoBench上,尽管这套系统本来是给流式场景设计的,也依然拿下了66.6%、74.0%、62.1%的成绩,比基线分别提升3.3、6.1、1.4个百分点,说明这套记忆内化机制的价值不局限于"实时"这一个场景。

    效率方面也有意外的收获。原本你可能会担心,加了这么多轮检索和优化,计算成本肯定飙升。但实测下来,LatentStream把峰值显存从30.80GB降到21.97GB,每个输出token的解码时间从6.45毫秒降到3.16毫秒,速度提升了一半以上。原因在于,压缩后的分层记忆大幅减少了需要在生成阶段反复处理的视觉上下文长度。当然,代价是首字延迟从7.63秒增加到8.41秒,因为多轮记忆演化本身需要额外的推理时间,这是一个合理的权衡:多花不到一秒钟去"想清楚",换来后续每一步回答都更快、更省资源。

    论文里还做了一组对比实验,很能说明问题。如果只是简单地把检索到的视觉证据拼接进上下文(不经过令牌内化这一步),OVO-Bench只能到59.7%;如果只加入未经优化的初始记忆令牌,反而降到56.5%,比基线还差;只有经过完整演化优化的记忆令牌,才能达到64.2%。这说明性能提升不是因为"多塞了点信息"这么简单,而是那个"内化并演化"的过程本身在起作用。

    写在后面

    读完这篇论文,最触动我的一点是,它其实在质疑一个我们过去几年都默认合理的假设:给AI装个检索模块,让它按需去查资料,这就够了。

    但检索这件事,本质上是"外部知识库+按需调用"的模式,跟人真正学会一个东西是不一样的。你能查到一个知识点,和你把这个知识点内化成自己的理解、能在后续推理里灵活调用它,是两种完全不同的认知状态。LatentStream把这个区分第一次明确地做进了流式视频理解这个具体任务里,而且拿出了具体的数字来证明这个区分是有意义的,比如那15个百分点的"回溯追踪"能力提升。

    还有一点让我意外,这套系统完全没有修改底层大模型的任何参数,靠的全是在推理阶段对几个额外插入的"记忆令牌"做优化。这意味着同样的思路理论上可以套用到任何现成的视频语言模型上,不需要重新训练一遍。这种"轻量插件式"的改进思路,如果推广开来,可能会比"训一个更大的模型"更实用。

    论文里没细说的一个问题是,这套机制在面对更长、更复杂的多轮对话场景(不是单次提问,而是连续追问)时会怎样演化,记忆令牌能不能在多轮交互里持续积累而不"饱和"或"遗忘",这个问题留给了后续研究。

    如果AI真的能做到把看过的东西"记在心里"而不是"存在硬盘里再翻",那它离真正理解这个世界,又近了一步吗?

    Q1:LatentStream是什么?

    A:LatentStream是一个面向流式视频理解的框架,它把AI处理视频历史信息的方式从"存储再检索"转变为"检索并内化",让历史证据被真正吸收进一个紧凑的潜在记忆状态,持续指导后续推理,而不是简单地作为外部参考资料贴在旁边。

    Q2:LatentStream需要重新训练AI模型吗?

    A:不需要。LatentStream在推理阶段工作,只优化额外插入的潜在记忆令牌,底层视频语言模型的参数完全保持冻结,因此可以直接套用在现成的Qwen2.5-VL等模型上。

    Q3:LatentStream相比之前的方法效果提升有多少?

    A:在OVO-Bench上整体得分从54.0%提升到64.2%,其中依赖长期回忆的"回溯追踪"任务提升超过15个百分点;同时显存占用从30.80GB降到21.97GB,解码速度提升超过一半。


    怎样将网上看到的学习资料变成自己大脑中的知识?

    将网上学习资料转化为自身知识,核心在于通过科学整理、工具辅助和重复记忆,将信息内化为长期记忆。 具体可分为以下步骤:

    一、信息筛选与初步整理 二、结构化加工:利用工具深度整理

    通过工具将信息转化为易记忆的格式,降低大脑加工负担。

    三、导入记忆工具:Anki的主动学习

    Anki通过间隔重复算法强化记忆,需将资料转化为卡片形式:

    四、深度加工:建立知识关联 五、长期维护与迭代 工具与技巧补充

    通过以上步骤,信息从“被动收藏”转化为“主动记忆”,最终形成可随时调用的知识体系。 关键在于结构化加工+间隔重复+实践应用,三者缺一不可。

    ?? AI时代必学技能:21天打造个人知识体系,告别学了就忘!

    21天可利用AI构建终身受用的知识体系,告别学了就忘。 在信息爆炸的时代,人们常面临信息过载、知识碎片化、学了就忘等痛点,而AI驱动的知识管理能有效解决这些问题。

    一、AI知识管理与传统方法的对比 二、AI知识体系构建四大阶段 三、四大核心功能详解 四、21天实战计划 五、真实用户反馈 六、福利时间 七、开启AI学习之旅

    在AI的帮助下,每个人都可以成为知识管理专家。不要让信息淹没你的大脑,让AI帮你构建属于自己的智慧宝库!

    字节LatentSync:6G显存玩转AI口型同步

    字节跳动开源的LatentSync是一款基于6G显存即可运行的AI口型同步工具,通过“声控嘴”技术实现视频人物口型与声音的精准同步,并配备时空稳定技术保障画面流畅性,同时提供一键启动包简化操作流程,适用于视频制作、多语言配音、虚拟主播及教育等多个领域。

    核心功能解析 技术亮点 一键启动包:降低使用门槛 应用场景 优势总结

    LatentSync的开源为视频制作领域提供了高效、低成本的解决方案,其技术创新与易用性设计有望推动AI口型同步技术的普及,进一步赋能内容创作者。

    相关标签: 上下文、 令牌、 调用、 断点、 追踪、 latentstream、 本文地址:https://h42v.5slw.cn/article/6675.html 上一篇:从17楼窗户坠下致残一审判朋友担责六成赔偿 下一篇:打破尘封16年赛会纪录单届7金平纪录张展硕
  • 相关推荐
  • 总统杯四人两球赛国际队五场全胜-7比3领先美国队 (2026总统杯阵容)

    总统杯四人两球赛国际队五场全胜-7比3领先美国队 (2026总统杯阵容)

  • 菲律宾爆发燃油危机 (菲律宾遭遇极端天气)

    菲律宾爆发燃油危机 (菲律宾遭遇极端天气)

  • 中国队破亚洲纪录夺冠-亚运会男子4×200米自由泳 (中国队历史亚洲排名)

    中国队破亚洲纪录夺冠-亚运会男子4×200米自由泳 (中国队历史亚洲排名)

  • 一出肉麻政治双簧-揭了特奥多罗的老底-社评

    一出肉麻政治双簧-揭了特奥多罗的老底-社评

  • 南方医科大学学生坠亡背后-医学生的心理困境该被看见 (南方医科大学南方医院)

    南方医科大学学生坠亡背后-医学生的心理困境该被看见 (南方医科大学南方医院)

  • 豆包手机助手消费者版发布;Suno发布v6音乐模型;ElevenLabs发布Music-v2.5音频模型-AI日报 (豆包手机助手是什么)

    豆包手机助手消费者版发布;Suno发布v6音乐模型;ElevenLabs发布Music-v2.5音频模型-AI日报 (豆包手机助手是什么)

  • 免费领取!-星界战士-Epic喜加二-天空奇兵 (免费领取折叠拐杖凳是真的吗)

    免费领取!-星界战士-Epic喜加二-天空奇兵 (免费领取折叠拐杖凳是真的吗)

  • 鹿岛鹿角外援莱奥-4场6球 (鹿岛鹿角外援马基尼奥斯)

    鹿岛鹿角外援莱奥-4场6球 (鹿岛鹿角外援马基尼奥斯)

  • DeepSeek-V4.1-Flash上线超算互联网 (deepseek v4 pro)

    DeepSeek-V4.1-Flash上线超算互联网 (deepseek v4 pro)

  • 神行者要打-开始-从一台-战损车-未来15年的战争 (神行者是什么)

    神行者要打-开始-从一台-战损车-未来15年的战争 (神行者是什么)

  • 2nm工艺最新资讯 (N 2工艺)

    2nm工艺最新资讯 (N 2工艺)

  • 中国男篮2连胜迎世界杯出线利好-杨瀚森准绝杀 (中国男篮2连胜列第三)

    中国男篮2连胜迎世界杯出线利好-杨瀚森准绝杀 (中国男篮2连胜列第三)

  • 文章推荐
    将于下半年发布-配大联屏-续航或破2300公里!方程豹钛9内饰谍照曝光 (将于下半年发生的英文)
    电商入门基础知识 (电商新手入门教学)
    秀肌肉-如何真正走进千行百业-人形机器人告别-湾区创客说 (秀肌肉的照片)
    最高领先5500约16%-5500F七款游戏初测曝光-AMD锐龙5
    Denuvo起诉破解大神voices38-首次通过法律手段应对D加密破解 (denuvo anti cheat)
    昔日中国外卖小哥-拿下世界越野跑王冠! (怎么接受母亲癌症晚期)
    近200GB-含-给他爱5-开发资料据称泄露-早期资产及自由城扩展-侠盗猎车手6
    看图作诗 (看图写诗的图片和答案)
    中国女排3-[图]亚运会 (中国女排3-1击败泰国队)
    瑞德恰卡拉正在接近美巡-欧巡2026赛季进入下半程 (瑞德喜是caha吗)
    小米18-Pro系列硬件级防窥屏采用双像素方案-画质依旧清晰 (小米18pro max)
    践行国企担当-匠造高品质海淀-海开控股 (践行国企担当,勇担社会责任)
    热门推荐
    湖南省富恒建设工程有限公司-主网工程,运维工程,光伏工程,配网工程
    Martin
    你当像鸟飞往你的山
    首页--上海焊谷仪表有限公司
    武汉骐骏房地产顾问有限公司
    海南水晶宫饼业有限公司
    充客Ai掌柜
    山东华美建材有限公司
    脑影像工坊
    NewaSoft云文档
    红器自控(江苏)有限公司
    软件下载,Windows软件下载,Mac软件下载-南北的猫
    发表评论

    Copyright @ 2021 书链收录网 此内容系本站根据来路自动抓取的结果,不代表本站赞成被显示网站的内容或立场。

    本页阅读量次 | 本站总访问次 | 本站总访客人 | 今日总访问次 | 今日总访客人 | 昨日总访问次 | 昨日总访客人 | 网站地图 |

    技术支持:书链收录网