嵌套学习的黎明:当机器从「外挂记忆」走向「立体直觉」
读 Google 的《Nested Learning》论文:为什么给大模型外挂 RAG 像是给顺行性遗忘症患者递小纸条,以及多尺度更新频率和连续统记忆系统如何让模型长出「立体直觉」。
TL;DR
在之前那篇记忆工程的文章下面,一位读者留了个对我很有启发的观点: 现在大模型的上下文本质上只是一维的线性记忆,而人类的记忆是一种立体的直觉, 面对庞大复杂的问题,单靠外挂记忆库可能就不行了。 Google 2025 年底的《Nested Learning》论文正好回应了这一点。 它用「顺行性遗忘症」来比喻当前的大模型——预训练前的记忆完好,但永远失去了形成新长期记忆的能力, 而 RAG 就是给这样的患者疯狂递小纸条。 论文更颠覆的一步是指出:注意力机制、前馈网络、优化器在本质上并无不同,全都是联想记忆模块, 区别只在于更新频率。参照人脑脑电波的频段划分,未来的模型应该允许不同层级的参数拥有各自的更新节奏。
目录
在之前关于记忆工程的文章下方,有一位读者提出了一个对我很有启发的观点:现在大模型的上下文,本质上只是一维的线性记忆,而人类的记忆却是一种立体的直觉。面对庞大复杂的问题,单靠给大模型外挂记忆库可能就不行了。
在面对大模型记忆容量的瓶颈时,通常的工程化解法是给它外挂一个向量数据库。但就像这位读者说的,人类的记忆绝不是在脑海里查字典。比如当一位经验丰富的医生看到患者的长期病历时,他不是在脑子里比对几千个文本切片,而是一种建立在岁月与经验之上的立体直觉。
最近刚好看到 Google 团队在 2025 年底发表的一篇论文《Nested Learning: The Illusion of Deep Learning Architecture》,帮助我更深刻地理解了这位读者的话,并看到了未来的 AI 是如何从一维的线性记忆走向立体的直觉。
一、「顺行性遗忘症」与外挂记忆的局限
要理解突破口在哪里,首先要精准定位当前大模型架构的局限。
论文中用了一个非常绝妙且直击痛点的医学比喻:顺行性遗忘症(Anterograde Amnesia)。
这是一种真实的神经系统疾病。患者在患病前的记忆完好无损,但他永远失去了形成新的长期记忆的能力。他的人生被永远困在了一个非常短暂的当前窗口里,一旦事情过去几分钟就会彻底忘记,只能永远活在当下的切片中。
这不就是我们当前使用的 LLM 的真实写照吗?
- 预训练阶段:模型贪婪地吸收人类几千年的知识,将其压缩到权重中。
- 推理阶段:一旦预训练结束,模型的持久参数通常就不再更新了。此时的模型就患上了顺行性遗忘症,它所有的适应能力仅仅依赖于上下文学习,也就是它短暂的工作记忆。
这就是外挂记忆天花板的底层根源:当我们用 RAG 给大模型外挂记忆时,本质上是在给一个顺行性遗忘症患者疯狂地递小纸条。面对简单的事实问答,小纸条很管用;但面对极其庞大、复杂、需要长周期跨越式推理的问题时,大量支离破碎的小纸条只会让患者的信息处理能力过载。
真正的学习,不应该是依靠外部数据库的检索,而应该是模型自身内部参数的持续演化与重组。
二、打破幻象:深度学习架构的本质是什么?
为了治好大模型的遗忘症,研究团队提出了一种全新的机器学习范式:嵌套学习(Nested Learning)。在抛出解决方案之前,论文首先指出了当前深度学习界的一个认知幻象。
过去的错觉:以为大模型是一台拼装车。在传统的认知中,我们看神经网络觉得它是由功能完全不同的零件拼装起来的:注意力机制像是雷达,负责在上下文中寻找关联信息;前馈网络像是硬盘,存储预训练学到的知识;优化器像是场外机械师,根据误差不断调整模型权重。
但这篇论文指出:这是一种幻象。
论文的真相:一切皆是联想记忆。在嵌套学习的视角下,无论是架构还是优化器,它们在本质上并没有什么不同。架构被分解为一组神经元,每个神经元都有自己的上下文流和目标——换句话说,它们全都是联想记忆模块,唯一在做的事情,就是压缩自己接收到的上下文信息流。
- 注意力机制:在压缩当前输入进来的 token 流。
- 前馈网络:其实也是在压缩信息,只不过它的上下文是海量的全局预训练数据。
- 优化器(如 Adam):同样是联想记忆模块,它压缩的是模型在训练过程中产生的梯度信息流。
既然底层机制完全一样,为什么这三者的表现截然不同?这就引出了嵌套学习的下一步:虽然都是记忆模块,但它们所处的层级和更新速度完全不同。
三、从「一维线性」到「立体直觉」:多尺度时间更新
既然所有的结构本质上都是同一类记忆模块,那如何用它们搭出一个能像人类大脑一样拥有立体直觉、且不会患上灾难性遗忘症的系统呢?
答案在于更新频率。
论文指出脑电波存在明显的频段划分,每个频段对应不同的信息处理时间尺度:
- 高频波(Gamma,30 到 150 Hz):更新极快,负责处理稍纵即逝的感觉信息。
- 中频波(Beta,13 到 30 Hz):主要负责活跃的思考。
- 低频波(Delta / Theta,0.5 到 8 Hz):更新极慢,主要负责长期的记忆巩固和学习。
这就是立体直觉的来源:大脑不需要单一的全局时钟来同步所有神经元,高频神经元负责快速适应但存储记忆的时间较短,而低频神经元则负责整合更持久的知识。
现在的模型架构之所以会患上顺行性遗忘症,是因为它的更新频率走了两个极端:预训练阶段所有知识被一次性压入参数,部署后更新频率变为 0,这是极其缓慢的低频;推理阶段模型根据用户的输入飞速计算,对应极高频率的更新,但上下文一清空记忆就随之消失。
没有中间态,没有层次感,这不可避免地导致了记忆的割裂。
为此,嵌套学习范式提出:未来的模型,必须允许不同层级的参数拥有各自独立的特定更新频率。
四、连续统记忆系统与自修改网络
为了让 AI 拥有这种多尺度的类脑直觉,研究员在模型内部做出了两个举措。
1、自修改 Titans
在传统的序列模型中,用于将输入映射为键、值和查询的投影矩阵,在预训练后就彻底写死了——这就像一个人成年后,他观察世界的视角和评估事物价值的标准就被永久固化了。而人类的直觉是能够审时度势的。
论文提出的自修改 Titans 架构中,模型所有的组件(不仅是记忆本身,还包括生成 K、V、Q 的权重,甚至包括模型内部优化的学习率和遗忘门)都可以通过上下文的输入进行学习和自我修改。
模型不再是一个被动处理数据的机器,而是一个能够动态调整自身认知结构的活体系统。
2、连续统记忆系统(CMS)
如果说自修改网络解决了短期工作记忆的敏捷度,那 CMS 则重塑了模型的长时记忆。在 CMS 的设计中,记忆被视为一条由不同频率更新的 MLP 块组成的连续统:高频块负责快速适应新上下文,但知识保留时间短;低频块以更慢的节奏(例如每处理几千上万个 token 才更新一次权重)进行参数级别的知识持久化。
这种机制显著缓解了持续学习中的灾难性遗忘——当一个高频块遗忘了旧知识去适应新场景时,那些底层的低频块依然稳稳地存储着旧知识。
五、HOPE 架构:从理论到实战
为了验证这套理论,Google 团队将自修改 Titans 与 CMS 结合,提出了 HOPE 架构。
超长上下文推理能力:在 BABILong 长文本推理基准测试中,许多大模型(包括 GPT-4 和 Llama-8B)在上下文长度达到 128K 到 256K 附近时性能会显著下降,而 HOPE 在处理高达 1000 万长度的上下文时依然保持着优异的准确率。
真正的持续学习而不遗忘:在类增量学习任务中,HOPE 的表现超越了传统的上下文学习,甚至击败了专门挂载外部持续学习器的 InCA 架构。
在上下文中学习一门新语言:在 CTNL 测试中,研究人员让模型接连学习两门完全陌生的语言(如满语)。传统模型在持续翻译中面临灾难性遗忘,但 HOPE 通过增加不同层级的 CMS 记忆模块,几乎完美地保留了对语言的掌握能力。
这时可能会担心,让模型在推理时不断更新自己的参数,计算成本会不会爆炸?论文指出,由于 CMS 将模块解耦并设定了不同的低频更新频率,实际上每次只有极少量的参数需要更新(类似于异步更新),配合序列并行计算,在实践中是非常高效的。这为端侧小模型的持续演进提供了巨大的可行性。
最后
嵌套学习告诉我们,未来的每一个本地 AI 智能体,都将在与用户的长期交互中,演化出独一无二的底层权重。这时候的个性化,不再是 prompt 里的前置条件,而是根植于模型神经网络底层的直觉映射。
未来的产品形态也许是千人千面的内生参数,而非千人千面的数据库。
这篇论文预言:打破异构架构的拼凑幻象,将神经网络真正视作一个由多重时间尺度、统一联想记忆嵌套而成的生命体。
也许,只有当机器的内部开始向人类大脑的多频脑电波看齐时,我们才能真正赋予 AI 跨越时间、深邃而又灵动的立体直觉。
核心结论
标注「判断」「假设」的是我的看法而非事实;标注「已推翻」的保留在这里,不删除。
当前 LLM 患的是「顺行性遗忘症」——预训练前的知识完好无损,但部署后持久参数不再更新,永远活在上下文窗口这个当下的切片里。#
判断 · 把握较大
用 RAG 给大模型外挂记忆,本质上是在给一个顺行性遗忘症患者疯狂递小纸条。面对简单事实问答很管用,但面对需要长周期跨越式推理的复杂问题,大量支离破碎的小纸条只会让信息处理能力过载。#
判断 · 把握较大
论文指出深度学习架构的「拼装车」认知是一种幻象——注意力机制、前馈网络、优化器在本质上并没有不同,它们全都是联想记忆模块,唯一在做的事情就是压缩自己接收到的上下文信息流。#
立体直觉的来源是更新频率的层次感。人脑不需要单一的全局时钟,高频神经元负责快速适应但记忆时间短,低频神经元负责整合持久知识。现在的模型只有两个极端,没有中间态。#
判断 · 把握较大
未来每个本地 AI 智能体都可能在长期交互中演化出独一无二的底层权重,个性化不再是 prompt 里的前置条件,而是根植于神经网络底层的直觉映射——千人千面的内生参数,而非千人千面的数据库。#
假设
引用本文
晨旭,《嵌套学习的黎明:当机器从「外挂记忆」走向「立体直觉」》,晨光里的AI,2026-02-21
[晨旭:《嵌套学习的黎明:当机器从「外挂记忆」走向「立体直觉」》](https://chenxu.xin/writing/nested-learning-hope)带进你的 AI 继续追问
这篇文章有一份干净的 Markdown 原文,可以直接交给任何模型读,不用复制粘贴。