# 嵌套学习的黎明：当机器从「外挂记忆」走向「立体直觉」

> 作者：晨旭｜发布：2026-02-21｜系列：AI技术理解
> 来源：https://chenxu.xin/writing/nested-learning-hope

读 Google 的《Nested Learning》论文：为什么给大模型外挂 RAG 像是给顺行性遗忘症患者递小纸条，以及多尺度更新频率和连续统记忆系统如何让模型长出「立体直觉」。

---

在之前关于记忆工程的文章下方，有一位读者提出了一个对我很有启发的观点：现在大模型的上下文，本质上只是一维的线性记忆，而人类的记忆却是一种立体的直觉。面对庞大复杂的问题，单靠给大模型外挂记忆库可能就不行了。

在面对大模型记忆容量的瓶颈时，通常的工程化解法是给它外挂一个向量数据库。但就像这位读者说的，人类的记忆绝不是在脑海里查字典。比如当一位经验丰富的医生看到患者的长期病历时，他不是在脑子里比对几千个文本切片，而是一种建立在岁月与经验之上的立体直觉。

最近刚好看到 Google 团队在 2025 年底发表的一篇论文《Nested Learning: The Illusion of Deep Learning Architecture》，帮助我更深刻地理解了这位读者的话，并看到了未来的 AI 是如何从一维的线性记忆走向立体的直觉。

## 一、「顺行性遗忘症」与外挂记忆的局限

要理解突破口在哪里，首先要精准定位当前大模型架构的局限。

论文中用了一个非常绝妙且直击痛点的医学比喻：顺行性遗忘症（Anterograde Amnesia）。

这是一种真实的神经系统疾病。患者在患病前的记忆完好无损，但他永远失去了形成新的长期记忆的能力。他的人生被永远困在了一个非常短暂的当前窗口里，一旦事情过去几分钟就会彻底忘记，只能永远活在当下的切片中。

这不就是我们当前使用的 LLM 的真实写照吗？

- **预训练阶段**：模型贪婪地吸收人类几千年的知识，将其压缩到权重中。
- **推理阶段**：一旦预训练结束，模型的持久参数通常就不再更新了。此时的模型就患上了顺行性遗忘症，它所有的适应能力仅仅依赖于上下文学习，也就是它短暂的工作记忆。

这就是外挂记忆天花板的底层根源：当我们用 RAG 给大模型外挂记忆时，本质上是在给一个顺行性遗忘症患者疯狂地递小纸条。面对简单的事实问答，小纸条很管用；但面对极其庞大、复杂、需要长周期跨越式推理的问题时，大量支离破碎的小纸条只会让患者的信息处理能力过载。

真正的学习，不应该是依靠外部数据库的检索，而应该是模型自身内部参数的持续演化与重组。

## 二、打破幻象：深度学习架构的本质是什么？

为了治好大模型的遗忘症，研究团队提出了一种全新的机器学习范式：嵌套学习（Nested Learning）。在抛出解决方案之前，论文首先指出了当前深度学习界的一个认知幻象。

**过去的错觉：以为大模型是一台拼装车**。在传统的认知中，我们看神经网络觉得它是由功能完全不同的零件拼装起来的：注意力机制像是雷达，负责在上下文中寻找关联信息；前馈网络像是硬盘，存储预训练学到的知识；优化器像是场外机械师，根据误差不断调整模型权重。

但这篇论文指出：这是一种幻象。

**论文的真相：一切皆是联想记忆**。在嵌套学习的视角下，无论是架构还是优化器，它们在本质上并没有什么不同。架构被分解为一组神经元，每个神经元都有自己的上下文流和目标——换句话说，它们全都是联想记忆模块，唯一在做的事情，就是压缩自己接收到的上下文信息流。

- 注意力机制：在压缩当前输入进来的 token 流。
- 前馈网络：其实也是在压缩信息，只不过它的上下文是海量的全局预训练数据。
- 优化器（如 Adam）：同样是联想记忆模块，它压缩的是模型在训练过程中产生的梯度信息流。

既然底层机制完全一样，为什么这三者的表现截然不同？这就引出了嵌套学习的下一步：虽然都是记忆模块，但它们所处的层级和更新速度完全不同。



## 三、从「一维线性」到「立体直觉」：多尺度时间更新

既然所有的结构本质上都是同一类记忆模块，那如何用它们搭出一个能像人类大脑一样拥有立体直觉、且不会患上灾难性遗忘症的系统呢？

答案在于**更新频率**。

论文指出脑电波存在明显的频段划分，每个频段对应不同的信息处理时间尺度：

- **高频波（Gamma，30 到 150 Hz）**：更新极快，负责处理稍纵即逝的感觉信息。
- **中频波（Beta，13 到 30 Hz）**：主要负责活跃的思考。
- **低频波（Delta / Theta，0.5 到 8 Hz）**：更新极慢，主要负责长期的记忆巩固和学习。

这就是立体直觉的来源：大脑不需要单一的全局时钟来同步所有神经元，高频神经元负责快速适应但存储记忆的时间较短，而低频神经元则负责整合更持久的知识。

现在的模型架构之所以会患上顺行性遗忘症，是因为它的更新频率走了两个极端：预训练阶段所有知识被一次性压入参数，部署后更新频率变为 0，这是极其缓慢的低频；推理阶段模型根据用户的输入飞速计算，对应极高频率的更新，但上下文一清空记忆就随之消失。

没有中间态，没有层次感，这不可避免地导致了记忆的割裂。

为此，嵌套学习范式提出：未来的模型，必须允许不同层级的参数拥有各自独立的特定更新频率。

## 四、连续统记忆系统与自修改网络

为了让 AI 拥有这种多尺度的类脑直觉，研究员在模型内部做出了两个举措。

**1、自修改 Titans**

在传统的序列模型中，用于将输入映射为键、值和查询的投影矩阵，在预训练后就彻底写死了——这就像一个人成年后，他观察世界的视角和评估事物价值的标准就被永久固化了。而人类的直觉是能够审时度势的。

论文提出的自修改 Titans 架构中，模型所有的组件（不仅是记忆本身，还包括生成 K、V、Q 的权重，甚至包括模型内部优化的学习率和遗忘门）都可以通过上下文的输入进行学习和自我修改。

模型不再是一个被动处理数据的机器，而是一个能够动态调整自身认知结构的活体系统。

**2、连续统记忆系统（CMS）**

如果说自修改网络解决了短期工作记忆的敏捷度，那 CMS 则重塑了模型的长时记忆。在 CMS 的设计中，记忆被视为一条由不同频率更新的 MLP 块组成的连续统：高频块负责快速适应新上下文，但知识保留时间短；低频块以更慢的节奏（例如每处理几千上万个 token 才更新一次权重）进行参数级别的知识持久化。

这种机制显著缓解了持续学习中的灾难性遗忘——当一个高频块遗忘了旧知识去适应新场景时，那些底层的低频块依然稳稳地存储着旧知识。



## 五、HOPE 架构：从理论到实战

为了验证这套理论，Google 团队将自修改 Titans 与 CMS 结合，提出了 HOPE 架构。

**超长上下文推理能力**：在 BABILong 长文本推理基准测试中，许多大模型（包括 GPT-4 和 Llama-8B）在上下文长度达到 128K 到 256K 附近时性能会显著下降，而 HOPE 在处理高达 1000 万长度的上下文时依然保持着优异的准确率。

**真正的持续学习而不遗忘**：在类增量学习任务中，HOPE 的表现超越了传统的上下文学习，甚至击败了专门挂载外部持续学习器的 InCA 架构。

**在上下文中学习一门新语言**：在 CTNL 测试中，研究人员让模型接连学习两门完全陌生的语言（如满语）。传统模型在持续翻译中面临灾难性遗忘，但 HOPE 通过增加不同层级的 CMS 记忆模块，几乎完美地保留了对语言的掌握能力。

这时可能会担心，让模型在推理时不断更新自己的参数，计算成本会不会爆炸？论文指出，由于 CMS 将模块解耦并设定了不同的低频更新频率，实际上每次只有极少量的参数需要更新（类似于异步更新），配合序列并行计算，在实践中是非常高效的。这为端侧小模型的持续演进提供了巨大的可行性。

## 最后

嵌套学习告诉我们，未来的每一个本地 AI 智能体，都将在与用户的长期交互中，演化出独一无二的底层权重。这时候的个性化，不再是 prompt 里的前置条件，而是根植于模型神经网络底层的直觉映射。

未来的产品形态也许是千人千面的内生参数，而非千人千面的数据库。

这篇论文预言：打破异构架构的拼凑幻象，将神经网络真正视作一个由多重时间尺度、统一联想记忆嵌套而成的生命体。

也许，只有当机器的内部开始向人类大脑的多频脑电波看齐时，我们才能真正赋予 AI 跨越时间、深邃而又灵动的立体直觉。

## 核心结论

- 当前 LLM 患的是「顺行性遗忘症」——预训练前的知识完好无损，但部署后持久参数不再更新，永远活在上下文窗口这个当下的切片里。（判断 · 把握较大）
  永久链接：https://chenxu.xin/writing/nested-learning-hope#llm-has-anterograde-amnesia
- 用 RAG 给大模型外挂记忆，本质上是在给一个顺行性遗忘症患者疯狂递小纸条。面对简单事实问答很管用，但面对需要长周期跨越式推理的复杂问题，大量支离破碎的小纸条只会让信息处理能力过载。（判断 · 把握较大）
  永久链接：https://chenxu.xin/writing/nested-learning-hope#rag-is-passing-notes-to-an-amnesiac
- 论文指出深度学习架构的「拼装车」认知是一种幻象——注意力机制、前馈网络、优化器在本质上并没有不同，它们全都是联想记忆模块，唯一在做的事情就是压缩自己接收到的上下文信息流。
  永久链接：https://chenxu.xin/writing/nested-learning-hope#everything-is-associative-memory
- 立体直觉的来源是更新频率的层次感。人脑不需要单一的全局时钟，高频神经元负责快速适应但记忆时间短，低频神经元负责整合持久知识。现在的模型只有两个极端，没有中间态。（判断 · 把握较大）
  永久链接：https://chenxu.xin/writing/nested-learning-hope#multi-scale-update-frequency
- 未来每个本地 AI 智能体都可能在长期交互中演化出独一无二的底层权重，个性化不再是 prompt 里的前置条件，而是根植于神经网络底层的直觉映射——千人千面的内生参数，而非千人千面的数据库。（假设）
  永久链接：https://chenxu.xin/writing/nested-learning-hope#personalization-in-weights-not-prompts

---

本文出自晨光里的AI（https://chenxu.xin），作者晨旭。
引用时请保留来源链接。文中标注「判断」「假设」的部分是作者的个人看法，不是事实。
