fcten@blog: ~
$ fcten's blog

# What I cannot create, I do not understand.

~2026/07/25/agi-second-half/ — cat

AI 的下半场:迈向通用智能

过去数年,大语言模型的能力边界迅速扩展。它们能够编写程序、求解数学问题、通过专业考试并完成长程对话,许多曾被视为需要专门智能的任务,已经被统一到同一种模型范式之中。随之而来的问题是:我们离 AGI 还有多远?

AGI 尚无公认定义,因此,直接判断当前模型是否已经“具备通用智能”并不容易。更有解释力的分析方式,是考察现有范式解决了哪些问题,又有哪些能力尚未形成稳定机制。Scaling law 表明,扩大参数、数据与算力能够持续改善模型表现(Kaplan et al., 2020);但规模本身并未回答另外三类问题:模型如何依据任务难度分配计算,如何跨会话保存经验,又如何在避免遗忘的同时持续更新知识。

本文提出的核心假设是:当前范式已经构造出能力极强的静态求解器;若要进一步形成能够随经验发展的智能体,还需要建立由自适应计算、持久记忆与持续学习组成的学习闭环。这一判断并不否定规模扩展,也不预设唯一的 AGI 路线,而是试图明确规模扩展之外仍需研究的机制。

本文主要讨论标准的、权重冻结的自回归基础模型。加入检索、工具、外部记忆和定期微调后,完整的 AI 系统可以补充部分能力,但这不等同于基础模型自身已经具备相应机制。


现有范式为何成功

Transformer 的优势首先来自对序列建模方式的改变(Vaswani et al., 2017)。在此前占主流的 RNN/LSTM 中,第 t+1 个 token(词元)的状态依赖第 t 个 token 的计算结果,时间维度难以并行;信息还要经过固定长度的隐状态逐步传递,依赖路径随序列长度增长。LSTM 缓解了梯度消失,却没有消除这一串行结构。

以 Transformer 为核心的大模型范式,主要依靠三项条件实现了规模化:

序列训练可以并行。 在单层全局自注意力中,任意两个允许互相访问的位置可以直接建立联系,最大依赖路径从 RNN 的 O(n) 降至 O(1)。训练时,同一层的不同位置能够并行计算,从而有效利用大规模加速器和互联网级语料。其边界同样明确:自回归模型仍受因果掩码约束,生成阶段仍需逐 token 进行;标准注意力的时间与显存开销也会随序列长度近似二次增长。

窗口内信息可以直接访问。 在因果语言模型中,每个位置都能访问窗口内更早的 token,不必将全部历史压缩进一个反复传递的固定长度状态。上下文窗口因而承担了工作记忆的部分功能。它不能保证模型准确定位或使用远距离信息,但显著缩短了建立长程依赖的路径。

集中训练与在线服务可以分离。 这并非 Transformer 独有的性质,而是现代基础模型的主流部署方式:模型先在海量数据上集中训练,再以冻结权重提供推理服务。冻结模型不意味着输出必然确定,采样仍会引入随机性;它的主要价值在于保持版本边界稳定,并支持批处理、缓存、弹性扩缩容和统一评估。

这三项条件共同解决了“如何扩大训练规模”和“如何扩大服务规模”的问题,却没有直接解决“模型如何在服务过程中继续学习”的问题。后者正是下一阶段的分界线。

从工程优势到机制边界

同一组工程选择,也形成了标准模型的默认边界。它们并非 Transformer 无法改变的固有定律,而是在效率、稳定性与可扩展性约束下形成的主流配置:

主流配置 工程收益 尚未覆盖的能力
固定计算深度 计算图规则,便于并行和容量规划 按任务难度动态分配计算
会话级瞬态状态 请求隔离清晰,状态管理简单 跨会话积累并组织经验
部署权重冻结 版本稳定,便于评估、扩容与回滚 从新经验中持续更新知识

因此,讨论重点需要从模型在单次评测中的表现,转向模型随时间变化的方式:它是否能为当前任务调整计算,是否能把结果保留到未来,以及这些经验能否进一步改变长期能力。三项问题依次对应自适应推理、持久记忆和持续学习。


鸿沟一:从固定计算到自适应推理

复杂问题往往需要提出假设、检验中间结果并在必要时回溯。认知研究常用快速、自动的加工与较慢、审慎的加工描述这种差异(Kahneman, 2011)。这一框架并不意味着大脑中存在边界清晰的两个模块,但它揭示了一个重要特征:认知系统会依据任务难度调整投入的计算。

标准稠密 Transformer 的单次前向传播不具备这种自适应深度,每个生成 token 都经过相同层数。现代推理系统已经可以通过更长的推理轨迹、多次采样、搜索和验证器增加测试时计算(Wei et al., 2022; Snell et al., 2024)。这说明模型并非不能为难题投入更多资源,只是额外计算主要发生在生成更多 token 或执行更多次模型调用的外层过程,而非连续隐状态中的自主迭代。

链式思维(chain-of-thought)是目前最成熟的实现路径之一:模型生成显式中间步骤,以增加序列长度换取更多计算。其代价在于,中间状态需要通过离散 token 表达,推理延迟随轨迹增长,早期误差也可能沿后续步骤传播。另一类方法则尝试在隐空间中迭代,使连续表示经过多次更新后再生成最终答案。

Adaptive Computation Time(Graves, 2016)与 Universal Transformer(Dehghani et al., 2019)较早探索了循环计算和动态停止;Mixture-of-Depths(Raposo et al., 2024)尝试按 token 分配计算,Coconut(Hao et al., 2024)则将连续隐状态直接送回模型继续推理。这些工作说明自适应计算并非架构上不可实现,但它尚未成为大规模语言模型的标准形态。

关键问题不只是增加循环次数,而是如何让隐状态在迭代中持续形成有效变化,如何将训练信号传递到多步计算,如何学习可靠的停止策略,以及如何在动态计算下保持硬件效率。模型还需要判断继续计算的预期收益,而非仅仅报告答案置信度。前者接近元认知意义上的计算控制,也比一般的置信度校准更为困难。

即使这一问题得到解决,模型获得的仍然主要是对当前任务投入更多计算的能力。若推理结果在请求结束后随状态一同消失,系统仍无法从历次任务中积累经验。这引出了第二道鸿沟。


鸿沟二:从上下文回读到持久记忆

长上下文扩展了模型一次可以读取的信息量,却不等同于跨会话记忆。朴素的长上下文仍需将历史重新放入输入;摘要、检索和外部数据库可以降低成本,但相关状态主要由模型外部的组件维护。它们提高了历史信息的可访问性,并不会自动把经历转化为模型内部的长期知识。

从功能上看,持久记忆至少包含两个不同层次:一类是能够保留原文、数字、时间和来源的情景记录;另一类是从多次经历中提取的语义结构。前者强调精确与可追溯,后者强调压缩与泛化。成熟的记忆系统需要同时处理这两类目标,而不是简单地扩大上下文窗口。

互补学习系统理论(Complementary Learning Systems, CLS)为这一分工提供了生物学参照(McClelland et al., 1995; Kumaran et al., 2016)。该理论认为,海马系统擅长快速形成相对分离的情景记忆,新皮层则通过较慢、分布式的学习提取跨经历的统计结构。睡眠和安静休息期间的经验重放(replay)被认为参与了两者之间的协作,使新经验逐渐融入既有知识。记忆固化(memory consolidation)因而不是记录的简单复制,而是跨时间尺度的重组与整合。

标准基础模型缺少的,正是这种跨时间尺度的内部学习闭环:它没有默认启用的跨会话可写状态,也不会将其中的经验自主整合进冻结权重。完整系统可以配置外部记忆,但“检索既有记录”与“将经验转化为可泛化知识”仍属于不同能力。

围绕这一目标,至少存在三类开放问题:

记忆载体。 可寻址的外部存储适合保留精确内容与来源,神经记忆或快速权重(fast weights)更适合压缩统计模式并直接参与计算。核心问题在于二者如何分工:哪些信息需要原样保存,哪些信息适合压缩,何时写入,以及如何处理冲突、过期和来源可信度。

固化机制。 参数更新可能形成更抽象的表示,也可能干扰旧知识;保留原始记录便于追溯,却不会自动产生泛化。Titans(Behrouz et al., 2025)尝试在测试时更新神经记忆,端到端测试时训练(Tandon et al., 2025)将上下文压入动态权重,Self-Consolidating Language Models(Wang et al., 2026)则直接研究从上下文到模型权重的持续固化。这些早期结果表明,小范围的上下文到权重(context-to-weight)更新具有可行性,但距离开放环境中的可靠长期学习仍有明显差距。

评估方法。 事实记忆可以通过准确率衡量,固化还涉及保持时间、干扰程度、跨情境迁移和抽象结构的形成。现有持续学习评测覆盖了其中一部分,却仍难以完整描述模型形成了何种知识图式(schema)、新旧经验如何重组,以及局部更新对其他能力造成了哪些影响。

持久记忆解决的是经验能否被保留,而不是经验能否改变模型。若记忆只停留在可检索的记录层面,系统的长期能力仍然保持不变。由此进入第三道鸿沟。


鸿沟三:从冻结部署到受控的持续学习

持续学习并不是无差别地保存所有交互,而是将经过验证的经验有选择地整合进长期行为,同时维持仍然有效的既有能力。标准基础模型可以在上下文内适应示例,却不会将这种短期适应自动转化为跨会话、跨任务的稳定变化。

这里的核心难题是稳定性—可塑性矛盾:模型既要吸收新经验,又要避免破坏旧能力。在连续变化的数据上直接训练,可能产生灾难性遗忘。经验回放、弹性权重固化(EWC;Kirkpatrick et al., 2017)、参数隔离和模块化等方法能够缓解部分问题,但尚未形成适用于开放环境、可以长期扩展的通用方案。

CLS 提供了一种值得检验的思路:新经验先进入快速记忆,再通过离线、交错的经验重放与旧知识共同训练,降低新数据直接覆盖长期参数的风险。由此形成的“快速记忆—选择性重放—渐进固化”路径可能缓解遗忘,但不能自然消除记忆容量、采样偏差、错误累积和分布漂移。

持续学习还必须与治理机制共同设计。真实服务包含错误反馈、提示注入、隐私数据和不同用户之间的权限边界。系统必须明确哪些主体可以触发学习、哪些经验允许跨会话或跨用户保留,以及每次更新能否审计、撤销和回滚。因此,目标不应是从所有经历中自动学习,而应是在明确授权、来源可追溯且结果可验证的边界内持续学习


从三项能力到学习闭环

自适应计算、持久记忆和持续学习并不是同一种能力,但可以组成一个具有明确顺序的闭环:

  1. 推理阶段:系统依据任务难度分配计算,形成候选结论、中间状态与误差信号。
  2. 记忆阶段:系统根据新颖性、任务价值和来源可信度,选择需要保留的经历,并区分精确记录与可压缩模式。
  3. 固化阶段:系统通过受控的经验重放、测试时训练或其他更新机制,将部分经验整合进长期表示。
  4. 治理阶段:系统评估更新效果,监测能力退化与数据污染,并保留隔离、审计和回滚能力。

这条递进关系构成了全文的主线:自适应计算提高单次经验的利用深度,持久记忆延长经验的时间跨度,持续学习再将经验转化为长期能力。缺少记忆,学习没有稳定素材;缺少固化,记忆无法改变长期行为;缺少治理,持续学习则可能成为新的系统性风险。

生物大脑中的多系统协作、选择性重放与记忆固化,为这个闭环提供了可研究的参照,但并不能证明人工系统必须复制同一种实现。更审慎的假设是:通往更通用智能,既需要继续扩大模型、数据与算力规模,也需要把状态和学习闭环纳入架构与系统设计。 两者不是替代关系;规模可以增强新机制,新机制也可能提高算力与经验的利用效率。


可验证的研究路径

上述假设可以进一步分解为四条相互关联、但能够独立验证的研究路径:

自适应计算与隐空间推理。 研究模型能否依据问题和 token 的难度分配计算,并在连续表示中完成部分迭代。主要指标包括任务收益、停止策略的校准程度、训练稳定性和实际硬件效率。

混合式可写记忆。 研究精确、可追溯的外部存储与可压缩、可泛化的神经记忆如何协作。主要问题包括写入策略、寻址方式、冲突处理、主动遗忘,以及记忆能否有效参与推理而不只是被重新拼接进提示词。

跨会话固化。 研究快速记忆中的经验能否通过经验重放、测试时训练或其他更新方式融入长期表示。除了知识获取率,还需要持续观察遗忘、迁移、错误传播和抽象结构形成。

学习治理与评估。 为记忆和参数更新建立来源追踪、权限隔离、效果评估、异常检测与回滚机制。对于部署系统而言,这不是附加功能,而是持续学习能够进入真实环境的前提。

这些方向最终可能汇合为一种新的模型形态:它能够根据任务难度调整计算,保留经过授权的经历,并在受控的离线阶段将经验整合为知识。与“固定深度—瞬态状态—冻结权重”的默认范式相比,这一图景仍有显著距离,但每个环节都可以转化为明确的实验问题。


结语

Scaling law 仍然是推动 AI 进步的重要规律。扩大参数、数据和算力不仅会提高已有能力,也可能产生难以预先推断的涌现行为。然而,有些边界来自明确的系统设定:如果会话结束后状态被清空,如果部署权重始终冻结,那么更大的模型也不会自动获得可授权、可追溯的跨会话学习能力。

因此,从当前模型走向能够随经验发展的智能体,关键差异不仅是单次任务表现,还在于跨时间的连续性。模型需要决定投入多少计算、保留哪些经验、如何更新长期知识,以及如何确保变化始终处于可验证和可控制的范围内。

大脑演化形成的学习与记忆机制,可能为这些问题提供假设与实验线索。它的价值不在于提供可以直接复制的设计,而在于提示我们:智能不仅体现为当下能够解决什么问题,也体现为一个系统如何被经验持续改变。


最后更新:2026-07-25

本文是个人研究思考的梳理,不涉及具体实验。


参考文献

  1. Kaplan, J., et al. (2020). Scaling Laws for Neural Language Models. arXiv:2001.08361.
  2. Vaswani, A., et al. (2017). Attention Is All You Need. Advances in Neural Information Processing Systems, 30. arXiv:1706.03762.
  3. Kahneman, D. (2011). Thinking, Fast and Slow. Farrar, Straus and Giroux.
  4. Wei, J., et al. (2022). Chain-of-Thought Prompting Elicits Reasoning in Large Language Models. Advances in Neural Information Processing Systems, 35. arXiv:2201.11903.
  5. Snell, C., Lee, J., Xu, K., & Kumar, A. (2024). Scaling LLM Test-Time Compute Optimally Can Be More Effective than Scaling Model Parameters. arXiv:2408.03314.
  6. Graves, A. (2016). Adaptive Computation Time for Recurrent Neural Networks. arXiv:1603.08983.
  7. Dehghani, M., et al. (2019). Universal Transformers. International Conference on Learning Representations. arXiv:1807.03819.
  8. Raposo, D., et al. (2024). Mixture-of-Depths: Dynamically Allocating Compute in Transformer-Based Language Models. arXiv:2404.02258.
  9. Hao, S., et al. (2024). Training Large Language Models to Reason in a Continuous Latent Space. arXiv:2412.06769.
  10. McClelland, J. L., McNaughton, B. L., & O’Reilly, R. C. (1995). Why There Are Complementary Learning Systems in the Hippocampus and Neocortex: Insights from the Successes and Failures of Connectionist Models of Learning and Memory. Psychological Review, 102(3), 419–457. PubMed.
  11. Kumaran, D., Hassabis, D., & McClelland, J. L. (2016). What Learning Systems Do Intelligent Agents Need? Complementary Learning Systems Theory Updated. Trends in Cognitive Sciences, 20(7), 512–534. PubMed.
  12. Behrouz, A., Zhong, P., & Mirrokni, V. (2025). Titans: Learning to Memorize at Test Time. arXiv:2501.00663.
  13. Tandon, A., et al. (2025). End-to-End Test-Time Training for Long Context. arXiv:2512.23675.
  14. Wang, Z., Gupta, A., Dong, Z., & MacLellan, C. J. (2026). Self-Consolidating Language Models: Continual Knowledge Incorporation from Context. arXiv:2605.07076.
  15. Kirkpatrick, J., et al. (2017). Overcoming Catastrophic Forgetting in Neural Networks. Proceedings of the National Academy of Sciences, 114(13), 3521–3526. arXiv:1612.00796.