智能AI
morning
Karpathy说还要十年,可这条路已经挤满了人
摘要
编辑|Panda 最近我们报道了不少剑指「持续学习」方向的创业公司和研究成果,比如《 Mind Lab 连续发布 LoRA 最新进展,大模型「持续学习」新范式浮现 》、《 告别 KV Cache 枷锁,将长上下文压入权重,持续学习大模型有希望了? 》、《 ICML 2026 | 突破极限!港大提出首个适配 300+任务的持续学习架构,破解遗忘难题 》、《 能让 DeepSeek 自进化的 Harn...
LLM
持续学习
Karpathy
Agent
2025
Learning
RAG
Letta
Wiki
Panda
2026-08-09
1 阅读
约10分钟阅读
机器之心
字号:
编辑|Panda 最近我们报道了不少剑指「持续学习」方向的创业公司和研究成果,比如《 Mind Lab 连续发布 LoRA 最新进展,大模型「持续学习」新范式浮现 》、《 告别 KV Cache 枷锁,将长上下文压入权重,持续学习大模型有希望了? 》、《 ICML 2026 | 突破极限!港大提出首个适配 300+任务的持续学习架构,破解遗忘难题 》、《 能让 DeepSeek 自进化的 Harness!LlamaFactory 作者开源新工具:0.2 元自动造 Agent 》、《 当「变大」不再是唯一的路,又一国产模型开源了 》…… 是的,相当密集,「 持 续 学习 」也正在成为我们最常遭遇的关键词之一。而这背后也昭示着一个被反复念叨的判断。 2025 年 10 月,Andrej Karpathy 在 Dwarkesh Patel 的播客里说:当下的大模型「没有持续学习。你没法告诉它一件事,然后指望它记住」,他认为把这些认知缺陷补齐, 大概还要花上十年 。两个月后,他在年度回顾里把这句话放进了更大的图景:2025 年模型能力的跃迁主要来自可验证奖励强化学习(RLVR),但整个 LLM 技术栈里,记忆、多模态感知、持续学习、操作电脑的能力仍是明显的短板,「我们有原型,但还没有能当同事用的智能体」。 持续学习 (Continual Learning,也叫 终身学习 /Lifelong Learning)由此成了过去一年里最热的概念之一。 它指的是模型在部署之后,还能像人一样从新任务、新知识、新经验里持续吸收,并且不把之前学会的东西忘掉。 这件事听上去理所当然,做起来却极难,难到足以成为通往「AI 同事」路上最硬的一块骨头。而上面那一串报道也说明,这条路已经不是一个方向,而是好几条岔开的路线在同时往前拱。 围绕怎么让模型「边用边学」,学术界和产业界这一年里岔出了好几条互不相同的技术路线。有的往模型外面挂记忆,有的持续改写权重,有的干脆重新预训练,还有一批更新的思路试图重新定义「学习」这件事本身。这篇文章尝试把这些方向逐一摊开,说清楚每条路在赌什么、卡在哪里。 先说清楚:难的不是「学」,是「不忘」 持续学习的核心障碍有一个专门的名字: 灾难性遗忘(catastrophic forgetting) 。神经网络的知识存储在数十亿个权重里,当你用新数据去微调模型、更新这些权重时,模型学会新任务的同时,往往会覆盖掉承载旧能力的那部分参数,导致在之前擅长的任务上性能骤降。 灾难性遗忘示意图。当人工深度神经网络顺序地在两个任务上进行训练时,它会在训练第二个任务时迅速且彻底地遗忘第一个任务。 这个现象在小模型时代就有大量研究,但到了 LLM 身上出现了新的麻烦。TRACE 这个专门评测 LLM 持续学习的基准发现,对一个已经对齐好的模型做连续微调,不仅会让它忘掉旧任务,还会连带损害通用能力和指令跟随能力。换句话说,你想教模型一件新事,代价可能是它整体变笨、变得不听话。 正因为直接改权重风险这么大,「持续学习」才分裂成了好几个流派。它们的根本分歧,其实就是在「改不改权重」以及「在哪里存新知识」这两个问题上做了不同的取舍。 把记忆挂在模型外面 最直接、也最快落地的思路是:干脆不动模型权重,把新知识存到模型外部的一个数据库里,需要时再检索回上下文。这条路线从 RAG(检索增强生成)一路演化而来,如今已经长成了一个专门的领域: 智能体记忆(Agent Memory) 。 代表性工作是 MemGPT(其背后公司现已更名 Letta)。它把 LLM 的上下文管理类比成操作系统的内存管理,区分出有限的「工作上下文」和更大的「外部存储」,让模型像操作系统调度内存那样,自己决定什么该调进上下文、什么该写回归档。 沿着这个思路,一批系统各有侧重:Mem0 主打生产级、可规模化的长期记忆存取;Zep 在检索之上加了时序知识图谱,用来处理跨会话的时间推理;A-MEM 借鉴卡片盒笔记法(Zettelkasten),给每条记忆打上结构化标签并自动关联到相关旧条目,让检索更贴合上下文。 Karpathy 本人也押注这个方向。他反复强调,未来需要的不是「更大的硬盘」式记忆,而是一个精简的「 认知内核 」(cognitive core,他估计一两 B 参数就够)外加一套会自己复利增长的结构化外部记忆。 基于这一思路,他在 GitHub 上发布了一个叫「 LLM Wiki 」的模式:不再每次查询都用 RAG 去捞原始文本块,而是让智能体主动把资料编纂成一个持续更新、互相链接的知识库,之后再去查询它。 Karpathy 的 LLM Wiki 文档已经收获了近 4.5 万 star,也已被 fork 9 千多次 Letta 自己则把这套东西上升成了「 token 空间里的持续学习 」这一命题。他们指出,今天默认的做法是「先追加、再摘要」,即把原始经验一直堆到上下文溢出,再压缩成摘要,这有两个毛病:追加把所有表征工作都推到了推理时,每次前向传播都要重新处理原始日志;而摘要是有损且突兀的,重要细节会毫无预警地消失。Letta 的赌注是,未来在 token 空间里学到的记忆,会比模型权重本身更有价值。 这个方向的长处是安全、可控、可解释,改错了随时能删;短处是它本质上没有真正把知识「内化」进模型,每次都要靠检索和上下文这道窄门,一旦记忆库膨胀,检索精度和成本都会成为瓶颈。 让上下文自己进化成「攻略手册」 从外挂记忆再往前走一步,是一类更精巧的思路:不改权重,但让模型输入的上下文本身持续进化。这被称作 上下文工程(Context Engineering) 。 2025 年 10 月,斯坦福、SambaNova 和 UC 伯克利提出的 ACE(Agentic Context Engineering)是其中的代表。它把上下文当作一本会不断成长的「攻略手册」(playbook),通过三个分工角色来维护:Generator 负责生成推理轨迹,Reflector 从成功和失败里提炼具体经验,Curator 把这些经验整理成结构化的增量更新,合并进手册。 ACE 想解决的是同类方法的两个通病。一是「简洁偏好」(brevity bias):让 LLM 反复重写上下文时,它倾向于压缩、丢掉领域细节;二是「上下文坍缩」(context collapse):反复重写会让细节逐渐流失。 ACE 用增量式的小改动(delta updates)而非整段重写来规避这两点。据论文数据,ACE 在智能体任务上相比基线提升 10.6%、金融推理上提升 8.6%,同时把适配延迟降了约 86.9%;在 AppWorld 榜单上,用较小的开源模型 DeepSeek-V3.1 配上 ACE,平均分能追平基于 GPT-4.1 的生产级智能体 IBM CUGA。 值得注意的是,ACE 强调它能在没有标注监督的情况下工作;它靠的是执行过程中天然产生的反馈信号(比如代码跑通还是报错)来指导反思和整理。这让它和「智能体从自己的经验里学」这条更大的叙事接上了头。 持续后训练:改权重,但要改得聪明 外挂记忆和上下文工程回避了改权重的风险,但也回避了真正的知识内化。另一派研究者认为,长期来看,有些知识和技能终究
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱