首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

启发学习:让大模型认知从外化到内生

摘要

过去两年,大模型几乎重写了人机协作的默认想象:写代码、查资料、做分析,似乎都能 “一问即答”。但仔细看会发现,当下很多能力并不是模型自己长出来的,而是人为地在外面包了一层又一层框架。 人类先定流程、写 Skills、建知识库;参数继续变大,工具链继续变厚。Agent、Skills、Function Calling、RAG、Harness 轮番上场,把临时判断固化成可调用的工作流。这套做法有效,也撑...

DIN CoDA Prompt Isaac Retrieval Skills 启发学习 库仑受牛顿万有引力思维模式启发 提出库仑定律 类比检索
2026-08-27 1 阅读 约10分钟阅读 机器之心
分享:
字号:
过去两年,大模型几乎重写了人机协作的默认想象:写代码、查资料、做分析,似乎都能 “一问即答”。但仔细看会发现,当下很多能力并不是模型自己长出来的,而是人为地在外面包了一层又一层框架。 人类先定流程、写 Skills、建知识库;参数继续变大,工具链继续变厚。Agent、Skills、Function Calling、RAG、Harness 轮番上场,把临时判断固化成可调用的工作流。这套做法有效,也撑起了眼下的繁荣。 问题在于,能力上限往往卡在脚手架上。换场景就要重写流程,换工具就要重排提示和权限。系统看起来更能干,知识却越来越多地挂在流程外面。另一条路更接近人类怎么学:复盘成败,把结构相近的问题连起来,把一次有效推理留到下次还能用。 现在主流方案多停在接口与检索,很少把 “经验怎么复用” 写进推理本身。外挂和算力人人都能堆,更难的是,让模型在新问题上自己调用旧经验。我们把这条路线命名为 “启发学习(Inspirational Learning)”,并把它集成到推理侧,取名 Isaac(源自牛顿的名字,寓意 “站在巨人肩膀上”)。 人类智慧如何进化: 从旧经验里 “启发” 出新知识 近现代科学史里,重大突破很少从零开始。例如,库仑受牛顿万有引力思维模式启发,提出库仑定律;霍兰德把达尔文自然选择的逻辑迁移到计算机领域,遗传算法随之出现。最常见的路径,是把已知结构搬到新领域:类比、迁移、再重组。 图 1-a:库仑受牛顿万有引力思维模式启发,提出库仑定律。 图 1-b:霍兰德借达尔文自然选择逻辑,发展出遗传算法。 启发学习:认知的进化飞轮 图 2:启发学习的认知进化飞轮。类比检索、逻辑重组、内生注入与经验沉淀形成闭环。 图 2 给出了启发学习的四个步骤:类比检索(Analogical Retrieval)、逻辑重组(Re-composition)、内生注入(Endogenous Injection)和经验沉淀(Experience Loop)。面对新领域、新问题,检索聚焦的不是字面相似的文本,而是经验库里其它领域解答过的类似问题的思路;注入阶段把这些思路整理后合并进当前输入;沉淀阶段再把新题的思维链抽象成可复用条目,写回经验库。我们把该流程集成形成推理侧框架 Isaac:不改基座权重,也不重新训练,只在推理时注入跨领域经验。模型还是原来的模型,但解题时旁边多了一批 “结构相近的旧题” 来做指导、做参考。 技术底座: Prompt 注入与网络层注入 要把启发学习跑起来,先得说清经验从哪里输入模型。团队把它拆成两条路,Prompt 注入:基座参数不动,把检索到的跨域示范写进上下文,让模型在给定示范下推理。网络层注入:基座仍冻结,但在中间层隐状态上加一个可训练的轻量适配器,用残差方式改表征,减轻源域与目标域的分布差距。对应团队提出的工作分别是域不变神经元检索(DIN-Retrieval,下称 DIN)和思维链引导的域适配(CoDA),合在一起构成 Isaac 的方法底座。 图 3:DIN 框架(Prompt 注入)。识别域不变神经元,构造 DIN 向量并检索跨域示范,再写入上下文提示。图片来源:DIN-Retrieval 论文。 DIN 做的是 Prompt 注入,核心是示范怎么选。源域有标签、目标域无标签时,先对隐状态做 token 均值,再按源、目标联合分布算神经元级 z-score;两侧激活极性一致、且超过阈值的维度,称为域不变神经元(必要时只保留幅度最大的前 K 维)。只用这些维度构造向量,在子空间里用余弦相似度找源域示范,并用 MMR 去掉太像的重复样本。示范与目标查询拼成提示后送进冻结基座。这样一来,跨域检索不再只靠文本嵌入是否相近,而是看域更稳的子空间里结构是否对齐。 图 4:CoDA 框架(网络层注入)。轻量适配器以残差方式调制中间隐状态;均方误差蒸馏源域思维链教师态,MMD 对齐源域与目标域增强表征。图片来源:CoDA 论文。 CoDA 做的是网络层注入。只把示范塞进提示,有时不够:源域和目标域差得大,共享推理模式仍难复用。做法是把冻结大模型按层拆开,前面抽特征、后面生成,中间插适配器,残差调制隐状态(增强态 = 原隐状态 + 适配器输出)。源域用 “问题 + 思维链” 得到教师隐状态;源域与目标域的原输入经适配器后得到学生增强态。训练两项损失一起优化:均方误差让源域增强态靠近教师态,MMD 对齐源、目标增强态分布。推理时基座仍冻结,只对目标输入过适配器,也不需要目标域思维链标注。和纯检索式上下文学习相比,这一步把迁移做到了中间表征上。 图 3、图 4 分别对应两条路:DIN 负责找对齐的示范并写入提示;CoDA 在隐空间里对齐推理相关表征,服务无标签目标域。可以先检索再适配,也可以按能不能训中间模块、能不能读隐状态,二选一。Isaac 把它们放在推理侧:基座权重不变,靠 Prompt 注入和(或)网络层注入复用旧经验。下面先看评测设置,再看增益。 评测基准:编程、推理、科学问答与科研编码 实验用了四个公开热门基准,用以全方位评价启发学习的解题能力,特别是解难题的能力。HumanEval 测函数级代码生成:按函数签名与说明补全 Python,用单元测试判对错。StrategyQA 测隐式多跳推理:题是是非题,但不写出推理步骤,模型得自己补策略。ScienceQA 测科学问答:题来自中小学科学课,多为选择题,部分带图。SciCode 测科研编程:题从真实科研流程拆成子任务,要把领域知识写成能跑的代码。四个任务覆盖编程、策略推理、科学问答和科研代码,后面的对比都基于这套设置。 从数据里各摘一例,方便对照题型: HumanEval(HumanEval/127)-- 实现 intersection (interval1, interval2):判断两闭区间交集长度是否为素数,返回 “YES” / “NO”。例如 intersection ((-1, 1), (0, 4)) 应返回 “NO”。 StrategyQA -- Does citrus grow well in places with 24-hour days in the summer?(答案:no)。题面是是非题,但不给推理步骤,需要自己补出 “极昼地区的气候与光照是否适合柑橘” 这类隐含链条。 ScienceQA -- Which better describes the Daintree rain forest ecosystem? 配图选择题。选项有 “全年温暖、生物多样” 和 “冬季寒冷、土壤肥沃” 等;正确答案是前者,要结合图像与选项判断。 图 5:ScienceQA 示例题配图(Daintree rain forest)。题目要求判断哪一项更准确地描述该生态系统。 SciCode(problem CG) -- 实现共轭梯度法 cg (A, b, x, tol),求解对称正定线性系统 Ax = b。任务拆自真实数值计算流程,输出需通过数值测试。 实验效果:标准基准上的增益 我们对比了主流大模型的零样本接口与接入 Isaac 后的表现。HumanEval 上,Claude 达到 100.0%(公开榜首约 95.1%);Str
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱