首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

早于LeCun相似研究一年!千诀科技联合清华团队让神经网络「简单性」可测可优化

摘要

机器之心发布 千诀科技联合清华大学团队,为神经网络提出了一把新的 “复杂度标尺”。 随着模型训练数据量的增大,我们有越来越多的 benchmark 可以用于评价一个模型答得准不准,却很难判断它究竟学到了可迁移的规律,还是用复杂方式 “记住” 了训练数据。团队提出的 “有效阶”(Effective Degree,ED),首次将这项研究路线中抽象的 “简单性偏置”,转化为一个能在真实规模模型上计算、比...

LeCun LeJEPA 简单性偏置 有效阶 Effective Degree Yann When Learn World
2026-08-06 1 阅读 约10分钟阅读 机器之心
分享:
字号:
机器之心发布 千诀科技联合清华大学团队,为神经网络提出了一把新的 “复杂度标尺”。 随着模型训练数据量的增大,我们有越来越多的 benchmark 可以用于评价一个模型答得准不准,却很难判断它究竟学到了可迁移的规律,还是用复杂方式 “记住” 了训练数据。团队提出的 “有效阶”(Effective Degree,ED),首次将这项研究路线中抽象的 “简单性偏置”,转化为一个能在真实规模模型上计算、比较并直接参与训练的指标。 这项研究不仅为理解神经网络为什么能够泛化提供了新工具,未来还有望用于筛选预训练模型、诊断微调过拟合,并改善视觉、语言、强化学习及世界模型面对新数据和新环境时的表现。 值得关注的是,这条研究路线与图灵奖得主 Yann LeCun 团队近期受到关注的世界模型理论形成了呼应,而千诀科技与清华团队对相似方法论视角的公开研究,比 LeCun 团队早约一年。 今年 5 月, Yann LeCun 与 David Klindt、Randall Balestriero 的论文《When Does LeJEPA Learn a World Model?》一经发布便获得广泛关注。论文从隐变量可辨识性的角度研究 LeJEPA 驱动的世界模型,并用 Hermite 多项式将高斯世界中的函数按非线性次数分解:非线性阶数越高,在 LeJEPA 的 alignment 目标下受到的惩罚越强,因此线性恢复真实隐变量成为最优解。 值得注意的是,早在一年前, 清华大学自动化系陈峰教授和千诀科技的联合团队(第一作者章天任)就在 ICML 2025 论文《When Do Neural Networks Learn World Models?》中采用了相近的方法论视角:将 “学习世界模型” 形式化为对数据生成隐变量的恢复(辨识)问题,并通过正交函数基将复杂函数分解为不同阶次,研究神经网络在解空间的低阶偏置如何促使真实隐变量变得可辨识。 两项研究使用的数学工具并不完全相同:千诀 - 清华团队研究多任务学习设定下具有低阶偏好的神经网络模型,使用 Fourier-Walsh 变换分析离散布尔世界;LeCun 等人研究 LeJEPA 及带平稳动力学的高斯世界,使用 Hermite 多项式进行谱分解。但二者尝试回答的关键问题和技术路径又是相似的: 从隐变量可辨识性出发,用函数的阶次刻画 “简单性”,再借助训练目标对低阶解的偏好,解释模型何时能够恢复世界的真实结构。 如今,千诀 - 清华团队又把这条理论线索向现实模型推进了一步。 在 ICML 2026《Quantifying and Optimizing Simplicity via Polynomial Representations》工作中,研究团队不再只问 “低阶偏好为何能帮助模型学到世界结构”,而是进一步追问: 这种偏好能不能在真实的 ResNet、ViT、语言模型和强化学习策略网络上被直接测量,甚至被主动优化? 他们给出的答案是 “有效阶”(Effective Degree,ED):沿真实数据点之间的插值路径观察高维神经网络,用正交多项式拟合模型输出,再根据不同阶次成分的权重计算函数复杂度。由此,“简单性偏置” 从团队上一项工作中的理论假设,变成了一个兼具通用性、可计算性和可微性的实用工具。 要理解 ED 解决了什么问题,还要回到深度学习中的一个经典谜题:为什么参数量远多于训练样本的神经网络,依然能在未见数据上表现良好? 一个广为接受的解释是 “简单性偏置”(simplicity bias):面对许多都能拟合训练数据的函数,神经网络及其训练过程并非随机选择,而是更倾向于学到相对简单的那个。类似奥卡姆剃刀,越简单的规律,往往越有可能超越有限样本,迁移到新的数据分布。 但一个基础问题始终没有令人满意的答案:对于现代深度神经网络,我们究竟该如何定义并测量 “简单”? 参数范数、损失面的 sharpness、Jacobian 范数、线性区域数量、压缩长度…… 已有研究提出了不少候选指标,但往往难以同时做到三点: 通用性(generality):不依赖某一种特定网络架构或任务; 可量化(quantifiable):能在真实规模的已训练模型上稳定计算; 可优化(optimizable):不仅能事后评价模型,还能通过梯度直接参与训练。 千诀 - 清华团队尝试给出一个同时满足上述要求的答案。 他们提出了一种多项式表征(polynomial representations)方法: 用数据点之间的插值路径 “切开” 高维神经网络,并以正交多项式近似网络沿路径的行为; 用多项式表征的有效阶(effective degree,ED)衡量神经函数的简单性; 将 ED 进一步变成可微的正则项,实现对神经函数复杂度的在线优化。 实验中,ED 不只是一个事后分析指标:在多个 benchmark 上,ED 都可以相当精确地预测出模型的实际 generalization gap;在对神经网络 grokking 现象的分析中,ED 也呈现出比参数范数、sharpness 等指标更稳定的信号。更进一步,由于整个度量过程可微,研究团队还将 ED 写入训练目标,在图像、文本、视觉 - 语言模型和强化学习任务中直接优化模型的函数复杂度,并由此带来泛化性能的提升。 论文标题:Quantifying and Optimizing Simplicity via Polynomial Representations 论文作者:章天任、李向欣、肖明昊、陈冠宇、陈峰 论文地址:https://arxiv.org/abs/2605.29823 代码地址:https://github.com/xinzaixinzai/Effective-Degree “简单” 为什么难以测量? 衡量神经网络复杂度的一种常见思路是观察参数空间。例如,参数范数越小,或者局部损失面越平坦(也即 sharpness 越小),模型也许就越简单。 但参数并不等于函数。同一个函数可以由尺度和参数化方式截然不同的权重实现;即便网络输出完全不变,一次重参数化也可能显著改变参数范数或 sharpness。换言之,这些指标有时反映的是模型 “如何被写出来”,而不一定是模型实现的函数本身有多复杂。 另一种更直接的思路,是在函数空间里定义复杂度。线性函数通常比二次函数简单,二次函数又比高阶振荡函数简单,因此按多项式次数衡量非线性程度十分自然。 然而,现代神经网络往往是从高维输入到高维输出的黑盒函数。如果直接在原始空间拟合多元多项式,基函数数量会随维度和阶数发生组合爆炸,在真实模型上几乎不可计算。 研究团队由此采用了一个降维视角:不试图一次看清整个高维函数,而是沿数据分布附近的许多一维路径观察它。 沿数据路径,给高维神经网络做 “函数切片” 给定从数据分布中采样的两个样本 x₁、x₂,团队在二者之间构造插值路径:x (α) = αx₁ + (1-α) x₂,α ∈ [0,1] 对于神经网络 f,模型沿这条路径的输出就变成了一个关于单变量 α 的函数。一个原本高维且复杂的神经函数,由此转化为许多条一维的 “函数切片”。 接下来,团队使用 Chebyshev 正交多项式
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱