智能AI
morning
模型中的模型:派出专家何时会胜过参与、适应或调整?
摘要
arXiv:2608.21386v1 Announce Type: new Abstract: Given a task described by a few examples, how should a model be specialized to it? Four mechanisms are available -- zero-shot, in-context attention, tes...
the
and
context
specialist
task
few
are
shot
training
per
2026-08-25
1 阅读
约2分钟阅读
John C. Howell
字号:
arXiv:2608.21386v1 公告类型:新 摘要:给定几个示例描述的任务,模型应该如何专门用于它?有四种机制可用——零样本、上下文注意力、测试时梯度适应以及从超网络发出专业权重——但最后一种机制很少被映射。我们对跨越回归、生成、语言建模、强化学习以及临床和基因组分类的六个任务进行相同的四向比较,并保持专家、背景和(在我们可以的情况下)固定的培训预算。发射最明显的胜利在于匹配质量的成本:它将最先进的摊销表格模型(TabPFN)与临床小样本分类联系起来,同时发射可重复使用的专家,而不是重新参与每个查询的支持集,并通过每实例 132 美元浮动的程序实现噪声基底形状生成。在少样本正弦回归中,在零测试时间梯度步长下,它比 MAML 低 $2$--$3$ 个数量级——这个裕度缩小到 $\sim$$30\times$,但一旦训练预算均衡,这个裕度就会持续存在。发射无法与高维序列建模上的上下文注意力相匹配:在匹配预算预训练下,一次性适配器仅恢复上下文增益的一小部分($14.0\pm0.9\%$ at $5$M,$11.2\pm0.5\%$ at $15$M),LoRA 排名扫描显示这种不足是部分容量限制 - 捕获从 $5\%$ 爬升至 $21\%$,如下所示排名有所增长,但远低于完全恢复的水平。机制消融证实发射的专家确实是受任务制约的,而不是记忆的先验;并且,更具推测性的是,发出的专家在权重空间中进行组合 - 对其中的两个进行插值,以跟踪其函数的相应组合。我们以一个可证伪的论文作为结束,该论文通过每个任务的解决措施来实施,限制了每种调节机制何时应该被优先选择。
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱