首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于

不要再将法学硕士视为下一个代币的预测者

2026-09-05 1 阅读 约5分钟阅读 garrinm
分享:
字号:
不要再将 LLM 视为下一个令牌预测器 严格来说,“LLM 是下一个令牌预测器”这一说法并没有错,但它并不完整。这是一个很好的零阶近似,并且它基于真实的东西:基于变压器的语言模型自回归地发出标记: while not did : tokens 。 append ( model .sample_next_token ( tokens )) 这当然具有您可能称之为下一个标记预测器的形状。在预训练期间,模型会重复获取一些先前的标记,查看实际跟随它们的标记,并使该标记更有可能在接下来被采样。从概念上讲,训练循环看起来像这样: for tokens intraining_data : forposition in range (1, len(tokens)):prior_tokens = tokens[:position]actual_next_token=tokens[position]model。 make_more_likely (actual_next_token, after =prior_tokens,) make_more_likely 当然在这里做了大量的工作。底层是损失函数、梯度和参数更新,但在这篇文章中,我们只关心它们的综合效果:接下来实际出现的令牌变得更有可能。至关重要的是,每个actual_next_token都来自training_data中的现有序列。可以公平地说,基本模型也充当下一个令牌预测器:它经过训练以预测训练数据中出现的下一个令牌。但我们使用的法学硕士不仅仅是基础模型。它们是经过后训练的,现代后训练的一个关键部分是具有可验证奖励的强化学习(RLVR)。在预训练期间,模型仅从训练数据中已存在的序列中学习。在 RLVR 期间,模型通过生成新序列并从其结果中学习来进行探索。从概念上讲,RLVR 训练循环看起来像这样: for task in Training_tasks : forexplored_tokens in model 。探索(任务):奖励=评估_结果(任务,探索_令牌)对于范围内的位置(len(探索_令牌)):先前_令牌=任务+探索_令牌[:位置]探索_下一个_令牌=探索_令牌[位置]模型。 make_more_likely (explored_next_token, after =prior_tokens,according_to=reward,) make_more_likely 在两个循环中都在做相同类型的工作,但出于根本不同的原因。在预训练期间,它使actual_next_token更有可能出现,因为该标记出现在训练数据中。在 RLVR 期间,它使explored_next_token 更有可能出现,因为包含它的探索序列获得了高奖励。因此,虽然经过训练的 LLM 仍然具有下一个令牌预测器的形状,一次发出一个令牌,但它不再仅通过预测现有文本来学习。它还从自己探索产生的新序列中学习。国际象棋类比 国际象棋引擎使这种区别更容易看出。想象一下两个国际象棋系统。第一个是在大型大师游戏数据库上进行训练。它学习大师如何应对不同棋盘位置的模式。给定一个新的位置,它会预测大师接下来最有可能采取的动作。这是下一步行动的预测指标。第二个是一个理想化的国际象棋引擎,它探索了每一种可能的游戏。通过详尽的探索,它知道从每个可能的棋盘位置获胜的概率。给定一个位置,它会选择获胜概率最高的着法。与第一个系统不同,它不仅仅针对特级大师已经玩过的游戏进行训练。它还从自己探索生成的游戏中学习。将第二个系统称为“下一步行动预测器”会很奇怪。它并不是试图预测数据集中接下来会出现什么动作。它试图选择一个获胜的举动。结束语 我在这篇文章中没有涉及其他培训后技巧,但它们也很重要。例如,基于人类反馈的强化学习 (RLHF) 使模型从整体模仿其预训练数据转向模拟有用的助手。正如我们在这篇文章中看到的,RLVR 更进一步:它允许法学硕士探索和学习其训练数据中从未见过的想法。这就是为什么“下一个令牌预测器”是错误的心理模型。它描述了机制的形状,一个令牌接一个发出,而忽略了该机制编码的内容。对有用助手的模拟和通过探索发现的知识都可以在完全相同的下一个令牌循环中进行编码。
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱