智能AI
morning
将 GLM-5.3-Flash 转变为类似 Jev 的决策模型
摘要
TL;DR: In this post, we show how an off-the-shelf LLM can make typed decisions in a single forward pass. This approach makes it possible to turn an LLM into a Jev-like decision model. We evaluate the ...
the
and
LLM
decision
this
Jev
like
model
that
with
2026-09-27
1 阅读
约6分钟阅读
flxflx
字号:
TL;DR:在这篇文章中,我们展示了现成的法学硕士如何在一次前向传递中做出打字决策。这种方法使得将 LLM 转变为类似 Jev 的决策模型成为可能。我们使用在 Privatemode 上运行的 GLM-5.3-Flash 来评估该方法。使用根据公共数据集构建的基准,我们表明此设置在决策准确性/正确性和速度方面提供的结果与 TypeSafe 的 Jev 相当。作为奖励,GLM-5.3-Flash 的设置可以对图像进行类型化决策,而这对于 Jev 来说是不可能的。它是如何工作的 Playground Benchmark 为什么需要输入决策 软件对法学硕士的要求大部分都是决策。 “这张票应该由哪个队处理?”,或者“这个合同条款属于责任部分吗?”。在这种情况下,软件通常要求 LLM 的响应遵循某种格式(例如 JSON),并且来自预定义的集合(例如“是”和“否”)。如果有正确的指示,法学硕士通常已经可以可靠地实现这一目标。然而,在基本方法中,速度和成本成为一个问题:对于每个决策,LLM 需要编写一个完整的 JSON 对象,而在此之前推理模型可能会考虑数百个标记。此外,您也不会了解模型的置信度(除非您明确询问)。所有这些方面在实践中都非常重要,并且迄今为止阻碍了人们利用法学硕士在大批量/高通量场景中进行决策。像 Jev 和 Laya 这样的专门决策模型(或“系统一”模型)就是为了解决这个问题而设计的。您传递一个状态和一组命名选项,然后返回所选选项以及每个选项的置信值(即概率)。将 LLM 转变为决策模型 最初,我们问自己是否可以将 LLM 转变为具有类似 Jev 属性的决策模型。简短的回答是:“是”。下面,我们将展示它是如何工作的。要理解我们的方法,了解法学硕士的工作原理很重要:法学硕士从不直接编写文本。根据提示,法学硕士会输出其整个词汇表的概率分布。在文本生成中,在最简单的情况下,选择概率最高的标记作为下一个标记。然后,所选标记将附加到提示中,并重复整个过程。如上所述,如果您只想在 JSON 对象中设置一些字段,则成本高昂且速度缓慢。我们的核心见解是,没有必要让 LLM 预测整个 JSON 对象,因为我们已经知道它的形状。我们只对法学硕士对给定输入的类型化判断感兴趣。我们意识到可以精心制作提示,以便我们在法学硕士的单次运行中获得键入的判断——无需微调,模型与发布时完全相同。这就是 Jev 和 Laya 的区别,它们是为此目的训练的模型。基本步骤如下: 给选项编号。状态、问题和输出选项以 JSON 形式进入提示,每个选项都有一个索引。该指令要求模型回答 choice_index: 后跟一个索引。预填答案。提示以 choice_index: 结尾。因此,模型生成的第一个标记将是预定义选项的索引。评估输出。我们不是读取模型发出的令牌,而是读取它分配给该单个位置的所有选项索引的概率。对选项进行归一化后,这些选项给出了每个答案的概率,我们只需选择最可能的一个。结束应答用户内的提示 {"state": "我的订单被收取了两次费用。", "question": "哪个团队?", "options": [ {"index": 0 , "name": " payment"} {"index": 1 , "name": "complaints"} {"index": 2 , "name": "technical"} ]} Assistant choice_index: 读取一行 logits 0 1 2 …整个词汇 max_tokens: 1 温度: 0 allowed_token_ids 保留选项,重新规范化 0 付款 62.1% 1 投诉 37.7% 2 技术 0.2% 答案付款信心 0.39 ,其中 1 表示确定,0 表示选项同样可能 提示对选项进行编号,并以助理的答案作为 choice_index: 开始,因此下一个标记是索引。词汇表上的掩码仅允许选项索引,API 返回它们的对数概率,并根据选项对它们进行标准化,给出每个答案的概率。中间面板中的 logit 值是说明性的。我们为在 vLLM(私有模式)上运行的 GLM-5.3-Flash 实施了上述步骤。我们将 /chat/completions 端点与 continue_final_message 和 add_ Generation_prompt: false 一起使用,因为这些可以让模型继续从步骤 2 开始的预填充助手轮次,而不是开始新的轮次。它们还让我们在文本旁边传递图像,这使得根据图像进行键入决策成为可能。对于 vLLM 和 GLM-5.3-Flash,我们发现以下细节很重要: vLLM 的 allowed_token_ids 可用于将 LLM 的输出词汇表限制为仅允许的选项。它会丢弃所有其他代币 t
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱