开发者生态
morning
介绍吐司1
2026-08-15
1 阅读
约7分钟阅读
mplappert
字号:
Toast 1 是我们的第一个专业搜索代理,现已推出。它提供前沿搜索质量,匹配或优于 Claude Opus 5 和 GPT-5.6 Sol,同时价格便宜 10 倍,速度快 12 倍。它在混合面包搜索中表现最佳,但它可以与任何搜索后端一起使用。如今,前沿模型现在能够执行真正的知识工作。他们可以在复杂的文档集合中推理、分析和查找信息。但它们也是该系列中最昂贵的型号。随着情报的计量日益增多,对能够以极低的成本匹配其能力的专业代理的需求比以往任何时候都更大。 Toast 1 可以作为独立的专用检索代理运行,也可以作为您的前沿模型已经知道如何依赖的众多子代理之一运行。它完全接管搜索循环:给定一个初始查询,它将其分解为子查询,收集证据,检查源,并在返回之前整理相关上下文。这让您的代理可以将其上下文和计算用于需要通才、前沿级模型的任务:推理、行动并生成最终答案。 Toast 1 代理搜索的瀑布跟踪:3 轮中的 16 个工具调用在短短 5 秒多一点的时间内回答了就业率比较查询。展开跟踪,然后选择一个步骤以查看子查询、grep 模式或计划在该点生成的代理。 “与医疗保健行业相比,零售业的就业率变化如何?” 16 次工具调用 · 3 轮 · 5.33 秒 · 查看跟踪 这种代理劳动的专业化导致搜索成本大大降低,而且在许多实际任务上也带来更好的端到端结果。我们发现 Toast 1 在代理工作负载、每个任务的成本和每个任务的速度上建立了一个新的帕累托前沿。 OfficeQA Pro V2 由 Databricks 发布,可评估现实、复杂的企业财务状况中 90 个问题的答案正确性。 GPT-5.6 Sol with Toast 1 作为 Codex 内的子代理提供,每项任务的价格约为 1.15 美元,答案正确率达到 70%:这是 OfficeQA v2 版本中 Databricks 评估的系统中的最高分,在质量和效率方面建立了新的最先进性能。 OfficeQA Pro V2 上答案正确性与每次部署成本的散点图,对数刻度成本。以 Toast 1 作为子代理在 Codex 中运行的 GPT-5.6 Sol 达到 70% 的正确率,每项任务的成本约为 1.20 美元,高于 Databricks 评估中之前的帕累托前沿,其中 Databricks Genie 上的 Claude Fable 5 的正确率达到 60%,成本约为 4 美元。 OfficeQA Pro V2 上的成本质量 Pareto 20% 30% 40% 50% 60% 70% $0.1 $0.2 $0.5 $1 $2 $5 $10 $20 $50 答案正确性 每次部署成本(对数刻度) GPT-5.6 Luna GPT-5.6 Terra Claude Fable 5 GPT-5.6 Sol Kimi K3 GLM 5.2 Sonnet 5 GPT-5.6 Luna (Codex) GPT-5.6 Terra (Codex) GPT-5.6 Sol (Codex) Sonnet 5 (Claude Code) Claude Fable 5 (Claude Code) GPT-5.6 Sol Low (Codex + Toast 1) GPT-5.6 Sol High (Codex + Toast 1) Databricks Genie 模型提供商工具 Pareto 前沿 (Databricks) Codex + Toast 1 OfficeQA Pro V2 上的答案正确性与每次部署成本。 Databricks 报告的精灵和安全带数量; Codex + Toast 1 轮是我们的。阴影区域位于先前的帕累托边界下方。相比之下,之前表现最好的 Databricks Genie 上的 Claude Fable 5 的正确率达到 60%,每项任务花费约 4 美元,而 Codex 中没有 Toast 1 的 GPT-5.6 Sol 只能达到 33% 的正确率。这一改进源于重新阐述证据收集的经济学。 Toast 1 的专业化使其能够生成高质量、代币高效的证据包,为推理过程留下充足的资源以得出最终答案。 Harvey LAB 的律师事务所知识基准旨在评估代理人在大规模、现实的范围内搜索和使用机构法律知识的能力。法律工作本质上是与背景密切相关的。你无法与拥有更好、更相关的先例和细节的人争论。但它也很嘈杂:许多情况相似,但因简单的细节而有所不同,这使得在不出现大量误报的情况下收集高质量的证据包变得很困难。在随机选择的 33 个任务子集上,1 我们发现 GPT-5.6 Sol 的答案质量在各种搜索方法中保持不变。 Harvey LAB 公司知识基准使用的代币总数的条形图。普通代理在每个任务 21.7 轮中使用 8060 万个代币。添加 Mixedbread Search 后,每个任务需要 14.6 轮,减少了 42% 至 4700 万个令牌。添加 Toast 1 作为子代理后,每任务轮次为 11.2 次,又减少了 51% 至 2300 万个令牌。所有三种配置都达到相同的任务分数 55,因此最终结果是相同的性能,但令牌数量减少了 3.5 倍。相同性能下,令牌数量减少 3.5 倍。 Harvey LAB 公司知识基准(33 项任务)——除了检索堆栈令牌/基准之外,所有设置均相同 80.6M 分数 55 Vanilla 代理 21.7 回合
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱