开发者生态
morning
HydraFusion 项目:通过多模型编排实现前沿质量
2026-09-05
1 阅读
约6分钟阅读
qainsights
字号:
为开发人员提供适合手头任务的最佳模型一直是我们的目标。今年早些时候,我们推出了自动模型选择功能,让这一切变得更加容易,它会审查您的任务并将其与最适合该任务的模型进行匹配。今天,我们将推出 HydraFusion 项目,这是一项研究预览版,可通过运行时编排提供前沿智能。它创建一个完整的执行计划,从多个提供商的模型中进行选择来起草、批评和修改,或级联到更强大的模型来完成您的任务。 HydraFusion 在我们的整体战略中发挥着关键作用,以在本地、云和复合模型之间提供自动化语义路由。对于开发人员来说,这种复杂性仍然存在于幕后:您像选择任何其他模型一样选择 HydraFusion,它会选择一个平衡每个任务的性能、成本和延迟的工作流程。现在作为研究预览提供 HydraFusion 可供所有 GitHub Copilot 计划的用户通过 GitHub Copilot CLI 中的 /experimental 使用。使用量基于 HydraFusion 使用的模型消耗的代币,按每个模型的标准费率定价。要在 Copilot CLI 中尝试 HydraFusion: 运行 /update 以安装最新版本 在 Run /model 上运行 /experimental ,然后选择 HydraFusion(研究预览) 请在 GitHub 社区 中发布反馈。 HydraFusion 将工作流程选择视为优化问题。它使用推理、代码生成、调试和工具使用的能力信号来选择最有效的执行模式来满足质量标准。对于每个请求,HydraFusion 当前选择三种执行模式之一: 单次。一个选定的模型可以直接解决任务。级联。高效的模型起草解决方案,质量门决定是接受它还是升级到更强大的模型。批判。一个模型起草一个结果,来自不同模型系列的独立只读评论家对其进行审查(遵循与橡皮鸭相同的审查模式),并且起草模型修改一次。图 1. HydraFusion 架构 每种模式都解决不同的质量与成本权衡问题。当一个模型可以直接解决任务时,单一模型可以保持速度和效率。 Cascade 在第一次尝试时提供了一个有效的模型,同时在候选人未清除接受门时保留了更强的推理路径。 Critique 为任务添加了独立的视角,其中回顾比其他独立尝试更有用。在三个代理编码基准的离线评估中,HydraFusion 始终表现出前沿水平的质量,并且预计可节省大量成本。在 TerminalBench 2.1 上,与 Claude Opus 5 相比,它将经过验证的任务质量提高了 4.9 个百分点,估计成本降低了 67%。让我们深入了解方法、结果和基准。自适应多模型编排开发人员已经手动协调模型:为任务选择一个模型,要求另一个模型审查工作,或者将难题升级为功能更强大的模型。 HydraFusion 将这个熟悉的过程带入运行时。您选择 HydraFusion 一次,即可专注于您的任务,同时它在幕后管理模型和工作流程。关键是选择性。有些编码任务可以直接解决,而另一些则可以从审查、修订或升级中受益。 HydraFusion 评估每个请求并选择最简单的工作流程来满足其需求,仅在可能改善结果时才使用额外的模型调用。这种自适应方法可以平衡模型之间的质量、成本和延迟。随着模型前沿的发展,HydraFusion 也在不断发展。当 GitHub Copilot 中出现新模型时,我们可以评估它们并将其合并到模型池中,将它们的优势用于最适合它们的任务。构建 HydraFusion 将自适应多模型编排转变为一种可靠的编码体验需要仔细控制执行、审查、成本和存储库状态。 HydraFusion 围绕五个操作原则构建: 完整的核算。汇总每个工作流环节的成本和使用情况,包括起草、批评、修订、升级、重试和回退。有界执行。为每个分支提供明确的超时和取消行为,以将执行和成本保持在定义的限制内。孤立审查。在隔离的无工具上下文中运行审核步骤,而求解器步骤则使用共享工作区和正常的权限感知代理循环。这允许模型独立评估工作,而无需修改存储库。故障安全应用。当工作流程取消或验证失败时,不应用补丁,以防止不完整的更改到达存储库。验证路由。在执行开始之前验证工作流定义、模型绑定、回退行为和模型可用性。这些原则共同使得多模型编排对于存储库级别的工作来说非常实用。在内部,运行时记录每条腿的角色、结果、成本、延迟和诊断,以便我们
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱