HydraFusion 项目:通过多模型编排实现前沿质量
在受控离线评估中,HydraFusion 的选择性编码工作流程匹配或超过了评估的 Opus 5 基线,同时降低了估计的工作流程成本。现在可在 GitHub Copilot 中作为研究预览。项目 HydraFusion:通过多模型编排实现前沿质量首先出现在 GitHub 博客上。

来自 GitHub AI 的官方动态,版本与适用范围以发布方说明为准。
GitHub AI · 查看官方发布中文机器翻译 · 原文附后
正文 · 来源原文
GitHub 是世界上最好的开发者体验,也是唯一一个将安全性融入到每一步的人工智能驱动平台,因此您可以充满信心地进行创新。
为开发人员提供适合手头任务的最佳模型一直是我们的目标。今年早些时候,我们推出了自动模型选择功能,让这一切变得更加容易,它会审查您的任务并将其与最适合该任务的模型进行匹配。
今天,我们将推出 HydraFusion 项目,这是一项研究预览版,可通过运行时编排提供前沿智能。它创建一个完整的执行计划,从多个提供商的模型中进行选择来起草、批评和修改,或级联到更强大的模型来完成您的任务。
HydraFusion 在我们的整体战略中发挥着关键作用,以在本地、云和复合模型之间提供自动化语义路由。对于开发人员来说,这种复杂性仍然存在于幕后:您像选择任何其他模型一样选择 HydraFusion,它会选择一个平衡每个任务的性能、成本和延迟的工作流程。
HydraFusion 将工作流程选择视为优化问题。它使用推理、代码生成、调试和工具使用的能力信号来选择最有效的执行模式来满足质量标准。
对于每个请求,HydraFusion 当前选择三种执行模式之一:
单身的。一个选定的模型可以直接解决任务。级联。高效的模型起草解决方案,质量门决定是接受它还是升级到更强大的模型。批判。一个模型起草一个结果,来自不同模型系列的独立只读评论家对其进行审查(遵循与橡皮鸭相同的审查模式),并且起草模型修改一次。
每种模式都解决不同的质量与成本权衡问题。当一个模型可以直接解决任务时,单一模型可以保持速度和效率。 Cascade 在第一次尝试时提供了一个有效的模型,同时在候选人未清除接受门时保留了更强的推理路径。 Critique 为任务添加了独立的视角,其中回顾比其他独立尝试更有用。
在三个代理编码基准的离线评估中,HydraFusion 始终表现出前沿水平的质量,并且预计可节省大量成本。在 TerminalBench 2.1 上,与 Claude Opus 5 相比,它将验证任务质量提高了 4.9 个百分点,估计成本降低了 67%。
让我们深入探讨方法、结果和基准。
自适应多模型编排
开发人员已经手动协调模型:为一项任务选择一个模型,要求另一个模型审查工作,或者将一个难题升级为功能更强大的模型。 HydraFusion 将这个熟悉的过程带入运行时。您选择 HydraFusion 一次,即可专注于您的任务,同时它在幕后管理模型和工作流程。
关键是选择性。有些编码任务可以直接解决,而另一些则可以从审查、修订或升级中受益。 HydraFusion 评估每个请求并选择最简单的工作流程来满足其需求,仅在可能改善结果时才使用额外的模型调用。这种自适应方法可以平衡模型之间的质量、成本和延迟。
随着模型前沿的发展,HydraFusion 也在不断发展。当 GitHub Copilot 中出现新模型时,我们可以评估它们并将其合并到模型池中,将它们的优势用于最适合它们的任务。
构建 HydraFusion
查看英文原文
Project HydraFusion: Frontier quality via multi-model orchestration
In controlled offline evaluations, HydraFusion’s selective coding workflows matched or exceeded the evaluated Opus 5 baseline while reducing estimated workflow cost. Now available as a research preview in GitHub Copilot. The post Project HydraFusion: Frontier quality via multi-model orchestration appeared first on The GitHub Blog .
正文 · 来源原文
GitHub is the world's best developer experience and the only AI-powered platform with security incorporated into every step, so you can innovate with confidence.
Providing developers the best model for the task at hand has always been our goal. Earlier this year, we made that easier by launching Auto model selection, which reviews your task and matches it to the best-suited model for that task.
Today, we’re introducing Project HydraFusion, a research preview that delivers frontier intelligence through runtime orchestration. It creates a full execution plan, choosing from models across multiple providers to draft, critique and revise, or cascade to more powerful models to complete your task.
HydraFusion fills a key role in our overall strategy to deliver automated semantic routing between local, cloud, and compound models. For developers, that complexity stays behind the scenes: you select HydraFusion like any other model, and it chooses a workflow that balances performance, cost, and latency for each task.
HydraFusion treats workflow selection as an optimization problem. It uses capability signals for reasoning, code generation, debugging, and tool use to select the most efficient execution pattern to meet the quality bar.
