跳到主要内容
AI News HubLIVE
站内改写2 分钟阅读

GitHub 推出 Project HydraFusion:在 Copilot CLI 中按编程任务动态编排多模型运行时工作流

文章摘要

Project HydraFusion 是 GitHub 发布的研究预览,它不再将模型选择视为一次性设置,而是针对每个请求构建并动态编排一个执行工作流,可在不同提供商的模型间进行起草、批判、升级等操作。目前仅在 GitHub Copilot CLI 中以研究预览形式提供,并按实际调用的各模型标准令牌费率计费。

来源MarkTechPost作者: Asif Razzaq
GitHub 推出 Project HydraFusion:在 Copilot CLI 中按编程任务动态编排多模型运行时工作流
报告错误

纠错通道尚未开通,可先复制下方文章信息留存。

查看更正说明
直接读正文

GitHub 近日发布了 Project HydraFusion,这是一项研究预览功能,标志着模型选择思路的转变:不再是设定一次模型就固定不变,而是为每一个编程请求动态构建并执行一个多模型协同的工作流。在 HydraFusion 的框架下,系统可能先用一个模型起草方案,再用另一个模型对其结果进行批判,或者当质量门拒绝初次尝试时,自动将任务升级到更强模型。这些模型可来自不同厂商,而开发者的操作方式与选择普通模型无异:只需选择一次 HydraFusion,后续由系统自行调度。

就部署范围而言,HydraFusion 目前有一定限制。它作为研究预览向所有 GitHub Copilot 套餐用户开放,但仅存在于 GitHub Copilot CLI 环境中。官方没有开放模型权重,也不支持本地或自托管部署。想使用该功能的用户需依次执行 /update、/experimental on、/model,并在模型列表中选择 HydraFusion (Research Preview)。计费方式按工作流实际调用各模型所消耗的 token 数计算,并使用每个模型各自的标准价格。

HydraFusion 是在 GitHub 于 2026 年初推出的 Auto model selection 基础上发展而来的。Auto model selection 负责将任务匹配到最合适的一个模型;HydraFusion 则更进一步,将工作流程的选择视为一个优化问题。系统会分析当前任务在推理、代码生成、调试和工具使用等方面所需的能力信号,然后选出预计能通过质量关卡的最简工作流程,只在预测有用的环节额外消耗模型调用,以此平衡质量与成本。

HydraFusion 目前为每个请求提供三种执行模式。Single 模式由一个既定模型直接处理任务,保留低延迟优势。Cascade 模式先用高效模型生成草案,质量门接受则结束,否则升级到更强模型。Critique 模式则先由模型起草,再由另一个不同模型家族的独立只读评审者进行评审,评审逻辑与 Rubber Duck 相同,最后交由起草模型做一次修订。三种模式各有侧重:Single 追求速度,Cascade 保留了向更强推理能力升级的通道,Critique 则引入外部视角,更适用于评审比再独立尝试一次更有价值的场景。

围绕仓库级代码任务,GitHub 为 HydraFusion 运行时设计了五条工程护栏:完整核算每个环节(涵盖起草、评审、修订、升级、重试和回退);每个环节设置明确的超时与取消界限;评审环节隔离运行,评审者处于无工具环境中,无法改动仓库;当工作流被取消或未通过验证时,不应用任何补丁(失效安全);在开始执行前验证模型绑定、回退行为与可用性(即路由校验)。在内部,系统会按环节记录角色、结果、成本、延迟和诊断信息;对开发者而言,最终只看到一个连贯的回应以及一套感知权限的变更集。

GitHub 团队在三个智能体编程基准上对固定策略的 HydraFusion 进行了评估,并以 Claude Opus 5 和 GPT-5.6 Sol 作为基线,所有模型均在中度推理水平下运行。相对 Opus 5,HydraFusion 在 TerminalBench 2.1 上预估成本低 67%、验证质量高 4.9 点;在 DeepSWE 上成本低 36%、质量低 1.5 点;在 CheckpointBench(GitHub 内部多轮评测集,基于真实 Copilot 会话并锚定不可变公开提交)上成本低 65%、质量低 0.1 点。总体而言,HydraFusion 能在明显降低开销的同时保持与顶级模型相当或更优的质量。目前该功能已在 Copilot CLI 中提供,用户可输入 /experimental 开启体验。

展开要点与分析

文章情报

工程师进阶

要点

  • HydraFusion 会为每个请求选择一个工作流程,而不仅是选择一个模型,并支持跨多个提供商的模型协作。
  • 提供三种执行模式:Single、带质量门的 Cascade、以及带跨模型家族只读评审的 Critique。
  • 在 TerminalBench 2.1 上比 Opus 5 成本低 67%、质量高 4.9 点;在 DeepSWE 与 CheckpointBench 上成本分别降 36% 和 65%,质量略降。
  • 现通过 Copilot CLI 中的 /experimental 以研究预览形式使用,按各底层模型标准费率计费。

要点与分析由自动化流程生成,可能有误,请结合原始来源核实。