SDOF:通过状态约束调度驯服多智能体编排中的对齐税
提出SDOF框架,将多智能体执行视为约束状态机,通过在线RLHF意图路由器和状态感知调度器强制业务过程阶段约束。在招聘系统测试中,7B模型在对抗性路由基准上准确率80.9%(GPT-4o 48.9%),端到端任务完成率86.5%,并阻止了所有注入和非法操作。
SDOF(State-Constrained Dispatch Orchestration Framework)是一种新颖的多智能体编排框架,由研究者提出,旨在解决当前编排框架在强制执行真实业务流程阶段约束方面的不足。现有的框架如LangChain、LangGraph和CrewAI虽然能够通过图流水线路由任务,但无法确保执行过程遵循业务过程的阶段顺序,导致可能出现对齐税问题。SDOF将多智能体执行视为一个受约束的有限状态机,通过两层防御机制确保执行的可控性和合规性。第一层防御是一个经由生成奖励模型(GRPO)训练的在线RLHF专门意图路由器,该路由器能够准确识别用户意图并路由到正确的智能体。第二层是状态感知调度器,包含GoalStage有限自动机检查和SkillRegistry的前置/后置条件验证,提供可审计的执行控制,确保每个操作都在正确的阶段执行。
在基于北森iTalent平台(服务6000多家企业)的招聘系统上,研究团队设计了185个专家策划的场景,触发了1671次实时API调用。经GSPO对齐的7B意图路由器在有限状态机约束的对抗性路由基准上实现了80.9%的联合准确率,远超零样本GPT-4o的48.9%,展示了其在复杂路由决策中的优越性。在端到端执行中,SDOF达到了86.5%的任务完成率(95%置信区间80.8-90.7),并成功阻止了所有22个注入和非法HR子集操作。在更广泛的消息级阻断审计中,SDOF实现了100%的精确率和88%的召回率,专家一致性kappa系数为0.94,表明其高度可靠。
此外,在涵盖8个服务领域的960个SGD派生对话的单独评估中,SDOF通过有限状态机映射发现了201个阶段顺序冲突,其中41个出现在正常分割中,凸显了阶段约束在真实世界应用中的重要性。该论文(arXiv:2605.15204)报告了当前已验证的范围,并指出后续将发布扩展的多种子训练比较和更深层的工作流评估。SDOF框架通过将业务过程阶段约束显式地纳入多智能体编排,有效降低了对齐税,为构建更安全、更可靠的自主代理系统提供了新的方向。