GenEvolve:通过工具编排的视觉经验蒸馏实现自我进化的图像生成智能体
GenEvolve是一种自我进化的图像生成框架,通过工具编排的视觉经验蒸馏,将生成尝试建模为工具编排轨迹,并比较多次轨迹以提取结构化视觉经验,提供密集的令牌级监督,帮助智能体更好地进行搜索、知识激活、参考选择和提示构建。实验表明,该方法在公共基准和GenEvolve-Bench上达到了最先进性能。
近年来,开放式图像生成领域取得了显著进展,但高质量生成仍然是一项复杂挑战。传统的简单提示到图像的映射往往无法满足多样化和高要求的用户需求。为了解决这一问题,研究人员开始探索将智能体与外部工具结合的方法,然而现有方法大多依赖图像级别的标量奖励,难以提供细粒度的指导。
在此背景下,由Sixiang Chen领导的研究团队提出了GenEvolve,一种基于工具编排视觉经验蒸馏的自我进化框架。该框架的核心思想是将每次生成尝试建模为一个工具编排的轨迹。在轨迹中,智能体首先收集相关证据,然后选择合适的参考图像,调用生成模型的各种技能,最后将这些元素组合成一个提示-参考程序。这一过程类似于人类在创作时不断尝试和调整的策略。
GenEvolve的创新之处在于其训练方式。与现有方法不同,GenEvolve不为每次生成分配单一的标量奖励,而是针对同一请求生成多个轨迹,并系统性地比较这些轨迹。通过提取最佳轨迹与最差轨迹之间的差异,GenEvolve构建出结构化的视觉经验。这些经验仅提供给一个特权教师分支,教师分支学习如何区分优质与劣质轨迹。
受到在线策略自蒸馏技术的启发,GenEvolve的视觉经验蒸馏过程能够提供密集的令牌级别的监督信号。这意味着智能体不仅知道最终生成的图像好坏,还能学习到在搜索证据、激活知识、选择参考和构建提示等各个环节中应该如何做出更优决策。这种细粒度的自我进化机制使得智能体能够不断迭代优化自己的行为。
为了验证方法的有效性,团队还创建了GenEvolve-Data数据集和GenEvolve-Bench基准测试。实验结果显示,在多个公共图像生成基准上,GenEvolve均显著超越了现有的强基线方法,达到了当前最先进的性能水平。这一成果为图像生成智能体的进一步发展提供了新的思路,也为开放式生成任务带来了更多可能性。