AI News HubLIVE
站内改写2 分钟阅读

Poetiq的元系统自动构建模型无关的推理框架,无需微调即可提升所有测试的大语言模型在LiveCodeBench Pro上的表现

Poetiq发布的新结果展示了其元系统在LiveCodeBench Pro(LCB Pro)上取得了最新最优性能,通过自动构建和优化推理框架,无需微调任何底层模型或访问模型内部。该框架仅针对Gemini 3.1 Pro优化,却使GPT 5.5 High等七种模型均有提升,验证了框架的模型无关性。

来源MarkTechPost作者: Asif Razzaq

Poetiq今日公布了其元系统(Meta-System)在LiveCodeBench Pro(LCB Pro)这一竞争性编程基准测试上的最新结果——通过自动构建并优化推理框架,无需对底层模型进行任何微调或访问模型内部状态,即达到了新的最先进水平。

LCB Pro是专为测试AI编程能力而设计的基准,它从主流编程竞赛中提取题目,并隐藏公共参考代码,转而使用全面测试框架验证解决方案。除了正确输出外,解决方案还必须满足特定的内存和运行时约束,同时持续更新以防止数据污染和过拟合。该基准聚焦C++挑战,强调创造性编码和复杂问题求解。

Poetiq的研究团队将大语言模型任务划分为三大类:推理挑战(ARC-AGI)、检索挑战(人类最后考试)和编码挑战。本次对LCB Pro的选择是有意为之,编码作为当前AI最普及的商业应用,融合了推理与检索以及专业逻辑生成。研究有三个具体目标:证明智能框架能在不微调或特殊访问的前提下提升效能;验证元系统在自动创建框架时具备递归自我改进能力;展示最终框架的模型无关性,即无需修改即可应用于任何模型。

所谓“框架”,在此语境下指围绕语言模型构建的基础设施,用于处理特定任务——包括控制提示方式、输出结构、跨调用组装答案以及评估解决方案。传统上这些框架由工程师手工构建,而Poetiq的元系统通过递归自我改进自动完成:内部不断优化提问策略、细化链式提问顺序,并设计新的答案组装方法,同时将先前的学习成果融入新任务。

元系统接受LCB Pro任务后,仅使用Gemini 3.1 Pro作为基础模型从头构建框架,充分考虑了准确性、运行时和内存约束三个维度。一旦针对Gemini 3.1 Pro优化完成,该框架被直接应用于其他多个模型——包括开源和专有模型——无需额外调整。结果所有测试模型均获得提升。

具体数据方面:GPT 5.5 High在LCB Pro(25Q2)上从89.6%提升至93.9%;Gemini 3.1 Pro从78.6%跃升至90.9%,超越了Google自家的Gemini 3 Deep Think(88.8%)。在困难题目上,Gemini 3.1 Pro从7.7%飙升至58.3%,GPT 5.5 High从50.0%升至75.0%。小型模型如Gemini 3.0 Flash提升10个百分点至82.3%,超过了Claude Opus 4.7、Gemini 3.1 Pro和GPT 5.2 High等更大更昂贵的模型。Kimi K2.6获得最大增幅,从50.0%跃升至79.9%,Nemotron 3 Super 120B提升12.8%。

这些结果凸显了Poetiq元系统的潜力:自动生成任务专用、模型无关的推理框架,通过递归自我改进持续提升性能,无需改动机器学习模型本身。