递归自我改进实现编码性能新巅峰
Poetiq 的元系统通过递归自我改进,无需微调或特殊模型访问,自动构建优化框架,在 LiveCodeBench Pro 编码基准测试中达到最新最优性能。该框架适用于多种模型,显著提升性能。
Poetiq 公司近日宣布,其元系统通过递归自我改进技术,在 LiveCodeBench Pro(LCB Pro)编码基准测试中取得了新的最优结果。LCB Pro 是一个权威的编码基准,专门设计用于评估 AI 的创造性编程能力,它要求解决方案不仅正确,还要满足特定的内存和运行时限制,并且持续更新题目以防止数据污染。Poetiq 的元系统在没有进行任何模型微调或获取特殊模型访问权限的情况下,仅通过标准 API 访问,就让 Gemini 3.1 Pro 的准确率从 78.6% 提升至 90.9%,超越了 Google 自家的顶级系统 Gemini Deep Think。更令人印象深刻的是,当将同一框架应用于 GPT 5.5 时,其准确率进一步跃升至 93.9%,创造了新的纪录。
Poetiq 的元系统通过递归自我改进,从以往的基准测试(如 ARC-AGI 和 HLE)中学习,自动为编码任务构建并优化智能框架。这个过程完全自动化:系统在优化框架时会综合考虑准确性、运行时间和内存限制。最终生成的框架具有模型无关性,可以不加修改地应用于任何大语言模型。除了 Gemini 和 GPT 系列,该框架还显著提升了 Gemini 3.0 Flash(从 72.3% 到 82.3%)和 Kimi K2.6(从 50.0% 到 79.9%)等模型的性能。
LCB Pro 根据人类解题率将题目分为简单、中等和困难三个等级。Poetiq 的框架在每个等级上都超越了原始模型家族。例如,使用 Gemini 3.1 Pro 时,框架在困难题上的准确率从 7.7% 提升至 58.3%,在中等题上从 64.9% 提升至 87.5%,在简单题上从 94.8% 提升至 96.9%。
Poetiq 选择编码作为第三个公开基准测试,因为编码是当前 AI 最广泛的商业应用,融合了推理和检索能力。此前,该公司已在 ARC-AGI(推理)和 HLE(知识检索)上证明了其方法的有效性。Poetiq 团队来自 Google/DeepMind,拥有 72 年的综合经验。他们专注于通过递归自我改进解决 AI 推理和知识提取中的根本问题。目前,该公司正在与少数精选早期客户合作,并计划继续扩展其元系统的应用范围。