AI News HubLIVE
站内改写2 分钟阅读

基准测试已死(至少对我们而言)

Poetiq 宣布其递归自我改进(RSI)循环能够自动为任何任务构建最先进的测试框架,在六个不同的基准测试中取得了最佳成绩,且无需人工干预。该公司认为静态基准测试不足以评估真正自我改进的AI系统,并建议转向动态的、无法被训练攻克的“活基准”。

来源Hacker News AI作者: felixbraun

Poetiq 近日发布了一篇博文,宣布其递归自我改进(RSI)循环已经达到新的高度:只需给定一个基准测试,系统就能自动构建代码、提示、工具和搜索策略组成的完整测试框架,无需任何人工干预。在这套机制下,Poetiq 在六项不同领域的复杂基准测试上取得了当前最优(SOTA)成绩,部分结果甚至超越了采用更先进模型的竞争对手。

Poetiq 的理念是将大型语言模型(LLM)视为一个更大推理系统中的一个组件,而整个系统会通过 RSI 循环不断自我优化。通过解耦推理机制与模型权重,Poetiq 的设计是模型无关的——无论是闭源还是开源模型,元系统都能将它们作为工具来使用,从而持续复利。

在已完成的基准测试中,Poetiq 展示了令人瞩目的成绩:

  • ArXivMath(竞赛数学):使用 GPT-5.5 达到 89.2%,超越之前由 Claude Fable 5 保持的 87.5%。
  • SciCode(科学编码):使用 Gemini 3.1 Pro 达到 61.5%,超过 Claude Fable 5 的 60.2%。
  • Haladir(长程规划):在完整200场景集上,使用 Gemini 3.1 Pro 达到 0.688,是先前最优(0.326)的两倍多;在挑战子集上达到 0.470,是 Claude Fable 5 的1.7倍。
  • MCP-Atlas(代理工具使用):结合 Muse Spark 1.1 和 Gemini 3.5 Flash 达到 89.8%,超过此前最优的 88.1%。
  • MRCR v2(长上下文检索):使用 Gemini 3.1 Flash-Lite 达到 99.26%,超越 GPT-5.4 的 97.3%,而该基础模型本身甚至未进入排行榜。
  • Toolathlon(真实工具使用):使用 Gemini 3.5 Flash 达到 59.26%,在未修改的原始基准上排名第一,超越了 Anthropic 使用修改版本所报告的更高分数。

Poetiq 强调,所有成绩均来自自动生成的框架,团队本身并未针对具体基准进行任何手动调优。这正是他们目标的一部分:构建一个能够自动为任何问题创建框架、数据和流程的元系统,而不是只解决某个特定问题。

然而,Poetiq 也指出,传统静态基准的实用性已大幅下降——一旦系统自动掌握一个基准,其诊断价值就所剩无几。因此,他们提出“活基准”的概念:一种动态生成、结合了多种模型能力且无法被针对性训练的评估方式。这标志着从静态基准到持续进化评估的转变。

展望未来,Poetiq 将让 RSI 循环持续运行,通过解决企业合作伙伴的实际问题来推动系统不断进步。他们相信,真正的智能不限于模型权重,而在于自我优化的架构。对于 Poetiq 而言,基准测试已经不再是终点,而是日常。