基準測試已死(至少對我們而言)
Poetiq 宣佈其遞歸自我改進(RSI)循環能夠自動為任何任務構建最先進的測試框架,在六個不同的基準測試中取得了最佳成績,且無需人工干預。該公司認為靜態基準測試不足以評估真正自我改進的AI系統,並建議轉向動態的、無法被訓練攻克的“活基準”。
Poetiq 近日發佈了一篇博文,宣佈其遞歸自我改進(RSI)循環已經達到新的高度:只需給定一個基準測試,系統就能自動構建代碼、提示、工具和搜索策略組成的完整測試框架,無需任何人工干預。在這套機制下,Poetiq 在六項不同領域的複雜基準測試上取得了當前最優(SOTA)成績,部分結果甚至超越了採用更先進模型的競爭對手。
Poetiq 的理念是將大型語言模型(LLM)視為一個更大推理系統中的一個組件,而整個系統會通過 RSI 循環不斷自我優化。通過解耦推理機制與模型權重,Poetiq 的設計是模型無關的——無論是閉源還是開源模型,元系統都能將它們作為工具來使用,從而持續複利。
在已完成的基準測試中,Poetiq 展示了令人矚目的成績:
- ArXivMath(競賽數學):使用 GPT-5.5 達到 89.2%,超越之前由 Claude Fable 5 保持的 87.5%。
- SciCode(科學編碼):使用 Gemini 3.1 Pro 達到 61.5%,超過 Claude Fable 5 的 60.2%。
- Haladir(長程規劃):在完整200場景集上,使用 Gemini 3.1 Pro 達到 0.688,是先前最優(0.326)的兩倍多;在挑戰子集上達到 0.470,是 Claude Fable 5 的1.7倍。
- MCP-Atlas(代理工具使用):結合 Muse Spark 1.1 和 Gemini 3.5 Flash 達到 89.8%,超過此前最優的 88.1%。
- MRCR v2(長上下文檢索):使用 Gemini 3.1 Flash-Lite 達到 99.26%,超越 GPT-5.4 的 97.3%,而該基礎模型本身甚至未進入排行榜。
- Toolathlon(真實工具使用):使用 Gemini 3.5 Flash 達到 59.26%,在未修改的原始基準上排名第一,超越了 Anthropic 使用修改版本所報告的更高分數。
Poetiq 強調,所有成績均來自自動生成的框架,團隊本身並未針對具體基準進行任何手動調優。這正是他們目標的一部分:構建一個能夠自動為任何問題創建框架、數據和流程的元系統,而不是隻解決某個特定問題。
然而,Poetiq 也指出,傳統靜態基準的實用性已大幅下降——一旦系統自動掌握一個基準,其診斷價值就所剩無幾。因此,他們提出“活基準”的概念:一種動態生成、結合了多種模型能力且無法被針對性訓練的評估方式。這標誌着從靜態基準到持續進化評估的轉變。
展望未來,Poetiq 將讓 RSI 循環持續運行,通過解決企業合作伙伴的實際問題來推動系統不斷進步。他們相信,真正的智能不限於模型權重,而在於自我優化的架構。對於 Poetiq 而言,基準測試已經不再是終點,而是日常。