Poetiq的元系統自動構建模型無關的推理框架,無需微調即可提升所有測試的大語言模型在LiveCodeBench Pro上的表現
Poetiq發佈的新結果展示了其元系統在LiveCodeBench Pro(LCB Pro)上取得了最新最優性能,通過自動構建和優化推理框架,無需微調任何底層模型或訪問模型內部。該框架僅針對Gemini 3.1 Pro優化,卻使GPT 5.5 High等七種模型均有提升,驗證了框架的模型無關性。
Poetiq今日公佈了其元系統(Meta-System)在LiveCodeBench Pro(LCB Pro)這一競爭性編程基準測試上的最新結果——通過自動構建並優化推理框架,無需對底層模型進行任何微調或訪問模型內部狀態,即達到了新的最先進水平。
LCB Pro是專為測試AI編程能力而設計的基準,它從主流編程競賽中提取題目,並隱藏公共參考代碼,轉而使用全面測試框架驗證解決方案。除了正確輸出外,解決方案還必須滿足特定的內存和運行時約束,同時持續更新以防止數據污染和過擬合。該基準聚焦C++挑戰,強調創造性編碼和複雜問題求解。
Poetiq的研究團隊將大語言模型任務劃分為三大類:推理挑戰(ARC-AGI)、檢索挑戰(人類最後考試)和編碼挑戰。本次對LCB Pro的選擇是有意為之,編碼作為當前AI最普及的商業應用,融合了推理與檢索以及專業邏輯生成。研究有三個具體目標:證明智能框架能在不微調或特殊訪問的前提下提升效能;驗證元系統在自動創建框架時具備遞歸自我改進能力;展示最終框架的模型無關性,即無需修改即可應用於任何模型。
所謂“框架”,在此語境下指圍繞語言模型構建的基礎設施,用於處理特定任務——包括控制提示方式、輸出結構、跨調用組裝答案以及評估解決方案。傳統上這些框架由工程師手工構建,而Poetiq的元系統通過遞歸自我改進自動完成:內部不斷優化提問策略、細化鏈式提問順序,並設計新的答案組裝方法,同時將先前的學習成果融入新任務。
元系統接受LCB Pro任務後,僅使用Gemini 3.1 Pro作為基礎模型從頭構建框架,充分考慮了準確性、運行時和內存約束三個維度。一旦針對Gemini 3.1 Pro優化完成,該框架被直接應用於其他多個模型——包括開源和專有模型——無需額外調整。結果所有測試模型均獲得提升。
具體數據方面:GPT 5.5 High在LCB Pro(25Q2)上從89.6%提升至93.9%;Gemini 3.1 Pro從78.6%躍升至90.9%,超越了Google自家的Gemini 3 Deep Think(88.8%)。在困難題目上,Gemini 3.1 Pro從7.7%飆升至58.3%,GPT 5.5 High從50.0%升至75.0%。小型模型如Gemini 3.0 Flash提升10個百分點至82.3%,超過了Claude Opus 4.7、Gemini 3.1 Pro和GPT 5.2 High等更大更昂貴的模型。Kimi K2.6獲得最大增幅,從50.0%躍升至79.9%,Nemotron 3 Super 120B提升12.8%。
這些結果凸顯了Poetiq元系統的潛力:自動生成任務專用、模型無關的推理框架,通過遞歸自我改進持續提升性能,無需改動機器學習模型本身。