面向AI編碼智慧體的Kotlin基準測試釋出
JetBrains 正式釋出 Kotlin Benchmark,一個基於 SWE-bench 的公開基準,用於評估 AI 編碼智慧體在真實 Kotlin 工程任務上的表現。首批結果中,Claude Code 搭配 Opus 4.7 xhigh 以 85.71% 的解決率領跑,JetBrains Junie 與 Codex 均為 81.9%。
JetBrains 正式釋出 Kotlin Benchmark,這是該公司面向 AI 編碼智慧體的官方基準測試,專門衡量智慧體在真實 Kotlin 軟體工程任務中的端到端表現。基準採用 SWE-bench 方法論,資料來自活躍開源倉庫中的 105 個工程任務。每個任務要求智慧體理解真實 issue 描述,在專案上下文中定位相關資訊並生成功能補丁;所有補丁都會在容器化環境中被嚴格驗證,只有透過測試驗證才算解決。
與 Kotlin_HumanEval、Kotlin_QA 等側重模型語法和核心概念理解的評估資源不同,Kotlin Benchmark 關注的是智慧體在完整倉庫中的實際工程能力。JetBrains 希望藉此為開發者提供一個公開、可信的參照系,讓團隊可以基於接近日常開發的任務來比較不同智慧體與配置,而不是隻依賴廠商宣傳。基準的程式碼、資料集和測試工具已經公開在 GitHub,官方排行榜也已上線,首批結果可在 kotlinlang.org/benchmark 檢視。
首輪評估中,領先的編碼智慧體已經能完成相當大比例的任務。Claude Code 搭配 Opus 4.7 xhigh 解決了 105 個任務中的 90 個,解決率為 85.71%;JetBrains Junie 搭配 Opus 4.7 max 和 Codex 搭配 GPT 5.5 xhigh 均達到 81.9%。需要強調,這些結果僅反映第一版公開基準,尚未包含最新的模型釋出。官方也提醒,分數只是參考訊號,真實效果還取決於團隊自身的架構、內部 API、編碼規範、工具鏈和驗證流程。
接下來,JetBrains 計劃基於開源的 Multi-SWE-bench 基礎設施持續擴充套件。路線圖包括:覆蓋更廣的 Kotlin 生態場景,如 Android 和 Kotlin Multiplatform,並擴大難度範圍;在測試透過之外加入成本、效能、可維護性和程式碼質量等評估指標;納入更多商業智慧體、智慧體與模型配置組合,以及開放權重模型。基準本身是開放的,社群可以檢查任務、比較結果,並反饋下一批應覆蓋的 Kotlin 場景。