面向AI编码智能体的Kotlin基准测试发布
JetBrains 正式发布 Kotlin Benchmark,一个基于 SWE-bench 的公开基准,用于评估 AI 编码智能体在真实 Kotlin 工程任务上的表现。首批结果中,Claude Code 搭配 Opus 4.7 xhigh 以 85.71% 的解决率领跑,JetBrains Junie 与 Codex 均为 81.9%。
JetBrains 正式发布 Kotlin Benchmark,这是该公司面向 AI 编码智能体的官方基准测试,专门衡量智能体在真实 Kotlin 软件工程任务中的端到端表现。基准采用 SWE-bench 方法论,数据来自活跃开源仓库中的 105 个工程任务。每个任务要求智能体理解真实 issue 描述,在项目上下文中定位相关信息并生成功能补丁;所有补丁都会在容器化环境中被严格验证,只有通过测试验证才算解决。
与 Kotlin_HumanEval、Kotlin_QA 等侧重模型语法和核心概念理解的评估资源不同,Kotlin Benchmark 关注的是智能体在完整仓库中的实际工程能力。JetBrains 希望借此为开发者提供一个公开、可信的参照系,让团队可以基于接近日常开发的任务来比较不同智能体与配置,而不是只依赖厂商宣传。基准的代码、数据集和测试工具已经公开在 GitHub,官方排行榜也已上线,首批结果可在 kotlinlang.org/benchmark 查看。
首轮评估中,领先的编码智能体已经能完成相当大比例的任务。Claude Code 搭配 Opus 4.7 xhigh 解决了 105 个任务中的 90 个,解决率为 85.71%;JetBrains Junie 搭配 Opus 4.7 max 和 Codex 搭配 GPT 5.5 xhigh 均达到 81.9%。需要强调,这些结果仅反映第一版公开基准,尚未包含最新的模型发布。官方也提醒,分数只是参考信号,真实效果还取决于团队自身的架构、内部 API、编码规范、工具链和验证流程。
接下来,JetBrains 计划基于开源的 Multi-SWE-bench 基础设施持续扩展。路线图包括:覆盖更广的 Kotlin 生态场景,如 Android 和 Kotlin Multiplatform,并扩大难度范围;在测试通过之外加入成本、性能、可维护性和代码质量等评估指标;纳入更多商业智能体、智能体与模型配置组合,以及开放权重模型。基准本身是开放的,社区可以检查任务、比较结果,并反馈下一批应覆盖的 Kotlin 场景。