PerceptionBench:评估多模态大语言模型的原子视觉感知能力
PerceptionBench 是一个全新基准测试,专注于隔离和评估多模态大语言模型的原子视觉感知能力。该基准从 42 个现有基准中的模型失败模式中归纳出 10 种原子感知能力,并构建了 3000 个经人工验证的问题。测试显示,顶尖模型均未达到 60% 的准确率,且感知相关的幻觉是平均最弱的能力。PerceptionBench 旨在精确诊断视觉感知的薄弱环节,推动多模态 AI 实现可靠且一致的视觉理解。
Official Kimi/Moonshot blog listing; verify terms before displaying full body.
PerceptionBench 是一个全新基准测试,专注于隔离和评估多模态大语言模型的原子视觉感知能力。该基准从 42 个现有基准中的模型失败模式中归纳出 10 种原子感知能力,并构建了 3000 个经人工验证的问题。测试显示,顶尖模型均未达到 60% 的准确率,且感知相关的幻觉是平均最弱的能力。PerceptionBench 旨在精确诊断视觉感知的薄弱环节,推动多模态 AI 实现可靠且一致的视觉理解。
Kimi 推出其最强模型 K3,拥有 2.8 万亿参数,采用 Kimi Delta Attention 和 Attention Residuals 架构,支持原生视觉和百万 token 上下文。这是全球首个开放的 3T 级模型,在长时间编码、知识工作和推理方面表现出色。尽管整体性能仍落后于最强大的专有模型,但在多项评估中超越其他测试模型。
Kimi K2 是一个开放智能体智能平台,提供多种工具和研究成果,包括电子表格公式、文档处理、AI代理部署、代码代理、浏览器扩展等,以及Kimi K2.6、Agent Swarm等前沿研究。
Kimi K2 是一个开源思考模型,提供多种AI工具,包括Excel公式生成、文档处理、代码代理、浏览器扩展等,支持Agent Swarm和深度研究功能。
Kimi 开源了供应商验证器(KVV),旨在帮助用户验证开源模型推理实现的准确性。项目包含六项关键基准测试,用于检测部署中的常见问题,并推动基础设施提供商修复根本原因。
Kimi K2.5 是一个开源多模态模型,在编码和视觉任务上表现卓越。它引入自我导向的代理群体,可协调多达100个子代理并行执行,将任务完成时间缩短高达4.5倍。该模型在办公生产力方面同样出色,能处理复杂的文档、电子表格和演示文稿。Kimi K2.5 已通过Kimi.com、应用、API和Kimi Code等多个平台提供,标志着开源社区向通用人工智能迈出了重要一步。
WorldVQA是一个新基准,用于评估多模态大语言模型在视觉世界知识上的事实准确性。它包含3500个高质量的图像-问题对,涵盖9个类别,重点关注头部与尾部知识分布。前沿模型准确率低于50%,暴露出过度自信和视觉知识差距。
Kimi推出Agent Swarm,支持最多100个子代理并行工作,实现水平扩展而非垂直扩展。该架构让AI自我组织,如同一个公司或实验室,可自动分解任务、分配代理、合成结果,在广泛研究、批量处理、多角度分析等场景显著提升效率。目前面向顶级订阅用户开放研究预览。
Kimi K2.6 是一款全新的开源模型,具备最先进的编码、长周期执行和智能体群体能力。本文详细介绍了其核心技术、性能提升、应用场景以及社区反馈。