PerceptionBench:マルチモーダル大規模言語モデルにおける原子的視覚知能の評価 2026-07-28 17:08 UTC+9 PerceptionBench は、マルチモーダル大規模言語モデルの原子的視覚知能を分離して評価する新しいベンチマークです。42の既存ベンチマークにおけるモデルの失敗から導き出された10の原子的知覚カテゴリに基づき、3,000の検証済み質問で構成されています。最先端モデルでも正答率60%に達しておらず、知覚関連の幻覚が平均的に最も弱い能力です。このベンチマークは、視覚知覚がどこで破綻するかを明らかにし、忠実で一貫したマルチモーダルAIの進歩を促進することを目的としています。
Kimi Blog サイト内本文 PerceptionBench:マルチモーダル大規模言語モデルにおける原子的視覚知能の評価 後で読む Kimi K3 テックブログ:オープンフロンティアインテリジェンス 2026-07-17 04:31 UTC+9 Kimi は、2.8兆パラメータの最も強力なモデルKimi K3を発表。Kimi Delta Attention と Attention Residuals 上に構築され、ネイティブビジョン機能と100万トークンのコンテキストウィンドウを備える。世界初のオープンな3Tクラスモデルで、長期コーディング、知識作業、推論などのフロンティアインテリジェンス向けに設計。最も強力なプロプライエタリモデルには及ばないものの、評価では他のテストモデルを上回る。
Kimi Blog サイト内本文 Kimi K3 テックブログ:オープンフロンティアインテリジェンス 後で読む Kimi K2: オープンエージェントインテリジェンス 2026-05-06 08:41 UTC+9 Kimi K2は、Excelフォーミュラ、ドキュメント処理、AIエージェント展開、コード支援、ブラウザ拡張などのツールと、Kimi K2.6、Agent Swarmなどの研究成果を含むオープンエージェントインテリジェンスプラットフォームです。
Kimi Blog サイト内本文 Kimi K2: オープンエージェントインテリジェンス 後で読む Kimi K2 シンキング 2026-05-06 08:41 UTC+9 Kimi K2 はオープンソースの思考モデルで、Excel、文書、コード、ブラウザ拡張などのツールを統合し、エージェントスウォームと深層研究をサポートします。
Kimi Blog サイト内本文 Kimi K2 シンキング 後で読む Kimi ベンダーベリファイア 2026-05-06 08:40 UTC+9 Kimiは、オープンソースモデルの推論実装の正確性を検証するためのベンダーベリファイア(KVV)をオープンソース化しました。このプロジェクトには、デプロイメントの一般的な問題を検出するための6つの重要なベンチマークが含まれており、インフラプロバイダーが根本的な原因を修正することを促進します。
Kimi Blog サイト内本文 Kimi ベンダーベリファイア 後で読む Kimi K2.5 テクノロジーブログ:ビジュアルエージェントインテリジェンス 2026-05-06 08:40 UTC+9 Kimi K2.5は、コーディングとビジョンタスクにおいて最先端の性能を発揮するオープンソースのマルチモーダルモデルです。最大100のサブエージェントを調整して並列実行する自己指示型エージェント群を備え、タスク完了時間を最大4.5倍短縮します。また、複雑なドキュメント、スプレッドシート、プレゼンテーションを処理するオフィス生産性にも優れています。Kimi.com、アプリ、API、Kimi Codeを通じて利用可能で、オープンソースコミュニティにとってAGIへの重要な一歩となります。
Kimi Blog サイト内本文 Kimi K2.5 テクノロジーブログ:ビジュアルエージェントインテリジェンス 後で読む WorldVQA:マルチモーダル大規模言語モデルにおける原子世界知識の測定 2026-05-06 08:39 UTC+9 WorldVQAは、マルチモーダル大規模言語モデルの視覚的世界知識に関する事実的正確性を評価する新しいベンチマークです。3,500の高品質な画像-質問ペアから構成され、9カテゴリをカバーし、ヘッドとテールの知識分布に焦点を当てています。最先端モデルでも50%未満の精度にとどまり、過信と視覚知識のギャップが明らかになりました。
Kimi Blog サイト内本文 WorldVQA:マルチモーダル大規模言語モデルにおける原子世界知識の測定 後で読む Kimi Agent Swarm: 100のサブエージェントによるスケール 2026-05-06 08:37 UTC+9 KimiはAgent Swarmを発表。最大100のサブエージェントを並行動作させ、水平スケーリングを実現するマルチエージェントアーキテクチャです。システムはCEO、研究者、アナリストなどの役割を自己組織化し、タスクの分解、エージェント割り当て、結果の統合を自律的に行います。逐次実行と比較して最大4.5倍高速で、大規模調査、バッチ処理、多視点分析に優れています。トップティア向けにプレビュー提供中。
Kimi Blog サイト内本文 Kimi Agent Swarm: 100のサブエージェントによるスケール 後で読む Kimi K2.6 テックブログ:オープンソースコーディングの進化 2026-05-06 08:36 UTC+9 Kimi K2.6 は、最先端のコーディング、長期間の実行、エージェントスウォーム機能を備えた新しいオープンソースモデルです。本記事では、その機能、ベンチマーク、コミュニティからのフィードバックを詳しく紹介します。
Kimi Blog サイト内本文 Kimi K2.6 テックブログ:オープンソースコーディングの進化 後で読む