跳到主要內容
AI News HubLIVE
公開文章 9採集文章 9可信度 88刷新頻率 120 分鐘
健康狀態 健康來源類型 官方原文權限 官方原文最近入庫 2026-07-28ID kimi-blog運行狀態 已啟用

Official Kimi/Moonshot blog listing; verify terms before displaying full body.

最新公開文章

PerceptionBench:評估多模態大語言模型的原子視覺感知能力

PerceptionBench 是一個全新基準測試,專注於隔離和評估多模態大語言模型的原子視覺感知能力。該基準從 42 個現有基準中的模型失敗模式中歸納出 10 種原子感知能力,並構建了 3000 個經人工驗證的問題。測試顯示,頂尖模型均未達到 60% 的準確率,且感知相關的幻覺是平均最弱的能力。PerceptionBench 旨在精確診斷視覺感知的薄弱環節,推動多模態 AI 實現可靠且一致的視覺理解。

Kimi Blog站內正文PerceptionBench:評估多模態大語言模型的原子視覺感知能力

Kimi K3 技術部落格:開放前沿智慧

Kimi 推出其最強模型 K3,擁有 2.8 萬億引數,採用 Kimi Delta Attention 和 Attention Residuals 架構,支援原生視覺和百萬 token 上下文。這是全球首個開放的 3T 級模型,在長時間編碼、知識工作和推理方面表現出色。儘管整體效能仍落後於最強大的專有模型,但在多項評估中超越其他測試模型。

Kimi Blog站內正文Kimi K3 技術部落格:開放前沿智慧

Kimi K2:開放智慧體智慧平臺

Kimi K2 是一個開放智慧體智慧平臺,提供多種工具和研究成果,包括電子表格公式、文件處理、AI代理部署、程式碼代理、瀏覽器擴充套件等,以及Kimi K2.6、Agent Swarm等前沿研究。

Kimi Blog站內正文Kimi K2:開放智慧體智慧平臺

Kimi K2 思考模型

Kimi K2 是一個開源思考模型,提供多種AI工具,包括Excel公式生成、文件處理、程式碼代理、瀏覽器擴充套件等,支援Agent Swarm和深度研究功能。

Kimi Blog站內正文Kimi K2 思考模型

Kimi 供應商驗證器

Kimi 開源了供應商驗證器(KVV),旨在幫助使用者驗證開源模型推理實現的準確性。專案包含六項關鍵基準測試,用於檢測部署中的常見問題,並推動基礎設施提供商修復根本原因。

Kimi Blog站內正文Kimi 供應商驗證器

Kimi K2.5 技術部落格:視覺代理智慧

Kimi K2.5 是一個開源多模態模型,在編碼和視覺任務上表現卓越。它引入自我導向的代理群體,可協調多達100個子代理並行執行,將任務完成時間縮短高達4.5倍。該模型在辦公生產力方面同樣出色,能處理複雜的文件、電子表格和簡報。Kimi K2.5 已透過Kimi.com、應用、API和Kimi Code等多個平臺提供,標誌著開源社群向通用人工智慧邁出了重要一步。

Kimi Blog站內正文Kimi K2.5 技術部落格:視覺代理智慧

WorldVQA:衡量多模態大語言模型中的原子世界知識

WorldVQA是一個新基準,用於評估多模態大語言模型在視覺世界知識上的事實準確性。它包含3500個高質量的影像-問題對,涵蓋9個類別,重點關注頭部與尾部知識分佈。前沿模型準確率低於50%,暴露出過度自信和視覺知識差距。

Kimi Blog站內正文WorldVQA:衡量多模態大語言模型中的原子世界知識

Kimi Agent Swarm:大規模並行100個子代理

Kimi推出Agent Swarm,支援最多100個子代理並行工作,實現水平擴充套件而非垂直擴充套件。該架構讓AI自我組織,如同一個公司或實驗室,可自動分解任務、分配代理、合成結果,在廣泛研究、批次處理、多角度分析等場景顯著提升效率。目前面向頂級訂閱使用者開放研究預覽。

Kimi Blog站內正文Kimi Agent Swarm:大規模並行100個子代理

Kimi K2.6 技術部落格:推進開源編碼

Kimi K2.6 是一款全新的開源模型,具備最先進的編碼、長週期執行和智慧體群體能力。本文詳細介紹了其核心技術、效能提升、應用場景以及社群反饋。

Kimi Blog站內正文Kimi K2.6 技術部落格:推進開源編碼

全部來源