AI News HubLIVE
公開文章 9採集文章 9可信度 88刷新頻率 120 分鐘
健康狀態 健康來源類型 官方原文權限 官方原文最近入庫 2026-07-28ID kimi-blog運行狀態 已啟用

Official Kimi/Moonshot blog listing; verify terms before displaying full body.

最新公開文章

PerceptionBench:評估多模態大語言模型的原子視覺感知能力

PerceptionBench 是一個全新基準測試,專注於隔離和評估多模態大語言模型的原子視覺感知能力。該基準從 42 個現有基準中的模型失敗模式中歸納出 10 種原子感知能力,並構建了 3000 個經人工驗證的問題。測試顯示,頂尖模型均未達到 60% 的準確率,且感知相關的幻覺是平均最弱的能力。PerceptionBench 旨在精確診斷視覺感知的薄弱環節,推動多模態 AI 實現可靠且一致的視覺理解。

  • PerceptionBench 從模型真實失敗中歸納出 10 種原子視覺感知能力,覆蓋視覺關係、計數、屬性、深度與3D、定位、比較、細粒度識別、上下文整合、OCR 和幻覺。
  • 基準包含 3000 個精心設計的問題,每個問題僅測試單一感知能力,無需推理或外部知識。
站內正文

Kimi K3 技術部落格:開放前沿智慧

Kimi 推出其最強模型 K3,擁有 2.8 萬億引數,採用 Kimi Delta Attention 和 Attention Residuals 架構,支援原生視覺和百萬 token 上下文。這是全球首個開放的 3T 級模型,在長時間編碼、知識工作和推理方面表現出色。儘管整體效能仍落後於最強大的專有模型,但在多項評估中超越其他測試模型。

  • Kimi K3 是全球首個開放的 3T 級模型,擁有 2.8 萬億引數。
  • 採用 Kimi Delta Attention 和 Attention Residuals 等新架構,提升擴充套件效率。
站內正文

Kimi K2:開放智慧體智慧平臺

Kimi K2 是一個開放智慧體智慧平臺,提供多種工具和研究成果,包括電子表格公式、文件處理、AI代理部署、程式碼代理、瀏覽器擴充套件等,以及Kimi K2.6、Agent Swarm等前沿研究。

  • 支援Excel公式、資料透視表和圖表生成
  • 一鍵部署24/7執行的AI代理(Kimi Claw)
站內正文

Kimi K2 思考模型

Kimi K2 是一個開源思考模型,提供多種AI工具,包括Excel公式生成、文件處理、程式碼代理、瀏覽器擴充套件等,支援Agent Swarm和深度研究功能。

  • 開源思考模型,適用於多種AI任務
  • 整合Sheets、Docs、Code等工具
站內正文

Kimi 供應商驗證器

Kimi 開源了供應商驗證器(KVV),旨在幫助使用者驗證開源模型推理實現的準確性。專案包含六項關鍵基準測試,用於檢測部署中的常見問題,並推動基礎設施提供商修復根本原因。

  • KVV 包含預驗證、OCRBench、MMMU Pro、AIME2025、工具呼叫測試和 SWE-Bench 六項基準測試。
  • 專案透過持續基準測試公開排行榜,增強透明度。
站內正文

Kimi K2.5 技術部落格:視覺代理智慧

Kimi K2.5 是一個開源多模態模型,在編碼和視覺任務上表現卓越。它引入自我導向的代理群體,可協調多達100個子代理並行執行,將任務完成時間縮短高達4.5倍。該模型在辦公生產力方面同樣出色,能處理複雜的文件、電子表格和簡報。Kimi K2.5 已透過Kimi.com、應用、API和Kimi Code等多個平臺提供,標誌著開源社群向通用人工智慧邁出了重要一步。

  • 具備視覺能力的開源編碼模型,達到最先進水平。
  • 自我導向代理群體,可並行呼叫多達100個子代理。
站內正文

WorldVQA:衡量多模態大語言模型中的原子世界知識

WorldVQA是一個新基準,用於評估多模態大語言模型在視覺世界知識上的事實準確性。它包含3500個高質量的影像-問題對,涵蓋9個類別,重點關注頭部與尾部知識分佈。前沿模型準確率低於50%,暴露出過度自信和視覺知識差距。

  • WorldVQA基準測試多模態大語言模型的原子視覺世界知識,使用3500個高質量的影像-問題對。
  • 模型表現顯著掙扎,頂級模型準確率低於50%,尤其在長尾知識上表現更差。
站內正文

Kimi Agent Swarm:大規模並行100個子代理

Kimi推出Agent Swarm,支援最多100個子代理並行工作,實現水平擴充套件而非垂直擴充套件。該架構讓AI自我組織,如同一個公司或實驗室,可自動分解任務、分配代理、合成結果,在廣泛研究、批次處理、多角度分析等場景顯著提升效率。目前面向頂級訂閱使用者開放研究預覽。

  • Agent Swarm實現水平擴充套件,支援多達100個並行子代理和1500次工具呼叫,速度比序列快4.5倍。
  • 系統自動組織代理團隊,包括CEO、研究員、分析師等角色,無需人類微管理。
站內正文

Kimi K2.6 技術部落格:推進開源編碼

Kimi K2.6 是一款全新的開源模型,具備最先進的編碼、長週期執行和智慧體群體能力。本文詳細介紹了其核心技術、效能提升、應用場景以及社群反饋。

  • Kimi K2.6 在編碼任務上達到領先水平,支援長週期自主執行
  • 模型在SWE-Bench、Terminal-Bench等基準測試中表現出色
站內正文

全部來源