AI News HubLIVE
公開文章 36採集文章 37可信度 88刷新頻率 5 分鐘
健康狀態 健康來源類型 官方原文權限 官方原文最近入庫 2026-08-07ID together-ai-blog運行狀態 已啟用

Official source; confirm reuse terms before enabling full body display.

最新公開文章

待翻譯:DeepSeek-V4 Flash 0731 vs GPT-5.6 Luna on DeepSWE: Cost and Coding

AI 服務暫時不可用,以下為來源摘要,待恢復後補全翻譯:We ran 900 DeepSWE rollouts on DeepSeek-V4 Flash and GPT-5.6 Luna. Luna leads pass@1 by 14 points; DeepSeek delivers 4.8x the solves per dollar.

  • AI 服務暫時不可用,系統已先保留來源內容與降級元數據。
  • We ran 900 DeepSWE rollouts on DeepSeek-V4 Flash and GPT-5.6 Luna. Luna leads pass@1 by 14 points; DeepSeek delivers 4.8x the solves per dollar.
站內正文

Kimi K3 完全開發者指南

Kimi K3 是 Moonshot AI 推出的 2.8 萬億參數開源權重模型,也是首個 3 萬億參數級別的開源模型。本文介紹其架構亮點、Together AI 上的調用方式、推理強度、視覺輸入、結構化輸出、工具調用與動態工具加載等關鍵開發要點。

  • Kimi K3 擁有 2.8 萬億參數,是迄今最大的開源權重模型,並支持 1M 上下文。
  • 採用 Kimi Delta Attention、Attention Residuals 與 Stable LatentMoE 等新架構,僅激活 896 個專家中的 16 個。
站內正文

ThunderAgent:大規模合成數據生成的2倍加速智能體推理

ThunderAgent是一種程序感知的智能體推理調度器。通過將每個智能體工作流視為可調度的程序,它消除了KV緩存顛簸,實現了超過2倍的單節點吞吐量和近線性的多節點擴展。

  • 引入程序抽象用於智能體LLM請求調度,消除KV緩存顛簸
  • 在單節點上實現高達2.5倍的吞吐量提升,8節點集羣上實現2.4倍加速
站內正文

Together AI宣佈與Moonshot AI建立戰略合作伙伴關係,原生服務Kimi模型

Together AI與Moonshot AI達成戰略合作,成為Moonshot模型發佈的啓動平台,首款模型為2.8萬億參數的Kimi K3,後續所有開源模型也將登陸Together AI。

  • Together AI成為Moonshot AI模型的啓動平台,提供第一時間訪問和US託管基礎設施。
  • Kimi K3是2.8T參數的稀疏MoE模型,支持視覺和1M上下文,採用Kimi Delta Attention和Attention Residuals等創新架構。
站內正文

配置專用模型推理

Together AI 的專用模型推理架構詳解:端點、部署、配置三部分模型,以及基於容量的路由機制。

  • 系統由端點(固定名稱)、部署(模型+硬件組合)和配置(不可變配方)三部分組成。
  • 流量路由基於有效容量(權重×就緒副本數),而非固定百分比。
站內正文

Kimi K3 vs GPT-5.6 Sol 在 DeepSWE 上的對比:成本、編碼和路由

我們在 DeepSWE 上對 Kimi K3 和 GPT-5.6 Sol 進行了 904 次測試。Sol 在 pass@1 上領先;Kimi K3 在 pass@4 上以每美元解決任務數 2.8 倍的優勢勝出,兩者之間的路由可達約 85.6%。

  • Sol 的單次通過率(pass@1)為 72.7%,Kimi K3 為 68.5%。
  • Kimi K3 在 pass@4 上達到 89.4%,高於 Sol 的 85.8%。
站內正文

Kimi K3 vs Claude Fable 5:DeepSWE上的成本與編碼能力對比

我們在DeepSWE基準上對Kimi K3和Claude Fable 5進行了452次實驗。Fable在pass@1上領先1.4個百分點,但Kimi K3在pass@4上勝出,且每美元解決問題的數量是Fable的2.8倍。Kimi K3作為開源模型,成本僅為Fable的三分之一,是追求性價比的理性選擇。

  • Kimi K3的pass@1為68.5%,略低於Claude Fable 5的69.9%,但在pass@2和pass@4上反超。
  • Kimi K3每次部署成本為4.65美元,遠低於Fable的13.41美元,每美元解決問題的效率是2.8倍。
站內正文

開源權重AI推理的生產平台

Together AI發佈了其推理平台的重大更新,為用户提供對性能、成本和質量的完全控制。新功能包括金絲雀部署、A/B測試、自動縮放以及自定義訓練的封閉測試版,包含強化學習和微調。

  • 數分鐘內部署開源權重模型,具備生產級控制
  • 支持金絲雀、藍綠和滾動更新,自動回滾
站內正文

Together AI 與 Y Combinator 合作推出首個專為 YC 社區打造的 GPU 集羣

Together AI 和 Y Combinator 宣佈合作,為 YC 初創公司提供首個專用 GPU 集羣,解決計算瓶頸。初創公司可靈活承諾數週而非兩年合同,通過自助服務平台直接管理 GPU,無需經過 YC。該集羣已滿負荷運行,並支持從單節點到大規模擴展的需求。

  • Together AI 與 YC 合作推出首個專用 GPU 集羣,YC 初創公司可直接訪問計算資源。
  • 承諾期為數週而非兩年,釋放資本用於業務其他部分。
站內正文

99.9% 的正常運行時間對推理意味着什麼?

本文深入解析了推理服務中 99%、99.9% 和 99.99% 正常運行時間所對應的不同故障域,以及每個層級所需的架構設計。作者分享了 Together AI 在構建可靠推理基礎設施方面的實踐經驗,並提供了在選擇推理提供商時應提出的關鍵問題。

  • 每個可靠性層級對應不同的故障域:99% 應對節點故障,99.9% 應對數據中心故障,99.99% 應對區域故障。
  • 實現高可靠性需要主動健康檢查、跨設施部署以及預留容量。
站內正文

Together GPU集羣新功能:為生產級GPU集羣提供可靠性與控制力

Together AI發佈一系列更新,旨在提升生產環境GPU集羣的可靠性與操作控制。新功能包括被動健康檢查、自動節點修復、強化版Slurm-on-K8s棧、集羣詳情視圖、外部OIDC認證、啓動腳本以及可選的驗收測試。這些改進幫助團隊更快發現硬件故障、自動化恢復流程,並提供更細粒度的訪問控制和自定義能力。

  • 新增被動健康檢查與自動節點修復,實時監測並處理硬件故障,減少停機時間。
  • Slurm-on-K8s 2.0實現自我修復守護進程、持久化作業會計和可靠進程清理,提升調度穩定性。
站內正文

Together AI 在首日即引入 Thinking Machines Lab 的新模型 Inkling

Thinking Machines Lab 發佈了 Inkling,一個多模態混合專家模型,專注於高效推理、原生多模態理解和廣泛任務適用性。Together AI 在其推理平台上提供該模型,支持可控推理努力、文本/圖像/音頻輸入,以及 1M 上下文窗口。

  • Inkling 是一個多模態 MoE 模型,總參數量 975B,每個 token 激活 40B 參數。
  • 支持文本、圖像和音頻輸入,並具有可控推理能力,允許開發者平衡推理深度、token 使用和延遲。
站內正文

開放、便捷且可預測:推出預留吞吐量功能

Together AI 推出預留吞吐量功能,為 MiniMax M3 和 GLM-5.2 等前沿開放模型提供保留推理容量,採用基於 Token 的定價和 99% 正常運行時間 SLA,成本比專有 API 降低高達 90%。

  • 預留吞吐量提供保留推理容量,無需管理 GPU 小時或基礎設施。
  • 基於 Token 的定價,每 PTU 每分鐘 0.05 美元,支持輸入、緩存輸入和輸出 Token。
站內正文

宣佈8億美元C輪融資:加速向開源AI的轉變

Together AI完成8億美元C輪融資,由Aramco Ventures、NVIDIA、Vista Equity等領投,旨在加速開源AI的普及。公司強調,閉源模型的成本無法規模化,而開源模型結合全棧優化可實現6-20倍成本降低。Together AI已推出FlashAttention-4、Together Megakernel等創新,成為全球最大的AI token生產商之一。

  • Together AI完成8億美元C輪融資,用於加速開源AI發展
  • 公司認為閉源模型的成本在規模化應用中不可持續
站內正文

Together AI在ICML 2026:涵蓋全棧的前沿研究

Together AI在ICML 2026上有八篇論文被接收,覆蓋從智能代理到GPU內核的整個堆棧。這些研究已集成到Together平台中,並在生產環境中應用。

  • 八篇論文被ICML 2026接收,覆蓋全棧AI研究,從代理到GPU內核。
  • DSGym提出了統一的數據科學代理評估和訓練框架,包含1000多個任務。
站內正文

ParallelKernelBench:前沿LLM尚無法編寫快速的多GPU內核

ParallelKernelBench是一個新的基準測試,評估LLM編寫多GPU CUDA內核的能力。在87個真實問題中,最佳模型僅能正確解決不到三分之一,且只有不到四分之一的解決方案優於基線。文章分析了模型失敗的原因,並展示了幾個意外生成的高性能內核案例。

  • ParallelKernelBench(PKB)包含87個來自真實代碼庫的多GPU內核生成問題。
  • 最佳前沿模型(GPT-5.5)在零次學習設置中僅解決28個問題,其中22個快於基線。
站內正文

Kimi K2.7 Code vs Claude Fable 5:着陸頁成本降低94%

我們使用Kimi K2.7 Code和Claude Fable 5生成了12個着陸頁。Kimi的成本降低了94%,且每個頁面的評分僅相差幾分。開源模型不僅更便宜,而且在質量上具有競爭力,差距正在迅速縮小。

  • Kimi K2.7 Code生成着陸頁的成本比Claude Fable 5低約94%。
  • 在質量評分上,Kimi與Fable的差距很小,尤其在使用設計靈感MCP後表現更佳。
站內正文

在企業AI中建立信任:Together AI獲得ISO 27001:2022認證

Together AI已獲得ISO 27001:2022認證,這驗證了我們對企業級安全的承諾,幫助客户在安全、治理良好的基礎設施上運行生產級AI工作負載。

  • Together AI通過A-LIGN認證獲得ISO 27001:2022證書
  • 認證範圍涵蓋全球平台及支持客户數據保護的系統流程
站內正文

高效推理服務MiniMax-M3:解鎖百萬Token上下文與多模態能力,毫無遺憾

Together AI 通過KV塊主稀疏注意力、分頁MSA解碼、優化索引評分內核以及基於Rust的多模態預處理網關等創新,實現了對MiniMax M3模型的高效服務,在不同併發級別下吞吐量提升81%–125%。

  • MiniMax M3 是一款集成編碼、智能體工作流和多模態推理的全能模型,支持1M上下文窗口。
  • Together AI 的推理和內核團隊實現了多項工程突破,包括KV塊主稀疏注意力內核和分頁注意力集成。
站內正文

Together AI如何構建全球最快的語音轉文本技術棧

Together AI通過將語音識別視為端到端系統問題,而非單純的GPU推理問題,在Artificial Analysis榜單上實現了最快的語音轉文本速度。本文詳細介紹了其優化策略:包括針對真實音頻形狀的TensorRT多配置文件引擎、條件CUDA圖消除CPU往返、共享內存減少數據拷貝、事件驅動I/O處理流式傳輸,以及通過gc.freeze()消除垃圾回收尾延遲。

  • Together AI通過全路徑系統優化,而非僅關注GPU推理,實現了最快的語音轉文本性能。
  • 核心技術包括TensorRT多配置文件編碼器、條件CUDA圖解碼器、零拷貝共享內存和事件驅動I/O。
站內正文

大規模推理基準測試:編碼智能體

在編碼代理生產負載下,Together Inference Engine 相比 TensorRT-LLM 每秒令牌數提升 31%,飽和時首令牌延遲提升 2 倍,成本比 Claude Opus 4.6 低 76%。

  • 實際編碼代理工作負載的推理基準測試,重點模擬高併發長上下文場景。
  • Together Inference Engine 在 4 塊 B200 GPU 上實現 31% 更高的 TPS 和更低的 TTFT。
站內正文

Together AI與Pearl Research Labs合作降低AI推理成本

Together AI與Pearl Research Labs合作,推出由Pearl網絡提供支持的Gemma-4-31B-it-pearl推理端點,享受超過25%的折扣。該創新利用有用工作量證明技術,在AI工作負載的同時挖礦產生加密貨幣,從而抵消計算成本。

  • Together AI與Pearl Research Labs合作,推出由Pearl網絡提供支持的折扣推理端點。
  • 該端點利用有用工作量證明技術,在AI推理的同時挖礦產生PRL幣,降低成本。
站內正文

Violin:打破語言障礙的開源視頻翻譯技能

Violin是一個完全開源的AI視頻翻譯工具,結合語音識別、大型語言模型翻譯和語音合成,使視頻內容跨越語言障礙。它提供網絡應用、命令行界面和代理技能,支持視頻內容問答和個性化語音選擇。使用Together API,利用Whisper、DeepSeek和Cartesia等模型,以MIT許可證發佈。

  • Violin將語音識別、LLM翻譯和語音合成整合為開源視頻翻譯工具。
  • 支持網絡應用、CLI和代理技能,適合不同用户羣體。
站內正文

從HuggingFace部署並推理任何模型

學習如何在一個會話中使用Goose和Together的專用容器推理部署任何HuggingFace模型。跳過複雜設置——一個提示就能讓你的模型在發佈當天在生產級GPU環境中運行。

  • 使用Goose和Together的專用容器推理,開發者可以零延遲部署新發布的模型。
  • 作者在Netflix發佈void-model當天成功部署並運行。
站內正文

部署DeepSeek-V4:為何百萬Token上下文是推理系統的問題

DeepSeek-V4通過混合注意力設計(CSA、HCA、SWA)壓縮KV緩存,將百萬Token上下文從模型挑戰轉變為推理系統挑戰。Together AI在NVIDIA HGX B200上的早期部署經驗展示了緩存策略、前綴緩存和端點配置對長上下文工作負載性能的關鍵影響。

  • DeepSeek-V4的壓縮稀疏注意力(CSA)和高度壓縮注意力(HCA)減小了KV緩存大小,但推理引擎需要管理多種緩存佈局。
  • 滑動窗口注意力(SWA)在長上下文時成為性能瓶頸,需謹慎選擇存儲策略。
站內正文

驅動大規模高效推理的基礎研究

隨着AI從研究走向生產,AI原生團隊面臨的挑戰從構建模型轉向高效、可靠、大規模地運行模型。推理成本佔生產AI系統總生命週期成本的80-90%。Together AI通過FlashAttention-4、ATLAS自適應推測解碼等研究,結合全棧硬件優化和智能調度,實現高效推理,幫助客户改善單位經濟效益。

  • 推理成本佔生產AI系統總成本的80-90%,是影響AI公司經濟模型的關鍵因素。
  • Together AI推出FlashAttention-4(比cuDNN快達1.3倍)和ATLAS(自適應推測解碼,提升4倍推理速度)。
站內正文

Together AI 與 Adaption 合作宣佈

Together AI 與 Adaption 合作,將 Together Fine-Tuning 原生集成到 Adaptive Data 平台,幫助團隊優化數據集、運行微調、評估結果並部署更強大的開放模型。

  • Together AI 與 Adaption 合作,將微調功能集成到 Adaptive Data 中。
  • 該合作簡化了從數據優化到模型部署的工作流程。
站內正文

從732字節到無處可逃:在生產環境中關閉Copy Fail漏洞

Together AI 詳細介紹了他們如何迅速應對 Linux 內核漏洞 Copy Fail(CVE-2026-31431),該漏洞允許本地無特權用户通過 AF_ALG 接口獲得精確的4字節寫入原語,從而實現權限提升。團隊通過立即卸載易受攻擊的內核模塊、滾動應用內核補丁,並加強檢測與監控,確保了 AI 基礎設施的安全。

  • Copy Fail(CVE-2026-31431)是 Linux 內核加密子系統中的一個邏輯錯誤,允許本地無特權用户對任意可讀文件的頁緩存實現精確4字節寫入。
  • Together AI 在數小時內卸載了 algif_aead 模塊並移除了模塊文件,阻止了漏洞利用,無需重啓。
站內正文

DeepSeek-V4 Pro 現已登陸 Together AI

DeepSeek-V4 Pro 是一款 1.6 萬億參數的 MoE 推理模型,現已在 Together AI 上線,提供 512K 上下文窗口、可控推理模式(非思考、深度思考、最大思考)以及緩存輸入定價,適用於代碼代理、文檔智能、長上下文代理和研究綜合等場景。

  • 1.6T 參數 MoE 架構,激活參數 49B,Together AI 上提供 512K 上下文(模型支持 1M)
  • 三種推理模式:非思考、深度思考、最大思考,靈活匹配任務難度
站內正文

全部來源