待翻譯:DeepSeek-V4 Flash 0731 vs GPT-5.6 Luna on DeepSWE: Cost and Coding 2026-08-06 08:00 UTC+8 AI 服務暫時不可用,以下為來源摘要,待恢復後補全翻譯:We ran 900 DeepSWE rollouts on DeepSeek-V4 Flash and GPT-5.6 Luna. Luna leads pass@1 by 14 points; DeepSeek delivers 4.8x the solves per dollar.
AI 服務暫時不可用,系統已先保留來源內容與降級後設資料。 We ran 900 DeepSWE rollouts on DeepSeek-V4 Flash and GPT-5.6 Luna. Luna leads pass@1 by 14 points; DeepSeek delivers 4.8x the solves per dollar. Kimi K3 完全開發者指南 2026-08-01 08:00 UTC+8 Kimi K3 是 Moonshot AI 推出的 2.8 萬億引數開源權重模型,也是首個 3 萬億引數級別的開源模型。本文介紹其架構亮點、Together AI 上的呼叫方式、推理強度、視覺輸入、結構化輸出、工具呼叫與動態工具載入等關鍵開發要點。
Kimi K3 擁有 2.8 萬億引數,是迄今最大的開源權重模型,並支援 1M 上下文。 採用 Kimi Delta Attention、Attention Residuals 與 Stable LatentMoE 等新架構,僅啟用 896 個專家中的 16 個。 ThunderAgent:大規模合成資料生成的2倍加速智慧體推理 2026-07-29 08:00 UTC+8 ThunderAgent是一種程式感知的智慧體推理排程器。透過將每個智慧體工作流視為可排程的程式,它消除了KV快取顛簸,實現了超過2倍的單節點吞吐量和近線性的多節點擴充套件。
引入程式抽象用於智慧體LLM請求排程,消除KV快取顛簸 在單節點上實現高達2.5倍的吞吐量提升,8節點叢集上實現2.4倍加速 Together AI宣佈與Moonshot AI建立戰略合作伙伴關係,原生服務Kimi模型 2026-07-29 08:00 UTC+8 Together AI與Moonshot AI達成戰略合作,成為Moonshot模型釋出的啟動平臺,首款模型為2.8萬億引數的Kimi K3,後續所有開源模型也將登陸Together AI。
Together AI成為Moonshot AI模型的啟動平臺,提供第一時間訪問和US託管基礎設施。 Kimi K3是2.8T引數的稀疏MoE模型,支援視覺和1M上下文,採用Kimi Delta Attention和Attention Residuals等創新架構。 配置專用模型推理 2026-07-29 08:00 UTC+8 Together AI 的專用模型推理架構詳解:端點、部署、配置三部分模型,以及基於容量的路由機制。
系統由端點(固定名稱)、部署(模型+硬體組合)和配置(不可變配方)三部分組成。 流量路由基於有效容量(權重×就緒副本數),而非固定百分比。 Kimi K3 vs GPT-5.6 Sol 在 DeepSWE 上的對比:成本、編碼和路由 2026-07-26 08:00 UTC+8 我們在 DeepSWE 上對 Kimi K3 和 GPT-5.6 Sol 進行了 904 次測試。Sol 在 pass@1 上領先;Kimi K3 在 pass@4 上以每美元解決任務數 2.8 倍的優勢勝出,兩者之間的路由可達約 85.6%。
Sol 的單次透過率(pass@1)為 72.7%,Kimi K3 為 68.5%。 Kimi K3 在 pass@4 上達到 89.4%,高於 Sol 的 85.8%。 Kimi K3 vs Claude Fable 5:DeepSWE上的成本與編碼能力對比 2026-07-24 08:00 UTC+8 我們在DeepSWE基準上對Kimi K3和Claude Fable 5進行了452次實驗。Fable在pass@1上領先1.4個百分點,但Kimi K3在pass@4上勝出,且每美元解決問題的數量是Fable的2.8倍。Kimi K3作為開源模型,成本僅為Fable的三分之一,是追求價效比的理性選擇。
Kimi K3的pass@1為68.5%,略低於Claude Fable 5的69.9%,但在pass@2和pass@4上反超。 Kimi K3每次部署成本為4.65美元,遠低於Fable的13.41美元,每美元解決問題的效率是2.8倍。 開源權重AI推理的生產平臺 2026-07-23 08:00 UTC+8 Together AI釋出了其推理平臺的重大更新,為使用者提供對效能、成本和質量的完全控制。新功能包括金絲雀部署、A/B測試、自動縮放以及自定義訓練的封閉測試版,包含強化學習和微調。
數分鐘內部署開源權重模型,具備生產級控制 支援金絲雀、藍綠和滾動更新,自動回滾 Together AI 與 Y Combinator 合作推出首個專為 YC 社群打造的 GPU 叢集 2026-07-20 08:00 UTC+8 Together AI 和 Y Combinator 宣佈合作,為 YC 初創公司提供首個專用 GPU 叢集,解決計算瓶頸。初創公司可靈活承諾數週而非兩年合同,透過自助服務平臺直接管理 GPU,無需經過 YC。該叢集已滿負荷執行,並支援從單節點到大規模擴充套件的需求。
Together AI 與 YC 合作推出首個專用 GPU 叢集,YC 初創公司可直接訪問計算資源。 承諾期為數週而非兩年,釋放資本用於業務其他部分。 99.9% 的正常執行時間對推理意味著什麼? 2026-07-16 08:00 UTC+8 本文深入解析了推理服務中 99%、99.9% 和 99.99% 正常執行時間所對應的不同故障域,以及每個層級所需的架構設計。作者分享了 Together AI 在構建可靠推理基礎設施方面的實踐經驗,並提供了在選擇推理提供商時應提出的關鍵問題。
每個可靠性層級對應不同的故障域:99% 應對節點故障,99.9% 應對資料中心故障,99.99% 應對區域故障。 實現高可靠性需要主動健康檢查、跨設施部署以及預留容量。 Together GPU叢集新功能:為生產級GPU叢集提供可靠性與控制力 2026-07-15 08:00 UTC+8 Together AI釋出一系列更新,旨在提升生產環境GPU叢集的可靠性與操作控制。新功能包括被動健康檢查、自動節點修復、強化版Slurm-on-K8s棧、叢集詳情檢視、外部OIDC認證、啟動指令碼以及可選的驗收測試。這些改進幫助團隊更快發現硬體故障、自動化恢復流程,並提供更細粒度的訪問控制和自定義能力。
新增被動健康檢查與自動節點修復,即時監測並處理硬體故障,減少停機時間。 Slurm-on-K8s 2.0實現自我修復守護程序、持久化作業會計和可靠程序清理,提升排程穩定性。 Together AI 在首日即引入 Thinking Machines Lab 的新模型 Inkling 2026-07-15 08:00 UTC+8 Thinking Machines Lab 釋出了 Inkling,一個多模態混合專家模型,專注於高效推理、原生多模態理解和廣泛任務適用性。Together AI 在其推理平臺上提供該模型,支援可控推理努力、文本/影像/音訊輸入,以及 1M 上下文視窗。
Inkling 是一個多模態 MoE 模型,總引數量 975B,每個 token 啟用 40B 引數。 支援文本、影像和音訊輸入,並具有可控推理能力,允許開發者平衡推理深度、token 使用和延遲。 開放、便捷且可預測:推出預留吞吐量功能 2026-07-08 08:00 UTC+8 Together AI 推出預留吞吐量功能,為 MiniMax M3 和 GLM-5.2 等前沿開放模型提供保留推理容量,採用基於 Token 的定價和 99% 正常執行時間 SLA,成本比專有 API 降低高達 90%。
預留吞吐量提供保留推理容量,無需管理 GPU 小時或基礎設施。 基於 Token 的定價,每 PTU 每分鐘 0.05 美元,支援輸入、快取輸入和輸出 Token。 宣佈8億美元C輪融資:加速向開源AI的轉變 2026-07-01 08:00 UTC+8 Together AI完成8億美元C輪融資,由Aramco Ventures、NVIDIA、Vista Equity等領投,旨在加速開源AI的普及。公司強調,閉源模型的成本無法規模化,而開源模型結合全棧最佳化可實現6-20倍成本降低。Together AI已推出FlashAttention-4、Together Megakernel等創新,成為全球最大的AI token生產商之一。
Together AI完成8億美元C輪融資,用於加速開源AI發展 公司認為閉源模型的成本在規模化應用中不可持續 Together AI在ICML 2026:涵蓋全棧的前沿研究 2026-06-30 08:00 UTC+8 Together AI在ICML 2026上有八篇論文被接收,覆蓋從智慧代理到GPU核心的整個堆疊。這些研究已整合到Together平臺中,並在生產環境中應用。
八篇論文被ICML 2026接收,覆蓋全棧AI研究,從代理到GPU核心。 DSGym提出了統一的資料科學代理評估和訓練框架,包含1000多個任務。 ParallelKernelBench:前沿LLM尚無法編寫快速的多GPU核心 2026-06-23 08:00 UTC+8 ParallelKernelBench是一個新的基準測試,評估LLM編寫多GPU CUDA核心的能力。在87個真實問題中,最佳模型僅能正確解決不到三分之一,且只有不到四分之一的解決方案優於基線。文章分析了模型失敗的原因,並展示了幾個意外生成的高效能核心案例。
ParallelKernelBench(PKB)包含87個來自真實程式碼庫的多GPU核心生成問題。 最佳前沿模型(GPT-5.5)在零次學習設定中僅解決28個問題,其中22個快於基線。 Kimi K2.7 Code vs Claude Fable 5:著陸頁成本降低94% 2026-06-17 08:00 UTC+8 我們使用Kimi K2.7 Code和Claude Fable 5生成了12個著陸頁。Kimi的成本降低了94%,且每個頁面的評分僅相差幾分。開源模型不僅更便宜,而且在質量上具有競爭力,差距正在迅速縮小。
Kimi K2.7 Code生成著陸頁的成本比Claude Fable 5低約94%。 在質量評分上,Kimi與Fable的差距很小,尤其在使用設計靈感MCP後表現更佳。 在企業AI中建立信任:Together AI獲得ISO 27001:2022認證 2026-06-10 08:00 UTC+8 Together AI已獲得ISO 27001:2022認證,這驗證了我們對企業級安全的承諾,幫助客戶在安全、治理良好的基礎設施上執行生產級AI工作負載。
Together AI透過A-LIGN認證獲得ISO 27001:2022證書 認證範圍涵蓋全球平臺及支援客戶資料保護的系統流程 高效推理服務MiniMax-M3:解鎖百萬Token上下文與多模態能力,毫無遺憾 2026-06-02 08:00 UTC+8 Together AI 透過KV塊主稀疏注意力、分頁MSA解碼、最佳化索引評分核心以及基於Rust的多模態預處理閘道器等創新,實現了對MiniMax M3模型的高效服務,在不同併發級別下吞吐量提升81%–125%。
MiniMax M3 是一款整合編碼、智慧體工作流和多模態推理的全能模型,支援1M上下文視窗。 Together AI 的推理和核心團隊實現了多項工程突破,包括KV塊主稀疏注意力核心和分頁注意力整合。 Together AI如何構建全球最快的語音轉文本技術棧 2026-05-29 08:00 UTC+8 Together AI透過將語音識別視為端到端系統問題,而非單純的GPU推理問題,在Artificial Analysis榜單上實現了最快的語音轉文本速度。本文詳細介紹了其最佳化策略:包括針對真實音訊形狀的TensorRT多配置檔案引擎、條件CUDA圖消除CPU往返、共享記憶體減少資料複製、事件驅動I/O處理流式傳輸,以及透過gc.freeze()消除垃圾回收尾延遲。
Together AI透過全路徑系統最佳化,而非僅關注GPU推理,實現了最快的語音轉文本效能。 核心技術包括TensorRT多配置檔案編碼器、條件CUDA圖解碼器、零複製共享記憶體和事件驅動I/O。 大規模推理基準測試:編碼智慧體 2026-05-19 08:00 UTC+8 在編碼代理生產負載下,Together Inference Engine 相比 TensorRT-LLM 每秒令牌數提升 31%,飽和時首令牌延遲提升 2 倍,成本比 Claude Opus 4.6 低 76%。
實際編碼代理工作負載的推理基準測試,重點模擬高併發長上下文場景。 Together Inference Engine 在 4 塊 B200 GPU 上實現 31% 更高的 TPS 和更低的 TTFT。 Together AI與Pearl Research Labs合作降低AI推理成本 2026-05-15 08:00 UTC+8 Together AI與Pearl Research Labs合作,推出由Pearl網路提供支援的Gemma-4-31B-it-pearl推理端點,享受超過25%的折扣。該創新利用有用工作量證明技術,在AI工作負載的同時挖礦產生加密貨幣,從而抵消計算成本。
Together AI與Pearl Research Labs合作,推出由Pearl網路提供支援的折扣推理端點。 該端點利用有用工作量證明技術,在AI推理的同時挖礦產生PRL幣,降低成本。 Violin:打破語言障礙的開源影片翻譯技能 2026-05-14 08:00 UTC+8 Violin是一個完全開源的AI影片翻譯工具,結合語音識別、大型語言模型翻譯和語音合成,使影片內容跨越語言障礙。它提供網路應用、命令列介面和代理技能,支援影片內容問答和個性化語音選擇。使用Together API,利用Whisper、DeepSeek和Cartesia等模型,以MIT許可證釋出。
Violin將語音識別、LLM翻譯和語音合成整合為開源影片翻譯工具。 支援網路應用、CLI和代理技能,適合不同使用者群體。 語音查詢器——一款可從600多種語音中快速為您的應用找到合適語音的新工具 2026-05-12 08:00 UTC+8 語音查詢器讓開發者能夠透過自然語言提示或上傳音訊樣本,搜尋、匹配、篩選和試聽Together AI TTS模型中的600多種語音。
支援對600+語音進行搜尋、篩選和試聽 可透過文本描述或上傳音訊樣本查詢相似語音 從HuggingFace部署並推理任何模型 2026-05-08 08:00 UTC+8 學習如何在一個會話中使用Goose和Together的專用容器推理部署任何HuggingFace模型。跳過複雜設定——一個提示就能讓你的模型在釋出當天在生產級GPU環境中執行。
使用Goose和Together的專用容器推理,開發者可以零延遲部署新發布的模型。 作者在Netflix釋出void-model當天成功部署並執行。 部署DeepSeek-V4:為何百萬Token上下文是推理系統的問題 2026-05-08 08:00 UTC+8 DeepSeek-V4透過混合注意力設計(CSA、HCA、SWA)壓縮KV快取,將百萬Token上下文從模型挑戰轉變為推理系統挑戰。Together AI在NVIDIA HGX B200上的早期部署經驗展示了快取策略、字首快取和端點配置對長上下文工作負載效能的關鍵影響。
DeepSeek-V4的壓縮稀疏注意力(CSA)和高度壓縮注意力(HCA)減小了KV快取大小,但推理引擎需要管理多種快取佈局。 滑動視窗注意力(SWA)在長上下文時成為效能瓶頸,需謹慎選擇儲存策略。 驅動大規模高效推理的基礎研究 2026-05-04 08:00 UTC+8 隨著AI從研究走向生產,AI原生團隊面臨的挑戰從構建模型轉向高效、可靠、大規模地執行模型。推理成本佔生產AI系統總生命週期成本的80-90%。Together AI透過FlashAttention-4、ATLAS自適應推測解碼等研究,結合全棧硬體最佳化和智慧排程,實現高效推理,幫助客戶改善單位經濟效益。
推理成本佔生產AI系統總成本的80-90%,是影響AI公司經濟模型的關鍵因素。 Together AI推出FlashAttention-4(比cuDNN快達1.3倍)和ATLAS(自適應推測解碼,提升4倍推理速度)。 Together AI 與 Adaption 合作宣佈 2026-04-30 08:00 UTC+8 Together AI 與 Adaption 合作,將 Together Fine-Tuning 原生整合到 Adaptive Data 平臺,幫助團隊最佳化資料集、執行微調、評估結果並部署更強大的開放模型。
Together AI 與 Adaption 合作,將微調功能整合到 Adaptive Data 中。 該合作簡化了從資料最佳化到模型部署的工作流程。 從732位元組到無處可逃:在生產環境中關閉Copy Fail漏洞 2026-04-30 08:00 UTC+8 Together AI 詳細介紹了他們如何迅速應對 Linux 核心漏洞 Copy Fail(CVE-2026-31431),該漏洞允許本地無特權使用者透過 AF_ALG 介面獲得精確的4位元組寫入原語,從而實現許可權提升。團隊透過立即解除安裝易受攻擊的核心模組、滾動應用核心補丁,並加強檢測與監控,確保了 AI 基礎設施的安全。
Copy Fail(CVE-2026-31431)是 Linux 核心加密子系統中的一個邏輯錯誤,允許本地無特權使用者對任意可讀檔案的頁快取實現精確4位元組寫入。 Together AI 在數小時內解除安裝了 algif_aead 模組並移除了模組檔案,阻止了漏洞利用,無需重啟。 DeepSeek-V4 Pro 現已登陸 Together AI 2026-04-29 08:00 UTC+8 DeepSeek-V4 Pro 是一款 1.6 萬億引數的 MoE 推理模型,現已在 Together AI 上線,提供 512K 上下文視窗、可控推理模式(非思考、深度思考、最大思考)以及快取輸入定價,適用於程式碼代理、文件智慧、長上下文代理和研究綜合等場景。
1.6T 引數 MoE 架構,啟用引數 49B,Together AI 上提供 512K 上下文(模型支援 1M) 三種推理模式:非思考、深度思考、最大思考,靈活匹配任務難度