AI News HubLIVE
公开文章 36采集文章 37可信度 88刷新频率 5 分钟
健康状态 健康来源类型 官方原文权限 官方原文最近入库 2026-08-07ID together-ai-blog运行状态 已启用

Official source; confirm reuse terms before enabling full body display.

最新公开文章

待翻译:DeepSeek-V4 Flash 0731 vs GPT-5.6 Luna on DeepSWE: Cost and Coding

AI 服务暂时不可用,以下为来源摘要,待恢复后补全翻译:We ran 900 DeepSWE rollouts on DeepSeek-V4 Flash and GPT-5.6 Luna. Luna leads pass@1 by 14 points; DeepSeek delivers 4.8x the solves per dollar.

  • AI 服务暂时不可用,系统已先保留来源内容与降级元数据。
  • We ran 900 DeepSWE rollouts on DeepSeek-V4 Flash and GPT-5.6 Luna. Luna leads pass@1 by 14 points; DeepSeek delivers 4.8x the solves per dollar.
站内正文

Kimi K3 完全开发者指南

Kimi K3 是 Moonshot AI 推出的 2.8 万亿参数开源权重模型,也是首个 3 万亿参数级别的开源模型。本文介绍其架构亮点、Together AI 上的调用方式、推理强度、视觉输入、结构化输出、工具调用与动态工具加载等关键开发要点。

  • Kimi K3 拥有 2.8 万亿参数,是迄今最大的开源权重模型,并支持 1M 上下文。
  • 采用 Kimi Delta Attention、Attention Residuals 与 Stable LatentMoE 等新架构,仅激活 896 个专家中的 16 个。
站内正文

ThunderAgent:大规模合成数据生成的2倍加速智能体推理

ThunderAgent是一种程序感知的智能体推理调度器。通过将每个智能体工作流视为可调度的程序,它消除了KV缓存颠簸,实现了超过2倍的单节点吞吐量和近线性的多节点扩展。

  • 引入程序抽象用于智能体LLM请求调度,消除KV缓存颠簸
  • 在单节点上实现高达2.5倍的吞吐量提升,8节点集群上实现2.4倍加速
站内正文

Together AI宣布与Moonshot AI建立战略合作伙伴关系,原生服务Kimi模型

Together AI与Moonshot AI达成战略合作,成为Moonshot模型发布的启动平台,首款模型为2.8万亿参数的Kimi K3,后续所有开源模型也将登陆Together AI。

  • Together AI成为Moonshot AI模型的启动平台,提供第一时间访问和US托管基础设施。
  • Kimi K3是2.8T参数的稀疏MoE模型,支持视觉和1M上下文,采用Kimi Delta Attention和Attention Residuals等创新架构。
站内正文

配置专用模型推理

Together AI 的专用模型推理架构详解:端点、部署、配置三部分模型,以及基于容量的路由机制。

  • 系统由端点(固定名称)、部署(模型+硬件组合)和配置(不可变配方)三部分组成。
  • 流量路由基于有效容量(权重×就绪副本数),而非固定百分比。
站内正文

Kimi K3 vs GPT-5.6 Sol 在 DeepSWE 上的对比:成本、编码和路由

我们在 DeepSWE 上对 Kimi K3 和 GPT-5.6 Sol 进行了 904 次测试。Sol 在 pass@1 上领先;Kimi K3 在 pass@4 上以每美元解决任务数 2.8 倍的优势胜出,两者之间的路由可达约 85.6%。

  • Sol 的单次通过率(pass@1)为 72.7%,Kimi K3 为 68.5%。
  • Kimi K3 在 pass@4 上达到 89.4%,高于 Sol 的 85.8%。
站内正文

Kimi K3 vs Claude Fable 5:DeepSWE上的成本与编码能力对比

我们在DeepSWE基准上对Kimi K3和Claude Fable 5进行了452次实验。Fable在pass@1上领先1.4个百分点,但Kimi K3在pass@4上胜出,且每美元解决问题的数量是Fable的2.8倍。Kimi K3作为开源模型,成本仅为Fable的三分之一,是追求性价比的理性选择。

  • Kimi K3的pass@1为68.5%,略低于Claude Fable 5的69.9%,但在pass@2和pass@4上反超。
  • Kimi K3每次部署成本为4.65美元,远低于Fable的13.41美元,每美元解决问题的效率是2.8倍。
站内正文

开源权重AI推理的生产平台

Together AI发布了其推理平台的重大更新,为用户提供对性能、成本和质量的完全控制。新功能包括金丝雀部署、A/B测试、自动缩放以及自定义训练的封闭测试版,包含强化学习和微调。

  • 数分钟内部署开源权重模型,具备生产级控制
  • 支持金丝雀、蓝绿和滚动更新,自动回滚
站内正文

Together AI 与 Y Combinator 合作推出首个专为 YC 社区打造的 GPU 集群

Together AI 和 Y Combinator 宣布合作,为 YC 初创公司提供首个专用 GPU 集群,解决计算瓶颈。初创公司可灵活承诺数周而非两年合同,通过自助服务平台直接管理 GPU,无需经过 YC。该集群已满负荷运行,并支持从单节点到大规模扩展的需求。

  • Together AI 与 YC 合作推出首个专用 GPU 集群,YC 初创公司可直接访问计算资源。
  • 承诺期为数周而非两年,释放资本用于业务其他部分。
站内正文

99.9% 的正常运行时间对推理意味着什么?

本文深入解析了推理服务中 99%、99.9% 和 99.99% 正常运行时间所对应的不同故障域,以及每个层级所需的架构设计。作者分享了 Together AI 在构建可靠推理基础设施方面的实践经验,并提供了在选择推理提供商时应提出的关键问题。

  • 每个可靠性层级对应不同的故障域:99% 应对节点故障,99.9% 应对数据中心故障,99.99% 应对区域故障。
  • 实现高可靠性需要主动健康检查、跨设施部署以及预留容量。
站内正文

Together GPU集群新功能:为生产级GPU集群提供可靠性与控制力

Together AI发布一系列更新,旨在提升生产环境GPU集群的可靠性与操作控制。新功能包括被动健康检查、自动节点修复、强化版Slurm-on-K8s栈、集群详情视图、外部OIDC认证、启动脚本以及可选的验收测试。这些改进帮助团队更快发现硬件故障、自动化恢复流程,并提供更细粒度的访问控制和自定义能力。

  • 新增被动健康检查与自动节点修复,实时监测并处理硬件故障,减少停机时间。
  • Slurm-on-K8s 2.0实现自我修复守护进程、持久化作业会计和可靠进程清理,提升调度稳定性。
站内正文

Together AI 在首日即引入 Thinking Machines Lab 的新模型 Inkling

Thinking Machines Lab 发布了 Inkling,一个多模态混合专家模型,专注于高效推理、原生多模态理解和广泛任务适用性。Together AI 在其推理平台上提供该模型,支持可控推理努力、文本/图像/音频输入,以及 1M 上下文窗口。

  • Inkling 是一个多模态 MoE 模型,总参数量 975B,每个 token 激活 40B 参数。
  • 支持文本、图像和音频输入,并具有可控推理能力,允许开发者平衡推理深度、token 使用和延迟。
站内正文

开放、便捷且可预测:推出预留吞吐量功能

Together AI 推出预留吞吐量功能,为 MiniMax M3 和 GLM-5.2 等前沿开放模型提供保留推理容量,采用基于 Token 的定价和 99% 正常运行时间 SLA,成本比专有 API 降低高达 90%。

  • 预留吞吐量提供保留推理容量,无需管理 GPU 小时或基础设施。
  • 基于 Token 的定价,每 PTU 每分钟 0.05 美元,支持输入、缓存输入和输出 Token。
站内正文

宣布8亿美元C轮融资:加速向开源AI的转变

Together AI完成8亿美元C轮融资,由Aramco Ventures、NVIDIA、Vista Equity等领投,旨在加速开源AI的普及。公司强调,闭源模型的成本无法规模化,而开源模型结合全栈优化可实现6-20倍成本降低。Together AI已推出FlashAttention-4、Together Megakernel等创新,成为全球最大的AI token生产商之一。

  • Together AI完成8亿美元C轮融资,用于加速开源AI发展
  • 公司认为闭源模型的成本在规模化应用中不可持续
站内正文

Together AI在ICML 2026:涵盖全栈的前沿研究

Together AI在ICML 2026上有八篇论文被接收,覆盖从智能代理到GPU内核的整个堆栈。这些研究已集成到Together平台中,并在生产环境中应用。

  • 八篇论文被ICML 2026接收,覆盖全栈AI研究,从代理到GPU内核。
  • DSGym提出了统一的数据科学代理评估和训练框架,包含1000多个任务。
站内正文

ParallelKernelBench:前沿LLM尚无法编写快速的多GPU内核

ParallelKernelBench是一个新的基准测试,评估LLM编写多GPU CUDA内核的能力。在87个真实问题中,最佳模型仅能正确解决不到三分之一,且只有不到四分之一的解决方案优于基线。文章分析了模型失败的原因,并展示了几个意外生成的高性能内核案例。

  • ParallelKernelBench(PKB)包含87个来自真实代码库的多GPU内核生成问题。
  • 最佳前沿模型(GPT-5.5)在零次学习设置中仅解决28个问题,其中22个快于基线。
站内正文

Kimi K2.7 Code vs Claude Fable 5:着陆页成本降低94%

我们使用Kimi K2.7 Code和Claude Fable 5生成了12个着陆页。Kimi的成本降低了94%,且每个页面的评分仅相差几分。开源模型不仅更便宜,而且在质量上具有竞争力,差距正在迅速缩小。

  • Kimi K2.7 Code生成着陆页的成本比Claude Fable 5低约94%。
  • 在质量评分上,Kimi与Fable的差距很小,尤其在使用设计灵感MCP后表现更佳。
站内正文

在企业AI中建立信任:Together AI获得ISO 27001:2022认证

Together AI已获得ISO 27001:2022认证,这验证了我们对企业级安全的承诺,帮助客户在安全、治理良好的基础设施上运行生产级AI工作负载。

  • Together AI通过A-LIGN认证获得ISO 27001:2022证书
  • 认证范围涵盖全球平台及支持客户数据保护的系统流程
站内正文

高效推理服务MiniMax-M3:解锁百万Token上下文与多模态能力,毫无遗憾

Together AI 通过KV块主稀疏注意力、分页MSA解码、优化索引评分内核以及基于Rust的多模态预处理网关等创新,实现了对MiniMax M3模型的高效服务,在不同并发级别下吞吐量提升81%–125%。

  • MiniMax M3 是一款集成编码、智能体工作流和多模态推理的全能模型,支持1M上下文窗口。
  • Together AI 的推理和内核团队实现了多项工程突破,包括KV块主稀疏注意力内核和分页注意力集成。
站内正文

Together AI如何构建全球最快的语音转文本技术栈

Together AI通过将语音识别视为端到端系统问题,而非单纯的GPU推理问题,在Artificial Analysis榜单上实现了最快的语音转文本速度。本文详细介绍了其优化策略:包括针对真实音频形状的TensorRT多配置文件引擎、条件CUDA图消除CPU往返、共享内存减少数据拷贝、事件驱动I/O处理流式传输,以及通过gc.freeze()消除垃圾回收尾延迟。

  • Together AI通过全路径系统优化,而非仅关注GPU推理,实现了最快的语音转文本性能。
  • 核心技术包括TensorRT多配置文件编码器、条件CUDA图解码器、零拷贝共享内存和事件驱动I/O。
站内正文

大规模推理基准测试:编码智能体

在编码代理生产负载下,Together Inference Engine 相比 TensorRT-LLM 每秒令牌数提升 31%,饱和时首令牌延迟提升 2 倍,成本比 Claude Opus 4.6 低 76%。

  • 实际编码代理工作负载的推理基准测试,重点模拟高并发长上下文场景。
  • Together Inference Engine 在 4 块 B200 GPU 上实现 31% 更高的 TPS 和更低的 TTFT。
站内正文

Together AI与Pearl Research Labs合作降低AI推理成本

Together AI与Pearl Research Labs合作,推出由Pearl网络提供支持的Gemma-4-31B-it-pearl推理端点,享受超过25%的折扣。该创新利用有用工作量证明技术,在AI工作负载的同时挖矿产生加密货币,从而抵消计算成本。

  • Together AI与Pearl Research Labs合作,推出由Pearl网络提供支持的折扣推理端点。
  • 该端点利用有用工作量证明技术,在AI推理的同时挖矿产生PRL币,降低成本。
站内正文

Violin:打破语言障碍的开源视频翻译技能

Violin是一个完全开源的AI视频翻译工具,结合语音识别、大型语言模型翻译和语音合成,使视频内容跨越语言障碍。它提供网络应用、命令行界面和代理技能,支持视频内容问答和个性化语音选择。使用Together API,利用Whisper、DeepSeek和Cartesia等模型,以MIT许可证发布。

  • Violin将语音识别、LLM翻译和语音合成整合为开源视频翻译工具。
  • 支持网络应用、CLI和代理技能,适合不同用户群体。
站内正文

从HuggingFace部署并推理任何模型

学习如何在一个会话中使用Goose和Together的专用容器推理部署任何HuggingFace模型。跳过复杂设置——一个提示就能让你的模型在发布当天在生产级GPU环境中运行。

  • 使用Goose和Together的专用容器推理,开发者可以零延迟部署新发布的模型。
  • 作者在Netflix发布void-model当天成功部署并运行。
站内正文

部署DeepSeek-V4:为何百万Token上下文是推理系统的问题

DeepSeek-V4通过混合注意力设计(CSA、HCA、SWA)压缩KV缓存,将百万Token上下文从模型挑战转变为推理系统挑战。Together AI在NVIDIA HGX B200上的早期部署经验展示了缓存策略、前缀缓存和端点配置对长上下文工作负载性能的关键影响。

  • DeepSeek-V4的压缩稀疏注意力(CSA)和高度压缩注意力(HCA)减小了KV缓存大小,但推理引擎需要管理多种缓存布局。
  • 滑动窗口注意力(SWA)在长上下文时成为性能瓶颈,需谨慎选择存储策略。
站内正文

驱动大规模高效推理的基础研究

随着AI从研究走向生产,AI原生团队面临的挑战从构建模型转向高效、可靠、大规模地运行模型。推理成本占生产AI系统总生命周期成本的80-90%。Together AI通过FlashAttention-4、ATLAS自适应推测解码等研究,结合全栈硬件优化和智能调度,实现高效推理,帮助客户改善单位经济效益。

  • 推理成本占生产AI系统总成本的80-90%,是影响AI公司经济模型的关键因素。
  • Together AI推出FlashAttention-4(比cuDNN快达1.3倍)和ATLAS(自适应推测解码,提升4倍推理速度)。
站内正文

Together AI 与 Adaption 合作宣布

Together AI 与 Adaption 合作,将 Together Fine-Tuning 原生集成到 Adaptive Data 平台,帮助团队优化数据集、运行微调、评估结果并部署更强大的开放模型。

  • Together AI 与 Adaption 合作,将微调功能集成到 Adaptive Data 中。
  • 该合作简化了从数据优化到模型部署的工作流程。
站内正文

从732字节到无处可逃:在生产环境中关闭Copy Fail漏洞

Together AI 详细介绍了他们如何迅速应对 Linux 内核漏洞 Copy Fail(CVE-2026-31431),该漏洞允许本地无特权用户通过 AF_ALG 接口获得精确的4字节写入原语,从而实现权限提升。团队通过立即卸载易受攻击的内核模块、滚动应用内核补丁,并加强检测与监控,确保了 AI 基础设施的安全。

  • Copy Fail(CVE-2026-31431)是 Linux 内核加密子系统中的一个逻辑错误,允许本地无特权用户对任意可读文件的页缓存实现精确4字节写入。
  • Together AI 在数小时内卸载了 algif_aead 模块并移除了模块文件,阻止了漏洞利用,无需重启。
站内正文

DeepSeek-V4 Pro 现已登陆 Together AI

DeepSeek-V4 Pro 是一款 1.6 万亿参数的 MoE 推理模型,现已在 Together AI 上线,提供 512K 上下文窗口、可控推理模式(非思考、深度思考、最大思考)以及缓存输入定价,适用于代码代理、文档智能、长上下文代理和研究综合等场景。

  • 1.6T 参数 MoE 架构,激活参数 49B,Together AI 上提供 512K 上下文(模型支持 1M)
  • 三种推理模式:非思考、深度思考、最大思考,灵活匹配任务难度
站内正文

全部来源