AI News HubLIVE
站內改寫3 分鐘閱讀

2026年7月AI發佈:前沿模型轉變的時間線

2026年7月成為AI前沿模型發佈最密集的月份:Anthropic、OpenAI、Google等四大實驗室相繼推出旗艦或準旗艦模型,新創公司Thinking Machines和Moonshot入局,最大開放權重模型Kimi K3發佈。價格分層、效率優化和開放權重成為關鍵詞,競爭焦點從“最強模型”轉向“能負擔得起的構建”。

來源Analytics Vidhya作者: Vasu Deo Sankrityayan

2026年7月成為前沿模型發佈最繁忙的一個月。四大主要實驗室推出了旗艦或接近旗艦的模型,兩家資金充裕的新入局者發佈了首款模型,史上最大的開放權重模型也開放下載,這一切發生在31天內。若將這些發佈羅列起來,看似混亂;但按時間線來看,一種清晰的模式浮現出來:競爭不再是誰擁有最強大的單一模型,而是誰能在合適的價格下為特定工作提供合適的模型。

6月30日,Anthropic發佈Claude Sonnet 5,以Sonnet的價格提供接近Opus的智能,重點面向智能體編碼和工具使用,而非頭銜性的推理。它並非Anthropic自家產品線中最強的模型,但卻是多數團隊真正會部署的模型。7月1日,Claude Fable 5迴歸。該模型在6月9日發佈,6月12日因美國出口管制指令被暫停,7月1日解除。這是前沿模型首次因政府命令被撤回後又恢復。Fable 5具備常開自適應思維、100萬token上下文,以及針對網絡與生物請求回退到Opus 4.8的安全分類器。

7月9日,OpenAI發佈GPT-5.6,分為三個持久能力層級:Sol(旗艦)、Terra(均衡)、Luna(最快),價格分別為每百萬輸入/輸出token 5/30美元、2.5/15美元、1/6美元。三者共享100萬上下文、128K最大輸出和2026年2月知識截止。Terra尤為引人注目,“GPT-5.5級別的質量,一半價格”。不過基準測試需謹慎:OpenAI稱Sol在Artificial Analysis Coding Agent Index上領先Fable 5達2.8分,但METR指出基準作弊,SWE-Bench Pro上Fable 5得80%,Sol僅64.6%。GPT-5.6最初於6月26日向約20家政府審查組織提供,經商務部審查後才廣泛開放。ChatGPT Work也同步推出。

7月14日,xAI發佈Grok 4.5 for Chat,面向日常用户,強調對話質量、速度和X生態集成,而非研究基準。7月15日,Mira Murati的$120億實驗室Thinking Machines發佈首個Apache 2.0開放權重模型Inkling:975B總參數、41B激活、MoE、100萬上下文,在45萬億token上預訓練。公司坦言並非當前最強模型,賭注在於定製化和避免供應商鎖定。

7月16日,Moonshot通過API發佈Kimi K3,7月26日公開完整權重(比原計劃提前一天)。這是迄今最大開放模型:2.8萬億總參數、104B激活、1,048,576上下文,Modified MIT許可。盲測顯示其在前端編碼上領先美國模型,開放與封閉模型差距縮小到3-5個月。市場反應劇烈:Z.ai股價一度跌30%,MiniMax跌16%,阿里巴巴跌4%,Moonshot日收入至少增長6倍。但4比特精度仍需約1.4TB顯存和至少64個加速器,實際運營者是雲廠商。

7月21日,Google發佈Gemini 3.6 Flash,定價每百萬輸入/輸出1.5/7.5美元(輸出較之前9美元下降),保留100萬上下文,知識截止從2025年1月更新至2026年3月,輸出token減少約17%,DeepSWE從37%升至49%,OSWorld-Verified從78.4%升至83.0%。同日,阿里發佈Qwen-Image-3.0,側重實用性而非美感,支持4500 token提示(約為之前4.5倍),單次生成密集排版,包括報紙頁和學術頁面,10像素下可讀文本,12種語言和20多種字體,並能拉取實時網頁數據。但未提供基準表、參數、許可證、權重或技術報告,其宣稱有待驗證。

7月24日,Anthropic發佈Claude Opus 5,性能接近Fable 5而價格減半:輸入/輸出每百萬5/25美元,對比Fable 5的10/50美元。具備100萬上下文和128K輸出,默認自適應思維,五級努力調節。在多個基準上甚至超越Fable 5。這是Anthropic不到兩個月內第四次Claude 5發佈,表明從轟動性發布轉向快速迭代能力、成本與速度。目前僅Haiku尚未升級到5系列。

總的來説,7月的真正轉變是成本:Terra將旗艦級價格幾乎減半,Gemini 3.6 Flash減少token使用,Opus 5以更低價格接近前沿性能。選擇也在擴大:兩天內出現了兩個強大開放權重模型,每個主要實驗室都提供多個層級。與其説是一系列發佈,不如説是一個轉折點:問題不再是哪個模型最好,而是你最終能負擔得起構建什麼。