AI News HubLIVE
站內改寫4 分鐘閱讀

頂流裡最快!智譜,你是在「噴」程式碼吧

智譜AI釋出GLM-5.1-highspeed高速API,速度達400 tokens/s,成為頂流模型中最快。實測顯示其程式碼生成如噴射,可即時互動調參、改變遊戲世界、快速處理萬字內容。背後是推理引擎、排程系統和基礎設施的系統工程最佳化,推動AI Agent進入快時代。

來源量子位作者: 十三

頂流裡最快!智譜,你是在「噴」程式碼吧 – 量子位

頂流裡最快!智譜,你是在「噴」程式碼吧

十三 2026-05-22 11:05:00

來源:量子位

400 tokens/s

金磊 發自 凹非寺

量子位 | 公眾號 QbitAI

AI啊,你這速度簡直是在噴射啊!

仔細看,千萬別眨眼:

影片地址:

https://mp.weixin.qq.com/s/Wn1-SzjpEkQLTyZnJKDRwg

這麼多的程式碼,直接就是“啪的一下”噴出來的感覺。

之前AI寫程式碼像CPU渲圖一樣,是一點一點打出來;但這個AI寫程式碼,更像GPU:

這麼快生成的程式碼,能好用嗎?

答案是可以的:

這就是智譜剛剛新出的高速版API——GLM-5.1-highspeed。

按照官方的說法,這個旗艦版模型的API,是目前頂流模型裡最快的,已經達到了400 tokens/s!

而且這個GLM-5.1啊,雖然已經出了一個多月了,但現在還是開源模型裡Coding最強的那一個:

那麼接下來,老規矩,一波實測走起~

一手實測GLM-5.1-highspeed

AI寫程式碼像開了倍速

我們先來做一個比開頭更加複雜的例子,Prompt是這樣的:

做一個網頁,畫面中心是一個會呼吸的星雲;使用者點選播放後,粒子會隨著模擬音訊節奏擴散、聚合、變色;旁邊還要有幾個可調引數,比如速度、密度、拖尾、光暈強度。

影片地址:

https://mp.weixin.qq.com/s/Wn1-SzjpEkQLTyZnJKDRwg

同樣的,如此多行的程式碼,AI在思考了十幾秒後,依舊是一口氣給噴出來的。

這類任務的難點在於,它要同時處理前端結構、Canvas 動畫、狀態管理、視覺引數、互動邏輯,還要讓效果看起來不至於太low。

從結果上來看,確實也是達到了Prompt的要求:

像跟設計師坐在同一塊畫布前

第二個測試更有意思。

我們在上一個程式碼基礎上,繼續提出更多要求:

“這個波紋再快一點。”

“光暈顏色偏暖一些。”

“粒子散開時別那麼硬,柔一點。”

“背景不要全黑,稍微有一點深藍層次。”

影片地址:

https://mp.weixin.qq.com/s/Wn1-SzjpEkQLTyZnJKDRwg

首先,我們的這些指令都是比較模糊的,並非像“把第42行的speed從0.6改成1.2”這麼精確,所以模型需要先精準地理解我們的意圖。

其次,由於GLM-5.1-highspeed的速度夠快,我們做專案的體感都不一樣了——

更像是和AI坐一起,一塊盯著畫布調參。

這也是高速API容易被低估的地方,和AI一起共事做專案,現在更接近即時的感覺了。

讓模型當遊戲導演

第三個測試,我們把場景再往前推一步。

如果模型足夠快,它能不能在遊戲裡即時改變世界?

比如做一個小型2D遊戲:

玩家控制一個角色在3D地圖裡移動,場景中有障礙、敵人、道具、天氣、光照和隨機事件。有對話方塊可以輸入文字,場景會根據輸入的文字即時改變。

然後我們不給模型固定指令碼,而是不斷髮出類似導演指令:

“下雪”、“下雨”、“爆炸”……

影片地址:

https://mp.weixin.qq.com/s/Wn1-SzjpEkQLTyZnJKDRwg

這類測試比寫網頁更刁鑽。

因為模型要理解遊戲狀態、程式碼結構、互動邏輯,還要判斷什麼改動會影響體驗。

而高速API讓此前因延遲而難以成立的產品形態變得可行,例如模型在遊戲中即時改變遊戲世界狀態。

當然,這裡還有很多工程問題沒解決,比如穩定性、安全邊界、狀態一致性、成本和併發。但至少從速度維度看,400 tokens/s級別的API已經讓這類想象不再只停留在 PPT 裡。

10秒處理萬字內容

第四個實測,我們回到內容行業。

我們用AI讀取一份萬字長文的內容素材,讓它一口氣執行下面的內容:

提煉3句最吸睛的海報主標題;

生成6條15字內短影片口播文案;

輸出三套產品宣傳語(適合官網首頁);

生成可直接發公眾號的文案(800字);

最後生成JSON格式彙總所有內容。

影片地址:

https://mp.weixin.qq.com/s/Wn1-SzjpEkQLTyZnJKDRwg

只花了10秒鐘!

而且效果也是依舊穩穩地拿捏到位了:

在AI的速度上來之後,讓人類更快地進入到了判斷的環節;由此,人和AI的協作更接近來回打磨了。而非一次性下單。

Agent進入快時代

如果只看400 tokens/s這個數字,我們可能很容易把它理解成模型變小了,所以跑得快。

但實際上,GLM-5.1-highspeed更值得關注的點在於,它主打旗艦模型高速版,而不是一個單純追求低延遲的小模型。

這背後靠的是系統工程。

智譜GLM團隊與TileRT團隊聯合打造GLM-5.1-highspeed,在推理引擎、排程系統和底層基礎設施三個層面做了最佳化:

推理引擎針對GLM-5.1架構特點重寫核心推理路徑,排程系統透過動態批處理、請求合併、KV快取排程等方式降低高併發場景尾延遲,基礎設施層面則圍繞推理叢集部署、網路鏈路和負載均衡做協同最佳化。

簡單理解,大模型推理不是GPU算一下就完事。

真實線上系統裡,請求怎麼排隊,怎麼合併,KV 快取怎麼排程,多卡之間怎麼通訊,網路鏈路怎麼負載均衡,都會影響最終延遲。

TileRT的思路更進一步。

它把推理排程單元從傳統operator/kernel進一步下沉到tile級別,透過編譯期靜態編排、常駐GPU的persistent Engine Kernel、減少host排程和跨運算元同步等方式,壓縮推理過程裡的排程、搬運與同步開銷。

用一句更通俗的話,可以這樣理解:

過去像一群工人每搬一塊磚都要等工頭髮一次指令;現在提前把路線、分工、節奏排好,讓工人持續在工地裡流水線協作。

大模型推理速度的提升,很多時候不只來自更強的晶片,也來自對系統裡每一個空轉環節的壓榨。

高速API的競爭,本質上是模型能力、推理引擎、排程系統和基礎設施的綜合戰。

當然,速度不能被神化。

一個API真要進入生產環境,還要看模型質量、穩定性、成本、上下文能力、工具呼叫可靠性、併發能力,以及複雜任務裡的錯誤率。

尤其是400 tokens/s這樣的速度數字,也需要在更多工、更多時段、更多併發條件下持續驗證。

但至少從這次測試可以看到一個明確趨勢:

國產大模型API的競爭,正在從能不能答得好,進一步走向能不能又快又穩地幹活。

GLM-5.1-highspeed的意義,也正在這裡。

它讓我們看到,當旗艦模型能力和高速推理系統疊在一起,AI Agent的體驗會出現一個很直觀的變化:等待變少,反饋變密,任務推進更連續。

Coding時代,速度是爽點。

版權所有,未經授權不得以任何形式轉載及使用,違者必究。

Coding GLM-5.1 智譜

十三

國產GPU組了個開源局,把SGLang等核心開發者都搖來了!2026-05-14

國產GPU開始造世界!國內首個全棧具身智慧模擬平臺來了2026-05-19

國內首家百億估值純推理GPU獨角獸誕生!專訪曦望聯席CEO王湛:誰的推理成本更低誰就是贏家2026-04-23

剛剛,“雲端計算一哥”版龍蝦釋出,奧特曼打著官司也要雲站臺2026-04-29

相關閱讀

厲害了,智譜造了全球首個手機通用Agent!人人免費,APP甚至直接操控雲電腦

跨APP,邊聊邊幹活

一水2025-08-20

手機Agent 智譜

國產AI可以拍微電影了!4K、60幀高畫質畫質,自帶音效

現在就差時長了

十三2024-11-08

人工智慧 智譜 影片生成

曝智譜AI以200億人民幣估值尋求新一輪融資

剛推出第三代基座大模型ChatGLM3

衡宇2023-11-10

AI大模型 大模型 智譜

一手實測首個龍蝦模型:長路徑任務不失誤,一人包攬全棧開發

還有龍蝦專屬套餐

克雷西2026-03-16

OpenClaw 智譜

楊植麟當主持人的大模型圓桌:張鵬羅福莉夏立雪都放開說了

中國大模型頂流都來了!

聽雨2026-03-27

Agent AI Kimi 人工智慧 小米 開源 智譜 龍蝦

GLM-5真夠頂的:超24小時自己跑程式碼,700次工具呼叫、800次切上下文!

前兩天的熱度還是保守了

十三2026-02-14

GLM-5 開源AI 智譜

熱門文章

奧特曼投的晶片漲瘋了,今年最大科技IPO

2026-05-16

不用再找了,AI落地最全的實戰打法,都在亦莊這場大會里

2026-05-16

蝦馬之後又火一個!OpenHuman用20分鐘瞭解你的一切,存成卡帕西式知識庫

2026-05-16

別讓模型燒Token了!GitHub 20k星神作:把全網變成命令列

2026-05-16

Agent、多模態、應用、算力一天看盡,峰會亮點在此|5.20日,來現場一起AI

2026-05-17

掃碼關注量子位

量子位 QbitAI 版權所有©北京極客夥伴科技有限公司 京ICP備17005886號-1