AI News HubLIVE
站內改寫6 分鐘閱讀

重生之我在AI時代當老闆:讓一群Agent互相PUA

MiniMax推出Mavis,一個多Agent團隊系統,包含Leader、Worker、Verifier角色,能自主拆解任務、分工協作並迭代,無需使用者頻繁干預。文章透過HTML專題頁製作案例,展示了多Agent在長程任務中的優勢,並探討了架構設計、成本權衡及未來開源計劃。

來源量子位作者: Jay

重生之我在AI時代當老闆:讓一群Agent互相PUA – 量子位

重生之我在AI時代當老闆:讓一群Agent互相PUA

Jay 2026-05-14 19:14:25

來源:量子位

Team,從來不是預設選項

Jay 發自 凹非寺

量子位 | 公眾號 QbitAI

終於,不用一直對AI說「繼續」了……

剛剛,MiniMax推出了新Agent。

Mavis,MiniMax as a Jarvis。

有意思的名字。

想了解一下,但有點懶,不太想看技術blog。

正好最近不是流行用AI做HTML嗎,我就給它丟了這麼一個任務:

基於Mavis的blog,做一個能放進文章展示的HTML專題頁。

對,就這麼一句話,沒咋認真想prompt。

然後趁它在思考,我去午睡了。想著睡醒再給feedback。

結果我起來,開啟一看,發現它竟然回了一句:

完成了。

不是??

從收到Prompt到交付,完全沒停,一口氣跑了整整28分鐘。

真就交付的HTML,圖文並茂能互動的那種。

不過,我一瞟側邊欄,不對勁。

怎麼冒出來這麼多對話方塊??

我記得我就開了一個啊???

點進去看才發現,原來這都是Mavis自己組的團隊。它們一直在內部交流、開會、分配任務……

說真的,這一下,終於體會到了當老闆的感覺。

使喚人太爽了。更別說使喚這麼多人,還可以讓Mavis唱紅臉,幫我PUA。

(bushi)

這是MiniMax全新的Agent產品。

嚴謹點說,是一群Agent。

一群Agent幫我做了個HTML專題頁

說實話,我自己都覺得最開始給的這個prompt,有點「不負責任」。

只給了一個目標,沒有給每一步的具體指令。

如果按照正常的習慣,我一般會跟AI反覆溝通很多次,精研細琢,最後讓它生成一份完整的Plan。

但出乎意料的是,這次真就One Take,啥額外的指示都沒有給,最後就拿到結果了。

我去看了看部落格,發現其中的秘訣在於Agent Team。

啥是Agent Team?

其實就是團隊分工,Mavis這有三個角色:Leader負責統籌全域性,Worker負責具體執行,Verifier負責驗收質量。

比如這個叫Mavis的,就是Leader,它是我的第一話事人,會指揮其他Agent幹活。

沒想到啊沒想到,矽基生物也玩起「上下級」這一套了。

這樣最大的一個好處就是,使用者只需要「會跟負責人說話」,不需要是提示詞工程師。

中間的拆解、分工、迭代,全部交給Agent Team自己搞定。

首先是Leader收到任務,然後做任務拆解,把一個大目標拆成若干子任務。

接著,每個子任務分配給不同角色的Agent牛馬。

我這個任務用到了3個Worker。

一個負責內容創作,一個負責設計,一個程式設計師負責生成HTML。

中間呢,還會有個叫Verifier的介入驗收。

從事實準確性、頁面可讀性、程式碼可執行性……這幾個角度入手監督,並最終生成驗收報告。

下面就是驗收時間!

帶大家簡單看看,我的Mavis最終做出來的HTML專題頁。

仔細看,竟然還是星塵背景的,有粒子動效。

Mavis自己開盒自己的工作流,以這種step時間線的方式呈現,中間這條線還是脈衝的。

還有個使用場景介面,真幫我大忙了,如果用文字方式呈現的話,不知道得寫多長。

大家自己看吧,哪些任務適合Agent Team做。

甚至在最後,又貼心準備了下載連結,自己宣傳自己這一塊。

說實話,如果單Agent來做這件事,我大概要說十幾次「繼續」,還得在過程中反覆糾錯。

但現在這些全被Agent Team內部消化了。

效果好是一方面,另一方面,看它們自己嘰裡咕嚕工作還挺有意思。

像角色扮演一樣,相當有情緒價值了。

主要讓我的Leader,PUA其他Agent,真有點爽。

你是一個高階前端開發。今天早上你交付了一個index-v2.html,現在被老闆罵得狗血淋頭。

原話:這個什麼破頁面?做完你自己照著截個圖看看,好意思說是科技公司產品專題頁?配色暗沉得像上世紀的財務軟體,動畫只有一個脈衝點在那裡……

(ps:這不是我的原話啊!汙衊,明明是它自己想的!!)

最後回到大家最關心的問題——

價格咋樣啊?

畢竟聽到多Agent工作流,第一反應肯定是:這得多貴?Token無限流咱可遭不住啊。

當然了,多Agent肯定比單Agent的Token消耗大。

這沒辦法,就跟用HTML替代Markdown一樣,好的體驗就是要付費的,也正常。

但我覺得,最關鍵的,還是在於實際效果如何。

如果效果好,能節省時間,也賺了。

而且MiniMax這次也挺實在。

TokenPlan和Agent Plan,合併了。

一份訂閱,CLI、API、Agent全打通,M2.7、音樂、影片、語音所有模型都包含在內。

Credits額度在Agent和API之間共享,一份錢幹兩份事。

之前同時訂閱了兩個Plan的使用者,額外贈送一個月會員。

為什麼一個AI不夠用了?

之所以這麼興奮,是因為這真是困擾我許久的使用痛點。

如果你也是一名vibe coding愛好者,你一定經歷過這三個崩潰瞬間——

△圖為AI生成

崩潰一:Agent總偷懶。

你讓AI寫一篇報告,它寫了3段就停下來——

我已經完成了1/2/3,需要繼續嗎?

像聽不懂話一樣!!

你說繼續,它又停。再說繼續,又停。

一個晚上下來,你有一半時間在打「繼續」「繼續」「繼續」……

崩潰二:長任務越跑越笨。

一開始它像個聰明助手,跑著跑著,變成了你在帶一個很忙但容易分心的人。

你得不斷追問——剛才那條要求還記得嗎?你為什麼又把研究任務寫成產品營銷了?

崩潰三:冷暴力……

在微信/飛書裡給AI發訊息,要麼30秒丟一個淺答案,要麼你盯著對話方塊等10分鐘沒任何反饋。

不是,你咋不回我了,幹到哪了啊??

這是我經常在IM跟小龍蝦發的高頻詞。

這三個場景,應該所有重度AI使用者都經歷過。

所以,長程任務到底難在哪?

這次MiniMax在技術部落格中,也給出了答案。

△圖為AI生成

簡單來說,這就是單Agent出生就帶著的“魔咒”。

主要還是上下文的問題。

首先,單Agent有上下文焦慮。

這其實是個很深層的話題。對於超長任務的訓練本身需要投入大量的金錢、時間成本和演算法最佳化,大家沒那麼多資源向這塊傾斜。

這就導致,模型對於「超長任務什麼時候該停」的判斷,普遍是模糊的。

它不知道一個任務什麼時候算「做完」,所以一直怕做錯,怕給Token幹崩了,幹一半就停下問。

這就像讓一個很謹慎的實習生做事,每完成一步都要請示一下。

關鍵是,即便說像不要錢一樣,瘋狂灌上下文,效果也並不好。

這在目前是無解的。

底層注意力的問題,隨著上下文越來越長,Agent會從一個聰明助手變成了一個容易走神的人。

只能隨時壓縮上下文。

但這肯定會丟掉一些資訊,而且很容易讓使用者焦慮。

更麻煩的是,單Agent很難形成自我制衡。

它可能很真誠地自檢,但檢查的仍然是自己剛剛構造出來的東西。

畢竟,又當選手又當裁判,做得對不對確實很難評判。

最後的最後,還有一個很現實的問題——

單Agent沒法快速響應長程任務。

你甚至就沒法跟它做長程的事。因為它一旦幹起活來,不太好透過IM跟它交流。

長任務和當前對話綁在同一個上下文裡,如果放任新訊息進來,容易干擾原來的任務。

但如果不引導,又只能乾等著。

這就很尷尬。

歸根結底,這些不是模型能力問題。

是架構問題。

所以回到Mavis,它們的Agent Team其實就是衝著這個架構來的。

思路很直接:一個主Agent牽頭,Leader、Worker、Verifier三類角色分工合作。

這裡有一個關鍵的設計——Worker和Verifier之間是對抗關係。

Worker停止的條件是Verifier啟動的原因,Verifier停止的條件是儘可能發現Worker的問題,而發現的問題又成為Worker重新啟動的原因。

類似企業裡研發和質量部門的關係,透過多輪對抗式迭代,交付高質量的結果。

不需要CEO(也就是你)事無鉅細地介入。

而這個底層,是一個狀態機,叫做Team Engine。

什麼時候該驗證、什麼時候該重試、什麼時候該停止……都是引擎層面的硬性約束,不靠模型自由發揮。

這樣,協作關係也不再被限制為一次函式呼叫,而是變成主動推送、按需查詢的多輪互動。

最後,再說一個我覺得很酷的設計:

Agent與人類同權。

使用者可以對Agent進行prompt、spawn、abort、kill這些操作,Agent自己也有能力對另一個Agent做同樣的事情。

真正操作Agent的渠道可以是使用者、其他Agent或Team Engine。

走的是同一套協議。誰做了什麼、有沒有越權,都可以審計追溯。

當然,涉及到高風險的節點,還是得human in the loop。

那把這些事情做完後,能實現什麼效果?

就是徹底解決掉上面提到的三個崩潰。

1、不再停下來問你。

Leader統籌全域性目標,Worker只管執行子任務,停止條件由Team Engine控制,不再是模型自己模糊地判斷「夠了嗎」。

2、不再越跑越笨。

每個Worker上下文隔離,查資料的不會被寫程式碼的資訊汙染。Verifier用獨立視角審查,不是自己檢查自己。

3、IM再不會不回訊息。

(ps:記得要先給許可權)

主Agent先秒回確認收到,具體任務拆到後臺並行執行,關鍵節點主動彙報。

你甚至可以中途加需求:

我剛想到一個新方向,巴拉巴拉……你順便幫我查一下。

主Agent可以馬上回:

好的,我現在再開啟一組Agent研究,有新的進展隨時彙報。

順便和你交代一下,已經在執行的任務中完成了2/5,剩下的有2個在核查,還有1個在跑。

說真的,這個體驗,太省心了……

像極了一個飛書時刻線上的同事,完全不需要加急。

多Agent時代,需要管理

以前我們總在琢磨怎麼把一個Agent「養」成超人。希望它更聰明、更全能,什麼都能幹。

但有時候我也會想,Agent的能力或許天生就是有限的,AI從來沒有電影裡那麼全知全能。

既然如此,其實也不該給單個Agent太大的壓力。

這也是Mavis這次給我的最大感觸。

除了模型本身的升級,Agent架構的更新,其實也能帶來巨大的體驗提升。

而且把目光放回眼前,比起一個遙不可及的AGI,我們的確更迫切地需要適配於實際應用場景的Harness。

但這也意味著,人機互動另一方的我們,也得相應地改變自己的工作習慣和思考方式。

你現在不是在跟一個AI聊天。

你在管理一個團隊。

多Agent時代,每個人都要學著去擔任那個更高的角色。

MiniMax的設計也指向這個方向。

在他們的設想裡,後續Agent產品會讓人類更多透過管理面板去配置Agent角色、能力和邊界,分配任務。

此時真正重要的能力,就不止是單純地寫提示詞了。

△圖為AI生成

最後,咱還是現實點,說回「經濟性」。

在算力不夠用的當下,每個Token都有實實在在的價格標籤,token消耗和效果是個無法規避的trade off。

其實,MiniMax在blog裡也有一段專門講這件事——

他們沒有迴避多Agent「貴」。

交接要成本,共享要成本,聚合也要成本……當然。

但問題是,研究Agent收來幾十個網頁,交接給寫作Agent的時候,資訊需要被重新組織——

很難。

這些不是「模型再大一點」就能解決的。

有些事情,就是得上多Agent才能解決的。

所以,MiniMax的思路一直是實用優先。

正視成本,不代表就要因噎廢食,而是要透過工程框架來把控ROI。

Team Engine就是這個作用:判斷什麼時候需要Agent Team、什麼時候單Agent就夠了。

有一篇論文,叫Cost of Consensus。

其中有一個反直覺發現:在特定模型和同質debate設定下,多Agent的token消耗可能達到單Agent自我修正的2.1到3.4倍。

而準確率,卻沒有提升。

沒有結構、沒有驗證、沒有停止條件的「多Agent」,就是在浪費Token。

那不叫團隊合作,那叫AI聊天室。

Team,從來不是預設選項。

對於簡單任務而言,單Agent綽綽有餘。

甚至有些時候指令碼就夠了。

不是所有事都要開會。

但當你真的需要開會的時候,有一個靠譜的團隊,肯定比一個人閉門造車強。

對了。

MiniMax說會開源這個Agent Team,預計會和MiniMax M3一起放出來。

桌面端下載:agent.minimaxi.com/download

版權所有,未經授權不得以任何形式轉載及使用,違者必究。

Jay

所有實驗室都怕位元組,所有人都在誇DeepSeek!美國研究員36小時中國AI行2026-05-08

Markdown要涼…卡帕西也站HTML了2026-05-12

第一批「AI原生」本科生,要畢業了2026-05-08

DeepSeek V4最大的遺憾2026-05-03

熱門文章

原生Agent殺入畫布!一站式搞定專業創作,全程可控、不抽卡

2026-05-07

00後下場整頓Agent:啥都不學就能用好AI,這才是正確開啟方式

2026-05-07

兩項AI政策釋出,正規化智慧戰略佈局與產業方向高度契合

2026-05-09

太初元碁攜龍蝦一體機亮相北京科博會

2026-05-09

階躍最新語音模型位列 Artificial Analysis 評測榜中國第一

2026-05-09

掃碼關注量子位

量子位 QbitAI 版權所有©北京極客夥伴科技有限公司 京ICP備17005886號-1