AI News HubLIVE
站內改寫1 分鐘閱讀

本週AI序列#899:探秘Inkling——一個僅喚醒410億參數的近萬億參數模型

Thinking Machine推出新模型Inkling,擁有9750億參數,但每次僅激活410億參數(約4.2%),通過路由器選擇專家子集實現稀疏計算,大幅提升效率。

來源TheSequence作者: Jesus Rodriguez

Inkling是Thinking Machine日前發佈的新一代AI模型,其架構設計顛覆了傳統大模型的全參數激活模式。該模型並非一個一次性激活全部9750億參數的巨型神經網絡,而是一個巨大的專業能力倉庫。每個輸入token經過時,一個智能路由器會從256個專業模塊中動態選擇出六個與當前任務最相關的模塊,再加上兩個始終參與的通用模塊,組合成一個臨時的工作組進行計算。這種做法使得實際參與計算的參數僅佔總參數的約4.2%,即每個token只激活大約410億參數,大幅降低了計算量和推理成本。

這種稀疏激活架構類似於一所擁有256個院系的大學:當一個問題到來時,調度員不會召集整個大學的所有學者,而是隻召喚與問題相關的幾個院系專家,外加一些常駐的基礎學科教師,他們協作後迅速給出答案。不同的輸入——比如一段Python代碼、一句希臘語短語、一張圖表標籤或一段音頻——會召喚完全不同的專家組合,從而在保持模型巨大容量的同時,實現了高效的推理。

Inkling的誕生為AI模型的設計提供了新思路。它證明了模型能力不必與總參數量的完全激活掛鈎,稀疏架構可以兼顧規模與效率。儘管模型中9750億參數幾乎接近萬億級別,但其每一次推理的實際計算量僅相當於一箇中等規模模型。這意味着在部署時,存儲和網絡傳輸的壓力依然巨大,但計算節點的負擔大大減輕,有望推動更多巨型模型在實際應用中的落地。