AI News HubLIVE
站内改写1 分钟阅读

本周AI序列#899:探秘Inkling——一个仅唤醒410亿参数的近万亿参数模型

Thinking Machine推出新模型Inkling,拥有9750亿参数,但每次仅激活410亿参数(约4.2%),通过路由器选择专家子集实现稀疏计算,大幅提升效率。

来源TheSequence作者: Jesus Rodriguez

Inkling是Thinking Machine日前发布的新一代AI模型,其架构设计颠覆了传统大模型的全参数激活模式。该模型并非一个一次性激活全部9750亿参数的巨型神经网络,而是一个巨大的专业能力仓库。每个输入token经过时,一个智能路由器会从256个专业模块中动态选择出六个与当前任务最相关的模块,再加上两个始终参与的通用模块,组合成一个临时的工作组进行计算。这种做法使得实际参与计算的参数仅占总参数的约4.2%,即每个token只激活大约410亿参数,大幅降低了计算量和推理成本。

这种稀疏激活架构类似于一所拥有256个院系的大学:当一个问题到来时,调度员不会召集整个大学的所有学者,而是只召唤与问题相关的几个院系专家,外加一些常驻的基础学科教师,他们协作后迅速给出答案。不同的输入——比如一段Python代码、一句希腊语短语、一张图表标签或一段音频——会召唤完全不同的专家组合,从而在保持模型巨大容量的同时,实现了高效的推理。

Inkling的诞生为AI模型的设计提供了新思路。它证明了模型能力不必与总参数量的完全激活挂钩,稀疏架构可以兼顾规模与效率。尽管模型中9750亿参数几乎接近万亿级别,但其每一次推理的实际计算量仅相当于一个中等规模模型。这意味着在部署时,存储和网络传输的压力依然巨大,但计算节点的负担大大减轻,有望推动更多巨型模型在实际应用中的落地。