过去几个月,很多人问我,我在文章、演讲和LLM-Gallery中使用的LLM架构草图是如何生成的。因此,我认为记录一下我通常遵循的流程会很有用。
简而言之,我通常从官方技术报告开始。但如今,论文往往不如以前详细,特别是对于大多数来自工业实验室的开源权重模型。好在如果权重在Hugging Face模型中心共享,并且模型在Python transformers库中得到支持,我们就可以直接检查配置文件(config file)和参考实现(reference implementation),从而获取更多架构细节。毕竟,“工作的代码”不会说谎。
需要说明的是,这个流程主要适用于开源权重模型,并不适用于像ChatGPT、Claude或Gemini这类权重和细节都专有的模型。此外,这故意是一个相当手动化的过程。你可以自动化部分步骤,但如果你目标是学习这些架构是如何工作的,那么亲手做几次仍然是最好的练习之一。