序列知识 #902:学习蒸馏:当数据集成为教师
本文探讨了大型语言模型如何改变数据在机器学习中的角色——从静态资源转变为智能传递的媒介。通过合成数据蒸馏,强大的教师模型生成训练数据,使学生模型继承其能力,而教师本身在推理时不再需要。
在机器学习的历史中,数据通常被视为类似地质资源的存在——它已经存在于世界的某个角落:书籍、网站、代码库、对话、照片和数据库中。研究者的任务就是挖掘、清理、分词,然后将其输入模型。
然而,大型语言模型彻底改变了这种关系。一个强大的模型不仅仅是数据的消费者,它还能生成问题、答案、解释、批评、偏好标签、工具使用痕迹、教科书、编程练习,甚至完整的微型课程。
这创造了一种新的训练原语:与其让昂贵的模型永无止境地处理生产查询,不如让它制造出小型模型学习所需的经验。教师模型离线运行,其输出成为数据集,数据集训练学生模型。在推理时,教师模型消失,但其部分行为已嵌入学生模型中。
这就是合成数据蒸馏的本质。这种方法不仅降低了推理成本,还使得知识能够以数据的形式高效传递。