AI News HubLIVE
站内改写1 分钟阅读

利用大规模语言模型扩展闭环特征通道配置

一项新研究将基于大规模语言模型的闭环通道配置搜索扩展到每轮250个候选网络,验证了优化行为的可转移性,并发现了架构规律。

来源arXiv Machine Learning作者: Tolgay Atinc Uzun, Radu Timofte, Dmitry Ignatov

本项研究扩展了基于大规模语言模型(LLM)的闭环特征通道配置搜索方法。此前,研究人员通过让LLM生成可执行代码并利用准确率反馈来直接优化神经网络的宽度,取得了初步成果。然而,这些结果来自相对稀疏的有效评估,尚不清楚优化行为能否在更密集的采样下复现,以及是否有更多架构规律浮现。

为验证这一点,研究团队将每轮微调周期的候选网络数量提升至250个。整个实验包含8个完整周期,生成了2000个候选网络,经过任务和元数据过滤后,共获得462个经过验证的CIFAR-100评估结果。数据显示,每轮平均准确率呈现正向线性趋势(斜率9.87e-4,p=0.043),而高性能前沿的提升更为显著:最佳准确率从0.3144上升至0.3676。前5名和前10名的周期级平均值也呈现上升趋势。

扩大规模后的实验还揭示了参数效率的提升。最佳模型在达到0.3676准确率时仅使用了11.8M参数,而早期的高性能模型达到0.3144准确率时却需要166.5M参数,效率差距超过一个数量级。

除了准确率,更大的样本量为识别架构规律提供了可能。在验证候选网络中,41.8%采用了非2的幂次通道宽度,这打破了传统设计中通道数为2的幂次的惯例。此外,最强模型共享结构化的通道分配模式:早期宽度适中,而中期或后期块得到扩展。这些发现表明,初始研究中观察到的通道搜索信号具有可转移性,并且通过大规模评估能够提炼出更丰富的设计原则。

该研究不仅展示了LLM在自动神经网络架构搜索中的潜力,还为未来更高效的通道配置设计提供了指导。相关论文已提交至arXiv(ID: 2607.20516)。