利用大規模語言模型擴展閉環特徵通道配置
一項新研究將基於大規模語言模型的閉環通道配置搜索擴展到每輪250個候選網絡,驗證了優化行為的可轉移性,並發現了架構規律。
本項研究擴展了基於大規模語言模型(LLM)的閉環特徵通道配置搜索方法。此前,研究人員通過讓LLM生成可執行代碼並利用準確率反饋來直接優化神經網絡的寬度,取得了初步成果。然而,這些結果來自相對稀疏的有效評估,尚不清楚優化行為能否在更密集的採樣下復現,以及是否有更多架構規律浮現。
為驗證這一點,研究團隊將每輪微調週期的候選網絡數量提升至250個。整個實驗包含8個完整週期,生成了2000個候選網絡,經過任務和元數據過濾後,共獲得462個經過驗證的CIFAR-100評估結果。數據顯示,每輪平均準確率呈現正向線性趨勢(斜率9.87e-4,p=0.043),而高性能前沿的提升更為顯著:最佳準確率從0.3144上升至0.3676。前5名和前10名的週期級平均值也呈現上升趨勢。
擴大規模後的實驗還揭示了參數效率的提升。最佳模型在達到0.3676準確率時僅使用了11.8M參數,而早期的高性能模型達到0.3144準確率時卻需要166.5M參數,效率差距超過一個數量級。
除了準確率,更大的樣本量為識別架構規律提供了可能。在驗證候選網絡中,41.8%採用了非2的冪次通道寬度,這打破了傳統設計中通道數為2的冪次的慣例。此外,最強模型共享結構化的通道分配模式:早期寬度適中,而中期或後期塊得到擴展。這些發現表明,初始研究中觀察到的通道搜索信號具有可轉移性,並且通過大規模評估能夠提煉出更豐富的設計原則。
該研究不僅展示了LLM在自動神經網絡架構搜索中的潛力,還為未來更高效的通道配置設計提供了指導。相關論文已提交至arXiv(ID: 2607.20516)。