AI News HubLIVE
站內改寫1 分鐘閱讀

利用大規模語言模型擴充套件閉環特徵通道配置

一項新研究將基於大規模語言模型的閉環通道配置搜尋擴充套件到每輪250個候選網路,驗證了最佳化行為的可轉移性,並發現了架構規律。

來源arXiv Machine Learning作者: Tolgay Atinc Uzun, Radu Timofte, Dmitry Ignatov

本項研究擴充套件了基於大規模語言模型(LLM)的閉環特徵通道配置搜尋方法。此前,研究人員透過讓LLM生成可執行程式碼並利用準確率反饋來直接最佳化神經網路的寬度,取得了初步成果。然而,這些結果來自相對稀疏的有效評估,尚不清楚最佳化行為能否在更密集的取樣下復現,以及是否有更多架構規律浮現。

為驗證這一點,研究團隊將每輪微調週期的候選網路數量提升至250個。整個實驗包含8個完整週期,生成了2000個候選網路,經過任務和後設資料過濾後,共獲得462個經過驗證的CIFAR-100評估結果。資料顯示,每輪平均準確率呈現正向線性趨勢(斜率9.87e-4,p=0.043),而高效能前沿的提升更為顯著:最佳準確率從0.3144上升至0.3676。前5名和前10名的週期級平均值也呈現上升趨勢。

擴大規模後的實驗還揭示了引數效率的提升。最佳模型在達到0.3676準確率時僅使用了11.8M引數,而早期的高效能模型達到0.3144準確率時卻需要166.5M引數,效率差距超過一個數量級。

除了準確率,更大的樣本量為識別架構規律提供了可能。在驗證候選網路中,41.8%採用了非2的冪次通道寬度,這打破了傳統設計中通道數為2的冪次的慣例。此外,最強模型共享結構化的通道分配模式:早期寬度適中,而中期或後期塊得到擴充套件。這些發現表明,初始研究中觀察到的通道搜尋訊號具有可轉移性,並且透過大規模評估能夠提煉出更豐富的設計原則。

該研究不僅展示了LLM在自動神經網路架構搜尋中的潛力,還為未來更高效的通道配置設計提供了指導。相關論文已提交至arXiv(ID: 2607.20516)。