標題:揭示深度不平衡迴歸評估中的盲點(Exposing Blind Spots in Deep Imbalanced Regression Evaluation)
深度不平衡迴歸(Deep Imbalanced Regression,簡稱 DIR)針對的是迴歸模型一類常見卻棘手的失效模式:當目標變量的分佈高度不均勻時,模型會在目標值密集的區域表現最佳,即便實際任務要求模型在整個目標取值範圍內都保持可靠的預測性能。換言之,模型在數據充足的區間看起來很好,但在稀有目標區域卻可能嚴重失真——而這些稀有區域往往恰恰是運營與安全上最關鍵的區間。
儘管 DIR 在方法論層面進展迅速,論文作者指出,該領域的評估實踐仍然受制於三個盲點:第一,評估基準以圖像數據為主,數據域過於狹窄;第二,標準的 many-/medium-/few-shot(多樣本/中樣本/少樣本)評估協議雖然具備診斷性,卻並非“決策完備”(decision-complete),難以據此在不同方法和數據集之間做直接取捨;第三,DIR 所關注的尾部區域在不同隨機種子下的穩定性,尚未得到系統性評估。論文正是沿着這三條軸線重新審視 DIR 的評估體系。
在數據域擴展方面,作者將 DIR 評估遷移到一個多模態虛擬傳感基準 MuViS 上,包含橫跨六個物理域的九個時間序列外生迴歸(extrinsic regression)任務。選擇這一基準的理由在於:在這些任務中,稀有目標值往往對應具有實際運行意義的工況狀態,因此尾部性能的好壞直接關係到系統可用性,而非僅僅是統計指標上的差異。
在評價指標方面,論文采用平衡平均絕對誤差(balanced MAE,bMAE),並進一步提出平衡平均絕對尺度誤差(balanced Mean Absolute Scaled Error,bMASE)。後者是一種經過尺度歸一化的指標,作用是讓不同方法、不同數據集之間的比較具備“決策完備性”,即能夠支撐方法選擇與取捨,而不僅僅是給出診斷性的描述。
在穩定性方面,作者對六種具有代表性的 DIR 方法進行了跨多個隨機種子的重複再評估。結果顯示,DIR 所瞄準的尾部區域對種子級別的隨機波動格外敏感——也就是説,同一方法在不同隨機種子下的尾部表現可能出現顯著差異,而這種差異在通常的單次實驗報告中被掩蓋了。
論文給出三方面結論。其一,標準的虛擬傳感模型存在明顯的尾部性能退化,而這種退化被全局 MAE 掩蓋,從全局指標上看不出來。其二,現有 DIR 方法確實能夠改善平衡性能,但在向多模態時間序列數據遷移時表現並不均衡,即並非所有方法都能穩定獲益。其三,尾部區域的不穩定性在當前 DIR 評估慣例下仍然是一種“基本上被隱藏的”失效模式。作者認為,這些發現連同其公開可獲取的代碼,為未來 DIR 研究提供了可復現的基礎,推動迴歸系統在捕捉稀有目標工況時達到與常見工況同等可靠的水平的。
需要説明的元信息與時間線:該論文以 arXiv:2609.25152 編號發佈於機器學習(cs.LG)類別,同時交叉列為人工智能(cs.AI)。提交時間為 2026 年 9 月 21 日(週一)08:51:40 UTC,版本為 v1,公告類型為 new,全文體積約 1,999 KB。作者為 Noah C. Puetz 及其他五位作者,共六人,提交人(From)為 Noah Christoph Puetz。引用格式為 arXiv:2609.25152 [cs.LG],本版本可寫作 arXiv:2609.25152v1 [cs.LG];DOI 為 10.48550/arXiv.2609.25152,由 arXiv 經 DataCite 發放,目前狀態為“待註冊”(pending registration)。頁面提供 PDF、實驗性 HTML 版本以及 TeX 源碼,並可查看該論文的許可協議。
需要留意的注意事項是:HTML 版本標註為實驗性(experimental),並非最終穩定呈現;DOI 尚未完成註冊;文中提到的 bMASE 為作者新引入的指標,其跨方法、跨數據集的普適性仍有待社區更多獨立工作檢驗;同時,關於“尾部對隨機種子高度敏感”的結論建立在六個代表性方法和多個隨機種子的重複實驗之上,其結論強度受所選取方法集合與基準範圍的限制。作者強調代碼已公開,正是為了讓後續研究能夠復現並擴展這些評估。整體而言,這篇論文並不提出新的 DIR 算法,而是把矛頭指向評估方法本身,主張在數據域、評價指標與穩定性三個維度同時補強,才能讓迴歸系統在稀有目標區間與常見目標區間上同樣可靠。