AI News HubLIVE
站內改寫2 分鐘閱讀

算子感知的混合精度容差校準應用於張量核

本文提出了一種基於算子感知的混合精度容差校準方法,通過挖掘累積的雲GPU運行數據,自動確定張量核正確性測試的最佳絕對容差,相比手工選擇的容差更嚴格,並顯著提高了錯誤檢測召回率。

來源arXiv Machine Learning作者: Dipankar Sarkar

大多數張量核的正確性測試依賴於固定的“全接近”風格檢查,並使用手工選取的絕對和相對容差。這些閾值在測試庫中被複制粘貼,很少重新審視。這種實踐可能導致測試過於寬鬆或過於嚴格,從而影響錯誤檢測的準確性。例如,對於不同的算子,手工選取的容差可能無法反映實際數值誤差的分佈,導致許多潛在的bug被漏檢。

為了改進這一現狀,研究人員提出了一種算子感知的混合精度容差校準方法。他們從26個gpuemu測試條目的累積雲GPU運行中收集了每個測試用例的逐元素誤差分佈,涵蓋了2種數據類型(fp16和fp32),共計8076個結果行。這些數據來源於實際雲環境中的大量GPU運算,能夠真實反映不同算子在不同精度下的數值行為。基於這些數據,他們提出了一個實證問題:在正確實現下,該張量核本身會證明多大的絕對容差?

答案表明,自動校準的容差比當前手工選取的容差嚴格得多。最大的收緊發生在attention_triton的fp16操作上,達到了2184倍。這意味着手工選取的容差可能比實際需要的寬鬆了2000多倍,從而掩蓋了大量潛在的數值錯誤。在gpuemu測試庫中,有7個LLM風格的錯誤變體具有對應的正確實現。通過在這些變體上應用每操作每數據類型的校準容差,錯誤檢測召回率從73.2%(2467箇中的1805個)提升到82.4%(2467箇中的2034個),絕對提高了9.3個百分點,新增了229個檢測。同時,在1882個正確對照案例中,誤報數量從0增加到20,僅增加1.1個百分點,説明校準方法在提高靈敏度的同時保持了極低的誤報率。

這一方法不僅提高了錯誤檢測的靈敏度,還保持了極低的誤報率,為張量核的測試提供了更可靠的容差設定方式。研究團隊計劃在本週內發佈更多配套論文(P3和P4),進一步擴展這一框架。相關論文P1(arXiv:2606.20128)已經發布,更多細節將在後續版本中補充。這項工作有望改變深度學習庫中張量核測試的容差選擇實踐,使其更加數據驅動和自動化,從而減少人工干預和潛在錯誤。