AI News HubLIVE
サイト内リライト2 分で読了

オペレータ認識型混合精度許容差キャリブレーションのテンソルカーネルへの適用

本論文では、累積されたクラウドGPU実行データを活用し、テンソルカーネルの正確性テストのための絶対許容差を自動的に決定するオペレータ認識型混合精度許容差キャリブレーション手法を提案する。手動で選ばれた許容差よりもはるかに厳しく、バグ検出の再現率を大幅に向上させる。

ソースarXiv Machine Learning著者: Dipankar Sarkar

多くのテンソルカーネルの正確性テストは、固定された「全接近」スタイルのチェックに依存し、手動で選ばれた絶対許容差と相対許容差を使用しています。これらの閾値はテストスイート内でコピーされ、ほとんど見直されることはありません。この慣行は、テストが過度に緩やかまたは厳しくなり、バグ検出の精度に影響を与える可能性があります。例えば、異なるオペレータに対して手動で選ばれた許容差は実際の数値誤差の分布を反映できず、多くの潜在的なバグが見逃される可能性があります。

この問題を改善するために、研究者らはオペレータ認識型混合精度許容差キャリブレーション手法を提案しました。彼らは26のgpuemuテスト項目からの累積クラウドGPU実行データから、各テストケースの要素ごとの誤差分布を収集し、2つのデータ型(fp16とfp32)にわたって合計8076の結果行を分析しました。これらのデータは実際のクラウド環境での大量のGPU演算から得られ、異なるオペレータと精度における数値挙動を正確に反映しています。これらのデータに基づき、彼らは実証的な質問をしました:正しい実装の下で、テンソルカーネル自体がどの絶対許容差を正当化するのか?

その答えは、自動調整された許容差が現在の手動選択よりもはるかに厳しいことを示しています。最大の厳格化はattention_tritonのfp16操作で観測され、2184倍に達しました。これは、手動で選ばれた許容差が実際に必要なものよりも2000倍以上緩く、多くの数値エラーを隠蔽していた可能性があることを意味します。gpuemuテストスイートには、7つのLLMスタイルのバグバリアントが対応する正しい実装と共に存在します。これらのバリアントに対して、操作とデータ型ごとに調整された許容差を適用した結果、バグ検出の再現率は73.2%(2467件中1805件)から82.4%(2467件中2034件)に向上し、絶対的な改善率は9.3ポイント、新たに229件のバグが検出されました。一方、1882件の正しい対照ケースにおける誤報数は0から20に増加しましたが、これはわずか1.1ポイントの増加であり、キャリブレーション手法が感度を向上させながら誤報率を低く保つことを示しています。

この手法は、バグ検出の感度を向上させるだけでなく、低い誤報率を維持し、テンソルカーネルのテストにおけるより信頼性の高い許容差設定を提供します。研究チームは今週中にさらに補完的な論文(P3およびP4)を公開し、このフレームワークを拡張する予定です。関連論文P1(arXiv:2606.20128)は既に公開されており、さらなる詳細は今後のバージョンで追加される予定です。この研究は、ディープラーニングライブラリにおけるテンソルカーネルテストの許容差選択の実践を、よりデータ駆動型で自動化されたものに変え、手動介入と潜在的なエラーを減らす可能性があります。