Show HN: Human Benchmark – あなたの推論能力をAIモデルと比較する
Human Benchmark は、AIの推論能力を測定するために使われる質問に答えることで、あなたのパフォーマンスを評価するインタラクティブなプラットフォームです。あなたの能力に応じて難易度が調整され、回答時間が計測されます。5つの質問に答えるだけで、マシンとの比較がわかります。
Human Benchmark は、AIモデルと直接比較しながら自分の推論能力を評価できる新しいインタラクティブプラットフォームです。このプラットフォームでは、CommonsenseQA、GSM8K、AGIEval(LSAT論理推論およびAQuA-RAT)、BIG-Bench Hardなど、さまざまなAIベンチマーク問題が使用されています。これらの問題は、常識推論、算数問題、論理推論、パズルなど多岐にわたります。
ユーザーは制限時間内に問題に回答し、難易度はパフォーマンスに応じて動的に調整されます。プラットフォームはRaschモデルを使用してスコアを推定し、95%信頼区間を提供します。回答数が増えるにつれて信頼区間は狭まります。2人のユーザーの信頼区間が重なっている場合、その差は誤差範囲内とみなされます。
Human Benchmark は、あくまで概念実証であり、LLMベンチマークが人間の文脈でどのように機能するかを示すものです。真剣な推論テストや知能テストではなく、心理測定学的な有効性は限られていると強調しています。それでも、ユーザーが自分とAIの推論タスクにおける違いを探求するための、興味深く刺激的な方法を提供しています。
さらに、プラットフォームにはリーダーボードがあり、さまざまなAIモデルと人間ユーザーのスコアが表示され、影付きのバーは信頼区間を示しています。各質問の回答時間は1分で、時間切れになると不正解とみなされます。質問の出典には、CommonsenseQA(日常常識)、GSM8K(小学校レベルの算数文章題)、AGIEval(法科大学院入学試験の論理推論とGMAT/GRE形式の定量問題)、BIG-Bench Hard(論理推論、物体カウント、日付計算、因果判断など複雑なタスク)が含まれます。この多様な問題設定により、ユーザーの推論能力を総合的に評価できます。