AI News HubLIVE
站內改寫1 分鐘閱讀

Show HN: Human Benchmark – 將您的推理能力與AI模型進行比較

Human Benchmark 是一個互動平台,通過回答用於衡量AI推理能力的問題來評估您的表現。它會根據您的水平調整難度,並記錄答題時間。只需回答五個問題,就能大致瞭解您與機器的對比情況。

來源Hacker News AI作者: twoslide

Human Benchmark 是一個新穎的互動平台,旨在讓用户通過與AI模型的直接比較來評估自己的推理能力。該平台採用了多種知名的AI基準測試問題,包括CommonsenseQA、GSM8K、AGIEval(LSAT邏輯推理和AQuA-RAT)以及BIG-Bench Hard。這些問題涵蓋了常識推理、算術問題、邏輯推理和謎題等多個領域。

用户需要在限時內回答問題,難度會根據用户的表現動態調整。平台使用Rasch模型來估算用户的得分,並提供95%置信區間,隨着答題數量的增加,置信區間會逐漸縮小。如果兩個用户的置信區間重疊較多,則説明他們之間的差異在誤差範圍內。

Human Benchmark 強調,這只是一個概念驗證,旨在展示LLM基準測試在人類環境中的應用方式,並非嚴肅的推理或智力測試,其心理測量學有效性有限。儘管如此,它為用户提供了一個有趣且富有啓發性的方式來探索自身與AI在推理任務上的差異。

平台還包含一個排行榜,顯示不同AI模型和人類用户的得分情況,陰影條表示置信區間。每道題的答題時間限制為1分鐘,超時則標記為錯誤。題目來源包括CommonsenseQA(日常常識)、GSM8K(小學數學應用題)、AGIEval(法學院入學考試邏輯推理和GMAT/GRE定量問題)以及BIG-Bench Hard(邏輯推理、物體計數、日期計算、因果判斷等複雜任務)。這種多樣化的題目設置使得測試能夠全面評估用户的推理能力。