AI News HubLIVE
站內改寫1 分鐘閱讀

Show HN: Human Benchmark – 將您的推理能力與AI模型進行比較

Human Benchmark 是一個互動平臺,透過回答用於衡量AI推理能力的問題來評估您的表現。它會根據您的水平調整難度,並記錄答題時間。只需回答五個問題,就能大致瞭解您與機器的對比情況。

來源Hacker News AI作者: twoslide

Human Benchmark 是一個新穎的互動平臺,旨在讓使用者透過與AI模型的直接比較來評估自己的推理能力。該平臺採用了多種知名的AI基準測試問題,包括CommonsenseQA、GSM8K、AGIEval(LSAT邏輯推理和AQuA-RAT)以及BIG-Bench Hard。這些問題涵蓋了常識推理、算術問題、邏輯推理和謎題等多個領域。

使用者需要在限時內回答問題,難度會根據使用者的表現動態調整。平臺使用Rasch模型來估算使用者的得分,並提供95%置信區間,隨著答題數量的增加,置信區間會逐漸縮小。如果兩個使用者的置信區間重疊較多,則說明他們之間的差異在誤差範圍內。

Human Benchmark 強調,這只是一個概念驗證,旨在展示LLM基準測試在人類環境中的應用方式,並非嚴肅的推理或智力測試,其心理測量學有效性有限。儘管如此,它為使用者提供了一個有趣且富有啟發性的方式來探索自身與AI在推理任務上的差異。

平臺還包含一個排行榜,顯示不同AI模型和人類使用者的得分情況,陰影條表示置信區間。每道題的答題時間限制為1分鐘,超時則標記為錯誤。題目來源包括CommonsenseQA(日常常識)、GSM8K(小學數學應用題)、AGIEval(法學院入學考試邏輯推理和GMAT/GRE定量問題)以及BIG-Bench Hard(邏輯推理、物體計數、日期計算、因果判斷等複雜任務)。這種多樣化的題目設定使得測試能夠全面評估使用者的推理能力。