AI News HubLIVE
站内改写1 分钟阅读

Show HN: Human Benchmark – 将您的推理能力与AI模型进行比较

Human Benchmark 是一个互动平台,通过回答用于衡量AI推理能力的问题来评估您的表现。它会根据您的水平调整难度,并记录答题时间。只需回答五个问题,就能大致了解您与机器的对比情况。

来源Hacker News AI作者: twoslide

Human Benchmark 是一个新颖的互动平台,旨在让用户通过与AI模型的直接比较来评估自己的推理能力。该平台采用了多种知名的AI基准测试问题,包括CommonsenseQA、GSM8K、AGIEval(LSAT逻辑推理和AQuA-RAT)以及BIG-Bench Hard。这些问题涵盖了常识推理、算术问题、逻辑推理和谜题等多个领域。

用户需要在限时内回答问题,难度会根据用户的表现动态调整。平台使用Rasch模型来估算用户的得分,并提供95%置信区间,随着答题数量的增加,置信区间会逐渐缩小。如果两个用户的置信区间重叠较多,则说明他们之间的差异在误差范围内。

Human Benchmark 强调,这只是一个概念验证,旨在展示LLM基准测试在人类环境中的应用方式,并非严肃的推理或智力测试,其心理测量学有效性有限。尽管如此,它为用户提供了一个有趣且富有启发性的方式来探索自身与AI在推理任务上的差异。

平台还包含一个排行榜,显示不同AI模型和人类用户的得分情况,阴影条表示置信区间。每道题的答题时间限制为1分钟,超时则标记为错误。题目来源包括CommonsenseQA(日常常识)、GSM8K(小学数学应用题)、AGIEval(法学院入学考试逻辑推理和GMAT/GRE定量问题)以及BIG-Bench Hard(逻辑推理、物体计数、日期计算、因果判断等复杂任务)。这种多样化的题目设置使得测试能够全面评估用户的推理能力。