AI News HubLIVE
站内改写2 分钟阅读

人工智能能胜任你的工作吗?我们用AI代理进行了测试

在一项实验中,AI代理被要求完成办公室任务,包括调查同事、建议裁员和填写表格。结果显示,AI在编程任务上表现出色,但在理解人类语言细微差别和操作用户界面方面存在困难,说明AI尚不能完全替代人类员工。

来源Hacker News AI作者: thm

近日,一项由《纽约时报》进行的实验引发了对人工智能在办公室工作中替代人类能力的广泛讨论。研究团队利用Anthropic公司的Claude Cowork应用程序,让AI代理执行三组典型的办公室任务,以测试其在真实工作环境中的实际表现。

第一项任务是收集同事对会议的反馈。AI代理通过Slack向预设的机器人同事发送消息,成功获取了评分并将数据存入Google Sheets。尽管过程中遇到了拼写错误(例如“Sara Johnson”而非“Sarah Johnson”)以及部分同事未回复等意外情况,AI代理仍能灵活应对,继续推进任务。然而,在格式化数据和命名文件时,它陷入了滑稽的循环错误,最终生成了“Meeting Feedback Meeting Feedback Meeting FeedbackUntitled spreadsheet”这样古怪的文件名。

第二项任务更具挑战性:分析政府机构员工数据,制定减员4%的计划。AI代理在阅读相关文件后注意到,有员工计划退休或辞职,因此得出结论:无需强制裁员即可满足预算要求。然而,它在决策过程中犯了一个重要错误——将至少三名计划休假的员工也列入裁减名单,完全没有考虑他们何时返回工作岗位。斯坦福大学和国家经济研究局的研究人员指出,这一错误突显了AI在替代隐性知识方面的不足。

第三项任务要求AI填写17份I-9就业验证表格并上传至Google Drive。尽管指令明确要求使用浏览器操作,AI代理几乎立即转向编写Python脚本来自动填充PDF表单,仅用5分钟就完成了这一繁琐工作。但在最后的上传环节,它却反复尝试压缩文件、求助其他AI代理,甚至将PDF转换为字节数据流,最终未能识别出简单的文件上传窗口,只能标记任务为完成。

卡内基梅隆大学教授Graham Neubig对此评论道:“AI的工作方式非常非人类,它更倾向于写代码而不是使用标准界面。” Scale AI的测试也显示,即使是最先进的模型,也只有约16%的概率生成可以直接交付客户的工作成果。

尽管AI在复杂编程任务上表现出色,但缺乏对人类界面和语境的直觉理解。这项实验提醒我们,虽然AI可以在特定领域提升效率,但当前仍需人类监督处理意外情况和细微判断,完全取代办公室工作的时机尚未成熟。