人工智能能勝任你的工作嗎?我們用AI代理進行了測試
在一項實驗中,AI代理被要求完成辦公室任務,包括調查同事、建議裁員和填寫表格。結果顯示,AI在編程任務上表現出色,但在理解人類語言細微差別和操作用户界面方面存在困難,説明AI尚不能完全替代人類員工。
近日,一項由《紐約時報》進行的實驗引發了對人工智能在辦公室工作中替代人類能力的廣泛討論。研究團隊利用Anthropic公司的Claude Cowork應用程序,讓AI代理執行三組典型的辦公室任務,以測試其在真實工作環境中的實際表現。
第一項任務是收集同事對會議的反饋。AI代理通過Slack向預設的機器人同事發送消息,成功獲取了評分並將數據存入Google Sheets。儘管過程中遇到了拼寫錯誤(例如“Sara Johnson”而非“Sarah Johnson”)以及部分同事未回覆等意外情況,AI代理仍能靈活應對,繼續推進任務。然而,在格式化數據和命名文件時,它陷入了滑稽的循環錯誤,最終生成了“Meeting Feedback Meeting Feedback Meeting FeedbackUntitled spreadsheet”這樣古怪的文件名。
第二項任務更具挑戰性:分析政府機構員工數據,制定減員4%的計劃。AI代理在閲讀相關文件後注意到,有員工計劃退休或辭職,因此得出結論:無需強制裁員即可滿足預算要求。然而,它在決策過程中犯了一個重要錯誤——將至少三名計劃休假的員工也列入裁減名單,完全沒有考慮他們何時返回工作崗位。斯坦福大學和國家經濟研究局的研究人員指出,這一錯誤突顯了AI在替代隱性知識方面的不足。
第三項任務要求AI填寫17份I-9就業驗證表格並上傳至Google Drive。儘管指令明確要求使用瀏覽器操作,AI代理幾乎立即轉向編寫Python腳本來自動填充PDF表單,僅用5分鐘就完成了這一繁瑣工作。但在最後的上傳環節,它卻反覆嘗試壓縮文件、求助其他AI代理,甚至將PDF轉換為字節數據流,最終未能識別出簡單的文件上傳窗口,只能標記任務為完成。
卡內基梅隆大學教授Graham Neubig對此評論道:“AI的工作方式非常非人類,它更傾向於寫代碼而不是使用標準界面。” Scale AI的測試也顯示,即使是最先進的模型,也只有約16%的概率生成可以直接交付客户的工作成果。
儘管AI在複雜編程任務上表現出色,但缺乏對人類界面和語境的直覺理解。這項實驗提醒我們,雖然AI可以在特定領域提升效率,但當前仍需人類監督處理意外情況和細微判斷,完全取代辦公室工作的時機尚未成熟。