AI News HubLIVE
站內改寫2 分鐘閱讀

人工智慧能勝任你的工作嗎?我們用AI代理進行了測試

在一項實驗中,AI代理被要求完成辦公室任務,包括調查同事、建議裁員和填寫表格。結果顯示,AI在程式設計任務上表現出色,但在理解人類語言細微差別和操作使用者介面方面存在困難,說明AI尚不能完全替代人類員工。

來源Hacker News AI作者: thm

近日,一項由《紐約時報》進行的實驗引發了對人工智慧在辦公室工作中替代人類能力的廣泛討論。研究團隊利用Anthropic公司的Claude Cowork應用程式,讓AI代理執行三組典型的辦公室任務,以測試其在真實工作環境中的實際表現。

第一項任務是收集同事對會議的反饋。AI代理透過Slack向預設的機器人同事傳送訊息,成功獲取了評分並將資料存入Google Sheets。儘管過程中遇到了拼寫錯誤(例如“Sara Johnson”而非“Sarah Johnson”)以及部分同事未回覆等意外情況,AI代理仍能靈活應對,繼續推進任務。然而,在格式化資料和命名檔案時,它陷入了滑稽的迴圈錯誤,最終生成了“Meeting Feedback Meeting Feedback Meeting FeedbackUntitled spreadsheet”這樣古怪的檔名。

第二項任務更具挑戰性:分析政府機構員工資料,制定減員4%的計劃。AI代理在閱讀相關檔案後注意到,有員工計劃退休或辭職,因此得出結論:無需強制裁員即可滿足預算要求。然而,它在決策過程中犯了一個重要錯誤——將至少三名計劃休假的員工也列入裁減名單,完全沒有考慮他們何時返回工作崗位。斯坦福大學和國家經濟研究局的研究人員指出,這一錯誤突顯了AI在替代隱性知識方面的不足。

第三項任務要求AI填寫17份I-9就業驗證表格並上傳至Google Drive。儘管指令明確要求使用瀏覽器操作,AI代理幾乎立即轉向編寫Python指令碼來自動填充PDF表單,僅用5分鐘就完成了這一繁瑣工作。但在最後的上傳環節,它卻反覆嘗試壓縮檔案、求助其他AI代理,甚至將PDF轉換為位元組資料流,最終未能識別出簡單的檔案上傳視窗,只能標記任務為完成。

卡內基梅隆大學教授Graham Neubig對此評論道:“AI的工作方式非常非人類,它更傾向於寫程式碼而不是使用標準介面。” Scale AI的測試也顯示,即使是最先進的模型,也只有約16%的機率生成可以直接交付客戶的工作成果。

儘管AI在複雜程式設計任務上表現出色,但缺乏對人類介面和語境的直覺理解。這項實驗提醒我們,雖然AI可以在特定領域提升效率,但當前仍需人類監督處理意外情況和細微判斷,完全取代辦公室工作的時機尚未成熟。