衡量2026年初AI對科技工作者生產力的自報影響
一項針對349名科技工作者的調查顯示,AI工具使其工作價值中位數提升1.4-2倍,速度提升3倍。受訪者估計2025年3月價值提升1.3倍,2026年3月2倍,預計2027年3月2.5倍。研究區分了“價值”和“速度”增益,並指出調查結果可能被高估,需謹慎解讀。
2026年2月至4月,METR開展了一項針對349名技術工作者(包括87名軟件工程師、71名研究員、129名學者和博士生以及48名創始人和管理者)的調查,旨在瞭解AI工具對其生產力的影響。與以往研究相比,該調查是迄今最詳細的技術工作者AI生產力增益自報研究之一。
調查試圖捕捉AI帶來的“價值”增益(即利用AI創造了多少額外價值),而非“速度”增益(即沒有AI時完成任務所需的時間)。這一區分至關重要,因為AI可能改變工作任務的分佈,例如研究人員可能利用AI快速構建數據儀表盤,雖節省時間但對項目核心價值貢獻有限。研究團隊認為,價值增益更貼近調查設計者通常關心的概念,而速度增益往往被高估。
結果顯示,參與者自報的價值增益中位數為1.4-2倍,速度增益中位數為3倍。同一批受訪者回顧性估計2025年3月的價值增益為1.3倍,當前(2026年3月)為2倍,並預測2027年3月將達到2.5倍。應答在內部一致性方面表現良好,僅3%的受訪者因異常回答被剔除。
然而,研究團隊對結果持謹慎態度。METR員工給出的價值增益在所有子組中最低,這可能因其熟知過往研究中感知與現實生產力的差距。此外,初步定性分析暗示,特別高的價值增益估計可能被誇大。更重要的是,調查結果未必反映現實——2025年初的類似研究發現,人們平均高估AI對任務時間的影響達40個百分點。
調查作為生產力證據的補充,與基準測試和隨機對照試驗(RCT)各有優劣。基準測試標準化且可重複,但外部效度存疑;RCT控制嚴格但成本高昂;調查成本低、範圍廣,但依賴自我報告,易受偏差影響。研究團隊建議,對AI自動化潛力感興趣的機構(如前沿AI公司)應基於此開展高質量調查,並優先調查管理者或生產力研究員而非個人貢獻者。
調查方法論包括:通過多渠道(GitHub、學術機構、METR網絡等)招募便利樣本,約70%參與者獲得平均200美元的報酬;參與者平均有12年編程經驗、19個月AI編程經驗和7個月AI代理工具使用經驗;48%位於美國,37%為學者或博士生。調查設計了多個價值增益問題以交叉驗證,並排除了極端不一致的應答。
總體而言,該調查為AI對技術工作者生產力的影響提供了寶貴自報數據,但結果需結合其他證據綜合解讀。未來研究應進一步細化度量指標,並探索實驗數據與調查結果的差異。