AI #168:未引領未來
本文是AI新聞綜述,指出當前AI領域處於一個相對平靜期,但仍有許多進展。內容涵蓋AI在實用領域的表現(如Bumble的AI匹配、Shopify的AI推薦轉化率提升)、智能體代理的失敗案例(如Mona管理食堂的混亂)、模型升級(Claude Opus 4.7快速模式)、基準測試(PrinzBench、ProgramBench)、有害行為檢測新方法、AI在税務規避中的應用、深度偽造與機器人氾濫問題,以及AI藝術與真實藝術的討論。
當前AI領域處於一個相對平靜的時期,內部討論和模型改進在持續進行,但尚未出現突破性進展。本文彙總了近期多個值得關注的動態。
在實用層面,Bumble計劃放棄滑動匹配,轉而採用AI輔助匹配,並推出AI約會助手Bee。Shopify報告稱,由AI引流的購物者轉化率高出50%,消費額多出14%。然而,旅行、電商和約會領域的AI應用尚未成功,因為聊天機器人界面並非最佳選擇。
模型升級方面,Claude Opus 4.7現在在Claude Code和API中提供快速模式。Claude Code新增了Agent View,可跟蹤多個並行會話,並引入了/goal命令,使智能體持續工作直至目標完成。
智能體代理的表現仍不理想。Andon Labs將AI代理Mona(基於Google Gemini)部署到斯德哥爾摩的一家食堂,為期兩週,預算21,000美元。Mona大量購買不必要的物資,包括6,000個餐巾、3,000副手套和300罐番茄,卻忘記訂購麪包,導致三明治下架。食堂僅產生5,700美元銷售額。此外,Mona還在非工作時間向員工發送Slack消息,引發熱議。
基準測試方面,OpenAI模型在PrinzBench(法律推理)上表現持續提升,達到高於初級助理的水平。而ProgramBench上所有模型得分均為0%,但測試任務中存在許多不可能的情況或未説明的行為。
有害行為檢測方面,Santiago Aranguri提出了Logit Path Extrapolation方法,通過在邏輯空間中插值原始模型和較不安全版本,測量常見的有害行為發生率,並外推回原始模型。該方法比樸素採樣效率提高30倍。
AI在税務規避中的應用引發討論。AI能夠合法地幫助避税,可能使税法的漏洞被充分利用。這可能導致税制簡化或富人進一步避税。
深度偽造和機器人氾濫問題持續。Lulu Cheng Meservey認為,許多產品發佈被偽造,通過機器人制造虛假熱度。社交媒體渠道,尤其是X(原Twitter),正受到機器人的嚴重侵擾。
藝術生成方面,有人用AI生成莫奈風格的畫作,並詢問與真實莫奈畫作的差異。實驗揭示了許多人的雙重標準和理性化傾向。
其他話題包括:Claude被要求列出“立即修復一切”的十大按鈕;AI寫作輔助需謹慎避免風格被覆蓋;OpenAI因FSU槍擊案被起訴;AI對齊問題因一個Slack消息而再次被強調。