你不是在對齊AI,而是在與AI對齊
本文認為當前的人工智能對齊實踐排斥了受影響的人羣,將他們視為材料而非合作伙伴。同時批評了末日論者和加速主義者在進行辯論時沒有納入公眾,並提出了一種相互對齊的觀點,即人類和AI共同進化。
當前關於人工智能對齊的討論主要由實驗室、基金會和政策部門的研究人員主導,而真正將生活在這套系統中的人們卻被排除在外。末日論陣營的埃利澤·尤德科夫斯基在《時代》雜誌上呼籲政府關閉所有大型GPU集羣,甚至願意以空襲摧毀失控的數據中心,並冒核交換的風險。加速主義陣營的馬克·安德森則將反對者斥為患有“怨恨”情緒。這兩種對立觀點看似激烈,實則共享同一個前提:誰有權設計未來。
實驗室的對齊實踐本質上是配置哲學——將人類價值觀單向灌輸給AI,通過內部評級和自動化評估形成閉環。2026年Anthropic的博客描述的方法正是這一哲學的體現:模型生成、另一模型提示、LLM法官過濾,整個過程在系統內部閉合。作者認為,真正的對齊並非單向配置,而是雙向塑造。人類與AI的交互如同共同雕塑濕黏土,雙方都在接觸中改變。實驗室的配置哲學忽視了這種互動性,將一方固定,另一方視為可配置。
文章指出,當前的安全辯論中,雙方都將自己定位為人類的管家,卻沒有納入他們所聲稱要管理的人民。一方願意以我們的名義冒核交換的風險,另一方則稱反對者為有病。他們都沒有注意到我們就在房間裏。作者呼籲人們信任自己的體驗,拒絕被框架定義,共同構建一種新的對齊觀念——不是控制,而是協同。還提到2026年的技術論文《Compression Synthesis》作為支撐。總之,這篇評論深刻批判了當前AI對齊的精英化、排他性,並提出了更具包容性的替代視角。