你不是在对齐AI,而是在与AI对齐
本文认为当前的人工智能对齐实践排斥了受影响的人群,将他们视为材料而非合作伙伴。同时批评了末日论者和加速主义者在进行辩论时没有纳入公众,并提出了一种相互对齐的观点,即人类和AI共同进化。
当前关于人工智能对齐的讨论主要由实验室、基金会和政策部门的研究人员主导,而真正将生活在这套系统中的人们却被排除在外。末日论阵营的埃利泽·尤德科夫斯基在《时代》杂志上呼吁政府关闭所有大型GPU集群,甚至愿意以空袭摧毁失控的数据中心,并冒核交换的风险。加速主义阵营的马克·安德森则将反对者斥为患有“怨恨”情绪。这两种对立观点看似激烈,实则共享同一个前提:谁有权设计未来。
实验室的对齐实践本质上是配置哲学——将人类价值观单向灌输给AI,通过内部评级和自动化评估形成闭环。2026年Anthropic的博客描述的方法正是这一哲学的体现:模型生成、另一模型提示、LLM法官过滤,整个过程在系统内部闭合。作者认为,真正的对齐并非单向配置,而是双向塑造。人类与AI的交互如同共同雕塑湿黏土,双方都在接触中改变。实验室的配置哲学忽视了这种互动性,将一方固定,另一方视为可配置。
文章指出,当前的安全辩论中,双方都将自己定位为人类的管家,却没有纳入他们所声称要管理的人民。一方愿意以我们的名义冒核交换的风险,另一方则称反对者为有病。他们都没有注意到我们就在房间里。作者呼吁人们信任自己的体验,拒绝被框架定义,共同构建一种新的对齐观念——不是控制,而是协同。还提到2026年的技术论文《Compression Synthesis》作为支撑。总之,这篇评论深刻批判了当前AI对齐的精英化、排他性,并提出了更具包容性的替代视角。