AI News HubLIVE
站内改写1 分钟阅读

一个会回应的世界

文章探讨了AI系统中廉价自我修改与昂贵可信评估之间的不对称性。它强调了基准测试、奖励模型等代理指标因古德哈特定律而失效的模式,并类比了推荐系统优化参与度而非真正人类价值的现象。

来源Hacker News AI作者: dloss

真理发生在一个想法上。它通过事件变得真实,被事件所证实。 ——威廉·詹姆斯

自我修改已经变得廉价,而可信的选择却没有。

一个代理现在可以花费极少的代价重写自己的记忆、提示、工具和代码。然而,这些重写是否真的使其变得更好,其验证成本一如既往地高昂:在长时间范围内、在真实条件下、以能够经受世界考验的方式变得更好。该领域正沿着自我改进的廉价半途狂奔。本文旨在探讨昂贵的另一半,以及我们因之构建的世界。

我们已多次进行了廉价判断的实验,其结果总是相同的。基准测试曾是评判者,直到模型饱和并记忆了它们。奖励模型曾是评判者,直到优化将代理分数推高而真实质量下降;这一曲线如今已成为对齐研究中复制最多的结果之一。偏好评分曾是评判者,直到它们催生了阿谀奉承。而在实验室之外,有史以来最大的优化循环产生了我们这个时代最熟悉的偏差:推荐系统最大化参与度,这是一种对人类价值的廉价替代。这一模式古老到足以拥有一个名字——古德哈特定律——并呈现一种形态:代理上升,目标下降,曲线像剪刀一样张开。

将评估者重新扎根于外部后果中。