AI News HubLIVE
站内改写3 分钟阅读

AI在“计分便宜”之处即为超人

AI的能力分野并非难易,而在于验证答案的成本:计分便宜处(代码、数学、漏洞挖掘)AI已超人;计分昂贵处(职业建议、谈判、审美)依然平庸。互联网文本耗尽后,合成数据与可验证强化学习进一步放大这一不对称,而慢速领域所依赖的资深判断正被自动化侵蚀。

来源Hacker News AI作者: lulzx

这世界上的AI能力分布,乍看像一团乱麻,直到你发现那条隐藏的规则。AI在竞技编程、形式数学、软件漏洞挖掘和棋类游戏中早已超越人类,却在要不要接受一份工作、谈判是否已经悄悄转向对你不利、以及审美品味这类事情上,只是“还行”。最自然的解释是前者简单、后者困难,但这个解释完全错了。真正的规则是:AI在验证答案便宜的地方变得超人,在验证答案昂贵的地方保持平庸。重点不是“做”,而是“检查”。

为什么?因为训练循环需要信号。几十年来,做出更好模型的配方就是更多文本、更多算力,但互联网文本正在见底。全球高质量人类文本大约有10^14个token,模型已经消耗了约10^13个,剩下的一个数量级还是低质量部分。于是前沿转向了合成数据、基于可验证结果的强化学习,以及能够廉价检查答案的领域中的自我对弈。这个转向不可能是中性的:它让整个行业依赖一种分布极不均匀的资源——便宜的答案校验方式。

最典型的对比是两条训练循环。第一条是“毫秒循环”:模型写代码,单元测试运行,通过或失败,瞬间给出信号,不需要人类,可以一天运行数百万次。第二条是“六个月循环”:模型给出职业建议,你得等六个月观察结果,再费力地把建议的效果从其他因素中剥离出来。同样的模型、同样的算力,左边的已经做了五百万次练习,右边的只能坐在钟表旁等待。没有哪种巧妙架构能修复一条根本跑不起来的循环。

由此可以预绘能力地图:左边是形式数学、带测试的代码、结构化检索、有明确胜负的游戏、自我验证的网络漏洞利用;中间是计算化学、窄域影像诊断、法律文书分析、可兑现的预测、电网调度;右边是实验生物学、临床判断、谈判与品味、社会科学与政策、特种农业和最后一公里配送。同一个模型,只是在左边滑下山坡、在右边推石头上山。决定方向的不是智能,而是“谁在为答案打分”。

关于合成数据的标准反驳是:模型可以自己生成训练数据。但这经不起推敲。未经过滤的合成数据会让模型退化;每次成功案例,依靠的都是一个廉价验证器作为过滤器,丢弃一切未被证实的样本。自对弈、数学证明检查、通过测试的代码,莫不如此。因此合成生成不是验证的逃逸,而是验证的放大器:在验证便宜处把信号放大无数倍,在验证昂贵处几乎什么都不放大。

真正令人沮丧的是二阶问题:慢速领域的进步依赖人类偏好和结果标签,也就是资深判断。而资深判断恰恰是被此轮自动化侵蚀的资源——你得先当十年初级员工,做那些最先被自动化掉的工作,才可能成为资深。慢速领域消耗的,正是这个转型正在切断供应的燃料。单元测试不需要二十年经验来写,但判断一个人生建议是否正确需要。这个回路跑错了方向,因此两列之间的差距很可能先扩大、再收窄。

有三类误读需要提防:第一,把基准测试进展当作领域进展,律师考试便宜易打分,执业并不如此;第二,把领域平均化,医学在窄域影像上快、在临床判断上慢,平均成“中等”会丢掉部署路径;第三,把排序当作就业预测,超人的代码生成完全可能通过需求扩张增加程序员岗位。

想逃出慢速侧?只能去买更便宜的地面真值:自动化实验室让实验自行产出机器可读结果;仪器化机器人制造从未公开存在的交互数据;按结果定价的合同把客户真实结果变成训练标签。每条路都会把领域向左拖,但不会删除任何一列。机器人学尤其受制于“操作互联网”的不存在;文本与代码有现成的公开语料,物理交互却只有空房间和一只手套。

什么可能打破这张表?学习式验证。如果模型能够为软领域引导出可靠的验证器,用稀疏人工标签训练出能正确泛化的评判者,那么串联线路就会断开,放大器变成开环,昂贵领域不再落后,整张表重新洗牌。但要诚实计分:看的是不可验证领域中的生产深度,而不是演示——愿意把自己置于诉讼风险之间的评判模型,才值得认真对待。

落到个人身上,结论简短而略带不适:如果你的工作自带廉价计分板,几年内就会有比你更快的东西来跑这个计分板,你的卓越市场价值会向算力成本坍缩;如果你的工作没有廉价计分板,你更安全,但保护你的恰恰也是让你难以证明自己优秀的东西——这本身就是一个职业难题,而且永远如此。