AI News HubLIVE
站内改写3 分钟阅读

AI内容同质化与写作困境

分析AI生成文本为何容易被识别:训练数据源于2010年代经SEO优化的互联网写作,导致风格雷同;低成本促使出版商大量生产AI“垃圾内容”,引发互联网低质化,并可能导致模型崩溃。

来源Hacker News AI作者: mldev_exe

2026年5月6日

如今,有一种写作风格——至少我们写作者——能立即识别出来。它出现在LinkedIn帖子、学生论文、营销邮件、博客草稿中,当然还有大量Medium文章。2023年初人们或许对此浑然不觉,但到2025年,如果有人使用这种风格,往往会在Reddit上被嘲笑。

每个人都有自己的判断文本是否为AI生成的方法。那些从未自己使用过长破折号的人可能会说这是“明显的标志”,但我强烈反对;一旦学会使用长破折号,你就会忍不住反复使用,除非你是反社会者或害怕被检测为AI。然而,最困扰我的问题不是AI写作是否可检测(事实上可以),而是无论提示或模型如何,它为何如此可检测。而且,如果它听起来像垃圾内容,为什么互联网会被它淹没?

为何AI写作听起来千篇一律

GPT-3和GPT-4的训练数据来自截至2021年9月的互联网文本(可能非法,但暂不评判)。这套数据代表了网络写作的一个特定时代,那个时代有特定的风格:从2010年开始,网络偏向一种不太正式、不太随意、不太有主见但乐于助人的风格。

2012年成立的Medium成为“思想领导力”的平台。到2021年,其数百万篇文章几乎都遵循相同模板:个人轶事、普遍见解、三点结构、乐观结论。风格口语化,但经过语法工具润色,去除了跑题句子、逗号等人类不完美之处。接着是SEO优化时代:2015至2020年间,企业博客崛起,目标明确——在谷歌上排名靠前。

第三是维基百科,经过大量编辑和校对,保持中立和百科全书风格,充满引用。第四是Reddit(我们认为它塑造了Claude的性格)。Karma系统就像一个巨大的RLHF数据集,训练人类——进而训练AI——以获得点赞的方式写作:清晰、平衡、稍微友好、不冒犯。美联社和路透社等新闻聚合器的风格指南定义了网络新闻业,通常带有标题党特征:短句、主动语态、避免副词。这可能强化了好写作应精炼、事实性、不加修饰的观念,因此像Gemini这样的AI模型为我们提供了没有灵魂的好写作。

因此,大多数模型的最终训练数据并非完全“人类”写作。它们由人类编写,但经过严重编辑和优化,以至于没有人性可言。这揭示了一个简单事实:当你提示LLM写作时,你实际上是在要求它生成与训练数据中“好写作”统计特征相匹配的文本。

这些“好写作”通常包括长破折号、反问句、含糊措辞和些许强制热情。AI模型开始在写作中使用长破折号时,人类最愚蠢的神话之一诞生了:“文章中的长破折号意味着由AI写就”。这个神话的原因确实是OpenAI的ChatGPT对长破折号情有独钟;这种痴迷如此强烈,以至于限制长破折号成为某些GPT升级的功能。某种程度上,ChatGPT痴迷于长破折号是因为人类在特定语境中频繁使用它们:随意但权威的网络散文,这正是许多LLM试图达到的语气。

为何AI内容泛滥正在发生

这引出了我在所谓AI繁荣中最困扰的问题:互联网的垃圾化。AI生成的内容,如果没有巧妙提示,就是垃圾。它们本质可预测,缺乏创造力,但一些不敏感的出版商仍然无视这个问题持续使用。

当生成一篇1500字文章的成本从支付写手60美元/小时降至几美分API费用时,追求利润的出版商停止问“这有见解吗?”而开始问“这足以在谷歌上排名第一吗?”答案是通常否定的和肯定的。AI非常擅长撰写SEO导向、关键词堆砌的文章,甚至可能比莎士比亚更擅长,尽管这是因为莎士比亚对谷歌一无所知。关键是许多公司和机构更关心在竞争对手的平庸博客文章之上排名,因此不断用AI生成的垃圾内容填充公司网站,也许他们不知道这些博客文章也是顶级平庸的。

仅仅是博客文章吗?哦,我希望如此。亚马逊上有数百本书,销售了数千本,是由AI写的。某种程度上,一部分人对AI的能力视而不见。虽然长破折号不是确凿标志,但写作的可预测性和缺乏自发的创造性可以被识别。但人们仍然阅读、出版甚至分享它们。

因此,我们已经有了一个AI垃圾化的互联网。

如果你不确定有多少人“拥抱AI”写作,请访问r/WritingWithAI。

这引入了一个次要但令人着迷的场景:模型崩溃。随着这些垃圾内容充斥互联网,它们不可避免成为下一代大型语言模型的训练数据。如果GPT-3是在拼命想模仿维基百科的人类写作者上训练的,未来模型将在拼命想模仿GPT-3的AI写作者上训练。当从旧神经网络的合成输出上训练模型时,它原本拥有的微小统计方差开始消失。语言完全扁平化,模型学习到一种极其重复、“平均化”的英语版本。

指责AI垃圾化就是指责我们自己。2010年代之后,人类写作者被训练成SEO机器——编辑怪癖、偏见、不寻常的句子,并用关键词填充文章。当AI出现并复制我们的写作时,我们真的不应感到惊讶。

那么,在当前时代写好文章就是要写得……低效。没有AI能猜到我在这个句子里插入了“blah”这个词,因为它们的统计概率显示在长破折号后添加“blah”的概率是0。这样做,人类就会知道这是一个人类在为他们写作。