AI內容同質化與寫作困境
分析AI生成文本為何容易被識別:訓練數據源於2010年代經SEO優化的互聯網寫作,導致風格雷同;低成本促使出版商大量生產AI“垃圾內容”,引發互聯網低質化,並可能導致模型崩潰。
2026年5月6日
如今,有一種寫作風格——至少我們寫作者——能立即識別出來。它出現在LinkedIn帖子、學生論文、營銷郵件、博客草稿中,當然還有大量Medium文章。2023年初人們或許對此渾然不覺,但到2025年,如果有人使用這種風格,往往會在Reddit上被嘲笑。
每個人都有自己的判斷文本是否為AI生成的方法。那些從未自己使用過長破折號的人可能會説這是“明顯的標誌”,但我強烈反對;一旦學會使用長破折號,你就會忍不住反覆使用,除非你是反社會者或害怕被檢測為AI。然而,最困擾我的問題不是AI寫作是否可檢測(事實上可以),而是無論提示或模型如何,它為何如此可檢測。而且,如果它聽起來像垃圾內容,為什麼互聯網會被它淹沒?
為何AI寫作聽起來千篇一律
GPT-3和GPT-4的訓練數據來自截至2021年9月的互聯網文本(可能非法,但暫不評判)。這套數據代表了網絡寫作的一個特定時代,那個時代有特定的風格:從2010年開始,網絡偏向一種不太正式、不太隨意、不太有主見但樂於助人的風格。
2012年成立的Medium成為“思想領導力”的平台。到2021年,其數百萬篇文章幾乎都遵循相同模板:個人軼事、普遍見解、三點結構、樂觀結論。風格口語化,但經過語法工具潤色,去除了跑題句子、逗號等人類不完美之處。接着是SEO優化時代:2015至2020年間,企業博客崛起,目標明確——在谷歌上排名靠前。
第三是維基百科,經過大量編輯和校對,保持中立和百科全書風格,充滿引用。第四是Reddit(我們認為它塑造了Claude的性格)。Karma系統就像一個巨大的RLHF數據集,訓練人類——進而訓練AI——以獲得點讚的方式寫作:清晰、平衡、稍微友好、不冒犯。美聯社和路透社等新聞聚合器的風格指南定義了網絡新聞業,通常帶有標題黨特徵:短句、主動語態、避免副詞。這可能強化了好寫作應精煉、事實性、不加修飾的觀念,因此像Gemini這樣的AI模型為我們提供了沒有靈魂的好寫作。
因此,大多數模型的最終訓練數據並非完全“人類”寫作。它們由人類編寫,但經過嚴重編輯和優化,以至於沒有人性可言。這揭示了一個簡單事實:當你提示LLM寫作時,你實際上是在要求它生成與訓練數據中“好寫作”統計特徵相匹配的文本。
這些“好寫作”通常包括長破折號、反問句、含糊措辭和些許強制熱情。AI模型開始在寫作中使用長破折號時,人類最愚蠢的神話之一誕生了:“文章中的長破折號意味着由AI寫就”。這個神話的原因確實是OpenAI的ChatGPT對長破折號情有獨鍾;這種痴迷如此強烈,以至於限制長破折號成為某些GPT升級的功能。某種程度上,ChatGPT痴迷於長破折號是因為人類在特定語境中頻繁使用它們:隨意但權威的網絡散文,這正是許多LLM試圖達到的語氣。
為何AI內容氾濫正在發生
這引出了我在所謂AI繁榮中最困擾的問題:互聯網的垃圾化。AI生成的內容,如果沒有巧妙提示,就是垃圾。它們本質可預測,缺乏創造力,但一些不敏感的出版商仍然無視這個問題持續使用。
當生成一篇1500字文章的成本從支付寫手60美元/小時降至幾美分API費用時,追求利潤的出版商停止問“這有見解嗎?”而開始問“這足以在谷歌上排名第一嗎?”答案是通常否定的和肯定的。AI非常擅長撰寫SEO導向、關鍵詞堆砌的文章,甚至可能比莎士比亞更擅長,儘管這是因為莎士比亞對谷歌一無所知。關鍵是許多公司和機構更關心在競爭對手的平庸博客文章之上排名,因此不斷用AI生成的垃圾內容填充公司網站,也許他們不知道這些博客文章也是頂級平庸的。
僅僅是博客文章嗎?哦,我希望如此。亞馬遜上有數百本書,銷售了數千本,是由AI寫的。某種程度上,一部分人對AI的能力視而不見。雖然長破折號不是確鑿標誌,但寫作的可預測性和缺乏自發的創造性可以被識別。但人們仍然閲讀、出版甚至分享它們。
因此,我們已經有了一個AI垃圾化的互聯網。
如果你不確定有多少人“擁抱AI”寫作,請訪問r/WritingWithAI。
這引入了一個次要但令人着迷的場景:模型崩潰。隨着這些垃圾內容充斥互聯網,它們不可避免成為下一代大型語言模型的訓練數據。如果GPT-3是在拼命想模仿維基百科的人類寫作者上訓練的,未來模型將在拼命想模仿GPT-3的AI寫作者上訓練。當從舊神經網絡的合成輸出上訓練模型時,它原本擁有的微小統計方差開始消失。語言完全扁平化,模型學習到一種極其重複、“平均化”的英語版本。
指責AI垃圾化就是指責我們自己。2010年代之後,人類寫作者被訓練成SEO機器——編輯怪癖、偏見、不尋常的句子,並用關鍵詞填充文章。當AI出現並複製我們的寫作時,我們真的不應感到驚訝。
那麼,在當前時代寫好文章就是要寫得……低效。沒有AI能猜到我在這個句子裏插入了“blah”這個詞,因為它們的統計概率顯示在長破折號後添加“blah”的概率是0。這樣做,人類就會知道這是一個人類在為他們寫作。