AI News HubLIVE
站內改寫2 分鐘閱讀

21.2萬次AI編程基準測試:上下文勝過通用提示詞

基於超過21.2萬次、覆蓋四種語言的AI編程基準測試,本文發現通用編碼指令會降低模型輸出質量,空白提示詞的基線表現最佳。項目專屬上下文最有價值;思維鏈對Go和C#有幫助但對Python有害;正面與負面措辭的差異在更大規模測試中不顯著;成長型心態框架有助益,高壓框架顯著有害。

來源Hacker News AI作者: tmuhlestein

2026年6月更新。本文最初基於1,458個Python基準測試,如今已擴展到212,000多次,覆蓋Python、Go、JavaScript和C#,並測試了思維鏈、禮貌、人格設定、上下文污染、模型選擇、驗證指令、多輪迭代、語言專屬規則、/init優化、情緒措辭、輸出壓縮等變量。所有實驗均使用Claude Haiku、Sonnet和Opus,數據開源在claude-benchmark倉庫。

最核心的基線發現依然令人不適:在1,458次運行、13種提示配置和3個模型上,沒有任何配置能穩定擊敗空提示詞。空提示詞的複合得分為92.15;micro-quality(4條通用編碼建議)為91.61(-0.54);typical-readable為91.08(-1.07);large-readable為91.29(-0.86)。指令token數與質量之間的相關係數為r=-0.95,接近完全負相關。換句話説,每多寫一條通用規則,輸出質量平均就會下降一點。

這説明常見提示工程建議在編碼任務上常常適得其反。風格規則、思維鏈指令、人格設定和格式要求,都是在向模型已有的能力中注入噪聲。跨語言實驗進一步揭示:Python的基線能力太高,這些建議大多是噪音;而Go、JavaScript和C#上模型信心較低,反而能從模型尚未內化的明確指令中受益。

第一條規則是不要教Claude怎麼寫代碼。把“使用snake_case”“為公共函數寫docstring”“處理邊界情況”這類通用編程知識寫進提示,看似無害,卻在測試中造成0.54分損失。第二條是不要告訴Claude怎麼思考。在270次運行的思維鏈實驗中,cot-prefix平均比基線低0.56,cot-detailed低0.73;Opus在refactor-01任務上從86.8跌到83.3。但跨語言結論發生了反轉:思維鏈在Go上提升5.3,在C#上提升7.7,在Python上反而下降0.5。

第三條規則是告訴模型它不知道的事:構建命令、項目結構、提交格式、領域術語等訓練數據裏沒有的項目專屬知識,才是真正有正向價值的信息。理想的CLAUDE.md應當像新成員入職文檔,而不是風格指南。第四條涉及措辭方向:在最初的Python數據中,正面框架比負面框架高0.66分;但跨語言實驗的20,499次評分顯示,這一差異只是噪聲。真正明顯的變量是情緒語氣:成長型心態框架提升1.88分,而“生死攸關”的高壓框架降低3.33分。

第五條規則是隻針對具體弱點寫指令。指令在簡單任務上有害,在困難任務上有用:workflow配置在Opus的指令遵循任務上提升5.80分,把最低分從61.4提高到83.5;refactor-aware在Haiku重構任務上提升2.54。因此,不要把CLAUDE.md一刀切,而應根據觀察到的弱點使用定向指令。第六條規則是保留格式:Markdown標題、項目符號和留白能幫助較小模型解析指令。typical-readable在Haiku(-1.56)和Sonnet(-0.86)上均優於壓縮版,Opus對格式不敏感(+0.19)。

所有任務遵循bug-fix-01-go之類的命名約定,共48個任務(每語言12個),位於tasks/builtin/目錄。跨語言實驗配置為experiments/cross-language.toml和experiments/cot-cross-language.toml。對多數開發者而言,核心建議很明確:少寫通用規則,多寫項目專屬上下文,並用鼓勵的口吻描述要做什麼。