這篇博文來自 Simon Willison 於 2026 年 10 月 6 日釋出的一條評論,內容是他在 Hacker News 上針對 Mistral Large 4 討論留下的回覆。
引發這條評論的,是 Hacker News 使用者 wren6991 的一句調侃:如今的基準測試已經飽和,前沿模型的評測題目簡直像是“讓一隻穿著漁網襪的犰狳在火星上亂穿馬路”。這個荒誕的說法顯然是玩笑,但它指向一個真實問題——常規基準越來越難區分頂級模型之間的差異。
Willison 表示自己實在按捺不住,於是決定真的把這個題目交給模型去做。他透過 llm 命令列工具,讓四個模型分別生成同一段提示詞對應的 SVG 影像,提示詞正是“生成一張穿漁網襪在火星亂穿馬路的犰狳的 SVG”。
參與測試的四個模型分別是 claude-opus-5.5、gpt-6.1-sol、gemini-3.8-flash,以及 mistral 的 mistral-large-4。Willison 特別說明,所有模型都使用各自的預設推理級別執行,以保證比較條件相對一致。
生成的 SVG 結果透過他搭建的 markdown-svg-renderer 工具頁面集中展示,原始檔案則存放在對應的 GitHub Gist 中,讀者可以自行對比不同模型在同一個荒誕任務上的表現。
這篇短文屬於 Willison 部落格中的日常評論類內容。文末還列出了他近期的幾篇文章,包括 10 月 3 日的《We're going to need default hard budget caps on pretty much everything》、9 月 29 日的 OpenAI DevDay 2026 即時部落格,以及 9 月 27 日的《2026 in LLMs (so far)》,並附有每月簡報的訂閱資訊。