這篇博文來自 Simon Willison 於 2026 年 10 月 6 日發佈的一條評論,內容是他在 Hacker News 上針對 Mistral Large 4 討論留下的回覆。
引發這條評論的,是 Hacker News 用户 wren6991 的一句調侃:如今的基準測試已經飽和,前沿模型的評測題目簡直像是“讓一隻穿着漁網襪的犰狳在火星上亂穿馬路”。這個荒誕的説法顯然是玩笑,但它指向一個真實問題——常規基準越來越難區分頂級模型之間的差異。
Willison 表示自己實在按捺不住,於是決定真的把這個題目交給模型去做。他通過 llm 命令行工具,讓四個模型分別生成同一段提示詞對應的 SVG 圖像,提示詞正是“生成一張穿漁網襪在火星亂穿馬路的犰狳的 SVG”。
參與測試的四個模型分別是 claude-opus-5.5、gpt-6.1-sol、gemini-3.8-flash,以及 mistral 的 mistral-large-4。Willison 特別説明,所有模型都使用各自的默認推理級別運行,以保證比較條件相對一致。
生成的 SVG 結果通過他搭建的 markdown-svg-renderer 工具頁面集中展示,原始文件則存放在對應的 GitHub Gist 中,讀者可以自行對比不同模型在同一個荒誕任務上的表現。
這篇短文屬於 Willison 博客中的日常評論類內容。文末還列出了他近期的幾篇文章,包括 10 月 3 日的《We're going to need default hard budget caps on pretty much everything》、9 月 29 日的 OpenAI DevDay 2026 實時博客,以及 9 月 27 日的《2026 in LLMs (so far)》,並附有每月簡報的訂閲信息。