这篇博文来自 Simon Willison 于 2026 年 10 月 6 日发布的一条评论,内容是他在 Hacker News 上针对 Mistral Large 4 讨论留下的回复。
引发这条评论的,是 Hacker News 用户 wren6991 的一句调侃:如今的基准测试已经饱和,前沿模型的评测题目简直像是“让一只穿着渔网袜的犰狳在火星上乱穿马路”。这个荒诞的说法显然是玩笑,但它指向一个真实问题——常规基准越来越难区分顶级模型之间的差异。
Willison 表示自己实在按捺不住,于是决定真的把这个题目交给模型去做。他通过 llm 命令行工具,让四个模型分别生成同一段提示词对应的 SVG 图像,提示词正是“生成一张穿渔网袜在火星乱穿马路的犰狳的 SVG”。
参与测试的四个模型分别是 claude-opus-5.5、gpt-6.1-sol、gemini-3.8-flash,以及 mistral 的 mistral-large-4。Willison 特别说明,所有模型都使用各自的默认推理级别运行,以保证比较条件相对一致。
生成的 SVG 结果通过他搭建的 markdown-svg-renderer 工具页面集中展示,原始文件则存放在对应的 GitHub Gist 中,读者可以自行对比不同模型在同一个荒诞任务上的表现。
这篇短文属于 Willison 博客中的日常评论类内容。文末还列出了他近期的几篇文章,包括 10 月 3 日的《We're going to need default hard budget caps on pretty much everything》、9 月 29 日的 OpenAI DevDay 2026 实时博客,以及 9 月 27 日的《2026 in LLMs (so far)》,并附有每月简报的订阅信息。