跳到主要内容
AI News HubLIVE
更多
站内改写1 分钟阅读

Mistral Large 4:让四个前沿模型画“穿渔网袜在火星乱穿马路的犰狳”

文章摘要

Simon Willison 在 Hacker News 上评论 Mistral Large 4 发布时,借一句“基准测试已经饱和”的吐槽,用四个前沿模型分别生成同一张荒诞提示词的 SVG,并在博客中给出了结果链接。

Mistral Large 4:让四个前沿模型画“穿渔网袜在火星乱穿马路的犰狳”
报告错误

纠错通道尚未开通,可先复制下方文章信息留存。

查看更正说明
直接读正文

这篇博文来自 Simon Willison 于 2026 年 10 月 6 日发布的一条评论,内容是他在 Hacker News 上针对 Mistral Large 4 讨论留下的回复。

引发这条评论的,是 Hacker News 用户 wren6991 的一句调侃:如今的基准测试已经饱和,前沿模型的评测题目简直像是“让一只穿着渔网袜的犰狳在火星上乱穿马路”。这个荒诞的说法显然是玩笑,但它指向一个真实问题——常规基准越来越难区分顶级模型之间的差异。

Willison 表示自己实在按捺不住,于是决定真的把这个题目交给模型去做。他通过 llm 命令行工具,让四个模型分别生成同一段提示词对应的 SVG 图像,提示词正是“生成一张穿渔网袜在火星乱穿马路的犰狳的 SVG”。

参与测试的四个模型分别是 claude-opus-5.5、gpt-6.1-sol、gemini-3.8-flash,以及 mistral 的 mistral-large-4。Willison 特别说明,所有模型都使用各自的默认推理级别运行,以保证比较条件相对一致。

生成的 SVG 结果通过他搭建的 markdown-svg-renderer 工具页面集中展示,原始文件则存放在对应的 GitHub Gist 中,读者可以自行对比不同模型在同一个荒诞任务上的表现。

这篇短文属于 Willison 博客中的日常评论类内容。文末还列出了他近期的几篇文章,包括 10 月 3 日的《We're going to need default hard budget caps on pretty much everything》、9 月 29 日的 OpenAI DevDay 2026 实时博客,以及 9 月 27 日的《2026 in LLMs (so far)》,并附有每月简报的订阅信息。

展开要点与分析

文章情报

工程师进阶

要点

  • 文章源自 Simon Willison 对 Hacker News 上 Mistral Large 4 讨论的评论。
  • 他引用 wren6991 的调侃:基准测试已饱和,前沿模型像是在测试“穿渔网袜在火星乱穿马路的犰狳”。
  • 他用 llm 命令行工具让 claude-opus-5.5、gpt-6.1-sol、gemini-3.8-flash 和 mistral/mistral-large-4 以默认推理级别生成同一张 SVG。
  • 所有模型的生成结果通过 markdown-svg-renderer 工具页面统一展示。

要点与分析由自动化流程生成,可能有误,请结合原始来源核实。