跳到主要內容
AI News HubLIVE
更多
站內改寫1 分鐘閱讀

Mistral Large 4:讓四個前沿模型畫“穿漁網襪在火星亂穿馬路的犰狳”

文章摘要

Simon Willison 在 Hacker News 上評論 Mistral Large 4 釋出時,借一句“基準測試已經飽和”的吐槽,用四個前沿模型分別生成同一張荒誕提示詞的 SVG,並在部落格中給出了結果連結。

Mistral Large 4:讓四個前沿模型畫“穿漁網襪在火星亂穿馬路的犰狳”
回報錯誤

更正管道尚未開通,可先複製下方文章資訊留存。

查看更正說明
直接讀正文

這篇博文來自 Simon Willison 於 2026 年 10 月 6 日釋出的一條評論,內容是他在 Hacker News 上針對 Mistral Large 4 討論留下的回覆。

引發這條評論的,是 Hacker News 使用者 wren6991 的一句調侃:如今的基準測試已經飽和,前沿模型的評測題目簡直像是“讓一隻穿著漁網襪的犰狳在火星上亂穿馬路”。這個荒誕的說法顯然是玩笑,但它指向一個真實問題——常規基準越來越難區分頂級模型之間的差異。

Willison 表示自己實在按捺不住,於是決定真的把這個題目交給模型去做。他透過 llm 命令列工具,讓四個模型分別生成同一段提示詞對應的 SVG 影像,提示詞正是“生成一張穿漁網襪在火星亂穿馬路的犰狳的 SVG”。

參與測試的四個模型分別是 claude-opus-5.5、gpt-6.1-sol、gemini-3.8-flash,以及 mistral 的 mistral-large-4。Willison 特別說明,所有模型都使用各自的預設推理級別執行,以保證比較條件相對一致。

生成的 SVG 結果透過他搭建的 markdown-svg-renderer 工具頁面集中展示,原始檔案則存放在對應的 GitHub Gist 中,讀者可以自行對比不同模型在同一個荒誕任務上的表現。

這篇短文屬於 Willison 部落格中的日常評論類內容。文末還列出了他近期的幾篇文章,包括 10 月 3 日的《We're going to need default hard budget caps on pretty much everything》、9 月 29 日的 OpenAI DevDay 2026 即時部落格,以及 9 月 27 日的《2026 in LLMs (so far)》,並附有每月簡報的訂閱資訊。

展開要點與分析

文章情報

工程師進階

要點

  • 文章源自 Simon Willison 對 Hacker News 上 Mistral Large 4 討論的評論。
  • 他引用 wren6991 的調侃:基準測試已飽和,前沿模型像是在測試“穿漁網襪在火星亂穿馬路的犰狳”。
  • 他用 llm 命令列工具讓 claude-opus-5.5、gpt-6.1-sol、gemini-3.8-flash 和 mistral/mistral-large-4 以預設推理級別生成同一張 SVG。
  • 所有模型的生成結果透過 markdown-svg-renderer 工具頁面統一展示。

要點與分析由自動化流程生成,可能有誤,請結合原始來源核實。

Mistral Large 4:讓四個前沿模型畫“穿漁網襪在火星亂穿馬路的犰狳” | AI News Hub