この投稿は、Simon Willison が2026年10月6日に公開したコメント記事で、Hacker News 上の Mistral Large 4 に関する議論に対して彼が寄せた返信をまとめたものだ。
発端は、Hacker News ユーザーの wren6991 による皮肉な指摘だった。現在のベンチマークはもはや飽和状態にあり、フロンティアモデルは「網タイツを穿いたアルマジロが火星で道路を横断する」ような課題でテストされているのではないか、というのである。もちろんこれは冗談めかした表現だが、最高性能のモデル同士を従来型のベンチマークで区別するのが難しくなっているという現実を突いている。
Willison はこのネタに抗えなかったと述べ、実際にその荒唐無稽なプロンプトをモデルへ投げることにした。彼は llm コマンドラインツールを使い、4つのモデルそれぞれに対して「網タイツを穿いたアルマジロが火星を横断している様子のSVGを生成せよ」という同一の指示を与えている。
対象となったモデルは claude-opus-5.5、gpt-6.1-sol、gemini-3.8-flash、そして mistral の mistral-large-4 である。Willison は各モデルを既定の推論レベルで実行したと明記しており、比較条件をおおむね揃えている。
生成されたSVGは、彼が公開している markdown-svg-renderer のページからまとめて確認できるようになっており、元ファイルは GitHub の gist に置かれている。同じ馬鹿げた課題に対して各モデルがどう描き分けたかを読み手が直接見比べられる構成だ。
この記事は Willison のブログにおける短いコメント形式の投稿に位置づけられる。文末には最近の記事として、10月3日の「We're going to need default hard budget caps on pretty much everything」、9月29日の OpenAI DevDay 2026 ライブブログ、9月27日の「2026 in LLMs (so far)」が挙げられ、あわせて月次ブリーフィングの購読案内も添えられている。