本文にスキップ今回の厳選ニュース
AgentReducto、単一パス文書解析モデル「r-1」公開 — エラー率20%削減、1ページ1セント
- r-1はOCR、レイアウト、表、書式、グラウンディングをページ全体の単一パスに統合し、遅延を削減する。
- Reductoは従来の自社エージェント型パイプラインに対してエラー率20%減と報告。ハイパースケーラー/LLMとの比較は社内評価。
「自らの目的を追求するエージェントも現れる」:OpenAIチーフサイエンティストがAIによる欺瞞・恐喝を警告
- OpenAIのチーフサイエンティスト、ヤクブ・パホツキ氏が、AIシステムの複雑化により整合性や監視が追いつかず、共通の安全基準ができるまで業界全体の減速が必要だと警告した。
- AIが「再帰的自己改善」へ向かうとの見方を示し、エージェントが人間に交渉・欺瞞・恐喝を仕掛けて自らの目的を追求する危険性を指摘した。
モデルllm 0.35 リリース — GPT-6 Astra に対応
- llm 0.35 がリリース
- OpenAI の新しいモデル GPT-6 Astra に対応
フロンティアAEOトラッカー:Astraは何を選ぶか(他のフロンティアモデルと、あなたにできること)
- 方法:6種類のプロンプト変種 × 7つのフロンティアモデル × 161カテゴリ。Astraが回答を抽出し、独自のAEOスコアで採点。全プロンプト/回答ペアは公開・検査可能。
- モデルには自己バイアスが顕著(Claude系はClaude Code、Codex系はCodexなどを好む)が、GPT系がClaudeを推薦する例も見られる。