翻訳待ち:AI agents can't yet do open-ended AI research
AI サービスが一時的に利用できないため、復旧後に翻訳を補完します。ソース概要:Early evidence from two case studies
- AI 生成が一時的に利用できないため、ソース内容とフォールバックメタデータを保存しました。
- Early evidence from two case studies
AI analysis newsletter; summary-only unless authorization is obtained.
AI サービスが一時的に利用できないため、復旧後に翻訳を補完します。ソース概要:Early evidence from two case studies
ICML 2025での基調講演。AIを「正常な技術」と捉え、その影響は発明・革新・普及・適応の4段階を経て徐々に現れると主張。再帰的自己改善は考慮すべきだが、突然の完全失業にはつながらない。将来の仕事は根本的に変化し、人間とAIの「協調的超知能」が必要となる。
本稿では、AIがソフトウェアエンジニアの大量解雇を引き起こしたというナラティブをデータとケーススタディで反論する。AIによる解雇とされるものは財務上の理由による「AIウォッシング」であることが多く、実際の雇用データは、AIが「実行」層を圧縮しても「意思決定」と「提供」層は人間に依存することを示している。「決定-実行-提供サンドイッチ」モデルを提示し、これらのボトルネックはAIの能力向上だけでは解消されないと論じる。
GoogleはAIエージェントチームがたった1つのプロンプトと約900ドルのAPI費用でOSを構築したと主張したが、本稿ではその主張の複数の問題点を分析:プロンプトは実際には数千行に及び、過学習の可能性、重要な詳細の欠如など。独立した評価の重要性を強調し、この種の「オープンワールド評価」には新たな方法論的規範が必要であると論じる。
AIガバナンスの難しい作業を避けるべきではない。本稿は、AIリスクに対する特別な政府介入の呼びかけに異議を唱え、社会の回復力と通常の政策プロセスへの投資を提唱する。
CRUXプロジェクトの紹介。長期にわたる現実世界のタスクを通じてAI能力を評価する「オープンワールド評価」を定期的に実施。最初の実験では、AIエージェントが自律的にiOSアプリを公開し、進歩とリスク(アプリストアスパムなど)の両方を浮き彫りにしました。
研究者らはAIエージェントの信頼性を測定する枠組みを提案し、12の指標に分解。14のモデルを18ヶ月にわたってテストした結果、能力は急速に向上したが信頼性の向上は緩やかであり、信頼性を独立した次元として最適化するよう呼びかけている。
本稿は「通常技術としてのAI」フレームワークを法律サービスに適用し、高度なAIが消費者の望むリーガルアウトカムを低コストで実現するのを自動的には助けないと論じる。その理由は、規制障壁、対抗的ダイナミクス、人間の関与という3つのボトルネックにある。また、制度改革の可能性についても検討する。
人間にとって難しいことはAIにとって簡単であり、その逆もまた然りとするこの有名な格言は、実証的根拠に乏しく、進化的説明にも疑問がある。AIコミュニティで繰り返されるこのパラドックスは、超知能への警鐘やロボット工学への誤った安心感を生み出している。著者は、予測に頼るのではなく、確実に来る技術変化に適応することを提唱する。
本稿は「AIを普通の技術とみなす」フレームワークを掘り下げ、AI 2027との対比、拡散速度の誤解、導入の実際の課題について論じる。
AIは科学の進歩を加速すると期待されているが、本稿は「生産-進歩パラドックス」を悪化させ、ソフトウェアエラーを拡大し、誤った理論への依存を強め、人間の理解を損なうことで、むしろ進歩を遅らせる可能性を指摘する。制度改革とAIツールの再設計を提言。
本稿は、汎用人工知能(AGI)がマイルストーンではないと論じる。AGIは明確な能力閾値を持たず、観測不可能であり、経済的影響は長期間をかけた普及によってのみ現れる。AIのリスクは能力ではなく環境設計に依存する。企業は慎重にAIを採用し、政策立案者はAGI追求よりも普及促進に注力すべきである。
新しい論文は、AIを超知能的な存在ではなく、正常な技術と見なすべきだと主張する。緩やかな採用、漸進的な経済的影響、そして人間の制御の重要性を強調し、ユートピア的・ディストピア的な物語とは対照的である。
本稿では、AI能力の進歩が鈍化しているかどうかの議論を分析する。著者らは、モデルスケーリングは終焉しておらず、業界リーダーの予測は信頼できないと指摘。推論時スケーリング(inference scaling)には可能性があるが限界もあり、能力向上と経済的影響の関連は弱く、製品開発と採用が鍵だと論じる。
2024年の世界の選挙におけるAI利用の分析により、ディープフェイクの半数以上に欺瞞的意図がなく、欺瞞的なコンテンツのほとんどはAIなしでも安価に作成可能であることが判明。誤情報の拡散は需要によって駆動される。