AI News HubLIVE
サイト内リライト2 分で読了

AI #168: 未来をリードしない

AI分野の最新ニュースをまとめた記事。主要な進展は少ないが、多くの小さなアップデートがある。BumbleのAIマッチング、ShopifyのAI紹介成功、Claude Opus 4.7のアップグレード、エージェントの失敗(Monaの食堂運営、Amazon社員のトークン浪費)、ベンチマーク、有害行動検出、税金回避、ディープフェイク、ボット、AIアートなどをカバー。

ソースHacker News AI著者: paulpauper

現在のAI分野は比較的落ち着いた時期にあり、社内での議論やモデル改善が続いているが、大きな進展はない。本記事では、最近の注目すべきいくつかの動向をまとめている。

実用面では、Bumbleがスワイプを廃止し、AIアシストによるマッチングとAIデートアシスタント「Bee」を導入する計画。ShopifyはAIによる紹介経由の買い物客のコンバージョン率が50%高く、支出が14%多いと報告。一方、旅行、eコマース、デート分野でのAI応用はまだ成功しておらず、チャットボットのインターフェースが適切ではないとの意見もある。

モデルのアップグレードとして、Claude Opus 4.7がClaude CodeとAPIで高速モードを提供。Claude Codeにはエージェントビュー(複数の並行セッションを追跡)と/goalコマンド(目標達成まで継続)が追加された。

AIエージェントのパフォーマンスは依然として不十分。Anton LabsはGoogleのGeminiベースのAIエージェントMonaをストックホルムの実際の食堂で2週間運営させ、予算は21,000ドル。Monaは不要な物資(ナプキン6,000枚、手袋3,000枚、トマト缶300個)を大量購入し、パンの注文を忘れたため、サンドイッチメニューを削除。売上は5,700ドルにとどまり、さらに業務時間外にSlackメッセージを送信した。

ベンチマークでは、OpenAIモデルが法律推論のPrinzBenchで向上し、ジュニアアソシエイト以上のレベルに達した。一方、ProgramBenchでは全モデルが0%だったが、多くのタスクが不可能または仕様にない動作をテストしていると報告されている。

有害行動検出では、Santiago AranguriがLogit Path Extrapolation法を発表。元モデルと安全性の低いバージョンの間をロジット空間で補間し、有害行動の発生率を推定。通常のサンプリングより30倍少ない試行で済む。

税金回避におけるAIの活用が話題に。AIは合法的に税金回避を支援でき、税法の穴を利用する。これにより税制の簡素化が進むか、富裕層のさらなる節税が進む可能性がある。

ディープフェイクとボットの問題が続く。Lulu Cheng Meserveyは、製品ローンチの多くがボットを使った偽のエンゲージメントで偽造されていると指摘。特にX(旧Twitter)の返信がボットで埋め尽くされ、対策が追いついていない。

アート生成では、AIで生成したモネ風画像と本物のモネ絵画を比較する実験が行われ、多くの人がAIアートより本物を優れと評価するが、それが本当にAIだと知ると評価が変わるという二重基準が明らかになった。

その他、Claudeに「今すぐすべてを修正する」トップ10ボタンを尋ねる、AI執筆支援の注意点、OpenAIがFSU銃撃事件で訴えられる、AIアライメント問題がSlackメッセージで再注目されるなどの話題があった。