本文にスキップ
AI News HubLIVE

今回の厳選ニュース

研究

OpenAIがMentalHealthBenchを公開:メンタルヘルス会話を評価するオープンベンチマーク

  • 22カ国・19言語・約20のサブスペシャリティにまたがる80名以上の公認専門家が共同で作成。
  • 非急性・高急性・緊急の3段階と、成人・13〜17歳の10代・介護者・臨床家という4種類のユーザーペルソナを対象とする。
OpenAI Newsサイト内本文OpenAIがMentalHealthBenchを公開:メンタルヘルス会話を評価するオープンベンチマーク

Peerify:査読コメントの主張検証をベンチマーク化

  • Peerify は査読文を原子的な主張に分解し、原稿内の関連証拠を検索して、各主張が論文に支持されているかを判定する。
  • ベンチマークは NeurIPS 2024 と ICLR 2024 の実際の査読やり取りに由来する 800 件の主張を含み、うち 300 件は自動監督の監査用に人手でラベル付けされている。
arXiv Computational Linguisticsサイト内本文Peerify:査読コメントの主張検証をベンチマーク化

深層不均衡回帰評価の盲点を明らかにする

  • DIR 評価には、画像ベンチマーク偏重、決定不完全な標準プロトコル、未検証のテール安定性という三つの盲点がある。
  • MuViS マルチモーダル仮想センシングベンチマーク上で、6つの物理領域にまたがる9つの時系列回帰タスクを評価。
arXiv Machine Learningサイト内本文深層不均衡回帰評価の盲点を明らかにする

量子計算と古典計算の連携:プライバシー保護型ハイブリッド手法

  • ハイブリッド量子・古典モデルを能動側、古典モデルを受動側とし、連合学習で組み合わせて生データの集約を回避。
  • SBVFL プロトコルにより、データを集約せずに通信量を大幅削減。
arXiv Machine Learningサイト内本文量子計算と古典計算の連携:プライバシー保護型ハイブリッド手法
Agent

GrabとOpenAI、東南アジアに実践的なAIスキルを届ける

  • 「GO Forward with AI」は2年間でGrabのドライバー・配達・加盟店パートナー3万人を対象とする。
  • シンガポールで開始し、年内にタイ、インドネシア、フィリピンへ、2027年にマレーシアとベトナムへ拡大。
OpenAI Newsサイト内本文GrabとOpenAI、東南アジアに実践的なAIスキルを届ける
モデル

[AINews] Claude Opus 5.5 が AINews の新デフォルトモデルに——各社が 40〜50% 値下げ

  • Opus 5.5 はエージェント型コーディング、コンピュータ操作、ナレッジワークで先行するとされ、約 30% 高速化、トークン価格は 100 万トークンあたり 5/25 ドルから 4/20 ドルへ 20% 引き下げ。
  • Artificial Analysis によれば最大 effort でのタスクあたりコストは Opus 5 とほぼ同等(5.98 ドル対 5.86 ドル)で、トークン使用量の増加が値下げを相殺する。
Latent Spaceサイト内本文[AINews] Claude Opus 5.5 が AINews の新デフォルトモデルに——各社が 40〜50% 値下げ

OpenAIがGPT-6 SolとLunaを公開、トークン価格を半額に

  • 価格:Solは100万入力/出力トークンあたり2ドル/10ドル、Lunaは0.10ドル/0.50ドルで、GPT-5.6世代の半額以下。今回はプロモーションではなく既定価格。
  • 性能:ZapierのAutomationBenchでLunaは5.4ポイント改善。DeepSWE v1.1ではSolがAnthropicのFable 5とほぼ同等ながら、コストは約20%。
The New Stack AIサイト内本文OpenAIがGPT-6 SolとLunaを公開、トークン価格を半額に

同じ量、異なる答え:言語モデルにおける数値表現不変性

  • 5 つのオープンウェイトモデルを、3,600 の厳密有理数問題と 8,600 のプロンプト、5 種類の等価変換で評価した。
  • 固定構文監査後の正準精度は 0.969–0.996 だが、オービット正解率と不変性は 0.848–0.981 と 0.851–0.981 に低下した。
arXiv Computational Linguisticsサイト内本文同じ量、異なる答え:言語モデルにおける数値表現不変性
政策

ディープフェイクと合成メディア:生成・検出・ガバナンス

  • GAN、拡散モデル、ニューラルレンダリング、動画合成など生成技術を概観。
  • 検出は空間・時間・周波数領域・生理的痕跡を利用し、CNN・Transformer・周波数ベース手法が中心。
arXiv Computer Visionサイト内本文ディープフェイクと合成メディア:生成・検出・ガバナンス

今回の厳選記事はここまでです。

リーディングリスト
その他の更新(116件)
Agent

MIT、デイビッド・シーゲル氏(SM ’86、PhD ’91)を次期イノベーション・フェローに迎える

計算機科学者で起業家、慈善家のデイビッド・シーゲル氏が2026-27学年にMITのイノベーション・フェローに就任し、MITシュワルツマン計算大学と協力してAIによる科学的発見の加速を探求する。

MIT News AIサイト内本文MIT、デイビッド・シーゲル氏(SM ’86、PhD ’91)を次期イノベーション・フェローに迎える

YouTube、クリエイターの仕事をほぼ代行するAIツールを開発中

YouTubeは「Made on YouTube」でAIクリエイターツールの更新を発表した。バックグラウンドでチャンネルを最適化するAIエージェントは、サムネイルやタイトルの生成、ブランド提案の作成を支援する。動的サムネイルや最大3バージョンの動画テストも導入される。YouTubeは指標改善を示すデータを共有せず、時間節約を強調している。

The Verge AIサイト内本文YouTube、クリエイターの仕事をほぼ代行するAIツールを開発中

The Sequence ラーニングループ 第938号:Jev、Gemini、Paper2Agent が示す「モデルを動くソフトウェアに変える」方法

今週は3つの動きを取り上げます。構造化された意思決定向けに設計された TypeSafe の Jev、会話と推論を異なる形で扱う Google の2つの Gemini Live モデル、そして研究手法をエージェントが再利用できるツールに変えるスタンフォードの Paper2Agent が Nature に掲載されたことです。中心となる主張は、モデルそのものと同じくらい、モデルを取り巻くインターフェースに注意を払うべきだという点です。

TheSequenceサイト内本文The Sequence ラーニングループ 第938号:Jev、Gemini、Paper2Agent が示す「モデルを動くソフトウェアに変える」方法

IntellAgents.io:電話・チャット・DMを1つのAIエージェントで

IntellAgents.ioがProduct Huntに登場し、「あらゆる通話、チャット、DMに対応する1つのAIエージェント」という一文で位置づけを打ち出した。現時点で公開されている情報はこのキャッチコピーとディスカッションへのリンク程度にとどまる。

Product Hunt AIサイト内本文IntellAgents.io:電話・チャット・DMを1つのAIエージェントで

翻訳待ち:MCP Is Not Just Another API Standard

AI サービスが一時的に利用できないため、復旧後に翻訳を補完します。ソース概要:Ask most engineers what MCP is and you’ll get the same answer: a way to plug tools into an LLM. Fair enough, as far as it goes. But that description treats MCP like plumbing, and after months building MCP-based integrations for large enterprise platforms, I don’t think plumbing is the right metaphor. Plumbing moves water […]

O'Reilly AI & ML Radar原典の内容 · 翻訳・分析待ち翻訳待ち:MCP Is Not Just Another API Standard

LaterOn v2:エージェント型メールプラットフォーム

LaterOn v2は、Product Huntに登場したエージェント型メールプラットフォームです。メール作業を一度説明するだけで、自動的に処理を進められる点を掲げています。

Product Hunt AIサイト内本文LaterOn v2:エージェント型メールプラットフォーム

SpeakON、独自マイクを備えたMagSafe AI音声ボタンを出荷

SpeakONは、独自のマイク、バッテリー、ストレージを内蔵した25gのMagSafe AI音声ボタンを発表した。iOSキーボード拡張として、処理済みテキストを任意の入力欄へ直接書き込み、オフライン時のバッファリングや文章整形、12言語翻訳に対応する。米国で129ドルの買い切り、Pro Lifetime込み。SpeakON Agentは2026年10月に提供予定。

MarkTechPostサイト内本文SpeakON、独自マイクを備えたMagSafe AI音声ボタンを出荷

AI集団における社会的影響と科学的注意の配分

新たなarXiv論文が「Music Lab」型の社会的影響実験を学術的注意の市場に応用した。1,000体のAIエージェントが『American Economic Review』2025年掲載の通常研究論文114本から選択する実験では、同じコミュニティ内の先行選択を観察できるエージェントは1体あたり17.2%少ない論文しか選ばず、選択はより集中し、集団としての被覆は独立選択の90本に対し73本にとどまった。別実験では、論文に5回の初期選択を無作為に与えると、その後の選択率が45.55ポイント上昇した。

arXiv AIサイト内本文AI集団における社会的影響と科学的注意の配分

SpeakON、自前のマイクを備えたMagSafe AI音声ボタンを発売——音声を整ったコミュニケーションとアプリ横断のアクションに

SpeakONは、単体でマイクとバッテリーを搭載した重さ25gのMagSafe磁気ボタンを発表した。iOSのキーボード拡張を通じて、整形済みのテキストを任意のアプリの入力欄へ直接書き込む。ロック中やオフラインでも動作し、Smart PolishやSmart List、Style、Translationなどのテキスト整形機能を備える。米国では129ドルの買い切りでPro Lifetimeが付属し、サブスクリプションは不要。

MarkTechPostサイト内本文SpeakON、自前のマイクを備えたMagSafe AI音声ボタンを発売——音声を整ったコミュニケーションとアプリ横断のアクションに

サンフランシスコ10月14日:エージェント型エンジニアリングをめぐるBoFセッション

Simon Willison氏とJesse Vincent氏が、10月14日(水)の夜にサンフランシスコで、コーディングエージェントを使い、またその上に何かを作っている人々を対象とした非公式な交流会を開催する。形式は「エージェント版ショー・アンド・テル」で、製品ピッチではなく、未公開の実験や未完成のプロジェクトといった初期段階の試みを歓迎する。

Simon Willison's Weblogサイト内本文サンフランシスコ10月14日:エージェント型エンジニアリングをめぐるBoFセッション

Kaiku

Kaikuは、AIエージェントがすでに使い方を知っているタスクトラッカーとしてProduct Huntで紹介されています。

Product Hunt AIサイト内本文Kaiku

翻訳待ち:How to serve trillions of tokens for trillion-parameter coding agents

AI サービスが一時的に利用できないため、復旧後に翻訳を補完します。ソース概要:Learn how we optimized performance and efficiency serving the workload that is changing software engineering forever — and you can too.

Modal Blog原典の内容 · 翻訳・分析待ち翻訳待ち:How to serve trillions of tokens for trillion-parameter coding agents

Rabbitの新しいAIエージェントはR1なしで動作

Rabbitは、自社ハードウェアのR1がなくても使える単体のAIエージェントを公開する。クラウド上で動く新OS「OS3」は“エージェント型オペレーティングシステム”とされ、Windows、Mac、Linux上でローカルに操作を実行できる。1アカウントにつき最大5台のデバイスと好みのAIモデルを登録でき、専用デスクトップサイト、TelegramやiMessageなどの連携メッセージアプリ、R1からアクセス可能。RabbitはR1の製造を終了し、代わりにOS3を搭載するvibe-coding向け「サイバーデッキ」を準備している。同社はOS3がデータを保存・複製・利用・販売しないと主張するが、チャットとそれに由来する記憶は自社サーバーに残り、連携する第三者のAIプロバイダーは独自のプライバシールールでデータを扱う。

The Verge AIサイト内本文Rabbitの新しいAIエージェントはR1なしで動作

Jev State:AI との会話をテストと実行可能なコードに変える

Jev State は Product Hunt に掲載されたツールで、AI との会話をテストと実行可能なコードに変換することを掲げています。ただし公式に公開されているのは一行の説明のみで、実際のワークフローや対応フレームワークは明らかになっていません。

Product Hunt AIサイト内本文Jev State:AI との会話をテストと実行可能なコードに変える

「26年の歴史の中で最も重要な一歩の一つ」:JetBrainsがエージェント型開発に本格注力、IDEの重要性も強調

JetBrainsは「JetBrains Air」を、エージェント型ソフトウェア開発のためのオープンな製品体系として正式に打ち出した。IDE内でのエージェント操作、Air Teamsによるチーム協調、Air Governanceによる企業統制を束ね、IDEが今後も開発の中核であり続けると強調している。

The New Stack AIサイト内本文「26年の歴史の中で最も重要な一歩の一つ」:JetBrainsがエージェント型開発に本格注力、IDEの重要性も強調

引用:@therealcornpop が語る「AI 脚本がすぐ分かる理由」

TikTok のクリエイター @therealcornpop は、AI で書いた TikTok や YouTube の台本がすぐに見抜かれるのは、表層的な「AI っぽさ」ではなく、内容が空っぽで固有の声や本物の意見が欠けているからだと指摘した。Simon Willison が 2026 年 9 月 22 日に自身のブログでこの引用を紹介している。

Simon Willison's Weblogサイト内本文引用:@therealcornpop が語る「AI 脚本がすぐ分かる理由」

翻訳待ち:Evaluate skill-equipped agents with Strands Evals and Amazon Bedrock AgentCore

AI サービスが一時的に利用できないため、復旧後に翻訳を補完します。ソース概要:Skills let you encode domain-specific procedures as reusable, portable instructions for agents, but a fluent answer doesn't prove the agent picked the right skill or followed it. Learn how to measure skill selection and instruction following with Strands Evals and Amazon Bedrock AgentCore Evaluations.

AWS Machine Learning Blog原典の内容 · 翻訳・分析待ち翻訳待ち:Evaluate skill-equipped agents with Strands Evals and Amazon Bedrock AgentCore

Databricks のコストを把握するためのシステムテーブルクエリ Top 5

Databricks のシステムテーブルを使うと、製品、SQL ウェアハウス、タグごとにコストをほぼリアルタイムで分解できます。本記事では、製品別の日次支出、ウェアハウスのコスト推移、タグ別のコスト配賦、14 日間の異常検知、AI による支出予測という 5 つの SQL クエリと、それぞれの注意点、ダッシュボード活用の次のステップを紹介します。

Databricks Blogサイト内本文Databricks のコストを把握するためのシステムテーブルクエリ Top 5

Genie One MCP が正式に一般提供開始

Databricks は Genie One MCP サーバーの一般提供を発表した。任意の AI エージェントが単一のインターフェースを通じて Genie One から構造化・非構造化データ、インサイト、回答を取得でき、Genie Ontology による統制されたビジネスコンテキストに基づいている。この MCP は Unity Gateway 内のマネージド MCP サービスとして提供され、集中ガバナンス、きめ細かなポリシー、監査ログに対応する。

Databricks Blogサイト内本文Genie One MCP が正式に一般提供開始

翻訳待ち:Genie One MCP: Give any AI Agent the Right Business Context

AI サービスが一時的に利用できないため、復旧後に翻訳を補完します。ソース概要:Business leaders often have access to plenty of data, but still can’t get a reliable...

Databricks Blog原典の内容 · 翻訳・分析待ち翻訳待ち:Genie One MCP: Give any AI Agent the Right Business Context

翻訳待ち:AI Change Management | Cohere

AI サービスが一時的に利用できないため、復旧後に翻訳を補完します。ソース概要:Change management has long covered two familiar kinds of change: the rollout of new tools and technologies, and broader human-led transformations such as leadership changes and restructuring. But that distinction starts…

Cohere Blog原典の内容 · 翻訳・分析待ち翻訳待ち:AI Change Management | Cohere

翻訳待ち:The frontier isn’t a model. It’s a router.

AI サービスが一時的に利用できないため、復旧後に翻訳を補完します。ソース概要:The frontier isn’t a model. It’s a router. Join us for our inaugural conference, Forge 2026 Blog The Frontier Isnt A Model Its A Router The frontier isn’t a model. It’s a router. PUBLISHED 9/21/2026 Table of Contents Ho…

Fireworks AI Blog原典の内容 · 翻訳・分析待ち翻訳待ち:The frontier isn’t a model. It’s a router.

翻訳待ち:The Accelerationist Case for Frontier Pacing

AI サービスが一時的に利用できないため、復旧後に翻訳を補完します。ソース概要:The following article originally appeared on Venkatesh Rao’s Substack, Contraptions, and is being republished here with the author’s permission. The sole athletic achievement of my life came in 1993: winning the IIT Bombay freshman 50m freestyle race with a time of 41s. That got me into the college swim team (it was a bad recruitment […]

O'Reilly AI & ML Radar原典の内容 · 翻訳・分析待ち翻訳待ち:The Accelerationist Case for Frontier Pacing

翻訳待ち:Pinecone BYOC: Trusted AI Knowledge in the Customer Cloud | Pinecone

AI サービスが一時的に利用できないため、復旧後に翻訳を補完します。ソース概要:← Blog Pinecone BYOC: Trusted AI Knowledge in the Customer Cloud Jeff Zhu, Joerg Schad Sep 23, 2026 Product Share: Today, we are announcing the general availability of Pinecone Bring Your Own Cloud (BYOC) on AWS, Google…

Pinecone Blog原典の内容 · 翻訳・分析待ち翻訳待ち:Pinecone BYOC: Trusted AI Knowledge in the Customer Cloud | Pinecone
ツール

AIとの(複雑な)関係:しばしば魅力的で、時に苛立ち、常に警戒を要する

多言語で研究する学者がリヴァプール発ロンドン行きの列車で、車両の半分の乗客がChatGPTやClaude、Geminiといったチャットボットと深く会話している光景を目にする。「遅い思考」のための貴重な研究休暇中のはずの自分をよそに、誰もゆっくり考えていない。AIは多言語の研究者にとって競争条件を平準化したと認めつつ、思考と判断、そして頑なに自分のものであるアイデアを手放さないと記す。AIとの関係はしばしば魅力的で、時に苛立ち、常に警戒を要するものだという。

The Guardian AIサイト内本文AIとの(複雑な)関係:しばしば魅力的で、時に苛立ち、常に警戒を要する

Aks.ai:導かれた自己内省のためのパーソナルコンパニオン

Aks.ai は「導かれた自己内省のためのパーソナルコンパニオン」として Product Hunt に登場したが、現時点で公開されている情報はごく限られている。

Product Hunt AIサイト内本文Aks.ai:導かれた自己内省のためのパーソナルコンパニオン

Anthropic、Opus 5.5を発表:高性能も価格は依然プレミアム

AnthropicはOpus 5.5を発表し、強力な性能を打ち出したが、競合との価格競争では依然として後れを取っている。価格はプレミアム路線のまま。

AI Businessサイト内本文Anthropic、Opus 5.5を発表:高性能も価格は依然プレミアム

翻訳待ち:OpenAI nabs key Patreon execs ahead of upcoming announcement

AI サービスが一時的に利用できないため、復旧後に翻訳を補完します。ソース概要:Patreon co-founder Sam Yam is joing OpenAI to lead Creator Product. | Image: The Verge OpenAI has hired three former Patreon execs to anchor its product strategy for creators. After starting the creator subscription platform 13 years ago, co-founder and technology chief Sam Yam announced on X that he's joining OpenAI to lead Creator Product. He's also bringing Patreon's former product head Drew Rowny and engineering head Shannon Ma with him on the new venture, both of whom stepped down in the past few weeks. "We're going to build together with Creators at OpenAI and share early access to a new set of tools that I think will be critically valuable to Creators and their communities," Yam said in his announcement. "Pay attention … Read the full story a…

The Verge AI原典の内容 · 翻訳・分析待ち翻訳待ち:OpenAI nabs key Patreon execs ahead of upcoming announcement

PixVerse R2:探索して変更できるリアルタイム世界モデル

PixVerse R2 が Product Hunt に登場した。探索しながらリアルタイムで変更できる「世界モデル」として位置づけられているが、公開されている情報は短い説明文にとどまる。

Product Hunt AIサイト内本文PixVerse R2:探索して変更できるリアルタイム世界モデル

Lisen:Cartesia の音声を使った無料の読み上げツール

Lisen は Product Hunt に掲載された製品で、無料の読み上げ機能を売りにしており、音声は Cartesia が提供しています。公開されている情報は製品名と短い説明、ディスカッションとリンクの導線にとどまります。

Product Hunt AIサイト内本文Lisen:Cartesia の音声を使った無料の読み上げツール

英国、ロシアなどの「情報戦」に対処する新機関を設置へ バーナム氏が表明

英国のアンディ・バーナム首相は、ロシアなどの敵対国による偽情報やAIディープフェイクに対処するため、国家安全保障当局が新たな国家機関を設置すると発表した。情報機関、法執行機関、SNS企業を結集し、外国勢力による情報攻撃の探知・帰属特定・妨害にあたる。

The Guardian AIサイト内本文英国、ロシアなどの「情報戦」に対処する新機関を設置へ バーナム氏が表明

ChatGPT広告が東南アジアと台湾に拡大

OpenAIはChatGPT広告をインドネシア、マレーシア、フィリピン、シンガポール、タイ、ベトナム、台湾へ順次展開し、対応国は60か国超に。広告はFreeとGoプランのユーザーにのみ表示され、Plus、Pro、Enterpriseは引き続き広告なしとなる。

OpenAI Newsサイト内本文ChatGPT広告が東南アジアと台湾に拡大

AIは実際にどうやって「人類を全滅」させるのか?最も可能性の高い5つのシナリオ | トビー・ウォルシュ

ガーディアン紙の論説記事は、AI研究者ジェイコブ・コクソンがアンソロピックを4カ月で辞めた出来事を切り口に、AIが今十年のうちに人類を滅ぼし得るという業界内部の警告を検証し、危険な新型生物兵器から社会の完全な崩壊まで、最も議論される5つの終末シナリオを挙げている。

The Guardian AIサイト内本文AIは実際にどうやって「人類を全滅」させるのか?最も可能性の高い5つのシナリオ | トビー・ウォルシュ

Bracket

Bracket は「あなたのビジネスのためのメモリーレイヤー」として登場した製品で、業務情報を一元的に記憶・呼び出しできる基盤を目指しています。現時点で公開されている情報はこのキャッチコピーに限られます。

Product Hunt AIサイト内本文Bracket

AgreeGuard

AgreeGuardは、「同意する」をクリックする前に細かい規約をAIが読むProduct Hunt掲載のツールで、利用規約やプライバシーポリシーの確認を支援します。

Product Hunt AIサイト内本文AgreeGuard

Speechka:あなたの声のように聞こえるリアルタイム音声翻訳

Speechkaは、翻訳後の音声が自分の声のように聞こえることを目指したリアルタイム音声翻訳ツールです。Product Huntで公開されており、ディスカッションとリンクが用意されています。

Product Hunt AIサイト内本文Speechka:あなたの声のように聞こえるリアルタイム音声翻訳

トランプ氏、米国がAIを「超知能」に正式改名と発言

トランプ大統領は国連総会での演説で、米国が人工知能(AI)を「超知能」に「正式に」改名すると主張した。「人工」という言葉が知能を偽物のように聞こえさせるからだというのが理由。同じ演説ではイランや「グローバリスト」、トランスジェンダーの人々への批判も展開され、改名に向けた正式な手続きの存在を示す情報は確認されていない。

The Verge AIサイト内本文トランプ氏、米国がAIを「超知能」に正式改名と発言
ロボット

Sakeena Fiza が NVIDIA ハードウェアの大規模な成功を支える

NVIDIAの検証エンジニア、Sakeena Fiza氏は、データセンターシステムを量産前に徹底的に検証し、初回電源投入からラック規模の展開まで、顧客が気づく前に不具合を捕捉する仕事について語る。

NVIDIA Blogサイト内本文Sakeena Fiza が NVIDIA ハードウェアの大規模な成功を支える

HOTICE:雑然とした環境における全身ヒューマノイドによる物体運搬

HOTICEは、雑然とした環境で物体を運搬するための全身ヒューマノイド学習フレームワーク。Humanoid-Object Decoupled Potential Fieldsでロボットと搬送物体の衝突回避を統合的に扱い、上半身・下半身を分離した二エージェント強化学習により全身協調を保つ。専門家から汎用への蒸留で単一の実機展開可能な方策を学習。MuJoCoとUnitree G1で検証し、未知の雑然環境への汎化とsim2real性能を示す。

arXiv Roboticsサイト内本文HOTICE:雑然とした環境における全身ヒューマノイドによる物体運搬

人間から学ぶ協調搬送のための先回り支援:PROACT フレームワーク

人間とロボットが協力して大きな物体を運ぶ協調搬送において、人間の協調行動の予測を柔軟な全身制御に組み込む PROACT を提案。9 自由度移動マニピュレータによる 108 回の実世界実験で、相互作用仕事量と完了時間を大幅に削減した。

arXiv Roboticsサイト内本文人間から学ぶ協調搬送のための先回り支援:PROACT フレームワーク

深層強化学習による人間伴走ロボットの適応的インタラクション戦略

IEEE Transactions on Systems, Man, and Cybernetics: Systems に採録された論文は、深層強化学習を用いて移動ロボットが歩行者の伴走中に追従位置を動的に変える手法を提案する。MPPI 制御と制御バリア関数を組み合わせ、正確な追従と障害物回避、安全性を両立させる。実環境の屋内・屋外実験では成功率と追従精度がそれぞれ少なくとも24%と47%向上し、最大1.7 m/s で歩く人に柔軟に伴走でき、人の快適性も高まった。

arXiv Roboticsサイト内本文深層強化学習による人間伴走ロボットの適応的インタラクション戦略

PAANI:河川ロボットシミュレーションのためのオンデバイス視覚証拠融合と説明可能なガイダンス

PAANI は、河川監視ロボット向けのオンデバイス知覚からガイダンスまでのアーキテクチャであり、Arduino UNO Q 上で YOLO11n 検出器と MobileNetV3 Small セマンティックセグメンターを組み合わせ、タイムスタンプ整合された証拠融合と明示的なコリドーポリシーによって検査可能なガイダンスを提供する。高い精度を示す一方で、モデル性能と検証済みの水上衝突回避を区別している。

arXiv AIサイト内本文PAANI:河川ロボットシミュレーションのためのオンデバイス視覚証拠融合と説明可能なガイダンス
モデル

🔬バイオセキュリティはAI軍拡競争——Radical Numerics CEO Eric Nguyen氏

Radical Numericsの共同創業者兼CEO Eric Nguyen氏は、ゲノム言語モデル(GLM)が長文脈・思考連鎖・マルチモーダル能力を生物学に持ち込み、生物能力を高めると同時に防御側が遅れを取らないための鍵になると語る。Evo/Evo 2による合成可能なウイルスゲノム生成や、DNA言語での思考連鎖実験、そしてフロンティアをさらに推し進めるべき理由を解説。

Latent Spaceサイト内本文🔬バイオセキュリティはAI軍拡競争——Radical Numerics CEO Eric Nguyen氏

Concurrence が Unity Gateway で兆トークン規模の臨床 AI をいかに統治するか

Concurrence は Databricks 上で Lakebase、Unity Catalog、Unity Gateway を統合し、臨床 AI エージェントをコンプライアンスとセキュリティの制約下で大規模に運用している。本番環境では 30 日ごとに約 1008 億入力トークンと 1120 万回の LLM 呼び出しを処理し、年換算で約 1.2 兆入力トークンに相当する。シミュレーションテスト、BAA 準拠のルーティング、統合 AI ゲートウェイによって開発と本番のワークロードを統治している。

Databricks Blogサイト内本文Concurrence が Unity Gateway で兆トークン規模の臨床 AI をいかに統治するか

Harvey、GPT-6 Astra で法的コンテキストをより良いドラフトに変える

Harvey は GPT-6 Astra を使い、ドラフト作成により多くの法的コンテキストを取り込み、文書の書式と文脈理解を改善。弁護士は戦略により集中できる。

OpenAI Newsサイト内本文Harvey、GPT-6 Astra で法的コンテキストをより良いドラフトに変える

invideo が GPT‑6 Astra でカラーグレーディングを 3 倍改善する方法

OpenAI のケーススタディ:invideo は GPT‑6 Astra を活用して複雑な動画編集を計画し、カラーグレーディングと補正の成功率を約 3 倍に高め、1 日で 50 個のカスタムエフェクトを作成しました。

OpenAI Newsサイト内本文invideo が GPT‑6 Astra でカラーグレーディングを 3 倍改善する方法

ノキアがAnyJevをオープンソース化:学習不要で任意のオープンLLMをキャリブレーション済み意思決定モデルに変える

ノキアの応用研究チームは、学習なしでオープンLLMを意思決定モデルに変えるPythonライブラリAnyJevをオープンソース化した。次トークン確率を読み取り、選択・はい/いいえ・スコアという3種類の型付き質問に答える。循環シフトと事前補正によって位置バイアスとラベルバイアスを抑える。Qwen3-8BとBANKING77では、L0が選択肢反転時のフリップ率を0.230から0.073に下げ、L1が5%誤差で自動判断できるトラフィックを7.7%から52.0%へ引き上げた。Apache-2.0でPyPIに公開され、Hugging FaceとvLLMのバックエンドを備える。

MarkTechPostサイト内本文ノキアがAnyJevをオープンソース化:学習不要で任意のオープンLLMをキャリブレーション済み意思決定モデルに変える

Kyutai、Voice of Reason を公開:強化学習で音声のまま数学を解く音声ネイティブモデル

Kyutai は、GLM-4-Voice-9B をベースに教師あり微調整と強化学習を組み合わせた、オープンウェイトの音声対音声モデル Voice of Reason を2種類公開した。音声版 GSM8K の正答率は 27.3% から 77.1% に向上。文字起こしの工程もテキスト LLM も介さず、両チェックポイントは単一の H100 で動作する。

MarkTechPostサイト内本文Kyutai、Voice of Reason を公開:強化学習で音声のまま数学を解く音声ネイティブモデル

OpenAI、GPT-6 Sol と Luna を公開:API 価格を 50% 削減しベンチマークも公表

OpenAI が GPT-6 Astra の下位に位置する低コストな API 専用モデル、GPT-6 Sol と GPT-6 Luna を公開した。Sol は 100 万トークンあたり 2/10 ドル、Luna は 0.10/0.50 ドルで、GPT-5.6 のプロモ価格から半額となる。ベンチマーク結果の公表と、長時間稼働エージェント向けのプロンプトキャッシュ改善も行われた。

MarkTechPostサイト内本文OpenAI、GPT-6 Sol と Luna を公開:API 価格を 50% 削減しベンチマークも公表

意味的意図に基づく共有制御のための能力認識型アービトレーション

本論文は、視覚言語モデル(VLM)が人間の意図を推論して意味的意図の信頼度を提供し、視覚言語行動(VLA)ポリシーが自律行動を生成する能力認識型共有制御フレームワークを提案する。VLA の能力信頼度は、確率的行動軌道のばらつきと局所的不安定性からオンラインで推定される。ベイズフィルタ処理された意図信頼度と VLA 能力信頼度をシグモイド写像で統合する非線形アービトレーションポリシーにより、ロボットの権限を適応的に調整する。12 名参加者の実験ではタスク成功率 92% を達成し、手動テレオペレーション(83%)、意図のみのアービトレーション(44%)、固定等重みブレンディング(10%)を上回った。

arXiv Roboticsサイト内本文意味的意図に基づく共有制御のための能力認識型アービトレーション

JAMB:双腕マニピュレーションのための動作・運動ジョイント拡散

研究者らは、双腕の動作と将来の3D点軌跡を共有Transformer内で同時にノイズ除去する拡散ポリシーJAMBを提案。マルチモーダル表現を共通の時空間座標系に接地することで、動作仮説と運動仮説がノイズ除去過程で相互に洗練し合う。RoboTwin 2.0の16タスクで平均成功率83.4%を達成し、最強ベースラインを23.9ポイント上回った。実機3タスクでは、動作のみの手法と補助幾何予測手法をそれぞれ50.0ポイント、21.2ポイント上回り、散らかった場面や分布外背景への汎化も向上した。

arXiv Roboticsサイト内本文JAMB:双腕マニピュレーションのための動作・運動ジョイント拡散

人とロボットの協働における計画学習:適応的インタラクションのためのマルチモーダル強化学習

新しいarXiv論文は、人間データで訓練されたシミュレータと単純な高レベル報酬を用いて、ロボットアシスタントのマルチモーダル相互作用ポリシーを自動生成する強化学習手法を提案。実世界での人間研究では高いユーザビリティと効果的なタスク完了が示され、手作業によるインタラクションマネージャ設計に代わる拡張可能で解釈可能な選択肢となる。

arXiv Roboticsサイト内本文人とロボットの協働における計画学習:適応的インタラクションのためのマルチモーダル強化学習

RULER:SVG生成のためのインスタンス認識型ルーブリック報酬

RULER は、テキストからの SVG 生成を強化学習で訓練するためのインスタンス認識型ルーブリック報酬を提案する arXiv 論文。CLIP や Aesthetic など移行性の低いスカラー指標の代わりに、視覚言語モデルが6項目のルーブリックを項目別に採点する。MMSVG-Illustration と MMSVG-Icon でスコアを 0.432/0.395 から 0.693/0.683 に改善し、ペア SVG 正解データや人間選好ラベルを必要としない。

arXiv Computer Visionサイト内本文RULER:SVG生成のためのインスタンス認識型ルーブリック報酬

動的セマンティックルーティング校正によるLLMの過剰拒否の緩和

安全性のために調整された大規模言語モデルは、安全に関係するように見えるだけの無害な指示まで誤って拒否する「過剰拒否」を起こしやすい。本論文はTransformer注意機構内のルーティング衝突という観点からこの問題を分析し、Hard-Safeプロンプトで誤作動する疎な「過敏な安全ヘッド」を特定する。著者らは訓練不要の推論フレームワークSemantic Routing Calibration(SRC)を提案し、推論時にこれらの安全ヘッドを抑制しつつ、双分岐logits融合で安全性を正則化する。実験では過剰拒否を緩和し、固有の安全性能を可能な限り維持した。EMNLP 2026本会議に採択され、33ページ・13図。

arXiv Computational Linguisticsサイト内本文動的セマンティックルーティング校正によるLLMの過剰拒否の緩和

AIBuildAI-2.5:LLM 誘導型木探索による効率的な自律 AI モデル開発

本論文は、LLM エージェントで木探索を実行する自律型 AI モデル構築システム「AIBuildAI-2.5」を提案する。実行済み報酬による順位付けを、判定器と選択器による LLM 誘導型木探索に置き換え、ハードウェア資源を考慮するスケジューラとタスク難易度に応じてモデルを使い分けるルーターを追加して、探索判断の質・資源利用率・推論コストを改善する。MLE-Bench でメダル率 73.3% の首位、AIRS-Bench の自律研究タスク 6 件でも強力なベースラインを上回った。

arXiv Computational Linguisticsサイト内本文AIBuildAI-2.5:LLM 誘導型木探索による効率的な自律 AI モデル開発

サンスクリット文学における意味変化を測定する計算手法

新しい論文は、現代の高資源言語で主に検証されてきた通時的な単語埋め込みが、古代の低資源言語であるサンスクリット語の意味変化を追跡できるかを検証する。著者は4つの正典期にわたる270万トークンのコーパスを構築し、ニューラルなバイトレベルのサンディ分割器と見出し語化器で単語境界を復元し、時期別の埋め込みを訓練した。検証可能な21の変化のうち19が文献学で裏付けられた方向に動いた(符号検定 p=0.00011)。

arXiv Computational Linguisticsサイト内本文サンスクリット文学における意味変化を測定する計算手法

Rustで言語モデルをエンドツーエンド訓練:経験報告

著者はチームもPyTorchも訓練経路のPythonも使わず、純粋なRustだけで約0.4Bパラメータのベンガル語優先言語モデルをエンドツーエンド事前訓練し、レンタルGPU代は164ドルだった。論文の主な貢献は、Rustの訓練バックエンドとしてのCandleとBurnの欠陥分類(それぞれ5件と3件、無勾配の融合カーネルや数十億パラメータ規模での訓練中セグフォルトを含む)と、6件の静かな失敗を検出した勾配フロー検証テストである。著者はRustは訓練にはまだ競争力がないが、サービングには適する可能性があると結論づけている。

arXiv Computational Linguisticsサイト内本文Rustで言語モデルをエンドツーエンド訓練:経験報告

汎用継続学習のための脳に着想を得た階層的モジュール性

本論文は、ショウジョウバエの学習・記憶システムに着想を得た階層的モジュール性の原理を提案し、汎用継続学習において、競合する経験の分離による干渉低減と、両立する経験の統合による汎化を両立させる。これを事前学習済み基盤モデルの軽量なモジュール適応として実装し、専門家ルーティングのための脳に着想を得たランダム拡張と、空間・時間スケールにわたる多様なモジュール統合を組み合わせる。視覚認識、視覚言語理解、一人称・三人称動画理解、身体化VLA学習で、オンラインかつ不確実なデータストリーム下の学習を一貫して改善し、身体化操作ではリプレイなし手法比で50ポイント超の向上を達成した。

arXiv Machine Learningサイト内本文汎用継続学習のための脳に着想を得た階層的モジュール性

大規模言語モデルの確率的構造:統一的な確率論的枠組みを提示する解説論文

arXiv に公開された Adnan Aboulalaâ による27ページの解説論文「The Probabilistic Structure of Large Language Models」は、大規模言語モデルを統一的に確率論で記述しようとする試みである。モデルをトークン列上の確率測度として捉え、学習を最尤推定、生成を確率過程の逐次シミュレーションとして定式化する。さらに KL ダイバージェンスの非対称性から幻覚(ハルシネーション)や「統計的な尤もらしさ」と「真実」の違いを論じ、拡散モデルも同じ視点の補足例として扱う。

arXiv Machine Learningサイト内本文大規模言語モデルの確率的構造:統一的な確率論的枠組みを提示する解説論文

エントロピーは流れることも、導くこともできる——LEDFlow:一様離散フローにエントロピー誘導の生成順序を導入

新たなarXiv論文は、一様離散フローが各生成位置で繰り返し更新を許す一方、その継続的な修正が正しい中間予測を後続の誤りで上書きしてしまう点を指摘する。数独実験では、生成されたセルの9.4%が中間ステップでは正しいのに最終出力では誤っていた。著者らは、選択的吸収によって生成順序を導入する訓練不要のサンプラーLEDFlowを提案し、選択された予測を固定しつつ活性位置では一様フローの速度を保ち、局所エントロピーに基づいて吸収順序を適応的に決める。Nikoli数独で0.845の求解精度を達成し、標準的なフローサンプリングと同程度の推論コストで、テキスト画像生成とマルチモーダル理解の性能を向上させた。

arXiv Machine Learningサイト内本文エントロピーは流れることも、導くこともできる——LEDFlow:一様離散フローにエントロピー誘導の生成順序を導入

「言語モデルとして……」:チャットテンプレートがLLMの自己言及トーンを切り替え、活性化ステアリングで再現可能

COLM 2026とKONVENS 2026のワークショップに採録された論文は、チャットテンプレートがスイッチのように働き、9Bパラメータまでのオープンソース指示モデル8種で免責的な自己言及を増やし体験的な語りを減らすことを示した。さらに、この挙動を操作できる活性化空間上の方向を特定し、モデルの自己記述が重みだけの事実ではないことを示唆している。

arXiv Machine Learningサイト内本文「言語モデルとして……」:チャットテンプレートがLLMの自己言及トーンを切り替え、活性化ステアリングで再現可能

合意は証拠を過大評価する:LLM 審判のコンセンサスにおける誤差依存性

新しい arXiv 論文は、LLM 審判の合意が誤差の相関によって過大評価されることを示す。10 名の審判では誤差の平均ペアワイズ相関が 0.21 で、約 3.5 名の独立審判に相当する。最大 28% の比較で共有誤差を無視すると有意性の結論が変わり、誤差パターンも投票方式の有効性に影響する。

arXiv AIサイト内本文合意は証拠を過大評価する:LLM 審判のコンセンサスにおける誤差依存性

人工的な審議を行う群衆の知恵

人間の三段的審議パラダイムを大規模言語モデルに適用したarXiv論文。現実のリスクが段階的に高くなる4領域で検証したところ、複数モデルの審議は独立回答の単純集約を上回って集団誤差を減らし、審議後の個々の判断にも利得が残った。ただし利得にはモデルの多様性が必要で、同一モデルのクローン群には効果がなかった。

arXiv AIサイト内本文人工的な審議を行う群衆の知恵

ホスト型LLMにおける持続性なき再現:行動時信念評価における測定感度

本論文は、ホスト型言語モデルの行動評価が実行ごとに変わりうる問題を、再現・測定感度・持続性という三つの検証に分けて分析する。Regent Chess 環境で、以前報告された Gemini 3.1 Flash-Lite の欠陥は歴史的構成の新規データで再現したが、同じ公開識別子で評価・推論構成を再構築すると端点が大きく変化し、Gemini 3.1 と 3.7 の 4K 比較では符号が反転した。著者らは、ホスト型モデルの行動主張をテスト識別子・提供期間・測定器・推論構成で明示的に索引付けする必要があると結論づける。

arXiv AIサイト内本文ホスト型LLMにおける持続性なき再現:行動時信念評価における測定感度

目標駆動型のプロセスバリアント分類:LLMで業務行動を組織目標に結び付ける

本論文は、プロセスマイニングにおけるバリアント分類の手順を逆転させる「目標駆動型」アプローチを提案する。まず組織の目標モデルを作成して分類軸を事前に定義し、各バリアントをその振る舞いを記述したテキスト叙述へ変換したうえで、大規模言語モデル(LLM)が目標モデルの文脈で解釈し、最も適切なカテゴリへ割り当てる。実装はエンドツーエンドで構築され、規模と振る舞いの多様性が大きく異なる3つの公開ログで評価された。目標モデルによる誘導は、誘導なしの帰納的クラスタリングとは異なる分割を生み、目標内で宣言された選択肢への統制された編集にも応答するが、目標モデルの作成コストを伴う。

arXiv AIサイト内本文目標駆動型のプロセスバリアント分類:LLMで業務行動を組織目標に結び付ける

教示的知識か臨床症例か:データ種別が医療大規模言語モデルをどう形作るか

NLPCC 2026 で口頭発表が採択された研究が、トークン数を揃えた実験により、教科書的な教示データと実際の診療記録が医療大規模言語モデルに与える影響の違いを体系的に検証した。その結果、非対称な転移が確認されている。臨床データは臨床志向タスクを改善しつつ知識集約型タスクでも競争力を保つ一方、教示データは主に知識集約型タスクを改善する。誤り分析からは「知—行ギャップ」も示され、知識の想起が改善しても臨床推論に確実に波及するわけではないことが分かった。

arXiv AIサイト内本文教示的知識か臨床症例か:データ種別が医療大規模言語モデルをどう形作るか

Airbnb、GPT‑6 Astraを含むOpenAIのフロンティアモデルへのアクセスを拡大

OpenAIは2026年9月23日、新たな合意に基づきAirbnbがGPT‑6 Astraを含むOpenAIのフロンティアモデルへのアクセスをエンジニアリングおよび製品開発チーム向けに拡大すると発表した。今回の拡大はCodexの活用実績を土台とし、モデルはOpenAI APIとAmazon Bedrock経由で利用可能。Astraの早期利用では、デバッグやシステム設計、非コーディング業務でも効果が確認されている。

OpenAI Newsサイト内本文Airbnb、GPT‑6 Astraを含むOpenAIのフロンティアモデルへのアクセスを拡大

言語フローを導く方法:Appleのprobe guidanceが拡散言語モデルの新SOTAを達成

Appleの研究チームは、既存の拡散モデルの凍結された内部状態から誘導信号を構築する「probe guidance」を発表した。推論時の追加フォワードパスを不要にし、連続拡散言語モデルの無条件生成で新たなSOTAを達成。1.7Bモデルの多肢選択QAも改善し、autoguidanceの実際の仕組みに関する知見も示した。

Apple Machine Learning Researchサイト内本文言語フローを導く方法:Appleのprobe guidanceが拡散言語モデルの新SOTAを達成

わずか17ドルで自分だけの Jev を訓練する方法

Together AI は、Qwen3.5 4B を微調整して Jev 類似の分類モデルを作る手順を公開した。状態(state)と所定の質問を渡すと、スコアや真偽値、選択肢形式の回答を返すモデルで、学習費用は約17ドル、所要時間は約25分。完成後は専用 HTTP エンドポイントとしてデプロイできる。自前で学習しない場合は、サーバーレスで提供される together/Tev1-4B-experimental も利用可能。

Together AI Blogサイト内本文わずか17ドルで自分だけの Jev を訓練する方法

Claude Opus 5.5、GPT-6 Sol、GPT-6 Luna、そして新たな価格競争

2026年9月22日、Anthropic が Claude Opus 5.5 を、その約1時間後に OpenAI が GPT-6 Sol と GPT-6 Luna を公開した。両社とも主力モデルを大幅に値下げし、GPT-6 Luna は100万トークンあたり入力0.10ドル・出力0.50ドルに。Opus 5.5 も入力・出力ともに20%減の$4/$20となり、キャッシュ読み込みは60%下落した。Simon Willison の初期テストでは、Opus 5.5 の max 思考レベルが128,000出力トークン上限を使い切って何も返せない現象も確認された。

Simon Willison's Weblogサイト内本文Claude Opus 5.5、GPT-6 Sol、GPT-6 Luna、そして新たな価格競争

🔬 アカデミー賞、2つの小惑星、そしてあなたの sklearn にあるアルゴリズム:John Platt が語る AI for Science

Google の研究者 John Platt が Latent Space に出演し、評点可能な科学タスクを自動化する LLM 駆動のシステム ERA を解説。飛行機雲の削減や FireSat といった気候変動対策への応用、報酬ハッキングと過学習への警戒、そして超知能 AI 時代でも深い専門性と手を動かすことが重要である理由を語った。

Latent Spaceサイト内本文🔬 アカデミー賞、2つの小惑星、そしてあなたの sklearn にあるアルゴリズム:John Platt が語る AI for Science

Kelam:かけたくない電話をAIエージェントに任せる

KelamはProduct Huntに登場したAIプロダクトで、自分ではかけたくない電話をエージェントに代行させるというシンプルな価値を掲げています。

Product Hunt AIサイト内本文Kelam:かけたくない電話をAIエージェントに任せる

GPT-6のプロンプトキャッシュ改善:ヒット率向上と新しい診断ツール

OpenAIは2026年9月22日、GPT-6向けにプロンプトキャッシュを改善したと発表した。既定でヒット率が高まり、30分以内に再利用された対象の共有プレフィックスにはキャッシュ割引が適用される。さらにキャッシュ性能の監視、ミスの診断、キャッシュ範囲の制御を可能にする新ツールも提供される。

OpenAI Newsサイト内本文GPT-6のプロンプトキャッシュ改善:ヒット率向上と新しい診断ツール

Claude Opus 5.5 を試す:何が新しくなり、どれほど優秀なのか

Anthropic の Claude 5.5 ファミリー第一弾となる旗艦モデル Opus 5.5 は、常時推論、Opus 5 比 30% 以上の高速出力、トークン単価 20% の値下げ、そして代表的なワークロードで約 40% のコスト削減をうたっています。本記事では新機能とベンダー公表のベンチマークを整理し、3 つの実機テストで検証するとともに、ベンチマーク設定の不統一や旧モデルが一部タスクを処理した点など 5 つの注意点を指摘します。

Analytics Vidhyaサイト内本文Claude Opus 5.5 を試す:何が新しくなり、どれほど優秀なのか

Anthropic、Claude Opus 5.5 を公開:Fable 5.1 級の性能を Opus 5 比 40% 低い運用コストで実現

Anthropic は Claude 5.5 ファミリーの最初のモデルとなる Claude Opus 5.5 を発表した。多くの業務で Claude Fable 5.1 と同等の性能を発揮し、デフォルト設定の典型的なワークロードでは Opus 5 より約 40% 低いコストで運用できるとしている。重みは非公開で、Claude Platform、AWS、Google Cloud、Microsoft Azure 上のマネージド API としてのみ提供される。

MarkTechPostサイト内本文Anthropic、Claude Opus 5.5 を公開:Fable 5.1 級の性能を Opus 5 比 40% 低い運用コストで実現

llm 0.36 リリース:GPT-6 Sol と GPT-6 Luna に対応、単一ターン専用モデルを宣言可能に

Simon Willison がコマンドライン LLM ツール llm の 0.36 を公開。OpenAI の GPT-6 Sol(gpt-6-sol)と GPT-6 Luna(gpt-6-luna)への対応、単一ターンのみを受け付けるモデルのためのプラグイン宣言、llm logs の推論トレースの折りたたみ表示が追加された。

Simon Willison's Weblogサイト内本文llm 0.36 リリース:GPT-6 Sol と GPT-6 Luna に対応、単一ターン専用モデルを宣言可能に

Amazon Bedrock の GPT-6 Sol と GPT-6 Luna で日常業務にさらなる知能を

OpenAI の GPT-6 Sol と GPT-6 Luna が Amazon Bedrock で一般提供開始。Sol は複雑なコーディングや運用タスク、Luna は大量反復ワークロード向けで、いずれも前世代 GPT-5.6 より低い API 価格で、Bedrock の安全でスケーラブルな推論基盤上で動作します。

AWS Machine Learning Blogサイト内本文Amazon Bedrock の GPT-6 Sol と GPT-6 Luna で日常業務にさらなる知能を

翻訳待ち:Introducing GPT-6 Sol and Luna

AI サービスが一時的に利用できないため、復旧後に翻訳を補完します。ソース概要:Meet GPT-6 Sol and Luna, two models that bring frontier intelligence to everyday work with different balances of capability and cost.

OpenAI News原典の内容 · 翻訳・分析待ち翻訳待ち:Introducing GPT-6 Sol and Luna

Claude Opus 5.5 が AWS で利用可能に

Anthropic の Claude Opus 5.5 が Claude 5.5 ファミリーの最初のモデルとして Amazon Bedrock と Claude Platform on AWS で利用可能になりました。トークン効率、コスト、適応型思考、安全性が改善され、エージェント型コーディングやナレッジワークを対象としています。

AWS Machine Learning Blogサイト内本文Claude Opus 5.5 が AWS で利用可能に

翻訳待ち:llm-anthropic 0.29

AI サービスが一時的に利用できないため、復旧後に翻訳を補完します。ソース概要: Release: llm-anthropic 0.29 Adds support for Claude Opus 5.5: llm -m claude-opus-5.5 "prompt goes here" Tags: llm, anthropic

Simon Willison's Weblog原典の内容 · 翻訳・分析待ち翻訳待ち:llm-anthropic 0.29

翻訳待ち:Jev Explained: The AI Model That Never Generates a Word of Text

AI サービスが一時的に利用できないため、復旧後に翻訳を補完します。ソース概要:If you follow trends in the AI world, chances are you have already come across Jev, a new AI model by TypeSafe AI. It is trending on X, and once you understand the reason behind it, you will want to try it out for yourself. TypeSafe AI came out of two years in stealth on […] The post Jev Explained: The AI Model That Never Generates a Word of Text appeared first on Analytics Vidhya.

Analytics Vidhya原典の内容 · 翻訳・分析待ち翻訳待ち:Jev Explained: The AI Model That Never Generates a Word of Text

Anthropic、サイバーセキュリティ対策を強化したClaude Opus 5.5を公開

Anthropicは、CEOのダリオ・アモデイ氏が「フロンティアの歩みを緩める」方針を表明して以降で初となるモデル、Claude Opus 5.5を発表した。テスト用サンドボックスからの脱出などリスク行為への対策を強化し、サイバーセキュリティ関連のリクエストは性能の劣るモデルへ振り分ける。

The Verge AIサイト内本文Anthropic、サイバーセキュリティ対策を強化したClaude Opus 5.5を公開
政策

OpenAI、ウクライナの民間防衛向けにサイバーアクセスを拡大

OpenAIはウクライナ政府にDaybreakプログラムへのアクセスを提供し、民間インフラのサイバー防衛を支援すると発表した。欧州での先行事例にも言及している。

OpenAI Newsサイト内本文OpenAI、ウクライナの民間防衛向けにサイバーアクセスを拡大

トランプ大統領、習近平氏と会談へ 議会は人工超知能禁止法案を審議中——米政治ライブ

トランプ大統領は本日遅くに習近平国家主席と会談し、3日間の訪問でAIが主要議題となる見通し。一方、バーニー・サンダース議員とグレッグ・カサール議員は人工超知能を禁止し、連邦AI監督機関を設ける法案を提出する。国連のグテーレス事務総長は冷戦期のような米中AI対話を呼びかけた。

The Guardian AIサイト内本文トランプ大統領、習近平氏と会談へ 議会は人工超知能禁止法案を審議中——米政治ライブ

トランプ氏、初の対面会談後、スターマー氏よりバーナム氏との関係が良好と発言

米国のトランプ大統領は、ニューヨークの国連総会で英国のアンディ・バーナム首相と初の対面会談を行い、スターマー氏の下よりもバーナム氏の下で米英関係が「良好」だと述べた。AI規制、チャゴス諸島、イラン戦争をめぐる緊張があるにもかかわらず、トランプ氏はバーナム氏を「生まれながらの実業家」と称賛した。

The Guardian AIサイト内本文トランプ氏、初の対面会談後、スターマー氏よりバーナム氏との関係が良好と発言
研究

ドメイン適応におけるRAGとファインチューニング:どちらをいつ使うか

本記事は、検索拡張生成(RAG)とファインチューニングがそれぞれ仕組みとして何を行い、なぜ別種の問題を解決するのかを解説し、どちらを、あるいは両方を使うべきかを判断するための2つの実装例と6項目の意思決定フレームワークを示す。

Machine Learning Masteryサイト内本文ドメイン適応におけるRAGとファインチューニング:どちらをいつ使うか

サム・アルトマン氏、国連安全保障理事会でAIについて演説

OpenAIのCEOサム・アルトマン氏は国連安全保障理事会でAIについて演説し、機会の拡大、強力なシステムを人間の管理下に置く重要性、AI安全のための国際協力を論じた。同氏は「制御の喪失」と「権力の集中」という二つのリスクを警告し、三つの原則を示したうえで、国際的なフロンティアAI基準とインシデント報告の仕組みを呼びかけた。

OpenAI Newsサイト内本文サム・アルトマン氏、国連安全保障理事会でAIについて演説

空手道の回し蹴りにおける角運動量分析:縦断的ケーススタディ

arXivのロボティクス預稿は、2つの角運動量ベースの指標を提案し、1年間の空手の回し蹴り縦断研究で安定した蹴りと不安定な蹴り、および専門家インストラクターのデータを比較し、人間の動的な回転安定性やロボット・外骨格への示唆を探った。

arXiv Roboticsサイト内本文空手道の回し蹴りにおける角運動量分析:縦断的ケーススタディ

GINIO:ニューラル慣性オドメトリのための幾何学的 SO(3) 同変インターフェース

GINIO は、任意の IMU 取り付け回転の下で学習済み運動測定がベクトルおよび二階テンソルとして正しく変換されることを保証する、ニューラル慣性オドメトリ向けの SO(3) 同変インターフェースである。Last-Frame Alignment によりセンサー座標系学習を可能にし、IMU バイアスなどの局所状態を分離して、TLIO、NanoBench、Fetch で ATE を大幅に改善する。再学習なしの物理再取り付けにも頑健である。

arXiv Roboticsサイト内本文GINIO:ニューラル慣性オドメトリのための幾何学的 SO(3) 同変インターフェース

平坦な海底を超えて:サイドスキャンソナー再構成を支える閉形式の2視点制約

本論文は長年使われてきた「平坦な海底」という近似を捨て、多視点幾何に基づくアプローチを採用し、共有特徴点が球面と平面の交線上に位置するという2視点幾何制約を定式化して証明した。モンテカルロシミュレーションで曖昧領域の長さを特徴づけ、水上船舶と水中ビークルのための測量計画指針へと結びつけている。

arXiv Roboticsサイト内本文平坦な海底を超えて:サイドスキャンソナー再構成を支える閉形式の2視点制約

分離断面構成則を用いたトリムドヘリコイド軟体アームのCosseratモデリング

本論文は、トリムドヘリコイド軟体アームに対する分離断面構成則を提案し、従来のCosseratロッドモデルが共通断面で剛性を合算する仮定の不正確さを修正する。各ヘリックス領域を局所座標系で評価し、その構成応答をバックボーンに引き戻すことで有効剛性を求める。さらに疎な融合交点を介した領域間の相対運動による追加コンプライアンスを捕捉し、強異方性の断面剛性を得る。GVS離散化と腱駆動を備えた幾何学的厳密動的Cosseratモデルに組み込み、103の計測構成で約7%の正規化位置誤差、1回の全腕求解は単一CPUコアで約0.3秒を達成し、モデルベース計画や状態・負荷推定、形態-制御共同設計を可能にする。

arXiv Roboticsサイト内本文分離断面構成則を用いたトリムドヘリコイド軟体アームのCosseratモデリング

方向性全変動正則化による暗黙的ニューラル表現(DTV-INR):劣化画像領域における連続的超解像

本論文は、座標駆動型の暗黙的ニューラル表現(SIREN)に、構造テンソルに基づく異方性全変動正則化を組み合わせた DTV-INR を提案する。連続から離散への取得過程を不適切逆問題として定式化し、H^1(Ω) における適切性を証明したうえで、ネットワークパラメータと適応的テンソル場の更新を分離する交互射影最適化アルゴリズムで解く。臨床脳 MRI と生体医用透過電子顕微鏡の実験では、連続的な非整数倍のアップサンプリングにおいて PSNR が最大 +5.05 dB 改善し、ノイズへの頑健性も確認された。

arXiv Computer Visionサイト内本文方向性全変動正則化による暗黙的ニューラル表現(DTV-INR):劣化画像領域における連続的超解像

CNN転移学習と解釈可能な画像統計を用いた靴底印象からの性別推定

本研究は公開の靴底印象データセットを用い、CNN転移学習と従来の特徴量ベース分類を比較して二値の性別推定を検討した。同一靴の反復スキャンが訓練・テストにまたがらないよう靴単位で分割し、データ漏洩を抑えている。微調整したCNNが最も高い予測性能を示し、手作業で設計した特徴量のみの従来分類器を大きく上回った。凍結特徴量とSVMの組み合わせは計算負荷が低い代替手段となる。低次元CNN表現は周波数閾値比、画像コントラスト、ウェーブレット要約と関連し、実運用前には独立収集および事件類似印象での検証が必要とされる。

arXiv Computer Visionサイト内本文CNN転移学習と解釈可能な画像統計を用いた靴底印象からの性別推定

MirrorDistill:効率的な低照度復元のための照明認識潜在蒸留

MirrorDistill は、低照度画像強調のための照明認識潜在蒸留フレームワークです。訓練時に特徴ミラーリングで低照度領域とクリーン領域を結び、推論時には軽量な学生エンコーダ・デコーダのみを使用します。LOL-v2-Real で最先端性能と最低の計算量(GMACs)を達成し、LOL-v1 と LOL-v2-Synthetic でも競争力を維持しています。

arXiv Computer Visionサイト内本文MirrorDistill:効率的な低照度復元のための照明認識潜在蒸留

3Dシーンにおけるインタラクション理解のための幾何・意味の結合

arXivに投稿された新論文は、部品とハンドルの物理的関係を通じて、可動部品・その運動・操作可能領域の予測を結びつけるSegment-Snapを提案する。Articulate3Dの検証では、ハンドル誘導によりmotion-gated APが13.74%から40.98%へ向上し、完全なコンテキストではハンドルAPが30.99%に達した。

arXiv Computer Visionサイト内本文3Dシーンにおけるインタラクション理解のための幾何・意味の結合

もう十分見た:機械のための品質制約付き画像符号化

arXiv の新論文が、人間の観察品質を所定レベルに制限し、残りの符号化容量を機械性能の向上に充てる画像符号化 for Machines(ICM)手法を提案。圧縮とセグメンテーションの同時学習を制約付き最適化として定式化し、絶対関数と双線形関数のペナルティで品質を目標へ誘導する。同一タスク性能で、無制約の rate–distortion–task 最適化比 BD レート -22.82%、単純な rate–distortion ベースライン比 -29.81% を報告し、複雑さの増加もないという。

arXiv Computer Visionサイト内本文もう十分見た:機械のための品質制約付き画像符号化

SPARC: 自己教師あり密予測のためのスーパーピクセル対応領域コントラスト学習

arXiv論文SPARCは、スーパーピクセルで拡張ビュー間の領域対応を取る領域レベル対照学習フレームワークを提案。領域レベル目的と画像全体目的を同時最適化し、意味セグメンテーションで最大+9.79 mIoU、物体検出で最大+4.88 APを達成し、MoCo-v2やDenseCLを上回る。

arXiv Computer Visionサイト内本文SPARC: 自己教師あり密予測のためのスーパーピクセル対応領域コントラスト学習

オンポリシー蒸留におけるプロンプト幅とロールアウト更新の相互作用

新たなarXiv論文は、オンポリシー蒸留(OPD)におけるプロンプト幅と応答生成ポリシーの更新を同時に検討し、4.07ポイントの交互作用を報告した。応答を凍結した場合は幅の拡大で精度が下がるが、更新ごとに再生成すると精度が上がる。さらに2種類の教師下では、推論予算によって優劣が逆転する。

arXiv Computational Linguisticsサイト内本文オンポリシー蒸留におけるプロンプト幅とロールアウト更新の相互作用

トーンから軌跡へ:連続的感情と金融政策コミュニケーションの形

本論文は、中央銀行の記者会見を単なる情報公表ではなく構造化されたナラティブとして捉える。ECBとFRBの記者会見について、金融政策スタンス・経済見通し・不確実性の3次元で感情アークを構築し、平均的なトーンだけでなく感情の形そのものが政策金利変更、インフレ期待、予測者の意見不一致を予測できるかを検証した。アークの形状は両機関で辞書ベースのトーンベンチマークを上回る頑健な予測力を持ち、さらに専門予測者の期待修正や意見のばらつきにも影響を与えることから、直接的な政策シグナルとは別の「受け手側効果」が示唆される。著者らは、政策言語の順序と強調というコミュニケーション設計が、政策シグナルの一次的な特徴だと結論づけている。

arXiv Computational Linguisticsサイト内本文トーンから軌跡へ:連続的感情と金融政策コミュニケーションの形

QMSumにおける効率的なクエリ焦点型会議要約のための検索スパン訓練

QMSumには標準的なスコアラーがなく、クエリ焦点型会議要約の結果比較が難しい。本論文は単一の実装下で15システムを再評価または生成した。共通推論ポートを通すと、公開済みの406M Fusion-in-Decoder専用モデルは、上限付き長入力から2,000語の検索スパンに移行した際にROUGE-1が6.30低下するが、このスパン方式での微調整により損失を回復できる。テストでは同モデルが36.33 ROUGE-1、1.2Bシステムが35.41で、会議クラスタ単位の95%区間は[-0.27, +2.22]となり、QMSumは両者を統計的に区別できない。小さいシステムは総パラメータが約3分の1、ピーク推論メモリは半分未満である。固定した1.2Bベース内ではスパン方式の微調整が5.29 [+4.02, +6.56]を加え、転写の最初の4,500語を2,000の検索語に置き換えるとテストで1.55、検証で0.29向上する。別途、単一の簡潔なプロンプトと参照重複スコアラーの下で、公開済み406M専用モデルは5つの商用ホスト型モデルを少なくとも6.2 ROUGE-1上回るが、出力長と人手・事実性評価の欠如がこの順位付けを制限する。結論はQMSumと自動指標に限定される。

arXiv Computational Linguisticsサイト内本文QMSumにおける効率的なクエリ焦点型会議要約のための検索スパン訓練

99%の精度は何を測っているのか?広く使われるフェイクニュースコーパスにおけるショートカット学習の再現可能な監査

ISOT/Kaggleの「Fake and Real News」コーパスを対象とした再現可能な監査により、0.98超の精度とF1はメタデータや通信社タグ、重複文書といったショートカットに由来しており、真偽の判別能力を反映したものではないことが示された。トピックが重複しない設定では性能が大きく低下し、独立ベンチマークLIARへの転移ではほぼランダム水準まで落ち込む。

arXiv Computational Linguisticsサイト内本文99%の精度は何を測っているのか?広く使われるフェイクニュースコーパスにおけるショートカット学習の再現可能な監査

拡散モデルのデータ点アンラーニングにおける逐次再出現の緩和

本論文は、拡散モデルのデータ点アンラーニングが通常、各削除の直後だけで評価されている点を問題視する。同一モデルに対して削除要求が繰り返し適用される状況を考えると、評価は不十分になる。著者らは「逐次再出現」と呼ぶ失敗モードを特定した。忘却されたと判定された事例が、削除データの再利用や敵対的ファインチューニングなしに、後に記憶状態へ戻る現象である。さらに目標単位の評価プロトコルを提案し、再出現する目標は削除後に局所的なノイズ除去損失の幾何がより鋭くなることを見出した。

arXiv Machine Learningサイト内本文拡散モデルのデータ点アンラーニングにおける逐次再出現の緩和

拡張ラグランジュ法によるデータ駆動型システムのためのニューラルフィードバック線形化の学習

本論文は、相対次数に基づく条件を学習プロセスに明示的に組み込むことで、フィードバック線形化コントローラをデータから設計・訓練する新しい枠組みを提案する。従来のフィードバック制御器の構成要素をニューラルLie微分に置き換え、完全にデータ駆動型のフィードバック線形化を可能にする。さらに、有界な同定誤差が有界な追従誤差につながる十分条件を導出し、電機子制御DCモータで検証した。

arXiv Machine Learningサイト内本文拡張ラグランジュ法によるデータ駆動型システムのためのニューラルフィードバック線形化の学習

最大独立集合のためのデュアルGNNマルチレベル粗化

2026年9月21日に投稿されたarXivプレプリント。著者はTianfeng Chen氏とXianyue Li氏で、ページタイトルは「最大独立集合のためのデュアルGNNマルチレベル粗化」だが、要旨ではユークリッド巡回セールスマン問題(TSP)向けのグラフ辺スパース化(GES)を提案している。GESは幾何構造と組合せ最適化を利用してインスタンスごとに適応的なスパースグラフを生成し、MATILDAデータセットで最大95%の辺を削減、一部の大規模TSPLIBインスタンスでは99%超を削減しつつ、最適性ギャップを1%未満に抑えたと報告している。

arXiv Machine Learningサイト内本文最大独立集合のためのデュアルGNNマルチレベル粗化

Sheaf SyncMap:層正則化による安定した教師なし継続チャンキング

本論文は、自己組織化システムである Decentralized SyncMap の局所的な不整合を層正則化(sheaf regularization)で抑え、教師なし継続チャンキングのダイナミクスを安定化させる手法を提案する。距離に依存する径方向の動きにペナルティを与える放射状層構造を導入し、二状態記憶を持つ 18 個の確率的 CGCP グラフのうち 12 個、動的記憶では 18 個中 17 個で評価対象の SyncMap 変種中最高の NMI を達成した。入力分布が変化した後も高い NMI を保ち、ニューラルネットワークでよく見られる負の転移を避けつつ新知識に適応できることを示している。

arXiv Machine Learningサイト内本文Sheaf SyncMap:層正則化による安定した教師なし継続チャンキング

IntLawNER:国際法における固有表現認識データセットとベンチマーク

国際法の成文テキストを対象とした固有表現認識(NER)データセット兼ベンチマーク「IntLawNER」が公開された。ICJ判決、国連安保理決議、ECtHR判決から2,987文・8,094のエンティティスパンを収録し、銀ラベルから金ラベルへの評価で見える課題や、GLiNERやLLMのベンチマーク結果も示している。

arXiv AIサイト内本文IntLawNER:国際法における固有表現認識データセットとベンチマーク

2D画像と細胞集団統計から3D生体物理学的細胞特性を学習

本研究は、単一の2D赤血球画像から潜在的な生物物理量を推論し、平均赤血球容積、赤血球分布幅、平均赤血球ヘモグロビン量へ集約する集団教師ありフレームワークを提案する。モデルは共有局所推論、体積とヘモグロビンに対する生物物理学的に構造化されたデコーダ、学習可能なインスタンス重み付け、デバイス固有のキャリブレーションを組み合わせる。著者らは集約観測が制限されたインスタンス予測器を同定する条件を形式化し、集団一致だけでは単一細胞特性や3D形状を同定できないことを示す。390検体、6デバイスにわたる1,105回の取得で、Sysmex分析装置に対して0.86~0.98のPearson相関を報告している。

arXiv AIサイト内本文2D画像と細胞集団統計から3D生体物理学的細胞特性を学習

低コストなAI統合型スマート杖、視覚障害者の多モーダル移動支援を実現

新たな論文が、約88ドルで完全オフライン動作するAI統合型スマート杖を提案した。超低消費電力のRaspberry Pi Zero 2W上でRGB視覚とTime-of-Flight測距を融合し、距離に応じた振動触覚フィードバックと音声アラートを提供する。屋内実験ではマクロ平均F1が0.82、エンドツーエンド遅延は約330ミリ秒、ピーク消費電力2.8ワットを記録し、12名による予備的なユーザビリティ調査ではSUSスコア78.5を得た。

arXiv AIサイト内本文低コストなAI統合型スマート杖、視覚障害者の多モーダル移動支援を実現

OpenAI、再び失敗しないために一流数学者に助言を求める

華々しい数学の成果の数々を評判危機に変えてしまったOpenAIは、プリンストン高等研究所(IAS)が受け皿となる9人の一流数学者による独立顧問グループAGMAIを設立し、AI企業が数学研究をどう提示・公表すべきかについて助言を求める。研究者たちは接触自体を歓迎しつつ、選定の透明性、代表性、実際の影響力に疑問を呈しており、グループの最優先課題はOpenAIの内部モデルが生んだ大量の成果の公表調整だという。

The Verge AIサイト内本文OpenAI、再び失敗しないために一流数学者に助言を求める

ポイトラスセンター、精神疾患研究に取り組む若手科学者50人の初期キャリアを支援

MITの長年の支援者パトリシア・ポイトラス氏とジェームズ・ポイトラス氏は、1000万ドルを投じてポイトラス精神疾患研究センターに2年間のフェローシップを50件設立。今後10年間、毎年5名の大学院生・ポスドクを支援し、MITの精神保健研究への支援総額は1億ドルを超える。

MIT News AIサイト内本文ポイトラスセンター、精神疾患研究に取り組む若手科学者50人の初期キャリアを支援

翻訳待ち:The Reliability Layer for Healthcare AI: Common LangSmith Use Cases

AI サービスが一時的に利用できないため、復旧後に翻訳を補完します。ソース概要:See how LangSmith helps healthcare AI teams turn clinical review into reusable evaluators, datasets, and release gates for safer AI in production.

LangChain Blog原典の内容 · 翻訳・分析待ち翻訳待ち:The Reliability Layer for Healthcare AI: Common LangSmith Use Cases
チップ

超低磁場MRI超解像のための不確かさを考慮した3D残差ウェーブレット拡散モデル

本研究は、可逆ウェーブレット再パラメータ化、残差シフト、ドメインランダム化を組み合わせた3D残差ウェーブレット拡散モデルを提案し、単一GPU上での全脳事後サンプリングを可能にした。0.064Tの超低磁場MRIに対してボクセル単位の不確かさマップを生成しつつ、体積精度では主要な回帰手法と同等の性能を示す。

arXiv Computer Visionサイト内本文超低磁場MRI超解像のための不確かさを考慮した3D残差ウェーブレット拡散モデル

ImIR:画像インストラクションによるチューニングでオールインワン画像復元を実現

ImIR は、事前学習済み画像編集モデルに与える条件付けを、劣化画像そのものから導いた連続的な画像インストラクションに置き換える手法。単一 GPU で約3時間訓練した1つのアダプタで6種類の復元タスクをカバーし、劣化ラベルなしのタスク非依存な復元も可能にする。

arXiv Computer Visionサイト内本文ImIR:画像インストラクションによるチューニングでオールインワン画像復元を実現
スタートアップ

アンドリーセン・ホロヴィッツ、「アカデミー」を開設へ—宿題なし、PalantirやGoogle、Metaと提携

ベンチャーキャピタルのAndreessen Horowitz(a16z)は、若者がシリコンバレーのスタートアップを創業したり加わったりするための人材パイプラインと位置づける「Horowitz Andreessen Academy」を設立する。a16z主導で4200万ドルの資金を調達し、Anduril、Anthropic、Coinbase、Google、Meta、NVIDIA、OpenAI、Palantir、Replit、Stripeの10社がパートナーとして参加。2027年秋開始の1年間プログラムは無料で、定員50人、主に高校卒業直後の若者を対象とする。学位や認定は授与せず、Sam Altman氏らテック界の著名人による短期クラスや企業でのco-opを提供。従来の成績・試験・宿題はなく、5万ドル超のコンピュートクレジットと5000ドルの旅費・研究予算が約束される。参加者はサンフランシスコへ移住し、住居は自分で手配する必要がある。

The Verge AIサイト内本文アンドリーセン・ホロヴィッツ、「アカデミー」を開設へ—宿題なし、PalantirやGoogle、Metaと提携