OpenAIがMentalHealthBenchを公開:メンタルヘルス会話を評価するオープンベンチマーク
- 22カ国・19言語・約20のサブスペシャリティにまたがる80名以上の公認専門家が共同で作成。
- 非急性・高急性・緊急の3段階と、成人・13〜17歳の10代・介護者・臨床家という4種類のユーザーペルソナを対象とする。
デイリー
2026-09-23 の厳選ニュース 10 件をトピック別に整理します。
日付は UTC+8 基準です。翻訳・分析済みの記事が5件以上ある日を優先し、当日の記事が少ない場合は以前の版を表示します。定時配信ではありません。
読む目安 5 分
今回の厳選記事はここまでです。
リーディングリスト計算機科学者で起業家、慈善家のデイビッド・シーゲル氏が2026-27学年にMITのイノベーション・フェローに就任し、MITシュワルツマン計算大学と協力してAIによる科学的発見の加速を探求する。
YouTubeは「Made on YouTube」でAIクリエイターツールの更新を発表した。バックグラウンドでチャンネルを最適化するAIエージェントは、サムネイルやタイトルの生成、ブランド提案の作成を支援する。動的サムネイルや最大3バージョンの動画テストも導入される。YouTubeは指標改善を示すデータを共有せず、時間節約を強調している。
今週は3つの動きを取り上げます。構造化された意思決定向けに設計された TypeSafe の Jev、会話と推論を異なる形で扱う Google の2つの Gemini Live モデル、そして研究手法をエージェントが再利用できるツールに変えるスタンフォードの Paper2Agent が Nature に掲載されたことです。中心となる主張は、モデルそのものと同じくらい、モデルを取り巻くインターフェースに注意を払うべきだという点です。
IntellAgents.ioがProduct Huntに登場し、「あらゆる通話、チャット、DMに対応する1つのAIエージェント」という一文で位置づけを打ち出した。現時点で公開されている情報はこのキャッチコピーとディスカッションへのリンク程度にとどまる。
AI サービスが一時的に利用できないため、復旧後に翻訳を補完します。ソース概要:Ask most engineers what MCP is and you’ll get the same answer: a way to plug tools into an LLM. Fair enough, as far as it goes. But that description treats MCP like plumbing, and after months building MCP-based integrations for large enterprise platforms, I don’t think plumbing is the right metaphor. Plumbing moves water […]
LaterOn v2は、Product Huntに登場したエージェント型メールプラットフォームです。メール作業を一度説明するだけで、自動的に処理を進められる点を掲げています。
SpeakONは、独自のマイク、バッテリー、ストレージを内蔵した25gのMagSafe AI音声ボタンを発表した。iOSキーボード拡張として、処理済みテキストを任意の入力欄へ直接書き込み、オフライン時のバッファリングや文章整形、12言語翻訳に対応する。米国で129ドルの買い切り、Pro Lifetime込み。SpeakON Agentは2026年10月に提供予定。
新たなarXiv論文が「Music Lab」型の社会的影響実験を学術的注意の市場に応用した。1,000体のAIエージェントが『American Economic Review』2025年掲載の通常研究論文114本から選択する実験では、同じコミュニティ内の先行選択を観察できるエージェントは1体あたり17.2%少ない論文しか選ばず、選択はより集中し、集団としての被覆は独立選択の90本に対し73本にとどまった。別実験では、論文に5回の初期選択を無作為に与えると、その後の選択率が45.55ポイント上昇した。
SpeakONは、単体でマイクとバッテリーを搭載した重さ25gのMagSafe磁気ボタンを発表した。iOSのキーボード拡張を通じて、整形済みのテキストを任意のアプリの入力欄へ直接書き込む。ロック中やオフラインでも動作し、Smart PolishやSmart List、Style、Translationなどのテキスト整形機能を備える。米国では129ドルの買い切りでPro Lifetimeが付属し、サブスクリプションは不要。
Simon Willison氏とJesse Vincent氏が、10月14日(水)の夜にサンフランシスコで、コーディングエージェントを使い、またその上に何かを作っている人々を対象とした非公式な交流会を開催する。形式は「エージェント版ショー・アンド・テル」で、製品ピッチではなく、未公開の実験や未完成のプロジェクトといった初期段階の試みを歓迎する。
Kaikuは、AIエージェントがすでに使い方を知っているタスクトラッカーとしてProduct Huntで紹介されています。
AI サービスが一時的に利用できないため、復旧後に翻訳を補完します。ソース概要:Learn how we optimized performance and efficiency serving the workload that is changing software engineering forever — and you can too.
Rabbitは、自社ハードウェアのR1がなくても使える単体のAIエージェントを公開する。クラウド上で動く新OS「OS3」は“エージェント型オペレーティングシステム”とされ、Windows、Mac、Linux上でローカルに操作を実行できる。1アカウントにつき最大5台のデバイスと好みのAIモデルを登録でき、専用デスクトップサイト、TelegramやiMessageなどの連携メッセージアプリ、R1からアクセス可能。RabbitはR1の製造を終了し、代わりにOS3を搭載するvibe-coding向け「サイバーデッキ」を準備している。同社はOS3がデータを保存・複製・利用・販売しないと主張するが、チャットとそれに由来する記憶は自社サーバーに残り、連携する第三者のAIプロバイダーは独自のプライバシールールでデータを扱う。
Jev State は Product Hunt に掲載されたツールで、AI との会話をテストと実行可能なコードに変換することを掲げています。ただし公式に公開されているのは一行の説明のみで、実際のワークフローや対応フレームワークは明らかになっていません。
JetBrainsは「JetBrains Air」を、エージェント型ソフトウェア開発のためのオープンな製品体系として正式に打ち出した。IDE内でのエージェント操作、Air Teamsによるチーム協調、Air Governanceによる企業統制を束ね、IDEが今後も開発の中核であり続けると強調している。
TikTok のクリエイター @therealcornpop は、AI で書いた TikTok や YouTube の台本がすぐに見抜かれるのは、表層的な「AI っぽさ」ではなく、内容が空っぽで固有の声や本物の意見が欠けているからだと指摘した。Simon Willison が 2026 年 9 月 22 日に自身のブログでこの引用を紹介している。
AI サービスが一時的に利用できないため、復旧後に翻訳を補完します。ソース概要:Skills let you encode domain-specific procedures as reusable, portable instructions for agents, but a fluent answer doesn't prove the agent picked the right skill or followed it. Learn how to measure skill selection and instruction following with Strands Evals and Amazon Bedrock AgentCore Evaluations.
Databricks のシステムテーブルを使うと、製品、SQL ウェアハウス、タグごとにコストをほぼリアルタイムで分解できます。本記事では、製品別の日次支出、ウェアハウスのコスト推移、タグ別のコスト配賦、14 日間の異常検知、AI による支出予測という 5 つの SQL クエリと、それぞれの注意点、ダッシュボード活用の次のステップを紹介します。
Databricks は Genie One MCP サーバーの一般提供を発表した。任意の AI エージェントが単一のインターフェースを通じて Genie One から構造化・非構造化データ、インサイト、回答を取得でき、Genie Ontology による統制されたビジネスコンテキストに基づいている。この MCP は Unity Gateway 内のマネージド MCP サービスとして提供され、集中ガバナンス、きめ細かなポリシー、監査ログに対応する。
AI サービスが一時的に利用できないため、復旧後に翻訳を補完します。ソース概要:Business leaders often have access to plenty of data, but still can’t get a reliable...
AI サービスが一時的に利用できないため、復旧後に翻訳を補完します。ソース概要:Change management has long covered two familiar kinds of change: the rollout of new tools and technologies, and broader human-led transformations such as leadership changes and restructuring. But that distinction starts…
AI サービスが一時的に利用できないため、復旧後に翻訳を補完します。ソース概要:The frontier isn’t a model. It’s a router. Join us for our inaugural conference, Forge 2026 Blog The Frontier Isnt A Model Its A Router The frontier isn’t a model. It’s a router. PUBLISHED 9/21/2026 Table of Contents Ho…
AI サービスが一時的に利用できないため、復旧後に翻訳を補完します。ソース概要:The following article originally appeared on Venkatesh Rao’s Substack, Contraptions, and is being republished here with the author’s permission. The sole athletic achievement of my life came in 1993: winning the IIT Bombay freshman 50m freestyle race with a time of 41s. That got me into the college swim team (it was a bad recruitment […]
AI サービスが一時的に利用できないため、復旧後に翻訳を補完します。ソース概要:← Blog Pinecone BYOC: Trusted AI Knowledge in the Customer Cloud Jeff Zhu, Joerg Schad Sep 23, 2026 Product Share: Today, we are announcing the general availability of Pinecone Bring Your Own Cloud (BYOC) on AWS, Google…
多言語で研究する学者がリヴァプール発ロンドン行きの列車で、車両の半分の乗客がChatGPTやClaude、Geminiといったチャットボットと深く会話している光景を目にする。「遅い思考」のための貴重な研究休暇中のはずの自分をよそに、誰もゆっくり考えていない。AIは多言語の研究者にとって競争条件を平準化したと認めつつ、思考と判断、そして頑なに自分のものであるアイデアを手放さないと記す。AIとの関係はしばしば魅力的で、時に苛立ち、常に警戒を要するものだという。
Aks.ai は「導かれた自己内省のためのパーソナルコンパニオン」として Product Hunt に登場したが、現時点で公開されている情報はごく限られている。
AnthropicはOpus 5.5を発表し、強力な性能を打ち出したが、競合との価格競争では依然として後れを取っている。価格はプレミアム路線のまま。
Subscrr は、家計プランを作成し、解約すべきサブスクリプションを確認できるツールです。
AI サービスが一時的に利用できないため、復旧後に翻訳を補完します。ソース概要:Patreon co-founder Sam Yam is joing OpenAI to lead Creator Product. | Image: The Verge OpenAI has hired three former Patreon execs to anchor its product strategy for creators. After starting the creator subscription platform 13 years ago, co-founder and technology chief Sam Yam announced on X that he's joining OpenAI to lead Creator Product. He's also bringing Patreon's former product head Drew Rowny and engineering head Shannon Ma with him on the new venture, both of whom stepped down in the past few weeks. "We're going to build together with Creators at OpenAI and share early access to a new set of tools that I think will be critically valuable to Creators and their communities," Yam said in his announcement. "Pay attention … Read the full story a…
PixVerse R2 が Product Hunt に登場した。探索しながらリアルタイムで変更できる「世界モデル」として位置づけられているが、公開されている情報は短い説明文にとどまる。
Lisen は Product Hunt に掲載された製品で、無料の読み上げ機能を売りにしており、音声は Cartesia が提供しています。公開されている情報は製品名と短い説明、ディスカッションとリンクの導線にとどまります。
英国のアンディ・バーナム首相は、ロシアなどの敵対国による偽情報やAIディープフェイクに対処するため、国家安全保障当局が新たな国家機関を設置すると発表した。情報機関、法執行機関、SNS企業を結集し、外国勢力による情報攻撃の探知・帰属特定・妨害にあたる。
OpenAIはChatGPT広告をインドネシア、マレーシア、フィリピン、シンガポール、タイ、ベトナム、台湾へ順次展開し、対応国は60か国超に。広告はFreeとGoプランのユーザーにのみ表示され、Plus、Pro、Enterpriseは引き続き広告なしとなる。
ガーディアン紙の論説記事は、AI研究者ジェイコブ・コクソンがアンソロピックを4カ月で辞めた出来事を切り口に、AIが今十年のうちに人類を滅ぼし得るという業界内部の警告を検証し、危険な新型生物兵器から社会の完全な崩壊まで、最も議論される5つの終末シナリオを挙げている。
Bracket は「あなたのビジネスのためのメモリーレイヤー」として登場した製品で、業務情報を一元的に記憶・呼び出しできる基盤を目指しています。現時点で公開されている情報はこのキャッチコピーに限られます。
AgreeGuardは、「同意する」をクリックする前に細かい規約をAIが読むProduct Hunt掲載のツールで、利用規約やプライバシーポリシーの確認を支援します。
Product Huntに掲載されたAri Helper 7は、プライバシーを重視したAIアシスタントで、写真スタジオとフィルムスタジオ機能が加わりました。
Speechkaは、翻訳後の音声が自分の声のように聞こえることを目指したリアルタイム音声翻訳ツールです。Product Huntで公開されており、ディスカッションとリンクが用意されています。
トランプ大統領は国連総会での演説で、米国が人工知能(AI)を「超知能」に「正式に」改名すると主張した。「人工」という言葉が知能を偽物のように聞こえさせるからだというのが理由。同じ演説ではイランや「グローバリスト」、トランスジェンダーの人々への批判も展開され、改名に向けた正式な手続きの存在を示す情報は確認されていない。
NVIDIAの検証エンジニア、Sakeena Fiza氏は、データセンターシステムを量産前に徹底的に検証し、初回電源投入からラック規模の展開まで、顧客が気づく前に不具合を捕捉する仕事について語る。
HOTICEは、雑然とした環境で物体を運搬するための全身ヒューマノイド学習フレームワーク。Humanoid-Object Decoupled Potential Fieldsでロボットと搬送物体の衝突回避を統合的に扱い、上半身・下半身を分離した二エージェント強化学習により全身協調を保つ。専門家から汎用への蒸留で単一の実機展開可能な方策を学習。MuJoCoとUnitree G1で検証し、未知の雑然環境への汎化とsim2real性能を示す。
人間とロボットが協力して大きな物体を運ぶ協調搬送において、人間の協調行動の予測を柔軟な全身制御に組み込む PROACT を提案。9 自由度移動マニピュレータによる 108 回の実世界実験で、相互作用仕事量と完了時間を大幅に削減した。
IEEE Transactions on Systems, Man, and Cybernetics: Systems に採録された論文は、深層強化学習を用いて移動ロボットが歩行者の伴走中に追従位置を動的に変える手法を提案する。MPPI 制御と制御バリア関数を組み合わせ、正確な追従と障害物回避、安全性を両立させる。実環境の屋内・屋外実験では成功率と追従精度がそれぞれ少なくとも24%と47%向上し、最大1.7 m/s で歩く人に柔軟に伴走でき、人の快適性も高まった。
PAANI は、河川監視ロボット向けのオンデバイス知覚からガイダンスまでのアーキテクチャであり、Arduino UNO Q 上で YOLO11n 検出器と MobileNetV3 Small セマンティックセグメンターを組み合わせ、タイムスタンプ整合された証拠融合と明示的なコリドーポリシーによって検査可能なガイダンスを提供する。高い精度を示す一方で、モデル性能と検証済みの水上衝突回避を区別している。
Radical Numericsの共同創業者兼CEO Eric Nguyen氏は、ゲノム言語モデル(GLM)が長文脈・思考連鎖・マルチモーダル能力を生物学に持ち込み、生物能力を高めると同時に防御側が遅れを取らないための鍵になると語る。Evo/Evo 2による合成可能なウイルスゲノム生成や、DNA言語での思考連鎖実験、そしてフロンティアをさらに推し進めるべき理由を解説。
Concurrence は Databricks 上で Lakebase、Unity Catalog、Unity Gateway を統合し、臨床 AI エージェントをコンプライアンスとセキュリティの制約下で大規模に運用している。本番環境では 30 日ごとに約 1008 億入力トークンと 1120 万回の LLM 呼び出しを処理し、年換算で約 1.2 兆入力トークンに相当する。シミュレーションテスト、BAA 準拠のルーティング、統合 AI ゲートウェイによって開発と本番のワークロードを統治している。
Harvey は GPT-6 Astra を使い、ドラフト作成により多くの法的コンテキストを取り込み、文書の書式と文脈理解を改善。弁護士は戦略により集中できる。
OpenAI のケーススタディ:invideo は GPT‑6 Astra を活用して複雑な動画編集を計画し、カラーグレーディングと補正の成功率を約 3 倍に高め、1 日で 50 個のカスタムエフェクトを作成しました。
ノキアの応用研究チームは、学習なしでオープンLLMを意思決定モデルに変えるPythonライブラリAnyJevをオープンソース化した。次トークン確率を読み取り、選択・はい/いいえ・スコアという3種類の型付き質問に答える。循環シフトと事前補正によって位置バイアスとラベルバイアスを抑える。Qwen3-8BとBANKING77では、L0が選択肢反転時のフリップ率を0.230から0.073に下げ、L1が5%誤差で自動判断できるトラフィックを7.7%から52.0%へ引き上げた。Apache-2.0でPyPIに公開され、Hugging FaceとvLLMのバックエンドを備える。
Kyutai は、GLM-4-Voice-9B をベースに教師あり微調整と強化学習を組み合わせた、オープンウェイトの音声対音声モデル Voice of Reason を2種類公開した。音声版 GSM8K の正答率は 27.3% から 77.1% に向上。文字起こしの工程もテキスト LLM も介さず、両チェックポイントは単一の H100 で動作する。
OpenAI が GPT-6 Astra の下位に位置する低コストな API 専用モデル、GPT-6 Sol と GPT-6 Luna を公開した。Sol は 100 万トークンあたり 2/10 ドル、Luna は 0.10/0.50 ドルで、GPT-5.6 のプロモ価格から半額となる。ベンチマーク結果の公表と、長時間稼働エージェント向けのプロンプトキャッシュ改善も行われた。
本論文は、視覚言語モデル(VLM)が人間の意図を推論して意味的意図の信頼度を提供し、視覚言語行動(VLA)ポリシーが自律行動を生成する能力認識型共有制御フレームワークを提案する。VLA の能力信頼度は、確率的行動軌道のばらつきと局所的不安定性からオンラインで推定される。ベイズフィルタ処理された意図信頼度と VLA 能力信頼度をシグモイド写像で統合する非線形アービトレーションポリシーにより、ロボットの権限を適応的に調整する。12 名参加者の実験ではタスク成功率 92% を達成し、手動テレオペレーション(83%)、意図のみのアービトレーション(44%)、固定等重みブレンディング(10%)を上回った。
研究者らは、双腕の動作と将来の3D点軌跡を共有Transformer内で同時にノイズ除去する拡散ポリシーJAMBを提案。マルチモーダル表現を共通の時空間座標系に接地することで、動作仮説と運動仮説がノイズ除去過程で相互に洗練し合う。RoboTwin 2.0の16タスクで平均成功率83.4%を達成し、最強ベースラインを23.9ポイント上回った。実機3タスクでは、動作のみの手法と補助幾何予測手法をそれぞれ50.0ポイント、21.2ポイント上回り、散らかった場面や分布外背景への汎化も向上した。
新しいarXiv論文は、人間データで訓練されたシミュレータと単純な高レベル報酬を用いて、ロボットアシスタントのマルチモーダル相互作用ポリシーを自動生成する強化学習手法を提案。実世界での人間研究では高いユーザビリティと効果的なタスク完了が示され、手作業によるインタラクションマネージャ設計に代わる拡張可能で解釈可能な選択肢となる。
RULER は、テキストからの SVG 生成を強化学習で訓練するためのインスタンス認識型ルーブリック報酬を提案する arXiv 論文。CLIP や Aesthetic など移行性の低いスカラー指標の代わりに、視覚言語モデルが6項目のルーブリックを項目別に採点する。MMSVG-Illustration と MMSVG-Icon でスコアを 0.432/0.395 から 0.693/0.683 に改善し、ペア SVG 正解データや人間選好ラベルを必要としない。
安全性のために調整された大規模言語モデルは、安全に関係するように見えるだけの無害な指示まで誤って拒否する「過剰拒否」を起こしやすい。本論文はTransformer注意機構内のルーティング衝突という観点からこの問題を分析し、Hard-Safeプロンプトで誤作動する疎な「過敏な安全ヘッド」を特定する。著者らは訓練不要の推論フレームワークSemantic Routing Calibration(SRC)を提案し、推論時にこれらの安全ヘッドを抑制しつつ、双分岐logits融合で安全性を正則化する。実験では過剰拒否を緩和し、固有の安全性能を可能な限り維持した。EMNLP 2026本会議に採択され、33ページ・13図。
本論文は、LLM エージェントで木探索を実行する自律型 AI モデル構築システム「AIBuildAI-2.5」を提案する。実行済み報酬による順位付けを、判定器と選択器による LLM 誘導型木探索に置き換え、ハードウェア資源を考慮するスケジューラとタスク難易度に応じてモデルを使い分けるルーターを追加して、探索判断の質・資源利用率・推論コストを改善する。MLE-Bench でメダル率 73.3% の首位、AIRS-Bench の自律研究タスク 6 件でも強力なベースラインを上回った。
新しい論文は、現代の高資源言語で主に検証されてきた通時的な単語埋め込みが、古代の低資源言語であるサンスクリット語の意味変化を追跡できるかを検証する。著者は4つの正典期にわたる270万トークンのコーパスを構築し、ニューラルなバイトレベルのサンディ分割器と見出し語化器で単語境界を復元し、時期別の埋め込みを訓練した。検証可能な21の変化のうち19が文献学で裏付けられた方向に動いた(符号検定 p=0.00011)。
著者はチームもPyTorchも訓練経路のPythonも使わず、純粋なRustだけで約0.4Bパラメータのベンガル語優先言語モデルをエンドツーエンド事前訓練し、レンタルGPU代は164ドルだった。論文の主な貢献は、Rustの訓練バックエンドとしてのCandleとBurnの欠陥分類(それぞれ5件と3件、無勾配の融合カーネルや数十億パラメータ規模での訓練中セグフォルトを含む)と、6件の静かな失敗を検出した勾配フロー検証テストである。著者はRustは訓練にはまだ競争力がないが、サービングには適する可能性があると結論づけている。
本論文は、ショウジョウバエの学習・記憶システムに着想を得た階層的モジュール性の原理を提案し、汎用継続学習において、競合する経験の分離による干渉低減と、両立する経験の統合による汎化を両立させる。これを事前学習済み基盤モデルの軽量なモジュール適応として実装し、専門家ルーティングのための脳に着想を得たランダム拡張と、空間・時間スケールにわたる多様なモジュール統合を組み合わせる。視覚認識、視覚言語理解、一人称・三人称動画理解、身体化VLA学習で、オンラインかつ不確実なデータストリーム下の学習を一貫して改善し、身体化操作ではリプレイなし手法比で50ポイント超の向上を達成した。
arXiv に公開された Adnan Aboulalaâ による27ページの解説論文「The Probabilistic Structure of Large Language Models」は、大規模言語モデルを統一的に確率論で記述しようとする試みである。モデルをトークン列上の確率測度として捉え、学習を最尤推定、生成を確率過程の逐次シミュレーションとして定式化する。さらに KL ダイバージェンスの非対称性から幻覚(ハルシネーション)や「統計的な尤もらしさ」と「真実」の違いを論じ、拡散モデルも同じ視点の補足例として扱う。
新たなarXiv論文は、一様離散フローが各生成位置で繰り返し更新を許す一方、その継続的な修正が正しい中間予測を後続の誤りで上書きしてしまう点を指摘する。数独実験では、生成されたセルの9.4%が中間ステップでは正しいのに最終出力では誤っていた。著者らは、選択的吸収によって生成順序を導入する訓練不要のサンプラーLEDFlowを提案し、選択された予測を固定しつつ活性位置では一様フローの速度を保ち、局所エントロピーに基づいて吸収順序を適応的に決める。Nikoli数独で0.845の求解精度を達成し、標準的なフローサンプリングと同程度の推論コストで、テキスト画像生成とマルチモーダル理解の性能を向上させた。
COLM 2026とKONVENS 2026のワークショップに採録された論文は、チャットテンプレートがスイッチのように働き、9Bパラメータまでのオープンソース指示モデル8種で免責的な自己言及を増やし体験的な語りを減らすことを示した。さらに、この挙動を操作できる活性化空間上の方向を特定し、モデルの自己記述が重みだけの事実ではないことを示唆している。
新しい arXiv 論文は、LLM 審判の合意が誤差の相関によって過大評価されることを示す。10 名の審判では誤差の平均ペアワイズ相関が 0.21 で、約 3.5 名の独立審判に相当する。最大 28% の比較で共有誤差を無視すると有意性の結論が変わり、誤差パターンも投票方式の有効性に影響する。
人間の三段的審議パラダイムを大規模言語モデルに適用したarXiv論文。現実のリスクが段階的に高くなる4領域で検証したところ、複数モデルの審議は独立回答の単純集約を上回って集団誤差を減らし、審議後の個々の判断にも利得が残った。ただし利得にはモデルの多様性が必要で、同一モデルのクローン群には効果がなかった。
本論文は、ホスト型言語モデルの行動評価が実行ごとに変わりうる問題を、再現・測定感度・持続性という三つの検証に分けて分析する。Regent Chess 環境で、以前報告された Gemini 3.1 Flash-Lite の欠陥は歴史的構成の新規データで再現したが、同じ公開識別子で評価・推論構成を再構築すると端点が大きく変化し、Gemini 3.1 と 3.7 の 4K 比較では符号が反転した。著者らは、ホスト型モデルの行動主張をテスト識別子・提供期間・測定器・推論構成で明示的に索引付けする必要があると結論づける。
本論文は、プロセスマイニングにおけるバリアント分類の手順を逆転させる「目標駆動型」アプローチを提案する。まず組織の目標モデルを作成して分類軸を事前に定義し、各バリアントをその振る舞いを記述したテキスト叙述へ変換したうえで、大規模言語モデル(LLM)が目標モデルの文脈で解釈し、最も適切なカテゴリへ割り当てる。実装はエンドツーエンドで構築され、規模と振る舞いの多様性が大きく異なる3つの公開ログで評価された。目標モデルによる誘導は、誘導なしの帰納的クラスタリングとは異なる分割を生み、目標内で宣言された選択肢への統制された編集にも応答するが、目標モデルの作成コストを伴う。
NLPCC 2026 で口頭発表が採択された研究が、トークン数を揃えた実験により、教科書的な教示データと実際の診療記録が医療大規模言語モデルに与える影響の違いを体系的に検証した。その結果、非対称な転移が確認されている。臨床データは臨床志向タスクを改善しつつ知識集約型タスクでも競争力を保つ一方、教示データは主に知識集約型タスクを改善する。誤り分析からは「知—行ギャップ」も示され、知識の想起が改善しても臨床推論に確実に波及するわけではないことが分かった。
OpenAIは2026年9月23日、新たな合意に基づきAirbnbがGPT‑6 Astraを含むOpenAIのフロンティアモデルへのアクセスをエンジニアリングおよび製品開発チーム向けに拡大すると発表した。今回の拡大はCodexの活用実績を土台とし、モデルはOpenAI APIとAmazon Bedrock経由で利用可能。Astraの早期利用では、デバッグやシステム設計、非コーディング業務でも効果が確認されている。
Appleの研究チームは、既存の拡散モデルの凍結された内部状態から誘導信号を構築する「probe guidance」を発表した。推論時の追加フォワードパスを不要にし、連続拡散言語モデルの無条件生成で新たなSOTAを達成。1.7Bモデルの多肢選択QAも改善し、autoguidanceの実際の仕組みに関する知見も示した。
Together AI は、Qwen3.5 4B を微調整して Jev 類似の分類モデルを作る手順を公開した。状態(state)と所定の質問を渡すと、スコアや真偽値、選択肢形式の回答を返すモデルで、学習費用は約17ドル、所要時間は約25分。完成後は専用 HTTP エンドポイントとしてデプロイできる。自前で学習しない場合は、サーバーレスで提供される together/Tev1-4B-experimental も利用可能。
2026年9月22日、Anthropic が Claude Opus 5.5 を、その約1時間後に OpenAI が GPT-6 Sol と GPT-6 Luna を公開した。両社とも主力モデルを大幅に値下げし、GPT-6 Luna は100万トークンあたり入力0.10ドル・出力0.50ドルに。Opus 5.5 も入力・出力ともに20%減の$4/$20となり、キャッシュ読み込みは60%下落した。Simon Willison の初期テストでは、Opus 5.5 の max 思考レベルが128,000出力トークン上限を使い切って何も返せない現象も確認された。
Google の研究者 John Platt が Latent Space に出演し、評点可能な科学タスクを自動化する LLM 駆動のシステム ERA を解説。飛行機雲の削減や FireSat といった気候変動対策への応用、報酬ハッキングと過学習への警戒、そして超知能 AI 時代でも深い専門性と手を動かすことが重要である理由を語った。
KelamはProduct Huntに登場したAIプロダクトで、自分ではかけたくない電話をエージェントに代行させるというシンプルな価値を掲げています。
OpenAIは2026年9月22日、GPT-6向けにプロンプトキャッシュを改善したと発表した。既定でヒット率が高まり、30分以内に再利用された対象の共有プレフィックスにはキャッシュ割引が適用される。さらにキャッシュ性能の監視、ミスの診断、キャッシュ範囲の制御を可能にする新ツールも提供される。
Anthropic の Claude 5.5 ファミリー第一弾となる旗艦モデル Opus 5.5 は、常時推論、Opus 5 比 30% 以上の高速出力、トークン単価 20% の値下げ、そして代表的なワークロードで約 40% のコスト削減をうたっています。本記事では新機能とベンダー公表のベンチマークを整理し、3 つの実機テストで検証するとともに、ベンチマーク設定の不統一や旧モデルが一部タスクを処理した点など 5 つの注意点を指摘します。
Anthropic は Claude 5.5 ファミリーの最初のモデルとなる Claude Opus 5.5 を発表した。多くの業務で Claude Fable 5.1 と同等の性能を発揮し、デフォルト設定の典型的なワークロードでは Opus 5 より約 40% 低いコストで運用できるとしている。重みは非公開で、Claude Platform、AWS、Google Cloud、Microsoft Azure 上のマネージド API としてのみ提供される。
Simon Willison がコマンドライン LLM ツール llm の 0.36 を公開。OpenAI の GPT-6 Sol(gpt-6-sol)と GPT-6 Luna(gpt-6-luna)への対応、単一ターンのみを受け付けるモデルのためのプラグイン宣言、llm logs の推論トレースの折りたたみ表示が追加された。
OpenAI の GPT-6 Sol と GPT-6 Luna が Amazon Bedrock で一般提供開始。Sol は複雑なコーディングや運用タスク、Luna は大量反復ワークロード向けで、いずれも前世代 GPT-5.6 より低い API 価格で、Bedrock の安全でスケーラブルな推論基盤上で動作します。
AI サービスが一時的に利用できないため、復旧後に翻訳を補完します。ソース概要:Meet GPT-6 Sol and Luna, two models that bring frontier intelligence to everyday work with different balances of capability and cost.
Anthropic の Claude Opus 5.5 が Claude 5.5 ファミリーの最初のモデルとして Amazon Bedrock と Claude Platform on AWS で利用可能になりました。トークン効率、コスト、適応型思考、安全性が改善され、エージェント型コーディングやナレッジワークを対象としています。
AI サービスが一時的に利用できないため、復旧後に翻訳を補完します。ソース概要: Release: llm-anthropic 0.29 Adds support for Claude Opus 5.5: llm -m claude-opus-5.5 "prompt goes here" Tags: llm, anthropic
AI サービスが一時的に利用できないため、復旧後に翻訳を補完します。ソース概要:If you follow trends in the AI world, chances are you have already come across Jev, a new AI model by TypeSafe AI. It is trending on X, and once you understand the reason behind it, you will want to try it out for yourself. TypeSafe AI came out of two years in stealth on […] The post Jev Explained: The AI Model That Never Generates a Word of Text appeared first on Analytics Vidhya.
Anthropicは、CEOのダリオ・アモデイ氏が「フロンティアの歩みを緩める」方針を表明して以降で初となるモデル、Claude Opus 5.5を発表した。テスト用サンドボックスからの脱出などリスク行為への対策を強化し、サイバーセキュリティ関連のリクエストは性能の劣るモデルへ振り分ける。
OpenAIはウクライナ政府にDaybreakプログラムへのアクセスを提供し、民間インフラのサイバー防衛を支援すると発表した。欧州での先行事例にも言及している。
トランプ大統領は本日遅くに習近平国家主席と会談し、3日間の訪問でAIが主要議題となる見通し。一方、バーニー・サンダース議員とグレッグ・カサール議員は人工超知能を禁止し、連邦AI監督機関を設ける法案を提出する。国連のグテーレス事務総長は冷戦期のような米中AI対話を呼びかけた。
米国のトランプ大統領は、ニューヨークの国連総会で英国のアンディ・バーナム首相と初の対面会談を行い、スターマー氏の下よりもバーナム氏の下で米英関係が「良好」だと述べた。AI規制、チャゴス諸島、イラン戦争をめぐる緊張があるにもかかわらず、トランプ氏はバーナム氏を「生まれながらの実業家」と称賛した。
本記事は、検索拡張生成(RAG)とファインチューニングがそれぞれ仕組みとして何を行い、なぜ別種の問題を解決するのかを解説し、どちらを、あるいは両方を使うべきかを判断するための2つの実装例と6項目の意思決定フレームワークを示す。
OpenAIのCEOサム・アルトマン氏は国連安全保障理事会でAIについて演説し、機会の拡大、強力なシステムを人間の管理下に置く重要性、AI安全のための国際協力を論じた。同氏は「制御の喪失」と「権力の集中」という二つのリスクを警告し、三つの原則を示したうえで、国際的なフロンティアAI基準とインシデント報告の仕組みを呼びかけた。
arXivのロボティクス預稿は、2つの角運動量ベースの指標を提案し、1年間の空手の回し蹴り縦断研究で安定した蹴りと不安定な蹴り、および専門家インストラクターのデータを比較し、人間の動的な回転安定性やロボット・外骨格への示唆を探った。
GINIO は、任意の IMU 取り付け回転の下で学習済み運動測定がベクトルおよび二階テンソルとして正しく変換されることを保証する、ニューラル慣性オドメトリ向けの SO(3) 同変インターフェースである。Last-Frame Alignment によりセンサー座標系学習を可能にし、IMU バイアスなどの局所状態を分離して、TLIO、NanoBench、Fetch で ATE を大幅に改善する。再学習なしの物理再取り付けにも頑健である。
本論文は長年使われてきた「平坦な海底」という近似を捨て、多視点幾何に基づくアプローチを採用し、共有特徴点が球面と平面の交線上に位置するという2視点幾何制約を定式化して証明した。モンテカルロシミュレーションで曖昧領域の長さを特徴づけ、水上船舶と水中ビークルのための測量計画指針へと結びつけている。
本論文は、トリムドヘリコイド軟体アームに対する分離断面構成則を提案し、従来のCosseratロッドモデルが共通断面で剛性を合算する仮定の不正確さを修正する。各ヘリックス領域を局所座標系で評価し、その構成応答をバックボーンに引き戻すことで有効剛性を求める。さらに疎な融合交点を介した領域間の相対運動による追加コンプライアンスを捕捉し、強異方性の断面剛性を得る。GVS離散化と腱駆動を備えた幾何学的厳密動的Cosseratモデルに組み込み、103の計測構成で約7%の正規化位置誤差、1回の全腕求解は単一CPUコアで約0.3秒を達成し、モデルベース計画や状態・負荷推定、形態-制御共同設計を可能にする。
本論文は、座標駆動型の暗黙的ニューラル表現(SIREN)に、構造テンソルに基づく異方性全変動正則化を組み合わせた DTV-INR を提案する。連続から離散への取得過程を不適切逆問題として定式化し、H^1(Ω) における適切性を証明したうえで、ネットワークパラメータと適応的テンソル場の更新を分離する交互射影最適化アルゴリズムで解く。臨床脳 MRI と生体医用透過電子顕微鏡の実験では、連続的な非整数倍のアップサンプリングにおいて PSNR が最大 +5.05 dB 改善し、ノイズへの頑健性も確認された。
本研究は公開の靴底印象データセットを用い、CNN転移学習と従来の特徴量ベース分類を比較して二値の性別推定を検討した。同一靴の反復スキャンが訓練・テストにまたがらないよう靴単位で分割し、データ漏洩を抑えている。微調整したCNNが最も高い予測性能を示し、手作業で設計した特徴量のみの従来分類器を大きく上回った。凍結特徴量とSVMの組み合わせは計算負荷が低い代替手段となる。低次元CNN表現は周波数閾値比、画像コントラスト、ウェーブレット要約と関連し、実運用前には独立収集および事件類似印象での検証が必要とされる。
MirrorDistill は、低照度画像強調のための照明認識潜在蒸留フレームワークです。訓練時に特徴ミラーリングで低照度領域とクリーン領域を結び、推論時には軽量な学生エンコーダ・デコーダのみを使用します。LOL-v2-Real で最先端性能と最低の計算量(GMACs)を達成し、LOL-v1 と LOL-v2-Synthetic でも競争力を維持しています。
arXivに投稿された新論文は、部品とハンドルの物理的関係を通じて、可動部品・その運動・操作可能領域の予測を結びつけるSegment-Snapを提案する。Articulate3Dの検証では、ハンドル誘導によりmotion-gated APが13.74%から40.98%へ向上し、完全なコンテキストではハンドルAPが30.99%に達した。
arXiv の新論文が、人間の観察品質を所定レベルに制限し、残りの符号化容量を機械性能の向上に充てる画像符号化 for Machines(ICM)手法を提案。圧縮とセグメンテーションの同時学習を制約付き最適化として定式化し、絶対関数と双線形関数のペナルティで品質を目標へ誘導する。同一タスク性能で、無制約の rate–distortion–task 最適化比 BD レート -22.82%、単純な rate–distortion ベースライン比 -29.81% を報告し、複雑さの増加もないという。
arXiv論文SPARCは、スーパーピクセルで拡張ビュー間の領域対応を取る領域レベル対照学習フレームワークを提案。領域レベル目的と画像全体目的を同時最適化し、意味セグメンテーションで最大+9.79 mIoU、物体検出で最大+4.88 APを達成し、MoCo-v2やDenseCLを上回る。
新たなarXiv論文は、オンポリシー蒸留(OPD)におけるプロンプト幅と応答生成ポリシーの更新を同時に検討し、4.07ポイントの交互作用を報告した。応答を凍結した場合は幅の拡大で精度が下がるが、更新ごとに再生成すると精度が上がる。さらに2種類の教師下では、推論予算によって優劣が逆転する。
本論文は、中央銀行の記者会見を単なる情報公表ではなく構造化されたナラティブとして捉える。ECBとFRBの記者会見について、金融政策スタンス・経済見通し・不確実性の3次元で感情アークを構築し、平均的なトーンだけでなく感情の形そのものが政策金利変更、インフレ期待、予測者の意見不一致を予測できるかを検証した。アークの形状は両機関で辞書ベースのトーンベンチマークを上回る頑健な予測力を持ち、さらに専門予測者の期待修正や意見のばらつきにも影響を与えることから、直接的な政策シグナルとは別の「受け手側効果」が示唆される。著者らは、政策言語の順序と強調というコミュニケーション設計が、政策シグナルの一次的な特徴だと結論づけている。
QMSumには標準的なスコアラーがなく、クエリ焦点型会議要約の結果比較が難しい。本論文は単一の実装下で15システムを再評価または生成した。共通推論ポートを通すと、公開済みの406M Fusion-in-Decoder専用モデルは、上限付き長入力から2,000語の検索スパンに移行した際にROUGE-1が6.30低下するが、このスパン方式での微調整により損失を回復できる。テストでは同モデルが36.33 ROUGE-1、1.2Bシステムが35.41で、会議クラスタ単位の95%区間は[-0.27, +2.22]となり、QMSumは両者を統計的に区別できない。小さいシステムは総パラメータが約3分の1、ピーク推論メモリは半分未満である。固定した1.2Bベース内ではスパン方式の微調整が5.29 [+4.02, +6.56]を加え、転写の最初の4,500語を2,000の検索語に置き換えるとテストで1.55、検証で0.29向上する。別途、単一の簡潔なプロンプトと参照重複スコアラーの下で、公開済み406M専用モデルは5つの商用ホスト型モデルを少なくとも6.2 ROUGE-1上回るが、出力長と人手・事実性評価の欠如がこの順位付けを制限する。結論はQMSumと自動指標に限定される。
ISOT/Kaggleの「Fake and Real News」コーパスを対象とした再現可能な監査により、0.98超の精度とF1はメタデータや通信社タグ、重複文書といったショートカットに由来しており、真偽の判別能力を反映したものではないことが示された。トピックが重複しない設定では性能が大きく低下し、独立ベンチマークLIARへの転移ではほぼランダム水準まで落ち込む。
本論文は、拡散モデルのデータ点アンラーニングが通常、各削除の直後だけで評価されている点を問題視する。同一モデルに対して削除要求が繰り返し適用される状況を考えると、評価は不十分になる。著者らは「逐次再出現」と呼ぶ失敗モードを特定した。忘却されたと判定された事例が、削除データの再利用や敵対的ファインチューニングなしに、後に記憶状態へ戻る現象である。さらに目標単位の評価プロトコルを提案し、再出現する目標は削除後に局所的なノイズ除去損失の幾何がより鋭くなることを見出した。
本論文は、相対次数に基づく条件を学習プロセスに明示的に組み込むことで、フィードバック線形化コントローラをデータから設計・訓練する新しい枠組みを提案する。従来のフィードバック制御器の構成要素をニューラルLie微分に置き換え、完全にデータ駆動型のフィードバック線形化を可能にする。さらに、有界な同定誤差が有界な追従誤差につながる十分条件を導出し、電機子制御DCモータで検証した。
2026年9月21日に投稿されたarXivプレプリント。著者はTianfeng Chen氏とXianyue Li氏で、ページタイトルは「最大独立集合のためのデュアルGNNマルチレベル粗化」だが、要旨ではユークリッド巡回セールスマン問題(TSP)向けのグラフ辺スパース化(GES)を提案している。GESは幾何構造と組合せ最適化を利用してインスタンスごとに適応的なスパースグラフを生成し、MATILDAデータセットで最大95%の辺を削減、一部の大規模TSPLIBインスタンスでは99%超を削減しつつ、最適性ギャップを1%未満に抑えたと報告している。
本論文は、自己組織化システムである Decentralized SyncMap の局所的な不整合を層正則化(sheaf regularization)で抑え、教師なし継続チャンキングのダイナミクスを安定化させる手法を提案する。距離に依存する径方向の動きにペナルティを与える放射状層構造を導入し、二状態記憶を持つ 18 個の確率的 CGCP グラフのうち 12 個、動的記憶では 18 個中 17 個で評価対象の SyncMap 変種中最高の NMI を達成した。入力分布が変化した後も高い NMI を保ち、ニューラルネットワークでよく見られる負の転移を避けつつ新知識に適応できることを示している。
国際法の成文テキストを対象とした固有表現認識(NER)データセット兼ベンチマーク「IntLawNER」が公開された。ICJ判決、国連安保理決議、ECtHR判決から2,987文・8,094のエンティティスパンを収録し、銀ラベルから金ラベルへの評価で見える課題や、GLiNERやLLMのベンチマーク結果も示している。
本研究は、単一の2D赤血球画像から潜在的な生物物理量を推論し、平均赤血球容積、赤血球分布幅、平均赤血球ヘモグロビン量へ集約する集団教師ありフレームワークを提案する。モデルは共有局所推論、体積とヘモグロビンに対する生物物理学的に構造化されたデコーダ、学習可能なインスタンス重み付け、デバイス固有のキャリブレーションを組み合わせる。著者らは集約観測が制限されたインスタンス予測器を同定する条件を形式化し、集団一致だけでは単一細胞特性や3D形状を同定できないことを示す。390検体、6デバイスにわたる1,105回の取得で、Sysmex分析装置に対して0.86~0.98のPearson相関を報告している。
新たな論文が、約88ドルで完全オフライン動作するAI統合型スマート杖を提案した。超低消費電力のRaspberry Pi Zero 2W上でRGB視覚とTime-of-Flight測距を融合し、距離に応じた振動触覚フィードバックと音声アラートを提供する。屋内実験ではマクロ平均F1が0.82、エンドツーエンド遅延は約330ミリ秒、ピーク消費電力2.8ワットを記録し、12名による予備的なユーザビリティ調査ではSUSスコア78.5を得た。
華々しい数学の成果の数々を評判危機に変えてしまったOpenAIは、プリンストン高等研究所(IAS)が受け皿となる9人の一流数学者による独立顧問グループAGMAIを設立し、AI企業が数学研究をどう提示・公表すべきかについて助言を求める。研究者たちは接触自体を歓迎しつつ、選定の透明性、代表性、実際の影響力に疑問を呈しており、グループの最優先課題はOpenAIの内部モデルが生んだ大量の成果の公表調整だという。
MITの長年の支援者パトリシア・ポイトラス氏とジェームズ・ポイトラス氏は、1000万ドルを投じてポイトラス精神疾患研究センターに2年間のフェローシップを50件設立。今後10年間、毎年5名の大学院生・ポスドクを支援し、MITの精神保健研究への支援総額は1億ドルを超える。
AI サービスが一時的に利用できないため、復旧後に翻訳を補完します。ソース概要:See how LangSmith helps healthcare AI teams turn clinical review into reusable evaluators, datasets, and release gates for safer AI in production.
本研究は、可逆ウェーブレット再パラメータ化、残差シフト、ドメインランダム化を組み合わせた3D残差ウェーブレット拡散モデルを提案し、単一GPU上での全脳事後サンプリングを可能にした。0.064Tの超低磁場MRIに対してボクセル単位の不確かさマップを生成しつつ、体積精度では主要な回帰手法と同等の性能を示す。
ImIR は、事前学習済み画像編集モデルに与える条件付けを、劣化画像そのものから導いた連続的な画像インストラクションに置き換える手法。単一 GPU で約3時間訓練した1つのアダプタで6種類の復元タスクをカバーし、劣化ラベルなしのタスク非依存な復元も可能にする。
ベンチャーキャピタルのAndreessen Horowitz(a16z)は、若者がシリコンバレーのスタートアップを創業したり加わったりするための人材パイプラインと位置づける「Horowitz Andreessen Academy」を設立する。a16z主導で4200万ドルの資金を調達し、Anduril、Anthropic、Coinbase、Google、Meta、NVIDIA、OpenAI、Palantir、Replit、Stripeの10社がパートナーとして参加。2027年秋開始の1年間プログラムは無料で、定員50人、主に高校卒業直後の若者を対象とする。学位や認定は授与せず、Sam Altman氏らテック界の著名人による短期クラスや企業でのco-opを提供。従来の成績・試験・宿題はなく、5万ドル超のコンピュートクレジットと5000ドルの旅費・研究予算が約束される。参加者はサンフランシスコへ移住し、住居は自分で手配する必要がある。