本研究は、ルーブリックに基づく自動スコアリングの文レベル解釈可能性を目的とし、モデルに依存しないShapley値帰属と大規模言語モデル(LLM)が生成する根拠を組み合わせたフレームワークを提案する。CLASSフレームワークのフィードバック品質次元において、NCTEコーパスを用いて評価した結果、微調整済み事前学習言語モデル(PLM)はLLMよりも予測精度で優れるが、中程度のスコアにラベルが圧縮される傾向がある。削除ベースのテストでは、SHAPがモデル予測を駆動する文を確実に特定し、LLM生成の根拠よりも大きく一貫した予測シフトを生み出すことが示された。クロスモデル分析では、SHAP帰属がアーキテクチャ間で頑健に転移する一方、LLM根拠の影響は限定的で一貫性に欠ける。全体として、SHAPはルーブリックベースのスコアリングに対してより忠実で転移可能な説明を提供し、提案フレームワークはハイステークスな教育環境におけるスコアリングモデルとその説明の評価に原理的な基盤を提供する。
AI ニュース速報
リアルタイム監視
最新ニュース
信頼できる情報源、出典、権限、サイト内閲覧を保ちながら、AI の変化を読める情報に圧縮します。
最新ニュース
既存のマルチモーダル安全性ベンチマークは視覚入力のみに焦点を当てており、視覚、音声、テキストを処理する全モーダル大規模言語モデル(Omni LLMs)を評価できません。本稿では、正確な安全性評価のために複数のモダリティの統合を必要とする、4つの安全カテゴリにわたる1196のシナリオからなるベンチマークMCBenchを紹介します。各不安全シナリオには、モデルの感度を評価するために最小限の違いしかない安全な対応シナリオがペアになっています。最先端モデルの評価により、重要な課題が明らかになりました。Omni LLMsは微妙または非物理的なリスクに苦戦しますが、顕著な視覚的または聴覚的手がかりがある場合にはより良いパフォーマンスを発揮します。推論トレースの分析により、モデルはモダリティ固有の情報を抽出できるものの、安全性判断のためにこれらの手がかりを効果的に統合できないことが多いことが示されました。我々の発見は、現在のOmni LLMsが安全クリティカルな設定において堅牢なクロスモーダル推論を欠いていることを明らかにし、マルチモーダル安全性のための改良されたアーキテクチャとトレーニング戦略の必要性を強調しています。
低ランク適応(LoRA)をQwen2.5-3Bに適用したパラメータ効率的ファインチューニング(PEFT)の体系的研究で、電気通信カスタマーサポート向けのドメイン固有対話アシスタントを構築。組み合わせ型合成データ生成手法を導入し、16のLoRA構成を評価。定量的検証損失と定性的ヒトアライメント評価の乖離を明らかにし、エネルギー-パフォーマンストレードオフ分析を提供。
本論文では、実行中のトークン状態と圧縮ペアメモリ経路を維持し、ベンチマーク固有の解析なしで高次トークン相互作用を捕捉する汎用三重潜在系列モデルを研究する。三重潜在ファミリーは、バイトレベルのWikiText-2およびトークナイザベースのMiniMind言語モデルベンチマークにおいて小規模Transformerベースラインを改善する一方、想起重視のゲート付きキーバリュー検索拡張は連想想起を向上させるが、シードに敏感で現在の参照実装では大幅に低速である。
本研究では、グループ相対方策最適化(GRPO)と分散認識報酬フレームワークを組み合わせ、心臓関連医療質問応答に特化したLLMの後学習を提案する。従来の二値基準集約や単一のLikertスコアリングを連続的な分析報酬関数に置き換え、より豊富な最適化信号を提供する。HealthBenchの心臓サブセットにおいて、最良のGRPO変種はQwen3-14Bベースモデルに対して精度を0.362から0.502、F1を0.532から0.668に向上させ、GPT-OSS-120Bと競合する性能を示した。
この研究は、JEPA潜在空間予測損失と標準的なマスク言語モデリング(MLM)を組み合わせたハイブリッド事前学習目的を提案し、言語表現の改善を目指します。実験では、ハイブリッドエンコーダがより均一な埋め込みと優れた意味-語彙バランスを生成する一方、下流の精度は純粋なMLMと同等であることが示されました。
研究チームは、AIエコシステムにおけるモデルとデータコーパス間の合成データのクロスコンタミネーションをモデル化する二層SIR/SIRSフレームワークを提案し、合成テキスト検出と集団免疫が重要な介入戦略であることを明らかにした。
DiffSlackは、学習可能なスラック変数を用いて不等式制約を等式に変換し、ニューラルネットワークに非線形不等式制約を効率的に組み込む微分可能な投影層を提案する。衝突回避や曲率制限を含む200の制約を持つ車両経路計画において、ベースライン手法よりも高い計画成功率と制約充足性を達成し、CARLAシミュレーションと実車実験で軌道の実行可能性を確認した。
研究者らは、マルチモーダル基盤モデルにおけるトークン削減の最適な方法を自動的に見つける微分可能なフレームワークを提案し、視覚トークンを大幅に削減しても精度と効率のバランスを達成した。
多経路深層線形ネットワークの最近の解析では、勾配流を用いて「勝者総取り」の専門化、すなわち経路対称性が破れ各特徴が単一経路に集中することを予測している。本研究では、大きなステップサイズの離散勾配降下法(GD)が異なる振る舞いを示すことを明らかにする。単一経路解はシャープな最小値である一方、経路間で信号を分散するとシャープネスが低下し、その低下率は経路数と深さの両方に依存して減少することを証明する。その結果、初期訓練では勾配流が予測する深さ駆動の対称性破れが再現されるが、その後、安定限界での振動がこの傾向を覆し、ネットワークを信号が経路間で再分配される再均衡フェーズへと導く。これらの結果は、深さが経路競争をどのように形成するかを明確にし、大きなステップサイズのGDが永続的な単一経路支配ではなく共有表現を好む理由を説明する。
この研究は状態コミットメント学習を提案し、反実在消去強化学習(CERL)を用いて言語モデルに一時的な計算と永続的な状態を区別させ、精度を犠牲にすることなく隠れた思考への依存を低減する。
研究者らは、蒸留大規模言語モデル(Qwen3-4B-Instruct-2507)において時間選好を司る神経サブグラフを特定し、モデルが人間よりも将来を割り引く程度が低いこと、この選好が文脈によって不安定であること、そしてステアリングベクトルで調整可能であることを発見した。
PyCCは、特性曲線に着想を得た構造的スケルトンを利用して、時系列データから常微分方程式を発見するPythonライブラリです。ドメイン仮説を組み込むことで、方程式発見における不良設定逆問題に対処します。
本論文は、限られた予算下で高ペナルティのハイパーパラメータ方向を効率的に特定するための段階的分数因子スクリーニング手法を提案する。613の実験を通じて、総バッチサイズ、深さ、幅の主ペナルティは短い予算で最大となり、予算の増加とともに緩和されることがわかった。短時間の設計スクリーニングは有望なアンカーを確認し、局所的な最適化に役立ち、2つのホスト上で24時間までのブリッジ中心の推奨を支持するが、ランキングはハードウェアに依存しないわけではない。
新しいベンチマークにより、オープンウェイト大規模言語モデル(LLM)は、同じ精度でもエラーの重大度分布が大きく異なることが明らかになりました。Errorquake-10kデータセットは、8つのドメインと5つの難易度レベルでエラーを0-4の重大度スケールでスコアリングし、重大度プロファイルがエラー率を超える情報を提供することを示しています。
新しい論文は、LLMベンチマークカバレッジを評価するステレオロジー理論を提案し、ベンチマークスイートの効果次元がスコア差をはるかに超える大きな盲点を引き起こすことを明らかにし、最小限のベンチマークセットとガードナー問題の解決を提示しています。
agentgatewayは、AIおよびエージェントワークロード向けに設計された統合オープンソースゲートウェイで、Linux Foundation傘下のAgentic AI Foundation (AAIF) の第4ホストプロジェクトとして参加しました。MCP、A2A、LLM推論、HTTP、gRPCトラフィックを単一プレーンで管理し、セキュリティ、可観測性、ルーティング、ガバナンスを提供します。
Deb Liuは、絶え間ない最適化と取り残される恐怖に駆られるAI文化を考察し、真の生産性には静寂が含まれ、AIは人間の内省を代替すべきではないと論じる。
AgentNotesは、AIエージェントの動作を平易な英語で要約するツールです。1つのパッケージをインストールし、3つの環境変数を設定するだけで、ダッシュボードでエージェントのログとサマリーを確認できます。Python、Node.js、ClawHubに対応し、7日間の無料トライアルを提供しています。
AISOPは、MermaidまたはJSONフローグラフを使用して構造化AIプログラムを定義するためのオープンプロトコルです。分岐、並列実行、サブタスク、エラーハンドリングなどをサポートし、単一のポータブルJSON形式で実現します。移植性、機械可読性、トークン効率に優れ、人間の主権と福祉の公理に準拠しています。
ZillizはVector Lakebaseのパブリックプレビューを発表しました。これは、リアルタイム検索、インタラクティブな発見、バッチ分析を統合したセマンティック中心のデータプラットフォームです。階層型サービス、オンデマンド検索、外部データレイク検索、フルスペクトラム検索、統一レイクネイティブストレージなどの機能を提供し、サーバーレスと比較して大幅なコスト削減を実現します。
OSSNAにて、DirkとLinusがAIとカーネル開発について議論しました。2026年5月25日、Joe Brockmeierが報告。
多くの企業がAIに巨額を投資する一方、実際のリターンを測定できていない。Cognitionは、AIエンジニア「Devin」が支払額に見合う価値を提供しない場合、最大1,000万ドルのクレジットを提供する「AI生産性保証」を発表。この保証は、AIの出力と人間の作業時間を比較する検証済みの推定ツールに基づく。
企業は競争市場や投資家からの圧力でAIの生産性を活用するよう求められているが、多くの場合ITの承認なしにAIエージェントが導入され、クレデンシャル流出のリスクが生じている。BitwardenはSecrets Manager、Access Intelligence、Agent Access SDK、MCPサーバーなどのソリューションを提供し、AIエージェントのクレデンシャルアクセスを保護する。
Bonsai は、エージェントAI、ブラウザ自動化、およびメモリ機能を活用してChatGPTを置き換えるツールで、Google Driveからダウンロードできます。
Ollama 0.30がリリースされ、llama.cppを通じてGGUFモデルの互換性とパフォーマンスが向上。Appleシリコン上のMLXエンジンを補完し、より多くのハードウェアでモデルを実行可能に。
30年近い経験を持つエンジニアが、子供の野球チームのためのラインナップ管理アプリ「CalledUp」をAIで構築した方法を紹介。アーキテクチャの決定権を自ら握り、思考とコーディングを分離し、小機能を一つずつ開発する重要性を強調。AIは意思決定ではなく、実装の高速化に貢献した。
Charity Majors は、AI熱狂者とAI懐疑論者の間のダイナミクスを巧みに捉えている。両者は優れたソフトウェアを構築しようと努めており、しばしば同じチームに属している。熱狂者はAIによる能力の飛躍的な向上を実感しているが、懐疑論者はコードの高速な出荷が信頼性の低下や知識の喪失を招くと懸念している。Majorsはこれをリーダーシップとエンジニアリングの両方の課題として捉え、両グループを結ぶ自然なフィードバックループが欠如していることが核心の問題だと指摘する。
モナシュ大学の科学者たちは、光に基づく情報を生成、操縦、読み取りできる小型チップを1つのデバイスで作成し、超高速でエネルギー効率の高いコンピューティングへの大きな飛躍を記録しました。このブレークスルーは、原子レベルの薄い材料とナノ構造を用いて、「谷」自由度と呼ばれる光のユニークな量子特性を制御し、情報を新しい方法で符号化することを可能にします。
韓国政府がオンラインフォーラムでのAI画像スキャンを義務化し、違法コンテンツ対策を強化。プライバシーと表現の自由をめぐる議論が活発化。