Shippyの構築から学んだエージェント開発の教訓
Shippyは、高い信頼性が求められる海洋状況認識のためのAIエージェントです。本稿では、そのアーキテクチャ(ソウル、スキル、設定)や、決定論的CLIによるAPIアクセス、ユーザー分離のためのサンドボックスホスティング、実データに対するエージェント全体の評価システムなど、主要な設計上の意思決定について説明します。また、得られた教訓と今後の計画についても述べます。
ソース詳細
AI News Hub は Hugging Face Blog の AI 更新を追跡し、ソース状態、利用範囲、収集方法、公開記事を表示します。
Official source; confirm license per article before full body display.
Shippyは、高い信頼性が求められる海洋状況認識のためのAIエージェントです。本稿では、そのアーキテクチャ(ソウル、スキル、設定)や、決定論的CLIによるAPIアクセス、ユーザー分離のためのサンドボックスホスティング、実データに対するエージェント全体の評価システムなど、主要な設計上の意思決定について説明します。また、得られた教訓と今後の計画についても述べます。
本記事では、AIエージェントにおけるモデルルーティングの複雑さを解説。単なる分類問題ではなくシステム最適化問題であると指摘し、コスト、複雑性、レイテンシの3つの次元でよくある誤解を解き、IBM Researchが構築した最適化ベースのルーターソリューションを紹介。
Thinking Machinesが、画像、テキスト、音声入力をネイティブで受け付ける約1兆パラメータのオープンモデル「Inkling」をリリース。100万トークンのコンテキストウィンドウを持ち、混合エキスパートアーキテクチャにより効率的な推論を実現。Hugging Faceで公開され、transformers、SGLang、llama.cppで即日利用可能。
既存のベンチマークは音声AIが人間レベルのパフォーマンスに近づいていることを示唆しているが、実際の会話は異なるストーリーを語っている。Hume AIはReal World VoiceEQを発表。これは40以上の音声モデルを15以上の評価軸と60以上の指標で評価し、100万以上の人間の評価に基づくベンチマークである。主な発見:進歩は専門化している、音声モデルは話すことよりも聞くことが苦手、従来のベンチマークは実世界のパフォーマンスを過大評価、人間による評価が依然として不可欠である。
NVIDIAは、エージェントAIの構築におけるオープンデータと合成データの重要性を強調し、データの検査可能性、品質、信頼を重視しています。Nemotronデータセット、Prompt Atlas可視化ツール、地域的多様性のための合成ペルソナについて詳細に説明しています。
TransformersライブラリのvLLMバックエンドが、多くのLLMアーキテクチャにおいてカスタムvLLM実装と同等以上の推論速度を達成。モデル作者は追加コードなしで超高速推論を利用可能に。
Hugging FaceとAmazon SageMaker AIのディープリンク統合により、モデル発見からSageMaker Studioでの実験までをワンクリックで実現。権限の自動構成、GPUクォータの表示、モデルのカスタマイズとデプロイをサポートし、発想からエンタープライズ展開までの道のりを短縮します。
SkyPilotとHugging Faceの連携により、モデルとデータセットをHubに保存し、SkyPilotを使っていずれのクラウドでもデータ転送料金なしで計算を実行できます。
LeRobot v0.6.0 は、世界モデルポリシー(VLA-JEPA、FastWAM、LingBot-VA)、新しいVLA(GR00T N1.7、MolmoAct2など)、報酬モデルAPI(Robometer、TOPReward)、6つの新しいシミュレーションベンチマーク、DAgger補正付きデプロイメントCLI、深度センシング、自動言語アノテーション、最大2倍高速なデータローディング、クラウドトレーニング、より軽量なインストールを導入し、ロボット学習ループを閉じることを目指しています。
この記事では、7Bテキストから画像へのモデルPRXのデータパイプラインについて詳しく説明しています。多様な事前学習データセットを公開・内部データセットから構築し、VLMを使用して長く正確なキャプションを生成し、データセット構築にはLance、ストリーミングにはMDSを使用しています。チームは、品質92のJPEGエンコーディングの選択、オンザフライのテキスト潜在変数の計算、データ断片化に関する教訓について説明しています。
Hugging Face の Kernels プロジェクトは、カスタムカーネルのパッケージ化、配布、利用を標準化することを目的としています。この記事では、主要なアップデートをまとめています。新しい「カーネル」リポジトリタイプによる発見性の向上、信頼できるパブリッシャーとコード署名によるセキュリティ強化、CLI の再設計、Torch Stable ABI と Apache TVM FFI のサポート拡張、エージェントによるカーネル開発の基盤、環境セットアップや互換性チェックの改善などです。
Hugging Face と Cerebras は、Gemma 4 を活用したリアルタイム音声AIシステムを発表。オープンなモジュラーアーキテクチャによりレイテンシを大幅に削減し、自然な対話を実現する。Nvidia の音声認識、Cerebras の高速推論、Alibaba の音声合成を統合し、9,000台以上の Reachy Mini ロボットに導入されている。
IBM Researchは、エンタープライズJavaにおけるクロスフレームワーク移行タスクのAIエージェントを評価するためのオープンベンチマークScarfBenchを発表しました。ベンチマークには34のアプリケーション、102のフレームワーク実装、204の移行タスクが含まれています。現在のトップエージェントの行動成功率は10%未満であり、移行中の振る舞い保持の難しさが浮き彫りになっています。
本稿は、最適化理論、進化生物学、競争市場、機械学習の四つの視点から、専門化が限られたリソース下でシステムの性能を向上させる必然的な道であることを論じる。著者は、汎用性は性能上の優位性ではなく、有限リソースではタスクを絞り込むことが効果的だと指摘する。また、専門化とドメイン知識の違いを明確にし、スケーリングがこの根本的な制約を変えないと述べる。
Every Eval Ever(EEE)とHugging Face Community Evalsが相互運用可能になり、評価結果のクロスポストと解釈が可能になり、オープンモデル、リーダーボード、統一された標準化メタデータストアへのリンクが提供されます。
DiScoFormerは、データポイントの集合から分布の密度とスコア(対数密度の勾配)を一回の順伝播で推定する新しいトランスフォーマーモデルです。再学習不要で、クロスアテンション、共有バックボーン、一貫性損失を利用して分布に適応します。100次元では、最適なKDEと比較してスコア誤差を約6.5倍、密度誤差を37倍以上削減します。
Hugging Faceのインフラ上で、サーバーのプロビジョニングやKubernetesを必要とせず、1つのコマンドでプライベートなOpenAI互換のLLMエンドポイントを起動できます。秒単位の課金です。起動、クエリ、クリーンアップ、大規模モデルへの拡張、チャットUIの作成、SSHデバッグ、コーディングエージェントのバックエンドとしての利用まで、完全なフローをカバーし、Inference Endpointsとの比較も行います。
Ai2チームは、7BパラメータのTransformerモデルOlmo 3とハイブリッドモデルOlmo Hybridを比較。ハイブリッドモデルは内容語(名詞、動詞、形容詞)や文脈推論が必要なトークンで優れるが、繰り返しトークンや閉じ括弧では優位性が消失する。トークンレベルの損失フィルタリングにより、アーキテクチャ間の微妙な差異が明らかになった。
NVIDIA NeMo AutoModelはHuggingFace Transformers v5をベースに、エキスパート並列化、DeepEP融合オールツーオールディスパッチ、TransformerEngineカーネルを追加し、MoEモデルのファインチューニングでトレーニングスループットを3.4~3.7倍、GPUメモリを29~32%削減、API変更は不要。
CUGAはIBMが開発したオープンソースのエージェントハーネスで、エージェント構築における配管作業を処理し、開発者はツールリストとプロンプトのみを記述すればよい。本記事では、IBM Cloudアドバイザーアプリの例を通して、CUGAの計画、リフレクション、ポリシーシステムがどのように堅牢で本番運用可能なエージェントを実現するかを解説する。
この記事では、Cross-Origin Storage(COS)APIの提案を紹介します。このAPIは、暗号化ハッシュを使用してファイルを識別することで、WebアプリがAIモデルやWasmランタイムなどの大規模ファイルをオリジン間で共有できるようにします。Transformers.jsを例に、現在のキャッシュ分離が引き起こす重複ダウンロードの問題と、COSがハッシュベースの識別、柔軟なアクセス制御、整合性検証によってどのように解決するかを説明します。
Hugging Faceチームは、AIとオープンソースツールを活用してhuggingface_hubのリリースサイクルを4~6週間から毎週に短縮し、人間による最終レビューを残しました。新しいパイプラインは1リリースあたり約0.25ドルのコストで、リリースノートの品質と統合問題の発見が向上しました。
PP-OCRv6 は PaddleOCR の最新の汎用 OCR モデルファミリーで、1.5M から 34.5M パラメータの 3 つのティアにわたり、50 言語をサポートします。PP-OCRv5_server と比較して、テキスト検出の Hmean が +4.6 ポイント、認識精度が +5.1 ポイント向上しました。新アーキテクチャには PPLCNetV4 バックボーン、RepLKFPN 検出モジュール、EncoderWithLightSVTR 認識モジュールが含まれます。Paddle Inference、Transformers、ONNX Runtime の複数の推論バックエンドをサポートします。
OpenClawのメンテナーがローカルのオープンウェイトモデル(Gemma、Qwen)をエージェントハーネスで使用し、イシューやプルリクエストをリアルタイムでトリアージするシステムを構築。クローズドモデルに匹敵する性能をローカルハードウェアで実現。
ディープリサーチエージェントがプライベート文書とWeb検索を組み合わせると、クエリログを通じて機密情報が意図せず漏洩する可能性があります。MosaicLeaksベンチマークはこのプライバシーリスクを定量化し、Privacy-Aware Deep Research (PA-DR) と呼ばれる訓練手法を提案します。これにより、タスクパフォーマンスを維持しながら情報漏洩を3倍以上削減します。
LoRAは最も人気のあるパラメータ効率的ファインチューニング(PEFT)技術だが、特定のタスクでは他の手法が優れることを研究が示している。本記事では、Hugging FaceのPEFTライブラリとそのベンチマークを紹介し、ニーズに応じた適切なPEFT技術の選択方法を解説し、LoRAが常に最良とは限らないと指摘する。
新しいベンチマークフレームワークは、AIエージェントがソフトウェアライブラリを使用する際のプロセス全体の労力を評価します。Hugging Face Transformersをケーススタディとして、トークン使用量、時間、エラー率を異なるモデルとツール階層で測定し、使いやすさとリソース消費のトレードオフを明らかにします。
MolmoMotionは、ビデオフレーム、オブジェクト上の3D点、および言語指示から、数秒後の3D点軌跡を予測する新しい3D動作予測モデルです。ロボット計画や制御可能なビデオ生成で既存手法を凌駕します。最大のデータセットMolmoMotion-1MとベンチマークPointMotionBenchも公開しています。
AWSのオープンソースSDK「Strands Robots」がLeRobotを統合し、開発者は単一のAgentワークフローでHubデータセットから学習し、シミュレーションまたは実ロボットにポリシーをデプロイできます。本記事では5つのステップを解説し、ラップトップで実行可能なサンプルを提供します。
Z.AI が最新フラッグシップモデル GLM-5.2 を発表。長期間タスクに特化し、安定した 1M トークンコンテキストを提供。コーディングベンチマークで優れた性能を発揮し、IndexShare アーキテクチャで計算コストを削減。努力レベル制御により柔軟性を実現。MIT ライセンスで公開。