AI News HubLIVE
公開記事 89収集記事 96信頼度 90更新頻度 5 分
稼働状態 自動停止ソース種別 公式全文利用権限 公式全文最終取り込み 2026-07-15ID huggingface-blog状態 無効

Official source; confirm license per article before full body display.

最新公開記事

Shippyの構築から学んだエージェント開発の教訓

Shippyは、高い信頼性が求められる海洋状況認識のためのAIエージェントです。本稿では、そのアーキテクチャ(ソウル、スキル、設定)や、決定論的CLIによるAPIアクセス、ユーザー分離のためのサンドボックスホスティング、実データに対するエージェント全体の評価システムなど、主要な設計上の意思決定について説明します。また、得られた教訓と今後の計画についても述べます。

  • Shippyのアーキテクチャは、ソウル(システムプロンプト)、スキル(Markdownファイル)、設定から構成され、バージョン管理と監査が容易。
  • 専用CLIが複雑なAPI呼び出しを抽象化し、エラーを削減して予測可能なツール使用を実現。
サイト内本文

モデルルーティングはシンプル?実はそうでもない

本記事では、AIエージェントにおけるモデルルーティングの複雑さを解説。単なる分類問題ではなくシステム最適化問題であると指摘し、コスト、複雑性、レイテンシの3つの次元でよくある誤解を解き、IBM Researchが構築した最適化ベースのルーターソリューションを紹介。

  • 実際のコストはキャッシュの影響を受け、モデル価格だけでは判断できない。
  • タスクの複雑性はルーティング時に正確に評価できず、ルーターは複数の目標を同時に考慮する必要がある。
サイト内本文

Inklingの登場:Thinking Machinesによるマルチモーダル大規模モデル

Thinking Machinesが、画像、テキスト、音声入力をネイティブで受け付ける約1兆パラメータのオープンモデル「Inkling」をリリース。100万トークンのコンテキストウィンドウを持ち、混合エキスパートアーキテクチャにより効率的な推論を実現。Hugging Faceで公開され、transformers、SGLang、llama.cppで即日利用可能。

  • Inklingは約1兆パラメータを持ち、画像、テキスト、音声入力をネイティブで処理する初の大規模オープンモデル。
  • 混合エキスパートアーキテクチャを採用し、総パラメータ9750億、アクティブパラメータは410億。
サイト内本文

Real World VoiceEQの紹介:音声AIの人間らしさを測定する

既存のベンチマークは音声AIが人間レベルのパフォーマンスに近づいていることを示唆しているが、実際の会話は異なるストーリーを語っている。Hume AIはReal World VoiceEQを発表。これは40以上の音声モデルを15以上の評価軸と60以上の指標で評価し、100万以上の人間の評価に基づくベンチマークである。主な発見:進歩は専門化している、音声モデルは話すことよりも聞くことが苦手、従来のベンチマークは実世界のパフォーマンスを過大評価、人間による評価が依然として不可欠である。

  • Real World VoiceEQは40以上の音声モデルを15以上の次元と60以上の指標で評価し、100万以上の人間の評価を使用。
  • 音声モデルは話す能力と聞く能力にギャップがあり、多くはテキストに依存し、トーンや感情などの副言語的手がかりを見逃す。
サイト内本文

エージェントのためのデータ

NVIDIAは、エージェントAIの構築におけるオープンデータと合成データの重要性を強調し、データの検査可能性、品質、信頼を重視しています。Nemotronデータセット、Prompt Atlas可視化ツール、地域的多様性のための合成ペルソナについて詳細に説明しています。

  • 合成データは、独自シグナルを保護しながらエージェントAIをスケールするために重要です。
  • NVIDIAのNemotronオープンデータセットは、10兆以上の事前学習トークンと数百万の事後学習サンプルを含みます。
サイト内本文

ネイティブ速度のvLLM transformersモデリングバックエンド

TransformersライブラリのvLLMバックエンドが、多くのLLMアーキテクチャにおいてカスタムvLLM実装と同等以上の推論速度を達成。モデル作者は追加コードなしで超高速推論を利用可能に。

  • Transformers vLLMバックエンドがQwen3 4B、32B、235B MoEモデルでネイティブvLLMのスループットに匹敵またはそれを上回る。
  • torch.fxとastを利用して実行時に推論特化の層融合を動的に適用し、カスタムコードと同等の速度を実現。
サイト内本文

Hugging FaceからAmazon SageMaker Studioへワンクリックで

Hugging FaceとAmazon SageMaker AIのディープリンク統合により、モデル発見からSageMaker Studioでの実験までをワンクリックで実現。権限の自動構成、GPUクォータの表示、モデルのカスタマイズとデプロイをサポートし、発想からエンタープライズ展開までの道のりを短縮します。

  • Hugging FaceのモデルページからSageMaker Studioへワンクリックで移動、モデルはプリロードされ環境は自動構成。
  • 新しいStudio環境には、ファインチューニング、トレーニング、ノートブック、エンドポイントデプロイのための完全な権限が自動で設定される。
サイト内本文

任意のクラウドでAIワークロードを実行し、Hugging Faceに保存:SkyPilotによるゼロエグレスストレージ

SkyPilotとHugging Faceの連携により、モデルとデータセットをHubに保存し、SkyPilotを使っていずれのクラウドでもデータ転送料金なしで計算を実行できます。

  • hf:// URLとHF_TOKENを使用してHugging FaceストレージをSkyPilotジョブにマウント
  • 20以上のクラウド、Kubernetes、オンプレミスクラスターに対応
サイト内本文

LeRobot v0.6.0: 想像、評価、改善

LeRobot v0.6.0 は、世界モデルポリシー(VLA-JEPA、FastWAM、LingBot-VA)、新しいVLA(GR00T N1.7、MolmoAct2など)、報酬モデルAPI(Robometer、TOPReward)、6つの新しいシミュレーションベンチマーク、DAgger補正付きデプロイメントCLI、深度センシング、自動言語アノテーション、最大2倍高速なデータローディング、クラウドトレーニング、より軽量なインストールを導入し、ロボット学習ループを閉じることを目指しています。

  • 3つの新しい世界モデルポリシーにより、ロボットが行動前に未来を想像できるようになりました。
  • GR00T N1.7、MolmoAct2、EO-1、Multitask DiT、EVO1などの新しいVLAが追加され、ファインチューニングとデプロイメントが可能です。
サイト内本文

PRX パート4:データ戦略

この記事では、7Bテキストから画像へのモデルPRXのデータパイプラインについて詳しく説明しています。多様な事前学習データセットを公開・内部データセットから構築し、VLMを使用して長く正確なキャプションを生成し、データセット構築にはLance、ストリーミングにはMDSを使用しています。チームは、品質92のJPEGエンコーディングの選択、オンザフライのテキスト潜在変数の計算、データ断片化に関する教訓について説明しています。

  • 事前学習データは公開・内部データセットの混合で構成され、一貫性のためにVLMで再キャプションされています。
  • 長く正確なキャプションが重要であり、不完全さを制御可能な属性に変えます。
サイト内本文

🤗 Kernels:主要アップデート

Hugging Face の Kernels プロジェクトは、カスタムカーネルのパッケージ化、配布、利用を標準化することを目的としています。この記事では、主要なアップデートをまとめています。新しい「カーネル」リポジトリタイプによる発見性の向上、信頼できるパブリッシャーとコード署名によるセキュリティ強化、CLI の再設計、Torch Stable ABI と Apache TVM FFI のサポート拡張、エージェントによるカーネル開発の基盤、環境セットアップや互換性チェックの改善などです。

  • Hub に新しい「カーネル」リポジトリタイプを導入。アクセラレータ、OS、バックエンドバージョンでフィルタリング可能。
  • セキュリティ向上:デフォルトでは信頼できるパブリッシャーのみロード。Sigstore の一時鍵によるコード署名でクレデンシャル漏洩対策。
サイト内本文

Hugging Face と Cerebras、Gemma 4 をリアルタイム音声AIに導入

Hugging Face と Cerebras は、Gemma 4 を活用したリアルタイム音声AIシステムを発表。オープンなモジュラーアーキテクチャによりレイテンシを大幅に削減し、自然な対話を実現する。Nvidia の音声認識、Cerebras の高速推論、Alibaba の音声合成を統合し、9,000台以上の Reachy Mini ロボットに導入されている。

  • Hugging Face と Cerebras が Gemma 4 ベースのリアルタイム音声AIデモを公開、超低レイテンシを達成。
  • システムはオープンなカスケード型アーキテクチャを採用:音声入力→ASR→モデル推論→TTS→音声出力。
サイト内本文

ScarfBench:エンタープライズJavaフレームワーク移行のためのAIエージェントベンチマーク

IBM Researchは、エンタープライズJavaにおけるクロスフレームワーク移行タスクのAIエージェントを評価するためのオープンベンチマークScarfBenchを発表しました。ベンチマークには34のアプリケーション、102のフレームワーク実装、204の移行タスクが含まれています。現在のトップエージェントの行動成功率は10%未満であり、移行中の振る舞い保持の難しさが浮き彫りになっています。

  • ScarfBenchはSpring、Jakarta EE、Quarkus間のフレームワーク移行におけるAIエージェントを評価し、ビルド、デプロイ、振る舞いの検証を要求します。
  • ベンチマークは34アプリケーション、約2,000のソースファイルとテストファイル、1,331の専門家作成テストで構成されています。
サイト内本文

専門化が不可避である理由

本稿は、最適化理論、進化生物学、競争市場、機械学習の四つの視点から、専門化が限られたリソース下でシステムの性能を向上させる必然的な道であることを論じる。著者は、汎用性は性能上の優位性ではなく、有限リソースではタスクを絞り込むことが効果的だと指摘する。また、専門化とドメイン知識の違いを明確にし、スケーリングがこの根本的な制約を変えないと述べる。

  • 最適化理論の「No Free Lunch」定理は、アルゴリズムには適用範囲があり、専門化が高性能の鍵であることを示す。
  • 生物学と市場経済では、リソース制限が専門化を生存・発展戦略とする。
サイト内本文

Hugging FaceモデルページでのEvery Eval Ever結果の表示

Every Eval Ever(EEE)とHugging Face Community Evalsが相互運用可能になり、評価結果のクロスポストと解釈が可能になり、オープンモデル、リーダーボード、統一された標準化メタデータストアへのリンクが提供されます。

  • EEEとHugging Face Community Evalsが相互運用可能になり、評価結果のクロスポストが可能に。
  • EEEは、実行主体、モデル、設定など評価の詳細を記録する統一JSONスキーマを提供。
サイト内本文

DiScoFormer: 密度とスコアを一つのトランスフォーマーで、分布を横断して

DiScoFormerは、データポイントの集合から分布の密度とスコア(対数密度の勾配)を一回の順伝播で推定する新しいトランスフォーマーモデルです。再学習不要で、クロスアテンション、共有バックボーン、一貫性損失を利用して分布に適応します。100次元では、最適なKDEと比較してスコア誤差を約6.5倍、密度誤差を37倍以上削減します。

  • 再学習なしで密度とスコアを同時に推定。
  • 一貫性損失による未知分布への適応。
サイト内本文

1つのコマンドでHF Jobs上にvLLMサーバーを実行

Hugging Faceのインフラ上で、サーバーのプロビジョニングやKubernetesを必要とせず、1つのコマンドでプライベートなOpenAI互換のLLMエンドポイントを起動できます。秒単位の課金です。起動、クエリ、クリーンアップ、大規模モデルへの拡張、チャットUIの作成、SSHデバッグ、コーディングエージェントのバックエンドとしての利用まで、完全なフローをカバーし、Inference Endpointsとの比較も行います。

  • hf jobs run コマンドとvLLM Dockerイメージ、--expose 8000 オプションを使用して、HF Jobs上でvLLMサーバーを実行します。
  • エンドポイントはHugging Faceトークンで認証され、ジョブの名前空間への読み取り権限が必要です。curlやOpenAI Pythonクライアントでクエリ可能です。
サイト内本文

ハイブリッドモデルはどのトークンをより正確に予測するか?

Ai2チームは、7BパラメータのTransformerモデルOlmo 3とハイブリッドモデルOlmo Hybridを比較。ハイブリッドモデルは内容語(名詞、動詞、形容詞)や文脈推論が必要なトークンで優れるが、繰り返しトークンや閉じ括弧では優位性が消失する。トークンレベルの損失フィルタリングにより、アーキテクチャ間の微妙な差異が明らかになった。

  • ハイブリッドモデルは意味のあるトークン(内容語)で予測が正確だが、繰り返しトークンでは優位性がない。
  • ハイブリッドモデルは一部のアテンション層を再帰層に置き換え、固定サイズのメモリで系列の状態追跡に適する。
サイト内本文

NVIDIA NeMo AutoModelによるTransformerファインチューニングの高速化

NVIDIA NeMo AutoModelはHuggingFace Transformers v5をベースに、エキスパート並列化、DeepEP融合オールツーオールディスパッチ、TransformerEngineカーネルを追加し、MoEモデルのファインチューニングでトレーニングスループットを3.4~3.7倍、GPUメモリを29~32%削減、API変更は不要。

  • NeMo AutoModelはAutoModelForCausalLMを継承し、インポート行を変更するだけで性能向上を実現。
  • 550Bモデルではエキスパート並列化により16ノードのH100クラスタでフルファインチューニングが可能に(Transformers v5はメモリ不足で実行不可)。
サイト内本文

CUGAを使用した本格的なエージェントアプリの構築:軽量ハーネス上の24の実働例

CUGAはIBMが開発したオープンソースのエージェントハーネスで、エージェント構築における配管作業を処理し、開発者はツールリストとプロンプトのみを記述すればよい。本記事では、IBM Cloudアドバイザーアプリの例を通して、CUGAの計画、リフレクション、ポリシーシステムがどのように堅牢で本番運用可能なエージェントを実現するかを解説する。

  • CUGAはオーケストレーション、状態管理、ツール呼び出しを抽象化し、開発者はツールとプロンプトに集中できる。
  • cuga-appsリポジトリには24の単一ファイルアプリが含まれており、それぞれが読み取り可能でコピー可能な実働例である。
サイト内本文

Transformers.jsにおける提案中のCross-Origin Storage APIの実験

この記事では、Cross-Origin Storage(COS)APIの提案を紹介します。このAPIは、暗号化ハッシュを使用してファイルを識別することで、WebアプリがAIモデルやWasmランタイムなどの大規模ファイルをオリジン間で共有できるようにします。Transformers.jsを例に、現在のキャッシュ分離が引き起こす重複ダウンロードの問題と、COSがハッシュベースの識別、柔軟なアクセス制御、整合性検証によってどのように解決するかを説明します。

  • 現在のブラウザキャッシュはオリジンごとに分離されており、異なるアプリ間で同じAIリソースが重複ダウンロードされる。
  • Cross-Origin Storage(COS)APIは、ファイルを暗号化ハッシュで識別し、オリジン間共有を可能にする。
サイト内本文

AI、オープンツール、人間の監視でhuggingface_hubを毎週リリース

Hugging Faceチームは、AIとオープンソースツールを活用してhuggingface_hubのリリースサイクルを4~6週間から毎週に短縮し、人間による最終レビューを残しました。新しいパイプラインは1リリースあたり約0.25ドルのコストで、リリースノートの品質と統合問題の発見が向上しました。

  • リリース間隔が4~6週から毎週に短縮
  • AIがリリースノートを草稿するが、決定論的検証で正確性を保証
サイト内本文

Hugging Face 上の PP-OCRv6: 1.5M から 34.5M パラメータの 50 言語対応 OCR

PP-OCRv6 は PaddleOCR の最新の汎用 OCR モデルファミリーで、1.5M から 34.5M パラメータの 3 つのティアにわたり、50 言語をサポートします。PP-OCRv5_server と比較して、テキスト検出の Hmean が +4.6 ポイント、認識精度が +5.1 ポイント向上しました。新アーキテクチャには PPLCNetV4 バックボーン、RepLKFPN 検出モジュール、EncoderWithLightSVTR 認識モジュールが含まれます。Paddle Inference、Transformers、ONNX Runtime の複数の推論バックエンドをサポートします。

  • 3 つのモデルティア: tiny (1.5M)、small (7.7M)、medium (34.5M) を提供し、様々な展開環境に対応。
  • 中国語、英語、日本語、46 のラテン文字言語を含む 50 言語をサポート。
サイト内本文

ローカルモデルでOpenClawリポジトリのトリアージを無料で実現!*

OpenClawのメンテナーがローカルのオープンウェイトモデル(Gemma、Qwen)をエージェントハーネスで使用し、イシューやプルリクエストをリアルタイムでトリアージするシステムを構築。クローズドモデルに匹敵する性能をローカルハードウェアで実現。

  • ローカルモデル(Gemma、Qwen)はGitHubのイシューやPRを効果的に分類し、トリアージに利用できる。
  • 読み取り専用シェル(reposhell)を備えたエージェントハーネスで安全にコードを調査。
サイト内本文

MosaicLeaks: あなたの研究エージェントは秘密を守れますか?

ディープリサーチエージェントがプライベート文書とWeb検索を組み合わせると、クエリログを通じて機密情報が意図せず漏洩する可能性があります。MosaicLeaksベンチマークはこのプライバシーリスクを定量化し、Privacy-Aware Deep Research (PA-DR) と呼ばれる訓練手法を提案します。これにより、タスクパフォーマンスを維持しながら情報漏洩を3倍以上削減します。

  • MosaicLeaksは、プライベートローカル文書とパブリックWebクエリを織り交ぜたマルチホップ研究チェーンのベンチマークを導入し、意図、回答、完全情報の3つの漏洩レベルを測定します。
  • タスクパフォーマンスのみを訓練すると成功率と漏洩率の両方が上昇しますが、PA-DRを使用すると回答/完全情報漏洩が34.0%から9.9%に減少し、厳密なチェーン成功率は58.7%を維持します。
サイト内本文

LoRAを超えて:最も人気のあるファインチューニング技術を打ち負かせるか?

LoRAは最も人気のあるパラメータ効率的ファインチューニング(PEFT)技術だが、特定のタスクでは他の手法が優れることを研究が示している。本記事では、Hugging FaceのPEFTライブラリとそのベンチマークを紹介し、ニーズに応じた適切なPEFT技術の選択方法を解説し、LoRAが常に最良とは限らないと指摘する。

  • LoRAはPEFT技術で支配的だが、最適とは限らない。
  • Hugging FaceのPEFTライブラリは統一APIとベンチマークを提供し、ユーザーの選択を支援する。
サイト内本文

それはエージェント的に十分か?独自のツールでオープンモデルをベンチマークする

新しいベンチマークフレームワークは、AIエージェントがソフトウェアライブラリを使用する際のプロセス全体の労力を評価します。Hugging Face Transformersをケーススタディとして、トークン使用量、時間、エラー率を異なるモデルとツール階層で測定し、使いやすさとリソース消費のトレードオフを明らかにします。

  • 標準ベンチマークは最終回答のみをチェックするが、このフレームワークはトークンコストやエラーを含むプロセス全体を測定する
  • 3つの階層(ベアインストール、クローン、スキル)をテストし、それぞれ異なるオーバーヘッドがある
サイト内本文

MolmoMotion:言語指導による3D動作予測

MolmoMotionは、ビデオフレーム、オブジェクト上の3D点、および言語指示から、数秒後の3D点軌跡を予測する新しい3D動作予測モデルです。ロボット計画や制御可能なビデオ生成で既存手法を凌駕します。最大のデータセットMolmoMotion-1MとベンチマークPointMotionBenchも公開しています。

  • MolmoMotionは言語指示で3D動作予測を誘導し、既存手法を大幅に上回る性能を達成。
  • 自己回帰型とフローマッチング型の2種類のバリアントを提供。
サイト内本文

Hugging Face Hubからロボットハードウェアへ:Strands AgentsとLeRobotの統合

AWSのオープンソースSDK「Strands Robots」がLeRobotを統合し、開発者は単一のAgentワークフローでHubデータセットから学習し、シミュレーションまたは実ロボットにポリシーをデプロイできます。本記事では5つのステップを解説し、ラップトップで実行可能なサンプルを提供します。

  • Strands Robots SDKはLeRobotをAgentToolsとして公開し、データセットからロボットハードウェアまでのエンドツーエンド制御を実現。
  • シミュレーションと実機は同一のDatasetRecorderとLeRobotDataset形式を共有し、互換性を確保。
サイト内本文

GLM-5.2:長期間タスク向けに構築

Z.AI が最新フラッグシップモデル GLM-5.2 を発表。長期間タスクに特化し、安定した 1M トークンコンテキストを提供。コーディングベンチマークで優れた性能を発揮し、IndexShare アーキテクチャで計算コストを削減。努力レベル制御により柔軟性を実現。MIT ライセンスで公開。

  • GLM-5.2 は 1M トークンの安定したコンテキストを提供し、長期間のエンジニアリングタスクをサポート。
  • FrontierSWE、PostTrainBench などの長期間コーディングベンチマークでオープンソースモデル中最上位。
サイト内本文

全ソース