構建Shippy:AI代理在海洋安全領域的經驗教訓 2026-07-16 01:29 UTC+8 Shippy是一個用於即時海洋領域感知的AI代理,其設計注重可靠性、模組化和可審計性。文章詳細介紹了其架構:由“靈魂”(系統提示)、技能(結構化Markdown檔案)和配置組成。透過專用CLI與Skylight API互動,並使用Mothership平臺進行沙盒託管和使用者隔離。評估系統針對真實場景和加權標準對整體代理進行評分。未來計劃包括代理驅動的UI控制、模型路由和跨執行緒記憶。
Shippy採用三層架構:靈魂(系統提示)、技能(Markdown檔案)和配置,便於版本控制和審計。 透過專用CLI訪問Skylight API,減少模型直接呼叫API的錯誤,提高可靠性。 模型路由看似簡單,實則不然? 2026-07-16 01:27 UTC+8 本文探討了AI代理中模型路由的複雜性,指出路由不僅僅是分類問題,而是系統最佳化問題。文章透過三個維度(成本、複雜度、延遲)揭示了常見誤解,並介紹了IBM Research團隊構建的基於最佳化的路由解決方案。
路由的實際成本受快取影響,模型標價並非真實成本。 任務複雜度難以在路由時準確評估,路由器需平衡多個目標。 歡迎Inkling:Thinking Machines的多模態大模型 2026-07-15 08:00 UTC+8 Thinking Machines釋出了Inkling,一個擁有約1萬億引數的開源多模態模型,支援影像、文本和音訊輸入,可處理高達100萬token的上下文。該模型採用混合專家架構,僅啟用410億引數,並配有相對注意力和短卷積等創新設計。Inkling已在Hugging Face上釋出,並得到transformers、SGLang和llama.cpp的即日支援。
Inkling是首個約1萬億引數的開源模型,原生支援影像、文本和音訊輸入,上下文視窗達100萬token。 採用混合專家架構,總引數9750億,但僅啟用410億,實現高效推理。 推出真實世界VoiceEQ:衡量語音AI的人類化質量 2026-07-15 08:00 UTC+8 現有的基準測試顯示語音AI接近人類水平,但實際對話卻大不相同。Hume AI釋出了Real World VoiceEQ基準,從超過40個語音模型在15+維度和60+指標上進行評估,基於超過100萬人類評分。關鍵發現包括:語音AI進展日益專業化、模型更擅長說話而非傾聽、傳統基準高估了實際效能、人類評估仍然不可或缺。
Real World VoiceEQ透過超過100萬人類評分評估40多個語音模型在15+維度和60+指標上的表現。 研究發現語音模型在表達和傾聽能力上存在差距,許多模型仍依賴文本轉錄而忽略語調、情感等副語言資訊。 智慧體的資料 2026-07-09 01:16 UTC+8 NVIDIA 透過開放資料和合成資料推動智慧體 AI 發展,強調資料質量、可檢查性和信任。
NVIDIA 釋出了 Nemotron 系列開放資料集,包括預訓練和後訓練樣本。 合成資料有助於在保護公司機密的同時共享有用訊號。 原生速度的vLLM transformers建模後端 2026-07-08 08:00 UTC+8 Hugging Face的Transformers庫的vLLM後端現在在多種LLM架構上達到了與原生vLLM實現相當甚至更快的推理速度。模型作者無需額外編碼即可自動利用其Transformers實現獲得超快推理。
Transformers vLLM後端在Qwen3 4B、32B和235B MoE模型上達到或超過了原生vLLM的吞吐量。 透過torch.fx和ast在執行時動態應用推理特定的層融合,匹配自定義程式碼實現的速度。 從Hugging Face一鍵直達Amazon SageMaker Studio 2026-07-08 05:15 UTC+8 Hugging Face與Amazon SageMaker AI深度整合,開發者現在可以透過一鍵操作從模型發現直接進入SageMaker Studio進行實驗。該整合自動配置許可權、顯示GPU配額,並支援模型微調和部署,大幅縮短從靈感到部署的路徑。
一鍵從Hugging Face模型頁面跳轉至SageMaker Studio,模型預載入、環境自動配置。 新Studio環境自動配置完整許可權,包括微調、訓練、筆記本實驗和端點部署。 在任何雲上執行AI工作負載,資料儲存在Hugging Face:SkyPilot實現零出口儲存 2026-07-07 08:00 UTC+8 SkyPilot與Hugging Face合作,允許使用者將模型和資料集儲存在Hugging Face Hub上,並透過SkyPilot在任何雲上執行計算任務,無需支付資料傳輸費用。
透過hf:// URL和HF_TOKEN直接掛載Hugging Face儲存到SkyPilot任務中 支援20多個雲平臺、Kubernetes和本地叢集 LeRobot v0.6.0:想象、評估、改進 2026-07-07 08:00 UTC+8 LeRobot v0.6.0 引入了世界模型策略(VLA-JEPA、FastWAM、LingBot-VA),新一批VLA模型(GR00T N1.7、MolmoAct2等),獎勵模型API(Robometer、TOPReward),六個新模擬基準,以及部署CLI、深度感知、資料集註解加速等功能,旨在閉環機器人學習迴圈。
新增三種世界模型策略,使機器人能夠透過想象未來輔助決策。 整合GR00T N1.7、MolmoAct2等VLA模型,支援微調和部署。 PRX 第四部分:我們的資料策略 2026-07-06 23:30 UTC+8 本文詳細介紹了PRX(一個7B文本到影像模型)背後的資料管道。關鍵點包括從公開和內部資料集構建多樣化的預訓練資料集,使用VLM生成長而準確的標題,並利用Lance構建資料集、MDS進行流式處理。團隊解釋了選擇質量92的JPEG編碼、即時計算文本潛在向量以及關於資料碎片化的經驗教訓。
預訓練資料由公開和內部資料集混合組成,並使用VLM重新生成標題以確保一致性。 長而準確的標題至關重要;它們將不完美轉化為可控屬性。 🤗 Kernels:重大更新 2026-07-06 08:00 UTC+8 Hugging Face 的 Kernels 專案旨在標準化自定義核心的打包、分發和使用方式。本文總結了近期重大更新:引入新的“核心”倉庫型別以提升可發現性;透過受信任的釋出者和程式碼簽名增強安全性;重構 CLI 以明確職責劃分;擴充套件對 Torch Stable ABI 和 Apache TVM FFI 等框架的支援;為 AI 代理開發核心奠定基礎;以及改進環境配置和相容性檢查工具。
引入新的“核心”倉庫型別,方便使用者按加速器、作業系統和後端版本篩選核心。 安全性提升:預設僅載入受信任釋出者的核心,並增加程式碼簽名功能,使用 Sigstore 的臨時金鑰。 Hugging Face 與 Cerebras 攜手將 Gemma 4 引入即時語音 AI 2026-07-01 08:00 UTC+8 Hugging Face 與 Cerebras 合作,利用 Gemma 4 模型打造即時語音 AI 系統,透過開放模組化架構顯著降低延遲,實現更自然的對話體驗。該系統整合 Nvidia 的語音識別、Cerebras 的推理加速和 Alibaba 的語音合成,已在 9000 多臺 Reachy Mini 機器人中應用。
Hugging Face 和 Cerebras 推出基於 Gemma 4 的即時語音 AI 演示,延遲極低。 系統採用開放的級聯架構:語音輸入→語音識別→模型推理→語音合成→語音輸出。 ScarfBench:面向企業Java框架遷移的AI智慧體基準測試 2026-07-01 02:32 UTC+8 IBM Research推出ScarfBench,這是一個用於評估AI智慧體在企業Java中跨框架遷移任務的開源基準。該基準包含34個應用程式、102個框架實現和204個遷移任務。目前頂尖智慧體的行為成功率低於10%,突顯了在遷移過程中保持行為的難度。
ScarfBench評估AI智慧體在Spring、Jakarta EE和Quarkus之間的框架遷移能力,要求構建、部署和行為驗證。 基準包含34個應用程式、約2000個原始檔和測試檔案,以及1331個專家編寫的測試。 專業化為何不可避免 2026-06-30 22:39 UTC+8 本文從最佳化理論、進化生物學、競爭市場和機器學習四個角度論證了專業化是資源有限條件下系統提升效能的必然路徑。作者指出,通用性並非效能優勢,在有限資源下,集中資源於有限任務集比分散到無限範圍更有效。文章還澄清了專業化和領域知識的區別,指出規模擴充套件不會改變這一根本約束。
最佳化理論中的“沒有免費午餐”定理表明,任何演算法都有其適用邊界,專業化是高效能的關鍵。 生物學和市場經濟中,資源有限導致專業化成為生存和發展策略。 將Every Eval Ever結果整合到Hugging Face模型頁面 2026-06-30 08:00 UTC+8 Every Eval Ever (EEE) 與 Hugging Face Community Evals 實現互操作,允許使用者交叉釋出和解讀評估結果,同時連結到開放模型、排行榜和統一的標準化後設資料儲存。
EEE 和 Hugging Face Community Evals 現已相容,支援評估結果的交叉釋出。 EEE 提供統一的 JSON 模式記錄評估細節,包括執行者、模型、設定等。 DiScoFormer:一個用於密度和分數的變換器,跨分佈通用 2026-06-30 02:02 UTC+8 DiScoFormer是一種新型變換器模型,能透過一次前向傳播從資料點估計分佈的密度和分數(對數密度的梯度),無需重新訓練。它結合了跨注意力機制和共享骨幹網路,利用密度與分數的數學關係進行無標籤一致性學習。在100維空間中,其分數誤差比最佳KDE降低約6.5倍,密度誤差降低超過37倍,且能泛化到未見的高斯和非高斯分佈。
DiScoFormer透過堆疊變換器塊,一次前向傳播同時估計密度和分數。 模型利用密度與分數之間的數學關係,透過一致性損失實現無監督適應。 一行命令在 HF Jobs 上執行 vLLM 伺服器 2026-06-26 08:00 UTC+8 本文介紹如何透過一行命令在 Hugging Face 基礎設施上快速啟動一個私有、相容 OpenAI 的 LLM 端點,無需配置伺服器或 Kubernetes,按秒計費。涵蓋從啟動、查詢、清理到擴充套件為大模型、建立聊天 UI、SSH 除錯及作為編碼代理後端的完整流程,並與 Inference Endpoints 進行比較。
使用 hf jobs run 命令結合 vLLM Docker 映象,透過 --expose 8000 暴露埠,即可在 HF Jobs 上執行 vLLM 伺服器。 端點透過 Hugging Face token 進行認證,僅限有讀取許可權的使用者訪問,支援使用 curl 或 OpenAI Python 客戶端查詢。 混合模型在哪些token上預測得更好? 2026-06-26 00:11 UTC+8 Ai2團隊比較了7B引數規模的Transformer模型Olmo 3和混合模型Olmo Hybrid,發現混合模型在內容詞(名詞、動詞、形容詞)和需要上下文推理的token上表現更優,但在重複token和閉合括號上優勢消失。研究表明,基於token的損失過濾可以揭示架構間的細微差異。
混合模型在含義豐富的token(如實詞)上預測更準確,而在重複token上優勢消失。 混合模型使用遞迴層替代部分注意力層,具有固定大小的記憶,適合跟蹤序列變化。 使用NVIDIA NeMo AutoModel加速Transformer微調 2026-06-25 00:00 UTC+8 NVIDIA NeMo AutoModel基於HuggingFace Transformers v5,透過專家並行、DeepEP融合通訊和TransformerEngine核心,將MoE模型微調的訓練吞吐量提升3.4-3.7倍,GPU記憶體減少29-32%,且無需更改API。
NeMo AutoModel繼承AutoModelForCausalLM,僅需更改匯入行即可實現效能提升。 在550B規模模型上,專家並行使全微調在16節點H100叢集上可行,而Transformers v5因記憶體不足無法執行。 使用CUGA構建真實的智慧體應用:輕量級框架上的二十多個工作示例 2026-06-23 20:51 UTC+8 CUGA是IBM開源的智慧體框架,處理了智慧體構建中的管道工作,讓開發者只需編寫工具列表和提示詞即可。本文透過一個IBM雲架構顧問示例,展示瞭如何用少量程式碼構建一個完整的智慧體應用,並介紹了CUGA的規劃、執行、反射步驟和策略系統。
CUGA是一個開源智慧體框架,簡化了智慧體應用的構建過程,開發者只需定義工具和提示。 本文展示了二十多個單檔案應用,其中一個IBM雲顧問示例詳細說明了實現。 在Transformers.js中試驗提出的跨域儲存API 2026-06-23 08:00 UTC+8 本文介紹了跨域儲存(COS)API提案,該API允許Web應用跨域共享大型檔案(如AI模型和Wasm執行時),透過加密雜湊而非URL標識檔案,從而避免重複下載和儲存。文章以Transformers.js為例,展示了當前瀏覽器快取隔離導致的問題,以及COS如何透過雜湊標識、可升級的訪問控制和安全完整性檢查來解決這些問題。
當前瀏覽器快取按源隔離,導致跨域應用重複下載相同的AI模型和Wasm檔案。 跨域儲存(COS)API使用加密雜湊標識檔案,實現跨域共享。 每週釋出huggingface_hub:藉助AI、開源工具和人工稽核 2026-06-23 08:00 UTC+8 Hugging Face團隊透過結合AI和開源工具,將huggingface_hub的釋出週期從4-6周縮短至每週一次,同時保留人工稽核環節以確保質量。該流程基於GitHub Actions、OpenCode和開放權重模型,每次釋出成本僅約0.25美元。
釋出週期從4-6周縮短為每週一次 AI生成釋出說明初稿,但透過確定性指令碼驗證準確性 PP-OCRv6 在 Hugging Face 上:從 1.5M 到 34.5M 引數的 50 種語言 OCR 2026-06-22 21:18 UTC+8 PP-OCRv6 是 PaddleOCR 的最新通用 OCR 模型系列,支援從 1.5M 到 34.5M 引數的三個層級,覆蓋 50 種語言。相比 PP-OCRv5_server,檢測準確率提升 4.6 個百分點,識別準確率提升 5.1 個百分點。新架構包括 PPLCNetV4 骨幹網路、RepLKFPN 檢測模組和 EncoderWithLightSVTR 識別模組。支援 Paddle Inference、Transformers 和 ONNX Runtime 後端。
釋出三個模型層級:tiny(1.5M)、small(7.7M)、medium(34.5M),適配不同部署場景。 支援 50 種語言,包括中、英、日及 46 種拉丁語系語言。 我們讓本地模型免費(*)為OpenClaw倉庫進行問題分類! 2026-06-22 08:00 UTC+8 OpenClaw維護者利用本地開源模型(Gemma、Qwen)在智慧體框架中,即時對問題和拉取請求進行分類,效能媲美閉源模型,僅需硬體電費成本。
本地模型(如Gemma和Qwen)能有效對GitHub問題和PR進行分類,用於問題分派。 系統使用帶有隻讀shell(reposhell)的智慧體框架,安全地檢查程式碼。 MosaicLeaks:你的研究代理能保守秘密嗎? 2026-06-19 02:13 UTC+8 深度研究代理結合私有文件與網頁搜尋時,可能透過查詢日誌無意中洩露敏感資訊。MosaicLeaks基準量化了這種隱私風險,並提出了一種名為隱私感知深度研究(PA-DR)的訓練方法,可以在保持任務效能的同時,將資訊洩露減少3倍以上。
MosaicLeaks引入了一個多跳研究鏈基準,這些鏈交織了私有本地文件和公共網頁查詢,測量了三種洩露程度:意圖、答案和完整資訊。 僅針對任務效能進行訓練會同時提高成功率和洩露率;使用PA-DR訓練可將答案/完整資訊洩露從34.0%降至9.9%,同時保持嚴格鏈條成功率為58.7%。 超越LoRA:你能擊敗最流行的微調技術嗎? 2026-06-18 08:00 UTC+8 LoRA是目前最流行的引數高效微調(PEFT)技術,但研究表明其他方法在某些任務上表現更好。本文介紹了Hugging Face的PEFT庫及其基準測試,探討了如何根據具體需求選擇合適的PEFT技術,並指出LoRA並非總是最佳選擇。
LoRA在PEFT技術中佔主導地位,但可能不是最優選擇。 Hugging Face的PEFT庫提供了統一API和基準測試,幫助使用者選擇合適的PEFT技術。 它足夠智慧體化了嗎?使用自有工具對開源模型進行基準測試 2026-06-18 08:00 UTC+8 一個全新的基準測試框架專注於評估AI智慧體使用軟體庫的整個過程工作量,以Hugging Face的Transformers庫為案例。透過測量令牌使用量、時間、錯誤率等指標,揭示不同模型和工具層級下的效能權衡,為庫維護者和智慧體使用者提供關鍵見解。
標準基準測試僅檢查最終答案,而該框架測量整個過程的令牌成本、時間和錯誤 測試了三種工具層級:裸安裝、克隆原始碼和打包Skill,各有不同的開銷 MolmoMotion:語言引導的3D運動預測 2026-06-17 23:26 UTC+8 MolmoMotion是一種新型3D運動預測模型,能夠根據影片幀、物體上的3D點以及語言指令預測未來幾秒內物體點的3D軌跡。該模型在多個下游任務中表現出色,如機器人規劃和可控影片生成。同時釋出了最大的3D點軌跡資料集MolmoMotion-1M和基準測試PointMotionBench。
MolmoMotion利用語言指令引導3D運動預測,顯著優於現有方法。 模型支援自迴歸和流匹配兩種變體,分別適用於確定性和不確定性場景。 從Hugging Face Hub到機器人硬體:Strands Agents與LeRobot的整合 2026-06-17 18:18 UTC+8 AWS開源SDK Strands Robots整合了LeRobot,允許開發者透過單一Agent工作流從Hub資料集訓練並在模擬或實體機器人上部署策略。本文介紹了五步流程,並提供了可在筆記本上執行的示例。
Strands Robots SDK將LeRobot暴露為可組合的AgentTools,實現從資料集到機器人硬體的端到端控制。 模擬和硬體場景共享相同的DatasetRecorder和LeRobotDataset格式,確保資料集相容。 GLM-5.2:專為長週期任務構建 2026-06-17 17:01 UTC+8 GLM-5.2 是 Z.AI 推出的最新旗艦模型,專為長週期任務設計,擁有穩定的 1M 上下文視窗,在編碼基準測試中表現優異,並引入 IndexShare 架構以降低計算成本,同時提供靈活的努力水平控制。該模型採用 MIT 開源許可證,無區域限制。
GLM-5.2 提供穩定的 1M token 上下文,支援長週期工程任務。 在 FrontierSWE、PostTrainBench 等長週期編碼基準上表現領先,接近封閉源模型。