構建Shippy:AI代理在海洋安全領域的經驗教訓 2026-07-16 01:29 UTC+8 Shippy是一個用於實時海洋領域感知的AI代理,其設計注重可靠性、模塊化和可審計性。文章詳細介紹了其架構:由“靈魂”(系統提示)、技能(結構化Markdown文件)和配置組成。通過專用CLI與Skylight API交互,並使用Mothership平台進行沙盒託管和用户隔離。評估系統針對真實場景和加權標準對整體代理進行評分。未來計劃包括代理驅動的UI控制、模型路由和跨線程記憶。
Shippy採用三層架構:靈魂(系統提示)、技能(Markdown文件)和配置,便於版本控制和審計。 通過專用CLI訪問Skylight API,減少模型直接調用API的錯誤,提高可靠性。 模型路由看似簡單,實則不然? 2026-07-16 01:27 UTC+8 本文探討了AI代理中模型路由的複雜性,指出路由不僅僅是分類問題,而是系統優化問題。文章通過三個維度(成本、複雜度、延遲)揭示了常見誤解,並介紹了IBM Research團隊構建的基於優化的路由解決方案。
路由的實際成本受緩存影響,模型標價並非真實成本。 任務複雜度難以在路由時準確評估,路由器需平衡多個目標。 歡迎Inkling:Thinking Machines的多模態大模型 2026-07-15 08:00 UTC+8 Thinking Machines發佈了Inkling,一個擁有約1萬億參數的開源多模態模型,支持圖像、文本和音頻輸入,可處理高達100萬token的上下文。該模型採用混合專家架構,僅激活410億參數,並配有相對注意力和短卷積等創新設計。Inkling已在Hugging Face上發佈,並得到transformers、SGLang和llama.cpp的即日支持。
Inkling是首個約1萬億參數的開源模型,原生支持圖像、文本和音頻輸入,上下文窗口達100萬token。 採用混合專家架構,總參數9750億,但僅激活410億,實現高效推理。 推出真實世界VoiceEQ:衡量語音AI的人類化質量 2026-07-15 08:00 UTC+8 現有的基準測試顯示語音AI接近人類水平,但實際對話卻大不相同。Hume AI發佈了Real World VoiceEQ基準,從超過40個語音模型在15+維度和60+指標上進行評估,基於超過100萬人類評分。關鍵發現包括:語音AI進展日益專業化、模型更擅長説話而非傾聽、傳統基準高估了實際性能、人類評估仍然不可或缺。
Real World VoiceEQ通過超過100萬人類評分評估40多個語音模型在15+維度和60+指標上的表現。 研究發現語音模型在表達和傾聽能力上存在差距,許多模型仍依賴文本轉錄而忽略語調、情感等副語言信息。 智能體的數據 2026-07-09 01:16 UTC+8 NVIDIA 通過開放數據和合成數據推動智能體 AI 發展,強調數據質量、可檢查性和信任。
NVIDIA 發佈了 Nemotron 系列開放數據集,包括預訓練和後訓練樣本。 合成數據有助於在保護公司機密的同時共享有用信號。 原生速度的vLLM transformers建模後端 2026-07-08 08:00 UTC+8 Hugging Face的Transformers庫的vLLM後端現在在多種LLM架構上達到了與原生vLLM實現相當甚至更快的推理速度。模型作者無需額外編碼即可自動利用其Transformers實現獲得超快推理。
Transformers vLLM後端在Qwen3 4B、32B和235B MoE模型上達到或超過了原生vLLM的吞吐量。 通過torch.fx和ast在運行時動態應用推理特定的層融合,匹配自定義代碼實現的速度。 從Hugging Face一鍵直達Amazon SageMaker Studio 2026-07-08 05:15 UTC+8 Hugging Face與Amazon SageMaker AI深度集成,開發者現在可以通過一鍵操作從模型發現直接進入SageMaker Studio進行實驗。該集成自動配置權限、顯示GPU配額,並支持模型微調和部署,大幅縮短從靈感到部署的路徑。
一鍵從Hugging Face模型頁面跳轉至SageMaker Studio,模型預加載、環境自動配置。 新Studio環境自動配置完整權限,包括微調、訓練、筆記本實驗和端點部署。 在任何雲上運行AI工作負載,數據存儲在Hugging Face:SkyPilot實現零出口存儲 2026-07-07 08:00 UTC+8 SkyPilot與Hugging Face合作,允許用户將模型和數據集存儲在Hugging Face Hub上,並通過SkyPilot在任何雲上運行計算任務,無需支付數據傳輸費用。
通過hf:// URL和HF_TOKEN直接掛載Hugging Face存儲到SkyPilot任務中 支持20多個雲平台、Kubernetes和本地集羣 LeRobot v0.6.0:想象、評估、改進 2026-07-07 08:00 UTC+8 LeRobot v0.6.0 引入了世界模型策略(VLA-JEPA、FastWAM、LingBot-VA),新一批VLA模型(GR00T N1.7、MolmoAct2等),獎勵模型API(Robometer、TOPReward),六個新仿真基準,以及部署CLI、深度感知、數據集註解加速等功能,旨在閉環機器人學習循環。
新增三種世界模型策略,使機器人能夠通過想象未來輔助決策。 集成GR00T N1.7、MolmoAct2等VLA模型,支持微調和部署。 PRX 第四部分:我們的數據策略 2026-07-06 23:30 UTC+8 本文詳細介紹了PRX(一個7B文本到圖像模型)背後的數據管道。關鍵點包括從公開和內部數據集構建多樣化的預訓練數據集,使用VLM生成長而準確的標題,並利用Lance構建數據集、MDS進行流式處理。團隊解釋了選擇質量92的JPEG編碼、實時計算文本潛在向量以及關於數據碎片化的經驗教訓。
預訓練數據由公開和內部數據集混合組成,並使用VLM重新生成標題以確保一致性。 長而準確的標題至關重要;它們將不完美轉化為可控屬性。 🤗 Kernels:重大更新 2026-07-06 08:00 UTC+8 Hugging Face 的 Kernels 項目旨在標準化自定義內核的打包、分發和使用方式。本文總結了近期重大更新:引入新的“內核”倉庫類型以提升可發現性;通過受信任的發佈者和代碼簽名增強安全性;重構 CLI 以明確職責劃分;擴展對 Torch Stable ABI 和 Apache TVM FFI 等框架的支持;為 AI 代理開發內核奠定基礎;以及改進環境配置和兼容性檢查工具。
引入新的“內核”倉庫類型,方便用户按加速器、操作系統和後端版本篩選內核。 安全性提升:默認僅加載受信任發佈者的內核,並增加代碼簽名功能,使用 Sigstore 的臨時密鑰。 Hugging Face 與 Cerebras 攜手將 Gemma 4 引入實時語音 AI 2026-07-01 08:00 UTC+8 Hugging Face 與 Cerebras 合作,利用 Gemma 4 模型打造實時語音 AI 系統,通過開放模塊化架構顯著降低延遲,實現更自然的對話體驗。該系統集成 Nvidia 的語音識別、Cerebras 的推理加速和 Alibaba 的語音合成,已在 9000 多台 Reachy Mini 機器人中應用。
Hugging Face 和 Cerebras 推出基於 Gemma 4 的實時語音 AI 演示,延遲極低。 系統採用開放的級聯架構:語音輸入→語音識別→模型推理→語音合成→語音輸出。 ScarfBench:面向企業Java框架遷移的AI智能體基準測試 2026-07-01 02:32 UTC+8 IBM Research推出ScarfBench,這是一個用於評估AI智能體在企業Java中跨框架遷移任務的開源基準。該基準包含34個應用程序、102個框架實現和204個遷移任務。目前頂尖智能體的行為成功率低於10%,突顯了在遷移過程中保持行為的難度。
ScarfBench評估AI智能體在Spring、Jakarta EE和Quarkus之間的框架遷移能力,要求構建、部署和行為驗證。 基準包含34個應用程序、約2000個源文件和測試文件,以及1331個專家編寫的測試。 專業化為何不可避免 2026-06-30 22:39 UTC+8 本文從優化理論、進化生物學、競爭市場和機器學習四個角度論證了專業化是資源有限條件下系統提升性能的必然路徑。作者指出,通用性並非性能優勢,在有限資源下,集中資源於有限任務集比分散到無限範圍更有效。文章還澄清了專業化和領域知識的區別,指出規模擴展不會改變這一根本約束。
優化理論中的“沒有免費午餐”定理表明,任何算法都有其適用邊界,專業化是高性能的關鍵。 生物學和市場經濟中,資源有限導致專業化成為生存和發展策略。 將Every Eval Ever結果集成到Hugging Face模型頁面 2026-06-30 08:00 UTC+8 Every Eval Ever (EEE) 與 Hugging Face Community Evals 實現互操作,允許用户交叉發佈和解讀評估結果,同時鏈接到開放模型、排行榜和統一的標準化元數據存儲。
EEE 和 Hugging Face Community Evals 現已兼容,支持評估結果的交叉發佈。 EEE 提供統一的 JSON 模式記錄評估細節,包括運行者、模型、設置等。 DiScoFormer:一個用於密度和分數的變換器,跨分佈通用 2026-06-30 02:02 UTC+8 DiScoFormer是一種新型變換器模型,能通過一次前向傳播從數據點估計分佈的密度和分數(對數密度的梯度),無需重新訓練。它結合了跨注意力機制和共享骨幹網絡,利用密度與分數的數學關係進行無標籤一致性學習。在100維空間中,其分數誤差比最佳KDE降低約6.5倍,密度誤差降低超過37倍,且能泛化到未見的高斯和非高斯分佈。
DiScoFormer通過堆疊變換器塊,一次前向傳播同時估計密度和分數。 模型利用密度與分數之間的數學關係,通過一致性損失實現無監督適應。 一行命令在 HF Jobs 上運行 vLLM 服務器 2026-06-26 08:00 UTC+8 本文介紹如何通過一行命令在 Hugging Face 基礎設施上快速啓動一個私有、兼容 OpenAI 的 LLM 端點,無需配置服務器或 Kubernetes,按秒計費。涵蓋從啓動、查詢、清理到擴展為大模型、創建聊天 UI、SSH 調試及作為編碼代理後端的完整流程,並與 Inference Endpoints 進行比較。
使用 hf jobs run 命令結合 vLLM Docker 鏡像,通過 --expose 8000 暴露端口,即可在 HF Jobs 上運行 vLLM 服務器。 端點通過 Hugging Face token 進行認證,僅限有讀取權限的用户訪問,支持使用 curl 或 OpenAI Python 客户端查詢。 混合模型在哪些token上預測得更好? 2026-06-26 00:11 UTC+8 Ai2團隊比較了7B參數規模的Transformer模型Olmo 3和混合模型Olmo Hybrid,發現混合模型在內容詞(名詞、動詞、形容詞)和需要上下文推理的token上表現更優,但在重複token和閉合括號上優勢消失。研究表明,基於token的損失過濾可以揭示架構間的細微差異。
混合模型在含義豐富的token(如實詞)上預測更準確,而在重複token上優勢消失。 混合模型使用遞歸層替代部分注意力層,具有固定大小的記憶,適合跟蹤序列變化。 使用NVIDIA NeMo AutoModel加速Transformer微調 2026-06-25 00:00 UTC+8 NVIDIA NeMo AutoModel基於HuggingFace Transformers v5,通過專家並行、DeepEP融合通信和TransformerEngine內核,將MoE模型微調的訓練吞吐量提升3.4-3.7倍,GPU內存減少29-32%,且無需更改API。
NeMo AutoModel繼承AutoModelForCausalLM,僅需更改導入行即可實現性能提升。 在550B規模模型上,專家並行使全微調在16節點H100集羣上可行,而Transformers v5因內存不足無法運行。 使用CUGA構建真實的智能體應用:輕量級框架上的二十多個工作示例 2026-06-23 20:51 UTC+8 CUGA是IBM開源的智能體框架,處理了智能體構建中的管道工作,讓開發者只需編寫工具列表和提示詞即可。本文通過一個IBM雲架構顧問示例,展示瞭如何用少量代碼構建一個完整的智能體應用,並介紹了CUGA的規劃、執行、反射步驟和策略系統。
CUGA是一個開源智能體框架,簡化了智能體應用的構建過程,開發者只需定義工具和提示。 本文展示了二十多個單文件應用,其中一個IBM雲顧問示例詳細説明了實現。 在Transformers.js中試驗提出的跨域存儲API 2026-06-23 08:00 UTC+8 本文介紹了跨域存儲(COS)API提案,該API允許Web應用跨域共享大型文件(如AI模型和Wasm運行時),通過加密哈希而非URL標識文件,從而避免重複下載和存儲。文章以Transformers.js為例,展示了當前瀏覽器緩存隔離導致的問題,以及COS如何通過哈希標識、可升級的訪問控制和安全完整性檢查來解決這些問題。
當前瀏覽器緩存按源隔離,導致跨域應用重複下載相同的AI模型和Wasm文件。 跨域存儲(COS)API使用加密哈希標識文件,實現跨域共享。 每週發佈huggingface_hub:藉助AI、開源工具和人工審核 2026-06-23 08:00 UTC+8 Hugging Face團隊通過結合AI和開源工具,將huggingface_hub的發佈週期從4-6周縮短至每週一次,同時保留人工審核環節以確保質量。該流程基於GitHub Actions、OpenCode和開放權重模型,每次發佈成本僅約0.25美元。
發佈週期從4-6周縮短為每週一次 AI生成發佈説明初稿,但通過確定性腳本驗證準確性 PP-OCRv6 在 Hugging Face 上:從 1.5M 到 34.5M 參數的 50 種語言 OCR 2026-06-22 21:18 UTC+8 PP-OCRv6 是 PaddleOCR 的最新通用 OCR 模型系列,支持從 1.5M 到 34.5M 參數的三個層級,覆蓋 50 種語言。相比 PP-OCRv5_server,檢測準確率提升 4.6 個百分點,識別準確率提升 5.1 個百分點。新架構包括 PPLCNetV4 骨幹網絡、RepLKFPN 檢測模塊和 EncoderWithLightSVTR 識別模塊。支持 Paddle Inference、Transformers 和 ONNX Runtime 後端。
發佈三個模型層級:tiny(1.5M)、small(7.7M)、medium(34.5M),適配不同部署場景。 支持 50 種語言,包括中、英、日及 46 種拉丁語系語言。 我們讓本地模型免費(*)為OpenClaw倉庫進行問題分類! 2026-06-22 08:00 UTC+8 OpenClaw維護者利用本地開源模型(Gemma、Qwen)在智能體框架中,實時對問題和拉取請求進行分類,性能媲美閉源模型,僅需硬件電費成本。
本地模型(如Gemma和Qwen)能有效對GitHub問題和PR進行分類,用於問題分派。 系統使用帶有隻讀shell(reposhell)的智能體框架,安全地檢查代碼。 MosaicLeaks:你的研究代理能保守秘密嗎? 2026-06-19 02:13 UTC+8 深度研究代理結合私有文檔與網頁搜索時,可能通過查詢日誌無意中泄露敏感信息。MosaicLeaks基準量化了這種隱私風險,並提出了一種名為隱私感知深度研究(PA-DR)的訓練方法,可以在保持任務性能的同時,將信息泄露減少3倍以上。
MosaicLeaks引入了一個多跳研究鏈基準,這些鏈交織了私有本地文檔和公共網頁查詢,測量了三種泄露程度:意圖、答案和完整信息。 僅針對任務性能進行訓練會同時提高成功率和泄露率;使用PA-DR訓練可將答案/完整信息泄露從34.0%降至9.9%,同時保持嚴格鏈條成功率為58.7%。 超越LoRA:你能擊敗最流行的微調技術嗎? 2026-06-18 08:00 UTC+8 LoRA是目前最流行的參數高效微調(PEFT)技術,但研究表明其他方法在某些任務上表現更好。本文介紹了Hugging Face的PEFT庫及其基準測試,探討了如何根據具體需求選擇合適的PEFT技術,並指出LoRA並非總是最佳選擇。
LoRA在PEFT技術中佔主導地位,但可能不是最優選擇。 Hugging Face的PEFT庫提供了統一API和基準測試,幫助用户選擇合適的PEFT技術。 它足夠智能體化了嗎?使用自有工具對開源模型進行基準測試 2026-06-18 08:00 UTC+8 一個全新的基準測試框架專注於評估AI智能體使用軟件庫的整個過程工作量,以Hugging Face的Transformers庫為案例。通過測量令牌使用量、時間、錯誤率等指標,揭示不同模型和工具層級下的性能權衡,為庫維護者和智能體用户提供關鍵見解。
標準基準測試僅檢查最終答案,而該框架測量整個過程的令牌成本、時間和錯誤 測試了三種工具層級:裸安裝、克隆源碼和打包Skill,各有不同的開銷 MolmoMotion:語言引導的3D運動預測 2026-06-17 23:26 UTC+8 MolmoMotion是一種新型3D運動預測模型,能夠根據視頻幀、物體上的3D點以及語言指令預測未來幾秒內物體點的3D軌跡。該模型在多個下游任務中表現出色,如機器人規劃和可控視頻生成。同時發佈了最大的3D點軌跡數據集MolmoMotion-1M和基準測試PointMotionBench。
MolmoMotion利用語言指令引導3D運動預測,顯著優於現有方法。 模型支持自迴歸和流匹配兩種變體,分別適用於確定性和不確定性場景。 從Hugging Face Hub到機器人硬件:Strands Agents與LeRobot的集成 2026-06-17 18:18 UTC+8 AWS開源SDK Strands Robots集成了LeRobot,允許開發者通過單一Agent工作流從Hub數據集訓練並在模擬或實體機器人上部署策略。本文介紹了五步流程,並提供了可在筆記本上運行的示例。
Strands Robots SDK將LeRobot暴露為可組合的AgentTools,實現從數據集到機器人硬件的端到端控制。 模擬和硬件場景共享相同的DatasetRecorder和LeRobotDataset格式,確保數據集兼容。 GLM-5.2:專為長週期任務構建 2026-06-17 17:01 UTC+8 GLM-5.2 是 Z.AI 推出的最新旗艦模型,專為長週期任務設計,擁有穩定的 1M 上下文窗口,在編碼基準測試中表現優異,並引入 IndexShare 架構以降低計算成本,同時提供靈活的努力水平控制。該模型採用 MIT 開源許可證,無區域限制。
GLM-5.2 提供穩定的 1M token 上下文,支持長週期工程任務。 在 FrontierSWE、PostTrainBench 等長週期編碼基準上表現領先,接近封閉源模型。