構建Shippy:AI代理在海洋安全領域的經驗教訓
Shippy是一個用於即時海洋領域感知的AI代理,其設計注重可靠性、模組化和可審計性。文章詳細介紹了其架構:由“靈魂”(系統提示)、技能(結構化Markdown檔案)和配置組成。透過專用CLI與Skylight API互動,並使用Mothership平臺進行沙盒託管和使用者隔離。評估系統針對真實場景和加權標準對整體代理進行評分。未來計劃包括代理驅動的UI控制、模型路由和跨執行緒記憶。
Official source; confirm license per article before full body display.
Shippy是一個用於即時海洋領域感知的AI代理,其設計注重可靠性、模組化和可審計性。文章詳細介紹了其架構:由“靈魂”(系統提示)、技能(結構化Markdown檔案)和配置組成。透過專用CLI與Skylight API互動,並使用Mothership平臺進行沙盒託管和使用者隔離。評估系統針對真實場景和加權標準對整體代理進行評分。未來計劃包括代理驅動的UI控制、模型路由和跨執行緒記憶。
本文探討了AI代理中模型路由的複雜性,指出路由不僅僅是分類問題,而是系統最佳化問題。文章透過三個維度(成本、複雜度、延遲)揭示了常見誤解,並介紹了IBM Research團隊構建的基於最佳化的路由解決方案。
Thinking Machines釋出了Inkling,一個擁有約1萬億引數的開源多模態模型,支援影像、文本和音訊輸入,可處理高達100萬token的上下文。該模型採用混合專家架構,僅啟用410億引數,並配有相對注意力和短卷積等創新設計。Inkling已在Hugging Face上釋出,並得到transformers、SGLang和llama.cpp的即日支援。
現有的基準測試顯示語音AI接近人類水平,但實際對話卻大不相同。Hume AI釋出了Real World VoiceEQ基準,從超過40個語音模型在15+維度和60+指標上進行評估,基於超過100萬人類評分。關鍵發現包括:語音AI進展日益專業化、模型更擅長說話而非傾聽、傳統基準高估了實際效能、人類評估仍然不可或缺。
NVIDIA 透過開放資料和合成資料推動智慧體 AI 發展,強調資料質量、可檢查性和信任。
Hugging Face的Transformers庫的vLLM後端現在在多種LLM架構上達到了與原生vLLM實現相當甚至更快的推理速度。模型作者無需額外編碼即可自動利用其Transformers實現獲得超快推理。
Hugging Face與Amazon SageMaker AI深度整合,開發者現在可以透過一鍵操作從模型發現直接進入SageMaker Studio進行實驗。該整合自動配置許可權、顯示GPU配額,並支援模型微調和部署,大幅縮短從靈感到部署的路徑。
SkyPilot與Hugging Face合作,允許使用者將模型和資料集儲存在Hugging Face Hub上,並透過SkyPilot在任何雲上執行計算任務,無需支付資料傳輸費用。
LeRobot v0.6.0 引入了世界模型策略(VLA-JEPA、FastWAM、LingBot-VA),新一批VLA模型(GR00T N1.7、MolmoAct2等),獎勵模型API(Robometer、TOPReward),六個新模擬基準,以及部署CLI、深度感知、資料集註解加速等功能,旨在閉環機器人學習迴圈。
本文詳細介紹了PRX(一個7B文本到影像模型)背後的資料管道。關鍵點包括從公開和內部資料集構建多樣化的預訓練資料集,使用VLM生成長而準確的標題,並利用Lance構建資料集、MDS進行流式處理。團隊解釋了選擇質量92的JPEG編碼、即時計算文本潛在向量以及關於資料碎片化的經驗教訓。
Hugging Face 的 Kernels 專案旨在標準化自定義核心的打包、分發和使用方式。本文總結了近期重大更新:引入新的“核心”倉庫型別以提升可發現性;透過受信任的釋出者和程式碼簽名增強安全性;重構 CLI 以明確職責劃分;擴充套件對 Torch Stable ABI 和 Apache TVM FFI 等框架的支援;為 AI 代理開發核心奠定基礎;以及改進環境配置和相容性檢查工具。
Hugging Face 與 Cerebras 合作,利用 Gemma 4 模型打造即時語音 AI 系統,透過開放模組化架構顯著降低延遲,實現更自然的對話體驗。該系統整合 Nvidia 的語音識別、Cerebras 的推理加速和 Alibaba 的語音合成,已在 9000 多臺 Reachy Mini 機器人中應用。
IBM Research推出ScarfBench,這是一個用於評估AI智慧體在企業Java中跨框架遷移任務的開源基準。該基準包含34個應用程式、102個框架實現和204個遷移任務。目前頂尖智慧體的行為成功率低於10%,突顯了在遷移過程中保持行為的難度。
本文從最佳化理論、進化生物學、競爭市場和機器學習四個角度論證了專業化是資源有限條件下系統提升效能的必然路徑。作者指出,通用性並非效能優勢,在有限資源下,集中資源於有限任務集比分散到無限範圍更有效。文章還澄清了專業化和領域知識的區別,指出規模擴充套件不會改變這一根本約束。
Every Eval Ever (EEE) 與 Hugging Face Community Evals 實現互操作,允許使用者交叉釋出和解讀評估結果,同時連結到開放模型、排行榜和統一的標準化後設資料儲存。
DiScoFormer是一種新型變換器模型,能透過一次前向傳播從資料點估計分佈的密度和分數(對數密度的梯度),無需重新訓練。它結合了跨注意力機制和共享骨幹網路,利用密度與分數的數學關係進行無標籤一致性學習。在100維空間中,其分數誤差比最佳KDE降低約6.5倍,密度誤差降低超過37倍,且能泛化到未見的高斯和非高斯分佈。
本文介紹如何透過一行命令在 Hugging Face 基礎設施上快速啟動一個私有、相容 OpenAI 的 LLM 端點,無需配置伺服器或 Kubernetes,按秒計費。涵蓋從啟動、查詢、清理到擴充套件為大模型、建立聊天 UI、SSH 除錯及作為編碼代理後端的完整流程,並與 Inference Endpoints 進行比較。
Ai2團隊比較了7B引數規模的Transformer模型Olmo 3和混合模型Olmo Hybrid,發現混合模型在內容詞(名詞、動詞、形容詞)和需要上下文推理的token上表現更優,但在重複token和閉合括號上優勢消失。研究表明,基於token的損失過濾可以揭示架構間的細微差異。
NVIDIA NeMo AutoModel基於HuggingFace Transformers v5,透過專家並行、DeepEP融合通訊和TransformerEngine核心,將MoE模型微調的訓練吞吐量提升3.4-3.7倍,GPU記憶體減少29-32%,且無需更改API。
CUGA是IBM開源的智慧體框架,處理了智慧體構建中的管道工作,讓開發者只需編寫工具列表和提示詞即可。本文透過一個IBM雲架構顧問示例,展示瞭如何用少量程式碼構建一個完整的智慧體應用,並介紹了CUGA的規劃、執行、反射步驟和策略系統。
本文介紹了跨域儲存(COS)API提案,該API允許Web應用跨域共享大型檔案(如AI模型和Wasm執行時),透過加密雜湊而非URL標識檔案,從而避免重複下載和儲存。文章以Transformers.js為例,展示了當前瀏覽器快取隔離導致的問題,以及COS如何透過雜湊標識、可升級的訪問控制和安全完整性檢查來解決這些問題。
Hugging Face團隊透過結合AI和開源工具,將huggingface_hub的釋出週期從4-6周縮短至每週一次,同時保留人工稽核環節以確保質量。該流程基於GitHub Actions、OpenCode和開放權重模型,每次釋出成本僅約0.25美元。
PP-OCRv6 是 PaddleOCR 的最新通用 OCR 模型系列,支援從 1.5M 到 34.5M 引數的三個層級,覆蓋 50 種語言。相比 PP-OCRv5_server,檢測準確率提升 4.6 個百分點,識別準確率提升 5.1 個百分點。新架構包括 PPLCNetV4 骨幹網路、RepLKFPN 檢測模組和 EncoderWithLightSVTR 識別模組。支援 Paddle Inference、Transformers 和 ONNX Runtime 後端。
OpenClaw維護者利用本地開源模型(Gemma、Qwen)在智慧體框架中,即時對問題和拉取請求進行分類,效能媲美閉源模型,僅需硬體電費成本。
深度研究代理結合私有文件與網頁搜尋時,可能透過查詢日誌無意中洩露敏感資訊。MosaicLeaks基準量化了這種隱私風險,並提出了一種名為隱私感知深度研究(PA-DR)的訓練方法,可以在保持任務效能的同時,將資訊洩露減少3倍以上。
LoRA是目前最流行的引數高效微調(PEFT)技術,但研究表明其他方法在某些任務上表現更好。本文介紹了Hugging Face的PEFT庫及其基準測試,探討了如何根據具體需求選擇合適的PEFT技術,並指出LoRA並非總是最佳選擇。
一個全新的基準測試框架專注於評估AI智慧體使用軟體庫的整個過程工作量,以Hugging Face的Transformers庫為案例。透過測量令牌使用量、時間、錯誤率等指標,揭示不同模型和工具層級下的效能權衡,為庫維護者和智慧體使用者提供關鍵見解。
MolmoMotion是一種新型3D運動預測模型,能夠根據影片幀、物體上的3D點以及語言指令預測未來幾秒內物體點的3D軌跡。該模型在多個下游任務中表現出色,如機器人規劃和可控影片生成。同時釋出了最大的3D點軌跡資料集MolmoMotion-1M和基準測試PointMotionBench。
AWS開源SDK Strands Robots整合了LeRobot,允許開發者透過單一Agent工作流從Hub資料集訓練並在模擬或實體機器人上部署策略。本文介紹了五步流程,並提供了可在筆記本上執行的示例。
GLM-5.2 是 Z.AI 推出的最新旗艦模型,專為長週期任務設計,擁有穩定的 1M 上下文視窗,在編碼基準測試中表現優異,並引入 IndexShare 架構以降低計算成本,同時提供靈活的努力水平控制。該模型採用 MIT 開源許可證,無區域限制。