構建Shippy:AI代理在海洋安全領域的經驗教訓
Shippy是一個用於實時海洋領域感知的AI代理,其設計注重可靠性、模塊化和可審計性。文章詳細介紹了其架構:由“靈魂”(系統提示)、技能(結構化Markdown文件)和配置組成。通過專用CLI與Skylight API交互,並使用Mothership平台進行沙盒託管和用户隔離。評估系統針對真實場景和加權標準對整體代理進行評分。未來計劃包括代理驅動的UI控制、模型路由和跨線程記憶。
Official source; confirm license per article before full body display.
Shippy是一個用於實時海洋領域感知的AI代理,其設計注重可靠性、模塊化和可審計性。文章詳細介紹了其架構:由“靈魂”(系統提示)、技能(結構化Markdown文件)和配置組成。通過專用CLI與Skylight API交互,並使用Mothership平台進行沙盒託管和用户隔離。評估系統針對真實場景和加權標準對整體代理進行評分。未來計劃包括代理驅動的UI控制、模型路由和跨線程記憶。
本文探討了AI代理中模型路由的複雜性,指出路由不僅僅是分類問題,而是系統優化問題。文章通過三個維度(成本、複雜度、延遲)揭示了常見誤解,並介紹了IBM Research團隊構建的基於優化的路由解決方案。
Thinking Machines發佈了Inkling,一個擁有約1萬億參數的開源多模態模型,支持圖像、文本和音頻輸入,可處理高達100萬token的上下文。該模型採用混合專家架構,僅激活410億參數,並配有相對注意力和短卷積等創新設計。Inkling已在Hugging Face上發佈,並得到transformers、SGLang和llama.cpp的即日支持。
現有的基準測試顯示語音AI接近人類水平,但實際對話卻大不相同。Hume AI發佈了Real World VoiceEQ基準,從超過40個語音模型在15+維度和60+指標上進行評估,基於超過100萬人類評分。關鍵發現包括:語音AI進展日益專業化、模型更擅長説話而非傾聽、傳統基準高估了實際性能、人類評估仍然不可或缺。
NVIDIA 通過開放數據和合成數據推動智能體 AI 發展,強調數據質量、可檢查性和信任。
Hugging Face的Transformers庫的vLLM後端現在在多種LLM架構上達到了與原生vLLM實現相當甚至更快的推理速度。模型作者無需額外編碼即可自動利用其Transformers實現獲得超快推理。
Hugging Face與Amazon SageMaker AI深度集成,開發者現在可以通過一鍵操作從模型發現直接進入SageMaker Studio進行實驗。該集成自動配置權限、顯示GPU配額,並支持模型微調和部署,大幅縮短從靈感到部署的路徑。
SkyPilot與Hugging Face合作,允許用户將模型和數據集存儲在Hugging Face Hub上,並通過SkyPilot在任何雲上運行計算任務,無需支付數據傳輸費用。
LeRobot v0.6.0 引入了世界模型策略(VLA-JEPA、FastWAM、LingBot-VA),新一批VLA模型(GR00T N1.7、MolmoAct2等),獎勵模型API(Robometer、TOPReward),六個新仿真基準,以及部署CLI、深度感知、數據集註解加速等功能,旨在閉環機器人學習循環。
本文詳細介紹了PRX(一個7B文本到圖像模型)背後的數據管道。關鍵點包括從公開和內部數據集構建多樣化的預訓練數據集,使用VLM生成長而準確的標題,並利用Lance構建數據集、MDS進行流式處理。團隊解釋了選擇質量92的JPEG編碼、實時計算文本潛在向量以及關於數據碎片化的經驗教訓。
Hugging Face 的 Kernels 項目旨在標準化自定義內核的打包、分發和使用方式。本文總結了近期重大更新:引入新的“內核”倉庫類型以提升可發現性;通過受信任的發佈者和代碼簽名增強安全性;重構 CLI 以明確職責劃分;擴展對 Torch Stable ABI 和 Apache TVM FFI 等框架的支持;為 AI 代理開發內核奠定基礎;以及改進環境配置和兼容性檢查工具。
Hugging Face 與 Cerebras 合作,利用 Gemma 4 模型打造實時語音 AI 系統,通過開放模塊化架構顯著降低延遲,實現更自然的對話體驗。該系統集成 Nvidia 的語音識別、Cerebras 的推理加速和 Alibaba 的語音合成,已在 9000 多台 Reachy Mini 機器人中應用。
IBM Research推出ScarfBench,這是一個用於評估AI智能體在企業Java中跨框架遷移任務的開源基準。該基準包含34個應用程序、102個框架實現和204個遷移任務。目前頂尖智能體的行為成功率低於10%,突顯了在遷移過程中保持行為的難度。
本文從優化理論、進化生物學、競爭市場和機器學習四個角度論證了專業化是資源有限條件下系統提升性能的必然路徑。作者指出,通用性並非性能優勢,在有限資源下,集中資源於有限任務集比分散到無限範圍更有效。文章還澄清了專業化和領域知識的區別,指出規模擴展不會改變這一根本約束。
Every Eval Ever (EEE) 與 Hugging Face Community Evals 實現互操作,允許用户交叉發佈和解讀評估結果,同時鏈接到開放模型、排行榜和統一的標準化元數據存儲。
DiScoFormer是一種新型變換器模型,能通過一次前向傳播從數據點估計分佈的密度和分數(對數密度的梯度),無需重新訓練。它結合了跨注意力機制和共享骨幹網絡,利用密度與分數的數學關係進行無標籤一致性學習。在100維空間中,其分數誤差比最佳KDE降低約6.5倍,密度誤差降低超過37倍,且能泛化到未見的高斯和非高斯分佈。
本文介紹如何通過一行命令在 Hugging Face 基礎設施上快速啓動一個私有、兼容 OpenAI 的 LLM 端點,無需配置服務器或 Kubernetes,按秒計費。涵蓋從啓動、查詢、清理到擴展為大模型、創建聊天 UI、SSH 調試及作為編碼代理後端的完整流程,並與 Inference Endpoints 進行比較。
Ai2團隊比較了7B參數規模的Transformer模型Olmo 3和混合模型Olmo Hybrid,發現混合模型在內容詞(名詞、動詞、形容詞)和需要上下文推理的token上表現更優,但在重複token和閉合括號上優勢消失。研究表明,基於token的損失過濾可以揭示架構間的細微差異。
NVIDIA NeMo AutoModel基於HuggingFace Transformers v5,通過專家並行、DeepEP融合通信和TransformerEngine內核,將MoE模型微調的訓練吞吐量提升3.4-3.7倍,GPU內存減少29-32%,且無需更改API。
CUGA是IBM開源的智能體框架,處理了智能體構建中的管道工作,讓開發者只需編寫工具列表和提示詞即可。本文通過一個IBM雲架構顧問示例,展示瞭如何用少量代碼構建一個完整的智能體應用,並介紹了CUGA的規劃、執行、反射步驟和策略系統。
本文介紹了跨域存儲(COS)API提案,該API允許Web應用跨域共享大型文件(如AI模型和Wasm運行時),通過加密哈希而非URL標識文件,從而避免重複下載和存儲。文章以Transformers.js為例,展示了當前瀏覽器緩存隔離導致的問題,以及COS如何通過哈希標識、可升級的訪問控制和安全完整性檢查來解決這些問題。
Hugging Face團隊通過結合AI和開源工具,將huggingface_hub的發佈週期從4-6周縮短至每週一次,同時保留人工審核環節以確保質量。該流程基於GitHub Actions、OpenCode和開放權重模型,每次發佈成本僅約0.25美元。
PP-OCRv6 是 PaddleOCR 的最新通用 OCR 模型系列,支持從 1.5M 到 34.5M 參數的三個層級,覆蓋 50 種語言。相比 PP-OCRv5_server,檢測準確率提升 4.6 個百分點,識別準確率提升 5.1 個百分點。新架構包括 PPLCNetV4 骨幹網絡、RepLKFPN 檢測模塊和 EncoderWithLightSVTR 識別模塊。支持 Paddle Inference、Transformers 和 ONNX Runtime 後端。
OpenClaw維護者利用本地開源模型(Gemma、Qwen)在智能體框架中,實時對問題和拉取請求進行分類,性能媲美閉源模型,僅需硬件電費成本。
深度研究代理結合私有文檔與網頁搜索時,可能通過查詢日誌無意中泄露敏感信息。MosaicLeaks基準量化了這種隱私風險,並提出了一種名為隱私感知深度研究(PA-DR)的訓練方法,可以在保持任務性能的同時,將信息泄露減少3倍以上。
LoRA是目前最流行的參數高效微調(PEFT)技術,但研究表明其他方法在某些任務上表現更好。本文介紹了Hugging Face的PEFT庫及其基準測試,探討了如何根據具體需求選擇合適的PEFT技術,並指出LoRA並非總是最佳選擇。
一個全新的基準測試框架專注於評估AI智能體使用軟件庫的整個過程工作量,以Hugging Face的Transformers庫為案例。通過測量令牌使用量、時間、錯誤率等指標,揭示不同模型和工具層級下的性能權衡,為庫維護者和智能體用户提供關鍵見解。
MolmoMotion是一種新型3D運動預測模型,能夠根據視頻幀、物體上的3D點以及語言指令預測未來幾秒內物體點的3D軌跡。該模型在多個下游任務中表現出色,如機器人規劃和可控視頻生成。同時發佈了最大的3D點軌跡數據集MolmoMotion-1M和基準測試PointMotionBench。
AWS開源SDK Strands Robots集成了LeRobot,允許開發者通過單一Agent工作流從Hub數據集訓練並在模擬或實體機器人上部署策略。本文介紹了五步流程,並提供了可在筆記本上運行的示例。
GLM-5.2 是 Z.AI 推出的最新旗艦模型,專為長週期任務設計,擁有穩定的 1M 上下文窗口,在編碼基準測試中表現優異,並引入 IndexShare 架構以降低計算成本,同時提供靈活的努力水平控制。該模型採用 MIT 開源許可證,無區域限制。