跳到主要內容
AI News HubLIVE
站內改寫2 分鐘閱讀

Nous Research 為 Hermes Desktop 新增一鍵式本地模型設定

文章摘要

Nous Research 將 Hermes Desktop 的本地開源模型部署簡化為單擊操作:應用會讀取硬體、從目錄中挑選適配 GPU 的模型、下載權重並自動配置 llama.cpp,全程無需賬戶。系統採用4bit量化下限、至少64K上下文視窗的推薦模型,並按綠色/琥珀色/紅色標註每款模型的視訊記憶體適配情況。

來源MarkTechPost作者: Michal Sutter
Nous Research 為 Hermes Desktop 新增一鍵式本地模型設定
回報錯誤

更正管道尚未開通,可先複製下方文章資訊留存。

查看更正說明
直接讀正文

本地執行開放權重模型的難點從來不在模型本身,而在於此前的準備工作:讀取視訊記憶體規格、猜測該用哪種量化、設定上下文長度與GPU層數,最後在載入時才發現檔案大了3GB。Nous Research 把這個流程壓縮為 Hermes Desktop 中的一次點選。新增的簡易設定流程會讀取你的硬體,選擇能裝下的模型,下載權重併為你配置推理執行時。

這次上線是否可直接部署?可以。Hermes Desktop 是開源 Hermes Agent 的 MIT 許可、免費構建版,支援 macOS 12+、Windows 10/11 和所有 Linux 發行版,本地模型完全無需賬戶。

釋出的細節具體明確:Hermes Desktop 現在可一鍵完成本地模型設定,應用讀取硬體、選模型、下載並配置執行時。該流程會在首次啟動時自動出現,也可稍後在 Settings → Providers → Local Models 中找到。

後臺方面,Hermes 自己管理推理引擎。根據 Local Models 文件,它會獲取與你硬體匹配的官方 llama.cpp 構建(約幾百MB),校驗並保持更新。後端覆蓋 CUDA、Metal、Vulkan、HIP 與 CPU。固定釋出標籤位於 config.yaml 的 local_runtime 塊中,桌面端 UI 會自動寫入,無頭使用者也可以手工指定。

下載前的每個目錄模型都會針對你的機器評估:每行有視訊記憶體適配結論,綠色表示完全放入 GPU 視訊記憶體,琥珀色表示會溢位到系統記憶體、速度較慢,紅色表示該機器無法執行。列表還顯示起始/最大上下文視窗,以及為你的硬體選擇的構建的下載大小。

量化選擇遵循一條規則:Hermes 會挑選能在 GPU 上完整執行的最高質量構建;視訊記憶體較少的機器會得到同一模型的更緊湊構建。系統設有4bit硬性下限,低於該值質量損失被認為過大,因此無法無溢位執行4bit構建的機器就不能執行該模型。裝不下的模型仍會顯示並說明原因,以便你看出增加視訊記憶體能帶來什麼。

本地推理的成敗取決於記憶體擺放,而 Hermes 不提供相關旋鈕。模型從完全適配 GPU 的上下文視窗開始,隨對話需要增長到原生最大值。每款推薦模型至少保證64K上下文。溢位時按照"傷害最小"的順序放入系統記憶體:專家權重優先,絕不放注意力快取。這一設計以吞吐量換上下文保證。對話壓縮只在模型達到最大視窗後觸發,所以擴充套件總在摘要之前。空閒模型15分鐘後解除安裝,下一條訊息時重新載入。

展開要點與分析

文章情報

工程師進階

要點

  • Hermes Desktop 現在可一鍵完成硬體檢測、模型選擇、權重下載與推理執行時的配置。
  • 該應用自動管理適配硬體的 llama.cpp 構建,不向使用者暴露上下文長度、GPU層數或量化引數。
  • 每個目錄模型都會先針對本機檢查適配度(綠色/琥珀色/紅色),4bit為量化質量下限。
  • 推薦模型保證至少64K上下文視窗,溢位時按專家權重優先順序解除安裝到系統記憶體。

要點與分析由自動化流程生成,可能有誤,請結合原始來源核實。