本地執行開放權重模型的難點從來不在模型本身,而在於此前的準備工作:讀取視訊記憶體規格、猜測該用哪種量化、設定上下文長度與GPU層數,最後在載入時才發現檔案大了3GB。Nous Research 把這個流程壓縮為 Hermes Desktop 中的一次點選。新增的簡易設定流程會讀取你的硬體,選擇能裝下的模型,下載權重併為你配置推理執行時。
這次上線是否可直接部署?可以。Hermes Desktop 是開源 Hermes Agent 的 MIT 許可、免費構建版,支援 macOS 12+、Windows 10/11 和所有 Linux 發行版,本地模型完全無需賬戶。
釋出的細節具體明確:Hermes Desktop 現在可一鍵完成本地模型設定,應用讀取硬體、選模型、下載並配置執行時。該流程會在首次啟動時自動出現,也可稍後在 Settings → Providers → Local Models 中找到。
後臺方面,Hermes 自己管理推理引擎。根據 Local Models 文件,它會獲取與你硬體匹配的官方 llama.cpp 構建(約幾百MB),校驗並保持更新。後端覆蓋 CUDA、Metal、Vulkan、HIP 與 CPU。固定釋出標籤位於 config.yaml 的 local_runtime 塊中,桌面端 UI 會自動寫入,無頭使用者也可以手工指定。
下載前的每個目錄模型都會針對你的機器評估:每行有視訊記憶體適配結論,綠色表示完全放入 GPU 視訊記憶體,琥珀色表示會溢位到系統記憶體、速度較慢,紅色表示該機器無法執行。列表還顯示起始/最大上下文視窗,以及為你的硬體選擇的構建的下載大小。
量化選擇遵循一條規則:Hermes 會挑選能在 GPU 上完整執行的最高質量構建;視訊記憶體較少的機器會得到同一模型的更緊湊構建。系統設有4bit硬性下限,低於該值質量損失被認為過大,因此無法無溢位執行4bit構建的機器就不能執行該模型。裝不下的模型仍會顯示並說明原因,以便你看出增加視訊記憶體能帶來什麼。
本地推理的成敗取決於記憶體擺放,而 Hermes 不提供相關旋鈕。模型從完全適配 GPU 的上下文視窗開始,隨對話需要增長到原生最大值。每款推薦模型至少保證64K上下文。溢位時按照"傷害最小"的順序放入系統記憶體:專家權重優先,絕不放注意力快取。這一設計以吞吐量換上下文保證。對話壓縮只在模型達到最大視窗後觸發,所以擴充套件總在摘要之前。空閒模型15分鐘後解除安裝,下一條訊息時重新載入。