使用 llama.cpp 和 Pi 本地執行 Mythos 增強編碼模型
瞭解如何使用 llama.cpp 本地執行 Qwythos-9B-Claude-Mythos-5-1M 模型,將其連線到 Pi 編碼代理,並透過 MTP 推測解碼和 OpenAI 相容 API 構建快速的本地編碼工作流。
Qwythos-9B-Claude-Mythos-5-1M 是一款基於 Qwen3.5 的 9B 引數推理與編碼模型,專為本地編碼工作流、代理開發及長上下文任務設計。其亮點在於體積小巧,可在消費級硬體上執行,同時具備處理實際編碼任務的能力。本指南將詳細介紹如何使用 llama.cpp 本地執行該模型,並將其連線至 Pi 編碼代理。
首先,安裝 llama.cpp 命令列介面。透過官方安裝指令碼即可獲取 llama 命令,包括用於本地執行模型的 llama serve。安裝後需將目錄新增至 Shell 路徑。設定 Hugging Face 快取目錄以管理模型檔案。接著,啟動 Qwythos MTP 模型,使用 Q6_K 量化版本並啟用所有 GPU 層。命令包含關鍵引數如 --n-gpu-layers all(解除安裝所有支援層到 GPU)、--ctx-size 100000(分配 100K token 上下文視窗)、--flash-attn on(啟用快閃記憶體注意力)、--cache-type-k/q8_0(減少 KV 快取記憶體佔用)、--spec-type draft-mtp(啟用 MTP 推測解碼)等。在 RTX 4070 Ti Super 上可實現約 81.74 token/秒的生成速度。
隨後安裝 Pi 及 pi-llama 外掛,配置本地 API 地址後即可在 Pi 中選擇模型作為編碼代理。測試階段,透過兩個實際任務驗證模型能力:構建一款名為“Beat the AI”的瀏覽器遊戲,要求包括 30 秒倒計時、計分、進度條及多種題型,模型生成了一個完整的單 HTML 檔案;另一個任務是構建 CSV 轉 Excel 的 Python CLI 工具,模型正確建立了指令碼並驗證了功能。
總體而言,該模型速度快、精度高,適合日常編碼任務,無需大量 VRAM。可配合 Pi、Claude Code 等工具使用,支援本地 OpenAI 相容端點。建議新增網頁搜尋等整合以提升效果。