AI News HubLIVE
站内改写1 分钟阅读

使用 llama.cpp 和 Pi 本地运行 Mythos 增强编码模型

了解如何使用 llama.cpp 本地运行 Qwythos-9B-Claude-Mythos-5-1M 模型,将其连接到 Pi 编码代理,并通过 MTP 推测解码和 OpenAI 兼容 API 构建快速的本地编码工作流。

来源KDnuggets作者: Abid Ali Awan

Qwythos-9B-Claude-Mythos-5-1M 是一款基于 Qwen3.5 的 9B 参数推理与编码模型,专为本地编码工作流、代理开发及长上下文任务设计。其亮点在于体积小巧,可在消费级硬件上运行,同时具备处理实际编码任务的能力。本指南将详细介绍如何使用 llama.cpp 本地运行该模型,并将其连接至 Pi 编码代理。

首先,安装 llama.cpp 命令行界面。通过官方安装脚本即可获取 llama 命令,包括用于本地运行模型的 llama serve。安装后需将目录添加至 Shell 路径。设置 Hugging Face 缓存目录以管理模型文件。接着,启动 Qwythos MTP 模型,使用 Q6_K 量化版本并启用所有 GPU 层。命令包含关键参数如 --n-gpu-layers all(卸载所有支持层到 GPU)、--ctx-size 100000(分配 100K token 上下文窗口)、--flash-attn on(启用闪存注意力)、--cache-type-k/q8_0(减少 KV 缓存内存占用)、--spec-type draft-mtp(启用 MTP 推测解码)等。在 RTX 4070 Ti Super 上可实现约 81.74 token/秒的生成速度。

随后安装 Pi 及 pi-llama 插件,配置本地 API 地址后即可在 Pi 中选择模型作为编码代理。测试阶段,通过两个实际任务验证模型能力:构建一款名为“Beat the AI”的浏览器游戏,要求包括 30 秒倒计时、计分、进度条及多种题型,模型生成了一个完整的单 HTML 文件;另一个任务是构建 CSV 转 Excel 的 Python CLI 工具,模型正确创建了脚本并验证了功能。

总体而言,该模型速度快、精度高,适合日常编码任务,无需大量 VRAM。可配合 Pi、Claude Code 等工具使用,支持本地 OpenAI 兼容端点。建议添加网页搜索等集成以提升效果。