社群開發者微調OpenBMB的MiniCPM5-1B模型:基於Claude Fable 5資料,打造657MB本地推理模型
一位社群開發者基於OpenBMB的MiniCPM5-1B模型,使用Claude Fable 5的對話資料進行微調,釋出了一個僅657MB的本地推理模型。該模型支援128K上下文視窗、可切換的思維模式,並可在llama.cpp等工具中執行。本文驗證了其技術細節,區分了微調與真正的能力繼承,並指出了許可問題。
一位社群開發者GnLOLot釋出了一個1B引數的模型,該模型完全在本地硬體上執行。模型名為MiniCPM5-1B-Claude-Opus-Fable5-Thinking,提供了GGUF格式,相容llama.cpp等執行時。它不需要API金鑰,也不涉及雲端呼叫。
模型基礎 該模型基於openbmb/MiniCPM5-1B。這是一個來自OpenBMB的正式釋出版本,擁有1.08B引數,採用標準的LlamaForCausalLM架構。它包含24層、分組查詢注意力機制,以及131,072 token的上下文長度。OpenBMB宣稱在其比較集中,該模型達到了1B類開源模型的SOTA水平。
基礎模型本身已自帶一個思考模板,透過enable_thinking可以切換思考模式,提供“思考”和“不思考”兩種選項。衍生模型保留了該模板以及MiniCPM5的工具呼叫格式。
微調過程 開發者在此基礎之上進行了微調。模型卡片說明其“在Fable 5資料上進一步微調”,以提升編碼和指令遵循能力。GGUF卡片也重複了這一說法。
值得注意的是,該方法並非經典的蒸餾過程。它並沒有縮小原始模型,而是先生成大量與教師模型的對話,捕獲其回覆和推理軌跡作為文本,然後在這些軌跡上對較小的基礎模型進行監督微調。由於無法獲取Claude的權重或logits,這實際上是對生成輸出的監督微調,而非權重級別的蒸餾。OpenBMB自己的基礎模型則採用了文件化的“線上蒸餾”階段。
實際效果是,1B模型學會了模仿回覆的格式和風格,但並沒有吸收教師的底層能力。1B引數預算無法承載前沿級別的推理。
已驗證的規格 上下文視窗為128K token,繼承自基礎模型的config.json(131,072)。GGUF倉庫提供了四種量化版本:Q4_K_M約657MB(最小體積),Q5_K_M約751MB,Q8_0約1.1GB(推薦預設),F16約2.1GB。模型可直接在llama.cpp、Ollama、LM Studio、jan和KoboldCpp中載入。
如何執行
GGUF卡片提供了透過Ollama的一行命令:ollama run hf.co/GnLOLot/MiniCPM5-1B-Claude-Opus-Fable5-Thinking-GGUF:Q4_K_M。其他工具的使用方法也已在倉庫中說明。推薦在思考模式下使用temperature=0.9、top_p=0.95的取樣引數。模型可能在最終答案前輸出推理塊,下游應用可以將其剝離。
關鍵要點
- 該模型是OpenBMB MiniCPM5-1B的監督微調版本,使用了Claude Fable 5的軌跡資料,而非權重蒸餾。
- 實際規格:128K上下文,GGUF量化從約657MB(Q4_K_M)到2.1GB(F16),Q8_0為推薦預設。
- 微調主要傳遞格式和風格,而非前沿推理或廣泛知識。
- 未公佈基準測試或訓練資料集,能力宣告目前無法驗證。
- Apache-2.0僅覆蓋基礎權重;基於Claude輸出訓練可能引發許可問題,模型卡片未明確說明。