我用本地語言模型做的5件酷事
作者分享了自己在日常工作流中使用本地語言模型的四個實際專案:私有文件大腦、原生代碼審查、完全離線的AI助手以及個性化的思考夥伴,強調了隱私、速度和定製化優勢。
近年來,大型語言模型(LLM)的發展使得在本地執行AI成為可能。作者透過Ollama工具,在自己的機器上部署了多個開源模型,並探索了四個實際應用場景,證明了本地模型不僅是雲端方案的替代,更在某些方面成為更好的選擇。
私有文件大腦 作者使用AnythingLLM結合Ollama執行Llama 3.2,構建了一個完全本地的檢索增強生成(RAG)系統。這一設定讓作者能夠對多年積累的研究論文、合同和個人筆記進行智慧問答。所有文件均儲存在本地,無需上傳到雲端。透過簡單的Docker命令即可啟動,並支援多種模型。作者指出,對於敏感材料,本地RAG比雲端方案更有優勢——不僅提供了相同的推理和綜合能力,還消除了資料遷移和第三方依賴的顧慮。具體來說,作者載入了一資料夾的研究論文,詢問需要跨文件閱讀的問題,模型準確抽取了相關部分,並指出了2023年和2025年論文在檢索增強方法上的實質性分歧。建議的模型包括Llama 3.2 3B(輕量級裝置)和Mistral 7B(更強綜合能力)。
原生代碼審查 針對開發中常見的程式碼審查焦慮,作者利用Qwen2.5-Coder 7B模型在本地進行程式碼審查。該模型專門針對程式碼最佳化,能夠發現SQL隱碼攻擊、資料暴露和未處理的邊緣情況。透過VS Code的Continue外掛,開發者可以直接在編輯器中獲得本地模型的即時反饋。作者用一個真實函式測試,模型立即捕獲了SQL隱碼攻擊漏洞、SELECT *導致的資料暴露風險,以及函式在使用者不存在時靜默返回None的問題。這種方式避免了將專有程式碼傳送到第三方伺服器,保護了公司智慧財產權。
完全離線的AI助手 在一次長途航班上,作者完全離線使用了Mistral 7B模型。透過預先下載模型,即使在飛航模式下也能快速啟動並執行。作者用它起草郵件、討論技術架構問題,甚至為本文構思大綱。儘管離線模式無法訪問即時資訊,但對於思考和寫作任務,本地模型提供了流暢的對話體驗。在M2 MacBook Pro上,Mistral 7B以Q4_K_M量化執行速度約為25-35 token/秒,足以支援即時對話。
個人思考夥伴 雲端AI每次會話都需要重新建立上下文,而本地模型透過Modelfile可以持久化系統提示。作者建立了一個包含個人背景、當前專案和工作偏好的Modelfile,使得每次與模型互動時都能從完整上下文開始。模型會質疑假設、提出澄清問題,並以直接的方式提供反饋,顯著提升了工作效率。Modelfile的建立和執行非常簡單,透過ollama create命令即可。
本文還提到第五個專案,但由於篇幅限制未能詳述。總體而言,本地語言模型為開發者提供了隱私、速度和定製化的全新可能性,尤其適合處理敏感資料或在無網路環境下工作。