我想執行自己的AI,但我的筆記型電腦說“還不行”
作者試圖在本地Mac上執行AI助手,但24GB記憶體不足以執行強大的模型,且記憶體價格因AI需求暴漲。儘管嘗試了多種工具,本地模型仍無法勝任重要任務,但在分析招聘廣告等簡單場景中表現良好。
我曾幻想擁有一個完全屬於自己的AI助手:執行在我的個人電腦上,無需聯網,所有輸入的資料都不會離開房間。沒有公司統計我的token使用量,沒有訂閱費,也沒有因為別人伺服器宕機而毀掉整個下午的煩惱(說的就是你,Anthropic,還有你那反覆出現的故障)。為了實現這個願望,我花了幾個月時間嘗試,現在我想誠實地告訴你結果如何。
24GB聽起來很多,直到你載入一個模型
我的Mac有24GB記憶體。購買時我覺得這很慷慨,但當你載入一個真正的語言模型時,這個數字迅速縮水。系統需要保留一部分來執行,留給模型的實際可用記憶體只有三分之二左右。那些真正值得信賴的模型恰好達到或超過這個上限。所以你只能選擇:要麼用一個小巧但不太聰明的模型,要麼用一個更智慧卻讓電腦喘不過氣的模型。
顯而易見的解決方案是增加記憶體,但你見過最近的記憶體價格嗎?時機再糟糕不過了。記憶體價格以令人驚訝的方式上漲,對於那些很久沒關注的人來說尤其如此。DRAM價格自2025年初以來大約翻了一番,而分析人士認為到2026年可能再上漲70%左右。儲存晶片的情況更糟。SSD所用的原始NAND晶圓價格比去年年中高出約八倍,一塊4TB硬碟不久前我可能只花250美元,現在卻要700多美元——而且由於市場波動劇烈,當這篇博文釋出時,這些數字可能已經完全變了,因為現在是2026年,誰知道RAM和SSD會賣多少錢呢。
這一切瘋狂的根源,也正是當今科技界半數故事的背後推手——AI。大型資料中心建設今年將吞噬全球約70%的高階記憶體,而云巨頭已經簽下鎖定未來數年產量的合同。他們實際上在購買尚未生產出來的晶片。美光甚至關閉了其消費級Crucial品牌,將全部精力投向AI市場。
想想看:正是那個讓私密本地模型如此吸引人的繁榮,反過來卻讓大多數人無法負擔執行它的硬體。如果不是因為錢包在哭泣,我覺得這還挺有趣的。
我最初責怪軟體
在接受這一切之前,我曾確信自己只是選錯了工具。於是我開始尋找“框架”。如果把LLM比作大腦,框架就是給它雙手的工具——那些讓AI真正有用的東西:Pi、OpenCode、Hermes。每一個都承諾能讓本地AI大放異彩。
我最終選擇了Pi,倒不是因為它功能出色,而是因為模型在這裡執行得最好,響應更快,互動更流暢。但這段尋找過程讓我明白,框架並非瓶頸所在。我可以整天切換它們,卻始終碰到同一堵牆——那堵牆就是模型本身以及支撐它的記憶體。沒有哪個介面能解決一個模型缺乏思考空間的問題。
於是,我發現自己處於一個尷尬的境地:我不信任本地模型能勝任那些錯誤代價高昂的任務。快速改寫、隨口一問,這些沒問題。但一旦任務需要真正的判斷力,我幾乎在做出決定之前就回到了雲端。我想擺脫對付費助手的依賴,並非因為它們貴得離譜,而是想擺脫對雲服務商的依賴,不受它們的反覆無常和服務中斷的影響。如今的token補貼如此之高,以至於這些更強大的模型很可能遲早會把我排斥在外。
我的本地AI真正擅長什麼
不過,並非全是壞訊息。本地模型有一個經常且出色完成的任務:分析招聘廣告。
我的求職過程就像後臺批處理。一個指令碼抓取招聘資訊,剔除明顯的垃圾內容,然後將剩下的交給筆記型電腦上的模型。模型會按照我寫的一份簡要說明,逐一比對每條廣告,告訴我匹配度如何。免費且離線執行,我的簡歷從不離開電腦,無論雲端的AI是否宕機都能正常工作。這正是我追求的那種獨立性,只是範圍比我原本期望的小得多。
它之所以能工作,要歸功於新模型的構建方式。我使用的Gemma模型採用混合專家(MoE)設計,簡單來說,它只喚醒給定問題所需的部分引數,而不是全量執行。它足夠輕量,能在我的硬體上真正進行推理,而不需漫長等待,每條廣告大約只需30秒。對於在我日常工作中默默執行的任務來說,30秒算不了什麼。
所以,還不行
我並沒有放棄本地AI。我只是對理想與現實之間的差距感到沮喪——我想要的和24GB記憶體加上殘酷的記憶體市場所能提供的之間仍有鴻溝。但混合專家技術已經將那條線向前推進了一次,希望它還能再次推進。模型在每GB上的智慧程度在不斷提升,而不僅僅是變得更大;價格遲早會回落。幾年後的我,或許可以毫不猶豫地完全執行本地AI。而現在,我只有一個工作流完全執行在自己的硬體上,其他一切仍然需要“打電話回家”。但這個工作流完全屬於我。這是一個開始。