AI News HubLIVE
站內改寫2 分鐘閱讀

如何選擇AI模型:來自Notion和Gamma的教訓

Notion和Gamma的經驗表明,選擇AI模型時應考慮成本、可靠性、任務匹配度,並善用開源模型。不要默認使用最強大的模型,而是根據具體工作流選擇最經濟高效的模型。

在AI模型的選擇上,Notion和Gamma給出了深刻的見解。兩年前,選擇模型很簡單:調用最好的API,然後圍繞它構建。但今天,每個模型的行為都不同,同一任務在不同模型上的成本可能相差10倍,而開源模型幾乎和封閉模型一樣好。同時,提供智能的實驗室也在推出與購買其產品的公司競爭的產品。

在Baseten主持的一次小組討論中,Notion的AI負責人Sarah Sachs和Gamma的聯合創始人Jon Noronha分享了六點關鍵收穫。

首先,單一的框架會削弱每個模型。框架是圍繞LLM構建的一切,使其真正功能性。模型本身沒有記憶,無法運行代碼或調用API,也無法阻止自己做出危險行為,因此框架處理所有這些。一個模型無關的框架會失敗,因為針對一個模型設計的提示會降低其他模型的性能。最佳實踐是每個模型都有自己的原生框架,然後根據用例進行修改。

其次,模型切換值得投入工程成本。每個模型的投資很昂貴,但比承諾使用單一模型更便宜,原因有三:可靠性,當提供商降級時,可以靈活遷移;成本,當更便宜的模型達到質量要求時,可以替換;採用速度,當新模型發佈時,可以在幾天內測試,而不是重新工程化數週。為了正確比較模型,公司使用A/B測試,讓真實用户測試不同模型生成的版本,並結合自動評分。

第三,根據工作流而非排行榜選擇模型。GPT模型是字面意義的,它們完全按照要求做;Claude模型更擅長推斷意圖。例如,Gamma用户可能要求“保留每個詞”,GPT會保留每個詞導致每張幻燈片上文字太多,而Claude會保留要點並製作一個可實際展示的演示文稿。Notion發現,某些任務不需要更先進的模型,比如編輯頁面或總結會議記錄,在這些任務上,更智能的模型沒有帶來可衡量的質量差異。

第四,開源模型已經趕上。在許多生產工作負載上,開源模型現在與前沿封閉模型相當,並且在服務速度和微調上有更多控制。這解鎖了封閉模型無法服務的市場。Gamma超過3/4的收入來自美國以外,其中許多來自巴西和印度等支付意願較低的國家。更便宜的開源模型使優秀產品在這些價格點上可行。評估提供商,而不僅僅是模型,因為相同的權重在不同平台上有不同的優化,產生不同的質量。

第五,微調是為了擴大市場,而不是利潤率。微調開源模型的明顯動機是利潤率——用更便宜的調整模型替換昂貴的封閉API,保持價格不變,在每個請求上賺取差價。但微調提供的不僅僅是利潤率:每個任務更便宜的智能降低了AI賦能工作的門檻,從而市場擴大。強化學習(RL)更進一步,通過訓練模型在自己的任務上提高,但RL需要良好數據,並且是投資。Notion指出,RL需要能夠複製工作空間並進行數十萬次訓練,而不影響生產搜索索引。

最後,他們接下來構建什麼。Gamma希望整合圖像生成,但進展比LLM慢得多,他們正在等待合適的時機。Notion希望構建權限系統並防止數據泄露,這需要上下文、治理和對公司運營的理解。

總之,現在是時候不同地選擇模型了。這意味着用正確的測試比較模型,為了可靠性和成本而切換,並根據任務選擇正確的模型,而不是默認使用最強大的。開源模型現在足夠強大,適用於大多數生產工作負載,正確的提供商可以幫助你以高質量輸出服務它們。