如何选择AI模型:来自Notion和Gamma的教训
Notion和Gamma的经验表明,选择AI模型时应考虑成本、可靠性、任务匹配度,并善用开源模型。不要默认使用最强大的模型,而是根据具体工作流选择最经济高效的模型。
在AI模型的选择上,Notion和Gamma给出了深刻的见解。两年前,选择模型很简单:调用最好的API,然后围绕它构建。但今天,每个模型的行为都不同,同一任务在不同模型上的成本可能相差10倍,而开源模型几乎和封闭模型一样好。同时,提供智能的实验室也在推出与购买其产品的公司竞争的产品。
在Baseten主持的一次小组讨论中,Notion的AI负责人Sarah Sachs和Gamma的联合创始人Jon Noronha分享了六点关键收获。
首先,单一的框架会削弱每个模型。框架是围绕LLM构建的一切,使其真正功能性。模型本身没有记忆,无法运行代码或调用API,也无法阻止自己做出危险行为,因此框架处理所有这些。一个模型无关的框架会失败,因为针对一个模型设计的提示会降低其他模型的性能。最佳实践是每个模型都有自己的原生框架,然后根据用例进行修改。
其次,模型切换值得投入工程成本。每个模型的投资很昂贵,但比承诺使用单一模型更便宜,原因有三:可靠性,当提供商降级时,可以灵活迁移;成本,当更便宜的模型达到质量要求时,可以替换;采用速度,当新模型发布时,可以在几天内测试,而不是重新工程化数周。为了正确比较模型,公司使用A/B测试,让真实用户测试不同模型生成的版本,并结合自动评分。
第三,根据工作流而非排行榜选择模型。GPT模型是字面意义的,它们完全按照要求做;Claude模型更擅长推断意图。例如,Gamma用户可能要求“保留每个词”,GPT会保留每个词导致每张幻灯片上文字太多,而Claude会保留要点并制作一个可实际展示的演示文稿。Notion发现,某些任务不需要更先进的模型,比如编辑页面或总结会议记录,在这些任务上,更智能的模型没有带来可衡量的质量差异。
第四,开源模型已经赶上。在许多生产工作负载上,开源模型现在与前沿封闭模型相当,并且在服务速度和微调上有更多控制。这解锁了封闭模型无法服务的市场。Gamma超过3/4的收入来自美国以外,其中许多来自巴西和印度等支付意愿较低的国家。更便宜的开源模型使优秀产品在这些价格点上可行。评估提供商,而不仅仅是模型,因为相同的权重在不同平台上有不同的优化,产生不同的质量。
第五,微调是为了扩大市场,而不是利润率。微调开源模型的明显动机是利润率——用更便宜的调整模型替换昂贵的封闭API,保持价格不变,在每个请求上赚取差价。但微调提供的不仅仅是利润率:每个任务更便宜的智能降低了AI赋能工作的门槛,从而市场扩大。强化学习(RL)更进一步,通过训练模型在自己的任务上提高,但RL需要良好数据,并且是投资。Notion指出,RL需要能够复制工作空间并进行数十万次训练,而不影响生产搜索索引。
最后,他们接下来构建什么。Gamma希望整合图像生成,但进展比LLM慢得多,他们正在等待合适的时机。Notion希望构建权限系统并防止数据泄露,这需要上下文、治理和对公司运营的理解。
总之,现在是时候不同地选择模型了。这意味着用正确的测试比较模型,为了可靠性和成本而切换,并根据任务选择正确的模型,而不是默认使用最强大的。开源模型现在足够强大,适用于大多数生产工作负载,正确的提供商可以帮助你以高质量输出服务它们。