AI News HubLIVE
站内改写2 分钟阅读

Liquid AI发布LFM2.5-Encoder-230M和LFM2.5-Encoder-350M:在CPU上以8K上下文保持快速的双向编码器

Liquid AI发布了两个开源权重的双向编码器LFM2.5-Encoder-230M和LFM2.5-Encoder-350M,均基于LFM2混合骨干网络,支持8192令牌上下文。其中350M参数模型在17项GLUE、SuperGLUE和多语言分类任务中排名第四,仅次于更大模型;230M模型在CPU上完成一次8K令牌前向传播仅需约28秒。这两款编码器专为边缘设备、监管环境及高吞吐量管道设计,可在无GPU环境下高效运行。

来源MarkTechPost作者: Asif Razzaq

Liquid AI近日发布了两个开源权重的双向编码器:LFM2.5-Encoder-230M和LFM2.5-Encoder-350M。这两款模型均为掩码语言模型,基于LFM2混合骨干架构,支持8192令牌的上下文长度。

编码器通常用于分类器、意图路由、安全过滤和PII检测等任务。这些任务通常持续运行,且往往没有GPU支持,同时输入长度日益增加。BERT奠定了该领域的基石,ModernBERT进一步提升了准确率、速度和上下文能力。Liquid AI认为,LFM2架构延续了这一发展方向,因为其计算成本随输入长度增长更慢。

从解码器到编码器的转换

这两款编码器并非从头训练,而是从LFM2.5-230M和LFM2.5-350M解码器骨干初始化,并通过三项修改转换而来:

  1. 将因果注意力掩码替换为双向掩码,使每个令牌能够关注两侧的上下文。
  2. 使用对称中心填充使LFM2短卷积变为非因果,确保每个令牌的卷积混合两侧相邻信息。
  3. 使用30%掩码率的掩码语言建模目标进行训练,这比BERT的15%更高,Liquid AI引用证据表明在此规模下更高掩码率更有益。

训练分为两个阶段:第一阶段在1024令牌短上下文中使用大型网页语料库进行MLM训练,建立通用语言能力;第二阶段将上下文扩展到8192令牌,使用完整数据混合,增强事实、法律和多语言能力。

架构上,骨干网络交错使用门控短卷积块和分组查询注意力,与LFM2技术报告一致。两个检查点均使用1024隐藏维度和65536令牌词汇表,支持15种语言,采用LFM Open License v1.0许可证。

基准测试结果

Liquid AI在GLUE、SuperGLUE和多语言分类的17项任务上评估了14个模型。每个模型针对每个任务进行全微调。LFM2.5-Encoder-350M的17任务平均得分为81.02(±1.00),排名第四。前三名均为更大模型:XLM-R XL(3.5B,83.06)、ModernBERT-large(395M,81.68)和XLM-R large(560M,81.34)。排名第一的模型几乎是其10倍大小。

LFM2.5-Encoder-230M得分为79.29(±1.02),排名第六,超过了ModernBERT-base(78.19)以及所有EuroBERT模型,包括EuroBERT-610M(75.87)和EuroBERT-2.1B(72.19)。两款新编码器还优于Liquid AI自家的检索模型LFM2.5-ColBERT-350M(76.18)和LFM2.5-Embedding-350M(75.68)。这一差距正是Liquid AI构建通用编码器而非复用检索模型的原因。

该方法已开源,采用Apache-2.0许可证。所有模型使用fp32主权重和bf16自动转换,确保公平比较。所有模型使用相同的AdamW优化器配置。学习率根据每个模型和任务从10个值和3个种子中选择,最终得分基于5个全新种子的平均值。Transformers版本固定为4.56.2,避免依赖漂移。

应用场景与部署环境

发布方指出了三个典型场景:首先,边缘和嵌入式设备(如汽车车载计算或工业控制器)没有多余GPU,也无法承受云端往返延迟;其次,金融、医疗和法律等监管严苛或本地化部署的系统,文件长且敏感,不能离开内部基础设施;最后,高吞吐量、成本敏感的管道,其中小型编码器作为大型模型前的廉价第一道处理。

Liquid AI还给出了上下文窗口的实际意义:8192令牌约等于13到15页内容,一次前向传播即可覆盖完整合同或完整病历。

为展示微调后的编码器效果,研究团队提供了五个演示,均在仅CPU的Hugging Face Spaces中运行,涵盖零样本提示路由、零样本策略检查、拼写检查、PII检测(支持16种语言的40种信息类型)以及一个掩码扩散演示(将编码器用作聊天机器人,通过迭代去掩码生成文本)。

使用指南

两款编码器通过transformers加载。模型体以Lfm2BidirectionalModel暴露,掩码LM加载使用Lfm2BidirectionalForMaskedLM。两者都通过auto_map连接,因此每次加载调用时需设置trust_remote_code=True。基本编码器产生通用表示而非任务输出,因此需要微调。Liquid AI的微调教程展示了在8K上下文配置下处理长法律文档的方法。模型选择建议:需要最高准确率时选用350M,硬件更受限或吞吐量要求更高时选用230M。