推荐这两个模型,Liquid AI 的新 encoder。
小参数下匹敌大模型质量——长文本 CPU 推理比 ModernBERT 快了数倍。
Liquid AI 在 7 月 28 日发布了两个新的 encoder 模型——LFM2.5-Encoder-230M 和 350M。核心卖点:在小参数下匹敌大模型的质量,上下文 8192 token 且延迟随输入长度增长缓慢,CPU 上比 ModernBERT-base 快约 3.7 倍。
架构
两个 encoder 从 LFM2 解码器主干初始化,然后做三步改造:双向注意力掩码(每个 token 看两边)、非因果短卷积(对称 padding)、30% token 的掩码语言建模训练。
两阶段训练:先用 1024 token 上下文做大语料 MLM,再扩展到 8192 token 强化事实、法律和多语言能力。
Benchmark
在 GLUE + SuperGLUE + 多语言分类共 17 个任务上,350M 版本排 14 个模型中的第 4 名,前 3 名都更大(最大一个 3.5B,近 10 倍参数)。230M 版本击败了 ModernBERT-base 和所有 EuroBERT 模型,参数量更小。
CPU 推理速度
最大的优势在 CPU 上。8192 token 输入时,ModernBERT-base 一次前向约 90 秒,LFM2.5-Encoder-230M 约 28 秒——约 3.7 倍快。这意味着你可以在笔记本 CPU 上 30 秒内扫描完一份完整合同、转录文本或长客服线程。
GPU 上的优势在长上下文时同样存在:短输入(<1000 token)ModernBERT 领先,长输入 LFM2.5-Encoders 反超。
实际用途
附带了 5 个 CPU-only 的 HuggingFace Space demo:零样本 prompt 路由、零样本策略检查、拼写纠正、40 种 PII 检测、掩码扩散文本生成(迭代 unmask 而非从左到右生成)。
两个模型都是开放权重,支持 transformers + Flash Attention 2。
模型:
博客:
#
Encoder# #
CPUInference# #
ONNX#