注册并分享邀请链接,可获得视频播放与邀请奖励。

搜索结果 SuperELLE
SuperELLE 贴吧
一个关键词就是一个贴吧,路径全站唯一。
创建贴吧
用户
未找到
包含 SuperELLE 的推特
@Supervellear 我发现老师这套方法特别有价值,逻辑清晰又接地气,学了之后收获很大。什么时候咱们可以整理一下
#深圳# 身高:178 体重:108斤 胸围:E(纯天然) 年龄:04年 SUPERMll星力签约 模特,超气质女神 皮肤水嫩白皙光滑,全身无熬肉,无纹身
推荐这两个模型,Liquid AI 的新 encoder。 小参数下匹敌大模型质量——长文本 CPU 推理比 ModernBERT 快了数倍。 Liquid AI 在 7 月 28 日发布了两个新的 encoder 模型——LFM2.5-Encoder-230M 和 350M。核心卖点:在小参数下匹敌大模型的质量,上下文 8192 token 且延迟随输入长度增长缓慢,CPU 上比 ModernBERT-base 快约 3.7 倍。 架构 两个 encoder 从 LFM2 解码器主干初始化,然后做三步改造:双向注意力掩码(每个 token 看两边)、非因果短卷积(对称 padding)、30% token 的掩码语言建模训练。 两阶段训练:先用 1024 token 上下文做大语料 MLM,再扩展到 8192 token 强化事实、法律和多语言能力。 Benchmark 在 GLUE + SuperGLUE + 多语言分类共 17 个任务上,350M 版本排 14 个模型中的第 4 名,前 3 名都更大(最大一个 3.5B,近 10 倍参数)。230M 版本击败了 ModernBERT-base 和所有 EuroBERT 模型,参数量更小。 CPU 推理速度 最大的优势在 CPU 上。8192 token 输入时,ModernBERT-base 一次前向约 90 秒,LFM2.5-Encoder-230M 约 28 秒——约 3.7 倍快。这意味着你可以在笔记本 CPU 上 30 秒内扫描完一份完整合同、转录文本或长客服线程。 GPU 上的优势在长上下文时同样存在:短输入(<1000 token)ModernBERT 领先,长输入 LFM2.5-Encoders 反超。 实际用途 附带了 5 个 CPU-only 的 HuggingFace Space demo:零样本 prompt 路由、零样本策略检查、拼写纠正、40 种 PII 检测、掩码扩散文本生成(迭代 unmask 而非从左到右生成)。 两个模型都是开放权重,支持 transformers + Flash Attention 2。 模型: 博客: #Encoder# #CPUInference# #ONNX#
显示更多
重磅,雷总又来整顿市场了 MiMo-V2.5 全系最高降 99%,今日生效。输入 ¥3,输出 ¥6,缓存 ¥0.025 MiMo 额外砍了两刀:Token Plan 加量 5-8 倍,已耗额度全部重置;TTS 语音合成限时免费 智力上,DeepSeek V4 Pro 是标准学霸,SuperCLUE 总分第一,数学知识样样精通。但致命伤是幻觉率高达 94%,不懂也硬编,做研究得逐句验证。 MiMo-V2.5-Pro 是工程偏科天才。SWE-bench Pro 代码实测 57.2%,与 GPT-5.4、Claude opus4.6持平;全球开源 Agent 能力第一。实测 4.3 小时自主写完编译器,11.5 小时独立完成视频编辑器,零人工干预。 总之大家有福了,deepseek写代码可能还不那么聪明,但是mimo这个价格是真的可以玩了。
显示更多