Jev要被开源模型干掉了 ?我来实测两个决策模型的能力,到底有没有吹牛?
Jev 实际上不应该跟LLM相比,要测就得找同一个生态位的对手!于是我找到了同样是决策模型的 FLock——一个超轻量级的决策模型,而且完全开源免费
为了不测垃圾数据,我从美国消费者金融保护局(CFPB)公开数据库摘了 1,000 条真实的真人长篇控诉(包含真实口语、愤怒投诉、维权错字以及乱码垃圾单),同时喂给这两个主打毫秒级决策的模型,实时分流到 15 个细分金融业务部门👇
左边:TypeSafe Jev(jev-latest)
右边:FLock(this-that-model-1.0)(开源免费)
─── 具体正确率表现如下 ───
• 日常核心业务 │ Jev: 90%~95% │ FLock: 85%~98%
(双方差距不大)
• 复杂长文过滤 │ Jev: 70%~100%│ FLock: 14%~61%(Jev占优)
• 决策时间对比 │ Jev:33.5 S │ FLock: 36.1S
(Jev占优)
• API响应速度 │ Jev: 368ms │ FLock: 405ms
(双方差距不大)
• 官方API 成本 │ Jev: $0.146│ FLock: $0
(Flock成本完胜)
────────────────────────
客观总结:
Jev
@typesafeai 在“复杂问题”表现更好: 只要你的业务涉及到多重逻辑交织的复杂长文本、严苛的垃圾噪音拦截、或是误判代价极高的核心环节,Jev 依然是定力最强的选择
FLock
@flock_io 免费开源,日常场景性价比无敌: 在占了 80% 以上的高频日常场景里,FLock 准确率稳在 85%~98%,完全够用了,重点的是它仅 2B 参数且开源免费,太厉害了,目前FLock 接API限时免费
同时也可以本地部署 FLock,完全不吃电脑配置:底层仅2 B 参数,一张普通 3060 显卡甚至苹果 MacBook(原生支持 MPS)就能直接拉起来。在消费级显卡上,它的本地推理延迟最低只有 约 31 毫秒...还可以做本地 LoRA 微调...这是JEV没有的优势,太香了🧐
@y95277777