Flash 0731 用下来还是笨笨的
我是说干活还可以
但是缺少思考
经常干完了发现个一开始就能发现的大问题。。。
DeepSeek Flash 还挺让人意外的。。。
我以为这种小模型没啥独立思考能力,结果完全不谄媚,还跟我较劲...
而且速度真是快啊,快得可以让你原谅它的缺点
显示更多
deepseek flash 给人的感觉就是快,速度非常快,有当年的groq 的感觉。
Gemini flash 3.5 昨晚发布,现已可用。
- 模型效果大幅超越 3.1 Pro,指标和 gpt 5.5 接近,比 gpt5.5 好的是 Agentic 和 多模态。
- 价格只要 gpt5.5 的三分之一,缓存价格只要六分之一。
- API 定价 $1.50 / $9.00 per 1M token(输入/输出),缓存 输入 $0.15。上下文窗口 1M token。
- 速度极快,是其他旗舰模型的4倍,非常适合 Agent 使用。
官方介绍地址:
显示更多
DeepSeek-V4.1-Flash 八卡H20 实测来了,一起看下552B 参数加 196B Engram 参数的模型在SGLang运行结果
启动参数:
sglang serve --model-path /model --served-model-name deepseek-v41-flash --tp 8 --ep-size 8 --context-length 32768 --max-running-requests 32 --mem-fraction-static 0.85 --attention-backend dsv4 --moe-runner-backend flashinfer_mxfp4 --reasoning-parser auto --tool-call-parser auto --enable-metrics --disable-radix-cache --host 0.0.0.0 --port 30000
测试方法:
核心矩阵为 1,024/128、8,192/128、1,024/512、24,576/128 Token,各测 C1、C8、C32,每组单独预热后正式重复三轮。各轮请求数分别为 8、16、64。C 是客户端并发上限,服务端最大运行序列也是 32
和历史V4测试对比结果:
DeepSeek-V4.1-Flash 结果稍快一点,但开始回答之后,输出速度比 DeepSeek-V4-Flash 慢,整体吞吐也更低,实际token/s 速度达不到DeepSeek API 中V4.1三倍提升的效果🤣
显示更多
鉴于 DS V4.1 Flash 模型在性能、费用、速度、总用时等各项指标上都全面超越了 V4 Pro。再以更高的价格、更慢的速度和更多的算力消耗给 DS 用户提供原有的性能较差的 V4 Pro 模型会不太合适。V4.1 Flash 正式上线之后,V4.1 Pro 上线之前,V4 Pro 模型的请求都会被路由到 V4.1 Flash,并按 Flash 的价格计费。
显示更多
DeepSeek下调flash系列模型定价,降幅11%-60%
DeepSeek开放平台今日公告,将于9月10日12:00起,调整flash系列定价:空闲时段输入缓存命中单价0.02元、输入缓存未命中单价1元,输出单价4元;高峰时段价格为空闲时段价格的2倍。
高峰时段是指北京时间周一至周五9:00-12:00、14:00-18:00(其余为空闲时段)。据悉,缓存命中、缓存未命中及输出价格最高降幅分别为60%、33.33%和11.11%。
显示更多
DeepSeek V4.1 Flash 已超前上线 Cola
欢迎体验
目前资源比较紧张
属于 beta 状态
DeepSeek 首次支持原生多模态
可以试试
Astra 已经证明了原生多模态的价值
用Gemini 3.8 flash的感觉,就像喜欢上一种饮料。本来想着慢慢喝,结果越喝越顺口,越喝越快,转眼就见底了。😂