註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

檢索結果 DeepSeekV4
DeepSeekV4 貼吧
一個關鍵字就是一個貼吧,路徑全站唯一。
建立貼吧
用戶
未找到
包含 DeepSeekV4 的搜尋結果
DeepSeekV4正式版计划于7月中旬正式上线。
在NewMax中,哪怕你使用deepseekV4 Flash这种性价比极高的模型 一样也能有很好的输出 这是套壳的价值
0
14
33
0
轉發到社區
魔法! DeepSeekV4 上下文内存压缩到1/10! 大家都知道 DeepSeekV4 是支持1M上下文的, 而且经过了极度优化, 如果要真的用到1M上下文, 显存占用只需要10G左右, (对比之下 DeepSeek-V3.2 大概需要84G显存). 然后我刚看到了FlashMemory这个论文, 直接能把显存占用压到 1.3GB! 甚至输出效果不降反升! 哥们你骗兄弟可以, 骗自己就没意思了, 真的吗? 压缩后反而性能上升? 我赶紧看了论文细节: 咱们先复习一下传统做法: 模型每吐出一个字,都要把之前的几十万字重新看一遍(这就是全局注意力). FlashMemory 的做法是: 预测未来需要什么, 它内置了一个神经内存索引器(Neural Memory Indexer, 其实就是个小模型了),能够主动预判接下来生成内容时需要用到历史文本里的哪些片段. 然后预先准备好这些片段, 接下来只要做到命中率超高, 那么这个提升就绝对有效. 即它的假设是, KVCache里面的东西并不是生成每个字的时候全都需要的, 只需要按需提前加载即可. 很像做作业的时候, 把参考资料摊满桌子, 然后优化了一下就是把参考资料需要用到的部分直接拍照, 用的时候看照片就行了. 那么听上去很简单, 但实际的难点在于, 训练一个专用的索引器小模型, 需要把 DeepSeek-V4模型加载到显存里一起炼. 相当耗费算力. 于是这篇论文第二个亮点来了, 它搞了个解耦训练. 他们把这个索引器当成一个标准的"双编码器(Dual-encoder,类似做搜索推荐的模型)"来单独训练. 在这个过程中,根本不需要把庞大的 DeepSeek-V4 基座模型加载到显存中. 这让训练成本断崖式下降,且兼容标准的检索(Retrieval)训练框架. (简单来讲就是它是通用方法训练的, 通过query预测需要检索哪些长句子. 所以其实是个通用模型) 听上去靠谱, 那也只是显存占用少了, 怎么就性能还提高了呢? 答案是注意力降噪. 因为每次只提取和当前生成最相关的记忆块(Chunks)放入显存,模型在运算时就看不见那些无关的冗余信息了.天然地起到了一种"去噪"作用,这也是为什么显存占用少了,模型准确率反而略微提升的原因.官方测试在长文本评测集(如 LongBench-v2 等)上的准确率平均最终提升了 0.6%. (其实还有数据如何逐出显存和如何预测数据实现预加载, 这部分也很棒, 很有启发性. 建议看原论文, 篇幅原因写不下了) 论文地址: 项目地址: #FlashMemory# #DeepSeekV4# #FlashMemoryDeepseekV4#
顯示更多
0
17
224
19
轉發到社區
王者归来?#DeepSeekV4# 已上架 HuggingFace,支持 1M 上下文窗口。 #DeepSeek#
说实话不显示名字,我认为 99% 的用户是分不清自己在用 opus5,gpt5.6,Kimi3,glm5.2,DeepSeekv4,grok4.5,Qwen 3.8 的。 模型性能的差距已经不像年初 opus4.6 秒杀一切的时候 普通人按照自己的需求和价格还有使用便利程度随意选择就行了。 重要的仍然是设计 context,loop 和 review 的能力 其中审美会是最重要的 如果你解决的问题本身没有价值,烧多少 token 都没有价值
顯示更多
又干没了! codex跟着我混可是一分钟都没闲着。 😌😌😌 最近又加上了deepseek, 最近两天烧了将近200块。 发现deepseekv4 pro也很好用, 特别是在跑ai交易上~~
顯示更多
0
31
19
0
轉發到社區
给大家带来 Flash 系列模型横评! 各个厂商除了旗舰级别模型, 也都有Flash级别的模型, 而这些模型的定位主要都是多智能体系统的驱动模型和RAG系统的驱动模型. 那么现有这些Flash模型应该怎么选? 给大家带来本篇评测! 本次主要从 Agent Loop 迭代能力, Agent 能力, 前端, 后端, 空间理解, 美学, 性价比等多个角度评测了 Gemini-3.5-Flash, Step-3.7-Flash, DeepSeek-V4-Flash 这三个模型. 从测试来看, Gemini-3.5-Flash 更适合干"漂亮活", 比如前端页面, 建模等. 而 Step-3.7-Flash 则极具性价比, 在Agent测试中取得了比旗舰模型还要高的Token效率(用最少的token干最多的事情). 所以特别适合用在Agent框架中(比如OpenClaw或者Hermes), 或者复杂的Agent系统中用来做驱动模型. DeepSeek-V4-Flash 则后端能力很不错, 很适合用来写脚本, 甚至给服务器安装一个 DeepSeek-V4-Flash 驱动的 ClaudeCode, 用来 AI-Ops. #flash模型# #step37flash# #deepseekv4flash# #gemini35flash# #AgentLoop#
顯示更多
Deepseek V4 Pro 发布了,回归梁圣周期🫡
DeepSeek-V4-Pro 正式版可能已经开始切换。DeepSeek 官方 API 文档悄悄把模型版本从原来的 DeepSeek-V4-Pro 改成 DeepSeek-V4-Pro-0813。调用名称仍是 `deepseek-v4-pro`,上下文为 1M,最大输出 384K,Responses API 现在也已经标为支持。
顯示更多
DeepSeek V4 Flash 0731:推理能力追上大厂,成本却只要 4 美分 DeepSeek V4 Flash 0731 在在抽象推理测试中达到 61.4% 准确率(ARC-AGI-2),每次任务成本 4 美分,比 OpenAI、Anthropic 等闭源模型便宜 10 倍以上。 这验证了一个关键判断:开源模型通过"推理时计算"路线,正在用更低成本逼近大厂性能。
顯示更多