註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

檢索結果 DeepSeekV4
DeepSeekV4 貼吧
一個關鍵字就是一個貼吧,路徑全站唯一。
建立貼吧
用戶
未找到
包含 DeepSeekV4 的搜尋結果
DeepSeekV4正式版计划于7月中旬正式上线。
梁文锋又来屠城,deepseekv4.1flash降低了1/4hbm用量需求, 继续大幅降价,实行了闲时半价,把我的minimax干地板了。 性能上以超越gpt5.6sol的性能卖着白菜的价格。
顯示更多
0
22
256
16
轉發到社區
在NewMax中,哪怕你使用deepseekV4 Flash这种性价比极高的模型 一样也能有很好的输出 这是套壳的价值
0
14
33
0
轉發到社區
魔法! DeepSeekV4 上下文内存压缩到1/10! 大家都知道 DeepSeekV4 是支持1M上下文的, 而且经过了极度优化, 如果要真的用到1M上下文, 显存占用只需要10G左右, (对比之下 DeepSeek-V3.2 大概需要84G显存). 然后我刚看到了FlashMemory这个论文, 直接能把显存占用压到 1.3GB! 甚至输出效果不降反升! 哥们你骗兄弟可以, 骗自己就没意思了, 真的吗? 压缩后反而性能上升? 我赶紧看了论文细节: 咱们先复习一下传统做法: 模型每吐出一个字,都要把之前的几十万字重新看一遍(这就是全局注意力). FlashMemory 的做法是: 预测未来需要什么, 它内置了一个神经内存索引器(Neural Memory Indexer, 其实就是个小模型了),能够主动预判接下来生成内容时需要用到历史文本里的哪些片段. 然后预先准备好这些片段, 接下来只要做到命中率超高, 那么这个提升就绝对有效. 即它的假设是, KVCache里面的东西并不是生成每个字的时候全都需要的, 只需要按需提前加载即可. 很像做作业的时候, 把参考资料摊满桌子, 然后优化了一下就是把参考资料需要用到的部分直接拍照, 用的时候看照片就行了. 那么听上去很简单, 但实际的难点在于, 训练一个专用的索引器小模型, 需要把 DeepSeek-V4模型加载到显存里一起炼. 相当耗费算力. 于是这篇论文第二个亮点来了, 它搞了个解耦训练. 他们把这个索引器当成一个标准的"双编码器(Dual-encoder,类似做搜索推荐的模型)"来单独训练. 在这个过程中,根本不需要把庞大的 DeepSeek-V4 基座模型加载到显存中. 这让训练成本断崖式下降,且兼容标准的检索(Retrieval)训练框架. (简单来讲就是它是通用方法训练的, 通过query预测需要检索哪些长句子. 所以其实是个通用模型) 听上去靠谱, 那也只是显存占用少了, 怎么就性能还提高了呢? 答案是注意力降噪. 因为每次只提取和当前生成最相关的记忆块(Chunks)放入显存,模型在运算时就看不见那些无关的冗余信息了.天然地起到了一种"去噪"作用,这也是为什么显存占用少了,模型准确率反而略微提升的原因.官方测试在长文本评测集(如 LongBench-v2 等)上的准确率平均最终提升了 0.6%. (其实还有数据如何逐出显存和如何预测数据实现预加载, 这部分也很棒, 很有启发性. 建议看原论文, 篇幅原因写不下了) 论文地址: 项目地址: #FlashMemory# #DeepSeekV4# #FlashMemoryDeepseekV4#
顯示更多
0
17
224
19
轉發到社區
王者归来?#DeepSeekV4# 已上架 HuggingFace,支持 1M 上下文窗口。 #DeepSeek#
说实话不显示名字,我认为 99% 的用户是分不清自己在用 opus5,gpt5.6,Kimi3,glm5.2,DeepSeekv4,grok4.5,Qwen 3.8 的。 模型性能的差距已经不像年初 opus4.6 秒杀一切的时候 普通人按照自己的需求和价格还有使用便利程度随意选择就行了。 重要的仍然是设计 context,loop 和 review 的能力 其中审美会是最重要的 如果你解决的问题本身没有价值,烧多少 token 都没有价值
顯示更多
又干没了! codex跟着我混可是一分钟都没闲着。 😌😌😌 最近又加上了deepseek, 最近两天烧了将近200块。 发现deepseekv4 pro也很好用, 特别是在跑ai交易上~~
顯示更多
0
31
19
0
轉發到社區
给大家带来 Flash 系列模型横评! 各个厂商除了旗舰级别模型, 也都有Flash级别的模型, 而这些模型的定位主要都是多智能体系统的驱动模型和RAG系统的驱动模型. 那么现有这些Flash模型应该怎么选? 给大家带来本篇评测! 本次主要从 Agent Loop 迭代能力, Agent 能力, 前端, 后端, 空间理解, 美学, 性价比等多个角度评测了 Gemini-3.5-Flash, Step-3.7-Flash, DeepSeek-V4-Flash 这三个模型. 从测试来看, Gemini-3.5-Flash 更适合干"漂亮活", 比如前端页面, 建模等. 而 Step-3.7-Flash 则极具性价比, 在Agent测试中取得了比旗舰模型还要高的Token效率(用最少的token干最多的事情). 所以特别适合用在Agent框架中(比如OpenClaw或者Hermes), 或者复杂的Agent系统中用来做驱动模型. DeepSeek-V4-Flash 则后端能力很不错, 很适合用来写脚本, 甚至给服务器安装一个 DeepSeek-V4-Flash 驱动的 ClaudeCode, 用来 AI-Ops. #flash模型# #step37flash# #deepseekv4flash# #gemini35flash# #AgentLoop#
顯示更多
DeepSeek机器学习系统工程师刘胜与发表一篇个人感想,谈AI的快速进步所带来的危机感。 作为DeepSeek V4.1模型核心组件的开发人之一,刘胜与判断,再过半年到一年,AI写算子的能力大概率就会和他写得同样优秀,甚至将他超越。届时,他不至于”失业“,但必须要”转业“,去做”机甲驾驶员“(指在智能体工作流中扮演的协作、监督与引导角色)。”我不得不把才华埋葬在昨天“,他感叹道。 刘胜与还对现在的学生利用AI完成作业,继而导致自身的工程能力严重不足表示担忧。他还谈到少数科技公司控制世界上最先进的AI可能导致的后果,其中包括只有极少数人能够使用最先进的 AI 和各式科技,并呼吁”最前沿的智能应该以一种开放、廉价的方式供应给所有人。“ 刘胜与的文章发表后迅速在微信公众号获得 10 万 + 的阅读量,并在知乎冲上热榜第一。刘胜与次日再次发文表示,他并非要表达对失业的焦虑,而是想和自己过去手写算子的那段时光说句再见。 你怎么看AI带来的危险与机遇?
顯示更多
DeepSeek-V4.1-Flash 八卡H20 实测来了,一起看下552B 参数加 196B Engram 参数的模型在SGLang运行结果 启动参数: sglang serve --model-path /model --served-model-name deepseek-v41-flash --tp 8 --ep-size 8 --context-length 32768 --max-running-requests 32 --mem-fraction-static 0.85 --attention-backend dsv4 --moe-runner-backend flashinfer_mxfp4 --reasoning-parser auto --tool-call-parser auto --enable-metrics --disable-radix-cache --host 0.0.0.0 --port 30000 测试方法: 核心矩阵为 1,024/128、8,192/128、1,024/512、24,576/128 Token,各测 C1、C8、C32,每组单独预热后正式重复三轮。各轮请求数分别为 8、16、64。C 是客户端并发上限,服务端最大运行序列也是 32 和历史V4测试对比结果: DeepSeek-V4.1-Flash 结果稍快一点,但开始回答之后,输出速度比 DeepSeek-V4-Flash 慢,整体吞吐也更低,实际token/s 速度达不到DeepSeek API 中V4.1三倍提升的效果🤣
顯示更多