DeepSeek 多模态大语言模型的论文《Thinking with Visual Primitives》已经公开
底座是 DeepSeek-V4-Flash,MoE架构,总参数量 284B,激活参数量 13B。
自研 DeepSeek‑ViT 视觉编码模型,14×14 patch,输出后 3×3 空间压缩,再接入 LLM。
模型在回答时不仅进行文字推理,还会同时通过画框、打点等“视觉原语”进行思考。
在极低的 Token 成本下,其效果能和 GPT-5.4、Claude 以及 Gemini 在一些前沿指标上对齐,甚至有的指标能反超。
显示更多
Cua开源多模态操作模型:轻量模型辅助决策
开源4B参数模型Cua-S1-4B-0.2,专门通过识别屏幕画面和任务目标来直接执行电脑操作。该模型在真实系统环境中通过任务完成奖励进行强化学习训练,无需依赖软件底层的无障碍结构。在168项GUI基准测试中,其任务完成率达到92.9%,大幅超过未训练基线模型的60.1%。
模型:
显示更多
Deepseek正式推出多模态模型!
DeepSeek-V4-Flash-Vision-Exp
🔹 它在文本、代理、推理和世界知识能力上与 DeepSeek-V4-Flash 相当。
🔹 在多模态代理基准测试上,相对于 V4-Flash 实现了重大飞跃,多模态代理性能接近 Opus-4.8。
显示更多
过去半年的 Seed:多模态领先、大语言追赶
过去半年,Seed 的多模态模型取得了显著成绩:今年 2 月上线的视频生成模型 Seedance2.0 和图片生成模型 Seedream 5.0 Lite 声量一度超过业内其他同类模型,迅速引发关注。Seedance2.0 成为火山引擎 MaaS 业务营收的基本盘。
同期发布的语言模型 Seed 2.0,市场反响却较为有限。它一度因较好承接春节期间涌入的 C 端需求,在内部获得好评。但春节大战中,Anthropic 凭借 Opus 系列的 Coding 能力迅速打开程序员和 B 端市场,ARR 很快逼近并反超 OpenAI。中国大厂这才意识到,自己错过了 Coding 的窗口期。与此同时,GLM-5 和 Kimi K2.5 的 Coding 能力也已明显领先。
模型能力的落后影响到了收入端。据我们了解,火山引擎目前是国内最大的模型 API 卖家,市场份额约占一半。火山引擎 2025 年的收入在 150 亿元左右,今年内部定下的目标是超 400 亿元。目标虽大,但并非没有隐忧。
火山引擎的 token 消耗能反应商业化的增长。多位接近火山引擎人士告诉我们,豆包大模型的 token 消耗中,超过一半来自 Seedance 和 Seedream 两个多模态生成模型系列,语言模型占比不高。
二季度以来,随着短剧行业增长见顶、经济大环境的变化,Seedance 的 token 消耗和收入增速放缓,并影响了火山 MaaS 的整体 token 增长——豆包大模型的 token 消耗,3 月为 120 万亿,6 月为 180 万亿,低于原计划的 250 万亿至 300 万亿目标。
智谱和月之暗面凭借持续提升的 Coding 能力,ARR 分别突破 10 亿美元和 3 亿美元。
为补课 Coding 能力,张一鸣亲自邀请,高薪吸引 DeepSeek 核心研究员郭达雅加入 Seed,负责模型 Coding 能力的专项训练。字节将 Coding 相关的研发资源收拢整合,统一划归给郭达雅。同期阿里千问基模团队也投入更多资源和人力专攻 Coding 训练。
训练好的模型更重要的是数据。大公司可以凭借推动内部业务线使用自研模型做开发,形成真实场景反馈数据。但仅有这些还不够。
我们了解到,Seed 内部曾激烈讨论过蒸馏路线的可行性,字节高层则担心蒸馏对 Seed 和技术带来的危害。据 The information,张一鸣在 Seed 的 all hands 会议上明确表示,即使不蒸馏意味着公司在技术上会短暂落后国内竞争对手,也不会采用这一捷径来推进其 AI 模型能力。
8 月 6 日,字节跳动举行公司全员会。豆包负责人赵祺在会称,大模型的市场潜力很大,因此不担心经济回报,但收入还是重要的。
在模型研发上,字节拥有国内最充足的算力储备、业内领先的基础设施能力和高密度的人才队伍,这些构成了它的底气。Seedance 的成功也让字节看到,模型能力一旦领先,便能迅速转化为商业护城河。
一位字节人士说,Seedance 证明,用户会自然流向能力最强的产品。只要能在关键节点做到行业第一,就有机会快速抢占市场,因此不必过度焦虑于短期的排名落后。
显示更多
【腾讯合并混元多模态和大语言模型部门 姚顺雨带队】7月23日下午,腾讯宣布合并两个模型团队:整合混元多模态模型部门与大语言模型部门,成立基础模型部,统一由腾讯首席AI科学家姚顺雨管理。腾讯称,这是为了进一步提升模型研发和协同效率,探索全模态模型的智能上限。
显示更多
冷知识:
目前多模态大模型创业的具体落地方向通常有如下方向,如果都不是你感兴趣的话,还是别赶时髦,乖乖回去学AI coding吧 :
1. 游戏 AI NPC / 智能体中间件(如端云协同的 OmniNPC,赋能 3D 角色交互与情感叙事)
2. 企业级多模态 Agent(如面向复杂文档、视觉流分析、跨系统 RPA 的智能体)
3. 多模态内容生成与创意工具(如 AI 视频、短剧生成、电商营销图视频设计)
4. 具身智能与机器人控制(如基于多模态物理感知与动作生成的端到端控制系统)
5. 视觉/多模态代码与设计助手(如 UI 截图一键生成高质量代码、交互式产品设计)
显示更多
Deepseek 的多模态模型全量了。
目前可以在网页版的识图模式尝试,看起来是一个单独的多模态模型
DeepSeek Harness发新版本:增强多模态能力能力
小短板被补上了
我为什么反复强调VLM(multimodal,多模态)是死路一条,世界模型更是臭狗屎。
一个最简单的第一性原理,100k tokens文字的信息量,远远高于图片,更远远远远高于视频,这些量文字形式能解决一些超级复杂完备的问题,而对于VLM输入图片,信息极其稀疏,能解决的问题基本约等于狗几把。
如果人类在1T~10T的VLM Agent能解决一个难度为X的问题,
那么同等模型下,对应纯文字LLM Agent给足上下文、memory、wiki、信息,全部以pure text和structured data形式准备好,并且通过text/bash/cli/api/mcp形式获取信息,那么这个LLM Agent一定能解决难度为1000X的问题。
等到VLM强大到让一个VLM Agent解决难度为1000X的问题的时候,LLM Agent已经可以解决(1000^2) * X难度的问题了。
就这么简单一个道理,绝大多数人根本想不明白。
显示更多