注册并分享邀请链接,可获得视频播放与邀请奖励。

搜索结果 VLM
VLM 贴吧
一个关键词就是一个贴吧,路径全站唯一。
创建贴吧
用户
未找到
包含 VLM 的推特
我为什么反复强调VLM(multimodal,多模态)是死路一条,世界模型更是臭狗屎。 一个最简单的第一性原理,100k tokens文字的信息量,远远高于图片,更远远远远高于视频,这些量文字形式能解决一些超级复杂完备的问题,而对于VLM输入图片,信息极其稀疏,能解决的问题基本约等于狗几把。 如果人类在1T~10T的VLM Agent能解决一个难度为X的问题, 那么同等模型下,对应纯文字LLM Agent给足上下文、memory、wiki、信息,全部以pure text和structured data形式准备好,并且通过text/bash/cli/api/mcp形式获取信息,那么这个LLM Agent一定能解决难度为1000X的问题。 等到VLM强大到让一个VLM Agent解决难度为1000X的问题的时候,LLM Agent已经可以解决(1000^2) * X难度的问题了。 就这么简单一个道理,绝大多数人根本想不明白。
显示更多
0
64
150
13
转发到社区
这是什么高雅活动?
0
52
415
15
转发到社区
太硬了,太硬了,此时心里无文案 #少妇# #约炮#
0
4
5.2K
330
转发到社区
Claude通过原生消息传递获取用户位置,真的假的?
七夕夜,把她操到只属于你 3个限定私密女友 · 8.17-8.19 限时开放 打开就能操: #七夕# #女友#
X的手机端ui样式又改了 退出未编辑完的帖子的时候,删除和保存编辑页面改成这样了
是你吗?👀 Is that you? 👀
0
17
11
0
转发到社区
腾讯又挖来一位 OpenAI 核心研究员。 据多家媒体确认,OpenAI 前研究员田永龙(Yonglong Tian)已正式加入腾讯,将参与混元大模型相关研发,重点方向为 VLM(视觉语言模型)。 这也是继姚顺雨之后,腾讯引入的第二位 OpenAI 背景核心研究员。 更有意思的是,两人本身就是 OpenAI 老同事。如果后续传闻中的组织架构落地,腾讯混元的多模态能力很可能会迎来一次明显加强。 田永龙的履历也很硬: • 清华本科 • 香港中文大学 MMLab • MIT EECS 博士(Phillip Isola 组) • Google Research • Google DeepMind • OpenAI 他的研究方向长期聚焦于: Computer Vision Representation Learning 多模态模型 VLM / 对比学习(SupContrast 作者之一) 相比「又挖了一个 OpenAI」,我觉得更值得关注的是腾讯最近的人才布局。 姚顺雨更偏基础模型、Scaling 和 AI Infra;田永龙则长期深耕视觉和多模态。如果两人的职责最终按目前传闻落地,一个补基础模型,一个补 VLM,多模态拼图基本就齐了。 这也说明腾讯今年的重点,已经不只是追赶大语言模型,而是在补齐 Agent、GUI、视频理解、数字人等下一阶段 AI 应用最核心的能力。 国内大厂这波 AI 人才争夺战,越来越有意思了。
显示更多