TwiScan
熱門
社區
帳號集合
登入
註冊
English
日本語
한국의
简体中文
繁体中文
註冊並分享邀請連結,可獲得影片播放與邀請獎勵。
立即註冊
Eric Xu (e/Mettā)
@xleaps
polymath, polyglot, root of a ternary tree. building prev
@Meta
@Google
@Reddit
phd in classic ai; rookie pilot 🛩️; martial artist
加入 January 2007
3.7K
正在關注
35.3K
粉絲
Eric Xu (e/Mettā)
@xleaps
2026.08.02 13:58
科普一下“多模态”的具体含义。 首先,我们虽然不认为盲人有“智力”上的缺陷,但不会因此让盲人靠听收音机去驾驶汽车。因为有些模态比如视觉,不是其他模态(文字或者语音)能够简单取代的。这里面有一个人择原理:即使最终在 AI 内大家都是 token, 但人类选择了用红灯而非多普勒雷达构建了整个交通系统,也选择了用 2D 屏幕而非字节流表达计算机操作,因此 AI 为了在现实世界和数字世界中完成任务,必须接受人类已经接受的模态和输入。 多模态是个被滥用了的词。模型多模态输入有利于内部更好的表示这个人择的世界,特别是视觉信号,可以帮助模型 grounding ,比如“红灯”它到底是一个什么样的信号, 在语义上毫无问题,但在开车场景里要接近人择的感知和推理,才能更加准确的表征人择世界的模型——这个世界上不存在客观的世界模型,都是人择的。 即是是纯粹追求虚幻的 AGI 目标,就以长程任务为标尺, DeepSeek 要做的长程任务,持续学习,最终也都绕不过多模态,特别是人择世界的视觉信号。一个很明显的例子就是盲人不能够仅靠语言,不依赖计算机屏幕,来操作针对视觉无碍者设计的计算机,很好完成长程计算机操作任务。 AI 也会在这种选择压力下,迫使 tokenize 人择的数字视觉信号。 DeepSeek 不愿意在 AGI 的路上做多模态的输出,和 Anthropic 的方向是一样的。因为多模态输出更多是一个工程问题,牵涉到如何构建扩散或者 flow match 模型,如何让输出的分布不塌陷到平均期望上,如何保障多步输出的一致性——在通往 AGI 路上这些都是垂直的任务,可以被通用的 AI 模型一句话调用,因此可以从通用智能里外化掉。 DeepSeek 放出一个只支持 text 输入的模型不代表 DeepSeek 就死死抱住 text-only 不放。实际上 DeepSeek 的非 API , 非开放权重版本是可以处理视觉信号的,而且许多我知道的企业应用里,都有人在试图给 DeepSeek 嫁接一个 ViT.
顯示更多
JUNDE WU
@JundeMorsenWu
2026.08.01 19:16
怎么还是有这么多人没懂 多模态对实现AGI真的不重要 这已经是业内两三年前的共识了 你见到盲人影响他们智力了吗 多模态是一种能力,不是一种智力 就像有的人反应快,有的人手很巧,有的人空间感很强 这些都是能力,但我们不会说有这些能力就很聪明 本质上来说,图像带来的大部分语义信息已经被压缩成语言了,剩下的像素信息对于实现机器人来说是重要的,但是一个会洗衣服,会做菜的机器人不代表他很聪明,实现了AGI,这些是能力不是智力 这就是为什么所有serious的AGI公司都在做coding和math,因为解决这些问题代表智力,解决好这些问题就离AGI更近了一步
顯示更多
0
0
23
175
23
轉發到社區
熱門用戶
New York Post
@nypost
4.1M 粉絲
Reuters
@Reuters
26.3M 粉絲
一劍浣春秋
@chee828
230.5K 粉絲
Hello! Project Link
@UpFrontLink
15.5K 粉絲
是你的KK
@KKLOVQ
212.1K 粉絲
Pop Base
@PopBase
6.5M 粉絲
First Squawk
@FirstSquawk
556.2K 粉絲
MLB
@MLB
13.6M 粉絲
JO KWON
@2AMkwon
976.9K 粉絲
Bitget中文
@Bitget_zh
109.7K 粉絲
モデルプレス
@modelpress
1.8M 粉絲
Binance
@binance
16.1M 粉絲
AB Kuai.Dong
@_FORAB
139.5K 粉絲
Forbes
@Forbes
20.3M 粉絲
追风Lab .eth🌿
@ZF_lab
107K 粉絲