註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

杀马特宅主
@Maxwell_SCU
码农,神经生物学,数学爱好者,我老婆炒股很厉害
加入 December 2016
1.2K 正在關注    13.6K 粉絲
说到“词元”的来历,最关键的是理解 Transformer 模型。Transformer 模型本质上是一种用于描述概率转移的数学结构。 什么是概率转移? 简单来说,就是我们在输入上一个字并预测下一个字时,它们之间存在着特定的概率关系。例如,“父”字后面接“亲”、“母”或“兄”的概率非常高,但如果接“鱼”、“猫”、“狗”,概率就会变得极低。我们可以通过这种概率转移机制来模拟人类语言。不过,单纯依靠低阶的概率转移很难得到有意义的结果。只有当我们把人类所有有价值的语言作为上下文背景,进行概率统计计算并构建起高维矩阵模型,再结合多头注意力机制(Multi-Head Attention)去捕获长距离的上下文依赖时,模型才能够输出逻辑连贯、甚至富有智慧的内容。 在这一计算过程中,我们把高维连续向量空间与离散输入输出序列之间的最小离散映射单位,定义为一个 Token。 由于 Transformer 模型不光是可以用来描述语言,所有的离散化之后的以一定概率进行转移的模型都可以进行描述。比如说,我们把图像分成一系列的色块,这些色块之间有意义的转移就会构成特定的图像,这个也是 Transformer,再比如说,我们还可以用 Transformer 来描述机器人的一系列动作,一系列的空间映射关节的活动。 一句话,Token 绝不仅仅是用来描述语言的。 以具身智能模型为例,其动作空间同样被进行了离散化处理。当我们控制机器人去完成“拿起一支笔”或“拿起一个茶杯”的动作时,并不需要过度纠结中间每一个微观动作过渡得有多么精确,只要这一连串动作序列整体执行完毕并达成目标即可,这样反而能让机器人的控制更具灵活性。这和我们表达同样的意思可以用不同的语句是一个道理。 如果在这些非语言场景中,如果我们依然把 Transformer 处理的各类基本单元都统称为“词元”,在语义上就会产生明显的概念错配,这是完全没有必要的。 在纯文本的自然语言处理中,用“词元”来表达 Token 或许尚可接受;但一旦延伸到多模态和具身智能领域,这种说法就不再适用了。事实上,在通用人工智能(AGI)时代,“词元”这种译法很快就会被淘汰。在这种情况下,如果硬要把一个单纯的术语翻译问题与所谓的“科技话语权”强行联系起来,是会出大问题的。 通过行政命令,让所有的科技工作者,用一种不恰当的说法来进行特定的科技概念的描述。这是一种经不起历史检验的语言污染。最终会损害喜好这样的一些什么搞科技话语权的这样一些人物的历史名声。
顯示更多