基于 Transformer 架构的 LLM 最大的问题就是没有时间感,我觉得这是主观智能甚至是意识到重要部分,时间的连续感知和记忆的先后形成了“自我”!每次涉及到Agentic 任务我都得让模型自己使用 tool 确定操作时间,别让它靠幻觉脑补😂 不知道我这样对不对?
顯示更多
想搞懂 Transformer 到底怎么运转的,翻教程不是一行代码调完接口,就是直接甩来 40 页论文。
how-to-train-your-gpt 是一本 12 章、7500 多行的教材,带着从零写出一个 LLaMA 3 那套架构的语言模型。
分词器、嵌入层、注意力、训练循环、推理引擎,每一部分都自己动手写,每行代码都注了是什么和为什么。
GitHub:
另配 28 篇专题拆细节,RoPE 怎么用旋转表达相对位置、KV 缓存省在哪、混合精度是怎么回事,都单独讲。
还有两篇走查,跟着一句话从进模型到出结果走一遍,中间每一步的数字都摆出来。
最后能训出一个 151M 参数的模型,配了 Colab 笔记本,不用自己折腾环境。
作者在开头写了句实话,说做这个是因为自己一直没吃透注意力那部分,边学边写。
学习需要一点 Python 基础,微积分和线性代数这些不用。在注意力那一章卡住过的朋友,可以从这份重新走一遍。
顯示更多
看完 Transformer 论文和科普视频,很多人还是不知道 GPT 训练时到底在跑什么代码。
这个项目从零实现了一个现代LLM,注意力机制、位置编码、LayerNorm、残差连接、训练循环、学习率调度,每个模块独立成文件,每一行代码都配了注释说明原理和意图。学完不是会调包,而是真正理解矩阵层面在发生什么。
它适合想深入 LLM原理的初学者,或者实践经验有余但底层知识有缺口的开发者,把"大概懂"进一步推进到"每一行都懂"。
顯示更多
Google 最先提出了了 Transformer 然后又重新发现了 MoE,并且最早设计了 AI 专用芯片 TPU,为什么现在会落后于两家 startup?
说到“词元”的来历,最关键的是理解 Transformer 模型。Transformer 模型本质上是一种用于描述概率转移的数学结构。
什么是概率转移? 简单来说,就是我们在输入上一个字并预测下一个字时,它们之间存在着特定的概率关系。例如,“父”字后面接“亲”、“母”或“兄”的概率非常高,但如果接“鱼”、“猫”、“狗”,概率就会变得极低。我们可以通过这种概率转移机制来模拟人类语言。不过,单纯依靠低阶的概率转移很难得到有意义的结果。只有当我们把人类所有有价值的语言作为上下文背景,进行概率统计计算并构建起高维矩阵模型,再结合多头注意力机制(Multi-Head Attention)去捕获长距离的上下文依赖时,模型才能够输出逻辑连贯、甚至富有智慧的内容。
在这一计算过程中,我们把高维连续向量空间与离散输入输出序列之间的最小离散映射单位,定义为一个 Token。
由于 Transformer 模型不光是可以用来描述语言,所有的离散化之后的以一定概率进行转移的模型都可以进行描述。比如说,我们把图像分成一系列的色块,这些色块之间有意义的转移就会构成特定的图像,这个也是 Transformer,再比如说,我们还可以用 Transformer 来描述机器人的一系列动作,一系列的空间映射关节的活动。
一句话,Token 绝不仅仅是用来描述语言的。
以具身智能模型为例,其动作空间同样被进行了离散化处理。当我们控制机器人去完成“拿起一支笔”或“拿起一个茶杯”的动作时,并不需要过度纠结中间每一个微观动作过渡得有多么精确,只要这一连串动作序列整体执行完毕并达成目标即可,这样反而能让机器人的控制更具灵活性。这和我们表达同样的意思可以用不同的语句是一个道理。
如果在这些非语言场景中,如果我们依然把 Transformer 处理的各类基本单元都统称为“词元”,在语义上就会产生明显的概念错配,这是完全没有必要的。
在纯文本的自然语言处理中,用“词元”来表达 Token 或许尚可接受;但一旦延伸到多模态和具身智能领域,这种说法就不再适用了。事实上,在通用人工智能(AGI)时代,“词元”这种译法很快就会被淘汰。在这种情况下,如果硬要把一个单纯的术语翻译问题与所谓的“科技话语权”强行联系起来,是会出大问题的。
通过行政命令,让所有的科技工作者,用一种不恰当的说法来进行特定的科技概念的描述。这是一种经不起历史检验的语言污染。最终会损害喜好这样的一些什么搞科技话语权的这样一些人物的历史名声。
顯示更多
DSH 是技术自嗨的巅峰之作
从某种意义上来说 Transformer 也是
发现 Token 的翻译「词元」总用得不太顺,对于不了解 Transformer 的人来说,也很难将其字面意思和「人工智能」联系在一起。不如将 Token 翻译成 「仝(tóng)根」。「仝」字上「人」下「工」,合起来就是「人工」;「根」即最基本的、根源的意思。「仝根」读音和 Token 较像,意思也到位,算是做到了信达雅。并且「仝」比「词元」更有意思些,让人一眼就能联想到人工智能。顺着这个思路,人工智能以后是不是也可以简称 「仝智」?同志们觉得如何?(主要还是因为福建人常被笑把「词元」读成「词云」😂)
顯示更多
Google 几周之内连丢了三位改写 AI 历史的人物——Transformer 发明者去了 OpenAI,诺贝尔奖得主去了 Anthropic,AlphaGo 缔造者去创业了。最耐人寻味的是,他们没有去同一个地方。录了一期视频分析背后的原因。
顯示更多
🖌️ 百度把自家的文生图模型开源了,权重直接放出来
80 亿参数的单流扩散 Transformer,GenEval 总分 0.8856
国内能拿到开放权重的文生图模型本来就不多,能把中文长文本渲染好的更少。想在图里放一句中文标语,出来经常是缺笔画的字符。
ERNIE-Image 在这块的成绩不错,LongTextBench 中英文平均分拿到 0.9733。它放了两个版本:标准版推理 50 步、CFG 4.0,追求质量;Turbo 版经过 DMD 和强化学习优化,8 步、CFG 1.0 就能出图,快得多。
生态接得也够全:Diffusers 和 SGLang 支持调用部署,ComfyUI 有 Turbo 版工作流模板,Unsloth 能构建 GGUF 权重,AI-Toolkit 支持微调。Apache 2.0 协议。
模型开源这件事上,权重放出来才算数。
GitHub:
顯示更多
能跑在本地的开源模型2个月能达到openai astra目前的水平吗?
《The Information》援引知情人士称:Astra 用了有限的循环深度(recurrent depth / looped transformer)——生成下一个 token 前,同一组层会对内部状态多跑几圈;报道把这说成提升表现、同时减少可见思维链的一项技术。
如果这是真的,那么这对开源模型来说是一件大好事,因为比起大模型,循环深度对小模型的性能提升更大。
因为循环深度可以让一部分原本需要靠更大参数量获得的能力,改为在推理时靠更多计算换回来。 代价是更高的 inference compute。
更重要的是,循环深度和 MoE 架构存在明显的结构性协同,天然比 dense Transformer 更适合 MoE架构。因为MoE 循环时,每一轮可以调用不同专家,因此同一套共享层可以在不同循环里执行不同计算
之前已经有论文研究发现,通过循环深度技术能让3.5b的模型跑出50b模型的评分
虽然最终无法确认2个月之内开源小模型就一定能达到astra水平,但架构上,显然有更大优势。接下来astra等级的模型的能力可能会以比之前前沿模型更快的速度,被开源小模型赶上
所以。。。
显卡是不是又要再涨价了?
顯示更多