TwiScan
热门
社区
账号集合
登录
注册
English
日本語
한국의
简体中文
繁体中文
注册并分享邀请链接,可获得视频播放与邀请奖励。
立即注册
搜索结果
Transformer
Transformer 贴吧
一个关键词就是一个贴吧,路径全站唯一。
创建贴吧
用户
未找到
包含
Transformer
的推特
indigo
@indigox
2026.05.07 03:13
基于 Transformer 架构的 LLM 最大的问题就是没有时间感,我觉得这是主观智能甚至是意识到重要部分,时间的连续感知和记忆的先后形成了“自我”!每次涉及到Agentic 任务我都得让模型自己使用 tool 确定操作时间,别让它靠幻觉脑补😂 不知道我这样对不对?
显示更多
0
0
11
43
3
转发到社区
XinGPT🐶
@xingpt
2026.05.13 13:16
看完 Transformer 论文和科普视频,很多人还是不知道 GPT 训练时到底在跑什么代码。 这个项目从零实现了一个现代LLM,注意力机制、位置编码、LayerNorm、残差连接、训练循环、学习率调度,每个模块独立成文件,每一行代码都配了注释说明原理和意图。学完不是会调包,而是真正理解矩阵层面在发生什么。 它适合想深入 LLM原理的初学者,或者实践经验有余但底层知识有缺口的开发者,把"大概懂"进一步推进到"每一行都懂"。
显示更多
0
0
1
4
0
转发到社区
Max Lv
@m0d8ye
2026.06.18 05:53
Google 最先提出了了 Transformer 然后又重新发现了 MoE,并且最早设计了 AI 专用芯片 TPU,为什么现在会落后于两家 startup?
0
0
131
383
8
转发到社区
Vincent
@Vincent_AINotes
2026.08.07 14:43
发现 Token 的翻译「词元」总用得不太顺,对于不了解 Transformer 的人来说,也很难将其字面意思和「人工智能」联系在一起。不如将 Token 翻译成 「仝(tóng)根」。「仝」字上「人」下「工」,合起来就是「人工」;「根」即最基本的、根源的意思。「仝根」读音和 Token 较像,意思也到位,算是做到了信达雅。并且「仝」比「词元」更有意思些,让人一眼就能联想到人工智能。顺着这个思路,人工智能以后是不是也可以简称 「仝智」?同志们觉得如何?(主要还是因为福建人常被笑把「词元」读成「词云」😂)
显示更多
0
0
0
0
1
转发到社区
范凯说 AI | Kai on AI
@fankaishuoai
2026.06.24 02:32
Google 几周之内连丢了三位改写 AI 历史的人物——Transformer 发明者去了 OpenAI,诺贝尔奖得主去了 Anthropic,AlphaGo 缔造者去创业了。最耐人寻味的是,他们没有去同一个地方。录了一期视频分析背后的原因。
显示更多
0
0
0
1
0
转发到社区
Ren
@Ryrenz
2026.08.11 13:09
🖌️ 百度把自家的文生图模型开源了,权重直接放出来 80 亿参数的单流扩散 Transformer,GenEval 总分 0.8856 国内能拿到开放权重的文生图模型本来就不多,能把中文长文本渲染好的更少。想在图里放一句中文标语,出来经常是缺笔画的字符。 ERNIE-Image 在这块的成绩不错,LongTextBench 中英文平均分拿到 0.9733。它放了两个版本:标准版推理 50 步、CFG 4.0,追求质量;Turbo 版经过 DMD 和强化学习优化,8 步、CFG 1.0 就能出图,快得多。 生态接得也够全:Diffusers 和 SGLang 支持调用部署,ComfyUI 有 Turbo 版工作流模板,Unsloth 能构建 GGUF 权重,AI-Toolkit 支持微调。Apache 2.0 协议。 模型开源这件事上,权重放出来才算数。 GitHub:
显示更多
0
0
2
0
0
转发到社区
比特币橙子Trader
@oragnes
2026.08.07 03:56
Sam Altman 谈起谷歌:OpenAI 能活下来纯属奇迹,谷歌本来应该横扫一切! 大公司病加上保守管理,造就了当前AI领域很被动的谷歌。 2017 年奠定大模型基础的 Transformer 论文 8 位作者,全部离开谷歌创业,跑出来撑起了 等半壁江山。 为了保护几千亿美元的搜索广告现金流,内部审核极其繁重,实验室里的研发成果迟迟不敢对外放手。 2024 年谷歌不得不豪掷 27 亿美元,通过技术授权的形式变相把离职创业的 Noam Shazeer 等人“买”回公司。
显示更多
0
0
19
10
0
转发到社区
ME News
@MetaEraCN
2026.08.03 06:57
马斯克
@elonmusk
转发了一张「AI then / AI now」对比图,只评价了一个词: Accurate? 过去做机器学习: 设计核方法、构建概率模型、证明算法为什么有效。 现在做大模型: 扩大 Transformer、增加训练数据、堆更多 GPU——模型就又变强了。 这张图讽刺的,正是大模型行业最真实的窘境: 过去是先理解原理,再设计模型; 现在是先扩大规模,再研究能力为什么会出现。 Scaling 确实有效。 问题是,我们越来越擅长制造更强的智能,却未必更理解智能本身。
显示更多
0
0
9
0
0
转发到社区
lidang 立党 (劝人卖房/学CS/买SP500/纳100/OpenAI/Anthrop第一人)
@lidangzzz
2026.07.19 07:33
在外行大血空眼里:2022年年底,ChatGPT横空出世,宇宙大爆炸。 在我们这些人眼里: 2017年发布transformer,我们一群人在跟着看,看不懂也想不明白,但知道这东西比RNN和LSTM强得多; 2018年发布BERT,Google狂妄至极,全世界都在训练BERT、蒸馏BERT、魔改BERT,OpenAI当时在做decoder only的GPT, 2018年之后很长一段时间,有公司羞辱性地问PhD,“来,跟我讲讲,为什么BERT encoder only是唯一正确道路,为什么GPT这种decoder only是死路一条” 2019年,BERT已经深刻改变世界,Google已经骄傲宣布所有搜索结果都是BERT indexing和sorting的结果,全世界每秒钟调用xxx次BERT,Google震撼发布T5 model,直接把OpenAI甩开身位, 2020年,GPT-3横空出世,当日登顶github trending(一个markdown说明书,没有任何模型,完全闭源,当天党哥全球第三,和GPT-3同框),全世界看了OpenAI的视频demo,彻底炸裂,SQuAD被刷到顶, 2021年,Stanford开始酝酿foundation model(基础模型),代替以前BERT、GPT、transformer这些概念,计划一统江湖,开启新时代。foundation model几乎是一个极其伟大的宣言,告诉整个世界,NLP时代要迎来技术爆发了, 2022年,GPT-3.5 Turbo训练完了,OpenAI发现GPT-3的模式挺好,于是随手糊了一个前端和infra的小玩具,给大家注册玩玩,随便起了一个名字,叫ChatGPT。
显示更多
0
0
78
612
44
转发到社区
AI Will
@FinanceYF5
2026.07.10 09:01
抛开朋友靠这个拿到75万年薪的故事包装,这条视频本身的干货是实打实的——一段3小时的从零构建LLM实录。 内容走了LLM入门、transformer架构、训练过程、模型现代化改造、扩展五个阶段,代码全程可见,边讲边敲。 想搞懂ChatGPT、Claude怎么造出来的👇
显示更多
0
0
3
118
25
转发到社区
加载中...