登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。

刘江/LIU Jiang
@turingbook
Exploring AGI. Co-Founder of Turing Company. ex Meituan, BAAI, CSDN. 图灵联合创始人。曾任:北京智源人工智能研究院副院长,CSDN&《程序员》杂志总编,美团技术学院院长。
参加 March 2007
3K フォロー中    54K ファン
还是亲历者来说说历史吧。中国最早的大模型研究基本上与智源研究院有关。第一个正式发布的大模型是智源研究院支持清华刘知远团队的清源CPM(2020年11月,26亿参数) ,后来演变为OpenBMB,现在还是最好的端侧模型之一。然后就是智源研究院牵头,唐杰老师挂帅的悟道1.0模型系列(2021年3月),其中就包括GLM的最早期版本(GLM论文通信作者是唐杰和杨植麟)。 其他比较早期的工作,百度是Ernie 3.0(2021年7月);阿里M6(2021年3月)是与唐杰团队合作的(林俊旸是第一作者,唐和当时在阿里的杨红霞是通信作者),后来演变为Qwen。华为盘古有两个版本,一个是华为云田奇与杨植麟团队合作,一个出自诺亚方舟实验室,但都没有持续。 可能有遗漏的,大家可以补充。
もっと見る
晚上刷到余承东在华为发布会上说盘古是国内第一个大模型,我还真去翻了一下时间线。 PanGu-α 论文是 2021 年 4 月 26 日发的,标题和摘要里已经写了 Large-scale Pretrained Language Models,最高 200B 参数,而百度的 ERNIE 3.0 是 2021 年 7 月 5 日,时间上确实晚了一步。 当然,放到全球看,GPT-3 早在 2020 年就已经把 175B 参数和 few-shot/in-context learning 打出来了,所以「全球都不知道大模型」更像是老余发布会惯用的夸张表达。 但如果只看国内早期中文大模型路线,盘古这波确实有资格说自己起得很早。 发布会上老余宣布 openPangu 2.0 要从 6 月 30 日起陆续开源,最高 505B 总参数、512K 上下文。 老余这次把盘古大模型又重新推到台前,真正的悬念已经变成:当年的「早」,这次能不能变成今天的「强」。
もっと見る