最近找了蛮多 model researchers 交流,一个共识结论是:数据的重要性再次凸显。
前阵子认识了 ex-kimi,在做数据方向创业的
@FanqingMengAI,请他来录了一期播客。
聊出的一个最大非共识,是繁青对国内外模型差异的判断:
原本我们以为,国内更有优势的会是偏工程的 Post-training;但在他看来,国内模型真正有特色的地方,反而是 Pre-training 阶段被资源限制倒逼出来的架构创新。
基于这个认知,我们也得出了一个让人乐观的结论:
很多人会说国模很依赖蒸馏,但繁青认为,蒸馏只是一个加速手段,并不是国内模型变强的决定性因素。就算有一天海外把所有蒸馏通道都封掉,国模依然可以靠预训练的创新能力,构建起自己的竞争力。
这期还解答了我自己的几个问题:
1)合成数据过去一段时间怎么这么赚钱,模型厂为什么不自己搞,大家对第三方数据的需求还能延续多久、或者说会有什么变化;
2)现在“算法就是数据,数据就是 Infra,Infra 就是算法”了吗?
3)怎么理解最近火起来的 ai for ai、self-evolving、rsi 之类的概念,以及如果这些概念成立,那为什么大家不直接去训更好的基模、未来会变成什么样。