HuggingFace被曝卖身英伟达:129亿美元!
一边是 OpenAI、Google、Anthropic、小米、阿里等等都在自研芯片,就是想减少对英伟达的依赖。
另一边是英伟达的老黄,要收购 Hugging Face,也就是收购AI界的Github。
核心就是一边闭源大厂都想摆脱对英伟达的芯片依赖,另一边是英伟达想在开源领域掌握更多的话语权。
Hugging Face作为开源AI的交通枢纽,一旦被英伟达收购,就能继续在开源社区为大家提供源源不断的算力供应,继续大卖GPU。
Github上开源的都是代码,那么HuggingFace 上开源的模型大致都包含了哪些东西呢?
最重要的莫过于模型权重,当然只有模型权重是远远不够的,还需要很多其他的配件。
下面暂时就主要来学一下模型权重到底是什么?
模型权重,可以理解成大模型训练之后真正学到的东西。
传统各种我们用到的软件或者手机里的APP能力都是写在代码里的,是程序员提前规划好的;
但大模型不是这样,大模型的代码更多的只是搭建好的一个“大脑结构”,真正决定它会不会写代码、懂不懂知识、能不能推理的,是训练之后得到的权重。
这些权重,本质上就是模型内部海量的数字参数。
比如你输入“苹果”,如果前面提到“甜、营养、水果”,模型会更倾向理解成水果;如果前面提到“iPhone、芯片、手机”,它就会理解成 Apple 公司。
这种判断并不是程序员一条条写进去的,而是模型在训练过程中,看了大量数据,不断预测、犯错、纠正,再一点点的调整内部参数形成的。
所以可以简单的理解成:
代码 = 大脑结构
训练数据 = 学习材料
训练过程 = 不断学习和纠错
权重 = 最终学出来的能力
比如实践哥测评的 Apodex-1.1-mini-GPTQ-Int4 35B 的大模型,意味着它大约有 350 亿个参数。这些参数组合在一起,最终决定了模型的语言、知识、推理和编程能力。
Hugging Face 上仓库总大小约 24.7 GB,而原始未量化版本仓库大约 71.9 GB。
所以所谓开放权重,其实就是把模型训练完成后的这套核心参数开放出来,让别人可以自己下载、运行、量化、微调和部署。
顯示更多
Qwen3.8-Flash-Next 开源了,Qwen4 的架构预览被扔出来了。
现在很多模型,底座没怎么变,做一层后训练之后,Agent 能力能突然往上窜一大截。
那问题来了:
后训练到底训练进去了什么?
是知识更多了?推理更强了?还是模型“干活的方式”变了?
我正好部署了两个特别适合做 A/B Test 的模型:
🔥Apodex-1.1-mini-GPTQ-Int4
vs
它自己的底座 Qwen3.5-35B-A3B-GPTQ-Int4
但做完后训练以后,Apodex 自己公布的 benchmark 已经吹得挺狠了:
在 FrontierFinance 上,Apodex-1.1-mini + Agent Team 拿到 50.2。
同一个 benchmark 里,Claude Fable 5 的参考成绩是 49.2。
一个 35B 的开源模型,后训练一下,号称专业 Agent 能力已经能摸到甚至超过 Fable。
这个我偏不信。
我正好有机器。我有两张 4090。
一张跑 Apodex,一张跑原版 Qwen。
同架构、同 INT4、同 128K 上下文、同一套 Agent Harness,两边同时接完全一样的任务。
所以这个实验非常干净:
底座基本没变,主要看的就是后训练到底给 Agent 加了什么能力。
结果越来越有意思。
甚至测出来一层能力,已经开始往 Fable 那个方向靠了。
🔥我给这两个模型和 Fable 出了一道预测题。
2026 年 8 月 26 日,NVIDIA 当天盘后要发 FY2027 Q2 财报。
我提前几个小时,让它们预测:
总营收
GAAP 毛利率
Data Center 营收
下一季度指引
要求自己上网调研,最后给判断。
本来我只是想看看:同一个底座,做过后训练以后,Research + Agent 能力到底能提升多少。
🔥结果这道题出了个非常离谱的乌龙。
底座其实非常努力。它搜了 40 次。
而且最离谱的是:它中间已经把正确答案全部查出来了。
然后到了最终答案——它自己把这些正确数据全扔了。
我一开始都看懵了。
后来翻完整 Agent 日志,才发现真正有意思的事情:
当外部证据和模型脑子里的旧认知发生冲突时,它到底信谁。
🔥这时候你就能明显感觉到,后训练之后的模型,跟底座已经不是一个“工作状态”了。
它看起来会更聪明、更机灵。
它更像一个被教过怎么干活的人。知道什么时候该搜。知道哪些证据更重要。
以后每个企业,都会有一个自己的模型。
不一定是从零预训练。
但至少会有自己的后训练、自己的 Agent 行为、自己的工作习惯。
🔥小模型不一定非得和 Frontier Model 拼所有能力。
把一个方向训透,再配上一套好的 Harness 和 Tool Use,它真的可以变得非常机灵、非常能干。
最后夸一下 Apodex。
这次不只是模型后训练做得好,他们那套 Harness + Tool Use 也确实很能打。
一个 35B 模型被他们训完,再塞进这套 Harness 里,真的已经开始有点专业工种的味道了。
顯示更多