华为的τ芯片量产后会熔化?当然不会!
华为的τ定律出来之后,笔者担心过散热,也写了一系列的文章,一些传播还比较广。昨天,华为的半导体业务部总裁何庭波女士有发了一篇论文,链接:
何老师在论文里面明确地说:我们的麒麟实测结果将散热这一质疑完全翻转(Our Kirin measurements turned that objection upside down)。何老师在开头就举了一个简单的例子:每个通勤者(Commuter)都知道的一件事,在芯片上,就像每个打工人的日常工作日一样,消耗大部分能量的不是工作本身,而是往返路途(芯片的功耗大部分由搬运数据产生,而不是计算单元的本身的功耗)。
同样,对真实的量产成品Wafer和Die进行的测量显示,这里的Die也就是计划于9月份出货的麒麟2026,结果恰恰相反:在每平方毫米晶体管数量增加55%的同时,该芯片比前代更凉,在某些关键任务上的功耗降低幅度最高达到66%。
这是一个令人震惊的表现,一起跟着笔者来学习一下这篇论文。
所以,华为(包括大部分中国客户)在受限的国际环境里面,制程被限制在最高5nm的区间,那怎么用不一样的方式来获得更快的开关速度,更短的响应时间和更高的时钟频率?这就是LogicFolding提出的背景。
LogicFolding通过3D混合键合实现,它更接近焊接,而不是封装。两片晶圆,当然也可以是一片晶圆与一颗芯片,经过精密对准、压合并缓慢加热。在退火过程中,两侧氧化物表面之间形成共价键,合并为一层连续的介电层;与此同时,两侧铜焊盘向彼此膨胀并熔合为连续金属。最终,堆叠芯片之间形成了一片垂直连接的森林。
那么,单位面积内需要多少垂直连接,才能使折叠真正降低RC(也就是拖慢并消耗每个信号的电阻和电容)?华为的探索表明:1.5μm已经足以支持良好的LogicFolding,1μm会更好,而720nm(典型逻辑工艺的顶层金属间距为720nm)将进一步扩大收益。未来,华为还打算把键合间距缩小到480nm。
何老师接着披露:华为在40nm设备基础上,在麒麟2026芯片上实现了1.5μm混合键合间距:5000万个垂直互连中,10%至15%用于传输信号。麒麟2027硅片已经达到1μm,并拥有超过1亿个垂直互连。之后华为将达到720nm的顶层金属间距,实现一比一的齿轮比,并拥有超过2亿个垂直互连。
在此的工艺水平上,华为工程师开始了真正的LogicFolding,他们检查了麒麟SoC中工作最繁重的模块:NPU、CPU、GPU和DSP,找出其中最长、最慢、最耗电的水平路径。随后,每个模块都被重新设计为同时占据两层硅片,把长距离水平连接变成在两颗芯片之间短距离跳转的垂直连接。
在采用LogicFolding的第一款移动SoC麒麟2026上,晶体管密度在一代之内从约每平方毫米1.55亿个增加到2.38亿个,提升55%。
到这里,反直觉的来了,因为。。。功率密度也下降了。。。
与华为前代平面布置的芯片相比,在性能相同的条件下,麒麟2026的NPU功耗降低66%,GPU降低58%,CPU性能核降低41%(测试采用真实世界基准)。
至此,华为在每平方毫米内放入了明显更多的晶体管,但芯片每完成单位工作所产生的热量反而更少,而不是更多。这个结果值得大量的解释,因为它看起来像违反了质疑者援引的物理规律。其实并没有,它真正揭示了芯片功率究竟消耗在哪里,而答案并不是大多数人以为的地方。
智能手机芯片的动态功耗大约占90%,而动态功耗里面有两种消耗,1是门电路的开关;2是移动信号,也就是把信号从芯片的一部分送到另一部分的长金属线充放电,导线就像沿距离摊开的电容,信号走得越远,需要充电的电容就越大,能量也随之增加。
这正是包括笔者在内的小伙伴们的直觉容易出错的地方:在现代SoC模块中,导线,也就是信号的移动,通常比逻辑门,也就是计算要消耗更多能量。处理器的大部分功率,不是花在思考上,而是花在通勤上。
回到何老师举的例子上,想象一名普通办公室职员每天的能量预算。人们很容易以为,大部分能量花在实际工作上:会议、电子表格和思考。但事实并非如此。对许多办公室职员而言,一天中最大的一笔能量支出是通勤:每天往返于家和办公室之间的驾车或乘车。相较之下,坐在办公桌前工作所需的能量要低得多;交通才是主导项。
何老师类比了一下,芯片也一样:逻辑门负责思考,导线负责通勤。在大型AI集群中,这一点同样成立:超过80%的能量花在移动数据,而不是对数据进行计算。只是程度较轻的同样失衡,也存在于每一颗智能手机SoC中。
所以,LogicFolding做了什么?何老师说,LogicFolding把每个人的家都搬到了办公室附近。
何老师举了个例子:芯片里面,时钟网络是最繁忙、最耗电的导线之一;华为团队通过LogicFolding把它缩短到相当的程度,足以把时钟缓冲器数量削减一半以上。仅在一个处理模块上,LogicFolding就使时钟走线缩短28%,并将缓冲器(Buffer)数量从43,600个降至19,000个。
麒麟2026的实际功耗:逐模块观察
华为让折叠芯片与其平面前代麒麟9030 Pro进行对比,并采用等性能条件:相同的AI吞吐量、帧率或基准分数。
NPU是华为τ定律批评者最担心堆叠的模块,因为它既是密度最高的模块之一,也是最热的模块之一。然而,它实现了最大的降幅:在相同的29 TOPS下,时钟频率可以降低63%,从1.2GHz降至0.442GHz;电压可以从0.85V降至0.55V。这使功耗降低66%,功率密度惊人地下降73%。GPU紧随其后:以与麒麟9030 Pro相同的61 FPS运行,但电压降低200mV,功耗下降58%。
收益梯度恰好沿着“通勤”展开:一个模块越并行、越耗数据,折叠给它的回报就越大。
DSP是一个例外,并且说明了一个重要教训:使用LogicFolding时,面积可能比功耗缩小得更快。第一代LogicFolding芯片麒麟2026在完成相同工作的情况下功耗降低25%,但功率密度,每平方毫米消耗的功率,反而上升24%;而真正决定热控制的是功率密度。原因很直接:LogicFolding使DSP占地面积缩小40%,所以即便功耗下降,功率密度仍会上升。第二代折叠芯片麒麟2027解决了这一问题:华为已经完成了流片,并完成了实际Die的测量,其功率密度低于原平面版本,功耗下降47%。
按照何老师的话说:功率密度是设计结果,而不是命运。
华为还让麒麟2026的模块跑在了全速模式,以观察它们相对于9030 Pro能达到什么水平。
在全负荷下,折叠NPU达到70 TOPS,比前代高141%;GPU帧数提高42%;CPU在HNX基准上的分数提高18%。在这些模式下,它们的功率密度都高于平面前代芯片。
因此,LogicFolding为华为的手机系统提供了一个平面芯片没有的控制旋钮:同一模块可以根据场景选择节俭运行,也可以成为性能猛兽。
华为还通过LogicFolding获得了更多的性能空间,比如,前代NPU由一个大核和两个能效核组成,而LogicFolding之后带来的晶体管余量使其能够配置四个大核。这组更宽的阵列以0.7V提供70 TOPS,远低于前代以0.85V提供不到一半性能所需的电压。
设计性消除热点
消除热点也是一个很大的话题,何老师直接点到了有意识的热密度控制是核心。第一,LogicFolding从热源处降低了热密度;第二,主动的热管理。
西西弗斯,但这座山通向某处
何老师支出:LogicFolding后的NPU可以用三分之一的功耗完成前代的工作,也可以反过来超过前代141%,同时超过前代的功率密度。物理学允许这两种设置;选择凉爽运行还是极限运行,取决于华为的设计纪律(取舍)。
LogicFolding后的CPU有意保持保守,只针对关键路径。但仅2026年,它就已经把性能核频率恢复到3.1GHz。要在未来三至五年释放LogicFolding的全部潜力,需要全行业积极创新,包括扩大设计空间、缩小混合键合间距、集成更低层金属的TSV以及垂直堆叠更多层等。
华为的方向比较乐观,LogicFolding将为麒麟CPU核心频率达到并超过5GHz铺平道路。这一路线图是可行且具有经济性的。
何老师提到西西弗斯的神话:西西弗斯被判把巨石推上山,却只能看着巨石滚下去,然后重新开始。在τ缩放定律下进行工程工作也有同样节奏:折叠芯片,获得时间裕量,再把裕量用于降低功耗;下一代芯片到来,巨石又要重新开始。
这个故事与神话不同的地方在于:这座山确实通向某处。每一轮循环都会留下计算能力更强、功耗更低的芯片,而不断累积的距离,就是产业所称的进步。
回应笔者的主题:那颗本来被认为会熔化的τ芯片,最终反而运行得更凉!
太酷了,华为的工程师们!!!
顯示更多