登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。

検索結果 HotChips
HotChips コミュニティ
1つのキーワードが1つのコミュニティです。
コミュニティ作成
アカウント
見つかりません
HotChips を含む検索結果
🧩HBMの壁は段数から、GPUと話す数ミリ角の温度へ移った | SamsungもSK hynixも次に足すのは冷やす構造だ 005930.KS 000660.KS 8月23日にStanfordで開幕したHot Chips 2026は、初日をチュートリアルに充てている。その一枠がメモリで、Micron、Samsung、SK hynixが順に登壇した。SamsungとSK hynixが次の世代に足すと説明したのは、容量でも帯域でもない。同じ数ミリ角を冷やすためだけの構造だった。 その数ミリ角をダイ間PHYと呼ぶ。HBMの一番下に敷くベースダイの上にあり、積み上げたDRAMとGPUの間で信号をやり取りする回路のことだ。標準的なHBMではこのPHYがベースダイの中で最大のブロックになる、とSamsungは説明した。 Samsungが示した設計は、そこを縮める。従来のHBM PHYを先端ロジックで作るダイ間インターフェースへ置き換えると、面積が縮み、信号の通り道が短くなり、1ビットあたりのエネルギーが下がる。空いたシリコンはGPU側の面積へ回せる。メモリを売る会社が、計算する側の陣地を広げる提案をしている。 代償は同じ資料に書いてある。通り道を短くすればエネルギーは下がるが、小さくなったPHYへ同じ電力を詰めれば電力密度が上がり、そこがホットスポットになる。SamsungはsHBM4EからsHBM5へ向かう区間でI/O速度がおよそ倍になり、電力密度が0.5W/mm²から2.0W/mm²超へ上がる数字を置いた。面積を稼ぐ動きが、自分で熱を作っている。 その熱を運び出すのがHeat Path Blockだ。ベースダイのダイ間PHYに専用の熱の通り道を作る構造で、PHYの被覆率を5割超まで上げるとピーク温度が35%超下がるという。Samsungはこれを現在HBM4Eで検証しており、採用はHBM5世代からと置いている。 SK hynixが同じ日に説明したi-HBMも、置く場所は同じだ。熱が最も集中するダイ間PHYの領域へ、電気を通さず熱をよく通すシリコン系の部材を直接埋め込み、コアダイ越しに逃がす従来の経路とは別の放熱路を作る。熱抵抗の低減幅は30%。搭載はHBM5を含む次世代からになる。名前も構造も違うが、狙う一点と入れる世代は同じだ。 段数の議論は、この熱の議論に吸収されつつある。SK hynixのHBM4は48GBで、12段が量産、16段が認定中だ。HBM3Eで16段を組んだとき、同社は同じ高さの枠に2段を足すため、チップの厚みも隙間も接合部の間隔もおおむね半分にした。20段以上へ向かえば熱管理が拘束条件になる、と講演では言い切っている。同じ枠で先に話したMicronは、演算性能が2年で3倍伸びる一方でHBMの帯域は2倍に届かないと示し、その差を埋める作業がいま熱と実装の問題になっていると並べた。 この二社の損益は、いまメモリが決めている。SamsungのQ2連結営業利益は89.5兆ウォン、そのうち89.2兆ウォンが半導体のDS部門から出た。SK hynixは同じ四半期に売上79兆3,187億ウォン、営業利益60兆5,426億ウォンで、営業利益率76%。段数を伸ばせるかどうかは、この数字の続きにそのまま効いてくる。 HBMの優劣は、長いあいだ段数で語られてきた。次の世代でそれを決めるのは、GPUと話す数ミリ角が何度まで耐えるかになる。HBM5の仕様が並ぶとき、容量と帯域の下に熱の構造が載っているかを見ればいい。そこに書ける会社だけが、20段の話を続けられる。 🤘情報提供 Stock Slayer :
もっと見る
💡HBFを積んだGPU1枚が、HBM8枚ぶんのモデルを丸ごと抱えられる | 同じ金額と電力で並べ直すと帯域は6割弱だ $SNDK HBFを積んだGPUが1枚、同じく4枚、そしてHBMを積んだGPUが8枚。SanDiskが8月13日の投資家説明会で見せた比較図には、この3つが並んでいる。1枚対8枚は同じモデルを走らせるのに要る最小構成の差で、会社はこれを設備投資効率8倍と呼んだ。4枚が8枚に並ぶのはトークンの出力量のほうで、こちらはGPU効率2倍。どちらも社内試験の数字で、グラフにトークン毎秒の目盛りは入っていない。 Hot Chips 2026で、同じ技術に別の問いを立てた数字が出た。 出したのはOxmiq Labs。Intelのチーフアーキテクトを務めたRaja Koduriが作った会社で、売っているのはライセンス提供のチップアーキテクチャとソフトウェアであって、メモリではない。 問いはこうだ。同じ金額と同じ電力を使うなら、トークンはどちらが安く出せるか。 条件はGPU 72枚のラック1本、1兆パラメータのKimi-K2をFP4で走らせ、入力100万トークン・出力1,000トークンのデコード中心。HBMだけで組むと容量20.7TB、帯域の合計1,584TB/s。同じ金額と電力でHBFに置き換えると、容量は294.9TBへ約14倍に増え、帯域合計は922TB/sへ6割弱に下がる。混ぜると89.3TBで、帯域は条件次第で279〜1,418TB/sに散る。 容量が枚数を決めているうちは、HBFの側が勝つ。HBFなら1枚でKimi-K2を丸ごと抱えられるので、ラック1本に72インスタンスが入る。HBMだと1インスタンスに8枚要るから9インスタンスで止まり、束ねた8枚の演算は容量のために遊ぶ。ここまではSanDiskの図と同じ向きだ。 向きが変わるのは、同時に使う人と1秒あたりの生成量が増えたときだ。帯域が律速になった時点から、トークン1個あたりの原価はHBMの側が下になる、というのがOxmiqの試算である。安くなるのは1ギガバイトの値段であって、1トークンの値段ではない。 Oxmiqの結論は一行に収まっている。ラックにはHBM、箱にはHBF。 SanDiskは投資家説明会で3つの置き方を並べていた。HBMを補う、HBMの枠をそのまま置き換える、そして切り離してデコードの重みとKVキャッシュを持たせ、小さいHBMをキャッシュに使う。Oxmiqが残したのは3つ目に近い。HBFが引き取るのはホスト側のDRAMが持っていた分で、そこへ回すのはMoEのエキスパートとKVキャッシュだ。Oxmiqが例に挙げたKimi-K3は、重み1.56TBのうち1.45TB、93%がエキスパートの重みで、トークンごとに呼ばれるのはその一部にすぎない。 置き分けはソフトウェアの仕事になる。最大の帯域を出すには64KB単位で読み、1MB単位で書く。データはDMAで動かすので、CPUやGPUのキャッシュ階層を通らない。どの重みをHBMに残しどれをHBFへ回すかも、書き換え寿命の残りも、ホスト側が管理する。Chips and Cheeseはこれを、ホストのソフトウェアがSSDコントローラの仕事を引き受けることだと書いた。vLLMには専用の実装が要る。 その実装を出すのは、仕様を書いた2社ではない。HBMとHBFの間でデータを動かす仕組みはドライバとランタイムの層にあり、そこを持っているのはNVIDIAとAMDだ。Oxmiqの見立てでは利点が一部の用途に限られるので、メモリ階層をもう一段抱える手間を負ってまで全面的に支える理由は、両社の側に強くない。 SanDiskの直近四半期(7月3日締め)の売上は89億6,500万ドル、研究開発費は3億4,800万ドルだった。HBFが生んだ売上はまだ1ドルもない。8月13日に見せたのはダイのテープアウトで、推論製品のサンプルは2027年に置いてある。1年前の同社は、最初のHBFサンプルを2026年後半、HBFを使う推論機器を2027年前半と言っていた。 仕様を書いたもう一方はSK hynixで、こちらはHBMも売っている。ラックにHBMが残る限り、SK hynixはそこでも売る側に立つ。SanDiskはHBMを売っていない。 だから2027年のサンプルより手前に、見えるものがある。vLLMにHBF用の割り当てと配置が入るか。NVIDIAとAMDが、HBMとHBFの間のデータ移動をドライバで出すか。歩留まりも積層も耐久性の認定もSanDiskの側に残っているが、この2つが動かない限り、そこを越えても採用は広がらない。 🤘情報提供 Stock Slayer :
もっと見る
⚙️NVIDIAがHBM4の主力を12段から8段へ替えてほしいと頼んだ | 歩留まりが落ちるのはDRAMでなく積む工程だ 000660.KS 005930.KS NVIDIAが韓国の2社へ出したのは、増やしてくれという依頼ではなかった。 ZDNet Koreaが8月26日に伝えたところでは、SamsungとSK hynixは今年下半期、NVIDIA向けHBM4の出荷で8段品の比率を引き上げる。両社はここまで、次世代AIアクセラレータVera Rubin向けに12段品を供給してきた。量産出荷の開始はSamsungが1〜3月期、SK hynixが4〜6月期とみられている。すでに走っている供給への、途中変更だ。 > 最近NVIDIAから、HBM4の主力供給製品を12段から8段へ変更してほしいという要請があった。それに合わせて下半期の供給計画が修正されたと理解している > (メモリ半導体業界関係者) 段数はそのまま容量になる。HBMはDRAMを縦に積んだメモリで、12段は12枚重ねたという意味だ。Vera Rubinは1基あたりHBM4を288GB載せる。8つのスタックに分けるので1つが36GB、それが12段の姿だ。同じ8スタックを8段で組めば24GBずつ、合計は192GBに下がる。 ただし動いているのは比率で、8段が何割まで来るかはまだ決まっていない。もう一人の関係者は、8段への需要はもともと一部あったが下半期に増え、関連する素材・部品の発注にも影響が出た、と話している。 減らすほうへ動いた理由は、同紙の中で2つに分かれている。 一つは熱だ。HBM4はデータの通り道である入出力端子を前の世代の2倍、2,048本へ増やした。増えた分の発熱は個別のチップに留まらず、サーバーラック全体に乗る。 熱を逃がす構造そのものは用意されている。8月23日のHot Chips 2026に登壇したSK hynix Americaのパッケージ技術担当VP、Jaesik Leeは、5月に自社が公開した熱ブロックを詳しく説明したうえで、この構造はすでに設計に入ったHBM世代へは適用できないと断った。HBM4はもう設計を終えている。この熱ブロックで解く道は、この世代には残っていない。 もう一つが歩留まりで、今回の芯はこちらにある。 HBMはいま極度の供給難にある。そのうえHBM4は、性能と集積度を上げたぶん歩留まりを取りにくい。同紙が書いているのは、その落ち方の場所だ。HBMの中身であるDRAMコアダイの歩留まりは比較的速く引き上げられる。落ちるのは、それを12枚積み、接合し、パッケージする工程のほうだという。 良品が減っているのは、DRAMを作る工程ではない。積む工程だ。 積む工程がいちばん狭い場所なら、そこを通す数を増やす一番速い手段は、新しい棟でも新しい装置でもない。積む回数を減らすことだ。増えるのは通るスタックの数で、1本に載る容量のほうは減る。 段数を変えてほしいと言われた製品の重さも、数字で出ている。Samsungでメモリのグローバル営業・マーケティングを統括するJaejune Kimは、7月30日の決算説明会で、下半期はHBM売上に占めるHBM4の比率が60%をかなり上回ると述べた。下半期のHBM売上の主力が、今回の変更の対象にあたる。 いまVera Rubin向けに12段のHBM4を量産供給しているのが SK hynix 000660.KS と Samsung 005930.KS で、同紙が計画を伝えているのもこの2社に限られる。 業界側の受け止めは、それでも冷静だ。 > NVIDIAは最新のAIプラットフォームを設計するうえで発熱管理を最も重視している。個別チップのスペックを下方調整するというより、システム全体で最適な組み合わせを探す過程であり、市場全体の需要に大きな変動を起こすものではない > (半導体業界関係者) 同じ変更は、次の世代へもう入り始めている。HBM4の後継のHBM4Eも、当初の12段ではなく8段中心の出荷になる公算が高いという。HBM4EはNVIDIAのRubin Ultra向けの製品だ。 > 12段と16段のHBM4Eサンプルも議論されてはいるが、いまの顧客との議論を見ると、来年供給されるHBM4Eは8段が主力になる可能性が高い。ただしRubin UltraがHBM4EとHBM4のどちらを使うのかといった論点が残っており、業界全体の不確実性は高い > (メモリ半導体業界の高位関係者) 見るべきは来年のHBM4Eの段数だ。8段で出てくれば、段数は積み上がっていくものだという前提が2世代続けて止まる。12段や16段で出てくれば、止まったのはHBM4の1世代だけということになる。 そのどちらになるかを決めているのが、いまのところJEDECの規格書ではなく客の発注書のほうだ、という点は覚えておいていい。 🤘情報提供 Stock Slayer :
もっと見る