次のトークンだけでなく「次の概念」も予測させたら、8.9Bモデルの事前学習が1.95倍速くなったという報告です。
NCP-ArchPreview: Moving towards Latent Space Language Models through Next Concept Prediction
複数トークンにまたがる離散的な「概念」をベクトル量子化で学習し、トークン予測と概念予測を同時に行う潜在空間言語モデルです。
🚀 注目ポイント1: 圧倒的な収束の速さ
OLMo-3-7Bと全く同じ5.73Tトークンで学習しても、訓練トークンのわずか51.3%を消費した時点で同じ損失に到達し、下流タスクのマクロ平均も2.45ポイント上回りました。
🧩 注目ポイント2: 概念予測がそのまま性能に効く
Concept Module・階層的残差接続・NCP損失を1つずつ足すアブレーションで、それぞれが独立に損失を改善することを確認。パラメータ・計算量を揃えた比較でも優位性が消えませんでした。
⚡ 注目ポイント3: 学習後も概念空間が使い回せる
わずか17Mパラメータのみを更新するドメイン適応で、フルチューニングより忘却を抑えつつ性能を伸ばし、投機的デコーディングの受理長も4.17%改善させています。
概念という抽象単位を副産物ではなく学習目標そのものに据える発想が、次世代モデル設計の実用的な指針になりそうです。
#
LLM# #
言語モデル#