LLMを「ゼロから」自分で組んで訓練すると、中で何が起きているかが本当に分かります🛠️ 単一GPUで動く、完全な教育用実装の登場です。
タイトル: FareedKhan-dev/train-llm-from-scratch
URL:
🛠️ 概要
「Attention is All You Need」に基づき、TransformerをPyTorchでゼロから実装する教育用リポジトリです。単一のGPUで、数百万〜十億パラメータ規模の自分だけのLLMを訓練できることを掲げています。
❓ 解決する課題
LLMは当たり前になりましたが、ゼロから訓練して内部を手を動かして理解する機会は限られています。
・既製フレームワークを使うだけでは、Transformerの仕組みが見えにくいままです
・事前学習から事後学習(アライメント)までの一連の流れを通しで体験できる教材が求められていました
💡 内容と構成
LLMのライフサイクル全体をカバーします。
・データの取得と前処理(The Pileから)
・コアなTransformerアーキテクチャの実装(埋め込み・アテンション・FFN)
・モデルの訓練(分散処理DDPにも対応)
・事後学習のアライメント:SFT、報酬モデリング、PPO、DPO、GRPO
・テキスト生成と推論
コードはsrc/models・scripts・data_loader・configs・ui(Streamlit)に整理。スタックはPyTorch、tiktoken、HDF5、NumPyです。
🌍 ユースケース / 対象読者
LLM訓練の仕組みを実地で学びたい開発者・研究者向けです。GPUが限られた人(13Mパラメータから)から、エンタープライズGPUで数十億パラメータを狙う人まで対応します。
#
LLM# #
機械学習#