MiniMind — 小さな言語モデルを最初から最後まで自分で学習する
2つのCPUでトークナイザーからDPOまで小さなモデルを焼き上げる
고급 · レッスン 30 · ラボ 10
カリキュラム
トークナイザー
データ準備 — パディングとパッキング
モデル構成
事前学習と損失曲線
チェックポイントと再開
SFT と損失マスキング
LoRA
- LoRA は重みに触れずに脇道を付ける reading
- MiniMind の LoRA で口調だけを変え、基盤の重みがそのままか確かめる lab
- クイズ:LoRA quiz
DPO — 選好学習
- DPO は報酬モデルなしに「こちらが良い」を教える reading
- DPO で口調を変え、内容が守られたかも測る lab
- クイズ:DPO quiz
推論 — KV キャッシュとサンプリング
評価と限界
- 小さなモデルでは暗記と学習の境界がはっきりしている reading
- 小さなモデルにできることとできないことを数字で分ける lab
- クイズ:評価と限界 quiz