LLMサービング
モデルなしでサービングの機械仕掛けを学ぶ。
고급 · レッスン 25 · ラボ 7
カリキュラム
サービングが学習と違う理由
- prefillとdecodeは別の仕事だ reading
- クイズ: サービングの指標 quiz
トークンストリーミングとSSE
- なぜストリーミングがUXを変えるのか reading
- トークンストリーミングサーバを自分で実装する lab
- クイズ: ストリーミング quiz
バッチング(連続バッチング)とキューイング
- 静的バッチングが捨てているもの reading
- 連続バッチングスケジューラのシミュレーション lab
- クイズ: バッチング quiz
モデルサーバの選定と再現可能な比較
- 道具の名前より先に測定契約を固定する reading
- クイズ: モデルサーバの選定 quiz
GPUメモリの見積もりと量子化
- メモリ予算を手で立てる reading
- KVキャッシュのメモリ見積もり計算機を作る lab
- クイズ: メモリの見積もり quiz
KVキャッシュがGPUに収まらないとき
KV 対応ルーティングと分離サービング
ゲートウェイ・レートリミット・コスト管理
- リクエスト数ではLLMのコストを制御できない reading
- レートリミットとトークン会計のゲートウェイを作る lab
- クイズ: ゲートウェイとコスト quiz
評価と回帰の防止
- 感覚でモデルを替えると起きること reading
- 応答品質の回帰テストハーネスを作る lab
- クイズ: 評価と回帰の防止 quiz