LLM 서빙
이 코스에는 GPU 도 모델 가중치도 없습니다. 대신 서빙을 서빙으로 만드는 기계 장치 — 토큰 스트리밍, 연속 배칭, KV 캐시 메모리 산정, 레이트리밋과 토큰 회계, 평가 회귀 방지 — 를 직접 구현합니다. vLLM 을 켜기 전에 무엇이 왜 그렇게 설계됐는지 아는 것이 목표이고, 그 앎이 GPU 를 붙였을 때 설정값의 의미를 아는 사람과 모르는 사람을 가릅니다.
고급 · 레슨 25 · 실습 7
커리큘럼
서빙이 학습과 다른 이유
- prefill 과 decode 는 다른 일이다 reading
- 퀴즈: 서빙의 지표 quiz
토큰 스트리밍과 SSE
- 왜 스트리밍이 UX 를 바꾸는가 reading
- 토큰 스트리밍 서버 직접 구현하기 lab
- 퀴즈: 스트리밍 quiz
배칭(연속 배칭)과 큐잉
- 정적 배칭이 버리는 것 reading
- 연속 배칭 스케줄러 시뮬레이션 lab
- 퀴즈: 배칭 quiz
모델 서버 선택과 재현 가능한 비교
- 도구 이름보다 먼저 측정 계약을 고정한다 reading
- 퀴즈: 모델 서버 선택 quiz
GPU 메모리 산정과 양자화
- 메모리 예산을 손으로 세우기 reading
- KV 캐시 메모리 산정 계산기 만들기 lab
- 퀴즈: 메모리 산정 quiz
KV 캐시가 GPU 에 다 안 들어갈 때
KV 인식 라우팅과 분리 서빙
게이트웨이·레이트리밋·비용 관리
- 요청 수로는 LLM 비용을 통제할 수 없다 reading
- 레이트리밋과 토큰 회계 게이트웨이 만들기 lab
- 퀴즈: 게이트웨이와 비용 quiz
평가와 회귀 방지
- 느낌으로 모델을 바꾸면 생기는 일 reading
- 응답 품질 회귀 테스트 하네스 만들기 lab
- 퀴즈: 평가와 회귀 방지 quiz