TT Lab
시작하기
배우기 러닝패스 코스

LLM 서빙

이 코스에는 GPU 도 모델 가중치도 없습니다. 대신 서빙을 서빙으로 만드는 기계 장치 — 토큰 스트리밍, 연속 배칭, KV 캐시 메모리 산정, 레이트리밋과 토큰 회계, 평가 회귀 방지 — 를 직접 구현합니다. vLLM 을 켜기 전에 무엇이 왜 그렇게 설계됐는지 아는 것이 목표이고, 그 앎이 GPU 를 붙였을 때 설정값의 의미를 아는 사람과 모르는 사람을 가릅니다.

고급 · 레슨 25 · 실습 7

실습 시작하기

커리큘럼

서빙이 학습과 다른 이유

토큰 스트리밍과 SSE

배칭(연속 배칭)과 큐잉

모델 서버 선택과 재현 가능한 비교

GPU 메모리 산정과 양자화

KV 캐시가 GPU 에 다 안 들어갈 때

KV 인식 라우팅과 분리 서빙

게이트웨이·레이트리밋·비용 관리

평가와 회귀 방지

참고 문서