태그: #Dynamo
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 3 편
쿠버네티스 CRD 와 오퍼레이터로 LLM 서빙 배포 자동화하기 ♪ 들을 수 있어요
LLM 서빙은 스케일의 단위가 파드 하나가 아니라 파드 묶음이어서 Deployment 만으로 표현하기 어렵고, 이를 LeaderWorkerSet, KServe, Dynamo 같은 CRD 와 오퍼레이터가 맡습니다. 조정 루프, 소유 참조와 finalizer, CRD 버전 관리, 롤아웃, Argo CD 와의 충돌을 공식 문서와 현재 스키마로 확인하고, 격리된 실습 환경에서 확인한 동작을 근거로
2026-10-08 · 48 분 읽기 #쿠버네티스#CRD#오퍼레이터#LeaderWorkerSet#KServeNVIDIA Dynamo 직접 써 보기: KV 인식 라우팅은 거의 다 맞혔고, 분리 서빙은 한 장에서 5배, 서버 둘 사이에서 20배 넘게 느렸다
NVIDIA Dynamo 를 쿠버네티스 없이 GPU 한 장짜리 환경에 설치해 프런트엔드 비용, KV 인식 라우팅의 적중, 라우터가 이벤트를 받지 못할 때의 조용한 실패, 한 장 위에서의 prefill/decode 분리 비용, 서로 다른 GPU 의 서버 둘로 나눴을 때의 비용을 직접 쟀습니다. 6편이 문서로 정리한 내용 가운데 무엇이 실측으로 확인되었고 무엇이 아직 미실측인지 구분해 적었습니다
2026-10-07 · 23 분 읽기 #Dynamo#LLM서빙#KV캐시#라우팅#prefill-decode분리분산 추론과 NVIDIA Dynamo: 병렬화, prefill/decode 분리, KV 캐시 이동
모델이 GPU 한 장에 들어가지 않을 때 쓰는 네 가지 병렬화와 통신 특성을 정리하고, prefill/decode 분리가 왜 필요하며 KV 캐시 이동이라는 대가를 어떻게 치르는지 설명합니다. 이어서 2026년 10월 기준 NVIDIA Dynamo v1.5.0 의 구조와 쿠버네티스 배포 방식을 llm-d, vLLM, SGLang 과 비교합니다.
2026-10-07 · 33 분 읽기 #LLM서빙#분산추론#Dynamo#병렬화#prefill-decode분리