태그: #prefill-decode분리
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 2 편
NVIDIA Dynamo 직접 써 보기: KV 인식 라우팅은 거의 다 맞혔고, 분리 서빙은 한 장에서 5배, 서버 둘 사이에서 20배 넘게 느렸다
NVIDIA Dynamo 를 쿠버네티스 없이 GPU 한 장짜리 환경에 설치해 프런트엔드 비용, KV 인식 라우팅의 적중, 라우터가 이벤트를 받지 못할 때의 조용한 실패, 한 장 위에서의 prefill/decode 분리 비용, 서로 다른 GPU 의 서버 둘로 나눴을 때의 비용을 직접 쟀습니다. 6편이 문서로 정리한 내용 가운데 무엇이 실측으로 확인되었고 무엇이 아직 미실측인지 구분해 적었습니다
2026-10-07 · 23 분 읽기 #Dynamo#LLM서빙#KV캐시#라우팅#prefill-decode분리분산 추론과 NVIDIA Dynamo: 병렬화, prefill/decode 분리, KV 캐시 이동
모델이 GPU 한 장에 들어가지 않을 때 쓰는 네 가지 병렬화와 통신 특성을 정리하고, prefill/decode 분리가 왜 필요하며 KV 캐시 이동이라는 대가를 어떻게 치르는지 설명합니다. 이어서 2026년 10월 기준 NVIDIA Dynamo v1.5.0 의 구조와 쿠버네티스 배포 방식을 llm-d, vLLM, SGLang 과 비교합니다.
2026-10-07 · 33 분 읽기 #LLM서빙#분산추론#Dynamo#병렬화#prefill-decode분리