태그: #KV캐시
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 5 편
#KV캐시 태그가 붙은 글은 5편이고, 가장 최근 글은 2026-10-07에 올라왔습니다.
함께 자주 붙은 태그: #LLM서빙 3 #토스 ML/AI Infra 준비 3 #Dynamo 2 #NIXL 2 #prefill-decode분리 2
최근 90일 동안 많이 읽힌 글:
NVIDIA Dynamo 직접 써 보기: KV 인식 라우팅은 거의 다 맞혔고, 분리 서빙은 한 장에서 5배, 서버 둘 사이에서 20배 넘게 느렸다
NVIDIA Dynamo 를 쿠버네티스 없이 GPU 한 장짜리 환경에 설치해 프런트엔드 비용, KV 인식 라우팅의 적중, 라우터가 이벤트를 받지 못할 때의 조용한 실패, 한 장 위에서의 prefill/decode 분리 비용, 서로 다른 GPU 의 서버 둘로 나눴을 때의 비용을 직접 쟀습니다. 6편이 문서로 정리한 내용 가운데 무엇이 실측으로 확인되었고 무엇이 아직 미실측인지 구분해 적었습니다
2026-10-07 · 23 분 읽기 #Dynamo#LLM서빙#KV캐시#라우팅#prefill-decode분리분산 추론과 NVIDIA Dynamo: 병렬화, prefill/decode 분리, KV 캐시 이동
모델이 GPU 한 장에 들어가지 않을 때 쓰는 네 가지 병렬화와 통신 특성을 정리하고, prefill/decode 분리가 왜 필요하며 KV 캐시 이동이라는 대가를 어떻게 치르는지 설명합니다. 이어서 2026년 10월 기준 NVIDIA Dynamo v1.5.0 의 구조와 쿠버네티스 배포 방식을 llm-d, vLLM, SGLang 과 비교합니다.
2026-10-07 · 33 분 읽기 #LLM서빙#분산추론#Dynamo#병렬화#prefill-decode분리AI 스토리지와 KV 캐시 오프로드: 가중치 로딩 경로부터 LMCache 실측까지 ♪ 들을 수 있어요
대형 모델 서빙에서 콜드 스타트를 결정하는 가중치 로딩 경로와, GPU 메모리에 다 들어가지 않는 KV 캐시를 CPU 메모리와 디스크로 내리는 방법을 정리합니다. 필자가 잰 LMCache 실측(TTFT 576ms 에서 48.6ms)과 그 한계를 그대로 밝힙니다.
2026-10-07 · 35 분 읽기 #AI스토리지#모델로딩#KV캐시#LMCache#vLLMNPU 완전 해부: 트랜스포머 아키텍처가 실리콘 위에서 어떻게 달리는가
NPU가 CPU/GPU와 무엇이 다른지, 트랜스포머의 모든 연산이 하드웨어에 어떻게 매핑되는지, 왜 LLM 추론은 메모리 바운드인지를 루프라인 모델과 실제 코드로 완전 해부합니다. Apple ANE부터 Qualcomm Hexagon, Groq LPU까지.
2026-03-18 · 28 분 읽기 #npu#트랜스포머#ai-hardware#양자화#KV캐시LLM 서빙 최적화 완전 가이드: KV Cache, PagedAttention, 양자화의 모든 것 ♪ 들을 수 있어요
LLM 서빙의 핵심 최적화 기술을 완전 해부한다. KV Cache의 메모리 문제부터 PagedAttention의 가상 메모리 혁신, 연속 배칭, 추측 디코딩, 양자화, 그리고 vLLM/TGI/TensorRT-LLM 비교까지.
2026-03-18 · 48 분 읽기 #LLM서빙#KV캐시#paged-attention#vllm#양자화