태그: #vLLM
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 7 편
#vLLM 태그가 붙은 글은 7편이고, 가장 최근 글은 2026-10-08에 올라왔습니다.
함께 자주 붙은 태그: #토스 ML/AI Infra 준비 7 #KV 캐시 2 #KV캐시 2 #실측 2 #처리량 2
최근 90일 동안 많이 읽힌 글:
LLM 서빙을 OpenTelemetry 로 관측하기: vLLM 에서 실제로 나오는 신호, 표준과의 거리, 컬렉터로 메우기
vLLM 에 OpenTelemetry 트레이싱을 켜고 컬렉터를 붙여, 요청 하나가 어떤 스팬과 속성으로 남는지, 지표는 어떤 이름으로 나오는지, 켜는 비용이 얼마인지, GenAI 시맨틱 컨벤션과 어디가 다른지를 직접 쟀습니다. 컬렉터의 변환 프로세서로 이름을 표준에 맞추고, 꼬리 기반 샘플링으로 느린 요청만 남기는 것까지 확인했습니다. OTCA 시험 범위(컬렉터 파이프라인, 샘플링, 시맨틱
2026-10-08 · 25 분 읽기 #OpenTelemetry#OTCA#vLLM#트레이싱#컬렉터NVIDIA Dynamo 직접 써 보기: KV 인식 라우팅은 거의 다 맞혔고, 분리 서빙은 한 장에서 5배, 서버 둘 사이에서 20배 넘게 느렸다
NVIDIA Dynamo 를 쿠버네티스 없이 GPU 한 장짜리 환경에 설치해 프런트엔드 비용, KV 인식 라우팅의 적중, 라우터가 이벤트를 받지 못할 때의 조용한 실패, 한 장 위에서의 prefill/decode 분리 비용, 서로 다른 GPU 의 서버 둘로 나눴을 때의 비용을 직접 쟀습니다. 6편이 문서로 정리한 내용 가운데 무엇이 실측으로 확인되었고 무엇이 아직 미실측인지 구분해 적었습니다
2026-10-07 · 23 분 읽기 #Dynamo#LLM서빙#KV캐시#라우팅#prefill-decode분리LoRA 어댑터 서빙을 직접 재 보기: 처리량 비용, 어댑터 슬롯, 실행 중 적재
기본 모델 하나에 LoRA 어댑터 여러 개를 얹어 서빙할 때 처리량이 얼마나 줄어드는지, 어댑터 수가 슬롯 수를 넘으면 무슨 일이 생기는지, 실행 중에 어댑터를 올리는 데 얼마나 걸리는지를 1.7B 모델과 vLLM 으로 직접 쟀습니다.
2026-10-07 · 19 분 읽기 #LoRA#vLLM#멀티 어댑터#서빙#처리량작은 모델로 vLLM 직접 재 보기: 부하, KV 캐시 용량, 접두사 캐시, 청크 크기
1.7B 모델 한 개를 8GB급 GPU 한 장에 올리고, 동시 요청을 늘리며 처리량과 첫 토큰 시간이 어디서 꺾이는지, KV 캐시 용량이 식과 맞는지, 접두사 캐시와 KV 8비트와 청크 크기가 각각 무엇을 바꾸는지 직접 쟀습니다.
2026-10-07 · 29 분 읽기 #vLLM#부하 테스트#KV 캐시#접두사 캐시#청크 프리필vLLM 과 SGLang 비교, 그리고 벤치마크를 제대로 하는 법 ♪ 들을 수 있어요
두 추론 엔진을 접두사 캐시 구조와 설계 철학, 기능, 워크로드 모양별 선택 기준으로 비교하고, 열린 루프 부하와 접두사 캐시 함정, 퍼센타일 읽기를 포함한 벤치마크 방법을 공식 도구로 확인해 정리합니다. 결과를 SLO 기준의 GPU 대수로 바꾸는 절차까지 다루며, 우열을 단정하지 않고 직접 측정하는 법을 남깁니다.
2026-10-07 · 40 분 읽기 #vLLM#SGLang#RadixAttention#벤치마크#용량 계획AI 스토리지와 KV 캐시 오프로드: 가중치 로딩 경로부터 LMCache 실측까지 ♪ 들을 수 있어요
대형 모델 서빙에서 콜드 스타트를 결정하는 가중치 로딩 경로와, GPU 메모리에 다 들어가지 않는 KV 캐시를 CPU 메모리와 디스크로 내리는 방법을 정리합니다. 필자가 잰 LMCache 실측(TTFT 576ms 에서 48.6ms)과 그 한계를 그대로 밝힙니다.
2026-10-07 · 35 분 읽기 #AI스토리지#모델로딩#KV캐시#LMCache#vLLMLLM 추론의 기본과 vLLM 내부: KV 캐시, PagedAttention, 스케줄러
decode 가 메모리 대역폭 한계인 이유를 산술 강도로 설명하고, KV 캐시 크기 식과 vLLM v0.30.0 의 블록 관리, 접두사 캐시, 스케줄러, 선점, 운영 파라미터를 소스와 문서로 확인해 정리합니다. 8GB급 노트북 GPU 에서 잰 실측과 그 한계도 있는 그대로 적습니다.
2026-10-07 · 29 분 읽기 #LLM 추론#vLLM#KV 캐시#PagedAttention#스케줄링