태그: #Kubernetes
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 4 편
멀티테넌트 GPU 스케줄링과 용량 계획 ♪ 들을 수 있어요
기본 스케줄러가 GPU를 다루는 방식의 한계에서 출발해 Kueue와 Volcano의 설계 차이, 토폴로지 인식 배치, GPU 공유의 격리 한계, DRA의 현재 상태를 정리합니다. 마지막으로 요청률과 지연 목표에서 GPU 수를 역산하는 방법을 필자의 실험 환경에서 잰 값을 기준점으로 보입니다.
2026-10-08 · 37 분 읽기 #Kubernetes#GPU#Kueue#Volcano#스케줄링하이브리드 GPU 쿠버네티스와 Cilium·Istio 네트워크 ♪ 들을 수 있어요
온프레미스 GPU 노드와 클라우드 노드를 한 클러스터 또는 여러 클러스터로 묶을 때 선택지와 네트워크 경로, 그리고 Cilium과 Istio의 역할 분담을 정리합니다. LLM 서빙의 긴 연결과 스트리밍 응답이 타임아웃, 로드밸런싱, 헬스체크에서 어떻게 깨지는지를 중심으로 다룹니다.
2026-10-08 · 46 분 읽기 #Kubernetes#하이브리드클라우드#GPU#Cilium#IstioGPU Operator 파드 구성요소와 역할, 호스트에 드라이버가 없어도 되는가
GPU Operator 를 설치하면 어떤 파드가 어느 노드에 뜨고 각각 무슨 일을 하는지, 파드들이 어떤 순서로 서로를 기다리는지, 호스트에 NVIDIA 드라이버가 없어도 오퍼레이터만으로 동작하는지를 실제 파드 구성과 공식 문서로 확인해 정리합니다.
2026-10-07 · 17 분 읽기 #GPU Operator#Kubernetes#NVIDIA 드라이버#디바이스 플러그인#Container ToolkitGPU Operator 스택 해부와 트러블슈팅
GPU Operator 의 구성요소와 파드가 GPU 를 받기까지의 경로를 해부하고, 같은 Insufficient nvidia.com/gpu 문장 뒤에 숨은 원인을 가르는 진단 순서와 용량 계획의 관점을 정리합니다. 소비자용 GPU 를 쓰는 필자의 실험 환경에서 겪은 containerd 드롭인 병합 사고를 근거로 쓰되, 데이터센터 GPU 와 대규모 프로덕션 경험이 아니라는 한계를 밝힙니다.
2026-10-07 · 20 분 읽기 #GPU Operator#Kubernetes#디바이스 플러그인#containerd#CDI