태그: #스케줄링
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 4 편
멀티테넌트 GPU 스케줄링과 용량 계획 ♪ 들을 수 있어요
기본 스케줄러가 GPU를 다루는 방식의 한계에서 출발해 Kueue와 Volcano의 설계 차이, 토폴로지 인식 배치, GPU 공유의 격리 한계, DRA의 현재 상태를 정리합니다. 마지막으로 요청률과 지연 목표에서 GPU 수를 역산하는 방법을 필자의 실험 환경에서 잰 값을 기준점으로 보입니다.
2026-10-08 · 37 분 읽기 #Kubernetes#GPU#Kueue#Volcano#스케줄링ML·AI 인프라와 쿠버네티스 엔지니어가 알면 좋은 지식 지도: 직접 재 본 숫자와 함께
GPU 한 장에서 쿠버네티스 위의 서빙까지, ML·AI 인프라 엔지니어와 쿠버네티스 엔지니어가 알아 두면 좋은 지식을 여덟 개 층으로 정리합니다. 층마다 핵심 개념, 직접 재 본 숫자, 흔한 함정, 더 읽을 글을 붙였고 4주 학습 경로와 현장 질문도 담았습니다.
2026-10-07 · 24 분 읽기 #ML 인프라#AI 인프라#쿠버네티스#GPU#LLM 서빙LLM 추론의 기본과 vLLM 내부: KV 캐시, PagedAttention, 스케줄러
decode 가 메모리 대역폭 한계인 이유를 산술 강도로 설명하고, KV 캐시 크기 식과 vLLM v0.30.0 의 블록 관리, 접두사 캐시, 스케줄러, 선점, 운영 파라미터를 소스와 문서로 확인해 정리합니다. 8GB급 노트북 GPU 에서 잰 실측과 그 한계도 있는 그대로 적습니다.
2026-10-07 · 29 분 읽기 #LLM 추론#vLLM#KV 캐시#PagedAttention#스케줄링운영체제 완전 정복: 프로세스/메모리/파일시스템부터 AI 워크로드 최적화까지
프로세스 스케줄링, 가상 메모리, 파일 시스템부터 iouring, NUMA-aware 메모리 할당, cgroups를 통한 GPU 자원 격리까지 AI 엔지니어를 위한 운영체제 완전 가이드입니다.
2026-03-17 · 21 분 읽기 #operating-system#linux#memory-management#스케줄링#iouring