블로그
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 3704 편
#2026-03 762#culture 283#deep-dive 275#kubernetes 262#career 233#ai 223#llm 217#devops 198#2026-04 158#security 149#observability 118#database 113#communication 108#history 107#architecture 101#productivity 98#performance 93#linux 90#networking 89#finance 87#economy 84#mindset 80#psychology 79#ai-papers 78#food 78#it 78#travel 78#japanese 76#deep-learning 75#english 74#gpu 74#ai-agent 69#business-travel 69#postgresql 67#cs-fundamentals 63#rag 63#systems 63#python 56#learning 54#self-improvement 53
전이중 음성 통화를 웹소켓으로 중계하기: 브라우저 마이크에서 GPU 모델까지
듣는 중에도 말하는 전이중 음성 모델을 브라우저에 붙이면서 웹소켓으로 무엇을 어떻게 주고받았는지 정리합니다. 왜 브라우저를 모델 서버에 바로 붙이지 않고 백엔드가 중계하는지, 소리를 몇 Hz·몇 비트·몇 초 묶음으로 보내는지, 텍스트 프레임과 이진 프레임을 어떻게 나눴는지, 몰아 보내는 클라이언트를 어떻게 막는지, 서버가 한 통화만 받을 때 웹 파드 둘에서 자리를 어떻게 지키는지를 직접 잰
2026-10-08 · 19 분 읽기 #웹소켓#전이중#음성 에이전트#MiniCPM-o#llama.cppLLM 서빙을 OpenTelemetry 로 관측하기: vLLM 에서 실제로 나오는 신호, 표준과의 거리, 컬렉터로 메우기
vLLM 에 OpenTelemetry 트레이싱을 켜고 컬렉터를 붙여, 요청 하나가 어떤 스팬과 속성으로 남는지, 지표는 어떤 이름으로 나오는지, 켜는 비용이 얼마인지, GenAI 시맨틱 컨벤션과 어디가 다른지를 직접 쟀습니다. 컬렉터의 변환 프로세서로 이름을 표준에 맞추고, 꼬리 기반 샘플링으로 느린 요청만 남기는 것까지 확인했습니다. OTCA 시험 범위(컬렉터 파이프라인, 샘플링, 시맨틱
2026-10-08 · 25 분 읽기 #OpenTelemetry#OTCA#vLLM#트레이싱#컬렉터DCGM exporter 지표 전부 해부: 실제로 나오는 18개와 나오지 않는 것
테스트 환경의 dcgm-exporter 에서 실제로 받아 온 지표 18개를 하나씩 설명하고, 이 GPU 에서 나오지 않는 지표(프로파일링, XID, NVLink)와 그 이유를 로그로 확인합니다. 지표 값의 해석 함정도 정리합니다.
2026-10-08 · 18 분 읽기 #DCGM#dcgm-exporter#GPU 모니터링#Prometheus#GPU Operator멀티테넌트 GPU 스케줄링과 용량 계획 ♪ 들을 수 있어요
기본 스케줄러가 GPU를 다루는 방식의 한계에서 출발해 Kueue와 Volcano의 설계 차이, 토폴로지 인식 배치, GPU 공유의 격리 한계, DRA의 현재 상태를 정리합니다. 마지막으로 요청률과 지연 목표에서 GPU 수를 역산하는 방법을 필자의 실험 환경에서 잰 값을 기준점으로 보입니다.
2026-10-08 · 37 분 읽기 #Kubernetes#GPU#Kueue#Volcano#스케줄링쿠버네티스 CRD 와 오퍼레이터로 LLM 서빙 배포 자동화하기 ♪ 들을 수 있어요
LLM 서빙은 스케일의 단위가 파드 하나가 아니라 파드 묶음이어서 Deployment 만으로 표현하기 어렵고, 이를 LeaderWorkerSet, KServe, Dynamo 같은 CRD 와 오퍼레이터가 맡습니다. 조정 루프, 소유 참조와 finalizer, CRD 버전 관리, 롤아웃, Argo CD 와의 충돌을 공식 문서와 현재 스키마로 확인하고, 격리된 실습 환경에서 확인한 동작을 근거로
2026-10-08 · 48 분 읽기 #쿠버네티스#CRD#오퍼레이터#LeaderWorkerSet#KServe하이브리드 GPU 쿠버네티스와 Cilium·Istio 네트워크 ♪ 들을 수 있어요
온프레미스 GPU 노드와 클라우드 노드를 한 클러스터 또는 여러 클러스터로 묶을 때 선택지와 네트워크 경로, 그리고 Cilium과 Istio의 역할 분담을 정리합니다. LLM 서빙의 긴 연결과 스트리밍 응답이 타임아웃, 로드밸런싱, 헬스체크에서 어떻게 깨지는지를 중심으로 다룹니다.
2026-10-08 · 46 분 읽기 #Kubernetes#하이브리드클라우드#GPU#Cilium#IstioML·AI 인프라와 쿠버네티스 엔지니어가 알면 좋은 지식 지도: 직접 재 본 숫자와 함께
GPU 한 장에서 쿠버네티스 위의 서빙까지, ML·AI 인프라 엔지니어와 쿠버네티스 엔지니어가 알아 두면 좋은 지식을 여덟 개 층으로 정리합니다. 층마다 핵심 개념, 직접 재 본 숫자, 흔한 함정, 더 읽을 글을 붙였고 4주 학습 경로와 현장 질문도 담았습니다.
2026-10-07 · 24 분 읽기 #ML 인프라#AI 인프라#쿠버네티스#GPU#LLM 서빙NVIDIA Dynamo 직접 써 보기: KV 인식 라우팅은 거의 다 맞혔고, 분리 서빙은 한 장에서 5배, 서버 둘 사이에서 20배 넘게 느렸다
NVIDIA Dynamo 를 쿠버네티스 없이 GPU 한 장짜리 환경에 설치해 프런트엔드 비용, KV 인식 라우팅의 적중, 라우터가 이벤트를 받지 못할 때의 조용한 실패, 한 장 위에서의 prefill/decode 분리 비용, 서로 다른 GPU 의 서버 둘로 나눴을 때의 비용을 직접 쟀습니다. 6편이 문서로 정리한 내용 가운데 무엇이 실측으로 확인되었고 무엇이 아직 미실측인지 구분해 적었습니다
2026-10-07 · 23 분 읽기 #Dynamo#LLM서빙#KV캐시#라우팅#prefill-decode분리LoRA 어댑터 서빙을 직접 재 보기: 처리량 비용, 어댑터 슬롯, 실행 중 적재
기본 모델 하나에 LoRA 어댑터 여러 개를 얹어 서빙할 때 처리량이 얼마나 줄어드는지, 어댑터 수가 슬롯 수를 넘으면 무슨 일이 생기는지, 실행 중에 어댑터를 올리는 데 얼마나 걸리는지를 1.7B 모델과 vLLM 으로 직접 쟀습니다.
2026-10-07 · 19 분 읽기 #LoRA#vLLM#멀티 어댑터#서빙#처리량작은 모델로 vLLM 직접 재 보기: 부하, KV 캐시 용량, 접두사 캐시, 청크 크기
1.7B 모델 한 개를 8GB급 GPU 한 장에 올리고, 동시 요청을 늘리며 처리량과 첫 토큰 시간이 어디서 꺾이는지, KV 캐시 용량이 식과 맞는지, 접두사 캐시와 KV 8비트와 청크 크기가 각각 무엇을 바꾸는지 직접 쟀습니다.
2026-10-07 · 29 분 읽기 #vLLM#부하 테스트#KV 캐시#접두사 캐시#청크 프리필실시간 음성 대화, 부품별로 직접 잰 지연: 음성인식 0.2초, LLM 첫 토큰 0.07초, 음성합성은 길이의 절반
외국어 말하기 연습용 실시간 음성 대화의 세 부품(음성인식, 대화 LLM, 음성합성)을 한국어, 일본어, 중국어, 영어로 직접 쟀습니다. 부품별 지연과 GPU 메모리, 오픈 모델 두 쌍의 비교, 한 턴의 첫 소리까지의 계산, 그리고 측정하면서 만나기 쉬운 함정을 정리했습니다.
2026-10-07 · 30 분 읽기 #음성 에이전트#ASR#TTS#지연 측정#LLM 추론실시간 음성 대화 앱을 만들 때 쓸 NVIDIA 오픈소스: Nemotron 음성 에이전트, PersonaPlex, NeMo
실시간 음성 대화 애플리케이션을 만들기 위해 NVIDIA 가 공개한 오픈소스를 조사합니다. 음성인식, LLM, 음성합성을 이어 붙이는 구조와 한 모델이 듣고 말하는 풀듀플렉스 구조를 비교하고, 한국어를 지원하는 조합이 무엇인지, 8GB급 노트북 GPU 와 24GB급 소비자용 GPU 로 어디까지 가능한지 정리합니다.
2026-10-07 · 17 분 읽기 #음성 에이전트#실시간 음성인식#Nemotron#PersonaPlex#Pipecat분산 추론과 NVIDIA Dynamo: 병렬화, prefill/decode 분리, KV 캐시 이동
모델이 GPU 한 장에 들어가지 않을 때 쓰는 네 가지 병렬화와 통신 특성을 정리하고, prefill/decode 분리가 왜 필요하며 KV 캐시 이동이라는 대가를 어떻게 치르는지 설명합니다. 이어서 2026년 10월 기준 NVIDIA Dynamo v1.5.0 의 구조와 쿠버네티스 배포 방식을 llm-d, vLLM, SGLang 과 비교합니다.
2026-10-07 · 33 분 읽기 #LLM서빙#분산추론#Dynamo#병렬화#prefill-decode분리vLLM 과 SGLang 비교, 그리고 벤치마크를 제대로 하는 법 ♪ 들을 수 있어요
두 추론 엔진을 접두사 캐시 구조와 설계 철학, 기능, 워크로드 모양별 선택 기준으로 비교하고, 열린 루프 부하와 접두사 캐시 함정, 퍼센타일 읽기를 포함한 벤치마크 방법을 공식 도구로 확인해 정리합니다. 결과를 SLO 기준의 GPU 대수로 바꾸는 절차까지 다루며, 우열을 단정하지 않고 직접 측정하는 법을 남깁니다.
2026-10-07 · 40 분 읽기 #vLLM#SGLang#RadixAttention#벤치마크#용량 계획GPU Operator 파드 구성요소와 역할, 호스트에 드라이버가 없어도 되는가
GPU Operator 를 설치하면 어떤 파드가 어느 노드에 뜨고 각각 무슨 일을 하는지, 파드들이 어떤 순서로 서로를 기다리는지, 호스트에 NVIDIA 드라이버가 없어도 오퍼레이터만으로 동작하는지를 실제 파드 구성과 공식 문서로 확인해 정리합니다.
2026-10-07 · 17 분 읽기 #GPU Operator#Kubernetes#NVIDIA 드라이버#디바이스 플러그인#Container Toolkit모델 가중치 암호화와 보호: 저장 시 암호화의 비용을 재고, 어디까지 막는지 정리하기
모델 가중치 파일을 AES-256-GCM 으로 암호화해 암호화·복호화 속도와 무결성 검사를 직접 재고, 저장 시 암호화가 막는 위협과 막지 못하는 위협(실행 중 메모리)을 위협 모델 표로 정리합니다. 콜드 스타트에 더해지는 시간도 계산합니다.
2026-10-07 · 22 분 읽기 #모델 보안#가중치 암호화#AES-GCM#무결성#기밀 컴퓨팅음성 대화의 원리를 숫자로 확인하기: 디코딩은 메모리 대역폭, 합성은 프레임 수, 스트리밍은 캐시
실시간 음성 대화의 세 부품(대화 LLM, 음성인식, 음성합성)이 왜 그 시간에 끝나는지를 원리로 설명하고, 20편에서 직접 잰 값으로 하나씩 검산합니다. LLM 토큰 속도는 크기와 정밀도가 다른 모델 네 개에서 직접 잰 메모리 대역폭의 86~98%, 동시 요청 16개에서 총 처리량 약 14~15배, 입력 처리는 연산 한계의 약 75~80% 이고, 합성은 프레임당 약 76ms, 스트리밍 음성
2026-10-07 · 32 분 읽기 #음성 에이전트#LLM 추론#메모리 대역폭#스트리밍 ASR#TTSCilium 지표 전부 해부: 에이전트, 오퍼레이터, Envoy, Hubble 네 곳
테스트 환경의 Cilium 1.20.1 에서 에이전트(169개 계열), 오퍼레이터(96개), Envoy(450개), Hubble(14개 계열, 한 노드에서 시계열 약 8만 개)의 지표를 실제로 받아 분류하고, 드롭 사유와 BPF 맵 압력 같은 실측 값과 Hubble 카디널리티 문제를 정리합니다.
2026-10-07 · 22 분 읽기 #Cilium#지표#Prometheus#Hubble#eBPFGPU 패스스루와 vfio-pci: VM 에 GPU 를 통째로 넘기는 원리
GPU 를 컨테이너가 아니라 VM 에 통째로 넘기는 패스스루가 어떤 원리로 동작하는지, IOMMU 그룹과 vfio-pci 가 각각 무슨 일을 하는지를 GPU 서버 한 대에서 읽은 예시 값으로 설명합니다. 같은 GPU 에서 nvidia-smi 가 실패하는 이유도 다룹니다.
2026-10-07 · 21 분 읽기 #GPU#패스스루#VFIO#IOMMU#KubeVirtGPU 하드웨어·드라이버 장애 진단
DCGM 지표, XID 코드, ECC·NVLink·스로틀링·PCIe 강등, 느린 GPU 하나가 전체를 늦추는 현상을 NVIDIA 공식 문서 기준으로 정리하고 쿠버네티스의 격리·자동 복구·알림 설계로 잇습니다. 필자의 실험 환경은 소비자용 GPU 뿐이라 XID·ECC 장애를 겪은 기록이 없으며, 소비자용 GPU 에서 지표가 빠지는 모습을 실측 출력으로 보여 줍니다.
2026-10-07 · 32 분 읽기 #DCGM#XID#ECC#NVLink#스로틀링