태그: #실측
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 3 편
전이중 음성 통화를 웹소켓으로 중계하기: 브라우저 마이크에서 GPU 모델까지
듣는 중에도 말하는 전이중 음성 모델을 브라우저에 붙이면서 웹소켓으로 무엇을 어떻게 주고받았는지 정리합니다. 왜 브라우저를 모델 서버에 바로 붙이지 않고 백엔드가 중계하는지, 소리를 몇 Hz·몇 비트·몇 초 묶음으로 보내는지, 텍스트 프레임과 이진 프레임을 어떻게 나눴는지, 몰아 보내는 클라이언트를 어떻게 막는지, 서버가 한 통화만 받을 때 웹 파드 둘에서 자리를 어떻게 지키는지를 직접 잰
2026-10-08 · 19 분 읽기 #웹소켓#전이중#음성 에이전트#MiniCPM-o#llama.cppLLM 서빙을 OpenTelemetry 로 관측하기: vLLM 에서 실제로 나오는 신호, 표준과의 거리, 컬렉터로 메우기
vLLM 에 OpenTelemetry 트레이싱을 켜고 컬렉터를 붙여, 요청 하나가 어떤 스팬과 속성으로 남는지, 지표는 어떤 이름으로 나오는지, 켜는 비용이 얼마인지, GenAI 시맨틱 컨벤션과 어디가 다른지를 직접 쟀습니다. 컬렉터의 변환 프로세서로 이름을 표준에 맞추고, 꼬리 기반 샘플링으로 느린 요청만 남기는 것까지 확인했습니다. OTCA 시험 범위(컬렉터 파이프라인, 샘플링, 시맨틱
2026-10-08 · 25 분 읽기 #OpenTelemetry#OTCA#vLLM#트레이싱#컬렉터NVIDIA Dynamo 직접 써 보기: KV 인식 라우팅은 거의 다 맞혔고, 분리 서빙은 한 장에서 5배, 서버 둘 사이에서 20배 넘게 느렸다
NVIDIA Dynamo 를 쿠버네티스 없이 GPU 한 장짜리 환경에 설치해 프런트엔드 비용, KV 인식 라우팅의 적중, 라우터가 이벤트를 받지 못할 때의 조용한 실패, 한 장 위에서의 prefill/decode 분리 비용, 서로 다른 GPU 의 서버 둘로 나눴을 때의 비용을 직접 쟀습니다. 6편이 문서로 정리한 내용 가운데 무엇이 실측으로 확인되었고 무엇이 아직 미실측인지 구분해 적었습니다
2026-10-07 · 23 분 읽기 #Dynamo#LLM서빙#KV캐시#라우팅#prefill-decode분리