태그: #양자화
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 3 편
음성 대화의 원리를 숫자로 확인하기: 디코딩은 메모리 대역폭, 합성은 프레임 수, 스트리밍은 캐시
실시간 음성 대화의 세 부품(대화 LLM, 음성인식, 음성합성)이 왜 그 시간에 끝나는지를 원리로 설명하고, 20편에서 직접 잰 값으로 하나씩 검산합니다. LLM 토큰 속도는 크기와 정밀도가 다른 모델 네 개에서 직접 잰 메모리 대역폭의 86~98%, 동시 요청 16개에서 총 처리량 약 14~15배, 입력 처리는 연산 한계의 약 75~80% 이고, 합성은 프레임당 약 76ms, 스트리밍 음성
2026-10-07 · 32 분 읽기 #음성 에이전트#LLM 추론#메모리 대역폭#스트리밍 ASR#TTSNPU 완전 해부: 트랜스포머 아키텍처가 실리콘 위에서 어떻게 달리는가
NPU가 CPU/GPU와 무엇이 다른지, 트랜스포머의 모든 연산이 하드웨어에 어떻게 매핑되는지, 왜 LLM 추론은 메모리 바운드인지를 루프라인 모델과 실제 코드로 완전 해부합니다. Apple ANE부터 Qualcomm Hexagon, Groq LPU까지.
2026-03-18 · 28 분 읽기 #npu#트랜스포머#ai-hardware#양자화#KV캐시LLM 서빙 최적화 완전 가이드: KV Cache, PagedAttention, 양자화의 모든 것 ♪ 들을 수 있어요
LLM 서빙의 핵심 최적화 기술을 완전 해부한다. KV Cache의 메모리 문제부터 PagedAttention의 가상 메모리 혁신, 연속 배칭, 추측 디코딩, 양자화, 그리고 vLLM/TGI/TensorRT-LLM 비교까지.
2026-03-18 · 48 분 읽기 #LLM서빙#KV캐시#paged-attention#vllm#양자화