블로그
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 3704 편
#2026-03 762#culture 283#deep-dive 275#kubernetes 262#career 233#ai 223#llm 217#devops 198#2026-04 158#security 149#observability 118#database 113#communication 108#history 107#architecture 101#productivity 98#performance 93#linux 90#networking 89#finance 87#economy 84#mindset 80#psychology 79#ai-papers 78#food 78#it 78#travel 78#japanese 76#deep-learning 75#english 74#gpu 74#ai-agent 69#business-travel 69#postgresql 67#cs-fundamentals 63#rag 63#systems 63#python 56#learning 54#self-improvement 53
멀티모달 토크나이제이션과 융합 — 이미지·오디오를 토큰으로
이미지와 오디오, 비디오를 어떻게 토큰으로 바꾸고 텍스트와 하나의 시퀀스로 엮는지 정리합니다. 패치·VQ 기반 이미지 토큰화, 이산 코덱 오디오 토큰화, 프레임 샘플링, 인터리빙과 구분 토큰, 토큰 폭증과 압축, 컨텍스트 비용까지 멀티모달 LLM의 입력 구성을 깊이 다룹니다.
2026-06-26 · 30 분 읽기 #llm#multimodal#tokenization#vision-language#q-formerVision LLM 학습법 — input과 output을 어떻게 가르치나 ♪ 들을 수 있어요
비전-언어 모델은 정렬 사전학습부터 인스트럭션 파인튜닝까지 단계적으로 학습됩니다. 비전 인코더 동결 전략, 데이터 구성, 입력 포맷과 출력 형태, 손실 계산까지 무엇을 어떻게 가르치는지 학습 파이프라인 관점에서 정리합니다.
2026-06-26 · 35 분 읽기 #mlops#vision-language-model#multimodal#training#instruction-tuningLLM 추론 서빙 2026 — vLLM, SGLang, TensorRT-LLM 비교
2026년의 LLM 추론 서빙을 한눈에 정리합니다. prefill과 decode의 성격 차이, continuous batching, paged KV 캐시 같은 핵심 원리부터 vLLM, SGLang, TensorRT-LLM의 강약점 비교와 선택 가이드, 실제 배포 설정까지 개발자 관점에서 다룹니다.
2026-06-26 · 27 분 읽기 #llm-serving#vllm#sglang#tensorrt-llm#inference위치 인코딩 완전 이해 — 사인파에서 RoPE까지
왜 Transformer에 위치 정보가 필요한지부터 시작해 sinusoidal, learned, 상대 위치 인코딩, 그리고 RoPE와 ALiBi를 단계적으로 설명합니다. 길이 외삽과 컨텍스트 확장(NTK, YaRN), 멀티모달의 M-RoPE까지 연결하고 흔한 함정을 정리합니다.
2026-06-26 · 29 분 읽기 #llm#positional-encoding#rope#alibi#long-contextTransformer 구조 완전 해부 — Attention부터 KV Cache까지
Transformer의 self-attention, 멀티헤드, 위치 인코딩, FFN, 잔차 연결과 정규화를 처음부터 분해해 설명합니다. 텐서 shape와 파라미터 수 계산, causal mask, 인코더/디코더 구조, 그리고 추론 단계의 KV cache까지 연결해 전체 그림을 그립니다.
2026-06-26 · 26 분 읽기 #llm#transformer#attention#positional-encoding#kv-cache어텐션의 진화 — MQA, GQA, FlashAttention, 그리고 긴 컨텍스트
표준 어텐션의 메모리와 연산 비용을 분석하고, MQA와 GQA가 KV cache를 어떻게 줄이는지, FlashAttention이 IO를 어떻게 최적화하는지 설명합니다. 슬라이딩 윈도우와 롱컨텍스트 기법, 그리고 이 모든 선택이 서빙 메모리에 미치는 영향까지 비교합니다.
2026-06-26 · 31 분 읽기 #llm#attention#flashattention#gqa#mqa추론을 빠르게 — Speculative Decoding과 처리량 최적화
LLM의 decode가 느린 근본 이유부터 speculative decoding으로 속도를 끌어올리는 원리, 메두사와 EAGLE 같은 변형, chunked prefill과 prefill/decode 분리, 지연과 처리량의 트레이드오프, 그리고 TTFT/TPOT 같은 측정 지표까지 추론 가속의 핵심을 정리합니다.
2026-06-26 · 23 분 읽기 #speculative-decoding#throughput#inference#mlops#latency멀티모달 LLM 서빙 — 이미지 입력이 만드는 새로운 과제
텍스트 전용 LLM 서빙과 무엇이 다른지부터, 비전 인코더 추가 단계, 가변 비주얼 토큰 수, 프리필 비용 급증, 멀티모달 KV 캐시와 배칭의 난점, 지연 분해와 처리량 최적화, 비용과 운영 함정까지 멀티모달 LLM 서빙의 실무를 정리합니다.
2026-06-26 · 30 분 읽기 #mlops#multimodal#llm-serving#vllm#kv-cacheKV 캐시와 PagedAttention — 추론 메모리의 모든 것
LLM 추론에서 메모리를 가장 많이 먹는 주범인 KV 캐시를 깊이 파헤칩니다. KV 캐시가 무엇이고 왜 메모리를 잡아먹는지, 메모리 산수와 단편화 문제, PagedAttention의 블록 관리, prefix 공유와 KV 양자화까지 개발자 관점에서 정리합니다.
2026-06-26 · 22 분 읽기 #kv-cache#paged-attention#inference#gpu-memory#quantization멀티모달 AI 학습법 — 여러 감각을 하나의 모델로 ♪ 들을 수 있어요
이미지·텍스트·오디오·비디오를 하나의 모델로 다루는 멀티모달 AI의 학습 원리를 정리합니다. 모달리티 정렬과 대조학습, 융합 방식, 공유 임베딩 공간, 사전학습과 파인튜닝, 데이터와 평가, 그리고 환각 같은 한계까지 학습 파이프라인을 코드와 함께 살펴봅니다.
2026-06-26 · 34 분 읽기 #ai-papers#multimodal#clip#vision-language#contrastive-learningRust 매크로: 선언적 매크로 vs 절차적 매크로(derive)
Rust의 매크로는 컴파일 시점에 코드를 생성하는 메타프로그래밍 도구입니다. 패턴 기반의 선언적 매크로(macrorules!)와, 코드를 토큰 스트림으로 받아 조작하는 절차적 매크로(derive·attribute·function-like)를 구분해 설명합니다. serde의 [derive(Serialize)]가 실제로 무엇을 하는지, syn과 quote로 TokenStream을 다루는 흐름,
2026-06-26 · 18 분 읽기 #rust#macros#metaprogramming머지되는 PR과 커밋 메시지 쓰기
리뷰가 빨리 끝나고 빨리 머지되는 PR에는 공통점이 있습니다. 작고 목적이 하나인 PR, Conventional Commits, "무엇"이 아니라 "왜"를 담은 커밋 본문, 스스로 하는 셀프 리뷰, 맥락·변경·테스트를 담은 PR 설명, 리뷰어에 대한 공감, 그리고 스택 PR까지. 리뷰어의 시간을 아끼는 것이 곧 내 PR을 빨리 통과시키는 길입니다.
2026-06-26 · 16 분 읽기 #git#code-review#collaborationOCR을 넘어서 — OCR-free 문서 이해와 통합 모델 ♪ 들을 수 있어요
전통적인 OCR 파이프라인은 검출-인식-레이아웃을 단계로 나누지만 오류가 누적됩니다. Donut류와 VLM 기반의 OCR-free 문서 이해, 고해상도와 표 처리, 통합 모델의 흐름까지 문서 AI의 전환을 정리합니다.
2026-06-26 · 40 분 읽기 #ai-papers#ocr-free#document-understanding#multimodal#donut코드 리뷰의 대화법: 갈등 없이 피드백 주고받기
코드 리뷰는 결함을 잡는 기술 활동인 동시에, 사람과 사람 사이의 대화입니다. 사람이 아니라 코드를 리뷰하는 프레이밍, nit과 blocker를 구분하는 컨벤셔널 코멘트, 명령 대신 질문하기, 작은 PR이 진짜 리뷰를 받는 이유, 잘한 코드를 칭찬하기, 작성자로서 피드백을 우아하게 받는 법, 그리고 리뷰어와 작성자가 나눠 지는 양방향 책임까지 다룹니다.
2026-06-26 · 29 분 읽기 #code-review#communication#engineeringDNS 깊이 보기 — 무료화가 부른 이름 해석의 세계 ♪ 들을 수 있어요
DNS가 다시 화제입니다. 재귀와 권한, 캐시와 TTL, Anycast 글로벌 분산, DNSSEC, DoH/DoT까지 이름 해석의 전 과정을 깊이 있게 살펴봅니다. 무료 DNS 호스팅이 보편화된 2026년, 우리가 알아야 할 운영 함정도 함께 정리합니다.
2026-06-25 · 43 분 읽기 #network#dns#anycast#dnssec#dohHTTP QUERY 메소드 — REST의 오랜 딜레마를 푸는 새로운 동사
GET은 본문을 보낼 수 없고 POST는 검색에 의미가 맞지 않습니다. 이 오랜 딜레마를 푸는 새로운 HTTP 동사 QUERY 메소드의 동기와 의미론, 그리고 실무 적용 방법을 깊이 있게 다룹니다.
2026-06-25 · 26 분 읽기 #http#query-method#rest#api-design#rfcAI 코드 리뷰 도구의 부상 — 무엇을 맡기고 무엇을 사람이 볼까
AI 코드 리뷰 도구가 빠르게 확산되고 있습니다. AI가 잘 잡는 결함과 사람이 반드시 봐야 하는 영역을 구분하고, CI 통합과 도입 체크리스트, 그리고 비판적 시각까지 정리합니다.
2026-06-25 · 28 분 읽기 #devops#code-review#ai-tools#developer-experience#ci-cd이해의 기쁨 — LLM 시대에도 깊이 이해해야 하는 이유 ♪ 들을 수 있어요
검색과 LLM은 빠른 답을 주지만, 깊은 이해는 통제와 소유권을 줍니다. 추상화 너머를 보는 것의 가치, 도구에 끌려가지 않는 태도, 디버깅과 장애에서 드러나는 이해의 차이, 학습으로서의 이해, 그리고 언제 추상화에 기대도 되는지의 균형을 정리합니다.
2026-06-25 · 46 분 읽기 #culture#learning#craftsmanship#understanding#engineeringAI로 버그를 사냥하다 — 자동화된 보안 연구의 시대 ♪ 들을 수 있어요
AI가 API를 대량으로 자동 탐침해 취약점을 발굴하는 사례가 늘고 있습니다. 퍼징과 차이 분석, LLM 보조 트리아지의 작동 원리부터 공격자도 AI를 쓰는 비대칭, 방어 측의 함의, 그리고 윤리와 책임공개까지 자동화된 보안 연구의 현재를 깊이 살펴봅니다.
2026-06-25 · 39 분 읽기 #devops#security#ai#bug-bounty#fuzzing기술적 과욕과 스코프 — 카맥의 회고에서 배우는 것 ♪ 들을 수 있어요
존 카맥이 공개한 Quake 개발 회고를 단서로, 초기 게임 개발의 기술적 야심과 조직 운영 문제를 일반적 교훈으로 풀어냅니다. 안정적 기반을 택하는 가치, 스코프 관리와 기술부채, 야심과 현실의 균형, 작은 팀의 의사결정을 정리합니다.
2026-06-25 · 49 분 읽기 #culture#engineering#scope#technical-debt#team