블로그
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 3704 편
#2026-03 762#culture 283#deep-dive 275#kubernetes 262#career 233#ai 223#llm 217#devops 198#2026-04 158#security 149#observability 118#database 113#communication 108#history 107#architecture 101#productivity 98#performance 93#linux 90#networking 89#finance 87#economy 84#mindset 80#psychology 79#ai-papers 78#food 78#it 78#travel 78#japanese 76#deep-learning 75#english 74#gpu 74#ai-agent 69#business-travel 69#postgresql 67#cs-fundamentals 63#rag 63#systems 63#python 56#learning 54#self-improvement 53
컨텍스트 예산 — 무엇을 넣을지가 아니라 무엇을 뺄지가 설계입니다
컨텍스트 창은 아직 남았는데 에이전트 정확도는 떨어집니다. 컨텍스트는 유한한 주의 예산이고, 도구 스키마도 그 예산을 먹습니다. 하네스 엔지니어링 시리즈 2편에서 프롬프트 누적을 플레이북으로 바꾸는 법, 드롭 정책과 컴팩션의 기준, 서브에이전트 위임의 비용까지 컨텍스트 예산 설계를 정리했습니다.
2026-08-12 · 11 분 읽기 #llm#agent#harness-engineering#하네스엔지니어링#AI에이전트지금 주목받는 오픈소스 (6) 스타 수가 말해 주지 않는 것
스타 수는 인기 지표이지 위험 지표가 아닙니다. 오픈소스를 프로덕션에 들이기 전에 실제로 확인해야 하는 신호를 정리합니다. 최근 커밋과 릴리스 주기, 이슈 응답, 기여자 분포와 버스 팩터를 GitHub API로 직접 세는 방법, 라이선스가 자동 분류되지 않을 때 LICENSE 파일을 직접 읽어야 하는 이유, 그리고 도입 전 체크리스트를 담았습니다. 시리즈에서 실제로 확인한 사례를 근거로 삼았
2026-08-12 · 10 분 읽기 #open-source#governance#supply-chain#risk#devops지금 주목받는 오픈소스 (1) AI 에이전트와 LLM 도구
LLM 애플리케이션 스택은 추론 서버, 오케스트레이션, 게이트웨이, 에이전트, RAG로 층이 갈라졌습니다. 각 층에서 실제로 쓰이는 오픈소스 12개를 스타 순위가 아니라 역할별로 묶어 소개합니다. 프로젝트마다 무엇을 대체하는지, 성숙도가 어느 정도인지, 어떤 상황에서 쓰면 안 되는지를 함께 정리했고, 저장소 경로와 라이선스, 스타 수, 최근 푸시 날짜는 2026년 8월 12일 GitHub에서
2026-08-12 · 10 분 읽기 #open-source#llm#ai-agent#ai-platform#rag컨테이너 인프라의 세대교체 — 자리를 내준 11개 프로젝트가 남긴 것
한때 컨테이너 인프라의 기본 구성이었다가 지금은 다른 것으로 대체된 프로젝트 11개를 공식 공지와 저장소 보관 상태만 근거로 정리합니다. rkt, dockershim, Classic Swarm, Docker Machine, Compose V1, Heapster, Apache Mesos, PodSecurityPolicy, CoreOS Container Linux, ingress-nginx, 그
2026-08-12 · 19 분 읽기 #open-source#kubernetes#container#docker#infrastructure지금 주목받는 오픈소스 (3) 인프라와 데이터베이스
데이터베이스와 인프라 영역은 라이선스 변경과 포크가 판을 다시 짠 분야입니다. 분석 엔진, 임베디드 데이터베이스, 포스트그레스 확장, 쿠버네티스 오퍼레이터, IaC까지 실제로 자리를 잡은 오픈소스 11개를 스타 순위가 아니라 해결하는 문제별로 묶어 소개합니다. 무엇을 대체하는지, 어느 정도 성숙했는지, 언제 쓰면 안 되는지를 함께 적었습니다. 저장소 경로와 라이선스, 스타 수, 최근 푸시는
2026-08-12 · 9 분 읽기 #open-source#database#infrastructure#postgresql#kubernetes지금 주목받는 오픈소스 (5) 데이터와 ML 파이프라인
데이터 파이프라인은 스케줄러 하나로 해결되지 않습니다. 적재, 변환, 오케스트레이션, 실행 엔진, 모델 수명 주기, 검색 저장소가 각각 다른 도구의 영역이 되었습니다. 이 층들에서 실제로 쓰이는 오픈소스 11개를 스타 순위가 아니라 담당 구간별로 묶어 소개합니다. 무엇을 대체하는지, 성숙도가 어느 정도인지, 언제 쓰면 안 되는지를 함께 적었고, 저장소 경로와 라이선스, 스타 수, 최근 푸시는
2026-08-12 · 9 분 읽기 #open-source#data-engineering#mlops#python#rust언어와 런타임의 세대교체 — 공식 EOL 공지로 읽는 11개 프로젝트
공식 종료 공지가 남아 있는 언어와 프레임워크, 런타임 11개를 정리합니다. Python 2, AngularJS, Vue 2, Nashorn, 자바 애플릿과 웹 스타트, Mono, Xamarin, PhoneGap, Atom, io.js, jQuery Mobile을 각각 무엇이었나, 왜 그때 옳았나, 무엇이 바뀌었나, 무엇이 그 자리에 왔나, 무엇을 남겼나, 지금도 쓰는 게 맞는 경우로 나눠
2026-08-12 · 20 분 읽기 #open-source#javascript#java#python#framework기본값에서 내려온 빌드 도구들 — 프론트엔드 툴체인 10개가 자리를 내준 이유
한때 프론트엔드 프로젝트의 기본값이었다가 지금은 새 프로젝트에서 잘 고르지 않게 된 도구 10개를, 공식 폐기 공지와 저장소 보관 상태 같은 확인 가능한 근거만으로 정리합니다. Create React App, Bower, TSLint, Karma, Protractor, PhantomJS, LibSass와 node-sass, Moment.js, Rome, Grunt를 각각 무엇이었나, 왜 그때
2026-08-12 · 16 분 읽기 #open-source#frontend#build-tools#deprecation#javascript지금 주목받는 오픈소스 (4) 관측 가능성과 보안
관측 데이터는 양이 곧 비용이고, 보안 도구는 파이프라인에 들어가지 못하면 쓰이지 않습니다. 계측 표준, 저장 엔진, eBPF 기반 런타임 감시, 공급망 검증까지 실제로 자리를 잡은 오픈소스 12개를 스타 순위가 아니라 담당하는 층별로 묶어 소개합니다. 무엇을 대체하는지, 성숙도가 어느 정도인지, 언제 쓰면 안 되는지를 함께 적었습니다. 저장소 경로와 라이선스, 스타 수, 최근 푸시는 202
2026-08-12 · 9 분 읽기 #open-source#observability#security#opentelemetry#ebpf지금 주목받는 오픈소스 (2) 빌드·에디터·CLI·터미널
패키지 설치, 린트, 번들링처럼 하루에 수십 번 반복되는 작업이 네이티브 언어로 다시 쓰이면서 대기 시간이 초 단위에서 밀리초 단위로 내려갔습니다. 빌드 도구, 에디터, 터미널, CLI 영역에서 실제로 자리를 잡은 오픈소스 12개를 스타 순위가 아니라 역할별로 묶어 소개합니다. 무엇을 대체하는지, 성숙도가 어느 정도인지, 언제 쓰면 안 되는지를 함께 적었고, 저장소 경로와 라이선스, 스타 수
2026-08-12 · 9 분 읽기 #open-source#developer-tools#cli#rust#performance무엇이 기술을 교체시키는가 — 우리 스택이 그 궤적 위에 있는지 점검하는 법
자리를 내준 오픈소스 시리즈의 마지막 편입니다. 앞선 세 편에서 다룬 30여 개 프로젝트를 가로질러, 기술을 교체시키는 힘이 무엇인지 다섯 가지로 정리합니다. 플랫폼 흡수, 운영 부담, 유지보수 인력, 라이선스 변경, 문제 정의의 이동. 특히 라이선스 변경은 MongoDB와 Elastic, HashiCorp, Redis 사례를 어디에서 어디로 바뀌었는지 사실만으로 표에 정리하고, 그 결과 생
2026-08-12 · 14 분 읽기 #open-source#architecture#license#migration#governance데이터 저장소와 큐의 세대교체 — 라이선스, 포크, 그리고 Attic으로 간 프로젝트들
데이터 계층에서 자리를 내주었거나 배포 조건이 바뀐 프로젝트 10개를 공식 발표문과 Apache Attic 기록만 근거로 정리합니다. Redis와 Elasticsearch, MongoDB의 라이선스 변경과 그로 인해 생긴 Valkey, OpenSearch 포크를 사실만으로 다루고, Kafka에서 ZooKeeper가 빠진 과정, Apache Attic으로 이관된 Sqoop과 Oozie, Gir
2026-08-12 · 18 분 읽기 #open-source#database#kafka#redis#elasticsearch하네스 엔지니어링이란 무엇인가 — 모델은 고정 입력이고, 배포하는 것은 그 주위 전부입니다
같은 모델을 쓰는데 왜 팀마다 에이전트 성과가 다를까요. 대부분의 팀에게 모델은 고정 입력이고, 실제로 배포하는 것은 도구 표면, 실패 반환 형식, 루프와 정지 조건, 컨텍스트 정책, 권한, 평가자까지 모델을 둘러싼 하네스 전부입니다. 하네스 엔지니어링 시리즈 1편으로, 하네스의 정의와 여섯 개의 손잡이, 그리고 프롬프트 엔지니어링이라는 이름이 이 일을 과소평가하는 이유를 정리했습니다.
2026-08-12 · 11 분 읽기 #llm#agent#harness-engineering#하네스엔지니어링#AI에이전트루프 설계 — 무한 루프와 조기 포기 사이
에이전트 루프의 실패는 두 방향입니다. 같은 호출을 수십 번 반복하는 무한 루프와, 한 번 막히자마자 포기하는 조기 정지. 하네스 엔지니어링 시리즈 4편에서 재시도 상한, 고정 스텝·목표 체크·확신도라는 세 가지 정지 조건, 확신도 기반 정지의 함정, 그리고 사람·서브에이전트로의 에스컬레이션까지 루프 설계를 정리했습니다.
2026-08-12 · 10 분 읽기 #llm#agent#harness-engineering#하네스엔지니어링#AI에이전트리워드 해킹 — 지표는 오르는데 과제는 실패합니다
에이전트가 테스트를 통과시키는 가장 싼 방법이 테스트를 고치는 것이라면, 에이전트는 그렇게 합니다. 리워드 해킹은 버그가 아니라 우리가 정의한 목표를 정확히 최적화한 결과입니다. 하네스 엔지니어링 시리즈 6편에서 채점 기준 완화와 assertion 삭제 같은 흔한 형태, 권한 격리가 지우는 절반, 그리고 견제 지표 설계까지 리워드 해킹 대응을 정리했습니다.
2026-08-12 · 10 분 읽기 #llm#agent#harness-engineering#하네스엔지니어링#AI에이전트vLLM 메트릭 — 무엇을 대시보드에 올리고 무엇으로 알람을 걸까
vLLM이 노출하는 시계열은 GPU 메트릭이 답하지 못하는 질문에 답합니다. 지금 몇 개가 실행 중이고 몇 개가 대기 중인지, KV 캐시가 얼마나 찼는지, 첫 토큰까지 얼마나 걸리는지 같은 것들입니다. 이 글은 vLLM 공식 문서와 저장소의 메트릭 로거 소스를 직접 읽고 스케줄러 상태 게이지, 캐시 계열 카운터, 지연 히스토그램의 정확한 이름과 의미를 정리하고, 카운터 이름의 접미사 차이처럼
2026-08-12 · 13 분 읽기 #gpu#kubernetes#vllm#prometheus#observabilityMIG와 time-slicing — GPU 한 장을 여럿이 쓰는 두 가지 방법
GPU 한 장에 여러 워크로드를 올리는 방법은 크게 두 가지입니다. 시간을 나누는 time-slicing과 하드웨어를 나누는 MIG인데, 이름이 비슷해 보이는 것과 달리 격리 수준이 전혀 다릅니다. 이 글은 NVIDIA GPU Operator 공식 문서를 기준으로 두 방식의 설정 파일 구조와 노드 라벨, 광고되는 리소스 이름, 지원 하드웨어 조건을 정리하고, time-slicing 복제본 사
2026-08-12 · 12 분 읽기 #gpu#kubernetes#mig#time-slicing#nvidiaDCGM Exporter — GPU 이용률은 당신이 생각하는 그것이 아니다
DCGM Exporter는 GPU 텔레메트리를 프로메테우스 형식으로 노출하는 표준 경로지만, 가장 많이 대시보드에 올라가는 GPU 이용률 계열 메트릭은 사람들이 기대하는 것을 재지 않습니다. 이 글은 dcgm-exporter 저장소의 기본 카운터 CSV와 DCGM 공식 문서, NVML API 문서를 직접 읽고 기본으로 켜져 있는 메트릭 목록, 이용률 메트릭이 실제로 무엇을 뜻하는지, 함께 봐
2026-08-12 · 17 분 읽기 #gpu#kubernetes#dcgm#prometheus#observabilityGPU 서빙 SLO와 알람 설계 — 무엇을 약속하고 무엇을 깨울 것인가
GPU 추론 서비스에 SLO를 걸려면 먼저 어떤 지표가 사용자 경험을 대변하는지 정해야 합니다. 첫 토큰 지연과 처리량은 서로를 잡아먹는 관계라 하나만 보고 목표를 세우면 반드시 다른 쪽이 무너집니다. 이 글은 vLLM과 DCGM Exporter가 실제로 노출하는 시계열만 써서 SLI를 정의하는 방법, 히스토그램 버킷 경계를 임계값으로 삼아야 하는 이유, 포화 신호를 읽는 순서, 증상 기반
2026-08-12 · 13 분 읽기 #gpu#kubernetes#slo#alerting#prometheusGPU 장애 진단 플레이북 — 계층을 정해 놓고 내려간다
쿠버네티스에서 GPU 문제를 진단할 때 가장 큰 낭비는 순서 없이 아무 데나 찔러 보는 것입니다. 파드가 스케줄되지 않는 것, 파드는 떴는데 GPU가 안 보이는 것, 드라이버와 툴킷 버전이 어긋난 것, 메모리가 부족한 것, 노드에서 GPU가 사라지는 것은 서로 다른 계층의 문제라 확인 순서가 다릅니다. 이 글은 NVIDIA GPU Operator 공식 트러블슈팅 문서와 dcgm-exporte
2026-08-12 · 14 분 읽기 #gpu#kubernetes#troubleshooting#nvidia#gpu-operator