블로그
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 3704 편
#2026-03 762#culture 283#deep-dive 275#kubernetes 262#career 233#ai 223#llm 217#devops 198#2026-04 158#security 149#observability 118#database 113#communication 108#history 107#architecture 101#productivity 98#performance 93#linux 90#networking 89#finance 87#economy 84#mindset 80#psychology 79#ai-papers 78#food 78#it 78#travel 78#japanese 76#deep-learning 75#english 74#gpu 74#ai-agent 69#business-travel 69#postgresql 67#cs-fundamentals 63#rag 63#systems 63#python 56#learning 54#self-improvement 53
2026년에도 윤초는 없다 — 그리고 아무도 겪어본 적 없는 음의 윤초
IERS가 2026년 7월 6일 Bulletin C 72로 "2026년 12월 말 윤초 없음"을 발표했습니다. 겉보기엔 조용한 소식이지만, 지구 자전이 2016년부터 오히려 빨라지면서 사상 처음으로 음의 윤초를 넣어야 할 가능성이 생겼습니다. 윤초가 무엇인지, POSIX 시간이 왜 이걸 표현하지 못하는지, 2012년과 2017년의 실제 장애가 무엇을 가르쳐 주는지, 그리고 한 번도 실행된 적
2026-07-11 · 10 분 읽기 #leap-second#utc#ntp#distributed-systems#posix-timeKubeVirt GPU 패스스루 VM은 왜 112일간 스케줄되지 못했나 — 실제 클러스터 부검
Rust 오퍼레이터가 "GPU 노드 4개 전부 NotReady"라는 진단을 내린 뒤, 그 죽음의 원인을 실제 8노드 클러스터(GPU Operator v25.3.0, KubeVirt v1.7.0)에서 끝까지 추적했습니다. gpu-fedora와 rhel9-gpu-vm이 112일간 ErrorUnschedulable로 멈춰 있던 진짜 이유는 화려한 GPU 설정이 아니라 kubelet 한 줄 에러 —
2026-07-11 · 8 분 읽기 #kubevirt#gpu#kubernetes#nvidia#devops느린 컴퓨터에서 GLM-5.2 돌리기 — colibrì가 744B 모델을 디스크에서 스트리밍하는 법
colibrì는 순수 C 약 1,300줄로 작성된 추론 엔진으로, 744B(7,440억) 파라미터 MoE 모델인 GLM-5.2를 램 25GB짜리 소비자용 PC에서 돌립니다. 핵심은 MoE 희소성과 디스크 스트리밍입니다 — 밀집 레이어 약 9.9GB만 램에 상주시키고, 약 370GB의 라우팅 전문가는 NVMe SSD에 두고 토큰마다 필요한 것만 읽습니다. 대가는 정직하게 느립니다: 콜드 상태
2026-07-11 · 8 분 읽기 #ai#llm#local-inference#moe#quantization보편 개념으로서의 계산 — 무엇이 단단하고 무엇이 과장인가
Tim Roughgarden이 가르치는 '보편적이고 근본적인 개념으로서의 계산' 강의가 화제입니다. 실제 내용은 정지 문제, 알고리즘 효율, NP-완전성, 그리고 P 대 NP를 다루는 견실한 계산 이론입니다. 이 글은 그 단단한 핵심과, 우주나 마음이 문자 그대로 계산이라는 더 큰 주장을 구분하고, '모든 것은 계산이다'가 어디서부터 반증 불가능한 말이 되는지를 따집니다.
2026-07-11 · 14 분 읽기 #computer-science#computation#complexity#theory#philosophyACSM 피트니스 트렌드 20년 — 미용에서 정신건강·수명·데이터로
미국스포츠의학회(ACSM)의 세계 피트니스 트렌드 설문이 올해로 20회를 맞았고, 2026년 1위는 다시 웨어러블 기술입니다. 이 글은 상위 10개를 정리하되 순위 자체보다 20년이 그린 궤적을 읽습니다 — "체중 감량"이 "체중 관리"로 이름을 바꾸고, 운동하는 사람의 78%가 정신적·정서적 안녕을 가장 큰 이유로 꼽는 변화. 이것이 약 2,000명의 전문가가 답한 인식 조사이지 대중 행동
2026-07-11 · 12 분 읽기 #fitness#health#trends#wellness#wearablesAI 코딩 모델 평가에서 신호와 잡음 가려내기 — SWE-bench가 흔들리는 이유
OpenAI 평가팀은 가장 널리 쓰이는 코딩 벤치마크인 SWE-bench Verified가 오염과 설계 결함 탓에 더 이상 의미 있는 신호를 주지 못한다고 밝혔습니다. 신호(모델을 가려내는 힘)와 잡음(실행마다 흔들리는 변동)이라는 두 축으로 다시 보면, 리더보드 순위의 상당수가 잡음 위에 서 있습니다. 오염·하네스 차이·채점 불가능한 과제·과적합이 어떻게 점수를 부풀리는지 정리하고, 팀이
2026-07-11 · 12 분 읽기 #llm-evaluation#coding-benchmarks#swe-bench#benchmarks#ai-codingRust로 쿠버네티스 GPU 오퍼레이터 만들기 — kube-rs로 실제 클러스터를 진단하다 ♪ 들을 수 있어요
8노드 실운영 홈랩 클러스터(k8s v1.32.5)를 상대로, kube-rs를 써서 GPU 오퍼레이터를 Rust로 직접 만들어 돌렸습니다. GpuInventory 커스텀 리소스를 정의하고, 두 개의 컨트롤러(노드 스캔→CR 상태 기록, 노드 감시→ConfigMap 갱신)를 한 바이너리로 띄워 클러스터 밖에서 실행했습니다. 그리고 오퍼레이터가 실제로 뱉은 결과 — GPU 노드 4개 중 Read
2026-07-11 · 10 분 읽기 #rust#kubernetes#operator#gpu#kube-rs프로덕션 RAG 패턴 — 순진한 RAG가 실패하는 이유와 실제로 통하는 기법들
데모용 RAG는 30분이면 만들지만, 프로덕션에서 조용히 무너지는 지점은 대부분 생성이 아니라 검색입니다. 청킹, 임베딩과 하이브리드 검색(BM25 + 벡터), 리랭킹, 컨텍스추얼 리트리벌, 쿼리 재작성, 그리고 평가를 각각 무엇이고·언제 도움이 되며·무엇을 대가로 치르는지 정리합니다. Anthropic의 컨텍스추얼 리트리벌 수치처럼 출처 있는 숫자만 인용하고, RAG가 마법이 아니라는 점과
2026-07-11 · 18 분 읽기 #ai#rag#llm#retrieval#embeddingsForward Deployed Engineer(FDE)를 준비하며 — 필요한 소프트웨어 지식 지도
Forward Deployed Engineer(FDE)는 Palantir이 만든 직군으로, 엔지니어가 고객사에 직접 들어가 제품을 그들의 실제 환경에 배포·통합하는 역할입니다. 최근 OpenAI·Anthropic 같은 AI 회사들이 자사 모델을 고객 인프라에 얹기 위해 이 직군을 대거 채용하며 다시 주목받고 있습니다. 이 글은 FDE를 준비하는 사람을 위해, 역할의 실체(실제 소스 기반)와
2026-07-11 · 12 분 읽기 #career#fde#software-engineering#palantir#solutions-engineering자동화의 세 부족 — Zapier·Make·n8n, RPA, 그리고 2026 에이전틱 자동화
"이거 자동화해 줘"라는 말 앞에서 사람들은 자주 엉뚱한 도구를 집습니다. 자동화에는 서로 다른 세 부족이 있기 때문입니다 — API를 잇는 워크플로 자동화(Zapier·Make·n8n), API가 없는 화면을 사람처럼 조작하는 RPA(UiPath·Power Automate), 그리고 판단까지 대신하는 AI 에이전트. 각 부족의 정체와 2026년 지형(과금 모델의 함정, n8n 2.0의 AI
2026-07-09 · 11 분 읽기 #automation#rpa#zapier#n8n#ai-agentsLLM 학습 데이터 전처리 완전 가이드 — 웹 크롤부터 토큰 패킹까지, 최신 논문과 함께
좋은 모델은 좋은 데이터에서 나오고, 좋은 데이터는 전처리 파이프라인에서 나옵니다. 웹 크롤 수집 → 본문 추출 → 언어 식별 → 휴리스틱·분류기 품질 필터링 → 정확·근사(MinHash) 중복 제거 → PII·독성 처리 → 벤치마크 오염 제거 → 토크나이즈와 시퀀스 패킹까지 사전학습 데이터의 전체 공정을 단계별로 설명하고, SFT 데이터 정제의 요점, datatrove·Dolma·NeMo
2026-07-09 · 13 분 읽기 #ai#llm#data-engineering#preprocessing#trainingKeycloak로 SSO 구축하기 — Realm·Client·플로우부터 2026 신기능까지
사내 앱 20개에 로그인을 각각 붙이는 대신, 하나의 아이덴티티 서버가 전부를 대신하게 만드는 것이 SSO입니다. 오픈소스 표준인 Keycloak을 Realm·Client·Role·Identity Provider라는 4개의 핵심 개념으로 이해하고, OIDC Authorization Code + PKCE 로그인 흐름을 한 단계씩 따라가며, Quarkus 배포의 build/start 2단계 모델
2026-07-09 · 16 분 읽기 #keycloak#sso#oidc#security#devops2026 로봇 기업 지도 — 휴머노이드 격전과 VLA 모델, 그리고 엔지니어의 진입 경로
2026년은 휴머노이드 출하가 전년 대비 7배(5만 대 전망)로 뛰는 변곡점입니다. 390억 달러 밸류에이션의 Figure와 자체 VLA 모델 Helix, 여름 양산에 들어가는 Tesla Optimus Gen 3, 5,500대를 이미 판 가격 파괴자 Unitree, 로봇의 범용 두뇌를 파는 Physical Intelligence(π0)까지 — 주요 기업들을 하드웨어·두뇌·시장 축으로 정리하고
2026-07-09 · 11 분 읽기 #robotics#ai#vla#trends#careerGPU Operator × KubeVirt 총정리 — 구성요소·설정·버전, 부분 MIG와 수동 MIG까지
쿠버네티스 GPU 인프라의 두 기둥을 한 장에 정리합니다. GPU Operator의 오퍼랜드 구성과 ClusterPolicy 설정, 버전 체계와 함께, 노드의 일부 GPU에만 MIG를 적용하는 커스텀 설정과 nvidia-smi로 MIG를 수동 생성·삭제하는 방법을 다루고, VM을 쿠버네티스에서 돌리는 KubeVirt의 4대 컴포넌트(virt-operator·controller·handler·
2026-07-09 · 14 분 읽기 #kubernetes#gpu#kubevirt#mig#nvidia3D를 만드는 두 가지 길 — 복원(NeRF·가우시안 스플래팅)과 생성(TRELLIS·Hunyuan3D)
"3D 모델을 만든다"는 말에는 완전히 다른 두 문제가 숨어 있습니다. 실제로 존재하는 장면을 사진 여러 장으로 되살리는 복원(reconstruction)과, 존재하지 않는 것을 텍스트·이미지 한 장에서 지어내는 생성(generation)입니다. 복원의 계보를 SfM에서 NeRF, 그리고 판을 바꾼 3D 가우시안 스플래팅과 feedforward 복원(Meta MapAnything)까지 따라가
2026-07-09 · 15 분 읽기 #3d#ai#gaussian-splatting#nerf#computer-vision멀티 GPU·멀티노드 학습 플랫폼 총정리 — 프레임워크 지도부터 Slurm·Kubeflow 실전 가이드까지
GPU 여러 장, 노드 여러 대로 모델을 학습시키는 전체 지형을 한 장에 정리합니다. AI 라이브러리·프레임워크 생태계 지도(PyTorch·JAX·HuggingFace·DeepSpeed·Ray), 병렬화 전략(DDP·FSDP·ZeRO·TP·PP)을 언제 무엇으로 고르는지, torchrun 단일노드→멀티노드 확장, HPC의 표준 Slurm 사용 가이드(sbatch 스크립트와 멀티노드 torch
2026-07-09 · 13 분 읽기 #ai#ml#distributed-training#slurm#kubeflowDocker에서 Podman으로 — 데몬 없는 컨테이너 엔진 전환 완전 가이드
Podman은 데몬 없이(fork-exec) 동작하고 rootless가 기본이라는 점에서 Docker와 아키텍처 철학부터 다릅니다. 내부 동작(conmon·crun), 설정 파일 위치와 의미, GPU를 쓰기 위한 CDI 설정, compose.yaml을 그대로 쓰는 두 가지 방법(podman 소켓 + docker compose vs podman-compose), SELinux 볼륨 라벨 같은
2026-07-08 · 15 분 읽기 #docker#podman#containers#devops#linuxLLM 캐싱의 원리 — 프롬프트 캐싱과 Prefix Cache는 왜 돈을 아껴주는가
프롬프트 앞부분이 같으면 왜 비용이 10분의 1이 될까요? 답은 트랜스포머 내부의 KV 캐시에 있습니다. 어텐션이 인과적(causal)이라 앞쪽 토큰들의 Key/Value 벡터는 뒤에 무엇이 오든 변하지 않고, 그래서 저장해 뒀다가 재사용할 수 있습니다. prefill과 decode의 구분, KV 캐시의 메모리 수치, vLLM·SGLang의 prefix cache 구현, 그리고 Anthrop
2026-07-08 · 14 분 읽기 #ai#llm#caching#inference#performance최신 LLM 양자화 기술 총정리 — GPTQ·AWQ부터 FP8·MXFP4·KV 캐시 양자화까지
양자화는 모델의 숫자를 더 적은 비트로 표현해 메모리와 비용을 줄이는 기술입니다. 비트가 줄어도 품질이 버티는 이유(이상치와 스케일링), GPTQ와 AWQ의 접근 차이, llama.cpp GGUF의 k-quant, QLoRA의 NF4, 그리고 2026년의 중심축인 FP8과 마이크로스케일링 FP4(MXFP4·NVFP4), 다음 병목인 KV 캐시 양자화까지 — W4A16 같은 표기법 읽는 법과
2026-07-08 · 15 분 읽기 #ai#llm#quantization#inference#optimization소유권의 반격과 AI 현실 점검 — 이번 주 HN·GeekNews 핫토픽
이번 주 Hacker News와 GeekNews 상위권을 관통하는 흐름은 두 갈래입니다. 오픈소스 지도·오픈 하드웨어·교체형 배터리로 번지는 「소유권의 반격」, 그리고 오픈웨이트 가격 압박과 에이전트 속도 조절론이 이끄는 「AI 현실 점검」. 두 흐름이 왜 같은 질문 — 통제권 — 으로 수렴하는지, 일곱 가지 핫토픽으로 짚어봅니다.
2026-07-07 · 11 분 읽기 #trends#hackernews#geeknews#ai#opensource