태그: #pytorch
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 24 편
#pytorch 태그가 붙은 글은 24편이고, 가장 최근 글은 2026-08-24에 올라왔습니다.
함께 자주 붙은 태그: #ai 10 #2026-03 9 #deep-learning 9 #distributed-training 6 #gpu 5
최근 90일 동안 많이 읽힌 글:
모두를 위한 AI 6편 — 111만 파라미터 디퓨전으로 단어에서 숫자 그리기
"zero"라고 쓰면 0을 그리는 조건부 디퓨전 모델을 111만 파라미터로 만들었습니다. 노이즈를 섞는 forward는 공식 한 줄이고, 복원하는 reverse는 그 한 줄을 400번 거꾸로 밟는 것뿐입니다. 5편에서 L1 손실이 색을 바래게 만든 문제를 디퓨전이 어떻게 피해 가는지, 그리고 왜 모델이 노이즈를 예측하도록 학습되는지를 실제 생성 결과로 확인합니다.
2026-08-24 · 15 분 읽기 #ai#diffusion#ddpm#generative#pytorch모두를 위한 AI 5편 — 47만 파라미터 U-Net으로 흑백 사진에 색 입히기, 그리고 왜 색이 바랬는가
시리즈에서 가장 작은 모델인 47만 파라미터 U-Net으로 CIFAR-10 흑백 이미지를 컬러로 복원했습니다. 형태는 정확히 살렸지만 색이 눈에 띄게 바랬는데, 이건 모델 용량 문제가 아니라 L1 손실을 고른 결과입니다. skip connection이 무엇을 나르는지, 그리고 회귀 손실이 왜 채도를 죽이는지를 실제 결과 이미지로 확인합니다.
2026-08-23 · 14 분 읽기 #ai#computer-vision#unet#colorization#pytorch모두를 위한 AI 4편 — 137만 파라미터로 이미지에 문장 붙이기, 그리고 3편의 버그가 여기엔 없던 이유
CNN 인코더와 트랜스포머 디코더를 이어 붙여 Fashion-MNIST 이미지에 캡션을 다는 모델을 만들었습니다. 137만 파라미터, 10분 학습으로 라벨 적중률 91%가 나왔습니다. 인코더-디코더 구조에서 cross-attention이 무엇을 하는지, 그리고 3편에서 정확도를 7.5%로 떨어뜨렸던 EOS 버그가 왜 이 코드에는 없었는지를 두 함수를 나란히 놓고 확인합니다.
2026-08-22 · 12 분 읽기 #ai#captioning#multimodal#transformer#pytorch모두를 위한 AI 3편 — 손실 0.0017인데 정확도 7.5%, 범인은 패딩 한 칸이었다
이미지와 질문을 함께 받아 답하는 VQA 모델을 148만 파라미터로 만들었습니다. 학습 손실은 0.0017까지 떨어졌는데 정확도는 7.5%였습니다. 무작위보다 나쁜 수치였죠. 원인은 모델이 아니라 정답을 만드는 코드 한 줄이었고, 고치자 99.5%가 됐습니다. 왜 낮은 손실이 좋은 모델을 보장하지 않는지, 그리고 그 함정을 어떻게 알아채는지를 실제 출력으로 확인합니다.
2026-08-21 · 14 분 읽기 #ai#vqa#multimodal#debugging#pytorch모두를 위한 AI 1편 — 16M 파라미터 언어모델을 15분에 처음부터 학습시키기
GPU 한 장으로 언어모델을 처음부터 학습시켜 봅니다. TinyStories 데이터셋과 1,600만 파라미터짜리 디코더 전용 트랜스포머로 15분 만에 읽히는 영어 동화를 생성했습니다. 어텐션 마스크가 왜 필요한지, 가중치 묶기가 무엇을 절약하는지, perplexity 20이 실제로 어떤 문장을 뜻하는지를 실제 학습 로그와 생성 결과로 확인합니다. RTX 3090 실측 기준.
2026-08-19 · 15 분 읽기 #ai#llm#transformer#pytorch#hands-onLLM 학습 스택 지도 2026 — 무엇이 무엇을 대신해 주고 무엇을 숨기는가
LLM 학습 프레임워크를 세 개 층으로 나눠 계보를 정리했습니다. 아래층은 PyTorch 분산, DeepSpeed, Megatron-Core 같은 실행 엔진이고, 가운데는 torchtitan과 Megatron-Bridge 같은 학습 루프이며, 위층은 TRL과 Axolotl처럼 설정 파일로 파인튜닝을 돌려 주는 도구입니다. 각 층이 무엇을 대신해 주고 대신 무엇을 감추는지, 그리고 상위 프레임
2026-08-02 · 23 분 읽기 #mlops#llm-training#pytorch#trl#frameworkGPU 컴파일러와 프레임워크 지형 — 그래프를 받아 커널을 만드는 하나의 문제, 층마다 다른 답 ♪ 들을 수 있어요
NVCC와 PTX부터 LLVM, MLIR, Triton, torch.compile, XLA, IREE, TVM까지를 하나의 지도 위에 올렸습니다. 이름이 다르고 소속이 다르지만 이들은 전부 같은 문제를 풉니다. 연산 그래프를 받아 실행 가능한 커널을 만드는 일입니다. 각 층이 그 문제의 어느 부분을 잘라 가져갔는지, 왜 층이 이렇게 많아졌는지, 그리고 엔지니어가 어떤 상황에서 어느 층까지 내
2026-08-02 · 39 분 읽기 #gpu#compiler#mlir#triton#pytorchPyTorch 2.13의 torchcomms — c10d를 대체하러 온 새 분산 통신 백엔드
2026년 7월 8일 릴리스된 PyTorch 2.13의 하이라이트 가운데 가장 구조적인 변화는 torchcomms — PyTorch Distributed의 새 통신 백엔드가 코어의 CI와 DeviceMesh 경로에 통합되기 시작한 것입니다. torchcomms는 2025년 10월 Meta가 발표한 실험적 통신 API로, 전역 상태 기반 c10d ProcessGroup의 기술 부채(NCCL 중
2026-07-17 · 19 분 읽기 #pytorch#distributed-training#nccl#deep-learningRTX 5090 한 장으로 작은 모델들 직접 굴려보기 — microGPT·OCR·음악 생성
RTX 5090(Blackwell, 32GB) 한 장에 SSH로 붙어 작은 모델 셋을 직접 돌려봤습니다. char-level GPT를 밑바닥부터 28초 만에 학습시키고(10.75M 파라미터, 117만 tokens/s), 전용 OCR(TrOCR)과 소형 VLM(Qwen2-VL-2B)을 같은 이미지에 붙여 CER로 대결시키고, MusicGen으로 8초짜리 음악을 1.9초(4.2배 실시간)에 생성
2026-07-11 · 12 분 읽기 #pytorch#gpu#llm#ocr#hands-on비전 모델 개발·파인튜닝 완전 가이드 2026 — CNN, ViT, DETR, SAM 2, VLM 까지 실전 의사결정 트리
2026년 비전 모델 개발은 더 이상 ResNet 한 줄 가져다 학습하는 시대가 아니다. CNN, ViT, DETR, SAM 2, 그리고 LLaVA·Qwen-VL·Gemini Vision·Claude Vision 같은 VLM 까지 — 같은 사진 한 장에 대해서도 어떤 모델을 쓰느냐로 비용이 100배, 정확도가 30%p 갈린다. 이 글은 분류·탐지·세그멘테이션·OCR·캡셔닝·VQA 라는 6가지
2026-05-14 · 30 분 읽기 #computer-vision#vision-model#cnn#vit#detrPython 3.13과 AI 시대의 부활 — GIL 제거, JIT, Typing, uv/ruff, PyTorch, Mojo까지 완전 정복 (2025)
Python은 어떻게 2008년 2 vs 3 분열 위기에서 2025년 "가장 많이 쓰이는 언어 1위"로 재기했나? CPython의 GIL 역사, 3.13의 실험적 Free-Threaded Python, 3.11의 35% 속도 향상, 3.13 JIT, 타입 힌트와 mypy/pyright/pyrefly, Astral의 uv/ruff가 연 Rust 혁명, PyTorch/JAX/Transformer
2026-04-15 · 20 분 읽기 #python#gil#jit#typing#uv[심층 강화학습] 03. PyTorch 딥러닝 기초: 텐서부터 신경망까지
PyTorch의 텐서 연산, 자동 미분, 신경망 구성 요소를 학습하고, TensorBoard 모니터링과 Atari 이미지를 활용한 GAN 예제를 구현합니다.
2026-03-19 · 27 분 읽기 #reinforcement-learning#deep-learning#ai#pytorchLLM 처음부터 만들기: 코드로 이해하는 GPT 완전 구현 가이드
대규모 언어 모델(LLM)을 처음부터 직접 구현하며 완전히 이해하는 가이드. 토크나이저부터 Transformer 아키텍처, 사전학습, 파인튜닝까지 PyTorch로 작은 GPT를 완전히 구축합니다.
2026-03-17 · 28 분 읽기 #llm#gpt#transformer#from-scratch#deep-learningTorch-Titan 완전 가이드: PyTorch 대규모 분산 학습의 모든 것
PyTorch Titan(torchtitan)으로 대규모 LLM 분산 학습을 마스터하는 완전 가이드. FSDP2, 파이프라인 병렬화, Tensor 병렬화, 4D 병렬화, 플래시 어텐션, 혼합 정밀도까지 실전 예제와 함께 배웁니다.
2026-03-17 · 31 분 읽기 #torch-titan#distributed-training#pytorch#fsdp#deep-learningPyTorch 고급 기법 완전 가이드: torch.compile, Custom Ops, Memory 최적화
PyTorch 고급 기법을 완전히 마스터하는 가이드. torch.compile, 커스텀 연산자, 메모리 최적화, Gradient Checkpointing, torch.vmap, functorch, PyTorch Profiler까지 실전 예제로 배웁니다.
2026-03-17 · 23 분 읽기 #pytorch#advanced#torch-compile#memory-optimization#custom-operatorsPyTorch 내부 구조 & 고급 최적화: autograd, torch.compile, FSDP, Triton까지
PyTorch autograd 엔진, torch.compile() TorchInductor 최적화, FSDP 분산 학습, gradient checkpointing, 커스텀 CUDA 연산까지 PyTorch 완전 정복 가이드입니다.
2026-03-17 · 15 분 읽기 #pytorch#torch-compile#fsdp#triton#혼합정밀도DeepSpeed 완전 가이드: ZeRO 최적화와 대규모 모델 학습
Microsoft DeepSpeed를 완전히 마스터하는 가이드. ZeRO-1/2/3 최적화, Offload, 파이프라인 병렬화, 혼합 정밀도, MoE, DeepSpeed Inference까지 실전 설정과 코드로 배웁니다.
2026-03-17 · 23 분 읽기 #deepspeed#zero-optimization#distributed-training#llm#pytorchPyTorch 완전 정복 가이드: Zero to Hero — 텐서부터 분산 학습까지 ♪ 들을 수 있어요
PyTorch의 기초부터 고급 기법까지 완전히 정복하는 가이드. 텐서 연산, 자동 미분, CNN/RNN/Transformer 구현, 분산 학습까지 실전 예제와 함께 단계별로 학습합니다.
2026-03-17 · 35 분 읽기 #pytorch#deep-learning#ai#python#neural-network딥러닝 디버깅 완전 가이드: 학습 실패 진단부터 성능 최적화까지
딥러닝 모델 학습 실패를 체계적으로 진단하고 해결하는 완전 가이드. Loss NaN, 기울기 소실/폭발, 과적합, 느린 수렴, 메모리 부족 등 모든 일반적인 문제의 원인과 해결책을 실전 코드와 함께 배웁니다.
2026-03-17 · 33 분 읽기 #deep-learning#debugging#pytorch#training#optimizationtorchaudio 완전 가이드 — 오디오 처리부터 음성인식, TTS, 음악 분석까지
torchaudio로 오디오 로드, 스펙트로그램 변환, Mel 필터뱅크, MFCC, 음성인식(Wav2Vec2/Whisper), TTS, 화자 분리, 노이즈 제거까지. 오디오 AI의 모든 것을 PyTorch로 다룹니다.
2026-03-02 · 11 분 읽기 #ai-platform#pytorch#torchaudio#audio#speech-recognition