한국어 English 日本語
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 1 件
← すべての記事
im2col変換からWinogradアルゴリズム、FlashAttentionのタイリング、TensorRT INT8量子化まで。cuDNNが深層学習演算を10〜100倍高速化する仕組みを実際のコードとともに完全解剖する。