博客
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 855 篇
#2026-03 168#ai 112#llm 90#ai-papers 62#career 60#kubernetes 57#mindset 51#ai-platform 48#devops 45#security 43#deep-learning 35#performance 33#psychology 32#mlops 30#observability 29#2026-04 26#linux 24#database 23#robotics 22#rust 22#ai-agent 21#mcp 20#productivity 20#culture 19#evaluation 19#gpu 18#transformer 18#electronics 17#paper-review 17#pytorch 17#developer-tools 16#distributed-systems 16#engineering 16#learning 16#open-source 16#postgresql 16#rag 16#fundamentals 15#network 15#2026-08 14
从公开的训练案例中学习 —— 试过什么,又是什么失败了 ♪ 可收听
挑选了七份公开的大规模训练技术报告与日志本,只抽取失败与应对,而不是成绩单。从 Llama 3 405B 54 天内 419 次中断的统计里反推出检查点周期,比较 DeepSeek-V3 与 Kimi K2 分别在哪一层消灭了损失尖峰。也讨论了 Olmo 系列为什么把稳定性修复留在了架构里、OPT-175B 与 BLOOM 日志本留下的失败记录原型,以及 SmolLM3 与 Marin 公开的数据混合实验笔记。每个案例都附上出处链接,并
2026-08-02 · 20 分钟阅读 #mlops#llm-training#case-study#training-stability#scaling值得花时间的30本小说,以及前50页法则 ♪ 可收听
小说推荐片单到处都是,可真正需要的信息却常常缺席:这本书到底有多少页,有多难,前50页读不下去的时候,这本书是该硬撑还是该放弃。这篇文章按这个标准,整理了30本书——经典、20世纪现代小说、最近二十来年、类型小说、韩国文学,以及非西方世界,最后单列出一批需要读者主动挑选译本的翻译敏感作品。
2026-08-02 · 32 分钟阅读 #storytelling#novels#reading#world-literature#culture用 AI 搭建博客写作流水线 —— 瓶颈不是初稿,是核实 ♪ 可收听
本文把用 AI 写博客文章的过程拆成从选题收集到复盘效果的七个阶段,区分出每个阶段模型真正帮得上忙的地方,以及绝对不能放手的地方。这条流水线的重心不在初稿,而在事实核查。文章配合可运行的脚本,讲清楚如何让模型只引用它真正读过的内容、如何区分"写得很自信的句子"和"已核实的句子",以及发布前要跑一遍的检查清单。自动化流程图特意保留了人必须停下来的那些环节。
2026-08-02 · 25 分钟阅读 #ai-writing#content-pipeline#fact-checking#automation#blogging这些模型到底是怎么造出来的 —— 剖析 2026 年开放权重流水线 ♪ 可收听
通读截至 2026 年 8 月在 Hugging Face 排名靠前的一批开放权重模型的卡片和技术报告,本文按顺序梳理了从数据采集到量化部署的整条生产流水线。内容以真实模型为例,讲了 MoE 稀疏度为什么突破 20 倍、削减全局注意力的四种思路、预训练的 token 预算和稳定化技巧、SFT 之后的偏好优化与强化学习,以及蒸馏和低比特部署。先说清一个重要前提:绝大多数开放权重发布并不公开训练数据的构成。文中逐段区分了哪些是真正公开的信息
2026-08-02 · 26 分钟阅读 #llm#pretraining#moe#post-training#quantizationWord・PowerPoint 快捷键 —— 文档按样式处理,幻灯片按对象处理 ♪ 可收听
Word 和 PowerPoint 用的是同一套功能区,但肌肉记忆完全不同,因为 Word 处理的是流动的文本和样式,PowerPoint 处理的是画布上的对象。本文把两个应用分别按各自的性格分组,每一组都先讲支配这一组的规则,而不是逐个讲按键,并且把"重复应用格式刷"和"用样式统管整份文档"这类会改变工作方式本身的条目放在前面重点讲。同一个组合键在两个应用里做相反的事的地方,放在了最后单独整理。全文同时给出 Windows 和 Mac
2026-08-02 · 31 分钟阅读 #word#powerpoint#shortcuts#office#productivity会被读的仪表盘与值得呼人的告警 — 定义问题、组织变量、SLO 与告警疲劳
仪表盘的价值不在于好看,而在于能按顺序回答一组固定的问题。本文讲在动手做面板之前先写下要回答的问题,再讲数据源和变量该怎么组织,才能让一个仪表盘在多个环境里复用。文中用案例说明为什么告警该挂在症状而不是原因上,并把 SLO、错误预算、多窗口燃烧率告警写成真实的规则。最后整理出减少告警疲劳的规则,以及把仪表盘当作代码来管理的方法。内容以 Grafana 12 系列和 Prometheus 3.13 LTS 为准。
2026-08-02 · 21 分钟阅读 #observability#grafana#alerting#slo#dashboards设计能回答问题的 Prometheus 指标 —— 类型选择、基数预算,以及 rate 和分位数的陷阱 ♪ 可收听
指标不是越多越好,能回答问题才有价值。本文先讲清楚 Counter、Gauge、Histogram 各自回答什么问题,选错了会让哪些计算在原理上变得不可能。接着讲怎么用数字而不是直觉给标签基数定预算,rate 和 histogramquantile 在什么条件下会悄悄给出错误答案,以及什么时候该建 recording rule、该起什么名字。最后留下五个在做面板之前应该问自己的问题。内容以 Prometheus 3.13 LTS 为准验
2026-08-02 · 24 分钟阅读 #observability#prometheus#promql#metrics#cardinalityAI 写的文章会在哪里崩掉 —— 六种失败模式与对应的护栏 ♪ 可收听
AI 写的文章,是在句子依然流畅的情况下出错的。本文把六种失败模式 —— 编造的出处、截止日期之后就过时的信息、被拉长重复同一个意思的段落、没有依据的断言、只为搜索排名而堆砌的重复表达,以及抄袭与版权问题 —— 按检测方法和修正方法逐一梳理。能自动化的检查配了可运行的脚本,不能自动化的地方也明确说清楚。文章还讨论了读者和搜索引擎真正会惩罚的是什么,以及一份未经核实的初稿会暴露出哪些句子模式。
2026-08-02 · 23 分钟阅读 #ai-writing#content-quality#hallucination#seo#editing2026 年 LLM 训练技术栈地图 —— 每一层替你做了什么,又藏起了什么 ♪ 可收听
把 LLM 训练框架分成三层来梳理谱系。最底层是 PyTorch 分布式、DeepSpeed、Megatron-Core 这类执行引擎;中间层是 torchtitan、Megatron-Bridge 这类训练循环;最上层是 TRL、Axolotl 这类靠一份配置文件就能跑起微调的工具。文中记录了每一层替你做了什么、又用这个换来了藏起什么,以及上层框架反而会碍事的那些地方。所有版本号与日期均于 2026 年 8 月 2 日直接在 PyPI
2026-08-02 · 19 分钟阅读 #mlops#llm-training#pytorch#trl#framework用 Slurm 跑 GPU 集群 —— 比提交更重要的是知道为什么不跑 ♪ 可收听
整理了在 GPU 集群上实务使用 Slurm 所需的一切。先建立分区、QoS、账户这套坐标系,再讲在 sbatch 脚本里申请 GPU、CPU、内存的方法,以及其间的绑定陷阱。用两段真正能跑起来的脚本,给出通过 srun 和 rendezvous 启动多节点训练的两种模式,还讲了如何用数组作业和依赖链把参数扫描和续训交给调度器去管。后半部分全是失败案例:按代码解读 PENDING 原因的方法、区分主机内存 OOM 与 GPU OOM 的
2026-08-02 · 20 分钟阅读 #mlops#slurm#hpc#gpu-cluster#distributed-training让日志可搜索,同时别把公司搜穷 — 结构化、映射爆炸、保留期与真实成本 ♪ 可收听
日志成本超过计算成本的那一天,会降临在大多数组织身上。真正决定这一天能推迟多久的,不是压缩率,而是「把什么定义成字段」这个决策。本文讲结构化日志的字段设计、OpenSearch 映射爆炸拖垮集群的真实路径、用索引模板和 ISM 控制生命周期的方法,以及有原则的采样和保留分层。最后用数字算一算,用日志去模拟指标到底要付出多大代价。内容以 OpenSearch 3.5 和 OpenTelemetry Collector v0.157.0 为
2026-08-02 · 21 分钟阅读 #observability#logging#opensearch#elasticsearch#cost现在 Hugging Face 上什么在火 —— 2026 年 8 月热门地图 ♪ 可收听
以 2026 年 8 月 2 日为准,亲自过了一遍 Hugging Face 的热门榜单,按用途整理出真正能用于部署的模型。按通用 LLM、编程、嵌入与重排、视觉、语音、图像视频生成、小型端侧模型的顺序,写清了每个模型的厂商、规模、许可证,以及使用前需要了解的限制。核心结论是:热门榜单里相当一部分根本不是新模型,而是量化重新上传和社区微调。文中讲了怎么分辨原版和衍生版、为什么衍生版的下载量会反超原版,以及这个事实对选型意味着什么。所有数
2026-08-02 · 25 分钟阅读 #llm#huggingface#open-weights#model-selection#quantization工具还是对象 — 把意识问题悬置之后,仍然能说的事情 ♪ 可收听
人们面对AI时最先抓住的问题是"这东西有没有意识"。这是最难的问题,大概也不是最有用的问题。本文把这个问题悬而不决地放在一旁,从可以观察到的东西讲起:工具开始用句子回答之后,究竟改变了什么;为什么拟人化是关于我们自己的事实,而不是关于系统的证据;"伊莉莎效应"证明了什么、又没能证明什么;以及无论答案倒向哪一边都不会改变的一种不对称性。
2026-08-02 · 21 分钟阅读 #humanities#ai#philosophy#cognition#technology编写核函数的三个层次 — 用同一个问题比较 CUDA C++、Triton 与 CUTLASS ♪ 可收听
比较在编写同一个 GPU 核函数时,手写 CUDA C++、用 Python 按瓦片编写 Triton、用模板拼装 CUTLASS 与 CuTe 这三种方式各自带来的变化。我们实际用 CUDA C++ 和 Triton 分别编写一个按行 softmax 核函数,并排测量代码量与性能,并从编译流水线的层面解释这种差异从何而来。文章还具体说明了 Triton 为何成为自定义注意力核函数事实上的标准,以及 Triton 不擅长的具体领域。内容
2026-08-02 · 25 分钟阅读 #triton#cuda#cutlass#gpu-kernel#compilerAMD 与 NVIDIA 有何不同 — 问题不在硬件,而在软件栈 ♪ 可收听
把 AMD GPU 与 NVIDIA GPU 的差异,按硬件结构、软件栈、移植路径、生态成熟度这四个层面拆开,不带感情地梳理一遍。从 SM 与 CU、Tensor Core 与 Matrix Core 的对应关系讲起,具体说明 warp 32 与 wavefront 64 到底会在代码里制造出什么样的 bug。区分 HIPIFY 能自动搬过去的部分和必须手动修改的部分,并解释在 cuBLAS 与 rocBLAS 这类库对应表中,为什么
2026-08-02 · 22 分钟阅读 #amd#rocm#hip#nvidia#cuda把 vLLM 调快 —— 配置、内部结构,以及真正值得动代码的地方 ♪ 可收听
按顺序梳理提升 vLLM 性能的做法,从完全不改代码就能做到的事情开始。先讲批处理相关参数、前缀缓存、chunked prefill、量化选择,再基于真实源码解释 PagedAttention 与连续批处理调度器内部到底在决定什么。同时给出真正值得动代码的三个位置——自定义 logits processor、自定义 attention backend、调度器策略——以及各自的代价。也必然包含该固定什么、该测量什么,以及如何权衡 TTFT
2026-08-02 · 29 分钟阅读 #vllm#llm-inference#paged-attention#benchmark#scheduler机械臂究竟由什么构成:连杆、关节,以及真正驱动关节的东西
想做一条机械臂,买了六个舵机,结果臂多半会在自重下垮掉。这篇文章从连杆、关节、末端执行器的精确定义讲起,解释自由度到底数的是什么、为什么以 6 为基准,并按厂商公布的规格比较驱动关节的三种真实选择——舵机、步进电机、无刷直流电机(BLDC)。文章按角分为单位算清楚减速器把扭矩放大多少倍、又带来多少背隙,以及谐波减速器为什么会用在机器人上。最后直接从臂长和负载算出各关节的静态扭矩,用真实数字说明为什么肩部电机要比腕部大九倍。
2026-08-02 · 39 分钟阅读 #robotics#hardware#electronics#arduino#math外包所失去的 — 自动化削弱能力的方式并不均匀 ♪ 可收听
没有人会因为用计算器而感到内疚,但大多数人在发送一份AI代笔的文档之后,多少都会觉得不太踏实。这种不对称正是本文要问的问题。文章把"外包纯属受益"的领域、"确实被测量出会削弱能力"的领域,以及当下大多数知识工作所处的那片暧昧中间地带分开来看。航空领域关于自动化依赖的研究发现了与常识相反的结果,而自动化偏差研究表明,培训并不能阻止它发生。文章还讨论了为什么"外包无聊"和"外包判断"是两种性质不同的决定,以及关于这一代人正在交出去的能力,我
2026-08-02 · 23 分钟阅读 #humanities#ai#cognition#automation#skill亲手改一个 GPU kernel 到底意味着什么 —— 把一个转置 kernel 提速 5 倍 ♪ 可收听
从线程、warp、内存层级讲起,梳理亲手修改 GPU kernel 到底意味着什么。从 roofline 的视角解释为什么占用率是症状而不是目标,以及为什么大多数 kernel 受限于内存带宽而不是计算。把一个矩阵转置 kernel 从 naive 一路改到合并访问、共享内存分块、消除存储体冲突这四个阶段,并提供了在每个阶段实测有效带宽的基准测试工具。最后梳理了在 Nsight Compute 里具体该打开哪些 section、该看什么
2026-08-02 · 26 分钟阅读 #cuda#gpu-kernel#nsight-compute#memory-bandwidth#performanceGPU 编译器与框架全景图 — 接收计算图、产出核函数,同一个问题,每一层给出不同的答案
本文把 NVCC 与 PTX、LLVM、MLIR、Triton、torch.compile、XLA、IREE、TVM 全部放到同一张地图上。它们名字不同、所属组织也不同,但解决的是同一个问题:接收计算图,产出可执行的核函数。文章梳理了每一层切走了这个问题的哪一部分、层为什么会变得这么多,以及工程师在什么情况下需要下探到哪一层。内容基于 2026 年 8 月 2 日核实的版本与官方文档写成,未能核实之处也如实标出。
2026-08-02 · 32 分钟阅读 #gpu#compiler#mlir#triton#pytorch