博客
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 855 篇
#2026-03 168#ai 112#llm 90#ai-papers 62#career 60#kubernetes 57#mindset 51#ai-platform 48#devops 45#security 43#deep-learning 35#performance 33#psychology 32#mlops 30#observability 29#2026-04 26#linux 24#database 23#robotics 22#rust 22#ai-agent 21#mcp 20#productivity 20#culture 19#evaluation 19#gpu 18#transformer 18#electronics 17#paper-review 17#pytorch 17#developer-tools 16#distributed-systems 16#engineering 16#learning 16#open-source 16#postgresql 16#rag 16#fundamentals 15#network 15#2026-08 14
为人形机器人准备的两个大脑 — GR00T N1与Helix ♪ 可收听
面向人形机器人的VLA必须同时具备快速反射与缓慢思考的能力。本文以NVIDIA GR00T N1和Figure AI Helix为中心,梳理结合快速低层控制(System 1)与缓慢规划(System 2)的双系统架构、训练方式、面临的课题与展望。
2026-06-27 · 25 分钟阅读 #ai-papers#robotics#humanoid#groot-n1#helixDiffusion Policy 与 π0 — 平滑机器人行为背后的秘密 ♪ 可收听
跨越离散动作 token 的局限,本文考察将动作生成为连续值的两条思路。Diffusion Policy 通过去噪生成动作,π0 则用 flow-matching 生成高频连续动作。我们梳理两种方法的思路、架构、控制频率、优势与局限。
2026-06-27 · 24 分钟阅读 #ai-papers#robotics#diffusion-policy#pi0#flow-matching用 Rust 打造 CLI:clap 与 ripgrep·fd·bat 的秘诀 ♪ 可收听
过去几年间,命令行工具悄悄地被重写为 Rust 版本 — ripgrep、fd、bat、eza、zoxide、bacon。本文梳理了这场复兴为何发生,以及你亲自动手写 CLI 时真正需要什么。用 clap 的 derive API 声明参数和子命令,看看没有 GC 的性能优势以及 SIMD、mmap 带来的好处,讲解如何以单一静态二进制文件发布,还涉及 anyhow、indicatif、crossterm 这些必备的 crate。
2026-06-27 · 14 分钟阅读 #rust#cli#tools工程师的沟通术:如何让技术决策获得通过 ♪ 可收听
好的想法之所以没被采纳,通常不是因为想法本身不好,而是传达方式不好。本文讨论了如何用设计文档和 RFC 来提案、如何先用问题而不是解决方案来说服人、如何针对经营层和同事工程师调整不同的表达方式、在争论中落败后如何前进的「不同意但执行」(disagree and commit)、异步与同步沟通方式的选择、如何明确说出每个决定的代价,以及「强烈主张,虚怀若谷」如何异化为掩饰坏态度的借口这一陷阱。
2026-06-27 · 21 分钟阅读 #career#communication#engineering生日悖论与哈希碰撞 — 为什么 23 人中就有一半概率撞车 ♪ 可收听
只要 23 个人凑在一起,两人生日相同的概率就超过一半。这个反直觉结果的根源是 √N 这一近似,而同一套数学贯穿了 UUID 与哈希碰撞概率、为什么 128 位就够用、哈希表的负载因子与扩容,乃至 git 从 SHA-1 转向 SHA-256 的原因。
2026-06-27 · 17 分钟阅读 #math#hashing#fundamentals多模态 AI 的训练方法 — 把多种感觉揉进一个模型 ♪ 可收听
梳理让多模态 AI 在同一个模型里处理图像、文本、音频、视频的训练原理。依次讲解模态对齐与对比学习、融合方式、共享嵌入空间、预训练与微调、数据与评估,以及幻觉之类的局限,并配代码展示训练流水线。
2026-06-26 · 28 分钟阅读 #ai-papers#multimodal#clip#vision-language#contrastive-learning写出会被快速合并的 PR 和提交信息 ♪ 可收听
很快就被审阅完、很快就被合并的 PR,都有一些共同点。小而目的单一的 PR、Conventional Commits、提交正文里写的是"为什么"而不是"改了什么"、上传前自己先做一遍自我审查、包含背景·变更·测试三部分的 PR 说明、对审阅者的共情,以及堆叠 PR。节省审阅者的时间,就是让自己的 PR 更快通过的捷径。
2026-06-26 · 13 分钟阅读 #git#code-review#collaborationRust 宏:声明式宏 vs 过程式宏(derive) ♪ 可收听
Rust 的宏是一种在编译期生成代码的元编程工具。本文区分了基于模式的声明式宏(macrorules!),与接收代码为 token 流并对其进行操作的过程式宏(derive、attribute、function-like)。我们会看 serde 的 [derive(Serialize)] 到底做了什么、用 syn 和 quote 处理 TokenStream 的流程,以及什么时候不该用宏。
2026-06-26 · 15 分钟阅读 #rust#macros#metaprogramming超越 OCR — OCR-free 文档理解与统一模型 ♪ 可收听
传统 OCR 流水线把检测、识别、布局拆分成多个阶段,但误差会逐级累积。本文梳理文档 AI 的这场转变 — 从 Donut 系与基于 VLM 的 OCR-free 文档理解,到高分辨率与表格处理,再到统一模型的走向。
2026-06-26 · 34 分钟阅读 #ai-papers#ocr-free#document-understanding#multimodal#donut代码评审的对话术:不带冲突地给予和接受反馈 ♪ 可收听
代码评审既是找出缺陷的技术活动,也是人与人之间的对话。本文讨论评审代码而非评审人的框架,用 Conventional Comments 区分 nit 与 blocker,用提问代替命令,小 PR 为何能获得真正的评审而大 PR 只会被盖橡皮图章,称赞做得好的地方,作为作者如何优雅地接受反馈,以及评审者与作者各自承担的双向责任。
2026-06-26 · 23 分钟阅读 #code-review#communication#engineering用 Rust 编写 Kubernetes Operator(kube-rs) ♪ 可收听
Kubernetes Operator 是把运维知识写进代码的控制器。本文从原理讲起,梳理 Operator 模式(CRD + 控制器 + reconcile 循环),然后讲如何用 kube-rs 构建真正的 Operator:用 CustomResource 派生宏定义 CRD、Api 与 Controller、watcher、reconcile 函数与 requeue、用 finalizer 处理清理逻辑,以及为什么会选 Rust
2026-06-25 · 17 分钟阅读 #rust#kubernetes#operator#kube-rs分布式系统教会我的恋爱技巧 ♪ 可收听
重试与退避、超时、心跳、一致性模型、背压、优雅降级、幂等性、两将军问题,以及作为带 TTL 缓存的信任。让分布式系统变得困难的那些问题,和让人与人靠近变得困难的问题惊人地一致。本文尝试用工程师的眼光,重新解读恋爱。
2026-06-25 · 20 分钟阅读 #engineering#relationships#fun#distributed-systems限流算法全面解析:固定窗口、滑动窗口、令牌桶与漏桶 ♪ 可收听
从固定窗口、滑动窗口日志与计数器,到令牌桶、漏桶,逐一对比几种具有代表性的限流算法。梳理各算法如何处理突发流量、如何用 Redis 在分布式环境中实现,以及 429 与 Retry-After、客户端的退避礼仪。
2026-06-25 · 17 分钟阅读 #systems#api#reliabilityRust 生态系统之旅:出色的 crate 与项目 ♪ 可收听
Rust 真正的力量,和语言本身一样多地存在于它的生态系统之中。本文从 cargo 与 crates.io 出发,巡览撑起 Rust 的代表性 crate:serde 与 tokio,数据并行的 rayon,数据帧的 polars,HTTP 的 reqwest/hyper 与 Web 框架 axum,数据库的 sqlx/diesel,CLI 的 clap,游戏引擎 Bevy,桌面应用的 Tauri,直到图形领域的 wgpu。此外也会看看
2026-06-24 · 14 分钟阅读 #rust#ecosystem#crates事故沟通:故障当下的对话方法 ♪ 可收听
故障爆发时,技术性的恢复只完成了一半的工作。本文梳理事故指挥官(Incident Commander)角色与职责分离、即便没有新消息也要坚持的状态更新节奏、每次更新都必须回答的三个问题、不追责的事后分析(postmortem)与 5 Whys、面向客户与面向内部的沟通差异,以及能让整个房间稳定下来的镇定 — 一份关于故障当下对话方法的整理。
2026-06-24 · 20 分钟阅读 #incident#oncall#communication#sre栈 vs 堆:内存的真相 ♪ 可收听
栈和堆不只是"内存的两个区域"。用帧和 LIFO 运转的快速、固定的栈,由 malloc 和 GC 支配的动态的堆,连接两者的指针与引用,栈溢出与 OOM,值语义与引用语义,递归深度,以及所有权、GC、手动管理——本文从底层出发,剖析程序究竟如何使用内存。
2026-06-24 · 25 分钟阅读 #systems#memory#fundamentals从定制到平台:把 FDE 的工作产品化 ♪ 可收听
前向部署工程师(FDE)与产品之间的反馈循环。从 N 个客户身上发现同一个模式,把它抽取为配置与抽象,并用三次法则判断什么时候不该泛化。为一个客户快速交付,与为所有人构建之间的张力,以及优秀产品是如何从前向部署工作中诞生的。
2026-06-24 · 12 分钟阅读 #product#engineering#fdeCAP 定理,不打马虎眼地讲清楚 ♪ 可收听
"三选二"这个流行的说法是错的。本文不打马虎眼地讲清楚:CAP 三个字母各自到底指什么、为什么实际上只有在发生分区时才需要在 C 和 A 之间做选择、为什么 PACELC 是更完整的图景,以及 Dynamo、Spanner 这类真实系统各自站在哪一边。
2026-06-23 · 18 分钟阅读 #distributed-systems#databases#theory实战 Big-O:没有数学焦虑的复杂度 ♪ 可收听
O() 到底意味着什么、常见复杂度类别配合现实例子、n 较小或缓存起作用时常数为何会赢、隐藏在嵌套循环与 N+1 查询里的 O(n²)、空间复杂度、动态数组的分摊成本,以及该在什么时候停止优化。用工程师的直觉而非数学上的严谨来处理复杂度。
2026-06-22 · 16 分钟阅读 #algorithms#performance#fundamentals幂等性与重试:构建可靠的 API ♪ 可收听
网络迟早会失败,失败了就得重试。棘手的情形是「已经处理完了,只是响应没送到」。本文梳理幂等性是什么、哪些 HTTP 方法安全、哪些不安全,POST 的幂等性键,「恰好一次」这个神话,以及指数退避加抖动如何避免惊群效应。
2026-06-21 · 20 分钟阅读 #api#reliability#distributed-systems