博客
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 855 篇
#2026-03 168#ai 112#llm 90#ai-papers 62#career 60#kubernetes 57#mindset 51#ai-platform 48#devops 45#security 43#deep-learning 35#performance 33#psychology 32#mlops 30#observability 29#2026-04 26#linux 24#database 23#robotics 22#rust 22#ai-agent 21#mcp 20#productivity 20#culture 19#evaluation 19#gpu 18#transformer 18#electronics 17#paper-review 17#pytorch 17#developer-tools 16#distributed-systems 16#engineering 16#learning 16#open-source 16#postgresql 16#rag 16#fundamentals 15#network 15#2026-08 14
Home Assistant Matter 服务器 9.0 — 为什么放弃官方 C++ SDK,改用 matter.js 重写 ♪ 可收听
2026 年 6 月 23 日,Home Assistant 的 Matter 服务器升级到 9.0,基于 Python + 官方 C++ SDK(connectedhomeip)的实现被整体替换为用 TypeScript 从零重写的 matter.js 服务器。这次升级带来了实打实的改善 — 重启和重连变快(局部询问/partial interview)、OTA 更新被整合进控制器、测试证书设备的入网(commissioning)改为
2026-07-17 · 17 分钟阅读 #iot#smart-home#home-assistant#matter#threadAI 编程智能体,哪个用来干什么 — 仅凭四家厂商官方文档确认的选择标准
在 Claude Code · Cursor · GitHub Copilot · OpenAI Codex 之间做选择时,被问得最多的问题是「哪个最便宜」。然而只靠四家公司公开的价格,这个问题得不出答案,因为四家出售用量的单位各不相同 — Anthropic 按相对 Pro 的倍数(5 倍·20 倍)卖,Cursor 按以美元标示的包含 API 用量卖,GitHub 按 1 积分 = 1 美分的积分卖,OpenAI 按每 5 小时窗口
2026-07-17 · 35 分钟阅读 #ai#ai-coding-agent#claude-code#cursor#github-copilotDeno 2.9 — deno desktop 实验、原样迁移锁文件,以及 24 小时供应链默认值
2026 年 6 月 25 日发布的 Deno 2.9,可以归纳为三件事。用 Web 技术栈构建原生桌面应用的实验功能 deno desktop(默认使用 OS 自带 webview,可选打包 CEF);直接读取现有 npm、pnpm、yarn、Bun 锁文件来播种 deno.lock 的迁移路径;以及 min-release-age 的默认启用 — 拒绝安装刚发布 24 小时内的 npm 包。在此之上还叠加了 Node 26 兼容目标
2026-07-17 · 21 分钟阅读 #javascript#deno#javascript-runtime#node-compatibility#supply-chainAI 代码评审到底能不能用 — 测量证据揭示的准确率与误报 ♪ 可收听
AI 代码评审工具的营销话术里充斥着「80% 的 PR 不需要人类评论」这样的数字,但真正把精确率和误报率一起公开的地方几乎没有。把公开的测量结果收集起来看,方向大体一致 — 在开源 PR 上,AI 评审评论真正带来代码变更的比例因工具而异,只有 0.9~19.2%,远低于人类评论的 60%(Gan 等,GitHub Actions 16 款·仓库 178 个·评论 22,326 条)。而在一家把评论解决写进政策强制执行的企业案例里,同
2026-07-17 · 38 分钟阅读 #ai#code-review#static-analysis#evaluation#software-engineering操控浏览器与计算机的 AI 智能体,如今走到了哪一步 — 基准测试数字实际衡量的是什么 ♪ 可收听
「计算机使用智能体在 OSWorld 上拿到了 83.5%」和「最强的智能体也只能做完 20.6%」都是 2026 年出现的事实,而且都是对的。前者是 OSWorld 1.0,后者是同一个团队做的 OSWorld 2.0。本文顺着原始论文和基准作者的自测,追踪这道鸿沟从何而来:Epoch AI 的独立分析指出 OSWorld 近一半的任务几乎不用 GUI、靠终端就能解决;作者重测显示同一个 o3 只改步数预算就会从 9.1% 摇到 23
2026-07-17 · 37 分钟阅读 #ai#computer-use#browser-agents#benchmark#prompt-injectionAI 智能体的记忆实际上是怎么做出来的 — 四种设计,以及基准测试实际证明了什么 ♪ 可收听
「智能体记忆」不是一种单一技术,而是把至少四种彼此不同的设计笼统打包的说法 — 文件草稿板、摘要/compaction、向量召回、知识图谱。本文先用产品文档确认每一种实际在做什么,然后抛出一个更不舒服的问题:「哪种更好」的证据真的被测量过吗? 直接去读 Mem0 论文(arXiv:2504.19413)的表格就会发现,头条的「相对 OpenAI 提升 26%」是事实,但在同一张表里,把整段对话原样贴进提示词的全上下文方式以 J 72.9
2026-07-17 · 31 分钟阅读 #ai#ai-agent#agent-memory#llm#benchmark上下文工程取代了提示词工程吗 — 哪些被测量过,哪些没有
「提示词工程已死」这句话,在创造这个术语的任何一手来源里都不存在。Karpathy 把 few-shot 示例和任务描述列为上下文工程的组成部分,Anthropic 则写道这是「提示词工程的自然演进(natural progression)」。也就是说,不是替代,而是包含。尽管如此,「这确实是一件不同的工作」是有证据的 — Chroma 的 LongMemEval 实验把问题和措辞原样保留,只把周围上下文从 300 token 增加到
2026-07-17 · 30 分钟阅读 #llm#context-engineering#prompt-engineering#long-context#ai-agentCassandra 6.0-alpha1 与 Accord 事务 — 五年之约的「通用事务」,现在走到哪一步了 ♪ 可收听
Accord 是 Cassandra 的通用事务协议,2021 年以 CEP-15 的形式提出,终于在 2026 年 3-4 月,随 6.0-alpha1 这个可运行的发布版本一起问世。这个协议的承诺是,通过无 leader 的共识,在正常条件下用一次 WAN 往返完成多分区的 strict-serializable 事务,而且这个发布版本里确实带上了 BEGIN TRANSACTION 语法和按表设置的 transactionalmo
2026-07-17 · 20 分钟阅读 #database#cassandra#distributed-systems#transactionsAI 智能体在生产环境中是如何失败的 — 14 种失败模式,以及重试为何不安全 ♪ 可收听
把智能体放上生产环境,会有三处疼。第一,失败大多不是出在模型,而是出在系统设计 — UC 伯克利的 MAST 研究对 1642 条执行轨迹做了分类,提炼出 14 种失败模式,其中 44.2% 属于系统设计问题。第二,最常见的两种失败模式(步骤重复 15.7%、未意识到终止条件 12.4%)会直接变成 token 账单。第三,恰恰是这两种模式制造了重试/幂等性问题 — 非确定性的调用方在驱动真实副作用,而 MCP 只给了 idempote
2026-07-17 · 32 分钟阅读 #ai#agents#observability#reliability#mcpRay 2.56 的标签局部性调度 — 放置组开始看见 NVLink 机架,而不是节点 ♪ 可收听
2026 年 6 月 29 日发布的 Ray 2.56.0,给放置组加上了一层 alpha 阶段的域级调度层。此前 PACK、STRICTPACK 这些放置策略全都只按节点粒度工作,于是在 GB200、GB300 NVL72 这类 NVLink 域横跨多个节点的机架上,根本没有办法表达「把这个放置组整个塞进同一个机架里」。新的标签局部性调度,把 ray.io/gpu-domain 标签值相同的一组节点视作一个域,并把整个放置组 STRI
2026-07-17 · 17 分钟阅读 #ray#gpu#scheduling#distributed-systemsMedia over QUIC 的现状 — 规范停在 draft-19,最大规模部署停在 draft-07,最初提案人转投 moq-lite ♪ 可收听
IETF 的 Media over QUIC(MoQ)想把 WebRTC 的交互延迟和 HLS/DASH 的可扩展性合并成一套架构,截至 2026 年 7 月 6 日已经推进到 draft-ietf-moq-transport-19,工作组的里程碑把 IESG 提交的目标定在 2026 年底。但现实中的部署却在别处 — 任何人都能接入的最大中继网络、Cloudflare 的网络,目前仍然固定在 draft-07 的子集上,其文档甚至自己
2026-07-17 · 20 分钟阅读 #network#quic#streaming#webrtc#rfcFlux 2.9 与 Weaveworks 之后的两年 — 失去赞助商的 GitOps 项目是怎么撑下来的 ♪ 可收听
2024 年初,Flux 的原开发公司 Weaveworks 关门时,GitHub 讨论区里冒出一个问题 — 「这个项目的未来有危险吗?」两年半之后的 2026 年 6 月 30 日,Flux 发布了 2.9.0。本文用可验证的一手资料,重构这期间真正发生的事 — 发布节奏如何动摇又如何恢复(v2.0 到 v2.9 每个次要版本的发布间隔实测)、如今 9 位核心维护者分别隶属何处(以 CORE-MAINTAINERS 文件为准,Cont
2026-07-17 · 18 分钟阅读 #devops#gitops#fluxcd#kubernetes#open-sourceClickHouse 的 Lazy Materialization — LIMIT 10 的小技巧是如何长成 FINAL 和 JOIN 的 ♪ 可收听
ClickHouse 的 lazy materialization 是一种在排序和 LIMIT 完成之前不读取 SELECT 列的优化,它在 25.4(2025 年 4 月)以「仅在 LIMIT 10 及以下时才生效」的保守姿态首次登场。此后,在把逐行 lookup 改造成 join 式批量获取的 25.12 中,这道闸门被提高到 10,000;进入 2026 年后,同一个思路又扩展到 26.2 的 UNION ALL 全部分支、26.
2026-07-17 · 22 分钟阅读 #database#clickhouse#olap#query-optimization#performanceAirflow 2 EOL 之后 — 从 2 迁移到 3 的实际工作清单,以及走到 3.3 的 3.x 现状 ♪ 可收听
Apache Airflow 2 已在 2026 年 4 月 22 日迎来 EOL,如今这个版本已经不再有安全补丁。可是从 2 到 3 的路并不是一次 pip 升级,而是一次架构转变 — worker 对元数据 DB 的直接访问消失了,executiondate 系列的上下文键被移除,就连 cron 调度的默认语义也变了。本文原文通读官方升级指南与发行说明,梳理了真正需要动手的工作 — 跑 ruff 的 AIR 规则检查、把导入迁到 a
2026-07-17 · 22 分钟阅读 #data-engineering#airflow#workflow-engine#migration模拟客户从不离开 — LLM 用户模拟器在哪里把智能体的分数吹高了 ♪ 可收听
在 τ-bench 这一类对话式智能体基准测试里,"用户"这个角色由另一个 LLM 来扮演。可这个模拟器不是被测量的对象,而是测量工具本身,工具是需要校准的。2026 年发表的三项验证研究都指向同一个方向 — 模拟出来的用户太配合了。一项把 τ-bench 协议原样搬给 451 名真人跑的研究报告说,模拟器制造出的"简单模式"会把智能体的成功率推到高于人类基线的水平;另一项研究报告说,换一个用户 LLM,成功率最多能摆动 9 个百分点。
2026-07-16 · 36 分钟阅读 #ai#llm#evaluation#agents#simulationZig 0.16.0 — 把 I/O 变成接口的这次发布,以及它的账单 ♪ 可收听
2026 年 4 月 14 日发布的 Zig 0.16.0,把标准库改成了所有输入输出都要以 Io 实例作为参数。这相当于把 Zig 那个「把 Allocator 作为参数传递」的老习惯原样搬到了 I/O 上,目的是让同一份源代码既能跑在基于线程的实现上,也能跑在事件循环上。但真正读一遍发布说明就会发现,完成的实现只有 Io.Threaded 一个;iouring 后端还处于概念验证阶段,缺网络处理、错误处理和测试覆盖;aarch64
2026-07-16 · 34 分钟阅读 #zig#systems-programming#async-io#compilerTriton Gluon — 把编译器藏起来的布局,重新用手写出来的语言 ♪ 可收听
Gluon 是搭建在 Triton 同一套编译器栈之上的底层 GPU 语言,它把 Triton 一直藏起来的布局、共享内存、warp 特化,原样交还给写内核的人。它存在的理由很明确 — 当 Triton 编译器生成的代码不够好时,过去你根本没有办法插手。本文会追踪 Gluon 到底暴露了什么、BlockedLayout 具体意味着什么,以及上游教程在 GB200 上记录的测量值(同一个 memcpy,仅凭一个布局,就能在 0.774 T
2026-07-16 · 28 分钟阅读 #gpu#triton#kernel#compiler#performanceZJIT 的 Lightweight Frames — Ruby 4.1 如何清除方法帧压栈,及其代价 ♪ 可收听
Ruby 4.0 在 2025 年 12 月 25 日搭载了 ZJIT,却没有打开它 — 只是编译进了二进制文件,默认的 JIT 依然是 YJIT。官方发布说明的原话是「ZJIT 比解释器快,但还没有 YJIT 快」,紧接着的下一句是「敬请期待 Ruby 4.1 的 ZJIT」。瞄准那个 4.1 的工作核心,就是 Lightweight Frames — 这是一种设计:不再在每次方法调用时向解释器帧里认真写入 pc、iseq、block
2026-07-16 · 29 分钟阅读 #ruby#zjit#yjit#jit#compilerSwift 6.3 的官方 Android SDK — 出了什么,又故意省去了什么 ♪ 可收听
2026 年 3 月 24 日发布的 Swift 6.3 中,包含了 Swift SDK for Android 的首次官方发布。经过十年的社区分支和非官方工具链,现在可以用 swift.org 亲自构建和发布的交叉编译 SDK 来生成 Android 二进制文件了。不过这句话到底意味着什么,需要精确地厘清 — 变成官方的是这个 SDK,而不是说 Android 变成了与 Linux、Windows 同一层级的官方支持平台。Androi
2026-07-16 · 18 分钟阅读 #swift#android-swift#cross-platform#kotlin-multiplatform#swift-package-managersched_ext 子调度器 — 内核 7.1 中只到了一半的 per-cgroup 调度器 ♪ 可收听
Linux 7.1(2026年6月14日发布)引入了 schedext 的 cgroup 子调度器支持。目标很清楚 — 可以在 cgroup 树的任意位置挂载 BPF 调度器,父调度器动态地把 CPU 分配给子级,让每个容器或应用域都能跑一套适合自己工作负载的调度策略。动机是 cpuset 硬分区给不了的那种灵活性,对运行多租户机器的人来说是等了很久的东西。不过 7.1 里真正落地的,只是以 dispatch 路径为核心的骨架,照搬 L
2026-07-16 · 20 分钟阅读 #linux#kernel#scheduler#cgroups#bpf