博客
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 855 篇
#2026-03 168#ai 112#llm 90#ai-papers 62#career 60#kubernetes 57#mindset 51#ai-platform 48#devops 45#security 43#deep-learning 35#performance 33#psychology 32#mlops 30#observability 29#2026-04 26#linux 24#database 23#robotics 22#rust 22#ai-agent 21#mcp 20#productivity 20#culture 19#evaluation 19#gpu 18#transformer 18#electronics 17#paper-review 17#pytorch 17#developer-tools 16#distributed-systems 16#engineering 16#learning 16#open-source 16#postgresql 16#rag 16#fundamentals 15#network 15#2026-08 14
KV 缓存降到 4 比特 — SAW-INT4 与系统感知的 INT4 量化
在长上下文 LLM 服务中,真正的内存瓶颈不是权重,而是 KV 缓存。直接把它降到 INT4 会让精度崩溃,但 2026 年 4 月的预印本 SAW-INT4 报告说,在逐 token 的 INT4 量化之上再叠加块对角阿达玛旋转,就能几乎追回朴素 INT4 丢掉的精度。这篇论文真正的角度不只是精度,而是吞吐量 — 通过直接集成进分页 KV 缓存布局的融合旋转·量化内核,作者们称没有可测量的端到端开销,吞吐量与纯 INT4 相同。向量量
2026-07-11 · 11 分钟阅读 #ai#llm#quantization#inference#kv-cache在慢速电脑上跑 GLM-5.2 — colibrì 如何从磁盘流式加载 744B 模型
colibrì 是一个用纯 C 写成、约 1,300 行的推理引擎,能在内存 25GB 的消费级 PC 上运行 744B(7,440 亿)参数的 MoE 模型 GLM-5.2。关键在于 MoE 稀疏性与磁盘流式加载 — 只把约 9.9GB 的密集层常驻内存,约 370GB 的路由专家放在 NVMe SSD 上,每个 token 只读取需要的部分。代价是诚实地慢:冷启动约 0.05–0.1 tok/s,实际上每段落要花几分钟。它靠学习缓存
2026-07-11 · 7 分钟阅读 #ai#llm#local-inference#moe#quantization编程基准与智能体时代脱节 — 排行榜错误比较智能体的三个原因
Tessl 团队于 2026 年 6 月投稿到 arXiv 的立场论文主张,如今的编程基准与智能体式软件工程存在根本性的脱节。因为基准本是为衡量单个模型而造的,我们却拿它来比较由模型、执行框架(harness)、上下文、环境、反馈相互交织而成的整个系统。论文指出了三处具体的脱节 — 把模型与执行框架混为一谈的分数、单一正解评分惩罚了正当的替代方案、缺乏组件级信号因而无法引导改进。本文梳理这一论证,并推敲更好的评测应如何朝着组件级、多正解
2026-07-11 · 10 分钟阅读 #ai#agents#evaluation#software-engineering#coding-benchmarks欧盟聊天管制 1.0:实际通过的内容,与客户端扫描这一争议焦点
2026年7月9日,欧洲议会尽管在参与表决的议员中反对票多于赞成票,仍通过了消息扫描规则。在"聊天管制"这一名称之下,混杂着允许自愿扫描的 1.0 与规定强制性检测的 2.0(CSAR)提案,因而引发了不少误解。本文从开发者的视角,梳理实际通过的内容、二读的绝对多数规则这一程序,以及客户端扫描与端到端加密之间的技术冲突。文中会区分规则所强制的内容、批评者所担忧的内容与支持者所主张的内容。
2026-07-11 · 10 分钟阅读 #privacy#encryption#eu-regulation#client-side-scanning#messaging构建高效的 AI 智能体 — 五种工作流模式与智能体参考指南 ♪ 可收听
把 Anthropic 的工程指南《Building Effective Agents》整理成了一份实战参考。文中厘清工作流与智能体的准确区分,介绍作为一切基础的增强型 LLM(检索·工具·记忆),并逐一讲解五种工作流模式(提示链·路由·并行化·编排者-工作者·评估者-优化者)各自的适用场景与示例。同时坦诚地写下自主智能体究竟是什么、何时该用智能体取代工作流,以及过度设计·失控循环·成本/延迟等失败模式。目标是为开发者和 AI 智能体提
2026-07-11 · 14 分钟阅读 #ai#agents#llm#engineering#anthropic为每一步选择该思考多少 — Ares 的自适应推理努力路由
本文从实践角度梳理了 Ares(2026 年 3 月的预印本)。这篇论文把推理努力当作以步骤为单位的成本杠杆,而不是任务整体层面的选择。一个轻量级路由器查看交互历史,预测每一步所需的最低推理级别,从而减少让所有步骤都以最大努力运行的浪费。作者报告称,在 TAU-Bench、BrowseComp-Plus、WebArena 上,推理 token 最多削减了 52.7%,而成功率下降甚微——但这是未经独立验证的作者自报数值。本文一并讨论路由
2026-07-11 · 7 分钟阅读 #ai#agents#llm#efficiency开发者离开 GitHub 转向 Codeberg 的原因 — 以及离开时真正失去的东西
离开 GitHub 转向 Codeberg、Forgejo、自托管的文章突然多了起来。背景是 Ghostty、Zig、Gentoo 的出走、频发的故障、微软将其并入 CoreAI,以及 2026 年 4 月 AI 训练默认值的反转。本文基于真实的一手资料,均衡地梳理是什么在推动人们、Codeberg 与 Forgejo 实际能带来什么,以及离开 GitHub 时真正失去的东西(网络效应、CI、可发现性)是什么。这不是对 GitHub 的
2026-07-11 · 9 分钟阅读 #github#codeberg#forgejo#self-hosting#open-source精英运动员的心理,撕掉海报之后 — 思维模式、刻意练习与压力的真实证据
"精英运动员的心理"是励志海报的常见题材,但真正的运动心理学要比海报谨慎得多,也正因如此更耐人寻味。本文梳理了 Carol Dweck 的成长型思维(以及她本人警告过的"伪成长型思维")、Anders Ericsson 的刻意练习与"一万小时定律"是如何被误解的,以及关于压力、专注、自我对话和正念的研究。文章诚实地区分哪些有证据支撑、哪些只是口号,也写了对开发者和创作者而言什么能迁移、什么不能迁移。
2026-07-11 · 9 分钟阅读 #mindset#psychology#performance#sports#deliberate-practice作为普遍概念的计算 — 什么是坚实的,什么是夸大的 ♪ 可收听
Tim Roughgarden 讲授的“作为普遍而根本的概念的计算”这门课程正引发热议。实际内容是一门扎实的计算理论,涵盖停机问题、算法效率、NP完全性,以及 P 对 NP。本文把它坚实的内核,与宇宙或心灵在字面意义上就是计算这一更大的主张切分开来,并追问“一切皆计算”从哪里开始变成一句无法证伪的话。
2026-07-11 · 12 分钟阅读 #computer-science#computation#complexity#theory#philosophy在 Emacs 中,一切看起来都像服务:用客户端-服务器视角重读"编辑器即操作系统"这个梗
读 Charles Choi 的文章《In Emacs, Everything Looks Like a Service》并梳理其论点。他正面否定"Emacs 是操作系统"这个常见的比喻,转而给出一幅更准确的图景:Emacs 是一个通用客户端,在它里面,无论是网络 API 还是命令行工具,都像是一个个可以向其发送请求的服务。我认同这个视角远比那个陈旧的梗更准确,同时也诚实地掂量它与"一个任务一个应用"模型有何不同,以及它的魅力与代价究竟
2026-07-11 · 10 分钟阅读 #emacs#elisp#client-server#developer-tools#text-editorsCloudNativePG 在 Kubernetes 上跑起 Postgres 再杀掉它 — 实测故障转移 23 秒
在真实的 8 节点 Kubernetes 集群上安装 CloudNativePG(CNPG) v1.30.0,启动一个 3 实例的 Postgres 集群,然后真的把主库杀掉。从引导启动、复制确认,到强制删除主库后的故障转移(23.1 秒内副本晋升、数据零丢失),再到死掉的节点作为副本自愈、恢复到 3/3 — 全过程连同实测日志一并记录。运行在 NFS 存储之上的家庭实验室环境里那些诚实的数字与陷阱,也原样收录。
2026-07-11 · 7 分钟阅读 #cloudnativepg#postgresql#kubernetes#operator#database只用体育场的巡演:BLACKPINK《Deadline》讲述的女性 K-pop 经济学
BLACKPINK 的《Deadline》世界巡演被作为组合首次全体育场巡演来营销,2025年7月5日在高阳开幕,2026年1月26日在香港落幕。先行单曲《Jump》于2025年7月11日发行,以第一名的成绩空降 Billboard 全球200榜;而同名 EP 却直到巡演结束后的2026年2月27日才以5首歌的形式面世,首日约146万张,刷新了女团纪录。不过总演出场次与观众人数在各家出处之间出入极大 — 维基百科的演出表约为33场,福布
2026-07-11 · 9 分钟阅读 #kpop#blackpink#music-industry#korea#touring兵役之后的 BTS:从《阿里郎》专辑与巡演看回归的规模与舞台设计
BTS 全员结束兵役后首次以团体名义推出的正规专辑《阿里郎》于 2026 年 3 月 20 日发行,以首周 641,000 的专辑等效销量在 Billboard 200 榜首出道,这是他们生涯第 7 次登顶、也是自 2022 年《Proof》以来首次夺冠,并连续 3 周稳居第一。同名的阿里郎世界巡演于 2026 年 4 月 9 日在高阳开演,覆盖 34 座城市、23 个国家、超过 88 场演出,一直延续到 2027 年,并主打 360
2026-07-11 · 9 分钟阅读 #kpop#bts#music#korea#touringACSM 健身趋势 20 年 — 从美容到心理健康·寿命·数据
美国运动医学会(ACSM)的全球健身趋势调查今年迎来第 20 届,2026 年的榜首再次是可穿戴技术。本文整理了前十名,但比起排名本身,更想读出这 20 年所勾勒的轨迹 — "减重"改名为"体重管理",运动者中有 78% 把精神与情绪层面的安康列为最大理由。文章也淡淡地点明:这是约 2,000 名专业人士参与的认知调查,而非对大众行为的测量;拥有可穿戴设备并不等于行为改变 — 连作者的这一告诫也一并道来。所有数字均以 ACSM 的公布为
2026-07-11 · 10 分钟阅读 #fitness#health#trends#wellness#wearables从 UniClawBench 看 2026 年的智能体基准测试 — 存活容器与隐藏的监督者
香港大学(HKU)MMLab 于 2026 年 7 月投稿到 arXiv 的 UniClawBench,是一个标榜"能力驱动(capability-driven)"的主动式智能体基准测试。它不再与预先静态记录好的标准答案做比对,而是在存活的 Docker 容器中用步骤级检查点来评分,并以执行者、隐藏的监督者、用户智能体组成的闭环来模拟多轮反馈。其核心在于:把 400 个双语任务划分为五种能力,并力图将基座模型的实力与智能体框架的设计分开
2026-07-11 · 9 分钟阅读 #ai#agents#evaluation#benchmark#llmScarf 为何恋恋不舍地告别用了 7 年的 Haskell — 语言选择的真正成本 ♪ 可收听
Scarf 正在把在生产环境跑了 7 年的 Haskell 迁移到 Python。有意思的是迁移的理由。创始人 Avi Press 坦承 Haskell 在很大程度上兑现了可靠性、类型安全和性能的承诺,但决定性的成本是编译时间和生态系统的摩擦。在多个 AI 智能体并行探索各自分支的开发方式下,冷构建的等待时间从一点小小的不便,变成了最大的成本。本文梳理了一个团队离开一门仍然尊重的语言的真正原因,以及语言的适合度会随时代与开发方式而改变这
2026-07-11 · 13 分钟阅读 #haskell#python#engineering-decisions#compile-times#ai-assisted-development想得更多不等于答得更对:测试时计算与过度思考
2026年4月,Shu Zhou 等6人在 "When More Thinking Hurts" 中,对一味增加推理 token 的潮流正面提出质疑。据作者们报告,计算预算越大,额外推理 token 的边际效用就下降得越多,而从某个点开始,模型会陷入"过度思考",亲手推翻自己此前已经答对的答案。最优思考长度因问题难度而各不相同,因此给所有问题相同预算的做法并不高效。摘要并未给出具体的模型名称或数值,所以我只谨慎地带回方向性。
2026-07-11 · 10 分钟阅读 #ai#llm#reasoning#inference#test-time-computeLLM 倦怠 — 当工作从"创造"变为"审阅"
开发者 Alec Scollon 的随笔《I Think I Have LLM Burnout》在 Hacker News 上引发热议。因为它精准地道出了这样一种感受:一天的工作从"编写"代码,悄然变成了"审阅"模型写出的东西。本文忠实地梳理他的观点,并补上一份平衡的视角。生成变便宜了,验证却没有,审阅 AI 的输出是实实在在的认知劳动。工具在样板代码和陌生领域里能显出价值,但疲惫来自同样错误的反复、频繁的上下文切换,以及"把一切都塞进
2026-07-11 · 10 分钟阅读 #llm#developer-experience#burnout#ai-tooling#code-review重返终端的创业者 — Hashimoto 的 Ghostty、Zig 这场豪赌,以及“没有义务”的开源 ♪ 可收听
HashiCorp 联合创始人 Mitchell Hashimoto 从成功创业者的位置上再次走下来,用还不到 1.0 的语言 Zig 打造终端模拟器 Ghostty,本文以最近的一次采访为依据梳理他这样做的理由。他坦言自己做了 15 年 CLI,却并不了解终端内部是如何运作的,为了重新磨砺已经变钝的技术手感,他向下钻进了 GPU、桌面和 Zig。Zig 在 0.15 中把输出接口几乎整个改掉,至今仍不稳定,但他反而欢迎这种破坏性变更。
2026-07-11 · 11 分钟阅读 #ghostty#zig#open-source#terminal#mitchell-hashimoto扩散 LLM 会写 CUDA 内核 — DICE,以及并行生成为何可能有效
DICE 是 2026 年 2 月的一篇预印本,它主张扩散(diffusion)大语言模型在 CUDA 内核生成上超越了同规模的自回归(autoregressive)模型,创下了新的最高性能(SOTA)。核心思路是:与其把 token 从左到右逐个写出,不如并行生成整个序列,并可以在任意位置非顺序地改写 — 这一性质似乎很适合全局结构至关重要的代码任务。作者用一个名为 CuKe 的 SFT 数据集和两阶段强化学习(BiC-RL)训练了
2026-07-11 · 10 分钟阅读 #ai#llm#diffusion#cuda#gpu