博客
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 855 篇
#2026-03 168#ai 112#llm 90#ai-papers 62#career 60#kubernetes 57#mindset 51#ai-platform 48#devops 45#security 43#deep-learning 35#performance 33#psychology 32#mlops 30#observability 29#2026-04 26#linux 24#database 23#robotics 22#rust 22#ai-agent 21#mcp 20#productivity 20#culture 19#evaluation 19#gpu 18#transformer 18#electronics 17#paper-review 17#pytorch 17#developer-tools 16#distributed-systems 16#engineering 16#learning 16#open-source 16#postgresql 16#rag 16#fundamentals 15#network 15#2026-08 14
FDE 入职 90 天 — 摸清、独立接单、主导任务的三个月
Forward Deployed Engineer(FDE)的入职适应,是同时融入两个陌生环境——自己的公司和客户现场——所以比普通工程师的入职更需要刻意设计。第一个月画出环境、产品、人的地图;第二个月用独立处理的工单开立信任账户;第三个月端到端主导一个小任务。本文给出逐周清单、每个月暗藏的陷阱,以及 90 天结束时自我检验的三个问题。这套 90 天框架不是任何公司的制度,而是从职位结构中归纳出的构建。这是 FDE 完全指南系列的第 3
2026-08-12 · 7 分钟阅读 #career#fde#forward-deployed-engineer#onboarding#checklistPoC 为什么到不了生产环境 — 成功标准、安全评审、交接
在演示会上赢得掌声的 PoC,相当一部分还是会悄无声息地死掉。不是技术不行,而是因为没有成功标准、安全评审留到了最后、没有内部支持者、PoC 环境与生产环境的落差发现得太晚。在 Forward Deployed Engineer(FDE)的工作里,从 PoC 走到生产的这一段,胜负手是运营设计而非技术。本文整理了开工前与客户共同敲定的一页成功标准文档、第一周就启动的安全评审与数据边界定义、PoC 代码里藏着的负债清单,以及让系统在你离开
2026-08-12 · 9 分钟阅读 #career#fde#forward-deployed-engineer#poc#production从后端、DevOps、数据工程师转型 FDE — 六个月路线图
考虑转型 Forward Deployed Engineer(FDE)的人,大多从三个起点出发:后端、DevOps/SRE、数据工程。好消息是无论哪个背景,FDE 技能地图的一半你已经握在手里;坏消息是空着的那一半因背景而异。本文对三种背景逐一切分「已经拥有的」与「需要补齐的」,指出三者共同缺失的客户对面技能,再归纳成以两个月为单位的六个月转型路线图。路线图是一般化的指南,不代表任何公司的招聘标准。这是 FDE 完全指南系列的第 7 篇
2026-08-12 · 8 分钟阅读 #career#fde#forward-deployed-engineer#career-transition#roadmapFDE 故障诊断手册 — 从访问权限到报告的六个步骤
自家服务的故障与客户现场的故障,决定性区别在于后者从一无所知开始。所以对 Forward Deployed Engineer(FDE)来说,比本事更先需要的是一套固定顺序。确认访问与权限、复现症状、切分层级、建立原因假设、验证、写报告——六个步骤,用「支付 API 下午起间歇性返回 504」这一个构造的示例贯穿始终,每一步都附上真正会敲的 kubectl、curl、grep 命令。还包括 FDE 特有的评分规则:诊断正确但报告迟到,仍然
2026-08-12 · 8 分钟阅读 #career#fde#forward-deployed-engineer#incident-response#debugging把「太慢了」翻译成工程问题 — FDE 的客户沟通
客户不会提交缺陷报告,他们提交的是疼痛报告:「太慢了」「跑不起来」「有时候怪怪的」。Forward Deployed Engineer(FDE)的核心技能之一,就是把这些话翻译成可测量工程问题的提问法。本文整理了五条轴——从什么时候开始、谁在哪里、做什么的时候、慢到什么程度、和什么相比——用来收窄症状;同一场景下消耗信任与积累信任的回答对照;把承诺单位从修复时刻换成下次汇报时刻的期望管理;以及故障进行中的沟通规则。文中对话均为构造的示例
2026-08-12 · 8 分钟阅读 #career#fde#forward-deployed-engineer#communication#customer-success不在资产清单里的东西不会被扫描 —— 自来水 PLC 事件带来的 OT 暴露面管理 ♪ 可收听
CISA 于 2026 年 7 月 30 日发出警告,称针对供排水行业 PLC 的活动大幅增加,并建议立即把暴露在互联网上的 OT 断开。通告所观察到的行为并不是通常意义上的攻陷,而是改掉密码把运维人员锁在门外、改掉 IP 地址让设备失联,其结果是煮沸饮水通告和长时间的手动运行。本文照着这份通告逐条读下去,梳理常规攻击面扫描抓不到的蜂窝调制解调器问题、缓解措施为什么是那个顺序,以及那个没人预先准备的恢复前提条件 —— 一份经确认干净的
2026-08-09 · 15 分钟阅读 #security#ot#ics#plc#cisa域名如何自己说「我在售」 —— DNS 是从什么时候起变成承载主张的通道的 ♪ 可收听
一个已经注册、网站也打得开的域名,其实是有意出售的 —— 而机器一直没有办法知道这件事。RFC 10023 用一个以下划线开头的节点名和一种 TXT 记录格式定义了这个信号。本文以这份文档为线索,梳理 DNS 长久以来是如何越过名称解析、被当作承载「关于该域名的主张」的公开通道来使用的,以及这套模式为什么部署起来便宜、却给不了信任。记录的准确语法以及规范明确钉死的禁止事项也一并覆盖。
2026-08-09 · 11 分钟阅读 #dns#rfc#networking#domain#protocol为什么 Diátaxis 会被误解成四个文件夹 —— 一篇文档里混两种模式为什么会塌 ♪ 可收听
Diátaxis 把文档分成教程、操作指南、参考、说明这四类。可大多数团队建完四个文件夹就算落地完毕,真正的问题原封不动地留在那里。因为真正的失败不在分类,而发生在一篇文档里混用四种模式的时候。本文从这套框架赖以成立的两条轴出发,重新梳理混起来为什么会塌,并整理了以段落为单位作判定的罗盘,以及这周就能跑起来的工作循环。
2026-08-09 · 12 分钟阅读 #documentation#diataxis#technical-writing#developer-experience#information-architecture文档里的代码截图从什么时候开始撒谎 —— 把图片做成构建产物 ♪ 可收听
手动截图再贴进文档的代码图,是一件没有源码的产物。代码变了图还在原地,于是从某一刻起它开始悄悄展示错误的东西。用 goshot 这类 CLI 把图片改成由一行命令生成,它就能跟着文档一起重建,而在那一刻,遮蔽敏感值和统一样式也一并被抬进了可评审的范围。文中也写明了哪些是我确认过的功能,哪些是我并没有亲自跑过的。
2026-08-09 · 12 分钟阅读 #documentation#developer-tools#cli#ci#automation框架不是配置,而是交付物 —— 自我改进循环真正的瓶颈 ♪ 可收听
Lilian Weng 在 2026 年 7 月整理的那篇框架工程(harness engineering)文章,给包裹着模型的整个系统起了名字,把它当成一个工程对象。本文不复述那个定义,而是讨论:当你把框架当作带版本的交付物而不是配置文件来对待时,会有什么不同。文中梳理了给框架打指纹以捕捉回归的做法、把上下文当成 playbook 而不是越写越长的提示词的做法,以及为什么自我改进循环真正的瓶颈不是模型而是评估者。
2026-08-09 · 11 分钟阅读 #llm#agent#harness-engineering#context-engineering#evaluation同时跑五个智能体真的会快五倍吗 —— 并行作业的瓶颈不在生成 ♪ 可收听
专门用来同时运行多个编码智能体的环境正在变多。Orca 就是其中之一,它主打把一条提示词撒给多个智能体、把每个都隔离到各自的 git worktree 里,再比较结果并合并其中一个。但提高吞吐并不会让瓶颈消失,只会让它换个位置。本文用排队论的一行结论指出它换到了评审与合并上,并整理了在装工具之前只用 git worktree 就能试同一套工作流的方法。
2026-08-09 · 13 分钟阅读 #developer-tools#git#worktree#code-review#workflow「x86 硬件后门」这句话的准确范围 —— 按作者写下的样子来读 rosenbridge ♪ 可收听
仓库标题写的是 x86 CPU 的硬件后门,但 README 正文明确写着:受影响的被认为只有 VIA C3,而此后的世代已经不再具备这项功能。作者在免责声明里写道,他认为这是为嵌入式市场出于善意做出来的一项有用功能,只是在早期若干世代里被无意间保留成了启用状态,并明言这不含任何恶意的意味。本文先把这条边界线准确地搬过来,再讨论真正被一般化的其实不是这个发现,而是方法:sandsifter 为寻找未文档化指令而系统性扫描整个 x86 指
2026-08-09 · 15 分钟阅读 #security#hardware#x86#cpu#fuzzing访客统计里只看得见 0.5% 的流量 —— 防机器人要看来源,而不是自我声明 ♪ 可收听
以一个 150 万页面的站点抵御爬虫一整年的记录为依据,梳理应对机器人流量的原则。基于 JavaScript 的分析工具数不到机器人,所以必须去看服务器日志;规则也不能建立在 User-Agent 这类自我声明的值上,而要建立在 ASN、地理位置、是否为经密码学验证的机器人这些难以伪造的来源信息上。文中还会谈到每次抓取带来多少访客这个指标、Cloudflare 公布的比率与单站实测值为何会分歧、防御装置本身吃掉性能预算的案例,以及在住宅
2026-08-09 · 17 分钟阅读 #network#bot#cloudflare#waf#scraping推理强度不是选模型,而是逐请求决定的部署参数 ♪ 可收听
ARC Prize 公开的 DeepSeek V4 Flash 0731 结果页上,分数不是一个,而是按推理强度列了三个。本文计算的是从这三个数字里真正能读出来的东西:同样一次强度上调,在简单基准上买到 5 个百分点,在困难基准上买到 15 个百分点;既然如此,强度就该被当成逐请求决定的值,而不是模型配置。文中用代码梳理了逐级上调的结构,以及这个结构成立所需要的条件。
2026-08-09 · 12 分钟阅读 #llm#benchmark#arc-agi#inference#cost编码智能体的开销不是靠额度管住的,而是靠摩擦 ♪ 可收听
Databricks 在 2026 年 7 月和 8 月接连发布的两篇工程文章表明,处理编码智能体开销的方式正在从预算额度转向网关加渐进式摩擦。本文拆解这套设计:为什么硬预算是最后的手段,为什么要把日常暴走防护与月度治理分开,为什么单次增量的大小就是设计的全部,以及为什么真正主导账单的不是模型单价而是上下文 —— 全部整理成可以计算的形式。
2026-08-09 · 12 分钟阅读 #mlops#llm#cost#ai-gateway#developer-productivity「便宜 100 倍」这个主张,只有在任务被收窄时才成立 —— 验证与盈亏平衡 ♪ 可收听
2026 年 8 月公开的一篇案例文章称,他们把一个 40 亿参数级的开源模型用强化学习做了后训练,在检索任务上与前沿模型打平,而单次请求成本降了一个数量级。本文不是转述这个主张,而是去验证它:区分原文里真正能确认的数字与确认不了的数字,梳理这套做法只在窄任务上成立的条件,并附上一段可以自己算「后训练何时优于路由」盈亏平衡点的代码。
2026-08-09 · 12 分钟阅读 #llm#cost#fine-tuning#retrieval#open-models慢的不是 CPU,是系统调用路径 —— 把手机做成服务器学到的东西 ♪ 可收听
本文借一个把 CMF Phone 1 变成个人基础设施服务器的案例,梳理 Linux 兼容层的真实代价究竟落在哪里。作者刷 postmarketOS 失败之后保留了原厂 Android,把 Termux 当作宿主控制平面;一般的 Web 服务用 PRoot 就够了,唯独基于 Chromium 的负载因为用户态转换层而够不着那些闲着的 CPU。解法不是改代码,而是改执行路径 —— root 之后进入真正的 chroot,用上原生系统调用。
2026-08-09 · 14 分钟阅读 #linux#termux#chroot#proot#self-hosting实例加上去了,可用性却原地不动 —— zot 的横向扩展真正卖的是什么 ♪ 可收听
本文以 zot 为例拆解容器镜像仓库的扩展设计。用一致性哈希把仓库分配给实例、非属主节点以代理方式转发的结构,是分片而不是高可用,官方文档也明确写着它不会自愈。文中依据文档与发布产物,梳理仅计算扩展与计算兼存储扩展各自放弃了什么、boltdb 缓存驱动为什么实际上把实例数锁死为一个、镜像同步中 digest 固定被破坏的条件,以及「单一静态二进制」这个说法与实际分发文件体积之间的落差。
2026-08-09 · 11 分钟阅读 #devops#oci#registry#zot#container同一家公司的两个项目,为什么在 AI 贡献上得出了完全相反的结论 ♪ 可收听
OpenJDK 在 2026 年 4 月全面禁止了由生成式 AI 产出的贡献,而同属甲骨文旗下的 GraalVM 在同一时期明确允许使用 AI 编码助手。两个项目用的是同一份贡献者协议。本文把三份文档并排来读:OpenJDK 的原文、GraalVM 的政策文件,以及两者都参考过的 Linux 内核文档。结论是:这个差异并不是对 AI 的态度差异,而是「把评审负担记到谁头上」的设计差异;知道了这根轴,你也就能写出自家仓库的政策。
2026-08-09 · 12 分钟阅读 #culture#open-source#ai#policy#code-reviewWeb 编辑器没有标尺的真正原因 —— 缺的不是尺,是纸 ♪ 可收听
Word 有而 Web 编辑器没有的功能里,被要求得最频繁的就是标尺。这不是因为没人做,而是因为 Web 里没有「页」这个模型,连「厘米是相对于什么的厘米」都定不下来。本文以最近公开的 editor-ruler 为线索,梳理为什么「加一把标尺」这个决定不是加一个 UI 部件,而是引入一整套文档模型,以及这个决定会牵出什么。
2026-08-09 · 11 分钟阅读 #frontend#rich-text-editor#ui-design#contenteditable#developer-tools