博客
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 855 篇
#2026-03 168#ai 112#llm 90#ai-papers 62#career 60#kubernetes 57#mindset 51#ai-platform 48#devops 45#security 43#deep-learning 35#performance 33#psychology 32#mlops 30#observability 29#2026-04 26#linux 24#database 23#robotics 22#rust 22#ai-agent 21#mcp 20#productivity 20#culture 19#evaluation 19#gpu 18#transformer 18#electronics 17#paper-review 17#pytorch 17#developer-tools 16#distributed-systems 16#engineering 16#learning 16#open-source 16#postgresql 16#rag 16#fundamentals 15#network 15#2026-08 14
Palantir 本体论 — 用官方文档读懂那层"把行动放在数据之上"的运营层 ♪ 可收听
Palantir 所说的本体论(Ontology)不是哲学术语,而是产品的一层。对象、属性、链接(语义)与动作、函数(动力)六个部件,数据集变成对象的路径,用户编辑与原始数据冲突时的规则,规模上限与 OSv1 的退役日期,以及 LLM 如何在其上使用工具 — 全部只用 Palantir 官方文档的原句整理。
2026-09-11 · 12 分钟阅读 #palantir#ontology#foundry#aip#data-platformAI 代理 harness 解剖 — 让规则自己得到遵守的 35 个文件 ♪ 可收听
模型一样,可在某个仓库里事故反复发生,在另一个仓库里却不会。差别就在 harness。逐个文件解剖一个三周内与 AI 一起积累了 1,491 次提交的仓库的 harness:规则只放一处、6 条路径规则、5 个技能、2 个钩子、3 个子代理,以及检查 harness 自身的 34 个测试。
2026-09-11 · 18 分钟阅读 #ai#agent#harness#claude-code#ci-cd云上的 bastion 是什么,在 AWS 上怎么用才好 — ProxyJump 实测、SSM Session Manager、EC2 Instance Connect Endpoint
bastion 是把进入私有网络的门减到只剩一扇的主机。在家庭实验室里用 OpenSSH 的 ProxyJump 经过跳板机,实测目标服务器到底看到了什么,再以文档为据比较 AWS 推荐用来替代 bastion 的两样东西:SSM Session Manager 和 EC2 Instance Connect Endpoint。
2026-09-10 · 11 分钟阅读 #aws#bastion#ssh#ssm#security在 Docker Hub 前面放代理缓存的三种方法 — registry:2、Nexus、ECR pull-through cache
亲自读取 Docker Hub 的限额响应头,把 registry:2 搭成 pull-through 缓存并把同一镜像拉三次,然后结合文档与实测,梳理 Nexus 的代理/组仓库和 ECR pull-through cache 各自适合放在哪里。
2026-09-10 · 9 分钟阅读 #docker#registry#nexus#ecr#devopsCloudNativePG 深入解析 — 在 Kubernetes 里由谁照看 PostgreSQL
为什么不用 StatefulSet,为什么 Pod 的 PID 1 不是 postgres,三个 Service 各做什么,为什么基础备份和 WAL 必须合在一起才能恢复。用生产集群的真实配置拆解 CNPG 的功能与角色。
2026-09-10 · 10 分钟阅读 #kubernetes#postgresql#cloudnativepg#backup#operator用 Trivy 扫描生产镜像 — 768 条结果里真正要动手的只有三个包和 Dockerfile 的一行
从登录库的签名验证绕过(CVE-2026-27962),到用摘要固定的基础镜像永远收不到操作系统安全修复。扫描工具把自己也数进去的陷阱、密钥检测的误报,以及用对照实验证明升级无害的记录。
2026-09-10 · 8 分钟阅读 #security#cve#trivy#docker#pythonMP3 用 VBR 编码会让字幕点击错位 — 用实测看 CBR 与 VBR 的区别
点击播客字幕却跳到错误位置,原因是音频文件的格式。VBR 的 Xing TOC 为什么最多偏差 0.9 秒,CBR 为什么能控制在 0.04 秒以内,以及对 96 集实测后的记录。
2026-09-10 · 8 分钟阅读 #audio#mp3#ffmpeg#web#debugging三行配置文件让 4 张 GPU 死了一周 — containerd drop-in 合并的真相 ♪ 可收听
节点不再广告 GPU。配置文件里 nvidia 运行时明明写得好好的,containerd config dump 里却没有。真凶是一周前加进去的三行 registry 配置,原因在于 containerd 的 imports 合并不是按字段合并,而是按插件整块替换。我把两次误诊的过程,以及最后给出答案的那个实验,原样记在这里。
2026-08-26 · 16 分钟阅读 #kubernetes#containerd#gpu#nvidia#troubleshooting人人可懂的 AI 第6篇 — 用111万参数的扩散模型从单词画出数字 ♪ 可收听
我们用111万参数做了一个条件扩散模型:输入 "zero" 就画出 0。加噪的 forward 只是一行公式,还原的 reverse 就是把这一行倒着走 400 次。本文用真实生成结果说明扩散如何绕开第5篇中 L1 损失导致的颜色发灰问题,以及为什么模型被训练去预测噪声而不是图像。
2026-08-24 · 11 分钟阅读 #ai#diffusion#ddpm#generative#pytorch人人可懂的 AI 第5篇 — 用47万参数的 U-Net 给黑白照片上色,以及颜色为何发灰
本系列最小的模型 —— 47万参数的 U-Net —— 把 CIFAR-10 的黑白图像还原成彩色。形状保留得很好,颜色却明显发灰。这不是容量问题,而是选用 L1 损失的必然结果。我们用真实输出图像说明 skip connection 究竟运送了什么,以及回归损失为何会抽干饱和度。
2026-08-23 · 10 分钟阅读 #ai#computer-vision#unet#colorization#pytorch人人可懂的 AI 第4篇 — 用137万参数给图像配句子,以及第3篇的 bug 为何没出现在这里
把 CNN 编码器接上 Transformer 解码器,给 Fashion-MNIST 图像配字幕。137万参数、十分钟训练,标签命中率达到 91%。本文讲清编码器-解码器结构中 cross-attention 在做什么,并把两个函数并排放在一起,说明让第3篇正确率跌到 7.5% 的 EOS bug 为何没有出现在这份代码里。
2026-08-22 · 9 分钟阅读 #ai#captioning#multimodal#transformer#pytorch人人可懂的 AI 第3篇 — 损失0.0017却只有7.5%正确率,元凶是一格填充
我们用148万参数做了一个 VQA 模型:同时接收图像和问题并给出答案。训练损失降到 0.0017,正确率却只有 7.5%,比随机猜还差。原因不在模型,而在生成标签的一行代码;改掉之后变成 99.5%。本文用真实输出说明:为什么低损失并不保证好模型,以及如何识破这个陷阱。
2026-08-21 · 10 分钟阅读 #ai#vqa#multimodal#debugging#pytorch用家里的服务器搭一个实操型学习平台 — 如何把 Kubernetes 塞进没有特权的 Pod 里 ♪ 可收听
学员按下按钮,专属容器随即启动,在浏览器终端里操作真实的 Linux shell,每一步点击评分后由服务器检查 Pod 内的实际状态来判定通过与否 — 这是把这样一个学习平台搭在家里 7 节点 Kubernetes 集群之上的记录。最难的问题不是功能,而是隔离。既然是实操,就必须把 root 交给学员,但这个 root 绝不能跑到家庭网络里去。解法是三层:把 Cilium 网络策略拆成按实验区分的三档配置,Linux capabilit
2026-08-20 · 22 分钟阅读 #kubernetes#cilium#security#homelab#kwokLabHub — 我做了一个在浏览器里操作真实服务器来学习的实操平台
有些东西光靠读是学不会的。连上服务器敲命令、敲错、再弄清楚为什么错了 — 这个过程没有任何替代办法。LabHub 就是把这个过程搬进浏览器里的学习平台。点下开始实验,专属的 Linux 容器立刻启动,用浏览器终端连上去解题,每一步由服务器检查实际状态并告诉你是否通过。里面有学习路径 12 条、课程 73 门、实验 261 个共 2058 步、测验 1876 题、理论 319 篇。从 IT 基础和 Linux 起步,一路延伸到容器、Kub
2026-08-20 · 10 分钟阅读 #labhub#kubernetes#devops#education#hands-on人人可懂的 AI 第1篇 — 用15分钟从零训练一个1600万参数的语言模型 ♪ 可收听
用一张 GPU 从零训练语言模型。借助 TinyStories 数据集和1600万参数的仅解码器 Transformer,15分钟就生成出可读的英文童话。我们用真实的训练日志和未经修改的生成结果,来看因果掩码为何必要、权重共享节省了什么、以及 perplexity 8 究竟对应怎样的句子。基于 RTX 3090 实测。
2026-08-19 · 12 分钟阅读 #ai#llm#transformer#pytorch#hands-on小习惯的力量 — 21天的神话、66天的中位数、18到254天的现实 ♪ 可收听
习惯21天就能养成这句话,没有习惯研究的依据。那个数字来自1960年一位整形外科医生的观察。实际上被引用最多的拉利团队的习惯形成研究,报告的是自动化平均需要66天,个体差异从18天到254天这样一个宽阔的范围。本文整理了情境稳定性与摩擦设计、缺一天并不等于失败的原因,以及习惯类书籍越过依据的那个地点。
2026-08-16 · 18 分钟阅读 #mindset#habits#psychology#self-improvement#2026-08专家不是知道得更多,而是看到的东西不一样 ♪ 可收听
1973年的棋盘实验是专业性研究的起点。高手对真实对局局面的记忆远远更好,但在随机撒开的排列上,这份优势大部分都消失了。这意味着靠的不是记忆容量而是模式知觉。本文梳理从国际象棋出发、经由体育的视线研究一直延伸到语言的成块处理的证据,并看看这个发现对练习方法提出了什么要求。
2026-08-16 · 19 分钟阅读 #mindset#learning#expertise#chunking#perception把事情做好的结构 — 自我评估、反馈、窄范围 ♪ 可收听
想把事情做好的心谁都很大,可是做得好这件事究竟由什么构成,反倒很少有人问。本文用校准过的自我评估、快速的反馈回路、先窄范围这三根柱子,把实力的结构整理成一张地图。每根柱子更深的内容接到刻意练习、元认知、从乒乓球里学到的东西那几篇,最后还写了这套建议不适用的情况。
2026-08-16 · 15 分钟阅读 #mindset#growth#deliberate-practice#self-improvement#2026-08人不容易改变,而人会改变 — 性格变化的证据与速度 ♪ 可收听
人不会变这句话和人可以变这句话都是真的,而这份张力就是本文的主题。整个成年期都维持着的大五名次稳定性,随年龄移动的成熟原理,用执行意图去尝试性格变化的哈德森的那些实验,通过智能手机干预连观察者都看得见的变化,以及治疗前后的性格变化综述。本文把性格重新定义为缓慢变化的一束习惯,并老实写下了可以期待的速度与幅度。
2026-08-16 · 18 分钟阅读 #mindset#personality#psychology#self-improvement#2026-08从乒乓球里学到的14件事:实力造就关系,头衔挡住成长 ♪ 可收听
把长年打乒乓球得来的十四条原则整理出来,看看它们怎么迁移到工作和生活里。实力成为关系入场券的结构、只图打得开心为什么不会进步,以及自己的头衔挡住学习的那一刻。迁移不过去的部分也一并写了。
2026-08-16 · 16 分钟阅读 #mindset#growth#deliberate-practice#sports#career