博客
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 855 篇
#2026-03 168#ai 112#llm 90#ai-papers 62#career 60#kubernetes 57#mindset 51#ai-platform 48#devops 45#security 43#deep-learning 35#performance 33#psychology 32#mlops 30#observability 29#2026-04 26#linux 24#database 23#robotics 22#rust 22#ai-agent 21#mcp 20#productivity 20#culture 19#evaluation 19#gpu 18#transformer 18#electronics 17#paper-review 17#pytorch 17#developer-tools 16#distributed-systems 16#engineering 16#learning 16#open-source 16#postgresql 16#rag 16#fundamentals 15#network 15#2026-08 14
苹果起诉了OpenAI — 人才流动与商业秘密法,开发者该如何解读
2026年7月10日,苹果将OpenAI、两名前员工以及OpenAI的硬件子公司io Products诉至加利福尼亚北区联邦地区法院。核心是商业秘密的不正当使用与违约。本文先把苹果所"主张"的内容作为主张明确区分开来,再从开发者的视角剖析这场诉讼真正的争点 — 由于加州的竞业禁止协议无效,商业秘密法几乎是规范人才流动的唯一杠杆。这还只是第一手棋,已确认的报道中既没有OpenAI的公开反驳,也没有法院的判断。
2026-07-11 · 10 分钟阅读 #openai#apple#trade-secrets#legal#industry用 Rust 编写 Kubernetes GPU Operator — 用 kube-rs 诊断真实集群
面对一个 8 节点的实际运行家庭实验室集群(k8s v1.32.5),我用 kube-rs 亲手用 Rust 写了一个 GPU Operator 并跑了起来。我定义了 GpuInventory 自定义资源,并把两个控制器(节点扫描→记录 CR 状态、节点监视→更新 ConfigMap)打包进一个二进制,从集群外部运行。然后是 Operator 真正吐出的结果 — 4 个 GPU 节点中 Ready 为 0 个,也就是整支 GPU 舰队都
2026-07-11 · 8 分钟阅读 #rust#kubernetes#operator#gpu#kube-rs生产级 RAG 模式 — 朴素 RAG 为何失败,以及真正管用的技法 ♪ 可收听
演示版 RAG 半小时就能做出来,但在生产环境中悄然崩坏的地方,大多不是生成,而是检索。本文把分块、嵌入与混合检索(BM25 + 向量)、重排序、上下文检索、查询改写以及评估逐一梳理,讲清每一项各自是什么、何时有用、又要付出什么代价。只引用像 Anthropic 上下文检索数值那样有出处的数字,并坦率地指出 RAG 并非魔法、最终终究要用自己的数据来评估。
2026-07-11 · 15 分钟阅读 #ai#rag#llm#retrieval#embeddings在 AI 编程模型评测中分辨信号与噪声 — SWE-bench 为何开始动摇
OpenAI 评测团队指出,最广泛使用的编程基准 SWE-bench Verified 因为污染和设计缺陷,已经无法再给出有意义的信号。用信号(区分模型的能力)和噪声(每次运行都会摇摆的变动)这两个维度重新审视,就会发现排行榜上相当一部分名次其实站在噪声之上。本文梳理污染、测试框架差异、无法评分的任务与过拟合是如何把分数抬高的,并结合 eval-first 原则,说明团队在挑选编程助手时为何应当用自己的任务、而非排行榜来评测。
2026-07-11 · 10 分钟阅读 #llm-evaluation#coding-benchmarks#swe-bench#benchmarks#ai-codingForward Deployed Engineer(FDE)备战 — 你需要掌握的软件知识地图
Forward Deployed Engineer(FDE)是 Palantir 创造的职位,工程师直接进驻客户公司,把产品部署、集成到他们的真实环境中。最近 OpenAI、Anthropic 这类 AI 公司为了把自家模型搭载到客户基础设施上,大量招聘这一职位,让它重新受到关注。本文写给准备做 FDE 的人,梳理了这个角色的真实面貌(基于真实资料),以及真正重要的软件知识 — Linux、网络、容器/Kubernetes、数据库、AP
2026-07-11 · 10 分钟阅读 #career#fde#software-engineering#palantir#solutions-engineering用 Keycloak 搭建 SSO — 从 Realm、Client、登录流程到 2026 年新功能 ♪ 可收听
与其给 20 个内部应用分别接上登录功能,不如让一台身份服务器代替所有应用完成这件事,这就是 SSO。本文用 Realm、Client、Role、Identity Provider 这四个核心概念来理解开源标准 Keycloak,一步步走完 OIDC Authorization Code + PKCE 登录流程,梳理 Quarkus 发行版 build/start 两阶段模型、hostname v2 等生产环境陷阱,并从实战角度整理 2
2026-07-09 · 13 分钟阅读 #keycloak#sso#oidc#security#devops自动化的三个部族 — Zapier·Make·n8n、RPA,以及 2026 年的智能体化自动化
面对「帮我自动化这个」这句话,人们常常拿错工具。因为自动化其实分属三个互不相同的部族 — 连接 API 的工作流自动化(Zapier·Make·n8n)、在没有 API 的画面上像人一样操作的 RPA(UiPath·Power Automate),以及连判断都能代劳的 AI 智能体。本文梳理各部族的真面目与 2026 年的格局(计费模型的陷阱、n8n 2.0 的 AI 节点、Zapier Agents、38 亿美元 RPA 市场的智能体
2026-07-09 · 10 分钟阅读 #automation#rpa#zapier#n8n#ai-agents2026年机器人企业地图 — 人形机器人混战与VLA模型,以及工程师的入场路径
2026年是人形机器人出货量同比跃升7倍(预计达5万台)的转折点。从估值390亿美元、拥有自研VLA模型Helix的Figure,到即将于夏季进入量产的Tesla Optimus Gen 3,再到已售出5,500台的价格破坏者Unitree,以及出售机器人通用大脑的Physical Intelligence(π0) — 本文按硬件、大脑、市场三条轴线梳理主要企业,追溯从RT-2到GR00T N2的VLA(Vision-Language-
2026-07-09 · 10 分钟阅读 #robotics#ai#vla#trends#careerLLM 训练数据预处理完全指南 — 从网页抓取到 Token 打包,附最新论文 ♪ 可收听
好模型来自好数据,好数据来自预处理流水线。本文逐步讲解预训练数据要经过的全部工序 — 网页抓取采集 → 正文抽取 → 语言识别 → 启发式规则与分类器结合的质量过滤 → 精确去重与近似(MinHash)去重 → PII·毒性处理 → 基准测试污染清除 → 分词与序列打包,并介绍 SFT 数据整理的要点、datatrove、Dolma、NeMo Curator 等工具,以及从 The Pile 到 FineWeb、DCLM 这些改变了这一
2026-07-09 · 12 分钟阅读 #ai#llm#data-engineering#preprocessing#trainingGPU Operator × KubeVirt 完全整理 — 组件、配置、版本,从部分 MIG 到手动 MIG ♪ 可收听
把 Kubernetes GPU 基础设施的两大支柱整理在一页里。涵盖 GPU Operator 的 operand 构成、ClusterPolicy 配置与版本体系,同时讲解只对节点上部分 GPU 应用 MIG 的自定义配置,以及用 nvidia-smi 手动创建、删除 MIG 的方法。接着介绍在 Kubernetes 上运行虚拟机的 KubeVirt 的四大组件(virt-operator、controller、handler、la
2026-07-09 · 12 分钟阅读 #kubernetes#gpu#kubevirt#mig#nvidia打造 3D 的两条路径 — 重建(NeRF・高斯泼溅)与生成(TRELLIS・Hunyuan3D) ♪ 可收听
"制作 3D 模型"这句话里,其实藏着两个完全不同的问题。重建(reconstruction)是从多张照片中,把真实存在的场景复原成 3D;生成(generation)则是从一段文字或一张图像里,凭空造出并不存在的东西。本文沿着重建的谱系,从 SfM 到 NeRF,再到改变格局的 3D 高斯泼溅与前馈式重建(Meta MapAnything)一路梳理;又沿着生成的谱系,从 DreamFusion 的 SDS 蒸馏到原生 3D 扩散,再到
2026-07-09 · 13 分钟阅读 #3d#ai#gaussian-splatting#nerf#computer-vision多 GPU、多节点训练平台全面梳理 — 从框架生态地图到 Slurm、Kubeflow 实战指南 ♪ 可收听
把用多张 GPU、多台节点训练模型的整体地形,梳理在一页之内。AI 库与框架生态地图(PyTorch、JAX、HuggingFace、DeepSpeed、Ray)、何时该选哪种并行化策略(DDP、FSDP、ZeRO、TP、PP)、torchrun 从单节点到多节点的扩展、HPC 标准 Slurm 的实战指南(sbatch 脚本与多节点 torchrun 的联动)、Kubernetes 阵营 Kubeflow 的实战指南(Training
2026-07-09 · 12 分钟阅读 #ai#ml#distributed-training#slurm#kubeflowDocker 到 Podman — 无守护进程容器引擎迁移完全指南 ♪ 可收听
Podman 以无守护进程(fork-exec)方式运行、且默认 rootless,这一点从架构哲学上就与 Docker 不同。本文梳理了内部工作原理(conmon·crun)、配置文件的位置与含义、使用 GPU 所需的 CDI 设置、原样使用 compose.yaml 的两种方法(podman 套接字 + docker compose vs podman-compose)、SELinux 卷标签之类的迁移陷阱,以及版本与社区的比较 —
2026-07-08 · 13 分钟阅读 #docker#podman#containers#devops#linuxLLM 缓存的原理 — 提示词缓存与 Prefix Cache 为什么能省钱 ♪ 可收听
为什么提示词的前半部分相同,成本就会降到十分之一?答案就在 Transformer 内部的 KV 缓存里。由于注意力是因果的(causal),前面 token 的 Key/Value 向量无论后面出现什么都不会改变,因此可以先存下来再复用。从 prefill 与 decode 的区分、KV 缓存的内存数字、vLLM/SGLang 的 prefix cache 实现,一直到 Anthropic/OpenAI 提示词缓存的定价结构与实战设计
2026-07-08 · 12 分钟阅读 #ai#llm#caching#inference#performance最新 LLM 量化技术全解 — 从 GPTQ、AWQ 到 FP8、MXFP4、KV 缓存量化 ♪ 可收听
量化是把模型的数值用更少的比特表示,从而降低内存和成本的技术。比特减少后质量为何依然能撑住(离群值与缩放)、GPTQ 与 AWQ 在思路上的差异、llama.cpp GGUF 的 k-quant、QLoRA 的 NF4,以及 2026 年的核心轴 — FP8 与微缩放 FP4(MXFP4、NVFP4),直到下一个瓶颈 KV 缓存量化 — 连同 W4A16 这类记法的读法,以及按硬件与目的划分的选型指南,在一篇里整理出最新的量化版图。还收
2026-07-08 · 13 分钟阅读 #ai#llm#quantization#inference#optimizationFDE(Forward Deployed Engineer)完全拆解 — 现在 AI 行业最炙手可热的岗位 ♪ 可收听
正如「企业 GenAI 试点中 95% 拿不出可衡量成果」这项调查所示,如今 AI 的瓶颈不是模型,而是部署。填补这道缝隙的职位就是 FDE — 被派驻到客户环境中、亲手构建生产级 AI 的工程师。本文梳理这个诞生于 Palantir、如今 OpenAI 与 Anthropic 正押上数十亿美元复制的职位 — 从起源、实际工作内容、所需能力、薪酬、权衡取舍到准备方法,全部整理在内。
2026-07-07 · 13 分钟阅读 #career#fde#ai#palantir#roles所有权的反击与AI现实核查 — 本周HN与GeekNews热门话题
本周贯穿 Hacker News 与 GeekNews 排行榜前列的潮流分为两股。一股是从开源地图、开放硬件蔓延到可更换电池的「所有权的反击」,另一股是由开源权重模型的价格压力与 AI 智能体减速论所引领的「AI 现实核查」。本文用七个热门话题,梳理这两股看似无关的潮流为何都收敛到同一个问题 — 控制权。
2026-07-07 · 9 分钟阅读 #trends#hackernews#geeknews#ai#opensourceNVIDIA GPU Operator 完全指南 — 从安装部署到 MIG 分区配置 ♪ 可收听
在 Kubernetes 里手动搭建 GPU 节点的时代已经结束。本文梳理了 NVIDIA GPU Operator 如何用 Operator 模式把驱动、设备插件、监控这一整套栈全部管起来的原理,以及 Helm 安装与验证方法;还有把一张 A100/H100 切分成多个硬件隔离 GPU 来用的 MIG——它的概念、single/mixed 两种策略、基于节点标签的配置、自定义 Profile、以及运维注意事项,配合实际命令从头到尾讲清
2026-07-07 · 12 分钟阅读 #kubernetes#gpu#nvidia#mig#devopsAI 模型开发,从头到尾 — 从数据到部署的现实生命周期 ♪ 可收听
模型开发不是从预训练开始,而是从决策阶梯开始 — 靠提示词能不能解决,靠 RAG 能不能解决,是否需要微调。先做评估集再做模型的 eval-first 原则、数据质量与合成数据的陷阱、缩放定律与分布式训练、从 LoRA 到 DPO 的微调光谱、量化与连续批处理的服务,以及部署后的数据飞轮 — 本文按实务顺序梳理 AI 模型开发的完整生命周期。
2026-07-07 · 14 分钟阅读 #ai#ml#llm#mlops#trainingOh My OpenCode 使用指南 — 把 OpenCode 变成多代理团队 ♪ 可收听
Oh My OpenCode 是叠加在 OpenCode 之上的编排层,用它组建一支异步子代理团队。本文以实战指南的方式,梳理从安装、配置到成本安全的完整流程。
2026-07-06 · 25 分钟阅读 #oh-my-opencode#opencode#ai-coding-agent#cli#developer-tools