博客
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 855 篇
#2026-03 168#ai 112#llm 90#ai-papers 62#career 60#kubernetes 57#mindset 51#ai-platform 48#devops 45#security 43#deep-learning 35#performance 33#psychology 32#mlops 30#observability 29#2026-04 26#linux 24#database 23#robotics 22#rust 22#ai-agent 21#mcp 20#productivity 20#culture 19#evaluation 19#gpu 18#transformer 18#electronics 17#paper-review 17#pytorch 17#developer-tools 16#distributed-systems 16#engineering 16#learning 16#open-source 16#postgresql 16#rag 16#fundamentals 15#network 15#2026-08 14
2025-2026美国影视全盘点 — 奥斯卡选中的与观众选中的 ♪ 可收听
整理了2025年到2026年上半年真正引发热议的17部美国电影与剧集。涵盖了拿下第98届奥斯卡最佳影片的《One Battle After Another》、创下奥斯卡史上最多16项提名纪录的《Sinners》、成为Netflix历代观看次数最多电影的《K-Pop猎魔女团》,以及横扫艾美奖的《The Pitt》和《The Studio》。每部作品都标注了导演与主演、已确认的观看渠道,以及谁会喜欢、谁可能不喜欢。
2026-08-02 · 25 分钟阅读 #culture#american-film#tv-series#movie-recommendation#oscars2025-2026华语影视全盘点 — 内地、香港、台湾三份不同的成绩单
整理了2025年到2026年上半年真正引发热议的17部华语电影与剧集,按内地、香港、台湾分类呈现。涵盖了成为全球动画票房冠军的《哪吒之魔童闹海》、拿下金马奖最佳剧情长片的台湾电影《大濛》、拿下香港电影金像奖最佳电影的《再见UFO》,以及用潮汕方言拍摄、豆瓣评分高达9分的《给阿嬷的情书》。每部作品都标注了出品地与导演、已确认的观看渠道。
2026-08-02 · 25 分钟阅读 #culture#chinese-film#hong-kong-cinema#taiwan-cinema#movie-recommendation2025-2026日本影视动画全盘点 — 被刷新的两项纪录,以及它们投下的阴影 ♪ 可收听
整理了2025年到2026年上半年真正引发热议的18部日本电影、剧集与动画。涵盖了刷新日本影史票房纪录的剧场版《鬼灭之刃》无限城篇、成为真人电影历代票房冠军的《国宝》、拿下洛迦诺电影节金豹奖的《旅与日々》,以及时隔25年首次有三位日本导演同时入围戛纳主竞赛单元的2026年。每部作品都标注了导演与制作方、已确认的观看渠道,以及谁会喜欢、谁可能不喜欢。
2026-08-02 · 27 分钟阅读 #culture#japanese-film#anime#j-drama#movie-recommendationLLM Ops 到底在做什么 —— 可复现性、数据污染、检查点、模型晋升与回滚 ♪ 可收听
本文把 LLM Ops 整理成一份责任清单,而不是工具清单。内容包括:让训练运行可以被重建的运行清单里应该包含什么、如何防止并审计评测集的数据污染、从故障率反推检查点间隔的公式与保存成本的真实数字、把评测接入 CI 时应该以什么作为门槛。后半部分讨论训练与服务之间的交接实际会在哪些地方出问题、部署后的回归检测,以及回滚设计。工具只按类别介绍,不涉及厂商定价。
2026-08-02 · 20 分钟阅读 #mlops#llmops#reproducibility#evaluation#model-registry怎样真正读懂一张模型卡片 —— 5 分钟内挑出你需要的东西 ♪ 可收听
模型卡片的写法是,从头读到尾反而找不到你需要的信息:基准测试表占了半屏,许可证和聊天模板却一笔带过。本文把阅读顺序倒过来,整理出在 5 分钟内挑出部署决策真正需要的七件事的方法。内容涉及开放权重和开源有什么不同、为什么不能对卡片上的分数照单全收、上下文长度的标注背后藏着什么,以及分词器和聊天模板为什么是最容易在不报错的情况下悄悄出问题的地方。最后按这份清单,把 2026 年 8 月 2 日在 Hugging Face 上直接核实过的一张
2026-08-02 · 27 分钟阅读 #llm#huggingface#model-card#license#tokenizer机器给的安慰是真的吗 — 为什么需要换一个问题 ♪ 可收听
人们在和AI对话之后,心情真的会变好。把这一点一口断定为错觉,不仅无礼,而且不准确。本文探讨响应性为什么会让人感到被关照,并深入到临床试验的设计层面,看基于聊天机器人的心理健康研究究竟证明了什么、又没能证明什么。文章提出,真正该问的问题不是"这种安慰是真的吗",而是"它替代了什么"——因为作为补充的安慰和作为替代的安慰,虽是同一种行为,却是截然不同的两回事。
2026-08-02 · 23 分钟阅读 #humanities#ai#psychology#loneliness#relationships机器人学所需的数学,按顺序学:以及哪些可以先放一放 ♪ 可收听
这是「做机械臂到底要把数学学到什么程度」这个问题的答案。按线性代数、三角学与旋转表示、微积分与多变量方法、微分方程与控制理论、概率与估计、优化的顺序,整理成六条分支。每条分支都写清楚三件事:在机械臂的哪个环节被用到、学到什么程度算够用、以及哪些可以放到后面再学。之所以要明确写出「可以放后面」,正是因为那里是大多数人卡住不前的地方。文章用 numpy 直接确认雅可比矩阵的 SVD 在奇异点附近是如何崩溃的,并把六条分支收进一张学习顺序表里
2026-08-02 · 38 分钟阅读 #robotics#math#electronics#linear-algebra#control2025-2026韩国影视全盘点 — 院线归来的一年,OTT重新洗牌的一年 ♪ 可收听
整理了2025年到2026年上半年真正引发热议的18部韩国电影与剧集。涵盖了吸引1691万观众的《王之守护者》、朴赞郁在威尼斯首映的《别无选择》,以及在Netflix拿下全球第一的《恰似阳光》与《真正的教育》。每部作品都用一句话标注了导演与主演、播出平台,以及谁会喜欢、谁可能不喜欢。只透露前提,绝不剧透结局。
2026-08-02 · 26 分钟阅读 #culture#korean-film#k-drama#movie-recommendation#netflix说服的结构 — 打动人心的是顺序,不是口才 ♪ 可收听
说服往往在打磨措辞之前,就已经在结构层面失败了。本文围绕四个维度展开:在提出主张之前先建立共同前提、把最有力的证据放在注意力最集中的位置、把要求缩小到对方能够接受的规模,以及"人会抗拒被说服"这一根本性的不对称。文章指出精细加工可能性模型与接种理论的证据分量并不相同,并列出登门槛效应、自我损耗等被广泛引用却复现薄弱的发现及其效应量。最后,把一条关于CI改进提案的真实消息做了修改前后的对比重写。
2026-08-02 · 28 分钟阅读 #career#persuasion#communication#influence#psychology用文字说服 — 让设计文档和RFC获批的结构 ♪ 可收听
写给那些要写设计文档、RFC、提案书、事故复盘建议的人。本文讲的是把想要的决定放在最前面,而不是按自己解决问题的顺序来写;讲清楚为什么"展示被否决的替代方案"是区分提案与广告的唯一标志;讲如何把"什么都不做"的成本变成数字;也讲如何应对那些只是快速浏览的决策者。最重要的是,讲如何写出那种会在你不在场的会议上被引用的段落。文章把一段薄弱的提案实际改写了一遍,并把文档中真正管用的招数整理成了一张表。
2026-08-02 · 22 分钟阅读 #career#writing#persuasion#design-doc#engineering如何处理反对意见 — 区分事实分歧、价值分歧与地位分歧
反对意见,是大多数学习说服技巧的人都会跳过的部分。本文把钢人论证(steelmanning)当作一套工作程序来讲——把对方的论点整理得比对方自己还清楚,大声说出来并请对方确认;讲清楚为什么自己先抛出最强的反对意见反而会提升而不是削弱信任;并区分事实分歧、价值分歧与地位分歧,说明各自该用什么方式应对。文章还讨论了在争论中途意识到自己错了该怎么处理,以及那个被广泛引用、却在大规模重复实验中大幅缩水的"逆火效应",并附上具体的效应量。最后收录
2026-08-02 · 23 分钟阅读 #career#persuasion#communication#conflict#teamwork为自家服务搭建评测集 —— 从流量采集到统计显著性判定 ♪ 可收听
公开基准测试没法替你测量自己的问题,因为输入分布、正确答案的定义、失败的成本结构统统不一样。本文用真实代码走一遍完整流程:从实际流量里捞出案例、按失败类型分层、给没有唯一正确答案的任务套上评分细则(rubric)、接上打分脚本。文章还讲了如何用置信区间估算需要多少样本才够、以及如何用 McNemar 检验和自助法(bootstrap)判断小评测集上两个模型 5 个百分点的差距是否具有统计意义。最后整理了如何把评测集接入 CI、如何防止污
2026-08-02 · 32 分钟阅读 #llm-evaluation#eval-set#rubric#statistics#regression-testing拆解 LLM 基准测试工具 —— 为什么同一个 MMLU 在不同评测框架下分数不一样 ♪ 可收听
基准分数不是模型的属性,而是在特定条件下完成的一次测量结果。同一个 LLaMA 65B 在同一个 MMLU 上同时拿到 63.6 分和 48.8 分这件事说明,评测框架如何拼装提示词、如何解析答案,很大程度上决定了分数本身。本文拆解评测框架内部实际执行的六个步骤,并对比 lm-evaluation-harness 0.4.12、HELM 0.5.16、Inspect AI。文中给出了从头到尾跑一个小模型的具体命令,也给出了手动修改任务定
2026-08-02 · 31 分钟阅读 #llm-evaluation#benchmark#lm-evaluation-harness#helm#reproducibility文本、图像、智能体分别怎么测 —— 三个领域的测量为何根本不同 ♪ 可收听
文本、图像、智能体都在用"性能"这同一个词,但测量结构完全不同。文本分裂成假装有正确答案的选择题和没有正确答案的生成式任务;图像的分布距离和人类判断对不上;智能体则因为部分成功、环境状态、非确定性,从一开始就无法压缩成一个数字。本文在定义层面拆解各领域代表性指标实际计算的是什么,并为每个领域各配上一个"指标很高但实际很差"的案例。最后用一张表总结领域、任务、指标,以及每个指标遗漏了什么。
2026-08-02 · 32 分钟阅读 #llm-evaluation#multimodal#llm-as-judge#agent-benchmark#metrics给应用接上 OpenTelemetry —— 从自动埋点到手动 span,以及为什么要放一个 collector ♪ 可收听
埋点不是安装一个 SDK 那么简单,而是要遵守一个顺序。本文用自动埋点在一天内搭好骨架,先把 resource 属性定下来,再讲清只在 self time 大的区间加手动 span 这个顺序,全程用一个真实服务从头到尾地埋点做示范。文中还原并修复了上下文传播断裂的四个地方:线程池、消息队列、后台任务,以及会剥掉请求头的代理。最后整理出把 collector 放在应用和后端之间的五个理由,并盘点埋点反而把应用搞坏的那些失效模式。
2026-08-02 · 22 分钟阅读 #observability#opentelemetry#instrumentation#otel-collector#tracing正运动学:从关节角度到末端位置,齐次变换矩阵与 DH 参数 ♪ 可收听
已知关节角度、计算末端执行器在哪里,这就是正运动学。这篇文章用真实数字展示 4×4 齐次变换矩阵如何调和「旋转是矩阵乘法、平移却是加法」这个不一致,以及为什么串接多个坐标系最终只需要做乘法。文章手工推导两连杆和三连杆手臂的正运动学,再转写成 DH 参数表并用 numpy 核对,同时精确辨清标准 DH 与改进 DH 乘法顺序的差异。用表格整理三种旋转表示法的取舍,并用代码复现万向锁现象。最后计算一个符号错误如何让末端偏移 212 毫米。
2026-08-02 · 31 分钟阅读 #robotics#math#electronics#raspberry-pi#hardware机械臂控制回路:从轨迹生成到 PID 与重力补偿 ♪ 可收听
逆运动学给出关节角度之后,剩下的就是控制的领域了。这篇文章从加速度不连续的角度,解释为什么直接把目标角度写进去会让手臂猛地一抖,并针对同一个 90 度的移动,用真实数字比较梯形速度曲线和五次多项式轨迹。文章计算出关节空间插值和作业空间插值产生的路径会相差 43 毫米,讲清楚 PID 三项各自修正的是什么问题,并通过仿真结果展示一个重力补偿前馈项如何把 5.13 度的稳态误差变成零。最后通过计算控制周期从 1 千赫兹降到 50 赫兹时 3
2026-08-02 · 33 分钟阅读 #robotics#electronics#arduino#hardware#math逆运动学:从目标位置反推关节角度 ♪ 可收听
正运动学是输入角度就能得到位置的一次性计算,而逆运动学则可能无解、可能有多个解,也可能有无穷多个解。这篇文章从余弦定理出发,把两连杆平面手臂的解析解一路推到底,用数字确认 elbow-up 和 elbow-down 这两个解为什么总是成对出现,以及代入工作空间之外的坐标时,平方根内部是如何变负的。接着转向用雅可比矩阵和伪逆矩阵反复迭代求解的数值解法,算出在奇异点附近,一条「移动 1 毫米」的指令如何要求每秒 3590 度的关节角速度,以
2026-08-02 · 30 分钟阅读 #robotics#math#electronics#hardware#raspberry-pi本地轻量级 Kubernetes 选型标准 —— 用数据存储和合规要求来区分 k3s、k0s、RKE2 ♪ 可收听
本文不罗列功能清单,而是只挑出真正决定选型的那几条轴线,来比较 k3s、k0s、RKE2。第一条轴线是数据存储:用 SQLite 起步就没法扩展服务器节点,内置 etcd 要求奇数节点,外部数据存储又多了一样要运维的东西。第二条是默认打包了什么、以及日后剥离它的成本;第三条是单一二进制和静态 Pod 部署方式的差异;第四条是 RKE2 存在的理由 —— CIS 配置文件与 FIPS 支持,到底是谁真正需要。最后把所有轴线汇总成一张表,并
2026-07-31 · 24 分钟阅读 #kubernetes#k3s#k0s#rke2#on-premisek0s 离线安装与 k0sctl 自动化 —— 从制作镜像包到多节点升级 ♪ 可收听
本文按命令逐条整理在没有互联网路径的离线网络里搭建并运维 k0s 集群的流程。内容包括用 k0s airgap list-images 和 bundle-artifacts 制作镜像包的三种方法、把自有工作负载镜像并入同一个镜像包的技巧、k0s 自动导入镜像包所依赖的目录规则,以及把 defaultpullpolicy 钉死为 Never、彻底阻断外部拉取尝试的配置。接下来讲了如何用 k0sctl 通过 SSH 把二进制和镜像包推送到多
2026-07-31 · 21 分钟阅读 #kubernetes#k0s#k0sctl#air-gap#on-premise