标签: #ai
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 112 篇
为每一步选择该思考多少 — Ares 的自适应推理努力路由
本文从实践角度梳理了 Ares(2026 年 3 月的预印本)。这篇论文把推理努力当作以步骤为单位的成本杠杆,而不是任务整体层面的选择。一个轻量级路由器查看交互历史,预测每一步所需的最低推理级别,从而减少让所有步骤都以最大努力运行的浪费。作者报告称,在 TAU-Bench、BrowseComp-Plus、WebArena 上,推理 token 最多削减了 52.7%,而成功率下降甚微——但这是未经独立验证的作者自报数值。本文一并讨论路由
2026-07-11 · 7 分钟阅读 #ai#agents#llm#efficiency从 UniClawBench 看 2026 年的智能体基准测试 — 存活容器与隐藏的监督者
香港大学(HKU)MMLab 于 2026 年 7 月投稿到 arXiv 的 UniClawBench,是一个标榜"能力驱动(capability-driven)"的主动式智能体基准测试。它不再与预先静态记录好的标准答案做比对,而是在存活的 Docker 容器中用步骤级检查点来评分,并以执行者、隐藏的监督者、用户智能体组成的闭环来模拟多轮反馈。其核心在于:把 400 个双语任务划分为五种能力,并力图将基座模型的实力与智能体框架的设计分开
2026-07-11 · 9 分钟阅读 #ai#agents#evaluation#benchmark#llm想得更多不等于答得更对:测试时计算与过度思考
2026年4月,Shu Zhou 等6人在 "When More Thinking Hurts" 中,对一味增加推理 token 的潮流正面提出质疑。据作者们报告,计算预算越大,额外推理 token 的边际效用就下降得越多,而从某个点开始,模型会陷入"过度思考",亲手推翻自己此前已经答对的答案。最优思考长度因问题难度而各不相同,因此给所有问题相同预算的做法并不高效。摘要并未给出具体的模型名称或数值,所以我只谨慎地带回方向性。
2026-07-11 · 10 分钟阅读 #ai#llm#reasoning#inference#test-time-compute扩散 LLM 会写 CUDA 内核 — DICE,以及并行生成为何可能有效
DICE 是 2026 年 2 月的一篇预印本,它主张扩散(diffusion)大语言模型在 CUDA 内核生成上超越了同规模的自回归(autoregressive)模型,创下了新的最高性能(SOTA)。核心思路是:与其把 token 从左到右逐个写出,不如并行生成整个序列,并可以在任意位置非顺序地改写 — 这一性质似乎很适合全局结构至关重要的代码任务。作者用一个名为 CuKe 的 SFT 数据集和两阶段强化学习(BiC-RL)训练了
2026-07-11 · 10 分钟阅读 #ai#llm#diffusion#cuda#gpu生产级 RAG 模式 — 朴素 RAG 为何失败,以及真正管用的技法 ♪ 可收听
演示版 RAG 半小时就能做出来,但在生产环境中悄然崩坏的地方,大多不是生成,而是检索。本文把分块、嵌入与混合检索(BM25 + 向量)、重排序、上下文检索、查询改写以及评估逐一梳理,讲清每一项各自是什么、何时有用、又要付出什么代价。只引用像 Anthropic 上下文检索数值那样有出处的数字,并坦率地指出 RAG 并非魔法、最终终究要用自己的数据来评估。
2026-07-11 · 15 分钟阅读 #ai#rag#llm#retrieval#embeddings2026年机器人企业地图 — 人形机器人混战与VLA模型,以及工程师的入场路径
2026年是人形机器人出货量同比跃升7倍(预计达5万台)的转折点。从估值390亿美元、拥有自研VLA模型Helix的Figure,到即将于夏季进入量产的Tesla Optimus Gen 3,再到已售出5,500台的价格破坏者Unitree,以及出售机器人通用大脑的Physical Intelligence(π0) — 本文按硬件、大脑、市场三条轴线梳理主要企业,追溯从RT-2到GR00T N2的VLA(Vision-Language-
2026-07-09 · 10 分钟阅读 #robotics#ai#vla#trends#careerLLM 训练数据预处理完全指南 — 从网页抓取到 Token 打包,附最新论文 ♪ 可收听
好模型来自好数据,好数据来自预处理流水线。本文逐步讲解预训练数据要经过的全部工序 — 网页抓取采集 → 正文抽取 → 语言识别 → 启发式规则与分类器结合的质量过滤 → 精确去重与近似(MinHash)去重 → PII·毒性处理 → 基准测试污染清除 → 分词与序列打包,并介绍 SFT 数据整理的要点、datatrove、Dolma、NeMo Curator 等工具,以及从 The Pile 到 FineWeb、DCLM 这些改变了这一
2026-07-09 · 12 分钟阅读 #ai#llm#data-engineering#preprocessing#training打造 3D 的两条路径 — 重建(NeRF・高斯泼溅)与生成(TRELLIS・Hunyuan3D) ♪ 可收听
"制作 3D 模型"这句话里,其实藏着两个完全不同的问题。重建(reconstruction)是从多张照片中,把真实存在的场景复原成 3D;生成(generation)则是从一段文字或一张图像里,凭空造出并不存在的东西。本文沿着重建的谱系,从 SfM 到 NeRF,再到改变格局的 3D 高斯泼溅与前馈式重建(Meta MapAnything)一路梳理;又沿着生成的谱系,从 DreamFusion 的 SDS 蒸馏到原生 3D 扩散,再到
2026-07-09 · 13 分钟阅读 #3d#ai#gaussian-splatting#nerf#computer-vision多 GPU、多节点训练平台全面梳理 — 从框架生态地图到 Slurm、Kubeflow 实战指南 ♪ 可收听
把用多张 GPU、多台节点训练模型的整体地形,梳理在一页之内。AI 库与框架生态地图(PyTorch、JAX、HuggingFace、DeepSpeed、Ray)、何时该选哪种并行化策略(DDP、FSDP、ZeRO、TP、PP)、torchrun 从单节点到多节点的扩展、HPC 标准 Slurm 的实战指南(sbatch 脚本与多节点 torchrun 的联动)、Kubernetes 阵营 Kubeflow 的实战指南(Training
2026-07-09 · 12 分钟阅读 #ai#ml#distributed-training#slurm#kubeflowLLM 缓存的原理 — 提示词缓存与 Prefix Cache 为什么能省钱 ♪ 可收听
为什么提示词的前半部分相同,成本就会降到十分之一?答案就在 Transformer 内部的 KV 缓存里。由于注意力是因果的(causal),前面 token 的 Key/Value 向量无论后面出现什么都不会改变,因此可以先存下来再复用。从 prefill 与 decode 的区分、KV 缓存的内存数字、vLLM/SGLang 的 prefix cache 实现,一直到 Anthropic/OpenAI 提示词缓存的定价结构与实战设计
2026-07-08 · 12 分钟阅读 #ai#llm#caching#inference#performance最新 LLM 量化技术全解 — 从 GPTQ、AWQ 到 FP8、MXFP4、KV 缓存量化 ♪ 可收听
量化是把模型的数值用更少的比特表示,从而降低内存和成本的技术。比特减少后质量为何依然能撑住(离群值与缩放)、GPTQ 与 AWQ 在思路上的差异、llama.cpp GGUF 的 k-quant、QLoRA 的 NF4,以及 2026 年的核心轴 — FP8 与微缩放 FP4(MXFP4、NVFP4),直到下一个瓶颈 KV 缓存量化 — 连同 W4A16 这类记法的读法,以及按硬件与目的划分的选型指南,在一篇里整理出最新的量化版图。还收
2026-07-08 · 13 分钟阅读 #ai#llm#quantization#inference#optimizationFDE(Forward Deployed Engineer)完全拆解 — 现在 AI 行业最炙手可热的岗位 ♪ 可收听
正如「企业 GenAI 试点中 95% 拿不出可衡量成果」这项调查所示,如今 AI 的瓶颈不是模型,而是部署。填补这道缝隙的职位就是 FDE — 被派驻到客户环境中、亲手构建生产级 AI 的工程师。本文梳理这个诞生于 Palantir、如今 OpenAI 与 Anthropic 正押上数十亿美元复制的职位 — 从起源、实际工作内容、所需能力、薪酬、权衡取舍到准备方法,全部整理在内。
2026-07-07 · 13 分钟阅读 #career#fde#ai#palantir#roles所有权的反击与AI现实核查 — 本周HN与GeekNews热门话题
本周贯穿 Hacker News 与 GeekNews 排行榜前列的潮流分为两股。一股是从开源地图、开放硬件蔓延到可更换电池的「所有权的反击」,另一股是由开源权重模型的价格压力与 AI 智能体减速论所引领的「AI 现实核查」。本文用七个热门话题,梳理这两股看似无关的潮流为何都收敛到同一个问题 — 控制权。
2026-07-07 · 9 分钟阅读 #trends#hackernews#geeknews#ai#opensourceAI 模型开发,从头到尾 — 从数据到部署的现实生命周期 ♪ 可收听
模型开发不是从预训练开始,而是从决策阶梯开始 — 靠提示词能不能解决,靠 RAG 能不能解决,是否需要微调。先做评估集再做模型的 eval-first 原则、数据质量与合成数据的陷阱、缩放定律与分布式训练、从 LoRA 到 DPO 的微调光谱、量化与连续批处理的服务,以及部署后的数据飞轮 — 本文按实务顺序梳理 AI 模型开发的完整生命周期。
2026-07-07 · 14 分钟阅读 #ai#ml#llm#mlops#training用 AI 学习的方法 — 把 LLM 变成最好的私教的 8 种技法 ♪ 可收听
只是接过 AI 给的答案去读,留下的只是"学过了"的感觉,实力并不会长进。布卢姆的 2 西格玛问题揭示了 1:1 私教的力量,本文讲的是如何用 LLM 把这种力量重现出来 — 苏格拉底式导师、费曼角色扮演、出题生成、错题分析、难度阶梯,一直到模拟面试 — 整理了 8 种基于学习科学(检索练习、间隔重复)的实战技法,并附上可以直接拿去用的提示词。这是三部曲的最后一篇。
2026-07-06 · 14 分钟阅读 #ai#learning#study#productivityPalantir 有何不同 — 真正的护城河不是 AI,而是本体论 ♪ 可收听
Palantir 这个名字常被提起,但它究竟是一家做什么的公司却始终模糊。本文梳理 Gotham、Foundry、AIP、Apollo 产品线,指出 Palantir 真正的竞争力不在于华丽的 AI,而在于把数据与现实世界的对象和行动连接起来的本体论(ontology)。同时也一并讨论批判性的视角。
2026-07-05 · 12 分钟阅读 #palantir#data#ai#enterpriseAI 代码审查工具的兴起 — 自动化审查正在改变团队 ♪ 可收听
AI 代码审查工具正以开源形式大量涌现,重塑着开发工作流。本文从 Git diff 分析、缺陷检测、规约强制,到与人工审查的角色分工、误报管理、CI 集成,做一次实务视角的梳理。
2026-06-29 · 33 分钟阅读 #devops#ai#code-review#ci-cd#developer-tools深度学习时间序列分析完全指南:LSTM、Transformer、PatchTST、TimesFM ♪ 可收听
用深度学习完全掌握时间序列数据的指南。从时间序列预处理、ARIMA、LSTM,到 Temporal Fusion Transformer、PatchTST、Mamba、TimesFM 等最新基础模型,通过实战示例学习。
2026-03-17 · 28 分钟阅读 #time-series#lstm#transformer#forecasting#deep-learning深度学习推荐系统完全指南:从协同过滤到基于 LLM 的推荐 ♪ 可收听
从推荐系统基础到最新深度学习技术的完全精通指南。通过实战代码,掌握协同过滤、Matrix Factorization、NCF、Two-Tower 模型、序列推荐、基于 GNN 的推荐,直至 LLM 推荐。
2026-03-17 · 30 分钟阅读 #recommendation-system#collaborative-filtering#deep-learning#two-tower#llm面向 AI/ML 的 Python 完全指南:精通 NumPy、Pandas、Matplotlib、Scikit-learn ♪ 可收听
面向 AI 与机器学习的 Python 生态系统完全精通指南。通过实战示例掌握 NumPy 数组运算、Pandas 数据处理、Matplotlib/Seaborn 可视化,直至用 Scikit-learn 完成机器学习。
2026-03-17 · 35 分钟阅读 #python#numpy#pandas#scikit-learn#matplotlib