タグ: #grpo
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 3 件
推論モデルはどう作られるのか — CoT から GRPO まで、論文十二本でたどる系譜
o1、R1、QwQ は新しい構造ではありません。採点できる目標に向けて長い出力を最適化した結果です。Chain-of-Thought(2022)から STaR、PRM、DeepSeek-R1 の GRPO、s1 の budget forcing まで論文十二本で系譜をたどり、最後に 24GB のカード一枚でどこまで再現できるかをメモリ項目ごとに見積もります。
2026-09-06 · 14 分で読めます #ai#llm#reasoning#reinforcement-learning#grpoLLMファインチューニングフレームワーク2026 — Axolotl / Unsloth / LLaMA-Factory / TRL / PEFT / TorchTune 徹底ガイド ♪ 聞けます
2026年のLLMファインチューニング生態系を一気に整理する。Axolotl・Unsloth・LLaMA-Factory・TRL・PEFT・TorchTuneといったオープンソースフレームワークから、LLM Foundry(MosaicML、Databricksが買収)、Modal・Together・OpenAI・Anthropic・Cohereのクラウドファインチューニング API まで。QLoRA・FSDP・DeepSpeed Ze
2026-05-16 · 37 分で読めます #llm#finetuning#axolotl#unsloth#llama-factoryAI 安全 & アライメント 2026 完全ガイド - Constitutional AI · RLHF · DPO · GRPO · Mechanistic Interpretability · AISI Evals · Red Team 徹底解説
2026年のAI安全とアライメントの全体地形を一気に整理する。outer/inner アライメントや mesa-optimization といった概念的基盤から、RLHF・DPO・GRPO・Constitutional AI に至る学習時アライメント手法、Anthropic RSP や OpenAI Preparedness Framework、Google DeepMind Frontier Safety Framework といった
2026-05-16 · 30 分で読めます #ai-safety#ai-alignment#constitutional-ai#rlhf#dpo