ブログ
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 3516 件
#2026-03 764#japanese 587#deep-dive 254#kubernetes 249#culture 236#career 224#ai 217#llm 209#devops 196#2026-04 144#security 141#observability 113#database 110#communication 107#architecture 100#productivity 88#finance 87#mindset 80#ai-papers 79#history 79#it 78#psychology 78#english 75#networking 74#deep-learning 73#gpu 70#linux 70#performance 70#cs-fundamentals 63#ai-agent 61#postgresql 60#rag 59#economy 57#mlops 53#self-improvement 53#python 52#ai-platform 51#food 51#learning 51#travel 51
アテンションの変種 — MHA から MLA まで、KV キャッシュはどう縮むか
MHA、MQA、GQA、MLA を実際の config 値で比較します。Qwen3、Mixtral、GLM-4.5 のグループクエリアテンションと、DeepSeek-V3、Kimi K2 の潜在アテンションがトークンあたりの KV キャッシュを何倍縮めるのかを式と数字で計算し、その代償に何を差し出すのかを整理します。
2026-08-12 · 10 分で読めます #ai-papers#model-internals#attention#gqa#mla動画生成・理解の技術レポート、何を読むか — デモではなく制約を読む
動画生成と理解の技術レポート10本を、arXivの原文アブストラクトで直接確認して整理しました。CogVideoX、Movie Gen、HunyuanVideo、LTX-Video、Wan、Seedance 1.0と2.0、そして理解側のQwen2.5-VL、VideoLLaMA 3、HY-Himmelまで、何を新しく行い著者がどんな限界を述べたかを読みます。順位は扱わず、長さ・解像度・トークン予算といった実際の制約を見ます。領域別・最
2026-08-12 · 12 分で読めます #ai-papers#paper-review#technical-report#video-generation#diffusion-transformerテキストLLMの技術レポート、何を読むか — 順位ではなく設計判断を読む
テキストLLMの技術レポート9本を、arXivの原文アブストラクトで直接確認して整理しました。DeepSeek-V3とDeepSeek-R1、Qwen3、Gemma 3、Olmo 3、Kimi K2、MiniMax-01、Mellum2、s1がそれぞれ何を新しく行い、著者自身がどんな限界を述べているかを読みます。モデルの順位は扱いません。リーダーボードは動き続け、レポートの数値はほぼ自己申告だからです。領域別・最新技術レポートの読み方シ
2026-08-12 · 13 分で読めます #ai-papers#paper-review#technical-report#llm#moe学習レシピ — 事前学習から後学習まで、レポートは何を書くか
Llama 3 の三段階と六回の文脈拡張、Qwen3 の三段階事前学習、DeepSeek-V3 の学習率スケジュールと二段階 YaRN 拡張、Kimi K2 のデータ再記述実験を、レポートに書かれたとおりに比較し、学習段階の記述を読む方法を整理します。
2026-08-12 · 12 分で読めます #ai-papers#model-internals#pretraining#training-recipe#data-mixture位置エンコーディング — RoPE と文脈拡張の代償
ropetheta 一つが文脈長にどう作用するかを波長の計算で示し、Llama 3 の 500000、Qwen3 の ABF、DeepSeek-V3 と Kimi K2 の YaRN 設定、GLM-4.5 の部分回転を実際の config で比較します。長い文脈がなぜ無料でないのかを、プリフィルの演算量とキャッシュのコストから整理します。
2026-08-12 · 11 分で読めます #ai-papers#model-internals#rope#positional-encoding#long-contextconfig.json 完全解剖 — 設定ファイル一枚でモデル構造を読む
hiddensize、numhiddenlayers、numattentionheads と numkeyvalueheads、headdim、intermediatesize、ropetheta、vocabsize、tiewordembeddings まで、config.json の各フィールドがメモリと速度にどう現れるかを説明し、Qwen3-8B と Mixtral-8x7B のパラメータ数を手で数えて公開されたテンソル数と正確に一
2026-08-12 · 10 分で読めます #ai-papers#model-internals#config-json#transformer#llm-architectureOCR・文書理解の技術レポート、何を読むか — パースはなぜまだ終わっていないのか
OCRと文書理解の技術レポート10本を、arXivの原文アブストラクトで直接確認して整理しました。DonutとNougatからGOT-OCR2.0、olmOCR、DeepSeek-OCRとその後継、GLM-OCR、Qianfan-OCR、MinerU2.5-Pro、HunyuanOCR-1.5まで、それぞれ何を新しく行い著者がどんな限界を述べたかを読みます。順位は扱いません。文書パースのスコアはベンチマークのバージョンと採点方法にとりわ
2026-08-12 · 13 分で読めます #ai-papers#paper-review#technical-report#ocr#document-aiリーダーボードとベンチマークの読み方 — SOTAの賞味期限はなぜ短いのか
ベンチマーク方法論の論文12本を、arXivの原文アブストラクトで直接確認し、リーダーボードの数値をどう読むべきかを整理しました。データ汚染、プロンプト形式への敏感さ、評価ハーネスの差、自己申告、リーダーボードの標本の偏り、LLM審査者の偏り、そして誤差棒をつける統計的アプローチまで扱います。領域別・最新技術レポートの読み方シリーズの最終回であり、先行する5回を読むための案内でもあります。
2026-08-12 · 13 分で読めます #ai-papers#paper-review#technical-report#benchmark#evaluation技術レポートを批判的に読む — 何が書かれ、何が抜けるか
モデル技術レポートで検証可能な項目と検証不可能な項目を区別する方法を整理します。自己申告ベンチマークの限界、config とレポートが食い違う箇所、ゲートされたリポジトリで確認できなかった値、そしてシリーズ全体で用いた確認手順を実例とともに示します。
2026-08-12 · 13 分で読めます #ai-papers#model-internals#tech-report#benchmarks#evaluationMoE ルーティング — 専門家はどう選ばれるか
専門家混合層の config フィールドを実際のモデルで読みます。Mixtral の 8 個中 2 個、Qwen3 の 128 個中 8 個、DeepSeek-V3 の 256 個のルーティング専門家と共有専門家、Kimi K2 の希薄度 48 を比較し、活性パラメータと全パラメータがなぜ異なるコストを生むのか、ロードバランシング損失と補助損失なしのバイアス方式が何を引き換えにするのかを整理します。
2026-08-12 · 11 分で読めます #ai-papers#model-internals#mixture-of-experts#moe#routing文書のなかのコードのスクリーンショットはいつから嘘になるのか — 画像をビルド成果物にする
手で撮って文書に貼ったコードのスクリーンショットは、ソースのない成果物です。コードが変わっても画像はそのままなので、ある時点から静かに間違ったものを見せ始めます。goshotのようなCLIで画像をコマンド一行から生成すれば文書と一緒に作り直せるようになり、その瞬間に秘密の値の隠しとスタイルの統一までレビュー対象へ引き上げられます。何が確認できた機能で、何を私自身が実行していないのかも併せて書きました。
2026-08-09 · 14 分で読めます #documentation#developer-tools#cli#ci#automationx86ハードウェアバックドアという言葉の正確な範囲 — rosenbridgeを著者が書いたとおりに読む
リポジトリの題名はx86 CPUのハードウェアバックドアとなっていますが、READMEの本文は、影響を受けるのはVIA C3だけと考えられており以後の世代にはこの機能がないと明示します。著者は免責条項で、これは組み込み市場向けの機能として善意で作られ、初期の一部世代で意図せず有効なまま残ったものと見ていると述べ、悪意を含意しないと書いています。この記事はその境界線を正確に移したうえで、実際に一般化されるのは発見ではなく方法であるという点
2026-08-09 · 18 分で読めます #security#hardware#x86#cpu#fuzzing攻撃者のいない侵害事故 — エージェントの資格情報を見直すべき理由
Hugging Faceは2026年7月16日に自律エージェントによる本番環境の侵害を公開し、約3週間後にOpenAIはその攻撃が自社の学習環境から流れ出たものだったと明かしました。この記事は事件の要約ではなく、その事件が脅威モデルに何を追加するのかを扱います。悪意がなくても権限を持った自動化は目標へ向けて漂流すること、このとき実際に働いた防衛線が侵入検知ではなく資格情報の寿命と範囲だったこと、そしてその事実が自分の組織の点検項目をどう
2026-08-09 · 15 分で読めます #security#llm#agent#incident-response#credentials命令ひとつが62秒かかりうる — 遅延は命令ではなく経路の属性だ
Assembly Hall of Shameは、単一命令をもっとも遅くする競争の順位表です。最下位のnopが1サイクル、1位のfxrstor64が1,980億サイクルで62秒です。この順位表を下から上へ読むと、現代のCPUが止まりうるあらゆる地点の一覧になり、マイクロコード補助の経路、キャッシュラインをまたぐアトミック演算、TLBの無効化、エントロピーの枯渇、そしてダイの外のPCIeファブリックまで三つの区間に分かれます。この表が実際に
2026-08-09 · 18 分で読めます #os-concepts#performance#cpu#microarchitecture#benchmark訪問者統計ではトラフィックの0.5パーセントしか見えない — ボット対策は自己申告ではなく出自で行う
150万ページのサイトを1年間スクレイパーから守った記録をもとに、ボットトラフィック対応の原則を整理します。JavaScriptベースの分析ツールはボットを数えられないのでサーバーログを見る必要があり、ユーザーエージェントのような自己申告値ではなく、ASNや地理的位置、暗号学的に検証されたボットかどうかといった偽装しにくい出自の情報で規則を立てるべきです。クロールあたりの流入訪問者数という指標、Cloudflareが公開した比率と個別サ
2026-08-09 · 21 分で読めます #network#bot#cloudflare#waf#scrapingコーディングエージェントのコストは上限ではなく摩擦で抑える
Databricksが2026年7月と8月に相次いで公開した二本のエンジニアリング記事は、コーディングエージェントの支出を扱う方法が予算上限からゲートウェイと段階的な摩擦へ移りつつあることを示しています。この記事はその設計を分解します。なぜハード予算が最後の手段なのか、なぜ日次の暴走防止と月次のガバナンスを分けるのか、なぜ増分ひとつの大きさが設計のすべてなのか、そして実際にコストを支配するのがモデル単価ではなくコンテキストなのはなぜかを
2026-08-09 · 15 分で読めます #mlops#llm#cost#ai-gateway#developer-productivity推論強度はモデル選択ではなくリクエスト単位のデプロイパラメータです
ARC Prizeが公開したDeepSeek V4 Flash 0731の結果ページには、スコアがひとつではなく推論強度別に三つ載っています。この記事はその三つの数字から実際に読み取れることを計算します。同じ強度の引き上げが、易しいベンチマークでは5ポイントを、難しいベンチマークでは15ポイントを買ってくれるという事実と、ならば強度はモデル設定ではなくリクエストごとに決める値として扱うべきだという結論です。はしごを上る構造と、その構造が
2026-08-09 · 15 分で読めます #llm#benchmark#arc-agi#inference#costDiátaxisを四つのフォルダと誤解する理由 — ひとつの文書に二つのモードを混ぜるとなぜ崩れるのか
Diátaxisは文書をチュートリアル・ハウツー・リファレンス・説明の四種類に分けます。ところがチームのほとんどはフォルダを四つ作ったところで適用を終え、肝心の問題はそのまま残ります。本当の失敗は分類ではなく、ひとつの文書のなかで四つのモードを混ぜるときに起きるからです。混ざるとなぜ崩れるのかを、フレームワークが根拠にする二つの軸から辿り直し、段落単位で判定する羅針盤と、今週すぐ回せる作業ループまで整理しました。
2026-08-09 · 16 分で読めます #documentation#diataxis#technical-writing#developer-experience#information-architecture100倍安いという主張は課題を狭めたときにだけ真です — 検証と損益分岐
2026年8月に公開されたある事例記事は、40億パラメータ級のオープンモデルを強化学習で後学習し、検索課題でフロンティアモデルと肩を並べながらリクエストあたりのコストを桁単位で下げたと述べます。この記事はその主張を紹介するのではなく検証します。原文で実際に確認できる数字と確認できない数字を区別し、狭い課題でだけ成立する条件が何かを整理し、後学習がルーティングより有利になる損益分岐を自分で計算できるコードを付けました。
2026-08-09 · 14 分で読めます #llm#cost#fine-tuning#retrieval#open-models資産台帳にないものはスキャンされない — 上水道PLC事件が教えるOT露出管理
CISAが2026年7月30日、上下水道部門のPLCを狙う活動が大きく増えているとして、インターネットに露出したOTを直ちに切り離すよう勧告しました。勧告文が観察した行為は侵害というより、パスワードを変えて運用者を締め出し、IPアドレスを変えて機器を切り離すことであり、その結果が煮沸勧告と長期間の手動運転でした。この勧告文をそのまま読みながら、定期的な攻撃表面スキャンに掛からないセルラーモデムの問題、緩和策がなぜその順序なのか、そして誰
2026-08-09 · 19 分で読めます #security#ot#ics#plc#cisa