タグ: #ai
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 217 件
AIエージェントを本番で運用するということ — 冪等性、予算、そして自信満々の誤答
エージェントをプロトタイプから本番へ移すとき、遅れて見つかる運用面があります。リトライされたツール呼び出しの冪等性、予算とステップ上限、非決定的な制御フローの可観測性、ツール単位の権限境界、そしてエージェントが自信満々に間違えたときのエスカレーション経路です。最近GeekNewsのAsk GNに投稿された分析は、ベンチマークのトレース6,780件から重複ツール実行8,042件を見つけ、そのうち159件は状態を変えるツールが実際に重複リソ
2026-07-31 · 29 分で読めます #ai#agents#observability#reliability#mcpプロンプトで3D CADを作るということ — メッシュとB-rep、そして制約条件というボトルネック
GeekNewsのShow GNに、プロンプトで3D CADモデルを作るツールCAIDが投稿されました。作った本人が自ら明かした限界がこの分野全体の状態を正確に要約しています — 寸法の自動検証がなく、公差とDFMと加工性を判断できず、出力物をそのまま製造に使ってはいけない検証済みプロトタイプにすぎないということです。エンジニアリングの視点からの問いは一つです。CADはパラメトリックで制約ベースなのに、メッシュを生成することと編集可能な
2026-07-31 · 22 分で読めます #ai#cad#llm#manufacturing#geometry社内ナレッジベースをLLMで作るということ — 権限認識検索、鮮度、そして公開前の評価セット
Cerebrasが2026年7月15日に公開した社内ナレッジベース構築記は、1日15,000件を超える問い合わせを人間と自動化とエージェントが一緒に投げるシステムの内部構造を明らかにしています。しかし社内ナレッジベースでチームが実際に過小評価しがちなのは、チャンキングやリランキングではなく、権限、鮮度、削除伝播、そして真実源の衝突です。HR文書を漏らす検索はないほうがましで、すでに廃止されたランブックを自信満々に引用する検索はウィキより
2026-07-31 · 26 分で読めます #ai#rag#enterprise-search#llm#platform-engineeringBunのZigからRustへの書き換え11日間 — AI大規模マイグレーションで実際に持ち帰れるもの
Bunが53万5千行のZigコードを11日でRustへ移した過程を一次ソースで追いかけます。2026年5月3日から14日まで、最大64個のClaudeインスタンス、約50個のワークフロー、6,502個のコミット、API定価換算で約16万5千ドルがかかりました。この記事が関心を持つのは11日という数字ではなく、その数字を成立させた条件です — 言語に依存しないテストスイートというオラクル、ファイル対ファイルで対応する構造保存の翻訳、そして
2026-07-31 · 24 分で読めます #ai#bun#rust#migration#testingAIでコードベースを移す実践手順 — 審判を先に立て、行数ではなくレビュー率を測る
2026年上半期に公開された大規模LLMマイグレーションの事例(53万5千行のZigからRustへ、16万5千行のPythonからTypeScriptへ)から共通の手順を抜き出し、実行可能な順序に整理します。核心は順序です — 翻訳を始める前に振る舞いのオラクルを立て、わざと壊したコードでそのオラクルが落ちるかどうかをまず確認します。そのうえで検証可能な境界で切ってキューを作り、完了判定をディスクの状態に任せてすべての工程を元に戻せるよ
2026-07-31 · 23 分で読めます #ai#migration#refactoring#testing#engineeringDeepSeek V4 Flashが実際に変えるもの — リーダーボードではなく能力あたり単価の問題
2026年7月31日、DeepSeekがV4-Flash APIを公開ベータに切り替えました。アーキテクチャは4月のプレビューと同じ284Bの総パラメータ・13BアクティブのMoEに1Mコンテキストで、変わったのはポストトレーニングだけです。公式チェンジログが公開したスコアはTerminal Bench 2.1で82.7、Toolathlon verifiedで70.3ですが、これらの数字はDeepSeekが自社ハーネスで測ったベンダー
2026-07-31 · 19 分で読めます #ai#llm#deepseek#inference-cost#moeRAG・ファインチューニング・ロングコンテキスト — 自分の問題には何を使うべきか:論文が実際に測ったもの、そして誰も測っていないもの ♪ 聞けます
LLMアーキテクチャで最も頻繁に出る質問ですが、大半の答えは出典のない意思決定ツリーです。本稿は測定されたものだけで答えます。ファインチューニングが新しい知識の注入に失敗することは複数の論文で繰り返し測定されており(Ovadiaら、Gekhmanら)、正反対に見える農業のケーススタディは実は別の介入(教師なし継続事前学習 vs 教師ありQ&Aチューニング)を測ったものなので、矛盾ではありません。ロングコンテキストは位置・長さ・語彙という
2026-07-17 · 43 分で読めます #rag#llm#fine-tuning#long-context#aiLLM APIコストを実際に下げる方法 — 「キャッシング90%割引」が請求書ではなぜ25%なのか ♪ 聞けます
プロンプトキャッシングのキャッシュ読み取りは入力価格の10分の1です。しかし、それが請求書を90%削ってくれるわけではありません。Anthropicが自社ドキュメントに載せている計算例をそのまま追うと、キャッシュが完全に効いた状態でも総額は0.705ドルから0.525ドルへ、25.5%しか減りません。理由は単純です — 割引はその項目に使うお金の割合の分だけしか請求書を減らさず、出力トークンがすでにコストの60%を食っているからです。こ
2026-07-17 · 38 分で読めます #llm#cost-optimization#prompt-caching#api#ai画像1枚から動画を作る — Kling・Veo・Sora vs Wan・HunyuanVideo、何をいつ選ぶか ♪ 聞けます
画像1枚とプロンプトから動画を作るモデルを選ぶとき、実際に決定を分けるのはデモリールの画質ではなく、秒あたり価格・入力画像の制約・ライセンスの3つです。2026年7月時点で、各ベンダーの公式価格表と文書だけを直接確認して整理しました。ホスティッド側はsora-2が720pで秒あたり0.10ドル、Veo 3.1 Fastがオーディオ込みの720pで秒あたり0.10ドル、Klingは秒単位ではなく5秒・10秒のクリップ単位で課金するため秒あ
2026-07-17 · 39 分で読めます #ai#video-generation#image-to-video#open-weights#licensingAI コーディングエージェント、何をどんな仕事に使うのか — 4ベンダーの公式ドキュメントだけで確認した選択基準 ♪ 聞けます
Claude Code · Cursor · GitHub Copilot · OpenAI Codex のどれを使うか選ぶとき、最も多く聞かれる質問は「どれが一番安いか」です。ところが、4社が公開している価格だけではこの質問に答えは出ません。使用量を売る単位が4つとも違うからです — AnthropicはPro比の倍率(5倍・20倍)で、Cursorは含まれるAPI使用額をドルで、GitHubは1クレジットが1セントのクレジットで、O
2026-07-17 · 41 分で読めます #ai#ai-coding-agent#claude-code#cursor#github-copilotブラウザ・コンピュータを操作するAIエージェントはいまどこまで来たか — ベンチマークの数字が実際に測っているもの ♪ 聞けます
「コンピュータユースエージェントがOSWorldで83.5%を記録した」と「最強のエージェントでも20.6%しか完了できない」は、どちらも2026年に出た事実であり、どちらも正しいのです。前者はOSWorld 1.0、後者は同じチームが作ったOSWorld 2.0です。本稿ではその隔たりがどこから来るのかを、原論文とベンチマーク著者らの自己測定でたどります。OSWorldの課題の半分近くはGUIをほとんど使わずターミナルで解けるというE
2026-07-17 · 44 分で読めます #ai#computer-use#browser-agents#benchmark#prompt-injectionAIエージェントはプロダクションでどう失敗するのか — 14の失敗モード、そしてリトライが安全ではない理由 ♪ 聞けます
エージェントをプロダクションに載せると、3つの場所が痛みます。第一に、失敗はモデルではなくシステム設計から生まれます — UCバークレーのMAST研究は実行トレース1642件を分類して14の失敗モードを抽出し、そのうち44.2%がシステム設計の問題でした。第二に、最も多い2つの失敗モード(ステップ反復15.7%、終了条件の未認識12.4%)が、そのままトークンの請求書になります。第三に、まさにその2つがリトライ/冪等性の問題を生みます
2026-07-17 · 39 分で読めます #ai#agents#observability#reliability#mcpAIエージェントのメモリは実際にどう作られているのか — 4つの設計と、ベンチマークが実際に証明したこと ♪ 聞けます
「エージェントメモリ」は単一の技術ではなく、少なくとも4つの異なる設計をひとまとめにした言葉です — ファイルスクラッチパッド、要約/コンパクション、ベクトル回収、知識グラフ。本稿はまず、それぞれが実際に何をするのかを製品ドキュメントで確認し、その後もっと不都合な質問を投げかけます: どちらが優れているという根拠は、実際に測定されたことがあるのか? Mem0論文(arXiv:2504.19413)の表を直接読むと、ヘッドラインの「Ope
2026-07-17 · 38 分で読めます #ai#ai-agent#agent-memory#llm#benchmarkAIコードレビューは実際に使い物になるのか — 測定された証拠が語る精度と偽陽性 ♪ 聞けます
AIコードレビューツールのマーケティング文句には「PRの80%に人間のコメントが不要」といった数字があふれていますが、精度と偽陽性率をあわせて公開しているところはほとんどありません。公開されている測定値を集めてみると、方向はおおむね一致します — オープンソースのPRでAIレビューコメントが実際のコード変更につながった割合はツールによって0.9〜19.2%で、人間のコメントの60%に大きく及びませんでした(Ganら、GitHub Act
2026-07-17 · 47 分で読めます #ai#code-review#static-analysis#evaluation#software-engineeringシミュレーションされた顧客は絶対に離脱しない — LLMユーザーシミュレーターがエージェントのスコアを水増しする場所 ♪ 聞けます
τ-bench系の対話型エージェントベンチマークでは、「ユーザー」役はもう一つのLLMが務めます。ところがこのシミュレーターは測定対象ではなく測定器具であり、器具は校正を受けなければなりません。2026年に出た3本の検証研究は同じ方向を指しています — シミュレーションされたユーザーは協調的すぎるのです。実在の人間451人でτ-benchプロトコルをそのまま回した研究は、シミュレーターが作る「イージーモード」がエージェントの成功率を人間
2026-07-16 · 41 分で読めます #ai#llm#evaluation#agents#simulationPD分離はスループットを増やさない — プリフィル/デコード分離が実際に買うもの
プリフィルとデコードを別々のGPUに分けるPD分離は、2026年にvLLM・SGLang・TensorRT-LLMすべてに入った設計ですが、どこを見ても「2倍から7倍」という数字ばかりが出回っています。ところがvLLM公式ドキュメントは同じ機能について「分離プリフィルはスループットを改善しない」と大文字で明記しています。実は両方とも正しいのです — そのベンダー数値はすべて、スループットではなくgoodput(SLOを守った処理量)か、
2026-07-16 · 29 分で読めます #llm#ai#inference#kv-cache#vllmMCPがセッションを取り払う — 2026-07-28リビジョンのステートレスコアを読む
MCP仕様の次のリビジョン2026-07-28は、公開以来もっとも大きな変更です。核心はプロトコル層から状態を取り払うこと — initializeハンドシェイクとMcp-Session-Idセッションが消え、すべてのリクエストがmetaにプロトコルバージョンとクライアント能力を載せて自らを説明します。その代償として、サーバーが聞き返す方式がMRTR(Multi Round-Trip Requests)にひっくり返り、SSE再開(res
2026-07-16 · 30 分で読めます #mcp#ai#protocol#agents#integrationイシュー1件でサプライチェーンの端まで — CI内のエージェントが崩れた経路と、防御が実際に稼いだ時間 ♪ 聞けます
2026年6月1日にGMO Flatt SecurityのRyotaKが公開したClaude Code GitHub Actionsの脆弱性は、CIパイプラインに入り込んだエージェントがどのようにしてリポジトリ全体を明け渡す通路になるのかを、最後まで追った事例です。ボット判定の一行が信頼境界を崩し、イシュー本文に仕込まれた指示が命令になり、読み取り専用に見える一つのコマンドが流出チャネルになります。本稿はその経路をアーキテクチャのレベル
2026-07-16 · 39 分で読めます #security#ai#prompt-injection#supply-chain#ci-cdドキュメントから知識グラフへ — 正直な構築パイプライン
「ドキュメントから知識グラフを抽出する」はデモでは LLM 呼び出し一回のように見えます。しかし顧客のドキュメントを実際にクエリ可能なグラフに変える仕事は6段階のパイプラインであり、コストと苦痛の大半は抽出ではなくエンティティ解決にあります。この記事では、スキーマ(オントロジー)を先に決める理由、LLM ベースのスキーマ制約抽出(LangChain の LLMGraphTransformer、LlamaIndex の Simple/Sc
2026-07-15 · 17 分で読めます #knowledge-graph#ai#llm#data-engineeringGraph RAG とは何か — ベクトルRAGが行き詰まる場所と、コストに見合う瞬間
RAGの標準レシピ(チャンク→埋め込み→上位k件の検索)は、答えが一つのチャンクに収まっているときはよく効きますが、マルチホップの質問や、コーパス全体を貫くグローバルな「センスメイキング」質問では構造的に行き詰まります。MicrosoftのGraphRAGはこの2つの死角を狙い、LLMでコーパスから知識グラフを抽出し、Leidenアルゴリズムでコミュニティを検出して要約を事前生成します。そのうえでグローバルな質問はコミュニティ要約のマッ
2026-07-15 · 15 分で読めます #rag#graph-rag#knowledge-graph#ai#llm