AIコードレビューの再現性は構造で決まる
AIコードレビューの結果が毎回ぶれるとき、壊れているのはモデルではなくモデルを囲む構造です。Alibaba の Open Code Review を固定 SHA で読み、対象選定・粒度・位置決め・検証層がどこに置かれているかを確認し、そのうえで「構造を入れただけでは効かない」ことを自リポジトリの失敗台帳 10 行で裏づけた記録です。
読み込み中...
17 件の記事が見つかりました
AIコードレビューの結果が毎回ぶれるとき、壊れているのはモデルではなくモデルを囲む構造です。Alibaba の Open Code Review を固定 SHA で読み、対象選定・粒度・位置決め・検証層がどこに置かれているかを確認し、そのうえで「構造を入れただけでは効かない」ことを自リポジトリの失敗台帳 10 行で裏づけた記録です。
AIコードレビューのツールを入れるとき、導入単位は「レビュー」だと無意識に決めていないでしょうか。Alibaba の Open Code Review には、LLM を一切呼ばず、ファイル選定とルール解決だけを返す委譲モードがあります。固定 SHA で実装とスキル定義を読み、段取りだけを外に出したときに手元へ残るものを数えた記録です。
エージェントに渡すツールを絞れば挙動は安定する、とよく言われます。ではその集合は本当に閉じているのか。Alibaba の Open Code Review を固定 SHA で読み、予約済みの組み込みツールと、動的に足せるツールの口が同じ名前空間に同居している構造を確認し、「閉じていると書いてあるものを拡張点から検算する」という読み方を、自リポジトリのガード実測と合わせて整理した記録です。
「ガードが存在するのに発火しない」欠陥を塞ぐPRが、その中で同じ型の欠陥を作り込んだ実例を5件、PR番号・コミット・失敗台帳の行で示します。無力化の座標が実装→配線→CIのrun:→run:の外側のYAML→判定関数の内部へ1段ずつ移る構造(外へだけではありません)と、最後の1件がいまも塞がっていないことの再現手順を、終了コードで示します。
「マージ済み main の最大IDの次を採る」という採番規則を全員が正しく守っても、並行ブランチがある限り同じIDが2つの別物に割り当てられます。本ブログのリポジトリで同じ日に2回起きた衝突を、CI の run ID と終了コードつきで記録しました。
AIの判断を決定的な自動化へ昇格させるループを実装したところ、「昇格すべきだと気づく」側の判定器が、8つのすり抜け型のうち6つで沈黙していました。対照実験の終了コードと監査スクリプトの実出力で記録します。
AIエージェントに危険なコマンド名を列挙して禁じても、被害範囲は狭まりません。このリポジトリのdeny 19件を数え、危険コマンドを止めていたはずのフックが本番のpayload形状では1件も止めていなかった実測を、修正前後の対照とコマンドつきで記録しました。
モデルが賢くなればSkillやAGENTS.mdは削れる、という前提を自リポジトリの全履歴で検証しました。結果は変更があった9か月すべてで増加、追加417ファイルに対し実質削除5件。削る判断が一度も行われていないという負債の形と、参照エッジ・二面検証という削除基準を、そのまま動くスクリプトと終了コードで示します。
CIが緑でも、そのガードが一度も発火していないことがあります。本ブログのリポジトリで見つかった7種類の「効かないガード」をPR番号つきで分類し、壊した入力を1回通す二面検証の手順と、その検証自体が摩耗していく実測(検出分岐9個のうちテストは4個)を、コマンドと終了コードで示します。
Issue Triage Agentにcloseを任せると誤クローズが怖い。このリポジトリの39 issue・close判断36件をリプレイし、PRリンクという最強の証拠でも2件を誤closeしていた実測と、証拠収集(Researcher)と判定(Judge)を分ける設計をコマンドつきで記録しました。
LLM 本番運用で必要なガードレールを、input validation・output filtering・prompt injection 対策の3レイヤーで設計する。NLP2026 の議論とOWASP LLM Top10 を参照した2026年版の実装パターン。
MCPのallowlist粒度・scope命名・組織導入の3点を判断軸で整理する。既存のMCP分離アーキ記事と合わせて読むと効果が高い。MCP権限の本丸は「allowlistの粒度」と「scope命名」の2つ
Claude Code hooks を品質担保・監査・安全制御の3用途で使い分け、ライフサイクルとCI責務分担で配置を決めるための実装パターンと失敗回避策を整理する。Claude Code hooks の用途は「品質担保」「監査」「安全制御」の3つ
AIコーディングエージェント導入で増える攻撃面を、権限・流出検知・実行時制御・設計判断の4層モデルで整理し、優先順位の判断軸を提示する。AIコーディングエージェント導入で増える攻撃面は「権限」「流出」「実行時」「設計判断」の4層に分解できる
AIエージェントが無理に処理を続けず、人間へ正しくエスカレーションするための条件設計と運用ルールを整理する。エスカレーション判定ロジックと実装例を具体的に解説。設計テンプレートと実装コード付きで解説。
AIを相棒からチームへ進化させる運用モデルを、Lead・Implementer・Critic・Scribeの4役割とガードレールで体系的に整理する。1体のAIに全部任せると、判断責任が曖昧になって破綻しやすい
Model Context Protocol(MCP)でAIワーカーのツール連携を標準化。属人プロンプトから脱出し、許可ツールを固定して禁止領域アクセスを0に近づける実践ガイド。こんにちは、みねです。