| リトライストーム |
障害時に全クライアントが一斉リトライし障害を増幅 |
バックオフ+ジッタ+サーキットブレーカ、リトライ予算 |
| 全プロンプト観測基盤フル投入 |
コスト爆発・PII混入・保持違反 |
G1 二層観測 |
| 万能マルチエージェント |
シングルで足りるのに分割し、コスト/遅延/非決定性/デバッグ困難 |
まずシングル(F-2) |
| 無限/過大タイムアウト |
失敗が隠れリソースが詰まる |
層別タイムアウト+全体デッドライン(A7) |
| 過剰ガードレール |
誤検知で正当出力を弾き、自己修正ループが回り続けUX破壊 |
block/warn使い分け、ループ上限 |
| 何でも同期/何でも非同期 |
短い処理を非同期化して複雑化、長い処理を同期化してタイムアウト |
A3 同期ファサード |
| 最強モデル一択 |
単純クエリにも最上位でコスト破綻 |
B7 ルーター |
| コンテキスト詰め込みすぎ |
"lost in the middle" で精度低下・コスト増 |
top-k+リランク+圧縮(D2) |
| プロンプトをセキュリティ境界にする |
インジェクション/挙動変化で禁止が破れる |
E2 Policy-as-Code + C1 ゲートウェイ |
| 自動メモリの無制限書込 |
記憶汚染で将来の判断が静かに劣化 |
D3 書込ゲート + D1 階層化メモリ(減衰/失効) |
| 目盛りの根拠を残さない |
なぜその値か誰も説明できず、変更が怖くなる |
駆動変数を設計ドキュメント/コードコメントに明記 |
| Excessive Agency |
過剰な権限・自律で被害半径が拡大 |
C1 ゲートウェイ(リース)・A7 予算・E1 承認 |
| AP-01 Phantom Autonomy(幻の自律性) |
デモでは自律的に見えるが実は非公式な人間介入に依存、その人が不在で崩壊 |
E1 承認・G1 二層観測 |
| AP-02 Capability Ceiling Denial(能力天井の否認) |
タスク分解せずプロンプト積み重ねで対処、脆弱な「プロンプトの塔」が崩壊 |
B4 Planner-Executor-Verifier・B1 決定論的シェル・B7 ルーター |
| AP-03 Eval-Production Gap(評価・本番キャズム) |
評価セットが本番分布と乖離し、高い評価スコアが偽りの安心感を与える |
G4 Eval Harness・G1 二層観測 |
| Rollback Amnesia(ロールバック健忘症) |
複数外部システムへの副作用に補償戦略がなく、部分失敗で不整合放置 |
C4 冪等コマンド・C3 Dry-Run・C2 書込ゲート |
| AP-04 擬人化エラーバジェット |
「人間並みの精度」でエラーバジェットを設定し、スケール・系統性・速度の違いを無視 |
failure_cost × request_volume で逆算、E1 承認、入力クラス別バジェット |
| AP-05 ツール過剰装備 |
ツールを追加し続け、選択精度低下・コスト膨張・攻撃面拡大・テスト爆発 |
ツール棚卸し、C1 ゲートウェイ(動的ローディング)、B7 ルーター(特化エージェント分割) |
| AP-06 潜在的統合カップリング |
エージェント間の暗黙的契約がモデル更新・プロンプト変更で予告なく破綻 |
E4 構造化出力、B1 決定的シェル、契約テスト |
| AP-07 フィードバックループの飢餓 |
本番データを収集するが改善に還流せず、Day-1構成で凍結したまま品質が劣化 |
G4 Eval Harness・G1 二層観測・フィードバック→アクションパイプライン |
| AP-08 決定論の演劇 |
temperature=0・seed固定で決定論を装い、モデル更新・キャッシュミスで下流が一斉破綻 |
B1 決定論的シェル・E4 構造化出力・セマンティック等価性テスト |
| AP-09 コスト崖への無知 |
コンテキスト膨張・ループ累積・タスク分散の複合で10x-100xのコスト急騰 |
A7 予算カスケード・D2 コンテキスト予算・B3 ループ予算 |