
Anthropicは本日(8月8日)、8月14日からPro、Max、Teamのサブスクリプションユーザーを対象に、Claude Codeのデフォルト権限モードを自動モード(Auto Mode)に変更すると発表しました。
IT之家がブログ記事を引用して伝えたところによると、自動モードとは、Claude Codeが独立したAI分類器(classifier)を使い、ツール呼び出しやShellコマンドを毎回リアルタイムで評価し、安全な操作を許可するとともに、破壊的・不可逆的な操作や権限逸脱行為を自動的にブロックする機能です。
対象範囲については、Claude Enterprise、Claude API、Claude Platform on AWS、Amazon Bedrock、Google Cloud's Agent Platform、Microsoft Foundryでは、現在も選択式が維持されています。Anthropicは今後1か月以内に上記プラットフォームでも変更を進め、自動モードをデフォルトの選択肢にするとともに、関連する追加費用を廃止する予定です。
テスト導入では、Anthropicが1,053人の有料テスターを招いて検証を実施しました。その結果、従来の手動承認モードでは危険なコマンドを13.6%しか識別できなかったのに対し、自動モードでは89%を識別できました。

プロンプトインジェクションの評価では、Trajectory Labsが72のシナリオについて各10回、計720回の攻撃を試行し、Claude Code v2.1.205とCodex v0.144.5を対象に検証しました。
Claude Fable 5、Opus 5、Sonnet 5は自動モードですべての攻撃をブロックし、成功回数は0回でした。GPT-5.6 Solの成功率は、CodexのAuto-review(自動レビュー)モードで5.83%、Full Access(完全アクセス)モードで19.03%でした。

Anthropicはさらに、追加の保護策を適用していないbypassPermissionsモードの平均攻撃成功率は0.09%だったと指摘しています。一方、OpenAIが先週公開した新しいAuto-reviewバージョンによって、結果が変わる可能性があります。


