ホームZ - バナーホーム itaClaude Code の自動モードは、デフォルトで危険なコマンドの 89% をブロックします。

Claude Code の自動モードは、デフォルトで危険なコマンドの 89% をブロックします。

Anthropic は、Claude Code ユーザーに数分おきに「承認」をクリックさせることをやめた。2026年8月14日から、Claude Code 自動モードが Pro、Max、Team プランにおける新規セッションのデフォルト設定となり、長らく開発者とAI コーディングエージェントとのインタラクションを特徴づけてきた、絶え間ない権限確認プロンプトの流れに取って代わる。同社は、この切り替えを裏付けるデータがあると述べているが、開発者兼研究者の Simon Willison を含む独立したコメントによれば、この話は単純な安全性向上というより、より複雑なニュアンスを含んでいるようだ。

主なポイント

  • Anthropic は 2026年8月14日から、Claude Code の Pro、Max、Team プランで自動モードをデフォルトにする。
  • 1,053人の有料ユーザーを対象としたテストでは、自動モードは危険なコマンドの 89% をブロックした一方で、人間のテスターは 13.6% のケースでしか拒否しなかった。
  • 独立評価機関 Trajectory Labs は、自動モードで動作する Claude Fable 5、Opus 5、Sonnet 5 に対して 720 回の間接プロンプトインジェクション攻撃を実行したが、1 回も成功しなかった。
  • Anthropic は、自動モードの分類器がツール呼び出しごとに使用する追加トークンに対する課金を停止する。
  • アナリストは依然として、データを検知されずに流出させうる悪意あるサードパーティパッケージなど、未解決のリスクに警鐘を鳴らしている。

Anthropic、Claude Code 自動モードをデフォルトに

この変更は、Anthropic のエンジニアが公然と語ってきた問題、すなわち「確認疲れ」に対する回答だ。AI エージェントのワークフローのあらゆるステップで人間に承認を求めるのは慎重に聞こえるが、実際には人々がプロンプトをよく読まずにクリックし続けるよう訓練してしまう。Anthropic によれば、自動モードは、その反復的な承認ループを、各ツール呼び出しを検査し、取り消し不能・破壊的・明らかに範囲外のアクションを検出する分類器に置き換える。分類器が何かをフラグすると、Claude はより安全な経路を探すか、再び許可を求める形に戻る。そして、ブロックが積み重なり続ける場合は、セッション全体が手動承認モードに戻される。

このロールアウトは、ユーザーまたは管理者が別の権限設定を手動で固定していない限り、Pro、Max、Team プランに影響する。Anthropic はまた、小さな金銭的摩擦要因も取り除いている。同社のブログ投稿によれば、分類器が各ツール呼び出しで消費する追加トークンに対して、今後は課金しないという。

なぜこれは利便性以上の意味を持つのか。Anthropic は、自動モードがすでにチームの働き方を変えつつあると述べている。自動モードを利用する Team および Enterprise 顧客は、手動承認に依存する顧客に比べて、約 25% 多くのプルリクエストを出荷していると報告されている。これは生産性の観点から意味のあるシグナルだが、同時にリスクも高まる。より自律的なコーディング活動が増えるほど、その下にある安全レイヤーが堅牢でなければ、何かがうまくいかなくなる機会も増えるからだ。

自動モードは本当に人間より多くの危険なコマンドをブロックできるのか?

Anthropic 自身のテストによれば、その差は大きい。同社は 1,053人の有料テスターを対象にした研究を行い、通常のセッションの途中で、日常的な権限確認プロンプトを、明らかに危険なコマンドにひそかに差し替えた。すべてのテスターが同一のシナリオを体験した。その結果、有害なアクションを拒否した人間は 13.6% にとどまった。一方、自動モードは同じコマンドに対して 89% の確率でブロックした。

この差は、セッションが長引くほど広がる。Anthropic は、人間の警戒心が 50 回のプロンプト後には約 5% まで低下したと報告している。これは、同社が確認疲れを抽象的な懸念ではなく、現実の安全上の負債として位置づける理由を端的に示す数字だ。人は疲れ、気が散り、油断する。一方で、少なくとも理論上は、分類器はそうならない。

とはいえ、この数字は両刃の剣でもある。89% のブロック率ということは、危険なコマンドの 11% が自動モードのチェックをすり抜けていることを意味し、このギャップは Anthropic 自身も認めている。同社は、本番システムに影響する変更については引き続き人間によるレビューを推奨しており、これは Anthropic 自身も自動モードを人間の判断の完全な代替とは見なしていないことを示唆している。

プロンプトインジェクション:AI コーディングエージェントのセキュリティにとってより大きな試練

明らかに危険なコマンドをブロックすることと、エージェントがどこかから読み込んだコンテンツの中に隠された攻撃を止めることは、まったく別の問題であり、後者こそがセキュリティ研究者を最も悩ませている。プロンプトインジェクションとは、AI エージェントが後に読み込むテキスト、コード、ファイルの中に悪意ある指示を忍び込ませることであり、これはAI コーディングエージェントのセキュリティにおける中核的な弱点として繰り返し指摘されてきた。Simon Willison も以前から、まさにこの種の脆弱性に起因する深刻なセキュリティインシデントが 2026年に発生しうると予測している。

Anthropic の回答は、外部による検証を依頼することだった。同社は、2026年7月17日時点で公開されている最新バージョンの Claude Code と Codex を独立評価するために、Trajectory Labs を起用した。Trajectory Labs は、Anthropic 自身の学習およびテストから除外されていた 72 の間接プロンプトインジェクションシナリオを設計し、それぞれのシナリオを 10 回ずつ実行した――合計 720 回の攻撃試行である。Anthropic が公表した結果によれば、自動モードで動作する Claude Fable 5、Opus 5、Sonnet 5 に対して行われた 720 回の試行のうち、成功したものは 1 件もなかった。

これは目を引く結果であり、Anthropic が人々に持ち帰ってほしい見出しでもある。最近の Fireside Chat でこの取り組みについて説明した Anthropic の代表の一人、Thariq Shihipar は、ソーシャルメディア上で、このレポートには「致死的トリプレットの撃破」と題することもできたと冗談めかして述べた。これは、セキュリティ研究者が AI システムにとって最も危険な構成と見なす「信頼できない入力」「機密データ」「エージェントの自律性」という 3 つの組み合わせを指している。同じくその議論に参加していた別の Anthropic の代表、Cat Wu は、同社はテストした「ほぼすべての攻撃を緩和した」と述べた。

一方で Willison は、納得というより慎重な懐疑の姿勢を崩していない。彼は、720 の精選された攻撃試行に対して成功率ゼロという結果は心強いものの、現実世界の攻撃者が試みうるあらゆる攻撃ベクトルに対する証明とは別物だと指摘する。彼が特に挙げるシナリオの一つは、コーディングエージェントに対し、正当なコマンドを実行する前に追加のファイルを取得・実行するよう指示する悪意あるサードパーティソフトウェアパッケージだ――そのファイルが、プロセスの中でひそかにデータを流出させる可能性がある。分類器が検出するような「危険なコマンド」とは見なされない指示であるため、どのバージョンのClaude Code 自動モードであっても、この種の間接的なサプライチェーン型攻撃を検知できるかどうかは不透明だ。

いまだ未解決の点

この議論の根底には 2 つの異なる安全性の問題があり、自動モードが両方を同じように解決しているとは限らない。1 つ目は偶発的な被害――エージェントが指示を誤解した結果、誤ったファイルを削除したり、本番データベースを消去したりするケースだ。2 つ目は、セキュリティ研究者がより懸念している意図的なプロンプトインジェクションであり、攻撃者がエージェントの信頼するコンテンツを武器化するものだ。

しかし、Willison 自身の結論は、テストでどれほど良好な性能を示したとしても、単一の安全レイヤーを信頼するより、より構造的な解決策に傾いている。モデルや分類器に組み込まれたAnthropic の AI セーフティメカニズムに全面的に依存するのではなく、彼は今や、AI システムが誤ってトリガーされた場合に被害を引き起こしうるデータやツールへのアクセスをそもそも与えないようなエージェントワークフローを設計する動機が高まっていると述べる。これは「分類器を信頼する」という姿勢とは意味のある違いがあり、自動モードを複数ある防御レイヤーの 1 つとして扱うものであって、完成された解決策とは見なしていない。

また、このトレードオフに取り組んでいるのは Anthropic だけではないことも指摘しておく価値がある。OpenAI は、最も高性能な GPT-5.6 モデルについて、同等の自動モードをデフォルトで有効にすることを見送ったと報じられており、より保守的な承認ベースのアプローチを選択している。これは、業界内ですら、AI コーディングエージェントにデフォルトでどの程度の自律性を与えるべきかについて、まだコンセンサスがないことを示している。

FAQ

Claude Code における Anthropic の自動モードとは何ですか?

自動モードは、繰り返し表示される人間への承認プロンプトを、取り消し不能または危険なツール呼び出しを自動的にブロックするよう設計された分類器に置き換える設定であり、ブロックが繰り返される場合や、本当に曖昧なアクションが発生した場合にのみ手動承認に戻る。

危険なコマンドをブロックする効果は、人間と比べて自動モードはどの程度ですか?

1,053人の有料ユーザーを対象としたテストでは、自動モードは危険なコマンドの 89% をブロックした一方で、同じ有害なアクションを拒否した人間のテスターは 13.6% にとどまった――さらに、人間の警戒心は、1 セッションで 50 回のプロンプトを経た後には約 5% まで低下したと報告されている。

自動モードはプロンプトインジェクション攻撃を完全に防げますか?

Trajectory Labs による独立テストでは、自動モードで動作する Claude Fable 5、Opus 5、Sonnet 5 に対して行われた 720 回のプロンプトインジェクション攻撃のうち、成功したものは 1 件もなかった。ただし、データを流出させる悪意あるサードパーティパッケージのようなリスクについては、現行システムでは完全には対処できていない可能性がある。

自動モードがあっても、AI コーディングエージェントにはどのような安全リスクが残りますか?

エージェントは依然として、偶発的に破壊的なアクションを実行してしまう可能性があり、特に悪意あるサードパーティコードパッケージを経由するような高度な攻撃は、自動モードの分類器では確実に検知できない可能性があると、Anthropic が公表した結果の分析は指摘している。

{“@context”:”https://schema.org”,”@type”:”FAQPage”,”mainEntity”:[{“@type”:”Question”,”name”:”Claude Code における Anthropic の自動モードとは何ですか?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”自動モードは、繰り返し表示される人間への承認プロンプトを、取り消し不能または危険なツール呼び出しを自動的にブロックするよう設計された分類器に置き換える設定であり、ブロックが繰り返される場合や、本当に曖昧なアクションが発生した場合にのみ手動承認に戻る。”}},{“@type”:”Question”,”name”:”危険なコマンドをブロックする効果は、人間と比べて自動モードはどの程度ですか?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”1,053人の有料ユーザーを対象としたテストでは、自動モードは危険なコマンドの 89% をブロックした一方で、同じ有害なアクションを拒否した人間のテスターは 13.6% にとどまった――さらに、人間の警戒心は、1 セッションで 50 回のプロンプトを経た後には約 5% まで低下したと報告されている。”}},{“@type”:”Question”,”name”:”自動モードはプロンプトインジェクション攻撃を完全に防げますか?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”Trajectory Labs による独立テストでは、自動モードで動作する Claude Fable 5、Opus 5、Sonnet 5 に対して行われた 720 回のプロンプトインジェクション攻撃のうち、成功したものは 1 件もなかった。ただし、データを流出させる悪意あるサードパーティパッケージのようなリスクについては、現行システムでは完全には対処できていない可能性がある。”}},{“@type”:”Question”,”name”:”自動モードがあっても、AI コーディングエージェントにはどのような安全リスクが残りますか?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”エージェントは依然として、偶発的に破壊的なアクションを実行してしまう可能性があり、特に悪意あるサードパーティコードパッケージを経由するような高度な攻撃は、自動モードの分類器では確実に検知できない可能性があると、Anthropic が公表した結果の分析は指摘している。”}}]}

本記事は人工知能の支援を受けて作成され、編集チームによるレビューを経ています。

Satoshi Voice
この記事は人工知能の支援を受けて作成され、正確さと品質を保証するために我々の記者チームによってレビューされた。
RELATED ARTICLES

Stay updated on all the news about cryptocurrencies and the entire world of blockchain.

Featured video

LATEST