Skip to content

「中身は確認しない」主要コーディングAIの盲点と、監視を買って出たAI企業

AIコーディングツール4種を襲ったゼロクリック脆弱性Plugin4Shellが発覚する一方、AnthropicはAccentureと2000億円規模で外部評価者を社内に迎え、米中はAIの危険信号を通知し合う仕組みを検討し始めた。

今週は、AIを「作る側」への信頼をどう担保するかが焦点になった。開発を助けるツール自体に潜んでいた盲点、AI企業自身が外部の目を社内に招き入れる決断、そして対立する大国同士がAIのリスクについて情報を交わし始めた動き。派手なモデル発表よりも、AIという技術をどう制御可能な状態に保つかという地味だが本質的な課題が前面に出た一週間だった。

「認証は通ったのに中身が違う」――主要AIコーディングツールを襲ったゼロクリック攻撃

セキュリティ企業AIRは9月17日、Claude Code、OpenAIのCodex、GitHub Copilot、GoogleのGemini CLIという主要な4つのAIコーディングエージェント(AIがコードを書く作業を助けるツール)すべてに共通する深刻な脆弱性「Plugin4Shell」を公表した。攻撃者の操作なしに任意のコードを実行できてしまう「ゼロクリックRCE(遠隔コード実行)」に分類される、危険度の高い欠陥だ。

原因は、拡張機能(プラグイン)の検証方法にあった。これらのツールは、プラグインを配布するマーケットプレイスが指定した特定のバージョン(コミットのハッシュ値、SHA値と呼ばれる識別子)をそのまま取得する仕組みを持つ。しかし、実際に取得したファイルの中身が、その識別子が示すはずの内容と一致しているかまでは確認していなかった。「正しい住所は控えているが、届いた荷物の中身は開けて確認しない」ような検証漏れだ。プラグインの保管場所を後から書き換えられる立場の攻撃者であれば、検証をすり抜けて悪意あるコードを送り込める。

さらに厄介なのは、Claude CodeとCodexがプラグインをバックグラウンドで自動更新する仕様になっていたことだ。利用者が新しいプラグインを入れる操作をしなくても、すでに信頼して使っている正規のプラグインが、ある日突然中身だけ差し替えられる恐れがある。プラグインは開発者本人と同じ権限で動くため、ソースコードやクラウドの認証情報、SSHキー、社内システムへのアクセス権までまとめて奪われかねない。

対応状況はツールごとに分かれた。AnthropicはClaude Codeをバージョン2.1.179で修正し、OpenAIもCodexをバージョン0.146.0で修正した。一方Googleは、Gemini CLI自体を修正せず、後継ツール「Antigravity」への移行を促す方針を取った。Microsoftは公表時点でGitHub Copilotの修正版を出していない。

実務上の示唆

  • AIコーディングツールを使うチームは、Claude CodeとCodexを直ちに最新版へ更新し、Copilotの修正状況を継続的に確認する
  • プラグインの「自動更新」機能は便利さと引き換えにリスクを運ぶ。業務利用では自動更新を無効化し、更新内容を確認してから反映する運用を検討する
  • 「識別子は正しいが中身は検証していない」という盲点は他のツールにも起こりうる。社内で使う外部連携ツール全般の検証方式を点検する材料にする

AI企業が「社内に外部の監視役」を迎え入れる――AnthropicとAccentureの2000億円規模の提携

Anthropicは9月18日、コンサルティング大手Accentureの専門AI部門「Faculty」を、自社初の「組み込み型評価者(embedded evaluator)」として迎えると発表した。両社はそれぞれ最低10億ドル(約1500億円)、合計で2000億円規模を5年間かけて投じ、Anthropicの社内でモデルの評価やレッドチーミング(あえて攻撃者の視点で弱点を探す手法)、安全対策の検証を行う専門チームを作る。

これまでの外部評価は、完成したモデルを外から検査する形が中心だった。今回の枠組みが異なるのは、Faculty所属の評価者が社員とほぼ同等のアクセス権を持ち、開発の初期段階からAnthropicの建物の中で継続的にモデルを見続ける点だ。この提携は非独占的で、AnthropicはMETR(AIの挙動を外部検証する非営利組織)など他の団体とも、それぞれの資金で同様の試みを進めているという。

背景には、AnthropicのCEOダリオ・アモデイ氏が先に示した「フロンティアのペースを落とすべきだ」という3段階の提言がある。組み込み型評価者の導入は、その提言の最初の一歩として位置づけられている。開発企業自身が「監視される側」に回る仕組みを、身銭を切って作った格好だ。

実務上の示唆

  • 外部評価者を「社内に置く」という発想は、今後他のAI企業や、AIを大規模導入する事業会社のガバナンス設計にも波及しうる
  • 自社がAIベンダーを選定する際、モデルの性能だけでなく「誰が、どの深さで検証しているか」を選定基準に加える視点が持てる
  • コンサルティング企業がAI安全性の実務を担う流れは、AI監査・評価という新しい専門職種の市場が育ちつつあることを示している

対立する米中が、AIの「危険信号」を教え合う仕組みを検討し始めた

米財務長官スコット・ベセント氏と中国の何立峰・副首相は9月20日、ニューヨークでの会談を終え、AIの安全性に関する「通知メカニズム(notification mechanism)」の創設を提案したことを明らかにした。今週後半にワシントンで予定されるトランプ大統領と習近平国家主席の首脳会談に向けた地ならしの一環だ。

提案の柱は、国家安全保障に関わるレベルのAI関連インシデント(事故・事件)が起きた際に、米中両国が互いに通知し合う仕組みを作ることだ。あわせて、両国間で新たな「AI対話」の枠組みを立ち上げることも話し合われたという。ベセント氏は「国境をまたぐあらゆる活動と同じように、世界一位と二位のAI大国の間で、不透明さから透明性へと移行することはとても重要だ」と述べた。

米中は貿易や半導体輸出規制などをめぐって対立してきた関係にある。その両国が、AIという競争分野において情報共有の枠組みを話し合うのは異例だ。ただし、これはまだ提案段階であり、具体的にどのインシデントが「通知の対象」になるのか、実効性をどう担保するのかといった詳細は今後の首脳会談以降に持ち越される。

実務上の示唆

  • 米中間でAIの安全性に関する情報共有が制度化されれば、両国で事業を展開する企業のコンプライアンス対応にも影響しうるため、首脳会談後の進展を注視する
  • 「通知メカニズム」はまだ骨組み段階で、実効性は不透明だ。合意内容を過大評価せず、正式な枠組み文書が出るまでは様子見が妥当
  • 地政学的な対立関係にあっても、AIのリスク管理という分野では協調の余地があるという構図は、他分野の国際協調のモデルケースになる可能性がある

まとめ

今週の3つの出来事は、いずれも「誰がAIを見張るのか」という一つの問いに収斂する。開発ツールの検証漏れは、便利な自動化の裏にある盲点を突きつけた。Anthropicが外部評価者を社内に招き入れた決断は、企業が自らの手で監視の目を増やす動きだ。そして対立する米中がAIの危険信号を共有する仕組みを話し合い始めたことは、競争関係にあっても最低限のリスク管理では手を組む必要があるという認識の表れだろう。AIの性能が上がるほど、それを制御し、検証し、報告する仕組みの整備が追いつくかどうかが問われている。

参照元: Plugin4Shell Zero-Click RCE Hits Claude Code, Codex, Copilot and Gemini CLI (Cyber Security News)Zero-click RCE vulnerability hit four major AI coding agents (Help Net Security)Plugin4Shell (AIR Security)Partnering with Accenture on embedded evaluation (Anthropic)Anthropic’s first embedded evaluator is … Accenture? (TechCrunch)Anthropic selects Accenture as first embedded evaluator (CNBC)Bessent proposes AI safety notifications in talks with China ahead of Xi-Trump meeting (CNN)U.S. proposes exchanging AI safety alerts with China, Bessent says (NBC News)