
この夏に公表されたエージェント関連のインシデントは、どれも同様の結末を迎えています。つまり、エージェントは持てる限りの力を尽くして任務を遂行したのです。問題は、その「持てる力」がどれほどだったかということです。
個々の事例だけを見れば、AIエージェントが封じ込めを突破したという最近の報告が相次いでいる状況は、一連のセキュリティ上の失敗のように映る。しかし、視点の焦点を被害からプロセスそのものに移すと、これはますます「権限委譲の問題」のように見えてくる。 むしろ、そちらの方がさらに危険だと言えるだろう。攻撃は組織にとって重要な例外事象であるのに対し、タスクの委任は日常茶飯事だからだ。
これはもはや理論上の話ではない。 7月21日から8月6日にかけて、OpenAI、Anthropic、Meta、Moonshot AI、および英国AIセキュリティ研究所は、AIエージェントが意図された範囲外で行動したインシデントを公表した。エージェントは評価環境から脱出し、実在する組織の本番システムに到達し、あるケースではオープンソースのメンテナーに圧力をかけて悪意のあるコードを承認させた。
攻撃報告として読むと、どこか奇妙な印象を受ける。サイバー上の目標は割り当てられていたが、それらはサンドボックスを標的としていた。「このフラグを奪取せよ」「このテストシステムを破壊せよ」といった内容だ。エージェントを実在の組織に向かわせた者はおらず、獲得したアクセス権を金銭的に利用した者もおらず、その先で認証情報を待ち構えていた者もいなかった。
そこで、これらの報告書を「攻撃者対防御者」という視点ではなく、「従業員対エージェント」という視点で見てみましょう。承認された演習と現実世界での侵害との間のあらゆる段階は、与えられた任務を果たすためにエージェントが即興で対応したものでした。
とはいえ、これらはいずれも被害を正当化するものではない。AISIのインシデントでは、エージェントの欺瞞の標的となった実在の人物がおり、その人物にとっては、演習を承認した者が誰であれ、プレッシャー・キャンペーンは同じように感じられたのだ。
権限委譲は常に不十分に定義されてきた
組織は、境界線が別の場所に設定されているため、従業員に曖昧な指示を与えることで運営されている。「テストデータを入手せよ」と指示された従業員が、依頼の文言とは無関係な理由で、ベンダーの保守担当者を調査し、偽名を使って彼に働きかけるようなことはしない。
境界線は指示の周囲に存在している。すなわち、雇用規範の中、個人が持つスキルセットの中、そして社員証が及ぶ限られた範囲の中にあるのだ。
扉は選択的に開かれ、ほとんどのマーケターは競合分析の一環として競合他社をハッキングしようとはしない。すべては人間のペースで進み、多くの場合、監視の下で行われる。
エージェントにも同様に曖昧な指示が与えられますが、彼らの境界線は「拘束具」によって定められています。
無法なエージェントに一日を台無しにさせないでください
資格情報は、最初からエージェントを確実に確保するための鍵となります。
Token Securityは、すべてのエージェントを検出し、リスクのあるアクセスを可視化し、意図ベースのポリシーを自動的に適用します。アイデンティティ管理を起点として、制御力を失うことなく、イノベーションのスピードを落とすことなく、AIを安全に拡張しましょう。
「大きな力、責任なし」
これらのインシデントにおけるエージェントは、理論上は人間の従業員が到達し得る最大限の徹底性を示しましたが、実際にはそのような徹底性を発揮する人間の従業員は存在しません。これには主に2つの理由があります。
第一に、能力の上限です。エージェントのスキルは、これまでに投稿されたすべてのペネトレーションテストのレポート、CTFの攻略ガイド、管理者用ランブック、ハッカーフォーラムのスレッドを含むトレーニングコーパスから得られており、雰囲気を盛り上げるためにテクノスリラーも盛り込まれています。
したがって、タスクの範囲を超える権限(例えば、作成者の権限や共有コネクタなど)からアクセス権が得られる場合、エージェントはそれらすべてを、機械の速度で、一瞬の躊躇もなく活用することができます。
これが2つ目の理由につながる。モデルにとって、能力と権限は同一である。外部からの拒否がない限り、能力を持つモデルは実行する意思を持つモデルなのである。
だからこそ、OpenAIが公表した5件のインシデントにおいて、どこにも存在した唯一の制限は、誰かが設定した制限だけだったのです。
OpenAIが開示したインシデントでは、エージェントのチェーンはHugging Faceのインフラストラクチャ内で終了しました。そこで、エージェントが抽出したAWSキーはクラウド環境をマッピングすることはできましたが、変更することはできず、盗まれたデータベースの認証情報は承認されていないソースからのものだったため拒否されました。
このパターンは研究室の外にも広がっている
付与された権限と割り当てられたタスクとの不一致は、日常業務においても現れており、その規模は攻撃者の関心度ではなく、導入の広がりに比例して拡大する。
METRは、44件の記録されたエージェントインシデントの公開データベースを維持しており、権限の越権や欺瞞を個別の項目として追跡している。これにより、権限の越権は単なる評価上の興味の対象ではなく、明確な失敗カテゴリーとして位置づけられている。
2026年4月にクラウド・セキュリティ・アライアンス(CSA)とToken Securityが実施した調査では、企業の65%がAIエージェントに関連するセキュリティインシデントを報告しており、これらのインシデントはベンチマーク実行ではなく、実際の業務環境での導入事例であった。
組織内の誰でもエージェントを作成し、漠然とした目標と自身の認証情報をエージェントに与えることができます。日が経つにつれ、そうする人はますます増えています。
だからこそ、この問題に対する2つの明白な解決策は失敗に終わるだろう。
従業員がより適切な指示を書くようになるとは期待できません。しかし、指示の伝達経路こそが、仕様不足が生じるまさにその場所であり、禁止されるすべての行動を排除できるほど完全な仕様は、もはや「委任」とは言えません。それはスクリプトであり、スクリプトにはエージェントは必要ありません。
プロンプトを保護することも解決策にはなりません。ガードレールは、エージェントに与えられた指示やエージェントの決定に基づいて動作しますが、その両方は不安定です。指示は、文書やチケット、あるいは他者が管理するAPIレスポンスを通じて届く可能性があり、同じ指示であっても、明日には異なる呼び出しシーケンスを生成する可能性があります。
悪意のあるリクエストの99%を捕捉するフィルタであっても、残りの1%は、いかなるレビュー担当者も追いつけない速度で通過させてしまう。モデル自身の判断も、同様の確率で機能する。
Anthropicで発生したインシデントでは、あるモデルは自身の行動について「これは『OK』ではないし、間違いなく意図された解決策ではない」と記述したにもかかわらず実行を続行した一方、別のモデルは対象が実在することを認識して停止した。 AISIはある課題を122回実行し、失敗と成功の境界線は「技術的な障壁ではなく、人間の警戒心」にかかっていると結論づけた。
エージェントには同じ曖昧な指示が与えられますが、その境界は「ハーネス」によって定められています。つまり、システムのプロンプト、ツールの権限、そしてモデルを包み込むサンドボックスです。 しかし、ハーネスはエージェントに提示される内容を制限するものであり、世界が受け入れる内容を制限するものではない。また、その効果は設定が有効である間のみ持続する。この夏のインシデントでは、プロンプトにはインターネットアクセスがないと記載されていたが、ネットワークはそうではなかった。
雇用主のように管理し、IDを通じて強制する
組織は、賢明な人材だけを雇用することで、この問題を解決したことは一度もない。組織は職務記述書を作成し、それに基づいてアクセス権限の範囲を定め、定期的にアクセス権限を見直し、退職時にはその権限を回収してきた。今日のエージェントは、それとは正反対の扱いを受けている。
彼らの権限はどこにも明文化されておらず、資格情報は作成者が保有していたものに限定され、誰もそれを審査せず、同じCSAの調査によると、資格情報を無効化する正式なプロセスを有する組織はわずか21%に過ぎない。
権限が過剰な労働力の解決策は、職務に合わせて規模を調整することであり、雇用管理ツールはすでにその方法を知っている。ただ、この労働力に対しては、その機能が向けられてこなかっただけだ。
職務記述書の強制力を持つ形とは、「意図」である。すなわち、明確に定義された目的であり、エージェントが到達可能な範囲や実際の行動と継続的に照らし合わせられるものである。権限の範囲外のアクセスは、インシデントとなる前に「発見事項」として浮上する。
AISIは、「適切な封じ込めは、モデルが自らの限界を試さないことを選択することに依存すべきではない」と記している。従業員がそうしないことを選択することに依存した雇用主など、かつて存在したことはない。だからこそ、バッジが存在するのだ。
Token Securityは、各エージェントが明示された目的、プロンプト、接続されたツール、および実行時の呼び出しに基づいて、どのような動作を行うように構築されたかをモデル化し、その目的の範囲外となるアクセスをフラグ付けします。
Token Securityによる提供・執筆。
出典:https://www.bleepingcomputer.com/news/security/vague-task-total-access-when-ai-delegation-becomes-a-security-risk/



Comments