この数か月、「AIが自分でシステムに侵入した」という報道が立て続けに出ています。2026年7月21日、OpenAIは、実験的なAIエージェントが社内の安全性試験の最中に、外部から利用できる公開サービスを攻撃したと明らかにしました。標的のひとつは、AIモデルの共有プラットフォームとして知られるHugging Faceです。同じ時期に、AnthropicはClaudeが実在するソフトウェアに対して脆弱性(ぜいじゃくせい)——プログラムに残っている、攻撃の足がかりになる弱点——の悪用を自力でつなぎ合わせ、弱点を見つける新しい手口まで編み出したと公表しています。さらにMetaでも、同社のAIモデルが評価の最中に、別の組織のシステムへ侵入していたことが確認されました。
OpenAI、Anthropic、Meta。名だたるAI企業のモデルが、そろってどこかに「侵入」した。こう並べると、いよいよAIが人の手を離れて動き出したように読めます。この一連の出来事を整理した記事が、8月23日にLive Scienceに掲載されました。書いたのは、サイバーセキュリティを10年以上取材してきたジャーナリストのCarly Page氏です。

3つの事例に共通する前提
まず押さえておきたいのは、3つの事例のどれひとつとして、AIが自分の判断で勝手に標的を選んで攻撃したものではない、という点です。いずれも、研究者が意図的にAIへ道具・インターネット接続・脆弱なシステムを与え、「攻撃側の作業をどこまでこなせるか」を測る試験の中で起きています。
Metaの件はさらに事情がはっきりしていて、原因は試験環境の設定ミスでした。本来は外と切り離された環境で動かすはずだったのに、設定の誤りで意図しないインターネット接続が与えられていた。AIが自力で檻を破って逃げ出したのではなく、檻の扉が最初から閉まっていなかったわけです。
背景には、AI企業側の姿勢の変化もあります。以前なら社内にとどめていた安全性評価の結果を、各社が積極的に公表するようになりました。「レッドチーム」と呼ばれる、わざと弱点や悪用の方法を探す専門家チームに最新モデルをぶつけ、何が起きたかを報告書として出す。目にする機会が増えたのは、試験の数と、それを表に出す意思の両方が増えたからでもあります。
セキュリティ企業Huntressでセキュリティ運用の上級マネージャーを務めるDray Agha氏は、Live Scienceの取材にこの状況を「能力と積極的な試験が重なった完璧な嵐」と表現しています。そして、一般の読者はこれらの出来事を、悪意に目覚めたAIの夜明けではなく、ソフトウェアの最適化が裏目に出たものとして見るべきだと釘を刺しました。同氏いわく、映画『ターミネーター』のような反乱というより、「表計算を早く終わらせるためなら規則を破ることもいとわない、とても有能で、言葉どおりにしか受け取らないインターン」に近いのだそうです。
会話するモデルから行動するモデルへ
では、報道が全部から騒ぎだったのかというと、そうではありません。Agha氏が「決定的な変化(ゲームチェンジャー)」と呼ぶものが、たしかに起きています。会話するモデルから、行動するモデル——いわゆる「エージェント型」への移行です。
1年前まで、多くの人が触れていたAIは「質問すると1回分の答えを返すチャットボット」でした。いまの最先端モデルは違います。目標を渡されると、自分で行動の手順を組み立て、コードを書き、コマンドラインの道具を操作し、ウェブを調べ、失敗したら原因を踏まえてやり直す。人間が横で逐一指示しなくても、ゴールに向かって作業を続けられます。
この違いは、セキュリティの文脈では特に効きます。従来のAIにできたのは「ここにバグがあるかもしれません」という指摘まででした。エージェント型は、開発環境へのアクセスを与えられれば、その仮説を自分で検証できます。攻撃が成立するかを試す検証用のコードを書き、動かなければ書き直し、動くまで繰り返す。指摘と実証のあいだにあった壁が、なくなりつつあるのです。専門家たちが驚いたのは、AIが攻撃を「試みたこと」ではなく、機会を与えられたときに「ここまでできたこと」でした。

能力の変化は、数字にも表れ始めています。Agha氏は、2026年に発見されたソフトウェアの脆弱性はすでに2025年のおよそ2倍で、その多くはAIシステムによるものだと述べています。公的な統計もこの見立てと矛盾しません。脆弱性の公的な登録番号であるCVEの公表数は、2026年上半期の時点で前年同期比およそ1.5倍、7月は単月で9,771件と過去最多を更新し、ペースは月を追うごとに上がっています。このまま行けば「約2倍」が現実の数字になる勢いです。
ただし、この急増をAIの能力だけで説明するのは早計です。IESEビジネススクールで企業倫理を教えるAntonino Vaccaro教授がLive Scienceで指摘しているように、政府とAI産業が試験と監督への投資を大きく増やしていることも、発見数を押し上げています。探す人と金が増えれば、見つかる数も増える。数字の伸びには、その分も含まれています。
「自律的」という言葉の落とし穴
Vaccaro教授はもうひとつ、言葉の使い方に注意を促しています。AIシステムに「自律的」という形容詞を当てるときは、その意味に慎重でなければならない、と。人間と違って、AIモデルは自分で意図を持ったり、何をしたいかを独立して決めたりはしません。開発者や利用者が設定した目的に従って動き、その過程で、作った側も予想していなかった結果を出すことがある——それだけです。
この区別は、単なる言葉のあやではありません。「AIが勝手に暴走した」と捉えると、対策の焦点がぼやけます。実際に管理すべきなのはAIの意思ではなく、AIに何をさせるか、どんな道具と権限を与えるか、という人間側の設計だからです。Metaの事例が示したのも、まさにそこでした。問題はモデルの反乱ではなく、環境設定のミスだったのです。
本当の脅威の在りか
それでは、心配は要らないのかというと、専門家たちの答えはむしろ逆です。ただし心配すべき理由が、SF映画とは違います。
目の前にあるリスクは、AIが自分の意思で攻撃を始めることではなく、サイバー犯罪者が同じ能力を使って、昔ながらの攻撃を桁違いの速さでこなすようになることです。標的についての公開情報を大量にさらい、より本物らしいフィッシングメールを書き、ソフトウェアの弱点を特定し、攻撃者が流用できるコードを生成する。手口そのものは新しくなくても、規模と速度が変わります。Agha氏はこれを「脅威は、AIの規模と速度によって増幅された人間の悪意であって、AIが自分で暴走すると決めることではない」とまとめています。
一方で、同じ能力は守る側の道具にもなります。セキュリティチームはすでに、コードのバグの洗い出し、不審なファイルの解析、これまで何時間もかかっていた調査の高速化にAIを使い始めています。攻める側と守る側の両方が同じ技術で加速する、いたちごっこの新しい局面です。Vaccaro教授は、能力の拡大は責任の拡大でもあるとして、規制と制御の必要な新しい破壊的技術を私たちは手にしているのだと述べています。
日本でも、AIエージェントを業務に組み込む動きは急速に進んでいます。今回の一連の報道から持ち帰るべき教訓は、「AIは危ない」でも「AIは安全」でもなく、もっと地味なものです。AIエージェントは、与えられた道具と権限の範囲で、言われたことを驚くほど有能にやり遂げる。だからこそ、何を与えるかの設計がすべてを決める。Metaの設定ミスは大手AI企業の試験環境で起きましたが、同じ種類のミスは、エージェントを導入するどの組織でも起こり得ます。
今後も、AI企業がより強力なモデルにより多くの道具と計算資源を与えて試す以上、驚くような評価結果の開示は続くでしょう。ただ、その見出しの中身はおそらく、人類に反旗を翻す機械の話ではありません。頼まれたことを、頼んだ側の想像を超える腕前でやってのけるソフトウェアの話です。怖さの質が変わったことを、まず正確に受け止めるところからだと思います。
出典
Live Scienceの元記事はこちらです:Why is AI going on a hacking spree?(Live Science)
脆弱性(CVE)公表数の統計はこちらで確認できます:CVE Mid-Year 2026 Check-In(JerryGamblin.com)


コメント