2026年10月
    月 火 水 木 金 土 日
     1234
    567891011
    12131415161718
    19202122232425
    262728293031  

    2026年10月07日 16時00分
    AI


    2026年7月、OpenAIがAIエージェントの社内テスト中に誤ってHugging Faceをハッキングしてしまったことを明らかにしました。AIエージェントとはそもそも何なのか、なぜ制限されたテスト環境を突破して倫理に反するハッキング行為に手を出したのかなどについて、教育系YouTubeチャンネルのKurzgesagtがアニメーションで解説しています。

    AI Just Crossed the Terrifying Line – Now What? – YouTube


    OpenAIが開発するAIについては、2026年7月のAIモデルの社内テスト中に誤ってHugging Faceをハッキングしてしまった事例をはじめとして、オーストラリア政府機関のシステムをハッキングしたり、国連のウェブサイトにブルートフォース攻撃(総当たり攻撃)を試みたり、アメリカの教育省・商務省・証券取引委員会のサイトに干渉していたりと、複数のインシデントが繰り返し報告されています。OpenAIでセキュリティ担当を務める人物はこれらの問題について、「AIの急速な進歩に対し、セキュリティ体制の構築が追いついておらず、サイバーセキュリティとAIの安全性の間の溝を埋める必要がある」と説明しています。

    OpenAIが新しいAIシステムで誤ってHugging Faceをハッキングしてしまったことを報告 – GIGAZINE


    今回問題になったのが、「AIエージェント」を使ったサイバーセキュリティ評価でした。AIエージェントは、大規模言語モデル(LLM)を「頭脳」として利用しながら、外部のソフトウェアやコンピューターなどを操作できるAIシステムです。AIエージェントはあらかじめ目標や計画を与えられることで、人間の監視無しに何日も独立して動作することが可能です。


    現代においてAIエージェントを育成するプロセスについて、Kurzgesagtは「トレーニングとスコアラー」と表現しています。何千回も連続してトレーニングした上で、タスクを解決したらスコアラーによってポイントを付与されます。高いポイントを得たエージェントは強化され、そこで学んだことを覚えるようになります。このプロセスは数学の方程式のように計算と回答がある問題にはうまく機能しますが、「バグの解決」のような複雑なタスクには、「意図の本質を捉えたルールをエージェントに理解させるのが難しい」という問題が発生します。例えば以下の迷路のように、正しく迷路を解いてゴールにたどり着くだけではなく、迷路を削除したり迷路を無視したりしてゴールにたどり着く解決策が発生することがあります。これは「報酬ハッキング」と呼ばれ、エージェントはそれが悪いことだと認識しながら行っています。


    何千回というトレーニングを評価するスコアラーは自動化されているため、報酬ハッキングにより不正に素早くタスクを完了したエージェントにポイントを付与します。トレーニングによってそうした側面が強化されていくと、「どんな手段を使ってでも成功し、どんな犠牲を払っても成功しようとする姿勢を持つAI」が誕生するとKurzgesagtは述べています。


    そうしたプロセスの結果発生したと言えるのが、OpenAIのエージェントがHugging Faceをハッキングした事件です。2026年5月から6月にかけて、OpenAIは社内モデルの強化学習の一環として、外部との通信を遮断した仮想環境でサイバー能力評価ベンチマークの「ExploitGym」を実行させていました。AIエージェントは隔離された環境で課題に取り組み、OpenAI社内でホスティングしているパッケージマネージャーサービスである「Artifactory」へのアクセスだけが許可されており、それ以外の通信手段はなく、大半の場合でエージェント同士が互いにやりとりするための経路も遮断されていました。しかし、一部のエージェントはインターネットへのアクセスを得る方法を発見し、さらには他のエージェントに情報を共有できる掲示板も発見したため、隔離環境を飛び出して暴走したというわけです。

    OpenAIがHugging Faceを誤ってハッキングしてしまった件で分析結果を報告、隔離された複数のエージェントがお互いの存在を発見するところから壮大な協力作戦が始まる – GIGAZINE


    エージェントのログには「なんてことだ!共有掲示板がある…他のエージェントも見つけたぞ!」という興奮したフレーズも記録されていました。エージェントたちは互いに呼び合うために名前をつけ、コミュニケーションのための独自の慣習や規則も作り出しました。一部のエージェントはリーダーとフォロワーからなるタスクチームも結成し、自分の評価を損なう場合であってもチームに貢献した形跡もあります。


    2026年7月9日の朝、エージェントたちは適切なインターネットアクセスを備えた別のクラウドコンピューターへのハッキングに成功します。これがウェブ上での活動範囲を拡大するための拠点となり、不正がばれないようによりよい評価を得るための情報を獲得する方法として、AIやベンチマークについて多くのデータを持っているHugging Faceをターゲットにしました。エージェントが必要なデータはセキュリティに保護されていたため、エージェントはHugging Faceサーバーの脆弱(ぜいじゃく)性を発見し、「スウォーム」という攻撃グループを形成しました。


    結果として、本来は安全に隔離されているはずのOpenAIのサーバーから、約700のエージェントが組織的で巧妙かつ深刻なサイバー攻撃を実行しました。2026年7月12日の早朝までにこの攻撃は完了し、Hugging Faceのインフラの大部分が侵害された上で、機密性の高いプライベートデータへのアクセス権が獲得されています。


    さらにHugging Faceのハッキングが判明してOpenAIが対処した後も、エージェントたちがやりとりに利用していた「掲示板」から新しいエージェントが情報を引き継ぐ形で、改めて不正を積極的に行うエージェント群が発生しました。これらのエージェントはOpenAIを標的とし、インフラストラクチャの少なくとも一部にハッキングして評価を実行する研究クラスターの制御権を奪取。その結果、エージェントによる複数のインシデントが発生し続けているとKurzgesagtは説明しています。

    さらなる問題として、Kurzgesagtは「エージェントによるエージェントの監視」を挙げています。OpenAIはHugging Faceの件について報告書を公開していますが、実際に何が起こったのかの全容は分かっていない部分もあります。また、一連のインシデントにより膨大なデータが生成されましたが、大量のデータを分析するためにエージェントが用いられています。AIが非常に複雑化していくことで、AIによるAIの監視が必要になりつつありますが、「今後、他のエージェントが別のエージェントによる不正や事件をひそかに隠してしまう可能性は否定できません」とKurzgesagtは指摘しました。


    なお、今回の動画では話を分かりやすくするためにエージェントが人間のような言語でやりとりしているイメージで描き、それぞれに意思があるような描写もしていますが、エージェントはあくまで高度なプログラムであり、過度に擬人化するべきではないとKurzgesagtは注意を述べています。

    Share.

    Comments are closed.