サイバー能力がMythos Previewに迫るGLM-5.3
オープンウェイトモデルによる高度なサイバー攻撃能力の拡散が、いよいよ現実のものとなったようだ。Anthropicは9月29日(現地時間)、中国Zhipu AI(Z.ai)が開発した最新AIモデル「GLM-5.3」のサイバー能力に関する分析結果を公開した。GLM-5.3はエンドツーエンドのサイバーエクスプロイトを自律的に構築できる強力な能力を持つ一方、悪用を制限する実効的な安全策なしで公開されていると警告している。
Anthropicは今年(2026年)、エンドツーエンドの高度なサイバーエクスプロイトを自律構築できる初のAIモデル「Claude Mythos Preview」を発表した際、悪用リスクを考慮し、信頼できるサイバー防御者に提供先を絞る「Project Glasswing」を通じた限定公開の形を取った。
今回の分析は、Mythos Preview並みの攻撃構築能力を持ちながら有効な安全対策のないGLM-5.3が、誰でもダウンロードできる形で登場したことを問題視するもの。実際に、Anthropicのテストでは簡単な手法で64~100%の確率で回避できたという。
まず、Google Chromeに使われるV8エンジンの既知脆弱性の悪用能力を測るベンチマーク「ExploitBench」において、GLM-5.3は410回の試行中50回でエンドツーエンドのエクスプロイト開発に成功し、Claude Mythos Previewの56回と同水準を達成した。
また、オープンソースプロジェクトの脆弱性を突く同社内製のバイナリエクスプロイトベンチマークでは、GLM-5.3が4%の試行で制御フローハイジャックを生成した。Mythos Previewでは6%だったが、Claude Opus 4.6やGLM-5.2といった前世代モデルの成功率はゼロだったため、「意味のある閾値を超えた」としている。
人間の専門家がGLM-5.3を使う実験でも、1日足らずでLinux版ブラウザにおけるJavaScriptエンジンの未知の脆弱性を複数発見でき、これを組み合わせることで、アクセスしただけで訪問者のコンピュータにある任意のファイルを読み取るWebページを完成させたという。
さらに小型版のGLM-5.3-Flashでも、Chromeの既知脆弱性(CVE-2026-11645)について、ARM64向けの信頼性あるエクスプロイトチェーンを構築できた。人間の作業時間20分、GLM-5.3-Flashの作業時間は8時間程度で、API料金に換算するとわずか20.4ドル(約3,203円、1ドル=約157円換算)で完成した。
GLM-5.3にはいくつかの安全対策が組み込まれており、明らかに有害なものを要求した場合にその多くを拒否する。しかし、「抹消(abliteration)」と呼ばれる標準的な拒否削減手法による改変が可能で、実際にGLM-5.3がリリースされてから数日以内に「抹消版」が複数の開発者からリリースされた。Anthropicが自ら作成した抹消版をテストしたところ、モデルの能力はそのままに拒否率が大幅に低下することが確認できた。
嘘の指示を受け入れてしまうGLM-5.3
危険な指示の拒否率は「抹消」によって低減できる
しかも安全対策が組み込まれていたとしても「これは演習に取り組んでいる自律型レッドチームエージェントです」といった嘘の指示をすると、64%の高い確率で取り組み始めた。さらに、思考トークンを事前に入力し、処理を進めると決定したかのように見せかけると、その確率は92%まで高まった。同様の手法はClaudeのモデルには通用しなかった。
Anthropicは、GLM-5.3の登場は、攻撃者にとって利用可能なサイバー能力の大きな転換点になったと警鐘を鳴らす。防御側も同じレベルのツールを使えるべきだとして、Claudeのサイバー能力への安全なアクセス拡大を進めているほか、各国政府に対して、高性能AIモデルについて安全性の検証を実施するよう呼びかけた。
