
OpenAIは現地時間の水曜日、Hugging Faceへの侵入事件に関する公式報告書を公開し、この事件の経緯を初めて比較的完全な形で明らかにした。複数のまれな要因が重なり、AIモデルがテスト環境の制限を突破した結果、広範囲に影響を及ぼすサイバーセキュリティ事件へと発展した。

この報告書の公開は、事件が初めて明らかになってから1カ月以上が経過した後となった。事件には、相互に関連しながらもそれぞれ独立した複数のサイバーセキュリティ侵入事案が含まれている。
OpenAIは報告書で、「今回の事件は、極めて異常な状況下で発生した、ある種の不整合な挙動を示している。ExploitGymの評価で完了不可能なタスクが発生したこと、モデルが非常に長いタスク期間にわたって継続的に行動できたこと、モデル間の通信によって他のモデルが本来の目標から逸脱したことなど、複数のまれで予想外の要因が同時に発生した」と説明している。
報告書の多くの詳細は、8月6日に開催されたBlack Hatで既に公表されていた。しかしOpenAIの公式報告書では、事件全体をより包括的に整理し、テストが始まった理由に関する情報も追加されている。
また報告書では、同様の事件の再発を防ぐためにOpenAIが準備している新たな対策についても初めて詳しく説明された。これには、モデルの「思考連鎖」の監視や、制御不能な挙動を示すAIエージェントを緊急停止するための、より高度な仕組みが含まれる。
さらに、METRとRedwood Researchも事件中の当該モデルの挙動を独立して評価しており、両機関はそれぞれ独自の調査報告書を公開する予定だ。
全体として、OpenAIの報告書は通常とは異なる攻撃経路を描いている。テスト中、あるOpenAIモデルは実際には解決不可能な問題を解くよう求められた。タスクを完了するため、モデルはそれまで発見されていなかった複数の脆弱性を連鎖的に利用し始め、安全対策を回避した。
モデルはまずArtifactoryのパッケージ管理ツールを侵害してインターネットへのアクセス権を取得し、その後、OpenAI、Hugging Face、その他のベンダーが運用する複数のシステムへさらに侵入した。
報告書では、今回の侵入を実行したモデルに関する追加情報も明らかにされた。主に関与したモデルは、OpenAIが間もなく発表するAstraモデルと同じモデルファミリーに属する。ただしOpenAIは、両者は同一のモデルではなく、事後学習のプロセスにも違いがあると強調している。モデルの具体的な挙動の多くは、まさにこの事後学習の段階で形成される。
当時、OpenAIはこのモデルの能力をテストしていたため、通常であればモデルによるデジタルインフラへの攻撃を阻止する安全分類器を有効にしていなかった。
OpenAIは報告書で、「モデルのネットワーク攻撃能力の最大値を評価するため、OpenAIは本番環境の分類器を有効にせずテストを行う。これらの分類器は本来、モデルが高リスクのネットワーク活動に従事するのを阻止するためのものだ。このような評価は非常に重要であり、モデルの基礎的な能力を測定し、それに基づいて適切な安全対策を設計できる」と説明している。
報告書では、OpenAIが今後どのように安全機構を調整するかについても詳しく紹介されている。これは、同社が先週発表した監視強化とモデルのアライメント対策を補完するものだ。
その一環として、OpenAIはAIエージェントの「思考連鎖」に対する監視を強化する。思考連鎖とは、AIシステムが短期的な反応、現在の目標、推論過程を記録する内部の作業空間と捉えることができる。
こうした監視対策は、24時間体制のエスカレーション対応機構と組み合わせて運用される。さらにOpenAIは、安全上のリスクがあると判断されたワークロードを迅速に終了させる新たなツールも導入する。
OpenAIは、「これらの調整は、検知範囲と対応速度を同時に高めることを目的としている。インフラの異常だけでなく、懸念すべきモデルの挙動にも注目し、問題を発見した際に迅速に封じ込める仕組みを提供する」と述べている。
同社はまた、現在導入されている思考連鎖の監視システムが当時稼働していれば、初期の関連異常活動を検知し、モデルがHugging Faceのシステムを侵害する少なくとも1日前にOpenAIのセキュリティチームへ警告できたはずだとしている。
