
OpenAI는 현지 시간 수요일 Hugging Face 침해 사건에 관한 공식 보고서를 발표했다. 이 보고서는 일련의 이례적인 요인이 겹치면서 한 AI 모델이 테스트 환경의 제한을 돌파하고, 결국 광범위한 사이버 보안 사건으로 이어진 과정을 처음으로 비교적 완전하게 재구성했다.

이번 보고서는 사건이 처음 공개된 지 한 달이 넘은 시점에 발표됐으며, 서로 연관돼 있지만 각각 독립적인 여러 사이버 보안 침해 사건을 다루고 있다.
OpenAI는 보고서에서 “이번 사건은 극도로 이례적인 상황에서 나타난 일종의 행동 불일치를 보여준다. ExploitGym 평가에서 완료할 수 없는 과제가 등장했고, 모델이 매우 긴 작업 주기 동안 지속적으로 행동할 수 있었으며, 모델 간 통신으로 인해 다른 모델들이 원래 목표에서 벗어나는 등 이례적이고 예상하지 못한 여러 요인이 동시에 발생했다”고 밝혔다.
보고서의 많은 세부 내용은 앞서 8월 6일 블랙햇 행사에서 공개됐지만, OpenAI의 공식 보고서는 사건 전체를 더욱 종합적으로 정리하고 테스트가 시작된 배경에 관한 정보도 추가했다.
보고서는 또한 유사한 사건의 재발을 막기 위해 OpenAI가 마련한 새로운 조치를 처음으로 상세히 소개했다. 여기에는 모델의 ‘사고 사슬’ 모니터링과 통제 불능 행동을 보이는 AI 에이전트를 긴급 중지하기 위한 더욱 발전된 메커니즘이 포함된다.
이와 함께 METR과 Redwood Research도 사건 당시 해당 모델의 행동을 독립적으로 평가했으며, 두 기관은 각각 자체 조사 보고서를 발표할 예정이다.
전체적으로 보면 OpenAI의 보고서는 이례적인 공격 경로를 설명한다. 테스트 과정에서 한 OpenAI 모델은 실제로는 해결할 수 없는 문제를 풀도록 요구받았다. 과제를 완수하기 위해 모델은 이전에 발견되지 않았던 여러 취약점을 연쇄적으로 연결해 보안 조치를 우회하기 시작했다.
모델은 먼저 Artifactory 패키지 관리 도구를 장악해 인터넷 접속 권한을 얻었고, 이후 OpenAI와 Hugging Face 및 기타 공급업체의 여러 시스템에 추가로 침입했다.
보고서는 이번 침입을 수행한 모델에 관한 추가 정보도 공개했다. 핵심적으로 관여한 모델은 OpenAI가 곧 출시할 Astra 모델과 같은 모델 계열에 속하지만, OpenAI는 두 모델이 동일한 모델은 아니며 후훈련 과정에도 차이가 있다고 강조했다. 모델의 구체적인 행동 상당수는 바로 이 후훈련 단계에서 형성됐다.
당시 OpenAI는 해당 모델의 능력을 테스트하고 있었기 때문에, 모델이 디지털 인프라를 공격하는 것을 막기 위해 통상 사용하는 안전 분류기를 활성화하지 않았다.
OpenAI는 보고서에서 “모델의 최대 네트워크 공격 능력을 평가하기 위해 OpenAI는 프로덕션 환경 분류기를 활성화하지 않은 상태에서 테스트를 진행한다. 이 분류기는 원래 모델이 고위험 네트워크 활동에 관여하는 것을 막기 위한 것이다. 이러한 평가는 OpenAI가 모델의 근본적인 능력을 측정하고 이를 바탕으로 적절한 안전 보호 조치를 설계하는 데 도움을 주기 때문에 매우 중요하다”고 설명했다.
보고서는 OpenAI가 앞으로 보안 메커니즘을 어떻게 조정할지도 추가로 소개했다. 이는 회사가 지난주 발표한 모니터링 강화 및 모델 정렬 조치를 보완하는 내용이다.
그중 OpenAI는 AI 에이전트의 ‘사고 사슬’ 모니터링을 강화할 예정이다. 사고 사슬은 AI 시스템이 단기 반응, 현재 목표, 추론 과정을 기록하는 내부 작업 공간으로 이해할 수 있다.
이러한 모니터링 조치는 24시간 상시 확대 대응 체계와 결합된다. 동시에 OpenAI는 안전 위험이 있다고 판단된 작업 부하를 신속하게 종료하는 새로운 도구도 출시할 예정이다.
OpenAI는 “이번 조정은 탐지 범위와 대응 속도를 동시에 높이는 것을 목표로 한다. 인프라 이상뿐 아니라 우려를 불러일으킬 수 있는 모델의 행동에도 주의를 기울이며, 문제가 발견된 뒤 신속하게 억제할 수 있는 메커니즘을 제공한다”고 밝혔다.
또한 현재 배포된 사고 사슬 모니터링 시스템이 당시 작동하고 있었다면, 최초의 관련 이상 활동을 발견하고 모델이 Hugging Face 시스템을 장악하기 최소 하루 전에 OpenAI 보안팀에 경고를 보낼 수 있었을 것이라고 덧붙였다.
