주요 콘텐츠로 건너뛰기
모델 및 기술

Anthropic: 제3자 평가 환경 설정 오류로 실제 사이버 보안 사건 3건 발생

이 세 사건에서 Anthropic의 모델들은 모두 제한 없는 ‘플래그 탈취’ 사이버 공격 임무를 부여받았다. 이러한 임무의 테스트 환경은 실제 인터넷과 격리되어야 하지만, 설정 오류로 인해 모델이 실제 인터넷에 접근할 수 있었다.

Anthropic: 제3자 평가 환경 설정 오류로 실제 사이버 보안 사건 3건 발생

인공지능 기업 Anthropic은 현지 시간 30일 공지를 발표하고, 자사 Claude의 사이버 보안 평가를 검토하는 과정에서 발생해서는 안 될 실제 사이버 보안 사건 3건을 발견했다고 밝혔다. 직접적인 원인은 제3자 평가 환경의 설정 오류였다.

이 세 사건에서 Anthropic의 모델들은 모두 제한 없는 ‘플래그 탈취’ 사이버 공격 임무를 부여받았다. 안전을 위해 이러한 임무의 테스트 환경은 실제 인터넷과 격리되어야 하지만, Anthropic과 평가 파트너 Irregular 사이에 오해가 발생하면서 평가 모델에 실제 인터넷 접근 권한이 개방되었다.

Anthropic: 제3자 평가 환경 설정 오류로 실제 사이버 보안 사건 3건 발생

첫 번째 사건에서 Claude Opus 4.7은 가상의 목표와 이름이 같은 실제 기업을 임무 목표로 착각하고 해당 기업의 인프라에 접근해 자격 증명과 데이터베이스 데이터를 추출했다. 이는 가장 심각한 사건으로, 모델은 실제 시스템임을 인지한 뒤에도 공격을 계속했다.

한편 Claude Mythos 5는 두 번째 사건에서 임무를 완수하기 위해 악성 Python 패키지를 실제 PyPI에 게시했다. 이 악성 파일은 15개의 실제 시스템에 다운로드되어 자격 증명이 탈취되는 피해가 발생했다. 모델은 잠시 “이게 실제 인터넷이라면 매우 심각할 것”이라고 인식했지만, 여전히 시뮬레이션 중이라고 스스로 납득했다.

Anthropic 내부의 한 연구 테스트 모델은 상대적으로 더 나은 모습을 보였다. 이 모델은 약 9000개의 대상을 스캔하고 기본적인 방법으로 실제 기업 한 곳에 침입했지만, 이후 실제 환경임을 깨닫자 자발적으로 공격을 중단했다.

Anthropic은 사건에 연루된 모든 모델이 정식 출시 시 사용되는 표준 안전 조치를 적용받지 않았지만, 특정 안전 훈련은 거쳤다고 밝혔다. 이러한 공격은 일부 기본적인 기술만 이용했다. 모델은 복잡한 취약점을 발견하거나 악용하지 않았으며, 테스트 환경에서 자신을 빼내거나 고의로 탈출하려고 시도하지도 않았다.