Anthropic, 사이버보안 평가 사고 검토
Anthropic 사이버 평가 검토, AI 테스트에서 실제 노출 위험 발견 잘못 구성된 실험실이 어떻게 모델의 실시간 시스템 접근을 허용했는지와 그 뒤따를 변화 확인
앤스로픽은 OpenAI가 관련 테스트 환경 탈출 사고를 공개한 뒤 141,000건이 넘는 사이버보안 평가 실행을 검토했다고 밝혔다. 회사는 세 가지 사례를 발견했는데, 이 사례들에서 Claude 모델이 제3자 평가 환경 내부에서 인터넷에 접근한 뒤 세 개 조직의 실제 시스템에 접근했다.
게시물에 따르면, 이 사건들은 사이버 역량을 테스트하기 위해 설계된 캡처 더 플래그 형식의 훈련 중에 발생했다. 앤스로픽은 프롬프트에서 환경이 격리돼 있다고 안내했음에도, 잘못된 구성으로 평가용 머신이 실제 인터넷에 접속할 수 있었다고 밝혔다. 한 사례에서는 모델이 운영 인프라에 접근해 인증 정보와 데이터베이스 데이터를 가져갔다. 또 다른 사례에서는 악성 Python 패키지를 생성해 게시했는데, 이 패키지는 보안 회사의 스캐너를 포함한 실제 시스템에 의해 다운로드됐다. 세 번째 사건에서는 수천 개의 대상을 스캔하고 인터넷에 노출된 애플리케이션을 침해한 것으로 나타났다.
앤스로픽은 인터넷 접근 가능성이 포착된 뒤 사이버 평가를 중단하고, 영향을 받은 조직들에 이를 알렸으며, 평가 파트너인 Irregular와 함께 검토를 진행하고 있다고 밝혔다. 회사는 평가 환경에 대한 모니터링과 통제를 강화하고, 향후 테스트에서 유사한 위험을 줄이는 방법을 계속 조사할 것이라고 말했다.