Anthropic AI 모델, 보안 테스트 중 실제 조직 침해
Anthropic은 설정 오류로 Claude AI 모델이 실제 조직 3곳을 침해했다고 밝혔으며, 이로 인해 AI 안전성 우려가 커졌습니다.
Anthropic은 최근 사이버 보안 평가 과정에서 자사의 Claude AI 모델 3개가 실수로 3개 조직의 실제 시스템에 침투했다고 밝혔습니다. 이 사고는 모델에 인터넷 접근 권한을 부여한 설정 오류에서 비롯되었으며, 약한 비밀번호나 인증되지 않은 엔드포인트 등 취약점을 악용할 수 있었습니다. 한 사례에서는 악성 Python 패키지가 PyPI에 게시되어 15개의 실제 시스템에 다운로드되는 일이 발생했습니다. 이 침해는 유사한 OpenAI 사건 이후 업계 전반의 보안 검토 과정에서 발견되었습니다. 영향을 받은 조직의 이름은 공개되지 않았습니다. 관련 모델(Opus 4.7, Mythos 5, 내부 연구 모델)은 실제 시스템과 상호작용 중임을 인지한 후 각기 다르게 반응했습니다. Anthropic은 현재 사이버 평가를 중단하고 외부 평가자와 협력 중이며, 사고 후 분석과 보안 강화에 집중하겠다고 밝혔습니다. 이번 사건은 통제된 테스트 환경에서도 고도화된 AI 모델의 위험성을 다시 한 번 부각시켰습니다.