Anthropic, Fable 5 사이버 보호장치와 탈옥 프레임워크를 상세히 설명

Claude Fable 5 사이버 보호장치: Anthropic이 위험한 요청을 차단하는 방법 과 그 탈옥 심각도 프레임워크가 AI 보안 표준을 어떻게 형성할 수 있는지 확인하세요

Anthropic은 Claude Fable 5에 내장된 사이버 보안 안전장치에 대한 추가 정보를 공개했으며, AI 탈옥 심각도를 평가하기 위한 제안 프레임워크의 초기 초안도 함께 발표했습니다. 회사는 이 모델이 안전 분류기를 사용해 위험하거나 잠재적으로 위험한 사이버 요청을 탐지하고 차단하는 한편, 일부 무해하고 방어적인 용도는 여전히 허용한다고 밝혔습니다. Anthropic은 사이버 관련 행위를 네 가지 범주로 정리했습니다: 금지된 사용, 고위험 이중 용도, 저위험 이중 용도, 무해한 사용. 또한 분류기는 접근 제어, 안전 교육, 오프라인 모니터링과 함께 여러 보호 계층 중 하나일 뿐이라고 설명했습니다. Anthropic은 또한 탈옥이 얼마나 심각한지를 설명하는 데 도움이 되도록 설계된 Cyber Jailbreak Severity 척도도 제시했으며, 이는 해당 탈옥이 해제하는 기능, 적용 범위, 무기화의 용이성, 그리고 발견 가능성 같은 요소를 기준으로 한다고 밝혔습니다. 회사는 이 프레임워크가 아직 초안 단계이며, 이러한 위험을 일관되게 평가하는 방법에 대해 연구자, 업계, 정부와의 논의를 촉진하기 위한 것이라고 말했습니다.