GPT-Red는 자동화된 레드팀을 통해 모델의 견고성을 향상시킵니다
GPT-Red 레드팀 모델은 OpenAI가 출시 전에 AI 취약점을 찾는 데 도움을 줍니다 확장 가능한 테스트와 더 강력한 안전 점검으로 프롬프트 인젝션 방어를 강화하세요
OpenAI는 AI 시스템의 취약점을 찾아 배포 전에 안전성을 개선하는 데 도움을 주도록 설계된 내부 자동 레드팀 모델인 GPTRed를 개발했다고 밝혔습니다. 회사는 이 접근 방식이 특히 모델이 더 강력해지고 브라우저, 앱, 파일 같은 도구를 통해 제3자 데이터와 상호작용하게 됨에 따라, 인간 테스터만으로 할 수 있는 범위를 넘어 레드팀 작업을 확대하기 위한 것이라고 말합니다.
게시물에 따르면 GPTRed는 자기 대전을 통해 훈련되며, GPT5.6 Sol을 포함한 더 최신의 프로덕션 모델을 위한 적대적 예시를 생성하는 데 사용됩니다. OpenAI는 이로 인해 자사의 최신 모델이 프롬프트 인젝션 공격에 더 강해졌으며, 가장 어려운 직접 프롬프트 인젝션 벤치마크에서 이전 프로덕션 모델들보다 실패 횟수가 더 적었다고 밝혔습니다.
또한 회사는 GPTRed가 AI 기반 자판기와 Codex CLI 에이전트를 포함해 새로운 환경과 현실 세계 스타일의 에이전트 시스템에 도전할 수 있었던 테스트도 설명합니다. OpenAI는 GPTRed 자체를 배포하는 것이 목표가 아니라, 인간 레드팀 작업, 제3자 테스트, 계층화된 안전장치, 모니터링을 계속하는 동시에 이를 활용해 향후 모델을 강화하는 것이라고 말합니다.