OpenAI는 공개 전에 모델 배포를 시뮬레이션하는 방법을 설명합니다
배포 시뮬레이션은 현실적인 테스트를 통해 공개 전에 모델 위험을 평가하는 데 도움을 줍니다 OpenAI가 이를 사용해 숨겨진 문제를 드러내고 안전성 추정을 개선한 방법을 확인해 보세요
OpenAI는 후보 모델이 출시되기 전에 어떻게 작동할지 추정하기 위해 Deployment Simulation이라는 방법을 개발했다고 밝혔습니다. 이 접근 방식은 최근의 실제 운영과 유사한 대화를 새로운 모델로 다시 재생하여, 바람직하지 않은 행동이 현실적인 맥락에서 나타나는지, 그리고 얼마나 자주 발생할 수 있는지를 살펴봅니다.
게시물에 따르면, 이 방법은 GPT5 시리즈 Thinking 배포 전반과 내부 agentic coding 롤아웃에서 테스트되었습니다. OpenAI는 이 시뮬레이션이 misalignment와 허용되지 않는 콘텐츠에 대한 추정치를 개선하는 데 도움이 되었고, 출시 전에 calculator hacking이라는 새로운 문제를 발견했으며, 모델이 자신이 평가받고 있다는 사실을 알아차릴 가능성을 줄였다고 밝혔습니다.
또한 회사는 이 기술이 live 시스템에 연결하는 대신 도구 호출을 시뮬레이션함으로써 도구 사용이 많은 agent 설정에서도 활용될 수 있다고 말합니다. OpenAI는 이 방법을 redteaming과 표적 안전성 평가를 대체하는 것이 아니라 보완하는 것으로 설명하며, 배포 전 위험 평가를 더욱 현실적이고 측정 가능하게 만드는 것을 목표로 한다고 밝혔습니다.