두 가지 설정으로 OpenAI의 ARC-AGI-3 벤치마크 점수가 3배로 향상되었습니다

OpenAI GPT-5.6 Sol은 추론과 압축을 유지해 ARC-AGI-3 점수를 향상시켰습니다. API 설정이 결과를 어떻게 높이고 출력 토큰을 6배 줄였는지 확인하세요.

OpenAI는 두 개의 API 설정, 즉 추론 유지와 압축 기능이 활성화된 후 자사의 GPT5.6 Sol 모델이 ARCAGI3 벤치마크에서 훨씬 더 좋은 성능을 보였다고 밝혔다. 회사는 이 변경으로 공개 과제 세트의 점수가 3배로 늘었고 출력 토큰은 약 6배 줄었다고 보고했다. 이 벤치마크는 AI 에이전트가 낯선 2D 퍼즐 게임을 얼마나 잘 학습하고 추론할 수 있는지 테스트한다. OpenAI는 자사 모델의 낮은 점수가 부분적으로는 비공개 추론을 폐기하고 과제가 길어질수록 오래된 맥락을 제거하는 롤링 절단을 사용한 평가 하니스 때문이라고 밝혔다. 회사는 Responses API를 사용해 턴 간 추론을 유지하고 절단을 압축으로 대체했다. OpenAI는 이것이 모델이 학습한 내용을 보존하고, 더 일관되게 행동하며, 벤치마크 과제를 더 많이 해결하는 데 도움이 되었다고 밝혔다. 회사는 벤치마크 결과가 모델 자체뿐 아니라 하니스 설계와 API 설정에 크게 좌우될 수 있다고 덧붙였다.