OpenAI가 코딩 벤치마크를 감사한 결과 결함을 발견
SWE-bench Pro 감사 결과 작업의 30%가 손상되어 있어 코딩 결과가 왜곡되는 것으로 나타났습니다. OpenAI가 권장 사항을 철회한 이유와 이것이 모델 평가에 어떤 의미인지 확인해 보세요.
OpenAI는 SWEBench Pro를 감사하여 해당 벤치마크가 여전히 코딩 능력을 신뢰할 수 있게 측정하는지 확인했다고 밝혔습니다. 회사는 정확한 평가는 배포와 안전성 결정에 중요하며, 결함이 있는 테스트는 모델 역량이 어떻게 이해되는지를 왜곡할 수 있다고 말했습니다.
검토에서 OpenAI는 데이터셋의 작업 중 상당수가 망가져 있다는 증거를 발견했다고 밝혔습니다. 회사는 주요 문제로 지나치게 엄격한 테스트, 불충분하게 명시된 프롬프트, 낮은 커버리지의 테스트, 그리고 모델을 오도할 수 있는 프롬프트를 포함했다고 말했습니다.
OpenAI는 표시된 작업을 평가하기 위해 자동화된 파이프라인, 조사 에이전트, 그리고 인간 검토자를 사용했다고 밝혔습니다. 이러한 점검을 바탕으로 SWEbench Pro 작업의 약 30%가 망가진 것으로 추정했으며, 모델 개발자들에게 벤치마크 결과를 신중히 검토할 것을 권고했습니다. 또한 이전에 SWEBench Pro로 전환하라고 권장했던 내용을 철회한다고 밝혔습니다.