OpenAI, 계산 생물학 평가를 위한 GeneBench-Pro를 소개

GeneBench-Pro는 유전체학, 정량 생물학, 의학에서의 AI 판단력을 테스트합니다 OpenAI의 벤치마크는 최첨단 모델이 복잡한 과학 데이터를 어떻게 추론하는지 보여줍니다

OpenAI는 계산 생물학에서 AI 모델이 판단 중심의 분석을 처리할 수 있는지 테스트하도록 설계된 새로운 벤치마크인 GeneBenchPro를 공개했습니다. 이 벤치마크는 유전체학, 정량 생물학, 중개 의학 분야의 과제에 중점을 두며, 모델은 지저분한 데이터를 어떻게 분석할지, 가정을 어떻게 수정할지, 그리고 결과를 언제 사용 가능한 상태로 볼지 결정해야 합니다. OpenAI에 따르면 GeneBenchPro는 10개 도메인과 21개 하위 도메인에 걸친 129개의 합성 문제를 포함합니다. 이 회사는 완전히 시뮬레이션된 데이터 생성 과정을 사용해 일반적인 평가 결함을 줄이도록 벤치마크를 구축했으며, 이를 통해 결과를 알려진 목표값과 비교해 채점할 수 있고 올바른 해법이 적절한 분석 경로를 선택하는 데 달려 있음을 보장하는 데 도움이 된다고 말합니다. OpenAI는 또한 내부 테스트 결과를 공개하며, 가장 강력한 모델인 GPT5.6 Sol이 최고 추론 수준에서 28.7%의 통과율을 기록했으며, Pro 모드를 활성화하면 31.5%에 도달했다고 밝혔습니다. 회사는 이 벤치마크가 최첨단 모델들이 복잡한 과학적 추론에서 발전하고 있음을 시사하지만, 여전히 대부분의 문제를 안정적으로 해결하기에는 부족하다고 말했습니다.