OpenAI가 생명과학 연구 과제를 위한 LifeSciBench를 소개합니다
LifeSciBench는 7개 분야에 걸친 실제 생명과학 연구 과제에서 AI를 테스트합니다. 모델이 실제로 증거, 실험, 불확실성을 어떻게 다루는지 확인해 보세요.
OpenAI는 AI 시스템이 현실적인 생명과학 연구 업무를 얼마나 잘 처리하는지 테스트하도록 설계된 벤치마크인 LifeSciBench를 공개했습니다. 이 벤치마크는 근거를 해석하고, 상충하는 결과를 해결하며, 실험을 설계하고, 불확실성 속에서 과학적 결론을 전달하는 등의 작업에 중점을 둡니다.
회사는 LifeSciBench에 7개 워크플로와 7개 생물학 분야에 걸친 전문가 작성 작업 750개가 포함되어 있다고 밝혔습니다. 해당 작업들은 생명공학과 제약 분야에서 산업 경험과 박사 수준의 교육을 받은 현업 생명과학자들이 만들고 검토했으며, 과학적 정확성과 유용성을 평가하는 데 상세한 채점 기준이 사용됐습니다.
OpenAI는 이 벤치마크가 단순한 사실 회상이나 좁은 범위의 예측 작업보다 더 많은 것을 측정하려는 것이라고 말합니다. 보고서에 따르면 모델은 과학적 커뮤니케이션과 번역에서는 가장 좋은 성능을 보이지만, 아티팩트가 많은 분석, 정확한 출력, 설계 중심 작업에서는 여전히 어려움을 겪습니다. 회사는 또한 벤치마크 결과를 실제 연구 영향의 증거로 간주해서는 안 된다고 덧붙였으며, 향후 연구에서는 실제 연구 환경에서의 성능을 살펴봐야 한다고 말했습니다.