Google은 코딩 에이전트를 위한 품질 선순환 구조를 설명한다

Google AI 에이전트 평가를 통해 팀은 다중 턴 코딩 에이전트를 개선할 수 있습니다 AutoRaters, 사용자 지정 지표, 인간 검토를 사용해 모든 변경 사항을 검증하세요

Google은 코딩 에이전트가 구조화된 품질 루프를 통해 멀티턴 AI 에이전트를 평가하고 개선하는 데 도움을 주는 개발자용 기능을 만들었다고 밝혔습니다. 이 접근 방식은 데이터 준비, 추론, 채점, 실패 분석, 반복을 결합합니다. Google의 적응형 AutoRaters와 맞춤형 지표를 함께 사용해 팀이 일부 예시에서 그저 더 좋아 보이는지에 그치지 않고 실제로 변경 사항이 행동을 개선하는지 측정할 수 있게 합니다. 회사는 이 워크플로가 평가와 최적화를 분리하도록 설계되었으며, 여전히 사람의 승인이 필요하다고 말합니다. 초기 테스트에는 합성 시나리오를, 지속적인 모니터링에는 프로덕션 추적 데이터를 사용할 수 있으며, 서로 다른 개발 스택을 위한 두 가지 패키지를 통해 제공됩니다.