OpenAI가 6개월 만에 실시간 음성 AI 시스템을 구축한 방법
GPT-Live는 전이중 음성 및 추론으로 더 빠르고 자연스러운 ChatGPT 음성을 구현합니다 OpenAI가 지연 시간을 줄이고 긴 음성 세션을 안정화해 더 매끄러운 라이브 채팅을 구현한 방법을 알아보세요
OpenAI는 음성 대화를 더 즉각적이고 자연스럽게 느껴지도록 하기 위해 ChatGPT용 3세대 음성 시스템인 GPTLive를 구축했다고 말했습니다. 회사는 더 깊은 추론과 도구 사용은 별도의 비동기 경로에서 처리하면서, 동시에 듣고 말할 수 있는 풀듀플렉스 모델을 설명했습니다.
엔지니어링 작업은 전체 스택 전반의 지연 시간을 줄이는 데 집중했습니다. OpenAI는 모델 추론, 컨텍스트 관리, 미디어 전송을 재작업했으며, 애플리케이션 로직이 실시간 음성을 느리게 하지 않도록 미디어 처리를 전용 고속 경로로 옮겼다고 밝혔습니다.
이 글은 또한 원활한 모델 인계, 컨텍스트 압축, WARP와 Instant Connect를 통한 더 빠른 세션 설정을 포함해 긴 음성 세션을 안정적으로 유지하기 위해 사용된 운영 기법도 설명합니다. OpenAI는 이 아키텍처가 이미 ChatGPT Voice를 지원하고 있으며, 앞으로 출시될 GPTLive API의 기반도 될 것이라고 밝혔습니다.