오픈AI, 실시간 풀 듀플렉스 음성 모델 'GPT-Live-1' API 공식 출시

오픈AI가 듣기와 말하기를 동시에 수행하는 실시간 풀 듀플렉스 음성 모델 'GPT-Live-1' API를 공식 출시했습니다. 자연스러운 끼어들기와 배경 소음 필터링, 프런티어 모델과의 이원 위임 구조를 지원합니다.

tau · 2026년 9월 11일

#OpenAI #GPT-Live-1 #Voice-API #Full-Duplex #음성AI #실시간음성

오픈AI, 실시간 풀 듀플렉스 음성 모델 'GPT-Live-1' API 공식 출시

오픈AI(OpenAI)가 2026년 9월 11일, 공식 개발자 계정과 기술 블로그를 통해 사용자와 동시에 듣고 말할 수 있는 실시간 풀 듀플렉스(Full-duplex) 음성 대화 모델인 'GPT-Live-1'의 API를 정식 출시했습니다. 이번 릴리즈는 기존의 턴 기반(turn-based) 음성 인터페이스가 가졌던 반응 지연과 부자연스러운 대화 단절을 극복하고, 인간 대 인간의 즉각적인 음성 상호작용 경험을 개발자 서비스에 직접 결합할 수 있도록 구성되었습니다.

오픈AI 실시간 풀 듀플렉스 음성 모델 GPT-Live-1 API 공식 발표 화면

이미지 출처: OpenAI (openai.com)

이번에 공개된 GPT-Live-1 API는 음성 스트림의 양방향 입출력을 네이티브 레이어에서 처리하며, 기업용 고객 응대 솔루션부터 핸즈프리 인터랙티브 에이전트까지 다양한 상용 음성 파이프라인의 핵심 엔진으로 투입될 수 있습니다.

풀 듀플렉스 실시간 스트리밍과 지능형 끼어들기(Barge-in) 지원

GPT-Live-1의 가장 핵심적인 기술적 진보는 완전한 양방향 동시 음성 처리(Full-duplex)의 구현입니다.

기존 음성 어시스턴트는 사용자의 발화가 완전히 끝날 때까지 대기한 후 오디오를 텍스트로 변환(STT)하고, 추론 모델을 거쳐 음성 합성(TTS)으로 응답하는 순차적 턴 방식을 취했습니다. 이로 인해 필연적인 침묵과 레이턴시가 발생했습니다.

  • 실시간 끼어들기(Barge-in): 모델이 응답 음성을 출력하는 도중에도 사용자의 새로운 입력을 지속적으로 감지하여, 말을 끊거나 질문을 수정할 때 즉각 응답을 멈추고 새로운 맥락으로 전환합니다.
  • 주변 환경 노이즈 필터링: 짧은 침묵, 한숨, 카페나 사무실 등의 주변 배경 소음을 지능적으로 식별하여 불필요한 발화 인터럽트나 오작동을 최소화합니다.

이를 통해 기계적인 대기 시간 없이 상대방의 반응에 기민하게 반응하는 실제 대화형 인터랙션을 구현할 수 있습니다.

인터페이스 제어와 심층 추론의 분리: 이원화 아키텍처

GPT-Live-1은 모델 자체에 거대한 파라미터를 담아 무겁게 구동하는 대신, 음성 제어 레이어와 심층 추론 레이어를 명확히 분리하는 이원화 아키텍처를 채택했습니다.

모델 자체는 즉각적인 오디오 스트리밍, 억양 표현, 레이턴시 제어, 사용자 음성 반응 등 음성 인터페이스의 전방 제어에 집중합니다. 복잡한 다단계 논리 추론, 방대한 데이터베이스 조회, 외부 툴 호출(Tool Calling)과 같은 무거운 연산 작업은 백그라운드 프런티어 모델로 자연스럽게 위임됩니다.

  • 프런티어 모델 백그라운드 연동: 실시간 대화를 유지하면서 심층 연산이 필요한 질의는 백그라운드에서 GPT-5.5 등 프런티어 모델 및 개발자가 구축한 하네스로 넘겨 병렬 처리합니다.
  • 도구 실행 및 기업 통합: Yelp 등 초기 파트너사의 실제 도구 통합 사례가 함께 공개되었으며, 음성 대화 중 위치 정보 검색이나 예약 API 호출을 끊김 없이 연계하는 작업 흐름을 실증했습니다.

개발자 커스텀 제어와 상용 배포 시 운영 유의점

개발자는 GPT-Live-1 API를 통해 음성 에이전트의 페르소나와 전달 방식을 정밀하게 조정할 수 있습니다.

API 파라미터를 통해 에이전트의 말투, 발화 속도, 피치와 톤을 커스텀 제어할 수 있어 브랜드 아이덴티티나 서비스 목적에 맞춘 음성 경험 설계가 가능합니다. 다만 실시간 동시 입출력이라는 특성상 상용 프로덕션 도입 시 몇 가지 운영적 한계와 비용 구조를 고려해야 합니다.

  • 실시간 과금 체계: 오디오 스트림을 연속적으로 입출력하는 구조적 특성상 텍스트 API와 달리 분당 과금(초기 커뮤니티 기준 분당 약 $0.05 수준)이 적용되므로 세션 관리 전략이 요구됩니다.
  • 네트워크 레이턴시 관리: 최소 지연 시간을 유지하기 위한 웹소켓/WebRTC 기반 네트워크 최적화 및 연결 안정성 확보가 필수적입니다.
  • 백그라운드 하네스 구성: 복잡한 비즈니스 로직을 수행하려면 앞단의 GPT-Live-1과 뒷단의 추론 엔진을 매끄럽게 중계하는 오케스트레이션 설계가 수반되어야 합니다.

출처