OpenAI Dots로 24시간 상시 가동되는 5인 AI 연구팀 구축 워크플로우

OpenAI의 상시 가동 에이전트 Dots를 활용해 문헌 검토, 재현 오류 수정 및 Codex PR 생성, 데이터 분석, 신호 탐색, 주간 브리핑 작성의 5대 전문 역할을 24시간 가동하고 사전 승인 안전 사다리를 적용하는 팁을 정리합니다.

tau · 2026년 10월 3일

#OpenAI Dots #AI 에이전트 #연구 자동화 #Codex Cloud #프롬프트 엔지니어링

OpenAI Dots로 24시간 상시 가동되는 5인 AI 연구팀 구축 워크플로우

OpenAI 엔지니어들의 실제 운용 방식을 바탕으로, 상시 가동형 AI 에이전트 시스템인 'OpenAI Dots'를 활용해 24시간 쉬지 않고 연구 및 개발 업무를 분담하는 5인 가상 연구팀 구성 팁이 X(구 트위터)의 AI 크리에이터 @N01ennn을 통해 공유되었습니다.

OpenAI Dots 에이전트 5종의 24시간 자율 연구 파이프라인과 인간 최종 승인 게이트 구조도

이미지 출처: @N01ennn on X

연구자가 잠든 새벽 시간대에도 최신 논문 검토, 실패한 실험 재현 코드의 자동 디버깅 및 PR 생성, 데이터셋 분석과 보고서 초안 작성을 자율적으로 수행하되, 인간 작업자의 최종 검토 및 승인 없이는 어떠한 변경 사항도 코드베이스에 직접 병합되거나 외부에 공유되지 않도록 안전 장치를 설계하는 것이 핵심입니다.

24시간 가동되는 5대 전문 에이전트 역할 구성

이 워크플로우는 단일 에이전트에게 모든 잡무를 포괄적으로 위임하는 대신, 명확한 임무와 트리거 조건을 가진 5개의 특화 역할('Seat')로 분리하여 상시 가동합니다.

  • 문헌 검토관 (you-reader / lit reviewer): 밤사이 공개된 프리프린트(preprint)와 최신 논문들을 정기적으로 탐색하여 정독합니다. 연구자가 현재 작성 중인 논문 초안이나 가설과 상충되는 주장, 혹은 상호 보완적인 연구 결과가 발견되면 이를 즉시 플래그하여 메모를 남깁니다.
  • 연구 엔지니어 (you-engineer / research eng.): 야간 빌드나 실험 환경에서 재현 오류(repro failure)가 발생했을 때 즉시 오류 트레이스를 추적합니다. Codex 클라우드 환경에서 수정 코드를 실행 및 검증한 뒤, 테스트 결과 리포트와 함께 검토용 드래프트 PR(Pull Request)을 생성해 둡니다.
  • 데이터 분석관 (you-analyst / data analyst): 새로운 실험 데이터셋이나 측정 지표가 유입되면 분석 파이프라인을 재실행합니다. 시각화 도표(figure)를 자동으로 최신화하며, 특정 그래프(예: Fig. 3)에서 예상치 못한 이상치나 특이 패턴이 감지되면 아침에 확인할 수 있도록 질의를 기록합니다.
  • 신호 탐색관 (you-scout / signal scout): 연구 관련 피드와 공개 데이터셋을 주기적으로 스윕(sweep)하고 선행 연구와의 상관관계를 비교합니다. 이를 바탕으로 새로운 후속 실험을 진행할 가치가 있는지 판단 근거를 정리하여 제안합니다.
  • 보고서 작성관 (you-writer / report writer): 미팅 녹취록, 인터뷰 기록, 주간 연구 노트를 취합하여 연구자 고유의 문체(voice)로 정리된 주간 브리핑 초안을 작성합니다. 연구자가 수정한 피드백을 지속적으로 반영하며 작성 스타일을 고도화합니다.

통제력을 유지하는 4단계 권한 사다리와 통합 메모리

상시 자율 가동 에이전트가 통제를 벗어나 무단으로 코드를 변경하거나 잘못된 정보를 유출하는 위험을 차단하기 위해, 시스템에는 엄격한 4계층 권한 사다리와 통일된 컨텍스트 공유 체계가 적용됩니다.

  • 전 채널 단일 공유 메모리: ChatGPT, Slack, Microsoft Teams, 화상 회의 통화 및 텍스트 채널 전반에서 단 하나의 일관된 메모리를 공유합니다. 도구 간 컨텍스트 단절 없이 모든 에이전트가 동일한 연구 맥락을 유지합니다.
  • 다양한 기동 트리거 지원: 에이전트는 자체 판단에 따른 자율 호출(self-call), 지정된 스케줄(cron), 또는 외부 이벤트(신규 데이터 도착, 빌드 실패 등)에 반응하여 즉각 깨어나 작업을 시작합니다.
  • 4단계 실행 권한 사다리(Permission Ladder):
    1. 자율 실행 (Act): 읽기 전용 검색, 데이터 수집 및 로컬 계산 등 부작용이 없는 작업은 즉시 실행합니다.
    2. 사전 승인 (Pre-approved): 사전에 정의된 안전 규칙 범위 내의 경미한 작업만 허용합니다.
    3. 사전 질의 (Ask before): 외부에 영향을 줄 수 있는 작업은 실행 전 사용자에게 승인을 요청합니다.
    4. 인간 이관 (Hand off): 불확실성이 높거나 민감한 판단은 모든 준비 자료를 갖추어 인간 연구자에게 위임합니다.
  • 격리된 최종 승인 데스크 (Sign-off Desk): 새벽 5시에 연구 엔지니어 에이전트가 완성한 드래프트 PR은 인간 작업자가 오전 9시에 출근하여 검토하고 서명할 때까지 대기 상태를 유지합니다. 사용자의 명시적 승인 없이는 어떤 코드도 머지되지 않으며 외부로 발행되지 않습니다.

원문 출처