PhAI Labs, 과학 연구 에이전트용 무료 워크스페이스 'ScienceBuddy' 출시… GPT-6 및 이중 자기개선 루프 결합
PhAI Labs가 GPT-6 무료 지원과 JEV 프레임워크 기반의 과학 연구 에이전트 워크스페이스 'ScienceBuddy'를 공식 출시했습니다. 하네스 진화와 루브릭 강화학습을 결합한 이중 자기개선(Recursive-in-Recursive) 구조를 통해 연구자와 협업하며 스스로 진화
2026년 9월 23일, 인공지능 연구 조직 PhAI Labs의 잉청 찰스 우(Yingcheng Charles Wu)가 과학 연구 에이전트를 위한 대화형 워크스페이스 'ScienceBuddy'의 공식 출시를 발표했습니다. ScienceBuddy는 연구자들의 일상적인 연구 워크플로우에 지속적으로 스스로 성능을 개선하는 과학 에이전트를 도입하기 위해 설계된 작업 공간입니다.

이미지 출처: PhAI Labs / @Charles_Y_Wu
무료 GPT-6 환경과 JEV 프레임워크 기반 GPU 가속 워크스페이스
PhAI Labs 발표에 따르면, ScienceBuddy는 연구자들에게 추가 비용 없이(at no cost) GPT-6 모델 접근 권한을 제공합니다.
워크스페이스 환경 전체가 완전한 GPU 가속 인프라를 바탕으로 구동되며, PhAI Labs의 경량 의사결정·실행 프레임워크인 JEV와 긴밀하게 결합(fused)되어 작동합니다. 연구자들은 복잡한 인프라 설정이나 개별 API 키 발급에 따르는 비용 부담 없이 웹 기반 인터페이스에서 과학 데이터 분석, 문헌 검토, 가설 검증 등의 에이전트 워크플로우를 즉시 실행할 수 있습니다.
'재귀적 재귀 자가 개선(Recursive-in-Recursive)': 하네스 진화와 루브릭 RL의 결합
ScienceBuddy의 핵심 동작 엔진은 연구팀이 '재귀적 재귀 자가 개선(Recursive-in-Recursive Self-Improvement)'이라 명명한 이중 피드백 루프 아키텍처를 기반으로 합니다.
- 내부 루프(Inner loop - Harness evolution): 기저 모델의 가중치를 고정한 상태에서, 연구자와 에이전트가 협업을 진행함에 따라 에이전트의 프롬프트 지침, 실행 도구 연동, 컨텍스트 관리 등 '에이전트 하네스(Harness)'를 동적으로 정밀화합니다.
- 외부 루프(Outer loop - Model learning): 최적화된 하네스 환경에서 수집된 실행 데이터와 연구자 피드백을 바탕으로, 과제별 평가 루브릭(rubric-guided RL)을 통해 모델 자체를 강화학습시킵니다.
연계 공개된 논문(arXiv:2609.17523)에 따르면, 하네스의 진화가 모델의 학습 경험을 조성하고, 모델의 능력 향상이 다시 하네스의 새로운 적응 가능성을 여는 상호 순환 구조로 설계되었습니다.
연구자 일상 협업을 통한 지속 학습과 4대 과학 과제 벤치마크
ScienceBuddy는 연구자의 일상적인 요청, 답변, 도구 조작, 관찰 결과 및 피드백 증거를 실행 가능한 과학 과제와 과제 맞춤형 평가 루브릭으로 자동 변환합니다.
연구진은 벤치마크 사례 연구를 통해 4대 과학 과제군(four scientific task families) 전반에서 연구자 상호작용, 하네스 정밀화, 모델 학습이 유기적으로 기능함을 검증했다고 밝혔습니다. 단순 일회성 질의응답 보조 도구를 넘어, 연구자와 지속적으로 함께 일하며 연구 분야의 성장에 발맞춰 진화하는 '발견 지능(Discovery Intelligence)'을 구축하는 것을 핵심 지향점으로 제시했습니다.
이용 정책 및 실무 적용 시 고려사항
- GPT-6 무료 제공 범위: 공식 발표상 추가 비용 없는 무료 제공으로 명시되었으나, 사용자당 일일/분당 구체적인 호출 제한(Rate limit 및 Quota)이나 장기적인 무상 정책 유지 기간은 별도로 발표되지 않았습니다. 대규모 배치 연구나 자동화 파이프라인 연동 시 실측 쿼터 확인이 필요합니다.
- 외부 루프 모델 가중치 업데이트 주기: 외부 루프를 통한 실질적인 모델 파라미터 갱신은 연구자 피드백 데이터와 검증된 루브릭이 충분히 축적되는 주기를 거쳐야 하므로, 초기 단계에서는 내부 하네스 최적화가 주로 즉각적인 협업 경험 개선을 견인합니다.