단발성 프롬프트를 넘어 24시간 자율 운영 AI 직원을 구축하는 시스템 루프 설계법
안드레이 카르파시의 에이전트 철학을 기반으로 단순 챗봇 지시를 벗어나 '목표→컨텍스트→계획→실행→검증→학습→반복' 7단계 루프와 8대 핵심 시스템 요소를 구축하는 AI 엔지니어링 설계를 정리했습니다.
2026년 10월 5일, 크리에이터 리커(Ricker, @0xRicker)가 안드레이 카르파시(Andrej Karpathy)의 에이전트 엔지니어링 철학을 종합하여, 단발성 프롬프트 입력을 벗어나 24시간 스스로 작동하는 자율 운영 AI 직원을 구축하기 위한 8대 시스템 요소와 7단계 실행 루프 프레임워크를 공개했습니다.

이미지 출처: X @0xRicker
대다수의 사용자는 거대언어모델(LLM)에 개별 작업을 지시하고 결과를 기다리는 '단발성 프롬프트' 방식에 머물러 있습니다. 그러나 작업자가 자리를 비우거나 잠든 사이에도 독립적으로 문제를 해결하고 유지되는 진정한 상시 가동(always-on) AI 작업자를 만들기 위해서는 단일 프롬프트가 아닌 유기적인 '시스템'이 필요합니다. 챗봇 대화창을 넘어 실제 오퍼레이터(Operator)로 전환시키는 핵심 시스템 아키텍처와 엔지니어링 원칙을 정리했습니다.
챗봇 지시에서 시스템 엔지니어링으로의 전환
많은 개발자와 팀이 AI 도입 과정에서 "모델에게 작업을 던져주는 것(give the model a task)"에서 멈춥니다. 이 방식은 인간이 매 턴마다 결과를 검토하고 다음 행동을 일일이 지시해야 하므로 실질적인 자율 자동화로 이어지지 못합니다.
안드레이 카르파시가 주창해온 소프트웨어 3.0(Software 3.0)과 에이전트 엔지니어링의 본질은 LLM을 단순 질문 응답기가 아닌 '자율 런타임의 인터프리터'로 다루는 데 있습니다. 모델이 장시간에 걸쳐 작업을 안정적으로 완수하려면, 작업을 수행하는 단일 추론 단계보다 그 추론을 둘러싼 상위 오케스트레이션 루프의 신뢰성이 훨씬 더 중요합니다.
24시간 항상 작동하는 AI 워커의 8대 필수 요소
상시 가동 AI 직원을 현실화하기 위해 필요한 시스템 아키텍처는 다음 8가지 핵심 축으로 구성됩니다.
- 명확한 목표(A Clear Goal): 모델에게 마이크로 단위의 작업을 지시하는 대신, 완료 조건(Definition of Done)과 제약 사항이 명시된 최종 목표를 부여합니다.
- 올바른 컨텍스트(The Right Context): 시스템 프롬프트, 도구 사양, 프로젝트 규칙, 최신 환경 상태를 과도하지도 부족하지도 않게 조율하는 컨텍스트 엔지니어링이 뒷받침되어야 합니다.
- 계획 수립 루프(A Planning Loop): 모델이 즉흥적으로 코드를 작성하거나 명령을 내리지 않고, 작업을 단계별로 쪼개고 종속성을 평가하는 사전 계획 단계를 강제합니다.
- 도구 활용(Tool Use): 파일 시스템 읽기/쓰기, 셸 명령 실행, API 호출, 웹 조회 등 환경과 직접 상호작용하는 구체적인 인터페이스를 제공합니다.
- 메모리와 상태 관리(Memory): 이전 세션에서 무엇을 시도했고 무엇이 실패했는지를 파일이나 데이터베이스에 영속화하여, 중단되더라도 처음부터 다시 시작하지 않고 이어갈 수 있게 합니다.
- 검증 게이트(Verification): 모델이 자신의 결과물을 스스로 채점하지 못하도록 단위 테스트, 린터, 스키마 검사기 등 독립적인 결정론적 판정 게이트를 마련합니다.
- 피드백 루프(Feedback): 검증 실패 시 오류 로그와 원인을 추출해 계획 수정 단계로 즉각 환류시키는 오류 복구 메커니즘을 내장합니다.
- 배포 환경(Deployment): 세션 중단이나 예기치 않은 프로세스 종료를 감시하고 안정적인 실행 상태를 유지하는 프로덕션 런타임 인프라를 구축합니다.
7단계 자율 실행 루프(Goal→Context→Plan→Act→Verify→Learn→Repeat)
이 8대 요소를 톱니바퀴처럼 맞물려 작동시키는 핵심 순환 메커니즘이 바로 7단계 실행 루프입니다.
- 목표(Goal): 해결해야 할 이슈나 태스크의 명세를 수립합니다.
- 컨텍스트(Context): 해당 작업에 필요한 관련 소스 코드, 레퍼런스, 시스템 제약 조건을 모델의 컨텍스트 윈도우에 적재합니다.
- 계획(Plan): 변경할 파일 목록, 실행 순서, 검증 방안을 담은 구조화된 계획을 수립합니다.
- 실행(Act): 도구를 순차 호출하여 파일 수정, 빌드, 스크립트 실행 등 물리적 액션을 수행합니다.
- 검증(Verify): 사전에 정의된 테스트 스위트나 검증 스크립트를 돌려 변경 사항이 시스템 계약을 만족하는지 확인합니다.
- 학습(Learn): 실패한 시도와 통과한 패턴을 상태 파일에 기록하여 다음 추론의 맥락으로 활용합니다.
- 반복(Repeat): 하위 목표가 달성될 때까지 또는 다음 대기열 작업으로 자율적으로 이동하여 루프를 재개합니다.
이 루프가 완전히 닫혀 있을 때 비로소 AI는 인간의 실시간 개입 없이도 밤새 실행을 지속하며 가치 있는 결과물을 축적할 수 있습니다.
실전 적용 시 핵심 유의점과 설계 원칙
자율 에이전트 시스템을 설계할 때 가장 경계해야 할 함정은 '자체 검증(Self-grading)'입니다. 모델에게 "이 작업이 제대로 되었는지 확인해"라고 물으면 모델은 높은 확률로 자신의 환각이나 실수를 정당화합니다. 따라서 검증 단계는 반드시 외부 인터프리터, 테스트 러너, 정적 분석 도구 등 결정론적 도구에 위임해야 합니다.
또한 카르파시의 대표적인 통찰인 "생각(Thinking)은 외주를 줄 수 있지만, 이해(Understanding)는 외주를 줄 수 없다"는 원칙을 기억해야 합니다. 초안 작성, 코드 구현, 데이터 분류, 테스트 실행과 같은 반복적인 지적 노동은 에이전트 시스템에 위임할 수 있지만, 시스템이 무엇을 위해 동작하며 어떤 결과물이 진짜 성공인지를 정의하는 통찰과 비즈니스 맥락 이해는 여전히 인간 엔지니어의 몫입니다.
원문 출처
- Ricker (@0xRicker) X 포스트: Andrej Karpathy’s ideas on 24/7 AI employee system loop