실전 AI 에이전트 구축을 위한 핵심 오픈소스 깃허브 저장소 10선
단순 LLM 호출을 넘어 워크플로우 제어, 타입 안전 구조화 출력, 장기 기억, 브라우저 제어, 격리 샌드박스 및 평가까지 지원하는 AI 에이전트 오픈소스 도구 모음.
고성능 파운데이션 모델의 등장은 AI 에이전트 개발의 출발점에 불과하며, 실무 환경에서 자율적이면서도 신뢰성 있게 동작하는 에이전트를 완성하기 위해서는 모델 주변의 시스템 아키텍처(상태 관리, 타입 검증, 동적 메모리, 도구 연동, 격리 실행, 정량 평가)를 어떻게 설계하느냐가 핵심 과제로 부상하고 있습니다.

이미지 출처: @RodmanAi (X)
최근 오픈소스 AI 엔지니어링 커뮤니티에서는 '모델(Model) → 컨텍스트(Context) → 메모리(Memory) → 도구(Tools) → 실행(Execution) → 평가(Evaluation)'로 이어지는 6단계 에이전트 아키텍처 스택이 정립되고 있습니다. 레너드 로드먼(@RodmanAi)이 정리한 10대 핵심 깃허브 오픈소스 저장소를 중심으로, 단순한 챗봇을 넘어 실제 작업을 완수하는 프로덕션급 AI 에이전트 구축 도구들을 살펴봅니다.
1. 워크플로우 오케스트레이션 및 타입 안전 제어 계층
에이전트가 복잡한 다단계 의사결정을 수행할 때 가장 먼저 요구되는 것은 실행 흐름의 제어 가능성(Controllability)과 출력 데이터의 구조적 무결성입니다.
- LangGraph (
langchain-ai/langgraph): 상태 유지(stateful) 및 제어 가능한 다중 에이전트 워크플로우를 저수준(Low-level)에서 조율하는 프레임워크입니다. Pregel과 Apache Beam의 분산 그래프 처리 개념에서 영감을 받아 설계되었으며, 에이전트의 각 단계를 노드와 엣지로 명시합니다. 사람의 개입(Human-in-the-loop)을 통한 상태 검토 및 수정, 오류 발생 시 이전 지점부터 작업을 재개하는 영속적 실행(Durable execution), 단기 작업 기억과 세션 간 장기 기억을 모두 지원합니다. - PydanticAI (
pydantic/pydantic-ai): Pydantic 팀이 개발한 모델 독립적(Model-agnostic) 파이썬 에이전트 프레임워크입니다. FastAPI의 개발 경험을 LLM 애플리케이션으로 확장하는 것을 목표로 하며, 강력한 타입 힌트와 Pydantic 검증 계층을 통해 모델 출력을 엄격하게 보장합니다. 의존성 주입(Dependency Injection), 비동기 스트리밍 출력 검증, MCP(Model Context Protocol) 기본 연동을 제공하며, 상태 머신이 필요한 복잡한 워크플로우는 전용 그래프 라이브러리인pydantic-graph로 제어할 수 있습니다. - Mastra (
mastra-ai/mastra): 복잡한 비즈니스 로직 워크플로우, 메모리 시스템, 외부 도구 연동을 일관된 구조 안에서 통합 구축할 수 있는 현대적 에이전트 프레임워크입니다. - Agno (
agno-agi/agno): 여러 특화 에이전트들이 협업하여 단일 목표를 달성할 수 있도록 다중 에이전트 시스템(Multi-agent systems)을 구성하고 상호 조율하는 기능을 제공합니다.
2. 동적 지식화 메모리와 웹·브라우저 상호작용 계층
단순한 프롬프트 컨텍스트 창(Context Window)의 확장을 넘어, 시간에 따른 정보 변화를 인지하고 실시간 웹 환경과 상호작용하는 도구들이 필수적입니다.
- Cognee (
topoteretes/cognee): 비정형 원시 데이터(문서, 로그 등)를 체계적인 지식 그래프와 정형화된 벡터 구조로 변환하여 에이전트가 검색하고 재활용할 수 있는 신뢰성 높은 장기 메모리 계층을 구성합니다. - Graphiti (
getzep/graphiti): 시간에 따라 사실 관계가 갱신되고 변화하는 동적 지식을 그래프 구조로 추적하는 에이전트 전용 메모리 프레임워크입니다. 과거 시점의 상태와 최신 정보를 분리 인지하여 에이전트가 모순된 기억을 학습하거나 왜곡하지 않도록 돕습니다. - Browser Use (
browser-use/browser-use): AI 에이전트가 실제 웹 브라우저를 구동하여 웹사이트 내 요소를 인식하고, 클릭, 텍스트 입력, 페이지 탐색, 양식 제출 등 복잡한 브라우저 작업을 자율적으로 완수하도록 돕는 자동화 라이브러리입니다.
3. 격리 샌드박스 실행 및 관측·평가 계층
에이전트가 자율적으로 생성한 코드를 안전하게 실행하고, 프로덕션 환경에 배포하기 전에 동작의 일관성을 검증하는 인프라 계층입니다.
- E2B (
e2b-dev/E2B): 에이전트가 작성한 파이썬 스크립트나 셸 명령을 호스트 시스템에 영향을 주지 않고 안전하게 실행할 수 있는 격리된 클라우드 샌드박스(MicroVM) 환경을 제공합니다. - Langfuse (
langfuse/langfuse): LLM 및 복합 에이전트 워크플로우의 실행 트레이스(Trace), 세션별 호출 지연 시간, 토큰 소모량 및 비용을 실시간으로 추적·모니터링하는 오픈소스 관측성(Observability) 플랫폼입니다. - DeepEval (
confident-ai/deepeval): 에이전트의 지시문 준수 여부(Instruction following), 환각 발생률, 답변 일관성 등을 단위 테스트(Unit testing) 형태로 정량 평가하여 배포 전 회귀 결함을 사전에 탐지하는 테스트 프레임워크입니다.
실무 도입 시 고려사항
이번에 소개된 10개의 오픈소스 프로젝트는 하나의 거대한 단일 솔루션이 아니라, 에이전트 아키텍처의 각 계층(오케스트레이션, 검증, 메모리, 브라우저, 샌드박스, 관측·평가)을 전담하는 독립적인 빌딩 블록입니다.
실제 프로덕션 파이프라인을 설계할 때는 모든 도구를 한꺼번에 도입하기보다, 프로젝트의 도메인 특성에 맞춰 필요한 계층을 선별 조합하는 엔지니어링 전략이 필요합니다. 예를 들어 엄격한 타입 안정성이 요구되는 백엔드 파이프라인에는 PydanticAI와 Langfuse를, 복합 상태 분기와 브라우저 조작이 필요한 웹 에이전트에는 LangGraph와 Browser Use, E2B 격리 환경을 결합하는 방식이 효과적입니다. 또한 샌드박스 런타임이나 브라우저 제어 라이브러리는 외부 인프라 구성 및 접근 권한 관리가 수반되므로 운영 환경의 보안 정책을 사전에 검토해야 합니다.
출처
- Leonard Rodman 공식 X (@RodmanAi): 10 GITHUB REPOS FOR BUILDING AI AGENTS THAT ACTUALLY DO THINGS
- LangGraph 깃허브 저장소: langchain-ai/langgraph
- PydanticAI 깃허브 저장소: pydantic/pydantic-ai
- Mastra 깃허브 저장소: mastra-ai/mastra
- Agno 깃허브 저장소: agno-agi/agno
- Cognee 깃허브 저장소: topoteretes/cognee
- Graphiti 깃허브 저장소: getzep/graphiti
- Browser Use 깃허브 저장소: browser-use/browser-use
- E2B 깃허브 저장소: e2b-dev/E2B
- Langfuse 깃허브 저장소: langfuse/langfuse
- DeepEval 깃허브 저장소: confident-ai/deepeval