VideoDB, 회의를 실시간 에이전트 루프로 전환하는 오픈소스 AI 어시스턴트 'Call.md' 공개
VideoDB가 마이크와 시스템 오디오를 듀얼 채널로 분리 캡처해 실시간 전사 및 통화 중 MCP 도구 호출을 수행하고, 회의 종료 후 3단계 요약과 n8n·Zapier 웹훅 자동화를 지원하는 오픈소스 도구 'Call.md'를 공개했습니다.
비디오 인프라 기술 플랫폼 VideoDB가 회의 오디오를 로컬에서 녹음하고 실시간 AI 인텔리전스를 제공하는 오픈소스 데스크톱 어시스턴트 'Call.md'(github.com/video-db/call.md)를 공식 공개했습니다. 사후 녹음 파일이나 녹취록을 업로드해 분석하던 기존 회의 도구와 달리, 통화 진행 중 마이크와 시스템 사운드를 실시간으로 전사하고 대화 맥락에 따라 AI 도구를 자동 호출하는 에이전트 루프(Agent Loop) 구조를 전면에 내세웠습니다.

이미지 출처: Tom Dörr (@tom_doerr) / X
이번에 공개된 Call.md는 회의가 끝난 뒤 분석 리포트를 확인하는 수동적인 어시스턴트를 넘어, 대화가 진행되는 순간 필요한 데이터와 후속 액션을 연결하는 능동적인 작업 보조 도구로 설계되었습니다.
듀얼 채널 오디오 분리와 실시간 WebSocket 전사
Call.md의 핵심 아키텍처는 회의 참여자의 발언을 오디오 입력 단계부터 물리적으로 분리하는 듀얼 채널(Dual-channel) 캡처 방식에 있습니다.
Electron, React, TypeScript 기반으로 구축된 이 데스크톱 애플리케이션은 VideoDB 인프라를 활용해 로컬 환경의 오디오 스트림을 처리합니다.
- 발화자 물리 분리(You vs Them): 로컬 마이크로 들어오는 사용자 음성('you')과 스피커를 통해 출력되는 상대방의 시스템 오디오('them')를 독립된 오디오 채널로 나누어 캡처합니다.
- 실시간 WebSocket 스트리밍: 분리된 오디오 스트림은 WebSocket을 통해 VideoDB 인프라로 전송되며, 지연 시간을 최소화한 실시간 음성-텍스트 변환(Real-time transcription)을 거칩니다.
오디오 캡처 단계에서 마이크('you')와 시스템 오디오('them')를 사전에 분리함으로써, 참여자들의 발언을 독립된 채널로 실시간 전사하고 회의 중 지표 분석과 인라인 도구 실행을 위한 핵심 데이터로 활용합니다.
실시간 대화 분석과 인라인 MCP(Model Context Protocol) 도구 호출
단순 전사를 넘어 Call.md는 회의 도중 실시간으로 대화 흐름을 분석하고 외부 에이전트 액션을 트리거합니다.
- 실시간 통화 지표 및 코칭: 회의 중 사용자의 발화 비율(Talk ratio), 발화 속도(Speaking pace), 질문 횟수, 혼자 길게 말하는 독점 발언(Monologues) 등을 실시간으로 측정합니다. 인공지능은 실시간 전사 내용을 지속적으로 분석해 사용자가 던지기 좋은 후속 질문이나 회의 맥락에 맞는 적절한 코칭 피드백을 실시간으로 제안합니다.
- 인텐트 감지 기반 인라인 MCP 호출: 대화 중 특정 데이터나 레퍼런스가 필요한 순간(능동적 또는 수동적 정보 필요)을 인텐트 감지기가 실시간으로 포착합니다. 정보 조회가 감지되면 시스템에 연결된 MCP(Model Context Protocol) 도구를 백그라운드에서 자동 호출하여, 회의 화면 내에 인라인으로 관련 정보와 도구 실행 결과를 즉시 제공합니다.
이를 통해 회의 중 맥락을 놓치지 않고 필요한 정보를 즉각 확인하거나, 대화 도중 필요한 데이터베이스 조회 및 서비스 연동을 별도의 수작업 검색 없이 이어갈 수 있습니다.
3단계 회의 요약과 n8n·Zapier 웹훅 자동화
통화가 종료되면 Call.md는 전체 대화 내용을 바탕으로 다층적인 인텔리전스 문서를 자동 생성합니다.
- 내러티브 개요(Narrative overview): 회의의 전체적인 맥락과 핵심 논의 흐름을 서술형으로 정리한 종합 리포트입니다.
- 주제별 참여자 핵심 요약(Key points by topic): 발화자별 발언 요지와 주요 안건별 핵심 논점을 분리해 일목요연하게 정리합니다.
- 구체적 후속 조치(Action items): 회의 중 약속되거나 할당된 작업 목록과 후속 실행 과제를 명확히 추출합니다.
생성된 리포트는 전사 전문과 대화 지표를 포함한 마크다운(Markdown) 문서로 내보낼 수 있으며, 회의 기록은 로컬 환경에 안전하게 보관됩니다. 아울러 회의 완료 시점에 맞춰 n8n, Zapier, CRM 등 외부 워크플로우 자동화 플랫폼으로 데이터를 즉시 전송할 수 있는 웹훅(Workflow webhooks) 연동을 지원하여, 회의 종료와 동시에 프로젝트 관리 도구의 태스크 생성이나 고객 관리 기록 갱신을 자동화할 수 있습니다.
지원 환경과 기술적 고려사항
Call.md 도입 시 확인해야 할 기술적 요구사항과 제약 사항은 다음과 같습니다.
- 오디오 라우팅 및 시스템 권한: 로컬 마이크 입력과 시스템 사운드를 듀얼 채널로 분리 캡처하므로, 운영체제별 오디오 접근 권한 및 가상 오디오 라우팅 설정이 필요할 수 있습니다.
- 네트워크 및 VideoDB 인프라 의존성: 회의 기록 보관과 마크다운 내보내기는 로컬에서 지원되지만, 실시간 음성 전사와 대화 지표 분석, 에이전트 도구 처리를 위해서는 인터넷 연결과 VideoDB API 및 WebSocket 통신 환경이 연결되어 있어야 합니다.
- 도구 및 모델 레이턴시: 회의 중 MCP 도구 호출과 실시간 인텔리전스 기능의 반응 속도는 연결된 MCP 서버의 상태 및 상류 AI 모델의 응답 레이턴시에 따라 영향을 받을 수 있습니다.
회의를 단순한 음성 아카이브가 아닌 실시간 자동화와 에이전트 연동의 진입점으로 전환하고자 하는 개발자와 팀은 GitHub 오픈소스 저장소(video-db/call.md)를 통해 코드베이스를 확인하고 직접 빌드해 활용할 수 있습니다.