보안 AI 에이전트 벤치마크를 위한 WitFoo Precinct 6 오픈 SOC 데이터셋
실제 엔터프라이즈 SOC 환경에서 수집된 200만 건 이상의 비식별화 보안 이벤트, 인시던트 출처 그래프, MITRE ATT&CK 매핑 및 자연어 공격 분석 리포트를 제공하는 오픈소스 사이버보안 데이터셋.
보안 관제 센터(SOC)와 침해 사고 대응을 자동화하려는 AI 에이전트 연구가 활발해지고 있지만, 실제 환경을 반영한 대규모 보안 데이터셋은 극히 드물었습니다. 사이버보안 플랫폼 기업 윗푸(WitFoo)가 자사의 보안 운영 플랫폼 Precinct 6.x 환경에서 실제 수집되어 비식별화된 대규모 오픈 보안 이벤트 데이터셋(witfoo/precinct6-cybersecurity)을 Hugging Face에 Apache-2.0 라이선스로 공개했습니다.

이미지 출처: WitFoo / @hetmehtaa
이번에 공개된 데이터셋은 단순한 단일 공격 기법 설명이나 합성 로그 수준을 넘어, 실제 158개 엔터프라이즈 보안 제품과 261개 리드 탐지 규칙을 거친 200만 건(2,011,674건) 이상의 보안 이벤트 로그와 13,119건의 인시던트 출처 그래프(Provenance Graph), 그리고 자연어 공격 분석 리포트를 포괄적으로 제공합니다.
200만 건의 실제 SOC 이벤트와 MITRE ATT&CK 매핑 구조
데이터셋은 실제 운영 환경의 트래픽 분포를 충실히 반영하고 있습니다.
- 3단계 레이블링: 전체 2,011,674건의 보안 이벤트 중 99.4% 이상이 정상(benign) 트래픽으로 구성되어 있으며, 실제 침해 시나리오에 해당하는 의심(suspicious) 및 악성(malicious) 이벤트가 정밀하게 레이블링되어 있습니다.
- 다양한 보안 제품군 연동: 158종의 상용 보안 솔루션에서 발생한 이벤트와 261개 리드 탐지 규칙을 기반으로 이벤트를 연계 분석했습니다.
- MITRE ATT&CK 컨텍스트: 각 공격 이벤트와 탐지 규칙에 대응하는 MITRE ATT&CK 기법(Techniques) 및 전술(Tactics) 매핑 메타데이터가 포함되어 보안 에이전트의 전술 추론 평가에 직접 활용할 수 있습니다.
더 방대한 규모의 벤치마크가 필요한 연구자를 위해 5개 조직에서 1억 1,400만 건(114,421,340건) 이상의 이벤트를 집계한 witfoo/precinct6-cybersecurity-100m 데이터셋도 함께 배포되었습니다.
13,000건 이상의 인시던트 출처 그래프와 자연어 공격 리포트
이번 데이터셋의 핵심적인 차별점은 단편적인 로그 나열이 아닌, 사건의 전후 인과관계를 추적할 수 있는 출처 그래프(Provenance Graph)와 자연어 리포트를 함께 제공한다는 점입니다.
- 인시던트 출처 그래프: 13,119건의 인시던트별로 총 35,133개 노드와 634,190개 엣지로 연결된 그래프 데이터(GraphML 및 streaming NDJSON 포맷)를 제공하여 침해 사고의 전파 경로를 시각화하고 그래프 신경망(GNN) 또는 그래프 기반 AI 에이전트 모델에 즉시 주입할 수 있습니다.
- 자연어 공격 분석 리포트: 각 인시던트의 정형 메타데이터를 기반으로 생성된 템플릿 기반 공격 보고서(
graph/attack_reports.jsonl)를 수록하여, LLM 기반 보안 분석 에이전트가 생성한 인시던트 브리핑 요약의 정확도를 평가하는 레퍼런스로 활용할 수 있습니다.
4단계 PII 비식별화 파이프라인과 데이터셋 활용 시 유의점
민감한 엔터프라이즈 데이터를 안전하게 공개하기 위해 WitFoo는 정규식(Regex), 포맷 전용 파서, 머신러닝 기반 개체명 인식(ML/NER), 그리고 Claude AI 검토로 이어지는 4단계 비식별화 파이프라인을 적용했습니다. 초기 릴리즈에서 지적된 잔여 식별자 문제를 해결한 v2.0.0 버전으로 전면 재생성되어 안전성을 강화했습니다.
다만 보안 에이전트 벤치마크 설계 시 반드시 주의해야 할 한계점도 존재합니다.
- 근사 오라클(Approximate Oracle): 데이터셋에 포함된 모든 레이블은 독립된 인간 보안 분석가의 전수 수동 감수가 아니라, WitFoo Precinct의 자동 상관관계 분석 엔진 규칙에 의해 부여된 것입니다.
- 평가 권장사항: 에이전트를 이 데이터셋으로만 평가할 경우 특정 관제 엔진의 상관 분석 편향을 학습할 수 있으므로, 최종 벤치마크 점수의 신뢰도를 확보하기 위해서는 사람이 직접 검증한 소규모 홀드아웃(Holdout) 평가셋과 병행하여 교차 검증하는 것이 권장됩니다.
출처
- Hugging Face Datasets: witfoo/precinct6-cybersecurity
- Hugging Face Datasets (100M): witfoo/precinct6-cybersecurity-100m
- GitHub: witfoo/dataset-from-precinct6
- WitFoo Research: Open cybersecurity research datasets
- Het Mehta X (@hetmehtaa): Dataset release announcement