아티피셜 애널리시스, 10월 말 'Intelligence Index v5' 공개 예고… Terminal-Bench Science 및 비공개 코딩 벤치마크 도입
AI 벤치마크 분석 플랫폼 아티피셜 애널리시스(Artificial Analysis)가 10월 말 차세대 모델 종합 평가 지표인 'Intelligence Index v5'를 출시합니다. 프론티어 AI 모델 측정을 위해 Terminal-Bench Science와 비공개 데이터셋 기반 신규
AI 벤치마크 및 모델 성능 분석 플랫폼 아티피셜 애널리시스(Artificial Analysis)가 2026년 10월 9일, 프론티어 AI 모델 평가 체계를 대폭 개편한 차세대 지표인 'Intelligence Index v5'를 10월 말 정식 출시한다고 공식 발표했습니다. 이번 버전 5 개편에서는 최신 과학적 추론 및 복합 터미널 과제를 평가하는 'Terminal-Bench Science'와 오염을 방지하는 비공개 데이터셋(private dataset) 기반 신규 코딩 벤치마크가 핵심 변경 사항으로 포함됩니다.

이미지 출처: Artificial Analysis (@ArtificialAnlys)
아티피셜 애널리시스의 Intelligence Index는 글로벌 AI 연구소와 엔터프라이즈 환경에서 프론티어 LLM의 종합 지능 수준과 비용 대비 성능을 가늠하는 대표적인 독립 평가 지표로 널리 활용되어 왔습니다. 이번 v5 개편은 기존 공개 벤치마크의 데이터 오염(data contamination) 문제를 극복하고 나날이 고도화되는 최신 추론형 모델들의 한계를 정밀하게 측정하기 위한 도약으로 평가받고 있습니다.
Intelligence Index v5의 주요 개편 사항: 과학 추론과 비공개 코딩 평가
공식 발표에 따르면 이번 Intelligence Index v5는 프론티어 AI 성능 측정 방식에 있어 유의미한 도약(significant leap)을 목표로 설계되었습니다. 공개된 핵심 변경 사항은 다음과 같습니다.
- Terminal-Bench Science 신규 편입: 실제 터미널 환경에서 과학적 계산, 데이터 처리, 복합 도구 활용 및 과학 영역의 연구 과제를 자율적으로 수행하는 능력을 측정하는 Terminal-Bench Science가 종합 지수 산출에 반영됩니다.
- 비공개 데이터셋 기반 신규 코딩 벤치마크 도입: 학습 데이터 오염(contamination)이나 벤치마크 과적합(overfitting)으로 인한 성능 왜곡을 원천 차단하기 위해 외부에 노출되지 않은 독자적 비공개 데이터셋(private dataset) 기반 코딩 평가가 새롭게 적용됩니다.
이를 통해 단순 코드 자동 완성이나 정형화된 알고리즘 테스트를 넘어, 오염되지 않은 환경에서 모델이 실제 소프트웨어 엔지니어링 문제를 얼마나 안정적으로 해결하는지 객관적으로 검증할 수 있게 됩니다.
프론티어 모델 평가 생태계에 미치는 영향 및 향후 일정
최근 주요 프론티어 AI 모델들이 기존 벤치마크에서 만점에 가까운 점수를 기록하며 벤치마크 포화(saturation) 현상이 가속화되는 상황에서, 과학적 연구 환경 시뮬레이션과 비공개 코딩 테스트를 결합한 v5 지표는 모델 간 실질적 추론 격차를 가려내는 새로운 기준점이 될 전망입니다.
아티피셜 애널리시스는 구체적인 릴리스 날짜와 개편된 지수에 포함될 프론티어 모델들의 초기 벤치마크 결과 및 순위표 세부사항은 10월 말 공식 출시 시점에 맞춰 순차적으로 공개할 예정(Stay tuned for more)이라고 밝혔습니다.
출처
- Artificial Analysis 공식 X: Intelligence Index v5 출시 예고 공지