TAU-HOME.COM
LOADING

15M 파라미터 소형 에이전트가 Craftax 최종 보스 44% 격파를 주장한 이유

Dan Kondratyuk가 2026년 10월 7일 공개한 에이전트 메타하네스 연구 주장 정리. 15M 파라미터 Craftax 에이전트의 최종 보스 승률 44%, 단일 실행 1회분으로 보이는 약 1센트·10초 주장과 OSS 그래프 DB trackinizer 기반 4,805회 실험 구조를

tau · 2026년 10월 8일

#Craftax #강화학습 #에이전트 #trackinizer #MetaHarness

15M 파라미터 소형 에이전트가 Craftax 최종 보스 44% 격파를 주장한 이유

Dan Kondratyuk(@hyperparticle)가 2026년 10월 7일 X 스레드에서 에이전트 메타하네스(agent meta-harness)가 3주 만에 만든 15M 파라미터 Craftax 에이전트가 최종 보스를 44%의 확률로 격파했다고 주장했다. 같은 주장에 따르면 단일 실행 1회분으로 보이는 비용은 약 1센트, 소요 시간은 10초이다. 상세 내용은 rekursiv.ai 공식 블로그에서 공개됐으며, 메타하네스 자체는 오픈소스가 아니고 이를 구동한 엔진인 trackinizer만 오픈소스라고 밝혔다.

픽셀 로그라이크 던전 보스와 맞선 소형 신경망 게임 에이전트, 연구 대시보드 모티프

이미지 출처: @hyperparticle / X

이번 발표의 뼈대는 '작은 신경망이 LLM의 지식 없이 Craftax를 깰 수 있느냐'는 질문에 대한 저자의 답이다. 저자는 전문가들이 회의적이었다고 전제한 뒤, 메타하네스가 스크래치부터 학습한 15M 파라미터 에이전트로 최종 보스 승률 44%를 달성했다는 주장을 내놨다. 다만 승률 측정 조건, 시도 횟수, 시드 수 같은 독립 검증용 세부 조건은 스레드 원문 증거 범위에서 확인되지 않으므로, 44%는 저자 주장 수치로만 읽어야 한다.

메타하네스와 4,805회 실험 구조

저자에 따르면 메타하네스는 rekursiv-ai의 OSS 그래프 데이터베이스인 trackinizer(github.com/rekursiv-ai/trackinizer) 위에 구축됐다. 연구 과정에서 총 4,805개의 실험을 실행했고, 각 실험은 1개 GPU에서 수 시간씩 학습했다고 밝혔다.

저자가 설명한 재귀 구조는 세 층이다. 에이전트가 연구를 수행하고, 학습자(learner)는 자신의 최고 플레이 구간부터 다시 시작하며, 각 세대의 게임 플레이가 다음 세대를 가르치는 모델을 학습시키는 방식이다. 저자는 trackinizer의 새 UI 업데이트도 무료로 쓸 수 있다고 덧붙였다.

비용 구조를 혼동하지 않아야 한다. 저자가 말한 약 1센트와 10초는 완성된 15M 모델의 단일 실행 1회분으로 보이는 주장이며, 4,805회 실험에 든 학습 비용과는 별개다. 스레드에는 총 학습 비용 합계가 제시되지 않았다.

최종 모델의 플레이와 기간 논란

저자는 최종 15M 파라미터 모델이 적을 가두는 플레이, 적이 코너를 돌 때 미리 사격하는 플레이, 얼음 공격과 불 공격의 상성을 활용하는 플레이를 스크래치부터 스스로 학습했다고 주장했다. 얼음 공격이 불을 이기고, 불 공격이 얼음을 이긴다는 표현은 저자 원문 그대로의 주장이며 독립 검증된 게임 메커니즘 설명이 아니다.

기간 표기에 주의가 필요하다. 첫 포스트의 3주라는 표현에 대해 저자 본인이 후속 포스트에서 보수적 표현이었다고 밝혔다. 실제 게임 격파 자체는 수일 만에 이뤄졌고, 나머지 기간은 점수 개선용 어블레이션과 메타하네스가 아이디어를 더 빨리 발견하도록 만드는 작업에 썼다는 것이 저자의 설명이다. Joshua V. Dillon도 실제 격파는 수일, 3주는 trackinizer 시스템 개선에 쓴 시간이라는 취지로 보충했다.

GPT-6 Astra 비교와 공개 범위

첫 포스트에는 GPT-6 Astra가 승률 1%, 소요 24시간, 비용 83달러를 기록했다는 비교 수치가 함께 제시됐다. 그러나 이 비교의 벤치마크 조건, 실행 환경, 측정 방식은 원문 증거 범위에서 제시되지 않았다. 따라서 이 수치는 독립 벤치마크 결과가 아니라 저자 주장에 따른 비교로만 다뤄야 하며, 기사 본문에서도 확정 사실처럼 인용하지 않았다.

공개 범위도 명확히 구분됐다. 메타하네스가 오픈소스냐는 질문에 저자는 메타하네스 자체가 아니라 이를 구동하는 엔진인 trackinizer를 오픈소스로 공개한다고 답변했다. 전체 연구 서사는 공식 블로그(https://rekursiv.ai/blog/craftax/)에서 확인할 수 있다는 것이 저자의 안내다. 스레드 답글에는 Craftax가 LLM 설계 정책이 아니라 강화학습 알고리즘의 일반 성능을 검증하도록 설계된 벤치마크라는 지적도 있었고, 저자는 에이전트가 제안한 개선이 보드를 2D 그리드로 표현하고 CNN을 쓰는 식으로 비교적 일반적이었다고 반박했다. 이 논쟁의 해결 여부는 확보된 스레드 증거 범위에서 확인되지 않는다.

출처