스탠퍼드로 소개된 논문: 루프·정체는 하니스 수정으로, 나쁜 계획은 가중치 학습으로
스탠퍼드 논문으로 소개된(요약자 진술, 원문·소속 미대조) 에이전트 개선 연구를 소개합니다. 여행 계획 벤치마크에서 하니스 진화와 LoRA 파인튜닝이 각각 어떤 지표를 움직였다고 전해졌는지 수치와 함께 정리합니다.
AI 리뷰어 로한 폴(Rohan Paul)이 2026년 10월 10일(현지시간 10월 10~11일 타임라인 기준) X를 통해 스탠퍼드 소속으로 소개된 새 논문 소식(스탠퍼드 소속·저자에 대한 독립 확인 없음)을 전했다. 논문 제목은 후속 게시가 전한 "Harness Evolution Hits a Ceiling: When Weight Training Should Begin"(arXiv 식별자 2610.11655)이며, 에이전트 개선의 두 갈래인 하니스(harness) 수정과 가중치(weight) 학습이 각각 어떤 실패를 고치는지를 구분한 연구라고 소개자는 전했다.

이미지 출처: @rohanpaul_ai on X
핵심 메시지는 진단용 구분이다. 에이전트가 루프에 빠지거나 정체되는 문제는 모델 주변의 프롬프트·도구·검사를 고치는 하니스 진화로 해결하고, 부실한 계획을 내놓는 문제는 가중치 학습으로 해결해야 한다는 것이다. 두 문제를 뒤섞어 하니스 수정만 반복하거나 성급하게 파인튜닝에 들어가는 일을 피하라는 취지다.
실패를 둘로 나누다: 프로세스 실패와 콘텐츠 실패
논문이 제시했다고 소개자가 전한 실패 분류는 두 가지다.
- 프로세스 실패(process failures): 루프(loop)에 빠지거나 스텝 예산(step budget)을 소진하는 등, 실행 과정이 멈추거나 헛도는 경우.
- 콘텐츠 실패(content failures): 실행은 끝나지만 부실한 계획(poor plan)이 전달되는 경우.
연구진은 여행 계획(travel-planning) 벤치마크에서 LLM 주도 루프가 하니스, 즉 모델 주변의 프롬프트·도구·검사를 다시 쓰게 한 뒤, 최적 실행 궤적(best runs)으로 모델을 파인튜닝하는 순서로 실험했다고 로한 폴은 전했다. 하니스는 실행 환경을 고치는 단계, 파인튜닝은 모델 자체의 계획 능력을 고치는 단계로 역할이 나뉜다.
수치로 본 역할 분담: 하니스 진화와 LoRA의 각자 몫
소개 게시물이 전한 수치는 Qwen3.5-4B 기준이며, 요약자의 진술에 의존한 것으로 원문 대조가 필요하다는 점을 먼저 밝힌다.
- 하니스 진화: held-out 과제 점수가 0.16에서 0.30으로 올랐고, 계획 전달률(plan delivery)은 55%에서 90%로 올랐다고 한다. 즉 에이전트가 일을 끝까지 마치는 비율은 하니스 수정만으로 크게 개선됐다는 진술이다.
- 하니스의 한계: 하니스 편집은 부실 계획의 비중을 줄이지 못했다고 한다. 일을 끝내는 것과 좋은 계획을 내는 것은 다른 지표라는 것이다.
- LoRA 어댑터: 부실 계획 비중을 28%에서 5%로 낮춘 것은 LoRA 파인튜닝 단계였다고 한다. 계획의 질은 가중치 학습의 몫이라는 진술이다.
이 수치들의 평가 분할·지표 정의는 메모에 들어 있지 않다. 따라서 확정 성능으로 읽어서는 안 되며, "어느 쪽 수정이 어느 지표를 움직였는가"라는 역할 분담의 방향성으로만 이해해야 한다. 댓글 반응도 같은 맥락이다. 루프 진단이 먼저이고 계획 오류에는 하니스가 통하지 않는다는 점, 작은 모델에서의 결과가 대형 모델에도 그대로 적용되는지는 별도 검증이 필요하다는 지적이 달렸다.
실무적 함의와 한계
실무 관점에서 이 연구가 주는 것은 값싼 진단 순서다. 에이전트가 돌거나 멈춘다면 프롬프트·도구·검사라는 하니스를 먼저 점검하고, 결과물이 끝까지 나오는데 내용이 부실하다면 그때 가중치 학습을 검토하라는 것이다. 순서가 바뀌면 긴 파인튜닝이 헛수고가 될 수 있다.
다만 한계도 명확하다. 본 기사 작성 시점에 번들 내 arXiv 원문 전문이 없어 모든 수치는 소개자(@rohanpaul_ai)의 진술에 의존하며, 스탠퍼드 소속·저자·게재 상태에 대한 독립 확인도 없다. 원문을 직접 대조하기 전에는 수치 인용을 잠정 진술로 취급해야 한다.
출처
- Rohan Paul (@rohanpaul_ai) on X: New Stanford paper finds that harness changes fix agents that loop or stall...
- arXiv: Harness Evolution Hits a Ceiling: When Weight Training Should Begin (arXiv:2610.11655)