EVOHARNESSBENCH가 묻는 것: 하네스가 커져도 에이전트의 기존 능력은 유지될까 | DAKER 커뮤니티

2026년 9월 3일 arXiv에 공개된 EVOHARNESSBENCH는, 에이전트 성능을 볼 때 과제만 바뀐다고 가정해 온 익숙한 틀을 조금 다르게 뒤집습니다. 최근의 LLM 에이전트는 도구, 재사용 스킬, 전문 에이전트가 얹힌 하네스 위에서 보고 행동합니다. 문제는 이 하네스가 실무에서 계속 커진다는 점입니다. 새 능력을 붙일수록 더 잘해야 할 것 같지만, 실제로는 이전에 되던 일이 흔들릴 수도 있습니다.

이 논문이 지금 읽을 만한 이유도 여기에 있습니다. 과제 스트림의 변화보다 하네스 자체의 진화를 중심에 놓고, 기존 능력의 유지와 새 능력에 대한 적응을 따로 보자는 제안이기 때문입니다. 오늘 글은 초록에서 확인되는 범위만 바탕으로 핵심을 정리합니다.

도구·스킬·에이전트가 늘 때 기존 능력이 유지되는지 잽니다

과제가 아니라 하네스가 바뀌는 설정

논문은 2026-09-03 arXiv에 올라왔습니다. 초록은 arXiv:2609.04280에서 볼 수 있고, 영문 제목은 EVOHARNESSBENCH: Can Your Agents Keep Pace with an Evolving Harness?입니다. 저자는 Zixuan Ke, Vaidehi Patil, Haizhou Shi, Yang Li, Ye Liu, Sarath Shekkizhar, Anurag Koul, Jiayu Wang, Xuan Phi Nguyen, Semih Yavuz, Mohit Bansal, Shafiq Joty입니다. PDF는 같은 번호의 pdf에 있습니다.

이 벤치의 출발점은 간단합니다. 에이전트는 도구, 재사용 가능한 스킬, 전문 에이전트로 이뤄진 하네스를 통해 환경을 보고 행동합니다. 그런데 기존 연속 학습 벤치는 대체로 시간이 지나며 바뀌는 대상을 과제 스트림에 두고, 하네스는 고정해 두었습니다. EVOHARNESSBENCH는 그 비정상성을 외부에서 공급되는 하네스 자체에 둡니다.

기존 연속 학습 벤치가 과제 스트림의 변화를 다뤘다면, EVOHARNESSBENCH는 하네스의 진화를 평가 대상으로 삼습니다.

초록에 따르면 축은 tools, skills, agents의 세 가지입니다. 검증기 기반 벤치에서 결정적으로 구성한 멀티스테이지 하네스 스트림은 17개이며, 과제는 802개, 도구는 520개, 스킬은 42개, 에이전트는 62개입니다. 세부 과제 이름이나 리더보드 수치는 초록에 없으므로 여기서는 다루지 않습니다.

유지와 적응을 분리해 보는 두 가지 평가

논문은 평가를 두 갈래로 나눕니다. 하나는 deployment evaluation이고, 다른 하나는 self-evolving adaptation evaluation입니다.

deployment evaluation은 하네스가 커질 때 이전에 가능했던 능력이 그대로 남아 있는지 보는 설정입니다. 반면 self-evolving adaptation evaluation은 새 능력이 들어왔을 때, 그동안 쌓아 둔 경험이 계속 유용하게 작동하는지 살펴봅니다. 둘은 비슷해 보이지만 초점이 다릅니다. 하나는 유지에, 다른 하나는 적응에 가깝습니다.

하네스 진화에서는 이전 능력을 지키는 문제와 새 능력에 적응하는 문제가 같은 질문이 아닙니다.

이 구분이 중요한 이유는, 에이전트 시스템이 커질수록 한쪽이 좋아진다고 다른 쪽도 자동으로 좋아진다고 보기 어렵기 때문입니다. 논문은 바로 그 지점을 벤치 차원에서 분리해 보려 합니다.

초록이 보고한 세 가지 빈틈

초록에서 보고한 핵심 결과는 세 가지입니다.

첫째, 하네스 확장만으로도 이전에 풀었던 과제의 성능이 떨어지는 harness-induced forgetting이 나타납니다. 즉, 새 도구나 새 구성요소를 붙였다고 해서 항상 순증가만 일어나는 것은 아닙니다.

둘째, 자기 진화 적응의 이득은 단계, 축, 환경마다 일정하지 않습니다. 어떤 상황에서는 경험 축적이 도움이 되지만, 다른 상황에서는 그 효과가 고르지 않을 수 있다는 뜻입니다.

셋째, 유지(retention)와 적응(adaptation)은 서로 다른 방향으로 움직일 수 있습니다. 이전 능력을 잘 지킨다고 해서 새 능력 적응이 자동으로 좋아지는 것도 아니고, 반대로 적응이 잘 된다고 해서 유지가 보장되는 것도 아닙니다.

유지와 적응은 함께 좋아질 수도 있지만, 서로 어긋날 수도 있습니다.

이 논문을 읽을 때 놓치지 말아야 할 점

이 글은 초록에 나온 사실만 옮깁니다. 따라서 세부 리더보드 점수, 코드 저장소, 구체적인 과제 목록은 확정하지 않습니다. 초록에는 코드 URL도 없습니다.

또한 이 결과는 모든 하네스 확장이 반드시 forgetting을 만든다는 보증이 아닙니다. 논문이 보고하는 것은 벤치에서 관측된 빈틈과 평가 관점입니다. 따라서 숫자를 인용할 때는 17개 스트림, 802개 과제, 520개 도구, 42개 스킬, 62개 에이전트라는 구성 규모와 함께, 그것이 하네스 진화를 다루는 설정이라는 점을 같이 보는 것이 좋습니다.

참고 자료

arXiv:2609.04280 — EVOHARNESSBENCH: Can Your Agents Keep Pace with an Evolving Harness? (2026-09-03)
PDF

여러분은 에이전트 평가에서 과제 변화보다 하네스 변화가 더 큰 변수라고 느낀 적이 있는지 궁금합니다.