멀티 하네스 RL에서 정말 중요한 것: 보상 그룹핑보다 평가 하네스 | DAKER 커뮤니티

2026년 9월 3일 arXiv에 공개된 Multi-Harness RL 논문은, 코딩 에이전트 학습에서 자주 한 덩어리로 묶이던 멀티 하네스 설정을 조금 더 정확하게 나눠 보게 합니다. 여러 하네스에 정책을 노출하는 일과, 보상을 어떤 경계 안에서 비교해 advantage를 계산하는 일은 비슷해 보이지만 같은 선택은 아닙니다. 이 논문은 그중에서도 후자, 즉 그룹핑 규칙이 실제 이식성에 얼마나 영향을 주는지를 따로 떼어 봅니다.

특히 눈에 띄는 대목은 학습 레시피보다 평가 하네스가 결과를 더 크게 좌우했다는 점입니다. 멀티 하네스라는 말만으로 실험을 설명하면 놓치기 쉬운 부분이라, 지금 읽어둘 만한 이유가 분명합니다.

여러 코딩 하네스 보상을 한데 묶어도 이식성은 거의 안 오릅니다

논문은 2026-09-03 arXiv에 올라왔습니다. 초록은 arXiv:2609.04518에서 볼 수 있고, 영문 제목은 What Does Multi-Harness RL Learn? Credit Assignment and Portability in Coding Agents입니다. 저자는 Chenqian Le, Jiayi Cheng, Qijia He, Runhao Li, Yinghao Li, Xupeng Chen입니다. PDF는 https://arxiv.org/pdf/2609.04518입니다. 이 글은 원문에 적힌 범위만 바탕으로 정리합니다.

멀티 하네스 레시피를 두 선택으로 나눠 봅니다

저자들은 에이전트 RL이 전체 실행 하네스를 통해 이뤄질 때, 흔히 멀티 하네스라고 부르는 설정 안에 사실 두 가지 선택이 섞여 있다고 설명합니다. 하나는 정책을 여러 하네스에 노출하는 것이고, 다른 하나는 보상을 하나의 relative-advantage 그룹 안에서 어떻게 비교할지 정하는 일입니다.

이 논문은 저장소 수준 코딩 문제에서 두 번째 선택만 분리해 실험합니다. 출발점은 Qwen3-8B의 지도 학습 워밍 스타트 하나입니다. 그 위에서 Aider, OpenHands, Qwen Code, SWE-agent의 같은 frozen task-harness 기록을 동일한 업데이트 수로 재플레이합니다.

여기서 비교한 GRPO 규칙은 두 가지입니다. Within은 task-harness 쌍마다 하나의 그룹을 두는 방식이고, Cross는 하나의 과제 안에서 하네스 보상을 함께 풀링하는 방식입니다.

이 논문의 핵심은 여러 하네스를 썼느냐보다, 보상을 어떤 경계 안에서 비교했느냐를 따로 떼어 본 데 있습니다.

점수를 가장 크게 흔든 것은 평가 하네스였습니다

평가는 봉인된 SWE-bench Verified 오라클로 진행합니다. 네 개의 소스 하네스와 함께, 학습에 쓰지 않은 minimal harness도 평가에 포함합니다. 초록에서 저자들은 평가 하네스가 지배 변수라고 보고합니다.

봉인 평가 24,000회에서 평균 solve rate는 2.14%에서 9.27%까지 움직였고, 이는 4.3배 차이입니다. 반면 학습 레시피가 움직인 폭은 1.16이라고 적습니다.

봉인 평가 24,000회에서 평균 solve rate는 2.14%에서 9.27%로 움직였고, 학습 레시피 변화 폭은 1.16에 그쳤습니다.

이 결과는 멀티 하네스 학습을 해석할 때, 학습 방식만 볼 것이 아니라 어떤 하네스로 평가했는지를 반드시 함께 적어야 한다는 뜻에 가깝습니다. 같은 모델이라도 평가 환경이 달라지면 인상 자체가 크게 달라질 수 있기 때문입니다.

Cross가 Within보다 이식성을 더 높였다고 보기는 어렵습니다

held-out 하네스에서 Cross에서 Within을 뺀 값은 +0.25pp였고, 95% 신뢰구간은 [-0.48, +1.02]입니다. 초록 기준으로 보면 이 차이는 작고, 신뢰구간도 0을 포함합니다.

또한 학습 시드 3개를 풀링한 값은 +0.16이고 구간은 [-0.41, +0.72]입니다. 개별 시드 추정치의 부호가 바뀐다고 적혀 있으며, 각 규칙의 시드 범위는 0.42pp에서 0.45pp로 규칙 간 차이보다 큽니다.

held-out 하네스에서 Cross와 Within의 차이는 +0.25pp였고, 95% 신뢰구간은 [-0.48, +1.02]입니다.

즉 Cross가 항상 더 낫다고 말하기는 어렵습니다. 적어도 초록에 적힌 수치만 보면, 그룹핑 규칙 차이보다 평가 하네스와 시드 변동이 더 크게 보입니다.

Cross는 하네스 정보를 더 남기지만, held-out 성능은 비슷했습니다

논문은 두 규칙 모두 가장 큰 이득을 같은 소스 하네스에서 얻는다고 설명합니다. 그리고 Cross의 advantage에서는 생성 하네스를 out-of-fold 분류기가 shuffled-label 기준선보다 +4.48pp 높게 복구하지만, Within의 advantage에서는 그런 복구가 되지 않는다고 적습니다.

그럼에도 두 규칙은 held-out 점수와 하네스 안 행동 분포에서 같은 수준에 도달합니다. 학습 데이터의 절반을 on-policy로 다시 모았을 때도 이 결론은 바뀌지 않는다고 합니다.

Cross-harness credit는 설정 적응을 주지만, Within-harness credit보다 더 이식 가능한 능력을 주지는 않는다고 논문은 정리합니다.

이 대목은 특히 중요합니다. Cross 방식이 하네스별 특성을 더 많이 품고 있을 수는 있지만, 그것이 곧바로 더 나은 이식성으로 이어진다고 보기는 어렵다는 뜻이기 때문입니다.

이 논문을 읽을 때 같이 봐야 할 포인트

초록만 놓고 보면, 이 논문이 말하는 실무적 메시지는 비교적 분명합니다. 멀티 하네스 RL을 보고할 때는 그룹핑 경계를 명시하고, 학습에 쓰지 않은 하네스에서도 시험해야 한다는 점입니다.

따라서 결과를 정리할 때는 적어도 학습 하네스, 평가 하네스, 그룹핑 규칙, held-out 점수를 분리해 적는 편이 좋습니다. 그래야 멀티 하네스라는 한 단어가 가리는 차이를 드러낼 수 있습니다.

이 글이 말하는 범위

이 글은 Cross가 Within보다 항상 낫다고 말하지 않습니다. held-out 차이의 신뢰구간은 0을 포함합니다.

또한 모든 코딩 에이전트와 모든 벤치에서 평가 하네스가 4.3배 차이를 만든다고 일반화하지도 않습니다. 여기서 옮긴 수치는 초록에 적힌 봉인 평가 범위에 한정됩니다.

마지막으로 코드 저장소 주소는 초록에 없습니다. 따라서 이 글도 없는 링크를 덧붙이지 않습니다.

참고 자료

arXiv:2609.04518 — What Does Multi-Harness RL Learn? Credit Assignment and Portability in Coding Agents
PDF

코딩 에이전트 실험을 정리할 때 여러분은 학습 레시피와 평가 하네스를 어느 정도까지 분리해 기록하고 계신가요?