DRACO 논문 공개: 긴 구간 에이전트 학습에서 루브릭 점수를 스텝별 advantage로 나누는 방법 | DAKER 커뮤니티
긴 구간 에이전트 학습에서는 마지막에 한 번 받는 점수만으로 무엇이 잘됐고 무엇이 잘못됐는지 가리기 어려운 경우가 많습니다. 특히 프로그램 검사기나 정답 성공 신호가 없는 과제라면, 보상 설계 자체가 학습 성능을 좌우합니다.
2026년 9월 4일 arXiv에 공개된 DRACO는 바로 이 지점을 다룹니다. 루브릭으로 궤적 전체를 평가하되, 그 점수를 다시 각 스텝의 책임으로 나눠 GRPO 학습에 쓰는 방식입니다. 아래 내용은 제공된 사실과 초록에서 확인되는 범위만 정리했습니다.

DRACO가 다루는 문제: outcome-blind 긴 구간 에이전트 학습
논문은 2026-09-04 arXiv에 올라왔습니다. 초록은 arXiv:2609.04094에서 볼 수 있고, 영문 제목은 DRACO: Fine-Grained Credit Assignment with Dynamic Rubrics for Long-Horizon Agent Training입니다. 저자는 Shubham Gandhi, Saurabh Goyal, Kiran Kate, Yara Rizk입니다. PDF는 같은 번호의 pdf, 코드는 github.com/IBM/draco에 공개되어 있습니다.
출발점은 분명합니다. 검증기가 있는 과제에는 RLVR이 잘 맞지만, 긴 구간 에이전트 도메인에는 그런 프로그램 검사기가 없는 경우가 많습니다. DRACO는 이런 상황, 즉 정답 성공 신호가 없는 outcome-blind 설정을 전제로 합니다.
다기준 루브릭을 궤적 끝에 한 번만 점수화하면 수십 스텝에 걸친 학습 신호가 지나치게 희소해집니다.
루브릭 자체는 흔히 쓰이는 평가 방식이지만, 궤적당 스칼라 하나만 남기면 어떤 스텝이 기여했는지 학습이 알기 어렵습니다. DRACO는 이 약한 신호를 더 세밀한 학습 신호로 바꾸는 데 초점을 둡니다.
핵심 아이디어: 동적 루브릭과 닫힌 형식 재분배
DRACO는 학습 중 정책 능력 변화에 맞춰 루브릭을 동적으로 생성합니다. 그리고 완료된 궤적에 대해 한 번 점수를 매긴 뒤, 주석된 루브릭을 담당한 스텝으로 그 점수를 재분배해 GRPO용 스텝별 advantage를 만듭니다.
DRACO는 학습된 attribution 모듈을 따로 두지 않고, 루브릭 점수를 스텝 책임으로 닫힌 형식 재분배합니다.
이 점은 중요합니다. 별도의 attribution 네트워크를 추가로 학습하는 대신, 루브릭과 궤적의 관계를 바탕으로 스텝별 credit assignment를 구성한다는 설명입니다. 결과적으로 궤적 끝의 평가 점수를 그대로 두지 않고, 실제 행동 단위의 학습 신호로 바꾸는 구조라고 이해하면 됩니다.
논문 초록에서 보고한 성능
초록 기준으로 보고된 수치는 다음과 같습니다. AppWorld에서는 기반 모델 대비 15.9포인트, 희소 정답 보상으로 학습한 GRPO 대비 5.3포인트 향상을 보고합니다. 또한 검증기 자체는 쓰지 않았다고 적고 있습니다.
도메인 밖 Tau-Bench에서는 프론티어 judge 없이도 기반 모델 대비 5.3포인트 향상을 보고하며, 정답 보상 학습과 다른 루브릭 기반 학습 설정보다 앞선다고 설명합니다.
AppWorld에서는 기반 모델 대비 15.9포인트, 희소 정답 보상 GRPO 대비 5.3포인트, Tau-Bench에서는 기반 대비 5.3포인트 향상을 보고합니다.
다만 절대 점수, 시드 수, 세부 설정 이름, 하이퍼파라미터 같은 항목은 초록에 없는 만큼 여기서 덧붙이지 않습니다.
이 결과를 읽을 때 놓치지 말아야 할 점
이 글이 뜻하는 바를 좁혀 읽는 것이 좋습니다. 먼저, 모든 에이전트 벤치에서 같은 상승 폭이 보장된다는 의미는 아닙니다. 제공된 내용은 AppWorld와 Tau-Bench에 대한 보고입니다.
또한 검증기가 있는 과제에서 RLVR을 대체하자는 주장으로 읽을 필요는 없습니다. 이 논문이 겨냥하는 것은 outcome-blind 설정입니다. 다시 말해, 정답 성공 신호가 없는 환경에서 루브릭 기반 credit assignment를 어떻게 더 촘촘하게 만들 것인가에 관한 제안입니다.
DRACO의 초점은 검증기가 없는 긴 구간 과제에서, 궤적 점수를 스텝별 학습 신호로 바꾸는 데 있습니다.
코드와 원문을 함께 보는 것이 좋은 이유
논문만 읽으면 아이디어는 이해할 수 있지만, 실제 구현 흐름은 코드에서 더 분명해질 수 있습니다. DRACO 코드는 github.com/IBM/draco에 공개되어 있습니다. 원문은 arXiv:2609.04094, PDF는 https://arxiv.org/pdf/2609.04094에서 확인할 수 있습니다.
특히 이 논문은 궤적 전체 점수와 스텝별 재분배를 구분해 보는 것이 핵심이기 때문에, README나 구현 코드를 볼 때도 이 두 층위를 나눠 읽으면 구조를 파악하기 좋습니다.
마무리
DRACO는 루브릭 기반 평가를 단순한 최종 점수로 끝내지 않고, 긴 구간 에이전트 학습에 필요한 스텝별 advantage로 연결하려는 시도입니다. outcome-blind 환경에서 credit assignment를 어떻게 더 세밀하게 만들 수 있는지 관심이 있다면, 이번 논문은 바로 그 문제를 정면으로 다룹니다.
참고 자료
arXiv:2609.04094 — DRACO: Fine-Grained Credit Assignment with Dynamic Rubrics for Long-Horizon Agent Training (2026-09-04)
PDF
GitHub
긴 구간 에이전트 학습에서 보상 재분배를 설계할 때, 여러분은 최종 점수와 스텝별 신호 사이의 간격을 어떻게 줄이고 계신가요?