TTPO: 정답 라벨 없이 시험 시간에 추론 정책을 고치는 방법 | DAKER 커뮤니티

2026년 8월 27일 Aozhe Wang 연구팀이 arXiv에 공개한 TTPO는, 정답 라벨이 없는 시험 시간에도 추론 정책을 고칠 수 있는 방법을 다룹니다. 수학 추론에서 성능을 끌어올린 강화 학습과 온폴리시 자기 증류는 보통 정답 라벨에 기대기 때문에, 정답이 숨겨진 실제 평가 상황에서는 그대로 쓰기 어렵습니다. TTPO는 이 막힌 지점에서 출발합니다.

핵심은 다수결을 정답처럼 그대로 믿지 않는 데 있습니다. 여러 롤아웃이 같은 답에 모였더라도, 그 합의가 틀릴 수 있기 때문입니다. TTPO는 동의한 롤아웃과 반대한 롤아웃을 다르게 다루는 비대칭 설계로 이 문제를 풀려 합니다.

시험 시간에 노트북으로 추론을 고치는 장면

논문은 2026년 8월 27일 arXiv에 올라왔습니다. 초록은 arXiv:2608.27448에서 확인할 수 있습니다. 저자는 Aozhe Wang, Zhengxi Lu, Jianze Wang, Shangke Lv, Ying Liu, Weiming Lu, Jun Xiao, Yueting Zhuang, Hua Yang, Qianglong Chen, Yongliang Shen입니다. 프로젝트 페이지는 zju-real.github.io/TTPO, 코드는 github.com/ZJU-REAL/TTPO입니다. 이 글은 초록에 적힌 사실과 숫자만 사용합니다.

도서관 야간 학습

정답이 없으면 시험 시간 학습은 왜 어려운가

강화 학습과 온폴리시 자기 증류는 수학 추론 성능을 높이는 대표적인 사후학습 방법입니다. 다만 둘 다 정답 라벨을 전제로 삼는 경우가 많습니다. 시험 시간 학습은 지금 풀고 있는 문제 위에서 모델을 조정하는 방식인데, 이 자리에는 정답 라벨이 주어지지 않습니다. 그래서 정답을 보상으로 쓰거나 교사 문맥으로 삼는 접근은 그대로 적용하기 어렵습니다.

이때 자연스럽게 떠오르는 대안이 여러 롤아웃을 뽑아 다수결을 가짜 라벨로 쓰는 방법입니다. 하지만 초록이 지적하듯, 이 방식은 투표가 틀렸을 때 교사 자체가 오염된다는 약점이 있습니다. 잘못된 다수결을 정답처럼 증류에 넣으면, 오류가 토큰 단위로 넓게 퍼질 수 있습니다.

다수결은 라벨이 없는 상황에서 쓸 수 있는 신호이지만, 정답처럼 그대로 증류하면 오히려 교사를 오염시킬 수 있습니다.

그렇다고 다수결을 완전히 버리기도 어렵습니다. 라벨이 없는 환경에서는 모델이 스스로 만든 합의가 사실상 유일한 신호가 되기 쉽기 때문입니다. TTPO는 바로 이 지점에서, 합의에 동의한 롤아웃과 반대한 롤아웃을 같은 방식으로 다루지 않습니다.

TTPO의 핵심: 동의한 롤아웃과 반대한 롤아웃을 다르게 다룹니다

TTPO의 출발점은 비대칭성에 대한 관찰입니다. 가짜 라벨에 반대하는 롤아웃은, 설령 그 가짜 라벨이 완전히 옳지 않더라도 대체로 틀린 쪽일 가능성이 높습니다. 따라서 반대한 롤아웃에는 벌을 주는 신호가 여전히 의미를 가질 수 있습니다. 반면 동의한 롤아웃을 가짜 라벨 쪽으로 강하게 증류하면, 다수결이 틀렸을 때 잘못된 답을 토큰마다 밀어 넣게 됩니다.

TTPO는 이 차이를 목적 함수에 반영합니다. 동의한 롤아웃은 온폴리시 자기 증류로 학습하고, 반대한 롤아웃은 그룹 강화 학습으로 벌합니다. 두 신호를 같은 롤아웃에 동시에 적용하지 않는 점이 중요합니다. 동의한 쪽에는 밀도 높은 감독을 주고, 반대한 쪽에는 라벨 내용에 덜 묶인 벌을 주는 구조입니다.

동의한 롤아웃은 증류하고, 반대한 롤아웃은 그룹 강화 학습으로 벌하는 것이 TTPO의 핵심입니다.

이 설계는 가짜 라벨이 완벽하지 않아도 학습 신호의 근거를 유지하려는 시도라고 볼 수 있습니다. 모델이 좋아질수록 다수결은 더 유용한 자기 감독 신호가 되고, 반대 롤아웃에 대한 벌은 잘못된 경로를 줄이는 역할을 맡습니다.

토큰마다 같은 무게를 주지 않습니다

TTPO는 롤아웃 전체를 한 덩어리로 다루지 않고, 토큰 단위에서도 선택적으로 가중치를 둡니다. 초록에 따르면 증류에서는 이미 수렴한 위치의 가중치를 낮추고, 강화 학습에서는 확신 있는 오류만 벌합니다.

이 구분은 단순하지만 중요합니다. 이미 모델이 잘 맞추고 있는 위치까지 강하게 다시 학습하면 불필요한 갱신이 생길 수 있습니다. 반대로 실패한 롤아웃 안에도 부분적으로는 올바른 계산이 들어 있을 수 있는데, 이를 전부 같은 강도로 벌하면 재사용 가능한 패턴까지 함께 약해질 수 있습니다.

증류는 수렴한 위치를 낮추고, 강화 학습은 확신 있는 오류만 벌합니다.

초록은 이 원칙을 제시하지만, 이 글에서는 초록에 없는 공식이나 구현 수치를 덧붙이지 않습니다. 구체적인 구현은 공개된 코드 저장소에서 확인하는 것이 좋습니다.

라벨 없이도 라벨 기반 감독과 맞붙었습니다

초록에 따르면 TTPO는 라벨이 없는 설정에서, 라벨을 사용하는 온폴리시 자기 증류와 다섯 대회급 벤치에서 비교되었습니다. 다섯 벤치의 이름은 초록에 없으므로 여기서도 적지 않습니다.

숫자는 두 가지가 제시됩니다. Qwen3-1.7B는 시험 시간 학습에서 38.0%에서 45.2%로 올랐습니다. 또 생각 모드를 끈 설정에서는 이득이 25.2%포인트에서 36.4%포인트로 제시됩니다. 초록은 과제 사이 일반화도 강하다고 적고 있습니다.

Qwen3-1.7B는 시험 시간 학습에서 38.0%에서 45.2%로 올랐고, 생각 모드를 끈 설정에서는 이득이 25.2%포인트에서 36.4%포인트로 제시됩니다.

다만 이 숫자는 논문이 다룬 설정의 결과입니다. 다른 과제나 다른 대회 점수로 바꿔 읽으면 안 됩니다. 이 글도 초록에 없는 벤치 이름, 세부 점수표, 추가 해석은 붙이지 않습니다.

공개된 코드와 프로젝트 페이지를 함께 보는 이유

TTPO의 아이디어는 문장으로는 비교적 간단해 보이지만, 실제 재현에서는 분기와 가중치 처리가 중요합니다. 동의한 롤아웃과 반대한 롤아웃이 학습 과정에서 어떻게 나뉘는지, 토큰 단위 마스크가 어떻게 구현되는지는 공개된 저장소를 함께 봐야 확인할 수 있습니다.

그래서 이 논문을 읽을 때는 초록만 보는 것보다, 프로젝트 페이지와 코드를 같이 보는 편이 좋습니다. 특히 비대칭 목적 함수가 실제 코드에서 어떻게 분리되어 있는지 확인해야 TTPO의 의도를 놓치지 않을 수 있습니다.

이 글에서 분명히 하지 않는 것들

이 글은 다섯 벤치 이름을 공개하는 글이 아닙니다. 초록은 다섯 대회급 벤치라고만 적고 있습니다.

또한 다수결을 정답처럼 믿으라는 뜻도 아닙니다. TTPO의 요지는 다수결을 쓰더라도 동의와 반대를 비대칭적으로 다뤄야 한다는 데 있습니다.

모든 토큰을 같은 무게로 갱신하는 방법을 소개하는 글도 아닙니다. 초록은 분명히 증류와 벌의 토큰 선택을 구분합니다.

마지막으로, 정답 라벨이 있는 사후학습을 완전히 대체한다고 단정하는 글도 아닙니다. 이 논문이 다루는 비교는 라벨이 없는 시험 시간 학습이라는 조건 안에서 읽는 것이 맞습니다.

참고 자료

arXiv:2608.27448
프로젝트 페이지
코드

정답 라벨이 없는 평가 환경에서 이런 비대칭 학습 방식이 실제로 얼마나 유용할지, 여러분은 어떻게 보시나요?