파인튜닝에서 검증 손실과 체크포인트를 함께 보는 이유 | DAKER 커뮤니티

파인튜닝에서는 학습이 잘되고 있는지 판단할 때 학습 손실만 보면 놓치는 부분이 생깁니다. 특히 기존 모델을 추가로 학습할 때는 학습 데이터에만 지나치게 맞춰지는 과적합을 빨리 알아차리는 것이 중요합니다.

그래서 학습률을 바꾸는 실험에서는 학습 손실뿐 아니라 검증 손실을 함께 비교하고, 중간 학습 상태인 체크포인트도 일정한 간격으로 저장해 두는 것이 좋습니다. 이 글은 DAKER 학습 자료 LLM 파인튜닝 중급 ② — 학습률·오버핏·체크포인트를 바탕으로, 과적합이 시작되는 지점을 어떻게 확인하는지 정리합니다.

파인튜닝 학습률, 한 번에 키우다가 체크포인트로 오버핏을 끊습니다

학습률을 높일 때 검증 손실을 함께 봐야 하는 이유

학습률은 모델이 한 번 학습할 때 내부 수치인 파라미터를 얼마나 크게 바꿀지 정하는 값입니다. 학습 데이터의 오차인 학습 손실이 잠깐 줄었다고 해서 학습률을 계속 높이면, 다른 데이터에서는 성능이 오히려 나빠질 수 있습니다.

학습 손실만 보면 과적합이 시작되는 시점을 놓치기 쉽습니다.

검증 손실을 함께 보지 않으면 성능이 언제부터 흔들렸는지 파악하기 어렵고, 체크포인트를 남기지 않으면 더 나았던 이전 상태로 돌아가기도 어렵습니다.

체크포인트를 저장하며 비교하면 변화가 보입니다

Karpathy식 실습에서는 한 번에 여러 조건을 바꾸기보다, 하나씩 바꾸고 같은 결과를 다시 확인하는 방식을 우선합니다. 여기서는 같은 데이터에서 학습률 하나만 바꾸고, 일정한 학습 단계 간격으로 체크포인트를 저장합니다.

이렇게 하면 학습 속도와 함께 검증 손실이 언제부터 높아지는지 비교할 수 있습니다. 또한 검증 손실이 올라가기 직전의 상태를 남겨 둘 수 있어, 필요할 때 그 지점으로 돌아가 확인하기도 수월합니다.

과적합이 시작되는 지점을 찾으려면 검증 손실의 변화와 저장된 체크포인트를 함께 봐야 합니다.

실험은 같은 조건에서 학습률만 바꿔 진행합니다

실험의 핵심은 비교 기준을 흐리지 않는 데 있습니다. 기준 학습률로 먼저 학습하고 검증 손실을 기록한 뒤, 같은 학습 단계 간격으로 체크포인트를 저장하면서 학습률 하나만 바꿔 봅니다. 그리고 검증 손실이 올라가기 시작한 지점을 적어 두면 됩니다.

이 과정에서 확인할 것은 단순합니다. 검증 손실이 언제부터 나빠졌는지, 그리고 그 직전 체크포인트로 돌아갈 수 있는지입니다.

네 칸 만화가 보여 주는 실험 흐름

파인튜닝 학습률, 한 번에 키우다가 체크포인트로 오버핏을 끊습니다 4칸 만화

네 칸 만화는 학습률을 높인 뒤 검증 손실이 올라가고, 체크포인트가 없으면 이전 상태로 돌아가기 곤란해지는 상황을 보여 줍니다. 마지막 칸에서는 과적합이 시작되는 지점을 확인하고, 저장해 둔 학습 상태를 활용하는 흐름을 설명합니다.

자주 묻는 질문

매 학습 단계마다 체크포인트를 저장해야 하나요

그럴 필요는 없습니다. 이번 연습에서는 비교가 가능하도록 저장 간격을 일정하게 정하고, 그 기록을 바탕으로 과적합이 시작되는 지점을 확인합니다.

학습 손실만 봐도 충분한가요

학습 손실만 보면 과적합을 놓치기 쉽습니다. 검증 손실도 함께 확인하는 것이 좋습니다.

참고 자료

원문 학습 자료: https://daker.ai/public/learning/materials/llm-finetuning-intermediate-2-lr-overfit-checkpoin

오늘은 학습률 실험 하나에서 체크포인트를 저장할 시점을 정하고, 검증 손실이 높아지기 시작한 지점을 한 줄로 기록해 보면 됩니다.

여러분은 파인튜닝 실험에서 검증 손실과 체크포인트를 어떤 기준으로 함께 관리하고 계신가요?