학습률 실험이 흔들릴 때, 한 칸씩 고정해 비교하는 방법 | DAKER 커뮤니티

학습률은 손실을 빨리 낮추고 싶을수록 크게 잡고 싶어지는 값입니다. 하지만 스텝을 무리하게 키우면 곡선이 튀고, 실험마다 결과가 달라져 무엇이 달라졌는지조차 비교하기 어려워집니다.

이럴 때 필요한 것은 더 빠른 설정이 아니라, 다시 비교 가능한 상태로 돌아가는 일입니다. 이 글은 DAKER 학습 자료 AI를 위한 미분 중급 ③ — 학습률·스텝 감각을 바탕으로, 크게 밟던 실험을 한 칸씩 고정해 살펴보는 감각을 정리합니다.

학습률 감각, 스텝을 크게 잡다가 한 칸씩으로 고정해 실험이 안정됩니다

스텝을 크게 잡을수록 비교가 어려워지는 이유

학습률은 기울기 방향으로 한 번에 얼마나 움직일지를 정하는 값입니다. 너무 크면 발산하거나 진동이 생기고, 너무 작으면 진도가 느려집니다. 문제는 손실이 기대만큼 내려가지 않을 때 여러 값을 한꺼번에 바꾸기 시작하는 순간입니다.

seed, 에폭, 배치까지 함께 바뀌면 결과가 흔들려도 원인을 짚기 어렵습니다. 곡선이 튀어도 운이 나빴다고 넘기기 쉽고, 기록이 없으면 어제와 오늘의 차이도 확인하기 어렵습니다.

빠르게 찾는 것보다 먼저 필요한 것은 재현 가능하게 비교하는 일입니다.

한 칸씩 고정하고 표로 쌓는 방식

Karpathy식 실습에서는 먼저 작은 고정 학습률로 baseline을 잡습니다. 같은 데이터, 같은 seed에서 학습률만 바꿔 보면서 표를 쌓아 가는 방식입니다. 이렇게 하면 어떤 값에서 안정적이었는지, 어디서부터 발산이나 진동이 나타났는지를 비교할 수 있습니다.

흐름은 단순합니다. 작은 고정 학습률로 baseline 곡선을 남기고, 학습률만 한 단계씩 올려 같은 에폭을 돌립니다. 발산이나 진동이 보이면 직전 값으로 되돌아가고, 최종 손실과 안정 여부를 표에 한 줄씩 적으면 됩니다.

한 실험에서는 변수 하나만 바꾸는 것이 좋습니다.

오늘 장면을 만화처럼 보면

학습률 감각, 스텝을 크게 잡다가 한 칸씩으로 고정해 실험이 안정됩니다 4칸 만화

오늘 장면의 흐름은 크게 키움, 발산, 고정 실험표, 안정으로 이어집니다. 핵심은 학습률을 고정한 상태에서 비교 가능한 실험을 만드는 데 있습니다.

짧게 정리하는 두 가지 질문

학습률을 매번 바꿔도 되나요?

탐색 단계에서는 가능합니다. 다만 한 실험 안에서는 하나만 바꾸고 기록을 남겨야 비교가 가능합니다.

학습률은 작을수록 좋은가요?

그렇지는 않습니다. 너무 작으면 시간만 늘어납니다. 목표는 무조건 작은 값을 고르는 것이 아니라, 안정되는 구간을 표로 찾는 데 있습니다.

참고 자료

https://daker.ai/public/learning/materials/ai-diff-part-3-learning-rate-step-intuition

여러분은 학습률을 정할 때 어떤 방식으로 기록하고 비교하는 편인지 궁금합니다.