makemore 문자 모델 학습: 이름 데이터로 토큰과 loss를 함께 읽는 첫 실습 | DAKER 커뮤니티

makemore 첫 실습에서 중요한 것은 멋진 생성 결과를 보는 일이 아니라, 입력 줄과 문자 토큰, 다음 문자 예측, loss 변화가 어떻게 이어지는지 한 흐름으로 읽는 일입니다. 이름 데이터처럼 짧은 텍스트를 다루면 이 연결이 비교적 선명하게 드러나서, 생성 모델 학습의 기본 감각을 익히기에 좋습니다.

이번 글은 코드없이 배우는 머신러닝 첫걸음: 상과 DAKER 학습 디렉터리를 바탕으로, 코드 없이도 바로 따라가 볼 수 있는 작은 실습 루프를 정리한 글입니다.

DAKER 학습 makemore 문자 모델 학습 대표 만화 카드
DAKER 학습 makemore 문자 모델 학습 핵심 질문과 오늘 실행할 액션을 요약한 대표 카드

왜 지금 이 실습을 보면 좋을까요?

생성 모델을 처음 볼 때는 결과 문장이 그럴듯한지부터 확인하기 쉽습니다. 하지만 그렇게만 보면 데이터 품질이 어떤 영향을 주는지, 학습 신호가 어디서 생기는지 놓치기 쉽습니다. 문자 수준 모델은 토큰 단위가 작아서 데이터 전처리와 분포, 예측 오류, loss 변화를 짧은 루프로 확인하기 좋습니다.

2026년 7월 21일 KST 공개 학습 API 기준 예상 30분, 10개 스테이지, 학습자 23명, 조회 55회로 확인됩니다.

makemore 첫 실습의 핵심은 생성 결과보다 입력 줄, 문자 토큰, 다음 문자 예측, loss 변화를 같은 표에서 읽는 것입니다.

makemore 문자 모델에서 먼저 봐야 할 핵심

Karpathy의 makemore 흐름은 bigram에서 MLP와 Transformer까지 같은 문제를 점점 키워 가며 배우는 방식입니다. 이때 출발점에서는 이름 생성 자체보다, 한 줄이 어떤 문자 토큰으로 나뉘는지, 어떤 다음 문자 예측이 loss를 만드는지 확인하는 것이 더 중요합니다.

makemore 문자 모델이란, 줄 단위 텍스트를 문자 단위 토큰으로 보고 다음 문자를 예측해 비슷한 문자열을 생성하는 학습 예제입니다.

특히 bigram은 앞 문자 하나로 다음 문자를 예측하는 가장 작은 기준선이라서, 데이터 분포와 예측 실패를 연결해 보기 좋습니다. 이후 MLP나 Transformer로 넘어가더라도, 처음의 이 기준선이 있어야 비교가 흔들리지 않습니다.

오늘 실습에서 남기면 좋은 기준

구분오늘의 질문남길 증거
입력Karpathy makemore로 문자 수준 언어 모델을 배우며 데이터, 토큰, loss 로그를 연결해 보고 싶은 한국어 학습자기준일과 샘플 기록
실험가장 작은 확인 단위가 무엇인가요?10분 안에 확인한 로그
검증성공과 실패를 어떻게 나눴나요?체크리스트 결과

작은 실습 루프는 어떻게 시작하면 될까요?

처음부터 전체를 다 이해하려 하기보다, 아주 작은 단위로 입력과 예측을 연결해 보는 것이 좋습니다. 다음 순서로 보면 됩니다.

  1. DAKER 학습에서 코드없이 배우는 머신러닝 첫걸음 교재를 엽니다.
  2. 이름 데이터 10줄만 골라 각 줄의 시작, 문자, 끝 표시를 나눠 씁니다.
  3. bigram 관점에서 앞 문자와 다음 문자 쌍을 10개만 만듭니다.
  4. 예측이 자주 틀리는 문자 쌍을 하나 고르고 왜 어려운지 적습니다.
  5. loss가 내려갔는지보다 같은 기준으로 로그를 비교했는지 먼저 확인합니다.
loss가 내려갔는지보다 같은 기준으로 로그를 비교했는지 먼저 확인하는 것이 중요합니다.

코믹 해설은 어떤 흐름으로 보면 좋을까요?

DAKER 학습 makemore 문자 모델 학습 실습 흐름 4~6컷 카드
DAKER 학습 makemore 문자 모델 학습 실습 흐름을 장면별로 보여 주는 워크플로 카드

4~6컷 코믹 해설은 결과 감상에서 출발해, 다시 데이터와 로그로 시선을 돌리는 구조로 보면 이해가 쉽습니다. 생성된 이름이 그럴듯해 보여도, 실제 학습의 핵심은 한 줄이 어떻게 토큰으로 나뉘고 어떤 예측 오류가 비용으로 연결되는지 확인하는 데 있습니다.

  1. 학습자가 생성된 이름 결과만 보며 좋아합니다.
  2. makemore 데이터 카드가 한 줄을 문자 토큰으로 쪼갭니다.
  3. bigram 카드가 앞 문자와 다음 문자 쌍을 보여 줍니다.
  4. loss 로그 카드가 틀린 예측과 비용을 연결합니다.
  5. 학습자는 결과 감상이 아니라 토큰 표와 로그 비교로 다음 실험을 정합니다.

자주 막히는 지점은 무엇인가요?

초보자가 가장 자주 놓치는 부분은 생성 결과와 학습 근거를 분리해서 보지 못하는 점입니다. 아래 항목은 실습 중 특히 자주 헷갈리는 지점입니다.

실수 방지 체크리스트

다음 학습은 어디로 이어질까요?

오늘 실습으로 bigram 기준선을 이해했다면, 다음에는 더 큰 모델과 더 긴 학습 흐름으로 자연스럽게 이어갈 수 있습니다. 카파시식 AI 학습법, Software 2.0 학습, nanochat 프리트레이닝 학습, llm.c GPT-2 재현 학습, DAKER 학습 디렉터리 순서로 보면 작은 모델, 목적함수, 프리트레이닝 로그, 저수준 학습 로그를 오늘 실습과 연결해 볼 수 있습니다.

참고 자료

코드없이 배우는 머신러닝 첫걸음: 상
DAKER 학습 디렉터리

자주 묻는 질문

makemore 문자 모델 학습은 초보자가 어떻게 시작하나요?

이름 데이터 몇 줄을 문자 토큰으로 나누고 다음 문자 예측 표를 만드는 것부터 시작하면 됩니다.

bigram부터 보는 이유는 무엇인가요?

앞 문자 하나로 다음 문자를 예측하는 가장 작은 기준선이라 loss와 데이터 분포를 쉽게 연결할 수 있기 때문입니다.

loss가 내려가면 바로 성공인가요?

아닙니다. 같은 데이터, 같은 기준, 같은 로그 칸으로 비교했는지 먼저 확인해야 합니다.

다음 학습은 무엇으로 이어지나요?

bigram 기준선을 이해한 뒤 MLP, batch normalization, Transformer로 모델 크기를 단계적으로 키우면 됩니다.

오늘은 전체를 끝내려 하기보다, 체크리스트에서 하나를 골라 작은 증거를 남겨 보면 어떨까요?