makemore MLP 학습: 문자 임베딩과 context window를 함께 이해하는 방법 | DAKER 커뮤니티
bigram 다음 단계가 막연하게 느껴질 때가 있습니다. 앞 문자 하나만 보던 방식에서 여러 문자를 함께 보고, 또 문자를 임베딩으로 바꿔 다루기 시작하면 예측이 왜 달라지는지 한 번에 잡히지 않기 때문입니다.
이번 글은 makemore MLP 학습을 코드 없이 따라가며, context window와 문자 임베딩이 예측에 어떤 차이를 만드는지 정리한 안내입니다. 작은 실습 루프를 기준으로 보면 bigram과 MLP의 차이를 더 분명하게 읽을 수 있습니다.

오늘 무엇을 보게 되나요
bigram 다음 단계에서는 앞 문자 하나만 보지 말고 context window와 문자 임베딩을 분리해 기록해야 예측이 왜 좋아지는지 볼 수 있습니다. 2026년 7월 22일 KST 공개 학습 API 기준 예상 30분, 10개 스테이지, 학습자 24명, 조회 56회로 확인됩니다.
bigram 다음 단계에서는 앞 문자 하나만 보지 말고 context window와 문자 임베딩을 분리해 기록해야 예측이 왜 좋아지는지 볼 수 있습니다.
왜 지금 이 순서를 따라보는 것이 좋을까요
생성 결과만 비교하면 모델이 무엇을 더 봤는지 놓치기 쉽습니다. context window는 입력 범위를 넓히고, embedding은 문자를 학습 가능한 좌표로 바꾸기 때문에 loss 변화와 예측 오류를 같은 표에서 읽을 수 있습니다.
외부 공식 정보는 비공개 검증으로만 확인했고, 공개 본문에는 DAKER 내부 학습 링크만 남겼습니다.
핵심 개념: makemore MLP 학습은 무엇이 다른가요
Karpathy의 makemore 흐름은 같은 이름 데이터 문제를 점점 키우며 모델 구조의 역할을 확인하게 만듭니다. MLP 단계에서는 문자 토큰, 임베딩 차원, context 길이, hidden layer를 따로 보면서 bigram보다 많은 정보를 쓰는 모델의 첫 감각을 잡습니다.
makemore MLP 학습이란, 이전 문자 여러 개를 작은 벡터로 바꾼 뒤 다음 문자를 예측하는 다층 퍼셉트론 실습입니다.
| 구분 | 오늘의 질문 | 남길 증거 |
|---|---|---|
| 입력 | makemore bigram 다음 단계에서 문자 임베딩과 context window가 왜 필요한지 이해하고 싶은 한국어 학습자 | 기준일과 샘플 기록 |
| 실험 | 가장 작은 확인 단위가 무엇인가요? | 10분 안에 확인한 로그 |
| 검증 | 성공과 실패를 어떻게 나눴나요? | 체크리스트 결과 |
작은 실습은 어떻게 시작하면 되나요
이번 단계의 핵심은 모델을 크게 돌리는 것이 아니라, 입력이 어떻게 바뀌는지 눈으로 확인하는 데 있습니다. 이름 데이터 한 줄을 기준으로 앞 문자 3개를 표시하고, 각 문자를 숫자 토큰과 임베딩 벡터라는 두 칸으로 나눠 적어 보면 됩니다.
그다음 bigram 예측과 context window 예측이 보는 정보 차이를 한 줄로 설명하고, loss 로그를 볼 때 입력 길이, 임베딩 차원, hidden 크기를 같은 표에 남기면 비교 기준이 분명해집니다.
4~6컷 코믹 해설은 이렇게 보면 됩니다

코믹 해설은 개념을 순서대로 붙잡는 데 도움이 됩니다. 학습자가 bigram 표만 보고 다음 문자를 맞히려 하다가, context window 카드가 앞 문자 3개를 한 묶음으로 보여 주고, embedding 카드가 문자를 작은 좌표 벡터로 바꾸는 흐름으로 이어집니다. 이후 MLP 카드가 hidden layer를 지나 다음 문자 후보를 비교하고, 마지막에는 결과 이름보다 입력 범위와 loss 표를 먼저 읽는 시선으로 정리됩니다.
자주 막히는 지점은 어디인가요
가장 흔한 혼동은 임베딩을 단순한 숫자 라벨로 보는 경우입니다. 여기서 임베딩은 문자에 붙인 번호가 아니라, 학습되는 좌표라는 점이 중요합니다.
또 context 길이와 hidden 크기를 동시에 바꾸면 무엇이 성능 변화의 원인인지 흐려집니다. bigram과 MLP를 다른 데이터 기준으로 비교하거나, loss가 낮아진 이유를 입력 정보 증가와 파라미터 증가로 나눠 보지 않는 경우도 자주 막히는 지점입니다.
실수 방지를 위한 확인 기준
기록을 남길 때는 context window에 들어가는 앞 문자 수를 명확히 쓰고, 문자 토큰과 임베딩 벡터를 다른 칸에 적는 것이 좋습니다. 또한 bigram 기준선과 같은 데이터로 비교했는지, loss 변화의 원인을 입력 정보와 모델 크기로 나눠 보았는지도 함께 확인하면 됩니다.
다음 학습은 어디로 이어지나요
카파시식 AI 학습법, Software 2.0 학습, micrograd 역전파 학습, makemore 문자 모델 학습, nanochat 프리트레이닝 학습, DAKER 학습 디렉터리 순서로 보면 작은 모델, 목적함수, 프리트레이닝 로그, 저수준 학습 로그를 오늘 실습과 자연스럽게 연결할 수 있습니다.
참고 자료
공식 출처는 코드없이 배우는 머신러닝 첫걸음: 상 교재와 DAKER 학습 디렉터리입니다.
자주 묻는 질문
makemore MLP 학습은 bigram과 무엇이 다른가요?
bigram은 앞 문자 하나를 주로 보지만 MLP는 여러 앞 문자를 임베딩으로 바꿔 다음 문자를 예측합니다.
context window는 왜 필요한가요?
이전 문자 여러 개를 함께 보면 이름 안의 짧은 패턴을 더 잘 사용할 수 있기 때문입니다.
임베딩은 무엇을 의미하나요?
문자 하나를 학습 가능한 작은 숫자 좌표로 바꿔 모델이 문자 관계를 조정하게 만드는 표현입니다.
오늘 남길 결과물은 무엇인가요?
앞 문자 3개, 임베딩 칸, bigram 대비 차이, loss 로그 기준을 한 표에 남기면 됩니다.
오늘은 전체를 끝내려 하기보다, 체크리스트에서 하나를 골라 작은 증거부터 남겨 보면 어떨까요?