Karpathy의 검증 가능성: 왜 수학과 코딩에서 AI가 특히 빠르게 발전할까 | DAKER 커뮤니티

왜 어떤 일에서는 AI가 유난히 잘하는 것처럼 보이고, 어떤 일에서는 아직 답답하게 느껴질까요. 수학과 코딩이 대표적입니다. 이 차이를 이해할 때 Karpathy가 말한 검증 가능성(verifiability)이라는 관점이 꽤 선명한 기준이 됩니다.

핵심은 단순합니다. 정답을 자동으로 확인할 수 있고, 빠르게 여러 번 시도할 수 있으며, 실패해도 다시 시작하기 쉬운 영역일수록 AI가 연습하고 개선되기 좋습니다. 이 글에서는 그 원칙을 정리하고, 바이브 코딩 작업을 더 검증 가능한 형태로 바꾸는 방법을 함께 봅니다.

검증 가능한 영역

검증 가능성이 중요한 이유

Karpathy는 AI가 빠르게 발전하는 영역의 공통점으로 resettable, efficient, rewardable이라는 세 조건을 짚습니다. 이 세 가지가 겹칠수록 자동화와 최적화가 쉬워집니다.

정답을 확인할 수 있고, 많이 시도할 수 있으며, 실패 후 다시 시작할 수 있는 영역일수록 AI가 강해집니다.

Resettable은 실패해도 상태를 되돌리고 다시 시작할 수 있다는 뜻입니다. Efficient는 시도 비용이 낮아 반복 연습이 쉽다는 뜻입니다. Rewardable은 정답이나 부분 점수를 자동으로 줄 수 있다는 뜻입니다.

이 관점으로 보면 수학과 코딩이 왜 AI에 유리한지 이해하기 쉽습니다. 답이 맞는지 비교적 분명하게 확인할 수 있고, 테스트를 반복 실행할 수 있으며, 실패한 뒤에도 다시 시도하는 비용이 상대적으로 낮기 때문입니다.

프롬프트와 작업 설계에 어떻게 적용할까

이 원칙은 실전 프롬프트를 설계할 때도 그대로 이어집니다. 성공 기준이 모호한 요청보다, 통과 여부를 확인할 수 있는 요청이 더 잘 작동합니다.

좋은 글을 써 달라는 요청보다 체크리스트를 만족하는 글을 만들고 각 항목을 자체 검토하라는 요청이 더 낫습니다.
앱을 만들어 달라는 요청보다 특정 테스트를 통과하는 기능을 만들어 달라는 요청이 더 낫습니다.

즉, AI에게 맡길 일을 설명할 때는 결과의 인상보다 검증 기준을 먼저 세우는 편이 좋습니다. 무엇이 성공이고 무엇이 실패인지 분명할수록, AI도 그 기준에 맞춰 더 안정적으로 반복할 수 있습니다.

바이브 코딩 작업을 검증 가능한 형태로 바꾸는 방법

실습의 출발점은 맡길 작업을 resettable, efficient, rewardable한 형태로 다시 쓰는 것입니다. 예를 들어 로그인을 고쳐 달라는 식의 요청보다, 실패 테스트가 통과하도록 고치고 같은 입력으로 재현이 닫히는지 확인하는 식의 요청이 더 검증 가능해집니다.

다음으로는 테스트, 린트, 타입체크, 스크린샷 가운데 하나를 AI의 보상 신호로 두는 방식이 유용합니다. 통과 증거가 없으면 다음 기능으로 넘어가지 않는 식으로 흐름을 잡으면 됩니다.

전략 수립이나 창의 작업처럼 검증이 어려운 일은 사람 리뷰 루프를 더 촘촘히 두는 편이 좋습니다. AI가 초안을 만들고, 체크리스트로 점검한 뒤, 사람이 한 줄 판정을 내리는 순서가 여기에 해당합니다.

해커톤 제출 전처럼 시간이 제한된 상황에서는 요구사항을 자동 검증 가능과 사람 검증 필요의 두 칸으로 나눠 보는 방법도 도움이 됩니다. 이때는 자동으로 닫을 수 있는 항목부터 정리하는 것이 효율적입니다.

자주 막히는 지점

가장 흔한 문제는 성공 기준이 좋아 보임에 머무는 경우입니다. 이렇게 되면 통과와 실패가 분명하지 않아 AI도, 사람도 판단이 흔들리기 쉽습니다.

또 다른 막힘은 테스트를 나중에 넣겠다고 미루다가 재현이 사라지는 경우입니다. 이때는 기능 범위를 줄이고, 통과와 실패가 분명한 한 건부터 다시 만드는 편이 좋습니다.

막히면 기능을 줄이고, 통과와 실패가 분명한 한 건부터 다시 만드는 것이 좋습니다.

다음 학습으로 이어 보기

검증 가능성 원칙이 잡히면 Software 2.0의 목적함수 설계, 한 번에 하나만 바꾸는 디버깅, append-and-review 기억법과도 자연스럽게 연결됩니다. 이어서 아래 글들을 함께 보면 맥락을 더 잘 잡을 수 있습니다.

관련 글: Karpathy Software 2.0 · Karpathy 신경망 레시피 디버깅 · Karpathy Append-and-review · 학습 디렉터리

참고 자료

https://daker.ai/community/post-mtuo1zv7-40351d93
https://daker.ai/community/karpathy-nn-recipe-debug-one-change-at-a-time
https://daker.ai/community/karpathy-append-review-memory-method
https://daker.ai/community?directory=learning

여러분은 지금 맡기고 있는 작업 가운데 무엇을 가장 먼저 검증 가능한 형태로 바꿔 보고 싶으신가요?