RTX 5090으로 처음부터 학습한 Puro-2B, 계산 비용 6,900달러 미만이 뜻하는 것 | DAKER 커뮤니티

2026년 8월 27일 공개된 Puro-2B는 소비자용 RTX 5090 GPU를 바탕으로 처음부터 학습한 2B 규모 모델 모음입니다. 요즘 오픈 가중치는 많지만, 실제로 다시 학습해 볼 수 있는 공개 레시피는 드뭅니다. 이 논문은 그 빈자리를 비용과 재현성이라는 두 축에서 건드립니다.

특히 숫자를 읽는 방식이 중요합니다. 최고 모델의 계산 비용은 6,900달러 미만이고, 저자들의 평가 프로토콜에서 Qwen2.5-1.5B에 근접합니다. 또 별도로 제시한 비용 스케일링 법칙은 약 4,400달러, 곧 5,090달러보다 적은 금액으로 Qwen2-1.5B 성능에 도달하기에 충분하다고 말합니다. 비슷해 보이는 숫자들이지만 비교 대상이 서로 다르기 때문에, 이 차이를 구분해 읽는 것이 좋습니다.

가정용 데스크톱과 그래픽카드가 보이는 작은 연구실

논문은 2026년 8월 27일 arXiv에 올라왔습니다. 초록은 arXiv:2608.27370에서 볼 수 있습니다. 저자는 Kairong Luo, Jiarui Cui, Yaorui Yin, Shengqi Chen, Yiming Yang, Linxiang Gao, Yanmohan Wang, Mingzhe Zhang, Kaiyue Wen, Kaifeng Lyu, Wenguang Chen이며, 분량은 62쪽입니다. 가중치와 데이터, 코드 모음은 Hugging Face 컬렉션 thu-pacman/puro-2b에 공개되어 있습니다. 이 글은 초록에 나온 달러와 토큰 예산을 중심으로 정리하며, 초당 토큰 수와 GPU 대수처럼 초록에 없는 값은 덧붙이지 않습니다. 하드웨어 표기는 RTX 5090 GPU로 유지합니다.

5090이 들어간 미니 랩

왜 이 논문이 눈에 띄는가

언어모델 사전학습은 오랫동안 비용의 문제였습니다. 열린 가중치와 공개 레시피는 이미 적지 않았지만, 실제로 접근 가능한 예산과 하드웨어를 전제로 한 사전학습 사례는 많지 않았습니다. 논문이 비교 대상으로 든 숫자만 봐도 분위기를 알 수 있습니다. Llama-3.2-3B를 학습하는 비용은 150만 달러를 넘고, SmolLM3-3B를 재현하는 비용은 70만 달러를 넘습니다.

가중치를 내려받는 것과 같은 학습을 다시 돌릴 수 있는 것은 다른 문제입니다.

Puro-2B는 이 간극을 줄이려는 시도입니다. 최대 1.4T 토큰, FP8, 소비자용 RTX 5090 GPU를 바탕으로 학습했으며, 모델 모음 안에는 토큰 예산과 레시피 조합이 다른 여러 체크포인트가 포함됩니다. 최고 모델의 계산 비용은 6,900달러 미만이고, 저자들의 평가 프로토콜에서 Qwen2.5-1.5B에 근접한다고 설명합니다. 여기서 중요한 점은, 이 문장을 논문 바깥의 더 넓은 승패 서사로 바꾸지 않는 것입니다. 초록은 모든 벤치마크 우위를 말하지 않습니다.

비용을 낮춘 다섯 가지 축

초록은 비용 절감의 배경으로 다섯 가지를 함께 제시합니다. 하드웨어 선택, 낮은 정밀도, 하이퍼볼 최적화, 커리큘럼 모델 평균, 데이터 레시피입니다. 이 다섯 요소는 하나로 뭉뚱그리기보다 각각 따로 읽는 편이 정확합니다. 하드웨어만 바꾸면 정밀도 이득이 빠지고, 정밀도만 낮추면 최적화와 데이터 순서의 효과를 놓치게 됩니다.

하드웨어 선택은 소비자용 RTX 5090 GPU입니다. 낮은 정밀도는 FP8입니다. 하이퍼볼 최적화는 가중치 갱신을 고정 반지름 안으로 묶는 최적화로 소개됩니다. 커리큘럼 모델 평균은 데이터 순서와 후반 체크포인트 평균을 함께 설계하는 방법입니다. 데이터 레시피는 어떤 토큰을 어떤 예산으로 넣는지와 연결됩니다. 같은 2B 규모라도 토큰 예산과 순서가 달라지면 다른 체크포인트가 되는 이유가 여기에 있습니다.

이 논문의 핵심은 단일 비법이 아니라, 다섯 요소를 함께 조합한 공개 레시피에 있습니다.

그래서 이 결과를 읽을 때는 무엇을 바꿨고 무엇을 그대로 두었는지 분리해 보는 것이 좋습니다. 예를 들어 FP8만 바꾼 실험과 커리큘럼만 바꾼 실험은 서로 다른 질문을 던집니다. 반대로 초록에 없는 초당 토큰 수나 GPU 대수를 끼워 넣으면 비교축이 흐려집니다.

6,900달러 미만과 4,400달러는 같은 숫자가 아닙니다

이 논문에서 가장 자주 오해될 수 있는 부분은 비용 숫자의 의미입니다. 최고 모델의 계산 비용 6,900달러 미만은, 저자들의 평가 프로토콜에서 Qwen2.5-1.5B에 근접한 모델에 대한 설명입니다. 반면 Puro Cost Scaling Law가 가리키는 약 4,400달러는 Qwen2-1.5B 성능에 도달하기에 충분하다는 비용 추정입니다. 비교 대상도 다르고, 문장의 성격도 다릅니다.

6,900달러 미만은 최고 모델의 계산 비용이고, 약 4,400달러는 비용 스케일링 법칙이 제시한 도달 추정치입니다.

함께 읽어야 할 숫자도 정리해 둘 필요가 있습니다. 150만 달러와 70만 달러는 각각 Llama-3.2-3B 학습과 SmolLM3-3B 재현의 기존 비용입니다. 1.4T는 최대 토큰 예산입니다. 6,900달러 미만은 최고 모델 계산 비용입니다. 4,400달러와 5,090달러는 스케일링 법칙이 가리키는 Qwen2-1.5B 도달 비용과 그보다 적은 금액이라는 설명에 연결됩니다.

또 하나 짚어둘 점은, 이 숫자들이 총비용 청구서가 아니라는 사실입니다. 논문은 계산 비용을 말합니다. 데이터 수집, 실패 실험, 전처리, 인건비까지 포함한 전체 프로젝트 비용이라고 적지는 않습니다. 따라서 이 수치를 그대로 다른 팀의 실제 청구서와 등치시키는 것은 조심하는 편이 좋습니다.

사전학습 커리큘럼이 사후학습 결과를 바꿀 수 있다는 점

논문은 사전학습 커리큘럼이 사후학습 이후 성능에 어떤 영향을 주는지도 살핍니다. 이 지점은 공개 가중치만 있는 모델로는 확인하기 어려운 부분입니다. 전체 사전학습 파이프라인이 열려 있기 때문에, 같은 사후학습을 서로 다른 사전학습 순서 위에 올려 비교할 수 있습니다.

이 말은 파인튜닝 중심의 작업에도 그대로 이어집니다. 밑바탕이 되는 모델의 데이터 순서와 예산이 다르면, 같은 지도 미세조정을 거친 뒤에도 결과가 달라질 수 있습니다. 따라서 사후학습 결과만 보고 차이를 모두 파인튜닝 탓으로 돌리는 해석은 이 논문이 보여주는 문제의식과 맞지 않습니다.

같은 사후학습이라도, 어떤 사전학습 커리큘럼 위에 올렸는지에 따라 결과는 달라질 수 있습니다.

이 때문에 공개 체크포인트를 읽을 때도 이름만 보는 것으로는 부족합니다. 토큰 예산과 레시피 조합을 함께 봐야 하고, 비교를 남길 때도 그 정보를 같이 기록하는 편이 좋습니다. 모음 안에 여러 모델이 있는 이유도 바로 이 조합 차이 때문입니다.

공개 레시피와 라이선스를 함께 읽어야 합니다

Puro-2B의 데이터, 코드, 가중치는 Apache 2.0으로 공개되어 있습니다. 관련 자료는 Hugging Face 컬렉션에서 확인할 수 있습니다. 다만 상위 데이터 일부는 원 라이선스가 다를 수 있으므로, 실제 활용 전에는 컬렉션 안내를 먼저 읽는 것이 좋습니다.

이 논문의 의미는 단순히 가중치가 열렸다는 데만 있지 않습니다. 레시피가 함께 열려 있기 때문에, 어떤 체크포인트를 받았는지, 어떤 예산과 커리큘럼을 썼는지까지 추적할 수 있습니다. 가중치만 받아 쓰면 편할 수는 있지만, 이 논문이 열어 둔 재현성과 비교 가능성의 절반은 놓치게 됩니다.

이 글이 말하지 않는 것

몇 가지는 분명히 선을 그어 두는 편이 좋습니다. 이 글은 GPU 한 장으로 끝났다고 GPU 대수를 확정하는 글이 아닙니다. 초록은 RTX 5090 GPU라고 적지만, 대수는 주지 않습니다. 초당 토큰 수도 없습니다.

또 이 글은 모든 벤치마크에서 Qwen2.5-1.5B를 이겼다고 말하지 않습니다. 초록은 최고 모델이 저자들의 평가 프로토콜에서 그 모델에 근접한다고 적습니다. 프로토콜 밖의 승패를 새로 만들지 않는 것이 정확합니다.

마찬가지로 4,400달러와 6,900달러 미만을 같은 비교로 읽지 않습니다. 전자는 Qwen2-1.5B 도달 추정이고, 후자는 최고 모델이 Qwen2.5-1.5B에 근접한 계산 비용입니다. 그리고 이 글은 총비용 청구서를 공개한 글도, 상용 API 출시 공지도 아닙니다. 연구 레시피와 공개 가중치에 관한 이야기입니다.

정리하며

Puro-2B가 흥미로운 이유는 단순히 싸다는 인상 때문이 아닙니다. 소비자용 RTX 5090 GPU, FP8, 공개 레시피, 그리고 사전학습 커리큘럼까지 포함한 비교 가능성을 함께 내놓았기 때문입니다. 최고 모델의 계산 비용 6,900달러 미만, 비용 스케일링 법칙이 제시한 약 4,400달러, 최대 1.4T 토큰, Apache 2.0 공개라는 네 가지 축만 정확히 기억해도 이 논문을 과장 없이 소개할 수 있습니다.

원문을 직접 보고 싶다면 arXiv:2608.27370와 Hugging Face 컬렉션 thu-pacman/puro-2b를 함께 읽어보면 됩니다.

참고 자료

arXiv:2608.27370 — Puro-2B (2026-08-27)
Hugging Face 컬렉션 thu-pacman/puro-2b

이 논문에서 가장 주목한 숫자나 해석 지점이 있다면 무엇이었는지 궁금합니다.