LLaDA-Image 공개: 6B DiT 학습 레시피와 가중치, 어디까지 확인됐나 | DAKER 커뮤니티
2026년 9월 3일 arXiv에 공개된 LLaDA-Image는 성능 수치만이 아니라 학습 레시피를 함께 연다는 점에서 눈길을 끕니다. 이미지 생성 모델을 볼 때 결과 샘플 몇 장보다 학습 순서와 공개 범위를 먼저 확인해야 하는 이유가 여기에 있습니다.
이번 글은 논문 초록과 공개된 PDF에서 확인되는 사실만 정리합니다. 없는 수치나 아직 드러나지 않은 URL은 보태지 않고, 지금 시점에 무엇이 확인됐는지 차분히 살펴봅니다.

논문 공개와 기본 정보
논문은 2026-09-03 arXiv에 올라왔습니다. 초록은 arXiv:2609.03796에서, PDF는 같은 번호의 pdf에서 볼 수 있습니다. 영문 제목은 LLaDA-Image: Building Strong Image Generators with Fully Open Training Recipes입니다. 저자는 Chuyan Chen, Haoxing Chen, Kun Chen 외 30명입니다.
이 글은 제공된 사실과 초록에서 확인한 범위만 옮기며, 초록에 없는 숫자와 주소는 쓰지 않습니다.
LLaDA-Image가 제안하는 학습 구조
LLaDA-Image는 처음부터 학습한 6B Diffusion Transformer(DiT)와, LLaDA2.0-Mini 기반의 동결된 비전–언어 이해 모듈을 하나의 프레임워크로 묶습니다. 핵심은 처음부터 이미지–텍스트 쌍에만 의존하지 않는다는 점입니다. 먼저 이미지 단독 사전학습과 미드트레이닝으로 시각 생성 사전을 만들고, 그 다음 텍스트 정렬을 이어 가는 구조를 취합니다.
최적화에는 DiT 전역에 파라미터 없는 RMSNorm과 Muon 옵티마이저를 사용한다고 적습니다. 논문은 이 구성이 사실적인 이미지를 만들면서도 세분화된 편집 지시를 따른다고 보고합니다.
이미지 단독 사전학습과 미드트레이닝으로 시각 생성 사전을 먼저 구축한 뒤 텍스트 정렬로 넘어가는 점이 이 모델의 큰 특징입니다.
Turbo 경로에서 강조한 점
논문은 이어서 LLaDA-Image-Turbo로 증류하면 2–4 샘플링 스텝의 빠른 추론이 가능하다고 설명합니다. 다만 이것은 빠른 추론을 위한 증류 보고이며, 초록만으로 모든 품질 축에서 원본과 동일하다고 단정할 수는 없습니다.
보고된 벤치마크 수치
초록에서 확인되는 벤치마크는 Qwen-Image-Bench입니다. 영어 트랙 overall 53.53, 중국어 트랙 overall 53.38을 보고하며, 오픈소스 모델 가운데 두 트랙 모두에서 새로운 최고 수준이라고 적습니다.
Qwen-Image-Bench에서 영어 트랙 overall 53.53, 중국어 트랙 overall 53.38을 보고합니다.
여기서 중요한 점은 인용 범위를 좁게 유지하는 것입니다. 하위 세부 점수는 초록에 없으므로 이 글에서도 다루지 않습니다. 또한 영어와 중국어 트랙 점수를 하나의 평균처럼 합쳐 쓰는 것도 적절하지 않습니다.
공개 범위는 어디까지 확인됐나
초록은 모델 가중치, 학습 코드, 상세 레시피를 공개한다고 밝힙니다. 다만 구체적인 Hugging Face URL이나 GitHub 주소는 초록에 적혀 있지 않습니다. 따라서 현재 시점에서는 공개 의도를 확인할 수 있지만, 실제 배포 주소는 공식 공지나 저장소 링크가 확인된 뒤에 붙이는 것이 좋습니다.
가중치, 학습 코드, 상세 레시피를 공개한다고 밝혔지만, 구체 URL은 초록에 없습니다.
이 점은 재현 문서를 정리할 때 특히 중요합니다. 논문이 말한 공개 범위와 실제로 확인된 링크를 구분해 적어 두면, 나중에 README나 프로젝트 문서가 불필요하게 부풀려지는 일을 줄일 수 있습니다.
이 논문을 읽을 때 놓치지 말아야 할 점
LLaDA-Image의 의미는 단순히 점수가 높다는 데만 있지 않습니다. 학습 순서를 공개 가능한 레시피로 제시한다는 점이 더 실질적인 가치로 읽힙니다. 사전학습, 미드트레이닝, 정렬, 그리고 선택적 증류라는 단계가 분명하게 드러나기 때문에, 생성 모델을 비교할 때도 결과물만이 아니라 어떤 순서와 설정으로 학습했는지를 함께 볼 수 있습니다.
또한 6B DiT, 동결된 이해 모듈, Muon, parameter-free RMSNorm, Turbo 2–4 스텝 같은 요소는 모두 재현 메모에서 분리해 기록할 만한 항목입니다. 다만 이 설정이 곧바로 다른 팀이나 다른 서비스의 실측 결과를 뜻하는 것은 아니므로, 논문 보고와 자체 실험 결과는 구분해 적는 편이 좋습니다.
이 글이 다루지 않는 것
이 글은 모든 이미지 벤치마크에서 1위를 선언하는 글이 아닙니다. Qwen-Image-Bench의 영어·중국어 overall 수치만 옮깁니다.
또한 세부 하위 점수나 Hugging Face URL을 확정하는 글도 아닙니다. 초록에 없는 항목은 넣지 않았습니다.
마찬가지로 Turbo의 2–4 스텝이 모든 품질 축에서 원본과 같다는 보증도 아닙니다. 논문이 빠른 추론을 위한 증류 경로를 보고했다는 수준에서 이해하면 됩니다.
참고 자료
https://arxiv.org/abs/2609.03796
https://arxiv.org/pdf/2609.03796
이 공개 방식이 앞으로 오픈 이미지 생성 모델의 기준을 어떻게 바꿀지, 어떤 점이 가장 인상적이었는지 궁금합니다.