Qwen3.8-Flash-Next: 토큰당 6B 활성으로 397B급 전작에 근접한 설계가 보여준 것 | DAKER 커뮤니티
모델 규모를 말할 때 이제는 총 파라미터만으로 설명하기 어려운 시점입니다. 같은 숫자라도 토큰마다 실제로 켜지는 양이 얼마인지, 어떤 구성요소를 가속기 밖에 두는지에 따라 비용과 성능의 해석이 달라지기 때문입니다.
2026년 8월 31일 공개된 Qwen Team의 Qwen3.8-Flash-Next 논문은 이 지점을 분명하게 보여줍니다. 총 125B 규모의 희소 MoE 모델이지만 토큰마다 활성 파라미터는 6B이고, 별도의 51B n-gram 임베딩 테이블은 호스트 메모리에 둡니다. 전작인 397B-A17B(Qwen3.7-Plus)보다 활성 파라미터와 학습 토큰은 약 1/3, 학습 FLOPs는 약 1/9인데도 사전학습 벤치마크 14개 가운데 8개에서 앞섰습니다.
큰 모델인지보다 무엇을 켜고 무엇을 호스트에 두는지까지 함께 봐야 설계를 제대로 읽을 수 있습니다.
논문은 2026년 8월 31일 arXiv에 올라왔습니다. 초록은 arXiv:2608.30320에서 볼 수 있고, 영문 제목은 On the Design of Qwen3.8-Next Architecture: Evaluation, Efficiency, and Training Stability입니다. 저자 표기는 Qwen Team이며, 핵심 기여자로 Zihan Qiu, Zekun Wang, Xiao Li, Yanpeng Li, Yang Xu, Yixuan Wang, Huaqing Zhang, Rui Men, Bo Zheng, Dayiheng Liu가 적혀 있습니다. PDF는 같은 번호의 pdf, FlashQLA 코드는 GitHub QwenLM/FlashQLA에 공개되어 있습니다.
활성 6B와 호스트 n-gram 51B를 분리해 봐야 합니다
Qwen3.8-Flash-Next는 희소 MoE 구조로 총 파라미터가 125B입니다. 하지만 토큰마다 실제로 활성화되는 양은 6B입니다. 여기에 백본 밖 용량으로 단일 n-gram 임베딩 계층이 따로 있으며, 51B 규모의 테이블은 호스트 메모리에서 미리 가져오는 방식으로 설계됐습니다.
이 구조는 전작 397B-A17B와 비교할 때 더 분명해집니다. 활성 파라미터와 학습 토큰은 대략 1/3, 학습 FLOPs는 대략 1/9 수준인데도, 사전학습 벤치마크 14개 중 8개에서 앞서고 나머지 6개도 최대 2.6점 차이로만 뒤졌습니다.
총 125B라는 숫자만으로는 이 모델의 의도를 설명하기 어렵고, 6B 활성과 51B 호스트 테이블을 함께 봐야 합니다.
논문이 보는 평가 축은 세 가지입니다. 손실과 다운스트림 성능, 학습·프리필·디코드 비용, 그리고 최적 하이퍼파라미터와 학습 안정성에 미치는 영향입니다. 여기서 중요한 점은 손실과 정확도가 항상 같은 방향으로 움직이지 않는다는 사실입니다. n-gram 어휘를 키우면 손실은 단조롭게 낮아지지만, 다운스트림 성능은 포화하는 경향을 보였습니다.
GDN 혼합과 QSA가 긴 문맥 효율을 받칩니다
토큰 혼합은 계층별 하이브리드 구조입니다. Gated DeltaNet(GDN)과 전역 어텐션을 섞고, 네 계층마다 전역 어텐션 하나를 둡니다. 계속 사전학습 단계에서는 이 전역 어텐션 계층을 Qwen Sparse Attention(QSA)으로 바꿉니다. QSA는 압축된 가벼운 인덱서를 이용해 마이크로 블록을 점수화합니다.
논문에 따르면 1M 문맥에서 QSA는 커널 기준으로 밀집 어텐션 대비 프리필 7.6배, 디코드 4.9배 빠릅니다. 긴 문맥 처리에서 어떤 방식으로 비용을 줄였는지 보여주는 대목입니다.
잔차 경로는 네 갈래로 넓히고, 원소별 게이트를 쓰는 Gated Residual(GR)을 사용합니다. 여기에 아키텍처와 Muon 옵티마이저의 조합이 최적 학습률과 배치 크기를 더 높은 쪽으로 옮기고, 배치 크기 워밍업을 불필요하게 만들며, 스트레스 테스트에서 안정성을 높였다고 설명합니다. 이전 구조는 최적 학습률의 4배에서 자주 불안정해졌지만, 새 조합은 안정적이었고 전체 규모 학습에서 손실 스파이크가 한 번도 없었습니다. qk-clip이나 SwiGLU-clip도 쓰지 않았습니다.
효율 개선은 단순한 커널 최적화가 아니라 토큰 혼합, 잔차 구조, 옵티마이저 안정성까지 묶인 결과입니다.
제거 실험 수치도 함께 제시됩니다. GDN 하이브리드 제거 실험(25B-A3B)에서 평균은 53.81이고, 전역 어텐션만 쓴 경우는 49.87, SWA는 51.15입니다. QSA와 전역 어텐션 평균은 76.8 대 75.9, RULER 512K–1M은 93.00 대 90.08입니다. FlashQLA는 GPU에서 Triton 기준 대비 순전파 2–3배, 역전파 약 2배로 보고됐습니다.
Table 11은 전작 추월보다 비교 방식이 더 중요합니다
논문 본문은 Flash-Next-Base, Qwen3.8-27B-Base, Qwen3.7-Plus-Base를 나란히 비교합니다. 숫자를 그대로 옮기면 다음과 같습니다.
| Benchmark | Flash-Next-Base | Qwen3.8-27B-Base | Qwen3.7-Plus-Base |
|---|---|---|---|
| MMLU | 90.36 | 87.51 | 90.43 |
| MMLU-Pro | 73.23 | 68.60 | 70.90 |
| SuperGPQA | 51.36 | 44.86 | 48.42 |
| BBH | 90.87 | 89.56 | 89.41 |
| GPQA | 51.42 | 45.01 | 51.52 |
| GSM8K | 93.29 | 93.18 | 92.95 |
| MATH | 72.78 | 60.54 | 74.38 |
| EvalPlus | 78.76 | 76.05 | 78.06 |
| MultiPL-E | 79.09 | 74.50 | 81.68 |
| SWEBench-Pretrain | 50.99 | 41.66 | 49.24 |
| MGSM | 89.33 | 86.37 | 85.42 |
| MMMLU | 84.86 | 79.74 | 84.53 |
| INCLUDE | 78.40 | 74.37 | 78.90 |
이 표를 보면 Flash-Next가 27B 밀집 모델보다 여러 축에서 앞서고, Plus-Base와는 과제마다 앞뒤가 갈립니다. MATH처럼 Qwen3.7-Plus-Base가 앞서는 지표도 있습니다. 그래서 이 논문을 읽을 때는 단순히 이겼다, 졌다보다 어떤 비용 조건에서 어느 정도까지 따라붙었는지를 함께 보는 편이 정확합니다.
이 논문은 모든 과제에서 전작을 압도했다는 이야기가 아니라, 훨씬 적은 활성량과 FLOPs로 성능 격차를 매우 좁혔다는 보고에 가깝습니다.
이 논문이 말하지 않는 것도 분명합니다
먼저, 모든 과제에서 397B 전작을 이긴다는 주장은 아닙니다. 사전학습 벤치마크 14개 중 8개에서 앞섰고, 나머지 6개는 최대 2.6점 차이로 뒤졌습니다.
또한 활성 6B만으로 125B 전체가 한 번에 돌아간다는 뜻도 아닙니다. 토큰마다 켜지는 양이 6B이고, 51B n-gram 테이블은 호스트에 둡니다.
손실이 내려가면 다운스트림도 항상 오른다는 법칙을 제시하는 것도 아닙니다. 논문은 오히려 n-gram 어휘 확대가 손실을 낮추면서도 다운스트림은 포화할 수 있다고 적습니다.
FlashQLA가 모든 하드웨어에서 동일하게 2–3배 빠르다는 보증도 아닙니다. GPU에서 Triton 기준 대비 순전파 2–3배, 역전파 약 2배라는 보고입니다.
마지막으로, 이것은 특정 대회 결과나 우승 공지가 아니라 아키텍처·효율·안정성에 대한 논문과 공개 커널 코드 안내입니다.
참고 자료
arXiv:2608.30320 — On the Design of Qwen3.8-Next Architecture: Evaluation, Efficiency, and Training Stability (2026-08-31)
PDF
FlashQLA
총 파라미터보다 활성 파라미터와 호스트 메모리 구성을 함께 보는 방식이 앞으로 모델 비교에 얼마나 중요해질지, 어떻게 보시는지 궁금합니다.