Qwen3.8-Flash-Next 공개, Qwen4 아키텍처 미리보기에서 봐야 할 점 | DAKER 커뮤니티
Qwen 팀이 2026년 8월 공개한 Qwen3.8-Flash-Next는 단순한 신모델 추가라기보다, 다음 세대인 Qwen4를 받칠 구조를 먼저 보여주는 실험 미리보기라는 점에서 눈길을 끕니다. 모델 하나의 성능표보다 아키텍처 방향을 먼저 읽어야 하는 이유가 여기에 있습니다.
특히 이번 공개는 파라미터 표기, 컨텍스트 길이, 하이브리드 어텐션, 사고 모드 기본값처럼 헷갈리기 쉬운 지점이 많습니다. 원문은 Qwen3.8-Flash-Next 블로그와 Hugging Face 모델 카드입니다. 이 글은 그 두 문서를 기준으로 핵심만 구조적으로 정리합니다.

Qwen4를 받칠 실험 미리보기로 공개됐습니다
Qwen3.8-Flash-Next의 가장 중요한 성격은 모델 카드에 적힌 그대로, Qwen4를 받칠 아키텍처의 실험 미리보기라는 점입니다. 블로그 제목은 Qwen3.8-Flash-Next: A New Architecture, Towards Ultimate Cost-Efficiency이고, 시점은 August 2026입니다. 기술 보고 제목은 On the Design of Qwen3.8-Next Architecture: Evaluation, Efficiency, and Training Stability이며 기관은 Alibaba Group입니다.
Qwen3.8-Flash-Next는 Qwen4 아키텍처의 실험 미리보기입니다.
이 공개는 어디까지나 Qwen3.8-Flash-Next 자체에 대한 소식입니다. GLM-5.3-Flash 옥 알파나 다른 모델 발표와 한 제목으로 묶어 읽기보다는, 원문 두 곳을 기준으로 별도로 보는 것이 좋습니다.
파라미터 표기는 한 숫자로 뭉뚱그리기 어렵습니다
모델 카드의 Number of Parameters 항목은 125B with 6B activated, plus 51B n-gram embedding and 4B MTP라고 적고 있습니다. 여기에 히든 차원은 2560, 레이어는 48, 토큰 임베딩은 248320입니다. 또 n-gram 항목 수는 20,000,000이며, 2번 레이어의 바이그램·트라이그램이라고 설명합니다.
125B with 6B activated, plus 51B n-gram embedding and 4B MTP
이 때문에 단순히 1250억 모델이라고만 적으면 중요한 정보가 빠집니다. 특히 활성 6B와 n-gram embedding 51B를 같은 활성 파라미터처럼 섞어 쓰지 않는 편이 정확합니다. 카드 하단의 Safetensors 표시인 180B params와 아키텍처 항목의 125B+51B+4B를 합쳐 새로운 공식 수치처럼 정의하는 것도 원문과 다릅니다.
기본 컨텍스트와 확장 상한은 구분해서 봐야 합니다
컨텍스트 길이는 Context Length: 262,144 natively and extensible up to 1,000,000 tokens라고 적혀 있습니다. 즉 Next의 기본값은 262,144 토큰이고, 1,000,000 토큰은 확장 가능한 상한입니다.
기본 컨텍스트는 262,144 토큰이고, 1,000,000 토큰까지 확장할 수 있습니다.
여기서 함께 구분해야 할 점은 Qwen3.8-Flash와 Qwen3.8-Flash-Next가 같은 표기가 아니라는 사실입니다. 카드 설명에 따르면 Qwen3.8-Flash는 Next를 바탕으로 한 공식 버전이며, 기본 1M 컨텍스트와 공식 내장 도구가 있습니다. 반면 Next는 실험 미리보기 가중치입니다. 긴 입력을 다룰 때는 카드에 적힌 YaRN 등 RoPE 스케일 안내를 함께 보는 것이 좋습니다.
핵심 구조는 Gated DeltaNet과 QSA를 결합한 하이브리드 어텐션입니다
이번 공개에서 구조적으로 가장 눈에 띄는 부분은 하이브리드 어텐션입니다. 구성 요소는 Gated DeltaNet과 Qwen Sparse Attention(QSA)입니다. 카드 설명에 따르면 QSA는 토큰 하나씩이 아니라 마이크로 블록 단위로 선택하며, 긴 컨텍스트에서 지연을 줄이는 것이 목적입니다. 에이전트 작업이 늘수록 이 이득이 중요하다고 적고 있습니다.
또 Gated Residual은 잔차 흐름을 읽기 게이트와 쓰기 게이트로 조절합니다. 분기는 4개, 병목 랭크는 320입니다. Mixture of Experts는 전문가 512명, 활성은 라우트 10 + 공유 1입니다. 전체 레이아웃은 12 × (3 × (Gated DeltaNet → MoE) → 1 × (QSA → MoE))입니다.
하이브리드 어텐션은 Gated DeltaNet과 Qwen Sparse Attention(QSA)입니다.
n-gram 임베딩과 학습·서빙 방식도 함께 공개됐습니다
모델 카드는 n-gram 임베딩을 MoE보다 계산이 적고 오프로드에 맞는 축으로 설명합니다. 짧은 n-gram으로 색인해 메모리 제약이 있는 가속기에서 파라미터를 늘리는 방식이라는 점이 핵심입니다.
학습 레시피에서는 가중치 종류에 따라 Muon과 AdamW를 나누어 쓰고, 배치 워밍업 없이 목표 배치부터 시작한다고 적혀 있습니다. 서빙 호환성으로는 Hugging Face Transformers, vLLM, SGLang, TokenSpeed를 언급합니다. 관리형 추론은 Qwen Cloud 공식 API를 가리킵니다.
n-gram 임베딩은 MoE보다 계산이 적고 오프로드에 맞는다고 적혀 있습니다.
기본 동작은 사고 모드이며, 비전 인코더도 포함합니다
모델 유형은 Type 항목 기준으로 Causal Language Model with Vision Encoder입니다. 학습 단계는 Pre-training & Post-training입니다.
기본 동작은 사고 모드이며, 사고 내용을 남긴 뒤 답을 쓰는 방식입니다. reasoning_effort 기본값은 xhigh이고 단계는 xhigh, medium, low입니다. enable_thinking, preserve_thinking으로 사고 동작을 조절한다고 적혀 있습니다.
샘플링 값도 사고 모드와 Instruct를 구분해서 봐야 합니다. 사고 모드 샘플링은 temperature 1.0, top_p 0.95, top_k 20입니다. Instruct(비사고)는 temperature 0.7, top_p 0.80, top_k 20, presence_penalty 1.5입니다. 다만 프레임워크마다 샘플링 지원 범위는 다를 수 있습니다.
기본은 사고 모드이고, reasoning_effort 기본은 xhigh입니다.
벤치마크 숫자는 모델 카드가 공개한 평가값입니다
모델 카드에는 언어와 비전 평가 표가 함께 공개돼 있습니다. 언어 표에서는 SWE-bench Pro 62.5, CoWorkBench 73.9, GPQA Diamond 91.7, LiveCodeBench v6 91.9가 적혀 있습니다. 비전 표에서는 AndroidWorld 84.5, LVBench 76.6이 보입니다.
이 숫자들은 모델 카드가 공개한 평가값이며, 이 글이 다시 측정한 값이 아닙니다.
각주에는 하네스, 온도, 컨텍스트 256K 등 평가 조건이 붙어 있습니다. 따라서 점수만 떼어 옮기기보다 각주 조건까지 함께 보는 편이 정확합니다. 비교 열에 있는 Qwen3.8-27B, Qwen3.7-Plus, DeepSeek-V4-Flash-0731, Claude-Opus-4.6 Max 역시 이 글이 재실험한 결과가 아닙니다. 빈 항목(--)은 아직 없거나 해당 없음으로 읽으면 됩니다.

이번 공개를 읽을 때 헷갈리기 쉬운 지점
Next와 Flash는 같은 제품이 아닙니다
Qwen3.8-Flash-Next는 실험 미리보기 가중치입니다. 반면 Qwen3.8-Flash는 Next 기반 공식 버전이며, 기본 1M 컨텍스트와 공식 내장 도구가 있다고 카드에 적혀 있습니다. Next 가중치만 보고 상용 Flash와 동일하다고 받아들이면 정보가 섞이기 쉽습니다.
기본 1M 컨텍스트라는 표현은 Next에 그대로 적용되지 않습니다
Next의 기본은 262,144이고, 1,000,000은 확장 가능 상한입니다. 기본 1M은 Flash 상용 안내에 붙어 있는 설명입니다. 두 숫자를 한 제품의 기본값처럼 합쳐 쓰지 않는 편이 좋습니다.
사고 모드를 끄면 항상 더 낫다는 뜻은 아닙니다
카드 설명에 따르면 멀티턴 에이전트에서는 낮은 추론이 턴당 응답은 더 빠를 수 있지만, 분석 부족과 재시도로 인해 총 지연과 토큰 사용량이 늘 수 있습니다. 기본값인 xhigh를 바꿨다면 그 이유를 함께 남기는 편이 해석에 도움이 됩니다.
원문을 볼 때 체크하면 좋은 포인트
원문 두 곳을 읽을 때는 몇 가지 구분만 분명히 해도 전체 구조가 훨씬 선명해집니다. 먼저 125B, 6B activated, 51B n-gram embedding, 4B MTP를 따로 읽는 것이 좋습니다. 다음으로 262,144와 1,000,000의 관계를 기본값과 확장 상한으로 나눠 봐야 합니다. 마지막으로 QSA, 사고 모드 기본값, 그리고 Next와 Flash의 차이를 함께 확인하면 핵심을 놓치지 않게 됩니다.
한 페이지로 정리하면
Qwen 팀은 Qwen3.8-Flash-Next를 Qwen4를 받칠 아키텍처의 실험 미리보기로 공개했습니다. 원문은 https://qwen.ai/blog?id=qwen3.8-flash-next와 https://huggingface.co/Qwen/Qwen3.8-Flash-Next입니다. 파라미터는 125B, 활성 6B, n-gram 임베딩 51B, MTP 4B입니다. 기본 컨텍스트는 262,144 토큰이고 1,000,000까지 확장할 수 있습니다. 구조는 Gated DeltaNet과 QSA를 결합한 하이브리드 어텐션, Gated Residual, n-gram 임베딩, 전문가 512·활성 10+1로 설명됩니다. 유형은 비전 인코더가 있는 인과 언어 모델이며, 기본은 사고 모드와 reasoning_effort xhigh입니다. 또 Qwen3.8-Flash는 Next 기반 공식 버전으로 기본 1M과 내장 도구가 있다고 적혀 있습니다. 카드 표의 SWE-bench Pro 62.5, GPQA Diamond 91.7 등은 모델 카드 평가값이지 이 글의 재측정 결과는 아닙니다.
참고 자료: Qwen — Qwen3.8-Flash-Next (2026-08) · Hugging Face — Qwen/Qwen3.8-Flash-Next
이번 공개에서 가장 먼저 확인해 보고 싶은 지점은 아키텍처, 컨텍스트, 사고 모드 가운데 어느 부분인가요?