Qwen3.8-2.4T-A95B 공개: 2.4조 웨이트가 풀렸지만, 오늘 고를 것은 API인지 셀프호스트인지입니다 | DAKER 커뮤니티
한 줄 답: 커뮤니티에 이미 올라온 딥시크 글은 프리뷰가 끝나고 V4-Pro가 정식이 됐다는 이야기였습니다 관련 일정 예: ; 2026년 8월 12일, 2026년 8월 12일.
데이콘·DAKER 커뮤니티 기준으로 정리한 안내입니다.
이번 주에 중국발 대형 모델 소식이 두 개 나왔습니다. 커뮤니티에 이미 올라온 딥시크 글은 프리뷰가 끝나고 V4-Pro가 정식이 됐다는 이야기였습니다. 오늘 다루는 것은 그 글이 아닙니다. 알리바바 큐웬 팀이 Max급 오픈 웨이트를 공개했습니다. 모델 이름은 Qwen3.8-2.4T-A95B입니다. 클라우드 API는 8월 초부터 있었고, 이번 주에는 웨이트 파일 다운로드가 열렸습니다.
이 차이를 놓치면 오늘 작업 경로를 잘못 잡기 쉽습니다. 딥시크는 정식 API를 연 쪽이고, 큐웬은 이미 서비스 중이던 클라우드 Max의 핵심 웨이트를 처음으로 받을 수 있는 파일로 공개한 쪽입니다. 둘 다 중국발 플래그십이고, 둘 다 에이전트를 말하지만, 오늘 기준으로 중요한 것은 어느 쪽이 더 세냐가 아니라 무엇이 실제로 공개됐느냐입니다.
오늘의 핵심은 모델 비교가 아니라, 웨이트 공개와 클라우드 서비스 공개를 구분하는 일입니다.
무엇이 공개됐는지부터 정리합니다
큐웬 공식 저장소 QwenLM/Qwen3.8 변경 기록에는 2026년 8월 12일, Qwen3.8-2.4T-A95B가 Hugging Face와 ModelScope에 올라왔다고 적혀 있습니다. 공식 페이지는 세 곳입니다. 블로그 qwen.ai/blog?id=qwen3.8, 허브 Qwen/Qwen3.8-2.4T-A95B, 그리고 ModelScope 같은 이름입니다.
순서는 클라우드가 먼저였습니다. 알리바바 클라우드 커뮤니티 글은 8월 3일에 Qwen3.8-Max를 QwenCloud API로 공식 출시한다고 썼고, 그때 웨이트는 다음 주에 공개한다고 밝혔습니다. 이번 주에 실제로 웨이트 파일이 올라왔으니, 클라우드 API가 먼저, 오픈 웨이트가 나중이라는 순서를 바꿔 말하면 안 됩니다.
모델 카드에 적힌 사양도 분명합니다. 총 파라미터는 2.4조, 토큰마다 활성화되는 파라미터는 950억입니다. 레이어는 92개, 히든 차원은 8192입니다. MoE 전문가는 512개이고, 토큰마다 라우팅 10개와 공유 1개를 사용합니다. 하이브리드 백본은 23번 반복되는 블록 구조이며, 한 블록 안에서 게이트 델타넷(선형 어텐션)이 세 번, 게이트 어텐션(풀 어텐션)이 한 번 들어갑니다. 네이티브 컨텍스트는 262,144토큰이고, 확장하면 1,010,000토큰까지 카드에 적혀 있습니다. MTP(멀티토큰 예측)도 학습에 포함됐다고 설명합니다.
여기서 2.4조는 파일에 저장된 전체 파라미터 수이고, 실제 토큰 계산에는 그중 950억만 사용됩니다. 그렇다고 가벼운 모델이라는 뜻은 아닙니다. 활성화 950억도 충분히 큰 규모입니다. 전문가 512개를 두 노드에 나누고, 토큰마다 11개를 계산에 넣는 구조이기 때문에, 27B에서 하던 식의 워크스테이션 감각을 그대로 가져오면 안 됩니다.
2.4T는 전체 저장 크기이고, 실제 추론에서도 95B가 활성화됩니다. MoE라고 해서 가볍다고 볼 수는 없습니다.
큐웬은 이 체크포인트를 처음으로 Qwen-Max급을 오픈 릴리스한다고 설명합니다. 이 표현은 큐웬이 자기 제품을 부르는 방식입니다. 외부에서 독립적으로 다시 순위를 매긴 결과는 아닙니다. 다만 실제 파일이 허브에 올라와 있고, 카드가 Transformers 형식이며 vLLM·SGLang·TokenSpeed와의 호환을 명시한 것은 확인 가능한 사실입니다.
서빙 도구 쪽도 당일 지원을 공지했습니다. vLLM 블로그는 2026년 8월 12일에 Qwen 3.5 아키텍처를 재사용해 구조 변경 없이 Day-0 지원이 가능하다고 썼습니다. 공식 체크포인트는 FP8과 BF16입니다. SGLang 팀도 같은 날 LMSYS 블로그에서 Day-0 지원을 공개했습니다. 다만 이것은 설치 절차가 공개됐다는 뜻이지, 누구나 자기 클러스터에서 바로 돌릴 수 있다는 뜻은 아닙니다.
클라우드 Max와 오픈 웨이트는 같은 이름처럼 보여도 다릅니다
오늘 가장 중요한 구분은 여기 있습니다. 같은 세대이고 파라미터 숫자도 같지만, 제공하는 기능은 다릅니다.
모델 카드 기준으로 보면 Qwen3.8-Max는 Qwen3.8-2.4T-A95B를 바탕으로 한 공식 서비스 버전입니다. 클라우드 쪽에는 비전 입력, 논-싱킹 지원, 기본 1M 컨텍스트, 공식 빌트인 툴이 더 있습니다. 반면 오픈 체크포인트는 텍스트 전용입니다. 멀티모달 입력은 없고, 싱킹 모드도 끌 수 없습니다. 매 응답은 생각 블록을 먼저 열고, 그다음에 답을 씁니다.
생각의 깊이는 reasoning_effort로만 줄일 수 있습니다. 기본값은 xhigh이고, 선택지는 medium과 low입니다. preserve_thinking은 기본으로 켜져 있어 이전 대화의 추론을 남깁니다. 생각을 끌 수 없는 것과, 생각의 양을 줄일 수 있는 것은 다른 설정입니다. 클라우드 Max는 논-싱킹을 지원한다고 카드에 적혀 있지만, 오픈 웨이트에서는 생각 모드를 끌 수 없습니다.
이 차이 때문에 배포 경로도 달라집니다. 스크린샷을 보고 화면을 고쳐야 하는 작업, 씽킹을 끄고 짧게 답해야 하는 작업, 공식 웹검색이나 코드 인터프리터를 바로 붙여야 하는 작업은 클라우드 Max 쪽이 맞습니다. 반대로 텍스트만 넣고, 생각을 항상 켠 채, 파일을 자기 장비에 두고 싶다면 웨이트 쪽입니다. 클라우드 모델 이름과 웨이트 이름을 같은 것으로 적으면 설정이 어긋납니다.
Qwen3.8-Max는 서비스 이름이고, Qwen3.8-2.4T-A95B는 오픈 웨이트 이름입니다. 같은 것으로 쓰면 배포 설정이 틀어집니다.
API 모델 아이디는 qwen3.8-max이고, 웨이트 아이디는 Qwen/Qwen3.8-2.4T-A95B입니다. extra_body를 넣는 위치도 다릅니다. 셀프호스트에서는 chat_template_kwargs 안에 enable_thinking과 preserve_thinking을 넣고, Qwen Cloud에서는 그 두 값을 extra_body 최상위에 넣으라고 카드에 적혀 있습니다. 복사 위치가 틀리면 생각 내용이 비어 나올 수 있습니다.
권장 샘플링 값도 카드와 vLLM 배포 팁이 같습니다. temperature 1.0, top_p 0.95, top_k 20, min_p 0.0, presence_penalty 0.0, repetition_penalty 1.0입니다. 에이전트 작업에는 출력 예산을 넉넉히 잡으라고 안내합니다. 100만 토큰 컨텍스트 안에서 추론 최대 262,144, 최종 답 최대 131,072입니다. 컨텍스트가 넓다고 해서 답을 길게 쓰는 것이 아니라, 화면에 보이지 않는 생각 토큰이 먼저 한도를 채운다는 점을 같이 봐야 합니다.
벤치마크 표는 참고하되, 오늘의 근거로 쓰지는 않습니다
모델 카드에는 Opus 4.8, Fable 5, GPT 5.6 Sol, Qwen3.7-Max, Qwen3.8-Max를 한 표에 올린 숫자가 있습니다. Terminal Bench 2.1에서 Qwen3.8-Max 86.6, PaperBench 93.0, SWE-bench Pro 67.7 같은 수치가 적혀 있습니다. 다만 각주가 길고, 하네스와 타임아웃이 다르며, 일부는 인하우스 벤치입니다. WideSearch는 상대를 클로드 코드로, 자기들은 Qwen-Agent로 측정했다고 적혀 있습니다.
그래서 이 글은 그 표를 보고 승자를 정하지 않습니다. 독립적으로 다시 돌린 결과가 이 글 안에 없기 때문입니다. 오늘의 근거는 공식 주장보다 실제로 열리는 저장소 링크와 배포 경로입니다.
장시간 자율 코딩, 논문 재현 뒤 개선, 대회 24시간, 칩 설계를 수백 번 돌린 사례, 365일 이커머스 시뮬레이션 같은 이야기들도 공식 블로그의 사례입니다. 인상은 강하지만, 재현은 별개의 문제입니다. 사례를 곧바로 자기 환경의 약속처럼 옮기기보다는, 먼저 어떤 경로로 붙일지부터 정하는 편이 낫습니다.
셀프호스트는 가능하지만, 오늘 바로 가볍게 돌릴 일은 아닙니다
웨이트 파일을 받았다고 해서 바로 실행할 수 있는 것은 아닙니다. 필요한 장비 규모가 큽니다.
vLLM은 이 모델을 지금까지 나온 가장 큰 오픈웨이트 중 하나라고 적고, 추론에 최소 NVIDIA B300 또는 AMD MI355X 두 노드가 필요하다고 썼습니다. FP4 양자화본은 한 노드로도 가능하다고 덧붙였습니다. NVIDIA 기술 블로그도 데이터센터급 가속 장비가 필요하다고 분명히 쓰며, GB300 NVL72에서 FP8 Day-0로 GPU당 초당 4천 토큰 이상, 사용자당 초당 350토큰 이상을 냈다고 주장합니다. 이 수치는 NVIDIA의 측정이지, 일반적인 노트북 벤치가 아닙니다.
SGLang은 하이브리드 어텐션이 기존 서빙 방식과 잘 맞지 않는다고 설명합니다. 풀 어텐션 KV, GDN 순환 상태, 컨볼루션 윈도우를 함께 관리해야 하기 때문입니다. Day-0에 NVFP4 체크포인트, 프리필-디코드 분리, MTP, 프리필 파이프라인 병렬을 같이 올린 것도 같은 맥락입니다. 그들이 공개한 파레토 수치 역시 SGLang의 측정값이지, 각자 클러스터의 SLA는 아닙니다.
파트너 양자화도 있습니다. Inferact가 MXFP4와 NVFP4를 올렸고, SGLang 쪽은 RadixArk의 NVFP4를 Day-0에 공개했다고 적었습니다. 다만 공식 카드의 기본은 BF16과 FP8입니다. 양자화본을 기본 경로처럼 말하기보다는, 각 벤치의 각주와 함께 읽는 것이 좋습니다. vLLM이 공개한 GSM8K·AIME25 비교도 양자화 검증용 초기 수치이며, 추론 예산을 늘려야 재현된다고 적어 두었습니다.
2.4T 셀프호스트는 오늘 밤 해커톤 자리에서 바로 돌릴 성격이 아니라, 먼저 클러스터를 정해야 하는 작업입니다.
워크스테이션에서 오늘 바로 받아보고 싶다면 다른 경로도 있습니다. 공식 변경 기록은 8월 14일 Qwen3.8-27B를 같은 허브에 올렸다고 적습니다. 27B는 덴스이고, 비전을 받으며, Apache-2.0입니다. 하지만 Max급 2.4T와는 다릅니다. 오늘 기준으로 경로는 세 가지입니다. 클라우드 API, 2.4T 클러스터, 27B 워크스테이션입니다. 노트북에서 Max급이라는 네 번째 경로는 없습니다.
오늘의 질문은 어느 모델이 더 좋은가가 아니라, 어디에 붙일 것인가입니다
API로 가는 조건은 비교적 분명합니다. 주말 안에 배포 URL이 필요하고, 스크린샷이나 PDF 같은 입력이 들어가며, 씽킹을 끄거나 줄여 비용을 통제해야 하고, 공식 툴이 이미 붙어 있는 쪽이 빠르며, 클러스터가 없다면 Qwen Cloud의 qwen3.8-max가 오늘 경로가 됩니다. 클로드 코드, 코덱스, Qwen Code, OpenClaw 연결 예시는 공식 블로그에 이미 적혀 있습니다. 프로토콜은 OpenAI 호환과 Anthropic 호환이 함께 있습니다. 리전 베이스 URL은 베이징·싱가포르·버지니아처럼 다르니, API 키와 엔드포인트는 같은 리전으로 맞추는 것이 좋습니다.
큐웬 출시 안내에 적힌 클라우드 리스트 가격은 입력 100만 토큰당 2달러, 출력 6달러, 암시적 캐시 0.25달러입니다. 프리뷰 할인 요금과 섞지 않는 편이 좋습니다. 실제 사용 전에는 콘솔과 리전 페이지에서 다시 확인하면 됩니다.
셀프호스트로 가는 조건도 분명합니다. 데이터가 바깥으로 나가면 안 되고, 체크포인트를 직접 후학습해야 하며, 추론 경로를 자기 장비에 고정해야 하고, 텍스트만으로 충분하며, 항상 생각하는 모델이 맞고, 라이선스를 읽을 사람이 있고, B300/MI355X급 노드가 실제로 있어야 합니다. 이 조건 중 하나라도 빠지면 오늘은 API가 더 현실적입니다.
여기서 자주 생기는 착각도 있습니다. 오픈이라고 해서 공짜는 아닙니다. 전기, 엔지니어링, 대기열, 장애 대응, 양자화 검증, 프롬프트 캐시, 컨텍스트 비용이 모두 내부 비용으로 들어옵니다. Max급이라고 해서 바로 이긴다고 말할 수도 없습니다. 공식 표는 공식 주장이고, 점수는 하네스의 결과입니다. 파일을 받았다고 해서 곧바로 제출이 되는 것도 아닙니다. 받은 파일은 아직 배포가 아닙니다.
비용 감각만 간단히 보면, 클라우드 리스트 가격을 그대로 적용할 때 입력 4만·출력 2천 토큰짜리 에이전트 요청 한 번은 대략 8센트와 1.2센트 수준입니다. 캐시가 붙으면 입력 비용은 더 줄어듭니다. 셀프호스트는 이 센트 비용 대신 노드 시간과 사람 시간을 냅니다. 한 주짜리 해커톤이라면 클라우드 비용이 더 나을 수 있고, 석 달짜리 내부 도구라면 자체 노드가 더 나을 수 있습니다.
90분 안에 경로를 정하고 배포까지 가려면
오늘 작업은 벤치를 읽는 일이 아니라, 경로를 고르고 한 번 성공하는 링크를 남기는 일입니다.
첫 20분에는 공식 카드와 라이선스만 보는 편이 좋습니다. Hugging Face든 ModelScope든 한 페이지면 됩니다. 파라미터, 텍스트 전용 여부, 싱킹 강제 여부, 컨텍스트, 라이선스 이름 다섯 줄만 적어 두면 충분합니다. 벤치 표는 공식 주장으로만 읽고, 오늘 할 일 목록에 넣지 않는 편이 낫습니다.
다음 20분에는 경로를 하나만 고릅니다. 클러스터가 없으면 API, 노드가 있고 데이터가 밖으로 나가면 안 되면 2.4T, 한 대의 워크스테이션에서 비전까지 오늘 받아보려면 27B입니다. 세 경로를 동시에 켜면 작업이 갈라지고, 정작 월요일에 보낼 링크가 없어질 수 있습니다.
남은 50분은 구현에 씁니다. API라면 공식 블로그의 클로드 코드 또는 코덱스 연결 예시를 그대로 따르는 것이 가장 빠릅니다. 모델 환경 변수는 qwen3.8-max, 베이스 URL은 키와 같은 리전, reasoning_effort는 기본 작업에서 medium으로 시작해 보고, 어려운 이슈 하나만 xhigh로 올리는 방식이 현실적입니다. 모든 요청을 xhigh로 두면 출력 토큰이 먼저 끝날 수 있습니다.
셀프호스트를 고른 경우에는 다운로드 진행률보다 서빙 레시피가 더 중요합니다. vLLM 또는 SGLang Day-0 레시피의 플래그를 그대로 쓰는 편이 안전합니다. vLLM 예시에는 --reasoning-parser qwen3, --tool-call-parser qwen3_coder, MTP 스펙 설정이 들어 있습니다. 이런 파서를 빼면 생각 블록이 답 본문에 섞이거나 툴 호출이 깨질 수 있습니다. 샘플 클라이언트의 타임아웃을 한 시간으로 잡아 둔 이유도 긴 추론이 기본이기 때문입니다.
하이브리드 어텐션은 기능 자랑보다 운영 메모에 가깝습니다. 풀 어텐션 레이어는 KV가 늘고, 선형 어텐션 레이어는 고정 크기 상태를 남깁니다. SGLang이 Day-0에 radix 캐시와 GDN 체크포인트를 함께 언급한 이유도 여기에 있습니다. 긴 에이전트 작업에서 컨텍스트가 100만 토큰이니 로그까지 다 넣자는 식의 접근은 가장 비싼 실수가 될 수 있습니다. 시스템 프롬프트와 도구 스키마만 고정 프리픽스로 두고, 로그는 파일로 빼는 편이 낫습니다.
제출 직전에는 한 번만 확인하면 됩니다. 다른 계정, 다른 브라우저, 시크릿 모드에서 로그인 없이 첫 화면이 뜨는지, 버튼 하나가 실제로 동작하는지, 제목보다 링크가 먼저 보이는지를 확인하는 정도면 충분합니다. 모델 이름은 자랑이 될 수 있지만, 동작하는 링크는 제출이 됩니다.
배포가 제출입니다. 웨이트를 받았다는 스크린샷은 제출이 아닙니다.
라이선스는 27B와 2.4T를 섞지 않고 읽어야 합니다
2.4T 카드의 라이선스 이름은 qwen3.8-max입니다. Apache-2.0이 아닙니다. 같은 세대의 27B가 Apache-2.0인 것과 섞으면 안 됩니다. 파일을 받기 전에 LICENSE를 먼저 여는 것이 좋습니다.
Qwen3.8-Max License는 사용, 수정, 배포, 호스팅, 파인튜닝을 허용합니다. 다만 조건이 있습니다. 상업 제품의 월간 활성 이용자가 1억을 넘거나 월 매출이 2천만 달러를 넘으면 모델 이름을 화면에 드러내야 합니다. 또 라이선시와 계열사의 최근 12개월 합산 매출이 5천만 달러를 넘는 상태에서 Model as a Service나 AI Work Assistant 사업을 하면, 상업적 사용 전에 큐웬과 별도 라이선스를 받아야 합니다. 내부 사용은 그 조항의 예외로 적혀 있지만, 모델이나 출력을 제3자에게 공개하면 내부 사용으로 보기 어렵습니다.
해커톤 한 주의 내부 실험은 대체로 이 문턱 아래일 가능성이 크지만, 가정으로 넘기기보다 실제 파일을 읽는 편이 안전합니다. 라이선스 문의 주소는 model-business@notice.qwencloud.com입니다. 이 글은 법률 의견이 아닙니다.
정리하면, 오늘은 경로를 하나만 고르면 됩니다
모델이 좋아질수록 기능 소개와 벤치만 읽다가 시간이 지나기 쉽습니다. 하지만 오늘 필요한 것은 소개가 아니라 경로 선택입니다. 이 글이 다루는 것은 큐웬 오픈 웨이트이고, 딥시크 V4-Pro 정식 공개가 아닙니다. 공식 카드 한 장을 열고, 벤치 표는 공식 주장으로만 읽고, 오늘 경로를 클라우드 API, 2.4T 클러스터, 27B 워크스테이션 중 하나로만 정하면 됩니다.
API라면 모델 아이디를 qwen3.8-max로 두고, reasoning_effort와 max_tokens를 먼저 적어 두는 것이 좋습니다. 2.4T라면 vLLM 또는 SGLang Day-0 레시피를 그대로 따르고, 노드 수가 안 되면 API로 되돌아오는 편이 낫습니다. 그리고 어떤 경로든 라이선스 파일은 먼저 읽어야 합니다.
결국 중요한 것은 Max급을 받았다는 사실이 아니라, 다른 사람이 열 수 있는 링크를 남기는 일입니다. 더 좋은 모델을 기다리는 동안에도, 이미 있는 모델을 어디에 붙일지 정하는 일이 먼저입니다.
출처
- QwenLM/Qwen3.8: https://github.com/QwenLM/Qwen3.8
- qwen.ai/blog?id=qwen3.8: https://qwen.ai/blog?id=qwen3.8
- Qwen/Qwen3.8-2.4T-A95B: https://huggingface.co/Qwen/Qwen3.8-2.4T-A95B
- ModelScope 같은 이름: https://modelscope.cn/models/Qwen/Qwen3.8-2.4T-A95B
- vLLM 블로그: https://vllm.ai/blog/2026-08-12-qwen3.8
- SGLang 팀도 같은 날: https://www.lmsys.org/blog/2026-08-12-qwen3-8-day0-support/
- LICENSE: https://huggingface.co/Qwen/Qwen3.8-2.4T-A95B/blob/main/LICENSE
- NVIDIA GB300 NVL72: https://developer.nvidia.com/blog/serve-qwen3-8-2-4t-a95b-a-2-4t-parameter-model-with-configurable-reasoning-on-nvidia-gb300-nvl72/
- Alibaba Cloud Community: https://www.alibabacloud.com/blog/qwen3-8-max-a-new-bar-for-coding-and-cowork_603421
- DAKER 대회 디렉터리: https://daker.ai/community?directory=competition