GLM-5.3-Flash: 총 320B·활성 18B, 멀티모달과 가격에서 봐야 할 점 | DAKER 커뮤니티
2026년 8월 26일 Z.ai가 공개한 GLM-5.3-Flash는 숫자만으로도 눈길을 끕니다. 총 파라미터는 3200억이지만 실제로 켜지는 활성 파라미터는 180억입니다. 여기에 네이티브 멀티모달, 1M 컨텍스트, 코딩·에이전트 성능, 그리고 GLM-5.2 대비 약 1/10 가격이라는 설명이 붙습니다.
다만 이런 발표는 큰 숫자와 인상적인 문구만 따라가면 쉽게 과장되기 쉽습니다. 이번 글은 원문에 적힌 사실만 유지하면서, 무엇이 새로 나왔는지와 무엇으로 확대 해석하면 안 되는지를 한 번에 정리합니다. 원문은 GLM-5.3-Flash이며, 함께 볼 문서는 모델 가이드와 pricing입니다.

이번 발표에서 먼저 봐야 할 핵심
GLM-5.3-Flash는 GLM-5 시리즈의 첫 네이티브 멀티모달 모델로 소개됐습니다. 원문은 새 베이스, 희소+선형 어텐션 하이브리드, mHC, 30T 토큰 멀티모달 사전학습을 언급합니다. 문서에서는 희소와 선형 어텐션을 결합한 첫 오픈소스 프론티어 모델이라고 설명합니다.
총 320B와 활성 18B는 같은 숫자가 아니라, 전체 규모와 실제 활성 규모를 나눠 봐야 하는 구조입니다.
이 모델은 OpenCode·OpenRouter에서 ox-alpha라는 이름으로 익명 테스트됐고, 그 주 가장 인기 있었으며 트래픽 전부가 중국 AI 칩에서 돌았다고 원문은 적고 있습니다. 다만 여기서 칩 벤더 이름을 원문 밖으로 단정하면 안 됩니다.
성능과 비용 측면에서는 AA Intelligence Index v4.1.1에서 57점·태스크당 $0.045(할인)이며, 이전 대비 약 10배 저렴했다고 밝혔습니다. 세부 수치로는 DeepSWE v1.1 63.4 대 GLM-5.2 46.2, AutomationBench 48.8 대 26.2가 제시됩니다. 또 Z.ai Code Bench v1.0 최대 노력에서는 29.0으로, Opus 4.8의 29.5에 근접한다고 적었습니다.
Opus 4.8 근접은 코딩·에이전트 축의 회사 평가이며, 모든 벤치에서 동급이라는 뜻은 아닙니다.
구조와 효율: 왜 320B인데 18B만 켜진다고 하나
GLM-4.5와 비교하면 총량은 320B 대 355B로 비슷하지만, 활성은 18B 대 32B, 레이어는 45 대 92입니다. 원문은 IndexPool이 인덱서 키 4개를 가중합으로 1개로 모아 1M 컨텍스트를 지원한다고 설명합니다.
또 GLM-5.3 대비 어텐션 연산은 3.0배 감소했고 KV 캐시는 4.4배 축소됐다고 적혀 있습니다. GLM-5.3·DeepSeek-V4-Flash·Kimi-K3 대비 어텐션 연산이 가장 낮고, KV는 Kimi-K3·V4-Flash보다 약간 크다고 했습니다.
1M 컨텍스트는 장문 워크로드에 유리하지만, 기본 호출마다 크게 채우면 비용이 커질 수 있습니다.
베이스 표 숫자로는 MMLU 88.1, BBH 86.6, HellaSwag 87.1, LiveCodeBench-Base 37.6, SimpleQA 33.5가 제시됩니다. 비교 열은 블로그 표의 GLM-4.5-Base·GLM-5-Base·V4-Flash-Base를 따릅니다.
멀티모달과 코딩: 비전을 코딩 루프에 넣었다는 뜻
이번 모델은 입력으로 비디오·이미지·텍스트·파일을 받고, 출력은 텍스트입니다. 컨텍스트는 1M, 최대 출력은 128K입니다. 문서에는 thinking.type이 enabled만 가능하며 끌 수 없다고 명시돼 있습니다. 권장 설정은 temperature 1, top_p 0.95, reasoning_effort max입니다.
특히 원문은 코딩 루프에 비전을 넣는다고 설명합니다. 렌더·검사·수정, CUA, 환경 피드백이 있는 프론트엔드 RL이 언급됩니다. 이는 이미지만 따로 보는 별도 모델이 아니라, 네이티브 멀티모달 시리즈의 한 모델이라는 점이 중요합니다.
비전 코딩 루프는 렌더 후 검사·수정까지 포함하는 설명이지, 스크린샷만 올리면 자동 배포된다는 보장은 아닙니다.
문서에는 비디오 입력이 가능하다고 적혀 있지만, 이 글에서는 최대 길이·해상도·요금 배수 같은 숫자를 임의로 채우지 않습니다. 최신 정보는 문서와 요금표를 함께 보는 것이 좋습니다.
벤치마크는 어떻게 읽어야 하나
블로그 표에는 Z.ai 기준 벤치 수치가 함께 제시됩니다. TB2.1 84.3, DeepSWE 63.4, NL2Repo 56.3, Toolathlon 78.4, Automation 48.8, ALE 26.3, HLE tools 55.3, GDPval-AA 1773, OfficeQA 62.4, CharXiv 89.4, Chartography 78.0, BabyVision 53.4, MVbench 77.8, MMVU 80.5입니다. 각 평가에는 특정 하네스가 있다는 각주를 따라야 합니다.
여기서 중요한 것은 서로 다른 축의 점수를 한 줄로 합쳐 읽지 않는 일입니다. TB2.1 84.3과 HLE tools 55.3은 같은 표의 다른 행이고, GDPval-AA 1773은 스케일이 다릅니다. CharXiv 89.4·Chartography 78.0·BabyVision 53.4·MVbench 77.8·MMVU 80.5는 비전·문서 축이며, DeepSWE 63.4와 직접 비교할 수 없습니다.
벤치마크는 같은 표에 있어도 같은 의미가 아니므로 평균을 내거나 단일 순위처럼 다루면 안 됩니다.
가격과 플랜: API 단가와 Coding Plan은 따로 봐야 합니다
공식 요금은 입력 $0.15 정가 / $0.075 프로모, 캐시 입력 $0.03/$0.015, 출력 $0.50/$0.25입니다. 50% 할인은 2026년 9월 9일 24:00 UTC+8(싱가포르)에 끝나며, 캐시 스토리지는 한시 무료라고 적혀 있습니다.
또 Coding Plan은 모든 사용자에게 열리고, GLM-5.3 대비 쿼터 3배, 비피크·주말 전체 포인트 50%라고 안내합니다. 다만 요금 페이지의 API 단가와 Coding Plan 쿼터를 한 표로 섞어 읽으면 안 됩니다.
API 요금과 Coding Plan 쿼터는 같은 과금축이 아니므로 별도로 비교해야 합니다.
서빙과 오픈 가중치: 가능한 것과 아직 단정할 수 없는 것
원문은 중국 칩 서빙에 대해 전용 SGLang 엔진, GLM-5.3 인프라 에이전트의 커널 도움, EPD 분리, 동일 하드웨어에서 초기 대비 종단 3배, 비용은 주류 NVIDIA와 비교 가능하다고 회사 주장으로 적고 있습니다. 하지만 제3자 감사 숫자가 붙어 있지 않으므로, 이를 검증된 동가로 단정할 수는 없습니다.
가중치는 Hugging Face에 공개됐고, SGLang·vLLM·TokenSpeed를 지원한다고 적혀 있습니다. 다만 이 글에서는 라이선스 이름을 붙이지 않습니다. 원문과 문서가 이 페이지에서 구체 이름을 밝히지 않은 상태에서, 확인되지 않은 라이선스명을 적지 않는 편이 정확합니다.
Hugging Face 가중치 공개는 자체 호스팅 경로를 뜻하지만, API 요금이나 Coding Plan과는 별개의 이야기입니다.

무엇으로 오해하면 안 되는가
이번 발표는 MiniMax H3 Max 영상 속도 발표가 아니고, DeepSeek 비전 단독 소식도 아니며, Qwen4 뼈대 티저도 아닙니다. 오늘의 주제는 GLM-5.3-Flash의 멀티모달·가격·벤치입니다.
또 라이선스 이름을 MIT로 확정한 공지도 아닙니다. 확인된 사실은 Hugging Face에 가중치가 공개됐다는 점입니다. 마찬가지로 모든 벤치에서 Opus 4.8을 넘어섰다는 뜻도 아닙니다. 원문이 말하는 범위는 코딩·에이전트 축의 근접이며, Code Bench 29.0 대 29.5 같은 숫자를 함께 두고 읽어야 합니다.
실제로 확인해 볼 포인트
먼저 Z.ai — GLM-5.3-Flash (2026-08-26), docs, pricing를 함께 보면서 모델 코드와 단가를 메모해 두면 됩니다.
호출을 시험할 때는 모델 코드가 glm-5.3-flash인지, thinking이 고정인지, temperature 1·top_p 0.95·reasoning_effort max 권장값이 맞는지 확인하는 것이 좋습니다.
예산을 볼 때는 프로모 종료 시점인 2026-09-09 24:00 UTC+8 전후의 단가 차이와 캐시 스토리지 한시 무료 조건을 같이 봐야 합니다. 자체 호스팅이 필요하다면 Hugging Face 가중치와 SGLang·vLLM 경로를 검토할 수 있지만, 실제 비용에는 칩·전력·엔지니어링이 따로 들어간다는 점도 염두에 둘 필요가 있습니다.
정리
GLM-5.3-Flash는 총 320B·활성 18B 구조, 네이티브 멀티모달, 1M 컨텍스트, 코딩·에이전트 중심의 성능 지표, 그리고 프로모션 기준 낮아진 가격을 함께 내세운 발표입니다. 다만 이 모델을 이해할 때는 총 파라미터와 활성 파라미터를 섞지 않고, 벤치마크를 한 줄 순위처럼 읽지 않으며, API 가격과 플랜 쿼터를 분리해서 보는 것이 중요합니다.
이번 발표의 핵심은 큰 숫자 자체보다, 멀티모달 구조와 효율, 그리고 가격 조건을 어디까지 사실대로 읽을 것인가에 있습니다.
참고 자료
Z.ai — GLM-5.3-Flash (2026-08-26)
GLM-5.3-Flash docs
Z.ai pricing
이 발표에서 가장 먼저 직접 확인해 보고 싶은 부분은 성능, 가격, 자체 호스팅 가운데 어느 쪽인가요?