ox-alpha의 정체, GLM-5.3-Flash로 드러난 이유 | DAKER 커뮤니티

익명으로 돌던 모델 하나가 커뮤니티의 관심을 끌 때가 있습니다. 이번에는 OpenCode와 OpenRouter에서 ox-alpha라는 이름으로 테스트되던 모델이 그 경우였습니다. Z.ai가 2026년 8월 26일 공식 블로그에서 밝힌 내용은 간단하지만, 파장은 작지 않습니다. 그 정체가 GLM-5.3-Flash였다는 점입니다.

중요한 것은 이 모델이 이미 다룬 GLM-5.3과는 다른 모델이라는 점입니다. 이름이 비슷해 헷갈리기 쉽지만, 이번 공지는 GLM-5.3-Flash의 성격과 수치, 그리고 배포 범위를 따로 읽어야 이해가 맞습니다.

OpenCode와 OpenRouter에서 익명으로 돌던 ox-alpha의 정체는 GLM-5.3-Flash였습니다.

옥 알파의 정체가 플래시였습니다

GLM-5.3-Flash에서 먼저 봐야 할 것

Z.ai는 GLM-5.3-Flash를 GLM-5 시리즈의 첫 네이티브 멀티모달 모델로 소개합니다. 총 파라미터는 320B, 활성 파라미터는 18B입니다. 공식 글에 따르면 이 모델은 벤치마크와 실제 워크로드에서 GLM-5.2를 앞서며, 가격은 GLM-5.2의 10분의 1 수준입니다. 코딩·에이전트 벤치에서는 Claude Opus 4.8에 근접한다고 적혀 있습니다.

출시 전에는 OpenCode와 OpenRouter에서 익명 테스트가 진행됐고, 그 이름이 ox-alpha였습니다. 공식 글은 이 모델이 빠르게 그 주 가장 인기 있는 모델이 되었고, 그 트래픽 전부가 중국 AI 칩에서 서빙되었다고 설명합니다. 이 대목은 Z.ai의 공식 설명이며, 별도로 다시 집계한 순위는 아닙니다.

GLM-5.3-Flash는 GLM-5 시리즈 첫 네이티브 멀티모달 모델이며, 출시 전에는 ox-alpha라는 이름으로 테스트됐습니다.

벤치마크와 비용 수치

공식 글은 Artificial Analysis Intelligence Index v4.1.1에서 점수 57, 할인 기준 작업당 비용 0.045달러라고 적습니다. 같은 문맥에서 이 수준의 지능이 예전에는 대략 10배 비용에서나 가능했다고 설명합니다. 이 글에서 인용할 수 있는 달러 수치는 이 작업당 비용과 GLM-5.2 대비 10분의 1 가격 주장입니다.

코딩·에이전트 비교에서도 GLM-5.2 대비 향상이 강조됩니다. DeepSWE v1.1은 63.4 대 46.2, AutomationBench는 48.8 대 26.2입니다. Z.ai Code Bench v1.0을 Claude Code 2.1.207에서 돌린 결과에서는 최대 노력(max effort) 기준 29.0으로, Claude Opus 4.8의 29.5에 거의 근접합니다. Terminal Bench 2.1은 Flash 84.3, GLM-5.2 81.0, Opus 4.8 85.0입니다. DeepSWE는 Flash 63.4, GLM-5.2 46.2, Opus 4.8 58.0입니다.

AA Intelligence Index v4.1.1에서 GLM-5.3-Flash는 57점, 할인 기준 작업당 0.045달러로 제시됐습니다.

아키텍처와 효율 개선

아키텍처는 희소 어텐션과 선형 어텐션을 섞은 하이브리드 구조입니다. Manifold-Constrained Hyper-Connections(mHC)를 도입했고, 사전학습 코퍼스는 30T 토큰 규모 멀티모달입니다. GLM-4.5 시리즈와 비교하면 총 파라미터는 320B 대 355B로 비슷하지만, 활성 파라미터는 18B 대 32B, 레이어 수는 45 대 92로 줄었습니다.

IndexPool은 인덱서 키 벡터 네 개를 하나로 압축합니다. 공식 글에 따르면 GLM-5.3과 비교해 어텐션 연산은 3.0배 줄고, KV 캐시는 4.4배 작아집니다. 비교군 가운데 어텐션 연산량이 가장 낮다고 설명하지만, KV 캐시는 여전히 Kimi-K3·DeepSeek-V4-Flash보다 약간 크다고도 적고 있습니다.

GLM-5.3 대비 어텐션 연산은 3.0배, KV 캐시는 4.4배 줄었다고 Z.ai는 설명합니다.

베이스 모델, 비전 작업, 서빙 방식

GLM-5.3-Flash-Base 표에는 활성 18B·총 320B, MMLU 88.1, BBH 86.6, HellaSwag 87.1, LiveCodeBench-Base 37.6, SimpleQA 33.5가 제시됩니다. 비교 열은 GLM-4.5-Base, GLM-5-Base, DeepSeek-V4-Flash-Base입니다. 이 가운데 DeepSeek-V4-Flash-Base는 Z.ai 내부 평가 프레임워크로 측정했다고 각주가 붙어 있습니다.

비전 쪽에서는 프론트엔드·게임·3D, CUA, 시각적 자기검증을 다룹니다. 서빙은 SGLang 위에 중국 칩용 전용 추론 엔진을 만들었고, GLM-5.3 기반 인프라 에이전트가 커널 작업에 도움을 줬다고 적혀 있습니다. Encode–Prefill–Decode(EPD) 분리 아키텍처를 사용하며, 같은 하드웨어 초기 기준 대비 종단 서빙이 3배 개선되었고 효율이 주류 NVIDIA GPU와 비교 가능하다고 Z.ai는 주장합니다.

사용 가능 범위와 공개된 가중치

공식 글에 따르면 GLM-5.3-Flash는 모든 GLM Coding Plan 사용자에게 롤아웃됐고, 사용 가능 할당량은 GLM-5.3의 3배입니다. 시작 안내는 https://z.ai/subscribe입니다. ZCode에서는 Browser Use와 Computer Use로 멀티모달 에이전트 기능을 사용할 수 있다고 설명합니다.

가중치는 Hugging Face에 공개되어 있으며, 로컬은 SGLang, vLLM, TokenSpeed를 지원한다고 적혀 있습니다. 이 점은 이전에 다룬 GLM-5.3 API 공지와 구분해서 읽는 것이 좋습니다. 이번 글이 공개 가중치를 말하는 대상은 GLM-5.3-Flash이며, GLM-5.3 오픈 웨이트 일정을 확정하는 내용은 아닙니다.

모든 GLM Coding Plan 사용자에게 롤아웃됐고, 할당량은 GLM-5.3의 3배라고 안내됐습니다.

옥 알파의 정체가 플래시였습니다

헷갈리기 쉬운 지점

가장 먼저 구분할 것은 GLM-5.3과 GLM-5.3-Flash입니다. 이번 공지는 이미 올린 GLM-5.3 공지를 다시 쓴 것이 아닙니다. 총 320B·활성 18B, 네이티브 멀티모달, 하이브리드 어텐션, ox-alpha 익명 테스트는 Flash 쪽 사실입니다.

또 하나는 비용 표기입니다. 오늘 본문에서 숫자로 확인되는 달러는 AA 할인 기준 작업당 0.045달러와 GLM-5.2 대비 10분의 1 가격 주장뿐입니다. 백만 토큰당 입력·출력 단가는 이 공식 글이 숫자로 주지 않습니다.

벤치마크 표도 그대로 읽는 편이 안전합니다. Terminal Bench·DeepSWE·AutomationBench·Code Bench처럼 원문에 있는 숫자만 옮겨야 하며, 비어 있는 셀을 추측해 채우면 안 됩니다. DeepSeek-V4-Flash-Base 점수는 Z.ai 내부 프레임워크 평가라는 각주도 함께 봐야 합니다.

하드웨어 관련 문장도 마찬가지입니다. 중국 칩 서빙, 초기 대비 3배 개선, NVIDIA와 비교 가능한 효율은 모두 벤더 설명입니다. 우리 측정으로 단정한 결과는 아닙니다.

한 페이지로 정리하면

2026년 8월 26일 Z.ai 공식 글의 핵심은 분명합니다. OpenCode·OpenRouter의 ox-alpha는 GLM-5.3-Flash였습니다. 이 모델은 GLM-5 시리즈 첫 네이티브 멀티모달이며 총 320B·활성 18B입니다. GLM-5.2보다 앞서고 가격은 10분의 1 수준이며, 코딩·에이전트에서 Claude Opus 4.8에 근접한다고 적혀 있습니다. AA Intelligence Index v4.1.1은 57점, 할인 기준 작업당 0.045달러입니다. 아키텍처는 하이브리드 어텐션·mHC·30T 멀티모달 사전학습·IndexPool이며, GLM-5.3 대비 어텐션 연산 3.0배·KV 캐시 4.4배 감소가 제시됩니다. Coding Plan 전원 롤아웃, GLM-5.3의 3배 할당량, Hugging Face 가중치 공개도 같은 글에 포함되어 있습니다.

이번 공지의 핵심은 GLM-5.3이 아니라, ox-alpha로 알려졌던 GLM-5.3-Flash의 공개입니다.

참고 자료

https://z.ai/blog/glm-5.3-flash

이 모델을 보실 때 가장 먼저 구분해 두는 기준은 GLM-5.3과 GLM-5.3-Flash 중 무엇인가요?