SKT A.X K2 기술 보고서 공개: 688B 오픈웨이트 에이전트 모델의 핵심 | DAKER 커뮤니티

2026년 8월 31일 SK Telecom(SKT)이 에이전트 응용을 위해 처음부터 학습한 688B 파라미터 MoE 오픈웨이트 A.X K2 기술 보고서를 arXiv에 공개했습니다. 토큰마다 활성은 33B입니다. A.X K1의 후속이며, 총 학습 토큰은 약 8.5T(사전학습 약 8.2T)로 K1의 약 10T보다 적습니다. 대신 더 작고 품질이 높은 혼합에 에이전트·소프트웨어 공학 데이터를 늘렸고, K1 대비 전 구간에서 개선되며 일부 벤치에서는 30퍼센트포인트 이상 상승했습니다.

이번 공개가 눈에 띄는 이유는 단순히 큰 모델이 하나 더 나왔기 때문만은 아닙니다. 에이전트용으로 설계·학습한 오픈웨이트라는 점, 그리고 한국어 축과 통신 도메인 벤치까지 함께 제시했다는 점이 실무적으로 읽을 만한 대목입니다. 가중치는 Hugging Face에도 공개되어 있습니다.

SKT가 에이전트용 688B 오픈웨이트를 공개합니다

기술 보고서와 공개 위치

논문은 2026년 8월 31일 arXiv에 올라왔습니다. 초록은 arXiv:2608.30181에서 볼 수 있고, 영문 제목은 A.X K2 Technical Report입니다. 저자는 SK Telecom(SKT)입니다. PDF는 같은 번호의 pdf에 있으며, 가중치는 Hugging Face skt/A.X-K2에 공개되어 있습니다. 한국 주권 AI(과학기술정보통신부·정보통신산업진흥원 과제 PJT-26-010018)로도 표기되어 있습니다.

약 8.5T 토큰으로 학습했지만 K1 대비 전 구간에서 개선됐고, 일부 벤치에서는 30퍼센트포인트 이상 올랐습니다.
SKT가 에이전트용 688B 오픈웨이트를 공개합니다 본문

에이전트용으로 처음부터 학습한 688B MoE

A.X K2는 688B 파라미터 MoE이며 활성은 33B입니다. 에이전트 응용을 목표로 처음부터 학습했습니다. 구조는 61계층, 헤드 64, 은닉 7168, 라우팅 전문가 256개 중 활성 8개, 공유 전문가 1개, 어휘 163840입니다. 문맥은 네이티브 128K이며 YaRN으로 256K를 지원합니다. 학습은 NVIDIA B200 512장에서 약 70일 진행됐습니다.

모델 설계에서는 Think-Fusion으로 사고 모드와 비서고 모드를 한 모델에 통합했습니다. 또 Sparse Gated Attention(SGA)과 Gated Norm(GN)을 사용합니다. SGA는 자체 희소 top-k에 대한 인덱서 워밍업으로 네이티브 128K를 지원하며, 각 쿼리는 2,048개 위치를 읽습니다. 장문 성능 지표로는 RULER 전체가 256K까지 94.6이며, LongBench는 SGA 이전 62.80에서 이후 62.99입니다.

총 파라미터, 활성 파라미터, 문맥 길이는 같은 항목으로 뭉뚱그리기보다 분리해서 보는 편이 모델 이해에 도움이 됩니다.

사고 모드 벤치마크에서 보인 변화

사고 모드 Table 6에서는 K1과 Qwen3.5-397B-A17B를 함께 비교합니다. AIME26은 97.1(K1 91.3, Qwen 92.5), Apex는 45.8(K1 1.0, Qwen 13.5), KMMLU-Pro는 80.5(K1 68.9, Qwen 78.4), CLIcK는 91.6(K1 85.3, Qwen 88.4), KoBALT는 73.0(K1 51.0, Qwen 69.9)입니다.

이어 LiveCodeBench v6는 84.0(K1 74.9, Qwen 82.6), HLE는 27.8(K1 8.3), GPQA Diamond는 85.6(K1 76.4, Qwen 89.3), IFBench는 75.9(K1 63.2, Qwen 78.8), AA-LCR은 66.0(K1 26.0)입니다. GDPval Elo는 1031(K1 500)입니다.

도메인 벤치에서는 τ²-Bench Telecom이 98.0(K1 86.0, Qwen 95.6)으로 비교군 중 최고입니다. 반면 Terminal Bench v2.1은 36.0으로 Qwen 51.3보다 낮아 격차가 남아 있습니다. 수학 성능에서는 IMO 2025가 35/42로 금메달 기준선에 해당하며, 앞 다섯 문제는 7/7입니다. KMO26 2차 라운드는 8문제를 모두 맞혔습니다.

τ²-Bench Telecom에서는 비교군 중 최고였지만, Terminal Bench v2.1에서는 여전히 격차가 남아 있습니다.

한국어 평가와 제조 벤치

한국어 축에서도 수치가 함께 제시됩니다. KS-Eval은 Common Sense 57.45, Instruction Following 71.67, Long Context 66.85, STEM 75.47입니다. K1 대비 이득은 각각 +19.47, +27.98, +27.11, +13.46퍼센트포인트입니다. 이 가운데 Instruction Following 71.67은 비교군 중 1위입니다.

제조 벤치 전체 F1은 69.0(Qwen 67.4)입니다. 세부적으로는 기권 F1 61.1이 앞서며, 사용자 주장 67.8, 문서 주장 41.4입니다. 한국어와 산업 도메인 축을 별도로 읽어야 모델의 강점이 더 분명해집니다.

KS-Eval에서는 Instruction Following 71.67로 비교군 중 1위를 기록했습니다.

서빙 메모리와 정밀도, 안전 지표

GN 덕분에 4비트 NVFP4 서빙은 FP8에 매우 가깝게 유지됩니다. Table 14 기준으로 NVFP4는 78.19, FP8은 78.95이며 유지율은 99.0%, 하락은 0.76입니다. 메모리는 K1 BF16 1038GB, K2 FP8 646GB, NVFP4 370GB입니다.

안전 지표는 모드별로 나뉘어 봐야 합니다. 레드팀 ASR은 비서고 12.1(K1 59.4, Qwen 21.9)로 낮지만, 사고 모드는 33.9로 Qwen 21.0보다 높습니다. 따라서 Think-Fusion을 사용할 때는 성능뿐 아니라 모드별 안전 수치도 함께 확인하는 것이 좋습니다.

NVFP4는 FP8과 완전히 동일하지는 않지만, Table 14 기준으로 99.0%를 유지합니다.

이 보고서를 읽을 때 놓치지 말아야 할 점

이 보고서는 모든 벤치에서 Qwen3.5-397B-A17B를 앞선다고 말하지 않습니다. GPQA Diamond, IFBench, Terminal Bench처럼 Qwen이 앞서는 지표가 분명히 있습니다.

또 학습 토큰이 줄면 언제나 성능이 오른다는 뜻도 아닙니다. K2는 약 8.5T로 K1의 약 10T보다 적지만, 데이터 혼합의 품질을 높이고 에이전트·소프트웨어 공학 데이터를 확대한 변화가 함께 있습니다.

마찬가지로 NVFP4가 FP8과 완전히 같다는 보증도 아니며, 사고 모드가 항상 더 안전하다는 주장도 아닙니다. 이 문서는 특정 제품 출시 공지라기보다 기술 보고서, 오픈웨이트, 벤치마크 수치를 정리한 자료로 읽는 편이 맞습니다.

참고 자료

arXiv:2608.30181 — A.X K2 Technical Report (2026-08-31)
PDF
Hugging Face skt/A.X-K2

이 모델에서 가장 먼저 확인해 보고 싶은 지표는 성능, 장문 처리, 서빙 메모리, 안전 중 어느 쪽인가요?