TuringLLM 논문으로 본 물리 AI용 장문맥 MoE 설계의 핵심 | DAKER 커뮤니티

물리 AI와 지연에 민감한 응용을 겨냥한 모델 설계는, 총 파라미터 수만으로 설명하기 어려운 경우가 많습니다. 2026년 8월 31일 공개된 TuringLLM 논문은 바로 그 지점을 보여줍니다. Turing-20B-A2B는 20B 규모의 MoE 모델이지만, 토큰마다 활성은 약 2B로 설계됐고, 네이티브 문맥 128K에 YaRN으로 512K까지 확장합니다.

이 글은 논문에 나온 사실만 바탕으로, 물리 AI 쪽에 장문맥 기반 모델을 붙일 때 무엇을 함께 봐야 하는지 정리한 글입니다. 특히 활성 규모, 문맥 길이, 라우팅 방식, 프리필 조건처럼 실제 비교에서 빠지기 쉬운 항목을 한 자리에서 읽을 수 있게 묶었습니다.

활성 2B로 물리 AI용 장문맥 기반 모델을 만듭니다

논문은 2026년 8월 31일 arXiv에 올라왔습니다. 초록은 arXiv:2608.30567에서 볼 수 있고, 영문 제목은 TuringLLM: Efficiently Scaling Foundation Models Toward Physical AI입니다. 저자 표기는 Foundation Model Team, Xpeng Inc.이며, 핵심으로 Yuheng Zhang, Yizhao Wang, Da Zhu와 팀이 있고, 프로젝트 리드 Qiman Wu, 자문 Hang Zhang, HongGou Yang, Xianming Liu가 적혀 있습니다. PDF는 같은 번호의 pdf입니다. 제공된 사실에는 공개 Hugging Face·코드 URL이 없습니다.

활성 2B로 물리 AI용 장문맥 기반 모델을 만듭니다 본문

활성 약 2B로 설계한 20B MoE 구조

Turing-20B-A2B는 20B MoE이며, 토큰마다 활성은 약 2B입니다. 구조는 24계층, 은닉 2048, 헤드 16·차원 128입니다. 첫 계층은 밀집 FFN이고, 나머지 계층은 MoE로 구성됩니다.

어텐션은 하이브리드 구조를 택했습니다. 6계층마다 Lightning Attention 5개와 전역 어텐션 1개를 배치해, 전체로는 Lightning 20·전역 4가 됩니다. 문맥은 네이티브 128K이고, YaRN으로 512K까지 확장합니다.

이 모델의 핵심은 총 20B가 아니라, 토큰마다 약 2B를 활성화하면서 장문맥과 지연 민감 응용을 함께 겨냥했다는 점입니다.

라우팅에는 Quantile Routing을 사용합니다. 동적 top-k로 토큰 적응 전문가를 고르며, 평균 연산량을 제어하면서 이용 균형을 맞추는 방식입니다. 평균적으로 약 8개의 라우팅 전문가와 공유 전문가 1개를 켭니다. 전체 전문가는 256입니다. 사전학습 중에는 dropless이고, 프롬프트 프리필에는 용량 제약 라우팅(γ=1.25)을 사용합니다.

정규화와 학습 설정에서 확인할 점

정규화는 RMSNorm 대신 DyT를 사용합니다. 논문은 이를 엣지·Turing 칩을 위한 선택으로 설명합니다.

메인 사전학습은 H800 512장에서 약 22일 진행됐습니다. 학습은 3단계로 구성되며, 770k 스텝 약 6.5T 토큰 이후 180k+180k 스텝에서 각 약 1.5T를 사용합니다. 시퀀스 길이는 4096이고, 스텝당 약 8.4M 토큰입니다.

학습 일정과 인프라 수치는 모델의 성격을 이해하는 데는 유용하지만, 그대로 다른 팀의 실측이나 클러스터 계획과 같다고 볼 수는 없습니다.

Base 벤치마크에서 보이는 강점과 한계

Qwen3-8B Base와 비교하면 Turing Base는 MMLU 79.83 대 78.92, CMMLU 84.17 대 81.28, DROP 82.61 대 79.03, HellaSwag 90.44 대 81.39, MATH 62.20 대 56.12, GPQA 37.05 대 34.82입니다. 반면 GSM8K는 74.53 대 90.07로 뒤집힙니다.

Qwen3.5-9B Base와는 전반적으로 근접합니다. CMMLU 84.17 대 81.13, MATH 62.20 대 53.38, HellaSwag 90.44 대 89.57, MMLU 79.83 대 81.02입니다.

이 논문은 활성 2B가 모든 벤치에서 8B·9B를 이긴다고 말하는 자료가 아닙니다.

따라서 이 모델을 소개할 때는 앞선 지표만 따로 떼어 쓰기보다, GSM8K처럼 뒤지는 항목도 함께 보는 편이 좋습니다.

RULER와 장문맥 성능, 그리고 512K의 의미

장문맥에서는 RULER 결과가 눈에 띕니다. Qwen3-8B 대비 Turing은 32K 93.16 대 89.26, 64K 90.00 대 74.83, 128K 84.87 대 61.56입니다.

Qwen3.5-9B Base와 비교하면 RULER 128K 84.87 대 88.89, 256K 81.31 대 81.81로 근접합니다. Turing의 512K는 YaRN으로 77.38입니다.

512K는 네이티브 문맥이 아니라, 네이티브 128K를 YaRN으로 확장한 결과입니다.

이 점은 장문맥 비교표를 만들 때 특히 중요합니다. 128K와 512K를 같은 성격의 문맥 길이처럼 적으면 해석이 달라질 수 있습니다.

프리필 속도와 MoE 라우팅 효율

프리필은 H800 FP16에서 Qwen3 대비 32K 약 1.2배, 64K 1.6배, 128K 2.2배입니다. 문맥이 길어질수록 배수가 커지는 형태로 보고됐습니다.

MoE 모듈은 기존 top-k 대비 16K–256K에서 평균 1.53배 속도(CF=1.25)입니다. 프롬프트 프리필에는 앞서 언급한 용량 제약 라우팅(γ=1.25)을 사용합니다.

프리필 속도 수치는 조건과 길이를 함께 적어야 의미가 있습니다. 이 논문에서는 H800 FP16 기준으로 32K·64K·128K에서 각각 약 1.2·1.6·2.2배입니다.

응용 예시로는 VLA 2.0 주행, 콕핏, XPeng Iron 로봇이 적혀 있고, 앞으로 TuringViT 멀티모달이 언급됩니다.

이 논문을 읽을 때 놓치지 말아야 할 구분

이 자료는 공개 가중치나 코드가 포함된 배포 안내가 아닙니다. 제공된 사실에는 Hugging Face·코드 URL이 없습니다. 또한 특정 차량이나 로봇의 출시 공지도 아닙니다. 물리 AI를 향한 기반 모델 설계 논문으로 읽는 것이 맞습니다.

또 하나 중요한 점은 Quantile Routing의 동적 top-k를 고정된 값처럼 이해하지 않는 것입니다. 논문에 적힌 것은 항상 8전문가가 아니라, 평균 약 8개의 라우팅 전문가와 공유 전문가 1개입니다. 토큰 적응 방식이라는 설명도 함께 봐야 합니다.

dropless 사전학습, 프리필의 용량 제약 라우팅, 평균 약 8개의 라우팅 전문가는 서로 다른 맥락의 설정입니다.

정리: 물리 AI용 장문맥 모델을 볼 때 함께 적어야 할 것

TuringLLM이 보여주는 핵심은 단순히 큰 모델을 만들었다는 데 있지 않습니다. 총 파라미터와 활성 파라미터를 구분하고, 장문맥의 네이티브 범위와 확장 범위를 나누며, 라우팅과 프리필 조건까지 함께 적어야 모델의 성격이 드러난다는 점에 있습니다.

논문 기준으로 정리하면, Turing-20B-A2B는 20B MoE에 토큰당 활성 약 2B, 평균 약 8개의 라우팅 전문가와 공유 전문가 1개, 네이티브 128K와 YaRN 512K, Lightning 20·전역 4의 하이브리드 어텐션, DyT 정규화, H800 FP16 기준 프리필 가속 수치를 함께 봐야 하는 모델입니다.

참고 자료

arXiv:2608.30567 — TuringLLM: Efficiently Scaling Foundation Models Toward Physical AI (2026-08-31)
PDF

이 논문에서 가장 먼저 비교해 보고 싶은 항목은 활성 규모, 장문맥 성능, 프리필 속도 중 어느 쪽인가요?