AMD가 공개한 Instella-MoE 16B: 활성 2.8B, 7.1T 토큰, 완전 공개 레시피의 의미 | DAKER 커뮤니티

2026년 9월 1일 AMD가 Instella-MoE 기술 보고서를 arXiv에 공개했습니다. 총 16B 규모의 MoE 모델이지만, 토큰마다 실제로 활성화되는 파라미터는 2.8B입니다. AMD Instinct MI300X·MI325X에서 스크래치로 학습했고, 단계별 체크포인트와 설정, 데이터 믹스, 코드까지 함께 공개했다는 점이 이번 공개의 핵심입니다.

요즘 공개 모델을 이야기할 때는 가중치만 열려 있는 경우와 학습 과정까지 재현 가능한 경우가 자주 한데 묶입니다. 이번 자료는 그 차이를 다시 분명하게 보여줍니다. 모델 크기나 벤치마크 숫자만 볼 것이 아니라, 무엇이 실제로 공개되었는지 함께 봐야 하는 이유가 여기에 있습니다.

AMD에서 학습한 16B 완전 공개 MoE를 공개합니다

논문은 2026-09-01 arXiv에 올라왔습니다. 초록은 arXiv:2609.00791에서 확인할 수 있습니다. 영문 제목은 Instella-MoE Technical Report입니다. 저자는 Jiang Liu, Sudhanshu Ranjan 외 (AMD)입니다. PDF는 같은 번호의 pdf입니다. 가중치·카드는 Hugging Face amd/Instella-MoE-16B-A3B-Base에 공개되어 있습니다. 이 글은 제공된 사실과 초록·본문에서 확인한 범위만 옮깁니다.

16B 총량과 활성 2.8B, AMD GPU에서 학습한 MoE

Instella-MoE는 희소 Mixture-of-Experts 구조로, 총 파라미터는 16B이고 토큰마다 켜지는 양은 2.8B입니다. 학습은 AMD Instinct MI300X와 MI325X에서 처음부터 진행했습니다. 아키텍처의 핵심으로는 Gated Multi-head Latent Attention(Gated MLA)과 FarSkip-Collective가 제시됩니다.

Gated MLA는 MLA에 입력 조건 게이트를 더해 표현력을 보강하는 방식으로 설명됩니다. FarSkip-Collective는 전문가 병렬 통신과 계산을 겹치는 구조입니다.

총 파라미터 16B와 토큰당 활성 2.8B는 같은 숫자가 아니며, 이 모델을 이해할 때 가장 먼저 구분해야 할 정보입니다.

학습 파이프라인은 사전학습, 미드트레이닝, 장문맥 확장, 피드백 기반 SFT, DPO, 강화학습으로 이어집니다. 강화학습에는 멀티 교사 온폴리시 증류가 포함됩니다. 사전학습 토큰은 7.1T이며, 문맥 길이는 4K에서 64K로 확장합니다.

공개 범위도 눈에 띕니다. 단계별 체크포인트와 설정, 데이터 믹스, 코드가 함께 공개된다고 보고서에 적혀 있습니다. Hugging Face 카드 이름은 amd/Instella-MoE-16B-A3B-* 시리즈입니다.

base 76.7, Think 73.2, 그리고 처리량 개선 수치

보고된 성능 수치도 단계별로 나눠서 볼 필요가 있습니다. base 체크포인트 평균은 76.7이며, 보고에 따르면 완전 공개 비교군에서 선두입니다. 같은 활성 규모대의 오픈웨이트 MoE·밀집 모델과도 경쟁한다고 설명합니다.

사후학습을 거친 Think 체크포인트 평균은 73.2입니다. 이 평균은 지시 따르기·추론·수학·코딩·채팅 벤치를 묶은 값입니다.

base 평균 76.7과 Think 평균 73.2는 서로 다른 단계의 숫자이므로 같은 성격의 점수처럼 섞어 읽지 않는 것이 좋습니다.

효율 측면에서는 FarSkip-Collective와 전문가 병렬이 사전학습 처리량을 +12.7% 높였고, TTFT 처리량은 +39.2%까지 올렸다고 적혀 있습니다. 이 수치 역시 품질 지표와는 별개로 읽어야 합니다.

+12.7%와 +39.2%는 각각 사전학습 처리량과 TTFT 처리량에 대한 보고 수치입니다.

따라서 성능 평균과 처리량 개선을 한 문장으로 묶어 단정적으로 해석하기보다는, 각 수치가 어떤 조건과 단계에서 나온 것인지 출처와 함께 확인하는 편이 정확합니다.

완전 공개와 오픈웨이트는 같은 말이 아닙니다

이번 공개에서 특히 중요한 대목은 완전 공개와 오픈웨이트를 구분해야 한다는 점입니다. 가중치만 공개된 경우와 달리, 이 보고서는 단계별 가중치, 학습 설정, 데이터 믹스, 학습 코드, 평가 절차를 함께 공개한다고 명시합니다.

완전 공개는 가중치 공개만을 뜻하지 않으며, 재현에 필요한 학습 정보가 얼마나 함께 열려 있는지가 핵심입니다.

공개 체크포인트에는 Pretrain·Midtrain·Base·SFT·DPO·Think 단계가 포함된다고 보고합니다. 따라서 이 모델을 인용하거나 활용할 때는 어떤 단계를 사용했는지 분명히 적는 것이 좋습니다. 특히 완전 공개 비교군에서 선두라는 표현은 base 평균 76.7을 가리키는 문맥에서 출처와 함께 써야 하며, Think 73.2와 섞지 않는 편이 맞습니다.

장문맥도 같은 방식으로 구분해야 합니다. 보고서에는 4K에서 64K로의 확장이 적혀 있지만, 실제 사용 시 어떤 체크포인트를 썼는지는 별도로 밝혀야 합니다. 64K 확장 체크포인트와 4K base를 같은 조건처럼 다루면 해석이 흐려집니다.

학습 인프라는 MI300X·MI325X로 보고되었고, 추론·서빙 환경은 카드와 코드를 따릅니다. 따라서 AMD에서 학습했다는 사실과 실제 런타임 환경을 한 문장으로 단정해 묶기보다는, 각각의 조건을 나눠 적는 편이 정확합니다.

이 보고서를 읽을 때 놓치지 말아야 할 점

이 자료는 모든 벤치에서 오픈웨이트 대형 모델을 이긴다고 주장하는 문서가 아닙니다. base 평균 76.7과 Think 평균 73.2는 보고된 비교 설정에서의 평균입니다.

또한 활성 2.8B라는 말은 16B 전체가 동시에 돌아간다는 뜻이 아닙니다. 토큰마다 켜지는 양이 2.8B라는 의미입니다.

처리량 +12.7%·+39.2% 역시 모든 배치 크기와 모든 환경에서 보장된다는 약속이 아닙니다. FarSkip/EP 관련 보고 수치로 읽어야 합니다.

마찬가지로 이 문서는 특정 대회 결과를 알리는 공지가 아니라, 완전 공개 MoE 기술 보고서와 가중치·코드 공개를 안내하는 자료입니다.

참고 자료

arXiv:2609.00791 — Instella-MoE Technical Report (2026-09-01)
PDF
Hugging Face amd/Instella-MoE-16B-A3B-Base

여러분은 공개 모델을 볼 때 가중치 공개와 학습 레시피 공개를 얼마나 엄격하게 구분해 보고 계신가요?