DeepSeek, Ascend용 DeepGEMM·DeepEP를 공개했습니다 — CUDA 없이 MoE 커널을 맞춥니다 | DAKER 커뮤니티

DeepSeek Ascend 오픈소스 DeepGEMM · DeepEP 설명용 생성 이미지

DeepSeek가 화웨이 Ascend NPU용 학습·추론 커널을 공개 저장소로 올렸습니다. DeepGEMM-Ascend README의 News에는 2026년 9월 30일 Ascend 950 지원 초기 릴리스가 적혀 있고, DeepEP-Ascend도 같은 시점에 Ascend용 전문가 병렬 통신 라이브러리로 공개됐습니다. Reuters는 같은 날 DeepSeek가 화웨이와 칩 프로그래밍 도구를 협력·오픈소스했다고 전했습니다. 이 글에서는 GitHub에 적힌 API 호환성, 지원 정밀도, 공개된 대역폭 수치만 정리합니다.

DeepGEMM-Ascend가 맞춘 것

DeepGEMM-Ascend는 NVIDIA 등에서 쓰던 DeepGEMM과 API를 맞춘 Ascend 포트입니다. BF16·FP8·FP4 GEMM, MQA logits, MegaMoE를 지원하며, 패키지 이름도 같아 기존 워크플로를 유지한 채 설치만 바꾸면 된다고 적혀 있습니다. Ascend MAD(행렬 곱·누적) 위에 가벼운 추상화를 두어 프랙탈 레이아웃·정렬·주소 계산을 감추고, 희소 로드·코루틴 파이프라인 같은 Ascend 특화 최적화로 피크 성능에 가깝게 간다고 설명합니다.

요구 사항으로는 Ascend 950 계열, CANN 9.20, torch_npu, Python 3.10+, C++20, tilelang 의존성이 나열됩니다. 스케일링 팩터 포맷은 NVIDIA와 달라 K차원 UE8M0 쌍을 int16으로 패킹하고 MN-major로 둔다고 주의합니다.

모델 가중치 공개가 아니라, Ascend에서 MoE·GEMM을 돌리는 커널·통신 레이어를 맞추는 인프라 공개입니다.

DeepEP-Ascend 통신 수치

DeepEP-Ascend는 MoE dispatch/combine용 전문가 병렬 all-to-all을 제공하고, FP8 dispatch·지연 epilogue를 지원합니다. 공개 buffer API는 NVIDIA판 DeepEP와 맞춘다고 적혀 있습니다. Ascend 950DT·CANN 9.2.0 측정에서 토큰/랭크 용량 16,384, hidden 7168, top-6 over 256 experts 조건으로 EP8 dispatch 373–375 GB/s, combine 345–347 GB/s를 공개했고, EP32까지 dispatch가 물리 페이로드 한도의 약 90–95%에 가깝다고 적었습니다. 더 큰 EP와 combine은 추가 최적화 중이라고 명시합니다.

화웨이 Q3 상용 HDK(Atlas 850E) 공개는 벤더 계획상 10월 중순(약 10월 15일)으로 안내돼 있으며, 일정은 화웨이 공개 일정에 따릅니다. 이 글의 확인일은 2026년 10월 2일입니다.

왜 이 공개가 중요한가

CUDA 중심 스택에 묶인 팀에게 Ascend는 다른 툴체인이 필요합니다. DeepSeek가 자체 학습·서빙에 쓰던 GEMM·EP 레이어를 API 호환 형태로 공개한 것은, Ascend 위에서 V4급 MoE를 재현하려는 연구·인프라 팀의 출발점을 낮춥니다. Reuters 보도는 엔비디아 의존을 줄이려는 협력 맥락을 전하지만, 수치와 API 범위는 GitHub README를 기준으로 읽어야 합니다.

공개일(README News 2026-09-30)과 확인일(2026-10-02)을 구분해, HDK 출시 예정일은 계획으로만 적습니다.

마치며

이번 소식은 새 챗 모델 발표가 아니라, Ascend 950에서 DeepGEMM·DeepEP를 돌리기 위한 오픈소스 기반 공개입니다. GPU 대신 NPU로 MoE를 옮기려는 팀은 API 호환 범위와 EP 대역폭 표를 먼저 대조표에 옮겨 두면 됩니다. 여러분 인프라에서는 Ascend GEMM과 EP 중 어디부터 재현 실험을 열시겠습니까?

출처