Uno 논문 공개: AR 품질을 유지하며 LLM 추론을 최대 3배 빠르게 하는 방법 | DAKER 커뮤니티

LLM 추론 가속은 이제 익숙한 주제이지만, 속도를 높이는 방식이 언제나 같은 것은 아닙니다. 특히 품질 저하 없이 빨라졌는지, 어떤 조건에서 그런 결과가 나왔는지는 숫자만으로는 잘 드러나지 않습니다.

2026년 9월 4일 arXiv에 공개된 Uno 논문은 바로 이 지점을 겨냥합니다. 자동회귀(AR) 모델이 정의하는 분포는 유지한 채, 확산(diffusion)을 붙여 여러 토큰을 한 번에 샘플링하고 추론을 가속하는 접근을 제안합니다. 오늘 글은 논문 초록과 공개된 링크에서 확인되는 사실만 바탕으로 핵심을 정리합니다.

확산으로 AR 품질을 유지한 채 추론을 최대 3배 빠르게 합니다

Uno가 제안하는 방식

논문은 2026-09-04 arXiv에 올라왔습니다. 제목은 Unlocking Lossless Speedups in LLMs via Discrete Diffusion이며, 초록은 arXiv:2609.04010, PDF는 같은 번호의 pdf에서 볼 수 있습니다. 저자는 Subham Sekhar Sahoo, Lingjie Chen, Khiem Pham 외 14명입니다. 프로젝트 페이지는 s-sahoo.github.io/uno입니다.

Uno의 핵심은 AR 모델의 분포를 그대로 두면서, 확산으로 여러 토큰을 병렬 샘플링하는 구조를 더하는 데 있습니다. 이를 위해 파라미터를 두 묶음으로 나눕니다. AR 가중치는 표준적인 다음 토큰 예측으로 학습하고, 가벼운 확산 가중치는 여러 토큰을 동시에 생성하도록 학습합니다. 이 확산 가중치는 Diffusion Distillation 단계로 학습된다고 설명합니다.

Uno는 AR 분포를 유지한 채 확산으로 여러 토큰을 한꺼번에 샘플링해 추론을 가속하는 diffusion-augmented LLM을 제안합니다.

논문이 구분하는 지점도 분명합니다. speculative decoding처럼 별도 draft 모델을 두는 방식이 아니며, 기반 AR 품질을 바꾸는 경로로 설명되는 확산 LLM(d-LLM)과도 다르다고 적습니다. 대신 AR 가중치는 그대로 두고, 추가된 확산 가중치와 Ψ-Spec 샘플러를 통해 가속을 노립니다.

Ψ-Spec 샘플러와 무손실 가속 주장

초록에 따르면 Ψ-Spec은 무손실 가속과 고정 문맥 길이에서의 추론 시간 확장을 지원하는 샘플러 계열입니다. 여기서 중요한 표현은 속도 향상 자체보다도, 기반 AR 품질을 희생하지 않는다는 주장입니다.

속도만 높이는 것이 아니라, 같은 AR 품질을 유지한 채 생성을 가속하는 것이 Uno의 핵심 주장입니다.

이 때문에 Uno를 읽을 때는 단순히 몇 배 빨라졌는지만 볼 것이 아니라, 그 수치가 어떤 비교 축에서 나왔는지 함께 보는 것이 좋습니다. 초록이 말하는 무손실 조건, draft 모델의 유무, 고정 문맥 길이 조건이 함께 읽혀야 의미가 분명해집니다.

초록이 보고한 속도와 비교 축

초록은 평가한 모든 배치 크기에서 주요 speculative decoding 방법보다 높은 처리량을 보였다고 적습니다. 또한 기기에서 지원하는 최대 배치 크기에서는 기반 AR 모델 대비 최대 3배 속도를 보고합니다.

평가한 모든 배치 크기에서 주요 speculative decoding보다 높은 처리량을 보고하며, 최대 배치에서는 기반 AR 대비 최대 3배 속도를 냈다고 적습니다.

다만 초록에 없는 수치는 여기서 덧붙이지 않는 편이 정확합니다. 초당 토큰 수, GPU 모델명, 세부 벤치 표의 수치 등은 초록에 직접 적혀 있지 않으므로 이 글에서도 확정적으로 옮기지 않습니다.

품질 비교에서도 같은 원칙이 필요합니다. 초록은 8B Uno가 26B DiffusionGemma와 Mercury 2보다 agentic tool use·코딩·장문맥 추론 벤치에서 앞선다고 적습니다. 하지만 개별 벤치 이름이나 점수는 초록에 없으므로 추정해서 채우지 않는 것이 맞습니다.

기존 AR LLM에 붙일 수 있는 경로

Uno는 기존 오픈웨이트 AR LLM을 증강하는 방식으로도, 처음부터 학습하는 방식으로도 사용할 수 있다고 설명합니다. 이 점은 실제로 모델을 다루는 팀에게 의미가 큽니다. 완전히 새로운 계열로 갈아타는 접근이 아니라, 이미 쓰고 있는 AR 기반 위에 확산 가중치를 더하는 선택지를 열어두기 때문입니다.

기존 오픈웨이트 AR LLM을 증강하거나 처음부터 학습할 수 있다는 점이 Uno의 실용적인 특징입니다.

또한 코드와 체크포인트는 프로젝트 페이지에 공개한다고 적고 있습니다. 실제 구현이나 재현을 검토할 때는 프로젝트 페이지의 안내를 우선 확인하면 됩니다.

이 글에서 선을 넘지 않는 부분

Uno에 대한 설명에서 가장 조심해야 할 부분은, 초록이 말한 범위를 넘어 일반화하지 않는 것입니다. 이 글은 모든 배치, 모든 GPU, 모든 환경에서 정확히 3배 속도를 보장한다고 말하지 않습니다. 초록이 보고한 것은 최대 3배이며, 평가한 배치에서 speculative decoding 대비 처리량 우세를 보였다는 점입니다.

마찬가지로 이 글은 세부 벤치 점수표를 확정하지도 않습니다. 8B Uno와 26B DiffusionGemma, Mercury 2의 비교 역시 초록에 적힌 영역(agentic tool use·코딩·장문맥 추론)까지만 옮깁니다. 프로젝트 페이지 외의 다운로드 URL을 새로 만들지도 않습니다.

참고 자료

arXiv:2609.04010 — Unlocking Lossless Speedups in LLMs via Discrete Diffusion (2026-09-04)
PDF
프로젝트 페이지

AR 품질 보존과 추론 가속 사이의 균형을 볼 때, Uno의 어떤 지점이 가장 흥미롭게 느껴지셨나요?