UI-Venus-2가 보여준 것: 모바일·웹·데스크톱을 잇는 GUI 에이전트의 범위와 검증 방식 | DAKER 커뮤니티

GUI 에이전트 이야기는 자주 나오지만, 실제로는 특정 벤치나 한 플랫폼에 머무는 경우가 많습니다. 그래서 모바일·웹·데스크톱을 하나의 closed-loop 추론–행동 구조로 묶겠다는 보고서는 지금 시점에서 한 번 짚어볼 만합니다.

Ant Group Venus Team이 공개한 UI-Venus-2는 단순히 점수만 내세우기보다, 어떤 환경을 다루는지, 과제를 어떻게 만들었는지, 보상과 검증 신호를 어떻게 안정화했는지를 함께 설명합니다. 오늘 글은 arXiv:2609.00028와 PDF, 그리고 공개 저장소에서 확인되는 범위만 정리합니다.

모바일·웹·데스크톱을 한 GUI 에이전트로 묶습니다

UI-Venus-2가 겨냥하는 문제

논문은 2026-08-27 arXiv에 올라왔고, 영문 제목은 UI-Venus-2 Technical Report입니다. 저자는 Venus Team (Ant Group)입니다. 이 보고서는 멀티모달 GUI 에이전트를 실사용에 더 가깝게 가져가려면 무엇이 부족한지를 먼저 짚습니다. 벤치 중심 성능만으로는 환경 커버리지, 과제 구성의 취약함, 보상 검증의 불안정을 넘기 어렵다는 문제의식입니다.

UI-Venus-2는 모바일·웹·데스크톱에서 동작하는 범용 기반 GUI 에이전트를 목표로, 통합 closed-loop 추론–행동 틀을 둡니다.

핵심은 세 가지입니다. 첫째, 실행 환경을 170개 이상 다국어 모바일 앱과 네이티브 데스크톱 OS까지 넓혔다고 설명합니다. 둘째, 과제는 deep-research 파이프라인을 통해 기능에 정초한 지시를 생성한다고 적습니다. 셋째, RL 신호는 visual keypoint, trace·sample 수준 검증기, 멀티모델 투표를 활용해 안정화한다고 설명합니다. 또한 결과 중대한 행동에는 안전 인식 제어를 통합한다고 덧붙입니다.

공개된 자료와 확인 가능한 링크

UI-Venus-2 관련 자료는 공개되어 있습니다. 코드는 GitHub inclusionAI/UI-Venus, 가중치는 Hugging Face inclusionAI/ui-venus, 프로젝트 페이지는 ui-venus.github.io/UI-Venus-2에서 볼 수 있습니다.

초록은 arXiv:2609.00028, 본문 PDF는 같은 번호의 pdf에서 확인할 수 있습니다. 이 글은 제공된 사실과 초록·본문에서 확인한 범위만 옮기며, 없는 숫자는 덧붙이지 않습니다.

그림 1에 제시된 점수

논문 그림 1 기준으로 UI-Venus-2-27B는 VenusBench-Mobile 48.7, WebVoyager 93.4, Odysseys 80.4를 보고합니다. 같은 그림의 MobileWorld 관련 패널에는 82.1이 표시되며, 비교열로 Qwen-UI-Agent-27B가 함께 언급됩니다.

UI-Venus-2-9B는 VenusBench-Mobile 46.5, MobileWorld 76.1, WebVoyager 90.8, Odysseys 77.3입니다. 다만 벤치마다 스텝 예산, 스캐폴드, 지표 정의가 다를 수 있으므로 숫자만 떼어 보기보다 그림 캡션의 조건 주를 함께 읽는 편이 좋습니다.

벤치 점수는 모델 크기, 벤치 이름, 지표와 함께 적어야 혼동이 줄어듭니다.

특히 9B와 27B를 한 줄로 섞거나, 서로 다른 벤치의 숫자를 하나의 홍보 문장처럼 합치는 방식은 피하는 것이 좋습니다. 이 보고서는 모든 GUI 벤치 1등 선언이 아니라, 그림 1에 표시된 점수와 비교열을 제시한 기술 보고서입니다.

이 보고서에서 함께 봐야 할 세 가지

환경 범위

UI-Venus-2는 모델 크기만 키운 사례로 읽기보다, 어떤 환경을 다루는지까지 함께 봐야 합니다. 논문은 170개 이상 다국어 모바일 앱과 네이티브 데스크톱 OS로 환경을 확장했다고 설명합니다. 이는 모바일만, 웹만을 전제로 한 에이전트와는 다른 범위를 지향한다는 뜻입니다.

과제 생성 방식

과제는 기능에 정초한 지시 생성으로 구성한다고 적습니다. 단순한 화면 단위 지시가 아니라 기능 중심으로 태스크를 만드는 접근이라는 점이 특징입니다.

검증기와 RL 신호

검증은 visual keypoint와 멀티모델 투표를 활용하는 trace·sample 수준 평가기로 구성된다고 설명합니다. RL 보상을 단일 판정에만 기대지 않고, 여러 검증 신호를 통해 안정화하려는 방향입니다.

UI-Venus-2는 환경 커버리지, 기능 정초 과제 생성, 검증기 품질을 함께 키운다고 적습니다.

실무 문서로 옮길 때 유용한 관점

이 보고서를 읽을 때는 점수만 옮기기보다, 팀 문서에도 환경·과제·검증기라는 세 칸을 나눠 적는 방식이 유용합니다. 환경 칸에는 OS·브라우저·앱 목록을, 과제 칸에는 기능 단위 지시 생성 방법을, 검증 칸에는 trace/sample 여부와 keypoint·투표 사용 여부를 적어두면 비교가 쉬워집니다.

또한 안전 인식 메커니즘이 있다고 해서 결제·삭제·전송 같은 중대 행동이 자동으로 안전해지는 것은 아닙니다. 논문은 중대한 행동 제어를 통합했다고 설명하지만, 그것이 모든 위험 행동을 차단한다는 보증은 아닙니다.

재현성 측면에서는 데모 영상만으로는 부족할 수 있습니다. 트레이스 재생 방법, 초기 URL, 계정 없이 돌릴 수 있는 샌드박스 여부 같은 정보가 함께 있어야 다른 사람이 같은 흐름을 확인하기 쉬워집니다.

이 글이 말하지 않는 것

이 글은 특정 대회 우승 공지가 아니며, 170+ 앱이 모든 언어·모든 버전을 커버한다는 보증도 아닙니다. 또한 9B와 27B가 같은 성능이라는 뜻도 아닙니다. 여기서는 논문과 공개 링크에서 확인되는 범위만 정리했습니다.

비교열에 등장하는 Claude·GPT·Kimi 등 이름이나 다른 모델의 수치를 우리 실측처럼 바꿔 적는 것도 적절하지 않습니다. 출처는 arXiv:2609.00028와 해당 그림 번호를 함께 남기는 편이 좋습니다.

참고 자료

arXiv:2609.00028 — UI-Venus-2 Technical Report (2026-08-27)
PDF
GitHub inclusionAI/UI-Venus
Hugging Face inclusionAI/ui-venus
Project page

여러분은 GUI 에이전트를 볼 때 성능 점수보다 환경 범위와 검증 방식을 함께 보는 편인지 궁금합니다.