주요 콘텐츠로 건너뛰기

Qwen-CUA – 알리바바 Qwen 등이 출시한 네이티브 Computer Use Agent 운영 중

Qwen-CUA는 Qwen 팀이 출시한 네이티브 Computer Use Agent로, 순수 비전 기반으로 키보드와 마우스를 조작해 크로스 플랫폼 애플리케이션을 제어하며 OSWorld-Verified에서 86.2점을 기록했습니다.

Qwen-CUA – 알리바바 Qwen 등이 출시한 네이티브 Computer Use Agent는 397B-A17B 혼합 전문가 아키텍처를 기반으로 하며, 스크린샷만으로 인터페이스 상태를 인식합니다. DOM 트리나 접근성 메타데이터에 의존하지 않고 키보드 및 마우스 이벤트를 직접 출력해 브라우저, 데스크톱 및 전문 소프트웨어를 조작할 수 있습니다. OSWorld-Verified 벤치마크에서 86.2점을 기록했으며, 더 큰 버전인 Qwen-CUA-Max는 87.6점을 달성해 오픈 소스 CUA 분야의 선도적인 수준에 도달했습니다. 엔드투엔드 비전-액션 학습을 적용해 크로스 플랫폼 범용성과 높은 안정성을 갖추었으며, 기술 보고서와 Demo를 공개해 자동화 테스트, RPA, 접근성 지원 및 과학 연구 소프트웨어 조작 등의 시나리오에 활용할 수 있습니다.

Qwen-CUA – 알리바바 Qwen 등이 출시한 네이티브 Computer Use Agent 제품 인터페이스
월간 방문 수
0
가격
무료 및 유료
등록일
2026-08-05
업데이트됨
2026-08-05

01Qwen-CUA란

Qwen-CUA는 Qwen 팀과 XLang Lab이 공동으로 출시한 네이티브 Computer Use Agent로, 397B-A17B 혼합 전문가 아키텍처를 기반으로 합니다. 스크린샷만으로 인터페이스 상태를 인식하며 DOM 트리나 접근성 메타데이터에 의존하지 않고 키보드와 마우스 이벤트를 직접 사용해 브라우저, 데스크톱 애플리케이션 및 전문 소프트웨어를 조작합니다. OSWorld-Verified 벤치마크에서 86.2점을 기록했으며, 더 큰 버전인 Qwen-CUA-Max는 1조 개가 넘는 파라미터를 바탕으로 87.6점을 달성했습니다.

02Qwen-CUA의 주요 기능

순수 비전 인식: 스크린샷만으로 인터페이스 상태를 이해하며 HTML 구조나 접근성 메타데이터에 의존하지 않아 크로스 플랫폼 범용성이 뛰어납니다.
네이티브 입력 시뮬레이션: 키보드와 마우스 이벤트를 직접 출력해 브라우저, 데스크톱 애플리케이션 및 전문 소프트웨어에서 작업을 수행할 수 있습니다.
MoE 아키텍처 기반: 397B-A17B 혼합 전문가 모델을 기반으로 성능과 추론 비용의 균형을 유지하며, 1조 개가 넘는 파라미터를 지원하는 Max 버전은 성능을 한층 향상했습니다.
기술 보고서 공개: GitHub에 기술 보고서와 참고 Demo가 공개되어 있어 연구자가 재현하고 2차 개발을 진행하기 쉽습니다.

03Qwen-CUA의 기술 원리

기반 아키텍처: Qwen3.5-397B-A17B 혼합 전문가 아키텍처를 기반으로 하며, 총 파라미터 수는 397B이고 매번 순전파에서 활성화되는 파라미터는 17B에 불과합니다. 강력한 표현 능력을 유지하면서 추론 비용을 제어합니다.
혼합 어텐션 메커니즘: GatedDeltaNet 선형 어텐션과 Gated Full Attention을 75:25 비율로 교차 배치해 긴 시퀀스의 계산 복잡도를 O(n²)에서 선형에 가까운 수준으로 낮춥니다. 256K 컨텍스트 처리량은 기존 아키텍처보다 19배 향상되었습니다.
전문가 라우팅: 각 레이어에 512개의 세분화된 라우팅 전문가를 구성하고 Top-10 선택과 가중치 재정규화를 통해 활성화합니다. 여기에 1개의 공유 전문가와 sigmoid 게이팅을 결합해 일반 지식의 기여도를 적응적으로 조절하고 정보 손실을 방지합니다.
순수 비전 인식: 화면 스크린샷만으로 인터페이스 상태를 인식하며 HTML DOM 트리, 접근성 메타데이터 또는 운영 체제 API에 전혀 의존하지 않습니다. 이를 통해 모든 GUI 애플리케이션을 크로스 플랫폼 방식으로 범용 인식할 수 있습니다.
비전 인코딩 및 위치 지정: Qwen-VL 시리즈의 ViT 아키텍처를 계승해 동적 해상도 입력을 지원합니다. MRoPE 멀티모달 회전 위치 인코딩을 활용해 시간, 높이, 너비의 3차원 정보를 동시에 인코딩하고 인터페이스 요소의 좌표를 정밀하게 지정합니다.

04Qwen-CUA 사용 방법

저장소 방문: GitHub에서 xlang-ai/Qwen-CUA를 검색해 프로젝트 홈페이지로 이동합니다.
기술 보고서 읽기: 프로젝트에 포함된 기술 보고서를 다운로드해 모델 아키텍처와 학습 세부 사항을 확인합니다.
참고 Demo 실행: README에 따라 환경을 구성한 뒤 공식 참고 Demo를 실행해 스크린샷 기반 자동화 작업을 체험합니다.
자체 환경에 연동: 모델을 로컬 또는 클라우드 데스크톱/브라우저 환경에 연동하고, 스크린샷 입력과 키보드·마우스 출력을 통해 작업을 순환적으로 수행합니다.

05Qwen-CUA의 핵심 장점

높은 벤치마크 점수: OSWorld-Verified에서 86.2점을 기록했으며 Max 버전은 87.6점으로 오픈 소스 CUA 분야의 선도적인 수준입니다.
진정한 네이티브 CUA: API에 의존하거나 여러 Agent를 조합하는 방식과 달리 Qwen-CUA는 엔드투엔드로 학습된 비전-액션 모델이므로 안정성이 더 높습니다.
크로스 플랫폼 호환성: 운영 체제나 애플리케이션 유형의 제약을 받지 않으며 그래픽 인터페이스가 있는 모든 소프트웨어를 조작할 수 있습니다.
오픈 소스 생태계: Apache 2.0 라이선스를 따르며 기술 보고서와 Demo가 공개되어 있어 커뮤니티에서 자유롭게 확장할 수 있습니다.

06Qwen-CUA 프로젝트 주소

GitHub 저장소:https://github.com/xlang-ai/Qwen-CUA
기술 논문:https://github.com/xlang-ai/Qwen-CUA/blob/main/paper/Qwen-CUA.pdf

07Qwen-CUA의 활용 시나리오

자동화 소프트웨어 테스트: 스크린샷으로 인터페이스 요소를 인식하고 클릭, 입력, 스크롤 등의 작업을 수행해 특정 스크립트를 작성하지 않고도 크로스 플랫폼 UI 회귀 테스트를 진행할 수 있습니다.
RPA 프로세스 자동화: 데이터 입력, 보고서 생성, ERP 조작 등 반복적인 데스크톱 업무를 대신 수행하며 기업의 기존 IT 시스템을 개조할 필요가 없습니다.
접근성 지원 도구: 시각 장애 사용자나 고령자를 위해 소프트웨어 인터페이스 요소를 자동으로 인식하고 정밀한 작업을 대신 수행해 전문 소프트웨어의 사용 장벽을 낮춥니다.
과학 연구 및 전문 소프트웨어 조작: MATLAB, SPSS 등 API가 없는 전문 소프트웨어를 자동으로 조작해 실험 데이터 처리와 차트 생성 등 장시간이 필요한 작업을 일괄 수행할 수 있습니다.
클라우드 Agent 호스팅 서비스: 클라우드 데스크톱 환경에 배포해 웹사이트 점검, 데이터 수집, 정기 보고서 다운로드 등 백그라운드 작업을 7×24시간 수행합니다.

© 면책 조항: 도메인 및 연결된 콘텐츠는 시간이 지나면서 변경될 수 있습니다. AIEZZ은(는) 제3자 웹사이트를 관리하지 않습니다. 외부 콘텐츠와 위험을 독립적으로 검토하세요.

사용자 리뷰0